Vue d’ensemble
Le streaming vous permet de recevoir les tokens de réponse au fur et à mesure de leur génération, plutôt que d’attendre la réponse complète. Cela améliore considérablement la latence perçue pour vos utilisateurs.Quand utiliser le streaming
- Interfaces de chat — afficher des indicateurs de saisie et du texte en temps réel
- Réponses longues — ne pas faire attendre les utilisateurs pour la réponse complète
- Génération de code — afficher le code au fur et à mesure de sa rédaction
Comment ça fonctionne
- Définissez
stream: truedans votre requête - OpenModex ouvre une connexion SSE (Server-Sent Events)
- Les tokens sont envoyés sous forme d’événements
data:au fur et à mesure de leur génération - Le flux se termine par
data: [DONE]