Skip to main content

Vue d’ensemble

Le streaming vous permet de recevoir les tokens de réponse au fur et à mesure de leur génération, plutôt que d’attendre la réponse complète. Cela améliore considérablement la latence perçue pour vos utilisateurs.

Quand utiliser le streaming

  • Interfaces de chat — afficher des indicateurs de saisie et du texte en temps réel
  • Réponses longues — ne pas faire attendre les utilisateurs pour la réponse complète
  • Génération de code — afficher le code au fur et à mesure de sa rédaction

Comment ça fonctionne

  1. Définissez stream: true dans votre requête
  2. OpenModex ouvre une connexion SSE (Server-Sent Events)
  3. Les tokens sont envoyés sous forme d’événements data: au fur et à mesure de leur génération
  4. Le flux se termine par data: [DONE]

Exemples

Streaming + Basculements

Le streaming fonctionne de manière transparente avec les basculements. Si le modèle principal échoue avant le début du streaming, OpenModex retente automatiquement avec le modèle de basculement :