Vue d’ensemble
La mise en cache des prompts stocke les réponses pour des requêtes identiques, renvoyant les résultats en cache instantanément sans effectuer de nouvel appel API. C’est idéal pour :- Les requêtes répétées (bots FAQ, questions fréquentes)
- Le développement et les tests
- Les endpoints à fort trafic avec des entrées prévisibles
Activer la mise en cache
Ajoutez le paramètrecache à votre requête :
Comment ça fonctionne
- OpenModex calcule le hash de la requête (modèle + messages + paramètres)
- Si une réponse en cache existe et n’a pas expiré, elle est renvoyée immédiatement
- Si aucun cache n’existe, la requête est envoyée au fournisseur et la réponse est mise en cache
Clé de cache
La clé de cache est calculée à partir de :- Le nom du modèle
- Le tableau des messages (contenu et rôles)
- La température, max_tokens et les autres paramètres de génération
TTL (Time to Live)
Économies
Les réponses en cache sont considérablement moins chères :- Les tokens d’entrée en cache sont facturés à environ 50 % du tarif normal
- Pas de coût de tokens de sortie pour les réponses en cache
- Zéro latence — les réponses sont renvoyées en <10ms