Descripción General
El almacenamiento en caché de prompts guarda respuestas para solicitudes idénticas, devolviendo resultados en caché instantáneamente sin realizar una nueva llamada API. Esto es ideal para:- Consultas repetidas (bots de FAQ, preguntas comunes)
- Desarrollo y pruebas
- Endpoints de alto tráfico con entradas predecibles
Habilitar el Caché
Agregue el parámetrocache a su solicitud:
Cómo Funciona
- OpenModex genera un hash de la solicitud (modelo + mensajes + parámetros)
- Si existe una respuesta en caché y no ha expirado, se devuelve inmediatamente
- Si no hay caché, la solicitud va al proveedor y la respuesta se almacena en caché
Clave de Caché
La clave de caché se calcula a partir de:- Nombre del modelo
- Array de mensajes (contenido y roles)
- Temperature, max_tokens y otros parámetros de generación
TTL (Tiempo de Vida)
Ahorro de Costos
Las respuestas en caché son significativamente más económicas:- Los tokens de entrada en caché se facturan a ~50% de la tarifa normal
- Sin costo de tokens de salida para respuestas en caché
- Latencia cero — las respuestas se devuelven en <10ms