概述
提示词缓存会存储相同请求的响应,无需发起新的 API 调用即可立即返回缓存结果。适用于以下场景:- 重复查询(FAQ 机器人、常见问题)
- 开发和测试
- 具有可预测输入的高流量端点
启用缓存
在请求中添加cache 参数:
工作原理
- OpenModex 对请求进行哈希(模型 + 消息 + 参数)
- 如果存在未过期的缓存响应,则立即返回
- 如果没有缓存,请求会发送到供应商,响应被缓存
缓存键
缓存键由以下内容计算:- 模型名称
- 消息数组(内容和角色)
- temperature、max_tokens 和其他生成参数
TTL(生存时间)
成本节省
缓存响应显著降低费用:- 缓存的输入 token 按正常费率的约 50% 计费
- 无输出 token 成本 用于缓存响应
- 零延迟 — 响应在 <10ms 内返回