AI Agent 点记录

AI摘要
【知识分享】本文介绍了Prompt Caching的省钱逻辑与实现要点,包括复用固定前缀以降低预填充计算成本,建议将不变内容前置、变化内容后置以提升缓存命中率,并监控缓存读写Token及在时间窗口内完成批量任务。

Prompt Caching的省钱逻辑

批量评测经常重复发送同一份 System Prompt,只替换末尾的样本;多轮对话也会重复携带一段固定历史。这类请求可以利用 Prompt Caching 复用前缀。后续请求满足模型、前缀长度、内容和有效期等条件时,命中部分会按缓存输入计费,并减少一部分预填充计算。

请求内容的排列会直接影响缓存命中:

  1. 把不变的内容放前面(System Prompt、工具定义、RAG Context),把变化的内容 放后面(User Prompt)。
  2. 按供应商响应字段监控缓存读取和缓存写入 Token,验证缓存命中率。
  3. 批量任务 尽量在缓存时间窗口内完成。
本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!