价格缓存成本建模
如何读懂 LLM Token 价格,而不被估算误导
一份关于输入、输出、缓存输入和缓存写入价格的实用指南,并拆解成本估算里容易被忽略的假设。
· 阅读约 6 分钟
本页目录
正在加载文章…
一份关于输入、输出、缓存输入和缓存写入价格的实用指南,并拆解成本估算里容易被忽略的假设。
· 阅读约 6 分钟
正在加载文章…
查找模型、服务商、价格页面和实用指南。
模型价格表看起来很简单:两个美元数字、一个模型名称,再加一个上下文窗口。真正昂贵的错误,往往藏在这些数字之间的假设里。
大多数服务商以每百万 Token 的美元价格公布文本模型费率。Token 并不等于单词。对英文文本来说,一个 Token 通常约等于四分之三个单词,但代码、数字和非英文文本的结果可能差异很大。
第一步是把单位统一:
成本 = Token 数量 / 1,000,000 × 每百万 Token 价格
如果某模型的输入价格是每百万 Token 2 美元,一次包含 25,000 个输入 Token 的请求,在生成任何输出前已花费 0.05 美元。
输入与输出通常价格不同。除非你已经根据自己的真实流量算出混合费率,否则不要把总 Token 数直接乘以一个统一价格。
| 字段 | 通常含义 | 常见错误 |
|---|---|---|
| 输入 | 发送给模型、且未命中缓存的 Prompt Token | 忘记 system prompt 与检索文档 |
| 输出 | 模型生成的 Token | 按最大输出上限估算,而不是使用真实观测值 |
| 缓存输入 | 从服务商缓存中读取的复用 Prompt Token | 假设所有符合资格的 Token 都能命中 |
| 缓存写入 | 写入 Prompt 缓存的 Token | 把缓存创建当作免费操作 |
当前被本站追踪的文本 API 并没有一个可广泛比较的“缓存输出”价格。Prompt Caching 处理的是可复用输入前缀。因此,LLM Price Lens 把第四个字段明确标成缓存写入,而不是虚构一个缓存输出数字。
假设一个应用发送 40,000 个输入 Token,收到 2,000 个输出 Token,其中 30,000 个输入 Token 命中缓存。使用以下假设价格:
| 价格维度 | 费率 | Token | 成本 |
|---|---|---|---|
| 未缓存输入 | $3.00 / 百万 | 10,000 | $0.03 |
| 缓存输入 | $0.30 / 百万 | 30,000 | $0.009 |
| 输出 | $15.00 / 百万 | 2,000 | $0.03 |
本次请求成本是 $0.069,尚未计入缓存写入费用。要得到有意义的月度估算,应乘以真实请求量,并把缓存命中率建模为一个范围,而不是一个承诺值。
可以先用本站快速比较模型,但在做采购决策前,仍应核对服务商的官方价格页。生产环境的成本控制应记录 API 响应中的真实输入、缓存输入与输出用量,并每月将估算结果与账单对照。