AI API 预算不能只看价格表。价格表只告诉你每百万 token 的单价,真实账单还取决于输入、输出、历史消息、检索片段、工具返回、失败重试和用户重复生成。

导读:你可以把这篇当成 AI API 预算估算流程来用。先按请求类型取 token 样本,再计算平均/P90/上限成本,最后把预算变成产品限额和告警。

官方来源与核验规则

价格和模型能力会变化,优先看 官方来源:

核验规则:

  1. 模型价格只看官方 pricing;
  2. token 估算要用真实样本;
  3. 预算不能假设缓存一定命中;
  4. 要包含重试率和安全余量;
  5. 上线后一周必须用真实账单校正。

第一步:按请求类型拆预算

不要问“整个产品一个月多少钱”。先拆请求类型:

请求类型输入来源输出预算风险
普通问答system + 用户问题短回答调用频率高
RAG 问答检索片段 + 问题带引用回答检索片段过长
长文总结文档正文摘要/报告输入大、输出长
代码解释代码 + 错误日志分析建议上下文波动
Agent 任务多轮 + 工具结果多步骤结果调用次数不可控

不同请求的成本结构不同,必须分开估算。

第二步:建立三档 token 样本

每类请求至少保留三档:

样本作用
平均样本日常成本
P90 样本常见长请求风险
合法上限最坏账单边界

示例:

字段平均P90上限
system prompt700700700
用户问题1204001000
检索片段2000500010000
历史消息40012003000
预期输出50012002500

如果没有这些上限,预算估算本身就不成立。

第三步:用公式计算月预算

1
月预算 = 单次成本 × 每日请求量 × 30 × (1 + 重试率) × 安全余量

建议初期保守:

变量建议
重试率5%-15%
安全余量1.3x-2x
观察期上线后 7 天

不要把重试率写成 0。AI 功能越复杂,越容易有失败重试、用户重新生成和后台任务重跑。

第四步:把预算转成上线限制

预算风险产品/工程限制
输入过长限制上传字数、历史轮数、检索片段
输出过长默认短回答,长报告二次确认
重试过多按钮防连点、幂等键、重试上限
Agent 循环最大步骤数、工具调用上限
高质量模型太贵只给高价值任务升级模型
用户滥用用户级额度、告警、限流

预算必须落到产品规则里,否则只是文档。

第五步:上线后一周复盘

检查:

  • 平均输入是否变长;
  • P90 请求是否比预期多;
  • 输出是否超长;
  • 检索片段是否过多;
  • 重试率是否被低估;
  • 是否有后台任务重复执行;
  • 是否有用户用短问答入口处理长文档。

如果账单偏离预算,不要直接说“模型太贵”。先定位是哪类请求、哪个字段导致成本上升。

成本控制 checklist

  • 每类请求都有 token 样本;
  • 输入、输出、历史、检索片段都有上限;
  • 有重试率和安全余量;
  • 有用户级额度;
  • 有日成本告警;
  • 有模型降级策略;
  • 有上线后一周复盘;
  • 有异常请求日志。

与成本工具配合

如果你需要快速估算,可以用 AI API 成本计算器辅助,但最终仍要回到自己的请求样本。站内可继续看:

FAQ

预算估算需要非常精确吗?

上线前不需要绝对精确,但必须知道哪些变量最危险。上线后一周用真实账单修正。

Prompt caching 可以直接算成省钱吗?

不要一开始就依赖缓存。先按无缓存估算,缓存命中只作为优化收益。

最容易低估的成本是什么?

输出长度、重试率和 Agent 多轮工具调用。这三项最容易让账单超出预期。

总结

AI API 预算估算的核心不是背价格表,而是建立从 token 样本到上线限额的 流程。先拆请求类型,再算三档样本,加入重试和安全余量,最后把预算变成产品限制、告警和复盘机制。