AI API 预算怎么估:从 Token 样本到上线限额
AI API 预算不能只看价格表。价格表只告诉你每百万 token 的单价,真实账单还取决于输入、输出、历史消息、检索片段、工具返回、失败重试和用户重复生成。
导读:你可以把这篇当成 AI API 预算估算流程来用。先按请求类型取 token 样本,再计算平均/P90/上限成本,最后把预算变成产品限额和告警。
官方来源与核验规则
价格和模型能力会变化,优先看 官方来源:
核验规则:
- 模型价格只看官方 pricing;
- token 估算要用真实样本;
- 预算不能假设缓存一定命中;
- 要包含重试率和安全余量;
- 上线后一周必须用真实账单校正。
第一步:按请求类型拆预算
不要问“整个产品一个月多少钱”。先拆请求类型:
| 请求类型 | 输入来源 | 输出 | 预算风险 |
|---|---|---|---|
| 普通问答 | system + 用户问题 | 短回答 | 调用频率高 |
| RAG 问答 | 检索片段 + 问题 | 带引用回答 | 检索片段过长 |
| 长文总结 | 文档正文 | 摘要/报告 | 输入大、输出长 |
| 代码解释 | 代码 + 错误日志 | 分析建议 | 上下文波动 |
| Agent 任务 | 多轮 + 工具结果 | 多步骤结果 | 调用次数不可控 |
不同请求的成本结构不同,必须分开估算。
第二步:建立三档 token 样本
每类请求至少保留三档:
| 样本 | 作用 |
|---|---|
| 平均样本 | 日常成本 |
| P90 样本 | 常见长请求风险 |
| 合法上限 | 最坏账单边界 |
示例:
| 字段 | 平均 | P90 | 上限 |
|---|---|---|---|
| system prompt | 700 | 700 | 700 |
| 用户问题 | 120 | 400 | 1000 |
| 检索片段 | 2000 | 5000 | 10000 |
| 历史消息 | 400 | 1200 | 3000 |
| 预期输出 | 500 | 1200 | 2500 |
如果没有这些上限,预算估算本身就不成立。
第三步:用公式计算月预算
1 | 月预算 = 单次成本 × 每日请求量 × 30 × (1 + 重试率) × 安全余量 |
建议初期保守:
| 变量 | 建议 |
|---|---|
| 重试率 | 5%-15% |
| 安全余量 | 1.3x-2x |
| 观察期 | 上线后 7 天 |
不要把重试率写成 0。AI 功能越复杂,越容易有失败重试、用户重新生成和后台任务重跑。
第四步:把预算转成上线限制
| 预算风险 | 产品/工程限制 |
|---|---|
| 输入过长 | 限制上传字数、历史轮数、检索片段 |
| 输出过长 | 默认短回答,长报告二次确认 |
| 重试过多 | 按钮防连点、幂等键、重试上限 |
| Agent 循环 | 最大步骤数、工具调用上限 |
| 高质量模型太贵 | 只给高价值任务升级模型 |
| 用户滥用 | 用户级额度、告警、限流 |
预算必须落到产品规则里,否则只是文档。
第五步:上线后一周复盘
检查:
- 平均输入是否变长;
- P90 请求是否比预期多;
- 输出是否超长;
- 检索片段是否过多;
- 重试率是否被低估;
- 是否有后台任务重复执行;
- 是否有用户用短问答入口处理长文档。
如果账单偏离预算,不要直接说“模型太贵”。先定位是哪类请求、哪个字段导致成本上升。
成本控制 checklist
- 每类请求都有 token 样本;
- 输入、输出、历史、检索片段都有上限;
- 有重试率和安全余量;
- 有用户级额度;
- 有日成本告警;
- 有模型降级策略;
- 有上线后一周复盘;
- 有异常请求日志。
与成本工具配合
如果你需要快速估算,可以用 AI API 成本计算器辅助,但最终仍要回到自己的请求样本。站内可继续看:
FAQ
预算估算需要非常精确吗?
上线前不需要绝对精确,但必须知道哪些变量最危险。上线后一周用真实账单修正。
Prompt caching 可以直接算成省钱吗?
不要一开始就依赖缓存。先按无缓存估算,缓存命中只作为优化收益。
最容易低估的成本是什么?
输出长度、重试率和 Agent 多轮工具调用。这三项最容易让账单超出预期。
总结
AI API 预算估算的核心不是背价格表,而是建立从 token 样本到上线限额的 流程。先拆请求类型,再算三档样本,加入重试和安全余量,最后把预算变成产品限制、告警和复盘机制。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 AJie's Blog!
评论

