返回指南
定价阅读约 10 分钟

AI API 成本计算:如何估算 Token 支出

在上线前估算输入、输出、缓存、重试和固定支出对 AI API 成本的影响。

Token 成本取决于工作负载形态

AI API 预算不能只看请求数。提示词长度、输出长度、模型、工具调用、重试和缓存上下文都会改变最终账单。

应使用真实测试集记录中位数与高分位的输入、输出长度。中位数代表正常支出,高分位用于为长对话和大文档预留空间。

分别计算输入和输出

供应商通常为输入和输出设置不同价格。每个模型应单独计算,只有在请求组合稳定后才适合使用加权平均价。

月 Token 成本 = 月输入 Token / 1,000,000 × 输入单价 + 月输出 Token / 1,000,000 × 输出单价

考虑重试、工具和上下文增长

生产流量通常比演示更贵:超时会触发重试,Agent 会多次调用工具,检索会增加上下文,对话历史也会不断增长。

可以用调用放大系数描述这种差异。例如 10,000 次用户操作产生 12,500 次上游请求,放大系数就是 1.25。

成本因素测量方式预算处理
重试每次成功操作的上游调用数放大请求和 Token
工具循环每个工作流的模型调用数逐步计算或使用放大系数
上下文增长不同轮次的 Token 数使用中位数与高分位情景
缓存缓存与未缓存输入分别使用对应单价

建立三个月度情景

不要只做一个预测。分别建立低增长、基准和压力情景,比较总成本和每次成功用户操作的成本。

  • 低增长:较少活跃用户、正常 Token、完整固定成本。
  • 基准:预期用户、实测 Token 与重试率。
  • 压力:更高流量、更长输出、更多重试和价格缓冲。

把估算转化为运行控制

用预算设置每日支出阈值、工作区配额、最大输出长度和成本异常告警,并在每个账期把实际数据与预测进行比较。

降低成本不一定只能涨价。精简提示词、为简单步骤使用更小模型、设置响应上限、缓存和优化重试都可能改善利润。