Token 成本取决于工作负载形态
AI API 预算不能只看请求数。提示词长度、输出长度、模型、工具调用、重试和缓存上下文都会改变最终账单。
应使用真实测试集记录中位数与高分位的输入、输出长度。中位数代表正常支出,高分位用于为长对话和大文档预留空间。
分别计算输入和输出
供应商通常为输入和输出设置不同价格。每个模型应单独计算,只有在请求组合稳定后才适合使用加权平均价。
月 Token 成本 = 月输入 Token / 1,000,000 × 输入单价 + 月输出 Token / 1,000,000 × 输出单价
考虑重试、工具和上下文增长
生产流量通常比演示更贵:超时会触发重试,Agent 会多次调用工具,检索会增加上下文,对话历史也会不断增长。
可以用调用放大系数描述这种差异。例如 10,000 次用户操作产生 12,500 次上游请求,放大系数就是 1.25。
| 成本因素 | 测量方式 | 预算处理 |
|---|---|---|
| 重试 | 每次成功操作的上游调用数 | 放大请求和 Token |
| 工具循环 | 每个工作流的模型调用数 | 逐步计算或使用放大系数 |
| 上下文增长 | 不同轮次的 Token 数 | 使用中位数与高分位情景 |
| 缓存 | 缓存与未缓存输入 | 分别使用对应单价 |
建立三个月度情景
不要只做一个预测。分别建立低增长、基准和压力情景,比较总成本和每次成功用户操作的成本。
- 低增长:较少活跃用户、正常 Token、完整固定成本。
- 基准:预期用户、实测 Token 与重试率。
- 压力:更高流量、更长输出、更多重试和价格缓冲。
把估算转化为运行控制
用预算设置每日支出阈值、工作区配额、最大输出长度和成本异常告警,并在每个账期把实际数据与预测进行比较。
降低成本不一定只能涨价。精简提示词、为简单步骤使用更小模型、设置响应上限、缓存和优化重试都可能改善利润。