Token 费用怎么算:AI API 成本估算与用量核对
估算大模型 API 成本时,不能只看输入文本的字数。输入、输出、缓存以及模型计费单位都会影响最终费用。本文给出可自行替换单价的计算方法。
先统一为“美元 / 百万 token”,分别计算输入和输出,再按 usage 定义处理缓存;不要把缓存或推理 token 重复相加。
本文目录
Token 费用计算器
填入实际单价和预计用量,即时估算无缓存文本请求的费用。
1. 先统一价格单位
本站文本模型价格使用美元 / 百万 token。Token 是模型处理文本等输入的单位,不能按固定比例直接等同于汉字数或英文单词数。历史对话、系统提示和工具定义也可能计入输入。
从 当前定价页 确认实际售价与适用分组。如果展示的已经是本站售价,就不要再次乘分组倍率。图像、视频等按张或按次计费的项目应另列,不能直接套用文本公式。
2. 没有缓存时的基本公式
单次费用 = 输入 token ÷ 1,000,000 × 输入单价
+ 输出 token ÷ 1,000,000 × 输出单价假设一次请求消耗 2,000 个输入 token、500 个输出 token;假设输入单价为 1 美元 / 百万 token,输出单价为 4 美元 / 百万 token,则费用为 0.004 美元。一万次相同用量的请求约为 40 美元。
这里的数字只用于展示计算方法,不是零词元或任何模型的当前报价,也不是实际账单承诺。
3. 有缓存时避免重复计算
缓存读取和缓存写入可能有不同单价。先查看协议与模型对 usage 字段的定义,确认输入总数是否已经包含缓存部分,再拆分计算。若输入总数中已包含缓存读取 token,就不能把全部输入按普通价格计费后又加一遍缓存读取费。
推理模型还可能单独报告推理 token。是否已包含在输出总量中,应以该模型的用量定义和本站账单明细为准。不要在未知字段关系时自行叠加。
4. 从真实样本预测月度预算
- 收集一组代表实际任务长度的成功请求,记录模型、输入、输出、缓存和实际扣费。
- 按任务类型分组:短问答、长文档处理、代码生成的输出长度往往不同。
- 分别计算平均费用,再乘预计请求量;保留长请求和用量峰值的预算空间。
- 设置密钥额度和应用侧告警,并定期在 用量记录 中核对。
5. 优先减少无效用量
删去重复的系统提示,避免每次发送与当前任务无关的完整历史;在任务允许的范围内控制输出长度。对重复任务,可评估应用层结果缓存,但需要明确数据时效、用户隔离和失效规则。
模型选择应同时比较任务成功率和单次成本。一个便宜但反复失败的模型,完成一次有效任务的总成本可能更高。计费规则详见 计费模式说明。
常见问题
一个汉字等于一个 token 吗?
没有通用的固定换算。不同模型、语言和输入形式会影响 token 数,实际核算应采用返回的 usage 和账单数据。
计算器里的单价是本站报价吗?
不是。默认值只是演示数字。请从定价页确认适用模型和分组的实际单价,再填入计算器。
有缓存和图片输入时如何计算?
本页计算器只估算无缓存的文本输入与输出。缓存需要按字段含义拆分,图片和其他按次计费项目需按相应规则另算。
准备好开始验证了吗?
使用已有账号进入控制台,确认密钥权限与可用额度,再执行最小请求。
登录控制台 查看文档