大模型API价格怎么算-输入输出缓存与100万Token说明
大模型 API 价格怎么算?先分别统计未缓存输入 Token、缓存输入 Token 和输出 Token,再把各自用量除以 1,000,000,乘以对应单价,最后加上搜索、图片、代码执行等工具费。若通过第三方平台调用,还要核对模型倍率、充值折算和结算汇率。
通用公式:API 费用 = 未缓存输入 Token ÷ 1,000,000 × 输入单价 + 缓存输入 Token ÷ 1,000,000 × 缓存单价 + 输出 Token ÷ 1,000,000 × 输出单价 + 其他费用。
| 计费项 | 通常包含什么 | 容易漏算的部分 |
|---|---|---|
| 输入 Token | 问题、系统提示、历史消息、文档、工具定义 | 多轮对话会反复发送上下文 |
| 缓存 Token | 重复且符合缓存条件的输入前缀 | 缓存写入、读取和存储可能分别计价 |
| 输出 Token | 模型生成的回答、代码及部分模型的推理 Token | 输出单价往往高于输入单价 |
| 其他费用 | 联网搜索、图片、音频、文件检索或工具执行 | 有的按次数、时长或存储量另收 |
大模型 API 价格怎么算:5 步完成估算
- 确认实际调用的模型版本和计费模式。
- 从官方价格页记录输入、缓存输入和输出的每百万 Token 单价。
- 从 API 返回值或用量后台取得各类 Token 数,不用肉眼按字数猜。
- 将每类 Token 分开套入公式,再加工具、存储或批处理费用。
- 按支付渠道加入汇率、平台倍率或充值折算,得到实际支出。
最关键的是“分开算”。把输入和输出相加后统一乘一个单价,结果通常会错,因为同一模型的输入价、缓存价与输出价往往不同。
第一步:认准模型完整名称与价格档位
同一家厂商的旗舰、轻量和推理模型,单价可能相差明显。即使名称相近,快照版本、标准模式、批处理模式和区域端点也可能采用不同价格。部分模型还会在输入超过某个长度后进入更高档位。
因此,报价页只写“GPT”“Claude”或“Gemini”还不够。你需要看到完整模型名、输入价、输出价、缓存规则和更新时间。比较 API 类商品时,可先浏览一可比价网商品目录,再把不同渠道的报价换成同一单位。
第二步:从 usage 字段读取 Token 用量
一次调用结束后,主流 API 通常会在响应的 usage 或 usage_metadata 中返回输入、输出和总 Token。缓存命中、推理 Token 等细项的字段名因平台而异,以对应接口文档为准。
账单应以服务端记录为准。中文字符、英文单词、数字、标点和代码的切分方式不同,“1000 个汉字等于 1000 Token”并不成立。换模型后,分词结果也可能变化。
第三步:分别代入每百万 Token 单价
假设某模型的输入价为 2 美元/百万 Token,缓存输入价为 0.2 美元/百万 Token,输出价为 10 美元/百万 Token。某次请求消耗 8,000 个普通输入 Token、20,000 个缓存 Token,并生成 1,500 个输出 Token:
输入费用:8,000 ÷ 1,000,000 × 2 = 0.016 美元
缓存费用:20,000 ÷ 1,000,000 × 0.2 = 0.004 美元
输出费用:1,500 ÷ 1,000,000 × 10 = 0.015 美元
本次合计:0.016 + 0.004 + 0.015 = 0.035 美元
这里的价格只是演示计算,不代表任何具体模型。正式估算时,应复制当天官方价格或渠道公开价,并保留核验日期。
第四步:加入非 Token 费用
开启联网搜索后,账单可能同时出现模型 Token 费与搜索调用费;显式上下文缓存可能另收存储费;代码执行可能按容器时长计费。图片、视频与音频也不一定沿用纯文本单价。看到“每百万 Token 仅需 X 元”时,要确认它是否只指文本输入。
第五步:换算成真正支付的人民币
官方以美元计价时,可用“美元费用 × 支付渠道结算汇率”换算人民币。第三方平台还可能设置模型倍率或余额兑换比例。不同平台对“1 元余额”“1 美金额度”和“1 倍率”的定义并不统一,不能只看充值面额。
较稳妥的比较方式,是拿同一组输入、缓存和输出用量,在各平台分别计算最终扣款。可以通过同源商品报价核对相近商品,并查看商品说明中的余额单位、可用模型、有效期和退款条件。
100 万 Token 是多少?它不是一次必须用完的套餐
“每 100 万 Token 多少钱”是一种计价单位,作用类似“每度电多少钱”。你不必一次消耗 100 万 Token,也不代表充值后会固定得到 100 万个字。实际只用 25,000 Token,就按 25,000 ÷ 1,000,000,也就是该档单价的 2.5% 计算。
100 万 Token 也不能固定换算成多少汉字。文本语言、标点、空格、代码和模型分词器都会影响结果。需要精确预算时,先用目标模型的 Token 统计接口测试一批真实请求,再用平均值估算月用量。
月成本估算:单次平均费用 × 每日调用次数 × 每月使用天数。不要只拿“每次提问的可见字数”计算,因为系统提示、历史对话和工具结果也会进入输入。
输入、输出和缓存 Token 到底怎么区分
输入 Token:不只包括你刚打的那句话
输入通常包括系统指令、当前问题、已携带的聊天记录、上传文档解析内容、工具说明与工具返回结果。一个对话到了第 20 轮,你只输入“继续”,接口仍可能发送前面的大段上下文。于是问题很短,输入账单却继续上涨。
输出 Token:可见回答之外还要看推理计费
输出是模型生成的内容。某些推理模型还会产生不可完全展示的推理 Token,并按平台规定计入输出或单独统计。设置最大输出长度只能限制上限,不等于每次都会消耗到上限。要控成本,回答长度、推理强度和任务复杂度都要观察。
缓存 Token:命中后便宜,但不是免费
缓存适合重复使用长系统提示、同一份文档或稳定的代码前缀。首次写入可能按普通输入价或更高倍率计费,后续命中才按较低价格读取。各平台对最小长度、前缀一致性和有效时间的要求不同;改动提示开头,也可能让后面的大段内容无法命中。
假设 10 次请求都携带 100,000 Token 的同一文档,普通输入价为 2 美元/百万 Token,缓存读取价为 0.2 美元/百万 Token。忽略首次写入差异,第一次按普通输入计算为 0.20 美元,后 9 次缓存读取共 0.18 美元;若全部未命中,仅这部分输入就要 2 美元。缓存是否划算,取决于复用次数和平台规则。
为什么实际扣费会高于你的预估
| 常见原因 | 账单表现 | 核对方法 |
|---|---|---|
| 多轮上下文变长 | 每次输入 Token 逐轮增加 | 逐次记录 usage,不只看总额 |
| 缓存未命中 | 普通输入增加,缓存输入减少 | 检查提示前缀、长度和有效期 |
| 推理或回答过长 | 输出费用明显上升 | 核对输出及推理 Token 明细 |
| 工具另行收费 | Token 之外出现按次或按时费用 | 查看价格页的工具计费栏目 |
| 平台倍率或汇率 | 渠道扣款与官方估算不一致 | 用小额真实请求反推扣费口径 |
如果某渠道的扣费突然变化,可查最近价格变化并保留调用时间、模型名、usage 明细和余额截图。公开报价只能说明页面当时展示的价格,不能替代你的实际账单。
比较不同 API 报价时,用这张核对清单
- 模型是否一致:完整名称、版本、上下文长度和推理模式是否相同?
- 单位是否一致:报价是每千 Token、每百万 Token、美元还是人民币?
- 输入输出是否分价:缓存命中与未命中有没有单列?
- 倍率如何定义:倍率作用于官方价、平台余额还是充值金额?
- 额外费用有哪些:搜索、图片、存储和工具调用是否另算?
- 余额有什么限制:是否过期,能否退款,模型调价后怎样扣除?
一可比价网展示的是第三方页面的公开价格、库存与更新时间,不对账号来源、长期可用性或履约能力作保证。数据采集和限制可查看数据介绍。
关于大模型 API 价格的常见问题
100 万 Token 等于 100 万个汉字吗?
不等于。Token 是模型分词后的计量单位,一个汉字、标点、英文片段或代码符号可能采用不同切分方式。准确数量应由目标模型的统计接口或账单返回。
为什么我只问一句话,却用了很多输入 Token?
API 可能同时提交系统提示、历史对话、文档和工具定义。聊天界面上只看到一句新问题,不代表请求体里只有这一句。
有缓存是不是一定更便宜?
不一定。内容需要满足平台的缓存条件,而且首次写入、存储时长可能收费。短提示只调用一两次时,缓存带来的节省可能很小;长文档被重复查询时更容易体现价值。
购买 ChatGPT、Claude 等会员后,会赠送 API 额度吗?
通常应把聊天产品订阅与开发者 API 账单视为两套产品,不能默认会员费包含 API 余额。是否互通要以对应厂商当前账户与计费说明为准。
最后:先统一口径,再比较价格
弄清大模型 API 价格怎么算,核心不是背下一张随时会变的价格表,而是保存一套可重复使用的公式。拿到模型完整名称、三类 Token 用量和对应单价后,先算模型费用,再加入工具费、倍率与汇率。
准备购买 API 余额或平台 Key 时,先在一可比价网比较当前价格与库存。把“每百万 Token 的实际扣款”作为统一单位,同时核对余额有效期、模型范围、售后边界和最近更新时间。
资料来源与核验说明
- OpenAI:什么是 Token,如何计算 Token
- Anthropic:Claude API 定价与提示缓存
- Google:Gemini Developer API 价格
- DeepSeek:模型与价格
本文于 2026 年 8 月 2 日核验计费规则。各厂商可能调整模型、价格、缓存和工具收费,实际费用以调用当日的官方价格页与账户账单为准。

