KNOWLEDGE ARTICLE

大模型API价格怎么算-输入输出缓存与100万Token说明

大模型 API 价格怎么算?先分别统计未缓存输入 Token、缓存输入 Token 和输出 Token,再把各自用量除以 1,000,000,乘以对应单价,最后加上搜索、图片、代码执行等工具费。若通过第三方平台调用,还要核对模型倍率、充值折算和结算汇率。

通用公式:API 费用 = 未缓存输入 Token ÷ 1,000,000 × 输入单价 + 缓存输入 Token ÷ 1,000,000 × 缓存单价 + 输出 Token ÷ 1,000,000 × 输出单价 + 其他费用。

计费项 通常包含什么 容易漏算的部分
输入 Token 问题、系统提示、历史消息、文档、工具定义 多轮对话会反复发送上下文
缓存 Token 重复且符合缓存条件的输入前缀 缓存写入、读取和存储可能分别计价
输出 Token 模型生成的回答、代码及部分模型的推理 Token 输出单价往往高于输入单价
其他费用 联网搜索、图片、音频、文件检索或工具执行 有的按次数、时长或存储量另收

大模型 API 价格怎么算:5 步完成估算

  1. 确认实际调用的模型版本和计费模式。
  2. 从官方价格页记录输入、缓存输入和输出的每百万 Token 单价。
  3. 从 API 返回值或用量后台取得各类 Token 数,不用肉眼按字数猜。
  4. 将每类 Token 分开套入公式,再加工具、存储或批处理费用。
  5. 按支付渠道加入汇率、平台倍率或充值折算,得到实际支出。

最关键的是“分开算”。把输入和输出相加后统一乘一个单价,结果通常会错,因为同一模型的输入价、缓存价与输出价往往不同。

第一步:认准模型完整名称与价格档位

同一家厂商的旗舰、轻量和推理模型,单价可能相差明显。即使名称相近,快照版本、标准模式、批处理模式和区域端点也可能采用不同价格。部分模型还会在输入超过某个长度后进入更高档位。

因此,报价页只写“GPT”“Claude”或“Gemini”还不够。你需要看到完整模型名、输入价、输出价、缓存规则和更新时间。比较 API 类商品时,可先浏览一可比价网商品目录,再把不同渠道的报价换成同一单位。

第二步:从 usage 字段读取 Token 用量

一次调用结束后,主流 API 通常会在响应的 usageusage_metadata 中返回输入、输出和总 Token。缓存命中、推理 Token 等细项的字段名因平台而异,以对应接口文档为准。

账单应以服务端记录为准。中文字符、英文单词、数字、标点和代码的切分方式不同,“1000 个汉字等于 1000 Token”并不成立。换模型后,分词结果也可能变化。

第三步:分别代入每百万 Token 单价

假设某模型的输入价为 2 美元/百万 Token,缓存输入价为 0.2 美元/百万 Token,输出价为 10 美元/百万 Token。某次请求消耗 8,000 个普通输入 Token、20,000 个缓存 Token,并生成 1,500 个输出 Token:

输入费用:8,000 ÷ 1,000,000 × 2 = 0.016 美元
缓存费用:20,000 ÷ 1,000,000 × 0.2 = 0.004 美元
输出费用:1,500 ÷ 1,000,000 × 10 = 0.015 美元
本次合计:0.016 + 0.004 + 0.015 = 0.035 美元

这里的价格只是演示计算,不代表任何具体模型。正式估算时,应复制当天官方价格或渠道公开价,并保留核验日期。

第四步:加入非 Token 费用

开启联网搜索后,账单可能同时出现模型 Token 费与搜索调用费;显式上下文缓存可能另收存储费;代码执行可能按容器时长计费。图片、视频与音频也不一定沿用纯文本单价。看到“每百万 Token 仅需 X 元”时,要确认它是否只指文本输入。

第五步:换算成真正支付的人民币

官方以美元计价时,可用“美元费用 × 支付渠道结算汇率”换算人民币。第三方平台还可能设置模型倍率或余额兑换比例。不同平台对“1 元余额”“1 美金额度”和“1 倍率”的定义并不统一,不能只看充值面额。

较稳妥的比较方式,是拿同一组输入、缓存和输出用量,在各平台分别计算最终扣款。可以通过同源商品报价核对相近商品,并查看商品说明中的余额单位、可用模型、有效期和退款条件。

100 万 Token 是多少?它不是一次必须用完的套餐

“每 100 万 Token 多少钱”是一种计价单位,作用类似“每度电多少钱”。你不必一次消耗 100 万 Token,也不代表充值后会固定得到 100 万个字。实际只用 25,000 Token,就按 25,000 ÷ 1,000,000,也就是该档单价的 2.5% 计算。

100 万 Token 也不能固定换算成多少汉字。文本语言、标点、空格、代码和模型分词器都会影响结果。需要精确预算时,先用目标模型的 Token 统计接口测试一批真实请求,再用平均值估算月用量。

月成本估算:单次平均费用 × 每日调用次数 × 每月使用天数。不要只拿“每次提问的可见字数”计算,因为系统提示、历史对话和工具结果也会进入输入。

输入、输出和缓存 Token 到底怎么区分

输入 Token:不只包括你刚打的那句话

输入通常包括系统指令、当前问题、已携带的聊天记录、上传文档解析内容、工具说明与工具返回结果。一个对话到了第 20 轮,你只输入“继续”,接口仍可能发送前面的大段上下文。于是问题很短,输入账单却继续上涨。

输出 Token:可见回答之外还要看推理计费

输出是模型生成的内容。某些推理模型还会产生不可完全展示的推理 Token,并按平台规定计入输出或单独统计。设置最大输出长度只能限制上限,不等于每次都会消耗到上限。要控成本,回答长度、推理强度和任务复杂度都要观察。

缓存 Token:命中后便宜,但不是免费

缓存适合重复使用长系统提示、同一份文档或稳定的代码前缀。首次写入可能按普通输入价或更高倍率计费,后续命中才按较低价格读取。各平台对最小长度、前缀一致性和有效时间的要求不同;改动提示开头,也可能让后面的大段内容无法命中。

假设 10 次请求都携带 100,000 Token 的同一文档,普通输入价为 2 美元/百万 Token,缓存读取价为 0.2 美元/百万 Token。忽略首次写入差异,第一次按普通输入计算为 0.20 美元,后 9 次缓存读取共 0.18 美元;若全部未命中,仅这部分输入就要 2 美元。缓存是否划算,取决于复用次数和平台规则。

为什么实际扣费会高于你的预估

常见原因 账单表现 核对方法
多轮上下文变长 每次输入 Token 逐轮增加 逐次记录 usage,不只看总额
缓存未命中 普通输入增加,缓存输入减少 检查提示前缀、长度和有效期
推理或回答过长 输出费用明显上升 核对输出及推理 Token 明细
工具另行收费 Token 之外出现按次或按时费用 查看价格页的工具计费栏目
平台倍率或汇率 渠道扣款与官方估算不一致 用小额真实请求反推扣费口径

如果某渠道的扣费突然变化,可查最近价格变化并保留调用时间、模型名、usage 明细和余额截图。公开报价只能说明页面当时展示的价格,不能替代你的实际账单。

比较不同 API 报价时,用这张核对清单

  1. 模型是否一致:完整名称、版本、上下文长度和推理模式是否相同?
  2. 单位是否一致:报价是每千 Token、每百万 Token、美元还是人民币?
  3. 输入输出是否分价:缓存命中与未命中有没有单列?
  4. 倍率如何定义:倍率作用于官方价、平台余额还是充值金额?
  5. 额外费用有哪些:搜索、图片、存储和工具调用是否另算?
  6. 余额有什么限制:是否过期,能否退款,模型调价后怎样扣除?

一可比价网展示的是第三方页面的公开价格、库存与更新时间,不对账号来源、长期可用性或履约能力作保证。数据采集和限制可查看数据介绍

关于大模型 API 价格的常见问题

100 万 Token 等于 100 万个汉字吗?

不等于。Token 是模型分词后的计量单位,一个汉字、标点、英文片段或代码符号可能采用不同切分方式。准确数量应由目标模型的统计接口或账单返回。

为什么我只问一句话,却用了很多输入 Token?

API 可能同时提交系统提示、历史对话、文档和工具定义。聊天界面上只看到一句新问题,不代表请求体里只有这一句。

有缓存是不是一定更便宜?

不一定。内容需要满足平台的缓存条件,而且首次写入、存储时长可能收费。短提示只调用一两次时,缓存带来的节省可能很小;长文档被重复查询时更容易体现价值。

购买 ChatGPT、Claude 等会员后,会赠送 API 额度吗?

通常应把聊天产品订阅与开发者 API 账单视为两套产品,不能默认会员费包含 API 余额。是否互通要以对应厂商当前账户与计费说明为准。

最后:先统一口径,再比较价格

弄清大模型 API 价格怎么算,核心不是背下一张随时会变的价格表,而是保存一套可重复使用的公式。拿到模型完整名称、三类 Token 用量和对应单价后,先算模型费用,再加入工具费、倍率与汇率。

准备购买 API 余额或平台 Key 时,先在一可比价网比较当前价格与库存。把“每百万 Token 的实际扣款”作为统一单位,同时核对余额有效期、模型范围、售后边界和最近更新时间。

资料来源与核验说明

本文于 2026 年 8 月 2 日核验计费规则。各厂商可能调整模型、价格、缓存和工具收费,实际费用以调用当日的官方价格页与账户账单为准。