AI 问答库

大模型的 token 成本怎么估算?

一句话回答

估算公式是:单次成本 =(输入 token × 输入单价)+(输出 token × 输出单价),再乘日调用次数。关键在三点:输入输出分开计价且输出通常更贵;RAG 片段和多轮对话历史会让输入 token 远超直觉;命中上下文缓存的部分按更低价计。不要照抄任何单价,各家几个月调一次,务必用官方最新价目和自己实测的 token 数算。

关键要点

  • 01输入和输出分开计价,输出通常更贵。所以「让模型少说废话」是最直接的降本手段:限制输出长度、要求结构化输出、去掉客套开场白。
  • 02中文与 token 的换算没有固定值。同一段文本在不同分词器下差异明显,估算时应直接用目标厂商的 tokenizer 实测一批真实样本,而不是套一个经验系数。
  • 03RAG 是 token 账单的主要放大器。每次调用都要把召回的多个文档片段塞进上下文,输入量可能是原始问题的几十倍 —— 降低 top-k 和缩短片段长度往往比换模型省得多。
  • 04多轮对话如果每轮都带全量历史,成本随轮次近似平方增长。做摘要压缩或滑动窗口是必要的工程动作,不是优化项。
  • 05上下文缓存能显著降低固定前缀的成本。把长 system prompt、固定的工具定义、稳定的知识片段放在提示词最前面并保持字节级一致,是命中缓存的前提。
  • 06推理型模型的「思考」过程通常也计入输出 token。用这类模型做简单分类或抽取,账单可能比预期高出一截 —— 按任务难度分级路由更省。

按场景看 token 消耗结构

下表刻意不给单价 —— 各家厂商的价目每几个月就会调整一次,写死会立刻过期并误导读者。表里给的是量级关系和成本变量,这部分相对稳定:同样一次调用,纯问答和长文档抽取的 token 量可能差两个数量级,而降本手段也完全不同。用法是先在表里找到你的场景,确认主要成本变量是什么,再去官方价目表取当前单价代入公式。

场景单次调用量级主要成本变量优化手段
单轮短问答(无检索)输入百级 token,输出百级 tokensystem prompt 长度与输出啰嗦程度压缩 system prompt、限制输出长度、开上下文缓存
RAG 知识库问答输入千级到万级 token,输出百级top-k 数量 × 单片段长度,输入侧占绝对大头降 top-k、加重排只送最相关片段、按结构切分避免冗余
长文档摘要 / 合同抽取输入万级到十万级 token,输出千级文档总长度;是否每次全文重传先做规则预筛只送相关章节、分段处理再汇总、缓存固定前缀
多轮 Agent 工具调用一个任务累计万级以上,随步数增长每步都重传完整历史与工具定义;失败重试翻倍历史摘要压缩、精简工具定义、限制最大步数、失败快速退出
批量离线处理(分类 / 打标)单条量级小,但总量 = 单条 × 数据条数数据条数;用了能力过剩的大模型换小模型或本地模型、走批量接口、能用规则先过滤的先过滤

怎么算出一个能用的预算数字

第一步,别猜 token 数,去测。取 30–50 条真实业务请求,用目标厂商的 tokenizer 统计每条的实际输入与输出 token,取平均值和 P90 —— P90 比平均值更重要,因为长尾请求经常贡献大部分成本。第二步,估调用量。用现有业务数据倒推:现在人工处理多少单、其中多少比例会走 AI、每单平均触发几次模型调用。第三步,代入公式:月成本 =(平均输入 token × 输入单价 + 平均输出 token × 输出单价)× 日调用次数 × 30。第四步,乘一个 1.3–1.5 的系数覆盖重试、评测跑批和试用期的浪费 —— 这部分在实际账单里永远存在。第五步,用 P90 而不是平均值再算一遍,作为预算上限。跑一个月真实流量之后回来修正这组数字,之前的一切测算都只是量级判断。

按性价比排序的降本手段

一、砍输入。RAG 场景下把 top-k 从 10 降到 3 并加一个重排模型,通常既省 token 又提高准确率,是少见的双赢。二、开上下文缓存。把长 system prompt 和固定工具定义放在提示词最前端并保持完全一致,命中缓存后这部分成本会大幅下降;注意任何一个字符的变动都会让缓存失效。三、按难度分级路由。简单分类、意图识别、格式转换用小模型或本地模型,只有真正需要推理的请求才送到旗舰模型 —— 这一步的收益通常最大,也最容易被忽略。四、限制输出。要求 JSON、限定最大长度、禁止复述问题。五、砍多轮历史。滑动窗口或定期摘要压缩。六、批量任务走批量接口,很多厂商对非实时批处理有明显折扣。做完前三条,多数场景的账单已经能降到一个可接受的量级。

适用边界

什么情况下本答案不成立

  • 本文刻意不给具体单价。各厂商的价目表每几个月就调整一次,写死的数字会立刻过期并误导读者 —— 测算时请以官方最新价目表为准。
  • 中文与 token 的换算随分词器变化明显,不存在通用系数。任何「一个汉字等于几个 token」的说法都只在特定模型上成立,必须用目标厂商的 tokenizer 实测。
  • 本文按调用云端模型 API 的计费口径写。私有化部署的成本结构完全不同 —— 主要是硬件折旧、电力与运维人力,边际成本接近电费,不适用本文公式。
  • 缓存、批量接口与折扣策略各厂商差异很大,且部分能力有最小前缀长度、生效时长等限制。签约前应就你的实际调用模式与厂商确认,不要按通用描述做预算。

同义问法

  • token 是怎么计费的?
  • 一次大模型调用大概消耗多少 token?
  • 中文一个字算几个 token?
  • 怎么降低大模型的 API 调用成本?
  • RAG 会让 token 成本涨多少?
撰写YGG 臻星科技解决方案团队发布2026-08-01最近复核2026-08-01