麦式参考 MickerBook Reference

Token 成本

Token Cost

也常被叫作:计费AI费用用量账单

你可能会这么说

「用 AI 到底怎么花钱?为什么聊着聊着账单就上去了?」

Token 成本 Token Cost

AI 按 token 量计费:输入输出都收钱,长对话会把历史反复重算,钱就这么花掉的。

AI 的计费单位是 token——你发过去的和它吐出来的每一小块内容都算钱。输入和输出都收费,而且通常输出的单价更贵。所以「让它多解释一遍」「把整个文件贴进去」「让它复述你的需求」这些动作,每一件都在直接花钱。

真正让账单悄悄变大的,是长对话的重复计费。AI 没有记忆,每一轮都要把当前能看到的全部内容重新读一遍——包括你第一轮说的那句话。一个聊了 50 轮的长对话,第 50 轮的输入量可能是第 1 轮的几十倍,而且每一轮都按这个量收钱。所以成本不是线性增长,是加速增长。输出也一样:模型一次只能生成有限个 token,让它长篇大论,等于按字数付费还等得更久。

省钱不是抠门,是把它当可测量的量来管:知道大概价格(模型之间差异很大,贵的可能差一个数量级)、看用量页面的真实数字、把大文件换成摘要、把长对话拆成多轮短交接。判断省不省钱的唯一标准是账单数字,不是感觉。

长什么样 真实可交互,不是截图

这一轮的账单
输入 12,000 tokens × 输入单价 = 输入费
输出   800 tokens × 输出单价(更贵)= 输出费
───────
长对话的真相:
第 50 轮会把前 49 轮的内容
再算一遍输入费
✕ 烧钱动作整个项目贴进去
让它复述你的需求
一个对话聊到底
✓ 省钱动作只贴相关文件
直接要结论
分轮做,每轮给交接

单价数字因模型而异,这里不写死。你要记住的是结构:输出更贵、历史反复重算——这两条决定了大部分账单。

拆开看,里面有这几块

  1. 1
    输入 token Input

    你发过去的一切,包括历史消息和贴入的文件。长对话里这是最大的开销项。

  2. 2
    输出 token Output

    它生成的内容。通常单价比输入贵,长篇输出是隐形成本。

  3. 3
    单价 Price per token

    每个模型不同,贵的可能差一个数量级;同一模型还有缓存命中和未命中的差价。

  4. 4
    累计重算 Re-billing

    长对话每轮把全部历史重新作为输入计费。成本随轮数加速增长。

常见的有哪几种

按量付费Pay-as-you-go

用多少算多少,灵活,账单直接反映用量。

用在:个人日常使用

包月额度Subscription

固定月费含一定额度,超额另算。

用在:使用强度稳定的场景

企业协议Enterprise

批量折扣、私有部署、审计。

用在:团队或高频调用

容易搞混?这样区分

Token 成本 Token Token

Token 是计量单位(内容被切成的小块),Token 成本是这笔账(单位 × 数量 × 单价)。懂 token 才能看懂成本从哪来。

看 Token
Token 成本 上下文窗口 Context Window

窗口是容量上限,成本是每轮实际读了多少。窗口大不等于贵——贵不贵,看每轮输入的 token 量。

看 上下文窗口
Token 成本 字数 Character count

中文字数接近 token 数,但英文长单词、代码符号、缩进会明显多算。估费用别拿字数当 token 数。

什么时候用得上

账单突然变高

先查有没有超长对话没结束,或者反复贴大文件。这两个是最常见原因。

换模型前

先对比单价和窗口,别只看「能力更强」。贵的模型单轮可能贵一个数量级。

批量任务

能合并的合并、能精简的精简、能用缓存的用缓存,压单轮成本。

你可以这样跟 AI 说

直接复制下面这段,把【】里的换成你的情况。它比一句「帮我加个 X」多说清楚了:改哪里、不许动啥、做完交什么。

【任务】评估一下用 AI 做 [这个事] 一个月大概花多少钱
【范围】只做估算和给省钱建议,不要改任何代码和配置
【目标】给出:
  1. 月成本估算,附完整计算过程(用量假设 × 单价 × 频率)
  2. 成本主要花在哪:输入 / 输出 / 长对话重算
  3. 3 个具体的省钱动作,每个写清省什么、代价是什么
【边界】不要推荐我换成具体付费产品;不要编造价格,给不出准确单价就标注「需查当前价格」
【交付】
  1. 计算过程(数字对数字,我能复核)
  2. 省钱动作清单(动作 → 省什么 → 代价)
  3. 哪些数字你没核实、我自己怎么核实

「需查当前价格」这句话很值钱:AI 对价格特别自信,却经常用几个月前的数字算今天的账。逼它标注不确定项,账单才不会估错。

它说「做好了」,你怎么自己验

这是本站的重头戏。AI 最会的不是写代码,是说「已完成」。这一条,它通常最多做到「概念」这层:只是说清了要做什么,还没有任何东西在跑。

要亲眼看到这些,才算数

  • 打开平台的用量 / 账单页面,看实际消耗的 token 数,和它的估算对不对得上。
  • 记录一个长对话开始和结束的用量数字,验证「历史反复重算」是不是真的让成本加速。
  • 执行一个省钱动作(比如让它不复述需求),对比前后输出 token 是否下降。

它常这么糊弄你

  • 「大概几块钱吧」——没有计算过程的价格都是感觉。要数字对数字的推导。
  • 用几个月前的单价算今天的账——价格会变。让它标注时间或「需查当前价格」。
  • 「上下文窗口大,随便贴」——贴的越多,每轮输入越贵,成本加速。
  • 把输出按输入单价算——输出通常更贵,混在一起会把预算低估一半以上。

成本是「概念」层:知道量级和账单数字就够,不需要精确到分。真正要盯的是变化方向——有没有在加速变贵。

考考你 选一个你觉得对的

为什么同一个对话聊到第 40 轮,成本比第 1 轮高得多?