Token 成本
Token Cost也常被叫作:计费AI费用用量账单
「用 AI 到底怎么花钱?为什么聊着聊着账单就上去了?」
Token 成本 Token Cost
AI 按 token 量计费:输入输出都收钱,长对话会把历史反复重算,钱就这么花掉的。
AI 的计费单位是 token——你发过去的和它吐出来的每一小块内容都算钱。输入和输出都收费,而且通常输出的单价更贵。所以「让它多解释一遍」「把整个文件贴进去」「让它复述你的需求」这些动作,每一件都在直接花钱。
真正让账单悄悄变大的,是长对话的重复计费。AI 没有记忆,每一轮都要把当前能看到的全部内容重新读一遍——包括你第一轮说的那句话。一个聊了 50 轮的长对话,第 50 轮的输入量可能是第 1 轮的几十倍,而且每一轮都按这个量收钱。所以成本不是线性增长,是加速增长。输出也一样:模型一次只能生成有限个 token,让它长篇大论,等于按字数付费还等得更久。
省钱不是抠门,是把它当可测量的量来管:知道大概价格(模型之间差异很大,贵的可能差一个数量级)、看用量页面的真实数字、把大文件换成摘要、把长对话拆成多轮短交接。判断省不省钱的唯一标准是账单数字,不是感觉。
长什么样 真实可交互,不是截图
这一轮的账单 输入 12,000 tokens × 输入单价 = 输入费 输出 800 tokens × 输出单价(更贵)= 输出费 ─────── 长对话的真相: 第 50 轮会把前 49 轮的内容 再算一遍输入费
让它复述你的需求
一个对话聊到底
直接要结论
分轮做,每轮给交接
单价数字因模型而异,这里不写死。你要记住的是结构:输出更贵、历史反复重算——这两条决定了大部分账单。
拆开看,里面有这几块
-
1
输入 token Input
你发过去的一切,包括历史消息和贴入的文件。长对话里这是最大的开销项。
-
2
输出 token Output
它生成的内容。通常单价比输入贵,长篇输出是隐形成本。
-
3
单价 Price per token
每个模型不同,贵的可能差一个数量级;同一模型还有缓存命中和未命中的差价。
-
4
累计重算 Re-billing
长对话每轮把全部历史重新作为输入计费。成本随轮数加速增长。
常见的有哪几种
用多少算多少,灵活,账单直接反映用量。
用在:个人日常使用
固定月费含一定额度,超额另算。
用在:使用强度稳定的场景
批量折扣、私有部署、审计。
用在:团队或高频调用
容易搞混?这样区分
什么时候用得上
先查有没有超长对话没结束,或者反复贴大文件。这两个是最常见原因。
先对比单价和窗口,别只看「能力更强」。贵的模型单轮可能贵一个数量级。
能合并的合并、能精简的精简、能用缓存的用缓存,压单轮成本。
你可以这样跟 AI 说
直接复制下面这段,把【】里的换成你的情况。它比一句「帮我加个 X」多说清楚了:改哪里、不许动啥、做完交什么。
【任务】评估一下用 AI 做 [这个事] 一个月大概花多少钱 【范围】只做估算和给省钱建议,不要改任何代码和配置 【目标】给出: 1. 月成本估算,附完整计算过程(用量假设 × 单价 × 频率) 2. 成本主要花在哪:输入 / 输出 / 长对话重算 3. 3 个具体的省钱动作,每个写清省什么、代价是什么 【边界】不要推荐我换成具体付费产品;不要编造价格,给不出准确单价就标注「需查当前价格」 【交付】 1. 计算过程(数字对数字,我能复核) 2. 省钱动作清单(动作 → 省什么 → 代价) 3. 哪些数字你没核实、我自己怎么核实
「需查当前价格」这句话很值钱:AI 对价格特别自信,却经常用几个月前的数字算今天的账。逼它标注不确定项,账单才不会估错。
它说「做好了」,你怎么自己验
这是本站的重头戏。AI 最会的不是写代码,是说「已完成」。这一条,它通常最多做到「概念」这层:只是说清了要做什么,还没有任何东西在跑。
要亲眼看到这些,才算数
- 打开平台的用量 / 账单页面,看实际消耗的 token 数,和它的估算对不对得上。
- 记录一个长对话开始和结束的用量数字,验证「历史反复重算」是不是真的让成本加速。
- 执行一个省钱动作(比如让它不复述需求),对比前后输出 token 是否下降。
它常这么糊弄你
- 「大概几块钱吧」——没有计算过程的价格都是感觉。要数字对数字的推导。
- 用几个月前的单价算今天的账——价格会变。让它标注时间或「需查当前价格」。
- 「上下文窗口大,随便贴」——贴的越多,每轮输入越贵,成本加速。
- 把输出按输入单价算——输出通常更贵,混在一起会把预算低估一半以上。
成本是「概念」层:知道量级和账单数字就够,不需要精确到分。真正要盯的是变化方向——有没有在加速变贵。
考考你 选一个你觉得对的
为什么同一个对话聊到第 40 轮,成本比第 1 轮高得多?
AI 没有记忆,每轮都要把当前能看到的全部内容重新读一遍——包括你第 1 轮说的话。历史越长,每轮输入越多,成本加速增长。这也是分轮做事更省钱的原因。