跳到主内容
全部文章

2026-08-03

Token 一直在降价,账单为什么越来越贵

同等能力的推理价格每年降一个数量级,企业的 AI 总支出却在涨。这两件事不矛盾,而且会长期并存。


先说一个容易被忽略的事实:AI 推理其实是过去几年降价最猛的东西之一。

Epoch AI 统计过固定性能水平的推理价格走势:达到同一个能力水平的成本,不同任务上的历史降速在每年 9 倍到 900 倍之间。比如达到某些 GPT-4 水平任务的价格,曾经以大约每年 40 倍的速度往下掉。今天要花大价钱才能买到的旗舰能力,过一两年大概率会下放到便宜得多的模型上。

那问题来了:单价降得这么狠,为什么身边超预算的公司反而越来越多?

因为用量涨得比单价降得快

关键变化是代理式(agentic)用法的普及。以前问一个问题、回一段代码,一来一回就结束了。现在一个编程代理接到任务,会自己读仓库、调工具、跑测试、失败重试、反思重来,每一步都在消耗 token。

有研究对比过两种用法的量级差距:代理式编程任务的 token 消耗,比普通代码问答高大约三个数量级。更麻烦的是稳定性——同一个任务,不同运行之间的消耗能差出 30 倍。而且烧得多不等于干得好,消耗更多 token 并不必然带来更高的成功率。

把这两条放在一起看:哪怕单价一年降十倍,只要用量涨了二十倍,总支出照样翻番。“token 越来越便宜”和”企业越来越容易超预算”完全可以同时成立,而且未来几年大概率会一直同时成立。

所以省钱的重点不在”少用”

用量增长本身不是坏事,多数时候它意味着更多工作被自动化了。真正漏钱的地方通常是这几个:

  • 杀鸡用牛刀。大量简单任务(格式转换、简单补全、批量处理)跑在旗舰模型上。这类任务换个便宜一个数量级的模型,结果几乎没有差别。
  • 重复计费的上下文。代理每一步都带着同样的系统提示和仓库上下文,不做缓存的话,等于同一份材料反复付全价。
  • 失控的重试。任务失败后无脑重跑,或者代理陷入循环,半夜空转没人发现。上面说的 30 倍差距,很多就是这么来的。
  • 看不见的账单。消耗归不了因,不知道哪个人、哪个项目、哪类任务在花钱,月底只有一个吓人的总数,想优化都无从下手。

这四件事对应的解法也很朴素:按任务分级选模型、用好缓存、给重试设上限、让账单可拆解。没有一条要求你”少用 AI”。

一个可以现在就做的检查

翻一下上个月的调用记录,看两个数:旗舰模型的调用里,有多少是简单任务?消耗最大的前几个来源,你能说出它们分别在干什么吗?

第一个数如果超过一半,说明路由有问题;第二个问题如果答不上来,说明可见性有问题。两个都中的话,你的账单里大概有相当一部分是可以直接省掉的。


JuCode 提供官方直连与高性价比双线路的模型通道,用量与账单在控制台实时可查。 前往控制台,或联系我们