发布日期: 2026年07月23日
更新日期: 2026年07月23日
在硅谷,一种新的“炫富”方式正在流行——比谁每天烧掉的token多。这个现象被称为 “Token-maxxing” ,意思是“把token用量拉到极限”。
你每天消耗多少token?你能同时调度多少个agent运行?你的token throughput(吞吐量)有多高?这些正在变成衡量一个人“有多AI原生”的新指标。
Token,可以理解为大模型处理信息的最小单元。一段话、一个问题在被AI处理之前,首先要被“分词器”拆分成一个个Token。一个Token可能是一个汉字、一个英文单词、一个标点,或者一个常见的词组。
打个比方来说,电的计量单位是“度”(千瓦时),Token就是AI世界的“度”。你用AI写一篇文章、问一个问题、生成一段代码,背后消耗的都是Token。

一次简单的AI对话,你的账单上就至少有三种不同价格的token在运转:
Input token(输入token) :你发给模型的内容
Cached input token(缓存输入token) :如果某些prompt或文件内容之前已被缓存,再次调用时价格更便宜
Output token(输出token) :模型生成回答时产生的token
不同公司根据模型能力给出不同定价。以GPT-5为例,Input是每百万token 1.25美元,Cached input是0.125美元,Output则是10美元。
而OpenAI发布的新模型GPT-5.5.短上下文Input涨到每百万token 5美元,Output涨到30美元。更高性能的GPT-5.5 Pro,Input达到每百万token 30美元,Output高达180美元。
但AI模型成本不能只看token单价。强模型虽然收费更高,却能减少重复调用、错误修正和人工干预,因此整体成本可能更低。也就是说,token价格上涨,并不代表使用成本上升,衡量标准应该是每个有效结果的成本。
大模型公司给token的定价基本基于三层逻辑——推理成本、研发费用摊销、模型质量定价。如果是通过云厂商,比如微软Azure、亚马逊AWS、阿里云等来调用模型时,token账单还会叠加云服务的封装费和企业级基础设施溢价。
理解了Token是什么,就不难理解大厂为什么在Token上“疯狂内卷”了。可以说Token就是AI时代的“硬通货”,谁掌握了Token的定价权和流量入口,谁就掌握了AI产业的命脉。
2026年上半年,AI行业最热的两个词是Agent和Token-maxxing。为了让公司成为更“AI原生”的组织,一些企业把Token消耗量当作转型指标,甚至纳入团队KPI。
今年4月,Meta一名员工做了个内部榜单“Claudeonomics”,给全公司超过8.5万名员工统计Token用量,甚至还给前250名来了个从“夯”到“拉”的评分。为了冲榜,有员工专门让AI Agent连跑几个小时,执行一些根本没必要的任务。
Uber的做法更为激进。目前Uber 95%的工程师常态化使用AI编码工具,70%的代码提交由AI生成。Uber全年34亿美元AI总预算,仅4个月就耗尽,工程师单人月均Token开销高达500至2000美元。
更复杂的变量来自Agent(智能体)场景。在Agent模式下,AI不再是“一问一答”,而是像团队协作般自我循环,规划、执行工具、反思、再规划。每一次循环都意味着Token的指数级消耗。
Meta推行Token消耗排行榜仅月余,全员Token总消耗量从6万亿暴涨至73.7万亿,月度算力成本超1亿美元。高额无效支出倒逼平台紧急叫停用量排名机制,为全员配发固定算力配额。
亚马逊、微软也相继关停第三方高价模型内部授权,废除AI用量考核榜单。Token计数只是衡量了消耗了多少资源,却无法证明产出了什么实质性商业价值。
行业已经开始意识到,Token是消耗的“水表”,而非价值的“存折”。消耗10万Token写出一份平庸报告,与消耗1万Token攻克一个技术难题,其意义天壤之别。市场上新的度量衡也正在崛起,市场重点也开始转向AI代理真正为业务创造可量化的产出。
Token经济是AI时代“智力服务标准化”的产物,它让AI的能力第一次有了可计量、可定价、可交易的统一标尺。
总的来说,大厂疯狂“卷”Token用量的背后是对AI时代定价权的争夺,谁能让更多用户消耗更多Token,谁就能积累更多数据、迭代更快模型、占据更大市场份额。
但这场竞赛也暴露了一个根本性问题——Token消耗量不等于商业价值。在经历成本阵痛后,Token经济的下半场正从“卷用量”转向“卷价值”。