發布日期: 2026年07月23日
更新日期: 2026年07月23日
在矽谷,一種新的「炫富」方式正在流行——比誰每天燒掉的token多。這個現像被稱為「Token-maxxing」 ,意思是「把token用量拉到極限」。
你每天消耗多少token?你能同時調度多少個agent運行?你的token throughput(吞吐量)有多高?這些正在變成衡量一個人「有多AI原生」的新指標。
Token,可以理解為大模型處理資訊的最小單元。一段話、一個問題在被AI處理之前,首先要被「分詞器」拆分成一個個Token。一個Token可能是一個漢字、一個英文單字、一個標點,或一個常見的詞組。
打個比方來說,電的計量單位是「度數」(kWh),Token就是AI世界的「度」。你用AI寫一篇文章、問一個問題、產生一段程式碼,背後消耗的都是Token。

一次簡單的AI對話,你的帳單上就至少有三種不同價格的token在運作:
Input token(輸入token) :你發給模型的內容
Cached input token(快取輸入token) :如果某些prompt或檔案內容之前已被緩存,再次呼叫時價格更便宜
Output token(輸出token) :模型產生回答時產生的token
不同公司根據模型能力給予不同定價。以GPT-5為例,Input是每百萬token 1.25美元,Cached input是0.125美元,Output則是10美元。
而OpenAI發布的新模型GPT-5.5.短上下文Input漲到每百萬token 5美元,Output漲到30美元。更高效能的GPT-5.5 Pro,Input達到每百萬token 30美元,Output高達180美元。
但AI模型成本不能只看token單價。強模型雖然收費較高,卻能減少重複呼叫、錯誤修正和人工幹預,因此整體成本可能更低。也就是說,token價格上漲,不代表使用成本上升,衡量標準應該是每個有效結果的成本。
大模型公司給token的定價基本上是基於三層邏輯——推理成本、研發費用攤提、模型品質定價。如果是透過雲端廠商,例如微軟Azure、亞馬遜AWS、阿里雲等來呼叫模型時,token帳單還會疊加雲端服務的封裝費和企業級基礎設施溢價。
了解Token是什麼,就不難理解大廠為什麼在Token上「瘋狂內捲」了。可以說Token就是AI時代的“硬通貨”,誰掌握了Token的定價權和流量入口,誰就掌握了AI產業的命脈。
2026年上半年,AI產業最熱的兩個字是Agent和Token-maxxing。為了讓公司成為更「AI原生」的組織,有些企業把Token消耗量當作轉型指標,甚至納入團隊KPI。
今年4月,Meta一名員工做了個內部榜單“Claudeonomics”,給全公司超過8.5萬名員工統計Token用量,甚至還給前250名來了個從“夯”到“拉”的評分。為了衝榜,有員工專門讓AI Agent連跑幾個小時,執行一些根本沒必要的任務。
Uber的做法更為激進。目前Uber 95%的工程師常態化使用AI編碼工具,70%的程式碼提交由AI產生。 Uber全年34億美元AI總預算,僅4個月就耗盡,工程師單人月均Token開銷高達500至2000美元。
較複雜的變數來自Agent(智能體)場景。在Agent模式下,AI不再是“一問一答”,而是像團隊協作般自我循環,規劃、執行工具、反思、再規劃。每一次循環都意味著Token的指數級消耗。
Meta推行Token消耗排行榜僅月餘,全員Token總消耗量從6兆暴漲至73.7兆,月度算力成本超1億美元。高額無效支出倒逼平台緊急叫停用量排名機制,為全員配發固定算力配額。
亞馬遜、微軟也相繼關停第三方高價模型內部授權,廢除AI用量考核名單。 Token計數只是衡量了消耗了多少資源,卻無法證明產出了什麼實質商業價值。
業界已經開始意識到,Token是消耗的“水錶”,而非價值的“存摺”。消耗10萬Token寫出一份平庸報告,與消耗1萬Token攻克一個技術難題,其意義天壤之別。市場上新的度量衡也正在崛起,市場重點也開始轉向AI代理商真正為業務創造可量化的產出。
Token經濟是AI時代「智性服務標準化」的產物,它讓AI的能力第一次有了可計量、可定價、可交易的統一標尺。
總的來說,大廠瘋狂「卷」Token用量的背後是對AI時代定價權的爭奪,誰能讓更多用戶消耗更多Token,誰就能累積更多數據、迭代更快模型、佔據更大市場份額。
但這場競賽也暴露了一個根本性問題──Token消耗量不等於商業價值。在經歷成本陣痛後,Token經濟的下半場正從「卷用量」轉向「卷價值」。