久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文提出「token不經(jīng)濟(jì)」現(xiàn)象,分析其成因與風(fēng)險(xiǎn),提出從供需兩端優(yōu)化,實(shí)現(xiàn)token凈收益轉(zhuǎn)正的落地路徑。 ## 1. token市場整體價(jià)格上行,推高下游使用成本 目前token市場呈現(xiàn)高端定價(jià)格局固化、中端量價(jià)齊升、經(jīng)濟(jì)型跟隨追漲的整體抬升趨勢:Anthropic憑借編碼能力優(yōu)勢建立行業(yè)最強(qiáng)定價(jià)權(quán),通過三維分層定價(jià)策略實(shí)現(xiàn)溢價(jià),2024年底到2026年5月ARR從約10億美元飆升至約450億美元;OpenAI、Google雖加速追趕,短期仍需以價(jià)換量。 即便是經(jīng)濟(jì)型token市場,過去兩年價(jià)格中樞也悄然上移:Haiku 4.5定價(jià)較Haiku 3.5上浮20%,Gemini 2.5 Flash百萬token輸出定價(jià)較2.0 Flash翻6倍以上,開源/半開源模型也普遍提價(jià),核心原因是經(jīng)濟(jì)型token消費(fèi)量爆炸式增長,競爭邏輯已從比價(jià)格轉(zhuǎn)向比性價(jià)比。 ## 2. 智能體架構(gòu)存在多重結(jié)構(gòu)性浪費(fèi),放大token損耗 token消耗存在多維度技術(shù)層面的隱形浪費(fèi),且損耗呈乘積性指數(shù)增長,對普通非技術(shù)用戶更不友好:一是上下文陷阱,Agent反復(fù)帶入歷史信息,ChatDev框架代碼審查階段近四成token消耗在傳遞已有信息,而非生成新內(nèi)容;二是分詞器黑箱,閉源模型分詞器調(diào)整往往帶來token數(shù)膨脹,Anthropic Opus 4.7新分詞器實(shí)測讓技術(shù)文檔平均token膨脹47%,高分辨率圖片膨脹201%;三是技能無意義調(diào)用,79.6%的公開軟件工程技能無法提升通過率,token開銷最高增加451%,平均通過率僅提升1.2個百分點(diǎn),盲目調(diào)用只會徒增成本;四是多Agent溝通稅與長任務(wù)熵稅,超過一半token消耗在內(nèi)部協(xié)調(diào)與自我糾偏,系統(tǒng)越復(fù)雜熵稅增長越快。 ## 3. token有效應(yīng)用場景局限,難以落地產(chǎn)生真實(shí)價(jià)值 當(dāng)前純語言模型范式與現(xiàn)實(shí)世界存在結(jié)構(gòu)性鴻溝,token應(yīng)用仍局限在少數(shù)高數(shù)字化場景:編程是具備通用性的特例,可依托自動反饋閉環(huán)快速迭代,但這一條件在多數(shù)其他場景不成立——法律AI僅能做初審,資深律師復(fù)核時(shí)間幾乎等同于從頭審閱,反饋成本遠(yuǎn)高于編程場景。 向物理世界拓展更面臨驗(yàn)證成本不對稱的難題,人形機(jī)器人等具身智能仍受虛擬與現(xiàn)實(shí)鴻溝限制,OpenAI早年靈巧手項(xiàng)目即便完成海量仿真訓(xùn)練,落地真實(shí)環(huán)境仍魯棒性不足,驗(yàn)證成本比虛擬世界高出幾個數(shù)量級。若token有效射程無法拓展,token不經(jīng)濟(jì)可能持續(xù)很長時(shí)間。 ## 4. token不經(jīng)濟(jì)的風(fēng)險(xiǎn)溢出與破局路徑 當(dāng)前AI產(chǎn)業(yè)鏈風(fēng)險(xiǎn)不均衡,上游硬件賺得盆滿缽滿,中游模型廠商虧損,下游用戶開始控本,風(fēng)險(xiǎn)向中游聚集;部分中游廠商與上游形成循環(huán)融資,風(fēng)險(xiǎn)藏在不透明的私人信貸市場,泡沫破裂股債雙殺風(fēng)險(xiǎn)高;同時(shí)算力擴(kuò)張極度消耗水電資源,已推高部分算力節(jié)點(diǎn)居民用電成本,擠壓民生需求。 破局需從供需兩端發(fā)力:供給側(cè)通過語義上下文壓縮、技能精簡優(yōu)化、自適應(yīng)模型路由、帶預(yù)算約束的主持人架構(gòu)等精細(xì)化技術(shù),堵住跑冒滴漏壓低單位token成本;需求側(cè)強(qiáng)化企業(yè)AI成本治理,在傳統(tǒng)行業(yè)尋找驗(yàn)證成本適中的中間場景,作為token經(jīng)濟(jì)從數(shù)字沙盒走向真實(shí)世界的橋梁。 最終行業(yè)需從炫技轉(zhuǎn)向精實(shí),讓token回歸ROI金標(biāo)準(zhǔn),用最少token完成任務(wù)才能實(shí)現(xiàn)凈收益轉(zhuǎn)正。
Token不經(jīng)濟(jì)
2026-06-30 06:30

Token不經(jīng)濟(jì)

本文來自微信公眾號:騰訊研究院,作者:李剛,頭圖來自:AI生成


近期部分媒體爆出微軟收回內(nèi)部Claude Code許可1。Claude Code是Anthropic推出的AI編程工具,在微軟內(nèi)部開放僅6個月就成為最受歡迎的輔助開發(fā)軟件之一,隨之而來的是token消耗劇增,成本暴漲,但產(chǎn)出質(zhì)量不盡如人意。多重考慮下,微軟踩下剎車,將員工導(dǎo)向自家的Copilot CLI。


Token消耗與實(shí)際產(chǎn)出不成比例的現(xiàn)象在其他平臺企業(yè)也普遍存在。Uber僅用4個月就耗盡了2026全年AI編程工具預(yù)算;亞馬遜部分員工無意義消耗token;Meta悄悄撤下內(nèi)部員工的Tokenmaxxing排行榜,不再鼓勵無產(chǎn)出的token消耗2。人人都在擁抱AI,但還沒有找到正確的姿勢;企業(yè)都在強(qiáng)調(diào)AI原生,但(暫時(shí))沒看到收益,只看到越來越長的賬單。我稱之為“token不經(jīng)濟(jì)”。


Token不經(jīng)濟(jì)是企業(yè)內(nèi)部管控不力、token使用回報(bào)有限、Agent本身的架構(gòu)設(shè)計(jì)(如Skill重復(fù)調(diào)用、長程任務(wù)的內(nèi)耗、多智能體協(xié)同成本)等多重因素互相疊加的結(jié)果。未來,這些問題可能會隨著內(nèi)控的精進(jìn)、技術(shù)面消耗不斷優(yōu)化而逐步緩解。但若要將token凈收益轉(zhuǎn)正,則不僅需要從供給端入手優(yōu)化Token成本,還需要從需求端入手,解決如何讓Token消耗在廣泛的產(chǎn)業(yè)場景中產(chǎn)生實(shí)際價(jià)值的難題。


一、好貨不便宜


過去兩年,主流大模型快速迭代,開發(fā)企業(yè)根據(jù)自身市場定位采取不同產(chǎn)品組合策略,API調(diào)用價(jià)格($每百萬token)隨之改變。模型性能大幅提升,但好貨不便宜,同一分層產(chǎn)品的調(diào)用價(jià)格也在悄悄提升,成為推高下游使用者token消耗成本的重要原因。


領(lǐng)導(dǎo)者的分層策略


Anthropic 是閉源模型廠商中最早認(rèn)識到編程是token變現(xiàn)核心場景的公司。大模型的主要付費(fèi)用戶是開發(fā)者和企業(yè)技術(shù)團(tuán)隊(duì),他們對價(jià)格不敏感,更看重模型的編碼效率和質(zhì)量。掌握編程這一商業(yè)場景的先機(jī),就可以實(shí)現(xiàn)token溢價(jià)。


因此Anthropic在研發(fā)上專注編程。在確立編程能力優(yōu)勢后,自2024年初推出 Claude 3 系列起,在業(yè)內(nèi)率先采用旗艦-中端-輕量的立體產(chǎn)品組合,實(shí)現(xiàn)同代模型分層定價(jià),同時(shí)搶占高端和大眾市場。Opus系列定位為編程業(yè)內(nèi)標(biāo)桿,以 $15/$75(輸入/輸出百萬token價(jià)格,下同)的定價(jià)錨定高端市場;Sonnet系列($3/$15)為日常編程和辦公任務(wù)提供高性價(jià)比選擇;Haiku系列($1/$5)面向輕量、快捷互動場景,價(jià)格親民。這種精細(xì)的層級劃分使 Anthropic 能夠在每一價(jià)格帶最大化利潤提取,同時(shí)保護(hù)市場份額。


這一定價(jià)策略讓作為技術(shù)領(lǐng)導(dǎo)者的Anthropic的競爭手段更多、操作更靈活。例如,在覺察到與競品性能差距快速縮小后,借Opus4.5發(fā)布大幅降價(jià),擠壓競品市場空間。再如,隨著新一代模型Mythos Preview($25/$125)發(fā)布,在Opus上置入新的超高端分層,抬升了旗艦產(chǎn)品價(jià)格,逆轉(zhuǎn)之前高端產(chǎn)品不斷降價(jià)的趨勢。


隨后發(fā)布的 Fable 5 采用同一底層架構(gòu),以安全為由對部分功能進(jìn)行限制,采用 $10/$50 的價(jià)格(仍是Opus系列的兩倍)面向更廣泛市場。不僅按性能定價(jià),更按安全約束的松緊程度定價(jià),形成能力分層、風(fēng)險(xiǎn)分層、定價(jià)分層的三維定價(jià)策略,重新拿回溢價(jià)市場。


這一定位策略的效果在2025年至2026年間得到了充分驗(yàn)證。Anthropic 的年度經(jīng)常性收入(ARR)從2024年底的約10億美元飆升至2026年5月的約450億美元3。更重要的是,這一策略充分保護(hù)了作為產(chǎn)品力領(lǐng)導(dǎo)者的市場溢價(jià),依靠性能優(yōu)勢跳出卷價(jià)格的窠臼,完成好貨不便宜的價(jià)值閉環(huán)。


追趕者的價(jià)格拉扯


相比之下,OpenAI 和 Google 在大模型商業(yè)化的早期階段選擇了與Anthropic不同的多元化路徑。OpenAI 在2024年曾將大量資源投入 Sora等多模態(tài)項(xiàng)目;Google 則圍繞 Gemini 構(gòu)建了覆蓋搜索、云服務(wù)、Workspace 等多條產(chǎn)品線的生態(tài)策略。這些投資雖然拓展了技術(shù)版圖,卻因資源被分散,在辦公和編程場景上表現(xiàn)相對并不突出。當(dāng)意識到編程才是模型能力變現(xiàn)的主戰(zhàn)場,返身再來追趕時(shí),已經(jīng)失去先手優(yōu)勢。


OpenAI 的返身非常堅(jiān)決。一方面重新聚焦編碼和 Agent 能力,砍掉 Sora等消耗巨大項(xiàng)目;另一方面,跟隨Anthropic建立自己的分層產(chǎn)品矩陣,一對一緊逼盯人,同時(shí)刻意拉大旗艦?zāi)P秃洼p量模型的價(jià)差,旗艦高價(jià)守住領(lǐng)先模型的招牌,輕量低價(jià)搶奪市場份額。GPT 5.5 的定價(jià)($5/$30)與Opus 4.7/4.8($5/$25)看齊,建立與 Claude Opus 同等的高端價(jià)格錨點(diǎn),次級模型GPT 5.4 mini($0.75/$4.50)和nano($0.20/$1.25),大幅低于同級 Claude Haiku 4.5($1.00/$5.00),以價(jià)格換市場。


Google 是安卓生態(tài)體系的核心,已經(jīng)有完整的商業(yè)閉環(huán),需要處理的關(guān)系更為復(fù)雜,動作也更謹(jǐn)慎。Gemini 需同時(shí)服務(wù)于 Google Cloud 的企業(yè)客戶、Workspace 的生產(chǎn)力用戶、以及搜索產(chǎn)品的消費(fèi)者體驗(yàn)。即便意識到編程的重要性,也無法決然將資源全部聚焦于編程和辦公,還是要走多模態(tài)、多元化路線。


Google也是緊隨Anthropic從1.5代 Gemini開始將產(chǎn)品分為旗艦Pro系列和輕量Flash系列,但產(chǎn)品迭代速度相對較慢,價(jià)格定位更低。2024年初的旗艦?zāi)P虶emini 1.5 Pro在短prompt(<128k)情形下輸出百萬token價(jià)格僅為5美元,是同期GPT-4o的三分之一,Opus 3的十五分之一。


2026年2月發(fā)布的Gemini 3.1 Pro百萬token輸出價(jià)格提升至12美元,顯著低于同期GPT 5.4的15美元和Opus 4.6/4.7的25美元。不僅如此,Google還搞了一個反向操作,在輕量產(chǎn)品線Flash下面加入超輕量產(chǎn)品線Flash-Lite,將調(diào)用價(jià)格壓到與開源模型同樣的水平線,這是典型的以價(jià)換量。


而被市場殷切期盼的 Gemini 3.5 Pro 遲遲未能正式發(fā)布,也反映出 Google 在平衡性能、安全性和生態(tài)適配方面面臨的內(nèi)部博弈。新一代旗艦?zāi)P偷亩▋r(jià)策略,也被市場高度關(guān)注。


圖1:旗艦?zāi)P投▋r(jià)變化趨勢Claude 系列及 GPT-4o/4.1/5.4 的定價(jià)來自官方定價(jià)頁;GPT-5.5 系列、Gemini 3.5 Flash 的定價(jià)來自 OpenAI/Google 平臺及第三方匯總;GLM 系列定價(jià)基于海外 Z.ai 平臺,具體價(jià)格受匯率波動和雙軌定價(jià)影響。繪圖:Codebuddy


次級/輕量和開源/半開源模型市場在需求爆發(fā)中默默漲價(jià)


旗艦?zāi)P推葱阅?,次?輕量模型卷價(jià)格,是市場競爭理所應(yīng)當(dāng)?shù)恼_姿勢。面對激烈的市場競爭,一般預(yù)期是市場價(jià)格中樞會不斷下降。但實(shí)際情況卻恰恰相反,由次級/輕量-開源/半開源模型構(gòu)成的經(jīng)濟(jì)型token市場,價(jià)格中樞在過去兩年悄然上移,而token市場價(jià)格地板的真正抬升正是在這樣的上移中完成的。


表面上看,這是一片殺瘋了的紅海。Sonnet、mini、Flash等收費(fèi)低廉的次級/輕量模型是主流閉源模型面向大眾市場的經(jīng)濟(jì)實(shí)惠裝,主要目標(biāo)是搶奪市場份額。與此同時(shí),DeepSeek、Qwen 和 GLM 等開源或半開源模型迅速崛起,普遍采用旗艦定位、次級/輕量定價(jià)的策略,給次級/輕量閉源模型市場帶來持續(xù)的價(jià)格壓力。


2024年底,DeepSeek V3 以約 $0.27/$1.10 的定價(jià)切入市場,遠(yuǎn)低于同級閉源模型。稍后推出的R1 以 $0.55/$2.19 的價(jià)格提供推理增強(qiáng)能力,直接壓縮了 GPT-4.1 mini 和 Claude Haiku 的定價(jià)空間。GLM-4 Plus 以僅 $0.69/$0.35 的價(jià)格提供接近 GPT-4 級別的能力,對價(jià)格敏感的開發(fā)者群體構(gòu)成了極大的吸引力。卷價(jià)格似乎是這一分層市場的常態(tài)。


但另一方面,每一代次級/輕量和開源/半開源模型的推出,都伴隨著價(jià)格地板的抬升。例如2024年10月推出的Haiku 3.5,輸入/輸出定價(jià)為$0.80/$4.00;一年后Haiku 4.5的定價(jià)上浮20%到$1.00/$5.00。


差不多同一時(shí)間,GPT mini系列定價(jià)幾乎翻番,從 4o mini的$0.15/$0.60上浮至4.1 mini的$0.40/$1.60。Gemini Flash系列也同樣,從2.0 Flash的$0.10/$0.40超低定價(jià),上浮至2.5 Flash的$0.30/$2.50,百萬token輸出定價(jià)翻了6倍還多。


開源/半開源模型如GLM 系列,GLM-5 在海外市場的定價(jià)較 GLM-4.7 提升了約67%到100%。用智譜自己的話,這次大幅提價(jià),顯示出國產(chǎn)模型的技術(shù)能力和市場競爭力正在快速提升。


產(chǎn)生這一現(xiàn)象的根本原因是經(jīng)濟(jì)型token消費(fèi)量的爆炸式增長。大多數(shù)日常編碼任務(wù)、文檔處理和自動化流程并不需要 Opus 或 GPT-5.5 級別的能力,而是由 Sonnet、mini、Flash 等模型承擔(dān),或交由開源/半開源模型完成。隨著 AI 編碼助手、Agent 工作流和企業(yè)級 AI 應(yīng)用的普及,這些次級/輕量-開源/半開源模型的調(diào)用量激增,遠(yuǎn)超旗艦?zāi)P汀?/p>


一方面,這使得經(jīng)濟(jì)型模型消耗快速上升,燒現(xiàn)金維持低價(jià)的游戲無法持續(xù);另一方面,這也為廠商開拓了提價(jià)空間,漲價(jià)的同時(shí)需求仍在快速增長。因此,即便是在經(jīng)濟(jì)型token市場,競爭邏輯也從哪家token更便宜轉(zhuǎn)向哪家token性價(jià)比更高。不論是Claude Sonnet/Haiku、GPT mini/nano、Gemini Flash,亦或是DeepSeek、Qwen、GLM系列,都出現(xiàn)定價(jià)中樞抬升的趨勢。


從上面的分析大概可以看到,token市場正在經(jīng)歷一個高端定價(jià)格局固化、中端量價(jià)齊升、經(jīng)濟(jì)型跟隨追漲的整體抬升過程。Anthropic 憑借編碼能力領(lǐng)先建立了行業(yè)最強(qiáng)的定價(jià)權(quán),OpenAI 和 Google 正在加速追趕但短期內(nèi)仍需以價(jià)換量,而開源/半開源模型在持續(xù)抬升定價(jià)地板的同時(shí)也開始分享市場增長的紅利。


這一格局的演變將深刻影響整個 AI 產(chǎn)業(yè)的利潤分配和競爭態(tài)勢。在消耗大增、單價(jià)上漲的token 市場,與模型廠商收入爆發(fā)相對應(yīng)的,必然是下游token使用者的成本攀升,是終端消費(fèi)token不經(jīng)濟(jì)的底層原因。


圖2:次級/輕量和開源/半開源模型定價(jià)趨勢。Claude 系列及 GPT-4o/4.1/5.4 的定價(jià)來自官方定價(jià)頁;GPT-5.5 系列、Gemini 3.5 Flash 的定價(jià)來自 OpenAI/Google 平臺及第三方匯總;GLM 系列定價(jià)基于海外 Z.ai 平臺,具體價(jià)格受匯率波動和雙軌定價(jià)影響。繪圖:Codebuddy


二、智能體的隱形消耗


token越來越貴固然傷及荷包,更讓人心疼的是不少token在調(diào)用智能體(Agent)干活時(shí)被系統(tǒng)性地浪費(fèi)掉了。上下文陷阱(Context Trap)、分詞器黑箱(Tokenizer Black Box)、技能冗余(Skill Redundancy)、以及多Agent協(xié)同中的溝通稅與長程熵增(Communication Tax and Entropy Drift),這些結(jié)構(gòu)性的跑冒滴漏疊加在一起,構(gòu)成了token不經(jīng)濟(jì)的內(nèi)部技術(shù)根源。


上下文陷阱


模型推理需計(jì)算每個token和其他token的關(guān)系,因此上下文越長,計(jì)算負(fù)擔(dān)越重,token消耗越多。同樣一個問題,沒有頭尾的丟給Agent,消耗不了幾個token。但如果是帶著歷史對話、工具日志、代碼文件、報(bào)錯信息和多輪討論,輸入token的消耗可能多出幾個數(shù)量級。


而Agent架構(gòu)天然放大長文本陷阱。智能體會將問題拆解,規(guī)劃調(diào)用工具,讀文件,檢查反饋,修改方案,再調(diào)用工具,循環(huán)往復(fù),每一步都可能把歷史記錄重新帶進(jìn)上下文。同一批信息被反復(fù)讀取,同一個任務(wù)被反復(fù)計(jì)費(fèi)。


Salim et al.,(2026)對ChatDev框架的分析發(fā)現(xiàn),代碼審查階段(Code Review)消耗的token平均占總消耗的39.5%,是所有開發(fā)階段中最高的4,這意味著近四成的token花費(fèi)在了Agent之間反復(fù)傳遞已有信息的過程中,而非真正生成新內(nèi)容。


圖3:對ChatDev框架30個任務(wù)中各階段Token消耗占比的分析。Salim, et al., (2026). Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering. Proceedings of the Mining Software Repositories Conference (MSR).


分詞器黑箱


分詞器(Tokenizer)是大模型訓(xùn)練的基礎(chǔ),決定同等參數(shù)量下模型的信息密度上限、有效上下文長度下限和邊緣case(數(shù)字/代碼/多語種)的可靠性。分詞越合理,模型訓(xùn)練和推理就越高效、穩(wěn)定。開源/半開源模型的分詞器和權(quán)重通常是公開的,而閉源模型的分詞器是“黑箱”,分詞器的更新?lián)Q代往往伴隨著token密度的變化。


2026年4月Anthropic發(fā)布Opus 4.7的同時(shí),更換了底層分詞器。根據(jù)Anthropic官方文檔披露,分詞器調(diào)整主要考慮模型訓(xùn)練的實(shí)際需求,為提升性能采用更細(xì)粒度的子詞分割方案,副作用是同樣長度的文本,token數(shù)量膨脹了1.0倍至1.35倍13。多家獨(dú)立測試機(jī)構(gòu)的結(jié)果顯示實(shí)際膨脹倍數(shù)更高。


企業(yè)AI成本管理平臺Finout針對真實(shí)企業(yè)prompt的加權(quán)實(shí)測顯示,技術(shù)文檔與英文密集代碼文件的平均膨脹率達(dá)到1.47倍(+47%)14;ClaudeCodeCamp對七種真實(shí)文件類型的綜合測試結(jié)果為平均1.325倍(+32.5%)15;開發(fā)者Simon Willison通過API直接比對發(fā)現(xiàn),同一份系統(tǒng)提示詞在新分詞器下從5,039 tokens膨脹至7,335 tokens(+46%),而高分辨率圖片的token膨脹更是高達(dá)3.01倍(+201%)16


更早之前,OpenAI在發(fā)布GPT-4o時(shí)將分詞器從cl100k_base升級為o200k_base,詞表規(guī)模擴(kuò)大了近一倍,官方說明此舉旨在提高壓縮率并增強(qiáng)多語言處理能力17。然而,詞表膨脹本身并不意味著同等文本的token計(jì)數(shù)減少,實(shí)際上對于非英語內(nèi)容(尤其是中文、日文等CJK字符),新分詞器的切割粒度變化可能導(dǎo)致token數(shù)不減反增。


關(guān)于更細(xì)顆粒度的分詞是否能提升模型表現(xiàn),目前尚缺乏來自模型廠商的系統(tǒng)性公開論證。Anthropic在Opus 4.7的變更文檔中將新分詞器歸入Breaking Changes條目,僅描述了事實(shí)層面的變更(更細(xì)粒度的子詞分割),未詳細(xì)解釋技術(shù)動因或性能收益。


社區(qū)中有研究者指出,更細(xì)的分詞理論上可以豐富模型的詞匯表征能力,尤其有利于代碼理解和結(jié)構(gòu)化數(shù)據(jù)處理(JSON、XML等格式在Opus 4.7中觸及了最高的1.35倍膨脹上限),但這種潛在的性能增益是否足以合理化近50%的成本增幅,是一個懸而未決的問題13


分詞器迭代頻率明顯低于模型更新,但事關(guān)token的最基本計(jì)費(fèi)標(biāo)準(zhǔn),且變化隱藏在技術(shù)細(xì)節(jié)之中,普通使用者幾乎不可能察覺。閉源模型對分詞器更是諱莫如深,有可能成為加重token不經(jīng)濟(jì)的原因之一。


技能的無意義調(diào)用


技能(Skill)是讓Agent架構(gòu)更專業(yè)的關(guān)鍵工具之一。有人把技能看成是長一點(diǎn)的markdown,有人把技能當(dāng)成一個裝了各類參考文獻(xiàn)和操作說明的文件夾,也有人把技能理解為一段超長的結(jié)構(gòu)化prompt。在實(shí)際的推理和Agent任務(wù)中,很多技能過長過雜,加大了token消耗。


Gao et al.,(2026)對55,315個公開技能的大規(guī)模實(shí)證研究揭示了技能的無效加載是如何浪費(fèi)token的5。在路由層面(即Agent決定是否調(diào)用某個技能的環(huán)節(jié)),高達(dá)26.4%的技能完全沒有路由描述,像一本本沒有目錄的工具手冊,大大增加被Agent無效加載的概率。


在正文層面,超過60%的技能內(nèi)容不是可直接執(zhí)行的操作規(guī)則,而是背景解釋或示例文本,使用技能的大部分token花在了閱讀說明書而非干活上。更嚴(yán)重的是,部分技能會密集引用文件,單次調(diào)用就會注入數(shù)萬乃至十余萬token,其中可能只有很小比例與當(dāng)前任務(wù)相關(guān)。


Han et al.,(2026)的SWE-Skills-Bench基準(zhǔn)測試進(jìn)一步證實(shí)了技能效用的有限性6。該研究在真實(shí)GitHub項(xiàng)目上測試了49個公開軟件工程技能,結(jié)果顯示39個技能(79.6%)沒有帶來通過率的任何提升(有技能和無技能的Pass率相同),全部49個技能的平均效用增量僅為可憐的1.2個百分點(diǎn),然而token開銷最高增加了451%。


僅有在編碼特定領(lǐng)域?qū)I(yè)知識的7個技能(如金融風(fēng)控公式、云原生流量管理、GitLab CI模式)帶來了有意義的性能提升(最高提升30個百分點(diǎn));更有3個技能因版本沖突導(dǎo)致性能下降(最高下降10個百分點(diǎn))。這說明技能的效用高度依賴場景匹配度,盲目調(diào)用只會徒增成本。


多Agent的廢話與長任務(wù)的跑偏


多Agent是目前受青睞的工作方式,讓使用者一個人領(lǐng)導(dǎo)一個由AI構(gòu)成的團(tuán)隊(duì),寫代碼的、審查的、測試的、修復(fù)的,多個Agent各司其職,互相監(jiān)督,在很多情況下確實(shí)提高了輸出質(zhì)量。但機(jī)器之間也會開無效會議,對話中不斷重復(fù)已經(jīng)討論過的任務(wù)背景、之前的結(jié)論、格式化套話,每重復(fù)一次,就再消耗一遍token,Salim et al.,(2026)稱之為多Agent系統(tǒng)的溝通稅(communication tax)4。


此外,將復(fù)雜的長程任務(wù)(long task)交由多Agent系統(tǒng)完成,正在成為編程和辦公的主流做法,并逐漸擴(kuò)展到餐飲、出行等日常生活的場景。長程任務(wù)本身就存在容易跑偏的問題。此類任務(wù)的上下文里塞滿工具輸出、報(bào)錯、草稿、日志,很容易造成模型推理逐漸偏離目標(biāo)。


為了糾偏,開發(fā)者往往會要增加摘要、記憶、檢查、回滾等機(jī)制,帶來更多token消耗。Luo et al.,(2026)在對TabTracer研究中觀察到,傳統(tǒng)鏈?zhǔn)酵评碓诼窂竭^長時(shí)容易陷入循環(huán)狀態(tài),對抗性注入可以故意觸發(fā)這種循環(huán),使Agent在錯誤路徑上反復(fù)消耗token而不自知7。


這種維持穩(wěn)定所需的額外消耗通常被稱為熵稅(entropy tax),系統(tǒng)越復(fù)雜,Agent越自由,越需要監(jiān)督,任務(wù)越長,上下文越大,熵稅增長越快。一個看似高效的Agent團(tuán)隊(duì),token賬單中可能有超過一半花在了內(nèi)部協(xié)調(diào)與自我糾偏上。


上下文陷阱、分詞器黑箱、技能的無意義調(diào)用、廢話文學(xué)和長任務(wù)跑偏,這些因素疊加在一起,對token消耗的效果不是簡單的加和,而是乘積性的指數(shù)增長。更值得注意的是,這些技術(shù)性損耗對不同使用者的影響是不對稱的。


具備技術(shù)背景的開發(fā)者可以通過調(diào)整系統(tǒng)提示詞(System Prompt)、裁剪技能內(nèi)容、設(shè)置上下文窗口管理策略等方式在一定程度上緩解這些問題,但對于缺乏技術(shù)背景的普通企業(yè)用戶而言,他們既不理解Agent內(nèi)部的token流轉(zhuǎn)機(jī)制,也無法有效干預(yù)其行為模式,只看到賬單上的數(shù)字在不斷增長,卻不知道錢究竟花在哪里、為什么花了那么多。


在這個意義上,token不經(jīng)濟(jì)不僅是一個技術(shù)效率問題,更是一個技術(shù)平權(quán)問題。AI工具的使用門檻,從會不會寫代碼變成了能不能理解Agent架構(gòu)的成本動力學(xué)?,F(xiàn)實(shí)中大多數(shù)智能體的使用者并不具備相關(guān)技術(shù)背景,被置于結(jié)構(gòu)性劣勢之中。


三、尋找真實(shí)的需求


比起定價(jià)、無效消耗等種種供給端的問題,應(yīng)用端的局限性是造成token不經(jīng)濟(jì)的更重要的原因。盡管模型性能在過去兩年取得了令人矚目的進(jìn)展,但token的通用性仍然相當(dāng)有限。目前的token的使用大都局限在數(shù)字化水平較高的場景中,比如編程輔助、文檔處理、數(shù)據(jù)分析。


跳出這些優(yōu)勢部分,大模型性能會隨著應(yīng)用場景數(shù)字化水平下降而急劇衰減。到了數(shù)字化程度極低的線下服務(wù)業(yè)態(tài),如餐飲、家政、零售終端、現(xiàn)場維修,token能夠獨(dú)立完成的任務(wù)都局限在已經(jīng)高度數(shù)字化的流程管理部分,很難實(shí)際參與現(xiàn)場操作。


這不是說AI永遠(yuǎn)無法進(jìn)入這些領(lǐng)域,而是說當(dāng)前的純語言模型范式(token-in, token-out)與現(xiàn)實(shí)世界之間存在著一條結(jié)構(gòu)性鴻溝。這一問題在移動互聯(lián)網(wǎng)時(shí)代就存在,是數(shù)字技術(shù)未能從根本上改變第一和第二產(chǎn)業(yè)的根本原因。


人工智能的發(fā)展為跨越這條鴻溝提供新的可能,科學(xué)智能(AI for Science)、世界模型(World Model)、機(jī)器人系統(tǒng)等基礎(chǔ)性研究正在取得進(jìn)展。過去兩年諾貝爾物理學(xué)獎和化學(xué)獎被授予人工智能科學(xué)家,F(xiàn)igure、Tesla Optimus、宇樹等人形機(jī)器人取得顯著進(jìn)展。但在這些前沿領(lǐng)域目前仍處在實(shí)驗(yàn)室階段,在取得劃時(shí)代的應(yīng)用層突破之前,token大概會持續(xù)困在高度數(shù)字化場景中。


編程是通用的特例


編程是目前大語言模型表現(xiàn)最好的應(yīng)用場景,但這一場景并不具有普遍的代表性,更準(zhǔn)確的描述是具有通用性的特例。


通用性是說,編程輸出的是Agent的通用語言,可以在數(shù)字化基礎(chǔ)較好(流程和文件已經(jīng)數(shù)字化并由算法驅(qū)動)的場景中,直接驅(qū)動不同類型的Agent協(xié)助完成多種多樣的任務(wù)。從這個角度看,Anthropic專攻編程的Claude Code,以及Open AI的GPT Codex成為目前市場上最受歡迎的Agent產(chǎn)品并非偶然。


特例是指編程場景在模型的后訓(xùn)練環(huán)節(jié)具備極大優(yōu)勢,一是確定的信號反饋,模型生成的代碼跑一遍,編譯器、解釋器、單元測試立刻可以給出精準(zhǔn)、結(jié)構(gòu)化、毫無歧義的對錯判斷,二是在這樣的自動信號反饋基礎(chǔ)上,可以高效形成自動的后訓(xùn)練閉環(huán),將反饋毫無阻礙地接進(jìn)強(qiáng)化學(xué)習(xí)回路,智能體在數(shù)字沙盒里高速生成、報(bào)錯、自我修正。這樣的自主訓(xùn)練環(huán)境在其他場景中很少見,甚至基本不可能形成。


一旦離開編程,模型訓(xùn)練的效率會大幅降低。在數(shù)字化程度相對較低、無法形成自動后訓(xùn)練閉環(huán)的傳統(tǒng)商業(yè)世界,如管理決策、法律談判、臨床醫(yī)療、供應(yīng)鏈物流,數(shù)據(jù)采集和結(jié)果驗(yàn)證成本會吃掉任何token經(jīng)濟(jì)。拿不到低成本的反饋信號的智能體,也就無法完成指數(shù)級自我進(jìn)化,難以重復(fù)其在編程上的巨大成功。


2023年2月,A&O Shearman(原Allen & Overy)率先與法律領(lǐng)域的垂直大模型公司Harvey AI達(dá)成獨(dú)家戰(zhàn)略合作,將后者開發(fā)的AI法律助手部署在前者遍布全球43個辦公室18。在為期數(shù)月的試用期內(nèi),A&O Shearman在全球的3,500余名律師向Harvey提交了約40,000次查詢請求,涵蓋合同起草、法規(guī)檢索、盡職調(diào)查等多項(xiàng)法律工作流程,確實(shí)提高了工作效率19


硬幣的另一面,A&O Shearman在其官方新聞稿中明確指出,Harvey AI生成的所有輸出都需要經(jīng)過執(zhí)業(yè)律師的仔細(xì)審查后方可使用18。AI并未真正替代律師的專業(yè)判斷,僅在原有工作流程之上新增了一個AI初審環(huán)節(jié)。資深合伙人在接受AI標(biāo)注后的合同草案時(shí),投入的復(fù)核時(shí)間幾乎等同于從頭審閱原始合同所需的時(shí)間。


當(dāng)然,人工審核的結(jié)果反饋是后續(xù)模型訓(xùn)練的高價(jià)值數(shù)據(jù),但這樣的反饋成本顯然較編程這樣的自動閉環(huán)高出太多。不能排除未來當(dāng)反饋數(shù)據(jù)積累到某一臨界點(diǎn),智能體在現(xiàn)實(shí)場景的表現(xiàn)會大幅提升,逼近甚至超越專業(yè)人士的水平。但與編程相比,這一臨界點(diǎn)的來臨還有相當(dāng)長的路要走。


向物理世界的艱難跨越


法律工作任務(wù)的主要內(nèi)容仍然是大量文字處理,是一個數(shù)字化水平較高且肯定會被高度數(shù)字化的場景。當(dāng)工作任務(wù)中可被數(shù)字化、可以從數(shù)字世界中直接控制和操作的成分降低,智能體能夠完成的任務(wù)比例也會隨之降低。雖然現(xiàn)實(shí)世界的設(shè)施大多由軟件驅(qū)動,但單純依靠智能體寫代碼來控制物理世界,仍然面臨巨大的障礙。


以人形機(jī)器人(humanoid robot)的發(fā)展為例,雖然已經(jīng)在馬拉松比賽中超越了人類最好成績,但人形機(jī)器人在大部分現(xiàn)實(shí)世界的任務(wù)仍在艱難掙扎。清潔、搬運(yùn)、開門、穿越雜亂場景,這些對人類來說輕而易舉的動作,對機(jī)器人而言卻是巨大挑戰(zhàn)。


所以Moravec(1988)講“讓計(jì)算機(jī)在智力測驗(yàn)或下跳棋中表現(xiàn)出成人水平的成績相對容易,而要賦予它們一歲幼兒的感知與行動能力卻極其困難,甚至不可能?!?span id="fe2iclqy7" class="text-remarks" label="備注">(It is comparatively easy to make computers exhibit adult-level performance on intelligence tests or playing checkers, and difficult or impossible to give them the skills of a one-year-old when it comes to perception and mobility),接近四十年后的今天,這句話的含金量仍在上升23。


李飛飛在長文《From Words to Worlds》中,把空間智能與具身智能列為需要更長時(shí)間才能成熟的中期目標(biāo)8。原因在于,現(xiàn)實(shí)世界沒有編譯器,物理世界不接受迭代,只接受驗(yàn)證,而驗(yàn)證的成本永遠(yuǎn)比生成的成本高。


曾被寄予厚望的仿真技術(shù)雖然起到一定效果,但要實(shí)現(xiàn)類似Agent自適應(yīng)在編程場景中的效能,還有很長的路要走。仿真技術(shù)是為繞開物理世界沒有編譯器的難題,用數(shù)字孿生和物理引擎搭一個虛擬驗(yàn)證空間。但具身智能發(fā)展還是撞上了虛擬與現(xiàn)實(shí)鴻溝(Sim-to-Real Gap),在簡化沙盒里靠海量Token練出的最優(yōu)控制軌跡,一碰上真實(shí)世界的摩擦、材料疲勞和環(huán)境噪聲,立刻變得極其脆弱。


Aljalbout et al.,(2025)認(rèn)為仿真到現(xiàn)實(shí)的差距并非單一問題,而是由動力學(xué)差異、感知失真、執(zhí)行器非線性、系統(tǒng)設(shè)計(jì)缺陷等多個子差距疊加而成,完美仿真器在計(jì)算上不可行20


此外,仿真訓(xùn)練策略往往會利用建模中不準(zhǔn)確但確定的邊界條件獲得虛高的性能表現(xiàn)。但若部署到真實(shí)環(huán)境,這些策略往往并不可靠,甚至?xí)盹L(fēng)險(xiǎn)。例如OpenAI的Dactyl靈巧手項(xiàng)目,用64塊NVIDIA V100 GPU和920臺32核CPU服務(wù)器在仿真中累計(jì)了相當(dāng)于13,000年工作量的訓(xùn)練經(jīng)驗(yàn),使機(jī)械手操作方塊達(dá)到極高的成功率21。


但靈巧手在面對真實(shí)世界中非預(yù)設(shè)的材質(zhì)、溫度和磨損變化時(shí),魯棒性迅速下降。2021年,OpenAI解散了整個機(jī)器人團(tuán)隊(duì)。聯(lián)合創(chuàng)始人Wojciech Zaremba在解釋這一決定時(shí)表示,資源需要轉(zhuǎn)移到更容易取得成就的領(lǐng)域22。盡管官方未將Sim-to-Real Gap列為主因,但行業(yè)普遍認(rèn)為,仿真訓(xùn)練的高昂算力成本與真實(shí)部署的不確定性之間的矛盾,是促使OpenAI放棄機(jī)器人方向的重要因素之一。


在真實(shí)的物理世界驗(yàn)證模型表現(xiàn),時(shí)間和資本成本比虛擬世界高出幾個數(shù)量級,而這樣的真實(shí)測試是無法被取代的。這種非對稱的驗(yàn)證成本從一個側(cè)面說明了編程場景的特殊性,算法不是萬能的,token也不是。


如果token的有效應(yīng)用范圍長期局限于編程和少數(shù)數(shù)字場景,始終無法跨越從數(shù)字世界到物理世界的鴻溝,AI產(chǎn)業(yè)化和產(chǎn)業(yè)AI化的可持續(xù)性就要打一個大大的問號。Token經(jīng)濟(jì)的未來,取決于我們能否把token的有效射程從數(shù)字孤島拓展到更廣闊的真實(shí)世界。在物理世界的真實(shí)需求爆發(fā)之前,token不經(jīng)濟(jì)可能會持續(xù)很長時(shí)間。


四、Token不經(jīng)濟(jì)的溢出風(fēng)險(xiǎn)


Token不經(jīng)濟(jì)在整個AI產(chǎn)業(yè)鏈條上的分布并不均衡。上游基礎(chǔ)設(shè)施和硬件廠商在當(dāng)下的固定資產(chǎn)投資熱潮中賺得盆滿缽滿;中游的模型廠商仍在比拼產(chǎn)品性能,高昂的資本支出擠壓現(xiàn)金流;下游應(yīng)用效果因人而異,因場景而異,大部分企業(yè)仍在持幣觀望。產(chǎn)業(yè)鏈風(fēng)險(xiǎn)在向中游聚集,而中游的模型廠商正在資本市場建立起一個個循環(huán)融資的小圈子。持續(xù)累積的token不經(jīng)濟(jì)風(fēng)險(xiǎn)一旦爆發(fā),必然會牽動金融市場,甚至影響民生穩(wěn)定。


產(chǎn)業(yè)鏈風(fēng)險(xiǎn)的不均衡分布


Token-Agent熱潮拉動巨額資金投向上游的數(shù)據(jù)中心、網(wǎng)絡(luò)和芯片制造,以及電力和能源基礎(chǔ)設(shè)施。臺積電2026年資本支出預(yù)計(jì)達(dá)520至560億美元9,微軟、Alphabet、亞馬遜與Meta在2025至2026年的AI基建投入合計(jì)遠(yuǎn)超3000億美元并向逼近7000億美元的量級攀升10。


中游的大模型廠家是本輪AI投資浪潮的發(fā)動機(jī)、所有有關(guān)AI樂觀預(yù)期的錨點(diǎn)、“全村的希望”。但主要廠商雖然營收爆發(fā)增長但仍深陷虧損,算力采購成本居高不下。OpenAI預(yù)計(jì)要到2030年前后才可能盈利11。而下游真正在用Agent干活、真正在燒token的企業(yè)用戶已經(jīng)開始控成本。畢竟尚未看到合理回報(bào),那么為token設(shè)預(yù)算上限、做成本歸因、收緊使用許可,都是順理成章的管理動作。


我們對比了AI產(chǎn)業(yè)鏈上下游具有代表性的上市公司過去兩年的自由現(xiàn)金流(FCF=經(jīng)營性現(xiàn)金流 - 資本支出)變化和最近一年的凈利潤率(圖4)。2025年,處于產(chǎn)業(yè)鏈上游的臺積電(44.5%)和英偉達(dá)(55.6%)不僅凈利潤率更高,自由現(xiàn)金流更取得14.5%和58.8%的高速增長。


相比之下,處于產(chǎn)業(yè)鏈下游的亞馬遜、微軟和Meta雖然凈利潤率與往年持平甚至有所提升,但自由現(xiàn)金流分別下降了76.6%、14.8%和3.4%,主要是受到資本支出大幅上升的影響。Token金礦尚未探明,挖金子的還在投錢,而賣鏟子的已經(jīng)賺得盆滿缽滿。


這樣的情況在歷史上多次重演。產(chǎn)業(yè)革命初期,隨著新技術(shù)興起,需求先在投資端和產(chǎn)業(yè)上游爆發(fā),中游巨額資本支出變成上游的巨大利潤,而下游的最終消費(fèi)方興未艾,尚不足以支撐中游企業(yè)的產(chǎn)能擴(kuò)張。風(fēng)險(xiǎn)向產(chǎn)業(yè)中游匯聚,資本與產(chǎn)能跑在真實(shí)付費(fèi)需求之前。


短期看,估值回調(diào)、產(chǎn)能閑置、部分參與者出局幾乎難以避免;長期看,只要底層需求最終成形,超前建造的數(shù)據(jù)中心、芯片與網(wǎng)絡(luò)還是會有用武之地,成為支撐經(jīng)濟(jì)增長的生產(chǎn)力底座。對于社會大眾和監(jiān)管者來說,需要防范產(chǎn)業(yè)鏈風(fēng)險(xiǎn)通過金融市場向外傳導(dǎo),風(fēng)險(xiǎn)外溢導(dǎo)致的經(jīng)濟(jì)大幅波動。


圖4:AI產(chǎn)業(yè)鏈上下游自由現(xiàn)金流增速與凈利潤率對比(FY2025—2026) 數(shù)據(jù)來源,各公司年報(bào),10-k SEC filing。繪圖:Codebuddy


循環(huán)融資與影子信貸


產(chǎn)業(yè)鏈風(fēng)險(xiǎn)向中游模型廠商集中,而部分中游的模型廠商與上游硬件企業(yè)玩起循環(huán)融資(circular financing),讓人看不透到底是技術(shù)驅(qū)動的真實(shí)增長,還是資本自循環(huán)支撐的估值游戲。


例如OpenAI與英偉達(dá)、甲骨文組建的“AI永動機(jī)”,先由Open AI接受英偉達(dá)戰(zhàn)略投資(原本承諾投資1000億美元,后轉(zhuǎn)為OpenAI新一輪融資的參與者,投資額也大幅縮減),再由OpenAI用融得資金向甲骨文購買云服務(wù)(兩家簽署為期5年總價(jià)值約 3000億美元的算力購買合同),最后甲骨文把OpenAI的付款承諾用于增信,發(fā)債融資向英偉達(dá)購買GPU用于算力中心建設(shè),完成資金閉環(huán)。每一步似乎都有合理的商業(yè)邏輯,但每一步都讓人覺得過于“超前”。


OpenAI的算力采購框架加總起來已突破1萬億美元,與其當(dāng)下330億美元的年化營收(截至2026年5月ARR)不匹配,完全是基于對未來高增長的預(yù)期26。一旦下游token終端消費(fèi)不能帶來模型廠商收入的指數(shù)級增長,“承諾”就會變成“泡沫”。


而token終端消費(fèi)的預(yù)期似乎并不樂觀,據(jù)Bain & Company的測算,要消化掉到2030年新增的200GW算力,終端消費(fèi)需要創(chuàng)造出每年約2萬億美元的新增營收。但即便算上AI帶來的成本節(jié)約,仍有約8000億美元的缺口12。


這樣的循環(huán)融資游戲在世紀(jì)之交的互聯(lián)網(wǎng)泡沫時(shí)代也出現(xiàn)過,但今天的估值泡沫有一半藏在不透明的私人信貸(private credit)市場里,更難確切掌握潛在風(fēng)險(xiǎn)。美聯(lián)儲加息抬高初創(chuàng)企業(yè)、杠桿收購等高風(fēng)險(xiǎn)債券市場利息,銀行在巴塞爾協(xié)議要求下不得不退出這一市場,為私募機(jī)構(gòu)留下空間,最終催生出一個規(guī)模約3萬億美元的美國私人信貸市場。


Apollo、Ares、Blue Owl、KKR、Blackstone等資管機(jī)構(gòu)用BDC(商業(yè)發(fā)展公司)和直接貸款為數(shù)據(jù)中心建設(shè)提供20-30年期的杠桿融資。這些貸款往往是通過私下談判達(dá)成,用模型來定價(jià)的(mark-to-model),可能出現(xiàn)期限錯配(為LLM這樣按月迭代的技術(shù)匹配未來30年現(xiàn)金流),同時(shí)因模型廠商缺現(xiàn)金,因此往往是實(shí)物支付利息(PIK,利息直接滾入本金),風(fēng)險(xiǎn)疊加且不易覺察。


國際清算銀行的一份報(bào)告講到,目前在股權(quán)一級和二級市場已經(jīng)把AI產(chǎn)業(yè)鏈的上行空間充分定價(jià),但債務(wù)市場還沒把下行風(fēng)險(xiǎn)定價(jià)進(jìn)去25。一旦下游需求釋放緩慢,營收不及預(yù)期,循環(huán)融資的估值邏輯將瓦解(股權(quán)壓縮),私人信貸里的模型被迫重估(信貸減值),泡沫破裂、股債雙殺的風(fēng)險(xiǎn)驟增。


資源饑渴擠壓其他需求


Token消耗催生的算力擴(kuò)張,算力中心對水、電等資源極度饑渴,往往在短期內(nèi)制造出巨大的供給缺口,對所在地的民生用水用電產(chǎn)生擠壓效應(yīng)。


美國弗吉尼亞州北部的數(shù)據(jù)中心巷(Data Center Alley)集中了全球密度最高的數(shù)據(jù)中心集群,承載了約70%的全球互聯(lián)網(wǎng)流量。由于地方電網(wǎng)容量被科技公司用長期躉售協(xié)議提前鎖定,居民和傳統(tǒng)商業(yè)的能源配額被嚴(yán)重壓縮。


據(jù)弗吉尼亞州聯(lián)合立法審計(jì)與審查委員會(JLARC)2024年12月發(fā)布的報(bào)告,數(shù)據(jù)中心的耗電量已經(jīng)超過了弗吉尼亞州最大核電站發(fā)電量的兩倍以上,僅滿足勞登縣(Loudoun County)已規(guī)劃或在建數(shù)據(jù)中心的能源需求,就需要在2030年前向電網(wǎng)增加相當(dāng)于數(shù)座核電站的發(fā)電能力。


數(shù)據(jù)中心對高壓輸電線路和清潔能源的瘋狂搶購,迫使地方公用事業(yè)公司斥巨資升級電網(wǎng)。Dominion Energy計(jì)劃在未來十五年內(nèi)投資數(shù)十億美元用于電網(wǎng)擴(kuò)容。這筆巨額基建成本最終將以電網(wǎng)維護(hù)費(fèi)、容量費(fèi)用等形式攤派到居民月度賬單上。


Dominion服務(wù)區(qū)域內(nèi)的容量拍賣價(jià)格已從29美元/MW-天飆升至444美元/MW-天,漲幅超過1400%,直接反映了電網(wǎng)發(fā)電和輸電容量的嚴(yán)重稀缺24。皮德蒙特環(huán)境委員會(PEC)對Dominion Energy綜合資源計(jì)劃(IRP)的分析顯示在該計(jì)劃覆蓋期內(nèi),普通居民的電費(fèi)賬單可能翻倍。


算力擴(kuò)張對日常需求的擠出效應(yīng)不僅限于弗吉尼亞,愛爾蘭都柏林、新加坡裕廊、我國貴州等全球主要算力節(jié)點(diǎn)都曾經(jīng)歷過類似矛盾。從這個意義上說,token不經(jīng)濟(jì)不僅存在于數(shù)字世界,在現(xiàn)實(shí)生活中也投下長長的陰影。


五、尋找Token價(jià)值方程式


Token是智能時(shí)代的最基本的生產(chǎn)要素之一。與其他所有生產(chǎn)要素如土地、數(shù)據(jù)、資本、人力一樣,只要存在資源錯配、要素浪費(fèi),就必然會有所謂“不經(jīng)濟(jì)”的存在。從這個意義上說,token不經(jīng)濟(jì)不會只是AI產(chǎn)業(yè)鏈爆發(fā)初期的暫時(shí)現(xiàn)象,而是與token經(jīng)濟(jì)并存,貫穿在智能經(jīng)濟(jì)發(fā)展的始終。在具體的當(dāng)下,token經(jīng)濟(jì)尚未完全展現(xiàn),因此token不經(jīng)濟(jì)相對較為突出。


始終存在并不意味著要放任自流,可以從供給和需求兩端施力,降低token不經(jīng)濟(jì),強(qiáng)化token經(jīng)濟(jì),讓技術(shù)的發(fā)展真正轉(zhuǎn)化為實(shí)在的經(jīng)濟(jì)價(jià)值。供給側(cè)可以通過精細(xì)化技術(shù)手段降低單位token成本,堵住跑冒滴漏,防止風(fēng)險(xiǎn)擴(kuò)散;需求側(cè)可以通過不斷發(fā)掘新的應(yīng)用場景讓 token花出價(jià)值來。當(dāng)供給端的成本下行曲線與需求端的價(jià)值上行曲線形成交叉,token經(jīng)濟(jì)和不經(jīng)濟(jì)互相抵消后的凈收益便可由負(fù)轉(zhuǎn)正。


技術(shù)面的精細(xì)化變革


上下文緩存與語義壓縮。上下文緩存(Context Caching)已經(jīng)成為模型廠商的通用做法,當(dāng)多智能體流水線頻繁命中歷史緩存時(shí),輸入token的計(jì)費(fèi)大幅壓減。但這一做法也有局限性,在復(fù)雜企業(yè)級部署中,由于Agent路徑高度分叉導(dǎo)致的緩存色散失效,實(shí)際成本節(jié)省的效果相對有限。


更根本的解法在于上下文壓縮,不是簡單地滑動截?cái)鄽v史信息,而是進(jìn)行語義層面的主動壓縮,保留關(guān)鍵指令和推理鏈路,去掉重復(fù)與冗余。這種語義上下文壓縮(Semantic Context Compression)能夠在保護(hù)指令遵循率的同時(shí),顯著減少輸入Token的消耗。


技能優(yōu)化與減法思維。Gao et al.,(2026)的SkillReducer研究提供了技能優(yōu)化的兩條路徑。一是描述壓縮,為缺少路由描述的技能補(bǔ)充精簡信息,壓縮冗余的背景解釋和示例;二是漸進(jìn)式加載,不一次性把完整技能塞入上下文,而是按需加載,可實(shí)現(xiàn)39%的技能體壓縮5。


兩者疊加后,在大幅壓減技能調(diào)用的token消耗的同時(shí),模型功能質(zhì)量反而提升2.8%。從中可以看出,Agent技能調(diào)用不是越多越好,必要時(shí)做減法的收益要遠(yuǎn)大于做加法。減少上下文中的無效信息,不僅可以降低token消耗,還能提升模型輸出的準(zhǔn)確性。Less is more在此處不僅符合代碼之美,也讓token更經(jīng)濟(jì)。


模型路由與任務(wù)分流。大模型殺雞用牛刀,是token浪費(fèi)的重要原因之一。按任務(wù)復(fù)雜度做自適應(yīng)模型路由(Model Routing),把簡單、高頻的子任務(wù)甩給具備特定領(lǐng)域能力的開源輕量模型,只在關(guān)鍵決策點(diǎn)才動用昂貴的Frontier模型。這樣分層調(diào)用,能大幅壓低單位任務(wù)的平均token成本,又不犧牲關(guān)鍵環(huán)節(jié)的質(zhì)量。


多Agent預(yù)算硬約束與主持人架構(gòu)。沒有分工、預(yù)算上限和明確停止條件的多Agent系統(tǒng),演變成馬拉松式的茶話會的概率大大增加。解決的路徑是在多智能體協(xié)同網(wǎng)絡(luò)中設(shè)計(jì)具備硬性預(yù)算約束(Hard Budget Constraints)與異步仲裁機(jī)制的主持人架構(gòu)。


Luo et al.,(2026)提出的蒙特卡洛樹搜索方法,在多智能體流程中加入中間步驟的工具驗(yàn)證,保存候選狀態(tài),必要時(shí)回滾??梢詫⑦@種思路從推理層面提升到架構(gòu)層面,為每個子任務(wù)設(shè)定token預(yù)算上限,由主持人Agent監(jiān)控全局消耗,在預(yù)算耗盡前強(qiáng)制終止無效循環(huán)7。這不僅能防止財(cái)務(wù)失控,往往也會同時(shí)提升系統(tǒng)的整體效率。


商業(yè)面的價(jià)值錨定


Token治理與成本紀(jì)律。微軟限制Claude Code、Meta撤下token消耗排行榜,大廠已經(jīng)從對token消耗的單純鼓勵轉(zhuǎn)向強(qiáng)調(diào)token產(chǎn)出和成本紀(jì)律性1,2。配額、審批、模型路由、成本歸因、團(tuán)隊(duì)賬單,未來這些措施大概率會成為企業(yè)AI治理的基本方式。


這是AI進(jìn)入生產(chǎn)系統(tǒng)后的必經(jīng)階段,即便AI是促進(jìn)創(chuàng)新和加速生產(chǎn)的有力工具,也必須把賬算清楚。用了多少token,產(chǎn)生了多少可驗(yàn)證產(chǎn)出,造成多少返工,都要被計(jì)量。沒有計(jì)量就沒有管理,沒有上限就沒有紀(jì)律。真正先進(jìn)的公司考核的不是用AI最多,而是用最少的token完成最多的工作。


配給制會成為常態(tài)。企業(yè)不會無限供給Token,而是像管理云計(jì)算資源一樣,設(shè)定預(yù)算池和審批流程。這種治理并不與技術(shù)創(chuàng)新對立,恰恰相反,配給制會倒逼架構(gòu)師設(shè)計(jì)更高效的Agent系統(tǒng),將成本約束內(nèi)化。


找到token大規(guī)模商業(yè)應(yīng)用的現(xiàn)實(shí)場景。這是實(shí)現(xiàn)從token凈收益轉(zhuǎn)正的根本。編程和智能體架構(gòu)只是邁向token經(jīng)濟(jì)的一小步,尋找到可以產(chǎn)生巨大生產(chǎn)力躍遷的商業(yè)場景,是進(jìn)入到token經(jīng)濟(jì)發(fā)展快車道、實(shí)現(xiàn)巨大經(jīng)濟(jì)價(jià)值創(chuàng)造的前提條件。目前在真實(shí)的商業(yè)場景中大規(guī)模應(yīng)用智能體架構(gòu)并帶來巨大收益的案例仍然較少,且多為個案。能廣泛應(yīng)用于其他企業(yè)、其他行業(yè)的通用性解決方案仍在醞釀中。


具身智能和數(shù)字孿生是拓展方向之一,但必須正視Sim-to-Real Gap帶來的非對稱驗(yàn)證成本。更務(wù)實(shí)的路徑是在傳統(tǒng)行業(yè)中尋找具備弱確定性反饋的中間地帶,如輔助診斷中的影像篩查(有影像學(xué)標(biāo)準(zhǔn)可參照)、供應(yīng)鏈中的需求預(yù)測(有歷史數(shù)據(jù)可回測)、法律領(lǐng)域中的合同初篩(有條款模板可比對)。


這些場景的驗(yàn)證成本雖不如編譯器趨近于零,但遠(yuǎn)低于純粹的物理世界驗(yàn)證,有望成為token經(jīng)濟(jì)從數(shù)字沙盒走向真實(shí)世界的橋梁。OpenAI近期重新開始進(jìn)行機(jī)器人研究,說明具身智能雖難,但始終無法繞開。


回歸ROI


任何所創(chuàng)造價(jià)值超過所花費(fèi)成本的投入,無論技術(shù)多么先進(jìn),終將不可持續(xù)。Token不經(jīng)濟(jì)不是技術(shù)失敗,而是技術(shù)走向大規(guī)模生產(chǎn)時(shí)經(jīng)常遭遇的暫時(shí)困境。正如工業(yè)革命初期的蒸汽機(jī),效率低下、煤耗驚人,但這并不能否定蒸汽機(jī)代表生產(chǎn)力發(fā)展的未來方向。通過不斷改良熱效率、拓展應(yīng)用場景,蒸汽動力最終成為驅(qū)動第一階段工業(yè)革命的最根本力量。


今天的token和Agent架構(gòu)正如早期的蒸汽機(jī),噪音大、油耗高,但在特定場景下已展現(xiàn)出遠(yuǎn)超人力的潛力,其后續(xù)發(fā)展必然是一場接一場的從粗放到精細(xì)的技術(shù)革新,未來更有價(jià)值的Agent,不是思維鏈最復(fù)雜的Agent,而是用最少token把事做成的Agent。


當(dāng)行業(yè)從以多為榮的炫技階段進(jìn)入以精為貴的生產(chǎn)階段,當(dāng)每一枚token的消耗都必須回答產(chǎn)出有何價(jià)值,token回歸ROI的金標(biāo)準(zhǔn),智能體時(shí)代就找到了自己的價(jià)值方程式。


本文為騰訊研究院“寫作者的夏天”活動征文


參考文獻(xiàn):

[1] Angelo, J. (2026, May 22). Microsoft reports expose AI’s cost problem: The tech is more expensive than paying human employees. Fortune.

[2] Morales, J. (2026, May 23). AI cost crisis hits tech giants as employee tokenmaxxing backfires. Tom’s Hardware.

[3] Semi Analysis. (2026, May). Anthropic revenue analysis: ARR reaches $44 billion. Semi Analysis.

[4] Salim, M., Latendresse, J., Khatoonabadi, S. H., & Shihab, E. (2026). Tokenomics: Quantifying where tokens are used in agentic software engineering. Proceedings of the Mining Software Repositories Conference (MSR).

[5] Gao, Y., Li, Z., Yuan, Y., Ji, Z., Ma, P., & Wang, S. (2026, March). SkillReducer: Optimizing LLM agent skills for token efficiency. arXiv preprint.

[6] Han, T., Zhang, Y., Song, W., Fang, C., Chen, Z., Sun, Y., & Hu, L. (2026, March). SWE-Skills-Bench: Do agent skills actually help in real-world software engineering? arXiv preprint.

[7] Luo, Z., et al.(2026, February). TabTracer: Monte Carlo tree search for complex table reasoning with large language models. arXiv preprint.

[8] Li, F.-F. (2025, November). From words to worlds: Spatial intelligence is AI’s next frontier.

[9] Butts, D. (2026, January 15). TSMC extends record quarter, profit jumps 35% on robust AI chip demand. CNBC.

[10] Microsoft Corporation. (2025–2026). Annual reports and 10-K SEC filings; Alphabet Inc. (2025–2026). Annual reports and 10-K SEC filings; Amazon.com, Inc. (2025–2026). Annual reports and 10-K SEC filings; Meta Platforms, Inc. (2025–2026). Annual reports and 10-K SEC filings.

[11] Muppidi, S. (2026, May 22). OpenAI financials detail Q1 margins and revenue trajectories. The Information.

[12] Bain & Company. (2025, September 23). $2 trillion in new revenue needed to fund AI’s scaling trend—Bain & Company’s 6th annual global technology report.

[13] Anthropic. (2026, April). Opus 4.7 breaking changes: Tokenizer update documentation.

[14] Finout. (2026, April). Anthropic Opus 4.7 tokenizer change: Enterprise prompt impact analysis. Finout.

[15] ClaudeCodeCamp. (2026, April). Opus 4.7 tokenizer: Seven file type comprehensive test results.

[16] Willison, S. (2026, April). Opus 4.7 tokenizer comparison via API. Simon Willison’s Blog.

[17] OpenAI. (2024, May). GPT-4o model card and o200k_base tokenizer release notes.

[18] A&O Shearman. (2023, February 15). A&O announces exclusive launch partnership with Harvey [Press release].

[19] 36氪. (2024, October 15). 1.5萬家律所排隊(duì)一年,獨(dú)角獸Harvey如何掀起法律AI革命?

[20] Aljalbout, E., Xing, J., Romero, A., et al.(2026). The reality gap in robotics: Challenges, solutions, and best practices. Annual Review of Control, Robotics, and Autonomous Systems, 9. arXiv:2510.20808

[21] OpenAI. (2018). Learning dexterous in-hand manipulation. arXiv:1808.00177.

[22] Vincent, J. (2021, June). OpenAI disbands its robotics team. VentureBeat.

[23] Moravec, H. (1988). Mind children: The future of robot and human intelligence. Harvard University Press.

[24] Jack Kemp Foundation. (2024, December). Report claims data centers could cause Virginia energy prices to rise 75 percent this decade.

[25] Aldasoro, I., Doerr, S., & Rees, D. (2026, January 7). Financing the AI boom: From cash flows to debt (BIS Bulletin No. 120). Bank for International Settlements.

[26] Sherwood News. (2026, May). Anthropic revenue surpasses OpenAI.


本文來自微信公眾號:騰訊研究院,作者:李剛

頻道: 金融財(cái)經(jīng)
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
谢通门县| 大方县| 延吉市| 阿尔山市| 赣榆县| 张家口市| 长宁县| 海丰县| 大同市| 庄河市| 尉氏县| 巴彦县| 宁乡县| 中西区| 拉萨市| 东港市| 博野县| 五常市| 安图县| 阿坝| 天等县| 枝江市| 遵化市| 牟定县| 武威市| 宁晋县| 苍溪县| 清镇市| 上饶县| 鸡西市| 平谷区| 烟台市| 辛集市| 武宣县| 张北县| 滕州市| 宝坻区| 柳州市| 临安市| 瑞昌市| 竹北市|