本文來自微信公眾號: 王智遠(yuǎn) ,作者:王智遠(yuǎn)
7月19日晚上,月之暗面發(fā)了一份公告,估計(jì)很多人都看到了。
標(biāo)題叫《關(guān)于算力緊缺與會(huì)員暫停開放的說明》。說三件事:
Kimi K3上線48小時(shí),逼近集群承載極限;暫停C端新用戶訂閱,現(xiàn)有算力全部服務(wù)已訂閱用戶;后續(xù)新訂閱,Kimi主權(quán)益和Kimi Code權(quán)益拆開賣,「以方便更精準(zhǔn)匹配算力」。
同一個(gè)晚上,阿里千問官宣Qwen3.8即將發(fā)布開源,參數(shù)2.4萬億;對多數(shù)人來說,這就是條產(chǎn)品新聞??赐炅?,劃走。
你要拿著算力股,里面有個(gè)反差,可以研究下。
被賣到停售的這個(gè)模型,三天來被用戶罵得最多的,恰恰是「貴」,發(fā)布博客把輸出定價(jià)寫到100元每百萬token,大概是上一代的4倍。
海外媒體直接拿這個(gè)說事,標(biāo)題叫「中國廉價(jià)AI時(shí)代的終結(jié)」,上手用戶曬的額度截圖,一天燒掉三五成,到處都是,抱怨列表的另一頭還掛著一個(gè)「慢」。
一邊貴到挨罵,一邊搶到關(guān)門,這兩件事同時(shí)成立,說明什么?「便宜」和「貴」這場架,兩邊吵的不是同一件事。
拆開來看,有三個(gè)刻度。
第一個(gè)刻度,單個(gè)token的標(biāo)價(jià);K3確實(shí)便宜,輸入3美元、輸出15美元每百萬token,大約是GPT-5.6 Sol的一半,全部的價(jià)格優(yōu)勢,都長在這個(gè)刻度上。
第二個(gè)刻度不同了,干完一件事,到底花多少錢?
我查了第三方評測機(jī)構(gòu)Artificial Analysis的數(shù)據(jù),截至7月21日口徑,跑完同一套智力測試,K3總共輸出約1.3億個(gè)token,是可比推理模型中位數(shù)6300萬的兩倍還多。
折到單個(gè)任務(wù),K3約0.94美元,GPT-5.6 Sol開到最高檔呢?1.04美元。
幾乎打平,單價(jià)一半,話多一倍,賬單回到原點(diǎn),用戶罵「額度燒得快」,罵的就是這個(gè)刻度的日常體感。
第三個(gè)刻度,總需求,停售公告本身就說明問題了,需求大到人家把門關(guān)了。
而且關(guān)門這家,手里本來就有閘,Kimi Code設(shè)著7天總量加每5小時(shí)滾動(dòng)窗口的雙層限流,幫助頁寫得清楚。
隔壁更直接,Qwen3.8預(yù)覽版壓根沒走「掛個(gè)API隨便買」的路子,只放在Token Plan訂閱里用,個(gè)人版掛兩層滑動(dòng)窗口,5小時(shí)、7天,觸頂即停,條款清清楚楚寫著:禁止當(dāng)API批量調(diào)用。
還有DeepSeek,六月底放了個(gè)消息,V4正式版要搞峰谷定價(jià),高峰時(shí)段API價(jià)格翻倍,注意,用智能最貴的那個(gè)時(shí)段,恰好是你上班干活的時(shí)段。
幾周之內(nèi),一家關(guān)門,一家裝閘,一家把電網(wǎng)的峰谷電價(jià)搬進(jìn)了API價(jià)目表;各干各的,指向同一件事:最強(qiáng)的智能,眼下是按份供應(yīng)的。
......
當(dāng)然,我這話也不能說得太滿,一家公司停售,只是一個(gè)樣本,不等于一個(gè)趨勢。
你說月之暗面自己卡買少了,也完全講得通;而且這波需求里摻著補(bǔ)貼,Qwen預(yù)覽期Credits消耗打一折,等于十倍用量白送,K3訂閱套餐的定價(jià)能不能覆蓋推理成本,也得打個(gè)問號。
不過,有一件事是確定的:
補(bǔ)貼也好,真實(shí)需求也好,攪在一起的現(xiàn)狀就是算力已經(jīng)先不夠用了。
有意思的是,市場第一反應(yīng)完全沒往這個(gè)方向走。
7月17日,A股CPO概念批量跌停;持倉群里刷屏的那句話你應(yīng)該見過:「第二次DeepSeek時(shí)刻」。什么意思?
2025年1月那筆舊賬還記得吧:
中國模型太省算力了,那算力和光是不是買多了?高盛的Rich Privorotsky在K3發(fā)布當(dāng)天也往這個(gè)方向定性,說這可能是「算力擴(kuò)張時(shí)代」終結(jié)的信號。
48小時(shí)后,那份停售公告出來了,算是對這個(gè)定性,當(dāng)場來了個(gè)回話。
價(jià)格戰(zhàn)這事,隨時(shí)可能反轉(zhuǎn);DeepSeek的V4預(yù)覽版4月起就在走省算力路線,正式版上線要同步調(diào)價(jià);比誰便宜,這個(gè)行業(yè)里從來沒有過定局。
有一樣?xùn)|西,回不了頭,這一代模型到底長成了什么形態(tài)?需要什么樣的集群來伺候它?貴與便宜是策略,形態(tài)是宿命。
所以,標(biāo)價(jià)砍半的模型,用到停售的需求,翻倍的任務(wù)賬單;三件事放在一起,你很難不問一句:K3的便宜,到底省在哪里了?
......
我先說結(jié)論,不全是省出來的。
K3拿到低價(jià)的每一招,都押著一個(gè)前提,三招拆開看,前提是同一個(gè)東西。
先說怎么看這套系統(tǒng),把它想成一座貨運(yùn)園區(qū);token是包裹,推理是分揀加派送,顯卡是工位,園區(qū)里的高速互連是傳送帶,跨園區(qū)的網(wǎng)線是跨城干線。
記住這個(gè)畫面,我們拆第一招:稀疏。
K3是混合專家模型,896個(gè)專家,每個(gè)token只激活其中16個(gè);什么意思?每件包裹進(jìn)園區(qū),只叫醒該干活的那十幾個(gè)工人,其余人不動(dòng),電費(fèi)自然省了。
但前提馬上就跟來了,幾百個(gè)專家攤在幾十張卡上,包裹要在工位之間寄出去、算完、再寄回來;這東西有個(gè)行話,叫all-to-all通信。
這類流量對帶寬和延遲極其敏感,差一點(diǎn)都不行。
有基準(zhǔn)可查,DeepSeek開源的通信庫實(shí)測,同一高帶寬域內(nèi)每卡能跑到約160GB/s;跨節(jié)點(diǎn)呢?掉到約50GB/s。
月之暗面顯然知道這個(gè)問題,應(yīng)對就寫在發(fā)布博客里:
訓(xùn)練階段就搞了「完全均衡的專家并行」設(shè)計(jì),部署一節(jié)明確建議「64個(gè)或更多加速器組成的supernode」,理由是推理效率受益于更大的高帶寬通信域。
這里我要說一點(diǎn),64卡是跑得經(jīng)濟(jì)的門檻,是把token賣到這個(gè)價(jià)的前提;傳送帶不夠長,工人再省電,包裹也堵在路上。
第二招:緩存。
發(fā)布博客里有句話容易滑過去,借助Mooncake分離式推理架構(gòu),編程場景緩存命中率超過90%,實(shí)際輸入價(jià)格僅為標(biāo)價(jià)的四分之一。
Mooncake是月之暗面自研的推理底座,它干的事是什么呢?
把緩存(行話叫KV cache)從單卡顯存里解放出來,在集群的處理器、內(nèi)存、硬盤之間流轉(zhuǎn);翻譯一下:包裹不必每次回總倉重新打包,去就近的中轉(zhuǎn)倉取就行。
這東西有多能搬?
我查了它的開源基準(zhǔn),一臺(tái)插滿8張400G網(wǎng)卡的節(jié)點(diǎn),搬運(yùn)40GB緩存能跑到190GB/s。
四分之一的輸入價(jià)不是白來的,它建立在集群內(nèi)部大規(guī)模搬數(shù)據(jù)的能力上,網(wǎng)絡(luò)帶寬是這門生意的效率變量。
第三招:壓縮。
K3用自研的KDA線性注意力,把緩存體積大幅壓小。官方說法是,借助帶緩存的KDA,「即使在大模型規(guī)模和長上下文條件下,也能以很有競爭力的token價(jià)格提供服務(wù)」。
你看,壓小的包裹還是要搬,月之暗面今年掛出一篇系統(tǒng)論文,標(biāo)題就很說明態(tài)度了:
「下一代模型的KVCache可以跨數(shù)據(jù)中心」,把緩存當(dāng)一等公民資源,在更大的網(wǎng)絡(luò)里調(diào)度。方向直接寫在了論文標(biāo)題上。
三招放在一起,答案完整了。
稀疏省算力,前提是域夠大,緩存省重復(fù)計(jì)算,前提是搬得動(dòng);壓縮省顯存,前提是緩存設(shè)施接得住,省錢的每一招,都建在網(wǎng)絡(luò)上。
很多人覺得推理是輕量活,訓(xùn)練才是重體力。不是的。這一代推理集群,長成了過去只有訓(xùn)練集群才有的形狀。
而且,這也不是一家的偏好,開源旗艦的「最小服務(wù)單元」,代際之間在變大。
上一代K2,官方部署指引最少16卡;K3推薦64卡起步。DeepSeek-V3的技術(shù)報(bào)告里,解碼階段最小部署單元是320卡。
再看過去一周的牌桌,已開源的V4-Pro站在1.6萬億參數(shù),Qwen3.8官宣2.4萬億即將開源,MiniMax被曝下一款2.5到3萬億,這一代模型,都長這個(gè)形狀。
SemiAnalysis給K3的判詞也通了:它需要「更多的GPU、HBM、DRAM和網(wǎng)絡(luò)」。
回頭再讀那份停售公告,可以從技術(shù)角度換個(gè)讀法了:
卡不是問題,市面上買得到;問題是把幾十張卡綁成一個(gè)域;能同時(shí)跑稀疏、緩存、壓縮的那種集群,臨時(shí)拼幾臺(tái)機(jī)器湊不出來。
緩存要在網(wǎng)絡(luò)里流轉(zhuǎn),隨便拉根網(wǎng)線也搬不動(dòng);公告里那句「承載極限」,說白了,是長成這個(gè)形狀的算力池不夠用。
......
需求是真的,形態(tài)也定死了,這筆錢,落到產(chǎn)業(yè)鏈上,會(huì)記到哪一段的頭上?
這份需求能兌現(xiàn)多少,第一道閘門,就在剛才那句判詞里:HBM,高帶寬內(nèi)存。
SemiAnalysis給K3算過一筆硬件賬;2.8萬億參數(shù)的權(quán)重超過1.5TB,單臺(tái)機(jī)器的顯存根本裝不下,注定要攤在集群里。
如果國產(chǎn)承接這頭,閘門更窄。
同一家機(jī)構(gòu)拆過長鑫存儲(chǔ)的口徑:HBM晶圓產(chǎn)能去年底約5000片每月,今年底爬到約3萬片,綜合良率約25%。
對比一下,國際大廠良率在85%以上;此前囤了約1300萬堆庫存,按他們的測算,約夠160萬顆910C級芯片用。
我翻譯下啊:地和鋼材是限量的。今年明年能蓋幾座園區(qū),基本已經(jīng)寫死了,這一段的賬,最確定,也最沒有彈性。
量看完,再說形態(tài),采購的單位在變。
以前叫「買卡」,現(xiàn)在叫「買超節(jié)點(diǎn)」。剛閉幕的世界人工智能大會(huì)上,我去逛一圈,燧原、沐曦、摩爾線程、中興、百度、平頭哥,各家的超節(jié)點(diǎn)扎堆亮相。
園區(qū)里的傳送帶怎么修,取決于一個(gè)工程邊界:銅的半徑。
銅纜便宜、穩(wěn)定,問題是它只夠在一個(gè)機(jī)柜內(nèi)部把卡連起來;阿里的磐久128單柜方案,柜內(nèi)全銅,一只光模塊不用。
英偉達(dá)NVL72同樣柜內(nèi)全銅,域一大過一個(gè)機(jī)柜,故事就換了。
華為CloudMatrix 384用十六個(gè)機(jī)柜拼一個(gè)域,柜內(nèi)走銅,柜間走光;SemiAnalysis拆出來,整機(jī)約6912只400G光模塊,芯片和光模塊的配比約1比18。
注意,這個(gè)配比只屬于多柜形態(tài),不能套到所有超節(jié)點(diǎn)頭上。
K3建議的64卡,今天恰好壓在這條銅光邊界上,單柜方案還兜得住;往前看一代呢?V3的320卡早就在柜外了。
最小服務(wù)單元16、64、320這條代際曲線,正在把負(fù)載往機(jī)柜外面推;域每跨出一個(gè)機(jī)柜,光的賬就跳一級。
最后說彈性,眼下最實(shí)的一段賬,在園區(qū)之間。
跨集群的高速以太網(wǎng),吃的是800G和1.6T光模塊;我查了LightCounting今年2月的預(yù)測:800G出貨量今年再翻一倍以上,1.6T增長到數(shù)千萬端口量級,1.6T芯片組銷售額今年突破20億美元。
墊在這批訂單底下的,是貨運(yùn)總量本身,谷歌在I/O上自報(bào),單月處理token達(dá)3200萬億,一年漲了7倍。
OpenRouter的官方博客說:
今年2月起,agent產(chǎn)生的流量超過了人類,單條agent請求消耗約是人類的15倍;包裹越來越多,寄件的還從人換成了不知疲倦的機(jī)器。
當(dāng)然,我前面說的全是需求往上走,這事還有另一面。
效率也在往前走,K3自己的輸出token比上一代少了21%;橫向比,仍是同行的兩倍;DeepSeek的V4,前面提過,走的稀疏注意力就是奔著省去的。
華為去年發(fā)了篇UB-Mesh論文,研究的東西更直接:機(jī)柜里用電纜直連,能少用光模塊就少用。
還記得那個(gè)貨運(yùn)園區(qū)的比方嗎?單件包裹在變小,包裝在變省。
所以,這其實(shí)是一場賽跑;總貨量跑在前面,光互連的賬就成立;哪天單件瘦身反超了總量,單位算力配多少光,就會(huì)掉頭。
兩邊都是真的,誰能跑贏,沒人知道。
有幾個(gè)東西可以盯著,按計(jì)劃,7月27日,K3的權(quán)重和技術(shù)報(bào)告放出來,看看誰第一個(gè)用64卡以上的國產(chǎn)集群把它跑起來。
Qwen3.8正式開源后,看它的部署指引推不推類似的大通信域;月之暗面全速擴(kuò)容,看采購?fù)姆N形態(tài)的集群流。
回到開頭那個(gè)反差:罵它貴的,罵的是token的標(biāo)價(jià);把它搶到關(guān)門的,搶的是長成這個(gè)形狀的算力。
參考來源:
[1].月之暗面、千問、DeepSeek官方公告與文檔,Artificial Analysis、SemiAnalysis、LightCounting,DeepSeek-V3技術(shù)報(bào)告及Mooncake、DeepEP、UB-Mesh等公開論文與開源倉庫(數(shù)據(jù)截至2026-07-21)
[2].個(gè)人觀點(diǎn),僅供參考,不構(gòu)成投資建議
