久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文解析Kimi K3停售事件,拆解當(dāng)前大模型推理算力供需邏輯,指出算力鏈路核心增長點(diǎn),為相關(guān)產(chǎn)業(yè)判斷提供參考。 ## 1. 一貴一停的供需反差:大模型強(qiáng)智能進(jìn)入按份供應(yīng)階段 Kimi K3單token定價(jià)約為GPT-5.6 Sol的一半,但單任務(wù)輸出token約是同級別模型中位數(shù)的2倍多,單任務(wù)成本約0.94美元,與GPT-5.6 Sol的1.04美元幾乎打平,既因單價(jià)貴挨罵,又因需求爆滿停售新訂閱。 近月多家大模型廠商通過限流、峰谷定價(jià)限制調(diào)用,說明**最強(qiáng)推理當(dāng)前算力供給已跟不上需求,補(bǔ)貼與真實(shí)需求疊加,算力緊缺是確定現(xiàn)狀**。 ## 2. K3降價(jià)三招:省錢邏輯均建立在大帶寬網(wǎng)絡(luò)基礎(chǔ)上 K3采用混合專家稀疏架構(gòu),896個(gè)專家每個(gè)token僅激活16個(gè),能省電費(fèi),但需要all-to-all通信,要求64卡及以上組成高帶寬通信域才能跑得出經(jīng)濟(jì)性。 K3借助Mooncake分離式推理架構(gòu),將KV緩存轉(zhuǎn)出單卡顯存調(diào)度,編程場景緩存命中率超90%,輸入實(shí)際價(jià)格僅為標(biāo)價(jià)四分之一,依賴集群內(nèi)部高帶寬搬數(shù)據(jù)。 K3用自研KDA線性注意力壓縮緩存體積,支持大上下文低價(jià)推理,核心方向是讓緩存在跨數(shù)據(jù)中心網(wǎng)絡(luò)調(diào)度,同樣依賴網(wǎng)絡(luò)基礎(chǔ)設(shè)施。 當(dāng)前大模型推理集群已向訓(xùn)練級形態(tài)發(fā)展,**最小服務(wù)單元從16卡升到64卡,DeepSeek-V3更是達(dá)到320卡,本質(zhì)是能滿足大通信域要求的成型算力池不足,而非單純?nèi)笨?*。 ## 3. 產(chǎn)業(yè)鏈增量:核心需求落在HBM與光模塊環(huán)節(jié) HBM產(chǎn)能彈性極低:國際大廠良率85%以上,國產(chǎn)長鑫今年底HBM晶圓產(chǎn)能約3萬片/月,良率僅約25%,今明兩年總供給已基本鎖死,是產(chǎn)業(yè)鏈第一道閘門。 超節(jié)點(diǎn)形態(tài)推動(dòng)光模塊需求上漲:單柜域內(nèi)用銅纜互聯(lián),跨柜域需要光互連,華為384卡多機(jī)柜超節(jié)點(diǎn)需要約6912只400G光模塊,芯片與光模塊配比達(dá)1:18;大模型最小服務(wù)單元不斷擴(kuò)大,正在把負(fù)載持續(xù)推向機(jī)柜外,拉動(dòng)光需求升級。 跨集群互聯(lián)進(jìn)一步拉動(dòng)高速光模塊需求:當(dāng)前agent流量已超過人類,單agent請求token消耗是人類的15倍,谷歌單月處理token一年漲7倍,LightCounting預(yù)測2026年800G光模塊出貨量再翻倍,1.6T芯片組銷售額突破20億美元。 ## 4. 產(chǎn)業(yè)趨勢待驗(yàn)證:總貨量增長與效率優(yōu)化仍在賽跑 大模型總token需求增長拉動(dòng)光互連需求,但大模型也在通過稀疏優(yōu)化、壓縮等方式降低單位算力消耗,這是一場總量增長與效率提升的賽跑,結(jié)果未定。 可跟蹤三個(gè)觀察點(diǎn):7月27日K3開源后國產(chǎn)64卡以上集群的落地情況、Qwen3.8開源后的部署指引要求、月之暗面擴(kuò)容的采購?fù)断颉?/div>
kimi不是DeepSeek時(shí)刻
2026-07-21 11:21

kimi不是DeepSeek時(shí)刻

本文來自微信公眾號: 王智遠(yuǎn) ,作者:王智遠(yuǎn)


7月19日晚上,月之暗面發(fā)了一份公告,估計(jì)很多人都看到了。


標(biāo)題叫《關(guān)于算力緊缺與會(huì)員暫停開放的說明》。說三件事:


Kimi K3上線48小時(shí),逼近集群承載極限;暫停C端新用戶訂閱,現(xiàn)有算力全部服務(wù)已訂閱用戶;后續(xù)新訂閱,Kimi主權(quán)益和Kimi Code權(quán)益拆開賣,「以方便更精準(zhǔn)匹配算力」。


同一個(gè)晚上,阿里千問官宣Qwen3.8即將發(fā)布開源,參數(shù)2.4萬億;對多數(shù)人來說,這就是條產(chǎn)品新聞??赐炅?,劃走。


你要拿著算力股,里面有個(gè)反差,可以研究下。


被賣到停售的這個(gè)模型,三天來被用戶罵得最多的,恰恰是「貴」,發(fā)布博客把輸出定價(jià)寫到100元每百萬token,大概是上一代的4倍。


海外媒體直接拿這個(gè)說事,標(biāo)題叫「中國廉價(jià)AI時(shí)代的終結(jié)」,上手用戶曬的額度截圖,一天燒掉三五成,到處都是,抱怨列表的另一頭還掛著一個(gè)「慢」。


一邊貴到挨罵,一邊搶到關(guān)門,這兩件事同時(shí)成立,說明什么?「便宜」和「貴」這場架,兩邊吵的不是同一件事。


拆開來看,有三個(gè)刻度。


第一個(gè)刻度,單個(gè)token的標(biāo)價(jià);K3確實(shí)便宜,輸入3美元、輸出15美元每百萬token,大約是GPT-5.6 Sol的一半,全部的價(jià)格優(yōu)勢,都長在這個(gè)刻度上。


第二個(gè)刻度不同了,干完一件事,到底花多少錢?


我查了第三方評測機(jī)構(gòu)Artificial Analysis的數(shù)據(jù),截至7月21日口徑,跑完同一套智力測試,K3總共輸出約1.3億個(gè)token,是可比推理模型中位數(shù)6300萬的兩倍還多。


折到單個(gè)任務(wù),K3約0.94美元,GPT-5.6 Sol開到最高檔呢?1.04美元。


幾乎打平,單價(jià)一半,話多一倍,賬單回到原點(diǎn),用戶罵「額度燒得快」,罵的就是這個(gè)刻度的日常體感。


第三個(gè)刻度,總需求,停售公告本身就說明問題了,需求大到人家把門關(guān)了。


而且關(guān)門這家,手里本來就有閘,Kimi Code設(shè)著7天總量加每5小時(shí)滾動(dòng)窗口的雙層限流,幫助頁寫得清楚。


隔壁更直接,Qwen3.8預(yù)覽版壓根沒走「掛個(gè)API隨便買」的路子,只放在Token Plan訂閱里用,個(gè)人版掛兩層滑動(dòng)窗口,5小時(shí)、7天,觸頂即停,條款清清楚楚寫著:禁止當(dāng)API批量調(diào)用。


還有DeepSeek,六月底放了個(gè)消息,V4正式版要搞峰谷定價(jià),高峰時(shí)段API價(jià)格翻倍,注意,用智能最貴的那個(gè)時(shí)段,恰好是你上班干活的時(shí)段。


幾周之內(nèi),一家關(guān)門,一家裝閘,一家把電網(wǎng)的峰谷電價(jià)搬進(jìn)了API價(jià)目表;各干各的,指向同一件事:最強(qiáng)的智能,眼下是按份供應(yīng)的。


......


當(dāng)然,我這話也不能說得太滿,一家公司停售,只是一個(gè)樣本,不等于一個(gè)趨勢。


你說月之暗面自己卡買少了,也完全講得通;而且這波需求里摻著補(bǔ)貼,Qwen預(yù)覽期Credits消耗打一折,等于十倍用量白送,K3訂閱套餐的定價(jià)能不能覆蓋推理成本,也得打個(gè)問號。


不過,有一件事是確定的:


補(bǔ)貼也好,真實(shí)需求也好,攪在一起的現(xiàn)狀就是算力已經(jīng)先不夠用了。


有意思的是,市場第一反應(yīng)完全沒往這個(gè)方向走。


7月17日,A股CPO概念批量跌停;持倉群里刷屏的那句話你應(yīng)該見過:「第二次DeepSeek時(shí)刻」。什么意思?


2025年1月那筆舊賬還記得吧:


中國模型太省算力了,那算力和光是不是買多了?高盛的Rich Privorotsky在K3發(fā)布當(dāng)天也往這個(gè)方向定性,說這可能是「算力擴(kuò)張時(shí)代」終結(jié)的信號。


48小時(shí)后,那份停售公告出來了,算是對這個(gè)定性,當(dāng)場來了個(gè)回話。


價(jià)格戰(zhàn)這事,隨時(shí)可能反轉(zhuǎn);DeepSeek的V4預(yù)覽版4月起就在走省算力路線,正式版上線要同步調(diào)價(jià);比誰便宜,這個(gè)行業(yè)里從來沒有過定局。


有一樣?xùn)|西,回不了頭,這一代模型到底長成了什么形態(tài)?需要什么樣的集群來伺候它?貴與便宜是策略,形態(tài)是宿命。


所以,標(biāo)價(jià)砍半的模型,用到停售的需求,翻倍的任務(wù)賬單;三件事放在一起,你很難不問一句:K3的便宜,到底省在哪里了?


......


我先說結(jié)論,不全是省出來的。


K3拿到低價(jià)的每一招,都押著一個(gè)前提,三招拆開看,前提是同一個(gè)東西。


先說怎么看這套系統(tǒng),把它想成一座貨運(yùn)園區(qū);token是包裹,推理是分揀加派送,顯卡是工位,園區(qū)里的高速互連是傳送帶,跨園區(qū)的網(wǎng)線是跨城干線。


記住這個(gè)畫面,我們拆第一招:稀疏。


K3是混合專家模型,896個(gè)專家,每個(gè)token只激活其中16個(gè);什么意思?每件包裹進(jìn)園區(qū),只叫醒該干活的那十幾個(gè)工人,其余人不動(dòng),電費(fèi)自然省了。


但前提馬上就跟來了,幾百個(gè)專家攤在幾十張卡上,包裹要在工位之間寄出去、算完、再寄回來;這東西有個(gè)行話,叫all-to-all通信。


這類流量對帶寬和延遲極其敏感,差一點(diǎn)都不行。


有基準(zhǔn)可查,DeepSeek開源的通信庫實(shí)測,同一高帶寬域內(nèi)每卡能跑到約160GB/s;跨節(jié)點(diǎn)呢?掉到約50GB/s。


月之暗面顯然知道這個(gè)問題,應(yīng)對就寫在發(fā)布博客里:


訓(xùn)練階段就搞了「完全均衡的專家并行」設(shè)計(jì),部署一節(jié)明確建議「64個(gè)或更多加速器組成的supernode」,理由是推理效率受益于更大的高帶寬通信域。


這里我要說一點(diǎn),64卡是跑得經(jīng)濟(jì)的門檻,是把token賣到這個(gè)價(jià)的前提;傳送帶不夠長,工人再省電,包裹也堵在路上。


第二招:緩存。


發(fā)布博客里有句話容易滑過去,借助Mooncake分離式推理架構(gòu),編程場景緩存命中率超過90%,實(shí)際輸入價(jià)格僅為標(biāo)價(jià)的四分之一。


Mooncake是月之暗面自研的推理底座,它干的事是什么呢?


把緩存(行話叫KV cache)從單卡顯存里解放出來,在集群的處理器、內(nèi)存、硬盤之間流轉(zhuǎn);翻譯一下:包裹不必每次回總倉重新打包,去就近的中轉(zhuǎn)倉取就行。


這東西有多能搬?


我查了它的開源基準(zhǔn),一臺(tái)插滿8張400G網(wǎng)卡的節(jié)點(diǎn),搬運(yùn)40GB緩存能跑到190GB/s。


四分之一的輸入價(jià)不是白來的,它建立在集群內(nèi)部大規(guī)模搬數(shù)據(jù)的能力上,網(wǎng)絡(luò)帶寬是這門生意的效率變量。


第三招:壓縮。


K3用自研的KDA線性注意力,把緩存體積大幅壓小。官方說法是,借助帶緩存的KDA,「即使在大模型規(guī)模和長上下文條件下,也能以很有競爭力的token價(jià)格提供服務(wù)」。


你看,壓小的包裹還是要搬,月之暗面今年掛出一篇系統(tǒng)論文,標(biāo)題就很說明態(tài)度了:


「下一代模型的KVCache可以跨數(shù)據(jù)中心」,把緩存當(dāng)一等公民資源,在更大的網(wǎng)絡(luò)里調(diào)度。方向直接寫在了論文標(biāo)題上。


三招放在一起,答案完整了。


稀疏省算力,前提是域夠大,緩存省重復(fù)計(jì)算,前提是搬得動(dòng);壓縮省顯存,前提是緩存設(shè)施接得住,省錢的每一招,都建在網(wǎng)絡(luò)上。


很多人覺得推理是輕量活,訓(xùn)練才是重體力。不是的。這一代推理集群,長成了過去只有訓(xùn)練集群才有的形狀。


而且,這也不是一家的偏好,開源旗艦的「最小服務(wù)單元」,代際之間在變大。


上一代K2,官方部署指引最少16卡;K3推薦64卡起步。DeepSeek-V3的技術(shù)報(bào)告里,解碼階段最小部署單元是320卡。


再看過去一周的牌桌,已開源的V4-Pro站在1.6萬億參數(shù),Qwen3.8官宣2.4萬億即將開源,MiniMax被曝下一款2.5到3萬億,這一代模型,都長這個(gè)形狀。


SemiAnalysis給K3的判詞也通了:它需要「更多的GPU、HBM、DRAM和網(wǎng)絡(luò)」。


回頭再讀那份停售公告,可以從技術(shù)角度換個(gè)讀法了:


卡不是問題,市面上買得到;問題是把幾十張卡綁成一個(gè)域;能同時(shí)跑稀疏、緩存、壓縮的那種集群,臨時(shí)拼幾臺(tái)機(jī)器湊不出來。


緩存要在網(wǎng)絡(luò)里流轉(zhuǎn),隨便拉根網(wǎng)線也搬不動(dòng);公告里那句「承載極限」,說白了,是長成這個(gè)形狀的算力池不夠用。


......


需求是真的,形態(tài)也定死了,這筆錢,落到產(chǎn)業(yè)鏈上,會(huì)記到哪一段的頭上?


這份需求能兌現(xiàn)多少,第一道閘門,就在剛才那句判詞里:HBM,高帶寬內(nèi)存。


SemiAnalysis給K3算過一筆硬件賬;2.8萬億參數(shù)的權(quán)重超過1.5TB,單臺(tái)機(jī)器的顯存根本裝不下,注定要攤在集群里。


如果國產(chǎn)承接這頭,閘門更窄。


同一家機(jī)構(gòu)拆過長鑫存儲(chǔ)的口徑:HBM晶圓產(chǎn)能去年底約5000片每月,今年底爬到約3萬片,綜合良率約25%。


對比一下,國際大廠良率在85%以上;此前囤了約1300萬堆庫存,按他們的測算,約夠160萬顆910C級芯片用。


我翻譯下啊:地和鋼材是限量的。今年明年能蓋幾座園區(qū),基本已經(jīng)寫死了,這一段的賬,最確定,也最沒有彈性。


量看完,再說形態(tài),采購的單位在變。


以前叫「買卡」,現(xiàn)在叫「買超節(jié)點(diǎn)」。剛閉幕的世界人工智能大會(huì)上,我去逛一圈,燧原、沐曦、摩爾線程、中興、百度、平頭哥,各家的超節(jié)點(diǎn)扎堆亮相。


園區(qū)里的傳送帶怎么修,取決于一個(gè)工程邊界:銅的半徑。


銅纜便宜、穩(wěn)定,問題是它只夠在一個(gè)機(jī)柜內(nèi)部把卡連起來;阿里的磐久128單柜方案,柜內(nèi)全銅,一只光模塊不用。


英偉達(dá)NVL72同樣柜內(nèi)全銅,域一大過一個(gè)機(jī)柜,故事就換了。


華為CloudMatrix 384用十六個(gè)機(jī)柜拼一個(gè)域,柜內(nèi)走銅,柜間走光;SemiAnalysis拆出來,整機(jī)約6912只400G光模塊,芯片和光模塊的配比約1比18。


注意,這個(gè)配比只屬于多柜形態(tài),不能套到所有超節(jié)點(diǎn)頭上。


K3建議的64卡,今天恰好壓在這條銅光邊界上,單柜方案還兜得住;往前看一代呢?V3的320卡早就在柜外了。


最小服務(wù)單元16、64、320這條代際曲線,正在把負(fù)載往機(jī)柜外面推;域每跨出一個(gè)機(jī)柜,光的賬就跳一級。


最后說彈性,眼下最實(shí)的一段賬,在園區(qū)之間。


跨集群的高速以太網(wǎng),吃的是800G和1.6T光模塊;我查了LightCounting今年2月的預(yù)測:800G出貨量今年再翻一倍以上,1.6T增長到數(shù)千萬端口量級,1.6T芯片組銷售額今年突破20億美元。


墊在這批訂單底下的,是貨運(yùn)總量本身,谷歌在I/O上自報(bào),單月處理token達(dá)3200萬億,一年漲了7倍。


OpenRouter的官方博客說:


今年2月起,agent產(chǎn)生的流量超過了人類,單條agent請求消耗約是人類的15倍;包裹越來越多,寄件的還從人換成了不知疲倦的機(jī)器。


當(dāng)然,我前面說的全是需求往上走,這事還有另一面。


效率也在往前走,K3自己的輸出token比上一代少了21%;橫向比,仍是同行的兩倍;DeepSeek的V4,前面提過,走的稀疏注意力就是奔著省去的。


華為去年發(fā)了篇UB-Mesh論文,研究的東西更直接:機(jī)柜里用電纜直連,能少用光模塊就少用。


還記得那個(gè)貨運(yùn)園區(qū)的比方嗎?單件包裹在變小,包裝在變省。


所以,這其實(shí)是一場賽跑;總貨量跑在前面,光互連的賬就成立;哪天單件瘦身反超了總量,單位算力配多少光,就會(huì)掉頭。


兩邊都是真的,誰能跑贏,沒人知道。


有幾個(gè)東西可以盯著,按計(jì)劃,7月27日,K3的權(quán)重和技術(shù)報(bào)告放出來,看看誰第一個(gè)用64卡以上的國產(chǎn)集群把它跑起來。


Qwen3.8正式開源后,看它的部署指引推不推類似的大通信域;月之暗面全速擴(kuò)容,看采購?fù)姆N形態(tài)的集群流。


回到開頭那個(gè)反差:罵它貴的,罵的是token的標(biāo)價(jià);把它搶到關(guān)門的,搶的是長成這個(gè)形狀的算力。


參考來源:


[1].月之暗面、千問、DeepSeek官方公告與文檔,Artificial Analysis、SemiAnalysis、LightCounting,DeepSeek-V3技術(shù)報(bào)告及Mooncake、DeepEP、UB-Mesh等公開論文與開源倉庫(數(shù)據(jù)截至2026-07-21)


[2].個(gè)人觀點(diǎn),僅供參考,不構(gòu)成投資建議

AI創(chuàng)投日報(bào)頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如涉及版權(quán)問題請聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
阳城县| 杭锦旗| 芦山县| 临澧县| 萨嘎县| 雅安市| 溆浦县| 台前县| 阳山县| 正安县| 聊城市| 红安县| 仁化县| 玉田县| 兴安县| 南靖县| 正宁县| 芦溪县| 若尔盖县| 赞皇县| 娄底市| 涿州市| 资源县| 漾濞| 汉寿县| 昭苏县| 宜城市| 伊宁县| 瑞金市| 嘉鱼县| 望谟县| 长武县| 云林县| 客服| 铜陵市| 开远市| 怀柔区| 本溪市| 浦东新区| 潍坊市| 吉安市|