久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

當前具身智能賽道“第一”泛濫、榜單注水問題嚴重,本文拆解亂象成因、造榜套路,幫讀者分辨可信榜單,判斷行業(yè)價值。 ## 1. 賽道亂象:人均一個“第一”的通脹格局 目前活躍的具身智能榜單超20個,按評測方向分為VLA操作綜合榜、世界模型榜、專項基準榜三類,三類各有側(cè)重無法互相替代。 近半年頭部企業(yè)幾乎每家都握有“第一”,亂象突出:榜首更換頻率遠超高,過去半年RoboChallenge Table30榜首至少換4次,單個模型霸榜一周已屬不易;同一個總榜多個子榜的“第一”被模糊化統(tǒng)一宣傳;不同性質(zhì)榜單含金量差異極大,卻被默認歸為同一檔次,最終導致“第一”頭銜嚴重通脹。 ## 2. 造“第一”潛規(guī)則:三層包裝造出注水頭銜 業(yè)內(nèi)造“第一”主要有三種常見手法,且常疊加使用: 最普遍的是話術(shù)包裝,成績真實但通過省略限定詞,放大“第一”指代范圍,偷換賽道概念。 第二種是干預評測結(jié)果,既可以針對公開榜單的任務定向采集數(shù)據(jù)微調(diào)刷分,也可鉆評測機制漏洞,比如RoboArena曾因規(guī)則漏洞,允許多個關(guān)聯(lián)賬號集中刷分推高排名,千尋智能Spirit v1.6曾因此登頂后被除名。 第三種是資源置換,部分媒體/產(chǎn)業(yè)榜標準不透明,直接和商務合作綁定,靠預算和關(guān)系換排名。 ## 3. 分辨可信榜單的三個核心標準 目前具身智能尚未形成統(tǒng)一技術(shù)評價體系,榜單仍有參考價值,可信榜單需同時滿足三個特征: 一是分項透明,不僅公布總分,還要公開各細分任務的成績,只報總分不報細項的榜單價值大打折扣。 二是第三方掌控評測,且?guī)в蟹此㈩}設(shè)計,比如要求模型“裸考”不允許微調(diào)、加入極端擾動防止死記硬背,將泛化能力設(shè)為真正門檻。 三是看評測機制而非更新頻率,真機榜單更新慢多因評測成本高,動態(tài)排名榜單更新快屬于機制設(shè)計,核心要看機制是否嚴密、規(guī)則漏洞是否補齊。 ## 4. 榜單亂象本質(zhì)是行業(yè)階段的資本焦慮 當前具身智能仍處于早期融資導向階段,出貨量、營收等硬指標不穩(wěn)定,榜單成為企業(yè)獲取關(guān)注度、估值溢價、產(chǎn)業(yè)資源的核心抓手,因此刷榜爭“第一”的現(xiàn)象很難避免。 未來行業(yè)進入落地階段后,評判標尺會切換為交付量、客戶、盈利等硬指標,“第一”通脹會自然消散,踏實推進落地的企業(yè)才是行業(yè)真正的核心力量。
人均第一,具身智能榜單能信嗎?
2026-07-21 09:00

人均第一,具身智能榜單能信嗎?

本文來自微信公眾號: 定焦One ,作者:定焦One團隊,編輯:魏佳


刷題、話術(shù)包裝、資源置換。


定焦One(dingjiaoone)原創(chuàng)


具身智能賽道持續(xù)吸引資本目光的同時,各類相關(guān)榜單也越來越多。當“第一”幾乎成為各家標配時,榜單還有可信度嗎?


一個多月前,千尋智能就經(jīng)歷了尷尬時刻。6月初,其具身基座模型Spirit v1.6在RoboArena榜單上以1918分的成績超過了英偉達Cosmos3的1880分,一度位居“世界第一”;緊接著,千尋宣布完成15億元A+輪融資,三個月內(nèi)累計完成四輪密集融資,總額接近50億元,創(chuàng)下具身智能賽道的融資頻率新高。


不過,業(yè)內(nèi)對評測數(shù)據(jù)的質(zhì)疑幾乎從次日就開始升溫。有觀察者指出,在310次評測記錄中,有72%的分數(shù)來自兩個賬號。更值得關(guān)注的是,RoboArena官方隨后發(fā)布聲明,經(jīng)回溯調(diào)查后移除了部分存疑的評測數(shù)據(jù),并更新了榜單排名。Spirit v1.6也隨之從榜單上除名。


但這一事件并未澆滅玩家們的熱情,翻開近半年的行業(yè)新聞,星動紀元、原力靈機、極佳視界、智元、跨維、鹿明……幾乎每一家頭部公司手里都攥著一個“第一”,且這些“第一”維度各不相同。


這一景象或許不難理解,具身智能目前技術(shù)路線還沒統(tǒng)一、真機成功率大多卡在五六成,外界想判斷一家公司到底行不行,很大程度上只能依賴榜單??僧敯l(fā)榜的既有高校、機構(gòu)也有媒體,各家標準各不相同、有的還牽扯商單和利益關(guān)系時,榜單本身還能不能當尺子用,就成了一個問題。


一位關(guān)注具身賽道的投資人坦言,榜單更偏市場行為,最多算投資決策的一個參考,他對于千尋這件事并不吃驚。在他看來,真正在意名次的,往往不是以財務或技術(shù)為出發(fā)點的機構(gòu),而是一些地方引導基金或偏國資的資金,一個“第一”,可能正是他們“寫在報告里一個比較好的入口”。但也有投資人持不同看法,他們認為在技術(shù)門檻高、信息不對稱的早期賽道,榜單至少提供了一個橫向比較的起點。


當“第一”的數(shù)量比認真做機器人的公司還多時,這些榜單到底是在測技術(shù),還是在測講故事的能力?哪些榜單還值得看?


01.技術(shù)路線還沒統(tǒng)一,先人手一個“第一”


我們先來盤一盤目前市面上的榜單,建立一個大致印象。據(jù)不完全統(tǒng)計,目前具身智能的活躍榜單高達20余個。按評測內(nèi)容,這些榜單大致可以分成三類。



VLA操作綜合榜,考察機器人能不能真干活,跑的是任務成功率,代表榜單是RoboChallenge Table30、MolmoSpaces;


世界模型榜,考的是腦內(nèi)推演對不對,考察模型對物理世界的推演,不考機器人手腳利不利索,代表是World Arena和WorldModelBench;


專項基準榜,考察“極端情況下會不會露餡”,針對單點極端能力,比如雙臂協(xié)同、仿真到真機遷移,代表是RoboTwin 2.0、SimplerEnv、LIBERO和CALVIN。它的價值在于,在綜合榜照不到的極端場景里,把模型的短板逼出來。


需要說明的是,這三類榜單各有側(cè)重、互不替代。真機榜測執(zhí)行、世界模型榜測推演、專項榜測邊界,沒有任何一個能覆蓋具身智能的全部能力。


有了這層坐標,近半年具身基座模型的戰(zhàn)報就能對號入座。如果把近兩個月具身基座模型的戰(zhàn)報匯總,可以得到一份相當壯觀的名單。


今年5月,星動紀元Era0宣稱拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨維DSCFuncWorld是World Arena Track2第一。進入6月,千尋Spirit v1.6拿下RoboArena第一(后被除名),鹿明Prime R0登頂MolmoSpaces。幾乎每一家都是第一,而且都有具體榜單排名作背書。


而亂象,也是從各種榜單開始的。


最明顯的是,榜首像流水席,“第一名”更換頻繁。


RoboChallenge Table30的榜首,過去半年里至少換了四次:先是千尋Spirit v1.5以50.33%的成功率刷新紀錄,很快又被極佳視界GigaBrain-0.1、美國波士頓動力Atlas、星動紀元Era0先后超越。


這個速度,比大語言模型的主流榜單更新快得多。2023年到2025年,GPT-4、Claude 3、Gemini 1.5在MMLU、GSM8K等榜單上的榜首位置,通常能守數(shù)月甚至一年,即便是2020年到2022年的高速迭代期,GPT-3、PaLM也是以月為換榜周期?!爱斚碌木呱碇悄埽瑔蝹€模型能霸榜一周就算不容易。”一家頭部具身智能公司的從業(yè)者米范表示。


其將主要原因歸結(jié)為兩點。一是物理世界的隨機性,同一個模型在真機上跑兩次,成功率差三到五個百分點很正常,光照、物體位置、機械臂公差都會影響結(jié)果,而MMLU這類大語言模型榜單是固定題目、確定性判分,同一模型跑一百次分數(shù)幾乎不變。二是測試任務的公開程度,像RoboChallenge的Table30,30項任務分布是公開的,各家可以照著任務專門采數(shù)據(jù)、微調(diào)模型再提交,榜首的“保質(zhì)期”于是被壓到了以周計。


更讓人迷惑的,是同一個榜里會同時冒出好幾個“第一”。


World Arena就是典型,智元GE-Sim 2.0、跨維DSCFuncWorld對外都稱自己“登頂World Arena”,但事實是,這個榜單含有多條賽道,智元GE-Sim 2.0在Track1(感知與動作響應)以68.26分排第一,跨維DSCFuncWorld在Track2(數(shù)據(jù)引擎)排第一?!暗谝弧狈謱俨煌瑐€子榜,對外卻被統(tǒng)一寫成了同一句話。


對不熟悉賽道劃分的讀者來說,兩家并列的“World Arena第一”的說法幾乎無法分辨,甚至會懷疑是不是有人在撒謊,但其實誰都沒說錯,只是不夠精確。


還有一層更模糊的地帶是,榜單性質(zhì)混雜,“第一”的含金量卻被默認成同一檔,容易產(chǎn)生誤導。


一些公司的對外口徑里,經(jīng)常會同時列出“某模型在RoboChallenge排名第一”,和“在某具身智能媒體的測評中也位居第一”。前者是7×24小時真機跑出來的成功率,后者可能只是編輯部閉門討論、甚至商務合作敲定的名單,兩者被并排放進一句話,含金量卻被默認成了同一檔。


其中最模糊的是“產(chǎn)業(yè)榜”,有些榜單頂著“產(chǎn)業(yè)”二字,但既不是真機鎖死的硬榜,也不是學術(shù)機構(gòu)背書的benchmark,而是咨詢公司或媒體合辦的打分榜。類似情況也在大語言模型圈出現(xiàn)過,但隨著學術(shù)榜、商業(yè)測評、媒體榜逐漸分層,“雙料第一”才慢慢被拆掉,而具身智能,眼下正處在那個尚未分層的階段。


三種現(xiàn)象疊加,結(jié)果就是榜單“第一”嚴重通貨膨脹。而且這種通脹不只停留在營銷層面,一個“第一”的頭銜往往能換來關(guān)注度、資源和實打?qū)嵉墓乐狄鐑r。


02.一個“第一”是怎么造出來的?


既然榜單能撬動真金白銀,如何把第一造出來,也形成了“潛規(guī)則”。業(yè)內(nèi)人士介紹,雖然千尋Spirit v1.6屬于極端個例,但行業(yè)里造“第一”的現(xiàn)象并不少,手法大致有三種。


成本最低、也最普遍的一種方式是話術(shù)包裝,“單科第一”成了“總分第一”,核心是省掉關(guān)鍵限定詞。


比如實際拿的是“RoboTwin 2.0雙臂協(xié)同VLA類Clean檔第一”,對外就變成“登頂RoboTwin 2.0”;實際是“LIBERO-Plus場景泛化專項第一”,對外就成了“LIBERO-Plus榜首”。數(shù)據(jù)沒造假、成績也是真的,但“第一”所指代的范圍被人為放大了。


第二種方式是利用“刷題”等方式直接干預結(jié)果。


一條是“照著考題練”。榜單公開的任務分布、評分標準、環(huán)境參數(shù),都可以拿來做定向后訓練,在一些任務相對固定的榜上尤其明顯,各家可以通過反復“刷題”、過擬合到特定場景換來高分。


米范表示,具身領(lǐng)域的部分榜單的測試任務是公開的,各家可以針對這些任務專門采集數(shù)據(jù)、微調(diào)模型后再提交,這在具身圈被視為正常迭代,不算作弊,和LLM領(lǐng)域的“數(shù)據(jù)泄露、數(shù)據(jù)污染”有本質(zhì)區(qū)別。


另一條是鉆評測機制的漏洞。有些榜權(quán)威性很高,機制卻有空子可鉆。比如RoboArena采用開放注冊、分布式評測,本意是讓更多人參與,卻留下了三個空子。


圖源/RoboArena官網(wǎng)


一是評測者身份無門檻。任何人都能注冊當裁判,短期內(nèi)大量新賬號集中評測同一個模型,就能把它的Elo分數(shù)快速推高;


二是匹配不強制全覆蓋,隨機分配對手不等于必須跟同期在榜者都打一輪,評測者領(lǐng)任務時,A是固定的,B是從分數(shù)相近的模型里隨機抽,樣本不夠大時兩個模型完全可能一次都排不上。比如Spiritv1.6早期與DreamZero交手,23場后停戰(zhàn),與5月30日入榜的英偉達Cosmos3-Nano-Policy為零對戰(zhàn);


三是集中刷評,用多個賬號密集評測自家模型,把負面記錄降低。比如Spirit v1.6的310次評測記錄中,72%的分數(shù)來自于ECUST和Robotics Lab兩個賬號,它們用224場評測刷出97%勝率,把Spirit v1.6推上第一,但英偉達用同樣條件自測21次,勝率0%,兩組數(shù)據(jù)擺在一起,直接讓從業(yè)者產(chǎn)生懷疑。


事后,RoboArena補了規(guī)則:評測者必須是無利益關(guān)聯(lián)的第三方,堵住自刷賬號的入口,評測完成率低于20%的賬號標為可疑,堵住選擇性匹配。而處理后,千尋跌出榜單。


還有一種方式最隱蔽也最泛濫,是資源置換,把榜單直接做成生意。


不少媒體榜評選標準并不透明,有的干脆與被評對象存在商務合作,雙方聯(lián)合發(fā)一份“權(quán)威報告”,把媒體榜和學術(shù)benchmark并排包裝。它不涉及技術(shù),也不涉及數(shù)據(jù),只涉及預算和關(guān)系。不止一位從業(yè)者表示,刷榜、買榜等現(xiàn)象并不少見。


這三種手法往往疊加,先靠針對性訓練或鉆空子把分數(shù)刷上去,再用賽道偷換掩蓋來源,最后用話術(shù)對外傳播,必要時再買個媒體榜背書。層層包裝之下,“第一”就成了。


這些手法在行業(yè)內(nèi)部并不是秘密。真正的問題在于,看穿它們需要一定的技術(shù)功底,技術(shù)越復雜,外行越難分辨,故事就越容易講。


03.去掉水分,還該信什么?


不止一位具身智能從業(yè)者坦言,他們當下已經(jīng)不太關(guān)注榜單排名了,因為榜單能刷、能買,即便一切合規(guī),物理環(huán)境的復雜性也讓數(shù)據(jù)很難做到百分百準確。


更深一層的問題是,這個行業(yè)目前還沒有一把“通用的尺子”。


具身智能從業(yè)者gashero用“炒雞蛋”和“拌涼菜”打了一個比方:機器人A擅長炒雞蛋、成功率90%,機器人B擅長拌涼菜、成功率85%,但不能就此說A比B強。炒雞蛋考驗抓取和翻鍋,拌涼菜考驗精準倒料和攪拌,兩件事技能不同、難度不同、評價標準也不同。當下的具身智能賽道還沒有一個統(tǒng)一標準,能把“炒雞蛋的能力”和“拌涼菜的能力”折算進同一個打分體系里。


不過,這不代表榜單一無是處。從業(yè)者普遍認為,榜單仍有其參考價值,關(guān)鍵在于知道什么值得看,以及看完之后還該看什么。


圖源/RoboChallenge官網(wǎng)


綜合業(yè)內(nèi)共識,真正可信的榜單,大體同時具備三個特征。


一是分項透明,不是只甩一個“第一”。


不論綜合榜還是專項榜,可信的做法都是把細項一一拆開。以RoboChallenge Table30為例,它測的是30項日常任務的綜合成功率,可信之處在于,不僅告訴讀者64.33%這個綜合數(shù)字,還讓讀者看到30項里哪幾項做得好、哪幾項掉鏈子。只報總分、不報細項的榜,價值要大打折扣。


二是評測由第三方掌控,且有反刷題設(shè)計。


MolmoSpaces不允許微調(diào),模型直接“裸考”;LIBERO-Plus則加了光照突變、背景雜亂、相機角度變化等極端擾動,專門防止靠死記硬背拿分。它們的共同特點,是讓刷題變難,讓泛化成為真正的門檻。


三是看評測機制,而不是看更新頻率。


更新慢的榜單不一定可靠,更新快的榜單也不一定可刷。有些榜更新慢,可能因為真機評測成本極高,比如RoboChallenge一次完整評測周期可能要數(shù)周,30項任務每項跑10次,一共300次真機嘗試,7×24小時連續(xù)運行,這是物理世界的成本約束。而有些榜更新快,則是機制設(shè)計。比如RoboArena采用了Elo評分系統(tǒng)進行動態(tài)排名,每天都有新對戰(zhàn)數(shù)據(jù)進來,排名自然每天更新。這種快本身不是問題,它的可信度取決于機制是否嚴密、漏洞是否被補上。


但是,既然圈內(nèi)都知道榜單有水分,為什么大家還在拼命刷?


答案在于行業(yè)當下的階段。


眼下這場“第一”的爭奪戰(zhàn),本質(zhì)上是資本焦慮的產(chǎn)物。今年是具身基座模型密集迭代的一年,早期賽道出貨量、營收、訂單量都不穩(wěn)定,只能拿榜單頂上。融資導向的階段沒變,刷榜這件事就不會停。


當行業(yè)進入下一階段,評判的標尺會自然切換,例如每年交付多少臺、有哪些固定客戶、是否能盈利。到那時候,“第一”的通貨膨脹會自然消散,榜單也會退回它本該在的位置。


或許,那些不忙著刷榜、只顧著把機器人送進產(chǎn)線的公司,才是行業(yè)真正的答案。


*題圖由「定焦One」拍攝。應受訪者要求,文中米范為化名。

AI創(chuàng)投日報頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
南江县| 泗洪县| 齐河县| 闻喜县| 雅安市| 静安区| 镇平县| 咸丰县| 丹寨县| 武穴市| 兴化市| 赞皇县| 江源县| 彭阳县| 上饶市| 常德市| 朝阳市| 伽师县| 清丰县| 桦南县| 乐安县| 平顺县| 永州市| 潞城市| 印江| 苗栗县| 鄂托克前旗| 喀喇沁旗| 府谷县| 六盘水市| 会同县| 固阳县| 眉山市| 怀来县| 龙口市| 泸水县| 磴口县| 会同县| 略阳县| 梁山县| 罗平县|