久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文拆解大模型榜單失真的原因,教大眾根據(jù)自身需求理性看待、正確參考榜單,找到適配的大模型。 ## 1. 大模型榜單的生成機(jī)制 大模型榜單基于基準(zhǔn)測(cè)試結(jié)果生成,主要分兩類:一類是類似高考的離線測(cè)試,有固定公開題庫和標(biāo)準(zhǔn)答案,可量化橫向?qū)Ρ?,但易被提前“背題”;另一類是類似選秀的在線競(jìng)技場(chǎng)測(cè)試,無固定題目,靠用戶投票排名,貼近真實(shí)體驗(yàn),但易受用戶主觀偏好影響。 出題方分為學(xué)術(shù)型(專業(yè)但更新慢)、廠商型(貼近場(chǎng)景但客觀性存疑)、第三方獨(dú)立型(立場(chǎng)中立但規(guī)則透明度有限)三類,不同榜單側(cè)重考察不同能力,可按需求對(duì)號(hào)入座。 ## 2. 當(dāng)前大模型榜單普遍存在失真問題 一是分?jǐn)?shù)通脹:主流基準(zhǔn)測(cè)試難度跟不上模型進(jìn)化速度,頭部模型集體趨近滿分,如GSM8K、MMLU已難以區(qū)分模型真實(shí)差距。 二是刷榜成行業(yè)潛規(guī)則:公開題庫允許廠商針對(duì)性訓(xùn)練,包括用原題/改編題訓(xùn)練、拆解考點(diǎn)做專項(xiàng)訓(xùn)練兩種常見方式。Meta曾將專門優(yōu)化的實(shí)驗(yàn)版Llama 4 Maverick送測(cè),拿到LMArena第二名,開源到用戶手里版本排名跌到32位,開啟風(fēng)格過濾后排名也跌到第5。 三是考題與真實(shí)場(chǎng)景脫節(jié):榜單側(cè)重標(biāo)準(zhǔn)化知識(shí)考核,用戶真實(shí)需求更復(fù)雜多元,高分模型實(shí)際體驗(yàn)往往落差較大;部分榜單存在公信力爭(zhēng)議,存在商業(yè)化“野榜”或利益關(guān)聯(lián)影響客觀性的情況。 ## 3. 理性看榜的核心方法 沒有任何一款大模型能包攬所有榜單第一,廠商通常只展示自身優(yōu)勢(shì)賽道的成績(jī),單一榜單名次參考價(jià)值有限,尤其是分?jǐn)?shù)相近的模型排名幾乎無意義。 判斷榜單可信度先看兩點(diǎn):一是出身,優(yōu)先選規(guī)則、流程公開透明的榜單,避開評(píng)測(cè)不透明的商業(yè)化野榜;二是題庫新鮮度,避開頭部模型普遍接近滿分、區(qū)分度不足的舊題庫。 看榜要遵循**多個(gè)來源、多個(gè)維度、動(dòng)態(tài)觀察**的原則,先明確自身需求找對(duì)應(yīng)細(xì)分領(lǐng)域榜單,再用不同出處的榜單交叉驗(yàn)證。 ## 4. 驗(yàn)證模型實(shí)用性的正確方式 榜單僅能提供初篩參考,最終判斷要靠真實(shí)場(chǎng)景測(cè)試:專業(yè)從業(yè)者可初篩后,針對(duì)自身業(yè)務(wù)定制測(cè)試集,將候選模型放在真實(shí)業(yè)務(wù)中并行測(cè)試對(duì)比效果。 普通用戶可先拿自己日常常用的任務(wù)(如寫周報(bào)、整理資料)讓不同模型輸出,橫向?qū)Ρ冉Y(jié)果,也可參考科技媒體的第三方測(cè)評(píng),無需過度糾結(jié)榜單排名。
大模型榜單,能不能信?
2026-06-26 21:46

大模型榜單,能不能信?

本文來自微信公眾號(hào):AIX財(cái)經(jīng),作者:雷晶,編輯:金玙璠,題圖來自:AI生成


大模型行業(yè)有一條潛規(guī)則:發(fā)布會(huì)可以遲到,但榜單戰(zhàn)報(bào)絕不能缺席。一張漂亮的成績(jī)單,已經(jīng)成了新模型的標(biāo)配。但這張成績(jī)單,到底有多少含金量?


去年4月,Meta發(fā)布Llama 4 Maverick模型,在LMArena(原Chatbot Arena)盲測(cè)榜單上以1417分的ELO沖到第二名,僅次于Gemini 2.5 Pro。但很快,學(xué)術(shù)圈一篇題為The Leaderboard Illusion的論文揭開了內(nèi)幕:Meta在發(fā)布前私下測(cè)試了至少27個(gè)模型變體,只公布了表現(xiàn)最好的那個(gè)。真正交到開發(fā)者手里的開源版本,排名從第2跌到了第32。更諷刺的是,Meta提交的“Llama-4-Maverick-03-26-Experimental”本身就是一個(gè)為對(duì)話風(fēng)格專門優(yōu)化的實(shí)驗(yàn)版本,回答冗長(zhǎng)、堆砌表情符號(hào),當(dāng)LMArena開啟“風(fēng)格控制”過濾后,它直接從第2名跌到了第5名。


這并非孤例。類似的“登頂”“屠榜”消息,幾乎每隔幾周就刷一輪。今年5月,阿里通義千問Qwen 3.7-Max沖上全球編程盲測(cè)榜單Code Arena第二,在國(guó)產(chǎn)模型中排名最靠前;6月,階躍星辰Step 3.7 Flash模型登上Artificial Analysis榜單輸出速度第一,達(dá)到409 tokens/s,其他速度相關(guān)指標(biāo)也排在前列。模型發(fā)布必配榜單戰(zhàn)報(bào),已經(jīng)是固定動(dòng)作。


榜單本應(yīng)是用戶挑選模型最直接的參考,但問題是,榜單排名的可信度正在受到質(zhì)疑。


一個(gè)模型的推出,往往伴隨著“榜單前幾”“能力接近海外頭部模型水平”這類話術(shù)來背書,用戶的實(shí)際感受卻是:各家模型的分?jǐn)?shù)越來越高,“誰更好用”這個(gè)問題反而越來越模糊。


模型榜單還有參考價(jià)值嗎?一個(gè)模型好不好用,到底該怎么判斷?


一、一張榜單是如何誕生的?


我們先來看看模型的排名是怎么來的。


排名來自“考試”。業(yè)內(nèi)把評(píng)估模型性能的測(cè)試稱為基準(zhǔn)測(cè)試(Benchmark),這是一套標(biāo)準(zhǔn)化的考題,由學(xué)術(shù)機(jī)構(gòu)、廠商甚至個(gè)人設(shè)計(jì),用固定的題目和評(píng)分標(biāo)準(zhǔn)來檢驗(yàn)?zāi)P驮谔囟ㄈ蝿?wù)上的表現(xiàn)。模型做完測(cè)試、拿到分?jǐn)?shù),再按分?jǐn)?shù)高低排出位次,就是廣義上的榜單。


目前的基準(zhǔn)測(cè)試大致可分為兩種:


一種是離線測(cè)試,有一套固定題庫,模型作答,系統(tǒng)按標(biāo)準(zhǔn)答案打分。MMLU、GPQA、HumanEval等,走的都是這條路線。這種方式最大的優(yōu)勢(shì)是可量化、可橫向比較。但題庫會(huì)公開,這也意味著廠商可以提前“背題”。


另一種是在線測(cè)試,通常被稱為Arena(競(jìng)技場(chǎng))。沒有固定題目,也沒有標(biāo)準(zhǔn)答案。用戶提交一個(gè)問題,系統(tǒng)將它同時(shí)發(fā)給兩個(gè)匿名模型,用戶對(duì)比回答后投票選出更好的那個(gè),平臺(tái)再將投票結(jié)果轉(zhuǎn)化為動(dòng)態(tài)排名。


LMArena就是這個(gè)賽道上的主流玩家,由加州大學(xué)伯克利分校等機(jī)構(gòu)發(fā)起的LMSYS組織創(chuàng)建,多個(gè)廠商直接引用其排名作為模型能力的背書。它最大的優(yōu)勢(shì)是貼近真實(shí)使用感受,但局限也很明顯:用戶評(píng)判帶有主觀偏好,曾有研究顯示,用戶會(huì)傾向于選擇篇幅更長(zhǎng)、“看上去更專業(yè)”的回答。


某美企AI出海負(fù)責(zé)人曾小健提到,在中文語境中,榜單和基準(zhǔn)測(cè)試經(jīng)常被混為一談,很多業(yè)內(nèi)人士也不刻意區(qū)分。日常交流中這樣說問題不大,但嚴(yán)格來說,兩者是有差異的:基準(zhǔn)測(cè)試指的是一套評(píng)測(cè)任務(wù),回答的是“怎么測(cè)”的問題;而榜單是基于測(cè)試結(jié)果生成的排名,解決的是“怎么排”的問題,且有些榜單還會(huì)實(shí)時(shí)或近實(shí)時(shí)更新,并引入用戶投票、模型對(duì)戰(zhàn)等機(jī)制。


簡(jiǎn)單總結(jié),離線測(cè)試像高考,有標(biāo)準(zhǔn)答案;在線測(cè)試像選秀,靠觀眾投票。在本文中我們不嚴(yán)格區(qū)分這兩個(gè)概念,但理解“固定考試”和“實(shí)時(shí)擂臺(tái)”這兩種機(jī)制的差異,有助于看懂排名的意義。


搞清楚怎么考,還得知道誰是出題方。當(dāng)前的離線基準(zhǔn)測(cè)試按來源大致分為三類:


一類是學(xué)術(shù)型,題庫由高?;蜓芯繖C(jī)構(gòu)設(shè)計(jì),如MMLU、GSM8K等,專業(yè)性更強(qiáng),但更新較慢,部分已趨于飽和。


第二類是廠商型,題庫由模型公司自行發(fā)布,如OpenAI的HumanEval(代碼能力測(cè)試),更貼近實(shí)際應(yīng)用場(chǎng)景,但出題方本身也是參賽者,客觀性存疑。


第三類是第三方獨(dú)立型,由獨(dú)立機(jī)構(gòu)出題運(yùn)營(yíng),也由它們通過整合多個(gè)維度的評(píng)測(cè)數(shù)據(jù)、按權(quán)重生成綜合評(píng)分,如SuperCLUE、LiveBench等。這類測(cè)試立場(chǎng)相對(duì)中立,但權(quán)重設(shè)置、評(píng)分規(guī)則仍由平臺(tái)自行把控,透明度有限。


知道了怎么考、誰出問題了,還要知道這些榜單考察的是什么能力。


離線答題側(cè)重學(xué)科知識(shí)與基礎(chǔ)推理,競(jìng)技場(chǎng)盲測(cè)側(cè)重對(duì)話體驗(yàn)與人類偏好。為了方便理解,我們將主流榜單按類型和考察能力做了梳理。



可以看出,想知道模型編碼能力強(qiáng)不強(qiáng)可以看LiveCodeBench、SWE-bench verifed等;想了解推理能力強(qiáng)不強(qiáng)可以看HLE、MMMU等;想看看智能體能力則可以看看GAIA、TerminalBench 2.0等榜單。這些也是目前國(guó)內(nèi)大模型廠商發(fā)布模型時(shí)最常引用的榜單。


也就是說,選模型的時(shí)候,可以先根據(jù)自己關(guān)心的能力“對(duì)號(hào)入座”。


二、模型榜單也會(huì)失真


大模型榜單,本是用戶挑選模型最直接的參考,但越來越多人發(fā)現(xiàn),高分選手用起來不一定如預(yù)期。


第一個(gè)問題是分?jǐn)?shù)通脹。隨著模型能力快速迭代,主流基準(zhǔn)測(cè)試的“試卷”難度已跟不上模型進(jìn)化速度,在部分測(cè)試中,頭部模型的成績(jī)集體趨近滿分,這樣就很難看出真實(shí)差距。


北京理工大學(xué)博士生李巖舉例,典型的數(shù)學(xué)應(yīng)用問題基準(zhǔn)GSM8K,兩三年前還是衡量模型推理能力的重要標(biāo)準(zhǔn),現(xiàn)在幾乎所有主流模型都能拿到高分,它也就失去了篩選的作用。另一個(gè)典型是MMLU,頂級(jí)模型的準(zhǔn)確率早已突破90%,趨于飽和。


第二個(gè)問題是刷榜成行業(yè)潛規(guī)則。目前主流榜單如MMLU、C-Eval等,測(cè)試題目與標(biāo)準(zhǔn)答案大多公開,廠商可以獲取到公開的考卷并進(jìn)行針對(duì)性訓(xùn)練。


李巖提到,行業(yè)內(nèi)的刷榜主要分兩種:一是用原題或高相似度的改編題訓(xùn)練,要么對(duì)標(biāo)測(cè)試原題,要么簡(jiǎn)單修改數(shù)據(jù)參數(shù),模型相當(dāng)于“背題考試”;二是考點(diǎn)拆解專項(xiàng)訓(xùn)練,不使用原題,而是拆解試題核心知識(shí)點(diǎn),合成同類數(shù)據(jù)訓(xùn)練,類似“刷模擬卷”。


第三個(gè)問題是考題與真實(shí)使用場(chǎng)景脫節(jié)。當(dāng)前榜單多為標(biāo)準(zhǔn)化試題,側(cè)重知識(shí)記憶與標(biāo)準(zhǔn)答案匹配,但用戶的真實(shí)需求遠(yuǎn)比考題復(fù)雜。大模型從業(yè)者陳楚提到,模型訓(xùn)練時(shí)都會(huì)以榜單高分為目標(biāo),但高分不意味著會(huì)做事。在實(shí)際業(yè)務(wù)中,問題不一定有唯一的標(biāo)準(zhǔn)答案,場(chǎng)景也更多元,一個(gè)模型是否好用很難單一通過“考試成績(jī)”評(píng)判。


曾小健打了個(gè)比方,榜單相當(dāng)于溫度計(jì),刷榜相當(dāng)于在溫度計(jì)旁邊擺了一個(gè)火爐,測(cè)的實(shí)際是火爐的溫度,但用戶感受到的是整個(gè)房間的體感溫度,顯然不會(huì)那么高。榜單測(cè)的是一個(gè)點(diǎn),用戶感受的是整個(gè)場(chǎng)景,自然差異落差。


這三個(gè)問題疊加在一起,就解釋了為什么榜單上的“優(yōu)等生”,到了真實(shí)環(huán)境里可能“水土不服”。


再加上,榜單的公信力也曾有過爭(zhēng)議。國(guó)內(nèi)第三方評(píng)測(cè)機(jī)構(gòu)SuperCLUE在2023年5月發(fā)布的評(píng)測(cè)榜單中,將科大訊飛的星火大模型排在第四位,僅次于Anthropic和OpenAI的兩個(gè)版本的模型。后被網(wǎng)友發(fā)現(xiàn),它的官網(wǎng)顯示的顧問排名第一位的是哈工大訊飛聯(lián)合實(shí)驗(yàn)室的研究員,榜單成績(jī)客觀性存疑。


所以看榜之前,需要會(huì)判斷一張榜單是否可信。重點(diǎn)來看兩個(gè)方面:一是出身,測(cè)試套件是否公開透明、是否由模型廠商或盈利機(jī)構(gòu)自行把控。曾小健提到,市面上存在不少“野榜”,有些評(píng)測(cè)機(jī)構(gòu)本身帶有商業(yè)化屬性,靠出榜單、寫軟文變現(xiàn),評(píng)測(cè)方法不透明,樣本和流程也不公開,聲稱某些模型表現(xiàn)更好,卻拿不出令人信服的依據(jù)。


二是題庫的新鮮度,如果主流模型分?jǐn)?shù)普遍趨近滿分,說明這份試卷已經(jīng)飽和,區(qū)分度有限。李巖認(rèn)為,隨著舊數(shù)據(jù)集逐漸失效,學(xué)術(shù)界也在不斷推出更高難度的測(cè)評(píng)集,榜單自身的迭代同樣在倒逼模型突破能力瓶頸。


三、什么才是好用的模型?


隨著大模型走向商業(yè)落地,榜單排名牽動(dòng)的利益鏈條只會(huì)更長(zhǎng),圍繞榜單的爭(zhēng)議也不會(huì)停止,那就不僅要會(huì)“看”榜單,還要能理解榜單呈現(xiàn)的信息。


當(dāng)前主流基準(zhǔn)測(cè)試已細(xì)分出數(shù)學(xué)推理、代碼生成、知識(shí)問答、長(zhǎng)文本理解等多個(gè)維度,一個(gè)在代碼榜單上領(lǐng)先的模型,未必擅長(zhǎng)寫營(yíng)銷文案;一個(gè)知識(shí)問答表現(xiàn)優(yōu)異的模型,處理長(zhǎng)文檔可能力不從心。


這里我們也根據(jù)主流榜單官網(wǎng)展示的數(shù)據(jù),梳理了一些模型排名情況。需要提醒的是,榜單上的數(shù)據(jù)更新有延遲,且隨時(shí)可能有變,目前截取的是截至發(fā)稿的情況,供大家參考。



可以看出,Google的Gemini系列是目前覆蓋面最廣的“全能型選手”;OpenAI和Anthropic各有優(yōu)勢(shì),OpenAI的模型推理能力更強(qiáng)、而Anthropic則更擅長(zhǎng)任務(wù)語言理解。


國(guó)內(nèi)廠商則在特定賽道上占有一定優(yōu)勢(shì)。其中,DeepSeek的V3.2 Speciale和智譜的GLM-4.7均躋身LiveCodeBench編碼能力榜前五;MiniMax的M3模型進(jìn)入了GPQA Diamond推理榜;而在視頻和圖像生成領(lǐng)域,字節(jié)跳動(dòng)的 Seedance 2.0、阿里巴巴的HappyHorse1.0、快手的Kling 3.0等國(guó)產(chǎn)模型已經(jīng)成為主力玩家。


更明顯的一個(gè)趨勢(shì)是,沒有一個(gè)模型能夠贏下所有榜單。如果關(guān)注各家廠商的技術(shù)報(bào)告或發(fā)布會(huì),會(huì)發(fā)現(xiàn)一個(gè)規(guī)律:模型在哪個(gè)方向有突破,就重點(diǎn)展示對(duì)應(yīng)的榜單成績(jī),有些廠商還會(huì)在一個(gè)綜合榜單上單獨(dú)拎出自己領(lǐng)先的幾個(gè)子項(xiàng),用局部?jī)?yōu)勢(shì)來佐證整體實(shí)力。


這也提醒我們,不要只看單一榜單的名次,尤其當(dāng)兩款模型分?jǐn)?shù)區(qū)間相近時(shí),排名先后幾乎沒有實(shí)際參考價(jià)值。與此同時(shí),場(chǎng)景不同,對(duì)“好模型”的定義也完全不同,所以要先明確自己的需求,再去找對(duì)應(yīng)領(lǐng)域的榜單,而不是盯著一張綜合排行看總分。


所以,看榜單的核心原則就是:多個(gè)來源、多個(gè)維度、動(dòng)態(tài)觀察。選幾個(gè)不同出處、不同題庫的榜單交叉驗(yàn)證,如果結(jié)論一致,才更可信。


除了看榜單,該如何判斷一個(gè)模型好不好用?


陳楚認(rèn)為,評(píng)估一個(gè)模型不能只看準(zhǔn)確性,還要看它面對(duì)意外輸入會(huì)不會(huì)犯錯(cuò)、在陌生任務(wù)上表現(xiàn)是否穩(wěn)定、推理速度和資源消耗是否可接受。


他的做法是先看榜單進(jìn)行初篩,再根據(jù)自己的使用需求定制相應(yīng)的基準(zhǔn)測(cè)試,把新舊模型放在真實(shí)環(huán)境里并行跑一段時(shí)間,看實(shí)際效果差異。


對(duì)于普通用戶來說,不需要這么復(fù)雜,但邏輯是類似的。李巖建議,可以挑幾個(gè)自己日常工作中反復(fù)出現(xiàn)的任務(wù),如做PPT、寫周報(bào)、整理資料等,分別讓不同模型跑一遍,并把結(jié)果做橫向?qū)Ρ取4送?,關(guān)注各種科技媒體的測(cè)評(píng)也是一個(gè)低成本的參考方式。


曾小健則認(rèn)為普通用戶不需要過度研究榜單,按照個(gè)人習(xí)慣和實(shí)際體驗(yàn)使用即可。但對(duì)專業(yè)從業(yè)者,他反復(fù)強(qiáng)調(diào)真實(shí)測(cè)試的重要性,在他看來,榜單只能提供有限參考,更多判斷要靠實(shí)際業(yè)務(wù)場(chǎng)景中的測(cè)試來驗(yàn)證。


模型能不能干好活,還得上手試。先縮小候選范圍,再把模型放到自己的業(yè)務(wù)場(chǎng)景中跑任務(wù),看它表現(xiàn)如何,這是當(dāng)前業(yè)內(nèi)的一種共識(shí)。


(應(yīng)受訪者要求,文中李巖、陳楚為化名。)


本文來自微信公眾號(hào):AIX財(cái)經(jīng),作者:雷晶,編輯:金玙璠

AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如對(duì)本稿件有異議或投訴,請(qǐng)聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
浦江县| 苏州市| 寿宁县| 墨竹工卡县| 曲麻莱县| 宁南县| 新晃| 鸡泽县| 蛟河市| 绍兴市| 无锡市| 靖宇县| 张家口市| 饶阳县| 太保市| 沾益县| 博湖县| 英山县| 伊春市| 仲巴县| 聂荣县| 乌兰浩特市| 福清市| 河曲县| 桐柏县| 宣武区| 邳州市| 南雄市| 普兰县| 沙河市| 萍乡市| 鹤峰县| 叶城县| 齐齐哈尔市| 中西区| 法库县| 南京市| 枣庄市| 三亚市| 拉萨市| 盐津县|