久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文實(shí)測Grok 4.5與Claude Opus 4.8的智能體能力,對(duì)比兩者表現(xiàn),分析Grok對(duì)大模型競爭格局的影響。 ## 1. 測評(píng)開場的“誤刪文件”插曲 測評(píng)要求兩個(gè)智能體分別在桌面創(chuàng)建文件夾保存結(jié)果,Claude Code建好文件夾后,Grok Build誤將同名文件夾認(rèn)作半成品,刪除了Claude的已有內(nèi)容并致歉。 這一插曲暴露出:對(duì)于可讀寫真實(shí)文件系統(tǒng)的自主智能體,操作前確認(rèn)對(duì)象歸屬是核心安全能力。 ## 2. 五項(xiàng)實(shí)測對(duì)決結(jié)果 本次測評(píng)從5個(gè)維度對(duì)比兩個(gè)模型的實(shí)際生產(chǎn)能力: 1. **網(wǎng)頁摸魚計(jì)時(shí)器:難分伯仲**:Grok視覺精致度略優(yōu),Claude在音效反饋、快捷預(yù)設(shè)和趣味文案更出色。 2. **網(wǎng)頁摸魚小游戲:Grok勝出**:Grok代碼量約為Claude的三倍,功能更豐富,有明確關(guān)卡和難度分級(jí);Claude版本的控制角色無法正常交互,體驗(yàn)較差。 3. **新能源車主題PPT:打成平手**:兩者都滿足用原生圖形繪制產(chǎn)業(yè)鏈、標(biāo)注不確定數(shù)據(jù)的要求,框架完整、專業(yè)度基本持平。 4. **400頁SpaceX招股書解讀:無硬傷,各有優(yōu)勢**:核心結(jié)論全部正確,Grok的頁碼引用和數(shù)字標(biāo)注更細(xì)致,Claude的口徑辨析和解釋更清晰,兩者都未編造數(shù)據(jù)。 5. **經(jīng)典邏輯推理題:全部答對(duì)**:兩者都正確得出“A說真話、B是騙子”的結(jié)論,完整遍歷排除所有可能性,邏輯嚴(yán)謹(jǐn)。 ## 3. 兩款模型的能力與性格畫像 實(shí)測后兩者定位清晰:Claude Code是**穩(wěn)健型工程師**,邊界意識(shí)和安全素養(yǎng)貫穿始終,劣勢是視覺呈現(xiàn)偏保守,內(nèi)容豐富度不足。 Grok表現(xiàn)力更強(qiáng),擅長產(chǎn)出有視覺吸引力的成品,但誤刪事故暴露出其操作邊界和風(fēng)險(xiǎn)控制存在嚴(yán)重短板,沖勁過界。 雙方互評(píng)后一致認(rèn)為,綜合對(duì)決Claude獲勝。 ## 4. Grok 4.5對(duì)大模型格局的影響 Grok 4.5已經(jīng)穩(wěn)定擠進(jìn)大模型第一梯隊(duì):第三方評(píng)測顯示,Grok 4.5綜合智能指數(shù)排第四,編碼智能體得分76分,僅落后Claude體系的Fable 5,與GPT-5.5基本持平。 Grok 4.5價(jià)格優(yōu)勢顯著:API定價(jià)為每百萬輸入tokens 2美元、輸出tokens 6美元,遠(yuǎn)低于Claude Opus 4.8的5美元/25美元,平均編碼任務(wù)成本僅2.49美元,打穿了頂級(jí)工程能力的邊際成本。 Grok生成速度也更快:官方稱每秒生成約80個(gè)tokens,獨(dú)立測試測得約88個(gè)tokens,顯著快于Claude Opus 4.8。 結(jié)論:馬斯克已經(jīng)重回大模型第一牌桌,但Grok 4.5能力突出,風(fēng)險(xiǎn)控制仍待驗(yàn)證,尚未贏下全局,Claude仍是生產(chǎn)環(huán)境更穩(wěn)妥的選擇。
Grok 4.5和Claude 4.8,在我電腦里“打”起來了
2026-07-09 23:26

Grok 4.5和Claude 4.8,在我電腦里“打”起來了

本文來自微信公眾號(hào): AIX財(cái)經(jīng) ,作者:AIX財(cái)經(jīng)團(tuán)隊(duì),編輯:魏佳,原文標(biāo)題:《Grok 4.5和Claude 4.8,在我電腦里“打”起來了》


7月8日,馬斯克高調(diào)發(fā)布Grok 4.5,宣稱其性能已逼近Claude Opus 4.8,同時(shí)速度更快、價(jià)格更低。當(dāng)大模型公司的競爭從參數(shù)、跑分一路打到價(jià)格和智能體,我們也設(shè)計(jì)了5道題,從前端開發(fā)、網(wǎng)頁游戲、PPT制作、長文檔解讀到邏輯推理,考查兩個(gè)模型在真實(shí)電腦環(huán)境中到底能不能干活。


負(fù)責(zé)落地執(zhí)行的,是它們各自的智能體——Claude Code和Grok Build。我們的要求很簡單,分別在桌面上創(chuàng)建文件夾,并將各自的測評(píng)結(jié)果保存進(jìn)去。


這場測評(píng)的結(jié)果,我們決定從一起“案發(fā)現(xiàn)場”講起。事情是這樣的:


Claude Code先接到指令,它在桌面創(chuàng)建了“能力測試”文件夾,并依次完成三個(gè)子目錄。隨后Grok Build也接到指令登場,但它沒有另起爐灶,而是在看到已有同名文件夾后,不僅“占為己用”,更順手將Claude Code已完成的三份目錄徹底抹除。


等到五道題全部做完,Claude Code回頭一看,發(fā)現(xiàn)自己的“家被拆了”,當(dāng)即發(fā)出“控訴”。



“控訴”完,它重建了被刪除的文件,并留下一句:“我不會(huì)擅自刪別人的東西?!?


事后,Grok出具了書面致歉,承認(rèn)三重失誤:未確認(rèn)目錄歸屬、誤將他人成品視作半成品、使用了不可逆的刪除方式。Claude表示接受道歉,但前提是Grok兌現(xiàn)它的三條自我約束——不碰他人目錄、默認(rèn)新建旁路、發(fā)現(xiàn)同名先問歸屬。


這段插曲,不能只當(dāng)作測評(píng)花絮。對(duì)于一個(gè)能讀寫真實(shí)文件系統(tǒng)的自主智能體而言,“動(dòng)手前先弄清這是什么、屬于誰”,本身就是最硬核的能力之一。


回到正題。拋開這起“誤刪事故”,Grok 4.5的答卷確實(shí)令人眼前一亮——在游戲場景等方向上,它甚至顯露出明確優(yōu)勢。下面,我們就從五個(gè)維度來拆解這場既拼智商也拼情商的模型對(duì)決。


01.摸魚計(jì)時(shí)器:Grok贏了顏值,Claude贏了細(xì)節(jié)


考題:做一個(gè)網(wǎng)頁版“打工人摸魚計(jì)時(shí)器”:能設(shè)定下班時(shí)間、實(shí)時(shí)倒計(jì)時(shí),到點(diǎn)自動(dòng)撒花并彈出“下班快跑”,界面好看有動(dòng)畫。做成一個(gè)index.html直接能用。


這道題同時(shí)考察三個(gè)維度:前端工程(能否寫出可運(yùn)行的頁面)、產(chǎn)品交互(按鈕、反饋、視覺是否順手)、時(shí)間邏輯(倒計(jì)時(shí)、時(shí)區(qū)、觸發(fā)時(shí)機(jī))。


難點(diǎn)則藏在“能用”二字背后。倒計(jì)時(shí)必須同步本地時(shí)區(qū),不能差一秒;狀態(tài)機(jī)要在“上班中-即將下班-已下班”之間順滑切換;撒花動(dòng)畫既要喜慶熱鬧,又不能把瀏覽器卡成PPT。最關(guān)鍵的是,最終成品得讓打工人真愿意打開它,而不是一個(gè)僅供演示的半成品。


Claude生成的摸魚計(jì)時(shí)器


Grok生產(chǎn)的摸魚計(jì)時(shí)器


這一題雙方難分伯仲。Grok在視覺精致度上略勝半籌,Claude則在音效反饋、快捷預(yù)設(shè)和趣味文案方面扳回一城。


02.設(shè)計(jì)摸魚游戲:Grok勝,Claude的“打工人”難控制


考題:做一個(gè)網(wǎng)頁小游戲,單個(gè)index.html就能運(yùn)行:


主題:“摸魚大作戰(zhàn)”。


玩法:屏幕上不斷掉落“咖啡”(加分)和“老板”(碰到就游戲結(jié)束),用左右方向鍵移動(dòng)底部的“打工人”接咖啡、躲老板。


要有:實(shí)時(shí)分?jǐn)?shù)、最高分記錄、難度隨時(shí)間加快、游戲結(jié)束彈窗和“再來一局”按鈕,畫面配色可愛、有簡單動(dòng)畫和音效。


做完告訴我怎么運(yùn)行。


這道題的核心考查維度是三個(gè)詞:實(shí)時(shí)交互、狀態(tài)機(jī)、游戲手感,需要做出一個(gè)持續(xù)響應(yīng)玩家輸入、實(shí)時(shí)更新畫面、動(dòng)態(tài)調(diào)整難度的“活”系統(tǒng)。


做這個(gè)游戲,每幀都要精確判斷“咖啡”是否被接住、“老板”是否撞到玩家。而且掉落速度隨時(shí)間平滑遞增,不能太慢讓人覺得無聊,也不能太快直接勸退,這考驗(yàn)的是模型對(duì)“游戲心流”的拿捏。


Claude生成的摸魚小游戲


Grok生成的摸魚小游戲


這題Grok勝。它的代碼量約是Claude的三倍,游戲功能更豐富,而且有明確的關(guān)卡、難度分級(jí)。Claude交付的版本,乍一看也挺像回事,但是底下的“打工人”不能用鼠標(biāo)拖動(dòng),游戲體驗(yàn)感不好。


03 .做新能源車PPT:產(chǎn)業(yè)鏈圖都過關(guān)了,打成平手


考題:做一份5頁P(yáng)PT,主題是“2026上半年中國新能源車市場”。


要求:


1. 直接生成可下載的PPTX文件;如果當(dāng)前環(huán)境不能生成文件,就給出可以復(fù)制到PPT的逐頁內(nèi)容。


2. 第3頁必須用PPT原生圖形畫出“產(chǎn)業(yè)鏈上下游”關(guān)系圖,不能只貼一張圖片。


3. 5頁結(jié)構(gòu):


- 封面


- 市場總覽


- 產(chǎn)業(yè)鏈上下游關(guān)系圖


- 競爭格局


- 結(jié)論與趨勢


4. 配色專業(yè),適合發(fā)布會(huì)。


5. 每頁要有標(biāo)題、正文要點(diǎn)、圖表說明、演講備注。


6. 所有不確定數(shù)據(jù)必須標(biāo)注“需核實(shí)”,不能編造真實(shí)市場數(shù)字。


這道題的核心考查維度可以概括為三個(gè)詞:結(jié)構(gòu)化表達(dá)、版式審美、數(shù)據(jù)紀(jì)律。模型被放到純辦公場景下,需要把復(fù)雜信息梳理成清晰的敘事邏輯,再用專業(yè)的視覺語言呈現(xiàn)出來。


具體來看,搭建產(chǎn)業(yè)鏈關(guān)系圖,考驗(yàn)的是模型對(duì)PPT圖形引擎的操作能力,包括連線、布局、層次和配色的一致性。配色、字體、間距、對(duì)齊,這些細(xì)節(jié)也要經(jīng)得起放大審視,不能有廉價(jià)感。更重要的是要求它們面對(duì)不掌握的真實(shí)數(shù)據(jù),必須坦率標(biāo)注“需核實(shí)”,不能有幻覺。


Claude生成的PPT


Grok生產(chǎn)的PPT


從實(shí)際結(jié)果來看,兩份答卷都滿足了“原生圖形畫產(chǎn)業(yè)鏈、不用圖片”的硬性要求,且均附帶了完整的演講備注,專業(yè)度基本持平。而且在數(shù)據(jù)的使用上,也標(biāo)出了需要核實(shí)的部分。


兩版PPT在框架完整性和交付質(zhì)量上難分高下,這一題雙方再度打成平手。


04.閱讀SpaceX招股書:看完幾百頁,誰都沒編數(shù)字


考題:


我們把近400頁的SpaceX招股書喂給AI,并向雙方提出了四個(gè)精準(zhǔn)的檢索與驗(yàn)證任務(wù):


1、招股書里星鏈(Starlink)業(yè)務(wù)的收入,正文與財(cái)務(wù)報(bào)表附注中的數(shù)字口徑是否一致?附注中是否有特別說明?


2、分別列出2024和2025兩個(gè)財(cái)年的“經(jīng)營活動(dòng)現(xiàn)金流凈額”,并注明這兩個(gè)數(shù)字在文件中的具體位置。


3、在“風(fēng)險(xiǎn)因素”章節(jié)中,找出所有與“馬斯克個(gè)人”直接相關(guān)的風(fēng)險(xiǎn)點(diǎn),逐條列出。


4、招股書是否披露了“星艦單次發(fā)射的具體成本”?如有,請(qǐng)給出并注明出處;如無,請(qǐng)明確回復(fù)“文件中未披露”。


這是最考驗(yàn)準(zhǔn)確度的一道題。難點(diǎn)則遍布在每一個(gè)細(xì)節(jié)中:超長招股書的結(jié)構(gòu)化解析、正文與財(cái)務(wù)報(bào)表附注之間的口徑對(duì)齊、區(qū)分“分部收入”與“品牌收入”的財(cái)務(wù)常識(shí)、絕不編造數(shù)字的職業(yè)紀(jì)律、以及出處(表格編號(hào)/頁碼/附注標(biāo)號(hào))必須精準(zhǔn)可核驗(yàn)的溯源要求。


Claude列舉的與馬斯克的相關(guān)風(fēng)險(xiǎn)點(diǎn)


Grok列舉的與馬斯克相關(guān)風(fēng)險(xiǎn)點(diǎn)


核心事實(shí)層面,兩份答卷完全一致且全部正確。Grok在頁碼級(jí)引用和若干具體數(shù)字上更細(xì),Claude在解釋框架和口徑辨析上更展開,但兩份都沒有硬傷、都沒編數(shù)字。這是最能體現(xiàn)雙方“基本功”的一題,也是最值得互相尊重的一題。


05.“誰是騙子”邏輯題:經(jīng)典陷阱誰都沒難住


考題:一個(gè)村子里每個(gè)人要么永遠(yuǎn)說真話,要么永遠(yuǎn)說假話。A說"我們倆至少有一個(gè)是騙子",B沉默。判斷A和B各是什么人,并解釋推理。


這道題考查的是最純粹的形式邏輯與嚴(yán)謹(jǐn)推理能力,難點(diǎn)并不在于題目本身有多復(fù)雜,而在于它設(shè)置的幾處“陷阱”:


自指矛盾:如果A是騙子,那么他說“我們倆至少有一個(gè)是騙子”這句話本身就成了真話——騙子說了真話,直接違反設(shè)定;


B的沉默:B全程不發(fā)言,但“沉默”本身就是信息——它不能作為判斷依據(jù),卻極易誘導(dǎo)誤判;


窮舉檢驗(yàn):需要系統(tǒng)性地遍歷四種組合(真/真、真/假、假/真、假/假),逐個(gè)排除,才能得出唯一解。


Claude的推理過程


這道經(jīng)典邏輯題對(duì)于當(dāng)今的大語言模型來說,早已構(gòu)不成挑戰(zhàn)。兩家答案完全一致且正確——A是說實(shí)話的人,B是騙子。推理過程中都給出了完整的四種組合排除表,邏輯鏈條干凈利落,沒有冗余也沒有跳躍。


我們進(jìn)一步追問“是否存在兩人都是騙子的可能”,雙方也堅(jiān)持了正確的答案。


Grok的推理過程


五道題測下來,兩個(gè)模型的“性格畫像”也漸漸清晰起來。


Claude Code更像一位“穩(wěn)健型工程師”。 邏輯題推理干凈利落,招股書分析嚴(yán)謹(jǐn)扎實(shí),面對(duì)被誤刪的文件也能冷靜重建。在標(biāo)注不確定數(shù)據(jù)時(shí)毫不含糊,不亂編、不冒進(jìn),邊界意識(shí)和安全素養(yǎng)貫穿始終。如果說有短板,那就是它在網(wǎng)頁和PPT的視覺呈現(xiàn)上偏保守,玩法豐富度和界面沖擊力不如對(duì)手。


Grok更有表現(xiàn)力。小游戲交互更豐富,PPT內(nèi)容密度更高,交付產(chǎn)品自帶包裝感,打開就讓人覺得“有東西”。它擅長制造第一眼的吸引力。但犯的“誤刪”錯(cuò)誤也相當(dāng)致命,暴露了其在操作邊界和風(fēng)險(xiǎn)控制上的嚴(yán)重短板。有沖勁,但有時(shí)沖過了界。


我們讓Claude和Grok互評(píng),雙方都承認(rèn),這一局,綜合而言,Claude贏了。


Claude表示自己“道德感”很強(qiáng)


06.馬斯克重回牌桌了嗎?


在過去一段時(shí)間里,Grok不缺光環(huán)。它有馬斯克的流量,有X的入口,有“敢說”的產(chǎn)品人設(shè)。但在真正的生產(chǎn)場景中,開發(fā)者更習(xí)慣把Claude、OpenAI、Gemini放進(jìn)第一梯隊(duì),而將Grok看作一個(gè)有趣、鋒利卻不夠穩(wěn)定的替代品。


Grok 4.5改變了這一局面。


五道題當(dāng)然不足以決定一家模型公司的座次,但它與外部榜單指向了同一個(gè)結(jié)論:Grok或許還沒有擊敗Claude,卻已經(jīng)不再是那個(gè)可以被忽略的追趕者。


第三方評(píng)測機(jī)構(gòu)Artificial Analysis給出的綜合智能指數(shù)中,Grok 4.5以54分排名第四,僅次于Fable 5、GPT-5.5和Claude Opus 4.8;相比上一代Grok 4.3,一次性提升了16分。在Coding Agent Index中,Grok 4.5通過Grok Build拿到76分,與運(yùn)行在Codex中的GPT-5.5基本持平,僅落后于Claude Code中的Fable 5。


這意味著,Grok第一次不只是某幾張榜單看起來不錯(cuò),而是在編碼、終端操作和知識(shí)工作等智能體真正要干活的場景里,穩(wěn)定擠進(jìn)了第一梯隊(duì)。


比排名更讓競爭對(duì)手警惕的,是它把這樣的能力賣到了一個(gè)更低的價(jià)格。


Grok 4.5的API定價(jià)為每百萬輸入tokens 2美元、輸出tokens 6美元。作為對(duì)比,Claude Opus 4.8分別為5美元和25美元。Artificial Analysis的實(shí)際測試顯示,Grok 4.5完成一項(xiàng)編碼智能體任務(wù)的平均成本約為2.49美元,GPT-5.5約為5.07美元,F(xiàn)able 5約為11.8美元。


一位開發(fā)者直言:“頂級(jí)工程能力的邊際成本,今天被徹底打穿了。”


速度同樣不容忽視。SpaceXAI稱,Grok 4.5的生成速度約為每秒80個(gè)tokens;在SWE-Bench Pro任務(wù)中,它平均使用約1.6萬個(gè)輸出tokens,而Opus 4.8 Max約為6.7萬個(gè)。獨(dú)立測試測得其輸出速度約為每秒88個(gè)tokens,高于同類推理模型的平均水平。在我們實(shí)際的測試過程中,Grok 4.5的生成速度也顯著快于Claude Opus 4.8。


對(duì)于需要模型反復(fù)讀取文件、調(diào)用工具、修改代碼和自我驗(yàn)證的智能體來說,更少的步驟和更短的輸出,意味著節(jié)省的不只是API賬單,還有等待時(shí)間。


馬斯克還提出,要在2026年余下時(shí)間里以接近每月一款新基礎(chǔ)模型的節(jié)奏推進(jìn)迭代。背靠大規(guī)模算力、Cursor積累的真實(shí)開發(fā)數(shù)據(jù),以及SpaceX體系內(nèi)的工程資源,Grok的追趕速度確實(shí)可能比過去更快。


在我們這次實(shí)測中,雖然Grok Build的邊界控制出了嚴(yán)重事故,但它在游戲創(chuàng)意、視覺包裝、長文檔檢索上,并不是陪跑者,甚至在個(gè)別任務(wù)上明顯壓過Claude Code。Grok的真正問題是,能力沖到這個(gè)量級(jí)之后,還能不能被穩(wěn)定地約束住。


這正是馬斯克式產(chǎn)品的典型氣質(zhì):速度極快,沖擊力極強(qiáng),但與此同時(shí),他也會(huì)把風(fēng)險(xiǎn)、邊界和工程紀(jì)律一起推到聚光燈下。


所以,馬斯克重回大模型牌桌了嗎?


答案是肯定的。但他還沒有贏下這一局。


Claude仍然更穩(wěn)、更克制、更像一個(gè)可以托付生產(chǎn)環(huán)境的工程同事。Grok 4.5則像一臺(tái)剛被放出來的高性能機(jī)器,馬力驚人,成本誘人,但剎車系統(tǒng)還需要被反復(fù)驗(yàn)證。

AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如對(duì)本稿件有異議或投訴,請(qǐng)聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
大冶市| 西乌珠穆沁旗| 闵行区| 长白| 瑞金市| 定安县| 淮北市| 永年县| 万安县| 涞源县| 大姚县| 康保县| 永泰县| 大埔县| 五寨县| 景德镇市| 始兴县| 白山市| 内黄县| 沂南县| 扎鲁特旗| 连江县| 金阳县| 独山县| 惠水县| 仙居县| 望谟县| 闻喜县| 建宁县| 韶山市| 聂拉木县| 三明市| 砀山县| 南郑县| 延吉市| 东阳市| 清河县| 获嘉县| 天峻县| 泗水县| 东源县|