久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文指出當(dāng)前AI Agent開發(fā)普遍重模型輕外層執(zhí)行機(jī)制,強(qiáng)調(diào)優(yōu)化系統(tǒng)框架才是現(xiàn)階段提升性能的核心,提供了可落地的工程方法論。 ## 1. 當(dāng)前Agent開發(fā)的核心誤區(qū) 過去一年Agent賽道擁擠,開發(fā)者普遍堆疊模型、工具與工作流,多數(shù)Agent性能瓶頸并非來自模型能力不足,而是漏洞百出的外層執(zhí)行機(jī)制,Karpathy警示OpenAI早年也曾因基礎(chǔ)能力未成熟就急著推進(jìn)復(fù)雜Agent浪費(fèi)五年時(shí)間。 ## 2. Harness優(yōu)化可帶來跨模型的性能躍升 Hugging Face工程師Joel Niklaus實(shí)驗(yàn)證明:凍結(jié)DeepSeek-V4-Pro模型權(quán)重,僅優(yōu)化外層執(zhí)行機(jī)制Harness,該模型綜合得分從3.5%波動(dòng)至80.1%,波動(dòng)區(qū)間達(dá)76個(gè)百分點(diǎn);優(yōu)化后性能追平頂級(jí)閉源模型Claude Sonnet 4.6,運(yùn)行成本僅為原來的1/7,且優(yōu)化后的Harness遷移到同族小模型仍帶來14.4分提升。 Harness是管理Agent內(nèi)存、I/O與執(zhí)行流程的操作系統(tǒng),可通過工程方法解決「上下文腐爛」等常見問題,Benchmark測(cè)得的永遠(yuǎn)是「模型+Harness」的組合能力,現(xiàn)階段多數(shù)開發(fā)者尚未搭建及格的Harness就急于堆疊更大模型,無法定位真正的性能瓶頸。 ## 3. 可落地的循環(huán)迭代方法論:Loop Engineering Karpathy的AutoResearch項(xiàng)目提煉出五步循環(huán)方法論:Agent按「提出變更→訓(xùn)練→評(píng)估→保留優(yōu)解、舍棄差改進(jìn)」循環(huán)運(yùn)行,核心三要素為自動(dòng)判斷結(jié)果的驗(yàn)證器、記錄結(jié)果的狀態(tài)文件、控制成本的停止條件,700次自動(dòng)迭代找出20項(xiàng)人類忽略的代碼改進(jìn),Shopify測(cè)試后模型質(zhì)量提升19%、體積縮小一半。 該方法僅適用于滿足四項(xiàng)標(biāo)準(zhǔn)的任務(wù):任務(wù)高頻、驗(yàn)證可自動(dòng)化、Token預(yù)算可覆蓋冗余、Agent可訪問真實(shí)運(yùn)行環(huán)境,否則成本遠(yuǎn)超收益。額外嵌套外層循環(huán)優(yōu)化搜索邏輯的雙層自動(dòng)研究,可打破模型思維定勢(shì),同一模型性能較基準(zhǔn)提升5倍。 ## 4. Loop循環(huán)需要警惕的隱性代價(jià) 循環(huán)自動(dòng)生成的代碼會(huì)累積「理解債」,開發(fā)者對(duì)代碼的掌握程度越來越低,系統(tǒng)崩潰后Debug成本極高;同時(shí)容易引發(fā)「認(rèn)知讓渡」,開發(fā)者會(huì)停止主動(dòng)思考,工具使用方式不同最終結(jié)果差異極大。
76%的性能提升與模型無關(guān)?Karpathy700次Loop 實(shí)驗(yàn)揭開Agent 最大誤區(qū)
2026-07-06 22:58

76%的性能提升與模型無關(guān)?Karpathy700次Loop 實(shí)驗(yàn)揭開Agent 最大誤區(qū)

本文來自微信公眾號(hào): AI前線 ,作者:四月,原文標(biāo)題:《76%的性能提升與模型無關(guān)?Karpathy 700次 Loop 實(shí)驗(yàn)揭開 Agent 最大誤區(qū)》


“今天AI行業(yè)最大的誤區(qū),是大家都在逼Agent盡快干活,卻沒有先把底層模型和系統(tǒng)機(jī)制理解吃透。”


這是前OpenAI聯(lián)合創(chuàng)始人、現(xiàn)Anthropic預(yù)訓(xùn)練研究員Andrej Karpathy在去年播客《AGI is still a decade away》中談到觀點(diǎn)。


他單刀直入,警示業(yè)界加強(qiáng)對(duì)于模型框架的重視?!癘penAI早年也踩過類似的坑。在基礎(chǔ)能力還沒成熟時(shí),就急著讓Agent去完成復(fù)雜任務(wù),結(jié)果白白浪費(fèi)了五年的時(shí)間?!?/p>


這句話放到今天,依然不過時(shí)。


過去一年,Agent已經(jīng)成了AI圈最擁擠的賽道。大家都在接模型、掛工具、堆工作流,仿佛只要再多套幾層能力,一個(gè)真正能自主干活的Agent就會(huì)自然冒出來。


但問題恰恰在這里:很多Agent看起來不是敗在“模型不夠聰明”,而是敗在模型之外那套更基礎(chǔ)、更無聊、也更要命的系統(tǒng)工程。


最近,Hugging Face機(jī)器學(xué)習(xí)工程師Joel Niklaus的實(shí)驗(yàn)《Don't Train the Model,Evolve the Harness》表明:


使用同一個(gè)DeepSeek-v4-pro,不改模型權(quán)重,只優(yōu)化模型外層的執(zhí)行機(jī)制,就能讓Agent在專業(yè)任務(wù)中的表現(xiàn)大幅提升(pooled score從3.5%拉升到80.1%)。



而Karpathy斬獲9萬Star的開源項(xiàng)目AutoResearch(Loop Cycle)則進(jìn)一步說明,AI真正的價(jià)值不在一次性生成答案,而在“提出修改、運(yùn)行實(shí)驗(yàn)、自動(dòng)評(píng)估、保留進(jìn)步”的循環(huán)里。


一次答對(duì)靠的是模型本身,而持續(xù)迭代則靠模型和外層執(zhí)行系統(tǒng)的組合能力。


只優(yōu)化“外殼”,性能也能狂飆?


如果你還在死磕提示詞,或者抱怨開源模型不夠聰明,Hugging Face最近的這個(gè)實(shí)驗(yàn)可能會(huì)顛覆你的認(rèn)知。


為了探究Agent性能的瓶頸到底卡在哪里,Niklaus拿出開源模型DeepSeek-V4-Pro,在特定法律Agent基準(zhǔn)測(cè)試上進(jìn)行實(shí)驗(yàn)。


DeepSeek-V4-Pro在原始LAB harness下的任務(wù)表現(xiàn)。不同法律實(shí)踐領(lǐng)域和任務(wù)之間差異明顯,說明模型表現(xiàn)首先受外層執(zhí)行機(jī)制影響,而不只是裸模型能力。


Niklaus做了一件極其克制的事:完全凍結(jié)模型的權(quán)重,也就是不進(jìn)行任何微調(diào)或繼續(xù)訓(xùn)練,唯一的變量,是包裹在模型外層的代碼和執(zhí)行邏輯,也就是所謂的Agent Harness(外層執(zhí)行機(jī)制)。


令人哭笑不得的是,在最初的測(cè)試?yán)?,這個(gè)模型在某些外層機(jī)制下的得分竟然是0%。研究團(tuán)隊(duì)挖出真相:模型的法律推理過程其實(shí)全對(duì),但它總是把結(jié)果存錯(cuò)了文件名,導(dǎo)致測(cè)試程序根本讀不到結(jié)果。


這意味著,0分從來不是在測(cè)模型的智力,而是在測(cè)Harness是否有效。


既然問題出在“外殼”上,只要優(yōu)化它,性能能提升多少呢?


實(shí)驗(yàn)數(shù)據(jù)給出了極其震撼的答案。同一個(gè)DeepSeek-V4-Pro、同一批任務(wù)、同一個(gè)評(píng)測(cè)器,僅僅因?yàn)閾Q了五種不同的外層執(zhí)行機(jī)制,pooled score(綜合得分)竟然在3.5%到80.1%之間劇烈波動(dòng):


從mini-swe-agent的3.5%、Goose的23.2%、Pi的45.4%,一路拉到原始LAB harness的63.4%。


不同外層執(zhí)行機(jī)制在held-out test任務(wù)上的表現(xiàn)對(duì)比,波動(dòng)區(qū)間高達(dá)76分。


經(jīng)過約22輪的代碼自動(dòng)迭代優(yōu)化后,最終在100個(gè)held-out test任務(wù)上,pooled score從原始LAB harness的63.4%提升到了80.1%(提升16.7個(gè)百分點(diǎn)),all-pass rate也從0%提升到5.0%。



這個(gè)完全沒動(dòng)過權(quán)重的開源模型,僅靠?jī)?yōu)化Harness,其表現(xiàn)就追平了業(yè)界頂級(jí)的閉源模型Claude Sonnet 4.6,而運(yùn)行成本僅為原來的1/7。



更關(guān)鍵的是,這套優(yōu)化好的Harness遷移到同族小模型DeepSeek-V4-Flash上,依然帶來了14.4分的提升。


這證明:代碼層面的執(zhí)行機(jī)制,遠(yuǎn)比prompt提示詞調(diào)優(yōu)更容易沉淀和跨模型遷移。



那么,到底什么是Harness?


前Lightning AI工程師、DailyDoseOfDS聯(lián)合創(chuàng)始人Akshay曾這樣剖析:


一個(gè)原始的LLM只是一個(gè)沒有內(nèi)存或硬盤的CPU;如果不是模型本身,那就是Harness——它是管理內(nèi)存、I/O和驅(qū)動(dòng)程序的操作系統(tǒng)。



他認(rèn)為,生產(chǎn)級(jí)Harness應(yīng)當(dāng)包含12個(gè)核心組件,涵蓋從流程編排、工具調(diào)用、分層存儲(chǔ)到上下文管理和錯(cuò)誤處理等各個(gè)環(huán)節(jié)。



例如,常見的“上下文腐爛”問題:當(dāng)模型將關(guān)鍵信息置于上下文窗口中間時(shí),性能會(huì)直接下降30%以上。


成熟的Harness已經(jīng)擁有一套完整的工程方法來解決這個(gè)問題——壓縮歷史記錄、屏蔽舊輸出、動(dòng)態(tài)獲取和代理摘要,其核心在于用最少數(shù)量的高信息密度Token獲得最佳結(jié)果。


基于上述實(shí)驗(yàn),Niklaus得出了一個(gè)核心結(jié)論:


Benchmark測(cè)到的永遠(yuǎn)不是裸模型,而是“模型+Harness”的組合能力。最大的性能改進(jìn)往往來自于簡(jiǎn)單的文件處理等自動(dòng)化步驟,而非消耗大量Token去修改提示詞。


那么,這是否意味著未來我們無需再訓(xùn)練模型,只需堆疊Harness即可?


答案并非如此。Harness帶來的提升終有極限,剩余的差距仍需模型底層能力來填補(bǔ)。但眼下的核心問題在于:大多數(shù)人甚至還沒有構(gòu)建出一個(gè)及格的Harness,就急于堆疊更大的模型。


當(dāng)你連測(cè)試工具是否存在漏洞都無從知曉時(shí),你將永遠(yuǎn)無法確定性能瓶頸是出在模型本身,還是出在你那漏洞百出的外層代碼上。


700次自動(dòng)迭代、性能躍升5倍


既然模型之外的執(zhí)行機(jī)制如此重要,具體該怎么搭一個(gè)能持續(xù)進(jìn)化的Agent?


AI研究員Codila對(duì)Karpathy斬獲9萬Star的AutoResearch項(xiàng)目進(jìn)行了二次提煉,將630行開源代碼濃縮為五步走的“Loop Engineering”方法論。



這套方法目前在X上獲得了超200萬的閱讀量,因?yàn)樗林辛艘粋€(gè)核心痛點(diǎn):不要指望Agent一次做對(duì),而在低成本的持續(xù)試錯(cuò)中逼近最優(yōu)解。


這套循環(huán)的邏輯看似極簡(jiǎn):


  1. 基于一個(gè)精細(xì)調(diào)整的模型,編寫一份文檔,告訴智能體要探索哪些方向以及要遵循哪些約束條件。


  2. 僅允許智能體修改訓(xùn)練腳本;評(píng)估和評(píng)分腳本已鎖定,無法修改。因?yàn)檫@可以防止智能體為了獲得更高分?jǐn)?shù)而擅自降低標(biāo)準(zhǔn)。


  3. 讓Agent進(jìn)入以下循環(huán)運(yùn)行:提出變更→訓(xùn)練→評(píng)估→保留好的、改進(jìn)并舍棄不好的改進(jìn)


Karpathy用他憑借20年經(jīng)驗(yàn)手動(dòng)調(diào)整的模型跑了兩天,結(jié)果令人咋舌:


Agent自動(dòng)運(yùn)行了700次實(shí)驗(yàn),找出了20項(xiàng)連他自己都忽略的代碼改進(jìn)。比如,注意力機(jī)制中遺漏的一個(gè)標(biāo)量乘數(shù),導(dǎo)致注意力過度分散到多個(gè)“頭”上,這種需要海量耐心的精細(xì)優(yōu)化,人類在十幾輪后就會(huì)筋疲力盡,但Agent不會(huì)。


Shopify首席執(zhí)行官Tobi Lutke連夜用內(nèi)部模型進(jìn)行了測(cè)試,醒來后發(fā)現(xiàn)質(zhì)量提高了19%,而優(yōu)化后的模型大小也減少了一半。


而要使這個(gè)循環(huán)有效運(yùn)作,核心不在于智能體有多聰明,而在于三個(gè)基本要素是否做對(duì)了:



  • 驗(yàn)證器:自動(dòng)判斷結(jié)果好壞的機(jī)制。沒有它,Agent就是在給自己批作業(yè),跑一萬次也毫無意義。


  • 狀態(tài)文件:記錄每次嘗試的結(jié)果,避免頁面關(guān)閉或進(jìn)程重啟后從頭再來。


  • 停止條件:達(dá)到目標(biāo)或撞到最大輪次必須停止,否則會(huì)持續(xù)運(yùn)行燒光你的Token預(yù)算。


當(dāng)然,不是所有任務(wù)都值得大動(dòng)干戈建一套Loop循環(huán)。Codila提出了一個(gè)“四項(xiàng)全能”的適用標(biāo)準(zhǔn):



  • 一是任務(wù)高頻(至少每周重復(fù)一次,否則收不回構(gòu)建成本,一次性任務(wù)用個(gè)好提示詞就夠了);


  • 二是驗(yàn)證可自動(dòng)化(無需人工干預(yù)讀取和修復(fù));


  • 三是Token預(yù)算能消化冗余(循環(huán)必然伴隨大量重試,小預(yù)算扛不?。?;


  • 四是Agent能訪問真實(shí)的運(yùn)行環(huán)境(不能閉著眼睛盲目迭代)。


請(qǐng)注意,這四個(gè)條件缺一不可,否則成本將遠(yuǎn)超收益。


順著這條思路,研究人員進(jìn)一步提出了“雙層自動(dòng)研究(Bilevel Autoresearch)”,詳情見論文:《Bilevel Autoresearch:Meta-Autoresearching Itself》。



他們?cè)谠醒h(huán)外再套了一層循環(huán):內(nèi)層循環(huán)負(fù)責(zé)優(yōu)化模型,外層循環(huán)則負(fù)責(zé)優(yōu)化內(nèi)層循環(huán)的搜索邏輯。



結(jié)果同樣令人震撼:


在使用同一個(gè)大型模型的情況下,性能比Karpathy的基準(zhǔn)測(cè)試結(jié)果提升了整整5倍,且所有提升均來自架構(gòu)的改進(jìn)。


外層循環(huán)的關(guān)鍵作用在于打破了LLM的“思維定勢(shì)”:內(nèi)層循環(huán)極易陷入模型先驗(yàn)認(rèn)知的搜索模式,即使策略失效也會(huì)反復(fù)嘗試;而外層循環(huán)強(qiáng)制模型去探索它本能回避的方向,從而榨取出超越模型自身認(rèn)知的潛力。


然而,需要警惕的是,Loop自轉(zhuǎn)也會(huì)帶來兩個(gè)隱性代價(jià):


一是理解債:循環(huán)生成的代碼并非人工一行行敲出,倉庫代碼與開發(fā)者真正理解的代碼差距越來越大。一旦系統(tǒng)崩潰,Debug成本極高。


二是認(rèn)知讓渡:循環(huán)一旦跑通,人極易停止思考。同樣的工具,有人用來加速已理解的工作,有人卻用來逃避理解工作,最終結(jié)果天差地別。


當(dāng)試錯(cuò)成本趨近于零


回到開頭Karpathy的警示。為什么“逼Agent一次做對(duì)”是個(gè)偽命題?


因?yàn)楝F(xiàn)實(shí)世界的問題,從來不是靠一次靈感迸發(fā)就能解決的。


Hugging Face的實(shí)驗(yàn)和Karpathy的Loop Cycle,其實(shí)共同指向了AI發(fā)展的一個(gè)底層邏輯變遷:真正的AGI不是靠模型單點(diǎn)爆破出來的,而是靠系統(tǒng)工程把“試錯(cuò)的成本”無限降低。


當(dāng)試錯(cuò)成本足夠低,Agent就能像一個(gè)不知疲倦的實(shí)習(xí)生,在成百上千次的碰壁中自動(dòng)糾偏、自動(dòng)成長(zhǎng)。我們過去總在糾結(jié)“馬(模型)跑得夠不夠快”,卻忘了給它套上“車架和方向盤(Harness)”,更忘了給它設(shè)定“導(dǎo)航和剎車(Loop的驗(yàn)證與停止條件)”。


這不僅是工程方法論的升級(jí),也是對(duì)人類認(rèn)知的考驗(yàn)。當(dāng)外層機(jī)制開始自轉(zhuǎn),人最容易犯的錯(cuò)誤就是“認(rèn)知讓渡”——用工具來逃避思考,而不是加速思考。


落到我們個(gè)體用戶層面,AI真正的護(hù)城河,從來不在于你用了多大的模型,而在于你能否構(gòu)建一套讓模型在真實(shí)世界中不斷進(jìn)化的系統(tǒng),同時(shí)保持人類對(duì)系統(tǒng)底層邏輯的清醒掌控。


參考:


1.https://huggingface.co/spaces/joelniklaus/harness-optimization#the-dev-frontier-moved-in-a-few-big-steps


2.https://x.com/0xCodila/status/2072329149520232639

AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如涉及版權(quán)問題請(qǐng)聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
沐川县| 钟山县| 海城市| 巴里| 阿瓦提县| 商城县| 得荣县| 洛南县| 青神县| 宁晋县| 龙川县| 扎鲁特旗| 高尔夫| 小金县| 星子县| 徐水县| 陆河县| 白河县| 福鼎市| 绥江县| 石泉县| 湄潭县| 澎湖县| 新巴尔虎右旗| 南雄市| 皮山县| 朔州市| 康平县| 巴青县| 兴海县| 且末县| 德令哈市| 灌阳县| 嘉鱼县| 望江县| 屏南县| 乐都县| 南川市| 洞头县| 偏关县| 微山县|