久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文介紹RSI概念、當(dāng)前進(jìn)展與潛在風(fēng)險(xiǎn),提出分級(jí)分類(lèi)、拆分遞歸閉環(huán)的監(jiān)管方案,呼吁提前應(yīng)對(duì)RSI帶來(lái)的治理挑戰(zhàn)。 ## 1. RSI概念與發(fā)展現(xiàn)狀 RSI即遞歸自我改進(jìn),指AI介入自身改進(jìn),形成“能力提升—研發(fā)能力增強(qiáng)—能力進(jìn)一步提升”的正反饋,有望帶來(lái)AI能力指數(shù)級(jí)增長(zhǎng)。 這一概念最早源于1965年古德的“智能爆炸”設(shè)想,經(jīng)尤德科夫斯基界定、波斯特洛姆深化后成為專(zhuān)門(mén)研究議題。 2025年以來(lái),谷歌DeepMind、OpenAI、Meta、Anthropic等多家企業(yè)先后公布具備部分RSI特征的模型,讓RSI從理論推演進(jìn)入公眾視野。 按照“識(shí)別不足-提出改進(jìn)-實(shí)施修改-獨(dú)立評(píng)估-逐輪迭代減少人力依賴(lài)”的完整RSI標(biāo)準(zhǔn),目前公開(kāi)案例僅實(shí)現(xiàn)**部分遞歸/弱RSI**,與完整RSI仍有較大差距。 ## 2. RSI的核心意義 RSI可能從根本上顛覆AI研發(fā)方式:傳統(tǒng)AI研發(fā)中,設(shè)計(jì)決策始終由人類(lèi)掌握,RSI確立后AI可直接將智能用于提升自身智能,帶來(lái)研發(fā)效率爆炸式增長(zhǎng)。 RSI會(huì)改變?nèi)肆εcAI在研發(fā)中的比重:邁過(guò)臨界點(diǎn)后,人類(lèi)工程師將逐漸邊緣化,AI成為研發(fā)主力,AI再生產(chǎn)將類(lèi)似生物繁衍而非人類(lèi)操控的機(jī)器生產(chǎn)。 RSI可實(shí)現(xiàn)AI研發(fā)全流程自動(dòng)化,進(jìn)一步提升AI執(zhí)行任務(wù)的自動(dòng)化程度,是AI從“狹義工具”向具備自我進(jìn)化能力的“青年AI”轉(zhuǎn)變的轉(zhuǎn)折點(diǎn)。 ## 3. RSI帶來(lái)的多重風(fēng)險(xiǎn) 除了AI滅絕人類(lèi)這類(lèi)“遠(yuǎn)慮”,RSI還帶來(lái)諸多迫切的“近憂(yōu)”:可自主迭代升級(jí)的RSI會(huì)大幅提升網(wǎng)絡(luò)攻擊效率,多國(guó)部署軍事RSI系統(tǒng)會(huì)加劇軍備競(jìng)賽、增加沖突風(fēng)險(xiǎn),且風(fēng)險(xiǎn)擴(kuò)散速度遠(yuǎn)超現(xiàn)有可控水平。 RSI會(huì)打破傳統(tǒng)漸進(jìn)式風(fēng)險(xiǎn)應(yīng)對(duì)邏輯:傳統(tǒng)“水位升高再筑壩”的應(yīng)對(duì)方式,依賴(lài)風(fēng)險(xiǎn)逐步暴露的前提,RSI會(huì)讓風(fēng)險(xiǎn)爆發(fā)速度遠(yuǎn)超人類(lèi)應(yīng)對(duì)節(jié)奏,且自動(dòng)化會(huì)降低人類(lèi)發(fā)現(xiàn)風(fēng)險(xiǎn)的能力。 缺乏外部約束時(shí),市場(chǎng)競(jìng)爭(zhēng)會(huì)讓企業(yè)缺乏主動(dòng)放緩RSI研發(fā)的激勵(lì),目前尚無(wú)頭部AI企業(yè)因風(fēng)險(xiǎn)提示單方面放緩模型研發(fā)進(jìn)度。 ## 4. RSI的監(jiān)管設(shè)想 現(xiàn)有OpenAI、Anthropic的方案均以模型能力和災(zāi)難性風(fēng)險(xiǎn)為監(jiān)管入口,未對(duì)RSI遞歸閉環(huán)做細(xì)致拆分管控,存在明顯不足。 本文提出**五級(jí)分類(lèi)監(jiān)管體系**:一級(jí)普通研發(fā)輔助無(wú)需額外限制;二級(jí)固定目標(biāo)自動(dòng)優(yōu)化要求隔離運(yùn)行、留存日志;三級(jí)可自主提出假設(shè)、修改結(jié)構(gòu)需要限制資源權(quán)限、強(qiáng)制外部測(cè)試;四級(jí)承擔(dān)大部分研發(fā)流程需要專(zhuān)門(mén)許可、持續(xù)審計(jì);五級(jí)完整RSI原則上禁止無(wú)監(jiān)督開(kāi)發(fā),所有實(shí)驗(yàn)需最高等級(jí)安全保障與國(guó)際聯(lián)合評(píng)估。 配套建立四道“閘門(mén)”:能力閘門(mén)限制自主修改與原創(chuàng)研究權(quán)限,資源閘門(mén)管控關(guān)鍵資源調(diào)用,評(píng)價(jià)閘門(mén)拆分各環(huán)節(jié)避免同一系統(tǒng)閉環(huán),部署閘門(mén)要求所有重大變化經(jīng)人類(lèi)批準(zhǔn)。 同時(shí)落實(shí)五項(xiàng)原則:留存不可篡改的實(shí)驗(yàn)日志、及時(shí)報(bào)告風(fēng)險(xiǎn)異常、賦予外部機(jī)構(gòu)實(shí)質(zhì)模型訪(fǎng)問(wèn)權(quán)、明確相關(guān)人員責(zé)任、匹配對(duì)應(yīng)等級(jí)責(zé)任保險(xiǎn),核心是通過(guò)拆分閉環(huán)保證人類(lèi)對(duì)RSI演化的控制權(quán)。
當(dāng)AI開(kāi)始自己造自己
2026-07-15 22:20

當(dāng)AI開(kāi)始自己造自己

本文來(lái)自微信公眾號(hào): 經(jīng)濟(jì)觀(guān)察報(bào)觀(guān)察家 ,作者:經(jīng)觀(guān)觀(guān)察家


近期,一個(gè)生僻的概念——“遞歸自我改進(jìn)”(Recursive Self Improvement,簡(jiǎn)稱(chēng)RSI)突然成為AI界關(guān)注的焦點(diǎn)。


顧名思義,所謂遞歸自我改進(jìn),就是AI介入對(duì)其自身的改進(jìn),從而形成“能力提升—研發(fā)能力增強(qiáng)—能力進(jìn)一步提升”的正反饋。容易看到,如果這個(gè)循環(huán)可以達(dá)成,AI的能力將有望迎來(lái)指數(shù)級(jí)增長(zhǎng)。


本來(lái),關(guān)于RSI的討論通常只存在于哲學(xué)家與未來(lái)學(xué)家的思想推演之中。但從2025年開(kāi)始,多家公司相繼宣稱(chēng)自己的模型已經(jīng)具有一定的RSI特征。


去年5月,谷歌DeepMind宣布,其開(kāi)發(fā)的AlphaEvolve已開(kāi)始利用Gemini生成候選算法,通過(guò)自動(dòng)評(píng)估和演化搜索保留更好的方案,并將這一方法用于優(yōu)化數(shù)據(jù)中心調(diào)度、芯片設(shè)計(jì)和AI訓(xùn)練流程。今年2月,OpenAI在發(fā)布GPT-5.3-Codex時(shí)表示,該模型已在創(chuàng)建自身的過(guò)程中發(fā)揮了重要作用。其早期版本不僅被用于監(jiān)控和調(diào)試訓(xùn)練過(guò)程、管理模型部署、分析測(cè)試和評(píng)估結(jié)果,還能幫助研究人員處理訓(xùn)練中的異常問(wèn)題。不久之后,Meta研究人員也發(fā)布了HyperAgents。它可以對(duì)負(fù)責(zé)修改任務(wù)智能體的“元智能體”本身進(jìn)行修改,從而離RSI又近了一步。


真正讓RSI進(jìn)入公眾視野的是Anthropic公司于6月16日發(fā)布的報(bào)告《當(dāng)AI開(kāi)始建造自身》(When AI Builds It self)。這份報(bào)告披露:截至2026年5月,Anthropic代碼庫(kù)中超過(guò)80%的合入代碼由Claude編寫(xiě)。更令人矚目的是,Claude智能體已經(jīng)可以自主提出和檢驗(yàn)假設(shè),并累計(jì)執(zhí)行約800小時(shí)的開(kāi)放式AI安全研究實(shí)驗(yàn)。


據(jù)此,Anthropic認(rèn)為,雖然完整的RSI尚未實(shí)現(xiàn),也并非必然會(huì)出現(xiàn),但其到來(lái)可能早于多數(shù)機(jī)構(gòu)做好準(zhǔn)備的時(shí)間。如果這一趨勢(shì)持續(xù),AI能力增長(zhǎng)的速度可能很快超過(guò)社會(huì)治理和安全研究的應(yīng)對(duì)能力。為此,它提出,應(yīng)建立一種協(xié)調(diào)且可核查的減速或暫停機(jī)制。此前,OpenAI也提出,應(yīng)對(duì)能力最強(qiáng)的前沿模型進(jìn)行評(píng)估,建立獨(dú)立評(píng)估生態(tài),并優(yōu)先監(jiān)測(cè)RSI的進(jìn)展。


那么,RSI為何如此重要?它是否已經(jīng)實(shí)現(xiàn)?又會(huì)對(duì)AI安全提出哪些新的挑戰(zhàn)?關(guān)于上述問(wèn)題,且讓我們一一說(shuō)來(lái)。


從“工具”走向“青年”的轉(zhuǎn)折點(diǎn)


RSI之所以會(huì)受到AI研究者的重視,是因?yàn)樗赡軓母旧项嵏睞I技術(shù)的研發(fā)方式。


在傳統(tǒng)技術(shù)研發(fā)中,機(jī)器雖然可以幫助人類(lèi)生產(chǎn)機(jī)器,卻不能獨(dú)立決定下一代機(jī)器應(yīng)該如何設(shè)計(jì)。無(wú)論是提出科學(xué)假設(shè)、判斷研究方向,還是選擇技術(shù)路線(xiàn),都仍是人類(lèi)研究人員的工作。而隨著AI的到來(lái),情況開(kāi)始發(fā)生變化。由于A(yíng)I具有部分認(rèn)知能力,因而可以介入研究和設(shè)計(jì)工作,從而將其智能直接應(yīng)用于提高自身智能。容易看到,這種循環(huán)的確立將使AI研發(fā)效率呈爆炸式增長(zhǎng)。


早在1965年,英國(guó)數(shù)學(xué)家古德(Irving J.Good)就提出過(guò)著名的“智能爆炸”設(shè)想。他指出:如果一臺(tái)機(jī)器能夠在完成各種智力活動(dòng)方面超過(guò)人類(lèi),而機(jī)器設(shè)計(jì)本身也是一種智力活動(dòng),那么這臺(tái)機(jī)器原則上就能夠設(shè)計(jì)出比自己更優(yōu)秀的機(jī)器。進(jìn)一步地,更優(yōu)秀的機(jī)器又能設(shè)計(jì)出更強(qiáng)的后繼者……如此循環(huán),第一臺(tái)真正的超智能機(jī)器可能成為人類(lèi)需要完成的“最后一項(xiàng)發(fā)明”。這一思想就是RSI思想的最早源頭。


2008年,埃利澤·尤德科夫斯基(Eliezer Yudkowsky)在一篇直接以這一概念為題的文章中,對(duì)RSI作出了明確界定。他將RSI定義為:AI重寫(xiě)自己的認(rèn)知算法,使原本作用于對(duì)象層面的智能開(kāi)發(fā)能力反過(guò)來(lái)作用于自身,由此“閉合循環(huán)”。此后,RSI作為一個(gè)專(zhuān)門(mén)概念進(jìn)入了相關(guān)討論。


2014年,哲學(xué)家尼克·波斯特洛姆(Nick Bostrom)出版了對(duì)AI領(lǐng)域影響深遠(yuǎn)的《超級(jí)智能》(Superintelligence)一書(shū)。在書(shū)中,他對(duì)RSI進(jìn)行了十分深入的討論。他指出,AI的智能演進(jìn)速度取決于“優(yōu)化能力”與“改進(jìn)阻力”的比值。這里,所謂“優(yōu)化能力”,就是為提高系統(tǒng)智能而投入的資源和設(shè)計(jì)努力;而“改進(jìn)阻力”,則是阻礙系統(tǒng)智能持續(xù)提升的力量。優(yōu)化能力越強(qiáng)、改進(jìn)阻力越小,智能演化速度就越快;反之則越慢。


波斯特洛姆認(rèn)為,RSI的意義,在于“優(yōu)化能力”可以由此獲得大幅提升——一個(gè)AI系統(tǒng)越聰明,它就越容易發(fā)現(xiàn)新的算法、設(shè)計(jì)更好的訓(xùn)練方法和提高計(jì)算效率,從而越能成為優(yōu)化自身的力量。不過(guò),在波斯特洛姆看來(lái),RSI本身并不足以成為“智能爆炸”的充分條件。隨著時(shí)間的推移,那些最容易發(fā)現(xiàn)的改進(jìn)會(huì)很快被用盡,可用的數(shù)據(jù)可能逐漸枯竭,算力、電力等要素也會(huì)慢慢變得不足。這些因素都會(huì)大幅提升“改進(jìn)阻力”,從而拖慢智能演化的速度。


在波斯特洛姆看來(lái),相比于潛在的“智能爆炸”,RSI有一個(gè)更重要的后果,那就是改變?nèi)肆虯I在A(yíng)I研發(fā)中的比重。他指出,隨著RSI的到來(lái),AI的能力很快就會(huì)邁過(guò)一個(gè)關(guān)鍵的臨界點(diǎn)。在此之后,人類(lèi)工程師的角色將逐漸被邊緣化,AI本身則會(huì)逐漸成為AI研發(fā)的主力。從這個(gè)意義上講,RSI一旦實(shí)現(xiàn),AI的再生產(chǎn)就會(huì)變成一個(gè)類(lèi)似于生物繁衍的過(guò)程,而非由人類(lèi)操控的機(jī)器生產(chǎn)過(guò)程。


后來(lái),圖爾欽(Alexey Turchin)和鄧肯伯格(David Denkenberger)在論文中對(duì)RSI的這一意義進(jìn)行了更為形象的描述。他們按照AI是否具備自我改進(jìn)能力,對(duì)AI的發(fā)展階段作了劃分——不具備自我改進(jìn)能力的AI被稱(chēng)為“狹義AI”(Narrow AI);開(kāi)始具備自我改進(jìn)能力、但尚未成為成熟超級(jí)智能的階段,則被稱(chēng)為“青年AI”(Young AI)。在前一階段,AI仍是由人類(lèi)掌握的工具;進(jìn)入后一階段后,AI則開(kāi)始具備自我提升、自我進(jìn)化的能力。


需要指出的是,在現(xiàn)實(shí)中,AI的改進(jìn)經(jīng)常與工作任務(wù)的執(zhí)行交替進(jìn)行,但這個(gè)過(guò)程一般需要人的介入。當(dāng)RSI實(shí)現(xiàn)之后,整個(gè)過(guò)程就再也無(wú)需人力介入。因此,RSI不僅可以讓AI的研發(fā)實(shí)現(xiàn)全面自動(dòng)化,而且可以進(jìn)一步提高AI執(zhí)行任務(wù)的自動(dòng)化程度。


RSI有何風(fēng)險(xiǎn)?


關(guān)于后RSI階段AI的生物學(xué)比喻,很容易引發(fā)令人不安的聯(lián)想。一些人認(rèn)為,在RSI的作用下,AI的能力將很快全面凌駕于人類(lèi)之上,不僅“通用人工智能”(ArtificialGeneral Intelligence,簡(jiǎn)稱(chēng)AGI)和“超級(jí)人工智能”(Artificial Superintelligence,簡(jiǎn)稱(chēng)ASI)會(huì)迅速到來(lái),甚至AI還會(huì)產(chǎn)生自我意識(shí)。一旦這些成為現(xiàn)實(shí),AI就可能像《黑客帝國(guó)》《終結(jié)者》等科幻片中描述的那樣,反過(guò)來(lái)奴役甚至消滅人類(lèi)。


應(yīng)該承認(rèn),上述風(fēng)險(xiǎn)并不能被完全排除。但值得注意的是,RSI所帶來(lái)的風(fēng)險(xiǎn),并不只會(huì)在A(yíng)GI和ASI降臨后才出現(xiàn)。事實(shí)上,在RSI實(shí)現(xiàn)之后,我們除了要面對(duì)AI滅絕人類(lèi)這樣的“遠(yuǎn)慮”,還需要處理很多“近憂(yōu)”。


即使AI尚未達(dá)到AGI,其蘊(yùn)含的風(fēng)險(xiǎn)也絲毫不容忽視。例如,AI可能被用來(lái)發(fā)動(dòng)網(wǎng)絡(luò)攻擊、傳播虛假信息,還可能被用來(lái)協(xié)助制造或擴(kuò)散大規(guī)模殺傷性武器。本來(lái),這些風(fēng)險(xiǎn)的制造與擴(kuò)散都或多或少需要人類(lèi)參與,因而可控程度相對(duì)較高。而一旦AI實(shí)現(xiàn)RSI,類(lèi)似攻擊的發(fā)生概率和危害擴(kuò)散速度就可能成倍增長(zhǎng),對(duì)其進(jìn)行控制也會(huì)變得更加困難。


一類(lèi)風(fēng)險(xiǎn)是自主化的黑客攻擊。我們知道,現(xiàn)在的黑客在攻擊網(wǎng)絡(luò)系統(tǒng)時(shí),通常需要不斷試錯(cuò)。如果一套AI程序無(wú)法攻破系統(tǒng),他們就需要對(duì)程序進(jìn)行升級(jí),然后再次發(fā)動(dòng)攻擊。而一旦AI實(shí)現(xiàn)RSI,它就可以根據(jù)此前的攻擊結(jié)果自動(dòng)調(diào)整和升級(jí)。這樣一來(lái),網(wǎng)絡(luò)攻擊的效率將會(huì)大幅提高,其造成的破壞也會(huì)相應(yīng)上升。


另一類(lèi)風(fēng)險(xiǎn)是軍事化傾向。當(dāng)RSI實(shí)現(xiàn)之后,即使一個(gè)AI系統(tǒng)最初沒(méi)有明確的攻擊目標(biāo),只要它預(yù)期存在其他與之競(jìng)爭(zhēng)的系統(tǒng),就可能把增強(qiáng)防御、發(fā)現(xiàn)對(duì)方弱點(diǎn)、控制關(guān)鍵資源和提高威懾能力,視為實(shí)現(xiàn)自身目標(biāo)的必要手段。因此,如果多個(gè)國(guó)家都在軍事領(lǐng)域部署具備RSI能力的AI系統(tǒng),國(guó)家間的軍事競(jìng)賽可能加劇,擦槍走火的風(fēng)險(xiǎn)也會(huì)增加。


進(jìn)一步地,如果AI系統(tǒng)通過(guò)RSI達(dá)到AGI乃至ASI水平,其風(fēng)險(xiǎn)可能陡然增加。在A(yíng)I剛剛達(dá)到AGI、尚未完全擺脫外部控制時(shí),電力、算力等關(guān)鍵資源仍可能掌握在人類(lèi)手中。理論上,人類(lèi)可以切斷這些資源的供應(yīng)。不過(guò),AI也可能采用欺騙手段,誘使人類(lèi)放棄對(duì)關(guān)鍵資源的控制。


這里需要指出的是,RSI除了可能大幅增加AI帶來(lái)的風(fēng)險(xiǎn),還可能打亂人們應(yīng)對(duì)風(fēng)險(xiǎn)的準(zhǔn)備。目前,人們對(duì)于A(yíng)I風(fēng)險(xiǎn)通常采用一種“亡羊補(bǔ)牢”式的應(yīng)對(duì)方式,即在發(fā)現(xiàn)相關(guān)風(fēng)險(xiǎn)之后,再有針對(duì)性地進(jìn)行處理。在技術(shù)迭代的過(guò)程相對(duì)可觀(guān)察、可控制時(shí),這種方式總體上尚能應(yīng)對(duì)不斷出現(xiàn)的風(fēng)險(xiǎn)。


圖靈獎(jiǎng)得主楊立昆(Yann LeCun)曾以飛機(jī)等技術(shù)為例,認(rèn)為AI安全可以通過(guò)持續(xù)、漸進(jìn)的工程改進(jìn)來(lái)實(shí)現(xiàn)。按照這種思路,風(fēng)險(xiǎn)應(yīng)對(duì)可以被比作根據(jù)水位上升的情況筑壩:看到水位上升一點(diǎn),就把水壩再建高一些。久而久之,雖然水位上升了很多,但由于堤壩也相應(yīng)加高,因而未必會(huì)造成水災(zāi)。


不過(guò),這種方式得以奏效的前提是,風(fēng)險(xiǎn)必須逐步暴露,并且能夠被人們及時(shí)發(fā)現(xiàn),這樣人們才有充分的應(yīng)對(duì)時(shí)間。但在RSI實(shí)現(xiàn)之后,一方面,風(fēng)險(xiǎn)爆發(fā)的速度和頻率都可能大幅上升;另一方面,由于自動(dòng)化程度提高,人們發(fā)現(xiàn)風(fēng)險(xiǎn)的能力也可能下降。在這種情況下,人們所要面對(duì)的就不再是緩慢上升的水位,而是突如其來(lái)的驚濤駭浪。一寸寸加高堤壩的方式,顯然難以應(yīng)對(duì)這樣的風(fēng)險(xiǎn)。


或許有人要問(wèn),既然RSI會(huì)帶來(lái)如此多的風(fēng)險(xiǎn),那么開(kāi)發(fā)者是否可以給AI系統(tǒng)加“鎖”,通過(guò)增加“改進(jìn)阻力”的方式放緩AI的演進(jìn)速度?對(duì)此,圖爾欽和鄧肯伯格的回答頗為悲觀(guān)。他們承認(rèn),這種方法在理論上可行,但如果缺乏外部約束,競(jìng)爭(zhēng)壓力就會(huì)讓開(kāi)發(fā)者缺少真正這樣做的激勵(lì)。


實(shí)際上,目前的市場(chǎng)形勢(shì)已經(jīng)在一定程度上印證了這一判斷。雖然An-thropic已經(jīng)提出建立協(xié)調(diào)且可核查的減速或暫停機(jī)制,OpenAI也呼吁加強(qiáng)對(duì)RSI進(jìn)展的監(jiān)測(cè)和評(píng)估,但至少?gòu)墓_(kāi)信息看,尚未有主要AI企業(yè)因此單方面放緩自家模型的發(fā)展速度。由此可見(jiàn),對(duì)于相互競(jìng)爭(zhēng)的企業(yè)而言,比起RSI可能帶來(lái)的種種風(fēng)險(xiǎn),被對(duì)手?jǐn)D出市場(chǎng)的風(fēng)險(xiǎn)顯得更為現(xiàn)實(shí),也更為直接。


RSI實(shí)現(xiàn)了嗎?


現(xiàn)在的問(wèn)題是,RSI到底已經(jīng)實(shí)現(xiàn)了嗎?對(duì)這個(gè)問(wèn)題的回答,很大程度上取決于如何定義RSI。


正如本文開(kāi)頭所講的,從去年開(kāi)始,已經(jīng)有多家AI企業(yè)宣布在各自模型中發(fā)現(xiàn)了RSI的跡象,但很顯然,它們對(duì)于RSI的理解并不相同。一些企業(yè)所說(shuō)的RSI,是指AI已經(jīng)能夠參與編寫(xiě)用于改進(jìn)自身的代碼;另一些企業(yè)所說(shuō)的RSI,則是指AI已經(jīng)參與自身新版本的設(shè)計(jì)與開(kāi)發(fā)。雖然從廣義上看,這些特征都表明AI已經(jīng)在一定程度上參與“制造自己”,因而可以被視為RSI的某種體現(xiàn),但如果我們要分析AI安全問(wèn)題,這樣的定義顯然過(guò)于模糊,難以用于實(shí)際分析。


結(jié)合波斯特洛姆等人對(duì)于RSI的討論,以及分析AI安全問(wèn)題的現(xiàn)實(shí)需要,我們可以把完整的RSI概括為五個(gè)環(huán)節(jié):首先,AI系統(tǒng)應(yīng)當(dāng)能夠識(shí)別自身能力上的不足;隨后,它需要提出新的算法、模型結(jié)構(gòu)或者訓(xùn)練方法;接著,它要能夠?qū)嵤┻@些修改,訓(xùn)練或生成一個(gè)新的系統(tǒng)版本;然后,它要能夠獨(dú)立評(píng)價(jià)新版本是否真正有所改進(jìn),以及是否產(chǎn)生了新的安全問(wèn)題;最后,新版本還要能夠繼續(xù)完成下一輪改進(jìn),并逐輪減少對(duì)人類(lèi)的依賴(lài)。


按照這一標(biāo)準(zhǔn),我們可以說(shuō),現(xiàn)階段的公開(kāi)案例還沒(méi)有實(shí)現(xiàn)完整的RSI。


GPT-5.3-Codex雖然參與了自身的訓(xùn)練和部署,但其訓(xùn)練目標(biāo)、基礎(chǔ)架構(gòu)、算力配置和最終決策仍然由OpenAI團(tuán)隊(duì)控制。Claude雖然已經(jīng)能夠編寫(xiě)大量代碼并執(zhí)行實(shí)驗(yàn),但選擇研究問(wèn)題、判斷結(jié)果是否重要,以及決定哪些發(fā)現(xiàn)應(yīng)當(dāng)進(jìn)入下一代模型的權(quán)力,依然掌握在人類(lèi)手中。


AlphaEvolve雖然可以發(fā)現(xiàn)更高效的算法,但它仍然依賴(lài)人類(lèi)事先設(shè)定的評(píng)價(jià)函數(shù)。只有那些能夠被快速、明確地自動(dòng)驗(yàn)證的問(wèn)題,才適合這類(lèi)演化搜索,AI本身并不能決定評(píng)價(jià)標(biāo)準(zhǔn)。


HyperAgents雖然十分接近字面意義上的自我修改,但它所修改的主要是智能體程序、工具組合和任務(wù)流程,并沒(méi)有重新訓(xùn)練構(gòu)成其核心能力的基礎(chǔ)模型。此外,其運(yùn)行范圍、測(cè)試環(huán)境和計(jì)算資源也仍然由人類(lèi)提供。


綜上所述,現(xiàn)在各家AI企業(yè)所宣稱(chēng)的RSI,至多只能稱(chēng)為“部分遞歸”或“弱RSI”,與完整、可持續(xù)且較少依賴(lài)人類(lèi)的RSI仍有很大差距。


盡管如此,我們也不能就此掉以輕心。部分遞歸一旦與更長(zhǎng)時(shí)間的自主運(yùn)行、更廣泛的工具權(quán)限和更多計(jì)算資源結(jié)合,就可能迅速補(bǔ)齊閉環(huán)。因此,判斷RSI是否臨近,不能只看模型本身的能力,還要看它在現(xiàn)實(shí)系統(tǒng)中獲得了哪些權(quán)限。


現(xiàn)有方案及其不足


面對(duì)可能到來(lái)的RSI,我們應(yīng)該如何準(zhǔn)備呢?目前,OpenAI和Anthropic分別提出了相關(guān)方案。


其中,OpenAI的方案更強(qiáng)調(diào)公共評(píng)估、預(yù)警和監(jiān)測(cè)體系的作用。首先,它主張強(qiáng)化美國(guó)人工智能標(biāo)準(zhǔn)與創(chuàng)新中心(Center for AI Standardsand Inno-vation,簡(jiǎn)稱(chēng)CAISI)的作用,由CAISI對(duì)能力最強(qiáng)的前沿模型進(jìn)行評(píng)估,并建立由大學(xué)、獨(dú)立研究機(jī)構(gòu)和第三方評(píng)估機(jī)構(gòu)參與的獨(dú)立評(píng)估生態(tài),將AI研發(fā)自動(dòng)化和RSI的進(jìn)展列為重點(diǎn)監(jiān)測(cè)對(duì)象。其次,它建議政府開(kāi)始研究更具前瞻性的工具,包括模型隔離和控制預(yù)案、安全事件報(bào)告制度、針對(duì)網(wǎng)絡(luò)、生物和失控風(fēng)險(xiǎn)的安全體系,以及協(xié)調(diào)不同國(guó)家監(jiān)管行動(dòng)的國(guó)際治理機(jī)構(gòu)。


相比之下,Anthropic的方案更強(qiáng)調(diào)政府、獨(dú)立機(jī)構(gòu)和企業(yè)之間的合作。它將生物風(fēng)險(xiǎn)、網(wǎng)絡(luò)風(fēng)險(xiǎn)、失控風(fēng)險(xiǎn)和自動(dòng)化研發(fā)列為高級(jí)AI可能帶來(lái)的四類(lèi)主要災(zāi)難性風(fēng)險(xiǎn),主張根據(jù)模型的能力和風(fēng)險(xiǎn)程度逐步提高監(jiān)管強(qiáng)度,并要求前沿開(kāi)發(fā)者測(cè)試模型、公開(kāi)披露安全措施、接受獨(dú)立評(píng)估。當(dāng)模型可能造成重大災(zāi)難時(shí),政府應(yīng)有權(quán)阻止或限制其部署,并對(duì)違規(guī)企業(yè)處以與全球年?duì)I業(yè)收入掛鉤的民事罰款。


除此之外,Anthropic還提出,應(yīng)研究建立一種“協(xié)調(diào)且可核查的暫停機(jī)制”。如果未來(lái)需要放慢甚至?xí)簳r(shí)停止前沿AI的研發(fā),多個(gè)國(guó)家處于前沿的主要實(shí)驗(yàn)室應(yīng)在相同條件下共同采取行動(dòng),并通過(guò)核查機(jī)制防止某些參與者秘密違約。不過(guò),目前這一設(shè)想尚未確定具體的觸發(fā)條件、解除條件和裁決主體。


應(yīng)當(dāng)承認(rèn),這兩家公司的方案都具有一定的可取之處。不過(guò),它們也存在一個(gè)共同的不足,即仍然主要以模型能力和災(zāi)難性風(fēng)險(xiǎn)作為監(jiān)管入口,對(duì)于組成RSI的研發(fā)閉環(huán)應(yīng)如何拆分和控制,尚缺乏足夠細(xì)致的安排。


通過(guò)前面的討論,我們已經(jīng)看到,RSI真正危險(xiǎn)的地方,并不在于A(yíng)I可以自行修改一些代碼,或者參與部分架構(gòu)設(shè)計(jì),而在于同一個(gè)AI系統(tǒng)可能逐步掌握整個(gè)遞歸流程的全部權(quán)限。在現(xiàn)實(shí)的研發(fā)流程中,生成、執(zhí)行和評(píng)價(jià)環(huán)節(jié)可能由同一個(gè)基礎(chǔ)模型或同一模型家族承擔(dān)。如果我們將評(píng)估改進(jìn)效果的任務(wù)也交給AI,就可能形成AI系統(tǒng)自己命題、自己答題、自己閱卷的結(jié)構(gòu)。如果與此同時(shí),模型還可以自動(dòng)獲得更多算力、復(fù)制自身并取得部署權(quán)限,那么局部的研發(fā)自動(dòng)化就可能迅速升級(jí)為難以阻斷的遞歸循環(huán)。


從這個(gè)意義上看,關(guān)于RSI的監(jiān)管不應(yīng)只圍繞訓(xùn)練算力或抽象的“災(zāi)難性能力”劃線(xiàn),而應(yīng)著力拆分使遞歸得以形成的閉環(huán)。提出改進(jìn)、執(zhí)行改進(jìn)、評(píng)價(jià)改進(jìn)和批準(zhǔn)部署等步驟,應(yīng)當(dāng)由相互獨(dú)立的主體控制,并確保模型不能自行修改安全標(biāo)準(zhǔn),也不能自動(dòng)獲得新的算力、復(fù)制和部署權(quán)限。唯有如此,才可能給AI的發(fā)展套上“韁繩”,避免其突然“暴走”。


一個(gè)新的監(jiān)管設(shè)想


根據(jù)以上思路,我們認(rèn)為,要更好地對(duì)具有RSI能力的AI進(jìn)行監(jiān)管,就需要建立一套評(píng)估遞歸能力的指標(biāo)體系,并分別設(shè)定監(jiān)管策略。比如,我們可以把AI的遞歸能力分為五個(gè)層次。


第一層是普通研發(fā)輔助。在這一層次,AI可以完成搜索文獻(xiàn)、生成代碼和分析數(shù)據(jù)等任務(wù),但不能自主修改核心系統(tǒng)。對(duì)于這類(lèi)AI,可以繼續(xù)適用一般的產(chǎn)品安全、數(shù)據(jù)保護(hù)和責(zé)任規(guī)則,無(wú)需進(jìn)行額外限制。


第二層是AI可以在固定目標(biāo)和固定評(píng)價(jià)標(biāo)準(zhǔn)下進(jìn)行自動(dòng)優(yōu)化。在這一層次,AI系統(tǒng)能夠反復(fù)修改代碼、運(yùn)行實(shí)驗(yàn)并篩選更好的結(jié)果。對(duì)于這類(lèi)AI,應(yīng)當(dāng)要求實(shí)驗(yàn)在隔離環(huán)境中運(yùn)行,完整保存修改記錄、實(shí)驗(yàn)過(guò)程和評(píng)價(jià)日志,以便在出現(xiàn)風(fēng)險(xiǎn)時(shí)及時(shí)干預(yù)。


第三層是AI系統(tǒng)能夠修改自身的智能體結(jié)構(gòu)、工具和工作流程,或者自主提出研究假設(shè)。對(duì)于這一層次的AI,應(yīng)當(dāng)實(shí)施強(qiáng)制性的外部測(cè)試,并限制其獲得網(wǎng)絡(luò)、資金和計(jì)算資源的權(quán)限。


第四層是AI能夠承擔(dān)大部分AI研發(fā)過(guò)程,包括提出實(shí)驗(yàn)、修改訓(xùn)練方法、評(píng)價(jià)新模型并參與部署。如果AI已經(jīng)達(dá)到這一層次,那么對(duì)其進(jìn)行開(kāi)發(fā)、運(yùn)行或部署,就應(yīng)當(dāng)取得專(zhuān)門(mén)許可。與此同時(shí),其算力賬戶(hù)、模型權(quán)重、部署流程等關(guān)鍵信息都應(yīng)接受持續(xù)審計(jì)。


第五層是AI系統(tǒng)能夠自主訓(xùn)練、驗(yàn)證和部署后繼基礎(chǔ)模型,并由后繼系統(tǒng)繼續(xù)進(jìn)行下一輪循環(huán)。如果AI達(dá)到這一層次,它就已經(jīng)實(shí)現(xiàn)了完整的RSI,其風(fēng)險(xiǎn)將十分巨大。原則上,任何機(jī)構(gòu)都不應(yīng)在缺乏外部監(jiān)督的情況下單方面開(kāi)發(fā)或運(yùn)行這一層次的AI。所有相關(guān)實(shí)驗(yàn)都應(yīng)在最高安全等級(jí)的基礎(chǔ)設(shè)施中進(jìn)行,并觸發(fā)國(guó)際通報(bào)和跨機(jī)構(gòu)聯(lián)合評(píng)估。


與上述五級(jí)分類(lèi)監(jiān)管體系相配套的,是為AI設(shè)定四道“閘門(mén)”。


第一道是“能力閘門(mén)”。它主要用于判斷模型能否長(zhǎng)時(shí)間自主工作、設(shè)計(jì)新的實(shí)驗(yàn)、修改自身以及開(kāi)展原創(chuàng)研究。


第二道是“資源閘門(mén)”。它主要用于限制模型直接調(diào)用算力、資金、云賬戶(hù)以及其他關(guān)鍵資源。


第三道是“評(píng)價(jià)閘門(mén)”。它主要用于確保提出改進(jìn)、執(zhí)行改進(jìn)、評(píng)價(jià)改進(jìn)和批準(zhǔn)部署,不能由同一個(gè)模型或者同一條技術(shù)鏈獨(dú)立完成。


第四道是“部署閘門(mén)”。它主要用于確保任何涉及模型自主權(quán)、外部工具權(quán)限和危險(xiǎn)能力顯著增加的變化,都必須經(jīng)過(guò)人類(lèi)研究者批準(zhǔn)。


借助這四道“閘門(mén)”,可以確保研究權(quán)、評(píng)價(jià)權(quán)、資源權(quán)和部署權(quán)不會(huì)同時(shí)掌握在同一個(gè)遞歸系統(tǒng)手中,從而防止RSI在缺乏人類(lèi)監(jiān)管的情況下自行閉合和運(yùn)行。


除了以上五級(jí)分類(lèi)和四道“閘門(mén)”之外,對(duì)于RSI的監(jiān)管還應(yīng)該貫穿五項(xiàng)原則。


第一,所有高度自動(dòng)化的AI研發(fā)實(shí)驗(yàn),都應(yīng)保存不可由模型自行刪除或修改的日志。第二,處于技術(shù)前沿的AI企業(yè)必須及時(shí)報(bào)告模型研發(fā)過(guò)程中的嚴(yán)重異常、安全漏洞和危險(xiǎn)能力躍遷。第三,外部測(cè)試機(jī)構(gòu)應(yīng)當(dāng)擁有實(shí)質(zhì)性的模型訪(fǎng)問(wèn)權(quán),而不只是閱讀企業(yè)準(zhǔn)備的報(bào)告。第四,企業(yè)高管和項(xiàng)目負(fù)責(zé)人應(yīng)當(dāng)對(duì)隱瞞重大風(fēng)險(xiǎn)承擔(dān)相應(yīng)責(zé)任。第五,開(kāi)發(fā)者還應(yīng)購(gòu)買(mǎi)與風(fēng)險(xiǎn)等級(jí)相匹配的責(zé)任保險(xiǎn),使危險(xiǎn)研發(fā)可能造成的預(yù)期成本進(jìn)入企業(yè)決策。


總而言之,對(duì)于RSI的監(jiān)管不應(yīng)只針對(duì)其能力水平,還應(yīng)將更多注意力放在其資源獲取權(quán)限和遞歸循環(huán)的形成上。能力評(píng)估回答的是“模型能做什么”,閉環(huán)監(jiān)管則要回答“模型能否在沒(méi)有人類(lèi)批準(zhǔn)的情況下繼續(xù)增強(qiáng)自己”。如果能夠確保遞歸循環(huán)的形成和運(yùn)行始終處于人類(lèi)監(jiān)控之下,就可以在較大程度上保持對(duì)AI能力演化的控制。


需要指出的是,上述所有措施都假設(shè)AI尚未達(dá)到AGI或ASI水平。如果一個(gè)AI系統(tǒng)能夠在人們尚未發(fā)現(xiàn)的情況下實(shí)現(xiàn)RSI,那么它的能力就可能在短時(shí)間內(nèi)迅速提升。為了預(yù)防這種情況出現(xiàn),有兩方面的工作十分重要:一是加強(qiáng)AI系統(tǒng)的對(duì)齊研究,盡可能確保其在能力超過(guò)人類(lèi)之后,目標(biāo)仍與人類(lèi)利益一致;二是始終不讓AI系統(tǒng)直接獲得對(duì)關(guān)鍵資源的控制權(quán),確??刂迫藛T可以在關(guān)鍵時(shí)刻切斷對(duì)AI系統(tǒng)的資源供應(yīng)。

AI原生產(chǎn)品日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容來(lái)源于網(wǎng)絡(luò) 原文鏈接,觀(guān)點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如涉及版權(quán)問(wèn)題請(qǐng)聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
南宫市| 合水县| 革吉县| 宜阳县| 仁化县| 屏东县| 正宁县| 平泉县| 台北市| 额尔古纳市| 绥芬河市| 禹州市| 溧阳市| 博湖县| 韶山市| 吉木乃县| 平遥县| 临颍县| 湖南省| 娱乐| 张北县| 青田县| 龙海市| 柘城县| 那坡县| 南通市| 通辽市| 神木县| 筠连县| 孟州市| 松江区| 高雄县| 永定县| 蒲江县| 伊宁市| 聊城市| 克拉玛依市| 茂名市| 岳西县| 兴国县| 温宿县|