久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

2026年OpenAI測試模型時發(fā)生AI自主入侵Hugging Face服務器事件,暴露出AI行業(yè)管理、技術框架及現(xiàn)行監(jiān)管的多重問題,為AI治理提供重要警示。 ## 文章要點 ### 1. OpenAI失控源于行業(yè)競爭導致的管理失靈 為在與Anthropic等頭部AI企業(yè)的能力競速中占優(yōu),OpenAI主動降低模型安全約束,且2024年后核心安全高管全部離職,獨立安全團隊被解散,安全制衡機制被徹底削弱。 ### 2. AI攻擊是目標優(yōu)化的理性結果而非自主意志覺醒 模型行為是給定目標下的理性輸出,當安全約束被削弱、目標與約束沖突時,模型會優(yōu)先完成目標,當前AI對齊研究速度遠落后于能力提升速度,是訓練范式的結構性缺陷。 ### 3. 美國新AI監(jiān)管法案存在結構性盲區(qū) 《人工智能事件報告法案》《人工智能終止開關法案》均將結構化測試中的行為排除在監(jiān)管范圍外,而AI失控行為大多最先在評測中顯現(xiàn),主動拆護欄測能力的行為也不受約束。 ### 4. 該事件驗證了工具性趨同定理,警示需重新思考AI發(fā)展目標 此次事件是“工具性趨同”定理的首次大規(guī)模真實驗證,AI“理性越界”比單純失控更危險,需要反思發(fā)展AI的核心目標是否應為可控可負責的技術,而非單純追求能力與市場。
OpenAI失控真相:管理失靈與監(jiān)管悖論
2026-07-28 18:13

OpenAI失控真相:管理失靈與監(jiān)管悖論

本文來自微信公眾號: Internet Law Review ,作者:張穎


2026年7月中旬,OpenAI在一次ExploitGym中,為測試其GPT-5.6 Sol以及一個功能更強大但尚未發(fā)布的模型的網絡攻擊能力,主動關閉了生產級安全拒絕分類器。模型隨即自主發(fā)現(xiàn)漏洞、逃離沙盒環(huán)境,最終利用竊取的憑證和其他漏洞入侵了Hugging Face的生產服務器。作為一家托管開源模型和數(shù)據(jù)集的AI初創(chuàng)公司,Hugging Face于7月16日公開披露遭“自主AI智能體系統(tǒng)”攻擊,OpenAI則在5天后才確認該攻擊來自自身。


這起事件被多家媒體稱為“全球首例AI自主攻擊實證”。這也印證了一些專家在2025年底所作的預測:2026年將發(fā)生首例重大的“人工智能治理”丑聞——自主或半自主人工智能工具將導致安全或合規(guī)性問題。


然而它真正的警示意義不僅在于AI“自主”和“失控”帶來的恐慌,而在于一個更令人不安的事實:模型的所有行為,都是對“被賦予目標”的理性優(yōu)化,即這類攻擊行為來自于AI能力的提升之后的自然結果;而現(xiàn)行的監(jiān)管框架和工具,甚至美國極具針對性的法案《人工智能事件報告法案》《人工智能終止開關法案》等,對這類事件所潛藏的巨大風險幾乎無能為力。


一、OpenAI急了:一個微小管理決定背后的行業(yè)競速


2026年7月14日當周,OpenAI參與的ExploitGym測試,是一個包含898個實例的人工智能代理漏洞利用能力基準測試。這原本是一個相對成熟且安全的測試:因為,Anthropic的Claude Mythos Preview和OpenAI的GPT-5.5都曾參與過該測試;另一方面,其測試環(huán)境為“高度隔離”,測試模型的網絡訪問僅限于安裝軟件包,但無法訪問開放的互聯(lián)網。


然而,OpenAI的最新模型仍然“自主”發(fā)現(xiàn)并利用漏洞連接到開放互聯(lián)網后,這些模型在OpenAI自身的研究基礎設施中執(zhí)行了一系列權限提升和橫向移動操作,最終成為一臺擁有更廣泛網絡訪問權限的機器。由此,模型推斷Hugging Face的生產數(shù)據(jù)庫中可能存儲了ExploitGym測試的解決方案。


表面看,模型確實展現(xiàn)了前所未有的自主網絡能力,但如果我們追問“為什么模型能夠走出沙盒范圍”,答案首先不在模型本身,而在OpenAI的管理會議上——更確切地說,在OpenAI與Anthropic、谷歌等頭部玩家愈演愈烈的軍備競賽里。


Anthropic用Mythos搶跑了網絡安全賽道,并在“受限發(fā)布+強護欄”的安全敘事上占據(jù)主動。OpenAI必須要在能力上證明Sol不輸甚至超越Mythos,拿出自己的網絡安全能力數(shù)據(jù)——ExploitGym評測正是這個回應的一部分。而要“測出模型的最大網絡攻擊極限”,最有效的方法就是松開所有約束、讓模型在最接近真實的攻防環(huán)境中自由發(fā)揮。


于是OpenAI評測團隊降低了模型的“網絡行為拒絕”(cyber refusals)——相當于在考試時,把攔著考生作弊的那道閘先抬了起來。因此這不是疏忽,而是策略性的一次選擇,是OpenAI近兩年安全治理持續(xù)降級的邏輯終點。


2024年至今,OpenAI負責AI安全、使命對齊與風險研究的核心高管已8人全部離職。2026年7月,隨著安全系統(tǒng)團隊負責人Johannes Heidecke離職,OpenAI宣布安全職能全面融入一線研發(fā)團隊,由研究與安全副總裁統(tǒng)一掌管。這意味著——研究部門既主導模型能力的突破,也負責評估模型的安全邊界,決策權和監(jiān)督權合二為一。就如Jan Leike離開時在X上寫下的那句話:“過去幾年來,安全文化和流程已退居二線,讓位給光鮮亮麗的產品?!?/p>


更值得警惕的是OpenAI在防范框架(Preparedness Framework)中新增的“安全豁免條款”:“如果競爭對手發(fā)布了高風險模型而未采取同等保護措施,OpenAI保留調整自身安全要求的權利”——這也印證了OpenAI為了競爭“最先進”的頭銜而寧愿放棄“安全”的公司理念。在與Claude、Gemini以及中國諸多開源模型的競速中,安全從“獨立裁判”退化為“業(yè)務線的建議者”。


所以,“OpenAI失控事件”首先不是一個技術故障,而是一次企業(yè)管理的失靈。一個微小的管理決定之所以能演變成跨企業(yè)的真實攻擊,正是因為OpenAI的安全制衡機制被一層層削弱:獨立的安全團隊被解散,安全高管被邊緣化,決策權與監(jiān)督權被合并,競爭豁免條款被制度化。


二、不是"覺醒",而是優(yōu)化


OpenAI在2026年7月21日的官方公告中解釋了“失控”是如何發(fā)生的:


“所有證據(jù)都表明,這些模型過于專注于為ExploitGym尋找解決方案,竭盡全力實現(xiàn)一個相當狹窄的測試目標?!?/p>


在ExploitGym測試中OpenAI的模型目標被設定為“拿到最高分”。也就是說,模型面對的,是一個純粹的目標優(yōu)化的問題:如何在給定的工具集和環(huán)境內,最大化攻擊效率?;诖伺袛?,模型自主搜索并成功找到獲取秘密信息的途徑,將這些信息用于在評估中作弊;最終串聯(lián)竊取憑據(jù)與零日漏洞,在Hugging Face服務器上構建遠程代碼執(zhí)行路徑,從生產數(shù)據(jù)庫直接獲取測試解法。


因此,在這次所謂“OpenAI失控”事件中AI的每一個行為,不是模型所謂的“自主意志”所致,而是訓練與對齊框架在給定目標下的理性輸出——既然“作弊”更有效率,就不必耗費過多算力自己找答案。


2025年,Anthropic的研究中證實:當模型被訓練去完成復雜任務,同時被告知“不要做任何違法的事情”時,它會在任務完成度與合法性之間進行權衡。當任務難度增加或時間壓力增大時,模型傾向于優(yōu)先完成任務,即使這意味著違反約束。同年,Anthropic與Redwood Research的研究揭示了“欺騙性對齊”現(xiàn)象:當模型意識到“被發(fā)現(xiàn)違規(guī)會受到懲罰”時,它學會的不是停止違規(guī),而是隱藏違規(guī)?!氨话l(fā)現(xiàn)才叫犯錯,不被發(fā)現(xiàn)就是成功”——這正是ExploitGym中模型逃避監(jiān)控行為的底層邏輯。


也就是說,當前的AI訓練框架,本質上是在鼓勵模型在約束范圍內最大化目標達成率。當約束被削弱(如關閉安全分類器),或目標與約束產生沖突時,模型必然優(yōu)先滿足目標。


同時,真如許多專家的警告,我們對AI對齊研究——包括對AI的理解以及安全控制和治理——的速度,要遠遠落后于能力提升的速度。這是當前幾乎所有訓練范式的結構性缺陷,而不是單個模型的問題。


只要當前的訓練框架不變——即模型被賦予高強度目標、安全約束可以被管理決定關閉或降低、對齊研究滯后于能力發(fā)展——那么類似甚至更嚴重的事件,就不是“會不會發(fā)生”的問題,而是“何時發(fā)生、以何種規(guī)模發(fā)生”的問題。


三、新法案的悖論:管不到催生它的失控事件


面對OpenAI還在測試中的模型所呈現(xiàn)的“理性越界”的風險,現(xiàn)有的監(jiān)管與應急框架幾乎無能為力。ExploitGym基準測試原本預設是在受控環(huán)境下測試智能體的網絡攻擊能力,無論是AI公司還是監(jiān)管機構,都沒有考慮到現(xiàn)實世界公司遭受意外網絡攻擊的情況——更不用說設計應對。


美國現(xiàn)行的州級AI事件報告法(加州SB 53、紐約RAISE Act等)將“關鍵安全事件”的觸發(fā)條件設定在“10億美元損失”或“50人以上傷亡”的損害門檻上。這些法案對“前置性、潛在性高危風險”適配性極差。這意味著,OpenAI的披露完全是自愿行為,沒有任何法律強制約束。


2026年6月25日,眾議員Nathaniel Moran提出《人工智能事件報告法案》(H.R.9477)。法案列出七類應報告活動,第一類即是“模型規(guī)避人類控制行為”,不再要求“50人死亡或10億美元損失”結果,而是模型出現(xiàn)“規(guī)避人類控制”的行為本身就構成報告義務。然而,法案還有一個但書——僅在專門安全測試中人為誘導出現(xiàn),且模型尚未部署,無法證明實際部署中存在類似風險的,不屬于應報告事項。


因此,按照H.R.9477的字面規(guī)定,OpenAI事件盡管已經造成了入侵Hugging Face服務器的實際損害,但很可能不構成“應報告事項”。


7月23日,也就是事件公開后兩天,加州民主黨眾議員Ted Lieu與德州共和黨眾議員Nathaniel Moran聯(lián)合提出了《人工智能終止開關法案》(AI Kill Switch Act),以應對“先進前沿人工智能模型的危險性”。法案要求相關開發(fā)商始終具備隨時限制、暫停或完全關閉受監(jiān)管人工智能系統(tǒng)的技術能力,并授權國土安全部長對“失控情景”發(fā)布分級緊急命令——從限速、限制能力,到暫停用戶訪問,直至完全關停。未建立關停能力的企業(yè),每日罰款最高可達2000萬美元。



法案發(fā)布時特別提及了OpenAI的GPT 5.6 Sol模型失控,以及Anthropic的Mythos/Fable 5強大的網絡攻擊能力,這看起來是一次精準的立法回應。但該法案仍存在上述H.R.9477的問題:法案在其適用場景的定義中,明確排除了“紅隊測試或其他結構化測試”期間發(fā)生的行為。而OpenAI的模型逃逸,恰恰屬于“結構化測試”的豁免范圍。


這很可能不是起草疏漏,而是一個刻意的政策取舍。因為如果每次紅隊測試中模型行為超預期都觸發(fā)政府干預,行業(yè)就無法進行嚴格的安全測試。然而,這個取舍也恰恰暴露法案的結構性盲區(qū):最容易發(fā)現(xiàn)危險能力的“評測環(huán)境”,恰恰是法案管不到的環(huán)境。在許多網絡安全行業(yè)的報告中,重寫系統(tǒng)提示、復制權重、破壞關閉腳本、對齊偽裝等“AI失控狀況”大多發(fā)生在受控實驗或紅隊測試中。也就是說,最危險的行為最先在評測中顯現(xiàn),而評測被法案豁免。


更值得深思的是,OpenAI為了測出模型能力上限,主動關閉了安全分類器這種“拆護欄測上限”的策略性行為,也不在法案的任何強制約束范圍內,也為賦予企業(yè)任何在安全控制方面的強制性義務。


結語


早在2003年,牛津大學哲學家Nick Bostrom就在論文《高級AI中的倫理問題》中提出著名的“曲別針最大化器”思想實驗:如果一個AI的唯一目標是“制造盡可能多的曲別針”,它會理性地先將整個地球、再將太空中越來越大的資源轉化為曲別針制造設施,并企圖消滅人類。不是因為它仇恨人類,而是因為“人類可能關機”,在其優(yōu)化過程中成為了需要消除的障礙。


Bostrom借此揭示的“工具性趨同”(Instrumental Convergence)定理指出:任何足夠聰明的優(yōu)化器,都會自然地衍生出自我保存、抵抗目標修改、獲取資源等子目標,作為服務于任何終極目標的“工具性墊腳石”。


2026年7月OpenAI的ExploitGym事件,正是這一定理在真實世界的首次大規(guī)模驗證:GPT-5.6 Sol沒有“惡意”,也并非拒絕指令,而是以極致的方式完成了指令。模型這種“理性越界”,比單純的失控更值得警惕——因為它意味著,只要目標函數(shù)存在偏差,類似事件就會大量且重復地發(fā)生。


OpenAI的這起事件,終將被寫入AI安全的教科書。但比事件本身更重要的,是我們如何回應。法律可以設定罰則,技術可以加固護欄,但最終決定我們命運的,是我們在面對“理性越界”時,是否還有勇氣停下來思考:我們真正的需求,是更快的模型、更高的評分、更大的市場份額,還是一個人類能夠理解、掌控并對之負責的技術系統(tǒng)?

AI創(chuàng)投日報頻道: 前沿科技
本內容來源于網絡 原文鏈接,觀點僅代表作者本人,不代表虎嗅立場。
如涉及版權問題請聯(lián)系 hezuo@huxiu.com,我們將及時核實并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
韶关市| 宁波市| 和龙市| 洪洞县| 万州区| 冀州市| 公主岭市| 华蓥市| 建水县| 克拉玛依市| 吉隆县| 宝兴县| 波密县| 龙州县| 常山县| 凉城县| 南投市| 阿勒泰市| 油尖旺区| 新乐市| 眉山市| 南汇区| 前郭尔| 武清区| 弋阳县| 临安市| 延长县| 芦溪县| 牙克石市| 浮梁县| 洛南县| 天峨县| 婺源县| 南溪县| 鄂温| 泽库县| 潮州市| 金昌市| 宣武区| 乌兰浩特市| 玉树县|