本文來自微信公眾號(hào): 劃重點(diǎn)KeyPoints ,編輯:重點(diǎn)君,作者:重點(diǎn)君
如果提到LLM路線的反對(duì)者,李飛飛和楊立昆(Yann LeCun)一定是繞不開的兩人。
近期,楊立昆在科技頻道Welch Labs詳細(xì)闡述了他反對(duì)僅依靠大語言模型(LLM)來通向AGI的理由,并說明了基于聯(lián)合嵌入預(yù)測(cè)架構(gòu)(JEPA)架構(gòu)的世界模型技術(shù)細(xì)節(jié)。
作為深度學(xué)習(xí)的主要推動(dòng)者之一,楊立昆認(rèn)為,單純的自回歸大語言模型與生成式AI無法實(shí)現(xiàn)通用人工智能(AGI),絕大部分人類智能來自于對(duì)真實(shí)世界的無監(jiān)督學(xué)習(xí)。如果AI只進(jìn)行逐字預(yù)測(cè)的文本生成,或者逐個(gè)像素預(yù)測(cè)的圖像生成,它就無法真正掌握物理世界的內(nèi)在運(yùn)行規(guī)律。
基于這樣的判斷,楊立昆試圖推進(jìn)一種不同于主流生成式大模型的研發(fā)方向:通過構(gòu)建在抽象表征空間內(nèi)進(jìn)行預(yù)測(cè)的JEPA架構(gòu),彌補(bǔ)AI在認(rèn)知與推理方面的能力缺失。
我們整理了這場(chǎng)訪談的主要信息,以下是重要內(nèi)容:
1.大語言模型追求復(fù)現(xiàn),而世界模型強(qiáng)調(diào)預(yù)測(cè)
在楊立昆看來,AI具備物理推理能力的層次要高得多。
生成式大模型是復(fù)現(xiàn)邏輯,模型本質(zhì)上是在重現(xiàn)訓(xùn)練數(shù)據(jù)中的統(tǒng)計(jì)規(guī)律,它的主要任務(wù)是模仿,只要輸出結(jié)果在視覺或語法上合理即可。
世界模型則是預(yù)測(cè)邏輯,模型的主要任務(wù)是推理。它必須在面對(duì)未知環(huán)境時(shí),準(zhǔn)確判斷行為產(chǎn)生的物理結(jié)果。AI的最終目標(biāo)是具備真正的常識(shí),成為能夠自主規(guī)劃和行動(dòng)的智能體。
2.大語言模型存在固有缺陷,世界模型才能通向AGI
楊立昆認(rèn)為,當(dāng)前的生成式大語言模型受制于自回歸機(jī)制。系統(tǒng)只是在計(jì)算下一個(gè)最可能出現(xiàn)的字符或像素,并未在全局層面建立對(duì)事物內(nèi)部邏輯的認(rèn)知。隨著輸出內(nèi)容的增加,誤差也會(huì)持續(xù)累加,最終必然導(dǎo)致嚴(yán)重偏離客觀事實(shí)的輸出結(jié)果。單純依靠擴(kuò)大模型參數(shù)量無法解決這一結(jié)構(gòu)性難題,概率統(tǒng)計(jì)過程本身無法直接轉(zhuǎn)化為嚴(yán)謹(jǐn)?shù)囊蚬评砟芰Α?/p>
而世界模型在系統(tǒng)內(nèi)部建立了反映現(xiàn)實(shí)邏輯的預(yù)測(cè)機(jī)制。這使得AI在實(shí)際執(zhí)行任務(wù)前,能夠先在抽象層面上準(zhǔn)確預(yù)判不同行動(dòng)路線的物理后果。這種基于客觀規(guī)律進(jìn)行內(nèi)部推演和決策的能力,改變了機(jī)器只能被動(dòng)響應(yīng)靜態(tài)數(shù)據(jù)的現(xiàn)狀,賦予AI主動(dòng)干預(yù)現(xiàn)實(shí)的基礎(chǔ)認(rèn)知,這是機(jī)器獲取通用人工智能的必要條件。
3.JEPA世界模型技術(shù)路線摒棄像素級(jí)預(yù)測(cè),轉(zhuǎn)向數(shù)學(xué)表征空間(Representation Space)
主流的生成式模型試圖重構(gòu)圖像或視頻的每一個(gè)視覺細(xì)節(jié)。由于物理世界充滿了不可預(yù)測(cè)的隨機(jī)干擾信息,這種嘗試往往會(huì)導(dǎo)致模型生成模糊的圖像,或者消耗極其龐大的計(jì)算資源。
與注重視覺生成效果的模型不同,JEPA架構(gòu)的主要特征在于剔除無用的環(huán)境細(xì)節(jié)。它通過孿生網(wǎng)絡(luò)(Siamese Networks)等結(jié)構(gòu),將輸入信息壓縮成高度概括的數(shù)學(xué)表征。這意味著模型不再需要完全還原環(huán)境,而是直接在抽象層面上預(yù)測(cè)事物的運(yùn)動(dòng)規(guī)律和發(fā)展趨勢(shì)。
JEPA目前已被用于提升機(jī)器視覺與物理推理能力,研究人員通過V-JEPA等模型,讓機(jī)器人在不依賴海量人工標(biāo)注數(shù)據(jù)的情況下,學(xué)會(huì)理解物體之間的相互作用。
4.解決表征坍塌(Representation Collapse)難題,世界模型即將迎來技術(shù)突破
為什么在抽象空間內(nèi)進(jìn)行預(yù)測(cè)的AI發(fā)展面臨困難?主要阻礙在于模型容易進(jìn)入表征坍塌的錯(cuò)誤狀態(tài)。在這種狀態(tài)下,模型會(huì)輸出恒定不變的錯(cuò)誤結(jié)果來強(qiáng)行匹配預(yù)測(cè)目標(biāo)。
為了解決這一難題,楊立昆團(tuán)隊(duì)采用了Barlow Twins等技術(shù)策略。通過最大化不同特征之間的信息差異,迫使模型學(xué)習(xí)真實(shí)有效的環(huán)境信息。隨著表征學(xué)習(xí)技術(shù)的成熟,基于JEPA的世界模型領(lǐng)域即將迎來大規(guī)模擴(kuò)展的技術(shù)突破時(shí)刻。
以下是楊立昆訪談實(shí)錄:
1.尋找取代LLM的全新架構(gòu):JEPA
主持人:人工智能傳奇人物楊立昆籌集了十億美元,用于探索人工智能的替代方案。與大型語言模型不同,楊立昆的方法既不以語言為基礎(chǔ),也不是生成式的,它在設(shè)計(jì)上就不會(huì)輸出文字、圖片或視頻。取而代之的是,他提出了JEPA方案。
JEPA不是單一的AI模型,而是一種全新的架構(gòu)或用于訓(xùn)練AI模型的框架。在人工智能和機(jī)器學(xué)習(xí)的許多成功案例中,模型都是通過給定輸入X來預(yù)測(cè)輸出Y進(jìn)行訓(xùn)練的。比如大型語言模型接收輸入文本X并被訓(xùn)練來預(yù)測(cè)接下來出現(xiàn)的文本Y;圖像分類器接收輸入圖像X并被訓(xùn)練來預(yù)測(cè)相應(yīng)的標(biāo)簽Y。
但JEPA的工作原理并非如此。在JEPA中,輸入X和輸出Y被分別輸入到名為編碼器(Encoder)的模型中。這些編碼器會(huì)返回一個(gè)數(shù)字向量或矩陣,也就是通常所說的嵌入(Embedding)。隨后,第三個(gè)被稱為預(yù)測(cè)器(Predictor)的模型會(huì)基于X的嵌入來預(yù)測(cè)Y的嵌入。
為什么這可能是構(gòu)建AI系統(tǒng)的一種更好方式?你認(rèn)為JEPA或者基于世界模型的方法未來有一天會(huì)取代LLM嗎?還是說它們其實(shí)是在解決不同的問題?
楊立昆:初期它們解決的是不同問題,但最終它們確實(shí)會(huì)取代LLM。因?yàn)長(zhǎng)LM雖然非常擅長(zhǎng)處理語言,但除此之外基本毫無建樹。在語言本身即為推理基底的領(lǐng)域,相比主流的生成式語言AI方法,它們的表現(xiàn)非常出色。
主持人:JEPA存在于聯(lián)合嵌入架構(gòu)(Joint Embedding Architectures)這一替代路徑上。有趣的是,楊立昆在這兩條路徑的發(fā)展初期都發(fā)揮了重要作用。
在這個(gè)由兩部分組成的系列訪談的第一部分中,我們將探索通往JEPA的這條替代路徑。我們將深入探討為什么楊立昆會(huì)在生成式架構(gòu)于語言領(lǐng)域嶄露頭角之時(shí)選擇放棄它,并探尋他在解決困擾聯(lián)合嵌入架構(gòu)多年的表示崩潰(Representation Collapse)問題時(shí)所獲得的靈感。最后我們將深入研究JEPA架構(gòu)本身。在第二部分中,我們將深入探討JEPA的實(shí)現(xiàn)方式,并看看這些模型與驅(qū)動(dòng)LLM的方法相比究竟表現(xiàn)如何。
楊立昆在20世紀(jì)80年代就預(yù)見到了這場(chǎng)變革的到來。當(dāng)時(shí)AI領(lǐng)域的大多數(shù)人正忙于構(gòu)建顯式編程而非從數(shù)據(jù)中學(xué)習(xí)的專家系統(tǒng),而他開創(chuàng)了卷積神經(jīng)網(wǎng)絡(luò)。25年后當(dāng)深度學(xué)習(xí)開始崛起并占據(jù)AI主導(dǎo)地位時(shí),突破性的深度學(xué)習(xí)模型AlexNet被發(fā)現(xiàn)與楊立昆在20世紀(jì)90年代提出的卷積網(wǎng)絡(luò)驚人地相似。
然而隨著深度學(xué)習(xí)在2010年代繼續(xù)高歌猛進(jìn),楊立昆和其他研究人員變得愈發(fā)擔(dān)憂,因?yàn)檫@種AI方法過度依賴帶標(biāo)簽的訓(xùn)練數(shù)據(jù)。AlexNet是在龐大且經(jīng)過精心標(biāo)注的ImageNet數(shù)據(jù)集上通過監(jiān)督學(xué)習(xí)進(jìn)行訓(xùn)練的,它被訓(xùn)練去匹配人類標(biāo)注者為每張圖像分配的標(biāo)簽。相比之下,兒童只需極少數(shù)明確標(biāo)記的示例就能學(xué)習(xí)到像“狗”這類概念且極具通用性的表示。
隨著手動(dòng)標(biāo)記數(shù)據(jù)成為監(jiān)督學(xué)習(xí)的瓶頸,人們對(duì)替代方法的興趣日益濃厚。強(qiáng)化學(xué)習(xí)讓模型通過與環(huán)境交互而非從標(biāo)記數(shù)據(jù)中學(xué)習(xí),它在2010年代中期經(jīng)歷了多次復(fù)興,Google DeepMind在Atari游戲以及高度復(fù)雜的圍棋(Go)上的突破性表現(xiàn)就凸顯了這一點(diǎn)。與此同時(shí)楊立昆等人探索了從無標(biāo)簽數(shù)據(jù)中學(xué)習(xí)的無監(jiān)督方法,其中包括一種被稱為自監(jiān)督學(xué)習(xí)(Self-supervised Learning)的變體,其標(biāo)簽直接取自數(shù)據(jù)本身。
楊立昆:大約在2015年,我開始在機(jī)器學(xué)習(xí)社區(qū)展示一張后來變成梗的幻燈片。我在上面說如果把智能比作一個(gè)蛋糕,那么自監(jiān)督學(xué)習(xí)就是蛋糕的主體,監(jiān)督學(xué)習(xí)是蛋糕上的糖霜,而強(qiáng)化學(xué)習(xí)只是頂端的那顆櫻桃。當(dāng)時(shí)人們對(duì)強(qiáng)化學(xué)習(xí)近乎瘋狂,所以我試圖告訴他們這種方法太低效了,永遠(yuǎn)不可能帶我們達(dá)到接近人類或動(dòng)物智能的水平。事實(shí)證明,自監(jiān)督學(xué)習(xí)的成功在文本和語言領(lǐng)域發(fā)生得要比在視覺等更自然的模態(tài)中快得多。

2.生成式模型在視覺領(lǐng)域的困境
主持人:楊立昆這里指的是通過預(yù)測(cè)下一個(gè)Token來訓(xùn)練大型語言模型(LLM)所取得的成功。OpenAI成立于2015年,最初致力于強(qiáng)化學(xué)習(xí),創(chuàng)建了OpenAIGym和Universe并在復(fù)雜的視頻游戲中展示了令人印象深刻的性能。
當(dāng)公司大部分精力都集中在強(qiáng)化學(xué)習(xí)上時(shí),Ilya Sutskever和Alec Radford等人開始對(duì)來自Google的一種新型神經(jīng)網(wǎng)絡(luò)架構(gòu)Transformer產(chǎn)生興趣。它最初是為語言翻譯設(shè)計(jì)的,但在實(shí)驗(yàn)過程中Radford嘗試了一種有趣的修改。他沒有讓Transformer將一種語言轉(zhuǎn)換為另一種語言,而是轉(zhuǎn)向了一種更簡(jiǎn)單的自監(jiān)督方法:訓(xùn)練文本被分解為序列,Transformer接收除了最后一個(gè)Token之外的所有內(nèi)容,并被訓(xùn)練來預(yù)測(cè)最后一個(gè)Token是什么。
Radford和他的OpenAI同事們?cè)谝粋€(gè)包含7000本書的龐大內(nèi)部數(shù)據(jù)集上訓(xùn)練了他們的Transformer。這個(gè)階段現(xiàn)在被稱為預(yù)訓(xùn)練(Pre-training),隨后他們使用標(biāo)準(zhǔn)的有監(jiān)督學(xué)習(xí)在特定的語言任務(wù)上進(jìn)一步訓(xùn)練模型。
這種兩階段訓(xùn)練方法效果顯著,在包括高中水平閱讀理解在內(nèi)的九項(xiàng)語言基準(zhǔn)測(cè)試中創(chuàng)下了新的SOTA結(jié)果,表現(xiàn)超越了針對(duì)每個(gè)單獨(dú)任務(wù)專門設(shè)計(jì)的架構(gòu)。Radford的模型也就是現(xiàn)在的GPT-1,雖然當(dāng)時(shí)沒有引起太多公眾關(guān)注,但它是一個(gè)巨大的突破,使模型擺脫了對(duì)人工標(biāo)注數(shù)據(jù)的依賴并開啟了前所未有的規(guī)?;?。
OpenAI的其他研究人員迅速領(lǐng)悟了這項(xiàng)研究的重要性,團(tuán)隊(duì)全力投入這種方法,在2019年激進(jìn)地?cái)U(kuò)展到GPT-2,2020年推出GPT-3,以及2022年發(fā)布ChatGPT。在2012年AlexNet是在約一百萬個(gè)樣本上訓(xùn)練的,而到2020年GPT-3的訓(xùn)練樣本量已達(dá)到數(shù)千億個(gè)。
有趣的是這種新出現(xiàn)的訓(xùn)練范式完全符合楊立昆幾年前的預(yù)測(cè):廣泛的自監(jiān)督預(yù)訓(xùn)練階段,隨后是監(jiān)督學(xué)習(xí),最后是強(qiáng)化學(xué)習(xí),將原始的下一個(gè)Token預(yù)測(cè)模型塑造成為一個(gè)實(shí)用的AI助手。然而盡管這些自監(jiān)督生成方法在語言領(lǐng)域取得了明顯突破,但在圖像和視頻數(shù)據(jù)方面的情況卻模糊得多。
楊立昆:我一直在研究視覺領(lǐng)域。最初的想法是使用生成式架構(gòu)來訓(xùn)練一個(gè)預(yù)測(cè)視頻中會(huì)發(fā)生什么的系統(tǒng),基本上就是在像素層級(jí)訓(xùn)練視頻后續(xù)的發(fā)展。
主持人:在GPT-1成功的前幾年,包括楊立昆在內(nèi)的研究人員曾嘗試將同樣的自監(jiān)督生成式方法應(yīng)用于視頻。在最直接的實(shí)現(xiàn)中,神經(jīng)網(wǎng)絡(luò)接收一系列視頻幀的RGB像素值,然后像GPT模型預(yù)測(cè)語言中的下一個(gè)Token一樣去預(yù)測(cè)下一幀的像素值。
然而當(dāng)我們使用這些模型來預(yù)測(cè)下一幀時(shí),結(jié)果是模糊的,而且這種模糊感在更長(zhǎng)周期的預(yù)測(cè)中會(huì)劇烈累積。大語言模型是自回歸(Autoregressive)的,當(dāng)ChatGPT回答問題時(shí)它一次生成一個(gè)Token,并在每一步將最新生成的Token傳回輸入端以產(chǎn)生下一個(gè)輸出。如果我們嘗試將這種自回歸方法應(yīng)用于下一幀視頻預(yù)測(cè)模型,結(jié)果會(huì)迅速退化為模糊的虛無。
生成式視頻預(yù)測(cè)方法產(chǎn)生的模糊幀并不是什么未解之謎。語言雖然復(fù)雜且不可預(yù)測(cè),但與視頻相比根本不算什么。語言模型使用固定大小的詞匯表,比如GPT-2擁有50257個(gè)離散輸出對(duì)應(yīng)下一個(gè)可能生成的Token。這種完全枚舉的方法在視頻領(lǐng)域行不通。
對(duì)于全高清視頻,在最一般的情況下每個(gè)像素可以取256個(gè)離散值,而我們擁有1920×1080×3個(gè)彩色像素。這意味著下一幀視頻可能有大約10的1500萬次方種可能性,這令可觀測(cè)宇宙中的原子數(shù)量都相形見絀。因此視頻預(yù)測(cè)模型不可能像語言模型那樣為每一個(gè)可能的下一幀提供離散輸出。相反那個(gè)時(shí)代的許多生成式視頻方法讓網(wǎng)絡(luò)直接輸出像素強(qiáng)度值,這種方法面臨的巨大挑戰(zhàn)是模型如何學(xué)習(xí)處理不確定性。
如果我們對(duì)比LLM學(xué)習(xí)補(bǔ)全句子“球彈向了xx地方”和一個(gè)預(yù)測(cè)球體彈跳視頻下一幀的神經(jīng)網(wǎng)絡(luò),就能清楚看到問題所在。在LLM訓(xùn)練案例中,模型在訓(xùn)練集中會(huì)看到各種示例,由于模型為每個(gè)Token都有獨(dú)立輸出,它基本上可以獨(dú)立更新這些概率。
但我們的視頻模型就沒有這么輕松了。如果數(shù)據(jù)集包含球從同一路徑開始運(yùn)動(dòng)然后向各個(gè)方向彈跳的視頻,由于模型被迫針對(duì)給定輸入直接預(yù)測(cè)單個(gè)輸出幀,面對(duì)這種歧義性它能做的最好處理就是預(yù)測(cè)這些結(jié)果的平均值。當(dāng)我們對(duì)視頻的像素值取平均時(shí),最終得到的就是一片模糊褪色的混亂畫面。
雖然這只是最天真的方法,在過去幾十年里人們也嘗試了許多圖像預(yù)測(cè)策略并取得了不同程度的成功,但這些自然產(chǎn)生的挑戰(zhàn)促使楊立昆等研究人員提出了一個(gè)有趣的問題:我們的模型真的必須是生成式的嗎?在GPT示例的關(guān)鍵預(yù)訓(xùn)練階段,模型是否具有生成能力其實(shí)并不重要。
在針對(duì)“預(yù)測(cè)下一個(gè)Token”進(jìn)行預(yù)訓(xùn)練之后,我們得到的是一個(gè)本質(zhì)上非常出色的自動(dòng)補(bǔ)全模型。但真正重要的是模型為了解決預(yù)測(cè)任務(wù)而學(xué)習(xí)到的內(nèi)部表示和特征,正是這些內(nèi)部表示使得預(yù)訓(xùn)練模型能夠被快速適配成強(qiáng)大的AI助手。語言上的下一個(gè)Token預(yù)測(cè)是智能的一種代理指標(biāo),事實(shí)證明這種方法效果驚人。但是否還有其他信號(hào)和方法可以用來學(xué)習(xí)構(gòu)建智能系統(tǒng)所需的強(qiáng)大內(nèi)部表示(Representations)呢?

3.聯(lián)合嵌入架構(gòu)的引入
楊立昆:與此同時(shí)在2017到2018年左右,我們開始意識(shí)到學(xué)習(xí)圖像表示的最佳系統(tǒng)是那些非生成式的系統(tǒng)。它們不進(jìn)行重構(gòu)。
你輸入一張圖像將其通過一個(gè)編碼器(Encoder),接著你嘗試引導(dǎo)這個(gè)編碼器在具備某些特性的前提下提取盡可能多的信息。例如你拍攝同一場(chǎng)景的兩張圖像,或者拍攝一張圖像并以某種方式對(duì)其進(jìn)行損壞或轉(zhuǎn)換。你將它們都通過Encoder運(yùn)行,然后告訴系統(tǒng)無論提取出什么,這兩張圖像的表示都應(yīng)該是相同的,因?yàn)樗鼈冊(cè)谡Z義上代表同一個(gè)事物。我
從90年代起就一直在研究這類聯(lián)合嵌入(Joint Embedding)的想法,這并不是新概念,我們以前稱之為孿生神經(jīng)網(wǎng)絡(luò)(Siamese Neural Net)。
主持人:楊立昆提到的孿生網(wǎng)絡(luò)是由他及其合作者于20世紀(jì)90年代初在貝爾實(shí)驗(yàn)室(Bell Labs)開發(fā)的,當(dāng)時(shí)是為了開發(fā)檢測(cè)欺詐簽名的系統(tǒng)。
該系統(tǒng)的工作原理是將一對(duì)簽名圖像輸入到兩個(gè)相同的神經(jīng)網(wǎng)絡(luò)副本中。這些網(wǎng)絡(luò)副本并非為了生成任何數(shù)據(jù)而訓(xùn)練,相反它們輸出的是數(shù)字向量也就是嵌入向量(Embedding Vectors)。
網(wǎng)絡(luò)副本在兩類樣本上進(jìn)行訓(xùn)練:正樣本包含一個(gè)參考簽名和一個(gè)非欺詐簽名,即出自同一人之手;負(fù)樣本包含一個(gè)參考簽名和一個(gè)欺詐簽名。對(duì)于欺詐樣本,網(wǎng)絡(luò)被訓(xùn)練為產(chǎn)生差異最大的嵌入向量;對(duì)于正樣本,則生成相似度最大化的嵌入向量。當(dāng)新簽名出現(xiàn)時(shí),我們可以將其傳入網(wǎng)絡(luò)計(jì)算出一個(gè)嵌入向量并與參考簽名生成的向量進(jìn)行比較,如果相似度不足該簽名將被檢測(cè)為偽造。
通過對(duì)簽名進(jìn)行聯(lián)合嵌入,孿生網(wǎng)絡(luò)學(xué)習(xí)到了簽名圖像中非常有用的內(nèi)部表示,值得注意的是這一過程無需學(xué)習(xí)預(yù)測(cè)或生成任何實(shí)際的簽名圖像。正如基于GPT的方法那樣,聯(lián)合嵌入為視頻模糊問題提供了一個(gè)潛在的可行解決方案。
楊立昆:你獲取一張圖像將其輸入編碼器,接著你嘗試引導(dǎo)這個(gè)編碼器提取盡可能多且具有特定屬性的信息。例如你拍攝同一場(chǎng)景的兩張圖像或者獲取一張圖像并對(duì)其進(jìn)行損壞或轉(zhuǎn)換。你將它們通過編碼器運(yùn)行并告訴系統(tǒng),無論提取出什么這兩張圖像的表示都應(yīng)該是相同的,因?yàn)樗鼈冊(cè)谡Z義上代表同一個(gè)事物。

4.攻克聯(lián)合嵌入的表示崩潰難題
主持人:所以這里的思路是,我們避開了在生成式模型中看到的視頻模糊問題。通過使用聯(lián)合嵌入架構(gòu),將經(jīng)過損壞或轉(zhuǎn)換處理的圖像或視頻副本映射到相似的嵌入向量。理想情況下,這個(gè)經(jīng)過訓(xùn)練的模型將學(xué)習(xí)到圖像或視頻的有用的內(nèi)部表示,我們可以將其重新用于其他任務(wù),正如GPT模型在預(yù)訓(xùn)練期間學(xué)習(xí)內(nèi)部表示并最終被調(diào)整為AI助手的行為一樣。
然而這種聯(lián)合嵌入(Joint Embedding)策略存在一個(gè)巨大的問題。由于我們訓(xùn)練網(wǎng)絡(luò)的目的是使原始圖像或視頻與損壞后的版本盡可能相似,網(wǎng)絡(luò)可能會(huì)找到一個(gè)平凡解,即無論傳入什么輸入,它都簡(jiǎn)單地返回相同的嵌入向量。如果網(wǎng)絡(luò)學(xué)會(huì)了對(duì)任何輸入都輸出全1的向量,那么它對(duì)于同一圖像的受損和未受損視圖都會(huì)返回全1,從而使產(chǎn)生的相似度最大化,但實(shí)際上并沒有學(xué)到任何有用的東西。這個(gè)問題被稱為表示崩潰(RepresentationCollapse)。
在楊立昆最初的孿生網(wǎng)絡(luò)(SiameseNetwork)方法中,團(tuán)隊(duì)使用了如今被稱為對(duì)比學(xué)習(xí)(ContrastiveLearning)的方法來避免表示崩潰,并在訓(xùn)練時(shí)為網(wǎng)絡(luò)提供正負(fù)樣本。事實(shí)證明這種對(duì)比方法同樣適用于圖像和視頻,我們可以訓(xùn)練網(wǎng)絡(luò)使其對(duì)同一底層圖像或視頻的不同視圖輸出相似的嵌入,而對(duì)不同的圖像或視頻輸出不同的嵌入。
這些對(duì)比方法雖然在圖像和視頻領(lǐng)域取得了成功,但在擴(kuò)大規(guī)模時(shí)卻面臨困境,往往需要海量的計(jì)算資源和龐大的負(fù)樣本庫(kù)才能學(xué)習(xí)到有意義的表示。楊立昆認(rèn)為在最壞的情況下,對(duì)比樣本的數(shù)量可能會(huì)隨表示維度的增加呈指數(shù)級(jí)增長(zhǎng)。
到2010年代末,楊立昆等人已經(jīng)清楚認(rèn)識(shí)到,使用生成式模型去完全重建圖像和視頻并不是自監(jiān)督學(xué)習(xí)的有效路徑。但當(dāng)時(shí)業(yè)界并沒有一個(gè)直接的解決方案來處理表示崩潰問題,這也阻礙了聯(lián)合嵌入架構(gòu)學(xué)習(xí)到與大語言模型同等強(qiáng)大的通用內(nèi)部表示。
楊立昆:很明顯,對(duì)于圖像和視頻這類信號(hào)采用重建的方法并不是個(gè)好主意。后來我恍然大悟,因?yàn)槲覀儺?dāng)時(shí)用來訓(xùn)練聯(lián)合嵌入架構(gòu)的方法多少有些取巧。直到我和Meta的幾位博士后同事,特別是阿德里安·巴德斯(AdrienBardes)做了一些研究,他提出了一種名為BarlowTwins的技術(shù)。這項(xiàng)技術(shù)基于計(jì)算神經(jīng)科學(xué)和機(jī)器學(xué)習(xí)領(lǐng)域的一個(gè)古老理念,杰夫·辛頓(GeoffreyHinton)也曾研究過類似觀點(diǎn),即系統(tǒng)需要有某種衡量信息內(nèi)容的標(biāo)準(zhǔn)并嘗試將其最大化。著名的理論神經(jīng)科學(xué)家霍勒斯·巴洛(HoraceBarlow)在這方面做過一些開創(chuàng)性的基礎(chǔ)研究。
主持人:這里楊立昆引用的是霍勒斯·巴洛的研究工作。1961年巴洛提出假設(shè),認(rèn)為動(dòng)物和人類視覺系統(tǒng)中的神經(jīng)元是通過減少相互之間的冗余信息來運(yùn)作的。2020年,楊立昆的博士后研究員斯蒂芬·德尼(StephaneDeny)基于對(duì)巴洛研究的了解,提出將巴洛的理念應(yīng)用于網(wǎng)絡(luò)輸出端,以此作為避免表示崩潰的一種途徑。
在我們討論的聯(lián)合嵌入架構(gòu)中,嵌入向量是由網(wǎng)絡(luò)最后一層的人工神經(jīng)元生成的。如果嵌入向量長(zhǎng)度為128,那么每個(gè)網(wǎng)絡(luò)的輸出層就包含128個(gè)神經(jīng)元。如果傳入一批多樣的圖像并觀察遍歷過程,第一個(gè)神經(jīng)元可能在狗的照片上強(qiáng)烈激活,但在貓的照片上則無反應(yīng)。
在聯(lián)合嵌入方法中,網(wǎng)絡(luò)接收同一批圖像的變形視圖,其核心目的就是讓同一底層圖像生成的嵌入表示趨于相似。因此我們希望第二個(gè)網(wǎng)絡(luò)中第一個(gè)神經(jīng)元的輸出能與第一個(gè)網(wǎng)絡(luò)中第一個(gè)神經(jīng)元的輸出保持高度一致。標(biāo)準(zhǔn)架構(gòu)只需測(cè)量并最大化這兩個(gè)向量的相似度即可,但這極易導(dǎo)致網(wǎng)絡(luò)簡(jiǎn)單地為所有輸入輸出相同值,即發(fā)生表示崩潰。
引入巴洛的假設(shè)后,團(tuán)隊(duì)選擇通過計(jì)算兩個(gè)網(wǎng)絡(luò)輸出向量之間的互相關(guān)(Cross-Correlation)來減少不同神經(jīng)元輸出間的冗余。計(jì)算過程包括對(duì)每個(gè)向量進(jìn)行縮放并求點(diǎn)積,最終得到皮爾遜相關(guān)系數(shù)(PearsonCorrelationCoefficient)。為了減少冗余,我們希望這種相關(guān)性趨近于零。
將兩個(gè)編碼器的神經(jīng)元輸出分別垂直和水平排列,計(jì)算所有神經(jīng)元對(duì)之間的相關(guān)性并構(gòu)建成一個(gè)矩陣。由于聯(lián)合嵌入架構(gòu)的核心理念是為同一圖像的不同失真版本產(chǎn)生相似輸出,我們希望兩個(gè)編碼器中對(duì)應(yīng)的神經(jīng)元具有高度相關(guān)性,同時(shí)希望非對(duì)角線上對(duì)應(yīng)不同神經(jīng)元的元素相關(guān)性為零。理想狀態(tài)下,這個(gè)互相關(guān)矩陣應(yīng)該呈現(xiàn)為單位矩陣(IdentityMatrix)。
楊立昆及其合作者由此設(shè)計(jì)了一個(gè)全新的損失函數(shù),用于衡量互相關(guān)矩陣與單位矩陣之間的偏差。這種被稱為Barlow Twins的新方法效果驚人,它在成功學(xué)習(xí)訓(xùn)練圖像強(qiáng)大內(nèi)部表示的同時(shí),完美避開了表示崩潰的陷阱。團(tuán)隊(duì)采用了多種方法來驗(yàn)證這些內(nèi)部表示的質(zhì)量。
正如早期自監(jiān)督預(yù)訓(xùn)練讓GPT-1超越了純監(jiān)督模型一樣,當(dāng)時(shí)視覺任務(wù)最重要的基準(zhǔn)測(cè)試是ImageNet數(shù)據(jù)集的分類準(zhǔn)確率。2012年原始的AlexNet在驗(yàn)證集上實(shí)現(xiàn)了59.3%的準(zhǔn)確率。為了將自監(jiān)督的Barlow Twins與全監(jiān)督模型進(jìn)行直觀對(duì)比,團(tuán)隊(duì)使用了線性探測(cè)(LinearProbe)方法,即在凍結(jié)的Barlow Twins編碼器輸出端添加一層神經(jīng)元,并使用監(jiān)督學(xué)習(xí)進(jìn)行分類訓(xùn)練。結(jié)果令人矚目,該模型在ImageNet上達(dá)到了73.2%的準(zhǔn)確率,比全監(jiān)督的AlexNet高出整整10個(gè)百分點(diǎn)。
然而在2012年到2021年間,全監(jiān)督方法本身也取得了長(zhǎng)足進(jìn)步,例如谷歌團(tuán)隊(duì)在2020年將Transformer架構(gòu)應(yīng)用于圖像分類,創(chuàng)下了88.6%的新紀(jì)錄。因此到2021年,盡管自監(jiān)督學(xué)習(xí)在視覺任務(wù)中進(jìn)展迅猛,但其綜合表現(xiàn)仍略遜于最頂尖的全監(jiān)督方法。在語言領(lǐng)域推動(dòng)大模型快速發(fā)展的生成式預(yù)訓(xùn)練范式,在圖像和視頻領(lǐng)域依然難以跑通。
楊立昆:事實(shí)證明我們選擇的是一條正確的道路。在那之后我們發(fā)布了Barlow Twins的簡(jiǎn)化版VICReg,效果同樣出色。與此同時(shí)我們?cè)诎屠璧耐乱苍谘芯款愃坡肪€,最終演變成了DINO系列。這也是一種JEPA技術(shù),事實(shí)非常明確,聯(lián)合嵌入在圖像表示的自監(jiān)督學(xué)習(xí)方面具有顯著優(yōu)勢(shì)。

主持人:2025年8月發(fā)布的DINOv3論文標(biāo)志著視覺領(lǐng)域的一個(gè)重要轉(zhuǎn)折點(diǎn)。它利用聯(lián)合嵌入架構(gòu)實(shí)現(xiàn)了88.4%的極高圖像準(zhǔn)確率,緊逼當(dāng)前行業(yè)的最先進(jìn)水平。
正如作者在論文中所述,這是自監(jiān)督學(xué)習(xí)首次在圖像分類任務(wù)上達(dá)到與監(jiān)督模型相匹敵的成果。DINOv3在零人工標(biāo)簽介入的情況下展現(xiàn)出的表征學(xué)習(xí)能力令人震撼。它為分析的每個(gè)圖像塊(Patch)輸出一個(gè)嵌入向量。如果從測(cè)試圖像的手部區(qū)域提取嵌入向量并與圖像其他部分進(jìn)行相似度比對(duì),DINO能夠精準(zhǔn)地將手部從復(fù)雜背景中完美分割出來,這種能力同樣適用于球、貓或書本等任何物體。
在Barlow Twins、VICReg和DINOv1取得連串成功后,楊立昆于2022年將這些思路凝練成了一篇長(zhǎng)達(dá)60頁(yè)的重磅立場(chǎng)論文《邁向自主機(jī)器智能之路》(A Path Towards Autonomous Machine Intelligence)。與他以往專注于機(jī)器學(xué)習(xí)具體技術(shù)細(xì)節(jié)的論文不同,這篇文章采用基于第一性原理的全局視角,深刻探討了我們究竟該如何構(gòu)建真正的智能機(jī)器。論文首先犀利指出,目前的AI方法距離人類的學(xué)習(xí)能力還差得很遠(yuǎn),比如一名青少年只需20小時(shí)左右的練習(xí)就能熟練掌握開車技能。
楊立昆:這基本上就是Tesla正在努力的方向。但是他們距離真正實(shí)現(xiàn)Level3至Level5的自動(dòng)駕駛還差得很遠(yuǎn)。然而一個(gè)17歲的少年只需幾個(gè)小時(shí)的練習(xí)就能學(xué)會(huì)開車。這究竟是如何實(shí)現(xiàn)的?難道我們不應(yīng)該弄清楚這背后隱藏的智能奧秘嗎?我的核心推測(cè)是,這個(gè)奧秘就是世界模型(WorldModels)。

5.世界模型:邁向自主機(jī)器智能
主持人:楊立昆壓下重注的論斷是:現(xiàn)代AI缺失的最關(guān)鍵一環(huán)正是世界模型,即能夠?qū)ξ锢硎澜邕\(yùn)行規(guī)律做出準(zhǔn)確預(yù)測(cè)的模型。正如他在2022年論文中所闡釋的,常識(shí)本質(zhì)上可以被視為一系列世界模型的集合,它們負(fù)責(zé)告訴智能體什么是可能的、什么是合理的以及什么是絕對(duì)不可能的。憑借這些世界模型,動(dòng)物只需極少量的試錯(cuò)就能掌握新技能,它們能夠預(yù)判自身行為的后果,進(jìn)而進(jìn)行推理、規(guī)劃、探索并為復(fù)雜問題構(gòu)思出全新的解決方案。楊立昆進(jìn)一步論證,聯(lián)合嵌入架構(gòu)為構(gòu)建這種世界模型提供了最堅(jiān)實(shí)的底層基礎(chǔ)。
楊立昆:JEPA代表聯(lián)合嵌入預(yù)測(cè)架構(gòu)(聯(lián)合嵌入PredictiveArchitecture)。其運(yùn)行機(jī)制是先獲取對(duì)世界的當(dāng)前觀測(cè)狀態(tài),再獲取下一個(gè)觀測(cè)狀態(tài),并將它們依次通過編碼器進(jìn)行處理。隨后預(yù)測(cè)器會(huì)嘗試根據(jù)時(shí)間t的狀態(tài)去預(yù)測(cè)時(shí)間t+1的狀態(tài),你還可以通過輸入具體的動(dòng)作指令來對(duì)預(yù)測(cè)過程進(jìn)行干預(yù)和調(diào)節(jié),這樣你就獲得了一個(gè)完整的世界模型。
主持人:舉個(gè)具體的例子,與其使用傳統(tǒng)的生成式架構(gòu)去逐個(gè)預(yù)測(cè)視頻下一幀的龐大像素值,我們完全可以將視頻當(dāng)前幀和下一幀映射到精簡(jiǎn)的嵌入空間中。然后訓(xùn)練一個(gè)預(yù)測(cè)器模型,讓它在給定當(dāng)前視頻嵌入的情況下直接預(yù)測(cè)下一幀的嵌入。在這種實(shí)現(xiàn)機(jī)制下,JEPA架構(gòu)成功將模型從預(yù)測(cè)海量像素的繁重且低效的任務(wù)中解脫出來,使預(yù)測(cè)器能夠全神貫注于分析場(chǎng)景中經(jīng)過編碼器篩選的那些核心顯著特征。楊立昆在這里提出了一個(gè)極佳的思維實(shí)驗(yàn)。
楊立昆:如果你訓(xùn)練一個(gè)模型來預(yù)測(cè)行車記錄儀畫面中接下來會(huì)發(fā)生什么,傳統(tǒng)的生成式模型會(huì)把極其寶貴的算力資源浪費(fèi)在預(yù)測(cè)道路兩旁樹葉的隨機(jī)擺動(dòng)上,這些內(nèi)容本質(zhì)上毫無預(yù)測(cè)規(guī)律可言,卻占據(jù)了畫面中大量移動(dòng)的像素。
主持人:正如楊立昆之前提到的,我們可以通過引入動(dòng)作條件將JEPA的應(yīng)用邊界進(jìn)一步拓寬。在V-JEPA2的研究中,團(tuán)隊(duì)將機(jī)械臂接收到的具體動(dòng)作信號(hào)作為約束條件輸入到JEPA模型中。JEPA在觀察機(jī)械臂及其所處環(huán)境的連續(xù)圖像序列時(shí),不僅要通過訓(xùn)練預(yù)測(cè)下一幀畫面的嵌入表示,還要同步處理發(fā)送給機(jī)械臂的控制信號(hào)。這使得預(yù)測(cè)器能夠深度學(xué)習(xí)并準(zhǔn)確預(yù)測(cè)出各種不同的控制指令將如何實(shí)際改變機(jī)械臂在未來嵌入圖像中的空間位置。
這種經(jīng)過充分學(xué)習(xí)的世界模型隨后就可以直接用于機(jī)器人的復(fù)雜規(guī)劃與精密控制。給定一張代表目標(biāo)狀態(tài)的圖像(例如將杯子移出平臺(tái)),該圖像被傳入下一幀編碼器生成目標(biāo)狀態(tài)的嵌入。在此基礎(chǔ)上,系統(tǒng)可以使用控制算法在世界模型中進(jìn)行預(yù)演和探索,測(cè)試各種假設(shè)性的動(dòng)作干預(yù),最終反向推導(dǎo)出一系列能夠引導(dǎo)模型預(yù)測(cè)狀態(tài)完美匹配目標(biāo)狀態(tài)的最優(yōu)動(dòng)作序列。正如楊立昆所評(píng)價(jià)的,這確實(shí)是用前沿架構(gòu)對(duì)一個(gè)經(jīng)典舊理念的全新重塑。
楊立昆:你構(gòu)建了一個(gè)強(qiáng)大的模型,它能根據(jù)當(dāng)前的世界狀態(tài)以及你設(shè)想采取的控制動(dòng)作,精準(zhǔn)提供下一個(gè)時(shí)間步的世界狀態(tài)。一旦擁有了這個(gè)模型,你就可以在虛擬空間中預(yù)測(cè)任意動(dòng)作序列的最終結(jié)果,并通過數(shù)學(xué)優(yōu)化計(jì)算出一條最優(yōu)的操作路徑以達(dá)成特定目標(biāo)。這是非常經(jīng)典的優(yōu)化控制(OptimalControl)理論,其歷史淵源可以追溯到20世紀(jì)50年代末的蘇聯(lián)以及60年代初的西方學(xué)術(shù)界。
主持人:這確實(shí)是控制理論中極其經(jīng)典的核心內(nèi)容。
楊立昆:是的。但這套架構(gòu)中不那么經(jīng)典的部分在于,你需要用最前沿的機(jī)器學(xué)習(xí)技術(shù)來從零訓(xùn)練這個(gè)模型。更具顛覆性的是,你還要讓網(wǎng)絡(luò)自行學(xué)習(xí)出一種高度抽象的輸入狀態(tài)表示,并在這個(gè)抽象的狀態(tài)空間中完成模型的學(xué)習(xí)閉環(huán),這正是JEPA的精髓所在。
讓我拋出一個(gè)可能會(huì)得罪不少硅谷同行的爭(zhēng)議性觀點(diǎn)。我根本無法理解你們?cè)趺茨茉O(shè)想去構(gòu)建一個(gè)高級(jí)的智能體系統(tǒng),卻不賦予它預(yù)測(cè)自身行為后果的基礎(chǔ)能力。變分自編碼器(VAE)做不到這一點(diǎn),當(dāng)前火熱的大語言模型也同樣不具備世界模型。它們根本無法在行動(dòng)前預(yù)判自己的輸出會(huì)造成什么后果,它們只是盲目地生成token采取行動(dòng),然后就像某位法國(guó)國(guó)王所說的那樣——“我死后哪怕洪水滔天”。
如果你真的想構(gòu)建安全可靠的智能體系統(tǒng),它們絕對(duì)必須具備預(yù)測(cè)行為后果的能力,只有這樣它們才能合理規(guī)劃行動(dòng)序列以完成復(fù)雜任務(wù),并在此過程中嚴(yán)格確保安全護(hù)欄不被突破。在這樣的系統(tǒng)里,推理過程已經(jīng)演變成了一個(gè)嚴(yán)密的搜索與推演過程,而不再是簡(jiǎn)單的自回歸預(yù)測(cè)。這就是世界模型的全部核心理念與終極價(jià)值。
