本文來(lái)自微信公眾號(hào): 愛(ài)范兒 ,作者:關(guān)注明日產(chǎn)品的,原文標(biāo)題:《蘋(píng)果的「空間重構(gòu)」,與一臺(tái) 90 年代的「欺詐相機(jī)」|硬哲學(xué)》
蘋(píng)果在即將正式推出的iOS 27中,給相機(jī)/相冊(cè)做了一個(gè)「空間重構(gòu)」(Spatial Reframing)功能:
開(kāi)啟「空間重構(gòu)」后,用手指在照片上劃動(dòng),你會(huì)發(fā)現(xiàn)照片像是有了「深度」;如果繼續(xù)劃動(dòng),出現(xiàn)了原圖中被遮擋的區(qū)域,Apple Intelligence會(huì)實(shí)時(shí)生成填補(bǔ)。通過(guò)「空間重構(gòu)」你可以對(duì)原圖的場(chǎng)景,創(chuàng)建一個(gè)從并未被拍攝的角度「拍攝」出的副本。

一張靜態(tài)的照片,原本不攜帶任何深度信息。而蘋(píng)果利用在空間計(jì)算的經(jīng)驗(yàn),可以從中推斷出深度。
這里還有幾組照片,看看效果:
對(duì)不起,我騙了大家。雖然看起來(lái)很像,但這些并不是「空間重構(gòu)」的樣片。
但如果我告訴你,這是一臺(tái)來(lái)自上世紀(jì)的古董相機(jī)拍出來(lái)的,你會(huì)不會(huì)稍微有點(diǎn)驚訝?
以上照片,是膠片攝影師Jason Kummerfeldt(YouTube:@grainydays)用一臺(tái)發(fā)布于1989年的Nishika N8000膠片相機(jī)所拍攝下來(lái)的,原理簡(jiǎn)單且暴力:
它平行放置了4個(gè)鏡頭,可以同時(shí)拍下4張同一場(chǎng)景、視角平行但具有細(xì)微差異的照片——更準(zhǔn)確來(lái)說(shuō),4張135畫(huà)幅的半格照片,占用兩格膠片的位置。
Nishika的宣傳策略是將其定位為「能拍攝35mm膠卷的3D相機(jī)」。至于如何實(shí)現(xiàn)所謂的3D效果,則需用戶將膠卷回寄給Nishika,由該公司沖洗并印刷成具有所謂「裸眼3D」效果的光柵照片:
光柵照片算不上黑科技,但在上世紀(jì)末,一臺(tái)能自己拍出裸眼3D的相機(jī)還是頗具想象力的。只是這個(gè)美妙而前衛(wèi)的創(chuàng)意背后,卻藏著一套復(fù)雜的騙局:
首先,Nishika這個(gè)名字給人營(yíng)造出一種日式精密光學(xué)的感覺(jué),然而該公司注冊(cè)于美國(guó)內(nèi)華達(dá),總部位于拉斯維加斯郊區(qū),生產(chǎn)則在香港以及中國(guó)大陸完成。
其次,產(chǎn)品本身的質(zhì)量也令人難以恭維:低質(zhì)量塑膠鏡頭,對(duì)焦采用小光圈泛焦,快門(mén)固定1/60秒;機(jī)身看起來(lái)像是單反,內(nèi)部卻沒(méi)有棱鏡,頂部凸起只是空心塑料殼;機(jī)頂貼著偽裝成液晶屏幕的貼紙,熱靴其實(shí)是冷靴;Nishika甚至在機(jī)身里塞了一塊配重,只為讓手感顯得沉甸甸。
Nishika的主要銷售策略是通過(guò)電話或郵購(gòu)渠道購(gòu)買(mǎi),后來(lái)甚至還發(fā)展出了幾乎原樣復(fù)刻安利的傳銷模式——果不其然,在產(chǎn)品問(wèn)世一年后就被美國(guó)監(jiān)管部門(mén)以電信欺詐等罪名發(fā)起調(diào)查。
1994年,Nishika因資不抵債宣告破產(chǎn),其運(yùn)營(yíng)的光柵沖印服務(wù)也隨之消失,讓N8000回歸成了一臺(tái)質(zhì)素令人難以恭維,但又在半格攝影這件事上打了雞血的垃圾相機(jī),二級(jí)價(jià)格一度跌至幾美元。
合成全新的視角
愛(ài)好者圈子里總會(huì)有兩種商家:一種站在巨人的肩膀上攫取利潤(rùn),商業(yè)上成功但被所有人所鄙視;另一種用熱愛(ài)開(kāi)創(chuàng)新的空間,推動(dòng)領(lǐng)域進(jìn)步,但往往商業(yè)上難以持續(xù)。
Nishika屬于前者,而另一家名為Nimslo的公司,也是Nishika幾乎全部的技術(shù)來(lái)源,屬于后者。
如果說(shuō)Nishika的故事是一場(chǎng)打著高科技幌子的跨國(guó)傳銷騙局,那么Nimslo則更像是真正具備技術(shù)、志向遠(yuǎn)大,卻最終悲情離場(chǎng)的「天才發(fā)明家」。
上世紀(jì)70年代,香港工程師盧國(guó)華(Allen Kwok Wah Lo)實(shí)現(xiàn)了從多鏡頭3D膠片相機(jī)到光柵印刷的全流程閉環(huán),攻克了高精度立體攝影的難題。
美國(guó)商人杰瑞·尼姆斯(Jerry Nims)嗅到了商機(jī),在香港和盧國(guó)華一起合伙組建了公司,后來(lái)又將總部搬到了美國(guó)亞特蘭大,并在1976年提交了專利。他們的公司名叫Nimslo——取自二人的姓。
Nimslo的第一款同名產(chǎn)品Nimslo 3D相機(jī)于1982年問(wèn)世。該公司還得到了天美時(shí)手表(Timex)的老板、挪威船王弗雷德·歐爾森(Fred Olsen)注資1700萬(wàn)美元,并且將生產(chǎn)線設(shè)在了蘇格蘭的天美時(shí)工廠。
雄心勃勃的Nimslo原本計(jì)劃年產(chǎn)40萬(wàn)臺(tái)3D相機(jī),然而一系列致命災(zāi)難接踵而至,將公司拖向深淵。
首批相機(jī)出貨時(shí),天美時(shí)蘇格蘭工廠爆發(fā)罷工,Nimslo臨時(shí)找日方外包,錯(cuò)過(guò)上市黃金期;光柵照片無(wú)法在常規(guī)照相館印刷,用戶必須寄回美國(guó)唯一指定中心進(jìn)行沖洗和印刷,而且工藝的限制導(dǎo)致廢片率高,收費(fèi)昂貴,消費(fèi)者需要等待數(shù)周時(shí)間,體驗(yàn)極差。
Nimslo 3D采用4顆日本制造的高品質(zhì)光學(xué)玻璃鏡頭,自動(dòng)曝光系統(tǒng)還能夠根據(jù)光線自動(dòng)調(diào)節(jié)光圈快門(mén),在當(dāng)時(shí)相當(dāng)先進(jìn);純金屬機(jī)身緊湊,做工扎實(shí),輕巧且高級(jí)——代價(jià)是在當(dāng)時(shí)高達(dá)200美元的售價(jià)(折合今天700美元左右)。而考慮到前述的印刷體驗(yàn)問(wèn)題,產(chǎn)品的實(shí)用性并不高。
在燒光數(shù)千萬(wàn)美元的投資之后,Nimslo終于撐不住了,在1986年宣布破產(chǎn)。而如果你看到下面這張兩款產(chǎn)品的對(duì)比圖,應(yīng)該明白過(guò)來(lái):Nishika把Nimslo給接盤(pán)了。產(chǎn)品配置全方位縮水,加上前面提到的種種欺詐玩法,卻仍然沒(méi)有拯救這家新公司以及4眼3D相機(jī)的命運(yùn)。
當(dāng)今天的人們談?wù)撈鹂臻g攝影/空間計(jì)算的先驅(qū),想起的可能是蘋(píng)果「空間重構(gòu)」、Vision Pro,或是2016年iPhone 7 Plus的「人像模式」(雙攝背景虛化)。
也可能是14年HTC One M8的后期重對(duì)焦,或者18年Facebook的3D Photos——這些都是「單張照片+深度信息=空間照片」的大規(guī)模消費(fèi)級(jí)應(yīng)用。
更別提在相機(jī)領(lǐng)域,還有光場(chǎng)相機(jī)這樣的怪物存在。
Nishika以及它的前身Nimslo,并不是典型意義上的空間攝影先驅(qū)。
但是,如果我們靜下心來(lái)想一下,由Nimslo所創(chuàng)造并首次在消費(fèi)級(jí)產(chǎn)品上完成實(shí)踐的多鏡頭相機(jī),和空間重構(gòu)、人像虛化、重對(duì)焦、3D照片——它們其實(shí)都在解決同一個(gè)圖形學(xué)、光學(xué)、AI領(lǐng)域的難題:
「新視角合成」(Novel View Synthesis)。
從21世紀(jì)10年代開(kāi)始,人類所掌握的技術(shù)就已足以「憑空」合成出并不存在的相機(jī)視角。先輩們的解題思路,是直接堆砌鏡頭。而這一思路的集大成者??赡芫褪恰腹鈭?chǎng)相機(jī)」。
光場(chǎng)相機(jī)的故事
公允來(lái)講,Lytro并沒(méi)有受到Nimslo的影響。但你會(huì)發(fā)現(xiàn)這兩者在很多角度上都極為相似。
盡管兩者分處模擬(analog)時(shí)代的末尾和數(shù)字(digital)時(shí)代的全盛,在相隔半個(gè)世紀(jì)的時(shí)間里走著不同的路,Lytro多鏡頭陣列的思路事實(shí)上與Nimslo試圖解決的,是同一個(gè)難題。
在Lytro的所有公開(kāi)資料中,沒(méi)有任何將其與Nimslo建立關(guān)聯(lián)的提及。但將兩家公司的專利、所做的事情放在一起,會(huì)發(fā)現(xiàn)它們用不同的語(yǔ)言描述同一個(gè)欲望。這不算是抄襲,更像是在各自時(shí)代獨(dú)立攻克同一個(gè)問(wèn)題——頗似牛頓和萊布尼茨各自發(fā)現(xiàn)微積分——當(dāng)然,Nimslo的工作要「粗淺」的多。
這個(gè)定論或許夸張,但如果我們回溯Lytro的學(xué)術(shù)傳承,就會(huì)發(fā)現(xiàn)兩者相似的端倪。
時(shí)間回到20世紀(jì)初,法國(guó)物理學(xué)家加布里埃爾·李普曼(Gabriel Lippmann)發(fā)明了基于光的干涉現(xiàn)象進(jìn)行彩色攝影的方法,在1908年榮獲諾貝爾物理學(xué)獎(jiǎng)。
在另一項(xiàng)攝影試驗(yàn)當(dāng)中,李普曼在感光乳劑前放置了一層緊密排列的小型球面透鏡陣列,使得單張成像介質(zhì)可以記錄從多個(gè)略微不同位置拍攝的「場(chǎng)景圖像」;觀片時(shí),觀察者移動(dòng)頭部就能看到這些從不同角度記錄的畫(huà)面。李普曼將其命名為「積分?jǐn)z影」(integral photography)。
受制于材料技術(shù),李普曼只能提出理論,無(wú)法提供實(shí)驗(yàn)結(jié)果。但這成為后世光場(chǎng)相機(jī)和「新視角合成」的重要理論基礎(chǔ)。
整個(gè)20世紀(jì),相關(guān)概念在零零落落的學(xué)術(shù)文獻(xiàn)當(dāng)中有所提及,實(shí)踐層面則一直沒(méi)有進(jìn)展。直到1996年,斯坦福大學(xué)圖形學(xué)教授馬克·勒沃伊(Marc Levoy)和帕特·漢拉罕(Pat Hanrahan)在SIGGRAPH上發(fā)表了著名的「光場(chǎng)渲染」論文。他們不僅提出了光場(chǎng)數(shù)據(jù)的數(shù)學(xué)表示,還搭建了能夠驗(yàn)證理論的物理裝置:在一個(gè)房間里擺滿相機(jī),全部連接到和冰箱一樣大的超級(jí)計(jì)算機(jī)上。
盡管算力需求恐怖,整套裝備也太大,勒沃伊等人證明了一件事:只要捕捉了足夠的光場(chǎng)數(shù)據(jù),就可以在后期合成的虛擬空間中自由移動(dòng)觀察點(diǎn),生成從未被真實(shí)拍攝過(guò)的視角?!感乱暯呛铣伞箷r(shí)隔一個(gè)世紀(jì),終于迎來(lái)曙光。
2002年,馬來(lái)西亞人吳義仁本科畢業(yè)后加入了勒沃伊領(lǐng)導(dǎo)的斯坦福圖形實(shí)驗(yàn)室(Stanford Graphics Lab),延續(xù)光場(chǎng)理論的實(shí)踐研究。
有一次給朋友的女兒拍照,小女孩太活潑,每次按下快門(mén)都拍糊了?!赣袥](méi)有辦法,能夠先拍照,后對(duì)焦?」
這個(gè)想法在吳義仁的腦海中揮之不去,他花了大半年的時(shí)間里在實(shí)驗(yàn)室和自己的家中,組裝出了世界上第一臺(tái)能真正工作的手持光場(chǎng)相機(jī)原型:一臺(tái)康泰時(shí)645中畫(huà)幅單反相機(jī),掛載了一個(gè)在當(dāng)時(shí)極為奢侈的飛思H20中畫(huà)幅1600萬(wàn)像素?cái)?shù)碼后背。
但真正的魔法在于吳義仁自行改裝的微透鏡陣列:在主鏡頭與CCD的光路之間,插入一塊定制的塑料微透鏡陣列薄片,由大約292 x 400個(gè)微小透鏡組成。
每個(gè)微透鏡都會(huì)在傳感器上投影出微小的光圈像,使得傳感器不僅記錄了光線的平面位置,還可以后期用算法來(lái)還原光線入射的角度。

2006年,吳義仁的博士論文「數(shù)字光場(chǎng)攝影」(Digital Light Field Photography)斬獲ACM(計(jì)算機(jī)學(xué)會(huì))最佳博士論文獎(jiǎng)。
畢業(yè)后,吳義仁暫別學(xué)術(shù)界,創(chuàng)立了光場(chǎng)攝影技術(shù)公司Lytro。2011年,第一代Lytro相機(jī)上市,它將吳義仁在斯坦福期間改裝原型機(jī)的光路機(jī)構(gòu)原版復(fù)刻,但實(shí)現(xiàn)了小型化,裝進(jìn)了一個(gè)看起來(lái)像是萬(wàn)花筒的設(shè)備里,當(dāng)時(shí)售價(jià)399美元。
這款產(chǎn)品在當(dāng)時(shí)引發(fā)震動(dòng),傳聞史蒂夫·喬布斯專門(mén)找到吳義仁了解關(guān)于光場(chǎng)攝影的更多細(xì)節(jié),研究該技術(shù)是否有利于改進(jìn)iPhone。
正如前面提到,Lytro從未在公開(kāi)和已知的私下場(chǎng)合提及Nimslo/Nishika,但兩家公司的定位確驚人般相似:他們都曾宣稱自己是「繼柯達(dá)和寶麗來(lái)之后攝影的第三次革命?!?/p>
冥冥之間,Lytro也復(fù)制了Nimslo的命運(yùn):第一代產(chǎn)品的分辨率對(duì)于2011年水平來(lái)說(shuō)實(shí)在太低,第二代Illum的定價(jià)高達(dá)1599美元,盡管極具前沿屬性,仍然無(wú)法得到市場(chǎng)的認(rèn)可。
反倒是2014年的HTC One M8,只用雙攝像頭和簡(jiǎn)單的后期算法就做出了重對(duì)焦功能,摸到了Lytro的七成功力——實(shí)際這就足夠了,畢竟One M8除了準(zhǔn)光場(chǎng)攝影能力之外,還是一臺(tái)無(wú)鎖價(jià)格$649的智能手機(jī)。
2016年,Lytro的商業(yè)實(shí)踐基本宣告終結(jié),其消費(fèi)業(yè)務(wù)的相關(guān)資產(chǎn)、專利以及絕大部分員工被Google收入囊中。(巧的是,次年Google也以類似的方式包攬了HTC的消費(fèi)業(yè)務(wù)與專利)。
Lytro的遺產(chǎn)像種子被風(fēng)吹散,在別處生根發(fā)芽:在Google,Lytro的部分前員工和資產(chǎn)專利構(gòu)成了VR/AR以及Pixel部門(mén)的技術(shù)儲(chǔ)備;還有一部分前員工去了比Lytro晚幾年成立的硅谷相機(jī)公司Light,延續(xù)光場(chǎng)攝影的理想。
下圖中就是Light開(kāi)發(fā)的光場(chǎng)相機(jī)L16。同樣令人唏噓的是,Light的結(jié)局并沒(méi)有逃離前輩Lytro的劇本,當(dāng)時(shí)大部分手機(jī)廠商已能將三、四顆攝像頭塞進(jìn)手機(jī),該公司后來(lái)也退出了消費(fèi)級(jí)市場(chǎng)。
開(kāi)枝散葉
Lytro創(chuàng)始人吳義仁離開(kāi)公司后重返學(xué)術(shù)界,前往UC伯克利任教。
他有兩個(gè)博士生:本·米爾登霍(Ben Mildenhall)和普拉圖爾·斯里尼瓦桑(Pratul Srinivasan)。他們后來(lái)在2020年提出了神經(jīng)輻射場(chǎng)(Neural Radiance Fields,NeRF)的全新概念。
NeRF不僅承襲了吳義仁的光場(chǎng)攝影技術(shù)研究,更顛覆了計(jì)算機(jī)對(duì)3D場(chǎng)景的表達(dá)方式:
在此之前,主流方法是「顯式表達(dá)」——點(diǎn)陣云、體素、3D mesh。這種方式在解決透明材質(zhì)、毛發(fā)、霧氣、反射等場(chǎng)景時(shí)效率不高,工作流也比較反人類;NeRF用「隱式表達(dá)」取而代之,不再需要定義具體的表面,而是利用神經(jīng)網(wǎng)絡(luò)將整個(gè)空間渲染成連續(xù)、帶有顏色和透明度的「非均勻迷霧」。
不夸張地說(shuō),NeRF是近年來(lái)計(jì)算機(jī)視覺(jué)和圖形學(xué)領(lǐng)域的最關(guān)鍵突破之一,可以被理解為3D領(lǐng)域的Transformer。
下圖就是單張照片使用NeRF渲染效果,是不是已經(jīng)很像光場(chǎng)攝影以及蘋(píng)果的「空間重構(gòu)」了?
它證明了神經(jīng)網(wǎng)絡(luò)本身可以作為全息的3D存儲(chǔ)介質(zhì):一個(gè)小小的模型權(quán)重文件就足以壓縮一個(gè)理論上分辨率無(wú)限、光影變化無(wú)限的世界。
NeRF還直接促進(jìn)了「神經(jīng)渲染」這一全新學(xué)科的繁榮。隨著Stable Diffusion、Midjourney等生成式AI技術(shù)爆發(fā)后,人們很快意識(shí)到可以利用NeRF將2D擴(kuò)散模型的先驗(yàn)知識(shí)應(yīng)用到3D領(lǐng)域。
今天所謂的「世界模型」,比如文生3D、圖像生成3D,以及影視和游戲工業(yè)中的AI生成資產(chǎn)——底層很多都是從NeRF衍生而來(lái)。不僅如此,NeRF還終結(jié)了早期視頻生成模型(如Sora 1等)的空間一致性幻覺(jué)。
2023年,3D高斯?jié)姙R(3DGS)的問(wèn)世,又解決了NeRF訓(xùn)練慢、渲染慢(無(wú)法做到實(shí)時(shí)60fps渲染)的問(wèn)題,可以說(shuō)在一定程度上「殺死」了NeRF。但3DGS也繼承了NeRF最核心的思想:可微體渲染以及基于圖像的逆向協(xié)同優(yōu)化。
在世界模型如火如荼的語(yǔ)境下,NeRF啟蒙了世界模型對(duì)于3D幾何和光影一致性的認(rèn)知,3DGS則成為其落地的工業(yè)基石。
如今,NeRF作者之一米爾登霍(下圖左)也是世界模型公司W(wǎng)olrd Labs的聯(lián)合創(chuàng)始人。
在學(xué)生忙著把博士論文變成產(chǎn)品的同時(shí),馬克·勒沃伊于2014年從斯坦福大學(xué)榮休,全職加入Google,進(jìn)行計(jì)算攝影方面的研究。
在勒沃伊的帶領(lǐng)下,Google的計(jì)算攝影團(tuán)隊(duì)走了一條不同的路:不在硬件上做功課,而是用算法與光影「玩游戲」,推出了備受用戶喜愛(ài)的Google Camera,以及后來(lái)的Pixel手機(jī)計(jì)算攝影技術(shù)。
在Nexus 6手機(jī)上首次推出的HDR+,會(huì)在按下快門(mén)時(shí)在緩存區(qū)里實(shí)時(shí)保存多張曝光數(shù)值各異的照片,然后合成出一張動(dòng)態(tài)范圍遠(yuǎn)超手機(jī)傳感器極限的照片。
HDR+的底層原理類似于曝光包圍,但算法的參與深度遠(yuǎn)超于此。它能夠分析所有圖像找到最清晰的一張進(jìn)行選擇性對(duì)齊,使用語(yǔ)義分割技術(shù)人臉并提亮,同時(shí)避免高光過(guò)曝和運(yùn)動(dòng)模糊。
為了突破成像的物理極限,你可以靠堆硬件來(lái)投機(jī)(Lytro),也可以用算法來(lái)取巧(HDR+)。而Levoy的團(tuán)隊(duì)很快證明了,算法不僅能夠突破極限,甚至可以無(wú)中生有。
2018年,Pixel手機(jī)推出Night Sight夜景模式,讓用戶即便在幾乎無(wú)光的環(huán)境下拍出干凈、細(xì)節(jié)充分、白平衡準(zhǔn)確的照片。效果過(guò)于震撼,被媒體形容為「魔法」。
Night Sight會(huì)自動(dòng)連續(xù)捕捉多幀長(zhǎng)曝光照片,用于算法融合??紤]到極暗環(huán)境下傳統(tǒng)測(cè)光會(huì)失效,白平衡容易被燈光帶偏,Google的魔法是引入了一個(gè)專門(mén)的、學(xué)習(xí)了日光下正確色彩的神經(jīng)網(wǎng)絡(luò),在Night Sight中負(fù)責(zé)「腦補(bǔ)」,修正色彩。
勒沃伊的團(tuán)隊(duì)對(duì)于Pixel人像模式同樣貢獻(xiàn)巨大:僅依靠單鏡頭配合神經(jīng)網(wǎng)絡(luò),即可從平面照片中「猜」出深度。在邊緣、毛發(fā)等難題上,僅靠單攝就能工作的Pixel一度勝過(guò)早期依賴雙目視覺(jué)的iPhone。
在2018年用一顆1200萬(wàn)像素的落后攝像頭,卻掀翻了所有對(duì)手堆滿硬件的桌子。勒沃伊在Google計(jì)算攝影方面的工作,給整個(gè)行業(yè)以及市場(chǎng)帶來(lái)了巨大的震撼。
行業(yè)終于明白了一個(gè)道理:手機(jī)相機(jī)的上限,其實(shí)不在硬件,而在算法。次年蘋(píng)果的夜間模式、三星的超視覺(jué)夜拍紛紛跟進(jìn),整個(gè)手機(jī)行業(yè)自那以后也全面步入拍照靠「算」的計(jì)算攝影時(shí)代。
2020年,勒沃伊離開(kāi)Google假如Adobe,擔(dān)任副總裁兼研究員。2025年,他輔導(dǎo)的團(tuán)隊(duì)推出了一個(gè)再次震撼手機(jī)攝影圈的項(xiàng)目。
它就是Project Indigo,重新定義了手機(jī)圖像處理管線,通過(guò)多幀合成、RAW域降噪、色彩重建等技術(shù),讓iPhone照片看起來(lái)像是用光學(xué)素質(zhì)遠(yuǎn)高于iPhone的專業(yè)相機(jī)所拍,進(jìn)一步突破硬件的極限。
Project Indigo收獲了幾乎一邊倒的好評(píng)。他實(shí)現(xiàn)甚至超越了「像單反」這個(gè)陳舊的目標(biāo),讓人們意識(shí)到,當(dāng)算法足夠強(qiáng)大,傳感器尺寸、鏡頭光學(xué)早已不再是手機(jī)攝影的瓶頸。
用有限的信息,創(chuàng)造無(wú)限視角
最后回到蘋(píng)果的「空間重構(gòu)」。
2022年,蘋(píng)果在ECCV上發(fā)表NeuMan論文,闡釋了用NeRF技術(shù)進(jìn)行人體模型和場(chǎng)景重建;去年,蘋(píng)果接連在ICLR、CVPR上接連發(fā)布Depth Pro、Matrix 3D、SHARP三篇論文,為「空間重構(gòu)」打好了研究基礎(chǔ)。
簡(jiǎn)單來(lái)說(shuō),空間重構(gòu)的研究分為兩個(gè)階段:一階段是單鏡頭估算深度,從照片中構(gòu)建深度圖;二階段是單鏡頭合成3D高斯?jié)姙R數(shù)據(jù),讓平面照片也能改變視角。

SHARP是一套前饋式神經(jīng)網(wǎng)絡(luò)。對(duì)比來(lái)看,NeRF需要為每個(gè)場(chǎng)景訓(xùn)練數(shù)十分鐘到數(shù)小時(shí),而SHARP只需要訓(xùn)練一次模型,完成后即可在任何照片上直接推理,1秒輸出上百萬(wàn)級(jí)的3D高斯點(diǎn)。
Depth Pro則解決了單鏡頭從平面照片中推斷深度這一更基礎(chǔ)的問(wèn)題,最快0.3秒就可輸出高質(zhì)量深度圖。
Depth Pro和SHARP合在一起,思路逐漸明朗:蘋(píng)果可以不再依賴多攝像頭實(shí)現(xiàn)相關(guān)功能,底線是一顆攝像頭就足以榨出所需的全部信息。

WWDC同期蘋(píng)果宣布,Vision Pro全景轉(zhuǎn)換、地圖鳥(niǎo)瞰體驗(yàn)等全面轉(zhuǎn)向3D高斯濺射。從OS 27這代開(kāi)始,戴上Vision Pro看一張全景照片,或打開(kāi)蘋(píng)果地圖飛越城市時(shí),看到的不再是傳統(tǒng)3D模型,而是數(shù)百萬(wàn)高斯點(diǎn)云實(shí)時(shí)渲染。
但是在前述的論文中,蘋(píng)果還是明確致敬了NeRF,稱其為「徹底改變了隱式3D場(chǎng)景表達(dá)與新視角合成的開(kāi)創(chuàng)性工作」。
一切始于19世紀(jì)攝影技術(shù)萌芽同期,人們對(duì)于「裸眼3D」的向往,現(xiàn)如今通過(guò)軟硬結(jié)合、AI算法等多種不同思路,我們已經(jīng)實(shí)現(xiàn)了對(duì)于光場(chǎng)的捕捉,甚至僅需單目視覺(jué)即可合成出極為精確的空間信息。
這是一部圍繞新視角合成這一經(jīng)典難題,橫跨200年的技術(shù)發(fā)展史。
從iPhone的攝像頭,到Lytro的光場(chǎng)照片,再到Nimslo的3D光柵成像,以及圍繞「計(jì)算攝影」這件事的無(wú)數(shù)偉大的發(fā)明和美好的體驗(yàn),它們指向一個(gè)相同的,古老的愿望:
用有限的信息,創(chuàng)造無(wú)限的視角。
