本文來自微信公眾號(hào): 字母AI ,作者:袁心玥,原文標(biāo)題:《Gemini 3.5 Pro難產(chǎn),谷歌先交了兩張草稿紙》
7月21日,谷歌突然上線了兩個(gè)新模型:
Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。
沒有一點(diǎn)點(diǎn)防備,也沒有一絲顧慮,它倆就這樣出現(xiàn)在了Google AI Studio和Gemini的模型選擇器里。

這兩個(gè)模型,一個(gè)主打更強(qiáng)的代碼和Agent能力,一個(gè)主打更低成本的大規(guī)模調(diào)用。
而作為旗艦?zāi)P偷腉emini 3.5Pro,千呼萬喚依然……出不來。
按照此前的計(jì)劃,3.5 Pro本應(yīng)在6月份上線,現(xiàn)在7月都過一大半了,這款被寄予厚望的模型仍然沒有正式亮相。
代表旗艦實(shí)力的答卷遲遲不交,谷歌先拿出兩張“草稿紙”,是個(gè)什么意思?
3.6 Flash:比上一代便宜,不比上一代聰明
谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash進(jìn)一步提升了編碼、推理和工具調(diào)用表現(xiàn),同時(shí)通過減少輸出token降低運(yùn)行成本。

Gemini 3.6 Flash的定位是一個(gè)面向真實(shí)生產(chǎn)環(huán)境的高效模型,或者更直白一點(diǎn),為Agent服務(wù)。
在Agent時(shí)代,一次任務(wù)可能需要幾十輪模型調(diào)用,這意味著模型不僅要聰明,還必須足夠快、足夠便宜。
Google此前已經(jīng)在Gemini 3.5 Flash上強(qiáng)化了這條路線。根據(jù)官方API文檔,Gemini 3.5 Flash支持100萬token的長(zhǎng)上下文,可以一次處理大量信息,同時(shí)支持代碼執(zhí)行、調(diào)用外部工具、搜索文件等能力,能夠完成更復(fù)雜、更長(zhǎng)時(shí)間的任務(wù)。
Gemini 3.6 Flash延續(xù)了這條路線,它追求的并不是單次回答的質(zhì)量,是一個(gè)“能夠承擔(dān)得起每日真實(shí)工作”的位置。
Gemini 3.6 Flash的定價(jià)如下:
輸入:1.50美元/百萬token
輸出:7.50美元/百萬token
相比此前Gemini 3.5 Flash每百萬token輸入1.5美元、輸出9美元的價(jià)格,輸入成本沒有變化,但輸出成本進(jìn)一步下降。
對(duì)于需要大量調(diào)用AI的企業(yè)來說,這種成本變化可能比benchmark上的幾個(gè)百分點(diǎn)提升更加重要。
另外,谷歌展示的一項(xiàng)內(nèi)部測(cè)試顯示,在完成同一任務(wù)時(shí),Gemini 3.6 Flash相比3.5 Flash減少了55.8%的token消耗,同時(shí)將任務(wù)評(píng)分從85分提升到了100分。
當(dāng)然,這只是谷歌自己的測(cè)試結(jié)果,只能說明Google希望展示的方向:
新模型不僅更省,而且能夠用更少的計(jì)算完成同樣甚至更好的任務(wù)。

在那些被公開的benchmark里,谷歌主要強(qiáng)調(diào)的是代碼能力和Agent能力。
在DeepSWE代碼評(píng)測(cè)中,Gemini 3.6 Flash得分49%,高于上一代的37%。谷歌表示,新模型能夠減少無效代碼修改和重復(fù)執(zhí)行過程。
在測(cè)試AI操作電腦能力的OSWorld-Verified評(píng)測(cè)中,Gemini 3.6 Flash得分83%,超過3.5 Flash的78.4%。
而在面向機(jī)器學(xué)習(xí)任務(wù)的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明顯提升。

不過,上述數(shù)據(jù)更多說明Gemini 3.6 Flash相比上一代有所進(jìn)步。
如果放到當(dāng)前大模型競(jìng)爭(zhēng)中橫向比較,Google選擇的對(duì)手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(這里也可以看出這個(gè)產(chǎn)品的定位)。
從結(jié)果來看,Gemini 3.6 Flash并沒有全面領(lǐng)先,GPT和Claude的模型在復(fù)雜軟件工程和知識(shí)工作任務(wù)上仍然保持優(yōu)勢(shì)。
但這其實(shí)也是Flash系列存在的意義:
它不一定要成為最強(qiáng)模型,只需要在明顯低于旗艦?zāi)P统杀镜那闆r下,提供夠用的能力。

官方測(cè)評(píng)之外,根據(jù)Artificial Analysis的發(fā)布前測(cè)試,Gemini 3.6 Flash在Intelligence Index上拿到了50分,與Gemini 3.5 Flash持平。
這意味著,如果只看模型綜合“智力”,Gemini 3.6 Flash并沒有什么升級(jí)。

但是呢,它的速度又很好地彌補(bǔ)了這一點(diǎn)。
Artificial Analysis還統(tǒng)計(jì)了模型完成Intelligence Index任務(wù)所需的平均時(shí)間。結(jié)果顯示,Gemini 3.6 Flash每項(xiàng)任務(wù)平均耗時(shí)約1.3分鐘,相比上一代3.5 Flash的約2.7分鐘,減少了一半。
與此同時(shí),Gemini 3.5 Flash-Lite的任務(wù)完成時(shí)間也從上一代3.1 Flash-Lite的約1.6分鐘,下降到約0.6分鐘。

總的來說,Gemini 3.6 Flash的升級(jí)方向其實(shí)是效率——更少的token消耗,更低的運(yùn)行成本,以及更適合長(zhǎng)期運(yùn)行的Agent能力。
對(duì)于習(xí)慣使用Gemini 3.5 Flash的用戶來說,確實(shí)是非常不錯(cuò)的升級(jí)。
3.5 Flash-Lite:更快,但沒有上一代便宜
然后再來看另一個(gè)模型Gemini 3.5 Flash-Lite。
顧名思義,F(xiàn)lash-Lite是Flash系列中更輕量的版本,相比Flash,它犧牲了一部分能力上限,換取了更低的成本和更快的速度。

就像前面提到的那樣,Gemini 3.5 Flash-Lite的任務(wù)完成時(shí)間從上一代3.1 Flash-Lite的約1.6分鐘,下降到了約0.6分鐘。
3.5 Flash-Lite也是3.5系列中速度最快的型號(hào),根據(jù)Artificial Analysis測(cè)試數(shù)據(jù),其生成速度達(dá)到約350 token/秒,已經(jīng)屬于當(dāng)前主流大模型中的高速水平。
Gemini 3.5 Flash-Lite的定價(jià)如下:
輸入:0.30美元/百萬token
輸出:2.50美元/百萬token
相比Gemini 3.6 Flash,輸入價(jià)格約為1/5,輸出價(jià)格約為1/3。不過,與上一代Gemini 3.1 Flash-Lite相比,新模型并沒有進(jìn)一步降價(jià)。
雖然Gemini 3.5 Flash-Lite由于能力提升,可以通過減少輸出量降低部分成本,但綜合起來,還是很難抵消單價(jià)上的成本增加。
根據(jù)官方文檔,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等級(jí)(thinking levels)下都有明顯提升。開發(fā)者可以根據(jù)任務(wù)需求調(diào)整模型的思考深度。
此外,Gemini 3.5 Flash-Lite還內(nèi)置了Computer Use能力,可以幫助Agent更可靠地操作電腦環(huán)境,完成跨應(yīng)用任務(wù)。
在具體測(cè)試中,Gemini 3.5 Flash-Lite相比上一代模型也有明顯提升:在Terminal-Bench 2.1編程Agent測(cè)試中,成績(jī)從31%提升到54%;在測(cè)試長(zhǎng)上下文理解能力的GDM-MRCR v2中,從60.1%提升到72.2%;在更貼近真實(shí)工作場(chǎng)景的GDPval-AA v2任務(wù)執(zhí)行測(cè)試中,從642提升到1140。

值得注意的是,在一些Agent和代碼相關(guān)測(cè)試中,Gemini 3.5 Flash-Lite甚至超過了上一代更高定位的Gemini 3 Flash模型。
例如,在SWE-Bench Pro軟件工程測(cè)試中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在測(cè)試AI操作電腦能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成績(jī)超過Gemini 3 Flash的65.1%。
這意味著,隨著模型能力不斷提升,過去需要更大模型才能完成的部分Agent任務(wù),正在逐漸下沉到更便宜、更快速的模型。

順便一提,除了前兩個(gè)面向普通用戶的通用模型,谷歌還推出了Gemini 3.5 Flash Cyber。
它主要針對(duì)網(wǎng)絡(luò)安全場(chǎng)景。根據(jù)官方文檔,在CodeMender系統(tǒng)中,多個(gè)Gemini 3.5 Flash Cyber Agent可以協(xié)同工作,分別完成不同分析任務(wù),并最終匯總成一份完整報(bào)告。在網(wǎng)絡(luò)安全基準(zhǔn)測(cè)試CyberGym中,F(xiàn)lash Cyber也達(dá)到了接近前沿模型的表現(xiàn)。

該模型目前不會(huì)公開提供,僅通過CodeMender平臺(tái)向政府和可信合作伙伴開放。
3.5 Pro:谷歌遲遲交不出的旗艦答卷
如果說Gemini 3.6 Flash和Gemini 3.5 Flash-Lite還可以看作是谷歌對(duì)AI規(guī)?;瘧?yīng)用的判斷,那么Gemini 3.5 Pro則代表著谷歌的模型上限。
但問題在于:這份答卷,到現(xiàn)在還沒有交出來。
5月I/O的時(shí)候,谷歌表示Gemini 3.5 Pro將在“接下來一個(gè)月左右”推出,也就是預(yù)計(jì)在今年6月上線。現(xiàn)在7月都過了一大半了。
據(jù)彭博社7月16日?qǐng)?bào)道,Gemini 3.5 Pro的發(fā)布時(shí)間已經(jīng)落后原計(jì)劃數(shù)月。谷歌正在繼續(xù)優(yōu)化模型能力,尤其是編碼表現(xiàn),希望達(dá)到內(nèi)部設(shè)定的目標(biāo)。
路透社最新的報(bào)道則顯示,截至目前,谷歌仍未公布具體上線時(shí)間,只表示該模型正在與合作伙伴測(cè)試,并將“很快”推出;另有新聞稿透露,Gemini 4的訓(xùn)練工作已經(jīng)開始了。
而我們都知道,“很快”就是不確定的意思。

Gemini 1.0發(fā)布時(shí)就曾因演示爭(zhēng)議受到質(zhì)疑;Gemini 1.5 Pro憑借百萬token上下文短暫扳回局面,但隨后Claude和GPT系列快速追趕;直到Gemini 3系列發(fā)布,谷歌才重新獲得“回到前沿競(jìng)爭(zhēng)”的評(píng)價(jià)。
如今Gemini 3.5 Pro再次延期,市場(chǎng)關(guān)注的已經(jīng)不只是一個(gè)模型什么時(shí)候上線,還有谷歌到底能否保持旗艦?zāi)P偷母?jìng)爭(zhēng)節(jié)奏問題。
何況谷歌透露出的編碼表現(xiàn)不及預(yù)期,并不是什么容易解決的小問題。
隨著Agent開始進(jìn)入企業(yè)工作流,代碼能力的重要性迅速提升。一個(gè)模型能否理解復(fù)雜項(xiàng)目、修改真實(shí)代碼、完成多步驟開發(fā)任務(wù),已經(jīng)成為衡量它是否具備實(shí)際生產(chǎn)價(jià)值的重要指標(biāo)。
路透社指出,華爾街正在等待Gemini 3.5 Pro,因?yàn)樗鼘⒊蔀榕袛郍oogle DeepMind是否能夠跟上OpenAI和Anthropic的重要指標(biāo)。
當(dāng)然,谷歌并不是沒有動(dòng)作,這次推出的幾個(gè)模型,恰說明谷歌正在強(qiáng)化另一條路線:讓AI變得更便宜、更容易規(guī)模化。
谷歌CEO Sundar Pichai近期也多次強(qiáng)調(diào)成本優(yōu)勢(shì),并表示企業(yè)如果將大部分AI工作負(fù)載遷移到Gemini模型,可以每年節(jié)省超過10億美元。
但問題在于,市場(chǎng)在期待一份證明谷歌模型實(shí)力的“答卷”,谷歌交出的卻是兩張關(guān)于效率和成本的“草稿紙”——很難不讓人覺得,谷歌在用Flash系列填補(bǔ)Pro延遲留下的空檔。
有意思的是,在Gemini 3.5 Pro延期的同時(shí),AI競(jìng)爭(zhēng)格局正在發(fā)生變化。
過去,人們討論AI領(lǐng)先者,主要關(guān)注海外“御三家”:OpenAI、Anthropic和Google DeepMind。
但最近,GLM-5.2、Kimi K3等國(guó)產(chǎn)模型也開始進(jìn)入前沿競(jìng)爭(zhēng),并引發(fā)了大量討論。
前沿模型的追趕速度正在加快,也讓谷歌的問題變得更加緊迫,它當(dāng)然可以繼續(xù)大力推出Flash模型,但前提是它的旗艦?zāi)P妥銐蚪o力——只要硬實(shí)力足夠,自有大儒為他辯經(jīng)。
如果谷歌最終推出一個(gè)真正領(lǐng)先的旗艦?zāi)P?,那么Flash路線會(huì)成為完整體系的一部分:Pro負(fù)責(zé)突破能力上限;Flash負(fù)責(zé)規(guī)模化應(yīng)用。
但如果Gemini 3.5 Pro持續(xù)落后,市場(chǎng)很可能會(huì)繼續(xù)追問:谷歌擁有最強(qiáng)AI研究資源,為什么卻無法穩(wěn)定跑贏競(jìng)爭(zhēng)對(duì)手?
在Alphabet本周舉行第二季度財(cái)報(bào)電話會(huì)議時(shí),人們很可能會(huì)進(jìn)一步詢問有關(guān)Gemini 3.5 Pro的更多細(xì)節(jié)。
