久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

原計(jì)劃6月上線的谷歌旗艦?zāi)P虶emini 3.5 Pro難產(chǎn),谷歌先推出兩款輕量化Gemini模型補(bǔ)位,凸顯大模型競(jìng)爭(zhēng)格局變化。 ## 1. 谷歌提前推出兩款輕量化Gemini模型補(bǔ)位 原定于今年6月發(fā)布的旗艦Gemini 3.5 Pro延期至7月仍未上線,谷歌7月21日突然上線Gemini 3.6 Flash、Gemini 3.5 Flash-Lite兩款模型,此外還面向特定場(chǎng)景推出了不公開的Gemini 3.5 Flash Cyber。 ## 2. Gemini 3.6 Flash:面向Agent場(chǎng)景的效率升級(jí) Gemini 3.6 Flash定位面向生產(chǎn)環(huán)境的高效Agent模型,延續(xù)低成本路線,輸入定價(jià)1.5美元/百萬token,輸出定價(jià)7.5美元/百萬token,相比上一代Gemini 3.5 Flash輸出成本下降16.7%。谷歌內(nèi)部測(cè)試顯示,同任務(wù)下該模型token消耗減少55.8%,任務(wù)評(píng)分從85提升至100;公開測(cè)評(píng)中代碼、Agent能力較上一代提升,綜合智力與上一代持平,但任務(wù)耗時(shí)從2.7分鐘降至1.3分鐘,整體定位是低成本提供夠用能力,未全面對(duì)標(biāo)領(lǐng)先旗艦?zāi)P汀? ## 3. Gemini 3.5 Flash-Lite:更高速的輕量成本優(yōu)化模型 Gemini 3.5 Flash-Lite是Flash系列的超輕量版本,生成速度達(dá)350 token/秒,任務(wù)耗時(shí)從上一代的1.6分鐘降至0.6分鐘;定價(jià)為輸入0.3美元/百萬token、輸出2.5美元/百萬token,綜合成本略高于上一代Gemini 3.1 Flash-Lite。該模型各項(xiàng)評(píng)測(cè)成績(jī)較上一代明顯提升,部分Agent和代碼測(cè)試成績(jī)已超過上一代更高定位的Gemini 3 Flash,體現(xiàn)出高端模型能力正在向下沉。 ## 4. Gemini 3.5 Pro延期引發(fā)行業(yè)對(duì)谷歌旗艦?zāi)芰Φ膿?dān)憂 谷歌此前Gemini系列起伏波動(dòng),Gemini 3.5 Pro被華爾街視為判斷谷歌能否跟上OpenAI、Anthropic節(jié)奏的核心指標(biāo),目前該模型因編碼表現(xiàn)未達(dá)內(nèi)部目標(biāo)延期,谷歌僅稱“很快推出”,同時(shí)已啟動(dòng)Gemini 4的訓(xùn)練。當(dāng)前大模型前沿競(jìng)爭(zhēng)已新增國(guó)產(chǎn)選手入場(chǎng),若Gemini 3.5 Pro硬實(shí)力不足,谷歌低成本規(guī)?;肪€也難以站穩(wěn)腳跟,其延期細(xì)節(jié)大概率會(huì)在谷歌第二季度財(cái)報(bào)電話會(huì)議被問詢。
Gemini 3.5 Pro難產(chǎn),谷歌先交了兩張草稿紙
2026-07-22 08:25

Gemini 3.5 Pro難產(chǎn),谷歌先交了兩張草稿紙

本文來自微信公眾號(hào): 字母AI ,作者:袁心玥,原文標(biāo)題:《Gemini 3.5 Pro難產(chǎn),谷歌先交了兩張草稿紙》


7月21日,谷歌突然上線了兩個(gè)新模型:


Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。


沒有一點(diǎn)點(diǎn)防備,也沒有一絲顧慮,它倆就這樣出現(xiàn)在了Google AI Studio和Gemini的模型選擇器里。



這兩個(gè)模型,一個(gè)主打更強(qiáng)的代碼和Agent能力,一個(gè)主打更低成本的大規(guī)模調(diào)用。


而作為旗艦?zāi)P偷腉emini 3.5Pro,千呼萬喚依然……出不來。


按照此前的計(jì)劃,3.5 Pro本應(yīng)在6月份上線,現(xiàn)在7月都過一大半了,這款被寄予厚望的模型仍然沒有正式亮相。


代表旗艦實(shí)力的答卷遲遲不交,谷歌先拿出兩張“草稿紙”,是個(gè)什么意思?


3.6 Flash:比上一代便宜,不比上一代聰明


谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash進(jìn)一步提升了編碼、推理和工具調(diào)用表現(xiàn),同時(shí)通過減少輸出token降低運(yùn)行成本。



Gemini 3.6 Flash的定位是一個(gè)面向真實(shí)生產(chǎn)環(huán)境的高效模型,或者更直白一點(diǎn),為Agent服務(wù)。


在Agent時(shí)代,一次任務(wù)可能需要幾十輪模型調(diào)用,這意味著模型不僅要聰明,還必須足夠快、足夠便宜。


Google此前已經(jīng)在Gemini 3.5 Flash上強(qiáng)化了這條路線。根據(jù)官方API文檔,Gemini 3.5 Flash支持100萬token的長(zhǎng)上下文,可以一次處理大量信息,同時(shí)支持代碼執(zhí)行、調(diào)用外部工具、搜索文件等能力,能夠完成更復(fù)雜、更長(zhǎng)時(shí)間的任務(wù)。


Gemini 3.6 Flash延續(xù)了這條路線,它追求的并不是單次回答的質(zhì)量,是一個(gè)“能夠承擔(dān)得起每日真實(shí)工作”的位置。


Gemini 3.6 Flash的定價(jià)如下:


輸入:1.50美元/百萬token


輸出:7.50美元/百萬token


相比此前Gemini 3.5 Flash每百萬token輸入1.5美元、輸出9美元的價(jià)格,輸入成本沒有變化,但輸出成本進(jìn)一步下降。


對(duì)于需要大量調(diào)用AI的企業(yè)來說,這種成本變化可能比benchmark上的幾個(gè)百分點(diǎn)提升更加重要。


另外,谷歌展示的一項(xiàng)內(nèi)部測(cè)試顯示,在完成同一任務(wù)時(shí),Gemini 3.6 Flash相比3.5 Flash減少了55.8%的token消耗,同時(shí)將任務(wù)評(píng)分從85分提升到了100分。


當(dāng)然,這只是谷歌自己的測(cè)試結(jié)果,只能說明Google希望展示的方向:


新模型不僅更省,而且能夠用更少的計(jì)算完成同樣甚至更好的任務(wù)。



在那些被公開的benchmark里,谷歌主要強(qiáng)調(diào)的是代碼能力和Agent能力。


在DeepSWE代碼評(píng)測(cè)中,Gemini 3.6 Flash得分49%,高于上一代的37%。谷歌表示,新模型能夠減少無效代碼修改和重復(fù)執(zhí)行過程。


在測(cè)試AI操作電腦能力的OSWorld-Verified評(píng)測(cè)中,Gemini 3.6 Flash得分83%,超過3.5 Flash的78.4%。


而在面向機(jī)器學(xué)習(xí)任務(wù)的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明顯提升。



不過,上述數(shù)據(jù)更多說明Gemini 3.6 Flash相比上一代有所進(jìn)步。


如果放到當(dāng)前大模型競(jìng)爭(zhēng)中橫向比較,Google選擇的對(duì)手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(這里也可以看出這個(gè)產(chǎn)品的定位)。


從結(jié)果來看,Gemini 3.6 Flash并沒有全面領(lǐng)先,GPT和Claude的模型在復(fù)雜軟件工程和知識(shí)工作任務(wù)上仍然保持優(yōu)勢(shì)。


但這其實(shí)也是Flash系列存在的意義:


它不一定要成為最強(qiáng)模型,只需要在明顯低于旗艦?zāi)P统杀镜那闆r下,提供夠用的能力。



官方測(cè)評(píng)之外,根據(jù)Artificial Analysis的發(fā)布前測(cè)試,Gemini 3.6 Flash在Intelligence Index上拿到了50分,與Gemini 3.5 Flash持平。


這意味著,如果只看模型綜合“智力”,Gemini 3.6 Flash并沒有什么升級(jí)。



但是呢,它的速度又很好地彌補(bǔ)了這一點(diǎn)。


Artificial Analysis還統(tǒng)計(jì)了模型完成Intelligence Index任務(wù)所需的平均時(shí)間。結(jié)果顯示,Gemini 3.6 Flash每項(xiàng)任務(wù)平均耗時(shí)約1.3分鐘,相比上一代3.5 Flash的約2.7分鐘,減少了一半。


與此同時(shí),Gemini 3.5 Flash-Lite的任務(wù)完成時(shí)間也從上一代3.1 Flash-Lite的約1.6分鐘,下降到約0.6分鐘。



總的來說,Gemini 3.6 Flash的升級(jí)方向其實(shí)是效率——更少的token消耗,更低的運(yùn)行成本,以及更適合長(zhǎng)期運(yùn)行的Agent能力。


對(duì)于習(xí)慣使用Gemini 3.5 Flash的用戶來說,確實(shí)是非常不錯(cuò)的升級(jí)。


3.5 Flash-Lite:更快,但沒有上一代便宜


然后再來看另一個(gè)模型Gemini 3.5 Flash-Lite。


顧名思義,F(xiàn)lash-Lite是Flash系列中更輕量的版本,相比Flash,它犧牲了一部分能力上限,換取了更低的成本和更快的速度。



就像前面提到的那樣,Gemini 3.5 Flash-Lite的任務(wù)完成時(shí)間從上一代3.1 Flash-Lite的約1.6分鐘,下降到了約0.6分鐘。


3.5 Flash-Lite也是3.5系列中速度最快的型號(hào),根據(jù)Artificial Analysis測(cè)試數(shù)據(jù),其生成速度達(dá)到約350 token/秒,已經(jīng)屬于當(dāng)前主流大模型中的高速水平。


Gemini 3.5 Flash-Lite的定價(jià)如下:


輸入:0.30美元/百萬token


輸出:2.50美元/百萬token


相比Gemini 3.6 Flash,輸入價(jià)格約為1/5,輸出價(jià)格約為1/3。不過,與上一代Gemini 3.1 Flash-Lite相比,新模型并沒有進(jìn)一步降價(jià)。


雖然Gemini 3.5 Flash-Lite由于能力提升,可以通過減少輸出量降低部分成本,但綜合起來,還是很難抵消單價(jià)上的成本增加。


根據(jù)官方文檔,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等級(jí)(thinking levels)下都有明顯提升。開發(fā)者可以根據(jù)任務(wù)需求調(diào)整模型的思考深度。


此外,Gemini 3.5 Flash-Lite還內(nèi)置了Computer Use能力,可以幫助Agent更可靠地操作電腦環(huán)境,完成跨應(yīng)用任務(wù)。


在具體測(cè)試中,Gemini 3.5 Flash-Lite相比上一代模型也有明顯提升:在Terminal-Bench 2.1編程Agent測(cè)試中,成績(jī)從31%提升到54%;在測(cè)試長(zhǎng)上下文理解能力的GDM-MRCR v2中,從60.1%提升到72.2%;在更貼近真實(shí)工作場(chǎng)景的GDPval-AA v2任務(wù)執(zhí)行測(cè)試中,從642提升到1140。



值得注意的是,在一些Agent和代碼相關(guān)測(cè)試中,Gemini 3.5 Flash-Lite甚至超過了上一代更高定位的Gemini 3 Flash模型。


例如,在SWE-Bench Pro軟件工程測(cè)試中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在測(cè)試AI操作電腦能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成績(jī)超過Gemini 3 Flash的65.1%。


這意味著,隨著模型能力不斷提升,過去需要更大模型才能完成的部分Agent任務(wù),正在逐漸下沉到更便宜、更快速的模型。



順便一提,除了前兩個(gè)面向普通用戶的通用模型,谷歌還推出了Gemini 3.5 Flash Cyber。


它主要針對(duì)網(wǎng)絡(luò)安全場(chǎng)景。根據(jù)官方文檔,在CodeMender系統(tǒng)中,多個(gè)Gemini 3.5 Flash Cyber Agent可以協(xié)同工作,分別完成不同分析任務(wù),并最終匯總成一份完整報(bào)告。在網(wǎng)絡(luò)安全基準(zhǔn)測(cè)試CyberGym中,F(xiàn)lash Cyber也達(dá)到了接近前沿模型的表現(xiàn)。



該模型目前不會(huì)公開提供,僅通過CodeMender平臺(tái)向政府和可信合作伙伴開放。


3.5 Pro:谷歌遲遲交不出的旗艦答卷


如果說Gemini 3.6 Flash和Gemini 3.5 Flash-Lite還可以看作是谷歌對(duì)AI規(guī)?;瘧?yīng)用的判斷,那么Gemini 3.5 Pro則代表著谷歌的模型上限。


但問題在于:這份答卷,到現(xiàn)在還沒有交出來。


5月I/O的時(shí)候,谷歌表示Gemini 3.5 Pro將在“接下來一個(gè)月左右”推出,也就是預(yù)計(jì)在今年6月上線。現(xiàn)在7月都過了一大半了。


據(jù)彭博社7月16日?qǐng)?bào)道,Gemini 3.5 Pro的發(fā)布時(shí)間已經(jīng)落后原計(jì)劃數(shù)月。谷歌正在繼續(xù)優(yōu)化模型能力,尤其是編碼表現(xiàn),希望達(dá)到內(nèi)部設(shè)定的目標(biāo)。


路透社最新的報(bào)道則顯示,截至目前,谷歌仍未公布具體上線時(shí)間,只表示該模型正在與合作伙伴測(cè)試,并將“很快”推出;另有新聞稿透露,Gemini 4的訓(xùn)練工作已經(jīng)開始了。


而我們都知道,“很快”就是不確定的意思。



Gemini 1.0發(fā)布時(shí)就曾因演示爭(zhēng)議受到質(zhì)疑;Gemini 1.5 Pro憑借百萬token上下文短暫扳回局面,但隨后Claude和GPT系列快速追趕;直到Gemini 3系列發(fā)布,谷歌才重新獲得“回到前沿競(jìng)爭(zhēng)”的評(píng)價(jià)。


如今Gemini 3.5 Pro再次延期,市場(chǎng)關(guān)注的已經(jīng)不只是一個(gè)模型什么時(shí)候上線,還有谷歌到底能否保持旗艦?zāi)P偷母?jìng)爭(zhēng)節(jié)奏問題。


何況谷歌透露出的編碼表現(xiàn)不及預(yù)期,并不是什么容易解決的小問題。


隨著Agent開始進(jìn)入企業(yè)工作流,代碼能力的重要性迅速提升。一個(gè)模型能否理解復(fù)雜項(xiàng)目、修改真實(shí)代碼、完成多步驟開發(fā)任務(wù),已經(jīng)成為衡量它是否具備實(shí)際生產(chǎn)價(jià)值的重要指標(biāo)。


路透社指出,華爾街正在等待Gemini 3.5 Pro,因?yàn)樗鼘⒊蔀榕袛郍oogle DeepMind是否能夠跟上OpenAI和Anthropic的重要指標(biāo)。


當(dāng)然,谷歌并不是沒有動(dòng)作,這次推出的幾個(gè)模型,恰說明谷歌正在強(qiáng)化另一條路線:讓AI變得更便宜、更容易規(guī)模化。


谷歌CEO Sundar Pichai近期也多次強(qiáng)調(diào)成本優(yōu)勢(shì),并表示企業(yè)如果將大部分AI工作負(fù)載遷移到Gemini模型,可以每年節(jié)省超過10億美元。


但問題在于,市場(chǎng)在期待一份證明谷歌模型實(shí)力的“答卷”,谷歌交出的卻是兩張關(guān)于效率和成本的“草稿紙”——很難不讓人覺得,谷歌在用Flash系列填補(bǔ)Pro延遲留下的空檔。


有意思的是,在Gemini 3.5 Pro延期的同時(shí),AI競(jìng)爭(zhēng)格局正在發(fā)生變化。


過去,人們討論AI領(lǐng)先者,主要關(guān)注海外“御三家”:OpenAI、Anthropic和Google DeepMind。


但最近,GLM-5.2、Kimi K3等國(guó)產(chǎn)模型也開始進(jìn)入前沿競(jìng)爭(zhēng),并引發(fā)了大量討論。


前沿模型的追趕速度正在加快,也讓谷歌的問題變得更加緊迫,它當(dāng)然可以繼續(xù)大力推出Flash模型,但前提是它的旗艦?zāi)P妥銐蚪o力——只要硬實(shí)力足夠,自有大儒為他辯經(jīng)。


如果谷歌最終推出一個(gè)真正領(lǐng)先的旗艦?zāi)P?,那么Flash路線會(huì)成為完整體系的一部分:Pro負(fù)責(zé)突破能力上限;Flash負(fù)責(zé)規(guī)模化應(yīng)用。


但如果Gemini 3.5 Pro持續(xù)落后,市場(chǎng)很可能會(huì)繼續(xù)追問:谷歌擁有最強(qiáng)AI研究資源,為什么卻無法穩(wěn)定跑贏競(jìng)爭(zhēng)對(duì)手?


在Alphabet本周舉行第二季度財(cái)報(bào)電話會(huì)議時(shí),人們很可能會(huì)進(jìn)一步詢問有關(guān)Gemini 3.5 Pro的更多細(xì)節(jié)。

AI原生產(chǎn)品日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如對(duì)本稿件有異議或投訴,請(qǐng)聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
墨江| 上犹县| 阳高县| 利辛县| 东源县| 临沭县| 桂阳县| 兴文县| 古丈县| 县级市| 辛集市| 绥江县| 中江县| 上思县| 汤阴县| 平潭县| 平利县| 黄浦区| 福海县| 桐柏县| 宝鸡市| 太仓市| 南宁市| 九龙城区| 石阡县| 洛阳市| 天镇县| 凌海市| 清丰县| 繁峙县| 丰台区| 乌兰察布市| 吉林省| 瑞昌市| 钦州市| 巴南区| 濮阳县| 鄂伦春自治旗| 嘉义市| 和平县| 石屏县|