久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

騰訊發(fā)布混元Hy3正式版,重回大模型第一梯隊視野,重構(gòu)研發(fā)體系,但其最終成敗還要看模型迭代能力與微信原生Agent落地。 ## 1. Hy3表現(xiàn):未達(dá)最強(qiáng)但幫騰訊重回開發(fā)者視野 - 參數(shù)層面,Hy3總參數(shù)2950億,支持256K上下文,未在指標(biāo)上盲目堆料;采用MoE架構(gòu),單次推理僅激活約210億參數(shù),在模型容量、速度和成本間找平衡。 - 能力層面,Hy3在高難度SWE-bench Pro、貼近真實(shí)場景的WildClawBench表現(xiàn)突出,整體處于**整體能力第二梯隊上沿、開放低成本模型第一梯隊**,在前端開發(fā)、常規(guī)代碼、工具調(diào)用上競爭力較強(qiáng)。 - 市場反饋層面,上線三天,限時免費(fèi)的Hy3升至OpenRouter最受歡迎模型榜單第八位,接入騰訊WorkBuddy后排隊率一度超50%,發(fā)布當(dāng)日騰訊股價上漲4.82%,已證明自身是一款“能用的模型”。 ## 2. 混元核心突破:重建了模型研發(fā)的閉環(huán)方法 - 此前混元走“大而全”通用底模路線,陷入同質(zhì)化,缺乏不可替代的清晰定位,核心問題是未建立把資源轉(zhuǎn)化為模型進(jìn)化能力的穩(wěn)定體系。 - 姚順雨加入騰訊重組混元研發(fā)體系后,騰訊沒有盲目堆參數(shù),而是重做預(yù)訓(xùn)練、強(qiáng)化學(xué)習(xí)等基礎(chǔ)工程,將真實(shí)產(chǎn)品反饋、人工盲測納入評測體系。 - 新研發(fā)模式以需求倒推模型,堅持產(chǎn)品和模型深度協(xié)同設(shè)計,產(chǎn)品反饋回流進(jìn)入訓(xùn)練閉環(huán),Hy3就是這套新方法的首批成果,這套循環(huán)已初步跑通。 ## 3. 騰訊AI仍待補(bǔ)齊的兩塊核心能力 - 第一是連續(xù)多版本保持模型前沿水平的能力,一次成功不代表長期競爭力,**穩(wěn)定產(chǎn)出前沿模型需要組織、算力、人才、產(chǎn)品反饋的持續(xù)協(xié)同**,目前僅完成一次階段性驗證。 - 第二是高頻可用的微信原生Agent,騰訊擁有完整的“模型-入口-工具-交易”生態(tài)鏈路,但目前微信原生Agent仍未正式落地,尚未將入口、生態(tài)、支付能力串聯(lián)轉(zhuǎn)化為商業(yè)優(yōu)勢。 ## 4. 騰訊AI的最終定位與檢驗標(biāo)準(zhǔn) - 混元對騰訊的核心價值是自研底盤,承擔(dān)高頻、敏感、對成本要求高的自研任務(wù),扮演成本錨點(diǎn)、供應(yīng)安全底座的角色,不需要包攬所有需求。 - 未來騰訊AI的成敗將按兩條線檢驗:技術(shù)端看混元能否持續(xù)迭代形成長期優(yōu)勢,產(chǎn)品端看能否做出可調(diào)用生態(tài)、完成交易的微信超級原生Agent。
騰訊AI,翻身了嗎?
2026-07-13 10:08

騰訊AI,翻身了嗎?

本文來自微信公眾號: 定焦One ,作者:定焦One團(tuán)隊,編輯:魏佳


在大模型密集交卷的上周,前OpenAI研究員姚順雨,也交出了加入騰訊后的第一份正式答卷。


7月6日,騰訊發(fā)布混元Hy3正式版。沒有聲勢浩大的發(fā)布會,也沒有鋪天蓋地的營銷,這款旗艦?zāi)P鸵砸环N不太符合大廠慣例的低調(diào)方式進(jìn)入市場。


但在開發(fā)者一端,它激起的水花并不小。


上線三天后,處于限時免費(fèi)階段的Hy3升至全球大模型API調(diào)用平臺OpenRouter最受歡迎模型榜單第八位。接入騰訊辦公智能體WorkBuddy后,調(diào)用量迅速沖高,排隊率一度超過50%,項目組不得不緊急擴(kuò)容。資本市場也給出反應(yīng),發(fā)布當(dāng)天,騰訊股價上漲4.82%。


這多少有些出人意料。


過去兩年,阿里、字節(jié)不斷加碼模型、應(yīng)用和算力基礎(chǔ)設(shè)施,智譜、DeepSeek等AI公司也各自憑借爆款模型刷足了存在感。唯獨(dú)騰訊,常被排除在國內(nèi)大模型第一梯隊之外。


它有微信、QQ和龐大的產(chǎn)業(yè)生態(tài),卻始終沒有拿出一款足以改變行業(yè)判斷的基礎(chǔ)模型。外界甚至開始懷疑,騰訊究竟是在等待更合適的入場時機(jī),還是已經(jīng)在這一輪技術(shù)競賽中慢了下來。


現(xiàn)在看來,騰訊沒有躺平。


引入姚順雨并重組混元研發(fā)體系之后,騰訊近期又被曝吸納其前同事田永龍。模型之外,騰訊還參與了可靈最高30億美元的融資,并傳出洽談成為AI智能體公司Manus最大股東的消息。從人才、模型到基礎(chǔ)設(shè)施,這家過去兩年顯得過于克制的互聯(lián)網(wǎng)巨頭,正在重新提高對AI的下注力度。


Hy3還不足以證明騰訊已經(jīng)追上所有對手,它更像是一個階段性信號。騰訊重新建立了一套能夠把模型、產(chǎn)品和工程體系連接起來的研發(fā)方法,也重新獲得了進(jìn)入開發(fā)者主流候選清單的機(jī)會。


但這只是第一步。


對騰訊而言,真正的問題已經(jīng)不只是能否再造出一款更強(qiáng)的模型,而是這種能力能否連續(xù)迭代,以及它最終能否在微信里變成一個真正被用戶使用、能夠完成任務(wù)和交易的Agent。


01.Hy3不是最強(qiáng),但夠騰訊重回牌桌


只看參數(shù)和公開榜單,Hy3并不是一款一眼可見的“最強(qiáng)模型”。


在這一輪國產(chǎn)模型更新中,DeepSeek V4 Pro、智譜的GLM-5.2、MiniMax M3都在爭奪能力上限:有的將總參數(shù)推至萬億級,有的把上下文拉到100萬Token,有的在代碼和長程Agent任務(wù)中占優(yōu)。相比之下,Hy3總參數(shù)為2950億,支持256K上下文,并沒有試圖在每一項指標(biāo)上壓倒對手。


判斷它的真實(shí)位置,需要看兩件事。


第一,是它在具體任務(wù)中的能力邊界。


在衡量軟件工程能力的SWE-bench Verified上,Hy3獲得78分,落后于Claude Fable 5等閉源模型,也排在GLM-5.2和DeepSeek V4 Pro之后。但在難度更高的SWE-bench Pro上,Hy3以57.9分反超DeepSeek V4 Pro。在更接近真實(shí)執(zhí)行環(huán)境的WildClawBench上,它又超過GLM-5.1和DeepSeek V4 Pro,位居開放模型前列。


騰訊組織的270名專業(yè)人員盲測則顯示,Hy3整體表現(xiàn)高于GLM-5.1,優(yōu)勢集中在前端開發(fā)、數(shù)據(jù)存儲和持續(xù)集成等場景。


資深A(yù)gent從業(yè)者趙江杰告訴「定焦One」,Hy3目前處于“整體能力第二梯隊上沿、開放與低成本模型第一梯隊”。它在前端開發(fā)、常規(guī)代碼、搜索瀏覽和工具調(diào)用上具備較強(qiáng)競爭力,但還沒有在高難度任務(wù)上全面領(lǐng)先。實(shí)際使用中,高頻、中低難度且結(jié)果可驗證的任務(wù),已經(jīng)可以由它獨(dú)立完成;中等復(fù)雜任務(wù)可以交由它執(zhí)行后復(fù)核;核心架構(gòu)設(shè)計和敏感操作,仍不適合無監(jiān)督交付。


因此,如果“趕上”意味著成為能力最強(qiáng)的國產(chǎn)模型,Hy3還沒有做到;但如果意味著重新進(jìn)入開發(fā)者的視野,騰訊已經(jīng)重新拿到了一張入場券。


第二,是它對工程化落地和成本控制的重視。


Hy3采用MoE架構(gòu),總參數(shù)2950億,單次推理只激活約210億參數(shù)。它沒有不斷堆高峰值能力,而是在模型容量、運(yùn)行速度和算力成本之間尋找平衡。


對企業(yè)而言,模型成本不只是單次Token價格。一個Agent完成任務(wù),往往需要多輪推理、連續(xù)調(diào)用工具、讀取和修改文件,并反復(fù)核驗中間結(jié)果。當(dāng)使用規(guī)模擴(kuò)大到數(shù)千名員工,單次調(diào)用中微小的成本差異,會被并發(fā)量和任務(wù)鏈條迅速放大。


更少的激活參數(shù),意味著Hy3具備降低推理開銷和部署門檻的架構(gòu)基礎(chǔ)。但激活參數(shù)少,并不天然等于真實(shí)成本低。


趙江杰指出,模型效率還取決于硬件、量化方式、推理框架、上下文長度、輸出長度、并發(fā)規(guī)模和任務(wù)成功率。騰訊目前證明的是Hy3有降低成本的可能性,但在統(tǒng)一條件下,Hy3還需驗證能否提供更低的首Token延遲、更高的吞吐量,以及更低的成功任務(wù)成本。


穩(wěn)定性同樣是成本的一部分。



企業(yè)需要的不一定是模型偶爾表現(xiàn)驚艷,而是在幾十次連續(xù)調(diào)用中少出錯、不失憶、不中斷。騰訊公布的數(shù)據(jù)顯示,Hy3在不同Agent框架下運(yùn)行SWE-bench Verified時,準(zhǔn)確率波動被控制在4%以內(nèi);在內(nèi)部場景中,幻覺率和多輪對話問題率也明顯下降。


趙江杰介紹,市場對Hy3的實(shí)際評價,更接近“一款工程型、性價比突出、Agent傾向明顯,但復(fù)雜認(rèn)知任務(wù)還不夠均衡的模型”,而不是一款全面領(lǐng)先的通用模型。


Hy3 Preview發(fā)布后,日均Token消耗增長20倍,WorkBuddy中主動選擇該模型的用戶增長6倍。正式版上線后,WorkBuddy算力消耗迅速觸頂,排隊率一度超過50%,聯(lián)合項目組緊急調(diào)度算力擴(kuò)容。與此同時,騰訊將Hy3接入元寶、CodeBuddy、ima和Marvis等產(chǎn)品,用于生成文檔、制作表格、編輯文件、管理電腦和編排工作流。


它的熱度也沒有局限在騰訊體系內(nèi)。在OpenRouter 7月的編程模型使用量排名中,Hy3進(jìn)入前四,與GLM-5.2、MiniMax M3和DeepSeek V4系列處于相近的調(diào)用梯隊。


但這些數(shù)據(jù)仍需謹(jǐn)慎看待。


目前Hy3在OpenRouter限時免費(fèi),WorkBuddy的調(diào)用增長,也可能受到積分、限免和內(nèi)部導(dǎo)流影響。真正的考驗,要等到免費(fèi)期結(jié)束之后。


即便如此,Hy3已完成了混元過去未完成的一步:讓外部開發(fā)者愿意主動試用,讓騰訊內(nèi)部產(chǎn)品開始把真實(shí)任務(wù)交給它。它沒有證明騰訊擁有最強(qiáng)模型,但證明騰訊重新?lián)碛辛艘豢睢澳苡玫哪P汀薄?


02.混元真正補(bǔ)的,是造模型的方法


談及國內(nèi)互聯(lián)網(wǎng)巨頭的AI布局,不少從業(yè)者過去對騰訊的評價很直接:場景很多,但大模型不行。


混元早在2023年就已經(jīng)發(fā)布。此后兩年,騰訊不斷補(bǔ)齊參數(shù)規(guī)模、多模態(tài)和長上下文能力,也將模型陸續(xù)接入會議、文檔、廣告、游戲和云服務(wù)。但相比以開源建立開發(fā)者生態(tài)的阿里,或憑借推理能力和低成本突圍的DeepSeek,混元始終缺少一個足夠清晰的位置。


馬化騰曾用“漏水的船”形容騰訊在AI浪潮中的處境,看似已經(jīng)上船,卻還沒有坐穩(wěn)。落到混元身上,真正的漏洞不在于騰訊沒有產(chǎn)品、場景或數(shù)據(jù),而是它沒有把這些資源持續(xù)轉(zhuǎn)化成模型進(jìn)化的能力。


最初的混元,走的是一條典型的“大而全”路線:先訓(xùn)練一款覆蓋盡可能多任務(wù)的通用底模,再接入騰訊云和內(nèi)部業(yè)務(wù)。這種方式幫助騰訊迅速補(bǔ)課,也讓混元陷入同質(zhì)化競爭。各項能力都有,但開發(fā)者很難找到必須選擇它的理由。


元寶接入DeepSeek,是騰訊第一次明顯把產(chǎn)品體驗放在模型歸屬之前。


對用戶而言,重要的是任務(wù)能否完成,而不是底層調(diào)用了哪一家模型。外部模型可以幫助騰訊迅速補(bǔ)齊產(chǎn)品短板,也能讓它更快看清用戶真正需要什么。這是騰訊對模型與產(chǎn)品關(guān)系的一次調(diào)整:產(chǎn)品不再必須等待自研模型成熟,模型也不再天然擁有內(nèi)部流量。


但這條路同樣有邊界。


如果騰訊的應(yīng)用長期建立在別人的模型之上,它掌握的只是入口,而不是AI時代的技術(shù)供給。模型價格如何調(diào)整、能力何時升級、敏感數(shù)據(jù)能否處理、產(chǎn)品反饋能否進(jìn)入訓(xùn)練閉環(huán),都將取決于外部供應(yīng)商。


多模型策略可以爭取時間,卻不能替代一款自主、可控且能夠持續(xù)迭代的基礎(chǔ)模型。


真正的變化,發(fā)生在姚順雨加入、混元研發(fā)體系重組之后。


2025年9月,姚順雨從OpenAI轉(zhuǎn)投騰訊;同年12月,騰訊正式任命其為首席AI科學(xué)家,同時負(fù)責(zé)大語言模型和AI基礎(chǔ)設(shè)施。他的加入,是騰訊重新組織混元研發(fā)體系的標(biāo)志性事件。從此之后,模型、算力、數(shù)據(jù)和評測,開始被納入一條更集中的決策鏈。


騰訊沒有急著訓(xùn)練一個參數(shù)更大的模型,而是先重做造模型的基礎(chǔ)工程:重建預(yù)訓(xùn)練和強(qiáng)化學(xué)習(xí)系統(tǒng),擴(kuò)充和清洗數(shù)據(jù),重新調(diào)整后訓(xùn)練流程。公開榜單也不再是唯一標(biāo)準(zhǔn),真實(shí)產(chǎn)品反饋、人工盲測和內(nèi)部任務(wù),開始進(jìn)入評測體系。


Hy3正是這套方法下的第一批結(jié)果。



它集中解決推理、代碼、工具調(diào)用和長程Agent任務(wù)。研發(fā)順序也被倒轉(zhuǎn)過來,先確定辦公、編程和知識管理需要什么樣的模型,再反推架構(gòu)、數(shù)據(jù)和訓(xùn)練方式。


產(chǎn)品也不再只是模型完成后的分發(fā)渠道,而成為訓(xùn)練體系的一部分。姚順雨在今年6月的騰訊云AI產(chǎn)業(yè)應(yīng)用大會上表示,重新出發(fā)的混元模型堅持與產(chǎn)品深度Co?Design,通過多產(chǎn)品數(shù)據(jù)回流與體系化訓(xùn)練,在優(yōu)化模型尺寸的同時持續(xù)提升性能。


趙江杰認(rèn)為,Hy3對騰訊的意義,超出一款模型本身。它為模型成本建立了錨點(diǎn),讓產(chǎn)品反饋重新進(jìn)入訓(xùn)練閉環(huán),也檢驗騰訊能否把分散在微信、辦公、云服務(wù)和開發(fā)工具中的應(yīng)用生態(tài),組織成真正的執(zhí)行能力。


過去兩年,騰訊真正缺的,是一套能夠穩(wěn)定造出模型、讓模型進(jìn)入產(chǎn)品,再讓產(chǎn)品反饋推動模型繼續(xù)進(jìn)化的方法。


Hy3暫時證明,這套循環(huán)開始重新運(yùn)轉(zhuǎn),但一次成功還不足以證明騰訊已經(jīng)建立起長期競爭力。


03.混元之外,騰訊還差什么?


Hy3讓騰訊重新?lián)碛辛艘慌_可用的自研發(fā)動機(jī),但這臺發(fā)動機(jī)在騰訊的AI版圖里,還不足以驅(qū)動一切。


騰訊總裁劉熾平在3月財報會上表示,AI不會是一場只產(chǎn)生一個冠軍的競賽?!按罅楷F(xiàn)有應(yīng)用將推出自身智能體與智能體能力,不同模型也將競爭贏得智能體的采用。這是一個更精彩、去中心化、人人可參與的世界?!?


騰訊首席戰(zhàn)略官詹姆斯·米切爾所將其描述為一條“性價比曲線”:未來成功的智能體,會根據(jù)不同任務(wù)的能力要求和成本約束,自主選擇合適的模型;不同模型,則分布在這條曲線的不同位置?!拔覀兿M蔀槠渲幸粏T,而不是唯一選擇?!?


按照這一判斷,未來的AI市場不會由某一個模型包攬所有需求,而會形成一個由模型、智能體、應(yīng)用和基礎(chǔ)設(shè)施共同組成的多層競爭格局。


這也決定了混元的角色:它不足以被騰訊拿去和別人拼勝負(fù),但它是騰訊不能沒有的底盤。



未來,混元不需要包攬騰訊體系內(nèi)的所有任務(wù),也不必成為每一款產(chǎn)品的默認(rèn)模型。高難度、低頻任務(wù)可以調(diào)用能力更強(qiáng)的外部模型;高頻、敏感、需要私有化部署或?qū)Τ杀疽蟾叩娜蝿?wù),則更多交給自研模型。


但這不意味著混元不重要。趙江杰將自研模型的戰(zhàn)略價值概括為:成本錨點(diǎn)、供應(yīng)安全、產(chǎn)品共訓(xùn)、私有化合規(guī)、持續(xù)學(xué)習(xí)能力,以及參與下一代技術(shù)競爭的資格。沒有自研模型,騰訊的產(chǎn)品依然可以借助外部供應(yīng)商迅速補(bǔ)齊體驗,但它會在AI最關(guān)鍵的生產(chǎn)函數(shù)上長期受制于人。


真正決定騰訊AI天花板的,是另一套東西。


騰訊手里的牌是14億微信月活入口、身份權(quán)限體系、小程序工具生態(tài)、支付與交易能力、企業(yè)微信里的組織流程,以及云基礎(chǔ)設(shè)施。與對手相比,阿里有電商和云但沒有社交入口,字節(jié)有流量但在小程序工具生態(tài)和企業(yè)組織側(cè)深度不足,DeepSeek和智譜在模型層強(qiáng)卻沒有生態(tài)。騰訊在“模型-入口-工具-交易”這條鏈路上更加完整。


但理論上的優(yōu)勢還沒有直接變現(xiàn)。真正的商業(yè)價值,取決于它能夠成功完成多少任務(wù),這些任務(wù)本身有多大價值,調(diào)用成本有多高,以及執(zhí)行失敗可能帶來多大風(fēng)險。正如趙江杰所說,一款能力只有90分,卻能以較低成本、安全地調(diào)用微信身份、小程序、企業(yè)流程和支付系統(tǒng)的模型,可能比一款能力達(dá)到100分、卻只能返回文本的外部模型更有商業(yè)價值。


這也指向騰訊AI戰(zhàn)略真正需要補(bǔ)上的兩塊能力。


第一,是連續(xù)多個版本保持前沿水平的模型能力。


Hy3暫時緩解了騰訊在這一環(huán)上的焦慮,但一次追趕,還不足以證明長期競爭力。一款模型偶爾在某幾個榜單上取得高分,與一家企業(yè)能夠連續(xù)多個版本穩(wěn)定處于前沿,是兩件不同的事。


前者可能來自一次架構(gòu)選擇、數(shù)據(jù)調(diào)整或訓(xùn)練周期,后者則要求組織、算力、數(shù)據(jù)、人才和產(chǎn)品反饋持續(xù)協(xié)同。


第二,是一個被用戶高頻采用、可信可控的微信原生Agent。


騰訊生態(tài)里的每一塊拼圖都很硬,但它們至今沒有被一款產(chǎn)品完整串聯(lián)起來。微信里被寄予厚望的原生Agent“小微”仍在灰度測試,能否真正調(diào)動小程序、調(diào)用支付、完成交易,都沒有答案。


只有當(dāng)模型能夠調(diào)動騰訊生態(tài)中的工具、服務(wù)和交易能力,微信的入口優(yōu)勢才會真正轉(zhuǎn)化成AI時代的執(zhí)行優(yōu)勢。


因此,騰訊AI戰(zhàn)略未來的檢驗標(biāo)準(zhǔn),最終可以被歸結(jié)為兩條線:


技術(shù)端,混元能否連續(xù)迭代,形成長期優(yōu)勢;產(chǎn)品端,騰訊能否造出一個超級原生Agent。


用戶留存、付費(fèi)率、任務(wù)成功率、生產(chǎn)流量和收入規(guī)模,都是這兩條線上的具體指標(biāo)。


趙江杰表示,如果混元長期無法承接大規(guī)模生產(chǎn)流量,不能服務(wù)敏感數(shù)據(jù)和私有化場景,也無法通過騰訊的產(chǎn)品反饋形成獨(dú)特能力,它最終可能只是一項昂貴的技術(shù)儲備。如果微信Agent始終停留在聊天、搜索和內(nèi)容生成層面,無法進(jìn)入工具調(diào)用和交易環(huán)節(jié),騰訊龐大的生態(tài)也很難自動轉(zhuǎn)化成AI優(yōu)勢。


騰訊AI的考驗,還將繼續(xù)。

AI原生產(chǎn)品日報頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
当雄县| 新野县| 甘德县| 旬阳县| 新泰市| 伊吾县| 启东市| 龙游县| 鸡东县| 昌黎县| 达尔| 盖州市| 新平| 鄄城县| 汕尾市| 余干县| 武安市| 九龙坡区| 阜阳市| 鹤岗市| 普兰店市| 芷江| 蒙城县| 九龙城区| 台南市| 平果县| 邳州市| 敖汉旗| 米脂县| 商都县| 共和县| 肥东县| 白银市| 临泽县| 大邑县| 友谊县| 西安市| 汶川县| 墨江| 古蔺县| 扎囊县|