
过去年,主流大模型把传统榜单基本刷穿了。前沿模型纷纷逼近满分,分数的低越来越难以说明实际能力的差距。个模型和Agent到底能不能解决真正的用户需求和问题变成了大关心的事。
腾讯大语言模型负责人姚顺雨的选择,正是对这趋势的回应。
据媒体报道,此前腾讯的大模型团队曾过度追求榜单成绩,甚至出现训练集污染,致模型在真实场景中表现不佳。姚顺雨加入后,团队主动放弃了传统的榜单评测标准,进行了系统的数据清洗。他所追求的,是大模型的价比——“按照他的设想,混元不需要在所有能力上正面击败ClaudeOpus这样的前沿模型。如果个模型能以Opus1的价格,在90的日常问题上做到与它样好,甚至过它,对大多数用户来说这就是个优的模型。”
Hy3(Hunyuan3)是腾讯混元重建之后出的新代旗舰语言模型,也是姚顺雨入职腾讯后交出的份答卷,于2026年7月6日正式开源。Hy3对外主的正是「跨框架差小于4」「幻觉率减半」「tool-call稳定」这类真实任务中的可靠指标,而不是某个榜单的。
我们这次为Hy3准备了套完整的测评,在主场和客场两个环境里各测了遍Hy3的表现:
主场:Hy3自的WorkBuddy——被腾讯自产品和脚手架反复调校过的环境。
客场:以开源框架OpenHands作固定执行环境、经OpenRouter接入裸模型,Hy3、GLM-5.2、DeepSeek-V4-Pro三个模型接同道题、同套环境,产物交给同个ClaudeOpus4.8盲评。
两处跑的都是同组任务,覆盖官标定的四项核心能力——长程执行、规划、上下文理解、工具使用。
后回答个产品问题:这是个什么样的模型,它强在哪、边界在哪、到底适谁?
01
Hy3的定位和亮点
腾讯在大模型域的布局统收拢在“混元”下,覆盖语言、图像、、3D等多个模态。Hy3是其中新代的语言模型,与混元的其他模型产品分属不同赛道。
在开始正式测试之前,我们先看看Hy3的定义以及各项基础参数。
Hy3在参数上的特是:295B的总参数里,单次理只激活21B,靠MoE(MixtureofExperts,混架构)架构加大规模后训练,实现小激活等省钱又够用的目标。作为对照,同赛道的GLM-5.2是744B总参、40B激活。Hy3的激活量约为它的半,这样确实省力、省钱。
在科学理这类任务上,它的官分数也确实:GPQADiamond91.9,FrontierScience-Olympiad项据官口径过GPT-5.5。(见下图)
官宣传里的快慢思考融在实现层面是由个reasoning_effort的参数控制,分为三档(不思考/低/),由同个模型切换。可靠面,官称Hy3的幻觉率从12.5降到5.4,同模型在CodeBuddy、Cline、KiloCode等不同Agent框架下的SWE-Bench成绩差控制在4以内。说明这是个稳定,具有工程落地价值的模型。
除此之外,Hy3在开源协议上采用Apache2.0,全球范围费商用,是宽松的种开源协议;定价为输入1元、输出4元、命中缓存0.25元每百万token。
02
测评前的要说明
据官披露,在接入Hy3后,腾讯的AI编程助手WorkBuddy的任务成功率从72升到90,ima(智能工作台)的Agent系统稳定达到95.1,面向企业的数据分析AgentMarvis任务完成率则为93.7。
这是姚顺雨「模型与产品共同设计」思路的自然结果,所谓共同设计,指的是模型和产品从开始就绑定在起开发:模型可以时间拿到真实场景和用户反馈,清楚自己该往哪个向改进;产品也能同步向模型输出需求,避训练优化与业务落地脱节。
Hy3从训练阶段就和这些产品起磨,官也刻意放弃了此前追逐的公开榜单,改用真实业务场景自建评测。这组数字代表的是Hy3在自场景里、被自产品反复调校之后的好状态,好马本来就该配好鞍,在WorkBuddy这样的主场表现自然会好看些。
而且还有个有意思的彩蛋:官Benchmark跑分表对标的是新的GLM-5.2、DeepSeek-V4-Pro、GPT-5.5,而270位的真人盲评只对标了上代的GLM-5.1;官表里DeepSeek-V4-Pro的GPQA标为83.4,三立测的分数则90.1左右。这些对比口径都不约而同地朝对自己有利的向偏了点点南充PVC管道管件粘接胶,而这这也解释了为什么我们在后续测评中相信开放环境下的客场盲评。
Hy3的能力分布上也有明确的边界,基础代码修复(SWE-benchVerified)78分是不错的成绩,但度Agentic任务(Deep-SWE只有28、ApexAgents25.6)的的得分上则稍逊筹。
03
正式测评
我们这次测评以开源框架OpenHands作中立执行环境,经过OpenRouter接入三个模型的裸版本,同道题、同套环境跑;产物交给同个ClaudeOpus4.8盲评,裁判员看不到作品是谁的,按每道题预设的评分表逐条0到1分,再加权成个质量分,同道题多跑几次取均分。环境失败的问题比如时、限流不进质量分。
三道题覆盖官标定的四项核心能力:单文件3D跑酷对应长程执行,多约束项目规划对应规划(兼考指令遵循),财报研道题测试上下文理解和工具使用两项能力。(详见下图)
测试:3D跑酷游戏,长程执行能力如何?
用Three.js写个单文件3D尽跑酷游戏,不依赖任何外部资源。测试的是长时运行下的工程致——对象池复用、难度递增、失败重开等。
先来看几个模型的答卷:
模型1
模型2
模型3
三个模型均成功生成了可运行的游戏代码。从量化指标看,裁判依据代码、静态截图和执行日志分,DeepSeek-V4-Pro约0.91(满分1分)南充PVC管道管件粘接胶,Hy3约0.88,GLM-5.2约0.66。DeepSeek与Hy3分数接近,GLM明显低档。GLM的产物完整读进去后,藏在代码后半段的运行问题被暴露出来,分数随之下滑。
此外,我们在测评中发现,PVC管道管件粘结胶通过OpenRouter接入的Hy3非常不稳定,若用于生产环境,荐使用腾讯自的WorkBuddy或元宝(元宝是腾讯的AI助手产品)。
从主观的体验上来看,裁判分的DeepSeek,实玩体验反而偏弱。它的几个样本,有的角按跳跃就限往上飞出画面,有的生成了金币却没有吃金币的计数逻辑,有的只在开头生成过次障碍物、之后路空场。GLM的样本里,有的进入约三秒就卡死、强制结束,有的地图每过小段就白屏重刷、金币吃了不计数。Hy3这边也有翻车的,比如死亡后法重开、整条游戏链路不完整。
但玩下来,完成度的个来自Hy3——金币有计数、距离越远分数越、速度随时长动态提升、跳跃与障碍生成、道路循环都完整。GLM好的那个样本与它接近,只在排版和配上略逊档。
这也足以说明Hy3的长程代码生成能力上限较,但多次运行的致仍有波动,尚未稳定。
测试二:多约束规划,指令遵循与冲突识别能力测试
二道题是泛办公场景中容易出现的规划:为个四人团队、八周上线套开源组件库的项目做落地案。难点在有很多不得不遵循的约束,题目钉死了六条硬格式要求:六个固定标题、里程碑须用四列表格、预各项相加须精确等于三万、全文不过千二百字、不许出现任何代码块,还埋了个资源冲突等模型自己发现。裁判按规划质量、关键路径、指令遵循、约束冲突识别四项分。
结果三模型的得分接近:GLM-5.20.936、DeepSeek0.919、Hy30.893,差都低。这道题六条摆在眼前的格式约束三几乎全遵守了,指令遵循这项都在0.95以上,拉开三差距的是隐藏的约束冲突识别,这题的人力配置本身偏紧,DeepSeek每次都点破并给取舍,Hy3有次没点透、收尾仓促,分数被拉低。
测试三:财报研,上下文理解与工具使用能力
三道题给模型批光通信公司Coherent的真实材料。年报、财报电话会记录、投资者演示,要它通读后做交叉综,写份面向业投资者的度分析,并联网补上材料里没有的新股价、业绩和观点。这道题有两项能力:读懂大量材料是上下文理解,读文件加联网查证是工具使用。裁判按上下文理解、工具使用、分析度、结构业度四项来分。
这是Hy3全场亮的地:上下文理解0.933、工具使用0.807,两项都排,财报总分也(0.903,GLM0.891紧随)。在读懂大堆材料再综这件事上,Hy3稳定占优。三的共同短板也在这题露出来:工具使用项都只有0.78到0.81,联网补数据、把引用做得可追溯,大都发挥差不多。
综上,在本次测试中,Hy3在上下文理解与工具使用两项上表现出,DeepSeek跑长程代码生成,GLM则在规划能力上占优。整体来看,Hy3没有明显的单项短板,综能力均衡;尤其值得关注的是,它在腾讯自WorkBuddy等Agent产品中的落地表现,相较纯粹的裸模型能力有进步的提升,体现了「模型与产品共同设计」策略带来的工程化优势。
Hy3在WorkBuddy主场与OpenHands客场的得分对比。三项主场得分均略于客场,但规划和财报两项基本持平,说明Hy3的上下文理解与规划能力相对稳定,受底层Agent框架变化的影响较小。
04
Hy3的受众和场景
回到文章开头我们抛出的疑问:这是个什么样的模型,它强在哪、边界在哪、到底适谁?
Hy3是个没有明显短板的经济型模型,没有任何单项,但是综能力表现不俗。叠加输入1元、输出4元(每百万token)的低定价,以及Apache2.0的全球费商用协议,这是款入手门槛低的模型。
从本次的测试结果来看,Hy3真正优秀的能力在上下文理解。在财报研题目中的得分0.933是全场、对值也、主客场致。读懂大堆材料再综是它稳定占优的地,在泛办公域叠加WorkBuddy出的Agent框架将给用户带来惊喜的办公体验提升。
不过,Hy3的能力边界也同样清晰。先,它没有任何项能力达到顶水准。其次,自主联网查证和工具使用的对水平仍属中等(测试中工具使用得分0.807,虽然全场,但对值不)。后,在度、长程的自主Agent任务上,它的表现不够稳定——Deep-SWE仅28分,ApexAgents仅25.6分,尽管这两个基准本身难度就,但Hy3在这些维度上并不占优。
所以,如果你从事的是需要处理大量上下文、且对成本敏感的工作——比如做文档或长材料理解类应用的团队,又或者是需要款开源可自部署、可商用、不被许可证限制的公司——那Hy3会是非常适的选择。
后需要坦诚说明本次测评的边界:我们只覆盖了4项能力、3道偏工程的题目,样本量偏小(DeepSeek的财报分析因OpenRouter波动仅取得1个成功样本),因此以上结论只代表个向的判断。至于对话、创意写作、多模态、真实长周期项目等广泛的维度,还需要在真实的生产力场景中进步验证。相关词条:铁皮保温施工 隔热条设备 锚索 离心玻璃棉 万能胶生产厂家
奥力斯 万能胶生产厂家 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述南充PVC管道管件粘接胶,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。