腾讯Hy3:295B参数MoE不炫技,Agent底座潜入微信十亿用户

当行业目光集中在Fable 5与GPT-5.6的参数竞赛与榜单刷分时,腾讯混元团队悄然发布了Hy3模型——一款295B总参数、21B激活参数的MoE架构大语言模型。它的核心卖点不在参数规模,而在于推理效率直接打平2-5倍参数规模的旗舰模型,并且已经埋入微信的十亿级用户场景中。

Hy3的定位明确为Agent向LLM,这意味着它不追求通用对话的“广谱”能力,而是围绕工具调用、任务规划、细分业务闭环进行深度适配。从preview版本到正式版,团队基于50多个真实业务反馈反哺迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%。更重要的是,幻觉与常识错误率持续下降——这是Agent从“能用”到“可靠”的关键拐点。

实测表现印证了这种取舍:在编码、办公自动化(如生成包含交互逻辑的HTML页面)、复杂多步任务规划上,Hy3展现出与更大参数模型相当甚至更优的流畅度。一个视频演示中,Hy3直接生成了可运行的HTML网页、Agent交互页面以及10页PPT,并具备自检机制——在能力边界处会主动说明不足,而非强撑生成幻觉。相较于目前主流模型“文过饰非”的倾向,这一特性对生产级Agent至关重要。

短板同样清晰:纯视觉理解能力偏弱。这背后可能是腾讯对多模态路线“先文本后视觉”的优先级判断——在Agent场景中,结构化信息处理与指令遵循的优先级,远高于图像识别。是否在下一版本补足,取决于业务需求而非技术炫技。

将Hy3集成至微信服务10亿+用户,是国产模型第一次把Agent底座铺到日常生活的毛细血管里。微信作为中国最大的超级App,其内嵌的支付、小程序、企业微信、文档、会议等场景,天然需要强大的Agent能力来完成跨应用任务编排。相比在公共评测集上刷分,“让十亿人不知不觉用上Agent”的落地密度,才是衡量模型工业价值的真正标尺

Hy3的启示在于:大模型的下一站不是堆参数,也不是拼多模态的无所不包,而是在特定Agent场景下,用高效激活的MoE架构、真实反馈的数据闭环、与现有超级应用的无缝绑定,实现“干活效率”对“参数规模”的降维打击。当其他厂商还在实验室里卷榜单时,腾讯已经用十亿用户的真实点击,给出了务实的答案。对行业而言,值得关注的下一个信号不是“参数多大”,而是“哪个Agent能真正帮用户省下34%的时间”。