
过去一年,AI 圈有个很怪的场面:一个互联网产品要是不说自己能接入 DeepSeek,好像用户就不敢信它真的有 AI。DeepSeek 一出来,行业情绪被点着了,连腾讯这样的公司,也很难完全不被这种气氛裹进去。
这不是纯吐槽。公开资料记录,腾讯元宝在今年 2 月同步支持混元和 DeepSeek-R1,用户可以在自家模型和外部爆款模型之间切换。对普通用户来说,这很方便;对腾讯来说,这多少有点尴尬。
因为腾讯手里明明有微信、游戏、办公、云,每个入口都像一座矿。可真到“谁家模型能打”这个问题上,很多人脑子里先蹦出来的反而不是混元。
7月6日,全新的腾讯混元Hy3官宣正式发布,可能要打破现阶段的怪场面。它要回答的问题很具体:腾讯能不能把那么多入口,变成一个真正会办事的 AI 系统。
![]()
腾讯公开文档里能确认的是,Hy3 是 Tencent Hy Team 做的多专家架构模型,总参数 295B,实际参与计算的激活参数是 21B,支持 256K 长上下文,并且以 Apache 2.0 许可证开放。官方还给出部署建议,如果用 8 张 GPU 服务,推荐 H20-3e 或更大显存的 GPU。
翻成人话,普通人很难随手在本地跑满这个模型。它更像腾讯拿出来给开发者、云服务和产品团队用的底座模型,目标也不在陪你聊两句,而在接更长、更复杂、更像工作的任务。
真正让我停一下的,是腾讯这次没有只堆参数。它在 GitHub 文档里写了专家盲测:270 位专家,用真实工作任务做 312 次比较,Hy3 得分 2.67/4,高于 GLM-5.1 的 2.51/4,优势集中在前端开发、数据与存储、持续集成这类任务。
![]()
这组信息比普通跑分更有用。因为 Agent 模型最难的地方,从来不是会不会答题,而是能不能在真实工作里接住一段活。你让它改前端、读数据、跑流程,它不能第三步就忘了第一步,也不能把工具调用格式写乱,结果让人来收拾残局。
Hugging Face 模型卡也列出了一些代码和推理评测,比如用来检查模型修代码能力的 SWE-bench Verified。评测分数能说明 Hy3 有一个不错的能力底盘,但它还不能替代用户体验。模型能在榜单上解题,和企业愿不愿意把内部流程交给它,中间还隔着稳定性、成本和验收。
腾讯不缺场景,这句话已经快说烂了。
问题是,场景多不等于模型心智强。微信里有入口,会议里有入口,文档里有入口,云上也有入口,可如果用户和开发者心里默认“国产强模型”的代表不是腾讯,那腾讯的入口会变得很拧巴:地盘很大,旗子不够响。
DeepSeek 把这种拧巴放大了。它让行业重新意识到,模型本身也能成为品牌和信任入口。以前很多产品说“我接了某某模型”,更像技术说明;DeepSeek 火了以后,这句话开始像一种安全感。
一个超级平台最难受的地方,是自己的产品要靠外部模型名来证明“我有 AI”。这后面跟着开发者选择、企业采购、云服务消耗和产品团队的话语权。
所以 Hy3 的胜负不在参数表上,而在信任里。腾讯要证明混元不只是一个可选模型,它还能成为可以托付一段任务的工作底座。
Hy3 被关注,绕不开姚顺雨。
从公开作品谱系看,他最清晰的标签与其说是“明星科学家”,不如说是长期研究怎么让模型行动起来。他过去一串代表性工作,都围绕同一个方向:让模型拆任务、调工具、在长任务里被验证,而不是只给一段漂亮回答。
所以外界自然会把 Hy3 的 Agent 取向和他联系起来。这个联系有合理性,但它不是腾讯官方公告。更稳妥的说法是:从他的研究背景和 Hy3 的产品方向看,腾讯这次要补的课,正好是 Agent 工作流里最硬的那一课。
这也是我更愿意认真看 Hy3 的原因。一个模型要进工作流,光会写一段顺滑答案没用。它得少犯低级错,输出格式要稳,工具调用不能半路抽风,多轮任务不能越聊越偏。开发者最怕那种看起来很聪明的模型,实际把返工和验收全丢给人。
Hy3 官方给出的内部数据,正是在往这个方向补:幻觉率从 12.5 降到 5.4,常识错误率从 25.4 降到 12.7,多轮测试问题率从 17.4 降到 7.9。数字来自官方,不能直接当成第三方体验结论,但它说明腾讯知道 Agent 模型最容易在哪里被骂:不稳定、不听约束、工具一多就乱、上下文一长就忘。
Hy3 真要有用,不能停在开源页面。
数字生命卡兹克 6 月 11 日写过一篇 WorkBuddy 实测。那篇文章里,WorkBuddy 的价值不在“又一个对话框”,而在它已经把代码开发、日常办公、设计创意拆成不同模式,有专家、技能、连接器,还能接 QQ 邮箱、腾讯会议、腾讯文档这类腾讯生态服务。
这就是腾讯最想要的 AI 形态。模型不在天上,而是在任务链里。
那篇实测里有一个很具体的场景:用户可以把上周公众号数据交给 WorkBuddy,让它生成周会报告;也可以让它做一个网页,再用技能继续优化和部署。你不用管这是不是最炫的演示,它至少说明一件事:腾讯已经有产品在试图把 AI 放进真实工作流。
但这篇文章也给了一个刺耳提醒。作者认为 WorkBuddy 做小项目、搓网页问题不大,真碰到复杂工程,最顶尖的代码工具仍然更稳。这句话正好戳中 Hy3 的任务:腾讯的 Agent 产品可以把入口、模板、权限、连接器做得很顺,可如果底座模型接不住复杂任务,用户迟早会绕回别的模型。
Hy3 如果能补上这块短板,WorkBuddy、腾讯云、腾讯文档、腾讯会议、开发者工具才有可能形成合力。否则入口再多,也只是很多入口各自热闹。
微信 Agent 的现场更能说明问题。
数字生命卡兹克 6 月 24 日体验微信小微时,把它总结成“只读不动”。它能查朋友圈、公众号、视频号,也能接一些微信原生能力,但很多敏感操作必须确认,甚至根本不能做。这个限制不难理解,微信的用户规模和社交关系太敏感,一旦 AI 乱动,后果不是小 bug。
宝玉 AI 6 月 9 日写过微信 AI 的困局,角度更尖一点:微信有十几亿用户和小程序生态,但 Agent 真要干活,需要权限、运行环境、工具接口和持续执行能力。小程序能提供服务入口,却不天然等于一个可靠的 Agent 工作台。
这两篇文章放在一起看,反而把 Hy3 的位置照得更清楚。腾讯不是没有入口,也不是没有产品想象力。它真正要解决的是:模型能不能在权限受限、流程复杂、用户不耐烦的真实环境里,把事情稳稳办完。
入口已经摆在桌上了。现在要看模型能不能少添乱。
Hy3 这次最值得看的地方,是它把战场选到了工作流可靠性。
过去模型发布太容易变成参数表、榜单表、开源表。Hy3 的官方文档虽然也有这些东西,但它最用力讲的其实是产品反馈、工具调用、输出格式、多轮意图和少犯错。这些词没有“最强模型”好听,却更接近企业和开发者真正会付钱的地方。
企业团队接 Agent,怕的往往不是回答漂不漂亮。真正崩溃的是,它跑到第三步突然忘了前两步,工具调用格式一乱,收尾还是人来擦屁股。一次两次可以忍,天天这样,团队就会回到老办法:让 AI 写草稿,人来重做。
Hy3 如果能把这个问题压下去,腾讯的优势会开始显形。WorkBuddy 可以接任务,腾讯云可以接部署,腾讯文档和会议可以接办公资料,微信和小程序可以接生活与服务入口。模型、入口、权限、数据、协作工具如果真能连起来,腾讯卖的就不只是一个模型,而是一套能干活的 AI 工作台。
风险也摆在这里。
它的强数据仍主要来自官方文档和模型卡,外部开发者的大规模真实验证还不够。部署门槛也不低,295B 模型对普通团队并不轻松。更重要的是,腾讯过去最大的问题经常不是没有技术,而是技术能不能被产品稳定地送到用户手上。
所以我现在不急着说 Hy3 是腾讯大模型的翻身仗。
但它至少不像一次为了热闹而热闹的发布。腾讯这次没有只喊生态和入口,而是把牌压到了一个更难、也更真实的问题上:模型能不能进入工作流,替人把活干完。
Hy3 不是参数新闻。
它是腾讯试图把入口优势变成办事能力的一次交卷。