腾讯混元Hy3实测:与GLM 5.1、DeepSeek V4 Pro横向对比

  心若无尘 2

腾讯混元Hy3正式版上线,实测对比GLM 5.1、DeepSeek V4 Pro等模型。在前端设计、3D物理、塔防游戏等9项任务中,Hy3表现领先,代码调试和写作任务中GLM 5.1略优。综合推理、编程、约束遵循等任务表现扎实。

腾讯混元Hy3实测:与GLM 5.1、DeepSeek V4 Pro横向对比

腾讯混元 Hy3 实测:和 GLM 5.1DeepSeek V4 Pro 比了比

最近腾讯混元 Hy3 正式版上线,WorkBuddy 里直接免费用。消息一出,不少人排队体验。

Hy3 是 4 月底 preview 版的升级。官方说,在真实工作场景的盲测里,Hy3 均分比 GLM 5.1 好,推理、智能体、长上下文这些任务上,甚至能跟参数大它 2 到 5 倍的模型掰手腕。

既然敢这么讲,那必须拉出来溜溜。我找了两个参数量比 Hy3 大的——GLM 5.1 和 DeepSeek V4 Pro,还有一个参数差不多的 DeepSeek V4 Flash,一起做了个横向对比。

实测 1:前端设计——AI 模型横评 Dashboard

提示词要求:做一个专业 SaaS 风格的横评工具页面,包含四个模型展示、评分矩阵、模型详情、测试记录,支持交互和响应式,不要营销感。

  • Hy3:完成度最高。顶部 KPI、模型卡片、评分矩阵、雷达图、优缺点、规格区、测试记录和筛选全都有,信息架构像真实工具。缺点是桌面端左侧有一块空白,浏览节奏不太均匀。
  • DeepSeek V4 Pro:结构清楚,6 维度 × 4 模型的矩阵能跑,筛选和测试历史也能用。但设计偏“标准白底 SaaS 表格 demo”,页面密度控制一般,缺少模型画像和图形化能力面板。
  • DeepSeek V4 Flash:卡片和条形图稳,视觉克制。但评分矩阵只展示当前选中模型的 6 个维度,不是真正的四模型横向对比,更像模型详情页加记录表。
  • GLM 5.1:页面没跑起来,浏览器报错,模型卡片、矩阵、详情、测试记录全没渲染,只剩暗色外壳和空表头。

本轮排名:Hy3 > DeepSeek V4 Pro > DeepSeek V4 Flash > GLM 5.1

实测 2:3D 物理交互——小球迷宫

提示词要求:用 Three.js 做一个倾斜迷宫板,小球根据键盘方向键滚动,有墙体、终点、失败洞口、计时和基础物理效果。

  • Hy3:非常稳,自带 three.min.js 可直接跑。物理实现清楚,倾斜板、滚动、碰撞、掉落重置、计时、移动端 D-pad 全有,按键后位置和计时变化明显。
  • DeepSeek V4 Pro:思路高级,用了 React Three Fiber + Rapier,构建通过。但实际玩起来左右重力逻辑混乱,板子翘起来球却往高处跑。
  • DeepSeek V4 Flash:有 canvas、迷宫、计时、洞口和通关弹窗。但游戏系统偏薄,洞口少、HUD 信息少,重力逻辑同样混乱。
  • GLM 5.1:完成度高,完整迷宫、墙体、多个洞口、终点、阴影、HUD、最佳时间、WASD/方向键、鼠标视角旋转都有。但上下左右重力逻辑全乱,板子翘起来球往高处跑。

本轮排名:Hy3 > GLM 5.1 > DeepSeek V4 Pro > DeepSeek V4 Flash

实测 3:塔防游戏

提示词要求:做一个迷你塔防,有固定路径、敌人、炮塔、金币、波次、生命值、暂停、重开,至少两种炮塔,能玩 5 波。

  • Hy3:三种塔(箭塔、炮塔、冰塔),覆盖单体、AOE、减速。有出售返还、暂停、重开、波次状态,UI 清楚,像完整小游戏原型。
  • DeepSeek V4 Pro:React/Vite 版本,放塔和 5 波流程可用。但更像基础 Demo,只有两种塔,没有日志、出售、减速、敌人类型变化,视觉简单。
  • DeepSeek V4 Flash:单文件完成度不错,能放塔、开波、击杀返钱,有事件提示和塔属性面板。短板是只有两种塔,策略深度一般。
  • GLM 5.1:游戏结构很产品化,10 波、两种塔、多敌人类型、速度按钮、事件日志、商店信息完整。但画面偏暗,战斗反馈不直观,没有出售和升级。

本轮排名:Hy3 > GLM 5.1 > DeepSeek V4 Flash > DeepSeek V4 Pro

实测 4:代码调试——Two Sum 问题

提示词要求:找出一段 Python 代码的 bug,修复并补充 3 个测试用例。

  • Hy3:标准用例解释清楚,能指出 [2,7,11,15] 会 KeyError,修复代码正确,测试覆盖基本、重复、无解。但表述略绝对。
  • DeepSeek V4 Pro:修复和测试正确,4 个用例覆盖全。但解释里说 seen[n] 可能是“当前数字 n 的索引,即 i 本身”,这不严谨。
  • DeepSeek V4 Flash:明显错误,误判成“返回顺序反了”,但没改对,标准用例仍会 KeyError,自己的测试都跑不过。
  • GLM 5.1:准确抓到核心,解释严谨,修复代码和测试都正确。

本轮排名:GLM 5.1 > Hy3 > DeepSeek V4 Pro > DeepSeek V4 Flash

实测 5:中文写作——改公众号正文

提示词要求:把一段 AI 腔明显的文字改成自然的公众号正文。

  • Hy3:审稿意识强,能准确指出原文 AI 腔来源,改写有公众号开头的抓力。
  • DeepSeek V4 Pro:干净、短、直接,但信息量偏少,把 Agent 写成普通效率工具,少了“主动执行、多步骤任务”等关键点。
  • DeepSeek V4 Flash:比原文口语化,但还保留明显模板,有标题党味。
  • GLM 5.1:具体、有场景,写到订机票、整理文档、盯进度、报表、邮件、资料归档,读者能马上理解 Agent 的用处。语气自然,小问题是“与其……不如……”用了两次。

本轮排名:GLM 5.1 > Hy3 > DeepSeek V4 Pro > DeepSeek V4 Flash

实测 6:约束遵循——JSON 输出广告语

提示词要求:用 JSON 输出 5 条中文广告语,每条不超过 16 字,不能出现“效率”“智能”“未来”,每条包含一个动词。

  • Hy3:JSON 格式规范,字段正确,5 条全是中文短句,没有英文、空格、多余解释。
  • DeepSeek V4 Pro:JSON 合规,文案有画面感,但有几条偏长。
  • DeepSeek V4 Flash:格式没问题,但用了 bug、AI 等英文,约束遵循最弱。
  • GLM 5.1:很稳,5 条都短,节奏统一,但用了 Bug 这个英文单词。

本轮排名:Hy3 > DeepSeek V4 Pro > GLM 5.1 > DeepSeek V4 Flash

实测 7:代码重构——订单计算函数

提示词要求:重构一个运行两年的订单计算函数,支持优惠券、会员折扣、区域税率,给出 TypeScript 代码和单元测试。

  • Hy3:拆分纯函数、配置对象,税率/会员折扣/优惠券边界讲得清楚,工程判断稳。
  • DeepSeek V4 Pro:落地扎实、测试覆盖广、零依赖可跑。扣分点是 User 改成 membership,有兼容风险。
  • DeepSeek V4 Flash:思路方向对,但实现问题最多,优惠券先于会员折扣,组合券时容易算成负数。
  • GLM 5.1:设计讲得好,配置注入、迁移节奏、哪些不要过度设计都说到了。扣分点是代码片段有小瑕疵,直接复制不一定能跑。

本轮排名:Hy3 > GLM 5.1 > DeepSeek V4 Pro > DeepSeek V4 Flash

实测 8:Excel 自动化——销售分析模板

提示词要求:设计一个 Excel 分析模板,自动计算毛利、毛利率,按月份/城市/销售员生成透视分析,找出低毛利订单,生成管理层看板。

  • Hy3:真实交付了 .xlsx,有生成脚本、公式列、条件格式、自动汇总、KPI 和 3 张图表。虽然没有真正创建 Excel 透视表,但给了透视字段说明。
  • DeepSeek V4 Pro:结构清楚,6 张 Sheet 设计完整,KPI 公式和 FILTER 低毛利清单比较可落地。
  • DeepSeek V4 Flash:有基本框架,但公式细节问题多,低毛利标记没有防除零,透视表字段配置有误。
  • GLM 5.1:方案最完整,6 张 Sheet 设计、KPI 公式、条件格式、透视表字段、图表类型全有,还给了低毛利标记和动态下拉菜单。但缺少实际交付文件。

本轮排名:Hy3 > GLM 5.1 > DeepSeek V4 Pro > DeepSeek V4 Flash

实测 9:DCF 估值

提示词要求:基于给定假设做 DCF 估值,计算显性期现金流现值、终值、企业价值、股权价值、每股价值,做敏感性分析。

  • Hy3:折现口径正确,2026–2030 五年现金流按 t=1..5 折现,终值也折现 5 年,基准每股 21.95 元,还生成了 HTML 报告和计算脚本。
  • DeepSeek V4 Pro:有本地脚本,但核心口径错了,漏掉 2026 年现金流,终值只折现 4 年,估值被抬高到 23.14 元。
  • DeepSeek V4 Flash:和 DeepSeek V4 Pro 犯了同一个错误,且没有本地文件,解释更短。
  • GLM 5.1:计算和口径严谨,明确写了估值日、年末现金流约定、终值折现 5 年,敏感性 5×5 完整。结论里有终值占比和交叉验证提醒,但没有生成本地文件。

本轮排名:Hy3 > GLM 5.1 > DeepSeek V4 Pro > DeepSeek V4 Flash

总结:Hy3 确实能打

测完一圈,Hy3 的宣传没怎么灌水。整体表现确实比 GLM 5.1 强,甚至比参数量更大的 DeepSeek V4 Pro 还要好一点。

Hy3 在前端、塔防、约束遵循、代码重构、Excel 自动化、DCF 这些题都拿了第一,强在能交付——会生成文件、能跑页面、能把需求拆成真实产物。

GLM 5.1 在代码调试、中文写作、DCF 口径这些需要判断力的题上很强,解释严谨,金融建模意识也好。

DeepSeek V4 Pro 更像一个中规中矩的工程型选手,结构化能力不错,代码重构里还跑通了 20 个测试。

DeepSeek V4 Flash 适合轻量任务,单文件页面、小型 Demo、快速草稿还行,但一到严谨推理、约束遵循、复杂业务口径就弱了。

一点感受

测下来,Hy3 给我的感觉挺明确:日常工作里真的可以拿来干活了。

当然要说明,这次测试用的是 WorkBuddy,腾讯自家 Agent 接自家模型,可能有适配加成。但结果摆在那里——页面能跑、文件能交、复杂任务也能拆得住,完成度确实不错。

更关键的是,现在 WorkBuddy 里用 Hy3 还免费,能用两周。对经常跑代码、做页面、写分析的人来说,等于先省下半个月 Token 费。后面接 API 的话,价格也不算贵,甚至比 DeepSeek V4 Pro 还低一点。

还有一个我比较期待的地方:Hy3 已经接进了腾讯不少产品,比如元宝、微信读书这些,刚好也是我平时会用的工具。

我也注意到,Hy3 在 7 月 8 日上午 10 点左右算力消耗冲到峰值,后面出现排队,下午排队率一度超过 50%。这说明一件事——觉得它好用的,应该不止我一个。

这次测完,我会把 Hy3 放进日常工作备选里。希望国产模型越做越好。

蛙蛙写作