首页 / 资讯详情

腾讯重金投入 AI 之后,混元 Hy4 preview 交出了什么答卷

极客公园 2026-08-29 05:58 中文

摘要

8 月 28 日,腾讯发布并开源混元 Hy4 preview。 这是继 Hy3 正式版之后,腾讯推出的新一代大模型:总参数从 295B 增加到 770B,激活参数从 21B 增加到 49B,上下文长度也从 256K 扩展至 1M。模型已经同步进入 WorkBuddy、CodeBuddy、元宝和 ima,并可通过腾讯云 TokenHub 及 OpenRouter 调用。 此外,Hy4 preview 继续走普惠的高性价比路线。根据公布的价格信息,Hy4 preview 输入 6 元/百万 tokens,输出 18 元/百万 tokens,缓存命中 0.3 元/百万 tokens。 Hy3 此前已经替腾讯验证过一次产品化路径。它在 7 月发布后迅速进入腾讯的办公、编程和内容产品;腾讯披露,其 API 调用量在发布一周后达到上一代模型的 68 倍以上。Hy3 的优势是实用和高性价比:降低幻觉与常识错误,改善工具调用和多轮承接,让网页、表格、代码和文档从「能生成」变得「基本可用」。 Hy4 preview 要回答的,是下一道题。 相比 Hy3,Hy4 preview 把优化重点进一步推向软件工程、办公分析、游戏开发和科学研究等生产力任务。它要处理的是更长的工作链:理解需求、拆分步骤、调用工具、验证结果,并在出现报错、信息冲突或交付问题时继续修改。 腾讯内部组织了 163 名专家,对 203 个工程任务进行盲测。按照腾讯公布的数据,Hy4 preview 平均得分为 2.99/4,略高于 Kimi K3 的 2.94 和 GLM 5.3 的 2.92。 图片来源:腾讯 还有一个细节是,腾讯称,Hy4 preview 首次参与了自身训练方法、数据策略、评估体系和底层算子的优化,并通过多轮实验将推理吞吐相较基线提升 31.8%。 这种「发现问题—运行实验—根据结果继续修改」的能力,是否也能出现在普通用户的任务里? 我们给 Hy4 preview 准备了三项测试:在多份材料中完成费用审核、使用原生 Canvas 制作网页小游戏,以及从一句话开始开发一款 Three.js 3D 竞速游戏。看当任务变长、代码报错、交付物打不开时,它是否能不能把事情继续做下去。 一、先让 AI 审 6 笔账 在做游戏和 3D 场景之前,我们先给 Hy4 preview 派了一项更像真实办公室工作、也更难靠「看起来很聪明」蒙混过关的任务。 一个模拟费用材料包里放着 6 笔申请、两版费用制度、预算台账和 3 封审批邮件。客户餐叙要算人均限额,晚间交通要找活动证明,酒店有城市住宿上限,软件订阅则要判断 IT 是否真的批准。模型需要自己翻完 12 份材料,再给出「全额通过」、「核减后通过」或「退回补件」的结论。 Hy4 preview 用了 3 分 27 秒完成任务,生成了一份 Markdown 格式的《费用审核报告》:先给出汇总表,再逐笔写明依据、计算过程和后续待办。6 笔申请总额 5364 元,模型最终核准 4294 元,核减 230 元,另有 840 元退回补件,账是平的。 它还会主动去找申请单之外的证据。 比如 RB-003 是一笔 86 元的晚间交通费。申请单里只有行程记录,没有直接附活动证明。Hy4 preview 没有就此退回,而是翻到了邮件附件:项目负责人 21:32 发邮件要求申请人在会场完成供应商确认后再离开,邮件中还写明会议预计 22:15 结束;行程记录则显示,申请人 22:28 从会场返回公司。人物、地点和时间都对得上,模型采信了这笔费用。

阅读原文(极客公园)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。