首页 / 资讯详情
GLM-5.3 来了:底座没换,编程暴涨 50%,还顺手揪出潜伏 40 年的世界级漏洞
摘要
GLM-5.3三大标签,最强安全模型,最强编程模型,最强开源模型 作者丨高允毅 编辑丨岑 峰 昨晚刚经历完DeepSeek的狂欢,智谱不声不响放个大招,GLM-5.3正式上线。我们先看智谱给GLM-5.3的三个标签,最强安全模型,最强编程模型,最强开源模型。在基座模型没变的情况下,GLM-5.3编程能力体感暴涨50%,写起代码来直逼干了十年的资深老架构师。在找Bug和漏洞防御上,甚至可以对标Mythos 5,能一口气挖出2436个漏洞,里面光是中高危漏洞就有 1097 个。而这些飞跃,都来自极致的后训练,智谱将秘诀归功于“架构优化技术IndexShare、强化学习算法SAO、以及新一代后训练框架Slime框架”。而且智谱这次动作极快,不仅官方编程工具 ZCode、效率神器 AutoClaw 连夜开放,GLM Coding Plan 也直接面向所有人开放订阅。为了配合这波全员狂欢,GLM Coding Plan 的额度已经满血复活。01编程能力:开源第一,体感超Claude Fable 5智谱的编程能力有多强?可以说,全面逼近全球顶尖模型Claude Fable 5,甚至在部分高难度评测里完成了反超。我们可以看一下数据。在考验真实终端环境复杂操作的 Terminal-Bench 3.0 上,GLM-5.3 开启了惊人进化,得分从4.6 直接大跃进到 28.3,紧逼Fable 5的33.7。在长程软件工程、极其考验持续改代码能力的 DeepSWE v1.1 中,它更是从 46.2 提升到 66.9,距离 Fable 5 只差 2.8 分,跟 Kimi K3 的差距更是缩短到了微弱的 0.6 分,而长程任务一直是 Kimi K3 的拿手好戏。而在强调多工具协作、覆盖真实专业场景的 Agents' Last Exam 评测中,GLM-5.3 直接反超Fable 5 。在测试AI 能不能在现实职场里真正替人类干活、以及能产出多大的实际经济价值的 GDPval-AA v2 里,GLM-5.3 直接拿下全球第一。整体而言,GLM-5.3 这次不仅进步大,而且提升的方向非常有针对性,它主要提升的是复杂软件工程、终端操作和真实世界 Agent 任务的表现。可以说,智谱希望把GLM-5.3训练成能真正扛起整个项目的专家级开发者,而这种能力的提升源于智谱自建的一套评测:Z.ai Code Bench。区别于传统的纸上谈兵,这个评测不看模型做题,而是直接把大模型空投进真实的本地开发环境,模拟人类开发者使用 Coding Agent 的体感。结果在难度最高的 High 档位下,GLM-5.3 拿到了 31.4% 的准确率,比Claude Opus 4.8(29.5%)还高1.9%。而在Token效率上,面对同一项高难任务,Opus 4.8需要12 万个 Token,而GLM-5.3 平均只用了 5 万个Token,这意味着,在真实开发环境中,GLM-5.3 不仅比Claude Opus 4.8做得更好,算力还节省了一半。这是怎么做到的呢?官方表示原来他们把训练环境一比一复刻成了大厂专家的完整工作流。拿最复杂的机器学习优化任务来说,智谱直接给模型配齐了和算法工程师一模一样的计算集群、存储系统、内部文档和代码库,让它在真实环境里端到端地实操。而有些任