首页 / 资讯详情

赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

雷锋网 2026-08-07 15:29 中文

摘要

张一鸣要的是,下一轮竞争中,Seed模型能力跻身世界第一梯队 作者丨高允毅 编辑丨岑 峰 近日,The Information爆出,在两周前的 Seed 全员会上,张一鸣罕见发声,明确拒绝以蒸馏手段追赶前沿大语言模型。他的态度很坚决:“字节跳动应该愿意为了长远目标牺牲一些短期利益。”最新一期 Artificial Analysis 全球 LLM 排行榜中,月之暗面 Kimi K3 Max 位列第二,阿里 Qwen 3.8 Max 位居第四,智谱 GLM 5.2 Max、DeepSeek V4 Flash 分列第七、第八,中国模型已占据全球前十近半席位。反观字节 Seed 2.1 Pro,仅排在第 21 位,远低于其他中国模型。论钱,字节年利润规模位居互联网头部;论人,Seed 团队汇聚了搜广推体系成长起来的顶尖算法人才;论算力,数万张 GPU 集群的智算中心正在全国铺开;论数据,抖音与 TikTok 坐拥全球最大的原生内容池。样样不缺的字节,为什么在大模型榜单上追不上?据字节员工透露,公司内部认为,字节不愿蒸馏,被认为是其大语言模型落后于中国其他人工智能实验室的原因之一。01三次被否决的“兵变”蒸馏(Distillation),通俗说就是拿其他大模型的答案来训练自己的模型,是行业公认的“捷径”。而在公开报道中,字节内部至少有三次关于是否蒸馏的路线之争。第一次冲突是在2025年1月。DeepSeek-R1横空出世,其推理风格席卷全球。Seed内部就有研究员提议跟进蒸馏,张一鸣拒绝了。他要的是 Seed 像人类一样“学习如何思考”,而不是学会模仿 R1 的“碎碎念”。第二次冲突是英伟达Blackwell芯片部署后。算力差距拉大,对手拿到了英伟达最新的入场券,字节只能靠 H20 苦撑,蒸馏呼声再起。但张一鸣再次说不,字节选择增资2000亿,在乌兰察布和怀来加盖智算中心。然后是Kimi K3成功跻身全球顶尖模型榜单带来的压力。每次国内开源新模型发布,都是一次压力测试。内部焦虑达到顶点,但在张一鸣眼里,榜单是虚的,商业主权是实的。张一鸣每次都顶住了。据接近Seed的人士透露,内部对开源模型的蒸馏禁令通过API检测等技术手段硬性执行,早在2023年4月就已明令禁止将GPT生成数据混入训练集。“字节刚开始也做蒸馏,后来张一鸣痛定思痛,说我们还是要走长远路。阿里、腾讯、字节这个量级的公司,不能总靠蒸馏别人过日子。” 国内某大厂高管曾对AI科技评论这样说。大模型的蒸馏可以用“背老师的作业答案”来形容。这条路见效极快。几百万条高质量指令数据灌进去,模型在基准测试上的分数能在短短几周内突飞猛进,快速逼近被蒸馏模型的水平。在大模型竞速的早期,几乎所有玩家都试过这招。但随着赛道进入深水区,争议随之爆发。2026 年以来,Anthropic 连续公开指责 Minimax、月之暗面、DeepSeek、阿里通义实验室存在蒸馏其模型的行为,将中国大模型的快速崛起直接归因于 “抄捷径”。不过,颇具讽刺意味的是,Anthropic 自身也被曝多次蒸馏 OpenAI 模型、使用盗版书籍数据训练。真正让张一鸣坚持 “不抄捷径” 的,是更深层的技术判断:在数据见顶、算力匮乏、全球模型 PK 进入白热化的阶段,靠蒸馏永远只能追在别人身后,甚至会在下一轮智能跃迁中彻底掉队。02

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。