首页 / 资讯详情

BAT 集体重做「AI 预训练」,补「脏数据」的坑

雷锋网 2026-09-24 01:43 中文

摘要

最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。“AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。01数据上的“粗放式弯路”预训练返工,本质上是在补数据的课。“多就行了”的误区一位头部基模公司的数据专家赵翔向雷峰网回忆,前些年刚开始做预训练的时候,大家的主流观点是“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。”于是开始一味地粗放式堆数据,只求规模不讲质量。再加上,当时行业普遍缺乏成熟的大规模数据治理体系,大家为了凑齐数千亿甚至上万亿 token 的语料库,抓取了大量网页垃圾、脏语料,甚至混入了各种来源不明的清洗包。很多数据的标注和筛选也没有处理好,导致训练出来的第一版模型效果较差。然后大家才发现,不注重数据质量,会让模型卡在 60、70 分上不去,“眼看海外的模型都跑到 90 分了,就是追不上。”于是不得不回过头来重做数据优化。脏数据的代价“底层脏数据的危害远比想象的大。它会让你投入的卡、钱、人力都浪费掉,而且还会耽误你的时间窗口。”某模型厂商前高管、现 AI 创业者王斌告诉雷峰网。他向雷峰网描述过一个典型案例。一家中部基模公司,把爬来的技术博客整批灌进预训练语料,跑到训练中期才发现,其中相当部分是采集站的机器生成页,同一个段落被重复了几万次。模型在评测集上开始莫名其妙地复读,等团队定位到问题,几万卡时已经烧掉了,那一版只能作废重来。事实上,这样的翻车在行业里远不止一例。不少团队都是训练效果出了问题后,才回过头来补数据治理的课。不当的数据 KPI基元律动创始人王云鹤也曾在接受媒体采访时提到过,AI 没有什么新鲜事,数据是地基,数据不行,不要怪算力;数据不达标,什么算法都不行,因为这违背机器学习理论。而且他还特别提到一点,数据团队要对预训练团队有一定话语权,预训练团队也要反向对数据提要求。独立考核会很乱。其实,对数据团队的考核不当,是不少模型厂商都踩过的一个坑。比如,有媒体曾描述过,腾讯混元团队曾在数据治理上,出现过“标注规则定义不清,但验收线设定过高,团队为了交差,生产出大批无法使用的数据”的情况;再加上一些打榜数据、冗余数据的污染,以至于最后不得不推倒重来,专门重拉团队从头清洗数据。“数据团队的考核只看数据量的话,会很荒谬。”前述数据专家赵翔补充道。因为大模型拼的是数据的信息密度和干净程度,而非绝对体积。考核只盯数量,等于在鼓励团队拿垃圾凑数。几百 T 的脏数据灌进去,训出来的模型反而会变笨,甚至训练崩溃。02数据背后的“苦活”与“花活”地基要重打,可好数据并不是说有就有的。互联网时代攒的家底,不顶用了本地生活、社交、游戏、电商与搜索,这些在互联网时代被各家大厂视作“壁垒”的场景数据,到了 AI 时代,不奏效了。因为基模比的是通用能力,某一场景数据的优势,落到通用能力上,影响变得有限。各家虽然都在拿自己的场景数据训一些垂直小模型,但最终应用面没那么广。“按理说 Google 各类场景数据最多,应该做得最好,但显然并

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。