BAT 集体重做「AI 预训练」,补「脏数据」的坑
最近大半年,国内一批 AI 模型厂商 密集启动“预训练返工”,起因都指向同一件事:数据不行。 它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。 有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。 还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。 与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。 数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。 “AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。 01 数据上的“粗放式弯路” 预训练返工,本质上是在补数据的课。 “多就行了”的误区 一位头部基模公司的数据专家赵翔向雷峰网回忆,前些年刚开始做预训练的时候,大家的主流观点是“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。” 于是开始一味地粗放式堆数据,只求规模不讲质量。 再加上,当时行业普遍缺乏成熟的大规模数据治理体系,大家为了凑齐数千亿甚至上万亿 token 的语料库,抓取了大量网页垃圾、脏语料,甚至混入了各种来源不明的清洗包。 很多数据的标注和筛选也没有处理好,导致训练出来的第一版模型效果较差。 然后大家才发现, 不注重数据质量,会让模型卡在 60、70 分上不去 ,“眼看海外的模型都跑到 90 分了,就是追不上。”于是不得不回过头来重做数据优化。 脏数据的代价 “底层脏数据的危害远比想象的大。它会让你投入的 卡、钱、人力都浪费掉,而且还会耽误你的时间窗口。 ”某模型厂商前高管、现 AI 创业者王斌告诉雷峰网。 他向雷峰网描述过一个典型案例。一家中部基模公司,把爬来的技术博客整批灌进预训练语料,跑到训练中期才发现,其中相当部分是采集站的机器生成页,同一个段落被重复了几万次。 模型在评测集上开始莫名其妙地复读,等团队定位到问题,几万卡时已经烧掉了,那一版只能作废重来。 事实上,这样的翻车在行业里远不止一例。不少团队都是训练效果出了问题后,才回过头来补数据治理的课。 不当的数据 KPI 基元律动创始人王云鹤也曾在接受媒体采访时提到过,AI 没有什么新鲜事,数据是地基,数据不行,不要怪算力;数据不达标,什么算法都不行,因为这违背机器学习理论。 而且他还特别提到一点,数据团队要对预训练团队有一定话语权,预训练团队也要反向对数据提要求。独立考核会很乱。 其实,对数据团队的考核不当, 是不少模型厂商都踩过的一个坑。 比如,有媒体曾描述过,腾讯混元团队曾在数据治理上,出现过“标注规则定义不清,但验收线设定过高,团队为了交差,生产出大批无法使用的数据”的情况;再加上一些打榜数据、冗余数据的污染,以至于最后不得不推倒重来,专门重拉
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。