过去大半年,国内一批大模型厂商密集启动“预训练返工”,而矛头几乎都指向同一个问题:数据质量不过关。所谓返工,并非简单调参或微调,而是把已经烧掉大量算力、时间与人力训练出的模型推倒重来,重新清洗语料、重建数据流程,甚至重组数据团队。这在过去以“堆算力、拼参数”为主旋律的行业里并不常见,如今却成了多家基模公司的共同选择。
问题的严重性,从几个典型案例中可见一斑。有厂商花了一年时间死磕万亿参数模型,结果落地表现却被市面上规模仅为其百分之一的小模型反超,最终排查发现是脏数据拖了后腿。还有团队把爬取来的技术博客整批灌入预训练语料,训练到中期才发现其中相当一部分是采集站生成的机器页面,同一段落被重复数万次,模型在评测集上开始莫名复读,等定位到问题时,几万卡时已经烧掉,那一版只能作废。评测集污染、标注规则模糊、垃圾语料冗余,这些看似“工程细节”的硬伤,正在成为模型性能的隐形杀手。
更深层的原因,在于早期行业普遍存在的认知误区。许多团队最初信奉“数据多就行,稍微差一点没关系,模型自己有鲁棒性”,于是粗放式堆数据,只求规模不讲质量。在缺乏成熟大规模数据治理体系的情况下,为了凑齐数千亿甚至上万亿 token 的语料库,抓取大量网页垃圾、来源不明的清洗包,标注与筛选也未能严格把关。结果是模型卡在六七十分上不去,眼看海外模型跑到九十分,却怎么追也追不上,只能回头补数据治理的课。
数据团队的管理与考核同样值得反思。有观点指出,数据是地基,数据不行不要怪算力,数据不达标什么算法都不行。数据团队应当对预训练团队拥有一定话语权,预训练团队也要反向对数据提出要求,独立考核容易造成混乱。此前也有厂商出现过标注规则定义不清、验收线却设定过高,团队为交差生产出大批无法使用数据的情况,再叠加打榜数据与冗余数据污染,最终不得不推倒重来。
这场返工潮的意义,在于它把数据从“后台支撑”推到了竞争前台。算力可以买,架构可以抄,人才可以挖,但高质量、大规模、可治理的数据体系,需要长期投入与工程积累。当模型规模红利逐渐见顶,数据质量正在成为决定模型上限的关键变量。对国内厂商而言,谁能更早建立从采集、清洗、标注到评测的完整数据闭环,谁就更有可能在下一阶段竞争中占据主动。
