南洋理工团队破解八年难题:MTS训练数据选择方法首次真正work
模型发布、学术 雷峰网

南洋理工团队破解八年难题:MTS训练数据选择方法首次真正work

南洋理工大学李搏扬团队在ICML 2026上提出突破,解决了Meta-learning for Training-data Selection(MTS)长期存在的数学缺陷。该框架让AI学会自主挑选高质量训练数据,此前因逻辑自洽但效果不佳困扰学界八年,此次突破有望显著提升大模型训练效率。

南洋理工大学李搏扬团队在ICML 2026上提出了一项突破性成果,成功解决了Meta-learning for Training-data Selection(MTS)领域长达八年的数学缺陷。MTS是一种让AI学会自主挑选高质量训练数据的方法,其核心思想是通过元学习优化数据选择策略,从而提升模型训练效率。然而,此前的方法虽然在逻辑上自洽,但在实际应用中效果不佳,困扰学界多年。李搏扬团队的创新在于从数学层面修正了MTS的底层缺陷,使其首次真正发挥作用。

这一突破的意义在于,它直接回应了大模型训练中的核心痛点:数据质量。当前,大模型依赖海量数据训练,但数据中往往包含噪声、冗余甚至错误信息,低质量数据不仅浪费计算资源,还可能损害模型性能。MTS的改进版本能够动态识别并筛选出高价值数据,从而在同等算力下实现更优的训练效果。李搏扬团队通过理论推导和实验验证,证明了新方法在多个基准测试上的显著提升,为AI训练效率的优化提供了新路径。

从行业影响看,这一成果可能加速大模型训练的降本增效。随着模型参数规模持续膨胀,训练成本已成为制约发展的关键因素。MTS的突破意味着,未来模型训练可以更智能地利用数据,减少无效计算,从而降低对算力的依赖。此外,该方法还可应用于数据标注、隐私保护等场景,例如自动过滤敏感信息。南洋理工团队的这项工作,不仅解决了学术界的长期难题,也为AI产业的实用化提供了有力工具,有望推动大模型从“堆数据”向“精数据”的范式转变。