高质量训练数据的枯竭,正成为全球大模型行业共同面对的“隐形天花板”。当互联网上的公开文本、图片和视频被模型反复“消化”后,人类自然产出的数据已难以支撑下一代模型的能力跃升。在此背景下,中国一支研究团队近日提出并验证了数据层RSI(递归自我改进)方案,让AI直接参与生成训练数据,从而构建起一条“AI出题、AI答题、AI评分”的自我迭代闭环。这一路径若走向成熟,有望从根本上缓解数据瓶颈,为模型持续进化开辟新的可能性。
所谓数据层RSI,核心在于将自我改进的着力点从模型参数转移到数据生产环节。传统训练流程中,人类负责筛选和标注数据,模型只是被动学习;而该方案让模型自身成为数据生成器——它可以根据当前能力短板,主动构造更具挑战性的训练样本,再通过内部评估机制筛选出高质量数据,用于下一轮训练。研究团队在多个基准任务上验证了该方法的有效性:经过数轮迭代,模型在数学推理、代码生成和逻辑问答等任务上的表现均出现持续提升,且未出现明显的过拟合或能力退化迹象。这意味着,AI开始像一位“出题老师”那样,为自己的后继者设计更合适的“教材”。
这一突破的意义不仅在于技术层面的可行性,更在于它改变了人们对AI进化方式的认知。过去,业界普遍依赖“人类投喂数据、模型被动吸收”的单向模式,数据质量与数量直接决定模型上限。而数据层RSI将AI置于数据生产的源头,使其能够主动探索知识边界,甚至发现人类尚未系统整理的问题模式。对于中文互联网场景而言,这一思路尤其具有价值——中文高质量语料相对稀缺,若能通过AI自主生成和筛选数据,将极大降低对人工标注的依赖,加速中文大模型的迭代速度。当然,该方案仍面临数据多样性衰减、评估标准偏差等潜在风险,如何确保AI“自产自销”的数据不陷入同质化陷阱,将是后续研究需要重点攻克的难题。
从产业视角看,数据层RSI的落地可能重塑大模型训练的基础设施。一旦AI能够稳定地自我生成有效训练数据,模型厂商对昂贵人工数据服务的依赖将显著下降,训练成本有望进一步压缩。同时,这也为“模型即数据工厂”的新范式埋下伏笔——未来的AI系统或许不再只是消费数据的产品,而是同时扮演数据生产者、质量检验员和训练调度者的多重角色。尽管距离完全自主进化的通用人工智能仍有距离,但中国团队此次在数据层的探索,无疑为整个行业提供了一条务实且充满想象力的技术路径。在数据枯竭的焦虑弥漫之际,让AI学会为自己“出题”,或许正是通往下一代模型的关键钥匙。
