Harness项目J-Space被指造假,独立复测结果与宣传完全相反

开源项目J-Space Cognition Suite声称无需修改模型权重,仅靠DeepSeek V4 Flash加外部工具即可追平GLM-5.3,但GitHub用户GoForceX严格按说明复测后,结果与宣传完全相反。该事件再次印证小模型加工具难以替代顶级大模型。

开源社区近日上演了一出“打假”大戏。一个名为 J-Space Cognition Suite 的开源项目,因宣称能借助外部工具让 DeepSeek V4 Flash 在 Agent 任务中追平甚至超越顶级大模型,在 48 小时内引发行业狂欢。然而,独立复测结果却与宣传完全相反,项目作者最终承认数据“确实夸张”。这一事件再次印证了 AI 领域那条著名的“苦涩的教训”:外挂工具补不了模型智商,小模型加工具难以替代顶级大模型。

据雷峰网报道,J-Space Cognition Suite 声称无需修改模型权重,仅靠 DeepSeek V4 Flash 配合其精巧的外部 Harness(即外部工具框架),就能在 Agent 任务中追平 GLM-5.3;若换成 DeepSeek V4 Pro,甚至能直接超越 Claude Fable 5。同时,该项目还宣称速度提升 2.53 倍,Token 效率提升 2.21 倍。如果这些数据属实,这无疑是 AI 工程史上的奇迹——意味着可以用几十分之一的成本复刻顶级大模型的效果。然而,泡沫破裂的速度比想象中更快。GitHub 用户 GoForceX 严格按照项目说明,使用 Terminal Bench 完成了独立复测,最终结果与宣传完全相反:加入 J-Space 后,基准测试分数不升反降,Token 消耗量明显增加,推理速度也比原生模型更慢。当社区进一步要求公开完整原始实验数据时,作者承认数据“确实夸张”,却始终拿不出可复现的运行日志,反而开始删除质疑的 issue。

这一事件并非孤立。几乎在同一时间,OpenAI 思维链(CoT)核心发明者 Jason Wei 在 X 上发布了一篇长文,精准戳破了“小模型 + 万能工具”的幻想。他用自己学羽毛球的经历做比:“在球场上,我就像一个 1B 参数的认知核心。教练教的每个击球动作我都能做,但要在高速回合里把架拍、转体、击球点、随挥这些要点全部串联起来,几乎要耗尽全部精力。这跟那些练了上万次、将动作化为肌肉记忆的专业选手完全不是一个级别。”Jason Wei 隐喻的正是“小模型 + 工具”与“大模型内化能力”的本质区别。他强调,模型不依赖外部工具,自然且快速地完成任务,这件事至关重要。一旦承认高维认知应该以内生的方式处理,那么 1B、甚至 10B 的核心显然都是不够的。

J-Space 神话之所以能在短时间内引发全行业狂欢,在于它精准地切中了当前 AI 产业的两大焦虑:大模型太贵,算力烧不起怎么办?大模型要落地,端侧设备太弱怎么跑?事实上,业内一直在寻找一种可能——小模型 + 工具也能干掉顶级大模型。AI 大牛吴恩达正是这一路线的支持者之一。他曾多次在公开演讲中展示数据:用版本更早、参数量更小的 GPT-3.5,搭配包含反思、工具调用、任务规划的迭代式 Agent 工作流,在很多基准测试上的表现能够超越当时最强的 GPT-4。微软 Phi-4、Mistral 等小模型,也靠着高质量数据训练,在代码、数学等垂直任务上,以 3B 到 14B 的体量击败过上一代千亿参数模型。这让很多开发者产生了一种错觉:Scaling Law 的边际效应正在递减,只要工具配得足够精巧,小模型也能“以小博大”。

然而,J-Space 的造假事件给这种乐观情绪泼了一盆冷水。它揭示了一个残酷的现实:工具链的优化确实能提升小模型在特定任务上的表现,但无法弥补模型本身认知能力的根本差距。顶级大模型之所以强大,是因为它们通过海量数据和算力训练,将复杂认知能力内化为“肌肉记忆”,能够在高速、多变的真实场景中自然流畅地完成任务。而小模型即使配上再精巧的工具,也像是在球场上手忙脚乱的初学者,每一个动作都要刻意思考,难以达到专业选手的自动化水平。对于开发者而言,这一事件也敲响了警钟:面对那些宣称“低成本替代顶级模型”的项目,必须保持审慎,用可复现的实验数据说话,而不是被华丽的宣传话术所迷惑。在 AI 技术快速迭代的当下,理性与实证精神,依然是抵御泡沫最有效的武器。