实测Qwen 3.8-Max:长程Agent能力惊艳但效率低下,算力消耗成隐忧

雷峰网实测阿里Qwen 3.8-Max从零搭建3D大模型演进宇宙网站,并与GPT-5.6迭代对比。结果显示Max在交付细节上远超GPT-5.6,但高完成度背后是低效的算力消耗,且因无法自主判断任务终点导致额度耗尽中断。在追求快速迭代和低成本原型场景下GPT仍是首选,Max则适合不计成本追求极致性能的特定需求。

雷峰网近日发布了一篇针对阿里通义千问最新旗舰模型Qwen 3.8-Max的深度实测报告,引发了业界对国产大模型长程Agent能力与算力效率之间矛盾的广泛讨论。测试者通过让该模型从零搭建一个3D大模型演进宇宙网站,并与GPT-5.6进行迭代对比,揭示了这款拥有2.4万亿总参数、约950亿激活参数的旗舰模型在真实任务中的表现与隐忧。

在效果上限方面,Qwen 3.8-Max展现了远超GPT-5.6的交付细节。测试者发现,Max在完成网站搭建任务时,对页面结构、视觉呈现和交互逻辑的打磨达到了令人惊艳的程度,其精雕细琢的完成度在国产模型中实属罕见。然而,这种高完成度背后隐藏着显著的效率问题。实测显示,Max在算力消耗上明显高于GPT-5.6,且因为无法自主判断任务终点,在多次迭代中持续消耗计算资源,最终导致额度耗尽而中断。这一现象暴露出当前长程Agent模型在任务边界感知和资源管理上的核心短板。

值得注意的是,Qwen 3.8-Max此次将战略重心明确转向长程Agent能力,而非延续以往单纯比拼参数规模和榜单分数的路线。官方技术博客中,模型规格和基准测试数据被快速带过,真正占据大量篇幅的是16天自主开发、125小时科研复现、数百轮芯片优化等端到端执行项目案例。这一转变的背景在于,当头部模型的基础能力普遍趋同后,“更大、更强、更开放”已难以构成差异化优势。阿里选择通过强化真实环境中的强化学习训练来提升Agent能力,官方数据显示,随着RL训练环境数量从0增加到约4000个,综合分数从SFT基线的约0.474显著提升,这为Max的Agent能力提供了技术路径上的解释。

从适用场景来看,雷峰网的实测给出了明确结论:对于追求快速迭代和低成本原型的开发场景,GPT-5.6依然是更理性的首选;而在不计成本、追求极致性能表现的特定需求下,Qwen 3.8-Max提供了一个昂贵但有效的国产替代方案。这一结论对行业具有双重启示:一方面,国产大模型在长程任务执行和交付质量上已具备与国际顶尖模型抗衡的实力,这是技术进步的积极信号;另一方面,算力效率低下和任务自主性不足的问题,提醒着整个行业——大模型的竞争正在从单纯的“能力竞赛”转向“能力与成本平衡”的综合较量。对于阿里而言,如何在不牺牲交付质量的前提下优化推理效率,并赋予模型更精准的任务终点判断能力,将是Qwen系列下一代迭代必须直面的课题。