三款国产大模型联手改造“屎山”代码,谁才是真正的救火队长?
硅星人让Kimi K3、Qwen 3.8-Max和GLM 5.2共同改造堆满历史遗留代码的网站,六轮测试揭示:没有全能冠军,模型能力随任务类型变化,选模型要看具体活。
让 Kimi K3、Qwen 3.8-Max 和 GLM 5.2 共同接管了一座屎山
最近,硅星人搞了次有点疯的实验:让三款国产大模型——Kimi K3、Qwen 3.8-Max 和 GLM 5.2——一起去改造我们那个堆满历史遗留代码的网站。这不是什么跑分测试,是一次真实的“屎山”救援。
网站的问题有多大?前后端换了好几拨人,代码结构臃肿,交互混乱,虚假功能遍地。说白了,这就是你能见到的最烂的网站开发范本之一。对模型来说,空白项目好发挥,但半路项目才是真试金石。它得看懂项目当前状态,在不破坏现有功能的前提下精确修改,属于“屎上雕花”的高难度操作。
我们设了六个任务,挨个测试三款模型的表现。结果挺有意思:没有一款模型能从头赢到尾。
第一轮:谁看懂了项目当前的进展?
接手半路项目,最怕的不是代码多,而是模型把旧文档当成当前需求,把已经做完的功能重新做一遍。所以我先让三个模型分析项目,看谁能更快摸清现状。
- Qwen 3.8-Max:10秒内完成分析,最快。它像每天待在现场的监工,知道施工队最近在改哪面墙、铺哪块砖。最准确地抓住了项目最近在做什么。
- Kimi K3:像一分钟带你看完房子的中介,讲清楚了房间布局,但把14个CMS集合数成了15个,还把隔壁的工作记录文件夹介绍成了“文档仓库”。
- GLM 5.2:像经验丰富的老师傅,检查承重墙和水电管线,对项目底层结构理解最深。但翻图纸翻得太认真,把四月份的旧方案也当成了当前施工计划,把已完成的搜索功能列为待办事项。
排名:Qwen 3.8-Max > Kimi K3 > GLM 5.2
第二轮:解决网站报错
我启动了前端页面,却没同时打开CMS,网页报错了。把报错信息丢给三个模型处理。
- Qwen 3.8-Max:快人一步,直接帮我启动了CMS。
- GLM 5.2:处理速度较慢,等它准备启动CMS时,公共端口已被Qwen占用,于是它直接复用了Qwen启动的服务。这是正确且成熟的工程判断。
- Kimi K3:只给出解决方案,没实际执行。
排名:Qwen 3.8-Max > GLM 5.2 > Kimi K3
第三轮:轮播图效果实现
要求实现无缝无限轮播,卡片持续向左移动,第08张移出后第01张从右侧自然接上,不能出现停顿、跳动或空白。
- GLM 5.2:功能最完整,自动播、可拖动、真循环都有。但接缝处仍然跳一下,离真正的无缝循环只差最后一点收尾。
- Kimi K3:把直线跑道改成了环形,但删掉了自动轮播功能,且动画细节不够精细,画面会跳帧。
- Qwen 3.8-Max:问题最严重。它删除了鼠标拖动功能,用复制多份内容的方式伪装成循环,播放到最后一轮时卡片仍然会跳回开头。这是一个看起来能用的错误答案,比半成品更危险。
排名:GLM 5.2 > Kimi K3 > Qwen 3.8-Max
第四轮:修改现有功能
要求将“最新观点”板块的强调色改为科技蓝(#3157FF),应用于标题、序号和悬停状态,卡片增加浅蓝色边框和圆角。
- Qwen 3.8-Max:修改速度最快,文字颜色、背景颜色、边框和圆角基本都处理正确。但鼠标悬停后的交互色仍然是绿色,没同步修改。
- GLM 5.2:没直接修改代码,先问了两个问题确认范围。问到的地方做得漂亮,没问到的地方彻底放飞。最大卡片的悬停色是绿色,小卡片是蓝色,同一种内容只改一半。
- Kimi K3:只改了边框、圆角和一处颜色,其他部分几乎没有变化。
排名:Qwen 3.8-Max > GLM 5.2 > Kimi K3
第五轮:考验模型审美
不给参考答案,让模型重新设计首页Hero区域,体现科技媒体的专业感和编辑气质。
- Kimi K3:采用科技极简风,标题粗体无衬线,左侧文案加蓝色按钮,右侧加入网格、细线与柔光背景动效。科技感最强,而且主动加了动效。
- Qwen 3.8-Max:粗体极简风,超大黑色无衬线标题分三行占据左侧,背景几乎没有装饰。最像现代内容媒体。
- GLM 5.2:杂志编辑风,标题改成超大衬线斜体,加入EDITORIAL、EDITION 2026等期刊元素,形成类似纸质杂志封面结构。
按硅星人自身的理解,我们认为“科技感”是第一属性,Kimi K3切中要义。Qwen 3.8-Max好歹是现代媒体风格,GLM 5.2做得像杂志,只好排第三。
排名:Kimi K3 > Qwen 3.8-Max > GLM 5.2
第六轮:增加快速审核功能
完善CMS审核工作台,要求集中显示待审核文章,点击后从右侧展开详情面板,不跳转页面,操作后立即更新列表和数量。
- Qwen 3.8-Max:侧边详情最完整,标题、作者、提交时间、状态、分类、摘要和正文预览全部出现,底部能直接执行审核操作。
- Kimi K3:基本信息和操作功能齐全,但正文预览过于简化,用户仍需跳转到编辑页查看完整内容。
- GLM 5.2:提供了摘要和固定操作栏,但正文预览区域被一个巨大的图片加载失败占位覆盖,偏离Prompt最明显。
排名:Qwen 3.8-Max > Kimi K3 > GLM 5.2
总结:没有全能冠军
几轮测试做完,没有一款模型能从头赢到尾。如果用最朴素的名次积分(第一名3分、第二名2分、第三名1分)叠加,结果仅供参考,它仅仅是在改造硅星人网站这一个项目上的具体表现。
- Qwen 3.8-Max:优势是快,对项目当前状态更敏感。但为了快,它会删功能、用伪装方案,信任度存疑。
- GLM 5.2:像喜欢先读资料的工程师,代码结构理解最深,轮播完成最全面。但速度慢,容易被旧文档牵着走。
- Kimi K3:带来最多意外。分析时最简洁但数字错误最多,修改前端常漏要求,却在CMS任务中第一个完成。像灵感好的设计师,又像没耐心做完检查的实习生。
这次实验告诉我们:模型的能力不是固定属性,它会随着任务类型发生变化。选模型,得看具体要干什么活。

