GLM 5.3 意外曝光:多模态视觉终于要来了,开发者苦等已久

Ai138 8

智谱AI的GLM 5.3意外曝光,核心升级方向为多模态视觉能力,涵盖图片识别、表格解析、UI截图生成代码等。此前GLM-5.2虽性能强劲但缺乏视觉功能,用户呼声极高。此次曝光推动智谱股价涨超8%,视觉能力落地将大幅拓展商业化应用场景。

GLM 5.3 意外曝光:多模态视觉终于要来了,开发者苦等已久

GLM 5.3 意外曝光,多模态视觉这次真的来了?

2026年8月3日下午,智谱AI的开发者社区突然热闹起来。起因是有人发现,智谱旗下的AI编程工具ZCode官网悄悄上线了一个“ZCode for GLM-5.3”的页面。紧接着,GLM-5.3的官方说明文档也短暂对外开放了大约一个小时,不少手快的网友直接截了图。必应搜索甚至一度把ZCode页面标题收录为“GLM-5.3官方Harness”。

页面很快被撤回,但“GLM-5.3”这个名字已经传开了。资本市场反应迅速,智谱(02513)股价当天涨超8%。机构给出的理由很直接:如果GLM-5.3能把视觉能力整合进来,商业化空间会大很多。

真正让开发者兴奋的,是这次曝光背后透露出的关键信息——GLM 5.3,要上多模态了。

GLM用户等视觉,等了太久

2026年6月中旬,智谱开源了旗舰模型GLM-5.2。这个模型实力不弱:开源界AI编程第一、全球第二,仅次于Fable-5。753B的MoE架构、1M超长上下文、MIT协议开源,每一项指标都拿得出手。

但有个痛点一直没解决:没有多模态。

纯文本模型,能处理百万Token的超长上下文,能做深度逻辑推理,但偏偏没装视觉编码器——看不了图,造不了图,截个屏也读不懂。

反观对手,Fable-5是原生多模态模型,视觉能力齐全。国内这边,Kimi K2.5今年1月就上了原生多模态,Qwen3.5-Omni三月份把文本、图像、音频、视频全统一进一个模型。国际上的Gemini 3更是文图音视频一把抓。

GLM用户只能看着别人家的模型羡慕。

所以当智谱首席科学家唐杰在6月29日通过X平台征集“下一个版本的GLM”功能建议时,评论区被一个词刷屏了——视觉。

那条帖子浏览量超过40万,评论里超过60%都在呼吁增加视觉模块。开发者们列出的愿望清单五花八门:原生多模态支持、更强的Agent能力、超长上下文质量保持、更灵活的API……但呼声最高的,始终是视觉。

GLM 5.3:补上那块拼图

从目前曝光的信息来看,GLM 5.3的核心升级方向已经很明确:多模态视觉能力。

具体来说,可能包含这几个关键能力:

图片识别与理解

跟主流大模型一样,具备基本的图片识别能力。图片理解据说也是这次更新的重点内容。拍个照片、发个截图,模型能读懂里面的信息。

表格解析与识别

得益于智谱在GLM-OCR上的技术积累,GLM 5.3有望支持从图片或扫描件中提取表格,识别含合并单元格的复杂表格,并转为Markdown或Excel等可编辑格式。

财务报表、发票、带表格的报告——这些过去需要人工录入的繁琐工作,未来可能只需要拍一张照片。

UI截图生成代码

这是开发者们最兴奋的功能之一。截一张图,AI直接生成可运行的代码——从设计到实现的距离,被压缩到只剩一次截图。

不过这个功能目前还只是社区讨论的猜测。有人提到智谱在研发这方面的能力,但考虑到连GPT现在都做得不够好,这个功能大概率还只是小道消息。

视觉+代码+Agent一体化

如果GLM 5.3真能把视觉、代码生成和Agent能力整合在一起,那就不只是“能看图”那么简单了。开发者可以让模型看懂界面、理解需求、直接写代码执行任务,整个链路会顺畅很多。

这次曝光意味着什么

从时间线来看,GLM-5.2开源才一个多月,5.3的文档就意外曝光了。这个节奏说明智谱内部对多模态的研发已经有一段时间了,不是临时起意。

另外,ZCode官网专门做了“ZCode for GLM-5.3”页面,说明编程工具会优先适配新模型。对开发者来说,这意味着GLM 5.3发布后,ZCode的体验可能会有一个明显提升。

至于GLM 5.3具体什么时候正式发布、视觉能力到底能做到什么程度,目前还没有官方消息。但有一点可以确定:智谱听到了用户的声音,多模态这块拼图,正在被补上。

GLM用户等了这么久,这次应该不会白等。