8月26日晚间,智谱正式上线并开源了GLM-5.3-Flash(320B-A18B),这是GLM-5系列的首个原生多模态模型。该模型总参数规模达到320B,能力全面超越前代GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic旗下广受欢迎的Claude Opus 4.8得分持平。这一成绩标志着国产大模型在多模态理解与生成领域已跻身世界第一梯队,也为后续商业化落地奠定了坚实的技术基础。
GLM-5.3-Flash的架构设计以极低成本为核心目标,结合智谱最新的30T Token多模态预训练语料,能够以更少的计算资源实现更强的性能表现。这种“低成本、高性能”的设计理念,直接回应了当前AI行业对推理成本高度敏感的痛点。值得注意的是,在正式发布前,GLM-5.3-Flash以匿名模型Ox-Alpha(中文社区称作“牛来”)在OpenCode和OpenRouter平台上进行了大规模公开测试,Token调用量高达62T,且这些请求流量全部由国产芯片提供算力支持。相较同一硬件环境下的初始基线,基于国产芯片集群的端到端服务性能提升了3倍,硬件效率和单Token成本已达到主流英伟达GPU相当水平。这一实践用真实数据证明,国产算力已具备在大规模真实业务场景下高效、经济地支撑前沿大模型推理需求的能力。
支撑这一成果的关键,是商汤大装置提供的国产异构混推技术。商汤打造的“一套模型、一座Token工厂、一套智能体管控系统”核心能力体系,在此次合作中发挥了枢纽作用。其中,Token工厂承担着将智能能力规模化生产的关键职能:它通过多模态模型与大装置基础设施的联合优化,将不同芯片、集群、能源和交付节点有机组织起来,持续生产更高质量、成本更低的Token。同时,Token工厂与大模型之间构建起双向反哺闭环,能够更好地适配原生多模态模型的迭代需求。商汤大装置高效支持GLM-5.3-Flash上线,正是这套闭环能力的有力印证。
长期以来,市场对国产算力的普遍认知是“性价比不高、难以规模商用”。商汤大装置在今年的WAIC期间,针对这一卡点从“性价比、适配性、能效比”三个维度系统性破题。在性价比层面,商汤跳出单卡性能比拼的传统思路,通过先进的异构混合推理技术,根据不同推理阶段对计算、带宽的不同需求,让不同架构、不同定位的国产芯片各尽其长、高效协同,整体推理性价比达到NVIDIA H系列的1.25倍,相比国产同构推理,同等成本下Token产能扩大约2.5倍。在适配性上,通过底层算子优化、多卡并行调优和工具链适配等手段,大幅降低了国产算力的应用门槛。在能效比层面,商汤推出算电协同Agent,并重新定义TPW(Tokens Per Watt)作为AIDC全新价值标尺。
此次智谱与商汤的深度合作,不仅是两家头部技术企业的强强联合,更是国产AI产业链协同创新的标志性事件。它意味着国产算力已经从“单点可用”走向“大规模商用”,能够以媲美国际主流硬件的性能和经济性,支撑起全球前沿级别的大模型推理服务。对于整个行业而言,这一案例提供了可复制的范式:通过软硬协同优化、异构资源调度和Token工厂化生产,国产算力完全有能力成为AI普惠化进程中的坚实底座。随着更多类似合作的落地,中国AI产业在算力自主可控与模型能力领先之间的良性循环将加速形成,最终惠及更广泛的开发者和终端用户。
