智谱今日宣布,其最新研发的GLM-5.3-Flash(320B-A18B)原生多模态模型正式上线并开源。这一模型作为GLM-5系列的首个多模态版本,总参数量达320亿,在性能上超越了前代GLM-5.2,并在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中斩获57分,与Anthropic旗下备受关注的Claude Opus 4.8模型得分持平,跻身全球前沿模型行列。
在编程能力评估方面,GLM-5.3-Flash在自研的Z.ai Code Bench测试中,表现与Claude Opus 4.8不相上下。更引人注目的是其定价策略:该模型的基础价格仅为GLM-5.3的十分之一,限时折扣期内更是低至二十分之一,仅为Claude Opus 4.8的四十分之一。这一价格优势使得前沿智能技术首次以如此亲民的成本面向市场。
为确保模型质量,智谱在正式发布前以匿名模型Ox-Alpha(中文社区昵称“牛来”)在OpenCode和OpenRouter平台上进行了大规模测试。测试期间,Ox-Alpha迅速成为双平台最受欢迎的模型,创下调用量新高。值得注意的是,所有测试流量均由国产芯片集群提供算力支持,展现了国产硬件在前沿AI领域的实际应用能力。
GLM-5.3-Flash的性能突破得益于其创新的模型架构设计。该架构专为极低成本场景优化,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量从320亿大幅缩减至180亿,层数也从92层减少至45层。结合智谱最新的30T Token多模态预训练数据,模型在减少计算资源消耗的同时实现了性能提升。GLM-5.3-Flash是全球首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,通过流形约束超连接(mHC)技术进一步增强了模型的扩展能力。
在架构效率方面,智谱通过线性注意力与稀疏注意力的混合设计显著降低了长上下文场景下的注意力成本。线性注意力通过递归机制捕捉局部依赖关系,稀疏注意力则利用轻量级索引器召回全局上下文。为进一步优化性能,智谱引入了IndexPool技术,将索引器的缓存向量从4个压缩至1个,大幅减少了时延与内存开销。与GLM-5.3、DeepSeek-V4-Flash和Kimi-K3等基线模型相比,GLM-5.3-Flash的注意力计算量降低了3.01倍,KV缓存大小减少了4.44倍,尽管其KV缓存仍略高于部分竞品,但已成为当前基线模型中注意力计算量最低的方案。
在硬件支持方面,智谱首次在大规模流量场景中部署了国产芯片集群。这些芯片通过自研高带宽互联网络连接,并基于SGLang构建了专用推理引擎。为克服单芯片算力与内存容量的限制,智谱采用了多项定制优化技术,包括算力换带宽、通信换显存等策略,并结合线性注意力、LM head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化及Layer Split等技术,形成了完整的技术栈。在集群层面,智谱采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为独立工作池,实现了高效、可靠的服务部署。与初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到主流英伟达GPU水平。
目前,GLM-5.3-Flash已正式面向全球开源,并接入ZCode等编码平台。用户可通过GLM Coding Plan每日限量领取10,000张体验卡,或直接调用API使用这一前沿模型。












