GLM-5.3-Flash: Frontier Intelligence, Flash Cost

发表时间: 2026-08 · Blog post by Z.ai (z.ai)

原文: https://z.ai/blog/glm-5.3-flash

速读

一句话结论 GLM-5.3-Flash 是一个拥有 320B 总参数和 18B 激活参数的原生多模态模型,通过引入线性与稀疏混合注意力机制及底层推理栈优化,在成本降至 1/10 的情况下,其代码与智能体能力大幅超越 GLM-5.2,并逼近 Claude Opus 4.8。

要解决什么问题 大模型在处理长达 1M tokens 的超长上下文时,注意力机制的计算量和 KV 缓存带来的显存开销会急剧膨胀,导致推理成本居高不下。这一卡点在显存容量和内存带宽相对受限的国产 AI 芯片集群上尤为致命,严重制约了前沿模型的大规模经济部署。此外,在代码生成领域(如前端、游戏开发和 3D 模拟),传统的纯文本输出无法覆盖最终产品的交互与渲染效果,模型如果缺乏原生的视觉能力,就无法在测试阶段通过观察渲染界面来发现布局错误或交互失效,从而导致代码生成任务在实际应用中出现断层,无法形成从生成到视觉反馈再到自我修正的完整闭环。

怎么做的 核心思路是对模型架构、训练配方和底层推理栈进行全链路的极致效率重构,并原生融入视觉反馈机制。首先,为了绕开长上下文带来的显存与计算卡点,模型在 GLM 系列中首次采用了线性注意力与稀疏注意力相结合的混合架构。其机制是:线性注意力通过状态建模来捕获局部依赖关系,而稀疏注意力则通过一个轻量级的索引器(indexer)来检索相关的全局上下文。为了进一步降低 1M 上下文长度下索引器的延迟和显存开销,作者设计了 IndexPool 技术,其核心操作是通过加权池化将四个索引器键(Key)向量压缩为一个,其压缩过程可抽象表示为 $K_{pooled} = \sum_{i=1}^{4} w_i K_i$,从而大幅压缩缓存体积。此外,模型引入了流形约束超连接(mHC)以提升扩展效率,并将网络层数从 92 层缩减至 45 层。在多模态与训练数据层面,模型使用了 30T tokens 的多模态预训练语料。针对视觉代码任务,构建了专门的数据合成流水线,强调视觉自我评估和测试时改进。模型能够渲染其生成的代码,检查用户实际看到的界面,识别视觉问题并迭代修改底层代码。对于前端代码,还引入了带有环境反馈的强化学习,并通过基于真实用户流的智能体验证来增强 GUI 评估。在工程实现与部署层面,为了在内存和带宽受限的国产 AI 芯片上实现高效服务,团队基于 SGLang 构建了专用推理引擎,采用了以计算换带宽和以通信换带宽的激进显存优化策略。关键组件包括:针对线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化以及 Layer Split 技术。在集群规模上,采用了生产级的编码-预填充-解码(EPD)分离架构,将多模态编码、提示词预填充和逐词元解码拆分为独立调度、可扩展的工作池。

效果如何 实验基于 320B 总参数(18B 激活参数)的模型,在 1M 上下文设置下,于国产 AI 芯片集群上进行测试。对比的基线模型涵盖了多个路线:代表上一代内部基线的 GLM-5.2 和 GLM-5.3,代表内部基础模型路线的 GLM-4.5-Base 和 GLM-5-Base,代表近期开源模型的 DeepSeek-V4-Flash 和 Kimi-K3,以及代表前沿智能路线的 Claude Opus 4.8、GPT-5.6 Terra、Gemini 3.7 Flash 和 DeepSeek-V4-Vision-Exp。在量化结果上,GLM-5.3-Flash 的每任务成本仅为 0.045 美元,在 Artificial Analysis Intelligence Index v4.1.1 中得分为 57,以 1/10 的成本提供了极具竞争力的性能。在代码与智能体任务中,它全面超越 GLM-5.2,例如在 DeepSWE v1.1 上得分为 63.4(基线为 46.2),在 AutomationBench 上得分为 48.8(基线为 26.2);在内部的 Z.ai Code Bench v1.0 最大努力级别下,以 29.0 的得分逼近 Claude Opus 4.8 的 29.5。在架构效率对比中,计算每层每个注意力头的开销时,GLM-5.3-Flash 的注意力计算量比 GLM-5.3 减少了 3.0 倍,是所有对比模型中最低的;其 KV 缓存比 GLM-5.3 缩小了 4.4 倍。在国产芯片的端到端服务性能上,相比初始基线实现了 3 倍提升,达到了与主流 NVIDIA GPU 相当的硬件效率。作者也坦诚了当前方法的局限性:尽管 KV 缓存大幅缩小,但其绝对尺寸仍然略大于 Kimi-K3 和 DeepSeek-V4-Flash,在此维度上仍有进一步优化的空间。

主要贡献

本文介绍了GLM-5系列中首个原生多模态模型GLM-5.3-Flash。该模型总参数量为320B,但激活参数仅为18B,以十分之一的成本在多项基准测试和实际工作负载中超越了GLM-5.2,同时在编码和Agentic基准测试中逼近了Claude Opus 4.8。

GLM-5.3-Flash从一个全新训练的基础模型开始,其架构和训练方案围绕能力和效率进行了重新设计。在GLM系列中,本文首次引入了结合稀疏注意力和线性注意力的混合架构,大幅降低了长上下文服务成本,同时保留了精确的长上下文能力。该模型还采用了流形约束超连接(Manifold-Constrained Hyper-Connections, mHC)以进一步提高扩展效率。结合最新的30T-token多模态预训练语料库,这些改变使得GLM-5.3-Flash能够以更少的计算量提供更高的智能。在发布之前,GLM-5.3-Flash作为ox-alpha在OpenCode和OpenRouter上进行了匿名测试以收集用户反馈,并迅速成为当周最受欢迎的模型——且所有这些流量均由国产AI芯片提供服务。

匿名测试反馈图1
匿名测试反馈图1
匿名测试反馈图2
匿名测试反馈图2

背景知识与设计原则

视觉编码的边界扩展:视觉编码不仅是处理图像,它更扩展了编码所能触及的边界。对于前端开发、游戏开发和3D模拟等任务,最终输出不仅是代码本身,而是用户体验的界面、交互或世界。许多失败案例只能通过渲染、交互或游戏测试才能暴露出来。CUA进一步将编码从可编程系统扩展到可见和交互式环境中。因此,视觉能力需要原生集成到模型中,使其能够决定何时进行观察,并使用视觉反馈来指导后续的操作。

视觉编码的数据合成与闭环验证:我们针对视觉编码开发了数据合成管道,重点关注视觉自我评估和测试时的改进(test-time improvement)。由此产生的轨迹(trajectories)要求模型与环境进行交互,检查其自身的输出,并迭代地对其进行改进。对于前端编码,我们还探索了带有环境反馈的强化学习,并通过基于真实用户流(user flows)的代理验证进一步加强了GUI评估。这使得验证过程超越了单纯的功能正确性,延伸到了渲染和交互式产品层面。代码让模型构建和改变世界,视觉让它进入人们看到和使用的世界。这里的关键是闭合生成和视觉反馈之间的循环:模型可以渲染其输出,检查用户实际看到的内容,识别视觉问题,并相应地修改底层的工件。这不仅适用于界面和游戏,也适用于视觉结构化输出(如演示文稿)。在下面的例子中,GLM-5.3-Flash检测到生成幻灯片中的布局问题,并通过视觉自我验证完善了排版。

存在布局问题的初始版本
存在布局问题的初始版本
视觉自我验证后的版本
视觉自我验证后的版本

超越编码的专业工作伙伴:编码能力为智能知识工作提供了重要基础,而视觉智能将这些能力扩展到更广泛的专业任务中。专业活动中很大一部分涉及解释异构的视觉和结构化信息,包括文档、电子表格、演示文稿、仪表板、界面和会议工件。视觉智能通过使模型能够联合推理文本、视觉和结构上下文,将模型的能力扩展到以代码为中心的环境之外。模型可以直接解释与任务相关的工件并识别相关信息,而不需要用户将他们的工作环境明确翻译成文本指令。它还可以根据视觉上下文和预期结果评估自己的输出,从而实现更有效的自我验证和改进——包括对演示文稿质量和美学的更强判断能力。

方法细节

架构设计图
架构设计图

超低成本推理架构设计:与GLM-4.5系列相比,GLM-5.3-Flash专门为超低成本推理而设计。尽管两者的总参数量相似(320B对比355B),但GLM-5.3-Flash将激活参数量(18B对比32B)和层数(45层对比92层)几乎减半。

混合注意力机制与IndexPool:为了最小化长上下文场景中的注意力计算成本,我们采用了一种结合线性注意力(linear attention)和稀疏注意力(sparse attention)的混合架构。线性注意力通过状态建模捕捉局部依赖关系,而稀疏注意力则通过轻量级索引器(indexer)检索相关的全局上下文。为了进一步降低在1M-token上下文长度下索引器的延迟和内存开销,我们引入了IndexPool技术,该技术通过加权池化(weighted pooling)将四个索引器键向量(key vectors)压缩为一个。

计算与KV Cache效率对比:为了说明我们架构的效率,我们将GLM-5.3-Flash的每个token计算量和KV缓存大小与GLM-5.3以及最近的两个开源模型(DeepSeek-V4-Flash和Kimi-K3)进行了比较。为了在不同规模的模型之间进行公平比较,我们计算了每层每个头(per head per layer)的注意力计算量和每层平均KV缓存大小(BF16格式)。与GLM-5.3相比,GLM-5.3-Flash使用的注意力计算量减少了3.0倍,KV缓存缩小了4.4倍。在所有比较的模型中,GLM-5.3-Flash的注意力计算量最低。其KV缓存大小仍略大于Kimi-K3和DeepSeek-V4-Flash,这留下了进一步改进的空间。整体架构的改进,结合优化的预训练语料库,使得GLM-5.3-Flash能够以更少的计算量产生更多的智能。

国产AI芯片集群上的大规模服务:在过去的一周里,我们在一个大规模的国产AI芯片集群上提供了GLM-5.3-Flash服务,该集群由高带宽互连和针对底层硬件优化的服务栈提供支持。

基于SGLang的专用推理引擎开发:为了克服单个芯片相对有限的计算和内存容量,我们在SGLang之上为这种架构构建了一个专用的推理引擎。值得注意的是,这项工作得到了由GLM-5.3驱动的基础设施代理(infrastructure agent)的加速,该代理协助工程师开发和优化内核(kernels),诊断性能瓶颈,并改进服务栈——从而创造了一个反馈循环,在这个循环中,模型帮助优化了服务于模型本身的系统。

针对内存和带宽受限的优化技术:这些芯片主要受限于内存容量和带宽,特别是在支持高达一百万token的上下文长度时。这要求进行积极的内存优化,包括针对底层架构量身定制的以计算换带宽(compute-for-bandwidth)和以通信换带宽(communication-for-bandwidth)技术。我们的技术栈结合了用于线性注意力和LM head的节点内张量并行(intra-node tensor parallelism)、ReplaySSM、W8A8量化、混合INT8/FP8/BF16缓存量化以及层拆分(Layer Split)技术。

集群规模的EPD解耦架构与端到端性能提升:在集群规模上,我们生产级的编码-预填充-解码(Encode–Prefill–Decode, EPD)解耦架构将多模态编码、提示预填充(prompt prefill)和逐token解码分离到独立调度和可扩展的工作池(worker pools)中,从而实现高效可靠的服务。与我们在相同硬件上的初始基线相比,我们在端到端服务性能上实现了3倍的提升,达到了与主流NVIDIA GPU相当的硬件效率和单token成本。这证明了国产芯片可以大规模、高效且经济地支持前沿模型推理。

实验环境

实验结果

性价比与综合智能评估
GLM-5.3-Flash推动了Artificial Analysis Intelligence Index v4.1.1的帕累托前沿(Pareto frontier),其得分为57,而每个任务的成本仅为0.045美元(折扣后)——这种智能水平以前通常需要大约10倍的成本才能获得。这使其成为广泛工作负载中极具竞争力的默认选择。
性价比散点图

编码与Agentic基准测试对比
在六个编码和Agentic基准测试中,GLM-5.3-Flash持续超越GLM-5.2,且通常优势显著。例如在DeepSWE v1.1上得分为63.4(GLM-5.2为46.2),在AutomationBench上得分为48.8(GLM-5.2为26.2),总体表现逼近Claude Opus 4.8。
雷达图性能对比

内部编码评估
在Z.ai Code Bench v1.0内部编码评估中,GLM-5.3-Flash在每一个努力水平(effort level)上都明显优于GLM-5.2,并且在最大努力(max effort)下几乎追平了Claude Opus 4.8(29.0对比29.5)。
内部编码评估条形图

基础模型能力对比测试
下表比较了GLM-5.3-Flash-Base与之前的Base模型以及DeepSeek-V4-Flash-Base。GLM-5.3-Flash-Base总体上优于GLM-4.5-Base,并在大多数基准测试中与参数量大得多的GLM-5-Base(744B)保持竞争力。

GLM-4.5-Base GLM-5-Base DeepSeek-V4-Flash-Base GLM-5.3-Flash-Base
Activated Params 32B 40B 13B 18B
Total Params 355B 744B 284B 320B
MMLU 86.1 88.3 88.5 88.1
BBH 86.2 87.4 84.9 86.6
HellaSwag 87.1 88.1 85.3 87.1
LiveCodeBench-Base 28.1 34.4 29.9 37.6
SimpleQA 30 36 31.2 33.5

(DeepSeek-V4-Flash-Base的结果使用内部评估框架进行评估,以控制实现差异)

多模型综合能力全面对比
在涵盖Coding、Agentic和Vision三大类的综合测试中,GLM-5.3-Flash展现出强大的原生多模态与推理能力。

GLM-5.3-Flash GLM-5.2 DeepSeek-V4-Vision-Exp Opus 4.8 GPT-5.6 Terra Gemini 3.7 Flash
Coding
Terminal Bench 2.1 84.3 81 83.9 85 87.4 85.8
DeepSWE (v1.1) 63.4 46.2 59.3 58 69.6 65.3
NL2Repo 56.3 48.9 57.7 69.7
Agentic
Toolathlon Verified 78.4 59.9 75.9 76.2 74.9
AutomationBench (v1.0.6) 48.8 26.2 38.8 41 37.2 52.3
Agents' Last Exam 26.3 20.4 27.3 27 28
HLE w/ Tools 55.3 54.7 55.1 57.9
GDPval-AA v2 1773 1504 1675 1582 1571 1527
Vision
OfficeQA Pro 62.4 57.9 48.9
CharXiv Reasoning (w/ Tools) 89.4 80.4 89.9 88 88.7
Chartography (w/ Tools) 78 64.3 75 68 65
BabyVision 53.4 35.1 46.8 61.6 70.9
MVbench 77.8 69.4 67.1 75 82.2
MMVU 80.5 72.7 67.4 75.8 82.3

结论

GLM-5.3-Flash表明,前沿智能不一定需要付出前沿的成本。这并非任何单一技巧的结果,而是三个层面共同作用的产物:一个用更少计算量提供更强能力的架构、一个更丰富的多模态预训练语料库,以及与推理硬件协同设计的基础设施。目前,该方案正在向更大的模型扩展——GLM-5.3-Flash推动了性价比的前沿,而从构建它中汲取的经验已经开始塑造下一个前沿模型。

补充细节

模型发布与应用集成
GLM-5.3-Flash已向所有GLM Coding Plan用户推出,提供3倍于GLM-5.3的可用配额。用户可以在ZCode中通过Browser Use和Computer Use解锁其多模态能力:代理可以通过点击和视觉验证网页,并操作桌面应用程序。GLM-5.3-Flash的模型权重已在Hugging Face上公开。对于本地部署,GLM-5.3-Flash目前支持SGLang、vLLM和TokenSpeed等推理框架,对更多框架的支持正在开发中。

详细评估参数与策略配置
* HLE w/ tools (full set):使用采样参数temperature=1.0top_p=0.95进行评估,最大生成长度为163,840 tokens。评估在最大上下文长度300,000 tokens下进行,使用上下文管理策略。使用GPT-5.6-luna (medium)作为裁判模型。
* NL2Repo:在1M上下文中,使用temperature=1.0top_p=1.0max_new_tokens=64k评估NL2Repo。为了防止黑客攻击,使用了基于规则和基于LLM的判断来防止恶意行为(例如未经授权的pip或curl操作)。
* DeepSWE:使用mini-swe-agent测试工具运行DeepSWE,参数为temperature=0.95top_p=1.0timeout=6h,上下文长度为400K。
* Terminal-Bench 2.1:在Claude Code 2.1.207中评估,参数为temperature=1.0top_p=1max_new_tokens=65536,6小时超时。
* Agent’s Last Exam (ALE):使用官方评估协议和Claude Code测试工具评估ALE(推理努力=max,1M上下文,64K最大输出)。工具搜索被禁用,结果由官方ALE评估器评分。
* Toolathlon Verified:通过官方评估服务获取所有结果,并报告3次独立运行的平均pass@1。
* AutomationBench:在AutomationBench v1.0.6上进行评估,包含了修复PR #13中引入的null类型处理问题的补丁。
* GDPval-AA v2:模型由Artificial Analysis进行独立评估。
* BabyVision:使用temperature=1.0top_p=0.95,最大上下文长度为164K tokens。将输入图像调整大小,使其较短边至少为1.5K像素,这与其他基线的设置保持一致。
* OfficeQA Pro:在不提供嵌入文本访问权限的情况下,在Treasury Bulletin PDF语料库上评估代理。使用temperature=1.0top_p=0.95,最大上下文长度为512K tokens。
* CharXiv Reasoning与Chartography:使用temperature=1.0top_p=0.95,最大上下文长度为256K tokens。
* MVBench和MMVU:使用temperature=1.0top_p=0.95,最大上下文长度为256K tokens。对于原生接受视频输入的模型(如Gemini 3.7 Flash),直接输入原始视频进行评估。对于不支持视频输入的模型,采用默认的1 fps帧提取策略。如果提取的总帧数超过API的最大限制,则在视频中执行均匀帧采样,直到达到此最大帧数限制。