GLM-5.3-Flash是Z.ai推出的新一代AI大模型,于2026年8月26日正式发布,也是GLM-5系列首款原生多模态模型。该模型总参数达到320B,但每次推理仅激活18B参数,主打AI编程、Agent智能体、多模态理解以及低成本推理等能力。
与GLM-5.2相比,GLM-5.3-Flash在编程、工具调用和自动化任务方面都有明显提升,同时支持最高100万Token长上下文,适合处理大型代码项目、长文档以及复杂连续任务。
GLM-5.3-Flash官方网页版入口:https://bigmodel.cn/
GLM-5.3-Flash网页版入口>>>智谱丨BigModel 平台~

GLM-5.3-Flash主要功能
1、AI编程
GLM-5.3-Flash重点提升了代码生成和Coding Agent能力,可以帮助用户编写代码、分析项目、查找Bug、运行测试并持续修改程序。
相比普通AI代码助手,它更强调连续执行任务,可以结合工具完成较复杂的软件开发工作。
2、原生多模态能力
GLM-5.3-Flash支持图片和视觉内容理解。
例如在网页开发过程中,模型不仅能生成前端代码,还能查看网页实际显示效果,根据页面布局、按钮以及交互结果继续修改代码。
因此,它不仅可以“写代码”,还能够通过视觉结果检查代码是否真正达到要求。
3、支持100万Token上下文
GLM-5.3-Flash支持最高100万Token上下文,可以一次处理更多代码、文档和历史信息。
对于大型代码仓库、长篇资料以及需要连续执行很多步骤的Agent任务来说,可以减少频繁补充上下文的问题。
4、Agent和工具调用
GLM-5.3-Flash可以结合浏览器、电脑操作以及其他外部工具执行任务。
例如可以让AI浏览网页、操作软件、处理文件,再根据执行结果继续下一步操作,比较适合自动化办公和AI智能体应用。
GLM-5.3-Flash有什么特点?
GLM-5.3-Flash最大的特点是性能和推理成本之间的平衡。
该模型采用320B总参数、18B激活参数的MoE架构,同时加入线性注意力和稀疏注意力混合架构,以降低长上下文场景下的计算量和显存占用。官方数据显示,GLM-5.3-Flash在DeepSWE v1.1测试中达到63.4分,高于GLM-5.2的46.2分;AutomationBench测试达到48.8分,高于GLM-5.2的26.2分。

GLM-5.3-Flash怎么使用?
目前用户可以通过Z.ai相关产品以及GLM Coding Plan使用GLM-5.3-Flash。
开发者还可以通过API将GLM-5.3-Flash接入自己的软件、网站或者AI Agent。此外,GLM-5.3-Flash模型权重已经在Hugging Face公开,并采用MIT License,支持SGLang、vLLM等推理框架进行本地部署。

GLM-5.3-Flash模型地址:https://huggingface.co/zai-org/GLM-5.3-Flash
总体来看,GLM-5.3-Flash是一款更加侧重AI编程、多模态和Agent应用的大模型。320B总参数、18B激活参数以及100万Token上下文,让它在保持较强性能的同时进一步降低推理成本。对于程序员以及需要使用AI自动完成复杂任务的用户来说,GLM-5.3-Flash值得关注。