你的位置:首页 > RF/微波 > 正文

GLM-5.3-Flash开源即适配,摩尔线程助力国产多模态模型高效运行

发布时间:2026-08-28 来源:转载 责任编辑:Lily

【导读】近日,智谱正式开源GLM-5.3-Flash(320B-A18B),这款在匿名公测中登顶OpenCode与OpenRouter双平台调用量榜首的原生多模态模型,以57分的AA综合智能指数进入全球前沿模型区间。模型发布当日,摩尔线程即基于AI训推一体智算卡MTT S5000及MUSA软件栈完成极速适配与高效运行,针对模型中KDA线性注意力机制等创新架构,实现了从算子定制到推理全链路的深度打通。


全球前沿性能,匿名公测登顶双榜


作为GLM-5系列的首个原生多模态模型,GLM-5.3-Flash总参数为320B,激活参数仅18B,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。在自研Z.ai Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。


202608281152435582.png


此前,该模型以代号Ox-Alpha(社区昵称“牛来”)在OpenCode和OpenRouter进行匿名公测,凭借出色的推理速度与智能表现,迅速成为当周最受欢迎的模型,创下双平台调用量新高。


全栈技术闭环,极速打通推理全链路


GLM-5.3-Flash发布当日,摩尔线程工程团队迅速完成模型架构拆解、核心技术分析与典型算子梳理。针对其混合架构中线性注意力采用的KDA机制,团队基于MATE算子优化引擎,快速完成了状态矩阵更新、分块并行扫描等全新算子形态的定制实现与深度调优,并与SGLang-MUSA缓存管理体系深度协同、无缝打通,充分释放了KDA在长上下文推理中的效率优势。


202608281152446170.png


KDA机制的核心创新在于,将传统注意力中随推理长度线性增长的KV Cache,转化为固定规模状态矩阵的增量更新——显存占用不再随序列变长而膨胀,从根本上大幅缓解了长上下文的显存压力。这一前沿架构特性与MTT S5000的高算力密度形成深度协同,为GLM-5.3-Flash超长上下文能力在国产算力平台上的高效、稳定运行提供了坚实支撑。


软硬协同,夯实国产算力底座


本次极速适配充分验证了MTT S5000智算卡的高算力密度与稳定性,展现了MUSA架构“适配—部署—优化”工程体系的高效成熟。摩尔线程以自主软硬件协同能力,为国产AI算力底座建设提供了有力支撑。


GLM-5.3-Flash开源地址:

https://huggingface.co/zai-org/GLM-5.3-Flash


开发者可下载镜像进行开箱体验:

registry.mthreads.com/mcconline/inference/sglang:v0.5.17-s5000-4.3.5-torch2.9.1-20260827-glm 


结论

从GLM-5.3-Flash发布到摩尔线程完成全链路适配,这场“发布即适配”的高效协同,展现了国产AI产业链日益成熟的协同能力。MTT S5000的高算力密度与MUSA软件栈的工程效率,成功承载了KDA机制在长上下文推理中的显存优化优势,使320B参数的超级模型能够在国产算力平台上稳定、高效运行。这不仅是一次技术验证,更是一次产业信心的建立——当顶尖大模型与自主算力底座之间的适配周期从“数月”压缩至“当日”,AGI的产业化规模普惠便不再是遥远的愿景。



gg_20260512171736_266_20260622170931_179.png


特别推荐
技术文章更多>>
技术白皮书下载更多>>
热门搜索

关闭

 

关闭