【导读】过去一周,一个代号为Ox-Alpha的神秘模型横扫AI圈,以匿名之姿同时冲上OpenCode和OpenRouter调用量榜首,终结了DeepSeek连续56天的霸榜纪录。开发者们惊呼“它在屠杀我们的内部基准”,全网竞猜其身份——谷歌?海外神秘团队?昨天,答案终于揭晓:它正是智谱刚刚开源的GLM-5.3-Flash,GLM-5系列首个原生多模态模型。但比“牛来”爆火更值得关注的,是一个正在浮出水面的关键信号:在匿名测试期间,所有推理请求均由国产芯片集群支撑,训练端或由海光DCU等国产芯片支持。
不到一天时间,Ox-Alpha 同时冲上 OpenRouter 和 OpenCode 的调用量榜首,刷新了 OpenRouter 的模型发布纪录,也结束了 DeepSeek 连续56天霸榜的局面。短时间内,用户累计调用量达到62T Token。
Hermes Agent 创始人在测试后直言:“This model is slaughtering all our internal benchmarks. What the actual fuck is it??”——这个模型几乎在“屠杀”他们所有的内部测试基准。
于是,全网开始猜:这到底是谁家的模型?有人猜是谷歌 Gemini,有人怀疑是某个海外大厂偷偷放出来测试的新模型,甚至还有人拿出各种截图对比,称它的表现疑似已经明显超过 Fable 5。一时间,关于 Ox-Alpha 的身份猜测几乎席卷了整个AI圈。
直到昨天,答案终于揭晓。Ox-Alpha,正是智谱的 GLM-5.3-Flash。而“Flash”这个名字,反而很容易让人低估它。这里的 Flash,并不意味着能力上的“轻量版”或“降档版”。
前沿智能进入普惠时代
总结一下,智谱的GLM-5.3-Flash有什么关键点:
第一,GLM首个原生多模态模型。GLM-5.3-Flash(320B-A18B)正式上线并开源,是GLM-5系列首个原生多模态模型,支持1M上下文,重点面向Coding、Agent及复杂专业任务。
第二,能力进入全球第一梯队。模型在AA综合智能指数中获得57分,与Claude Opus 4.8持平;在编程能力测试中表现对标Opus 4.8,同时全面超过参数量更大的GLM-5.2。
第三,同等能力,价格大幅下降。GLM-5.3-Flash价格仅为GLM-5.3的1/10,限时优惠低至1/20,约为Claude Opus 4.8的1/40,主打“前沿能力+低成本”。
第四,匿名测试期间直接爆火。正式发布前,模型以匿名身份Ox-Alpha登陆OpenCode和OpenRouter进行大规模测试,迅速成为双平台热门模型并创下调用量新高,相关请求全部由国产芯片提供算力支持。
第五,架构、Coding和专业Agent全面升级。模型采用稀疏注意力与线性注意力混合架构,并引入mHC等新技术,将注意力计算量和KV缓存显著降低;原生视觉能力则让模型可以“观察—验证—改进”自己的输出,不仅能用于前端、游戏、3D等视觉Coding,也进一步拓展到金融、法律、Office文档等专业工作场景。



国产芯片正在扛起大旗
这次GLM-5.3-Flash最值得关注的,可能不只是模型本身,而是它背后的算力——国产芯片开始真正扛起前沿模型的大规模推理服务。
过去一周,智谱首次尝试让大规模真实流量跑在国产芯片集群上。国产芯片单卡算力和内存容量相对有限,而GLM-5.3-Flash又支持最长1M上下文,长上下文带来的内存容量和带宽压力非常大。因此,智谱围绕国产芯片的底层架构进行了大量针对性优化,甚至采用“以算力换带宽、以通信换显存”等策略。
在软件栈上,团队基于SGLang打造了专用推理引擎,并结合节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化以及Layer Split等技术,尽可能把有限的硬件资源榨干。集群层面,则采用生产级的Encode–Prefill–Decode(EPD)分离架构,把多模态编码、Prompt预填充和逐Token解码拆成可以独立调度、独立扩缩容的工作池,从而提升整个推理集群的利用率和稳定性。
最终的结果相当直接:相比同一硬件上的初始基线,端到端服务性能提升了3倍,硬件效率和单Token成本已经达到与主流英伟达GPU相当的水平。
而在训练端,同样值得关注。训练或由海光DCU等国产芯片支持。以海光DCU为代表的国产GPGPU,不仅提供训练所需要的通用并行算力,还通过DTK软件栈、算子库和集群互联能力,尽可能降低从主流GPU生态迁移过来的成本。换句话说,国产芯片正在从“能不能跑大模型”,走向“能不能把大模型规模化训练起来”
结论
GLM-5.3-Flash的爆火,不只是智谱在模型能力上的又一次跃升,它更是一份关于“国产算力能不能扛住前沿模型”的实战报告。匿名测试一周,真实流量跑在国产芯片集群上,端到端服务性能比初始基线提升3倍,硬件效率和单Token成本对标主流英伟达GPU——这组数据说明,国产芯片正在从“能跑”走向“能规模化跑起来”。训练端或由海光DCU支撑,推理端以混合架构与EPD分离调度榨干硬件资源,智谱与国产芯片的这次深度协同,为“国产大模型+国产算力”的组合提供了一个极具说服力的实战样本。



