2026-08-28 12:06:16
来源:量子位
国产异构助力前沿智能进入普惠时代
8月26日晚,智谱正式上线并开源了 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列的首个原生多模态模型。该模型总参数量为 320B,性能超越 GLM-5.2。在全球权威的 Artificial Analysis Intelligence Index(AA 综合智能指数)中,它取得了 57 分的成绩,成功迈入全球前沿模型能力区间,与 Anthropic 旗下备受欢迎的 Claude Opus 4.8 得分持平。GLM-5.3-Flash 的架构专为极低成本设计,结合智谱最新的 30T Token 多模态预训练语料,能够以更少的计算资源实现更强的性能。
依托先进的国产异构混推技术,商汤大装置为 GLM-5.3-Flash 的上线提供了大规模国产算力支持与 Token 服务,打造了国产算力规模化商用的又一硬核落地标杆。

这一合作的背后,正是商汤所打造的“一套模型、一座 Token(词元)工厂、一套智能体管控系统”核心能力体系。其中,Token 工厂承担着将智能能力进行规模化生产的关键角色:它通过多模态模型与大装置基础设施的联合优化,将不同的芯片、集群、能源和交付节点有机组织起来,持续生产出更高质量、更低成本的 Token。同时,Token 工厂与大模型之间构建了双向反哺的闭环,能够更好地适配原生多模态模型的迭代需求。商汤大装置高效支持智谱 GLM-5.3-Flash 的上线,正是这套闭环能力的有力印证。
长期以来,市场对国产算力普遍存在“性价比不高、难以规模化商用”的固有认知。然而,在正式发布前,GLM-5.3-Flash 曾以匿名模型“Ox-Alpha”(中文社区昵称为“牛来”)在 OpenCode 和 OpenRouter 上进行了大规模测试,Token 调用量高达 62T。**值得注意的是,这些请求流量全部由国产芯片提供算力支持。**且相较