快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 前天 · 星期五 · 08-28 12:06 约 2 分钟读完

智谱发布GLM-5.3-Flash原生多模态模型,商汤国产算力支撑上线

摘要

8月26日,智谱上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型,AA指数57分,与Claude Opus 4.8持平。商汤大装置提供国产算力支持,端到端性能提升3倍,Token成本比肩英伟达GPU,标志着国产算力规模化商用新突破。

智谱发布GLM-5.3-Flash原生多模态模型,商汤国产算力支撑上线
图片来源:量子位

8月26日晚间,智谱正式推出并开源了GLM-5.3-Flash(320B-A18B),作为GLM-5系列的首个原生多模态模型,该模型总参数规模达320B,性能超越前代GLM-5.2。在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)评测中,GLM-5.3-Flash取得57分,与Anthropic旗下热门模型Claude Opus 4.8持平,跻身全球前沿模型能力区间。

该模型架构专为极低推理成本设计,结合智谱最新30T Token多模态预训练语料,能以更少计算资源实现更强性能。商汤大装置依托国产异构混推技术,为GLM-5.3-Flash上线提供大规模国产算力支持与Token服务,成为国产算力规模化商用的又一标杆案例。

商汤方面介绍,其核心能力体系为“一套模型、一座Token工厂、一套智能体管控系统”。Token工厂通过多模态模型与大装置基础设施联合优化,整合不同芯片、集群、能源及交付节点,持续生产高质量、低成本Token,并与大模型形成双向反哺闭环,适配原生多模态模型迭代需求。

在正式发布前,GLM-5.3-Flash以匿名模型Ox-Alpha(中文社区称“牛来”)在OpenCode和OpenRouter上进行大规模测试,Token调用量达62T,全部由国产芯片提供算力。相较同一硬件环境初始基线,基于国产芯片集群的端到端服务性能提升3倍,硬件效率和单Token成本已达到主流英伟达GPU相当水平。

这一实践印证国产算力已能在真实业务场景中高效、经济地支撑前沿大模型推理。商汤大装置持续推动国产算力从“单点可用”走向“大规模商用”,通过异构混合推理技术,整体推理性价比达NVIDIA H系列1.25倍,同等成本下Token产能扩大约2.5倍。7月日均Token服务量达2.42万亿,预计2026年底突破日均10万亿。

智谱GLM-5.3-Flash商汤大装置国产算力
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词