数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

智谱开源GLM-5.3-Flash多模态模型:性能超越前代,国产芯片高效支撑

2026-08-27来源:快讯编辑:瑞雪

智谱今日宣布,其最新研发的GLM-5.3-Flash(320B-A18B)原生多模态模型正式上线并开源。这一模型作为GLM-5系列的首个多模态版本,总参数量达320亿,在性能上超越了前代GLM-5.2,并在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中斩获57分,与Anthropic旗下备受关注的Claude Opus 4.8模型得分持平,跻身全球前沿模型行列。

在编程能力评估方面,GLM-5.3-Flash在自研的Z.ai Code Bench测试中,表现与Claude Opus 4.8不相上下。更引人注目的是其定价策略:该模型的基础价格仅为GLM-5.3的十分之一,限时折扣期内更是低至二十分之一,仅为Claude Opus 4.8的四十分之一。这一价格优势使得前沿智能技术首次以如此亲民的成本面向市场。

为确保模型质量,智谱在正式发布前以匿名模型Ox-Alpha(中文社区昵称“牛来”)在OpenCode和OpenRouter平台上进行了大规模测试。测试期间,Ox-Alpha迅速成为双平台最受欢迎的模型,创下调用量新高。值得注意的是,所有测试流量均由国产芯片集群提供算力支持,展现了国产硬件在前沿AI领域的实际应用能力。

GLM-5.3-Flash的性能突破得益于其创新的模型架构设计。该架构专为极低成本场景优化,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量从320亿大幅缩减至180亿,层数也从92层减少至45层。结合智谱最新的30T Token多模态预训练数据,模型在减少计算资源消耗的同时实现了性能提升。GLM-5.3-Flash是全球首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,通过流形约束超连接(mHC)技术进一步增强了模型的扩展能力。

在架构效率方面,智谱通过线性注意力与稀疏注意力的混合设计显著降低了长上下文场景下的注意力成本。线性注意力通过递归机制捕捉局部依赖关系,稀疏注意力则利用轻量级索引器召回全局上下文。为进一步优化性能,智谱引入了IndexPool技术,将索引器的缓存向量从4个压缩至1个,大幅减少了时延与内存开销。与GLM-5.3、DeepSeek-V4-Flash和Kimi-K3等基线模型相比,GLM-5.3-Flash的注意力计算量降低了3.01倍,KV缓存大小减少了4.44倍,尽管其KV缓存仍略高于部分竞品,但已成为当前基线模型中注意力计算量最低的方案。

在硬件支持方面,智谱首次在大规模流量场景中部署了国产芯片集群。这些芯片通过自研高带宽互联网络连接,并基于SGLang构建了专用推理引擎。为克服单芯片算力与内存容量的限制,智谱采用了多项定制优化技术,包括算力换带宽、通信换显存等策略,并结合线性注意力、LM head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化及Layer Split等技术,形成了完整的技术栈。在集群层面,智谱采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为独立工作池,实现了高效、可靠的服务部署。与初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到主流英伟达GPU水平。

目前,GLM-5.3-Flash已正式面向全球开源,并接入ZCode等编码平台。用户可通过GLM Coding Plan每日限量领取10,000张体验卡,或直接调用API使用这一前沿模型。

英伟达前AI总监携新架构挑战Transformer,5万亿上下文物理AI开启宇宙模拟新纪元
当我们在为大语言模型能写出一首好诗、能帮我们润色工作邮件而欢呼时,Accelerated Understanding像一个从未来穿越回来的破壁人,冷酷地告诉我们:语言和图像只是人类理解世界的表象,物理法则,…

2026-08-27

OPPO Find X10首发天工屏2.0:有害蓝光创新低,重新定义高端OLED显示新标准
据悉,这块屏幕首发搭载N1原色光谱发光材料,实现了有害蓝光低至3.7%的行业最低水平,同时将650至670纳米有益红光占比提升至5.5%,创下OLED行业新高。天工屏2.0以“原色好光,护眼通透”重新定义了…

2026-08-27

9月新机潮来袭!vivo X500系列三杯齐发,iQOO 16与小平板同期亮相
IT之家 8 月 27 日消息,博主 @数码闲聊站 今日爆料,vivo X500 系列 9 月三杯齐发,大概率是最早发布的国产直板旗舰,Pro系列首发 2nm 天玑 9600 Pro。此外,该机还搭载 X3…

2026-08-27

英伟达或129亿美元收购Hugging Face,补全AI生态布局待监管审查
8 月 27 日,据 The Information 援引知情人士消息,英伟达已经同意以 129 亿美元收购 HuggingFace,交易将使英伟达获得这家拥有广泛开发者基础的人工智能模型平台。 根据英伟…

2026-08-27

对话科安创能姜伟:以“小制冷机矩阵”破局,解锁高温超导与氢液化新未来
智客ZhiKer近期与姜伟进行了一次对话,聊到矩阵式方案为什么是聚变和氢液化的必选项、20K温区的技术壁垒在哪、大厂模仿的难度有多大?我做产品定义和系统架构;联创兼CTO 吴英哲博士负责低温系统与制冷机开…

2026-08-27

o1和o3缔造者预言:两年后人类AI研究或成“边缘角色”?
要知道,这几十个人到底有多抢手,看他自己的招人名单就够了。而所谓放大,就是你得凭三寸不烂之舌说服差不多十个掌握生杀大权的人,然后这十个人再把三到六个月砸进你这个无底洞。 访谈最后,主持人把这件事挑明了问他…

2026-08-27

面壁智能四周年喜讯:MiniCPM系列开源模型下载量破5000万次大关
IT之家 8 月 26 日消息,面壁智能官方今日宣布,在面壁智能四周年之际,MiniCPM 系列开源模型全球累计下载量突破 5000万次。官方表示,在最新的 Artificial Analysis(AA)榜…

2026-08-26