320B 国产大模型本地跑,GLM 量化版更新 3 个坑先看清

国产大模型 GLM-5.3-Flash 的本地版,又要更新了。

发消息的是 Mia(@MiaAI_lab),一位专攻本地推理部署的开发者。她的原话很短:「Coming soon: GLM 5.3 Flash EXL3 update 」,配一张黑底白字的海报,写着 GLM-5.3-Flash 和 EXL3。没有日期,没有细节,就一句预告。

可这条只有一句话的消息,懂行的人一看就明白分量:GLM-5.3-Flash 是目前能在本地跑起来的最强国产开源模型之一,而她手上那套 EXL3 方案,正把这个 320B 的庞然大物往两台桌面小机器里塞。

一、这个模型到底有多大

GLM-5.3-Flash 是智谱(Z.ai)8 月 26 日发布的开放权重模型,MIT 许可,第一天就放出了完整权重。

它是一套混合专家模型:总共 320B 参数,每个 token 只激活 18B。45 层,288 个专家,每次路由挑 8 个。注意力用上线性注意力加稀疏注意力的混合结构,外加一个叫 IndexPool 的压缩器,把四路索引向量并成一路。官方说法是,相比 GLM-5.3,注意力计算降到三分之一,KV 缓存降到约四分之一。

它也是 GLM-5 系列里第一个原生多模态的型号:文字、图片、视频塞进同一段对话处理,上下文窗口 100 万 token。

有意思的是,它在 8 月 20 日先以「Ox Alpha」的匿名身份挂在 OpenRouter 上跑了一周,成了那周最火的模型,直到 8 月 26 日才揭晓身份。价格也很能打:输入每百万 token 0.15 美元,输出 0.5 美元,大约是 GLM-5.3 的十分之一。

二、为什么本地跑要靠 EXL3

麻烦在于体积。

GLM-5.3-Flash 的 FP8 权重约 328GB,BF16 版本约 642GB。这个数字意味着你几乎不可能把它装进一台机器,更别说还得留出空间给 KV 缓存。

EXL3 是 ExLlamaV3 项目(作者 turboderp)的量化格式。4bpw 的 EXL3 版本把体积压到约 176GB,只有 FP8 的 54%。

关键是质量几乎没掉。Mia 自己给的对照数据是:FP8 的 KLD 为 0.0206,EXL3 4bpw 为 0.0246,只落后约 0.004 nat,体积却少了一半。她给出的排序是 BF16 最好,FP8 和 EXL3 4bpw 基本打平,NVFP4 垫底。

今年 ExLlamaV3 也补上了对 GLM-5.3-Flash 的支持,还把 MoE 专家的 CPU 卸载做了进去,显存不够时可以借内存顶上。

三、她已经跑出什么成绩

光有量化文件不够,还得有人把服务端调好。Mia 在 GitHub 上开源了一套方案(
GLM-5.3-Flash-EXL3-2x-DGX-Sparks,约 500 星),专门跑在两到四台 NVIDIA DGX Spark 上。

DGX Spark 是英伟达的桌面级 AI 机器,每台 128GB 统一内存。两台并起来,刚好装得下 4bpw 的 GLM-5.3-Flash,再加一大块 KV 缓存。

从 9 月开始,这套方案几乎每周都在更新:

现在的成绩单大致是这样:两台 Spark 上,散文单流约 36 token/秒,四路并发合计约 75 token/秒,上下文能开到 100 万 token;三台 Spark 的版本解码再快 28%。

四、各方怎么看

先说句实话:这条推文底下的评论取不到,Twitter 的鉴权墙拦着。但围绕这套方案的公开讨论不少,几个真实声音挺有代表性。

跑起来的人怎么说。 英伟达开发者论坛上,一位用户统计自己已经喂进去 20 亿输入 token、250 万输出 token,日常解码 31 到 37 token/秒,64K 提示词的预填充约 1500 token/秒。他的评价是「像折扣店里的 Opus」:便宜,但确实能干正事。

和对手比怎么说。 中文社区 CocoLoop 有人把几个 Flash 系模型在两台 Spark 上横向比过:速度上 Qwen3.8-Flash-Next 第一,代码质量 GLM-5.3-Flash 第一,图形理解也是 GLM 第一。他还比了两种量化:NVFP4 预填充快(约 1500 token/秒 对 EXL3 的 1000),EXL3 解码快(28 对 20 token/秒)。这个取舍值得记下来。

实测机构的结论。 一家评测机构把它列为自己跑过最强的本地模型:行为测试 23 项全过,视觉测试 5 项全过。但他们也点出一个硬约束:让 GLM 变快的那个投机解码器 DFlash2,许可是 CC BY-NC-ND,只能用于研究和评估,商用得退回慢两三倍的 MTP 模式。

五、动手之前,3 个坑先看清

坑一:许可不能想当然。 EXL3 模型本身是 MIT,没问题;真正让速度好看的 DFlash2 投机解码器却是 CC BY-NC-ND,商用要么换方案,要么接受速度回落。别等到上线才发现这一段用不了。

坑二:硬件门槛按「多台」算。 176GB 只是权重,还得留显存给 KV 缓存。两台 DGX Spark 是起步配置,单张消费级显卡装不下。想入门的话,先按手头硬件选对量化档位,再从短上下文试起。

坑三:速度别只看最好那一项。 36 token/秒是结构化输出或代码的成绩,散文和混合内容会明显变慢,因为投机解码器猜自然语言猜得差。挑方案前,用你自己的真实文本跑一遍,别拿别人的代码评测当日常体验。

写在最后

这条推文只有一句话,背后却是一条跑满一个月的更新线:把 320B 的国产开源模型,从「云端 API 才玩得起」推到「两台桌面小机器就装得下」。

这次更新具体改了什么,等 Mia 放出来才知道。但方向已经很清楚了:本地跑大模型的门槛,正在一个版本一个版本地往下掉。

原文链接:
https://x.com/MiaAI_lab/status/2103938526786326669

展开阅读全文

更新时间:2026-10-09

标签:科技   模型   权重   缓存   方案   版本   上下文   注意力   解码器   机器   速度

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top