
苹果这四台新桌面机器明天开卖。32GB 的 Mac mini 装得下 8 位量化的 Qwen3.8-27B,一秒能吐出 5 个词。
内存决定模型装不装得进去,可它决定不了你用不用得下去。
真正说了算的是内存带宽,也就是芯片把权重重新读出来的速度。发布会上的 AI 数字一个比一个漂亮,只是乱花渐欲迷人眼,它衡量的是读你提示词有多快,跟你等它答完的速度关系不大。
模型写一个词,要把当下用得上的那部分权重从内存里读一遍;写下一个词,再读一遍。所以你能拿到的速度,等于内存读取速度除以每次要读的那块模型有多大。
tokens per second ≈ memory bandwidth ÷ bytes read per word × 0.8那个 0.8 是因为规格表上的带宽是天花板,实际跑不到那么高。
普通模型每写一个词,读的就是你硬盘上那个文件的全部体积,每一个参数、每一个词都要过一遍。所以下载哪个文件,和你买哪台机器一样影响结果:

提问那一侧几乎不动。只有出字速度跟着文件走,而这恰恰是机器摆上桌以后你还能改的那一半。

有些模型并不把自己整个读一遍。每写一个词,路由器从一大堆专家里挑出几个,只读这几个,文件剩下的部分就搁在内存里不动,等后面某个词需要了再说。
这就是 64GB 的 Mac 值得上 Qwen3.5–122B-A10B 的原因。文件有 57GB,但每写一个词只从内存里拉大约 4.7GB 出来,所以它的出字速度比一个只有它三分之一大的 27B 还快好几倍。

M6 是最典型的例子。它的带宽顶到 170GB/s,比两年前的 M4 Pro 还低,而且第一次加内存之后就不再放宽。所以在那台机器上加内存,只能换来更大的模型,换不来更快的速度。
这是实打实的限制,可也不至于把这台机器一棍子打死。Ornith-1.5–9B 用 4 位量化只有 5GB,大约能跑到一秒 24 个词。这比你读得还快,日常聊天、起草、总结,加上大多数轻量的本地工具都够用。它干不了的,是 8 位的 Qwen3.8-27B。
在 Studio 上,同一个数字被埋进了配置器里。更宽的位宽只跟更大的 GPU 一起卖,而订更大的 GPU 又逼着你顺带加内存。两样各 300 美元,也就是说快的那条总线要 600 美元,还分在两项互不提及的清单里。
盯着一台机器下单,容易捡了芝麻丢了西瓜:卡住你的那条线是带宽,而且买完就改不了。有了机器的带宽,再有了模型每写一个词的读取量,每一种搭配都能算出一个数。

最后一列每一个数字都是算出来的。除了苹果自己,还没人在 M6 或者 M5 Ultra 上真跑过;M5 Pro 的数字来自 MacBook Pro 而不是 mini,同样的芯片,散热更差。
有两行是同一个模型、同样的内存。它们之间的差别,53 和 79,就是这两台机器之间那 300 美元买到的东西。
第二行是那种装得进去、然后让你干等的组合。同一台机器上,它上面那行 9B 的速度是你每天都会用到的。
同一档位里,选择取决于那些头部评分掩盖掉的东西。写代码这一项,27B 上下的模型彼此差不到 25 分,近到你怎么说服自己选哪个都行。到工具调用,差距拉到七倍。Qwen3.8-27B 两张榜都排第一,Gemma 4 两张榜都垫底,而且 Gemma 在工具上的下滑比在代码上大得多,所以它是个还行的聊天模型,却是个糟糕的 Agent 底座。
在这些机器上评判 Qwen 之前,先改一个设置。它每一条提示词都要想到极限才开口。有人拿同一条提示词测过,默认设置花了 21 分钟,把思考关掉只要 2 分钟。这个开关叫推理强度(reasoning effort),在你的运行环境里,不在你下载的文件里。
规划档位之前,有个空档值得知道。今年没有东西落在 35B 参数到 120B 之间,所以这个区间的选择只有两条:拿一个更小的当代模型开 8 位,或者拿一个更大的过时模型开 4 位。

从那两张表到你的机器之间,隔着两件事。
第一件,内存明明够,模型也可能被拒绝加载。64GB 那档选的是 57GB 的文件,而 llama.cpp 在这种尺寸的机器上过不了大约 48GB。这是程序给自己设的线,Mac 并没拦你,所以你可以把它抬上去:
sudo sysctl iogpu.wired_limit_mb=60000第二件是你下载的那个文件。两种格式看着能互换,实际不能。nvfp4 比 mxfp8 既小得多也快得多,后者在苹果的图形栈上根本没有加速路径。模型提供 nvfp4 就用 nvfp4,没有就用普通的 4 位构建。
要不要买,和它能干什么,是两个问题,而在最高档位上,不买的理由很充分。配好的 Ultra 是 9499 美元。同样这笔钱花在托管的开源模型上能用很久,而一台一天闲置 20 小时的机器,并不比 API 账单便宜,它只是同一笔账提前付了。租是中间路线,看起来不少人走这条路,入门 Ultra 每月大约 110 美元,基础 Max 是 49 美元。
这些都不涉及中间那两台。2899 美元或者 3199 美元的时候,你要比的对象已经换成手里那台笔记本,跟 API 账单没什么可比性。所以租还是买的算术,在 Ultra 上值得认真做,在它以下基本是干扰项。
这些机器还没人跑过。它们周二开卖,512GB 的 Ultra 要到十月底,而苹果芯片的基准测试表上,M6 和 M5 Ultra 的位置还是空的。这里关于这两款机器的每一个数字都出自除法,没人真测过。
机器摆上桌之后自己跑一遍。从表里挑一个模型加载进去,给它一条真实的提示词,等它稳定下来再看每秒出多少个词。如果落在预测附近,那张表剩下的部分就是可信的,你不用等谁来跑分,也能自己算出下一个模型的表现;如果远远低于预测,就照着上面那张清单往回查。
表里的数字终究是纸上得来终觉浅,绝知此事要躬行,机器到手自己跑一遍才算数。这里点名的每一个模型,都会在你跑它的那台机器报废之前被换掉,真正能留下来的,是那道除法。
原文链接:
https://medium.com/data-science-collective/best-local-llms-for-apples-new-mac-mini-and-mac-studio-7d7bcf08add1
更新时间:2026-10-04
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号