最近大模型本地部署热度持续攀升,尤其是苹果M系列芯片凭借统一内存架构和MLX框架的优化,成为许多开发者关注的“平民算力”方案。今天,我们基于真实测试数据,对Qwen3.6-35B在搭载M3 Ultra芯片的Mac Studio上的部署表现进行深度拆解,看看它在长上下文、高吞吐和缓存效率等核心指标上,能否满足实际生产需求。
一、硬件与模型配置
设备:Mac Studio(Apple M3 Ultra丐版)
模型:Qwen3.6-35B-A3B-8bit
测试工具:oMLX v0.5.4(性能基准测试模块)
二、核心性能指标解读
1. 单请求性能:首字延迟与生成速度
TTFT(首字延迟):在pp1024/tg128配置下,TTFT仅为484.8ms;即使将prompt长度提升至4096,TTFT也控制在1753.5ms以内。这意味着用户输入后,模型响应几乎“秒级”启动,体验流畅。
TPOT(每Token生成时间):稳定在12ms/tok左右,对应生成速度约83 tok/s。对于35B参数量的模型而言,这一速度已接近部分云端API的水平,足以支撑日常对话、代码补全等场景。
2. 连续批处理:多并发下的吞吐能力
2x batch:吞吐量提升至151.5 tok/s,加速比达1.81x;
4x batch:吞吐量进一步跃升至379.6 tok/s,加速比高达4.54x。
这表明MLX框架在批量推理时能高效利用芯片并行计算单元,适合需要同时处理多个请求的场景(如客服机器人、批量文档摘要)。
3. 上下文窗口:突破26万Token的极限
这是本次测试最惊艳的部分:
64k上下文:预填充速度1,264.5 tok/s,耗时63.2s;
128k上下文:预填充速度838.7 tok/s,耗时168s;
256k上下文:成功跑通!测得实际上限为262,144 Token,预填充速度501.8 tok/s,耗时535.9s。
这一成绩意味着你可以在本地轻松处理整本长篇小说、海量代码库或超长会议记录,彻底告别“上下文溢出”的焦虑。

性能基准测试

128K上下文速度测试

64K上下文速度测试

64K最大上下文测试

128K最大上下文测试

256K最大上下文测试
三、缓存效率:SSD读写与内存管理
服务统计数据显示,累计预填充Token总数达4.4B,其中缓存Token数高达4.0B,缓存效率达到惊人的91.9%。这意味着绝大多数重复或相似的请求都能直接从缓存中命中,大幅减少了重复计算。
内存占用:活跃模型占用约35.2GB,说明8bit量化非常成功,完美适配Mac Studio的内存规格。
SSD缓存:SSD缓存大小已达1809.4 GB,包含18,270个文件。这得益于MLX框架对SSD的高效利用,使得超大上下文加载不再单纯依赖内存,而是通过高速SSD交换实现。

openclaw日常使用数据
四、总结与建议
M3 Ultra + MLX + Qwen3.6-35B的组合,在本地部署场景中展现出极强的竞争力:
性能强劲:单请求响应快,批量处理效率高;
上下文超长:支持26万Token,胜任复杂任务;
缓存智能:91.9%命中率,节省资源提升体验。
如果你正在考虑搭建本地大模型服务,或希望在不依赖云端的情况下获得高性能AI推理能力,这套方案值得重点关注。当然,实际部署时还需根据具体业务负载调整batch大小和上下文长度,以达到最佳性价比。
更新时间:2026-08-06
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号