3060 12G + 24G 内存 老平台 CPU 跑 Qwen3.6 35B MoE MTP:实测 10+ tokens/s

21GB 大模型塞进 24G 内存,老平台也能跑 35B 带推理的ai模型

最近折腾本地大模型,主流声音都是"3060 12G 跑 14B 到顶了,35B 模型要 24G 显存,AI 推理是高端显卡的天下。

但实测发现是被 dense 模型经验带偏的偏见**。

我手头这台机器是几年前攒的:
- **GPU**:RTX 3060 12G
- **内存**:24G DDR4(21GB 装下整个模型)
- **CPU**:i5-3820(Intel 第三代 Ivy Bridge,2012 年发布,4 核 4 线程)

跑 Qwen3.6 35B(35B 总参 MoE + MTP,激活 5-8B)Q4 量化 GGUF(21GB 文件),32K context,**实测 10+ tokens/s**。

是的,老平台 + 入门显卡 + 24G 内存,跑 35B 大模型。

下面把完整方案、原理、调优、误区一次性讲清楚。

---

一、为什么"反常识"可行?—— MoE 模型的工作方式

传统 dense 模型(比如 Qwen2.5-32B-Instruct):
- 总参数 32B** = 每次前向传播用到的参数
- 显存 = 模型大小
- Q4 量化下要 **~18G 显存**,3060 12G 跑不动

而 MoE(Mixture of Experts)模型**完全不同:
- 总参数 35B,但每次只激活 5-8B**
- 显存 = 全量(所有专家都要能访问到)
- 但**计算量只跟激活参数有关**——跟你跑 5-8B dense 模型差不多

所以 Qwen3.6 35B 的真实需求是**:
- 模型文件:**21GB**(Q4_K_M 量化)
- 显存:**只需要装下"被路由到的几个专家"**——5-8B Q4 也就 3-6GB
- 剩下的层:**放在内存甚至 SSD 上**,通过 mmap 按需加载

这就是为什么"35B 大模型"听起来吓人,但**实际资源占用比 14B dense 还小**。

---

二、硬件配置(极限案例)

| 组件 | 配置 | 说明 |
|------|------|------|
| GPU | RTX 3060 12G | 入门游戏卡,AI 推理性价比之王 |
| 内存 | 24G DDR4 | **关键**——21GB 模型主力放这里 |
| CPU | i5-3820(Ivy Bridge,2012)| 老平台,计算量小所以够用 |
| 存储 | NVMe SSD | mmap 直接读模型文件,速度比 HDD 快 10x |

24G 内存跑 21GB 模型是极限——理论需要 21GB 模型 + 系统开销。靠 Ollama 的自动 mmap + 部分层 SSD swap 才能稳定跑。

如果你有 32G / 48G 内存,体验会更从容**,KV cache 完全在内存,32K context 不卡。

---

三、实测性能

| 指标 | 数值 |
|------|------|
| 模型 | **Qwen3.6 35B MoE + MTP** Q4_K_M(GGUF) |
| 模型文件大小 | 21GB |
| GGUF 来源 | 千问社区官方(huggingface.co/Qwen)|
| 框架 | Ollama |
| Context | 32K |
| 速度 | 10+ tokens/s(日常输出稳定 10-12)|
| GPU 占用 | ~45%(约 5-6GB,热点专家)|
| 内存占用 | ~54%(约 13GB)|
| 启动命令 | `ollama run qwen3.6:35b` |

**关键观察**:24G 内存只占 13GB——**不是因为没加载完整模型**,而是剩下的 8GB 专家在 SSD 上通过 mmap 透明加载。Ollama 自动按访问频率调度。

四、上手步骤(5 分钟跑起来)

1. 安装 Ollama(Windows)

去 [ollama.com](https://ollama.com) 下载 Windows 安装包,建议问一下豆包,找个国内网速快的网站下载,然后一路 Next。

2. 拉取模型

```bash
ollama pull qwen3.6:35b
```

或者如果上面 tag 不可用:

```bash
ollama pull qwen3:35b
ollama pull qwen3-35b-a3b
```

任选一个能拉到的,Ollama 会自动选 Q4 量化。

3. 跑起来

```bash
ollama run qwen3.6:35b
```

第一次启动会等几秒加载模型,之后就是对话界面。

4. 验证效果

```bash
ollama ps
```

看 GPU/内存分配是否符合预期。

---

五、调优(从 10 → 14-18 tokens/s)

默认配置能跑 10+ token/s,但通过几个环境变量可以再榨 30-50%。

1. KV cache 量化(最大收益)

```bash
set OLLAMA_KV_CACHE_TYPE=q8_0
```

32K context 的 KV cache 占显存很大,量化到 Q8 能省 40-50% 显存 → 给 GPU offload 更多空间 → 速度直接上 14+。

2. Flash Attention 开启

```bash
set OLLAMA_FLASH_ATTENTION=1
```

长 context 必备,节省显存 + 加速计算。

3. 智能 GPU offload

```bash
set OLLAMA_NUM_GPU=99
```

让 Ollama 智能决定哪些层上 GPU。

4. Context 按需用

```bash
set OLLAMA_CONTEXT_LENGTH=8192
```

日常聊天/写代码用 8K 足够(KV cache 减少 75%),长文本分析才用 32K。

一键调优脚本(Windows)

把下面内容存成 `start_qwen3_6_35b.bat`:

```bat
@echo off
set OLLAMA_KV_CACHE_TYPE=q8_0
set OLLAMA_FLASH_ATTENTION=1
set OLLAMA_NUM_GPU=99
set OLLAMA_CONTEXT_LENGTH=8192
ollama run qwen3.6:35b
```

双击就用最优配置启动。

---

六、关键原理:三层 offload 策略

跑 35B Q4 21GB 模型的本质是**把模型按"访问频率"分三层**:

```
┌──────────────────────────────────────┐
│ GPU (5-6GB) │ ← 热点专家
│ - 当前激活的 5-8B 路由 │ 每 token 都用
│ - 32K KV cache │
└──────────────────────────────────────┘
↑ 按需调度(PCIe 几百 GB/s)
┌──────────────────────────────────────┐
│ 内存 (13GB) │ ← 主力专家池
│ - 高频访问的专家 │ 几十 token 触发一次
│ - 上下文缓存 │
└──────────────────────────────────────┘
↑ mmap 按需加载(NVMe 几 GB/s)
┌──────────────────────────────────────┐
│ SSD (剩余 8GB 模型 + 系统) │ ← 冷门专家
│ - 不常激活的专家 │ 几乎不访问
│ - 通过 mmap 透明加载 │
└──────────────────────────────────────┘
```

**这就是 24G 内存能跑 21GB 模型的关键**——不是把所有模型都塞内存,而是**用访问频率分层**,老平台也能跑得飞起。

**冷门专家在 SSD 上靠 mmap 加载,速度瓶颈是 NVMe 带宽**。NVMe 一般 3-7 GB/s 顺序读,21GB 模型按需访问只触发几 MB/s 的流量——足够支撑 10+ token/s。

---

七、适用场景

| 场景 | 推荐度 | 备注 |
|------|--------|------|
| 日常聊天 / 写代码 / 数据分析 | ⭐⭐⭐⭐⭐ | 主力场景 |
| 量化交易回测 / 财报分析 | ⭐⭐⭐⭐⭐ | 写代码快 |
| 长文本总结(32K context)| ⭐⭐⭐⭐ | 完全够用 |
| 大批量 token 输出(>10K)| ⭐⭐⭐ | 受限于 CPU-SSD 带宽 |
| 实时语音对话(要 30+ t/s)| ⭐ | 不适合,需要更高端卡 |
| 多用户并发 | ⭐ | 单请求最佳 |

---

八、常见误区澄清

**❌ "35B 模型需要 35G 显存"**
→ 错。MoE 模型激活参数小(5-8B),3060 12G 也能跑。

**❌ "24G 内存装不下 21GB 模型"**
→ 极限但可行。靠 mmap + SSD swap,模型文件直接映射到虚拟地址空间。

**❌ "CPU 太老跑不动 AI"**
→ 错。计算量小(5-8B 激活),CPU 瓶颈不在算力而在数据搬运,**SSD 速度决定一切**。

**❌ "Q4 精度会严重影响效果"**
→ 不会。Q4_K_M 在大多数任务上和 FP16 几乎无差别,速度却快 2-3 倍。

**❌ "必须用 Linux + vLLM 才能跑"**
→ 不一定。Ollama 在 Windows 上完全够用,vLLM 的 Linux 优势主要在多卡 + 生产级吞吐。

**❌ "老 CPU + 老平台跑 AI 是浪费电"**
→ 错。激活参数小 + MoE 路由对算力要求低,老 CPU 主要是数据搬运瓶颈,NVMe 速度够就行。

---

九、Q&A

**Q:为什么不直接用 Qwen2.5-32B dense 模型?**
A:Qwen2.5-32B 是 dense,Q4 要 ~18G 显存,3060 12G 跑不动;Qwen3.6 35B MoE 激活 5-8B 只需 3-6G 显存。

Q:MTP 是什么?有什么用?**
A:Multi-Token Prediction,训练时让模型一次预测多 token,推理时如果接受预测能加速 1.5-2 倍。

Q:21GB Q4 文件怎么算出来的?**
A:Q4_K_M 量化每个参数约 0.6 字节,35B × 0.6 ≈ 21GB。如果 Q8 量化就是 35GB,FP16 是 70GB。

Q:和云端 API 比,本地跑有什么优势?**
A:① 隐私(数据不出本机)② 离线可用(断网也能跑)③ 不限量 ④ 单位时间成本低(边际电费)。

Q:3060 12G 跑 70B 模型可行吗?**
A:可以,但体验会差。70B Q4 量化下模型 ~40GB,得大量 SSD swap,速度 1-3 token/s。24G 内存建议跑到 35B MoE 为止**。

Q:要不要升级到 4060 Ti 16G / 3090 24G?**
A:看你需求。
- 4060 Ti 16G:显存多了 4G,能跑更多 dense 模型,但内存瓶颈仍在
- 3090 24G:显存够跑 35B dense(不用 MoE),但二手价格 ¥3500+
- 当前配置已经够用,如果不是刚需,先熟练一段时间,ddr5最近价格小幅下降,ai预测明年下半年会有显著降幅,升级前先想清楚 ROI

Q:i5-3820 不是 2012 年的吗?真能跑 AI?**
A:能跑。AI 推理在老 CPU 上的瓶颈是数据搬运,不是算力。CPU 只负责:
1. 调度专家路由
2. 搬运 SSD → 内存 → GPU 的数据
3. 不参与矩阵运算(那是 GPU 的事)

老 CPU 完全够用。

---

## 十、给"AI 入门者"的话

2026 年跑本地大模型的成本已经低到不可思议了。

3 年前跑 7B 模型都要 RTX 3090 24G,现在 **3000 块的 3060 12G 就能跑 35B MoE**。

**AI 不会抛弃普通人**——它正在被硬件和工程优化推平。

如果你手里有:
- 任何 6G 以上的 N 卡(1060 6G 起步)
- 16G 以上内存
- 一块 NVMe SSD

就能跑 Qwen3.6 35B Q4 量化版,**速度 5-10 token/s,日常用完全够**。

门槛从来没这么低过。

---

有问题欢迎评论区讨论。

展开阅读全文

更新时间:2026-07-24

标签:数码   内存   平台   模型   显存   专家   速度   加载   参数   瓶颈   数据   路由

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top