本地大模型如何选:参数、格式、量化三刀
本地大模型如何选:参数、格式、量化三刀
在 Hugging Face 搜一个模型名,能弹出几十个文件,名字一长串、后缀各不相同,很容易劝退。其实它们只是同一个模型沿三个维度排列组合出来的:参数规模(多聪明、多吃硬件)、文件格式(给哪类软件用)、量化等级(压得多狠)。把这三刀理清,选版本就不再是玄学。
第一刀:参数规模
参数量(B = 十亿)同时决定模型有多聪明,以及有多吃硬件。档位大致如下:
| 档位 | 参数规模 | 定位 |
|---|---|---|
| 玩具 | 1-3B | 尝鲜、弱机器、跑通流程 |
| 甜点 | 7-8B | 日常够用,硬件门槛低 |
| 进阶 | 14B | 明显更聪明,需中端显卡 |
| 准专业 | 32B | 接近在线模型体验 |
| 重型 | 70B+ | 效果最好,硬件要求高 |
提示
经验法则:从 7B 起步。先把甜点档跑顺,体会过速度和效果,再决定要不要往上爬。
第二刀:文件格式
格式决定这个文件能被哪类软件加载,选错了客户端根本扫不到。
| 格式 | 给谁用 | 特点 |
|---|---|---|
| safetensors | 写代码 / 微调的人 | transformers、vLLM 用,可微调;LM Studio 扫不到 |
| GGUF | 桌面客户端用户 | LM Studio、Ollama 的事实标准,能 CPU 跑,文件名带量化标记 |
| MLX | 苹果 M 芯片用户 | 专为 Apple Silicon 优化 |
注
一句话决策:用 LM Studio / Ollama 就选 GGUF;写 Python 或要微调选 safetensors;Mac(M 芯片)可优先 MLX。
第三刀:量化等级
量化就是把模型权重的精度压低,换取更小的体积和更快的速度,代价是变笨一点。位数越少越小越快越笨。
| 等级 | 体积 | 质量 | 建议 |
|---|---|---|---|
| FP16 | 最大 | 原始精度 | 显存极充裕或要微调 |
| Q8_0 | 大 | 几乎无损 | 追求质量、显存够 |
| Q5_K_M | 中 | 很好 | 显存有余的升级选项 |
| Q4_K_M | 小 | 平衡 | 默认推荐 |
| Q3 | 更小 | 有下降 | 显存紧张时退而求其次 |
| Q2 | 最小 | 明显变笨 | 仅勉强塞下时使用 |
提示
经验法则:默认 Q4_K_M,优先选带 _K_M 的版本,它在体积与质量间最平衡。
名字里的 K 指新版分块量化算法,M 是 medium 档——同样是 4 位,Q4_K_M 的质量明显好过老式的 Q4_0,所以看到两者并存时选前者。
我的电脑能跑多大
先把显存数字弄准。Windows 的任务管理器和设备管理器可能显示错(32 位接口会把大显存报成 4GB),用 nvidia-smi 看真实值:
nvidia-smi --query-gpu=name,memory.total --format=csv
# NVIDIA GeForce RTX 3080 Ti, 12288 MiB → 12GB 显存关键看显存(独立显卡)或内存(纯 CPU / 核显)。粗略估算:
Q4 量化下,模型占用 ≈ 参数量(B) × 0.6 GB,再额外留 1-2 GB 给上下文。
| 显存 / 内存 | 能舒服跑的参数规模 |
|---|---|
| 6-8GB | 7-8B |
| 12GB | 14B |
| 16GB | 14B 流畅,32B 勉强 |
| 24GB | 32B |
| 仅 CPU + 大内存 | 7B,慢但能跑 |
注
宁可选小一档、把模型完整塞进显存,也别硬上大模型导致溢出到内存——一旦溢出,速度会断崖式下跌。
三步决策
- 先定软件 → 定格式:用客户端就 GGUF,写代码就 safetensors,Mac 看 MLX。
- 再看显存 → 定参数:按上表对照,挑能完整塞进显存的最大档。
- 最后挑量化:默认 Q4_K_M,显存有余往上,紧张往下。
完整走一遍:在 12GB 卡上跑翻译模型
框架讲完了太抽象,把三刀连起来跑一遍。目标:用 LM Studio 跑 translategemma。
第 0 步,摸清硬件。 nvidia-smi 查到 RTX 3080 Ti、12GB 显存。
第 1 步,定软件 → 定格式。 要用 LM Studio,所以只能下 GGUF。这一步就排除了一大半搜索结果——官方仓库那些 safetensors 直接跳过。(最常见的翻车就在这:搜到官方仓库直接下,结果 LM Studio 根本扫不到,几个 G 白下。)
第 2 步,看显存 → 定参数规模。 按上表,12GB 可以吃到 14B 档。translategemma 这一族最大就是 12B,Q4 约 7GB,塞进显存还留 4-5GB 给上下文——取这一族的最大档正合适,比 7B 聪明又不爆显存。于是去找 translategemma-12b-it 的 GGUF 仓库。
第 3 步,挑量化。 GGUF 仓库里常常 Q3 到 Q8 一整套,逐个看体积:
| 量化 | 体积 | 12GB 能否全塞进 |
|---|---|---|
| Q4_K_M | 6.8 GB | ✅ 舒适,余量足 |
| Q5_K_M | 7.9 GB | ✅ 可以,上下文偏紧 |
| Q6_K | 9.0 GB | ⚠️ 很挤 |
| Q8_0 | 11.7 GB | ❌ 放不下,溢出会掉速 |
结论一目了然:Q4_K_M 是这张卡上 12B 的最优解。
真正花脑子的是前三步——等你敲下载命令时,下哪个文件已经是确定的了。这就是「下载前先选对」的意义:用硬件和软件把选项收敛到唯一答案,再动手。