本地大模型的部署与调用:LM Studio 与 Ollama
约 890 字大约 3 分钟...
两条主流路线
模型文件下好之后(还没下的看下载与加速,不知道选哪个的看如何选模型),需要一个"运行器"把它跑起来。新手两条主流路线:
| 维度 | LM Studio | Ollama |
|---|---|---|
| 形态 | 图形界面 | 命令行 |
| 适合 | 新手、只想聊天 | 开发者、接入应用 |
| 上手 | 装好即用,自带模型市场 | 一条命令搞定 |
| 本地 API | 一键开启(:1234) | 默认常驻(:11434) |
| 模型格式 | GGUF / MLX | GGUF |
进阶/服务端还有:llama.cpp(上面两者的底层推理引擎,能直接命令行跑 GGUF)、vLLM(服务端高并发部署,吃 safetensors 权重)、transformers(写代码、做研究时直接在 Python 里加载)。
LM Studio 上手
- 打开 My Models 页,确认模型根目录指向你下载文件的位置(可在此查看/修改)。
- 加载模型后进入设置,把 GPU Offload(GPU 卸载层数)尽量拉满——显存放得下就全部 offload,速度最快;放不下会溢出到内存导致掉速。
- Context Length 按需设置:普通对话、翻译 4K-8K 足够,别一上来拉到最大,要给显存留余量。
- 切到 Developer / Local Server 标签,一键开启 OpenAI 兼容的本地 API,默认地址
http://localhost:1234/v1。
Ollama 上手
ollama pull qwen2.5 # 拉取模型
ollama run qwen2.5 # 直接跑起来对话API 默认常驻在 http://localhost:11434,无需额外开启。
想跑自己下载的 GGUF?写一个 Modelfile 指向 .gguf 文件,再 create:
# Modelfile 内容:
# FROM ./your-model.gguf
ollama create mymodel -f Modelfile
ollama run mymodel调用本地 API
因为都是 OpenAI 兼容接口,把 base_url 指到本地端口即可,模型名填你已加载的那个:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1234/v1", # Ollama 用 http://localhost:11434/v1
api_key="not-needed", # 本地无需真实 key,占位即可
)
resp = client.chat.completions.create(
model="your-model-name",
messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)或用 curl 快速验证:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5","messages":[{"role":"user","content":"你好"}]}'提示
只想点点鼠标用,就选 LM Studio;想接进脚本/应用做自动化,就用 Ollama 起本地 API。两者都讲 OpenAI"方言",换软件时业务代码基本不用改,只改 base_url 和模型名。