LM Studio 本地部署入门

如果你不想碰命令行,LM Studio 是本地运行大模型最友好的选择:全图形化界面,下载模型、聊天对话、本地 API 服务,全部鼠标点点就能完成。

LM Studio

一、安装

  • 前往 https://lmstudio.ai 下载对应系统安装包(Windows / macOS / Linux)

  • 双击安装,首次启动会提示选择模型目录(默认 ~/.lmstudio)

二、下载模型

  • 左侧边栏点击「🔍 搜索」图标

  • 在搜索框输入模型名(如 qwen2.5、llama 3.1)

  • 选择量化版本:显存不够选 Q4_K_M(体积/质量平衡),显存充足可选 Q6/Q8

  • 点击「Download」等待完成

模型在 Hugging Face 下载,若速度慢可在「Settings → Hobby」配置镜像(hf-mirror.com)。

三、开始对话

  • 左侧「💬 聊天」图标

  • 顶部选择已下载的模型

  • 右侧可调节参数: Temperature:越低越严谨,越高越有创造性(默认 0.7)

  • Max Tokens:最大回复长度

  • Context Length:上下文窗口,按显存调整(默认 4096)

  • 底部输入框直接对话

对话界面

四、启动本地 API 服务

LM Studio 内置 OpenAI 兼容服务器,可被其他程序调用:

  • 切到「开发者」标签页(Developer)

  • 点击「Start Server」,默认端口 1234

  • 其他程序通过 http://localhost:1234/v1 访问:

1
from openai import OpenAIclient = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")resp = client.chat.completions.create( model="qwen2.5-7b-instruct", messages=[{"role": "user", "content": "介绍一下 LM Studio"}],)print(resp.choices[0].message.content)

也可以直接打开 http://localhost:1234 使用网页版聊天界面。

五、硬件要求

模型规模 最低显存 体验
1~3B 4GB 流畅
7~8B 8GB 流畅(Q4)
14B 12~16GB 可用
32B 24GB+ 可用(Q4)

没有 NVIDIA 显卡也能用:LM Studio 支持 Apple Silicon(M 系列芯片优化)与纯 CPU 模式(速度较慢)。

六、LM Studio vs Ollama vs vLLM

维度 LM Studio Ollama vLLM
上手难度 ⭐ 最低 ⭐⭐ ⭐⭐⭐⭐
界面 图形化 命令行 命令行/API
适用人群 小白/日常使用 开发者 生产环境
API 兼容 ✅ ✅ ✅

小结

LM Studio 适合「先体验后深入」:用它跑通本地模型的完整流程(下载→对话→API),理解了原理后,再根据需求切换到 Ollama(自动化/脚本)或 vLLM(高并发)。

延伸阅读: