Ollama 本地部署大模型指南

Ollama 是目前最流行的本地大模型运行工具:支持 macOS / Linux / Windows,一条命令即可下载并运行 Llama、Qwen、DeepSeek 等开源模型,无需写代码。

Ollama 部署

一、安装 Ollama

macOS

1
brew install ollama# 或官网下载 .dmg 安装包

Linux

1
curl -fsSL https://ollama.com/install.sh | sh

Windows

官网下载安装包,或使用 WSL2:wsl --install 后在 WSL 中执行 Linux 命令。

二、下载并运行模型

常用模型

1
ollama run llama3.1:8b # Llama 3.1 8Bollama run qwen2.5:7b # 通义千问 2.5ollama run deepseek-r1:7b # DeepSeek R1 推理模型ollama run qwen2.5-coder:7b # 代码模型

首次运行会自动下载(8B 模型约 4.7GB),之后可直接对话:

1
>>> 用 Python 写一个快速排序(模型开始输出代码)

终端对话

三、常用管理命令

1
ollama list # 查看已安装模型ollama pull qwen2.5:14b # 只下载不运行ollama rm llama3.1:8b # 删除模型ollama ps # 查看运行中的模型ollama serve # 启动服务(默认 11434 端口)

四、HTTP API 调用

Ollama 自带 OpenAI 兼容 API,方便程序集成:

1
curl http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"你好"}]}'

也可以直接修改 OpenAI SDK 的 base_url 指向本地:

1
from openai import OpenAIclient = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")resp = client.chat.completions.create( model="qwen2.5:7b", messages=[{"role": "user", "content": "你好"}],)print(resp.choices[0].message.content)

五、硬件与显存建议

模型规模 量化级别 显存需求 推荐显卡
7~8B Q4 6~8GB RTX 3060 12G
14B Q4 10~12GB RTX 4070 Ti
32B Q4 20~24GB RTX 4090
70B Q4 40~48GB 双卡/服务器

没有独显也能跑:Ollama 自动使用 CPU 推理(速度较慢,7B 约 5~10 token/s)。

六、进阶技巧

  • 自定义模型:写 Modelfile 定制系统提示词
1
FROM qwen2.5:7bSYSTEM 你是一位专业的法律顾问,回答必须引用法条。
1
ollama create my-lawyer -f Modelfile
  • Ollama + Dify:在 Dify 的模型设置中选「Ollama」,填入 http://localhost:11434,即可把本地模型接入智能体平台(见 Dify 教程)

  • 多模型同时服务:ollama serve 支持并发,配合 OLLAMA_NUM_PARALLEL=4 提升吞吐

小结

Ollama 是本地部署的最佳起点:安装简单、模型丰富、API 兼容。从「一条命令跑通」开始,逐步掌握量化、调优、集成,是进入实验室的第一课。

延伸阅读: