Ollama 本地部署大模型指南:一条命令跑通 Llama / Qwen
发表于|更新于|lab
|浏览量:
Ollama 本地部署大模型指南
Ollama 是目前最流行的本地大模型运行工具:支持 macOS / Linux / Windows,一条命令即可下载并运行 Llama、Qwen、DeepSeek 等开源模型,无需写代码。

一、安装 Ollama
macOS
1 | brew install ollama# 或官网下载 .dmg 安装包 |
Linux
1 | curl -fsSL https://ollama.com/install.sh | sh |
Windows
官网下载安装包,或使用 WSL2:wsl --install 后在 WSL 中执行 Linux 命令。
二、下载并运行模型
常用模型
1 | ollama run llama3.1:8b # Llama 3.1 8Bollama run qwen2.5:7b # 通义千问 2.5ollama run deepseek-r1:7b # DeepSeek R1 推理模型ollama run qwen2.5-coder:7b # 代码模型 |
首次运行会自动下载(8B 模型约 4.7GB),之后可直接对话:
1 | >>> 用 Python 写一个快速排序(模型开始输出代码) |

三、常用管理命令
1 | ollama list # 查看已安装模型ollama pull qwen2.5:14b # 只下载不运行ollama rm llama3.1:8b # 删除模型ollama ps # 查看运行中的模型ollama serve # 启动服务(默认 11434 端口) |
四、HTTP API 调用
Ollama 自带 OpenAI 兼容 API,方便程序集成:
1 | curl http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"你好"}]}' |
也可以直接修改 OpenAI SDK 的 base_url 指向本地:
1 | from openai import OpenAIclient = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")resp = client.chat.completions.create( model="qwen2.5:7b", messages=[{"role": "user", "content": "你好"}],)print(resp.choices[0].message.content) |
五、硬件与显存建议
| 模型规模 | 量化级别 | 显存需求 | 推荐显卡 |
|---|---|---|---|
| 7~8B | Q4 | 6~8GB | RTX 3060 12G |
| 14B | Q4 | 10~12GB | RTX 4070 Ti |
| 32B | Q4 | 20~24GB | RTX 4090 |
| 70B | Q4 | 40~48GB | 双卡/服务器 |
没有独显也能跑:Ollama 自动使用 CPU 推理(速度较慢,7B 约 5~10 token/s)。
六、进阶技巧
- 自定义模型:写
Modelfile定制系统提示词
1 | FROM qwen2.5:7bSYSTEM 你是一位专业的法律顾问,回答必须引用法条。 |
1 | ollama create my-lawyer -f Modelfile |
Ollama + Dify:在 Dify 的模型设置中选「Ollama」,填入
http://localhost:11434,即可把本地模型接入智能体平台(见 Dify 教程)多模型同时服务:
ollama serve支持并发,配合OLLAMA_NUM_PARALLEL=4提升吞吐
小结
Ollama 是本地部署的最佳起点:安装简单、模型丰富、API 兼容。从「一条命令跑通」开始,逐步掌握量化、调优、集成,是进入实验室的第一课。
延伸阅读:
文章作者: 智算工坊
版权声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 智算工坊!
相关推荐

2026-08-10
Qwen3 本地部署完整教程:从下载到跑通全流程
Qwen3 本地部署完整教程Qwen(通义千问)是国产开源模型里生态最完整、中文能力最强的一个系列。本教程带你把 Qwen3 从「下载」到「本地跑通」,覆盖 Ollama、llama.cpp、LM Studio 三条主流路线,并附常见问题排查。 一、准备工作:确认你的硬件 模型规模 量化 显存需求 推荐显卡 Qwen3 0.6B Q4 约 1GB 任意 4GB 显卡 / 纯 CPU Qwen3 4B Q4 约 3GB RTX 3060 12G 起步 Qwen3 8B Q4 约 6GB RTX 3060 12G Qwen3 14B Q4 约 10GB RTX 4080 / 4090 Qwen3 30B-A3B(MoE) Q4 约 18GB RTX 4090 24G Qwen3 32B Q4 约 20GB RTX 4090 / 双卡 Qwen3 72B Q4 约 45GB 双卡 / 服务器 > 没有独显也能跑:Qwen3 0.6B~4B 用 CPU 推理,速度较慢但可用。 二、路线一:Ollama 一键运行(推荐新手)Ollama 是本地运行 ...
2026-08-14
Apple Silicon 跑本地大模型:M1 到 M4 的完整指南
Apple Silicon 跑本地大模型:M1 到 M4 的完整指南Mac 没有 NVIDIA 显卡,但 Apple Silicon 的统一内存架构让它跑大模型有独特优势:模型直接用内存跑,不用抠显存,还能低功耗待机。这篇文章覆盖 M1 到 M4 全系,讲清怎么选 Mac、用什么工具、各档机型能跑多大模型。 一、Apple Silicon 跑大模型的底层逻辑为什么 Mac 能跑大模型?关键在于统一内存(Unified Memory)。传统 PC 有独立的显存和内存,两者之间传数据是性能瓶颈;Apple Silicon 的 CPU、GPU 共享同一块内存,模型可以直接放在内存里跑,GPU 直接读——省去了数据搬运。 这带来两个直接结果: 显存=内存:你买 64GB 的 MacBook Pro,跑模型就能用到 64GB「显存」,这比任何消费级显卡都大; 门槛低:8GB 内存的入门 Mac 也能跑 7B 模型,而 NVIDIA 8GB 显卡已经被 14B 卡脖子。 代价也明显:内存带宽远低于显卡。NVIDIA 4090 带宽约 1TB/s,M3 Max 只...

2026-08-14
Ollama 量化与显存规划指南:用公式算出你的显卡能跑多大的模型
Ollama 量化与显存规划指南Ollama 拉模型很方便,但「该拉多大、选什么量化」没人替你算:这篇文章把显存换算公式、量化档位怎么选、装不下怎么办一次讲清楚,让你买显卡前就能算出能不能跑。 一、先搞懂模型大小:参数不是体积很多人把「7B 模型」理解成 7GB,这是最大的误区。B 是 Billion(十亿),7B 表示模型有 70 亿个参数。参数只是神经元数量,真正占空间的,是这些参数「用什么精度存」。 模型权重的原始精度是 FP16(半精度),每个参数占 2 字节。所以一个 7B 模型的原始体积是: 17B × 2 字节 ≈ 14GB 这还只是权重,跑起来还要算上 KV Cache(键值缓存)和运行时开销。所以「7B 模型要 14GB 显存」的说法,指的是 FP16 原版。绝大多数人用的是量化版,体积小得多,这也是 Ollama 默认帮你做的事。 为什么 Ollama 会默认用量化?因为对普通用户来说,「体积小、能装进显存、速度够快」比「理论上更准的那几个百分点」重要得多。官方库里的标签如 qwen3:8b,拉下来基本都是 Q4_K_M,体积 4.9GB 左右,8GB 显...

2026-08-14
VS Code + Continue 接入本地大模型:完全离线的 AI 编程助手
VS Code + Continue 接入本地大模型:完全离线的 AI 编程助手代码补全和对话是本地大模型最实用的两个场景,而 VS Code 里把两者整合得最好的免费插件就是 Continue。配上 Ollama 跑 Qwen3 Coder,你的代码助手全程离线、代码不上云。这篇文章从安装到配置调优,附实测速度。 一、Continue 是什么Continue 是 VS Code 的开源 AI 编程助手插件,对标 Copilot,但核心卖点是自由接模型:既能接 OpenAI 等云端 API,也能接本地 Ollama / llama.cpp 跑的模型。对在意代码隐私的开发者来说,本地模型 + Continue 是目前最成熟的自托管方案。 在深入之前,先搞清楚 Continue 与 Copilot 类工具的本质差异:Copilot 全家桶把模型、数据、功能都打包在一起,你只能用它内置的云端模型,代码片段会传到微软/OpenAI 的服务器;Continue 则把「模型层」完全开放——模型可以是本地的、可以是你自建的、也可以是任意云端 API。这种开放性让「代码不出...

2026-08-08
LM Studio 本地部署入门:图形化界面,小白友好
LM Studio 本地部署入门如果你不想碰命令行,LM Studio 是本地运行大模型最友好的选择:全图形化界面,下载模型、聊天对话、本地 API 服务,全部鼠标点点就能完成。 一、安装 前往 https://lmstudio.ai 下载对应系统安装包(Windows / macOS / Linux) 双击安装,首次启动会提示选择模型目录(默认 ~/.lmstudio) 二、下载模型 左侧边栏点击「🔍 搜索」图标 在搜索框输入模型名(如 qwen2.5、llama 3.1) 选择量化版本:显存不够选 Q4_K_M(体积/质量平衡),显存充足可选 Q6/Q8 点击「Download」等待完成 模型在 Hugging Face 下载,若速度慢可在「Settings → Hobby」配置镜像(hf-mirror.com)。 三、开始对话 左侧「💬 聊天」图标 顶部选择已下载的模型 右侧可调节参数: Temperature:越低越严谨,越高越有创造性(默认 0.7) Max Tokens:最大回复长度 Conte...

2026-08-14
Wan 2.2 本地视频生成全流程:ComfyUI 从安装到出片
Wan 2.2 本地视频生成全流程:ComfyUI 从安装到出片开源视频生成在 2026 年的答案基本是 Wan 2.2:画质高、中文支持好、ComfyUI 一条龙。这篇文章完整走一遍「模型下载 → ComfyUI 配置 → 文生视频 → 视频延长」,并给出不同显存下的实际参数和显存峰值规划。 一、Wan 2.2 是什么,需要什么配置Wan 2.2(阿里通义实验室)是开源视频生成模型,支持文生视频、图生视频、视频延长。相比同期的 LTX-Video、CogVideo,它的画面稳定性更好、中文 prompt 支持优秀,是目前中文用户本地跑视频的首选。 从模型家族说起:Wan 系列最早是通义万相的多模态模型,2025 年开源了支持视频的 2.1,随后 2.2 在画质、运动控制和中文理解上做了明显升级。它最大的特点是「一支模型既能文生视频、又能图生视频」,切换场景只需换输入,不需要换模型。对本地玩家来说,这意味着下一种模型就能覆盖多种玩法,学习成本和磁盘占用都很友好。 和云端视频生成(Sora、Kling、可灵)相比,本地 Wan 的定位很清楚:想要可控、可批量、不上传素材的创作者。...