云端大模型很好用,但总有几个场景让人犹豫:处理公司内部文档怕泄露、按量计费心疼钱包、出差路上没网络。本地部署大模型恰好补上了这三块短板——数据不出本机、完全免费、离线可用。而 Ollama 是目前把这件事做得最简单的工具,没有之一。
一、Ollama 是什么?
一句话:Ollama 就是大模型界的 Docker。它把"下载模型、配置环境、启动推理服务"这一整套复杂流程,压缩成一条命令。模型像镜像一样用 ollama pull 拉取,用 ollama run 运行,底层自动处理量化、GPU 调度、内存管理。你不需要懂 CUDA,不需要配 Python 环境,甚至不需要知道什么是 GGUF。
二、安装:三个平台都只要一分钟
# Windows:官网下载 OllamaSetup.exe,双击安装即可
# https://ollama.com/download
# macOS:推荐用 Homebrew
brew install ollama
# Linux:官方一键脚本
curl -fsSL https://ollama.com/install.sh | sh
安装完成后,Windows 和 macOS 会在后台自动运行 Ollama 服务(托盘里能看到小羊驼图标)。
三、跑起你的第一个模型
# 拉取并运行通义千问 Qwen3 8B(中文场景推荐)
ollama run qwen3:8b
# 或者 DeepSeek-R1 蒸馏版(推理能力更强)
ollama run deepseek-r1:8b
# 英文为主、追求速度可以选 Llama 3.1
ollama run llama3.1:8b
第一次运行会自动下载模型(8B 级别约 5GB),下载完直接在终端里对话。就这么简单——你已经在自己的电脑上跑起一个大模型了。
四、硬件要求对照表
最常见的疑问是"我的电脑能跑多大的模型"。经验法则:内存(或显存)≥ 模型文件大小 × 1.2。有独立显卡时模型优先加载进显存,速度快 5-10 倍;纯 CPU 也能跑,只是慢一些。
| 模型规模 | 文件大小 | 纯 CPU 最低内存 | 流畅体验建议 |
|---|---|---|---|
| 1.5B - 3B | 1-2 GB | 8 GB | 任何现代电脑都流畅 |
| 7B - 8B | 4-5 GB | 16 GB | 8GB 显存独显 / 32GB 内存 |
| 13B - 14B | 8-9 GB | 32 GB | 12GB 显存独显 |
| 32B | 18-20 GB | 64 GB | 24GB 显存(如 RTX 4090) |
| 70B+ | 40 GB+ | 不推荐纯 CPU | 多卡或专业工作站 |
五、常用命令速查
ollama list # 查看已下载的模型
ollama pull qwen3:8b # 只下载不运行
ollama run qwen3:8b # 运行模型(未下载则先下载)
ollama rm qwen3:8b # 删除模型
ollama ps # 查看正在运行的模型
ollama show qwen3:8b # 查看模型详细信息
ollama stop qwen3:8b # 停止运行中的模型
Ollama 还内置了 API 服务,默认监听 localhost:11434,可以直接用代码调用:
curl http://localhost:11434/api/generate -d '{
"model": "qwen3:8b",
"prompt": "用一句话解释什么是递归",
"stream": false
}'
六、加个好用的界面:Open WebUI
终端对话太极客?用 Docker 一键部署 Open WebUI,获得类似 ChatGPT 的网页界面,支持多轮对话、历史记录、文档上传(RAG):
docker run -d -p 3000:8080 \
-v open-webui:/app/backend/data \
--name open-webui \
ghcr.io/open-webui/open-webui:main
启动后访问 http://localhost:3000,它会自动发现本机 Ollama 里的所有模型。不想装 Docker 的话,也可以用 Chatbox、Cherry Studio 这类免部署的客户端,填上 localhost:11434 就能用。
七、本地 vs 云端,到底怎么选?
选本地(Ollama)
处理涉密文档、离线环境、高频调用不想付费、想折腾学习。代价是效果上限受硬件限制。
选云端(DeepSeek 等)
追求最强效果、处理超长文本、复杂推理任务。DeepSeek、Kimi 等国产模型免费额度已经很慷慨。
成年人不做选择——两个都要。日常敏感任务走本地,攻克难题调云端,这才是 2026 年 AI 工具的正确打开方式。
本地大模型的意义不只是省钱和隐私,更是一种"这个 AI 完全属于我"的确定性。当你的笔记本在万米高空的机舱里依然能帮你润色文档时,你会明白这种自由值多少。