云端大模型很好用,但总有几个场景让人犹豫:处理公司内部文档怕泄露、按量计费心疼钱包、出差路上没网络。本地部署大模型恰好补上了这三块短板——数据不出本机、完全免费、离线可用。而 Ollama 是目前把这件事做得最简单的工具,没有之一。

一、Ollama 是什么?

一句话:Ollama 就是大模型界的 Docker。它把"下载模型、配置环境、启动推理服务"这一整套复杂流程,压缩成一条命令。模型像镜像一样用 ollama pull 拉取,用 ollama run 运行,底层自动处理量化、GPU 调度、内存管理。你不需要懂 CUDA,不需要配 Python 环境,甚至不需要知道什么是 GGUF。

二、安装:三个平台都只要一分钟

# Windows:官网下载 OllamaSetup.exe,双击安装即可
# https://ollama.com/download

# macOS:推荐用 Homebrew
brew install ollama

# Linux:官方一键脚本
curl -fsSL https://ollama.com/install.sh | sh

安装完成后,Windows 和 macOS 会在后台自动运行 Ollama 服务(托盘里能看到小羊驼图标)。

三、跑起你的第一个模型

# 拉取并运行通义千问 Qwen3 8B(中文场景推荐)
ollama run qwen3:8b

# 或者 DeepSeek-R1 蒸馏版(推理能力更强)
ollama run deepseek-r1:8b

# 英文为主、追求速度可以选 Llama 3.1
ollama run llama3.1:8b

第一次运行会自动下载模型(8B 级别约 5GB),下载完直接在终端里对话。就这么简单——你已经在自己的电脑上跑起一个大模型了。

四、硬件要求对照表

最常见的疑问是"我的电脑能跑多大的模型"。经验法则:内存(或显存)≥ 模型文件大小 × 1.2。有独立显卡时模型优先加载进显存,速度快 5-10 倍;纯 CPU 也能跑,只是慢一些。

模型规模文件大小纯 CPU 最低内存流畅体验建议
1.5B - 3B1-2 GB8 GB任何现代电脑都流畅
7B - 8B4-5 GB16 GB8GB 显存独显 / 32GB 内存
13B - 14B8-9 GB32 GB12GB 显存独显
32B18-20 GB64 GB24GB 显存(如 RTX 4090)
70B+40 GB+不推荐纯 CPU多卡或专业工作站
建议:大多数人的甜点是 7B-14B 级别。日常问答、文案润色、代码辅助完全够用,16GB 内存的笔记本就能跑。不确定显卡型号和显存?用 FreeBox 硬件检测页的系统信息功能先查一下配置。

五、常用命令速查

ollama list              # 查看已下载的模型
ollama pull qwen3:8b     # 只下载不运行
ollama run qwen3:8b      # 运行模型(未下载则先下载)
ollama rm qwen3:8b       # 删除模型
ollama ps                # 查看正在运行的模型
ollama show qwen3:8b     # 查看模型详细信息
ollama stop qwen3:8b     # 停止运行中的模型

Ollama 还内置了 API 服务,默认监听 localhost:11434,可以直接用代码调用:

curl http://localhost:11434/api/generate -d '{
  "model": "qwen3:8b",
  "prompt": "用一句话解释什么是递归",
  "stream": false
}'

六、加个好用的界面:Open WebUI

终端对话太极客?用 Docker 一键部署 Open WebUI,获得类似 ChatGPT 的网页界面,支持多轮对话、历史记录、文档上传(RAG):

docker run -d -p 3000:8080 \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

启动后访问 http://localhost:3000,它会自动发现本机 Ollama 里的所有模型。不想装 Docker 的话,也可以用 Chatbox、Cherry Studio 这类免部署的客户端,填上 localhost:11434 就能用。

七、本地 vs 云端,到底怎么选?

选本地(Ollama)

处理涉密文档、离线环境、高频调用不想付费、想折腾学习。代价是效果上限受硬件限制。

选云端(DeepSeek 等)

追求最强效果、处理超长文本、复杂推理任务。DeepSeek、Kimi 等国产模型免费额度已经很慷慨。

成年人不做选择——两个都要。日常敏感任务走本地,攻克难题调云端,这才是 2026 年 AI 工具的正确打开方式。

本地大模型的意义不只是省钱和隐私,更是一种"这个 AI 完全属于我"的确定性。当你的笔记本在万米高空的机舱里依然能帮你润色文档时,你会明白这种自由值多少。