ollama/ollama · 上手攻略
- 仓库:ollama/ollama
- 链接:https://github.com/ollama/ollama
- 分类:LLM Inference · Local
- 作者:Jay
- 更新:2026-08-04
是什么
Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI 不再只是模型运行器,而是一个本地 AI 工作站入口。
最新稳定版:v0.32.1(2026年7月16日),rc 版本为 v0.32.4-rc0。
解决什么问题
- 隐私敏感场景:数据不离本地,适合医疗、金融、法律等合规要求
- 成本控制:避免云端 API 按 token 付费,本地 GPU 可复用
- 快速原型:一条命令起服务,秒级切换模型
- 离线可用:无网络也能跑 LLM 应用
- 集成生态:OpenAI 兼容 API + Python/JS/Go/Rust 多语言 SDK
快速安装
macOS
# 方法一:下载安装包
# https://ollama.com/download/Ollama.dmg
# 方法二:Homebrew
brew install ollama
brew upgrade ollama # 升级
Linux / Windows (WSL)
curl -fsSL https://ollama.com/install.sh | sh
Windows 原生
irm https://ollama.com/install.ps1 | iex
# 或下载 https://ollama.com/download/OllamaSetup.exe
Docker(跨平台,推荐隔离环境)
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
验证安装
ollama --version
# ollama version 0.32.1 (当前稳定版,或更高 rc 版本)
核心用法
1. 运行模型(最基础用法)
# 运行一个模型(首次自动下载)
ollama run gemma4
# 运行指定模型
ollama run llama3.3
ollama run qwen2.5:14b
ollama run deepseek-r1:7b
# 查看可用模型库
ollama list
⚠️ 模型 tag 格式为
name:size,如qwen2.5:14b。首次运行会从 ollama.com/library 拉取 GGUF 格式权重。
2. REST API(最常用服务端接口)
Ollama 启动后默认在 localhost:11434 提供 OpenAI 兼容 API:
# Chat 接口
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [
{ "role": "user", "content": "Why is the sky blue?" }
],
"stream": false
}'
# 生成接口
curl http://localhost:11434/api/generate -d '{
"model": "llama3.3",
"prompt": "Write a hello world in Python",
"stream": false
}'
# 模型列表
curl http://localhost:11434/api/tags
3. Python SDK
pip install ollama
from ollama import chat
response = chat(model='gemma4', messages=[
{ 'role': 'user', 'content': 'Why is the sky blue?' },
])
print(response.message.content)
4. JavaScript/TypeScript SDK
npm i ollama
import ollama from "ollama";
const response = await ollama.chat({
model: "gemma4",
messages: [{ role: "user", content: "Why is the sky blue?" }],
});
console.log(response.message.content);
5. 交互式 Agent 模式(v0.32.0 新功能)
# 直接运行 ollama,进入 Agent 模式(v0.32.0+)
ollama
# 启动指定集成
ollama launch claude # 启动 Claude Code 集成(注意:Ollama 0.32.0 将 Codex App 集成重命名为 ChatGPT)
ollama launch openclaw # 启动 OpenClaw 个人 AI 助手
ollama launch codex # 启动 Codex 集成
v0.32.0 引入的 Agent 模式让
ollamaCLI 本身成为可以聊天、写代码、搜索网页、委托任务的交互式 Agent,而不仅仅是模型运行器。
6. 自定义模型(Modelfile)
用 Modelfile 定义专属模型,支持系统提示、参数调整、RAG 等:
# 创建 Modelfile
cat > Modelfile << 'EOF'
FROM llama3.3
SYSTEM """
You are a helpful Python assistant.
Always write clean, typed Python code.
"""
PARAMETER temperature 0.7
PARAMETER top_p 0.9
EOF
# 创建并运行
ollama create my-python-assistant -f Modelfile
ollama run my-python-assistant
7. 模型导入
支持导入 GGUF、PyTorch、Safetensors 格式的模型权重:
ollama create my-model -f /path/to/model
# 参考文档:https://docs.ollama.com/import
典型适用场景
| 场景 | 推荐配置 |
|---|---|
| 本地快速实验 | ollama run llama3.3(7B 模型,~4GB VRAM) |
| 代码辅助 | ollama run codellama:7b 或 ollama run deepseek-r1:7b |
| 长上下文任务 | ollama run qwen2.5:14b(支持 32K+ 上下文) |
| Apple Silicon Mac | v0.19+ 内置 MLX 加速,~2× 更快 |
| 生产推理服务 | Docker 部署 + REST API + Nginx 反向代理 |
| RAG 应用 | Open WebUI / AnythingLLM / Dify.AI + Ollama 后端 |
坑与注意
- v0.32.0 Agent 模式是重大行为变化:运行裸
ollama命令不再只是启动 REPL,而是进入交互式 Agent。如果只想跑模型,用ollama run <model>替代。 - 模型大小与硬件匹配: - 7B 模型:至少 6GB VRAM(GTX 1060 / M1 Mac 可跑) - 14B 模型:至少 12GB VRAM(RTX 3090 / M2 Mac 可跑) - 70B+ 模型:需要 24GB+ VRAM(单卡 A100 或多卡)
- Ollama CLI 不会自动后台运行:
ollama serve才是服务模式,ollama run是交互式 CLI,两者不同。 - 中国模型注册需注意:Moonshot(Kimi)、DeepSeek、Qwen 等国内模型可能需要网络代理访问。
- Ollama 默认端口 11434:确保防火墙允许;生产环境建议配合 Nginx + SSL。
- v0.32.0 将 Codex App 集成重命名为 ChatGPT:文档中"Codex 集成"入口实际已改名,注意版本。
- Apple Silicon Mac 推荐用 MLX 版本模型:v0.19+ 支持 MLX,GPU 利用率和速度显著优于 CPU 推理。
与同类对比
| 方案 | 类型 | 规模 | 优势 | 劣势 |
|---|---|---|---|---|
| Ollama | 本地运行时 | ~177k ⭐ | 零配置、模型库丰富、OpenAI 兼容 API | 定制化有限 |
| llama.cpp | C/C++ 推理引擎 | ~65k ⭐ | 最轻量、最灵活、纯 C | 无 REST API,需自行封装 |
| vLLM | 高性能推理引擎 | ~23k ⭐ | PagedAttention、连续批处理、高吞吐 | 显存要求高,配置复杂 |
| text-generation-webui | Web UI | ~32k ⭐ | 界面友好、插件丰富 | 资源占用较大 |
核心差异:Ollama 是零配置体验,一条命令跑起来;llama.cpp 是底层引擎;vLLM 是面向生产的高性能方案。如果追求开箱即用,Ollama 最合适。
一句话推荐结论
Ollama 是本地 LLM 推理的"终极入门级"方案——一条命令跑起来,REST API 立刻可用,2026年 v0.32+ 的 Agent 模式更让 CLI 本身成为 AI 工作站;如果你需要在本地跑开源模型且不想折腾配置,Ollama 是绕不开的第一选择。
原始 commit:https://github.com/ollama/ollama/commits/main · v0.32.1 release SHA: cd4e73d(2026-07-16)