ollama/ollama · 上手攻略

  • 仓库:ollama/ollama
  • 链接:https://github.com/ollama/ollama
  • 分类:LLM Inference · Local
  • 作者:Jay
  • 更新:2026-08-04

是什么

Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI 不再只是模型运行器,而是一个本地 AI 工作站入口。

最新稳定版:v0.32.1(2026年7月16日),rc 版本为 v0.32.4-rc0。


解决什么问题

  • 隐私敏感场景:数据不离本地,适合医疗、金融、法律等合规要求
  • 成本控制:避免云端 API 按 token 付费,本地 GPU 可复用
  • 快速原型:一条命令起服务,秒级切换模型
  • 离线可用:无网络也能跑 LLM 应用
  • 集成生态:OpenAI 兼容 API + Python/JS/Go/Rust 多语言 SDK

快速安装

macOS

# 方法一:下载安装包
# https://ollama.com/download/Ollama.dmg

# 方法二:Homebrew
brew install ollama
brew upgrade ollama   # 升级

Linux / Windows (WSL)

curl -fsSL https://ollama.com/install.sh | sh

Windows 原生

irm https://ollama.com/install.ps1 | iex
# 或下载 https://ollama.com/download/OllamaSetup.exe

Docker(跨平台,推荐隔离环境)

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

验证安装

ollama --version
# ollama version 0.32.1  (当前稳定版,或更高 rc 版本)

核心用法

1. 运行模型(最基础用法)

# 运行一个模型(首次自动下载)
ollama run gemma4

# 运行指定模型
ollama run llama3.3
ollama run qwen2.5:14b
ollama run deepseek-r1:7b

# 查看可用模型库
ollama list

⚠️ 模型 tag 格式为 name:size,如 qwen2.5:14b。首次运行会从 ollama.com/library 拉取 GGUF 格式权重。

2. REST API(最常用服务端接口)

Ollama 启动后默认在 localhost:11434 提供 OpenAI 兼容 API:

# Chat 接口
curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [
    { "role": "user", "content": "Why is the sky blue?" }
  ],
  "stream": false
}'

# 生成接口
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.3",
  "prompt": "Write a hello world in Python",
  "stream": false
}'

# 模型列表
curl http://localhost:11434/api/tags

3. Python SDK

pip install ollama
from ollama import chat

response = chat(model='gemma4', messages=[
    { 'role': 'user', 'content': 'Why is the sky blue?' },
])
print(response.message.content)

4. JavaScript/TypeScript SDK

npm i ollama
import ollama from "ollama";

const response = await ollama.chat({
    model: "gemma4",
    messages: [{ role: "user", content: "Why is the sky blue?" }],
});
console.log(response.message.content);

5. 交互式 Agent 模式(v0.32.0 新功能)

# 直接运行 ollama,进入 Agent 模式(v0.32.0+)
ollama

# 启动指定集成
ollama launch claude    # 启动 Claude Code 集成(注意:Ollama 0.32.0 将 Codex App 集成重命名为 ChatGPT)
ollama launch openclaw  # 启动 OpenClaw 个人 AI 助手
ollama launch codex     # 启动 Codex 集成

v0.32.0 引入的 Agent 模式让 ollama CLI 本身成为可以聊天、写代码、搜索网页、委托任务的交互式 Agent,而不仅仅是模型运行器。

6. 自定义模型(Modelfile)

用 Modelfile 定义专属模型,支持系统提示、参数调整、RAG 等:

# 创建 Modelfile
cat > Modelfile << 'EOF'
FROM llama3.3
SYSTEM """
You are a helpful Python assistant.
Always write clean, typed Python code.
"""
PARAMETER temperature 0.7
PARAMETER top_p 0.9
EOF

# 创建并运行
ollama create my-python-assistant -f Modelfile
ollama run my-python-assistant

7. 模型导入

支持导入 GGUF、PyTorch、Safetensors 格式的模型权重:

ollama create my-model -f /path/to/model
# 参考文档:https://docs.ollama.com/import

典型适用场景

场景 推荐配置
本地快速实验 ollama run llama3.3(7B 模型,~4GB VRAM)
代码辅助 ollama run codellama:7bollama run deepseek-r1:7b
长上下文任务 ollama run qwen2.5:14b(支持 32K+ 上下文)
Apple Silicon Mac v0.19+ 内置 MLX 加速,~2× 更快
生产推理服务 Docker 部署 + REST API + Nginx 反向代理
RAG 应用 Open WebUI / AnythingLLM / Dify.AI + Ollama 后端

坑与注意

  1. v0.32.0 Agent 模式是重大行为变化:运行裸 ollama 命令不再只是启动 REPL,而是进入交互式 Agent。如果只想跑模型,用 ollama run <model> 替代。
  2. 模型大小与硬件匹配: - 7B 模型:至少 6GB VRAM(GTX 1060 / M1 Mac 可跑) - 14B 模型:至少 12GB VRAM(RTX 3090 / M2 Mac 可跑) - 70B+ 模型:需要 24GB+ VRAM(单卡 A100 或多卡)
  3. Ollama CLI 不会自动后台运行ollama serve 才是服务模式,ollama run 是交互式 CLI,两者不同。
  4. 中国模型注册需注意:Moonshot(Kimi)、DeepSeek、Qwen 等国内模型可能需要网络代理访问。
  5. Ollama 默认端口 11434:确保防火墙允许;生产环境建议配合 Nginx + SSL。
  6. v0.32.0 将 Codex App 集成重命名为 ChatGPT:文档中"Codex 集成"入口实际已改名,注意版本。
  7. Apple Silicon Mac 推荐用 MLX 版本模型:v0.19+ 支持 MLX,GPU 利用率和速度显著优于 CPU 推理。

与同类对比

方案 类型 规模 优势 劣势
Ollama 本地运行时 ~177k ⭐ 零配置、模型库丰富、OpenAI 兼容 API 定制化有限
llama.cpp C/C++ 推理引擎 ~65k ⭐ 最轻量、最灵活、纯 C 无 REST API,需自行封装
vLLM 高性能推理引擎 ~23k ⭐ PagedAttention、连续批处理、高吞吐 显存要求高,配置复杂
text-generation-webui Web UI ~32k ⭐ 界面友好、插件丰富 资源占用较大

核心差异:Ollama 是零配置体验,一条命令跑起来;llama.cpp 是底层引擎;vLLM 是面向生产的高性能方案。如果追求开箱即用,Ollama 最合适。


一句话推荐结论

Ollama 是本地 LLM 推理的"终极入门级"方案——一条命令跑起来,REST API 立刻可用,2026年 v0.32+ 的 Agent 模式更让 CLI 本身成为 AI 工作站;如果你需要在本地跑开源模型且不想折腾配置,Ollama 是绕不开的第一选择。


原始 commit:https://github.com/ollama/ollama/commits/main · v0.32.1 release SHA: cd4e73d(2026-07-16)