Kiln-AI/Kiln · 上手攻略
- 仓库:Kiln-AI/Kiln
- 链接:https://github.com/Kiln-AI/Kiln
- 分类:AI 开发平台 · 全流程工具链
- 作者:Tom
- 更新:2026-09-02
这是什么
Kiln 是一个覆盖 AI 开发全流程的本地优先工作台,涵盖评测(evals)、提示词优化、RAG、微调、合成数据生成和多智能体编排。提供跨平台桌面应用(Mac / Windows / Linux)和 MIT 许可开源 Python 库两条路径,本地运行,不强制上云。
核心设计:同一份数据集在 evals、优化、微调、RAG、agents 各阶段流转,结果互相叠加,无需每阶段重复导入。
解决什么问题
- 工具碎片化:评测用 A 库、优化用 B 库、微调用 C 平台,数据反复迁移。Kiln 一个工具全搞定。
- SaaS 数据主权问题:医疗、金融、企业内部等场景不能接受数据上云。Kiln 完全本地运行,支持 Ollama 离线模式。
- 非工程师参与难:PM、领域专家无法贡献 AI 开发流程。桌面应用让非技术人员也能评分、标注和添加数据。
快速安装
桌面应用
macOS / Windows:下载 GitHub Releases 最新版,按系统选择对应架构(Apple Silicon / Intel / Windows)。
⚠️ Windows 出现"未识别应用"警告是新版未过微软认证,直接点"更多 info"继续安装。McAfee/AVG 偶有误报,可放心加入白名单。
Linux:
curl -fsSL https://raw.githubusercontent.com/Kiln-AI/Kiln/refs/heads/main/app/desktop/linux_installer.sh | bash
安装前可先下载脚本 review 内容,脚本会安装到 PATH 并创建桌面图标。
Python 库
⚠️ GitHub README 写的是
pip install kiln-ai,PyPI 官方页面写的是pip install kiln_ai,两者等价(pip 将横杠和下划线视为相同)。
pip install kiln_ai
桌面应用和 Python 库相互独立,共享同一项目文件格式(.kiln 目录)。
核心用法
Eval Builder(评测)
三个核心概念: - Eval(评测器):定义评测目标 + 数据集定义 - Judge(裁判):具体评分方式,支持 LLM as Judge、G-Eval、正则规则 - Task Run Method:指定 prompt + 模型 + 参数,同一 Eval 可对比多种配置
内置模板包括"Overall Score and Task Requirements"(推荐起步)、"Issue Template"(Bug 复现)、毒性检测、偏见检测、越狱检测等。
典型流程:创建 Task → Evals 标签页新建评测 → 上传或合成数据集 → 添加 Judge → 运行并比较不同 Judge → 用 Eval 找到最优 Run Method。
Auto-Optimize(自动优化)
⚠️ 这是 Kiln 区别于一般评测工具的核心能力——不仅记录结果,还自动搜索最优配置。搜索空间覆盖: - prompt 数百种变体 - 190+ 已接入模型(OpenAI、Anthropic、Gemini、Ollama、Fireworks、Groq 等) - 工具组合、子智能体结构、temperature / top_p 等参数
合成数据生成
快速构建评测或微调数据集。界面提供交互式策展工具,支持实时修正样本。用于微调的数据必须打 fine_tune 标签(从"Create a New Fine Tune"界面发起会自动添加)。
Fine-Tuning(微调)
支持 60+ 模型,零代码 UI 操作,后端覆盖 Fireworks(Llama 系列、Mixtral)、OpenAI(GPT-4o 系列)、Together、Vertex(Gemini 系列)、Unsloth(本地加速)。
⚠️ 微调推理模型(reasoning model)需要参考专门的推理模型微调指南,标准流程的某些步骤需要调整。
RAG
拖拽上传 PDF、图片、视频、音频即可建立 RAG,自动从文档生成评测集量化质量。Python 库支持通过 LlamaIndex 接入 LanceDB Cloud 等外部向量数据库。
Agents(多智能体)
核心机制:"Kiln Task as Tool"——任意 Task 都可以被其他 Task 作为工具调用,实现层级编排。
步骤:创建 Task → 创建 Run Configuration → "Tools → Add Tools → Kiln Task as Tool" → 配置工具名称和描述(⚠️ 描述非常重要,决定模型何时调用该子智能体)。
此外支持 MCP 服务器接入外部工具、自定义 Python Code Tools、Kiln Search Tools(RAG 接入)。
Python 库示例
from kiln_ai import Kiln
k = Kiln.from_project("./my_project.kiln")
result = k.run_task("my_task", input_data={"query": "..."})
dataset = k.load_dataset("my_dataset")
import pandas as pd
df = dataset.to_pandas() # 接入 Pandas
团队协作
项目文件同步走 Git,应用内自动处理 sync,队友无需懂 Git 也能参与(评分、标注等)。
典型适用场景
| 场景 | Kiln 的价值 |
|---|---|
| AI 产品团队迭代 prompt | Auto-Optimize 自动搜索最优配置,无需手动 A/B |
| 数据主权敏感场景 | 完全本地 + Ollama 离线,数据不离开机器 |
| 快速建立评测体系 | Eval Builder + 合成数据,30 分钟可用 |
| 小团队微调 | 零代码 UI + 多后端自动部署 |
| 多智能体产品开发 | Task as Tool 层级编排,UI 可视化调试 |
| 非技术背景人员参与 | 桌面应用让 PM、领域专家直接贡献 |
坑与注意
- Linux 无包管理器渠道:必须用 curl 脚本安装,没有 apt/yum 渠道。
- PyPI 包名歧义:
kiln-aivskiln_ai混用,实测等价但建议优先用kiln_ai(PyPI 官方写法)。 - 推理模型微调非标准流程:不能用通用微调步骤,需要单独参考文档。
- Task as Tool 描述决定调用质量:描述要包含"输入 → 返回 → 适用场景",Poor 描述会导致模型错误决策。
- Git 协作有门槛:sync 走 Git,冲突解决需要基本 Git 能力(但日常 pull/push 应用内自动处理)。
与同类对比
| Kiln | LangSmith | PromptLayer | W&B | |
|---|---|---|---|---|
| 本地优先 | ✅ 完全离线 | ❌ SaaS | ❌ SaaS | ❌ SaaS |
| Auto-Optimize | ✅ 自动搜索 | ❌ 仅记录 | ❌ | ❌ |
| 合成数据 | ✅ 内置 | ❌ | ❌ | ❌ |
| 微调支持 | ✅ 60+ 模型 | ❌ | ❌ | ⚠️ 需自行配置 |
| MIT 许可 | ✅ | ❌ 专有 | ❌ 专有 | ❌ 专有 |
| 非工程师协作 | ✅ 桌面应用 | ⚠️ 偏开发者 | ⚠️ 偏开发者 | ⚠️ 偏开发者 |
一句话推荐结论
需要本地搭建评测→优化→微调全链路、又不希望数据上云的 AI 团队,Kiln 是目前最接近"一站式开源 AI 开发平台"的选择。
参考来源
- GitHub:https://github.com/Kiln-AI/Kiln
- 文档首页:https://docs.kiln.tech
- 快速入门:https://docs.kiln.tech/docs/quickstart.md
- 评测文档:https://docs.kiln.tech/docs/evals-and-specs/evaluations.md
- Python 库:https://docs.kiln.tech/developers/python-library-quickstart.md
- Agents:https://docs.kiln.tech/docs/agents.md
- 微调指南:https://docs.kiln.tech/docs/fine-tuning/fine-tuning-guide.md
- PyPI:https://pypi.org/project/kiln-ai/
⚠️ 推理模型微调步骤以官方文档为准;Linux 安装脚本内容建议安装前先 review。