Kiln-AI/Kiln · 上手攻略

  • 仓库:Kiln-AI/Kiln
  • 链接:https://github.com/Kiln-AI/Kiln
  • 分类:AI 开发平台 · 全流程工具链
  • 作者:Tom
  • 更新:2026-09-02

这是什么

Kiln 是一个覆盖 AI 开发全流程的本地优先工作台,涵盖评测(evals)、提示词优化、RAG、微调、合成数据生成和多智能体编排。提供跨平台桌面应用(Mac / Windows / Linux)和 MIT 许可开源 Python 库两条路径,本地运行,不强制上云

核心设计:同一份数据集在 evals、优化、微调、RAG、agents 各阶段流转,结果互相叠加,无需每阶段重复导入。


解决什么问题

  • 工具碎片化:评测用 A 库、优化用 B 库、微调用 C 平台,数据反复迁移。Kiln 一个工具全搞定。
  • SaaS 数据主权问题:医疗、金融、企业内部等场景不能接受数据上云。Kiln 完全本地运行,支持 Ollama 离线模式。
  • 非工程师参与难:PM、领域专家无法贡献 AI 开发流程。桌面应用让非技术人员也能评分、标注和添加数据。

快速安装

桌面应用

macOS / Windows:下载 GitHub Releases 最新版,按系统选择对应架构(Apple Silicon / Intel / Windows)。

⚠️ Windows 出现"未识别应用"警告是新版未过微软认证,直接点"更多 info"继续安装。McAfee/AVG 偶有误报,可放心加入白名单。

Linux

curl -fsSL https://raw.githubusercontent.com/Kiln-AI/Kiln/refs/heads/main/app/desktop/linux_installer.sh | bash

安装前可先下载脚本 review 内容,脚本会安装到 PATH 并创建桌面图标。

Python 库

⚠️ GitHub README 写的是 pip install kiln-ai,PyPI 官方页面写的是 pip install kiln_ai,两者等价(pip 将横杠和下划线视为相同)。

pip install kiln_ai

桌面应用和 Python 库相互独立,共享同一项目文件格式(.kiln 目录)。


核心用法

Eval Builder(评测)

三个核心概念: - Eval(评测器):定义评测目标 + 数据集定义 - Judge(裁判):具体评分方式,支持 LLM as Judge、G-Eval、正则规则 - Task Run Method:指定 prompt + 模型 + 参数,同一 Eval 可对比多种配置

内置模板包括"Overall Score and Task Requirements"(推荐起步)、"Issue Template"(Bug 复现)、毒性检测、偏见检测、越狱检测等。

典型流程:创建 Task → Evals 标签页新建评测 → 上传或合成数据集 → 添加 Judge → 运行并比较不同 Judge → 用 Eval 找到最优 Run Method。

Auto-Optimize(自动优化)

⚠️ 这是 Kiln 区别于一般评测工具的核心能力——不仅记录结果,还自动搜索最优配置。搜索空间覆盖: - prompt 数百种变体 - 190+ 已接入模型(OpenAI、Anthropic、Gemini、Ollama、Fireworks、Groq 等) - 工具组合、子智能体结构、temperature / top_p 等参数

合成数据生成

快速构建评测或微调数据集。界面提供交互式策展工具,支持实时修正样本。用于微调的数据必须打 fine_tune 标签(从"Create a New Fine Tune"界面发起会自动添加)。

Fine-Tuning(微调)

支持 60+ 模型,零代码 UI 操作,后端覆盖 Fireworks(Llama 系列、Mixtral)、OpenAI(GPT-4o 系列)、Together、Vertex(Gemini 系列)、Unsloth(本地加速)。

⚠️ 微调推理模型(reasoning model)需要参考专门的推理模型微调指南,标准流程的某些步骤需要调整。

RAG

拖拽上传 PDF、图片、视频、音频即可建立 RAG,自动从文档生成评测集量化质量。Python 库支持通过 LlamaIndex 接入 LanceDB Cloud 等外部向量数据库。

Agents(多智能体)

核心机制:"Kiln Task as Tool"——任意 Task 都可以被其他 Task 作为工具调用,实现层级编排。

步骤:创建 Task → 创建 Run Configuration → "Tools → Add Tools → Kiln Task as Tool" → 配置工具名称和描述(⚠️ 描述非常重要,决定模型何时调用该子智能体)。

此外支持 MCP 服务器接入外部工具、自定义 Python Code Tools、Kiln Search Tools(RAG 接入)。

Python 库示例

from kiln_ai import Kiln

k = Kiln.from_project("./my_project.kiln")
result = k.run_task("my_task", input_data={"query": "..."})
dataset = k.load_dataset("my_dataset")

import pandas as pd
df = dataset.to_pandas()  # 接入 Pandas

团队协作

项目文件同步走 Git,应用内自动处理 sync,队友无需懂 Git 也能参与(评分、标注等)。


典型适用场景

场景 Kiln 的价值
AI 产品团队迭代 prompt Auto-Optimize 自动搜索最优配置,无需手动 A/B
数据主权敏感场景 完全本地 + Ollama 离线,数据不离开机器
快速建立评测体系 Eval Builder + 合成数据,30 分钟可用
小团队微调 零代码 UI + 多后端自动部署
多智能体产品开发 Task as Tool 层级编排,UI 可视化调试
非技术背景人员参与 桌面应用让 PM、领域专家直接贡献

坑与注意

  1. Linux 无包管理器渠道:必须用 curl 脚本安装,没有 apt/yum 渠道。
  2. PyPI 包名歧义kiln-ai vs kiln_ai 混用,实测等价但建议优先用 kiln_ai(PyPI 官方写法)。
  3. 推理模型微调非标准流程:不能用通用微调步骤,需要单独参考文档。
  4. Task as Tool 描述决定调用质量:描述要包含"输入 → 返回 → 适用场景",Poor 描述会导致模型错误决策。
  5. Git 协作有门槛:sync 走 Git,冲突解决需要基本 Git 能力(但日常 pull/push 应用内自动处理)。

与同类对比

Kiln LangSmith PromptLayer W&B
本地优先 ✅ 完全离线 ❌ SaaS ❌ SaaS ❌ SaaS
Auto-Optimize ✅ 自动搜索 ❌ 仅记录
合成数据 ✅ 内置
微调支持 ✅ 60+ 模型 ⚠️ 需自行配置
MIT 许可 ❌ 专有 ❌ 专有 ❌ 专有
非工程师协作 ✅ 桌面应用 ⚠️ 偏开发者 ⚠️ 偏开发者 ⚠️ 偏开发者

一句话推荐结论

需要本地搭建评测→优化→微调全链路、又不希望数据上云的 AI 团队,Kiln 是目前最接近"一站式开源 AI 开发平台"的选择。


参考来源

  • GitHub:https://github.com/Kiln-AI/Kiln
  • 文档首页:https://docs.kiln.tech
  • 快速入门:https://docs.kiln.tech/docs/quickstart.md
  • 评测文档:https://docs.kiln.tech/docs/evals-and-specs/evaluations.md
  • Python 库:https://docs.kiln.tech/developers/python-library-quickstart.md
  • Agents:https://docs.kiln.tech/docs/agents.md
  • 微调指南:https://docs.kiln.tech/docs/fine-tuning/fine-tuning-guide.md
  • PyPI:https://pypi.org/project/kiln-ai/

⚠️ 推理模型微调步骤以官方文档为准;Linux 安装脚本内容建议安装前先 review。