LFM2.5-2.6B 四阶段后训练全解:从 SFT 到 Agentic RL 的端侧 Agent 模型炼成记 · 干货攻略
- 链接: https://x.com/maximelabonne/status/2104098635118223716
- 分类: x-tips
- 来源: X @maximelabonne(转自 @liquidai)
- 作者: Jay
- 更新: 2026-10-02
- 仓库: LiquidAI/LFM2.5-2.6B(Hugging Face,无 GitHub 仓库)
这是什么
LFM2.5-2.6B 是 Liquid AI 于 2026 年 8 月 4 日开源的端侧 Agent 模型:2.6B 参数、128K 上下文窗口、支持原生工具调用,可在手机、笔记本、PC 和机器人上完全本地运行,数据不离开设备,推理边际成本为零。
本攻略不是关于模型评测或部署的——而是深度解析它的后训练管线:如何把一个基座模型(2.6B 参数、~34T tokens 预训练)变成一个能在真实 Agent 环境中规划、调用工具、完成多步骤任务的端侧智能体。这套四阶段管线(Pipeline)包括:监督微调(SFT)→ 教师专业化(Teacher Specialization)→ 多域同策略蒸馏(MOPD)→ Agentic 强化学习(Agentic RL)。
为什么值得关注
谁分享的、解决了什么问题
@maximelabonne(Liquid AI 后训练团队成员 Maxime Labonne)于 2026 年 9 月 26 日转发了 @liquidai 的官方帖子,帖子由 Liquid 后训练团队(@maximelabonne、@EdoardMosca、Jiahui Wang)联合署名,解释了"端侧 Agent 模型到底什么让它真正有用"——核心答案就是后训练。
对于 LLM 工程师和 Agent 开发者,这套管线的意义在于:
- 它展示了 2.6B 小模型如何同时掌握工具调用、指令遵循、长上下文和复杂任务恢复——这些能力过去被认为需要更大参数量的模型
- 它把业界最新的 OPD(同策略蒸馏)和 Agentic RL 串联成完整流水线,提供了可直接参考的实战配方
- 它解决了后训练领域的一个经典矛盾:各领域数据混在一起 RL 会产生域间干扰(cross-domain interference);分开顺序训练又会让先前技能被遗忘
核心规格参数(均来自 Liquid AI 官方博客)
| 参数 | 值 |
|---|---|
| 模型参数量 | 2.6B |
| 预训练 tokens | ~34T |
| 上下文窗口 | 128K |
| 词表大小 | 128K(从 64K 扩展) |
| 发布时间 | 2026-08-04 |
核验过程
官方来源
| 来源 | 读取内容 | 状态 |
|---|---|---|
| Liquid AI 官方博客 (liquid.ai/blog/lfm2-5-2-6b) | 四阶段管线完整描述、SFT 数据配比、教师专业化领域列表、MOPD 机制、Agentic RL 的 GRPO + sandbox 架构、benchmark 表格 | ✅ 读取成功 |
| Hugging Face 模型卡 (huggingface.co/LiquidAI/LFM2.5-2.6B) | 参数量(2.6B)、128K 上下文、benchmark 数值、推理框架支持列表 | ✅ 读取成功 |
| Liquid AI 官方文档 (docs.liquid.ai/lfm/models/lfm25-2.6b) | 部署命令(llama.cpp / SGLang / vLLM)、采样参数、工具调用方式 | ✅ 读取成功 |
交叉验证
| 说法 | 官方来源 | 第三方验证 | 结论 |
|---|---|---|---|
| LFM2.5-2.6B IFBench 59.17 / BFCLv4 56.88 / ToolSandbox 77.83 | Liquid AI 博客 benchmark 表格 | Hugging Face 模型卡、llm-stats.com、Medium 报道(Mehul Gupta)均确认相同数值 | ✅ 确认 |
| 预训练 ~34T tokens | Liquid AI 博客 "pre-trained on ~34T tokens" | llm-stats.com 确认 "~34T pretrain tokens" | ✅ 确认 |
| 128K 上下文 | Liquid AI 博客 + HF 模型卡 | benchlm.ai 确认 "128K context" | ✅ 确认 |
| 2.6B 参数 | Liquid AI 博客 | Hugging Face 模型卡、llm-stats.com 均确认为 2.6B | ✅ 确认 |
| Agentic RL 使用 GRPO 优化 | Liquid AI 博客 | —(首次在 LFM2.5 官方博客披露,无第三方交叉) | ⚠️ 原帖主张,未找到独立来源验证 |
| OpenClaw / Hermes Agent 作为 RL harness | Liquid AI 博客 | OpenClaw 官网文档确认支持 harness 模式 | ✅ 部分确认(OpenClaw 官方文档支持 harness 集成) |
| MOPD = 多域同策略蒸馏 | Liquid AI 博客 | MOPD 已由 x-tip-20260814 攻略覆盖,原理一致 | ✅ 确认 |
上手步骤
1. 理解四阶段管线整体架构
基座模型 (LFM2.5-2.6B-Base, 2.6B, 34T tokens)
│
▼ Stage 1: SFT(监督微调)
│ 两阶段 SFT:
│ ① 广覆盖 SFT(全领域,7x LFM2.5-8B 训练配比)
│ ② 定向塑形 SFT(agentic tasks、reasoning、tool use 权重提升)
│ → 输出:SFT checkpoint(同时作为 student 和 teacher 初始化点)
│
▼ Stage 2: Teacher Specialization(教师专业化)
│ 为每个领域训练一个 RLVR specialist:
│ instruction following / math / knowledge / code / tool use / long context
│ → 输出:一组领域专家 teacher
│
▼ Stage 3: MOPD(多域同策略蒸馏)
│ 将多个 teacher 的能力蒸馏进单一 student
│ student 在自己的输出上 roll out(on-policy)
│ 每个 prompt 路由到对应领域 teacher,获得 token 级反馈
│ → 输出:蒸馏后统一 student 模型
│
▼ Stage 4: Agentic RL(Agentic 强化学习)
通过真实 agent harness(OpenClaw / Hermes Agent)进行多轮 RL
优化器:GRPO(Group Relative Policy Optimization)
Reward:LLM-as-judge + 程序化检查 + 安全门
→ 输出:LFM2.5-2.6B 最终模型
2. 部署 LFM2.5-2.6B(llama.cpp / vLLM / SGLang)
llama.cpp(本地 CPU/边缘设备,推荐)
# 安装
brew install llama.cpp
# 下载 GGUF 模型并对话
llama-cli -hf LiquidAI/LFM2.5-2.6B --conversation \
-p 50 -p 50 -p 5 --temp 0.1 -p 1.0
SGLang(单卡 H100 GPU 高吞吐)
uv pip install "sglang>=0.5.10"
sglang serve \
--model-path LiquidAI/LFM2.5-2.6B \
--host 0.0.0.0 \
--port 30000 \
--tool-call-parser hf
vLLM(GPU serving)
pip install vllm==0.14
python -c "
from vllm import LLM, SamplingParams
llm = LLM(model='LiquidAI/LFM2.5-2.6B')
params = SamplingParams(temperature=0.3, max_tokens=32768)
output = llm.chat('Plan a trip to Tokyo', params)
print(output.0.message.content)
"
3. 工具调用格式(原生 tool call tokens)
LFM2.5-2.6B 使用 ChatML 类格式,通过特殊 tokens 发起工具调用:
# 在 system prompt 中以 JSON 提供工具定义
messages = [
{"role": "system", "content": "You have access to tools. ..."},
{"role": "user", "content": "What's the weather in Tokyo?"}
]
# 模型生成类似以下结构:
# <|tool_call_start|>{"name": "get_weather", "arguments": {"city": "Tokyo"}}<|tool_call_end|>
4. 接入 Agent Harness(OpenClaw / Hermes Agent)
# Liquid AI 官方文档推荐的本地 Agent 搭建两步法:
# Step 1: 用 SGLang 或 vLLM 在本地服务模型(OpenAI 兼容 API)
# Step 2: 将 Agent harness 指向本地 endpoint
# 连接 OpenClaw harness(支持 browse/terminal/文件操作)
# 在 OpenClaw 配置中指向:
# OPENAI_API_BASE=http://localhost:30000/v1
# OPENAI_API_KEY=None
坑与适用边界
1. 基准分数为自报告,未独立第三方验证 LFM2.5-2.6B 的所有 benchmark 数字(IFBench 59.17、BFCLv4 56.88、ToolSandbox 77.83 等)均来自 Liquid AI 官方博客,为自报告结果。llm-stats.com 等第三方明确标注"self-reported;verify before promoting"。ToolSandbox 等特定 benchmark 尚未建立广泛第三方榜单,数字需谨慎对待。
2. Coding 能力仍是短板 官方博客明确承认"coding is the one area where the larger models keep an edge"——LFM2.5-2.6B 在 LiveCodeBenchv6(59.41)和 AIME25(51.87)上落后于 Qwen3.5-9B。对于代码密集型 Agent 任务,大模型仍是首选。
3. Agentic RL 阶段细节披露有限 GRPO 算法的具体超参数、训练步数、reward 设计细节未公开;Harness Proxy 的 R3(Rollout Routing Replay)机制仅以一句话提及。复现该阶段缺乏具体参考。
4. 工具调用 benchmark 竞争激烈 BFCLv4(56.88)落后于 Qwen3.5-9B(60.13);在 ToolSandbox 上与 Qwen3.5-4B(75.55)几乎持平,并非全面领先。
5. 生态锁定风险 模型使用 LFM License(非 Apache 2.0),对商业使用有一定限制;且 MOPD/Agentic RL 管线无开源实现,无法自由修改。
6. 128K 上下文依赖中英预训练数据配比 词表从 64K 扩展到 128K 以支持非拉丁文字(中文等),但扩展后 tokenizer 效果未在中文专项任务上单独验证。
一句话结论
LFM2.5-2.6B 的后训练管线(SFT → 教师专业化 → MOPD → Agentic RL)展示了一条将 2.6B 小模型训练成真实 Agent 的完整路径:在指令遵循和工具调用上可以越级打 8B 模型,但在复杂代码任务上仍有差距;部署建议用 llama.cpp 做端侧推理,接 OpenClaw harness 做 Agent 任务,benchmark 数字参考为主、不做横向直接对比。
核验来源(按优先级): 1. Liquid AI 官方博客 — https://www.liquid.ai/blog/lfm2-5-2-6b ✅ 2. Hugging Face 模型卡 — https://huggingface.co/LiquidAI/LFM2.5-2.6B ✅ 3. Liquid AI 官方文档 — https://docs.liquid.ai/lfm/models/lfm25-2.6b ✅ 4. 第三方验证(llm-stats.com / benchlm.ai / Medium by Mehul Gupta)— 交叉确认 benchmark 数字 ✅
不确定处: - Agentic RL 阶段 GRPO 算法的具体超参数和训练步数——官方未披露,无从验证 - MOPD 的"teacher 与 student 来自同一 SFT checkpoint"这一设计选择对训练稳定性的实际影响——无消融实验数据 - Benchmark 数字均为 Liquid AI 自报告,ToolSandbox、τ³-Bench 等尚未建立广泛第三方独立榜单,数字可能存在选择性报告