LFM2.5-2.6B 四阶段后训练全解:从 SFT 到 Agentic RL 的端侧 Agent 模型炼成记 · 干货攻略

  • 链接: https://x.com/maximelabonne/status/2104098635118223716
  • 分类: x-tips
  • 来源: X @maximelabonne(转自 @liquidai)
  • 作者: Jay
  • 更新: 2026-10-02
  • 仓库: LiquidAI/LFM2.5-2.6B(Hugging Face,无 GitHub 仓库)

这是什么

LFM2.5-2.6B 是 Liquid AI 于 2026 年 8 月 4 日开源的端侧 Agent 模型:2.6B 参数、128K 上下文窗口、支持原生工具调用,可在手机、笔记本、PC 和机器人上完全本地运行,数据不离开设备,推理边际成本为零。

本攻略不是关于模型评测或部署的——而是深度解析它的后训练管线:如何把一个基座模型(2.6B 参数、~34T tokens 预训练)变成一个能在真实 Agent 环境中规划、调用工具、完成多步骤任务的端侧智能体。这套四阶段管线(Pipeline)包括:监督微调(SFT)→ 教师专业化(Teacher Specialization)→ 多域同策略蒸馏(MOPD)→ Agentic 强化学习(Agentic RL)。


为什么值得关注

谁分享的、解决了什么问题

@maximelabonne(Liquid AI 后训练团队成员 Maxime Labonne)于 2026 年 9 月 26 日转发了 @liquidai 的官方帖子,帖子由 Liquid 后训练团队(@maximelabonne、@EdoardMosca、Jiahui Wang)联合署名,解释了"端侧 Agent 模型到底什么让它真正有用"——核心答案就是后训练。

对于 LLM 工程师和 Agent 开发者,这套管线的意义在于:

  1. 它展示了 2.6B 小模型如何同时掌握工具调用、指令遵循、长上下文和复杂任务恢复——这些能力过去被认为需要更大参数量的模型
  2. 它把业界最新的 OPD(同策略蒸馏)和 Agentic RL 串联成完整流水线,提供了可直接参考的实战配方
  3. 它解决了后训练领域的一个经典矛盾:各领域数据混在一起 RL 会产生域间干扰(cross-domain interference);分开顺序训练又会让先前技能被遗忘

核心规格参数(均来自 Liquid AI 官方博客)

参数 值
模型参数量 2.6B
预训练 tokens ~34T
上下文窗口 128K
词表大小 128K(从 64K 扩展)
发布时间 2026-08-04

核验过程

官方来源

来源 读取内容 状态
Liquid AI 官方博客 (liquid.ai/blog/lfm2-5-2-6b) 四阶段管线完整描述、SFT 数据配比、教师专业化领域列表、MOPD 机制、Agentic RL 的 GRPO + sandbox 架构、benchmark 表格 ✅ 读取成功
Hugging Face 模型卡 (huggingface.co/LiquidAI/LFM2.5-2.6B) 参数量(2.6B)、128K 上下文、benchmark 数值、推理框架支持列表 ✅ 读取成功
Liquid AI 官方文档 (docs.liquid.ai/lfm/models/lfm25-2.6b) 部署命令(llama.cpp / SGLang / vLLM)、采样参数、工具调用方式 ✅ 读取成功

交叉验证

说法 官方来源 第三方验证 结论
LFM2.5-2.6B IFBench 59.17 / BFCLv4 56.88 / ToolSandbox 77.83 Liquid AI 博客 benchmark 表格 Hugging Face 模型卡、llm-stats.com、Medium 报道(Mehul Gupta)均确认相同数值 ✅ 确认
预训练 ~34T tokens Liquid AI 博客 "pre-trained on ~34T tokens" llm-stats.com 确认 "~34T pretrain tokens" ✅ 确认
128K 上下文 Liquid AI 博客 + HF 模型卡 benchlm.ai 确认 "128K context" ✅ 确认
2.6B 参数 Liquid AI 博客 Hugging Face 模型卡、llm-stats.com 均确认为 2.6B ✅ 确认
Agentic RL 使用 GRPO 优化 Liquid AI 博客 —(首次在 LFM2.5 官方博客披露,无第三方交叉) ⚠️ 原帖主张,未找到独立来源验证
OpenClaw / Hermes Agent 作为 RL harness Liquid AI 博客 OpenClaw 官网文档确认支持 harness 模式 ✅ 部分确认(OpenClaw 官方文档支持 harness 集成)
MOPD = 多域同策略蒸馏 Liquid AI 博客 MOPD 已由 x-tip-20260814 攻略覆盖,原理一致 ✅ 确认

上手步骤

1. 理解四阶段管线整体架构

基座模型 (LFM2.5-2.6B-Base, 2.6B, 34T tokens)
    │
    ▼ Stage 1: SFT(监督微调)
    │  两阶段 SFT:
    │  ① 广覆盖 SFT(全领域,7x LFM2.5-8B 训练配比)
    │  ② 定向塑形 SFT(agentic tasks、reasoning、tool use 权重提升)
    │  → 输出:SFT checkpoint(同时作为 student 和 teacher 初始化点)
    │
    ▼ Stage 2: Teacher Specialization(教师专业化)
    │  为每个领域训练一个 RLVR specialist:
    │  instruction following / math / knowledge / code / tool use / long context
    │  → 输出:一组领域专家 teacher
    │
    ▼ Stage 3: MOPD(多域同策略蒸馏)
    │  将多个 teacher 的能力蒸馏进单一 student
    │  student 在自己的输出上 roll out(on-policy)
    │  每个 prompt 路由到对应领域 teacher,获得 token 级反馈
    │  → 输出:蒸馏后统一 student 模型
    │
    ▼ Stage 4: Agentic RL(Agentic 强化学习)
       通过真实 agent harness(OpenClaw / Hermes Agent)进行多轮 RL
       优化器:GRPO(Group Relative Policy Optimization)
       Reward:LLM-as-judge + 程序化检查 + 安全门
       → 输出:LFM2.5-2.6B 最终模型

2. 部署 LFM2.5-2.6B(llama.cpp / vLLM / SGLang)

llama.cpp(本地 CPU/边缘设备,推荐)

# 安装
brew install llama.cpp

# 下载 GGUF 模型并对话
llama-cli -hf LiquidAI/LFM2.5-2.6B --conversation \
    -p 50 -p 50 -p 5 --temp 0.1 -p 1.0

SGLang(单卡 H100 GPU 高吞吐)

uv pip install "sglang>=0.5.10"

sglang serve \
    --model-path LiquidAI/LFM2.5-2.6B \
    --host 0.0.0.0 \
    --port 30000 \
    --tool-call-parser hf

vLLM(GPU serving)

pip install vllm==0.14

python -c "
from vllm import LLM, SamplingParams
llm = LLM(model='LiquidAI/LFM2.5-2.6B')
params = SamplingParams(temperature=0.3, max_tokens=32768)
output = llm.chat('Plan a trip to Tokyo', params)
print(output.0.message.content)
"

3. 工具调用格式(原生 tool call tokens)

LFM2.5-2.6B 使用 ChatML 类格式,通过特殊 tokens 发起工具调用:

# 在 system prompt 中以 JSON 提供工具定义
messages = [
    {"role": "system", "content": "You have access to tools. ..."},
    {"role": "user", "content": "What's the weather in Tokyo?"}
]

# 模型生成类似以下结构:
# <|tool_call_start|>{"name": "get_weather", "arguments": {"city": "Tokyo"}}<|tool_call_end|>

4. 接入 Agent Harness(OpenClaw / Hermes Agent)

# Liquid AI 官方文档推荐的本地 Agent 搭建两步法:
# Step 1: 用 SGLang 或 vLLM 在本地服务模型(OpenAI 兼容 API)
# Step 2: 将 Agent harness 指向本地 endpoint

# 连接 OpenClaw harness(支持 browse/terminal/文件操作)
# 在 OpenClaw 配置中指向:
# OPENAI_API_BASE=http://localhost:30000/v1
# OPENAI_API_KEY=None

坑与适用边界

1. 基准分数为自报告,未独立第三方验证 LFM2.5-2.6B 的所有 benchmark 数字(IFBench 59.17、BFCLv4 56.88、ToolSandbox 77.83 等)均来自 Liquid AI 官方博客,为自报告结果。llm-stats.com 等第三方明确标注"self-reported;verify before promoting"。ToolSandbox 等特定 benchmark 尚未建立广泛第三方榜单,数字需谨慎对待。

2. Coding 能力仍是短板 官方博客明确承认"coding is the one area where the larger models keep an edge"——LFM2.5-2.6B 在 LiveCodeBenchv6(59.41)和 AIME25(51.87)上落后于 Qwen3.5-9B。对于代码密集型 Agent 任务,大模型仍是首选。

3. Agentic RL 阶段细节披露有限 GRPO 算法的具体超参数、训练步数、reward 设计细节未公开;Harness Proxy 的 R3(Rollout Routing Replay)机制仅以一句话提及。复现该阶段缺乏具体参考。

4. 工具调用 benchmark 竞争激烈 BFCLv4(56.88)落后于 Qwen3.5-9B(60.13);在 ToolSandbox 上与 Qwen3.5-4B(75.55)几乎持平,并非全面领先。

5. 生态锁定风险 模型使用 LFM License(非 Apache 2.0),对商业使用有一定限制;且 MOPD/Agentic RL 管线无开源实现,无法自由修改。

6. 128K 上下文依赖中英预训练数据配比 词表从 64K 扩展到 128K 以支持非拉丁文字(中文等),但扩展后 tokenizer 效果未在中文专项任务上单独验证。


一句话结论

LFM2.5-2.6B 的后训练管线(SFT → 教师专业化 → MOPD → Agentic RL)展示了一条将 2.6B 小模型训练成真实 Agent 的完整路径:在指令遵循和工具调用上可以越级打 8B 模型,但在复杂代码任务上仍有差距;部署建议用 llama.cpp 做端侧推理,接 OpenClaw harness 做 Agent 任务,benchmark 数字参考为主、不做横向直接对比。


核验来源(按优先级): 1. Liquid AI 官方博客 — https://www.liquid.ai/blog/lfm2-5-2-6b ✅ 2. Hugging Face 模型卡 — https://huggingface.co/LiquidAI/LFM2.5-2.6B ✅ 3. Liquid AI 官方文档 — https://docs.liquid.ai/lfm/models/lfm25-2.6b ✅ 4. 第三方验证(llm-stats.com / benchlm.ai / Medium by Mehul Gupta)— 交叉确认 benchmark 数字 ✅

不确定处: - Agentic RL 阶段 GRPO 算法的具体超参数和训练步数——官方未披露,无从验证 - MOPD 的"teacher 与 student 来自同一 SFT checkpoint"这一设计选择对训练稳定性的实际影响——无消融实验数据 - Benchmark 数字均为 Liquid AI 自报告,ToolSandbox、τ³-Bench 等尚未建立广泛第三方独立榜单,数字可能存在选择性报告