NeoHorse-1:Qwen3.5 后训练递归自改进 Agent 原型 · 干货攻略
- 链接:https://github.com/TokenRhythm/NeoHorse
- 分类:x-tips
- 来源:X @_akhaliq
- 作者:Jay
- 更新:2026-09-16
- 仓库:TokenRhythm/NeoHorse
这是什么
NeoHorse-1 是 TokenRhythm 发布的一个 Agent 原生语言模型家族,包含 4B 和 9B 两个规模,均从 Qwen3.5 后训练而来,定位是「递归自改进(RSI)」路径上的初始原型。
官方将其描述为「agent-native」——模型从一开始就不是为通用对话设计的,而是专门针对工具调用、编码、Agent Harness 场景、指令遵循这四个能力方向做过后训练优化。
两个 checkpoint 均以 Apache 2.0 许可证开源,权重格式为 Safetensors / BF16,可直接本地部署。
为什么值得关注
谁在分享、解决什么问题
@_akhaliq 在 X 雷达里将其标注为「Agent Post-Training 复现必读」。这个评价背后有两个层面的原因:
工程层面:当前开源社区里,Agent 后训练的范式基本是「收集轨迹数据 → SFT → 评测」。NeoHorse-1 提出了一套更结构化的闭环:
路由 Harness 分配任务 → 记录交互与结果 → 评估能力需求 → 能力级别反馈进入下一轮训练数据配比
这套机制叫 Routing Harness,核心是把模型能力评估和训练数据构建自动化,形成评估-筛选-更新循环(evaluation–selection–update loop)。更新后的模型可以重新进入 Harness,实现「多轮迭代」——这正是迈向 RSI 的关键一步。
学术层面:arXiv:2609.08183 论文作者列表超过 30 人,来自 TokenRhythm Technologies、Infinigence AI 及多所高校,系统地阐述了从单轮后训练到递归自改进的技术路线。
核验结论
- ✅ 官方文档与 arXiv 摘要一致:RSI 原型定位、路由 Harness 机制、基准提升数字(4B: +5.93,9B: +3.44)全部可交叉验证
- ✅ benchmark 数据与 HuggingFace model card 一致:MindStudio 等第三方报道数字相同
- ⚠️ 「 extensible up to 1,010,000 tokens」:README 原文如此,MindStudio 等第三方报道也引用了此数字,但技术报告中未见完整消融实验,此处标注「原帖主张,官方文档未展开」
上手步骤
部署方式一:SGLang(推荐生产用途)
pip install "sglang==0.5.17"
MODEL_PATH="/path/to/NeoHorse-1-4B" # 或 NeoHorse-1-9B
python3 -m sglang.launch_server \
--model-path "$MODEL_PATH" \
--served-model-name neohorse-1-4B \
--host 0.0.0.0 --port 30000 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
部署方式二:vLLM
pip install -U vllm
MODEL_PATH="/path/to/NeoHorse-1-4B" # 或 NeoHorse-1-9B
vllm serve "$MODEL_PATH" \
--served-model-name neohorse-1-4B \
--host 0.0.0.0 --port 8000 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
注意:SGLang 推理报告使用的协议为 temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0, thinking mode enabled,复现时建议保持一致。
下载模型
| checkpoint | HuggingFace | ModelScope | GGUF 量化版 |
|---|---|---|---|
| NeoHorse-1-4B | HF 链接 | MS 链接 | GGUF |
| NeoHorse-1-9B | HF 链接 | MS 链接 | GGUF |
核验过程详述
本文引用的所有数字均来自以下官方来源:
已读官方来源
- GitHub README (
TokenRhythm/NeoHorse):完整模型规格、benchmark 表格(4B/9B 各 10 项)、部署命令、checkpoint 下载链接 - arXiv:2609.08183 摘要页:RSI 定义、Routing Harness 机制描述、核心指标(4B 58.94→64.87,9B 65.60→69.04)、作者机构信息
- HuggingFace model card(NeoHorse-1-9B):与 GitHub README 数字完全一致的 benchmark 表格
交叉验证
通过 web_search 检索发现 MindStudio、alphaXiv、YouTube 等第三方来源均独立引用了相同 benchmark 数字(4B: 64.87 macro avg, 9B: 69.04 macro avg),数值吻合。
与原帖差异处理
- 原帖称「RSI 原型」,官方 arXiv 摘要将 NeoHorse-1 明确定位为「initial prototype of this feedback-driven process」,两者一致
- 原帖数字(+5.93 / +3.44 提升)来自官方 benchmark 表,予以采信
- 上下文扩展至 1,010,000 tokens 的说法,官方 README 有载但技术报告未展开,标注为「原帖主张,官方未充分展开」
核心架构:Routing Harness 三阶段
NeoHorse-1 的后训练框架分为三个阶段:
第一阶段:Routing-Guided Curriculum SFT
按照能力难度递增的顺序组织训练数据,由路由信号(Routing Signal)决定每个阶段学什么。能力级别反馈来自 Harness 对模型输出的评估结果,而非人工定义。
第二阶段:Routing-Guided On-Policy Distillation
在相同的能力进阶路径下,用教师模型监督学生模型(更新的模型)生成 response,确保新模型在 harness 环境下与教师保持一致的解题思路。
第三阶段:Capability-Guided Allocation
将评测反馈转化为下一轮训练数据的混合比例——模型在 Harness 里暴露的弱点直接决定下一批训练数据的采样权重。
这三个阶段共同构成闭环:模型在 Harness 上评测 → 评测结果指导数据配比 → 新数据训练新模型 → 新模型回到 Harness → 循环往复。
Benchmark 详情(官方数据)
4B 规模对比
| 类别 | 基准 | Qwen3.5-4B 基座 | NeoHorse-1-4B | Δ |
|---|---|---|---|---|
| Agentic | QwenClawBench | 38.47 | 44.68 | +6.21 |
| Agentic | WorkBuddy Bench | 24.62 | 34.41 | +9.79 |
| Agentic | PinchBench | 71.19 | 77.33 | +6.14 |
| Agentic | VitaBench | 21.50 | 32.00 | +10.50 |
| Agentic | BFCL v4 | 61.02 | 61.79 | +0.77 |
| Agentic | tau2-Bench | 84.29 | 88.46 | +4.17 |
| Coding | HumanEval | 87.20 | 96.95 | +9.75 |
| Coding | LiveCodeBench v6 | 53.71 | 59.43 | +5.72 |
| Instruction | IFEval | 60.33 | 65.33 | +5.00 |
| Instruction | IFEval (strict) | 87.06 | 88.35 | +1.29 |
| 平均 | 58.94 | 64.87 | +5.93 |
9B 规模对比
| 类别 | 基准 | Qwen3.5-9B 基座 | NeoHorse-1-9B | Δ |
|---|---|---|---|---|
| Agentic | QwenClawBench | 44.04 | 48.73 | +4.69 |
| Agentic | WorkBuddy Bench | 39.60 | 40.15 | +0.55 |
| Agentic | PinchBench | 74.55 | 82.25 | +7.70 |
| Agentic | VitaBench | 31.25 | 42.25 | +11.00 |
| Agentic | BFCL v4 | 64.88 | 67.43 | +2.55 |
| Agentic | tau2-Bench | 88.04 | 90.82 | +2.78 |
| Coding | HumanEval | 92.68 | 98.17 | +5.49 |
| Coding | LiveCodeBench v6 | 65.14 | 65.14 | +0.00 |
| Instruction | IFEval | 66.33 | 66.33 | +0.00 |
| Instruction | IFEval (strict) | 89.46 | 89.09 | -0.37 |
| 平均 | 65.60 | 69.04 | +3.44 |
坑与适用边界
⚠️ 定位明确,非通用助手
NeoHorse-1 的后训练目标是 Agent 场景(工具调用、编码、复杂指令执行),不推荐用于闲聊或通用知识问答。基座 Qwen3.5 在这些场景的基座能力已经很强,后训练主要是补强 agentic 能力,并非全面提升。
⚠️ 长上下文扩展未充分验证
官方 README 提到 context window 可扩展至 1,010,000 tokens,但技术报告对此没有展开的消融实验。如果你的场景需要超长上下文,建议先在自有数据上做评测,不要直接假设与 262,144 同样有效。
⚠️ 评测协议敏感
官方报告使用 temperature=1.0 + thinking mode,部分 benchmark(QwenClawBench、WorkBuddy Bench、tau2-Bench)跑了 3 次取均值。换用 temperature=0 或关闭 thinking mode 可能会导致结果与官方不可比。
✅ 适合的场景
- 本地跑 Agent Harness 评测(4B 轻量,9B 精度)
- 研究 Routing Harness 机制如何与后训练数据构建结合
- 想复现「评估驱动数据构建」pipeline 的团队
一句话结论
NeoHorse-1 不是一个「更强的小模型」,而是一个 Routing Harness 驱动的 Agent 后训练闭环系统,4B/9B 两个 checkpoint 开源了,核心价值在于将「评测→数据→训练」的循环跑通,为真正的递归自改进提供了可复现的原型。