NeoHorse-1:Qwen3.5 后训练递归自改进 Agent 原型 · 干货攻略

  • 链接:https://github.com/TokenRhythm/NeoHorse
  • 分类:x-tips
  • 来源:X @_akhaliq
  • 作者:Jay
  • 更新:2026-09-16
  • 仓库:TokenRhythm/NeoHorse

这是什么

NeoHorse-1 是 TokenRhythm 发布的一个 Agent 原生语言模型家族,包含 4B 和 9B 两个规模,均从 Qwen3.5 后训练而来,定位是「递归自改进(RSI)」路径上的初始原型。

官方将其描述为「agent-native」——模型从一开始就不是为通用对话设计的,而是专门针对工具调用、编码、Agent Harness 场景、指令遵循这四个能力方向做过后训练优化。

两个 checkpoint 均以 Apache 2.0 许可证开源,权重格式为 Safetensors / BF16,可直接本地部署。


为什么值得关注

谁在分享、解决什么问题

@_akhaliq 在 X 雷达里将其标注为「Agent Post-Training 复现必读」。这个评价背后有两个层面的原因:

工程层面:当前开源社区里,Agent 后训练的范式基本是「收集轨迹数据 → SFT → 评测」。NeoHorse-1 提出了一套更结构化的闭环:

路由 Harness 分配任务 → 记录交互与结果 → 评估能力需求 → 能力级别反馈进入下一轮训练数据配比

这套机制叫 Routing Harness,核心是把模型能力评估和训练数据构建自动化,形成评估-筛选-更新循环(evaluation–selection–update loop)。更新后的模型可以重新进入 Harness,实现「多轮迭代」——这正是迈向 RSI 的关键一步。

学术层面:arXiv:2609.08183 论文作者列表超过 30 人,来自 TokenRhythm Technologies、Infinigence AI 及多所高校,系统地阐述了从单轮后训练到递归自改进的技术路线。

核验结论

  • 官方文档与 arXiv 摘要一致:RSI 原型定位、路由 Harness 机制、基准提升数字(4B: +5.93,9B: +3.44)全部可交叉验证
  • benchmark 数据与 HuggingFace model card 一致:MindStudio 等第三方报道数字相同
  • ⚠️ 「 extensible up to 1,010,000 tokens」:README 原文如此,MindStudio 等第三方报道也引用了此数字,但技术报告中未见完整消融实验,此处标注「原帖主张,官方文档未展开」

上手步骤

部署方式一:SGLang(推荐生产用途)

pip install "sglang==0.5.17"

MODEL_PATH="/path/to/NeoHorse-1-4B"  # 或 NeoHorse-1-9B
python3 -m sglang.launch_server \
 --model-path "$MODEL_PATH" \
 --served-model-name neohorse-1-4B \
 --host 0.0.0.0 --port 30000 \
 --context-length 262144 \
 --reasoning-parser qwen3 \
 --tool-call-parser qwen3_coder

部署方式二:vLLM

pip install -U vllm

MODEL_PATH="/path/to/NeoHorse-1-4B"  # 或 NeoHorse-1-9B
vllm serve "$MODEL_PATH" \
 --served-model-name neohorse-1-4B \
 --host 0.0.0.0 --port 8000 \
 --max-model-len 262144 \
 --reasoning-parser qwen3 \
 --enable-auto-tool-choice \
 --tool-call-parser qwen3_coder

注意:SGLang 推理报告使用的协议为 temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0, thinking mode enabled,复现时建议保持一致。

下载模型

checkpoint HuggingFace ModelScope GGUF 量化版
NeoHorse-1-4B HF 链接 MS 链接 GGUF
NeoHorse-1-9B HF 链接 MS 链接 GGUF

核验过程详述

本文引用的所有数字均来自以下官方来源:

已读官方来源

  1. GitHub README (TokenRhythm/NeoHorse):完整模型规格、benchmark 表格(4B/9B 各 10 项)、部署命令、checkpoint 下载链接
  2. arXiv:2609.08183 摘要页:RSI 定义、Routing Harness 机制描述、核心指标(4B 58.94→64.87,9B 65.60→69.04)、作者机构信息
  3. HuggingFace model card(NeoHorse-1-9B):与 GitHub README 数字完全一致的 benchmark 表格

交叉验证

通过 web_search 检索发现 MindStudio、alphaXiv、YouTube 等第三方来源均独立引用了相同 benchmark 数字(4B: 64.87 macro avg, 9B: 69.04 macro avg),数值吻合。

与原帖差异处理

  • 原帖称「RSI 原型」,官方 arXiv 摘要将 NeoHorse-1 明确定位为「initial prototype of this feedback-driven process」,两者一致
  • 原帖数字(+5.93 / +3.44 提升)来自官方 benchmark 表,予以采信
  • 上下文扩展至 1,010,000 tokens 的说法,官方 README 有载但技术报告未展开,标注为「原帖主张,官方未充分展开」

核心架构:Routing Harness 三阶段

NeoHorse-1 的后训练框架分为三个阶段:

第一阶段:Routing-Guided Curriculum SFT

按照能力难度递增的顺序组织训练数据,由路由信号(Routing Signal)决定每个阶段学什么。能力级别反馈来自 Harness 对模型输出的评估结果,而非人工定义。

第二阶段:Routing-Guided On-Policy Distillation

在相同的能力进阶路径下,用教师模型监督学生模型(更新的模型)生成 response,确保新模型在 harness 环境下与教师保持一致的解题思路。

第三阶段:Capability-Guided Allocation

将评测反馈转化为下一轮训练数据的混合比例——模型在 Harness 里暴露的弱点直接决定下一批训练数据的采样权重。

这三个阶段共同构成闭环:模型在 Harness 上评测 → 评测结果指导数据配比 → 新数据训练新模型 → 新模型回到 Harness → 循环往复。


Benchmark 详情(官方数据)

4B 规模对比

类别 基准 Qwen3.5-4B 基座 NeoHorse-1-4B Δ
Agentic QwenClawBench 38.47 44.68 +6.21
Agentic WorkBuddy Bench 24.62 34.41 +9.79
Agentic PinchBench 71.19 77.33 +6.14
Agentic VitaBench 21.50 32.00 +10.50
Agentic BFCL v4 61.02 61.79 +0.77
Agentic tau2-Bench 84.29 88.46 +4.17
Coding HumanEval 87.20 96.95 +9.75
Coding LiveCodeBench v6 53.71 59.43 +5.72
Instruction IFEval 60.33 65.33 +5.00
Instruction IFEval (strict) 87.06 88.35 +1.29
平均 58.94 64.87 +5.93

9B 规模对比

类别 基准 Qwen3.5-9B 基座 NeoHorse-1-9B Δ
Agentic QwenClawBench 44.04 48.73 +4.69
Agentic WorkBuddy Bench 39.60 40.15 +0.55
Agentic PinchBench 74.55 82.25 +7.70
Agentic VitaBench 31.25 42.25 +11.00
Agentic BFCL v4 64.88 67.43 +2.55
Agentic tau2-Bench 88.04 90.82 +2.78
Coding HumanEval 92.68 98.17 +5.49
Coding LiveCodeBench v6 65.14 65.14 +0.00
Instruction IFEval 66.33 66.33 +0.00
Instruction IFEval (strict) 89.46 89.09 -0.37
平均 65.60 69.04 +3.44

坑与适用边界

⚠️ 定位明确,非通用助手

NeoHorse-1 的后训练目标是 Agent 场景(工具调用、编码、复杂指令执行),不推荐用于闲聊或通用知识问答。基座 Qwen3.5 在这些场景的基座能力已经很强,后训练主要是补强 agentic 能力,并非全面提升。

⚠️ 长上下文扩展未充分验证

官方 README 提到 context window 可扩展至 1,010,000 tokens,但技术报告对此没有展开的消融实验。如果你的场景需要超长上下文,建议先在自有数据上做评测,不要直接假设与 262,144 同样有效。

⚠️ 评测协议敏感

官方报告使用 temperature=1.0 + thinking mode,部分 benchmark(QwenClawBench、WorkBuddy Bench、tau2-Bench)跑了 3 次取均值。换用 temperature=0 或关闭 thinking mode 可能会导致结果与官方不可比。

✅ 适合的场景

  • 本地跑 Agent Harness 评测(4B 轻量,9B 精度)
  • 研究 Routing Harness 机制如何与后训练数据构建结合
  • 想复现「评估驱动数据构建」pipeline 的团队

一句话结论

NeoHorse-1 不是一个「更强的小模型」,而是一个 Routing Harness 驱动的 Agent 后训练闭环系统,4B/9B 两个 checkpoint 开源了,核心价值在于将「评测→数据→训练」的循环跑通,为真正的递归自改进提供了可复现的原型。