onPanda:标注员定位首个错误 token,模型从修正位置继续生成 · 干货攻略
- 链接:https://x.com/_akhaliq/status/2102474190335234301
- 分类:x-tips
- 来源:X @_akhaliq
- 作者:Jay
- 更新:2026-09-28
这是什么
onPanda(全称 on-Policy alignment data annotator)是 StepFun 与厦门大学联合开源的交互式 LLM 对齐数据标注工具,论文链接 arXiv 2609.24983。核心创新是token 级修正(token-level correction)交互范式——标注员不再手动编辑完整回复,而是在模型生成过程中定位第一个出错 token,从模型给出的候选 token 中选一个替代(或直接打字替换),系统随即截断该位置之后的内容并让模型从修正前缀继续生成,如此循环直到得到合格回复。
发布内容: - onPanda 标注工具(支持外部工具/harness 集成,支持 agent 轨迹交互标注) - Panda-CVL:用 onPanda 标注的数据集 - Token 级修正评测基准(benchmark)
为什么值得关注
LLM 对齐数据标注长期面临三重困境:成本高(人工撰写或全量编辑回复)、off-policy 漂移(标注数据与模型真实采样分布脱节)、监督粒度粗(偏好数据只有 response 级信号,无法定位具体错误位置)。
onPanda 同时缓解这三个问题,且方法极简——不需要标注员写完整回复,只要点一下鼠标选 token。分享者 @_akhaliq 指出,这套字节级修正交互范式可以直接改造用于 agent trajectory 标注,是对齐数据构建 SOTA 流水线的工程化参考。
📌 原帖硬核点:标注员定位首个错误 token → 截断重生成,释放 Panda-CVL 数据集;对齐数据构建 SOTA 流水线,可直接改造用于 agent trajectory 标注。
核验过程
官方来源
-
arXiv 2609.24983 摘要页(https://arxiv.org/html/2609.24983) - 作者团队:StepFun(荔晶时代/阶跃星辰关联公司)+ 厦门大学 - 核心机制:token-level correction(locate-correct-continue loop) - 效率数据:52% median annotation time reduction over manual post-editing(controlled study) - 四大优势:高效标注 / 高 on-policy 保真度 / 细粒度监督 / 完整表达能力 - 发布物:Panda-CVL 数据集 + token-level correction benchmark
-
AI Weekly 报道(独立信源交叉验证) - 独立测得 annotation time reduction ~51.5%,与论文 52% 吻合(数据可信) - 报道确认 headline claim:51.5% ~ 52% median reduction
-
rcap.io / hypepaper.app 等二次引用 - 均引用同一摘要,未发现版本冲突
关键数字核验
| 说法 | 来源 | 核验结果 |
|---|---|---|
| 52% 中位标注时间缩减 | arXiv 摘要 | ✅ 原文直接引用 |
| 51.5%(另一来源测得) | AI Weekly | ✅ 与 52% 高度一致,可信 |
| Panda-CVL 数据集发布 | arXiv 摘要 | ✅ 官方确认 |
| 标注工具支持 agent 轨迹 | arXiv 摘要 | ✅ 原文明确 |
⚠️ 未核验项:原帖提到"字节级修正"(byte-level),arXiv 摘要原文为"token-level",两者有细微差别,以官方"token-level"为准。
上手步骤
在线体验
onPanda 提供在线 Demo,支持移动端访问:
https://on-panda.github.io/research
核心交互流程
- 读模型回复,每个 token 下方显示颜色编码概率(绿色=高,红=低)
- 定位第一个不当 token,点击弹出 top-20 候选 token 列表
- 选择替代 token(或双击直接打字替换)
- 系统截断该位置之后的内容,让模型从修正前缀继续生成
- 重复 locate-correct-continue 循环,直到
is_good=Y - 标注会话自动保留所有中间版本:最终版为 positive sample,中间版作为 negatives
Agent 轨迹标注集成
onPanda 支持连接外部工具和 harness,可在真实环境中进行交互式轨迹标注:
# 示意:连接外部 agent harness(论文描述,非可直接运行代码)
# 详见 https://on-panda.github.io/research
onpanda.connect_harness(external_harness_url)
onpanda.start_trajectory_annotation(task_id)
数据产物
- SFT 数据:高质量 on-policy 正样本
- 偏好数据:每次修正自然产生 positive-negative pair
- 过程奖励数据:可提取含修正 token 的 step 及前置 step 用于 PRM 训练
坑与适用边界
适用场景
- LLM SFT 对齐数据批量标注(效率提升显著)
- Agent trajectory 交互标注(多步工具调用场景)
- 需要细粒度 token 级正负样本的对齐训练(DPO/PRM)
当前局限
- 研究规模验证:52% 效率提升来自小规模控制实验(21 prompts),大规模工业部署效果待验证
- 候选 token 覆盖:free-form editing 作为 fallback,但当模型分布严重偏离正确方向时,标注员仍需频繁手动打字
- 多轮对话标注:目前文档主要展示单轮对话场景,多轮交互的标注工作流需进一步了解
- 无主仓库:目前 onPanda 工具本身未见公开 GitHub 仓库,工具代码可获得性需查阅官方页面
一句话结论
onPanda 用"标注员点一下错误 token,模型从修正处继续生成"的范式,将 LLM 对齐数据标注效率提升约 52%,同时产出 on-policy SFT 数据、token 级偏好对和过程奖励信号,是当前对齐数据构建工具链中值得关注的新节点——特别适合需要高效标注 agent 轨迹的团队。