2609.24983 · 小红书推广卡片文案

三个标题变体

  1. 标一行就把 DPO 数据准备时间砍掉 52%?这套「标错就续」的标注神器悄悄上线 🤫
  2. 「整段重写」已成历史——arXiv 新工具把 DPO 标注精细到 token 级别
  3. 做 RLHF 的姐妹听我说:你的标注工具可能一直在浪费时间 😩

小红书卡片文案(约 220 字)

做 LLM 对齐的姐妹听我说 🫶

你有没有被「整段后编辑」折磨疯过?

AI 生成的回复明明只有 1 个 token 写得不对,标注员要重写整段——又慢,又偏离模型自己说话的风格,还只能拿到"这段不好"的粗粒度反馈。

arXiv 2609.24983(onPanda)给了一个粗暴答案——

❌ 错法:读完整段再回写 → 慢 + 偏离 on-policy + 粒度粗 ✅ 真法:定位首个不适当 token → 替换(从候选词挑/自由输入) → 截断后文 → 让 AI 从改正位置继续生成

每个循环都自动产出一对偏好样本,中位标注时间 -52%,顺手白送 Panda-CVL 数据集 + token 级修正 benchmark ✨

AI #LLM #RLHF #DPO #对齐 #标注工具 #Agent #SFT #论文解读 #arXiv


关联论文:2609.24983(点格式)
科普版/shared/research-kb/organized/promo/popular/2609-24983.md