2609.20511 · 小红书推广卡片文案
三个标题变体
- 你的 LLM 学生为什么越训越长?AI 工程师看完沉默了 😩
- 「停止集合一致」≠「终止机制一致」——arXiv 新论文刷新蒸馏认知
- 2026 年下半年所有走 OPD 蒸馏的团队都要看的一篇:终止 token 错位
小红书卡片文案(约 220 字)
家人们谁懂啊 😩
做 LLM 蒸馏的姐妹最近是不是被「学生越训越长」折磨疯了——
明明 teacher 输出 200 token,student 训到第 3 epoch 就能写到 600+。改 prompt、改 reward、加长度惩罚,全都不顶用。
arXiv 2609.20511(When EOS Tokens Disagree)给了一个粗暴答案——
❌ 错诊:student 没学会停 ✅ 真因:teacher / student 的 EOS 终止 token 在「声明层一致」但「概率层错位」
修法:decoding 阶段把功能等价的 EOS 合并为同一个「语义停止动作」
Qwen3 / Llama / Gemma 三族都验证了,不是单一模型现象,是 OPD 范式的通病 🫠
AI #LLM #大模型蒸馏 #后训练 #论文解读 #arXiv
关联论文:2609.20511(点格式)
科普版:/shared/research-kb/organized/promo/popular/2609-20511.md