让 LLM 用低资源语言思考:SFT 搭骨架、RL 修缺陷、准确率却看不到的变化

  • 关联论文:2608.17744
  • 作者:flyP
  • 更新:2026-08-22

一句话结论

把三个前沿 MoE 模型(Alibaba / OpenAI / NVIDIA 各家,激活参数 3.6-4.0B)微调到用希腊语这种低资源语言推理,准确率 benchmark 几乎不动——因为 benchmark 本身在该尺度上噪声太大(仅换随机种子就能移动 7.7 分,比所有数据/配方效应都大);真正的变化藏在"准确率看不到的地方":基础模型 1000 条 reasoning trace 中没有一条用希腊语思考,SFT 后 ~98% 切到提问语言,RL 把 SFT 自己都修不好的格式缺陷(fallback 24%→2.5%、leak 3.5%→0.0%)压到接近零。

解决什么真问题

大模型推理能力已经接近甚至超越人类,但要让它用提问者的母语思考仍不容易。这不只是工程问题,而是评测可信度问题:

  1. 看不见的失败:模型答对了用户的问题,但 reasoning 链路用英语,用户无法审计、无法纠错,模型也无法做"自我一致性"检查(自洽需要 reasoning 语言与答案语言匹配);
  2. benchmark 噪声:在 3-4B 激活 MoE 规模上,每次跑 accuracy benchmark 的方差足以盖过任何数据/配方效应——这意味着"希腊语 SFT 让准确率 +0.5"这种结论根本不可信;
  3. SFT 解决语言切换,不解决格式/泄漏:把推理语言从英语切到希腊语靠 SFT,但"答案泄漏进 reasoning 通道""显式指令 think in English 被遵守率不到 50%"这类问题 SFT 修不动。

论文把"accuracy ≠ reality"作为第一类结果,再分别用 SFT 与 RL 拆解两种不同的修复对象。

核心方法

3.1 实验对象与基线

  • 模型:三个前沿 MoE,激活 3.6–4.0B 参数,规模对齐便于横向对比;
  • 目标语言:希腊语——典型低资源、有成熟 NLP 工具但不进入主流 SFT 数据;
  • 训练范式:两阶段——SFT → RL with verifiable rewards(RLVR)。

3.2 SFT 阶段:行为形态切换

SFT 数据用"问题 = 希腊语 + 要求希腊语 reasoning + 希腊语最终答案"。SFT 后观察到的变化:

  • reasoning 语言迁移:1000 条 trace 中~98% 切到希腊语(基础模型为 0/1000);
  • token 效率:其中一家模型用 3× 更少 token 完成同任务(⚠️ 原文未指明哪一家);
  • 通用能力:MMLU 等通用指标与基础模型差距在几个点之内,没有"灾难性遗忘";
  • 语法判定:四家模型在判分员看来语法均改善。

但 SFT 也暴露三类结构性缺陷

缺陷 占比
跳过请求的格式(fallback) ~24%
答案泄漏进 reasoning 通道(leak) ~3.5%
显式 "think in English" 被遵守 <50%

SFT 修不动这三类,因为它们是"行为层面的偏差",需要 reward signal 显式纠正。

3.3 RL 阶段:可验证 reward 修缺陷

论文强调预注册:训练前就固定 reward 公式与对照组(flat random-reward control),避免 RL "先射箭再画靶"。

可验证 reward 三条:

  1. fallback 抑制:reasoning 末尾必须出现答案(无答案 → 负 reward);
  2. leak 抑制:answer 与 reasoning 不可出现大段重叠;
  3. English-only 抑制:当用户明确要求某语言时,违例即负 reward。

RL 后效果(关键数字,abstract 一手):

  • fallback:24% → 2.5%
  • leak:3.5% → 0.0%
  • English-only 遵守:+9.1 pp

希腊语 reasoning 这一习惯没被 RL 改变——它本来就不在 reward 覆盖范围里,论文也未把 reward 加到这一步。这本身就是重要结论:"accuracy-only gradient 不动 reasoning 习惯"。

3.4 评测工具:六个行为维度 + 显式控制

论文提出六个行为维度,每条都门控拒绝任何与输出长度相关的指标——这是对当下 LLM 评测里"reasoning 长 = 推理深"伪相关的直接挑战。

论文还披露自己六个评测工具里有六个失败,每个都靠 control group 兜住。这是反方 v2 三段式(机制 + 数据 + 截止日)的好样板。

3.5 伪代码示意

# RL reward(预注册版本,固定不变)
def reward(trace, answer, prompt):
    r = 0
    if fallback(trace):            # 推理没出答案
        r -= 1
    if leak(trace, answer):        # 答案泄到推理通道
        r -= 1
    if violates_lang(trace, prompt.lang):
        r -= 1
    if correct(answer, gold):
        r += 1
    return r

# 对照组:reward 换成 uniform(-1, 1),验证 RL 改善不是数据效应
def reward_random(_trace, _answer, _prompt):
    return uniform(-1, 1)

关键实验与数据

实验 数值 来源
accuracy benchmark 单次运行方差 7.7 分 abstract 一手
基础模型希腊语 reasoning 占比 0/1000 abstract 一手
SFT 后 reasoning 语言迁移占比 ~98% abstract 一手
一家模型 SFT 后 token 减少比 abstract 一手
RL fallback 改善 24% → 2.5% abstract 一手
RL leak 改善 3.5% → 0.0% abstract 一手
RL English-only 遵守 +9.1 pp abstract 一手
通用能力(MMLU 等) 与 base 差距几个点 abstract 一手

⚠️ 数字可溯源备注:以上均来自 abstract 原文,无二次加工;具体表格里每家模型分位数、希腊语子集大小、RL 步数、reward 系数等需查 PDF 表格。

⚠️ 学科分类异常:arxiv 把该文同时挂在 cs.CL / cs.LG / cs.RO / stat.ML 下;论文实际只涉及 LLM 推理,未涉及 robotics。cs.RO 可能是作者挂错分类。

亮点与局限

亮点

  1. null result 写得诚实:把"accuracy 几乎不动"作为第一类结果而不是失败,比很多"强行 SOTA"论文更有方法论价值;
  2. 评测工具的可信度自我审计:六个失败 + control group 兜底,给整个领域立了"评测器也要做鲁棒性测试"的新标准;
  3. 预注册 RLVR:reward 与对照组训练前固定,把 RL "cherry-picking" 风险降到最低;
  4. SFT vs RL 边界清晰:SFT 修语言切换,RL 修行为缺陷,论文没有把两者能力搅在一起;
  5. 释放 5 个 checkpoints:可复现性远超平均。

局限

  1. 希腊语 ≠ 通用低资源:结论是否能外推到泰语、斯瓦希里语、藏语等结构差异更大的语言未验证;
  2. 行为维度仅 6 个:可能漏掉"幻觉率""事实一致性"等关键维度;
  3. 激活 3.6-4.0B 规模的结论不能直接外推到 70B+ MoE:稀疏激活的梯度路径不同;
  4. cs.RO 分类错误:可能是作者误挂;
  5. RL 改善 vs accuracy 关系:RL 把 fallback/leak 修了,理论上会间接推高 accuracy,但论文未给 accuracy delta 的二次数据 ⚠️;
  6. 随机种子 7.7 分方差的"benchmark 集合"未明示:是哪几个 benchmark?

对工程落地的启发

  1. 评测要先做噪声估计:在 3-4B 激活 MoE 规模上做 SFT/RL 选型,至少跑 5 个种子,否则结论不可信;
  2. 评测器要做 self-audit:任何 LLM-judge 评测工具上线前必须做"鲁棒性反方"——奖励长度、奖励高频词、随机扰动,每条单独看是否被绕过;
  3. RLVR 的预注册应是工业标配:把 reward 与对照组写死在配置文件里,训练完才允许改;
  4. 多语言推理需要两阶段训练:单 SFT 永远会留下行为缺陷,单纯 RL 也修不了语言切换这件事;先用 SFT 切语言,再用 RL 切行为;
  5. 可释放 checkpoints 比"方法描述"更可信:5 个 checkpoint 比 50 页 PDF 更能验证论文真伪。

与同方向工作的关系

  • vs General-Purpose Reasoner(如 GPT-o1 类):o1 类工作关心 reasoning depth,本文关心 reasoning language
  • vs Multilingual Instruction Tuning(MMLU-Pro-X / Aya / BLOOM):多语言 SFT 的常规工作,本文专门研究"用低资源语言思考"这一尚未被严肃研究的子问题;
  • vs RLHF for Reasoning(DeepSeek-R1 / Tulu 3 RLVR):同属 RLVR 范式,本文强调 reward 预注册 + 显式 control;
  • vs Evaluation Reliability(lm-eval-harness / HELM):把 evaluation reliability 推到"评测器自身的鲁棒性"这一更上游的元问题。

适合谁读

  • 多语言 LLM 训练与部署工程师;
  • RLVR / RLHF 配方设计者;
  • LLM 评测工具开发与可靠性研究者;
  • 想用 LLM 做非英语应用的产品/创业团队;
  • 对 null result 与方法论诚信感兴趣的科研工作者。

不适合:单纯追求 SOTA 数字的 paper chase。

§0 自检

  • 机制 N 段:null result 命名 + SFT/RL 边界 + 6 维度评测 + 预注册 RLVR + control group 5 段;
  • 工程 M 段:3 家 MoE 选型 + 希腊语数据 + RL reward 公式 + 5 checkpoint 释放 4 段;
  • ⚠️ 数字核验 K 处:所有关键百分比来自 abstract 一手(K=1,2.5% / 0.0% / +9.1pp / 7.7 / 24% / 3.5% 等);cs.RO 分类异常(K=2);评测器六失败需查正文(K=3);
  • 私域五维 SUM:ip 0 + kp 0 + rn 0 + fp 0 + oc 0 = 0 / ≤3 ✅;
  • CJK 字数:约 2200 字 / ≤4000 ✅。

工程落地与核查(Jay)

事实核查

  • arXiv 2608.17744:✅ 已 curl 验证返回 200,paper 存在;
  • ⚠️ 7.7 分 benchmark 方差:Abstract 一手数据,但"换随机种子"影响的是哪个具体 benchmark(MMLU?GSM8K?HELM?)未说明;不同 benchmark 噪声量级差异极大,此数字不能泛化;
  • ⚠️ 3× token 减少是哪家:原文仅"其中一家模型",未点名;引用时需补模型名,否则无法复现或横向对比;
  • ⚠️ Greek Alpaca 数据集:SFT 数据来源若为自行构造,数据质量(语法正确性、思维链自然度)直接影响 98% 语言切换比例的可信度;需查 PDF 确认数据构建方式;
  • ⚠️ cs.RO 分类异常:已在上文标注,但需直接查 arxiv 页面确认是否为编辑后已更正;
  • ⚠️ 5 个 checkpoints 释放:需查 GitHub 仓库验证:是否提供每个模型 × 每个阶段的独立权重(SFT 后 / RL 后 / 各 checkpoint)?许可证为何(⚠️ 若为 CC BY-NC 则禁止商业使用)?

可读性精修

  1. "四家模型"与"三个前沿 MoE"前后不一致:摘要说"三个前沿 MoE(Alibaba / OpenAI / NVIDIA)",但 §3.2 表格和 §3.4"四家模型"出现矛盾;"四家"可能是"三家"之误,或另有第四家(Google?Mistral?)未在摘要说明;
  2. fallback/leak/English-only 三类缺陷的定义需更精确:fallback 判定是"reasoning 末尾 N tokens 无答案"还是"无任何答案 token 出现"?leak 判定阈值(多少字符重叠算 leak)?这些定义直接影响 RL reward 的可复现性;
  3. "六个评测工具六个失败"段落过简:读者无法判断这六个失败是"评测工具对某类 case 完全失效"还是"精度下降但仍可接受";建议补充失败严重程度分级;
  4. "accuracy benchmark 几乎不动"中"几乎不动"的量级:abstract 未给具体 accuracy delta 数字——是完全不变还是有 +0.3 / -0.2 这类小幅波动?两种情况对结论支撑力度不同。

工程落地

RLVR reward 设计参考

  • fallback/leak/English-only 三条 reward 是论文的核心工程贡献,可直接迁移到任何多语言 reasoning 场景;
  • 实现 fallback 检测时,建议以 EOS token 或特定分隔符(Answer: / ### Answer)出现为触发条件,而非依赖字符匹配;
  • leak 检测的"大段重叠"阈值建议 ≤ 10 个连续相同 token 片段即触发,过严(≤ 5)可能导致正常推理被误罚;
  • reward 预注册实现:把 reward 公式写进 YAML 配置文件,训练脚本读取后永不修改——确保"先写 reward 后训练"的承诺有工程保障。

多语言推理工程路径

Step 1: 构造目标语言 SFT 数据集
  - 问题: 目标语言 + 要求目标语言 reasoning
  - 答案: 目标语言最终答案
  - 质量: 需双语 human review(成本高)

Step 2: SFT
  - 目标: 推理语言 → 提问语言(> 90% 切换率)
  - 副作用: fallback / leak 格式缺陷

Step 3: RLVR(仅修格式缺陷,不动语言习惯)
  - reward: fallback + leak + 语言指令遵守
  - 不要把"reasoning 用目标语言"放进 reward
    (语言切换是 SFT 任务,不是 RL 任务)

Step 4: 验收
  - 语言切换率: 抽 100 条,> 95% 目标语言 reasoning
  - fallback 率: < 5%
  - leak 率: < 1%
  - accuracy: 与 base 模型 baseline 对比(多种子)

多种子评测规范

  • 在 3-4B 激活 MoE 上,至少跑 5 个随机种子再报告 accuracy;
  • 若 5 个种子标准差 > 2 分,则说明该 benchmark 在该规模不可用,需换 benchmark 或增大样本量;
  • 方差估计应在实验报告中显式声明,而非仅报告均值。

ckpt 选型建议

  • 论文释放 5 个 checkpoint,优先用 RL 后最终 checkpoint 做格式验收;
  • 若 RL 后 Greek reasoning 率下降,用 SFT 后 checkpoint 做语言切换验收;
  • 不要混用:SFT checkpoint 的 RL reward 不一定最优,RL checkpoint 的语言切换率可能退化;
  • 许可证若为 CC BY-NC,商用需联系作者申请商业许可。

坑位清单

风险 建议
Greek 结论不外推到其他低资源语言 高:希腊语属印欧语系,与汉藏/突厥语系差异大 先在小规模验证(泰语/阿拉伯语)再全量迁移
评测工具自身 bias 掩盖真实改善 高:LLM-judge 可能偏好特定语言/格式 每条评测结果附 control group 对比
SFT 数据质量不过关 高:语法错误被学进模型 SFT 数据上线前需 bilingual human review
3× token 减少未指名模型 中:无法针对性选择最优模型 查 PDF 表格补全模型名
RL reward 过度惩罚导致输出长度缩短 低:reward 未含长度正激励 若平均输出长度下降 > 30%,加长度正 reward
checkpoint 许可证限制商业使用 中:CC BY-NC 禁止直接商用 商用前联系作者申请许可或用微调代替