Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- CritICL:基于小语言模型失败模式的推理时弱到强泛化 — 推理时缩放的最新进展显著提升了大语言模型(LLM)的推理性能。然而,这些方法通常依赖于重复……
- TTPO:测试时策略优化 — 近年来,诸如强化学习(RL)和在策略自蒸馏(OPSD)等突出后训练方法推动了大语言模型在数学推理方面的快速进展。
- 转导语言模型的随机估计 — 转导语言模型(TLM)将预训练源语言模型与一个函数式有限状态转导器组合,以在目标字符串上归纳出一个语言模型……
- 通过 RLVR 中的弱模型引导提升 LLM 探索能力 — 带可验证奖励的强化学习(RLVR)显著提升了 LLM 的推理能力,但常常导致策略熵下降,进而造成推理覆盖范围收窄和……
- 跨领域整合 RLVR 能力:融合范式的深度剖析 — 带可验证奖励的强化学习(RLVR)能够提升大语言模型的特定能力,但覆盖多种能力通常需要分别训练……