Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- CritICL:从小型语言模型失败模式到推理时的弱到强泛化 — 近年来推理时扩展的进展显著提升了大语言模型(LLM)的推理性能。然而,这些方法通常依赖重复……
- TTPO:测试时策略优化 — 近期突出的后训练方法,如强化学习(RL)和在线策略自蒸馏(OPSD),推动了大语言模型数学推理能力的快速进步……
- 转导语言模型的随机估计 — 转导语言模型(TLM)将预训练的\emph{源}语言模型与一个函数式有限状态转导器组合,以在\emph{目标}字符串上归纳出一个语言模型……
- 通过弱模型引导增强 RLVR 中 LLM 的探索 — 带可验证奖励的强化学习(RLVR)显著提升了 LLM 的推理能力,但常常导致策略熵下降,从而造成推理覆盖范围收窄和多样性降低……
- 跨域整合 RLVR 能力:融合范式的深入探讨 — 带可验证奖励的强化学习(RLVR)提升了大语言模型的特定能力,但覆盖多种能力往往需要针对不同能力分别训练专用模型……