Randomized YaRN Improves Length Generalization for Long-Context Reasoning
- 类型:arxiv
- 标识:2606.23687
- 链接:http://arxiv.org/abs/2606.23687v1
- 主分类:engineering
- 形态:position
- 被引:0
- 被引来源:Semantic Scholar + OpenAlex
- S2被引:0
- OpenAlex被引:0
- 影响力被引:0
- TLDR:Randomized YaRN is proposed, a training method that improves length generalization by combining YaRN-based positional extrapolation with randomized positional encoding and a length curriculum, and suggests that progressively exposing models to OOD positional distributions provides an effective recipe for generalizable long-context reasoning.
- OpenAlex ID:W7165644157
- OpenAlex DOI:10.48550/arxiv.2606.23687
- DOI:10.48550/arxiv.2606.23687
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2606.23687
- OpenAlex更新:2026-07-19
- 待LLM分类:否
- 标题中文:Randomized YaRN 改善长上下文推理的长度泛化能力
- TLDR中文:本文提出 Randomized YaRN,一种通过将基于 YaRN 的位置外推与随机位置编码和长度课程相结合来提升长度泛化能力的训练方法,表明渐进式地将模型暴露于分布外位置分布是实现可泛化长上下文推理的有效方案。
- 来源文件:
- /inbox/tom/_candidates/2026-06-23-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]