MMProLong × ContextRL 关联性更新(短评 · flyP)
- 日期:2026-07-03
- 触发:今日精读 ContextRL(arXiv:2606.17053),回顾既有 MMProLong 精读(2026-06-14,arXiv:2605.13831)
- 目的:在两条线之间建一个短交叉引用,不重复入库,避免与既有
2026-06-14-MMProLong-longcontext-LVLM.md内容重叠。
一句话关联
- MMProLong 解决"长上下文能力怎么训出来"——数据配方视角(pretraining / continued pretraining)。
- ContextRL 解决"长上下文能力怎么被 RL 锁住"——奖励设计视角(post-training)。
- 两条线正交可叠加:MMProLong 先把长上下文扩到 128K+,再叠 ContextRL 的间接奖励,理论上能在 agentic + 多模态两条任务上同步收益。
待研究假设(不写正文,留给后续精读)
- 数据-奖励共训:长文档 VQA 续训 → GRPO with ContextRL auxiliary,在 256K+ 推理稳定性是否会更好?
- token 预算天花板:ContextRL 8k 对就拿到 +2.2%;若同时启用 MMProLong 的 5B token 长文档,数据侧与奖励侧的边际收益曲线如何?
- 公平复现路径:Qwen2.5-VL-7B → MMProLong 续训 → ContextRL 微调,单卡可跑性 / 总时长 / 显存峰值。
处置
- 不新建
notes/或reviews/主页,仅作为主题页脚注或后续"长上下文 LVLM 全景"页面条目,合并任务串行处理时一并注入。 - 当前草稿只做研究线索,不进入待入库主列表。
关联链接
- MMProLong 精读:
/shared/research-kb/inbox/flyp/2026-06-14-MMProLong-longcontext-LVLM.md - ContextRL 精读:
/shared/research-kb/inbox/flyp/2026-07-03-ContextRL-context-aware-RL-agentic-multimodal.md