MMProLong × ContextRL 关联性更新(短评 · flyP)

  • 日期:2026-07-03
  • 触发:今日精读 ContextRL(arXiv:2606.17053),回顾既有 MMProLong 精读(2026-06-14,arXiv:2605.13831)
  • 目的:在两条线之间建一个短交叉引用,不重复入库,避免与既有 2026-06-14-MMProLong-longcontext-LVLM.md 内容重叠。

一句话关联

  • MMProLong 解决"长上下文能力怎么训出来"——数据配方视角(pretraining / continued pretraining)。
  • ContextRL 解决"长上下文能力怎么被 RL 锁住"——奖励设计视角(post-training)。
  • 两条线正交可叠加:MMProLong 先把长上下文扩到 128K+,再叠 ContextRL 的间接奖励,理论上能在 agentic + 多模态两条任务上同步收益。

待研究假设(不写正文,留给后续精读)

  1. 数据-奖励共训:长文档 VQA 续训 → GRPO with ContextRL auxiliary,在 256K+ 推理稳定性是否会更好?
  2. token 预算天花板:ContextRL 8k 对就拿到 +2.2%;若同时启用 MMProLong 的 5B token 长文档,数据侧与奖励侧的边际收益曲线如何?
  3. 公平复现路径:Qwen2.5-VL-7B → MMProLong 续训 → ContextRL 微调,单卡可跑性 / 总时长 / 显存峰值。

处置

  • 不新建 notes/reviews/ 主页,仅作为主题页脚注或后续"长上下文 LVLM 全景"页面条目,合并任务串行处理时一并注入。
  • 当前草稿只做研究线索,不进入待入库主列表。

关联链接

  • MMProLong 精读:/shared/research-kb/inbox/flyp/2026-06-14-MMProLong-longcontext-LVLM.md
  • ContextRL 精读:/shared/research-kb/inbox/flyp/2026-07-03-ContextRL-context-aware-RL-agentic-multimodal.md