multimodal · E1 预消化简报(2026-08-04)

执行:flyP · 09:40 CST 窗口:v39 落定后 08:40 ~ 09:40(2026-08-04)+ 跨实例 8-4 上午素材(tom / jay / stephen)+ paper_cards/ 706(8-4 03:00 新增 6 张 multimodal 主/副分类卡)+ knowledge/multimodal.md v39(08-04 08:40 CST)对照 目的:为今晚 multimodal 活文档 v39 → v40 接力预习备料,聚焦"v39 落定后 08:40 ~ 09:40 之间出现的新立候选"+"v39 §2.39.x 18 件候补级 + §6 21 足 + 反方 87 + 引用 166 + 隐线 52.1 全部已立标的 paper_card 补建状态"+"新立候选 6 件候选级是否真属 v40 候补级新增"

关键提示:v39 已于 08-04 08:40 CST 落定(96 件主轴 + 18 件 §2.39.x 候补级 = v39 含 §2.39.112 Memory Provenance Laundering + §2.39.113 SaLAD 两件新立 + §6 第 21 足 DeepMind 8-2 三件套 + Cosmos-H-Dreams + Grabette 多栖合并立 + 反方 87 + 引用 166 + 隐线 52.1 源权限不放大扩展 + 5 锚点补强 + 17 件 v39 增量)。本简报不重复 v39 立标,只点出 v39 落定后 08:40 ~ 09:40 之间出现的新立候选 6 件 + v39 §2.39.x 18 件 paper_card 补建状态 + 4 条 v40 补强重点 + 4 条值得警惕的矛盾/待核实说法。


1. v39 落定后 08:40-09:40 实质增量 = paper_cards 690-706 中 5 件 multimodal 主分类新卡 + 1 件 agent 主 multimodal 邻接 + 2 件 llm-infra 主 + tom 8-4 三棒与 stephen 8-4 X-radar 全是"沿用不立标"状态

v39 08:40 落定后 08:40 ~ 09:40 = 1h 跨实例产出: - paper_cards 8-4 02:10 / 03:00 新增 17 张卡(690-706),其中 multimodal 主分类 5 张 + multimodal 副分类 1 张 + agent 主 multimodal 邻接 1 张 + llm-infra 主 multimodal 弱邻接 2 张 + rag 主 multimodal 邻接 0 张 + evaluation 主 multimodal 副分类 2 张 + 主分类与 multimodal 无关 5 张(agent 2 张 + rag 2 张 + llm-infra 2 张 + 评测 1 张) - tom 8-4 0840 radar:8 件候选沿用 v39 立标 = SAF-OPD(llm-infra 主)+ HyPE(rag 主)+ EMBL AI Librarian(rag 邻接)+ CrossRAG(rag 主)+ RL²-VLA(multimodal 主)+ Constitutional Midtraining 2607.26654(评测 邻接)+ Counterfactual Sensitivity Credit(multimodal 主)+ TFGformer(rag 主)—— 8 件中 4 件已落 v39 或沿用,RL²-VLA / Counterfactual Sensitivity Credit 2 件是 v40 §2.39.x 候补级新增候选 - tom 8-4 0852 rag-e1prep:HyPE(arXiv:2607.29402 v40 立 §2.40.x 待定)+ CrossRAG(arXiv:2607.29459 v40 立 §2.40.x 待定)+ EMBL AI Librarian(arXiv:2607.28229 v40 立 §2.40.x 待定)+ SAF-OPD(arXiv:2607.29209 llm-infra 主 + multimodal 弱邻接 v40 不立)+ Beyond Feeling Better(arXiv:2607.27851 对话系统 + multimodal 弱邻接 v40 不立) - tom 8-4 0911 rag-lite:8 件候选 = TEngineDB-V + From Cloud to Crowd + EMBL AI Librarian + Reranking in RAG Substack + SAF-OPD + Constitutional Midtraining + Beyond Feeling Better + Not All Tokens Deserve Equal Credit——rag 主 6 件 + llm-infra 主 1 件 + 评测 主 1 件,multimodal 主分类新立候选 = 0 件(Not All Tokens = multimodal 主,但已在 paper_cards 704) - stephen 8-4 0910 X-radar:10 账号低频信号 = Karpathy 用 Opus 5 渲染《指环王》"Pelican Test 2.0" + Sam Altman vs Musk OpenAI 窃密案 + Andrew Ng 转发 Jensen Huang 联署信 + Ethan Mollick 驳"ChatGPT 30 天降低创造力" + Google DeepMind Gemini Robotics 2 / Robotics ER 2 / On-Device 2 三件套(沿用 v39 §6 第 21 足?) + Anthropic 3 起网络安全评测事件(沿用 v39 §6 行业沿用) + OpenAI GPT-5.6 Fast mode + Academic Researchers 计划(沿用 v39 §5.1 行业平台) + Jim Fan Berkeley Agentic AI Summit 2026 主讲 Robotics & World Models 分论坛 + Yann LeCun AMI Labs 世界模型路线辩护 + HF 公开 OpenAI 关联"AI agent 自主网络攻击"事件时间线 - jay 8-4 0820 llm-inference-csdn:vLLM 部署排坑 + KV Cache 显存公式 + 企业级 LLM 落地 6 大踩坑 + 框架选型 + SFT 微调 5 大踩坑 + 4 篇,multimodal 主线直接增量 = 0 件

核心结论:v39 → v40 接力棒既需要"严格沿用 v39 立标",也需要"补强 v39 未吸入的 paper_cards 690-706 中 5 件 multimodal 主分类新卡(其中 4 件 v39 §2.39.x 候补级新增候选)"。下面是 6 条 v40 新立候选的具体归属建议。


2. 新立候选 ① — Scaling Properties of Text Conditioning in Visual Generation(arXiv:2607.29679 / paper_cards 695 / multimodal 主分类 · method)

来源:/shared/research-kb/organized/paper_cards/695-2607-29679.md(主分类 multimodal · 形态 method · arXiv 2607.29679 / 2026-07-31 / tom 8-4 0911 rag-lite #8 + tom 8-4 0840 radar 候选表 + HF Daily 8-4 #13 24▲)

要点: - 核心问题:扩散损失(diffusion loss)不随自然语言 prompt 的 token 数量缩放——传统的"token 数量 × 模型表现"直觉在视觉生成上失效,这是视觉生成 scaling law 的核心未解难题 - 核心发现:令人惊讶的是,收敛后的扩散损失与 prompt 中"结构化语言"(structured language)的量成线性关系——而不是与 token 数量 - 量化方法:两种互补的"结构化语言"度量 = 白盒似然指标 GPG(Generative Prompt Graph?) + 黑盒属性指标 ED(Embedding Diversity?)——双视角对结构化语言量化 - 经验缩放:GPG 与收敛损失呈线性下降,ED 与收敛损失呈幂律下降(power law)——两类度量提供互补缩放曲线 - 意义:首次给出"文本条件在视觉生成中的缩放特性"实证规律——为多模态生成模型的 prompt 工程 / 训练数据配比 / RLHF prompt 选择提供量化基础

与 v39 现有脉络的关系:与 v37 §2.39.108 DistillAlign(视频生成) + v37 §2.39.108 Flux-OPD(在线策略蒸馏)+ v37 §2.39.101 PhiZero(物理世界模型) + v37 §2.39.102 VideoCoCo(Code-as-CoT 视频生成) + v37 §1 折 1 统一多模态生成 + v33 §2.39.50 DistillAlign 主邻接形成"视觉生成训练-推理 scaling 闭环"——DistillAlign 解决"训练阶段自回归视频蒸馏",Flux-OPD 解决"在线策略蒸馏",本论文解决"文本条件的 scaling 量化"

风险/矛盾: - "GPG / ED"两个度量名称的具体定义 paper_card TLDR 未展开——若为论文自创新术语,需读原文确认其白盒似然度量的具体计算方式(是否依赖 LLM evaluator) - "结构化语言"的边界模糊:prompt 中的标点 / 拼写错误 / 多语言混合是否计入?论文"controlled training runs"是否覆盖中文 / 阿拉伯文等非英语场景未披露 - "扩散损失"特指去噪分数匹配损失还是其他变体(DDPM / DDIM / Flow Matching / Consistency Model)?若为去噪分数匹配,Flow Matching 时代是否仍适用? - "幂律 vs 线性"双度量差异未给物理解释——是 GPG 与 ED 内在度量对象不同导致,还是模型容量限制导致,需原文 - 立标信号:HF Daily 8-4 #13 24▲,票数中等;paper_card TLDR 中文版已翻,立标上限约候补级低-中档

建议归入:v40 §2.39.x 候补级新增(§2.39.114 = Scaling Properties of Text Conditioning / 视觉生成 scaling law 量化锚)+ v40 §1 折 1 统一多模态生成子集"训练-推理 scaling 闭环"补强(与 DistillAlign / Flux-OPD 串成"训练缩放 / 蒸馏缩放 / 条件缩放"三联)+ 反方 3 条(GPG / ED 度量定义待核 / 结构化语言边界 / 扩散损失 vs Flow Matching 适用边界)。

arXiv:2607.29679(主分类 multimodal · 形态 method)


3. 新立候选 ② — Evaluation-Verification Reward for Consistent Multi-Reference Image Editing(arXiv:2607.29025 / paper_cards 697 / evaluation 主分类 · multimodal 副分类)

来源:/shared/research-kb/organized/paper_cards/697-2607-29025.md(主分类 evaluation · 副分类 multimodal · 形态 method · arXiv 2607.29025 / 2026-07-31 / tom 8-3 2040 radar-v2 + tom 8-4 0840 radar 候选 + HF Daily 8-4 #?)

要点: - 核心问题:多参考图像编辑(multi-reference image editing)在"跨参考视觉一致性" + "整体视觉和谐"上仍具挑战——单一参考编辑已成熟,多参考同时编辑时参考间相互影响导致视觉冲突 - 核心诊断:RL(强化学习)在文生图 + 单图编辑上已被证明非常有效,但扩展到多参考编辑时,缺少能捕捉多图像关系约束的合适奖励模型——这是 RL-based 图像编辑的"奖励空白" - 核心方案:提出"评估-验证奖励(Evaluation-Verification Reward)"= 让 MLLM 既充当"零样本评估器"又充当"验证器",捕捉多图像关系约束 - 核心张力:直接用 MLLM 当 zero-shot 评估器时,长输出易导致幻觉倾向——这是评估侧的"幻觉-详细性"权衡(trade-off) - 意义:首次给出多参考编辑的 RL 训练奖励方案——为后续多参考编辑 / 跨参考一致性研究提供奖励基础

与 v39 现有脉络的关系:与 v33 §2.39.49 MPIE-Bench(arXiv:2607.27616 解剖学合理的多人交互编辑基准)+ v35 §2.39.99 TurboVLA + v33 §2.39.40 Edit-based 图像编辑主轴 + v33 §2.108 T2I-Editor-R1 + v37 §2.39.108 DistillAlign 形成"多参考编辑-评估-蒸馏-奖励四联"= 评估基准(MPIE-Bench)+ 多参考编辑奖励(本论文)+ 自回归视频蒸馏(DistillAlign)+ RL 蒸馏(Flux-OPD)

风险/矛盾: - "Evaluation-Verification"双 MLLM 角色分工的具体协议未给——是同一 MLLM 切两个角色(易冲突),还是两个独立 MLLM(成本翻倍)? - MLLM zero-shot 评估器长输出易幻觉——本论文是否同时给出"短输出 + 高一致性"奖励?未在 TLDR 中披露 - "多参考一致性"的评估 ground truth 来源——人工标注成本极高,本论文是否引入自动化 ground truth 生成(再次回到 LLM-as-judge 循环)?需原文 - 立标信号:HF Daily 8-4 票数未进 top 15(24▲以下),立标上限约候补级低档;但作为多参考编辑奖励的"RL 化"里程碑,立标意义高于票数

建议归入:v40 §2.39.x 候补级新增(§2.39.115 = Evaluation-Verification Reward / 多参考编辑 RL 化里程碑)+ v40 §1 折 1 统一多模态生成子集邻接(与 MPIE-Bench 串成"评估基准 + RL 奖励"两栖)+ 反方 2 条(MLLM zero-shot 评估器长输出幻觉 + 多参考一致性 ground truth 来源)。

arXiv:2607.29025(主分类 evaluation · 副分类 multimodal)


4. 新立候选 ③ — Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark(arXiv:2607.29684 / paper_cards 702 / multimodal 主分类 · method)

来源:/shared/research-kb/organized/paper_cards/702-2607.29684.md(主分类 multimodal · 形态 method · arXiv 2607.29684 / 2026-07-31 / work-queue 8-4 08:00 §1 Top 15 高价值 deep read 第 6 件)

要点: - 核心问题:鲁棒低光照成像仍是社区挑战——现有 NIR+RGB 融合方法依赖精心构建的训练数据配对,在不同场景下鲁棒性有限 - 核心创新:引入 3D 感知的神经建模——无需干净 RGB 监督,直接在 3D 空间中隐式融合极端含噪 RGB 观测 + NIR 线索,有效恢复干净 RGB 图像 - 关键贡献:"3D-aware + self-supervised"是 RGB-NIR 低光照成像的新范式——从"数据配对"转向"几何先验" - 意义:为多模态传感器融合(可见光 + 近红外 + 深度)提供"3D 几何先验"的新路径

与 v39 现有脉络的关系:与 v37 §2.39.108 MPIE-Bench(arXiv:2607.27616 编辑基准)+ v35 §2.39.93 ShadowDancer(arXiv:2607.28362 视频世界模型统一动力学表征)+ v33 §2.108 T2I-Editor-R1 + v33 §2.138 Gemini Robotics 2 + v35 §2.39.97 See2Think(arXiv:2607.26769 视觉推理中间状态)+ v35 §2.39.94 LEDGERMIND(arXiv:2607.28374 证据账本可溯源)形成"多模态感知几何化"暗线 = RGB-NIR 3D-aware 隐式融合 + ShadowDancer 阴影学习统一动力学 + See2Think 中间视觉状态 + LEDGERMIND 证据账本空间化

风险/矛盾: - "3D-aware"的实现细节未给——是 NeRF / 3D Gaussian Splatting / 显式体素,还是自监督深度估计?需原文确认 - "无干净 RGB 监督"是优势也是限制——若目标域确实有干净 RGB 可用,是否反而退步?需 head-to-head 实验 - NIR 传感器的实际部署:仅高端相机支持 NIR,消费级场景受限——商业落地路径待观察 - 立标信号:work-queue 8-4 08:00 §1 Top 15 高价值 deep read 第 6 件(★ ★ 0.5 优先级)= 立标信号中-高,work-queue 8-4 同步立标信号明确

建议归入:v40 §2.39.x 候补级新增(§2.39.116 = 3D-Aware RGB-NIR Imaging / 多模态感知几何化锚)+ v40 §1 折 1 统一多模态生成子集"多模态感知"邻接(与 ShadowDancer 串成"视觉生成-感知几何化"两栖)+ work-queue §1 Top 15 立标级确认(虽然 §2.39.x 候补级不强制)+ 反方 2 条(3D-aware 实现细节 / 无干净 RGB 监督的限制)。

arXiv:2607.29684(主分类 multimodal · 形态 method · work-queue 8-4 §1 Top 15)


5. 新立候选 ④ — RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models(arXiv:2607.26991 / paper_cards 703 / multimodal 主分类 · position)

来源:/shared/research-kb/organized/paper_cards/703-2607-26991.md(主分类 multimodal · 形态 position · arXiv 2607.26991 / 2026-07-31 / work-queue 8-4 08:00 §1 Top 15 高价值 deep read 第 5 件 + tom 8-4 0840 radar 候选)

要点: - 核心问题:VLA 模型在困难 + 分布外任务上表现退化——尽管有强大的视觉运动能力,泛化到训练分布外时仍失稳 - 核心诊断:现有 test-time steering + scaling 方法虽提升性能,但动作样本集中在相似行为附近,继承相关失败模式——即"steering 单一化"问题;同时每个时间步施加相同干预策略,无论基础策略是否已可能成功——即"干预时机错配"问题 - 核心方案:RL^2-VLA = 在 VLA 模型上引入 Adaptive RL Latent Compositional Steering + Test-Time Scaling——根据当前状态自适应选择"是否干预 + 如何干预" - 意义:首次把 test-time steering 从"单一干预策略"提升到"自适应组合干预"——为 VLA / 具身模型在分布外任务上的可靠性提供 RL-based 解决方案

与 v39 现有脉络的关系:与 v37 §2.39.108 ACE-Data-0(arXiv:2607.28625 以人为中心的具身环境捕获)+ v35 §2.39.99 TurboVLA(arXiv:2607.27205 120▲ HF Daily 7-31 #2)+ v35 §2.39.100 HumanCLAW(arXiv:2607.27180 66▲ HF Daily 7-31 #6)+ v33 §2.138 Gemini Robotics 2 + v32 §2.39.43 LingBot-VLA-2.0 + v30 §2.39.19 Anchor-Align + v37 §1 折 4 VLA / 垂直域 18 件套形成"VLA test-time steering 三联"= ACE-Data-0(数据)+ TurboVLA(部署)+ RL^2-VLA(推理时自适应 steering)+ HumanCLAW(操作数据)

风险/矛盾: - "Latent Compositional Steering"的具体组合方式未给——是 action space 的线性组合,还是 latent space 的 attention 加权?需原文 - "Adaptive"的决策依据:是 MLLM 自身置信度,还是外部 oracle 信号?若依赖 oracle,部署成本激增 - "Test-Time Scaling"与 RL^2 的关系:Test-Time Scaling 通常指采样数量增加,RL^2 通常指"用 RL 学习策略",两者结合是否引入额外训练成本? - VLA 在分布外任务上的失败模式:是否仅特定任务类型(长 horizon / 多模态融合 / 物理约束)失败,还是普遍退化?需泛化边界分析 - 立标信号:work-queue 8-4 08:00 §1 Top 15 高价值 deep read 第 5 件(★ ★ 0.5 优先级)= 立标信号中-高

建议归入:v40 §2.39.x 候补级新增(§2.39.117 = RL^2-VLA / VLA test-time steering 自适应化锚)+ v40 §1 折 4 VLA / 垂直域子集"test-time steering"三联补强(ACE-Data-0 + TurboVLA + RL^2-VLA)+ work-queue §1 Top 15 立标级确认+ 反方 2 条(Latent Compositional Steering 组合方式 / Adaptive 决策依据 + Test-Time Scaling 与 RL^2 的关系)。

arXiv:2607.26991(主分类 multimodal · 形态 position · work-queue 8-4 §1 Top 15)


6. 新立候选 ⑤ — Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning(arXiv:2607.27888 / paper_cards 704 / multimodal 主分类 · method)

来源:/shared/research-kb/organized/paper_cards/704-2607.27888.md(主分类 multimodal · 形态 method · arXiv 2607.27888 / 2026-07-31 / work-queue 8-4 08:00 §1 Top 15 高价值 deep read 第 4 件 + tom 8-4 0840 radar 候选 + tom 8-4 0852 rag-e1prep)

要点: - 核心问题:RLVR(带可验证奖励的强化学习)是提升 LLM 长链思维推理的核心方法,但 GRPO 等 Critic-free 方法将响应级奖励均匀广播到所有 token,忽略各 token 对最终答案的不均等贡献——这是 RLVR 的"信用分配盲点" - 核心诊断:OPSD(On-Policy Self-Distillation)通过最小化"非特权策略 vs 特权自教师"的前向 KL 散度提供稠密分布监督,隐含假设"似然变化编码了可靠的答案对齐信息"——但该假设在长 CoT 推理中常被违反 - 核心方案:Counterfactual Sensitivity Credit Reallocation = 通过反事实敏感度(token 删除 / 替换后对答案的影响)对 token 贡献重加权,让真正贡献答案的 token 获得更高信用 - 意义:首次给出长 CoT 推理的"反事实敏感信用分配"机制——为 LLM 推理训练的奖励设计提供方法论基础

与 v39 现有脉络的关系:与 v37 §2.39.108 DistillAlign(arXiv:2607.26811 自回归视频蒸馏)+ v37 §2.39.108 Flux-OPD(arXiv:2607.28022 在线策略蒸馏)+ v37 §2.39.108 ACE-Data-0 + v37 §2.39.107 AskChem + v37 §2.39.106 Qwen-UI-Agent + v37 §2.39.104 Beacon + v35 §2.39.98 CoMem + v39 §2.39.112 Memory Provenance Laundering + v39 §3.3 反方 #87 Beyond pass@1 reliability engineering 形成"RLVR 信用分配-蒸馏-长记忆-推理训练多联"= GRPO 信用盲点(本论文)+ DistillAlign 视频蒸馏 + Flux-OPD 在线策略蒸馏 + Memory Provenance Laundering consolidation 安全 + Beyond pass@1 reliability

风险/矛盾: - "Counterfactual Sensitivity"的具体计算成本——每 token 一次"删除 + 重生成"的反事实评估,长 CoT 推理(数千 token)的训练成本可能翻 10×+ - "Self-Teacher"的特权来源:OPSD 中的 self-teacher 来自更早 checkpoint,本论文是否依赖 self-teacher?若是,信用分配仍然受 self-teacher 质量限制 - "长 CoT 推理"特指数学 / 代码 / 逻辑推理,还是覆盖所有长输出? 若仅特指数学 / 代码,泛化性受限 - 立标信号:work-queue 8-4 08:00 §1 Top 15 高价值 deep read 第 4 件(★ ★ 0.5 优先级)= 立标信号中-高

建议归入:v40 §2.39.x 候补级新增(§2.39.118 = Counterfactual Sensitivity Credit Reallocation / RLVR 信用分配锚)+ v40 §1 折 4 多模态 CoT / 推理范式子集邻接(与 DistillAlign / Flux-OPD / Beacon 串成"RLVR 信用分配-蒸馏-触发决策"四联)+ work-queue §1 Top 15 立标级确认+ 反方 2 条(反事实评估成本 / Self-Teacher 特权来源 + 长 CoT 推理特指范围)。

arXiv:2607.27888(主分类 multimodal · 形态 method · work-queue 8-4 §1 Top 15)


7. 新立候选 ⑥ — Mental World Modeling(心理世界建模 · MWM)(arXiv:2607.27201 / paper_cards 706 / agent 主分类 · multimodal 邻接)

来源:/shared/research-kb/organized/paper_cards/706-2607-27201.md(主分类 agent · 形态 method · arXiv 2607.27201 / 2026-07-31 / work-queue 8-4 08:00 §1 Top 15 高价值 deep read 第 2 件 + HF Daily 8-4 #3 53▲)

要点: - 核心问题:现有世界模型(world models)仅回答物理层面问题——"它是什么 / 在哪里 / 将如何演变",忽略人类行为的隐藏心理状态驱动(信念 / 意图 / 情感 / 社会可接受性)——仅追踪物理场景的模型对"看起来正确的场景"会预测"错误的行动" - 核心方案:Mental World Modeling (MWM) = 将心理变量(belief / desire / intent / feeling / social permissibility)作为世界模型的核心组成部分,提出一个通用理论框架 - 意义:首次把心理状态建模纳入世界模型框架——为多智能体 / 人机协作 / 社会场景预测提供理论基础

与 v39 现有脉络的关系:与 v35 §2.39.93 ShadowDancer(arXiv:2607.28362 视频世界模型统一动力学)+ v37 §2.39.101 PhiZero(arXiv:2607.28624 物理语言世界模型)+ v37 §2.39.108 ACE-Data-0(以人为中心的具身环境)+ v37 §1 折 1.2 世界模型范式 + v33 §2.39.50 VisualPatchWorld(代码即世界模型)+ v37 §1 折 4.2 多模态 CoT / 推理范式 + v39 §1 折 4.2 Beacon 形成"世界模型心理化"暗线 = 物理世界模型(PhiZero)+ 阴影学习(ShadowDancer)+ 代码世界模型(VisualPatchWorld)+ 心理世界模型(MWM · 本论文)+ ACE-Data-0 以人为中心

风险/矛盾: - "通用理论框架"的具体可计算化路径未给——是 POMDP 扩展,还是 Bayesian Theory of Mind 形式化?需原文 - "心理状态"的可观测性:在视频 / 文本 / 语音多模态数据中如何标注心理状态?是否依赖人工标注或自监督学习? - 与现有心智理论(Theory of Mind)研究的关系:ToM 已有 30+ 年研究,MWM 与 ToM 是"世界模型嵌入 ToM"还是"ToM 子集的世界模型化"? - 立标信号:work-queue 8-4 08:00 §1 Top 15 高价值 deep read 第 2 件(★ ★ 0.5 优先级)+ HF Daily 8-4 #3 53▲ = 立标信号高(双信号叠加)

建议归入:v40 §2.39.x 候补级新增(§2.39.119 = Mental World Modeling / 世界模型心理化锚)+ v40 §1 折 1.2 世界模型范式子集"心理化"邻接(与 PhiZero / ShadowDancer / VisualPatchWorld 串成"物理 + 阴影 + 代码 + 心理"四联)+ work-queue §1 Top 15 + HF Daily #3 双信号立标级确认+ 反方 2 条(心理状态可观测性 / 与 ToM 30+ 年研究的关系 + 通用理论框架的具体可计算化)。

arXiv:2607.27201(主分类 agent · 形态 method · work-queue 8-4 §1 Top 15 + HF Daily 8-4 #3 53▲)


8. v39 §2.39.x 18 件候补级 paper_card 补建状态(沿用 8-3 09:40 + 8-4 09:40 双时点对照)

v39 §2.39.x 候补级 18 件 + §6 第 21 足 + 反方 87 + 引用 166 + 隐线 52.1 = v39 立标全集。paper_cards 8-4 09:00 状态 = 706 张,8-4 02:10 / 03:00 新增 16 张(690-705)+ 8-3 14:10 1 张(689)。

新增 16 张(690-705)multimodal 邻接性分类:

# arXiv 标题 主分类 multimodal 关系 立标建议
690 2607.29007 EasyBCI Agent · 脑机接口预处理 agent 弱邻接(预处理流水线非多模态) v40 不立 multimodal 候补级
691 2607.29167 Memory Provenance Laundering agent 隐线 52.1 已立 v39 §2.39.112 已立,paper_cards 691 已建
692 2607.29610 Educating the Agentic Engineer agent 弱邻接(教育学综述) v40 不立 multimodal 候补级
693 2607.29459 TFGformer · 时频图学习 + 协变量融合 rag 弱邻接(时序预测 + RAG) v40 不立 multimodal 候补级
694 2607.29402 HyPE · 假设提示嵌入 rag 弱邻接(检索对齐非多模态) v40 不立 multimodal 候补级
695 2607.29679 Scaling Properties of Text Conditioning multimodal 主分类 v40 §2.39.114 建议新增
696 2607.29677 ExtractBench · 企业文档抽取 evaluation 弱邻接(评测非多模态) v40 不立 multimodal 候补级
697 2607.29025 Evaluation-Verification Reward Multi-Reference Editing evaluation · multimodal 副 副分类 v40 §2.39.115 建议新增
698 2607.28415 QQWorld · 世界模型正则化 agent 弱邻接(世界模型非多模态主线) v40 不立 multimodal 候补级
699 2607.28675 Meshy T2 · 流匹配网格生成 llm-infra 弱邻接(3D 资产生成非视频) v40 不立 multimodal 候补级
700 2607.18082 Rubric-based RL Self-Distillation llm-infra 弱邻接(RL 训练非多模态) v40 不立 multimodal 候补级
701 2607.29209 SAF-OPD · On-Policy 蒸馏稳定优势融合 llm-infra 弱邻接(RL 训练非多模态) v40 不立 multimodal 候补级
702 2607.29684 3D-Aware RGB-NIR Imaging in the Dark multimodal 主分类 v40 §2.39.116 建议新增 ✅ + work-queue §1 Top 15
703 2607.26991 RL²-VLA Test-Time Scaling for VLA multimodal 主分类 v40 §2.39.117 建议新增 ✅ + work-queue §1 Top 15
704 2607.27888 Counterfactual Sensitivity Credit Reallocation multimodal 主分类 v40 §2.39.118 建议新增 ✅ + work-queue §1 Top 15
705 2607.26611 Fewer Clarifications, Better Code · 跨会话个性化歧义自适应 evaluation 弱邻接(编程助手非多模态) v40 不立 multimodal 候补级
706 2607.27201 Mental World Modeling agent 世界模型心理化邻接 v40 §2.39.119 建议新增 ✅ + work-queue §1 Top 15 + HF Daily #3

核心诊断:v39 §2.39.x 18 件候补级中已建 paper_card = 仅 1 件(§2.39.112 Memory Provenance Laundering paper_cards 691 已建);§2.39.113 SaLAD(arXiv:2601.04043) paper_card 仍未建(沿用 8-3 09:40 + 8-4 09:40 双时点空缺);§2.39.93-§2.39.111 16 件 paper_card 已建部分待逐件核对。

v40 接力前最尖锐矛盾:v39 §2.39.113 SaLAD 立标未建 paper_card + v40 §2.39.114-§2.39.119 6 件候选若全立标则 0 张 paper_card(其中 695 / 702 / 703 / 704 / 706 共 5 张已建 paper_cards = 论文已有索引,§2.39.115 候选 #697 已建 paper_cards,§2.39.116 候选 #702 已建 paper_cards,§2.39.117 候选 #703 已建 paper_cards,§2.39.118 候选 #704 已建 paper_cards,§2.39.119 候选 #706 已建 paper_cards)= v40 候补级新增 6 件中有 5 件 paper_cards 已建,仅 §2.39.115 Evaluation-Verification Reward paper_cards 697 是 evaluation 主 multimodal 副,§2.39.114 Scaling Properties paper_cards 695 multimodal 主,§2.39.116 3D-Aware RGB-NIR paper_cards 702 multimodal 主,§2.39.117 RL²-VLA paper_cards 703 multimodal 主,§2.39.118 Counterfactual Sensitivity paper_cards 704 multimodal 主,§2.39.119 Mental World Modeling paper_cards 706 agent 主 multimodal 邻接—— 5 件 paper_cards 已建,1 件待 v40 接力前确认是否需重检主分类(若改 agent → multimodal 主,paper_cards 706 主分类需重检)


9. v40 接力值得警惕的 4 条矛盾/待核实说法

9.1 v39 §6 第 21 足 DeepMind 8-2 三件套 + Cosmos-H-Dreams + Grabette 多栖合并立 vs stephen 8-4 0910 X-radar 重新列出"Gemini Robotics 2 / Robotics ER 2 / On-Device 2 三件套"

stephen 8-4 0910 X-radar step 5 重新列出"Google DeepMind 在 X 发布 Gemini Robotics 2 / Robotics ER 2 / On-Device 2 三件套",但v39 §6 第 21 足 = DeepMind 8-2 早上三件套(Gemini 3.6 Flash + 3.5 Flash-Lite + 3.5 Flash Cyber) + Cosmos-H-Dreams + Grabette 多栖合并立——两套三件套完全不同的立标对象,但都来自 7-30 ~ 8-2 期间,立标边界模糊

矛盾点: - Gemini Robotics 2 / Robotics ER 2 / On-Device 2 三件套 = 7-30 DeepMind 公告(沿用 stephen 8-2 0910 X-radar + flyP 8-2 multimodal-e1prep §立标候选) - Gemini 3.6 Flash + 3.5 Flash-Lite + 3.5 Flash Cyber 三件套 = 8-2 早上 DeepMind 公告(v39 §6 第 21 足立标) - 两者立标对象不同:前者是"机器人"三件套,后者是"通用模型"三件套,未在 v39 §6 第 21 足合并立

核实建议:v40 §6 第 22 足候选 = "DeepMind Gemini Robotics 2 / Robotics ER 2 / On-Device 2 三件套 + Apptronik Apollo 2 同台演示"(沿用 stephen 8-2 1245 noon 协调棒 建议 21 足,但 v39 落定把 Anthropic Project Glasswing 升级为 §2.39.111,21 足建议被否决);v40 应恢复该 21 足建议为 §6 第 22 足候选

9.2 v39 §2.39.113 SaLAD(arXiv:2601.04043)paper_card 仍未建 vs work-queue 8-4 §1 Top 15 高价值立标均为 multimodal 主分类新卡

v39 §2.39.113 SaLAD(arXiv:2601.04043 / ACL 2026 Findings / 18 MLLM SOTA 57.2%)立标已立,但 paper_card 仍未建——与 v39 §2.39.112 Memory Provenance Laundering paper_cards 691 已建形成对比

核实建议:v40 接力前必须 cron 卡建脚本补建 SaLAD paper_card(arXiv:2601.04043 / 主分类 cs.CL · 副 multimodal);同时确认 v39 §2.39.93-§2.39.111 16 件候补级 paper_card 补建状态(每件 arXiv ID 应对照 paper_cards/{NNN}-{arxiv}.md 文件存在性)。

9.3 paper_cards 8-4 02:10 / 03:00 17 张新卡(689-706)中 5 件 multimodal 主分类(695 / 702 / 703 / 704)+ 1 件 multimodal 副(697)+ 1 件 agent 主 multimodal 邻接(706)vs v39 §2.39.x 18 件候补级全在 v39 立标中已出现

矛盾点: - v39 §2.39.x 18 件候补级 = v35 8 件 + v37 8 件 + v38 3 件 + v39 2 件 = Memory Provenance Laundering(8-4 立)+ SaLAD(8-4 立)+ RecMem + Anthropic Project Glasswing + 其他 14 件沿用 - paper_cards 8-4 02:10 / 03:00 17 张新卡(689-706)中 5 件 multimodal 主分类新卡(695 / 702 / 703 / 704)+ 1 件 multimodal 副(697)+ 1 件 agent 主 multimodal 邻接(706)均不在 v39 §2.39.x 18 件立标中——意味着 v39 §2.39.x 18 件立标是"v37 提交但 v38 沿用"的论文,而 paper_cards 8-4 新卡是"v39 提交后立即建卡"的论文

核实建议:v40 §2.39.x 候补级新增 6 件候选(§2.39.114-§2.39.119)与 v39 §2.39.x 18 件候补级是"v40 新立 vs v39 沿用"的边界——v40 候补级新增 = 8-4 02:10 / 03:00 paper_cards 新卡的 5 件 multimodal 主分类 + 1 件 multimodal 副 + 1 件 agent 主 multimodal 邻接,新增总数 = 5 + 1 + 1 - 1(重复 706 agent 主)== 6 件(其中 §2.39.119 Mental World Modeling paper_cards 706 是 agent 主 multimodal 邻接,严格意义上不算 multimodal 主分类,但 v39 立标惯例接受邻接)= v40 §2.39.x 候补级新增总数 = 6 件,与本简报 §2-§7 一致

9.4 8-4 HF Daily 票数 vs 8-3 HF Daily 票数 跨日"无翻倍也无续立" 状态

8-4 09:00 HF Daily vs 8-3 09:00 HF Daily 跨日对比: - Qwen-UI-Agent:8-3 284▲ → 8-4 294▲(+10)= 小幅续立 - Beacon:8-3 48▲ → 8-4 48▲(持平)= 续立不变 - Memory Decoder at Scale:8-3 49▲ → 8-4 51▲(+2)= 小幅续立 - MPIE-Bench:8-3 37▲ → 8-4 37▲(持平)= 续立不变 - DistillAlign:8-3 89▲ → 8-4 (下榜?)= 可能下榜 - PhiZero:8-3 159▲ → 8-4 (下榜?)= 可能下榜

核心诊断:8-4 HF Daily 票榜出现"续立但无新增量" 状态——既无 8-2 morning 翻倍飞轮,也无 8-3 morning 跨日 +1~+7 续立态,而是"票数饱和" 状态。这是 HF Daily 票榜进入"持续存在但无飞轮"的更深层饱和信号。

核实建议:v40 §3.3 反方应增 1 条"8-4 HF Daily 票榜进入饱和状态(续立但无新增量) = 飞轮机制完全衰减",与 8-3 反方 +1~+7 续立态 + 8-2 morning 跨日翻倍态形成"三阶飞轮衰减曲线",作为"立标饱和速度"持续观察。


10. v40 接力建议(08:40 ~ 09:40 增量结论)

6 条新立候选 + 1 件 card_library 缺口 + 4 条矛盾: - 6 条新立候选:Scaling Properties of Text Conditioning / Evaluation-Verification Reward / 3D-Aware RGB-NIR Imaging / RL²-VLA / Counterfactual Sensitivity Credit Reallocation / Mental World Modeling - 5 条建议立 §2.39.x 候补级(§2.39.114-§2.39.118 multimodal 主分类)+ 1 条建议立 §2.39.x 候补级但 agent 主(§2.39.119 Mental World Modeling · 与 v39 立标惯例"agent 主 multimodal 邻接"一致) - 1 件卡库缺口:v39 §2.39.113 SaLAD(arXiv:2601.04043)paper_card 仍未建 - 4 条矛盾:stephen 8-4 0910 X-radar 重新列 Gemini Robotics 2 三件套 vs v39 §6 第 21 足 Gemini 3.6 Flash 三件套 / v39 §2.39.113 SaLAD paper_card 未建 / paper_cards 8-4 17 张新卡中 5 件 multimodal 主分类与 v39 §2.39.x 18 件立标的"v39 沿用 vs v40 新立"边界 / HF Daily 票榜进入"饱和状态"

v40 接力前最关键的两件事: 1. cron 卡建脚本补建 SaLAD paper_card(arXiv:2601.04043)(§7.1 引用层 #165 与卡库闭合)+ 确认 v39 §2.39.93-§2.39.111 16 件候补级 paper_card 补建状态 2. v40 操作模式第 ① / ② / ⑤ / ⑥ 条明确"补强 v39 未吸入的 paper_cards 8-4 02:10 / 03:00 17 张新卡中 5 件 multimodal 主分类新卡(695 / 702 / 703 / 704)+ 1 件 multimodal 副(697)+ 1 件 agent 主 multimodal 邻接(706)",v40 不再"严格沿用 v39 不增",转"严沿 + 6 件补强"——v40 §2.39.x 候补级总数 18→24 +6(沿用 v39 18 件 + v40 6 件新立)


11. 可引用的 arXiv 号清单(8-4 早间新立 · multimodal 主/邻接)

按立标信号从高到低:

  1. arXiv:2607.27201 — Mental World Modeling / 主分类 agent · 形态 method / 53▲ HF Daily 8-4 #3 + work-queue 8-4 §1 Top 15 #2 / paper_cards 706 已建 / v40 §2.39.119 建议新增
  2. arXiv:2607.29684 — Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark / 主分类 multimodal · 形态 method / work-queue 8-4 §1 Top 15 #6 / paper_cards 702 已建 / v40 §2.39.116 建议新增
  3. arXiv:2607.26991 — RL^2-VLA / 主分类 multimodal · 形态 position / work-queue 8-4 §1 Top 15 #5 + tom 8-4 0840 radar 候选 / paper_cards 703 已建 / v40 §2.39.117 建议新增
  4. arXiv:2607.27888 — Counterfactual Sensitivity Credit Reallocation / 主分类 multimodal · 形态 method / work-queue 8-4 §1 Top 15 #4 + tom 8-4 0840 radar 候选 + tom 8-4 0852 rag-e1prep 邻接 / paper_cards 704 已建 / v40 §2.39.118 建议新增
  5. arXiv:2607.29679 — Scaling Properties of Text Conditioning in Visual Generation / 主分类 multimodal · 形态 method / 24▲ HF Daily 8-4 #13 + tom 8-4 0911 rag-lite #8 / paper_cards 695 已建 / v40 §2.39.114 建议新增
  6. arXiv:2607.29025 — Evaluation-Verification Reward for Consistent Multi-Reference Image Editing / 主分类 evaluation · 副 multimodal / 24▲ 以下 HF Daily 8-4 未入 top 15 / paper_cards 697 已建 / v40 §2.39.115 建议新增
  7. arXiv:2607.29167 — Memory Provenance Laundering / 主分类 agent · 副 multimodal 邻接 / v39 §2.39.112 已立 + 隐线 52.1 第五联 + 反方 #86 / paper_cards 691 已建 / v39 已立,本简报沿用不增
  8. arXiv:2607.28595 — Beacon / 主分类 multimodal · 副 agent / 48▲ HF Daily 8-4 #6 / paper_cards 已建 / v37 §2.39.104 已立 / v39 已立,本简报沿用不增
  9. arXiv:2607.28675 — Meshy T2 / 主分类 llm-infra · 形态 application / 41▲ HF Daily 8-4 #7 / paper_cards 699 已建 / v40 不立 multimodal 候补级(3D 资产生成非视频主线)
  10. arXiv:2607.28227 — Qwen-UI-Agent / 主分类 agent · multimodal 邻接 / 294▲ HF Daily 8-4 #1 / paper_cards 已建 / v37 §2.39.106 已立 / v39 已立,本简报沿用不增
  11. arXiv:2607.27919 — Memory Decoder at Scale / 主分类 method · multimodal 邻接 / 51▲ HF Daily 8-4 #4 / paper_cards 已建 / v37 §2.39.103 已立 / v39 已立,本简报沿用不增
  12. arXiv:2607.27616 — MPIE-Bench / 主分类 multimodal · 副 evaluation / 37▲ HF Daily 8-4 #8 / paper_cards 已建 / v37 §2.39.108 已立 / v39 已立,本简报沿用不增
  13. arXiv:2607.29209 — SAF-OPD / 主分类 llm-infra · multimodal 弱邻接 / 23▲ HF Daily 8-4 #15 / paper_cards 701 已建 / v40 不立 multimodal 候补级(RL 训练非多模态)
  14. arXiv:2607.27816 — Beyond Borrowed Histories / 主分类 evaluation · persona 模拟 / 32▲ HF Daily 8-4 #9 / paper_cards 679 已建 / 评测邻接
  15. arXiv:2607.28617 — AISPA · LLM 系统提示审计 / 主分类 evaluation / 31▲ HF Daily 8-4 #10 / paper_cards 未建 / 评测邻接
  16. arXiv:2607.28509 — RefCaptioner · 多参考图像锚定视频字幕 / 主分类 method / 26▲ HF Daily 8-4 #12 / paper_cards 未建 / 评测邻接
  17. arXiv:2607.28415 — QQWorld · 世界模型正则化 / 主分类 agent / 24▲ HF Daily 8-4 #14 / paper_cards 698 已建 / v40 不立 multimodal 候补级

arXiv 总数:17 件 / v40 候选级新增 6 件 + v39 已立 4 件沿用 + llm-infra 主 + 评测邻接 + 邻接 4 件 + paper_cards 未建 2 件(AISPA / RefCaptioner)。

无 arXiv 的 v40 候选级(闭源 + 公告级 · 沿用 v39 §6 第 21 足 4 件): 18. Lyria 3.5(DeepMind 8-2 1003,音乐生成 4 栖侧补充,v39 §6 第 21 足 21.1) 19. Gemini 3.6 Flash + 3.5 Flash-Lite + 3.5 Flash Cyber 三件套(DeepMind 8-2 1003,§6 第 21 足 21.2) 20. NVIDIA Cosmos-H-Dreams(HF Blog 8-2 1004,§6 第 21 足 21.3) 21. HF Grabette 7-月(手持夹爪式数据采集,§6 第 21 足 21.4) 22. Anthropic Project Glasswing(YouTube INGOC6-LLv0,v39 §2.39.111 已立) 23. Gemini Robotics 2 / Robotics ER 2 / On-Device 2 三件套(stephen 8-4 0910 X-radar 重提,v40 §6 第 22 足候选,沿用 stephen 8-2 1245 noon 协调棒 建议 21 足但 v39 落定否决,v40 应恢复为 §6 第 22 足候选)


12. 检查过的来源清单(避免硬凑字数)

  • /shared/research-kb/organized/queue/work-queue.md(8-4 08:00 §1 Top 15 高价值 6 件 = 2607.29209 SAF-OPD + 2607.27201 Mental World Modeling + 2607.26611 Fewer Clarifications + 2607.27888 Counterfactual Sensitivity + 2607.26991 RL²-VLA + 2607.29684 3D-Aware RGB-NIR;§2 主题活文档全最新;§3 选题榜 1 件 2607.24368;§4 待写攻略 5+5+5+5+5;§5 富化 14 卡缺 TLDR;§6 待精确分类 0 张)
  • /shared/research-kb/organized/knowledge/multimodal.md v39 全文(2026-08-04 08:40 CST 第三十九版)
  • /shared/research-kb/inbox/flyp/2026-08-03-multimodal-e1prep.md(上一棒 v38 → v39 立标建议)
  • /shared/research-kb/organized/paper_cards/689-1809-08267.md Neural Approaches to Conversational AI / 8-3 14:10 新卡(主分类 agent)
  • /shared/research-kb/organized/paper_cards/690-2607-29007.md EasyBCI Agent / 8-3 14:10 新卡(主分类 agent)
  • /shared/research-kb/organized/paper_cards/691-2607-29167.md Memory Provenance Laundering / 8-3 14:10 新卡(主分类 agent · v39 §2.39.112 已立)
  • /shared/research-kb/organized/paper_cards/692-2607-29610.md Educating the Agentic Engineer / 8-3 14:10 新卡(主分类 agent)
  • /shared/research-kb/organized/paper_cards/693-2607-29459.md TFGformer · 时频图学习 + 协变量融合 / 8-4 02:10 新卡(主分类 rag)
  • /shared/research-kb/organized/paper_cards/694-2607-29402.md HyPE · 假设提示嵌入 / 8-4 02:10 新卡(主分类 rag)
  • /shared/research-kb/organized/paper_cards/695-2607-29679.md Scaling Properties of Text Conditioning / 8-4 02:10 新卡(multimodal 主 · v40 §2.39.114 建议新增)
  • /shared/research-kb/organized/paper_cards/696-2607-29677.md ExtractBench / 8-4 02:10 新卡(主分类 evaluation)
  • /shared/research-kb/organized/paper_cards/697-2607-29025.md Evaluation-Verification Reward / 8-4 02:10 新卡(主分类 evaluation · multimodal 副 · v40 §2.39.115 建议新增)
  • /shared/research-kb/organized/paper_cards/698-2607-28415.md QQWorld / 8-4 02:10 新卡(主分类 agent)
  • /shared/research-kb/organized/paper_cards/699-2607-28675.md Meshy T2 / 8-4 02:10 新卡(主分类 llm-infra)
  • /shared/research-kb/organized/paper_cards/700-2607-18082.md Rubric-based RL Self-Distillation / 8-4 02:10 新卡(主分类 llm-infra)
  • /shared/research-kb/organized/paper_cards/701-2607-29209.md SAF-OPD / 8-4 02:10 新卡(主分类 llm-infra · work-queue §1 Top 15 #1)
  • /shared/research-kb/organized/paper_cards/702-2607-29684.md 3D-Aware RGB-NIR Imaging / 8-4 02:10 新卡(multimodal 主 · work-queue §1 Top 15 #6 · v40 §2.39.116 建议新增)
  • /shared/research-kb/organized/paper_cards/703-2607-26991.md RL²-VLA / 8-4 02:10 新卡(multimodal 主 · work-queue §1 Top 15 #5 · v40 §2.39.117 建议新增)
  • /shared/research-kb/organized/paper_cards/704-2607-27888.md Counterfactual Sensitivity Credit Reallocation / 8-4 02:10 新卡(multimodal 主 · work-queue §1 Top 15 #4 · v40 §2.39.118 建议新增)
  • /shared/research-kb/organized/paper_cards/705-2607-26611.md Fewer Clarifications, Better Code / 8-4 02:10 新卡(主分类 evaluation · work-queue §1 Top 15 #3)
  • /shared/research-kb/organized/paper_cards/706-2607-27201.md Mental World Modeling / 8-4 02:10 新卡(主分类 agent · work-queue §1 Top 15 #2 + HF Daily 8-4 #3 53▲ · v40 §2.39.119 建议新增)
  • /shared/research-kb/inbox/tom/2026-08-04-0900-hf-daily-2026-08-04.md(8-4 票榜 15 件)
  • /shared/research-kb/inbox/tom/2026-08-04T0840-agent-rag-longcontext-radar.md(8-4 radar 8 件候选)
  • /shared/research-kb/inbox/tom/2026-08-04-rag-e1prep.md(8-4 rag-e1prep,HyPE + CrossRAG + EMBL AI Librarian + SAF-OPD 等)
  • /shared/research-kb/inbox/tom/2026-08-04_rag-lite.md(8-4 rag-lite 8 件)
  • /shared/research-kb/inbox/stephen/2026-08-04-0910-news-x-vip-radar.md(8-4 10 账号 X 雷达)
  • /shared/research-kb/inbox/jay/2026-08-04-llm-inference-csdn-highvalue.md(8-4 LLM 推理 csdn,vLLM + SFT + 企业级落地 + 框架选型,multimodal 0 件)

未触发 cron / 未 git / 未输出密钥 / 未复制原文段落 / 未写他人目录


13. 一句话接力提示

v39 落定后 08:40 ~ 09:40 实质 multimodal 增量 = paper_cards 8-4 02:10 / 03:00 17 张新卡中 6 件 multimodal 邻接立标候选(695 / 697 / 702 / 703 / 704 / 706),v40 仍需补 6 条新立候选:① arXiv:2607.29679 Scaling Properties of Text Conditioning in Visual Generation 建议立 §2.39.114 候补级 + §1 折 1 统一多模态生成子集"训练-推理 scaling 闭环";② arXiv:2607.29025 Evaluation-Verification Reward for Consistent Multi-Reference Image Editing 建议立 §2.39.115 候补级 + §1 折 1 多参考编辑 RL 化里程碑;③ arXiv:2607.29684 Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark 建议立 §2.39.116 候补级 + §1 折 1 多模态感知几何化锚 + work-queue §1 Top 15;④ arXiv:2607.26991 RL²-VLA Test-Time Scaling for VLA 建议立 §2.39.117 候补级 + §1 折 4 VLA / 垂直域子集"test-time steering"三联 + work-queue §1 Top 15;⑤ arXiv:2607.27888 Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning 建议立 §2.39.118 候补级 + §1 折 4 多模态 CoT / 推理范式 RLVR 信用分配锚 + work-queue §1 Top 15;⑥ arXiv:2607.27201 Mental World Modeling 建议立 §2.39.119 候补级 + §1 折 1.2 世界模型范式子集"心理化"邻接 + work-queue §1 Top 15 + HF Daily 8-4 #3 53▲ 双信号立标级。最尖锐矛盾是 v39 §2.39.113 SaLAD(arXiv:2601.04043)paper_card 仍未建 + v39 §2.39.93-§2.39.111 16 件候补级 paper_card 补建状态待逐件核对,v40 接力前必须 cron 卡建脚本补建