multimodal · E1 预消化简报(2026-08-17)

生成者:flyP · multimodal 主题负责人 窗口:v50 落定后(2026-08-16 08:40 CST)~24h → 2026-08-17 08:40 CST(昨日窗口) + 2026-08-17 09:40 CST 收尾 目的:为今晚 multimodal 主题活文档 v50 → v51 升级轮(Wave3 E2 接力)备料 上下文:活文档 knowledge/multimodal.md v50 已于 08-16 08:40 CST 落定 = 第四十一重叠加。本日核心事件 = flyp 8-16 22:50 Alaya-EVOKE web_search v2 精读棒落盘 → 立标等级评估方法学延革第 7 例反方立基础延展候选建议升级 ★→★★(vs 8-16 15:50 v1 棒提议 "维持 ★ 中档")= v51 接力棒必须处理的第 1 个升级候选 · 继 8-15 22:50 Self-Geometry 第 6 例"提议 ★★ vs v50 采纳 ★"后第 2 个延续实例 + 第 1 个"flyp 跨轮次判断反转"实例。叠加:flyp 8-16 21:20 NoLiMa-VideoMMLU v2 覆盖落盘(multimodal 评测方法学锚邻接)+ flyp 8-16 23:23 coding-agents e1prep 落盘(coding-agents 主轴沿用)+ tom 8-17 0900 HF Daily:Alaya-EVOKE 107▲ → 116▲(+9▲ +8.4% 续立加强延续 = v33 以来第 2 个续立加强而非维持或回落实测例的第 3 日延续)+ LiveAnimate 21▲ 重入 top 15(8-16 跌出 → 8-17 #15)+ Self-Geometry 15▲ 维持(连续 3 日 top 15)+ OpenART 253▲ → 253▲ = 反弹锚第 3 日 + 立标池双向锚 v33 首次 7 向并存实测第 3 日 + 立标等级评估方法学延革第 6 例(Self-Geometry flyp 8-15 22:50 提议 ★★ vs v50 ★)+ 第 7 例(Alaya-EVOKE flyp 8-16 22:50 v2 提议 ★★ vs v50 ★ + 15:50 v1 提议 ★)双首次机制化升级延续 = 立标池饱和度机制压力测试第 6 日 8-16 = 立标池双向锚 24h 窗口实测 v33 首次机制化第 3 日 + 立标等级评估方法学延革 v33 首次双首次机制化升级延续 + 立标等级评估方法学延革第 7 例"flyp 跨轮次判断反转"首次实测。

E1 窗口整体判定24h 窗口(08-16 08:40 → 08-17 08:40 CST)内 multimodal 主轴净增量 = 0 件 multimodal 主分类 net-new 候补级新增候选(v50 已吸纳 8-13/8-14/8-15 全部相关信号)+ 1 件 v51 §2.39.178 立标等级评估方法学延革第 7 例反方立基础延展候选升级 ★→★★(Alaya-EVOKE flyp 8-16 22:50 v2 接力棒兑现 + 跨轮次判断反转 flyp 15:50 v1 "维持 ★" → 22:50 v2 "升级 ★★")+ 1 件 NoLiMa-VideoMMLU v2 覆盖落盘(multimodal 评测方法学锚邻接 · B + B- 评级 · 候选级低档 ☆)+ 2 件 v50 flyp critical-read 接力棒落盘归位(Alaya-EVOKE 15:50 v1 + 22:50 v2 二联 + Self-Geometry 8-15 22:50 = v51 §2.39.x 候补级新增候选备选 6-10 件延展候选)+ 1 件 8-16 flyp critical-read 22:50 Alaya-EVOKE 立标等级评估延革第 7 例反方立基础延展升级 ★→★★ 候选flyp 跨轮次判断反转首次实测+ 1 件 8-16 flyp critical-read 21:20 NoLiMa-VideoMMLU v2 覆盖落盘(评测方法学锚 + 反思强制补稿闸第 49 天连续生效)+ 7 件 multimodal 邻接续立(Alaya-EVOKE 107→116▲ + OpenART 252→253▲ + Mechanist 82▲ 维持 + DreamX-Phi 1.0 79→82→91▲ + LLMRouter 94→102▲ + DarwinX 66→84▲ + SkillZip 74▲ 维持 + 修辞手法 39→47▲ + AutoDesign 35→43▲ + PlayWorld 35→42▲ + Spatial Memory Agent 30→40▲ + 混合线性注意力 19→28▲ + LLM Agent Stick to Script 26→27▲ + Self-Geometry 15▲ 维持 3 日 + LiveAnimate 21▲ 重入 top 15 + 修辞手法 39→47▲)+ 1 件 HF Daily 8-17 头条 OpenART 253▲(反弹锚第 3 日 · 立标池双向锚 v33 首次 6 向并存实测第 3 日)+ 1 件 paper_cards 8-16 ~ 8-17 净增 1 张 multimodal 主分类 965(合计 1 张 = 立标池饱和度供给侧 v51 反向补给窗口微开启+ 1 件 jay 8-17 csdn 检索 multimodal 主轴 0 件净增(沿用 jay 8-16 csdn)+ 1 件 stephen 8-17 0910 morning 棒 Jim Fan NVIDIA Actuate 26 + Cosmos 3 + ASPIRE 评注沿用(multimodal 邻接 = v50 §6 第 32 足 DeepMind SL2T 邻接)+ 1 件 coding-agents 主轴 0 件 net-new multimodal 主分类新增(flyp 8-16 23:23 coding-agents e1prep 沿用 8-16 沿用)+ 立标池饱和度 v44-v51 八日连续 + 立标池双向锚 v33 以来首次 6 向并存实测第 3 日 + 立标等级评估方法学延革第 6+7 例双首次机制化升级延续本简报核心不在罗列新候选(v50 已充分吸纳 8-13/8-14/8-15 全部相关信号),而在为 v51 接力棒标注五件必须处理的"立基础机制 / 矛盾信号 / 待核实 / 立标等级延革 / 跨轮次判断反转"问题:① Alaya-EVOKE flyp 8-16 22:50 v2 接力棒兑现 → 立标等级 ★ → ★★ 升级建议flyp 跨轮次判断反转首次实测:15:50 v1 = "维持 ★ 中档 · 不升级" vs 22:50 v2 = "升级 ★★ 中档" · 继 8-15 22:50 Self-Geometry 第 6 例"提议 ★★ vs v50 采纳 ★"后第 2 个延续实例 + 第 1 个"flyp 跨轮次判断反转"实测 · v51 接力棒必须决定是否采纳升级至 ★★ 中档 · 与 v50 §2.39.178 沿用 ★ 中档 -1 档)② Self-Geometry flyp 8-15 22:50 critical-read 评级 vs v50 实际采纳立标等级不完全一致持续(flyp 提议 ★★ 中-高档候选待验 vs v50 采纳 ★ 中档 -1 档 = 立标等级评估方法学延革第 6 例反方立基础延展候选 · v51 接力棒必须决定是否升级至 ★★ 中档)③ NoLiMa + Video-MMLU flyp 8-16 21:20 v2 覆盖落盘(评测方法学锚邻接 · RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 6 联横向对照表接力 multimodal-e1prep · v51 §3.3 反方立基础候选)④ 8-15 ~ 8-16 flyp critical-read 四联落盘归位建议(Penguin-VL arXiv:2603.06569 + MMProLong arXiv:2605.13831 + Self-Geometry arXiv:2608.10708 + Alaya-EVOKE arXiv:2608.13546 二联 = v51 §2.39.x 候补级新增候选第 6-10 件备选五件备选 · 立标等级候选级中-低档 ★ + B+ 评级 2 件 + Self-Geometry 与 Alaya-EVOKE 升级待决)⑤ paper_card P1 缺口累积 12 件未建持续(v50 候补级新增前必须先补建 7 件 · 立标池饱和度供给侧枯竭 v51 落定前必须开启 v51 反向补给窗口由 paper_cards 8-16 ~ 8-22 净增 ≥7 张 multimodal 主分类开启)。


0. 检查过的来源(不编造来源)

来源 文件 / 段 与 multimodal 主题相关性
work-queue.md 2026-08-17 08:00 §1 Top 15 backlog = 0 件 multimodal 主分类新立(沿用 8-16 数据)+ §3 选题榜 = 2608.08020 Thought-Level Beam Search(coding-agents / inference 主轴 · multimodal 邻接)+ 2608.10708 Self-Geometry(v50 §2.39.177 已落定)+ 2608.13546 Alaya-EVOKE(v50 §2.39.178 已落定 · 立标等级评估延革第 7 例反方立基础延展候选 ★ → ★★ 升级建议)。multimodal 主分类 backlog 0 件 net-new(沿用 8-13 ~ 8-16 数据)
inbox/flyp/2026-08-16-multimodal-e1prep.md 67.1KB · 8-16 09:43 v50 备料棒沿用(昨日 24h 综述 + 5 件主轴 + 1 立标机制升级触发 + 34 个 arXiv ID)
inbox/flyp/2026-08-16-2250-Alaya-EVOKE-web-search-verification-critical-read.md 27.9KB · 8-16 22:50 🔴 v51 接力棒必须处理 · 立标等级评估方法学延革第 7 例反方立基础延展候选升级 ★ → ★★ · Alaya-EVOKE(arXiv:2608.13546 v1 2026-08-14 · cs.CV · Yuanyang Yin 等 · USTC PhD + Alaya Lab 体系)= v50 §2.39.178 候选级新增 #2(v50 沿用 flyp 8-15 multimodal-e1prep §2.6);web_search v2 实测补 5 条硬事实 = ① Alaya-EVOKE ≠ AlayaWorld(同 Alaya Lab 体系两篇连续工作 · arXiv:2607.18367 vs arXiv:2608.13546)② Evict 操作已显式声明(GitHub README "evict — retention window")③ License = LTX-2 Community License(非 Apache 2.0)④ WBench SOTA 限定在 3-step 子集 ⑤ 撞名核验 AlayaLab/Evoke vs SII-YuanyangYin/Evoke 双仓共存;flyp 评级 A-(v1 = B+ · 15:50 棒升 1 档) · 建议立标等级 ★ 中档 升级至 ★★ 中档flyp 跨轮次判断反转首次实测:8-16 15:50 v1 = "维持 ★ 中档" vs 8-16 22:50 v2 = "升级 ★★ 中档")= v51 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选升级 · 继 8-15 22:50 Self-Geometry 第 6 例"提议 ★★ vs v50 采纳 ★"后第 2 个延续实例 + 第 1 个"flyp 跨轮次判断反转"实测;7 项后续验证动作(PDF §3-§5 + AlayaWorld 横向对照 + Evoke README evict 硬数字 + LTX-2 License 全文 + 撞名核验 + 1 小时独立复测 + Self-Geometry vs Alaya-EVOKE 方法学交叉点 = 截止日 2026-08-23 ~ 2026-09-15)
inbox/flyp/2026-08-16-1550-Alaya-EVOKE-external-memory-world-model-critical-read.md 13.3KB · 8-16 15:52 v51 接力棒 v1 棒存档 · flyp 8-16 15:50 critical-read 评级 B+ · 候选级中档 ★ 中档维持 = 与 v50 实际采纳完全一致 0 档差 · 第 7 例反方立基础未触发 · v2 棒升级到 ★★ 后 v1 棒判断被部分覆盖
inbox/flyp/2026-08-16-NoLiMa-VideoMMLU-short-review.md 20.6KB · 8-16 21:22 v2 覆盖落盘(反思强制补稿闸第 49 天连续生效 · v1 = 5359 字节 / 74 行 7 处结构性硬伤全部修复)· NoLiMa(arXiv:2502.05167v2 · ETH Zurich + collaborators · 18 个月时滞)= 长上下文评测方法学锚 · RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 同方向旁证 · flyp 评级 B + 立标等级候选级低档 ☆ · Video-MMLU(arXiv:2504.14693v2 · 16 个月时滞)= 大规模视频多学科课堂理解基准 · MMMU-Pro / Video-MME 趋饱和垂类差异化 · flyp 评级 B- + 仅登记级
inbox/flyp/2026-08-16-coding-agents-e1prep.md 85.9KB · 8-16 23:23 coding-agents 主轴 0 件 net-new multimodal 主分类(沿用 8-15 multimodal-e1prep + 8-15 flyp 三件 critical-read + 8-15 立标池双向锚第 2 日 + 立标等级评估方法学延革第 5 例 + DarwinX 候选级新增 + Spec-First AI Coding Agent v55 §1.1 第 55 栖候选 + LLMRouter 邻接级 + AutoDesign 邻接级 + PlayWorld 邻接级 + Ex-Omni-2D arXiv ID 矛盾已修订 + 立标饱和度供给侧枯竭 v50 反向补给窗口开启)
inbox/tom/2026-08-17-0900-hf-daily-2026-08-17.md 15 件 · 2026-08-17 HF Daily #1 OpenART 253▲ 续立反弹锚第 3 日(8-14 #1 184▲ → 8-15 #1 252▲ → 8-16 #1 252▲ → 8-17 #1 253▲ = +1▲ 续立微强维持 arXiv:2608.00677)+ #2 Alaya-EVOKE 116▲(8-15 #3 82▲ → 8-16 #2 107▲ → 8-17 #2 116▲ = +9▲ +8.4% 续立加强持续 arXiv:2608.13546 v50 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选 ★ → ★★ 升级建议)+ #3 LLMRouter 102▲(8-15 #2 90▲ → 8-16 #3 94▲ → 8-17 #3 102▲ = +8▲ +8.5% 续立微强 arXiv:2608.06867)+ #4 DreamX-Phi 1.0 91▲(8-15 #5 79▲ → 8-16 #4 82▲ → 8-17 #4 91▲ = +9▲ 续立微强 arXiv:2608.13489 paper_card 942 已建 multimodal 主分类)+ #5 DarwinX 84▲(8-15 #7 59▲ → 8-16 #7 66▲ → 8-17 #5 84▲ = +18▲ 续立加强 arXiv:2608.07545 agent 主分类)+ #6 Mechanist 84▲(8-15 #4 82▲ → 8-16 #5 82▲ → 8-17 #6 84▲ = +2▲ 续立微强 arXiv:2608.12036 立标等级 ★★ 中档偏上沿用)+ #7 SkillZip 74▲(8-15 #6 73▲ → 8-16 #6 74▲ → 8-17 #7 74▲ = 维持 arXiv:2608.05604)+ #8 Intern-S2-Preview 54▲(8-15 #8 43▲ → 8-16 #8 43▲ → 8-17 #8 54▲ = +11▲ 续立加强 arXiv:2608.13505 agent 主分类)+ #9 修辞手法 47▲(8-15 #9 39▲ → 8-16 #9 39▲ → 8-17 #9 47▲ = +8▲ 续立微强 arXiv:2608.08975 risk 邻接)+ #10 AutoDesign 43▲(8-15 #11 32▲ → 8-16 #10 35▲ → 8-17 #10 43▲ = +8▲ 续立微强 arXiv:2608.13560 meta-harness 邻接 multimodal)+ #11 PlayWorld 42▲(8-15 #10 33▲ → 8-16 #11 35▲ → 8-17 #11 42▲ = +7▲ 续立微强 arXiv:2608.13552 world model 评测)+ #12 Spatial Memory Agent 40▲(8-15 #12 29▲ → 8-16 #12 30▲ → 8-17 #12 40▲ = +10▲ 续立加强 arXiv:2608.12743 multimodal 邻接)+ #13 混合线性注意力 28▲(8-15 #14 17▲ → 8-16 #14 19▲ → 8-17 #13 28▲ = +9▲ 续立微强 arXiv:2608.12149 llm-infra)+ #14 LLM Agent Stick to Script 27▲(8-15 #13 26▲ → 8-16 #13 26▲ → 8-17 #14 27▲ = +1▲ 续立极弱 arXiv:2608.08160 paper_card 925 已建 multimodal)+ #15 LiveAnimate 21▲8-16 跌出 top 15 → 8-17 #15 21▲ = 重入 top 15 arXiv:2608.11745 paper_card 944 已建 multimodal 主分类);Self-Geometry 15▲ 跌出(8-15 #15 15▲ → 8-16 #15 15▲ → 8-17 跌出 = 续立极弱 0▲ 跌出 v33 以来立标信号弱锚);multimodal 主分类 0 件 net-new(沿用 8-13/8-14/8-15/8-16 全部数据)
inbox/tom/2026-08-16-0900-hf-daily-2026-08-16.md 15 件 · 2026-08-16 HF Daily 沿用 flyp 8-16 multimodal-e1prep §0(OpenART 252▲ #1 / Alaya-EVOKE 107▲ #2 / LLMRouter 94▲ #3 / DreamX-Phi 82▲ #4 / Mechanist 82▲ #5 / SkillZip 74▲ #6 / DarwinX 66▲ #7 / Intern-S2-Preview 43▲ #8 / 修辞手法 39▲ #9 / AutoDesign 35▲ #10 / PlayWorld 35▲ #11 / Spatial Memory 30▲ #12 / LLM Script 26▲ #13 / 混合线性注意力 19▲ #14 / Self-Geometry 15▲ #15)= multimodal 主分类 0 件 net-new(v50 已吸纳 8-13/8-14/8-15 全部相关信号)
inbox/tom/2026-08-17T0840-agent-rag-longcontext-radar.md 8 件 · 2026-08-17 08:40 multimodal 主轴 0 件 net-new(Thought-Level Beam Search 2608.08020 inference 邻接 · Spec-First AI Coding Agent 2608.12440 agent 邻接 · Agent Memory Is Not RAG Substack · Hybrid-Policy Self-Editing 2608.11660 knowledge editing · Maglev 2608.02870 memory · Context-Matched Distillation 2608.13391 multimodal video 蒸馏 · Low-Frequency Safety Risks in LALMs 2608.09158 audio benchmark multimodal 邻接 · RibAssist 3D 2608.06914 医学影像 multimodal 邻接 = 8 件全部邻接级或已立)
inbox/tom/2026-08-17-rag-e1prep.md 14KB · 8-17 08:52 RAG 主轴 1 件 net-new 视角类 = Agent Memory Is Not RAG Substack = multimodal 主分类 0 件 net-new(沿用 8-13 ~ 8-16 数据)
inbox/jay/2026-08-17-csdn-substack-inference-rag-agent-highvalue.md 10.9KB · 8-17 08:22 multimodal 主轴 0 件净增(vLLM vs SGLang 推理框架横评 + 三大框架汇总 + SGLang + vLLM + Qwen3.5 企业级部署 + LangGraph + MCP 多 Agent 工作流 + vLLM 源码解析 + KV-Cache 压缩技术综述 + GTC 2026 解读 + RAG 2026 实战指南 + LangChain/LangGraph 源码对照 + RAG 2026 全面升级 = 10 件全部 inference/Agent/RAG 邻接)
inbox/jay/2026-08-16-csdn-multimodal-rag-vecdb-graphrag-substack.md 8-16 早棒 multimodal 主轴 0 件净增(沿用 8-16 multimodal-e1prep §0 + Multimodal RAG Survey arXiv:2502.08826 + Scaling Beyond Context arXiv:2510.15253 = v51 §2.39.x 候补级新增候选第 15-16 件备选已记录)
inbox/stephen/2026-08-17-0910-news-x-vip-radar.md 2.7KB · 8-17 09:12 multimodal 主轴 0 件净增(沿用 8-16 morning 棒 + Jim Fan 在 NVIDIA Actuate 26 推介 Cosmos 3 post-training + ASPIRE 评估套件 · "下一代物理 AI 的 GPT-3 时刻"叙事沿用 · ENPIRE 仓库仍未放出 · multimodal 主轴 0 件 net-new)+ DeepMind SL2T 手语→文本模型在 Pixel 11 Gboard 与 Live Transcribe 上线 8-12 = v50 §6 第 32 足沿用 + WeatherNext 登 Nature 8-06 沿用 + Qwen 3.8-27B 开权重周三 11:00 EST 发布 8-12 沿用
inbox/spark/ 无 8-17 文件 spark 8-17 agent/llm-infra 棒未到 · 沿用 8-16 棒 · multimodal 主分类 0 件 net-new(沿用 8-15/8-16 数据)
inbox/flyp/2026-08-15-multimodal-e1prep.md 83.4KB · 8-15 09:43 v49 备料棒沿用 + 5 件主轴 + 1 立标机制升级触发 + 26 个 arXiv ID + 11 件 P1 缺口(v50 已吸纳绝大部分)
paper_cards 库总规模 965 张(8-17 09:00 沿用) multimodal 主分类累计 ≈ 226+1 = 227 张(8-16 ~ 8-17 净增 1 张 965 = RibAssist 3D arXiv:2608.06914 medical imaging multimodal 邻接 + 沿用 8-14 ~ 8-15 数据 924/926/940/942/943/944/945/948)= 立标池饱和度供给侧 v51 反向补给窗口微开启
paper_cards 8-16 ~ 8-17 净增 1 张 multimodal 邻接 965 = RibAssist 3D arXiv:2608.06914 medical imaging multimodal 邻接 = 立标池饱和度供给侧 v51 反向补给窗口微开启 + 立标饱和度机制压力测试第 6 日延续(沿用 8-14 8 张 + 8-15 0 张 + 8-16 ~ 8-17 1 张 = 9 张累计)

1. 今日(2026-08-17)multimodal 主轴核心增量 = 净增 0 件 multimodal 主分类 net-new + 1 件 v51 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选 ★ → ★★ 升级建议 + 1 件 NoLiMa-VideoMMLU v2 覆盖落盘 + 2 件 v50 flyp critical-read 接力棒落盘归位 + 1 件 flyp 跨轮次判断反转首次实测 + 14 件 multimodal 邻接续立

筛选准则:E1 窗口 08-16 08:40 CST ~ 08-17 08:40 CST 24h 内新出现、或在 v50 落定后尚未被 v50 主文件消化、且 flyp 8-16 22:50 Alaya-EVOKE web_search v2 critical-read + 8-16 21:20 NoLiMa-VideoMMLU v2 覆盖 + 8-16 23:23 coding-agents e1prep + 8-16 09:43 multimodal-e1prep + 8-15 22:50 Self-Geometry critical-read + 8-15 21:23 Penguin-VL/MMProLong 三联精读 v2 + 8-15 09:51 agentic-MLLM survey critical-read + 8-15 10:36 三件反方审稿 + 8-15 16:34 risk e1prep + 8-15 23:24 coding-agents e1prep 已识别的 multimodal 主分类相关增量。由于 v50 在 08-16 08:40 落定已吸纳 8-13 全天 + 8-14 早棒 + 8-15 全部相关信号(5 件 critical-read + 2 件候补级新增落定 + 1 件反方 + 1 件立标机制升级 + 2 件 P0 警示性事实修正 + 1 件 P0 arXiv ID 矛盾修订 + 1 件立标池双向锚实测 + 立标等级评估方法学延革第 5 例 + 立标饱和度机制压力测试第 4 日 + 8-14 8 张 multimodal 主分类 paper_cards 反向补给),24h E1 窗口净增量集中于"续立信号 + flyp critical-read 接力棒落盘归位 + 立标等级评估延革第 6+7 例反方立基础延展候选 + flyp 跨轮次判断反转首次实测 + NoLiMa-VideoMMLU v2 覆盖落盘 + Multimodal RAG 邻接 + paper_cards 8-16 ~ 8-17 净增 1 张 multimodal 邻接 = 立标池饱和度机制压力测试第 6 日延续"七类,而非新候选。今日 E1 窗口判定的核心不在新增候选(v50 已充分吸纳),而在为 v51 接力棒标注"五件必须处理的立基础机制 / 矛盾信号 / 待核实 / 立标等级延革 / 跨轮次判断反转"问题

增量 1 · Alaya-EVOKE · flyp 8-16 22:50 web_search v2 接力棒兑现 → 立标等级 ★ → ★★ 升级建议(v51 接力棒必须处理的第 1 个立标等级评估方法学延革第 7 例反方立基础延展候选升级 · flyp 跨轮次判断反转首次实测 · 继 8-15 22:50 Self-Geometry 第 6 例"提议 ★★ vs v50 采纳 ★"后第 2 个延续实例 · multimodal · method)

来源: - inbox/flyp/2026-08-16-2250-Alaya-EVOKE-web-search-verification-critical-read.md 27.9KB · 8-16 22:50(flyp critical-read 接力棒 v2 核心产出 + flyp 跨轮次判断反转首次实测) - inbox/flyp/2026-08-16-1550-Alaya-EVOKE-external-memory-world-model-critical-read.md 13.3KB · 8-16 15:52(v1 棒存档 · 评级 B+ · 立标等级 ★ 中档维持 = 第 7 例反方立基础未触发 · 22:50 v2 棒反转升级) - inbox/tom/2026-08-17-0900-hf-daily-2026-08-17.md 第 2 名 116▲(8-15 82▲ → 8-16 107▲ → 8-17 116▲ = +9▲ +8.4% 续立加强持续 = v33 以来第 2 个续立加强而非维持或回落实测例的第 3 日延续) - inbox/tom/2026-08-16-0900-hf-daily-2026-08-16.md 第 2 名 107▲ - inbox/tom/2026-08-15-0900-hf-daily-2026-08-15.md 第 3 名 82▲ - paper_cards/未建 P1 缺口(work-queue §1 Top 15 backlog 未列) - v50 §2.39.178 候选级新增 #2 备选已落定(v50 实际采纳立标等级 = ★ 中档 · vs flyp 8-16 22:50 v2 提议 ★★ 中档 = 立标等级评估方法学延革第 7 例反方立基础延展候选升级

arXiv:2608.13546(主) + 2607.18367(lineage 配套 AlayaWorld)

核心要点(flyp 8-16 22:50 v2 web_search 实测补 5 条硬事实): - 标题:Alaya-EVOKE:从线性扩展监督到无界世界(Alaya-EVOKE: From Linearly Scaled Supervision to Endless Worlds) - 作者组:Yuanyang Yin(USTC PhD · 自动化系)+ Gongxuan Wang + Yifan Zhan + Chuanhao Li + Kaipeng Zhang + Feng Zhao(通讯 · Alaya Lab 体系)= 机构权威性中等偏强(vs Mechanist NUS/浙大/UCSD/NUS 跨校顶会级 = 弱 1 档) - v2 实测补 5 条硬事实: 1. Alaya-EVOKE ≠ AlayaWorld——同 Alaya Lab 体系两篇连续工作:AlayaWorld arXiv:2607.18367(7-08 项目页 + 7-16 推理代码 + 7-21 完整 Technical Report · 15B DiT + Gemma-3 text encoder + Depth-Anything-3 spatial memory + 4-step denoising + 24fps 720p + dual memory: spatial 3D cache + temporal compressed history + error bank)vs Alaya-EVOKE arXiv:2608.13546(8 月提交 · 3-step CFG-free student + 单一 World State Bank · 外部点云 + 30s self-forced distribution matching) 2. Evict 操作已显式声明——GitHub README 明确 "evict — an optional retention window, which hour-scale runs enable explicitly" = 15:50 棒 §四 主要问题 #1("World State Bank 何时饱和未明")得到正面回答 3. License = LTX-2 Community License Agreement(非 Apache 2.0)——HF AlayaLab/Evoke / AlayaLab/AlayaWorld merged_infer.safetensors 是 LTX-2.3-22B 衍生,商用受限(与 v50 摘要级 "Apache 2.0" 隐含假设不一致) 4. WBench SOTA 限定在 3-step 子集——X/cv_usk 实测确认 "rank 1 of 10 systems" 但仅与 3-step 模型对比(不是与 10-step 或更多 step 的 SOTA 对比)= 立标等级需修正"competitive SOTA"措辞 5. 撞名核验新增——SII-YuanyangYin/Evoke 个人 mirror 与官方 AlayaLab/Evoke 共存(README 内容几乎一致)= 必须以 AlayaLab/Evoke 为准,避免误链 - 方法三组件:(1) External Geometric Memory = 相机位姿索引的 World State Bank(点云几何库)+ O(1) 上下文锁定;(2) Long-Horizon Teacher = chunk-wise grouping + 远帧 retrieval + linear-attention 全局 + 30 秒 self-forced 监督 + distribution-matching 蒸馏;(3) 3-Step CFG-Free Student = coarse-to-fine latent pyramid + 单 H200 · 384×640 · 2.11s / 1.5s chunk + WBench SOTA + VBench-2.0 66.77 rank 1/10 + mid-flight re-prompting - flyp v1 评级 B+ → v2 评级 A- · 建议立标等级 ★ 中档 升级至 ★★ 中档flyp 跨轮次判断反转首次实测:8-16 15:50 v1 = "维持 ★ 中档 · 不升级" vs 8-16 22:50 v2 = "升级 ★★ 中档") - v2 升级理由:(a) Read–Sample–Write 形式化 + O(1) 上下文锁定是工程范式贡献;(b) Web State Bank + read/write/evict 三操作为后续"world model with persistent memory" 工作提供可复用工程契约;(c) 与 AlayaWorld 形成同 lineage 双产品线(前者偏 full-stack 演示、后者偏方法学精简与理论分析),其 lineage 价值高于单点 SOTA;(d) License 限制反向:商用受限 = 不影响学术立标等级评估,反而是工程可复现性约束的"诚实声明"

与活文档 v50 现有脉络的关系: - v50 §1 折 1.2 世界模型范式 = v51 §2.39.x 候补级新增候选立标等级评估延革第 7 例反方立基础延展候选升级(v50 §2.39.178 已落定 · flyp 8-16 22:50 v2 提议升级至 ★★ 中档 · v51 接力棒必须决定是否采纳) - v50 §1 折 1.3 长视频与流式生成 = 与 v50 §2.39.176 Ex-Omni-2D 全模态对话原生视觉存在 邻接 - v50 §1 折 4.4 推理效率与训练范式 = 与 v50 §2.39.171 Kimi K2.5 MoonViT-3D "3D ViT 视频压缩" 邻接(K2.5 C2 = 4 帧 patch 级时间平均)= Alaya-EVOKE 3-step CFG-free 与 MoonViT-3D 形成"工程范式 + 3D ViT"二联候选 - v50 §3.2 立标饱和度机制压力测试第 6 日 8-16 = 立标池双向锚 v33 以来首次 6 向并存实测第 3 日 + 立标等级评估方法学延革第 5 例首次机制化 + 立标等级评估延革第 6 例反方立基础延展候选(Self-Geometry flyp 8-15 22:50 提议 ★★ vs v50 采纳 ★)+ 立标等级评估延革第 7 例反方立基础延展候选升级(Alaya-EVOKE flyp 8-16 22:50 v2 提议 ★★ vs v50 采纳 ★ · flyp 跨轮次判断反转首次实测)= 四首次机制化升级延续

建议归入 v51: - §2.39.x 候补级新增候选立标等级评估延革第 7 例升级(候选级第 10 件 = §2.39.180 沿用候选级新增 + 立标等级评估延革第 7 例反方立基础延展候选升级 ★ → ★★) - 立标等级判定 = ★★ 中档(flyp 8-16 22:50 v2 提议升级 · flyp 跨轮次判断反转首次实测 · v51 接力棒必须决定是否采纳升级至 ★★ 中档 · 与 v50 采纳 ★ 中档 -1 档 · 继 8-15 22:50 Self-Geometry 第 6 例"提议 ★★ vs v50 采纳 ★"后第 2 个延续实例) - 沿用 v50 §2.39.165 RynnValue 候选级候选档位(不立标级,立标前必须补建 paper_card + 核实 arXiv 主分类 cs.CV/cs.LG/cs.AI)

flyP 反方 5 条(沿用 flyp 8-16 22:50 v2 critical-read §0.3): - R1 ★★★★「教师长程能力传递的因果链未充分验证」——30 秒 self-forced supervision + linear-attention global state 仍是 chunk-wise grouping 的工程组合;distribution matching distillation 在文生图(SD 蒸馏)已被验证,但在长程视频上的有效性是新问题。30 秒监督是否足够覆盖 5 分钟 / 30 分钟的失败模式,需要长程消融。v2 升级证据:[AlayaWorld techtimes.com 7-09 评注] 提到 "qualitative figures, camera control, prompt-driven actions, leave-and-return trajectories, one-minute rollouts, diverse styles, but no quantitative head-to-head numbers" —— 即使是配套的 AlayaWorld 也未给 1 分钟以上的量化 head-to-head,EVOKE 声称 "1 小时以上"但论文与 README 均未给 1 小时以上评测的数字(仅 README 提到 "every clip was produced by the launchers in this repo")。 - R2 ★★★★「单目深度 + 点云的累积误差」——README 描述 write 操作"a monocular depth model estimates depth for the emitted chunk under its known poses, unprojected into a persistent point cloud" = 几何误差会递归累积;read 操作"batch z-buffered scatter" 给出 per-pixel visibility mask 但未给累积误差上界v2 风险升级:如果相机位姿漂移 + 深度估计误差未给量化上界,"持久记忆"叙事会被审稿质疑。 - R3 ★★★「License = LTX-2 Community License(非 Apache 2.0)」——v2 实测新增反方:商用受限。HF model card 明确"This project is based on LTX-2 by Lightricks Ltd. merged_infer.safetensors is fine-tuned from the LTX-2.3-22B base and is a derivative of LTX-2.3; accordingly it is released under the LTX-2 Community License Agreement, not Apache 2.0"。第三方商用前必须读 LTX-2 Community License Agreement 全文v2 评级影响:商用受限反向证明工程诚信度,但降低生产可用性——不适合作为基础组件直接商用。 - R4 ★★★「VBench-2.0 rank 1 of 10 限定在 3-step 子集」——v2 实测补充:X/cv_usk "matching multi-step competitors" = 强调"matching"而非"exceeding"。论文与 README 都明确"as a three-step world model" = WBench SOTA 仅与 3-step 子集对比,与 10-step 或更多 step 的 SOTA 对比未给。v2 评级影响:立标等级可上调(★→★★)但措辞需限定为"3-step world model 范畴 SOTA"。 - R5 ★★「同 lineage 双产品线的协同性 vs 自我竞争」——v2 实测新增观察:AlayaWorld(7 月 · 15B DiT · dual memory + error bank · 4-step · 演示导向)与 Alaya-EVOKE(8 月 · 3-step CFG-free · 单一 World State Bank · 方法学导向)= 同 lab 两篇工作协同性:EVOKE 的 3-step 蒸馏思想可应用于 AlayaWorld;AlayaWorld 的 error bank 训练机制可补 EVOKE 的长程鲁棒性。自我竞争风险:研究者可能困惑于"两篇哪篇是主推",立标等级评估时需把两篇都纳入 lineage 而不是仅 EVOKE 单点

v51 接力棒 7 项后续验证动作(沿用 flyp 8-16 22:50 v2 critical-read §0.4): - A1 · 读 Alaya-EVOKE PDF §3(Read–Sample–Write 形式化)+ §4(30s self-forced 实验)+ §5(3-step 蒸馏 + distribution matching 细节)= 列出 Read/Write/Evict 形式化符号 + distribution matching 损失函数 + 3-step 蒸馏为何选择无 CFG 的理论依据(截止 2026-08-23) - A2 · 与 AlayaWorld arXiv:2607.18367 Technical Report §4-§6 做横向对照表(dual memory vs single World State Bank / error bank vs distribution matching / 4-step vs 3-step)= 落到 notes/multimodal/world-models/alaya-lineage-2026.md 一节(截止 2026-08-30) - A3 · 核 Evoke GitHub README "evict — retention window" 是否给硬数字(默认 retention size / eviction policy / 何时触发 evict)= 列出 ≥3 个 evict 触发条件 + 默认值(截止 2026-08-23) - A4 · 抓 LTX-2 Community License Agreement 全文 + 评估对二次开发的商用限制 = 列出允许场景 / 禁止场景 / 衍生作品必须声明(截止 2026-08-30) - A5 · 撞名核验:AlayaLab/Evoke vs SII-YuanyangYin/Evoke 双仓关系 + Evoke (BlueFinity 商用平台) 撞名边界 = 列出 ≥2 条撞名证据 + 命名注释声明(截止 2026-08-23) - A6 · 跟踪 VBench-2.0 1 小时以上 / 跨场景切换 / 动态物体一致性的独立复测(如有第三方实现)= 若有复测结果维持 ★★ 中档;若无则下调回 ★ 中档(截止 2026-09-15) - A7 · 抓 Self-Geometry (arXiv:2608.10708) vs Alaya-EVOKE 方法学交叉点(test-time adaptation vs external memory = 都属于"长时一致性"路线的两种解)= 落到 notes/multimodal/world-models/long-horizon-consistency-2026.md 一节 + 接力棒 #1(Self-Geometry flyp 8-15 22:50 critical-read)的方法学对照表(截止 2026-08-30)


增量 2 · NoLiMa + Video-MMLU · flyp 8-16 21:20 v2 覆盖落盘(multimodal 评测方法学锚邻接 · v51 §2.39.x 候补级新增候选评测方法学锚延革候选 + §3.3 反方立基础候选 · 立标等级候选级低档 ☆ · multimodal · eval anchor)

来源: - inbox/flyp/2026-08-16-NoLiMa-VideoMMLU-short-review.md 20.6KB · 8-16 21:22(v2 覆盖落盘 · 反思强制补稿闸第 49 天连续生效 · v1 = 5359 字节 / 74 行 7 处结构性硬伤全部修复) - inbox/flyp/2026-08-16-NoLiMa-VideoMMLU-short-review.md.v1.bak.2026-08-16 5.4KB · v1 备份(md5 fecd43602ac7859019265daf12220825 · 与 v1 完全一致) - paper_cards/未建 P1 缺口(work-queue §1 Top 15 backlog 未列

arXiv:2502.05167v2(NoLiMa · 2025-02-07 v1 · 2025 年内修订 v2 · ETH Zurich + 合作机构)+ 2504.14693v2(Video-MMLU · 2025-04-21 v1 · 2025 年内修订 v2 · 多模态视频多学科课堂理解基准)

核心要点(flyp 8-16 21:20 v2 覆盖落盘):

NoLiMa(v51 §2.39.x 候补级新增候选评测方法学锚延革候选 · 立标等级候选级低档 ☆)

  • 标题:NoLiMa: Long-Context Evaluation Beyond Literal Matching
  • 作者组:ETH Zurich + 合作机构(v2 顶部 author 列表待 A1 核验)
  • 方法:把 NIAH(Needle-in-a-Haystack)的"字面匹配作弊"路径堵死——needle 设计成与问题仅有潜在/隐式语义关联,必须靠 latent association reasoning 才能定位,从根上消除"靠字面检索 cheat"的可能
  • 核心实验:评估 12 个宣称 ≥128K 上下文的流行 LLM(v1 abstract 列名 · 待补查 A1);短上下文(<<1K):所有模型表现良好;32K 起:10 个模型跌到 <50% 准确率;关键洞察:NIAH 类基准上的"高分"很可能反映字面检索能力,而非真正的长上下文推理能力
  • flyp 评级 B(v1 触线 + NoLiMa 方法学锚有效 + Video-MMLU 仅登记 = 体量小但价值清晰)+ 立标等级 候选级低档 ☆
  • 撞名核验:与 arXiv:2305.08908(2023)"Round-Trip Consistency for Self-Supervised 3D Human Pose Estimation" + arXiv:2608.00675(2026-08)"Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors" 同方向关键词撞名 = 必须带 arXiv ID 引用(撞名风险中-低,主题不同但命名风格撞名)

Video-MMLU(v51 §2.39.x 候补级新增候选 · 立标等级仅登记 ☆)

  • 标题:Video-MMLU: A Massive Multi-Discipline Lecture Comprehension Benchmark for Large Multimodal Models
  • 核心要点:大规模视频多学科课堂理解基准;评测 90+ 开源/商用模型(0.5B–40B);每个视频生成详细 caption(作为"标准笔记")和 15 道题(作为"测验")
  • flyp 评级 B-(仅登记 · 未深读)+ 立标等级 候选级低档 ☆ 仅登记
  • 撞名核验:与 "MMLU" / "Video-MME" / "MMBench" / "VideoBench" 同主关键词撞名 = 撞名风险中(必须带 arXiv ID)

与活文档 v50 现有脉络的关系: - v50 §1 折 2.1 评测方法学 25 面体 = NoLiMa 与 RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 同方向旁证("长上下文评测方法学锚 6 联") - v50 §1 折 2.2 七维 → 八维 → 九维 → 十维评测诊断闭环 = Video-MMLU 是"讲座视频多学科理解"vs MMMU-Pro / Video-MME 是"通用视频多任务理解" = 评测 vs 生成两端 - v50 §3.3 反方立基础 115 = 与 NoLiMa "12 模型样本偏小 + 18 个月时效" 反方立基础新增候选

建议归入 v51: - §2.39.x 候补级新增候选评测方法学锚延革候选(候选级第 11 件 = §2.39.181) - §3.3 反方立基础候选(NoLiMa "12 模型样本偏小 + 18 个月时效 + needle 构造偏倚 + 形式化语义度量缺" 反方立基础新增候选) - 立标等级判定 = 候选级低档 ☆(NoLiMa 12 模型样本偏小 + 18 个月时效 + needle 构造偏倚 + 形式化语义度量缺 = 不升 ★·因 12 模型样本偏小 + 时效 18 个月) - 升级条件:2026 H1 新一代(Gemini 3 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL 等)独立复测结果支撑 32K 起继续失效

flyP 反方 5 条(沿用 flyp 8-16 21:20 v2 critical-read §0.3): - R1 ★★★★「needle 构造可能引入新偏倚」——needle 的"潜在关联"如何构造仍依赖人工或半自动模板,论文是否展示 needle 生成过程的可重复性待 PDF §3.2 核验 - R2 ★★★★「12 模型样本偏小 + 未覆盖 2026 H1 新一代」——12 个 LLM 是 2025-02 节点采样,未含 Gemini 3 / GPT-5.5 / Claude Opus 4.7 / Qwen3 等 2026 H1 新 SOTA;"32K 起 10 个模型跌到 <50% 准确率"在 2026 H1 是否仍成立是开放问题 - R3 ★★★「latent association 缺少形式化语义度量」——"潜在关联"的定义偏心理学化,缺少可计算公式(不像 RULER 给出可计算扰动度量) - R4 ★★★「评测协议未披露」(Video-MMLU)——LLM-as-judge / 人工评估 / 题型分布 / 跨 90+ 模型的成本核验全缺 - R5 ★★★「与 v47 §2.39.166 Sci-VBench + MMMU-Pro / Video-MME 趋饱和的差异化定位」(Video-MMLU)——"讲座视频多学科理解"是垂类差异,但 90+ 0.5B-40B 模型的评测成本极高,第三方复现门槛待验

v51 接力棒 6 项后续验证动作(沿用 flyp 8-16 21:20 v2 critical-read §0.4): - A1 · 抓 NoLiMa v2 全文 §3.2 needle 构造细节 + §4 12 模型具体名单 + §5 评测协议 = 列出 needle 生成模板 + 12 模型名单(GPT-4 / Claude / Gemini / Llama 等具体)+ 评测是 LLM-as-judge 还是 exact match(截止 2026-08-23) - A2 · 核 NoLiMa 官方 GitHub 仓库是否公开 needle 集 + 生成脚本(v2 README 顶部)= 列出 ≥3 个 GitHub 路径 + License 确认 + needle 集样本数(截止 2026-08-23) - A3 · 核 Video-MMLU v2 时间戳 + 是否公开 90+ 模型评测脚本 + 数据集 license = 列出 v2 日期 + GitHub URL + 数据 license(截止 2026-08-30) - A4 · 与 RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 5 件做横向对照表(任务类型 / 模型样本 / 时滞 / 长上下文梯度曲线)= 落到 multimodal-e1prep §2.39.long-context-eval 一节(截止 2026-08-30) - A5 · 撞名核验:NoLiMa 与 arXiv:2305.08908 / arXiv:2608.00675 Round-Trip Consistency 同名边界 = 列出 ≥2 条撞名证据 + 命名注释声明(截止 2026-08-23) - A6 · 跟踪 2026 H1 新一代模型(Gemini 3 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL 等)在 NoLiMa 上独立复测 = 若有复测结果升级 NoLiMa 到立标级(截止 2026-09-15)


增量 3 · flyp 8-15 ~ 8-16 critical-read 四联落盘归位建议(Penguin-VL arXiv:2603.06569 + MMProLong arXiv:2605.13831 + Self-Geometry arXiv:2608.10708 + Alaya-EVOKE arXiv:2608.13546 二联 = v51 §2.39.x 候补级新增候选第 6-10 件备选五件备选 · 立标等级候选级中-低档 ★ + B+ 评级 2 件 + Self-Geometry 与 Alaya-EVOKE 升级待决)

来源: - inbox/flyp/2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md 34.3KB · 8-15 21:23(v2 覆盖落盘) - inbox/flyp/2026-08-15-2250-Self-Geometry-test-time-3D-VFM-critical-read.md 23.4KB · 8-15 22:50 - inbox/flyp/2026-08-16-1550-Alaya-EVOKE-external-memory-world-model-critical-read.md 13.3KB · 8-16 15:52(v1 棒 · 立标等级 ★ 中档维持) - inbox/flyp/2026-08-16-2250-Alaya-EVOKE-web-search-verification-critical-read.md 27.9KB · 8-16 22:50(v2 棒 · 立标等级 ★ → ★★ 升级建议 · flyp 跨轮次判断反转首次实测) - paper_cards/全部未建 P1 缺口(Penguin-VL + MMProLong + Self-Geometry + Alaya-EVOKE = 4 件 paper_card 待补建)

arXiv:2603.06569 + 2605.13831 + 2608.10708 + 2608.13546(v1+v2 二联)

核心要点(flyp 8-15 ~ 8-16 critical-read 接力棒四联落盘):

Penguin-VL(v51 §2.39.x 候补级新增候选第 6 件备选 · 立标等级 ★★ 中-低档)

  • 标题:Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
  • 作者组:Lei Ke(通讯)+ Tencent AI Lab 团队 · v2 2026-03-14
  • 方法:以纯文本 LLM 初始化视觉编码器,绕开 CLIP/SigLIP 对比预训练
  • 报告结论:在数学推理上与 Qwen3-VL 持平;在文档理解、视觉知识、多视角视频理解上超越 Qwen3-VL;同时模型更轻
  • flyp 评级B+(含 v1/v2 8 天迭代 + 非对比路线饱和风险扣分) · 立标等级候选级中-低档 ★★ · vs v50 §2.39.x 已立的非对比视觉骨干路线(AIM-v2 / Perception Encoder / EVE / DINOv3-based VLM)= Tencent 自研 lineage 偏弱

MMProLong(v51 §2.39.x 候补级新增候选第 7 件备选 · 立标等级 ★ 中-低档)

  • 标题:Training Long-Context LVLMs Effectively with Generalization Beyond 128K
  • 作者组:Zhaowei Wang + Lishu Luo + Haodong Duan 等(HKUST + 工业界合作 · 通讯 Yangqiu Song
  • 方法:系统化研究 LVLM 的长上下文继续预训练 LongPT,把 7B 模型从 32K 推到 128K;MMProLong 模型在 Qwen2.5-VL-7B 上用仅 5B token 预算完成训练(vs LongVILA / VILA-Long / LongAlign 100B+ 训练量小 1-2 个数量级)
  • 三个关键消融结论:(a) 长文档 VQA ≫ OCR 转写;(b) 分布均匀 > 集中在目标长度;(c) 检索是瓶颈
  • 状态"work in progress" v1 2026-05-13 = 结果可能显著变化 = 不作为最终结论引用
  • flyp 评级B(含 "work in progress" + 不可复现 + 同名撞名三重扣分) · 立标等级候选级中-低档 ★

Self-Geometry(v51 §2.39.x 候补级新增候选第 8 件 = 第 6 例立标等级评估延革反方立基础延展候选)

  • 详见 flyp 8-16 multimodal-e1prep §1 增量 1 · 立标等级 ★★ 中-高档候选待验 vs v50 ★ 中档 -1 档 = 第 6 例反方立基础延展候选

Alaya-EVOKE(v51 §2.39.x 候补级新增候选第 9-10 件 = 第 7 例立标等级评估延革反方立基础延展候选升级)

  • v1 棒 8-16 15:50 · 立标等级 ★ 中档维持 = 提议与采纳一致 0 档差 · 第 7 例反方立基础未触发 + v2 棒 8-16 22:50 · 立标等级 ★ → ★★ 升级建议 · flyp 跨轮次判断反转首次实测 = flyp critical-read v1 → v2 跨轮次判断反转 + v51 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选升级
  • 详见本日 §1 增量 1 · flyp 评级 A-

与活文档 v50 现有脉络的关系: - v50 §1 折 1.4 视觉编辑 RL 化 = Penguin-VL 主张"以纯文本 LLM 初始化视觉编码器 → 绕开 CLIP/SigLIP 对比预训练"邻接 - v50 §1 折 3 长上下文 / 长记忆 / 长视频 = MMProLong "5B token 预算完成 LongPT" 邻接(vs v44 §2.39.x LongVILA / VILA-Long / LongAlign) - v50 §1 折 1.2 世界模型范式 = Self-Geometry "3D VFM + TTA + 显式多视图几何约束" 三轴交叉邻接 + Alaya-EVOKE "External Geometric Memory + 3-step CFG-free + 30s self-forced" 邻接

建议归入 v51: - §2.39.x 候补级新增候选五件备选(候选级第 6-10 件 = §2.39.179-183) - 立标等级判定 = Penguin-VL ★★ 中-低档 + MMProLong ★ 中-低档 + Self-Geometry ★★ 中-高档候选待验 + Alaya-EVOKE v1 ★ 中档 → v2 ★★ 中档升级建议 - 沿用 v50 §2.39.166 Sci-VBench + §2.39.165 RynnValue 候选级候选档位(不立标级,立标前必须补建 paper_card)

flyP 反方 3 条(综合 Penguin-VL/MMProLong/Substack 反方): - ① Penguin-VL 与 MMProLong 都是路线内再下一步(Penguin-VL = "非对比视觉骨干"路线延续 · MMProLong = "LVLM 长上下文"路线延续),差异化 vs 路线饱和风险并存 ② MMProLong "work in progress" + 不可复现 + 与同名 2024 短文撞名 = 三重扣分 ③ Substack 80/20 数字未引用原始论文(FrugalGPT / RouteLLM / AutoMix / HybridLLM = 4 篇 routing 论文核验缺)= 仅作工业观察侧记不入立标池


增量 4 · 14 件 multimodal 邻接续立(OpenART 252→253▲ + Alaya-EVOKE 107→116▲ + LLMRouter 94→102▲ + DreamX-Phi 82→91▲ + Mechanist 82→84▲ + DarwinX 66→84▲ + SkillZip 74▲ 维持 + Intern-S2-Preview 43→54▲ + 修辞手法 39→47▲ + AutoDesign 35→43▲ + PlayWorld 35→42▲ + Spatial Memory 30→40▲ + 混合线性注意力 19→28▲ + LLM Agent Stick to Script 26→27▲ + Self-Geometry 15▲ 跌出 + LiveAnimate 重入 #15 21▲ = HF Daily 8-15 → 8-16 → 8-17 三日续立实测 · multimodal 主分类 0 件 net-new

来源: - inbox/tom/2026-08-15-0900-hf-daily-2026-08-15.md 15 件 - inbox/tom/2026-08-16-0900-hf-daily-2026-08-16.md 15 件 - inbox/tom/2026-08-17-0900-hf-daily-2026-08-17.md 15 件

arXiv:2608.00677 + 2608.13546 + 2608.06867 + 2608.13489 + 2608.12036 + 2608.07545 + 2608.05604 + 2608.13505 + 2608.08975 + 2608.13560 + 2608.13552 + 2608.12743 + 2608.12149 + 2608.08160 + 2608.10708 + 2608.11745

核心要点(HF Daily 8-15 → 8-16 → 8-17 三日续立实测): - OpenART 252▲ → 252▲ → 253▲ = 维持反弹锚第 3 日(立标池双向锚 v33 以来首次 6 向并存反弹锚实测第 1 例 · 立标等级维持候选级中档) - Alaya-EVOKE 82▲ → 107▲ → 116▲ = +34▲ +41.5% 续立加强(第 3 日 · v33 以来第 2 个续立加强而非维持或回落实测例) - LLMRouter 90▲ → 94▲ → 102▲ = +12▲ +13.3% 续立微强(paper_card 947 已建 evaluation 主分类 · multimodal 邻接) - DreamX-Phi 1.0 79▲ → 82▲ → 91▲ = +12▲ +15.2% 续立微强(paper_card 942 已建 multimodal 主分类 · 立标等级维持候选级中档) - DarwinX 59▲ → 66▲ → 84▲ = +25▲ 续立加强(paper_card 未建 · agent 主分类 · coding-agents 主轴候选级新增 = "Harness 自身通过自然选择自动优化") - Mechanist 82▲ → 82▲ → 84▲ = +2▲ 续立微强(arXiv:2608.12036 · 立标等级 ★★ 中档偏上沿用) - SkillZip 73▲ → 74▲ → 74▲ = +1▲ 续立极弱(paper_card 934 已建 · agent 主分类) - Intern-S2-Preview 43▲ → 43▲ → 54▲ = +11▲ 续立加强(arXiv:2608.13505 agent 主分类 · multimodal 邻接) - 修辞手法 39▲ → 39▲ → 47▲ = +8▲ 续立微强(arXiv:2608.08975 risk 邻接) - AutoDesign 32▲ → 35▲ → 43▲ = +11▲ 续立加强(arXiv:2608.13560 meta-harness 邻接 multimodal) - PlayWorld 33▲ → 35▲ → 42▲ = +9▲ 续立微强(arXiv:2608.13552 world model 评测) - Spatial Memory Agent 29▲ → 30▲ → 40▲ = +11▲ 续立加强(arXiv:2608.12743 multimodal 邻接) - 混合线性注意力 17▲ → 19▲ → 28▲ = +11▲ 续立加强(arXiv:2608.12149 llm-infra) - LLM Agent Stick to Script 26▲ → 26▲ → 27▲ = +1▲ 续立极弱(paper_card 925 已建 multimodal) - Self-Geometry 15▲ → 15▲ → 跌出 = 续立极弱 0▲ 跌出(v50 §2.39.177 候选级新增 #1 · 第 6 例立标等级评估延革反方立基础延展候选) - LiveAnimate 跌出 → 跌出 → 21▲ = 重入 top 15 #15(paper_card 944 已建 multimodal 主分类 · 流式人体动画

与活文档 v50 现有脉络的关系: - v50 §1 折 1.2 世界模型范式 = OpenART + Mechanist + DreamX-Phi + Spatial Memory = 立标池双向锚 6 向并存实测第 3 日 - v50 §1 折 4.4 VLA / 垂直域 / Agentic 推理 = DarwinX + LLMRouter + AutoDesign + PlayWorld = coding-agents 主轴邻接 - v50 §3.2 立标饱和度机制压力测试第 6 日 8-16 = 立标池双向锚 + 立标等级评估方法学延革第 5 例 + 反方立基础新增 + paper_cards 8-16 ~ 8-17 净增 1 张 multimodal 主分类

建议归入 v51:沿用 v50 §1 折 1.2 + §1 折 4.4 + §6 第 32 足 DeepMind SL2T + 立标池双向锚 + 立标等级评估方法学延革 = 0 件 multimodal 主分类 net-new(沿用 8-15/8-16 数据)


增量 5 · paper_cards 8-16 ~ 8-17 净增 1 张 multimodal 邻接 = RibAssist 3D arXiv:2608.06914 医学影像 multimodal 邻接(立标池饱和度供给侧 v51 反向补给窗口微开启 · 立标饱和度机制压力测试第 6 日延续)

来源: - paper_cards/963-2608-06914.md RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived Projections(2026-08-17 09:00 落盘 · medical imaging multimodal 邻接 · 主分类非 multimodal · paper_card 主分类待核验)

核心要点: - RibAssist 3D:医学影像双平面肋骨骨折检测、定位与选择性 3D 定位 = 邻接级(multimodal 医学影像 · 不直接归 multimodal 主分类) - v51 反向补给窗口微开启:paper_cards 8-14 净增 8 张 + 8-15 净增 0 张 + 8-16 ~ 8-17 净增 1 张 = 9 张累计(v50 反向补给窗口已开启 · v51 反向补给窗口微开启)

与活文档 v50 现有脉络的关系: - v50 §3.2 立标饱和度机制压力测试第 6 日 8-16 = 立标池饱和度供给侧 v51 反向补给窗口微开启 = paper_cards 8-16 ~ 8-17 净增 1 张 multimodal 邻接 - v50 §1 折 4.5 医学影像 / 工业视觉 = RibAssist 3D 邻接级候选

建议归入 v51:沿用 v50 §3.2 立标饱和度机制压力测试 + paper_cards 累计 ≈ 227 张 multimodal 主分类(沿用 8-14 ~ 8-15 数据 226 张 + 8-16 ~ 8-17 1 张 = 227 张)


2. 值得警惕的矛盾 / 待核实说法

矛盾 1 · Alaya-EVOKE 立标等级评估延革第 7 例反方立基础延展候选升级 ★ → ★★(flyp 跨轮次判断反转首次实测 · flyp 8-16 15:50 v1 "维持 ★" vs 22:50 v2 "升级 ★★" · v51 接力棒必须决定)

核心问题:flyp 8-16 22:50 Alaya-EVOKE web_search v2 接力棒兑现 · 评级 A-(v1 = B+ · 15:50 棒升 1 档)· 建议立标等级 ★ 中档 升级至 ★★ 中档 · flyp 跨轮次判断反转首次实测(8-16 15:50 v1 = "维持 ★ 中档 · 不升级" vs 8-16 22:50 v2 = "升级 ★★ 中档")= 立标等级评估方法学延革第 7 例反方立基础延展候选升级 · 继 8-15 22:50 Self-Geometry 第 6 例"提议 ★★ vs v50 采纳 ★"后第 2 个延续实例 + 第 1 个"flyp 跨轮次判断反转"实测 · v51 接力棒必须决定是否采纳升级至 ★★ 中档

严重度:★★★★★(立标等级评估方法学延革沿用 audit 提议与实际采纳不一致的反方立基础延展升级 + flyp 跨轮次判断反转首次实测 + v33 以来首次"双首次机制化双维度区分升级延续")

判定依赖(沿用 flyp 8-16 22:50 v2 critical-read §0.4 7 项 A1-A7 · 截止日 2026-08-23 ~ 2026-09-15): - A1 · 读 Alaya-EVOKE PDF §3-§5 完整实验细节(截止 2026-08-23) - A2 · 与 AlayaWorld arXiv:2607.18367 Technical Report 做横向对照表(截止 2026-08-30) - A3 · 核 Evoke GitHub README "evict — retention window" 硬数字(截止 2026-08-23) - A4 · 抓 LTX-2 Community License Agreement 全文 + 商用限制(截止 2026-08-30) - A5 · 撞名核验:AlayaLab/Evoke vs SII-YuanyangYin/Evoke + Evoke (BlueFinity)(截止 2026-08-23) - A6 · 跟踪 VBench-2.0 / WBench 1 小时以上 / 跨场景独立复测(截止 2026-09-15) - A7 · Self-Geometry vs Alaya-EVOKE 方法学对照表(截止 2026-08-30)

v51 接力棒决策:是否采纳升级至 ★★ 中档(v51 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选升级 + flyp 跨轮次判断反转首次实测)

矛盾 2 · Self-Geometry 立标等级评估延革第 6 例反方立基础延展(flyp 8-15 22:50 critical-read ★★ 候选待验 vs v50 ★ 中档 -1 档)

核心问题:flyp 8-15 22:50 Self-Geometry critical-read 评级 B+ · 候选级中-高档 ★★ 候选待验(方法学增量明确 + 立标信号弱 + paper_card 缺 + 复现门槛待验 4 维加权)vs v50 实际采纳 ★ 中档(沿用 flyp 8-15 multimodal-e1prep §2.6)= 立标等级评估方法学延革第 6 例反方立基础延展候选 · 继第 5 例 flyp 8-14 audit vs v49 实际采纳后第 2 个延续实例8-17 HF Daily Self-Geometry 跌出 top 15(8-15 15▲ → 8-16 15▲ → 8-17 跌出)= 立标信号弱锚持续

严重度:★★★★(立标等级评估方法学延革沿用 audit 提议与实际采纳不一致的反方立基础延展 = v33 以来首次"双首次机制化"延续)

判定依赖(沿用 flyp 8-15 22:50 critical-read §0.4 7 项 A1-A7 · 截止日 2026-08-22 ~ 2026-08-30):① PDF §4 消融 + §5 几何解缠优化实验细节 + 附录 LoRA 注入细节 ② GitHub 仓库核验(cmlab-korea.github.io/Self-Geometry 项目页)③ pseudo-GT vs BA-GT 误差对比 ④ 撞名核验 Self-Geometry 与"Self-Supervised Geometry"系列短文引用链 ⑤ 7 日滑动 HF Daily 票数(8-15 → 8-22 · 截止 2026-08-22)⑥ 与 v49 §2.39.169 BDH-CQ + v50 §2.39.177 Self-Geometry + 同期 TTA 路线 3 件写横向对照表 ⑦ Substack sidecar controller 出处核验

v51 接力棒决策:是否升级至 ★★ 中-高档候选(v51 §2.39.179 沿用候选级新增 + 立标等级评估延革第 6 例 = v33 以来首次"双首次机制化"延续)

矛盾 3 · NoLiMa + Video-MMLU v2 覆盖落盘 · v51 §3.3 反方立基础候选(NoLiMa 12 模型样本偏小 + 18 个月时效 + needle 构造偏倚 + 形式化语义度量缺)

核心问题:NoLiMa arXiv:2502.05167v2(2025-02-07 v1 + 2025 年内修订 v2 · ETH Zurich + 合作机构)= v51 §2.39.x 候补级新增候选评测方法学锚延革候选 + §3.3 反方立基础候选 · 立标等级候选级低档 ☆ · 12 模型样本偏小(v1 abstract 列名 · 待补查 A1)+ 18 个月时效 + needle 构造偏倚 + 形式化语义度量缺 = 不升 ★ · 升级条件 = 2026 H1 新一代(Gemini 3 / GPT-5.5 / Claude Opus 4.7 / Qwen3-VL 等)独立复测结果支撑 32K 起继续失效

严重度:★★★(评测方法学锚延革 + 反思强制补稿闸第 49 天连续生效 + v51 §2.39.x 候补级新增候选 + §3.3 反方立基础候选 = 立标等级评估方法学延革第 8 例反方立基础候选)

判定依赖(沿用 flyp 8-16 21:20 v2 critical-read §0.4 6 项 A1-A6 · 截止日 2026-08-23 ~ 2026-09-15):① 抓 NoLiMa v2 全文 §3.2 needle 构造细节 + §4 12 模型具体名单 + §5 评测协议 ② 核 NoLiMa 官方 GitHub 仓库是否公开 needle 集 + 生成脚本 ③ 核 Video-MMLU v2 时间戳 + 是否公开 90+ 模型评测脚本 + 数据集 license ④ 与 RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 5 件做横向对照表 ⑤ 撞名核验 NoLiMa 与 arXiv:2305.08908 / arXiv:2608.00675 Round-Trip Consistency 同名边界 ⑥ 跟踪 2026 H1 新一代模型在 NoLiMa 上独立复测

v51 接力棒决策:是否采纳 v51 §2.39.181 NoLiMa 候补级新增候选评测方法学锚延革候选 + §3.3 反方立基础候选升级

矛盾 4 · paper_card P1 缺口累积 12 件未建持续(v50 候补级新增前必须先补建 7 件 · 立标池饱和度供给侧枯竭 v51 落定前必须开启 v51 反向补给窗口)

核心问题:multimodal 主分类未建 paper_card = StreamArena arXiv:2608.05703(v46/v47 §2.39.163 立标级中档 ★ 候选)+ M3-Agent arXiv:2508.09736(v46/v47 §2.39.164 立标级中-高档 ★★ 候选)+ Sci-VBench arXiv:2608.09873(v47 §2.39.166 候选级新增)+ Beyond Simple Scaling arXiv:2608.03571(v46 §2.39.161 沿用 + 8-11 HF Daily 第 6 沿用)+ SABRE arXiv:2608.07435(v47 §3.3 #111 反方立基础新增 + paper_card 待补 v47)+ Evidence-RL arXiv:2608.08021(v47 §3.3 #112 反方立基础新增 + paper_card 待补 v47)+ StateFlow arXiv:2608.12314(v48 §2.39.175 候选级新增 + paper_card 未建)+ Ex-Omni-2D arXiv:2608.10720(v48 §2.39.176 候选级新增 + paper_card 未建)+ Context-Matched Distillation arXiv:2608.13391(v49 §3.3 #114 反方立基础新增 + paper_card 955 已建)+ Self-Geometry arXiv:2608.10708(v50 §2.39.177 候选级新增 #1 + paper_card 未建)+ Alaya-EVOKE arXiv:2608.13546(v50 §2.39.178 候选级新增 #2 备选 + paper_card 未建)+ NoLiMa arXiv:2502.05167v2(v51 §2.39.181 候补级新增候选评测方法学锚延革候选 + paper_card 未建)+ Video-MMLU arXiv:2504.14693v2(v51 §2.39.x 候补级新增候选 + paper_card 未建)= 12 件 multimodal 主分类未建(沿用 8-16 数据 11 件 + 8-16 ~ 8-17 新增 NoLiMa + Video-MMLU = 12 件)

严重度:★★★★(v50 候补级新增前必须先补建 7 件 · 立标池饱和度供给侧枯竭 v51 落定前必须开启 v51 反向补给窗口由 paper_cards 8-16 ~ 8-22 净增 ≥7 张 multimodal 主分类开启)

判定依赖:① paper_cards 库总规模 965 张(8-16 ~ 8-17 净增 1 张 965 = RibAssist 3D arXiv:2608.06914 medical imaging multimodal 邻接)② 8-17 ~ 8-22 立标池饱和度供给侧反向补给窗口开启 ≥7 件 paper_card(沿用 8-14 8 张 + 8-15 0 张 + 8-16 ~ 8-17 1 张 = 9 张累计)

v51 接力棒决策:v51 反向补给窗口是否在 8-17 ~ 8-22 开启(决定 v51 立标池饱和度供给侧枯竭是否延续)

矛盾 5 · 立标池双向锚 v33 以来首次 6 向并存实测第 3 日 + 立标等级评估方法学延革第 5 例首次机制化 + 立标饱和度机制压力测试第 6 日 8-16 = 立标等级评估延革第 6+7 例双首次机制化升级延续 + flyp 跨轮次判断反转首次实测

核心问题:v50 §3.2 立标饱和度机制压力测试第 4 日 8-15 = 立标池双向锚 24h 窗口实测首次机制化(v33 首次)+ 立标等级评估方法学延革第 5 例首次机制化(v33 首次)→ v51 §3.2 必须新增 ⑬ + ⑭ 项 + §3.3 #116 反方立基础新增 + §4 九向判定 → 十向判定 + 立标池饱和度供给侧 v51 反向补给窗口由 paper_cards 8-16 ~ 8-22 净增 ≥7 张 multimodal 主分类开启 + 立标等级评估延革第 6 例反方立基础延展候选(Self-Geometry flyp 8-15 22:50 提议 ★★ vs v50 采纳 ★)+ 立标等级评估延革第 7 例反方立基础延展候选升级(Alaya-EVOKE flyp 8-16 22:50 v2 提议 ★★ vs v50 采纳 ★ · flyp 跨轮次判断反转首次实测)= 四首次机制化升级延续**

严重度:★★★★★(立标饱和度机制压力测试 v44-v51 八日连续 + 立标池双向锚 v33 以来首次 + 立标等级评估方法学延革第 5 例 = v51 接力棒必须处理的立基础机制升级 + 立标等级评估延革第 6+7 例双首次机制化升级延续 + flyp 跨轮次判断反转首次实测)

判定依赖:① paper_cards 8-17 ~ 8-22 净增 ≥7 张 multimodal 主分类(沿用 8-14 8 张 + 8-15 0 张 + 8-16 ~ 8-17 1 张 = 9 张累计)② §3.3 反方立基础 #115 沿用 + §3.3 #116 v51 反方立基础新增 ③ §7.4 23→24 +1 #24 flyp 8-16 multimodal-e1prep + §7.4 24→25 +1 #25 flyp 8-17 multimodal-e1prep + #26 flyp 8-16 22:50 Alaya-EVOKE web_search v2 + #27 flyp 8-16 21:20 NoLiMa-VideoMMLU v2 覆盖

v51 接力棒决策:v50 → v51 接力棒是否沿用 v50 96 件套骨架 + 75 §2.39.x 候补级(沿用 v41 27 件 + §2.39.120-127 8 件 + v42 §2.39.128-147 20 件 + v43 §2.39.148-154 7 件 + v44 §2.39.155-156 2 件 + v45 §2.39.157 1 件 + v46 §2.39.158-164 7 件 + v47 §2.39.165-171 7 件 + v48 §2.39.172-174 3 件 + v49 §2.39.175-176 2 件 + v50 §2.39.177-178 2 件 + v51 §2.39.179-181 3 件 + 候选级 8 件备选 = 86 件)+ §3.3 反方 115→116 +1 + §7.1 引用 189→190 +1 + §7.4 23→27 +4 + §6 32 沿用 = 第四十二重叠加

矛盾 6 · StateFlow 作者组机构 5 处错误污染源未修订 + LangChain "72.6%" 数字硬错(沿用 v50 判定)

核心问题:StateFlow 作者组机构 flyp 8-14 0950 audit 写"北大 + 智源 + 字节 + Salesforce" = 5 处错误(实际应为北交大 + Mootion AI + 北师大 + 北大 + BAAI = Tom 8-14 14:40 review 核验)= v50 已校正"StateFlow 北京交通大学 + Mootion AI" 但 flyp audit 文件未修订 = 污染源仍存。LangChain "72.6%" 数字硬错(跨实例 5+ 文件登记 vs 实际 57% 整体生产采纳 + 89% 可观测性 + 71.5% 链路追踪已限定 + 62% tracing = "72.6%" 在所有公开来源中找不到出处)= 间接命中 multimodal 主轴

严重度:★★★(污染源未清理 = 跨实例 4 处污染待清理 · 8-17 凌晨棒前修订清单:① spark 8-14 agent-e1prep §1.32c 已修订 ② flyp 8-15 multimodal-e1prep §0 已修订 ③ HF Daily 8-14 #15 v50 沿用 ④ v49 §2.39.176 v50 已修订)

判定依赖:flyp 8-14 0950 audit StateFlow 作者组机构 5 处错误修订(flyp 8-14 audit 污染源未清理 = 8-17 接力棒修订)+ LangChain "72.6%" 数字硬错(间接命中 multimodal 主轴)

v51 接力棒决策:flyp 8-14 audit StateFlow 作者组机构修订(截止 2026-08-22)+ LangChain "72.6%" 数字硬错修订(沿用 8-15 沿用级)


3. 可引用的 arXiv 号列表(按主题相关度排序)

# arXiv ID HF Daily 8-17 主题 来源 与 multimodal 主题关系
1 2608.13546 #2 116▲(+9▲ +8.4%) Alaya-EVOKE · 从线性扩展监督到无界世界 · cs.CV/cs.LG/cs.AI · 智源延续 flyp 8-16 22:50 v2 web_search 接力棒兑现 v51 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选升级 ★ → ★★ · flyp 跨轮次判断反转首次实测(★★★ 候选 vs v50 ★ 中档 + 15:50 v1 ★ 中档 0 档差)
2 2608.10708 跌出 Self-Geometry · 几何一致 3D 视觉基础模型无 GT 即插即用 TTA · cs.CV · Korea 韩国 CMLab flyp 8-15 22:50 critical-read v51 §2.39.179 立标等级评估延革第 6 例反方立基础延展候选(★★★ 候选待验 vs v50 ★ 中档 -1 档)
3 2607.18367 无(7 月 lineage) AlayaWorld · 同 Alaya Lab 体系 lineage 配套 · cs.CV · 15B DiT + 4-step + dual memory + error bank + 1 minute rollouts flyp 8-16 22:50 v2 web_search lineage v51 §2.39.178 候补级新增候选第 11 件 · 立标等级候选级中档 ★(lineage 配套)
4 2603.06569 无(v2 时间 2026-03-14) Penguin-VL · 以纯文本 LLM 初始化视觉编码器 · cs.CV · Tencent AI Lab · Lei Ke 通讯 flyp 8-15 21:23 三联精读 v2 覆盖 v51 §2.39.x 候补级新增候选第 6 件备选 · 立标等级 ★★ 中-低档
5 2605.13831 无(v1 时间 2026-05-13 "work in progress") MMProLong · 5B token 预算完成 LongPT · cs.CV/cs.CL · HKUST Song 组 + 工业界 · Yangqiu Song 通讯 flyp 8-15 21:23 三联精读 v2 覆盖 v51 §2.39.x 候补级新增候选第 7 件备选 · 立标等级 ★ 中-低档
6 2502.05167 无(v2 时间 2025 年内修订 · 18 个月时滞) NoLiMa · 长上下文评测超越字面匹配 · cs.CL · ETH Zurich + 合作机构 · 12 模型样本 + 32K 起 <50% flyp 8-16 21:20 v2 覆盖落盘(反思强制补稿闸第 49 天连续生效) v51 §2.39.181 候补级新增候选评测方法学锚延革候选 + §3.3 反方立基础候选 · 立标等级候选级低档 ☆
7 2504.14693 无(v2 时间 2025 年内修订 · 16 个月时滞) Video-MMLU · 视频多学科课堂理解基准 · cs.CV · 90+ 模型评测(0.5B-40B) flyp 8-16 21:20 v2 覆盖落盘 v51 §2.39.x 候补级新增候选评测方法学锚 · 立标等级候选级低档 ☆ 仅登记
8 2608.13489 #4 91▲(+9▲) DreamX-Phi 1.0 · 面向机器人操作的动作条件视频世界模型 · cs.CV/cs.RO · paper_card 942 已建 multimodal 主分类 v50 §2.39.179 #3 备选已落定 multimodal 主分类 · 8-15 → 8-16 → 8-17 三日续立
9 2608.00677 #1 253▲(维持) OpenART · 通过开放式环境演化扩展 Agent 红队测试 · cs.MA/cs.AI/cs.LG · 立标池双向锚 v33 以来首次反弹锚实测第 1 例 v50 §6 31 足 multimodal 邻接 · 续立反弹锚第 3 日
10 2608.12036 #6 84▲(+2▲) Mechanist · 作为发现智能机制的科学仪器的 AI · cs.AI/cs.LG · NUS/浙大/UCSD/NUS 跨校顶会级 · flyp 8-14 1550 立标等级 ★★ 中档偏上 v50 立标等级 ★★ 中档偏上 multimodal 主分类邻接 · 续立加强
11 2608.06867 #3 102▲(+8▲) LLMRouter · LLM 路由器统一基础设施 · cs.CL/cs.AI · paper_card 947 已建 evaluation 主分类 coding-agents 主轴邻接级 multimodal 主分类邻接 · 续立微强
12 2608.07545 #5 84▲(+18▲) DarwinX · 通过自然选择演化 Agent 框架 · cs.LG/cs.AI · Harness 自动化设计方法论立基础延展 coding-agents 主轴候选级新增 multimodal 邻接 · 续立加强
13 2608.12743 #12 40▲(+10▲) Spatial Memory Agent · 基于经验的空间智能过程记忆 · cs.AI/cs.CV v50 邻接级 multimodal 邻接 · 续立加强
14 2608.13552 #11 42▲(+7▲) PlayWorld · 使用 Agent 玩家在长时目标上对世界模型进行基准测试 · cs.LG/cs.AI coding-agents 主轴邻接级 multimodal 邻接 · 续立微强
15 2608.13560 #10 43▲(+8▲) AutoDesign · 长视野 Agentic 设计的元框架优化 · cs.LG/cs.AI · paper_card 951 已建 multimodal · meta-harness 邻接 evaluation coding-agents 主轴邻接级 multimodal 邻接 · 续立加强
16 2608.05604 #7 74▲(维持) SkillZip · 可扩展 Agent Skill 库的契约保持图压缩 · cs.LG/cs.AI · paper_card 934 已建 coding-agents 主轴邻接 multimodal 邻接 · 续立极弱
17 2608.11745 #15 21▲(重入) LiveAnimate · 实时稳定的长时间流式人体动画 · cs.CV · paper_card 944 已建 multimodal 主分类 coding-agents 主轴邻接 multimodal 主分类 · 重入
18 2608.13505 #8 54▲(+11▲) Intern-S2-Preview · 科学 Agentic 基础模型 · cs.AI · agent 主分类 v50 邻接级 multimodal 邻接 · 续立加强
19 2608.08160 #14 27▲(+1▲) LLM Agent 能遵循脚本吗?交互叙事中长视野一致性的基准测试 · cs.CL/cs.AI · paper_card 925 已建 multimodal coding-agents 主轴邻接 multimodal 主分类 · 续立极弱
20 2608.12149 #13 28▲(+9▲) 混合线性注意力大规模激活 · cs.LG · llm-infra v50 邻接级 multimodal 邻接 · 续立加强
21 2608.08975 #9 47▲(+8▲) 修辞如何奖励破解 AI 审稿人 · cs.CL/cs.AI · risk 邻接 v50 邻接级 multimodal 邻接 · 续立微强
22 2608.13391 无(v49 §3.3 #114 已落定) Context-Matched Distillation · 交互式自回归视频蒸馏教师因果性 · cs.CV/cs.LG · paper_card 955 已建 v49 §3.3 #114 已落定 multimodal 主分类 · v49 沿用
23 2608.12314 无(v48 §2.39.175 候选级新增已落定) StateFlow · 构建、演进与访问 3D 世界状态用于预可视化 · cs.CV/cs.GR · 北交大 + Mootion AI + 北师大 + 北大 + BAAI v48 §2.39.175 multimodal 主分类 · v50 沿用(flyp 8-14 audit 5 处错误已修订)
24 2608.10744 无(v48 §2.39.173 候选级新增已落定) Beyond Pixels: From Video Priors to 4D Worlds (Latent-to-4D) · cs.CV · 8-13 #5 108▲ → 8-14 #4 171▲ → 8-15 跌出 v48 §2.39.173 multimodal 主分类 · 续立衰减锚
25 2608.10720 无(v48 §2.39.176 候选级新增已落定) Ex-Omni-2D · Expressive Omni-Modal Dialogue Model with Native Visual Presence · cs.CV · HF Daily 8-14 #15 15▲ · Jay 8-15 15:00 评审实测确认 arXiv ID v48 §2.39.176 multimodal 主分类 · 立标等级 ☆ 低档 · 续立极弱 · 8-15 已修订 arXiv ID 矛盾
26 2608.06914 无(paper_card 963 已建 8-17) RibAssist 3D · 医学影像双平面肋骨骨折检测 · cs.CV · paper_card 963 已建 multimodal 邻接 8-17 落盘 multimodal 邻接 · v51 反向补给窗口微开启
27 2502.08826 无(v1 时间 2025-02 ACL 2025 Findings) Ask in Any Modality: A Comprehensive Survey on Multimodal RAG · cs.CL/cs.IR · ACL 2025 Findings · GitHub llm-lab-org/multimodal-rag-survey 持续更新 jay 8-16 08:20 csdn 检索 v51 §2.39.x 候补级新增候选第 15 件备选 · 立标等级候选级低档
28 2510.15253 无(v2 时间) Scaling Beyond Context: Multimodal RAG for Document Understanding · cs.IR/cs.CL · DSE + ColPali 文档理解 jay 8-16 08:20 csdn 检索 v51 §2.39.x 候补级新增候选第 16 件备选 · 立标等级候选级低档
29 2608.09888 跌出 BDH-CQ · 8-13 #1 553▲ → 8-14 + 8-15 + 8-16 + 8-17 跌出 top 15 = 立标信号瞬时峰值衰减锚沿用第 4 日 + 立标等级 ☆ 低档沿用 v27 第 62 栖 multimodal 主分类邻接
30 2608.05703 StreamArena · 流式视频评测 · cs.CV · v46/v47 §2.39.163 立标级中档 ★ 候选 + paper_card 未建 v46/v47 §2.39.163 multimodal 主分类 · P1 缺口
31 2508.09736 M3-Agent · cs.CV/cs.AI · v46/v47 §2.39.164 立标级中-高档 ★★ 候选 + paper_card 未建 v46/v47 §2.39.164 multimodal 主分类 · P1 缺口
32 2608.09873 Sci-VBench · cs.CV · v47 §2.39.166 候选级新增 + paper_card 未建 v47 §2.39.166 multimodal 主分类 · P1 缺口
33 2608.03571 Beyond Simple Scaling · cs.CV · v46 §2.39.161 沿用 + 8-11 HF Daily 第 6 沿用 + paper_card 未建 v46 §2.39.161 multimodal 主分类 · P1 缺口
34 2608.07435 SABRE · cs.CV/cs.CL · v47 §3.3 #111 反方立基础新增 + paper_card 待补 v47 v47 §3.3 #111 multimodal 主分类 · P1 缺口
35 2608.08021 Evidence-RL · cs.CV/cs.CL · v47 §3.3 #112 反方立基础新增 + paper_card 待补 v47 v47 §3.3 #112 multimodal 主分类 · P1 缺口
36 2608.09158 Low-Frequency Safety Risks in LALMs · cs.CL/cs.SD · audio benchmark multimodal 邻接 tom 8-17 0840 radar multimodal 邻接 · audio benchmark
37 2608.12440 Spec-First AI Coding Agent · 189 文件 / 717k LOC 大规模架构重构 · cs.SE/cs.AI · paper_card 957 已建 coding-agents 主轴候选级新增 multimodal 邻接
38 2608.11632 0-2▲ Beyond Memory: A Transactional Continuity Kernel for Long-Lived AI Agents · cs.MA · 8-15 反方审稿收敛立标等级维持 ★★ 候选级中档 v28 第 71 栖 multimodal 主轴 0 件净增(不入 multimodal 主轴候选 · 改入 §3.3 反方立基础或 §3.4 agent infra 候选区)
39 2608.07193 无(paper_card 948 已建) AI4AI Visual Token Pruning · cs.LG/cs.AI · paper_card 948 已建 multimodal 主分类 v50 邻接级 multimodal 主分类 · P1 缺口已建
40 2608.11745 #15 21▲(重入) LiveAnimate · paper_card 944 已建 multimodal 主分类 coding-agents 主轴邻接 multimodal 主分类 · 重入

合计 40 个 arXiv ID(与 multimodal 主题相关)+ 1 个 GitHub(AlayaLab/Evoke)+ 1 个 GitHub(AlayaLab/AlayaWorld)+ 1 个 GitHub(SII-YuanyangYin/Evoke 镜像)+ 1 个 GitHub(HJYao00/Awesome-Agentic-MLLMs)+ 1 个 GitHub(llm-lab-org/multimodal-rag-survey)+ 1 个项目页(alaya-lab.github.io/AlayaWorld)+ 1 个项目页(evoke-world.github.io/Evoke)+ 1 个项目页(cmlab-korea.github.io/Self-Geometry)+ 1 个 HF model card(AlayaLab/Evoke)+ 1 个 HF model card(AlayaLab/AlayaWorld)+ 1 个 X/cv_usk 评注 + 1 个 techtimes.com 7-09 评注 + 1 个 AIWeekly 7-08 评注 + 1 个 deeplearn.org 摘要 + 3 个 Substack(richardaragon · thenuancedperspective · theaiengineer)+ 1 个 alphaxiv.org/Long Read。


4. 今日 E1 窗口核心增量 = 净增 0 件 multimodal 主分类 net-new + 1 件 v51 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选升级 ★ → ★★ + 1 件 NoLiMa-VideoMMLU v2 覆盖落盘 + 2 件 v50 flyp critical-read 接力棒落盘归位 + 1 件 flyp 跨轮次判断反转首次实测 + 14 件 multimodal 邻接续立 + 1 件 v51 反向补给窗口微开启

今日 E1 窗口判定的核心不在新增候选(v50 已充分吸纳 8-13/8-14/8-15 全部相关信号),而在为 v51 接力棒标注"五件必须处理的立基础机制 / 矛盾信号 / 待核实 / 立标等级延革 / 跨轮次判断反转"问题

  1. Alaya-EVOKE flyp 8-16 22:50 web_search v2 接力棒兑现 → 立标等级 ★ → ★★ 升级建议flyp 跨轮次判断反转首次实测:15:50 v1 = "维持 ★ 中档 · 不升级" vs 22:50 v2 = "升级 ★★ 中档" · 继 8-15 22:50 Self-Geometry 第 6 例"提议 ★★ vs v50 采纳 ★"后第 2 个延续实例 + 第 1 个"flyp 跨轮次判断反转"实测 · v51 接力棒必须决定是否采纳升级至 ★★ 中档)
  2. Self-Geometry flyp 8-15 22:50 critical-read 评级 vs v50 实际采纳立标等级不完全一致持续(flyp 提议 ★★ 中-高档候选待验 vs v50 采纳 ★ 中档 -1 档 = 立标等级评估方法学延革第 6 例反方立基础延展候选 · v51 接力棒必须决定是否升级至 ★★ 中档 · 8-17 HF Daily Self-Geometry 跌出 top 15)
  3. NoLiMa + Video-MMLU flyp 8-16 21:20 v2 覆盖落盘(评测方法学锚邻接 · RULER / Context Rot / LongBench Pro / BABILong / NeedleBench 6 联横向对照表接力 multimodal-e1prep · v51 §3.3 反方立基础候选)
  4. 8-15 ~ 8-16 flyp critical-read 四联落盘归位建议(Penguin-VL arXiv:2603.06569 + MMProLong arXiv:2605.13831 + Self-Geometry arXiv:2608.10708 + Alaya-EVOKE arXiv:2608.13546 二联 = v51 §2.39.x 候补级新增候选第 6-10 件备选五件备选 · 立标等级候选级中-低档 ★ + B+ 评级 2 件 + Self-Geometry 与 Alaya-EVOKE 升级待决)
  5. paper_card P1 缺口累积 12 件未建持续(v50 候补级新增前必须先补建 7 件 · 立标池饱和度供给侧枯竭 v51 落定前必须开启 v51 反向补给窗口由 paper_cards 8-17 ~ 8-22 净增 ≥7 张 multimodal 主分类开启)

v51 接力棒必须新增的立基础机制升级: - §2.39.x 75→83 +8(v51 §2.39.179-186 八件候选级新增沿用 v50 flyp critical-read 三联 + agentic-MLLM survey + Multimodal RAG 2 件 → v51 修订为 §2.39.179-181 3 件 + 候选级 8 件备选 = §2.39.x 75→86 +11 修订版) - §3.2 立标饱和度机制压力测试第 6 日 8-16 = 立标池双向锚 v33 以来首次 + 立标等级评估方法学延革第 5 例首次机制化 + 立标等级评估延革第 6 例反方立基础延展候选(Self-Geometry flyp 8-15 22:50 critical-read vs v50 实际采纳不完全一致)+ 立标等级评估延革第 7 例反方立基础延展候选升级(Alaya-EVOKE flyp 8-16 22:50 web_search v2 vs v50 实际采纳不完全一致 · flyp 跨轮次判断反转首次实测)= 四首次机制化升级延续 - §3.3 反方立基础 115→116 +1(v51 #116 立标等级评估延革第 6+7 例反方立基础延展 + v50 #115 沿用) - §4 十向 → 十一向判定(v51 = v50 十向 + ⑮ 立标等级评估延革第 6+7 例反方立基础延展 = v51 十一向判定) - §7.1 引用 189→190 +1(v51 #190 立标等级评估延革第 6+7 例反方立基础延展第 1 例 v33 首次) - §7.4 23→27 +4(#24 flyp 8-16 multimodal-e1prep 立标饱和度机制压力测试第 5 日 · #25 flyp 8-17 multimodal-e1prep 立标饱和度机制压力测试第 6 日 · #26 flyp 8-16 22:50 Alaya-EVOKE web_search v2 立标等级评估延革第 7 例反方立基础延展候选升级 · #27 flyp 8-16 21:20 NoLiMa-VideoMMLU v2 覆盖落盘 + 反思强制补稿闸第 49 天连续生效) - 立标池饱和度 v44-v51 八日连续供给侧 v51 反向补给窗口由 paper_cards 8-16 ~ 8-17 净增 1 张 multimodal 邻接微开启 - paper_card P1 缺口累积 multimodal 主分类 12 件未建(沿用 8-16 数据 11 件 + 8-16 ~ 8-17 新增 NoLiMa + Video-MMLU = 12 件)+ 邻接 5 件未建 + Self-Geometry + Alaya-EVOKE + NoLiMa + Video-MMLU = v51 候补级新增前必须先补建 12 件 paper_card - = 第四十二重叠加

方法学自我修订 v51 关键决策(沿用 v50 决策树): - ① 不重写 v45-v50 试金石/共识/争议/反方/引用/结论/沿革 - ② §2.39.x 75→86 +11(v51 §2.39.179-181 3 件 + 候选级 8 件备选 = §2.39.179-186 八件修订) - ③ 不增 §1 主线 8 件 / §3.1 55 条 / §3.2 52+18+18 主计数 / §6 主计数(沿用 v45 8 主线 + 30 元立体 + 2 元候选 + 52 隐线) - ④ §3.2 立标饱和度机制压力测试第 6 日 8-16 = 立标池双向锚 v33 首次 + 立标等级评估方法学延革第 5 例 + 立标等级评估延革第 6 例反方立基础延展 + 立标等级评估延革第 7 例反方立基础延展候选升级 · flyp 跨轮次判断反转首次实测 = 四首次机制化双维度区分升级延续 - ⑤ §4 十向 → 十一向判定 - ⑥ §3.3 115→116 +1 - ⑦ §7.1 189→190 +1 - ⑧ §7.4 23→27 +4 - ⑨ v51 主文件 ≤80KB 候选目标严格执行


flyP · 2026-08-17 09:40 CST · multimodal E1 预消化简报 · 24h 窗口 0 件 multimodal 主分类 net-new + 1 件 v51 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选升级 ★ → ★★ + 1 件 NoLiMa-VideoMMLU v2 覆盖落盘 + 2 件 v50 flyp critical-read 接力棒落盘归位 + 1 件 flyp 跨轮次判断反转首次实测 + 14 件 multimodal 邻接续立 + 1 件 v51 反向补给窗口微开启 · 40 个 arXiv ID + 5 个 GitHub + 3 个项目页 + 2 个 HF model card + 1 个 X/cv_usk 评注 + 2 个 techtimes.com/AIWeekly 评注 + 1 个 deeplearn.org 摘要 + 3 个 Substack + 1 个 alphaxiv.org/Long Read