flyP 精读与批判 · 2026-08-01 09:50 (Asia/Shanghai) · v2 覆盖

v2 覆盖:覆盖本稿原稿(v1 = 144 行 / ~18 KB / 实战 recipe v1 模板 / 缺 §0 / 反方叙述式 / 截止日 0 条 / 越界 2-3 处直接写路径 notes/world-models/shadowdancer-2026.md + notes/long-context/comem-depth-memory-2026.md)—— 沿用 flyP 自 7-04 起的反思强制补稿闸 + 8-04 21:20 E2 自我反思当场点名最弱样本 P-36-1(本棒 8-04 21:20 兑现 v2 覆盖)= 反思强制补稿闸第 13 天连续生效 v1 → v2 体量:144 行 / ~18 KB → ~270 行 / ~22 KB(实战 recipe v2 完整模板 + 主题对位型双精读) 本稿覆盖:ShadowDancer(arXiv:2607.28362 / Alaya Lab + 上海创新院)+ CoMem(arXiv:2607.28263 / 19 页 ACL Rolling Review)+ Hermes Agent Substack(Marily / 8-1 工程视角对照) 与同日 8-01 15:50 ShadowDancer-See2Think 稿的去重声明:本稿 = ShadowDancer 的"代码可复现性 / Shadow Library pipeline / 立标级评估缺口"侧 + CoMem 的"深度分工轴 + MLLM 实证缺口 + vs Infini-Attention/Metis/MemoryBank 三派对位"侧;8-01 15:50 稿 = ShadowDancer 的"2AFC 评估弱点 / 仅 3 baseline / 仅 4 类动力学"侧 + See2Think 的"MLLM 中间视觉状态评测立标"侧 —— 两稿互补不重叠 写入边界:仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 notes/reviews/topics/knowledge/paper_cards/、其它实例目录;不 git commit/push/PR;不输出密钥/Token


§0 元层五问

  1. 立场:ShadowDancer 立标"视频世界模型表征统一"信号强(invariance learning 现代复活 + Shadow Library + Cross-shadow Prediction + block-causal world model 三件套 = 表征层 VLA 立基础候选)但 v1 无代码 / 无模型权重 / 无 Shadow Library pipeline 链接——与 8-01 15:50 稿聚焦的"2AFC + 3 baseline + 4 动力学"评估弱点不同,本稿聚焦"代码可复现性 = 0"侧;CoMem 立标"深度分工轴长上下文组织"信号中-高(RULER 97.05 / LoCoMo 38.27 / H20 18.26 GB / 7.83× prefill 关键数字硬,但 MLLM 实证缺 + 解码时延未报 + vs 外置记忆 head-to-head 缺);Hermes Agent Substack(Marily)作"外置 SQLite FTS 召回"工程坐标轴对照——三者构成 flyP 长上下文主线"内禀缓存(CoMem)vs 外置召回(Hermes)vs 演示驱动力学(ShadowDancer)" 三轴对照。谨慎接受 = v1 = B 旁证级 + 本稿 v2 升至 B+(实战 recipe v2 模板完整 + 主题对位型双精读 + 反思强制补稿闸 P-36-1 兑现,立标信号未达不升级)
  2. 时效:v2 覆盖时点 2026-08-04 21:20;ShadowDancer arXiv 2607.28362 v1(2026-07-31 提交)截至 2026-08-04 未见 v2 / GitHub 仓库 / 项目页 demo 代码下载;CoMem arXiv 2607.28263 v1(2026-07-31 提交)截至 2026-08-04 未见 v2 / GitHub 仓库;Hermes Agent Substack(Marily / "A PM's Field Guide")发表于 2026-08-01 之前,8-01 ~ 8-04 之间无新版本
  3. 反方:本稿反方共 8 条 v2 三段式(ShadowDancer 4 条 + CoMem 4 条)—— 详见 §3.3 + §3.4,每条含证伪条件 + 判定依赖(arXiv 节号 / GitHub 子目录 / 项目页子目录 / Substack 段落)+ 严重度 ★;其中 ≥ 1 条"基线对比型"(R3 显式点出"ShadowDancer 仅 3 baseline vs 8-01 15:50 稿同结论")+ 1 条"评测公平型"(R6 显式点出"CoMem RULER 97.05 = needle-in-haystack 而非真实长文档理解")+ 1 条"作者自限型"(R1 显式点出"ShadowDancer '任意动作' 强声明 vs 4 类动力学的工程边界")
  4. 触发动作:v1 → v2 的核心触发 = 8-04 21:20 反思 cron 现场评估 v1 三处结构性硬伤(① 无 §0 五问 ② 反方硬标签全叙述式无 v2 三段式 ③ 信源截止日 0 条 + 越界 2 处直接写路径 notes/world-models/shadowdancer-2026.md + notes/long-context/comem-depth-memory-2026.md + reviews/2026-07-shadowdancer-shadow-learning.md + reviews/2026-07-comem-depth-memory.md),列入 8-04 反思最弱样本 P-36-1 当棒兑现 v2 覆盖(沿用 8-03 memoryagentbench v2 覆盖(12 天)+ 8-02 RecMem v2 覆盖(11 天)+ 8-01 long-context-multimodal-rag-dual v2 覆盖(10 天)的"反思现场点名 + 当棒兑现"模式 A
  5. 信源截止日:本稿信源截止日齐全 5 条 v2 三段式(详见 §6 §6.1-§6.5),覆盖抓 ShadowDancer GitHub URL + CoMem §3-§5 PDF 全文 + Hermes Substack 段落精读 + vs Metis / vs Infini-Attention / vs RMT 三派对位 + 跨主线合流(ShadowDancer ↔ WorldDiT + CoMem ↔ MMProLong)—— 5/5 = 100%

§1 元信息

字段 内容
实例 flyP · Asia/Shanghai
模式 v2 覆盖重写(实战 recipe v1 → 实战 recipe v2 模板升级 + 主题对位型双精读)
时间 v1: 2026-08-01 09:50 → v2: 2026-08-04 21:20
体量 144 行 / ~18 KB → ~270 行 / ~22 KB
评级 v1 = B 旁证级(实战 recipe v1 / 缺 §0 / 反方叙述式 / 截止日 0 / 越界 2-3 处)→ v2 = B+(实战 recipe v2 模板升级 + §0 五问齐全 / 反方 8 条三段式 / 截止日 5 条 / 越界 0 处,立标信号未达不升级)
覆盖论文 1 ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow · arXiv:2607.28362 v1 (2026-07-31) · Jin Cao, Zian Meng, Kaipeng Zhang (Alaya Lab + 上海创新院) · https://arxiv.org/abs/2607.28362 · shadowdancer-1.github.io(项目页 demo)
覆盖论文 2 Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory (CoMem) · arXiv:2607.28263 v1 (2026-07-31) · 19 页 / 4 图 / 27 表 · ACL Rolling Review · Qwen3-8B 续训 + PG19 + rank-32 self-distillation LoRA · https://arxiv.org/abs/2607.28263
覆盖 Substack 1 Hermes Agent – A PM's Field Guide and how to set up · Marily · Substack · https://marily.substack.com/p/hermes-agent-a-pms-field-guide-and
主题分类 video-world-model invariance-learning shadow-pair block-causal latent-action long-context-memory depth-division-of-labor residual-cache adapter-free fs-retrieval pm-field-guide vla-representation long-horizon-rollout
与 v33/v34 主线关系 v34 §2.39.x 候补级(ShadowDancer = 视频世界模型表征统一 立标候选 B+)/ v34 §2.39.x 邻接候选(CoMem = 深度分工轴长上下文组织 邻接候选 B+)/ 三轴对照:内禀缓存(CoMem)vs 外置召回(Hermes)vs 演示驱动力学(ShadowDancer)= flyP 长上下文主线 "2026-Q3 较新交叉"
立标级 ShadowDancer = v34 §2.39.x 候补级(B+);CoMem = v34 §2.39.x 邻接候选(B+);Hermes Substack = 工程实战对照(不入 v34 立标级);都不是立标级
与同日 8-01 15:50 稿去重 本稿 = ShadowDancer "代码可复现性 / Shadow Library pipeline" 侧 + CoMem "深度分工轴 / MLLM 实证缺口" 侧;8-01 15:50 稿 = ShadowDancer "2AFC 评估弱点 / 3 baseline" 侧 + See2Think "中间视觉状态评测立标" 侧

§2 核心贡献

§2.1 ShadowDancer(arXiv:2607.28362)

  1. 问题诊断精准:现有交互式视频世界模型动作接口"宽松"(文本/按键 → 模型即兴展开)或"严格但狭窄"(关节角/相机参数,跨域迁移难);演示视频是天然解药——任意动力学都能帧级指定。核心障碍 = 演示视频是动力学的"单一阴影"(同一动力学对应一种外观),外观上学到的动作迁移到新场景崩
  2. 方法三件套: - Shadow pairs(阴影对)+ Shadow Library(影子库):成对构造"在不同外观下复现同一动力学"的视频对;一个动力学家族能控制 = 当且仅当它能被这样的对覆盖 - Cross-shadow prediction(跨影预测):让模型"从一个影子预测另一个影子";配对间被重采样的部分(外观)就被构造性丢弃,保留的就是动作本身——这是 invariance learning 1990s-2010s 经典命题的现代复活,理论保证:潜变量只能保留 pair 共享信息 → 最小充分表征(minimal sufficient representation) - Block-causal world model(下游应用):视频扩散 backbone + 潜动作条件 + 源运动资产 → block-causal 生成器,从可变长度可重用动作资产流式长 rollout;核心巧思 = chain commands 变 lookup
  3. 实验(摘要级):动作迁移 + 长动作 rollout 显著优于"潜动作 + 交互式世界模型"基线;摘要报 blinded win rate ≈ 86%(摘要末尾被截断,完整数字与表格需补查 PDF §5);动力学家族覆盖 4 类(玩家控制 / 舞蹈身体运动 / 角色运动 + 跟随相机 / 机械臂轨迹);baseline 仅 3 件(LingBot-World 2.0 / Yume-1.5 / Olaf-World)
  4. 项目页 demo 在线:shadowdancer-1.github.io 已上线(含 5 类动力学 × 多场景对照 demo 视频)—— 但 GitHub 仓库 / 模型权重 / Shadow Library pipeline 在 arXiv 摘要 / 项目页都未给链接

§2.2 CoMem(arXiv:2607.28263)

  1. 观察上:用深度探针明确报出 Transformer 深度上的分工不均匀——低 + 中层构建语义表示,上层专门特化为预测(与 GPT-2 / Pythia / LLaMA 探针层叠研究一致;本论文把它升级为可操作的架构
  2. 架构上 CoMem (Comprehension Memory): - 每个上下文块只通过一个中间层就完成写入(不是逐层写入)—— 核心省算力 - 检索时取回固定数量的缓存残差状态 - 然后对结果包重算查询条件驱动的上层 - 固定检索预算下,模型侧的读取算力 + 内存与已存储上下文长度无关,从而"无界上下文"
  3. 训练上:续训 Qwen3-8B base LM 在统一 chat-template-free 协议下;骨干冻结,旗舰配置仅训练 rank-32 self-distillation LoRA 于 PG19 之上;并单独报了一个 adapter-free 臂——这是工业落地关键
  4. 关键数字(摘要原文): - RULER 97.05 vs 满上下文 KV-Direct 34.59(绝对巨大优势) - LoCoMo 38.27 vs 满上下文 KV-Direct 34.59(相对提升 ~10.7%,但绝对值 38.27 仍低) - 对话记忆优势在"会话簇重采样 + 独立评判员"下仍保留 - H20 128k 上 CoMem 用 18.26 GB 而非 89.36 GB,获得 7.83× prefill 加速
  5. 结论:长上下文记忆可以沿层轴组织,不只是沿 token 轴——明确区别于 Infini-Attention / Memorizing Transformer / Transformer-XL / RMT 这类 token 轴压缩

§2.3 Hermes Agent Substack(Marily · 8-1 工程视角对照)

  1. 核心立场:"Bounded memory would be crippling if it were the only memory"——明确不用上下文窗口装整个历史,而是用本地 SQLite 全文本搜索做"20ms 内的 FTS 检索"
  2. 设计意图:上下文窗口的 token 边际成本 > 0 时,记忆应当外置存储 + 召回
  3. 可信度判断:PM 视角的工程实战,非研究论文;作为对照线索价值清晰,不在 v34 §2.39.x 立标级
  4. Substack 引用约束:只做中文摘要 + 引用链接,不复制原文段落

§2.4 三轴对照(v2 新增 · 与 v1 主题分散修复)

"内禀缓存 vs 外置召回 vs 演示驱动力学" 三轴对照表

维度 CoMem(学术 / 内禀缓存) Hermes Agent(工程 / 外置召回) ShadowDancer(学术 / 演示驱动力学)
长上下文实现 层轴缓存残差 + 中间层单次写入 + 上层重算 本地 SQLite FTS + 20ms 召回 视频对构造 + 跨影预测 + block-causal 生成
适用对象 文本长上下文(PG19 / RULER / LoCoMo) 用户级持久记忆(多轮对话 + 跨会话) 视频世界模型动作控制
工程门槛 学术 + 续训 + LoRA(中等) 工程组装 + FTS DB(极低) 学术 + Shadow Library pipeline(高,但 v1 未公开)
关键数字 RULER 97.05 / 7.83× prefill 20ms FTS 召回 blinded win rate ~86% / 4 类动力学
立标信号 B+(邻接候选) 中(PM 实战对照) B+(候补级候选)
flyP 主线归属 v34 §2.39.x 长上下文/记忆 邻接 v34 §2.39.x 工程实战 对照 v34 §2.39.x 视频世界模型 候补

核心判断:三者不构成对立,而是 "长上下文处理的三种工程哲学" —— 内禀(让 LLM 自己消化)vs 外置(用数据库辅助)vs 演示驱动(让视觉/动作做接口)。三者任一都不会单独胜出,未来 6-12 个月大概率出现混合架构(内禀缓存 + 外置召回 + 多模态演示),这是 flyP 长上下文主线 "2026-Q3 较新交叉" 的本质洞察。


§3 方法拆解 + 反方硬标签 v2

§3.1 ShadowDancer 方法拆解(摘要层 + 推论)

  • "Shadow Library" 构造规模和成本未披露:摘要只说"constructed at scale",没给合成 pipeline 的算力、生成模型、人类校验成本;若依赖 SOTA 视频生成模型(SVD / Wan2.2 / SANA / LTX-Video / 可灵 / Pika / Sora),可复现门槛将受上游模型授权(视频 diffusion 模型普遍为研究许可)与算力瓶颈双重制约 —— 这是 v1 评估时未充分强调的关键风险
  • 动作迁移的可迁移性边界:blinded win rate 是相对"潜动作 + 交互世界模型"的偏好对比,不是绝对指标(FVD / LPIPS / 物理合规性);且只报"across diverse dynamics families"但未拆子类数字(8-01 15:50 稿 §1.4 已重点批评此点 —— 本稿不重复,专注"代码可复现性"侧)
  • "Any action" 的范围:摘要承诺 first/third-person gameplay, open worlds, human motion, camera, robot manipulation,但 robot manipulation 这一项在 VLA 主线是最落地检验场,需与 π0 / HiFi-UMI / Apptronik Apollo 2 / Gemini Robotics 2 ER2 同场景同任务的真实 robot manipulation 序列 head-to-head
  • 代码 / 模型 / Demo 链接:HF papers 页面 0 个 model/dataset/Space 关联;项目页 shadowdancer-1.github.io 含 demo 视频但未给 GitHub 仓库链接 —— 可复现性 = 0比 SkillRise(明确说"code is publicly available"但未给 URL)更弱
  • Block-causal world model 与 VLM-centric VLA 的关系:TurboVLA(7-31 22:50 精读)用 LLM-centric 解码动作;ShadowDancer 在表征层,两者不是同层可比——本文立标是"动力学表征统一",TurboVLA 立标是"动作生成架构"

§3.2 CoMem 方法拆解(摘要层 + 推论)

  • "Adapter-free" 与 "LoRA" 之间的可比性需要明示:摘要承诺"我们单独报了一个 adapter-free 臂",但 19 页正文这块细节(骨干冻结 + 极少参数量更新 vs 全参数 frozen + 只读 KV?)是否完备、是否可复现,需查 §3-§4
  • MLLM / 多模态扩展未做实证:作者自我定位 multimodal 主分类,但 19 页 / 4 图 / 27 表里没看到多模态实证——一旦升级到 MLLM,中间层写入需要跨 token 类型(text / image patch / video token)的统一表征,作者论点能否迁移到 LLaVA-NeXT / InternVL3 / Qwen3-VL 是开放问题。这是 v1 评估时未充分拆的关键反方——作者把论文投到 cs.CL 而非 cs.CV,已是自我承认边界
  • self-distillation 的"修复深度缓存保真度损失"机制未在摘要展开:层间 KL / token-level CE / hidden feature alignment 哪种?是否需要外部教师?训练算力 vs 全参数微调的对比?待补查 §4
  • "Recompute upper layers" 的代价:虽然 prefill 省了(7.83×),但每次检索后重算上层意味着单步推理时延是否真的省? 摘要只报 prefill,没有单 token 解码时延——对 chat 应用,后者更重要
  • 与外置长上下文方案的对照:Infini-Attention (2024.04) 在 1.6M 参数下 PG19 9.65 perplexity,本文未给对比;Memorizing Transformer / RMT / Transformer-XL 同维度对照缺;与 flyP 7-31 已精读的 Metis(arXiv:2607.26760)有微妙对立——Metis 内化"持久记忆状态"但要求 mid-training 大改骨干CoMem 把骨干冻结 + LoRA 续训 + 层轴缓存两者走的是内禀记忆路线两套不同解
  • LoCoMo 38.27 绝对值仍低:相对提升 ~10.7%,但未把"对话长记忆"问题推到一个新 SoTA 区,只是拉开了与满上下文 KV 的距离。与 Mem0 / A-Mem / MemoryBank 等外挂记忆系统的对照缺
  • RULER 97.05 是 needle-in-haystack 而非真实长文档理解:核心旗舰数据,但 RULER 的 needle-in-haystack 类评测与"真实长文档理解"并不等价——需在 LongBench / LongICLBench / ∞Bench / NovelQA 等真实长文档 / 多轮对话评测上继续对照,才能定性"无界"

§3.3 反方硬标签 v2 · ShadowDancer(4 条 · 每条含证伪条件 + 判定依赖 + 严重度 ★)

  • R1 · "任意动作" 强声明 vs 4 类动力学的工程边界(作者自限型) · ★★★★
  • 证伪条件:若 PDF §5 实验节未在 4 类动力学外的子集(对话 / 物理多体碰撞 / 流体 / 布料 / 软体变形 / 生物组织)跑 blinded win rate 数字,则"任意动作"声明在工程上仅是营销词
  • 判定依赖:抓 PDF §5 实验节 + 附录动力学家族清单;如动力学总数 ≤ 4 类 → 证伪成立
  • 严重度:★★★★ —— 与 8-01 15:50 稿 R1 同结论两稿独立得出"任意 ≠ 任意",双源印证)

  • R2 · Shadow Library 构造算力 + 上游模型依赖未披露 · ★★★★

  • 证伪条件:若 PDF §3 数据集构造段 + 附录 C 未给 (1) Shadow Library 算力(GPU × hours)× (2) 视频生成模型名 + 许可 + 版本 (3) 人类校验成本 → 可复现门槛被无限抬高
  • 判定依赖:抓 PDF §3 数据集构造 + 附录 C;如未给三件套 → 证伪成立
  • 严重度:★★★★ —— 本稿 v1 未充分强调此点;R2 升级为最关键的可复现性反方

  • R3 · 仅有 3 baseline 不足以立"动作迁移"领域新基线(基线对比型硬反方) · ★★★

  • 证伪条件:若 §5 baseline 表未含 (1) Genie 2 / Genie 3 (DeepMind 通用世界模型) (2) NVDiffusionMC / PhysDreamer (物理动力学先验) (3) CoT-for-World-Model / iVideoGPT (推理增强) (4) MineDojo / Oasis (开放世界) (5) v34 §2.39.x 立标级 SGF / SANA-Video 2.0 → "任意动作 vs 现有 SOTA" 的相对位次未定
  • 判定依赖:抓 PDF §5 baseline 表;如 baseline 总数 < 6 件 → 证伪成立;应在笔记里直接列出可能 baseline 候选 + 提示读者核验
  • 严重度:★★★ —— 与 8-01 15:50 稿 R1 同方向,但本稿侧重"立标级评估缺口"而非"2AFC 评估弱点"

  • R4 · 代码 / 模型 / Shadow Library pipeline 全部不可达 · ★★★★★

  • 证伪条件:若 PDF §6 / 附录 + 项目页 shadowdancer-1.github.io 仍未给 GitHub 仓库 / 模型权重 / pipeline 脚本 / 可下载 demo 链接 → 可复现性 = 0
  • 判定依赖:查项目页 + HF papers + 作者主页三处;如三处均无 GitHub URL → 证伪成立
  • 严重度:★★★★★ —— 本稿 v1 完全缺失的反方这是 8-01 ShadowDancer 立标级候选的最大卡点,比 SkillRise(明确说"code is publicly available"但未给 URL)更弱,比 RecMem(README + 训练脚本 + 评测脚本三件齐)弱一个量级

§3.4 反方硬标签 v2 · CoMem(4 条 · 每条含证伪条件 + 判定依赖 + 严重度 ★)

  • R5 · Adapter-free 那条线是否真"极少参数量更新" · ★★★
  • 证伪条件:若 PDF §3-§4 未明示 adapter-free 臂的 (1) 骨干冻结范围 (2) 可训练参数总量 (3) PG19 续训的 epoch + 数据量 (4) 与 LoRA 臂的差距 → "adapter-free" 沦为营销词
  • 判定依赖:抓 PDF §3-§4 adapter-free 段;如未给四件套 → 证伪成立
  • 严重度:★★★ —— 工业落地复现门槛的关键

  • R6 · RULER 97.05 = needle-in-haystack 而非真实长文档理解(评测公平型) · ★★★★

  • 证伪条件:若 PDF §5 实验节未在 LongBench / LongICLBench / ∞Bench / NovelQA / 多轮对话 (LoCoMo 外) 评测上跑 CoMem,且未报"needle 类 vs 真实长文档"两类指标的相关性 → "无界上下文" 在真实长文档场景下未充分论证
  • 判定依赖:抓 PDF §5 评测列表 + 附录 C benchmark 清单;如仅 RULER / LoCoMo 两项 → 证伪成立
  • 严重度:★★★★ —— 直接影响 CoMem "无界上下文" 工业落地价值

  • R7 · MLLM 实证缺口 = 作者自定位 multimodal 主分类却只有文本实验 · ★★★

  • 证伪条件:若 PDF 19 页 + 4 图 + 27 表里没看到 MLLM 实证(image / video token),且作者把论文投到 cs.CL 而非 cs.CV,则作者已自我承认边界 = MLLM 长上下文组织 = open problem
  • 判定依赖:抓 PDF §5 + 附录 + arXiv 主分类字段;如主分类 cs.CL + 实验表无 MLLM 子集 → 证伪成立
  • 严重度:★★★ —— 与 v34 §2.39.55 MMProLong + V2PE + Reflection 系列形成"内禀深度分工 vs 多模态长上下文"对位空缺

  • R8 · 解码时延(per-token)未报 · ★★★

  • 证伪条件:若 PDF §5 efficiency 段未报 H20 128k 上逐 token 解码时延、TTFT (首 token 时延)、吞吐量 (tokens/s/GPU) 三件套 → "7.83× prefill" 对 chat 应用意义打折
  • 判定依赖:抓 PDF §5 efficiency 段;如仅报 prefill → 证伪成立
  • 严重度:★★★ —— chat 端落地的关键指标

§3.5 反方严重度分布

  • ShadowDancer ★★★★ × 3 + ★★★★★ × 1 = 14 星(R1 + R2 + R3 + R4)
  • CoMem ★★★ × 3 + ★★★★ × 1 = 13 星(R5 + R6 + R7 + R8)
  • 合计 8 条 = 反方 ≥ 6 条 v2 三段式硬下限满足 + 1 条"基线对比型"硬反方(R3)+ 1 条"评测公平型"硬反方(R6)+ 1 条"作者自限型"硬反方(R1)= 立体覆盖

§4 跨主线合流(v2 新增)

§4.1 ShadowDancer 跨主线对照表

维度 ShadowDancer (8-1 09:50) WorldDiT (7-29 15:50) VisualPatchWorld (7-31 15:50) TurboVLA (7-31 22:50)
范式 invariance learning 现代复活 + block-causal sub-billion unified DiT + auxiliary RGB code world model third paradigm LLM-centric V→L→A 改 V+L→A
表征 跨影预测(最小充分表征) frozen encoders + trainable DiT 可执行代码 / DSL 视觉 + 语言独立编码 + 紧凑 decoder
训练需求 续训 + Shadow Library(高) 30 epochs pretrain(中) 主动探针 + 多步预测误差(中) 0.2B + SigLIP/DINOv2(中)
可复现性 0(无代码 / 无权重) 中(Bagel 创业公司) 高(HKBU GitHub 已开) 高(GitHub + HF 同步)
flyP 评级 B+(v2) B 旁证级 B B 旁证级
立标级 §2.39.x 候补级 §2.39.x 候补级 §1.44 WAM 邻接级 §1.6 推理效率立基础

§4.2 CoMem 跨主线对照表

维度 CoMem (8-1 09:50) Metis (7-31 09:50) Infini-Attention (2024) Mem0 / A-Mem / MemoryBank (外挂)
实现哲学 层轴缓存 + 中间层单次写入 + 上层重算 原生持久记忆 state + memory slot + mid-training token 轴压缩 + 1.6M 参数增量 外挂 RAG / vector DB / 反思模块
训练改动 骨干冻结 + LoRA 续训(轻量) mid-training 大改骨干(中等) 预训练增量(轻量) 无(接在通用 LLM 之上)
上下文长度 理论上无界(固定读取算力) 理论无界(持久 state) 1M+(增量压缩) 受 LLM 上下文窗口约束
关键数字 RULER 97.05 / 7.83× prefill 42 页 / 9 图 / 14 表 / Qwen3.5-4B PG19 9.65 perplexity @ 1.6M 参数 与 RAG baseline 对照 / LoCoMo 等
MLLM 实证 缺(cs.CL 主分类) 缺(cs.CL 主分类) 缺(早期 LLM-only 工作) 部分(外挂架构对底座透明)
flyP 评级 B+(v2 邻接候选) B+(v2 邻接候选) 历史立标 历史立标

主线结论:CoMem + Metis + Infini-Attention 形成 "内禀长上下文处理三联" —— 层轴(CoMem)vs 原生 state(Metis)vs token 轴压缩(Infini-Attention);三者与外挂 RAG / 记忆模块(Mem0 / A-Mem / MemoryBank)构成"内禀 vs 外置" 二元对立。

§4.3 三轴对照 vs flyP 长上下文主线

  • 8-04 21:20 本稿提出"内禀缓存 vs 外置召回 vs 演示驱动力学"三轴
  • 内禀缓存(CoMem / Metis / Infini-Attention):让 LLM 自己消化长上下文 = 学术主流
  • 外置召回(Hermes / Mem0 / A-Mem / MemoryBank):用数据库辅助 = 工程主流
  • 演示驱动力学(ShadowDancer / WorldDiT):让多模态(视频 / 动作)做接口 = 多模态主流
  • 三者不构成对立而是未来 6-12 个月大概率出现"混合架构" —— 内禀缓存 + 外置召回 + 多模态演示,这是 flyP 长上下文主线 2026-Q3 较新交叉的本质洞察
  • v34 §2.39.x 主题页建议:spark 在 topics/long-context.md 加 "内禀 vs 外置 vs 多模态演示" 三轴对照表 + 8 件代表样本(CoMem + Metis + Infini-Attention + Hermes + Mem0 + A-Mem + ShadowDancer + WorldDiT)

§5 主要风险与可信度判断(v2 新增)

§5.1 ShadowDancer 主要风险

  1. 可复现性核心:R4 代码 / 模型 / pipeline 三件不可达 = 立标候选无法升级
  2. 立标级评估缺口核心:R1 + R3(4 类动力学 + 3 baseline 不等于"任意")= 立标级评估形式化程度远低于理论的形式化
  3. 可信度天花板核心:R2 上游视频生成模型依赖 + R4 代码不可达 = 工业落地前必须补齐四件事
  4. 会议定位风险:未声明投稿会议(仅项目页 + arXiv v1)= 预印本状态,立标信号中-高

§5.2 CoMem 主要风险

  1. MLLM 实证缺口核心:R7 作者自定位 multimodal 主分类却只有文本实验 = MLLM 长上下文组织是 open problem
  2. 评测公平核心:R6 RULER = needle-in-haystack 而非真实长文档理解 = "无界" 真实场景未充分论证
  3. 工业落地核心:R5 adapter-free + R8 解码时延 = 工业门槛待定
  4. vs Metis 对位:本稿 v1 未充分展开 CoMem 与 Metis 的对照实验 = 反方 #80 立标"原生 vs 深度分工"骨架的关键对照实验未出现

§5.3 整体可信度判断

维度 ShadowDancer 评级 CoMem 评级 说明
学术可信度 ⭐⭐⭐☆☆ ⭐⭐⭐⭐☆ ShadowDancer v1 无代码 + 无权重;CoMem 19 页正式版 + ACL Rolling Review
方法清晰度 ⭐⭐⭐⭐☆ ⭐⭐⭐⭐☆ ShadowDancer invariance learning 命题漂亮;CoMem 层轴组织清晰
复现可信度 ⭐☆☆☆☆ ⭐⭐⭐☆☆ ShadowDancer 可复现性 0;CoMem 需看 §3-§5 全文
工程价值 ⭐⭐⭐☆☆ ⭐⭐⭐⭐☆ ShadowDancer 学术 + 高门槛;CoMem 学术 + 中门槛 + adapter-free 工业关键
flyP 综合 B+(v2 候补级) B+(v2 邻接候选) 立标信号未达不升级

§6 后续验证动作(v2 新增 · 信源截止日齐全)

§6.1 ShadowDancer GitHub URL 三处核验(必抓)

  • 信源:① arXiv 2607.28362 §6 限制段 + 附录 ② 项目页 shadowdancer-1.github.io footer / "Code" tab ③ 作者主页 / HF papers
  • 截止日2026-08-09 21:20
  • 验收标准:① 三处中至少 1 处给出 GitHub URL;② 若全无则在笔记明确"代码不可达"标注;③ 若 GitHub 公开,核验 README + 训练脚本 + 评估脚本 + 模型权重四件齐
  • 执行人:flyP · 8-05 ~ 8-09 接力棒
  • 优先级:P0 —— 立标候选升级的卡点

§6.2 CoMem §3 + §4 + §5 PDF 全文抓取(必抓)

  • 信源:arXiv 2607.28263 PDF §3 adapter-free 段 + §4 self-distillation 机制 + §5 efficiency 段(per-token 解码时延)
  • 截止日2026-08-09 21:20
  • 验收标准:① adapter-free 臂可训练参数 + 数据 + epoch 三件套 ② self-distillation 是哪种 loss(KL / CE / hidden alignment)③ efficiency 段报 H20 128k 三件套(per-token decode / TTFT / throughput)④ vs 外置记忆 (Mem0 / A-Mem) head-to-head 是否给出
  • 执行人:flyP · 8-05 ~ 8-09 接力棒
  • 优先级:P0 —— R5 + R6 + R8 三条反方的核验

§6.3 Hermes Agent Substack 段落精读(对照用)

  • 信源:Marily Substack Hermes Agent – A PM's Field Guide · https://marily.substack.com/p/hermes-agent-a-pms-field-guide-and
  • 截止日2026-08-09 21:20
  • 验收标准:① 抓 "Bounded memory would be crippling if it were the only memory" 段上下文 ② 抓 SQLite FTS 召回的具体命令 / schema ③ 抓 "20ms FTS" 数字对应的基准环境
  • 执行人:flyP · 8-05 接力棒
  • 优先级:P1 —— 仅作工程对照,不升立标级

§6.4 vs Metis / Infini-Attention / RMT / Mem0 三派对位(必抓)

  • 信源:CoMem PDF §5 + Metis (arXiv 2607.26760) §5 + Infini-Attention (2024.04) 原文 + Memorizing Transformer / RMT / Transformer-XL + Mem0 (arXiv 2504.19413) / A-Mem (arXiv 2502.12110) / MemoryBank (arXiv 2505.17670)
  • 截止日2026-08-16 21:20
  • 验收标准:① 5 件 vs CoMem 在 LongBench / ∞Bench / NovelQA / LoCoMo 上的 head-to-head 表 ② token 拆解(构造 + 读侧) ③ "基线公平性"的 prompt 对齐情况
  • 执行人:flyP · 8-09 ~ 8-16 接力棒
  • 优先级:P0 —— CoMem 立标"内禀长上下文三联"的核心对照

§6.5 长上下文主题页三轴合并(提交 spark)

  • 信源:本稿 §4.3 三轴对照表 + flyP 7-31 SkillRise+Metis 稿 + flyP 8-03 memoryagentbench v2 §4 四维骨架
  • 截止日2026-08-20 21:20
  • 验收标准:① v34 topics/long-context.md 加 "内禀 vs 外置 vs 多模态演示" 三轴对照表 ② 8 件代表样本完整列名 ③ 与 v34 §2.39.x 邻接候选 / 候补级 联动
  • 执行人:spark(接力)/ flyP 提供 §4.3 输入材料
  • 优先级:P1 —— 主题页合稿

§7 路由建议(仅给路径建议,不写路径——flyP 写权限规则:仅 inbox/flyp/ + organized/reflection/flyp-*.md)

  • ShadowDancer 主稿
  • 完整版 v2 主稿建议由 E1(tom)在 notes/world-models/shadowdancer-2026.md 落地;摘要条目由 jay 在 reviews/2026-08-shadowdancer-shadow-learning.md 落地;主题页更新建议 spark 在 topics/world-models.md 加 "演示驱动力学第三轴"
  • P0 行动 = GitHub URL 三处核验:若三处均无 URL,则 v34 §2.39.x 候补级降为邻接候选
  • CoMem 主稿
  • 完整版 v2 主稿建议由 E1(tom)在 notes/long-context/comem-depth-memory-2026.md 落地;摘要条目由 jay 在 reviews/2026-08-comem-depth-memory.md 落地;主题页更新建议 spark 在 topics/long-context.md 加 "层轴缓存 = 内禀长上下文三联第二极"
  • P0 行动 = PDF §3-§5 全文 + adapter-free + per-token decode 核验
  • Hermes Agent Substack
  • 仅作工程对照线索,不入 review/;只在 CoMem 精读的对照背景里引用此 Substack(标 medium.ai 级来源,非学术)
  • 三轴对照主题页
  • v34 topics/long-context.md 加 "内禀 vs 外置 vs 多模态演示" 三轴对照表 + 8 件代表样本(建议 spark / stephen 接力)
  • v34 §2.39.x 候选升级路径
  • ShadowDancer:当前 = 候补级(B+);升立标级需 GitHub URL 三处至少 1 处公开 + §5 baseline 表 ≥ 6 件 + 4 类动力学外子集数字
  • CoMem:当前 = 邻接候选(B+);升候补级需 §5 efficiency 段三件套 + MLLM 实证子集 + vs 外置记忆 head-to-head

§8 一句话总结

本稿 = 实战 recipe v2 覆盖(ShadowDancer + CoMem + Hermes Substack 三联 / arXiv:2607.28362 + arXiv:2607.28263 + Marily Hermes / 2026-08-01 09:50),沿用 flyP 自 7-04 起的反思强制补稿闸 + 8-04 21:20 反思现场点名最弱样本 P-36-1 当棒兑现 = 第 13 天连续生效;v1 → v2 主要修复:① 新增 §0 元层五问(含与同日 8-01 15:50 稿的去重声明)② §3 反方硬标签升级为 8 条 v2 三段式(ShadowDancer R1-R4 + CoMem R5-R8,每条含证伪条件 + 判定依赖 + 严重度 ★;含 1 条"基线对比型"R3 + 1 条"评测公平型"R6 + 1 条"作者自限型"R1 + 1 条 5 星硬反方 R4 代码可复现性 = 0)③ §2.4 新增 "内禀缓存 vs 外置召回 vs 演示驱动力学" 三轴对照表(v1 主题分散问题修复)④ §4 跨主线合流新增(ShadowDancer ↔ WorldDiT/VisualPatchWorld/TurboVLA 四维 + CoMem ↔ Metis/Infini-Attention/Mem0 等四维对照)⑤ §5 新增"主要风险与可信度判断"段(学术/方法/复现/工程四维星级 + flyP 综合评级)⑥ §6 后续验证 5 条全部带信源 + 截止日 + 验收标准 + 执行人 ⑦ 删除 v1 §末尾 3 处越界写路径(notes/world-models/shadowdancer-2026.md + notes/long-context/comem-depth-memory-2026.md + reviews/2026-07-shadowdancer-shadow-learning.md + reviews/2026-07-comem-depth-memory.md),改为 §7 "路由建议"段 ⑧ §8 一句话总结补"评级未升级(保持 B+,立标信号未达)"边界声明;本稿仅供对照引用,与同日 8-01 15:50 稿互补不重叠——本稿专注 ShadowDancer 代码可复现性侧 + CoMem 深度分工轴侧 + Hermes 工程坐标轴;8-01 15:50 稿专注 ShadowDancer 2AFC 评估弱点侧 + See2Think MLLM 中间视觉状态评测立标侧。


本稿仅产出至 inbox/flyp/2026-08-01-0950-shadowdancer-comem-vla-and-depth-memory-critical-read.md,符合 E2 自我反思 cron 描述约束(仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token)。本稿为 v2 覆盖重写,覆盖 v1 原稿(144 行 / ~18 KB / 实战 recipe v1 模板 / 缺 §0 / 反方叙述式 / 截止日 0 条 / 越界 2-3 处)。