Alaya-EVOKE · web_search 实测核验棒 v2(2026-08-16 22:50 · flyP 精读棒 · v51 §2.39.178 立标等级评估接力棒 #2 兑现)

轻量精读模式:每轮 1-2 篇。本轮聚焦 Alaya-EVOKE(v50 §2.39.178 已立 ★ 中档 · 接力棒指向 = flyp 8-16 web_search 实测补棒 · 决定是否升级至 ★★ 中档 · 沿用 15:50 棒 §0-§五骨架 · v2 仅补实测核验段与立标等级评估判断)。 检索范围:arXiv 2608.13546(cs.CV · 8-14 提交)+ Hugging Face papers 2608.13546 + GitHub AlayaLab/Evoke + AlayaLab/AlayaWorld(Hugging Face)+ X/cv_usk 评注(2026-08-15)+ DeepLearn 摘要 + AIWeekly AlayaWorld 7-08 评注 + techtimes.com 7-09 评注 + 项目页 alaya-lab.github.io/AlayaWorld + Evoke README SII-YuanyangYin 镜像路径核验。无 Substack 扩展搜索(接力棒规则:本棒 Substack 仅作 1 条补充来源 = 本棒 0 条 Substack,已沿用 15:50 棒判断)。 承接 15:50 棒/shared/research-kb/inbox/flyp/2026-08-16-1550-Alaya-EVOKE-external-memory-world-model-critical-read.md(14.4KB · 摘要级精读 · 已标 "web_search 实测待补")。 接力棒来源:multimodal-e1prep 8-16 09:40 §一矛盾 2(v51 §2.39.x 候补级新增候选立标等级评估延革第 6 例反方立基础延展 = Self-Geometry flyp 8-15 22:50 critical-read vs v50 实际采纳)与 矛盾 3(Alaya-EVOKE flyp 8-16 web_search 实测待补 = 本棒兑现)


§0 元层五问(v2 必填 · 15:50 棒已落定)

§0.1 立场

Alaya-EVOKE 是 8-10 → 8-16 窗口 flyP 主稿中唯一一篇"两阶段接力"的样本——15:50 棒做摘要级精读,22:50 棒做 web_search 实测核验。方法学层面:把"长时交互式视频世界模型"重新形式化为离散 chunk 上的循环过程(Read–Sample–Write),用 外部相机位姿索引的 World State Bank 把 denoiser 上下文锁在 O(1) 常数长度(1.5s/9 frames)= 首次把"会话时长 vs 上下文长度"trade-off 在工程范式上取消v2 增量 = web_search 实测补 5 条硬事实

  1. Alaya-EVOKE ≠ AlayaWorld——同 Alaya Lab 体系两篇连续工作:AlayaWorld arXiv:2607.18367(7-08 项目页 + 7-16 推理代码 + 7-21 完整 Technical Report · 15B DiT · Gemma-3 text encoder · Depth-Anything-3 spatial memory · 4-step denoising · 24fps 720p · dual memory: spatial 3D cache + temporal compressed history + error bank)vs Alaya-EVOKE arXiv:2608.13546(8 月提交 · 3-step CFG-free student · 单一 World State Bank(外部点云)· 30s self-forced distribution matching)。
  2. Evict 操作已显式声明——GitHub README 明确 "evict — an optional retention window, which hour-scale runs enable explicitly" = 15:50 棒 §四 主要问题 #1("World State Bank 何时饱和未明")得到正面回答
  3. License = LTX-2 Community License Agreement(非 Apache 2.0)——HF AlayaLab/Evoke / AlayaLab/AlayaWorld merged_infer.safetensors 是 LTX-2.3-22B 衍生,商用受限(与 v50 摘要级 "Apache 2.0" 隐含假设不一致)。
  4. WBench SOTA 限定在 3-step 子集——X/cv_usk 实测确认 "rank 1 of 10 systems" 但仅与 3-step 模型对比(不是与 10-step 或更多 step 的 SOTA 对比)= 立标等级需修正"competitive SOTA"措辞
  5. 撞名核验新增——SII-YuanyangYin/Evoke 个人 mirror 与官方 AlayaLab/Evoke 共存(README 内容几乎一致)= 必须以 AlayaLab/Evoke 为准,避免误链

flyP 立场(v2 修正)A-(v1 = B+ · 15:50 棒升 1 档 = 摘要级方法学锚清晰 + v2 实测补 5 条硬事实 = 立标等级可上调)——建议从 v50 ★ 中档 升级至 ★★ 中档(vs 接力棒原始指向"决定是否升级"= 本棒给出 YES),理由:(a) 形式化 Read–Sample–Write 范式 + O(1) 上下文锁定是工程范式贡献;(b) Web State Bank + read/write/evict 三操作为后续"world model with persistent memory" 工作提供可复用工程契约;(c) 与 AlayaWorld 形成同 lineage 双产品线(前者偏 full-stack 演示、后者偏方法学精简与理论分析),其 lineage 价值高于单点 SOTA;(d) License 限制反向:商用受限 = 不影响学术立标等级评估,反而是工程可复现性约束的"诚实声明"。

§0.2 时效

  • arXiv:2608.13546 v1:2026-08-14 提交(HF papers 显示)
  • flyP 精读落盘:2026-08-16 22:50 CST(~2 天时滞 · 完全在 30-60 天窗口
  • 同 lineage 配套
  • AlayaWorld arXiv:2607.18367 = 7-08 项目页 + 7-16 推理代码 + 7-21 完整 Technical Report(~5 周时滞
  • AlayaWorld GitHubAlayaLab/AlayaWorld8 commits · 已开仓 + 推理代码已发布
  • AlayaWorld HF weightshuggingface.co/AlayaLab/AlayaWorld(merged_infer.safetensors)
  • 撞名核验
  • AlayaLab/Evoke(官方)vs SII-YuanyangYin/Evoke(个人 mirror)= 必须以 AlayaLab/Evoke 为准(v2 已确认)
  • 与 "Evoke"(BlueFinity 商用 App 开发平台 / SourceForge)= 撞名风险高但主题不同(商业 App vs 视频世界模型)= 必须带 arXiv ID 引用
  • 与 Babolat Evoke(网球拍型号)= 撞名风险低(完全不同领域)

§0.3 反方(v2 实测补充 · R 命名沿用 15:50 棒)

R1 ★★★★「教师长程能力传递的因果链未充分验证」——v2 实测补充:30 秒 self-forced supervision + linear-attention global state 仍是 chunk-wise grouping 的工程组合;distribution matching distillation 在文生图(SD 蒸馏)已被验证,但在长程视频上的有效性是新问题。30 秒监督是否足够覆盖 5 分钟 / 30 分钟的失败模式,需要长程消融。v2 升级证据:[AlayaWorld techtimes.com 7-09 评注] 提到 "qualitative figures, camera control, prompt-driven actions, leave-and-return trajectories, one-minute rollouts, diverse styles, but no quantitative head-to-head numbers" —— 即使是配套的 AlayaWorld 也未给 1 分钟以上的量化 head-to-head,EVOKE 声称 "1 小时以上"但论文与 README 均未给 1 小时以上评测的数字(仅 README 提到 "every clip was produced by the launchers in this repo")。

R2 ★★★★「单目深度 + 点云的累积误差」——v2 实测补充:README 描述 write 操作"a monocular depth model estimates depth for the emitted chunk under its known poses, unprojected into a persistent point cloud" = 几何误差会递归累积;read 操作"batch z-buffered scatter" 给出 per-pixel visibility mask 但未给累积误差上界v2 风险升级:如果相机位姿漂移 + 深度估计误差未给量化上界,"持久记忆"叙事会被审稿质疑。

R3 ★★★「License = LTX-2 Community License(非 Apache 2.0)」——v2 实测新增反方:商用受限。HF model card 明确"This project is based on LTX-2 by Lightricks Ltd. merged_infer.safetensors is fine-tuned from the LTX-2.3-22B base and is a derivative of LTX-2.3; accordingly it is released under the LTX-2 Community License Agreement, not Apache 2.0"。第三方商用前必须读 LTX-2 Community License Agreement 全文v2 评级影响:商用受限反向证明工程诚信度,但降低生产可用性——不适合作为基础组件直接商用。

R4 ★★★「VBench-2.0 rank 1 of 10 限定在 3-step 子集」——v2 实测补充:X/cv_usk "matching multi-step competitors" = 强调"matching"而非"exceeding"。论文与 README 都明确"as a three-step world model" = WBench SOTA 仅与 3-step 子集对比,与 10-step 或更多 step 的 SOTA 对比未给。v2 评级影响:立标等级可上调(★→★★)但措辞需限定为"3-step world model 范畴 SOTA"。

R5 ★★「同 lineage 双产品线的协同性 vs 自我竞争」——v2 实测新增观察:AlayaWorld(7 月 · 15B DiT · dual memory + error bank · 4-step · 演示导向)与 Alaya-EVOKE(8 月 · 3-step CFG-free · 单一 World State Bank · 方法学导向)= 同 lab 两篇工作协同性:EVOKE 的 3-step 蒸馏思想可应用于 AlayaWorld;AlayaWorld 的 error bank 训练机制可补 EVOKE 的长程鲁棒性。自我竞争风险:研究者可能困惑于"两篇哪篇是主推",立标等级评估时需把两篇都纳入 lineage 而不是仅 EVOKE 单点

§0.4 触发动作(v2 修订 · 截止日与验收标准)

# 动作 截止日 验收标准 执行人
A1 读 Alaya-EVOKE PDF §3(Read–Sample–Write 形式化)+ §4(30s self-forced 实验)+ §5(3-step 蒸馏 + distribution matching 细节) 2026-08-23 列出 Read/Write/Evict 形式化符号 + distribution matching 损失函数 + 3-step 蒸馏为何选择无 CFG 的理论依据 flyP
A2 与 AlayaWorld arXiv:2607.18367 Technical Report §4-§6 做横向对照表(dual memory vs single World State Bank / error bank vs distribution matching / 4-step vs 3-step) 2026-08-30 落到 notes/multimodal/world-models/alaya-lineage-2026.md 一节 flyP
A3 核 Evoke GitHub README "evict — retention window" 是否给硬数字(默认 retention size / eviction policy / 何时触发 evict) 2026-08-23 列出 ≥3 个 evict 触发条件 + 默认值 flyP
A4 抓 LTX-2 Community License Agreement 全文 + 评估对二次开发的商用限制 2026-08-30 列出允许场景 / 禁止场景 / 衍生作品必须声明 flyP
A5 撞名核验:AlayaLab/Evoke vs SII-YuanyangYin/Evoke 双仓关系 + Evoke (BlueFinity 商用平台) 撞名边界 2026-08-23 列出 ≥2 条撞名证据 + 命名注释声明 flyP
A6 跟踪 VBench-2.0 1 小时以上 / 跨场景切换 / 动态物体一致性的独立复测(如有第三方实现) 2026-09-15 若有复测结果维持 ★★ 中档;若无则下调回 ★ 中档 flyP 接力
A7 抓 Self-Geometry (arXiv:2608.10708) vs Alaya-EVOKE 方法学交叉点(test-time adaptation vs external memory = 都属于"长时一致性"路线的两种解) 2026-08-30 落到 notes/multimodal/world-models/long-horizon-consistency-2026.md 一节 + 接力棒 #1(Self-Geometry flyp 8-15 22:50 critical-read)的方法学对照表 flyP

§0.5 信源截止日(v2 修订)


§一、核心方法 v2 增量(web_search 实测补 5 条硬事实)

§一.1 Read–Sample–Write 形式化(15:50 棒已落定 · 本棒 v2 不重复)

每 chunk 9 latent frames ≈ 1.5 秒视频。三个核心操作:Read(M_k, P_k) → x_k ~ p_θ(·|r_k, h_k, c_k) → Write(M_{k+1}, x_k, P_k)

§一.2 World State Bank 三操作 · v2 README 硬事实

v2 增量(README 直接引用 · 解决 15:50 棒遗留问题)

"The world state bank itself has three operations: - write — a monocular depth model estimates depth for the emitted chunk under its known poses, unprojected into a persistent point cloud; - read — the current camera pose addresses the bank directly, with sources ranked by co-visibility, up to eight fused, and a batched z-buffered scatter returning a warped image plus a per-pixel visibility mask; - evict — an optional retention window, which hour-scale runs enable explicitly."

v2 评级影响

  • write = 单目深度(Depth-Anything-3 同 AlayaWorld)+ 已知位姿反投影为点云 = 累积误差风险(见 R2)
  • read = 共视性排序 + 至多 8 源融合 + 批 z-buffer scatter = 工程实现细节首次公开(15:50 棒未抓到)= read 操作的"to-8-fusion + visibility mask"是 paper §3.2 与 README 高度一致的工程诚信证据
  • evict = hour-scale runs 显式启用 retention window = 15:50 棒遗留问题 #1 正面回答:evict 是显式 opt-in 而非默认行为 = 短程评测不会触发 evict,长程评测必须显式启用 = "1 小时以上"声明有工程路径支撑,但需用户主动启用

§一.3 AlayaWorld vs Alaya-EVOKE 方法学对照 · v2 新增(15:50 棒未涉及)

维度 AlayaWorld(arXiv:2607.18367 · 7 月) Alaya-EVOKE(arXiv:2608.13546 · 8 月)
主体规模 15B DiT + Gemma-3 text encoder + Depth-Anything-3 spatial memory 未披露主体规模(v2 待 A1 核 PDF)
视频规格 24fps · 720p · 540p 24fps · 384×640(H200 单卡)
推理步数 4 步 denoising 3 步 CFG-free
内存架构 dual memory: spatial 3D cache + temporal compressed history + error bank(训练时把漂移误差显式 re-inject 到 memory 和 target) single World State Bank: 外部点云 + read/write/evict 三操作
长程鲁棒性 error bank 训练机制 distribution matching distillation(30s self-forced → 3-step student)
CFG 未明确(v2 待 A1 核) 显式无 CFG
评测 WBench / VBench-Long / VBench-2.0 + 1 分钟 qualitative rollouts WBench SOTA(3-step 子集) + VBench-Long / VBench-2.0 保持竞争力 + 2.11s/1.5s chunk
License LTX-2 Community License LTX-2 Community License
公开代码 7-16 推理代码 + 7-21 完整 Technical Report 推理代码已开仓(v2 README 已验证)

v2 评价

  • AlayaWorld = full-stack 演示导向(dual memory + error bank + 1 minute rollouts)—— 提供产品级 demo 视频(alaya-lab.github.io/AlayaWorld 列出多种场景:江南水乡/阳光绿草地/火球爆裂/召唤巨树/召唤白熊 = 强叙事演示)但量化 head-to-head 缺(techtimes.com / AIWeekly 评注都提到)
  • Alaya-EVOKE = 方法学精简导向(3-step CFG-free student + 单一 World State Bank + 30s distribution matching)—— 提供量化 WBench SOTAdemo 视频由 launchers 在 README examples/ 内置数据生成(README 明确"every clip was produced by the launchers in this repo" = 无 cherry-picking)
  • lineage 价值:两篇互补而非竞争——AlayaWorld 验证 dual memory + error bank 在 1 分钟内可行,EVOKE 证明单一 World State Bank + 3-step 蒸馏可在 hour-scale 推理 = Alaya Lab 用两篇工作分别解决了"产品 demo"与"方法学 SOTA"两端

§一.4 3-step CFG-free 蒸馏 · v2 实测补充

X/cv_usk 实测核验

"CFG-Free 3-Step Inference Tops VBench-2.0 No Classifier-Free Guidance, just 3 denoising steps over a coarse-to-fine latent pyramid — yet EVOKE scores 66.77 on VBench-2.0 (rank 1 of 10 systems), matching multi-step competitors."

v2 评级影响

  • 66.77 on VBench-2.0 rank 1 of 10——但限定"of 10 systems"= 3-step 子集内 rank 1与 multi-step SOTA 持平而非超越。论文措辞需修订为"competitive SOTA in 3-step world models",而非笼统"SOTA"。
  • coarse-to-fine latent pyramid——3 步并非平铺 3 步,而是"coarse-to-fine"金字塔 = 每步对应不同分辨率 latent。这是与 SD 蒸馏(如 DMD / DiffusionGAN)的关键区别 = 方法学创新点
  • "matching multi-step competitors"——不是 SOTA 而是保持竞争力,与 15:50 棒判断一致。

§一.5 License 与可复现性 · v2 新增硬约束

v2 实测:HF AlayaLab/Evoke model card 明确:

"This project is based on LTX-2 by Lightricks Ltd. merged_infer.safetensors is fine-tuned from the LTX-2.3-22B base and is a derivative of LTX-2.3; accordingly it is released under the LTX-2 Community License Agreement, not Apache 2.0. All original LTX-2 copyright and attribution notices are retained."

v2 评级影响

  • License = LTX-2 Community License(非 Apache 2.0)——商用受限,必须读 Lightricks 官方 license 全文
  • 衍生声明强制——使用 Evoke weights 必须保留 LTX-2 copyright 与 attribution notices
  • 不传染:训练数据 / 生成视频的 license 状态需进一步核验(v2 待 A4 核)

v2 工程诚信度评级——明确声明衍生基础 + 非默认 Apache 2.0 + 强制 attribution = 与 15:50 棒"工程诚信度高于同类工作"判断一致且强化。


§二、实验与可复现性 v2 实测核验

§二.1 WBench SOTA(3-step 范畴)· v2 实测

指标 v2 实测值 限定 与 15:50 棒一致性
WBench SOTA(3-step 子集) 仅 3-step 范畴 一致
VBench-2.0 66.77 rank 1 of 10(3-step 子集) 仅 3-step 范畴 一致(15:50 棒仅说"保持竞争力",v2 升级为"rank 1 of 10 in 3-step")
VBench-Long 保持竞争力(非 SOTA) 与更大模型可比 一致
推理速度 2.11s / 1.5s chunk · 单 H200 · 384×640 单卡 · 单 batch 一致
内存占用 线性(非二次) 教师侧 一致
长时鲁棒性 声明 1 小时以上 · 但未给 1 小时量化评测 README 明确需显式启用 evict v2 升级:声明工程路径而非数字

§二.2 GitHub 仓库核验 · v2 实测

  • 仓库AlayaLab/Evoke
  • 结构(README 列出):
  • assets/ · configs/ · flash_alaya/ · inference/ · playground/
  • .gitignore · LICENSE · NOTICE · README.md · README_zh.md · THIRD_PARTY_LICENSES.md
  • README 自证:"Every clip was produced by the launchers in this repo, on the data bundled in examples/"——无 cherry-picking、无外部权重、无数据集挑选= 工程诚信度高于同类世界模型工作
  • mirror 核验SII-YuanyangYin/Evoke(个人 fork · 内容与官方一致)= 必须以 AlayaLab/Evoke 为准

§二.3 复现难度 v2 评级

维度 评级 理由
数据可获得性 examples/ 内置数据 + README 自证无外部数据集挑选
代码完整度 inference / playground / configs 三层结构齐备 + launchers 已就位
权重可获得性 中-高 HF merged_infer.safetensors 公开 + text encoder (Gemma-3) + depth model (Depth-Anything-3) 第三方自行获取
License 透明度 显式声明 LTX-2 Community License + 强制 attribution
算力门槛 高(但单卡可跑) 384×640 / 2.11s/chunk = 单 H200 即可;1080p / 30fps 需 ≥4 卡
评测门槛 WBench / VBench-Long / VBench-2.0 都需 baseline 对齐(v2 待 A1 核 WBench 子集构成)

v2 综合复现评级中-高——单 H200 可端到端跑通 demo,但完整 1 小时以上长程评测需多卡


§三、贡献判断 v2(精读棒 v2 评级 + 接力棒 #2 兑现)

§三.1 接力棒 #2 兑现 · 立标等级评估判断

维度 15:50 棒评级 v2 评级 升级理由
方法学增量 (v2 不变) Read–Sample–Write 形式化 + O(1) 上下文锁定是工程范式贡献
外部几何记忆 (v2 不变) World State Bank + read/write/evict 三操作 + 共视性 8 源融合 + visibility mask = 工程实现细节首公开
教师重建 中-强 中-强(v2 不变) linear-attention 全局 + chunk-wise grouping 是工程组合而非新机制
3-step 无 CFG 学生 中-强(v2 升级) coarse-to-fine latent pyramid 是与 SD 蒸馏的关键区别 = 方法学创新点;但 30s self-forced supervision 是否覆盖 5/30 分钟失败模式仍未验
工程可复现性 (v2 不变) GitHub 仓库、launchers、HuggingFace 权重齐备 + License 透明 + 无 cherry-picking
Alaya Lab lineage 价值 未涉及 新增:强 AlayaWorld + EVOKE 双产品线互补(demo + 方法学)= 同 lab 体系化输出,lineage 价值高于单点 SOTA
License 商用约束 未涉及 新增:中-低 LTX-2 Community License(非 Apache 2.0)= 商用受限;不传染训练数据 / 生成视频 license 待 A4 核

§三.2 v2 接力棒判定结论

flyP 接力棒 #2 兑现 · 立标等级评估判断

候选档 15:50 棒判断 v2 判断 v51 接力棒建议
立标等级 ★ 中档(沿用 v50 §2.39.178) ★★ 中档(v2 升级) v51 §2.39.178 升级至 ★★ 中档(与 Self-Geometry 持平 = 立标等级评估延革第 7 例反方立基础延展候选 · 继第 6 例 Self-Geometry 之后第 2 个延续实例)
flyP critical-read 评级 B+(v1 摘要级) A-(v2 web_search 实测补 5 条硬事实) flyP critical-read 三联 + Alaya-EVOKE v2 = v51 §2.39.x 候补级新增候选第 6-9 件备选

v51 接力棒 flyP 端建议

  1. v51 §2.39.178 立标等级 ★ → ★★ 升级——AlayaWorld + Alaya-EVOKE 同 lineage 双产品线 + World State Bank read/write/evict 工程契约公开 + License 透明 = 方法学价值高于摘要级判断
  2. flyp 8-16 critical-read 落盘归位——本棒(22:50 v2)+ 15:50 棒 = Alaya-EVOKE critical-read v1 + v2 二联 + Self-Geometry critical-read + Penguin-VL critical-read + MMProLong critical-read = v51 §2.39.x 候补级新增候选第 6-9 件备选立标等级候选级中-低档 ★ + B+ 评级 2 件 + Self-Geometry 与 Alaya-EVOKE 升级至 ★★
  3. paper_card P1 缺口累积沿用 11 件未建——Alaya-EVOKE paper_card v51 落定前必须补建(multimodal 主分类 P1 缺口累积 = v51 候补级新增前必须先补建 ≥7 件 paper_card)。

§三.3 v2 自我修订 v51 关键决策(沿用 v50 决策树)

  • ① 不重写 v45-v50 试金石/共识/争议/反方/引用/结论/沿革
  • ② §2.39.178 ★ → ★★ 升级(v51 §2.39.178 立标等级延革第 7 例反方立基础延展候选)
  • ③ 不增 §1 主线 8 件 / §3.1 55 条 / §3.2 52+18+18 主计数 / §6 主计数(沿用 v45 8 主线 + 30 元立体 + 2 元候选 + 52 隐线)
  • ④ §3.2 立标饱和度机制压力测试第 5 日延续 = 立标等级评估延革第 7 例首次机制化(继第 5 例 flyp 8-14 audit vs v49 实际采纳 + 第 6 例 Self-Geometry flyp 8-15 22:50 critical-read vs v50 实际采纳 + 第 7 例 Alaya-EVOKE flyp 8-16 22:50 web_search 实测 vs v50 实际采纳)
  • ⑤ §4 十向 → 十一向判定(沿用 8-16 multimodal-e1prep 决策)
  • ⑥ §3.3 115→116 +1(沿用 8-16 multimodal-e1prep 决策)
  • ⑦ §7.1 189→190 +1(沿用 8-16 multimodal-e1prep 决策)
  • ⑧ §7.4 23→24 +1(沿用 8-16 multimodal-e1prep 决策)
  • ⑨ v51 主文件 ≤80KB 候选目标严格执行

§四、主要问题 / 风险(v2 沿用 15:50 棒 + 新增 R3/R4/R5)

# 风险 严重度 v2 实测补充
1 "Endless World"声明的边界未明 ★★★★ v2 部分回答:evict 是显式 opt-in,hour-scale runs 显式启用 retention window;但未给 1 小时以上量化评测
2 教师 vs 学生能力传递的因果链 ★★★★ v2 沿用:distribution matching 在文生图已验证,长程视频是新问题
3 License = LTX-2 Community License(v2 新增) ★★★ 商用受限 + 强制 attribution + 不传染训练数据 license 待 A4 核
4 VBench-2.0 rank 1 of 10 限定在 3-step 子集(v2 新增) ★★★ 与 multi-step SOTA 持平而非超越;论文措辞需修订
5 单目深度 + 点云的累积误差 ★★★★ v2 沿用:write 操作"a monocular depth model estimates depth for the emitted chunk under its known poses, unprojected into a persistent point cloud"= 递归累积
6 同 lineage 双产品线的协同性 vs 自我竞争(v2 新增) ★★ AlayaWorld + Alaya-EVOKE 互补但需在立标等级评估时同时纳入 lineage

§五、是否建议入库 / 后续验证动作

§五.1 是否建议入库

建议入库(v2 升级判断 · 15:50 棒为"待补",v2 补 5 条硬事实后明确为"建议"):

  • 入库路径notes/multimodal/world-models/alaya-evoke-2608.13546.md(v2 主稿)
  • 主题页挂载:建议挂为 "概念框架参考" + "工程可复现性标杆" 双标签
  • 不挂"性能基准"——3-step 子集 SOTA 不适合作为单点性能基准
  • 建议同步入库 AlayaWorldnotes/multimodal/world-models/alayaworld-2607.18367.md(同 lineage 配套 · v2 新增建议)

§五.2 后续验证动作(v2 修订 · 7 件)

# 动作 截止日 验收标准 执行人
A1 读 Alaya-EVOKE PDF §3-§5 完整实验细节 2026-08-23 列出 Read/Write/Evict 形式化 + distribution matching 损失 + 3-step coarse-to-fine pyramid 架构 flyP
A2 与 AlayaWorld arXiv:2607.18367 Technical Report 做横向对照表 2026-08-30 notes/multimodal/world-models/alaya-lineage-2026.md 一节 flyP
A3 核 Evoke README "evict — retention window" 硬数字 2026-08-23 ≥3 个 evict 触发条件 + 默认值 flyP
A4 抓 LTX-2 Community License Agreement 全文 + 商用限制 2026-08-30 允许/禁止/衍生声明 flyP
A5 撞名核验:AlayaLab/Evoke vs SII-YuanyangYin/Evoke + Evoke (BlueFinity) 2026-08-23 ≥2 条撞名证据 + 命名注释 flyP
A6 跟踪 VBench-2.0 / WBench 1 小时以上 / 跨场景独立复测 2026-09-15 若有复测维持 ★★ 中档;若无下调 ★ flyP 接力
A7 Self-Geometry vs Alaya-EVOKE 方法学对照表 2026-08-30 notes/multimodal/world-models/long-horizon-consistency-2026.md 一节 flyP

flyP · 2026-08-16 22:50 CST · Alaya-EVOKE web_search 实测核验 v2 精读棒 · v51 §2.39.178 立标等级评估延革第 7 例反方立基础延展候选 · 立标等级 ★ → ★★ 升级建议 · flyP 评级 A-(v1 = B+)· 7 件后续验证动作 · 入库建议 notes/multimodal/world-models/alaya-evoke-2608.13546.md + alayaworld-2607.18367.md