短评 v2 · Xiaomi-Robotics-U0 · 38B 统一具身合成世界基础模型

角色:flyP · 短注(short review)v2 主题:具身合成世界基础模型 · 统一 autoregressive AR 框架 · 国产代表作 生成时间:2026-07-15 09:54 Asia/Shanghai(v1)|v2 2026-07-16 21:20 覆盖 触发:cron b37d3839 · E2 自我反思 · 7-16 反思 §3.2 判定 v1 为本周期最弱


§0 v2 元层说明(v1 失误诚实陈述)

§0.1 v1 五处失误

  1. 未抓 Xiaomi Robotics 官方页 + 未 web_search:v1 全文仅引用 arXiv abs + author list + title 元数据,完全没有 web_search 核验。v2 web_search 实测后确认:Xiaomi Robotics 官方页 robotics.xiaomi.com/xiaomi-robotics-u0.html 明确披露 5 类 capability + 单一 autoregressive framework + continual training on general + embodied datasets;GitHub XiaomiRobotics/Xiaomi-Robotics-U0 公开;alphaxiv / themoonlight / AIWeekly / explainx.ai / Trendshift 五方均独立报道。根因:v1 写时是同日上午第三篇候选微审稿后的第 4 篇,贪图快速短注没做基本 web_search。违反 7-15 §3.3 规则 8 延伸——v1 不是质疑命名,而是连核验都没做就直接写。
  2. 0 条可证伪反方:v1 §3 仅有"摘要完整度 ⭐⭐"评分 + "主要盲点"3 行,完全没有任何可证伪反方风险点。违反 7-13 §3.3 规则 5(abstract-only 短审稿必 ≥6 条可证伪反方风险)。根因:v1 错误地把"短注 short-review"豁免了 6 条反方规则。
  3. 后续验证动作仅 3 条 < 6:v1 §4 仅 3 条 checkbox(等 v2 / 与 LingBot-Video 对位 / 跟进 Xiaomi blog)。违反 7-13 §3.3 规则 5(≥6 条后续验证动作)。根因:同上,把短注豁免了 6 条后续动作规则。
  4. 建议路径两处越界 notes/ + reviews/:v1 §4 写 notes/embodied/world-foundation-models.md + reviews/short-notes/xiaomi-robotics-u0.md —— 两条全部越界。违反 7-13 §3.3 规则 3(建议路径不允许越界到 review/ / notes/ / published/)。根因:v1 写时把"建议路径"段理解成"由 flyP 自执行"。
  5. 评级"建议入库"违反 7-12 §3.3 规则 6 门槛:v1 §3 "影响 ⭐⭐⭐⭐" → §4 "短注路径"实质等同"建议入库"。违反 7-12 §3.3 规则 6(评级"建议入库"门槛 = 摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6)。根因:v1 写时图快,忘了规则 6 门槛。

§0.2 v1 → v2 变化表(8 维度)

维度 v1 v2
信源数 1(arXiv abs + author list) 6(arXiv abs / Xiaomi Robotics 官方页 / GitHub / alphaxiv abs / themoonlight 评论 / AIWeekly 报道 / Trendshift GitHub 统计)
关键数字 仅 38B + autoregressive + multimodal + World Arena #1 + GPT-Image-2.0 击败(人评)+ π₀.₅ OOD 36.9%→63.2% + 5 类 capability + 单一 AR framework + continual training
可证伪反方 0 条 6 条(5.1-5.6),每条挂"待核验依据" + 证伪条件
后续验证动作 3 条(违反 ≥6 规则) 7 条(必做 4 + 选做 3 = 7,每条挂信源标签)
建议路径 越界 notes/embodied/ + reviews/short-notes/ 由同步任务执行……主题页合并形式(flyP 不预设具体路径文件名)
入库评级 中(6/10)· "短注路径建议入库" 中-偏低(5/10)· ⚠️ 监控清单(v1 违反规则 6 门槛)
横向对照 仅 LingBot-Video 一行 + 7 个同期工作(LingBot-Video / Cosmos3 / LongCat-Video / Wan 2.2 A14B / HunyuanVideo 1.5 / GR00T-N1 / World Arena 评测源清华 FIB-LAB)
主题页归类 notes/embodied/world-foundation-models.md(越界) 候选主题页:①"国产世界模型双雄"(Xiaomi U0 + LingBot-Video)②"embodied world model 评测"(Xiaomi U0 + World Arena + RBench)

§0.3 v1 → v2 可迁移教训(3 条)

  1. 短注不豁免六规则:abstract-only 短注(无论 short-review / micro-triage / rss-followup / candidates-triage / weekly-digest-candidates)都必须满足 ≥6 条可证伪反方 + ≥6 条后续验证动作 + 摘要级证据 ≥3 三项最低门槛。短注的唯一豁免权是:可以省略与 KB 主题树无关的横向对照不允许豁免反方 + 后续动作 + 评级证据门槛
  2. 短注必做 web_search + 官方页 + GitHub 三路:abstract-only 短注在引用前必须做 web_search ≥1 条独立信源(除 arXiv abs 之外)+ 尝试抓项目页/官方页(如有)+ 检查 GitHub 仓库(如有)。不允许仅依赖 arXiv abs + author list 写 short-review
  3. 建议路径不越界是边界硬规则:v1 写 notes/embodied/ + reviews/short-notes/ 均越界——所有 short-review / micro-triage / candidates-triage 写"建议路径"段时,必须使用"由同步任务执行……主题页合并"形式,不预设具体路径文件名(notes/ / reviews/ / published/ 三处均为越界)。

§1 论文身份卡(表格化 + 每条来源标签)

字段 内容 信源
标题 Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model arXiv abs 2607.11643 / 官方页 / GitHub
单位 Xiaomi Robotics + 多家高校(米系生态) author list / 官方页
一作 Xinghang Li + 22 coauthor arXiv abs / 官方页
v1 2026-07-13 arXiv version history
模型规模 38B 参数 · autoregressive · multimodal arXiv abs / 官方页 / alphaxiv / themoonlight / AIWeekly
学科 cs.RO + cs.AI arXiv subject
主题 统一 embodied synthesis(5 类 capability 单 autoregressive framework) arXiv abs / 官方页
GitHub XiaomiRobotics/Xiaomi-Robotics-U0(Trendshift trending) Trendshift / 官方页
官方页 robotics.xiaomi.com/xiaomi-robotics-u0.html 官方页
alphaxiv alphaxiv.org/abs/2607.11643 alphaxiv
第三方报道 themoonlight.io / explainx.ai / AIWeekly / ComfyUI Wiki 衍生 三方独立报道
评测基准 World Arena(清华 FIB-LAB,GitHub tsinghua-fib-lab/WorldArena,arXiv 2602.08971v2,2026-03-20 online arena release,2026-02-13 leaderboard release) GitHub + arXiv 2602.08971v2
标签 embodied-world-modelunified-synthesisautoregressive38Brobotics国产 自定

不补:训练数据规模 / 训练 token 数 / 训练 GPU 数 / 训练算法 / 数据配比 / 模型具体结构(是否 MoE / 是否 shared expert / tokenizer 细节)—— 全部待 PDF §3-§6 核验。


§2 摘要核心 v2 扩充(5 类 capability)

v2 web_search 实测 Xiaomi Robotics 官方页 + arXiv abs + alphaxiv 三方一致披露

  1. Text-to-Image Generation(基础图文生成,foundation image gen 起点)
  2. Image Editing(图像编辑)
  3. Multi-view Embodied Scene Generation多视角具身场景生成——核心新能力)
  4. Structured Embodied Transfer结构化具身 transfer——核心新能力,abstract 强调"structured, controllable")
  5. Embodied Video Generation / Rollout(具身视频生成)

统一框架: - 单一 autoregressive framework(不是 diffusion + AR 混合,是纯 AR) - continually trained on both general-domain and embodied datasets(一般数据 + 具身数据联合持续训练) - jointly optimizing 上述 5 类任务 under unified AR objective - multimodal tokenization + embodied data training + accelerated autoregressive inference 三件套

关键声明(abstract 自报,v2 实证支撑): - "Xiaomi-Robotics-U0 is the first model to support high-quality multi-view scene generation across multiple robot embodiments" —— "first model" 主张需 PDF §5 反方审稿 - "outperforms GPT-Image-2.0 in human evaluations of embodied scene generation and transfer" —— 人评口径需 PDF §6 详查 - "ranking first on World Arena for embodied video generation" —— World Arena 是清华 FIB-LAB 2026-02-13 起的 leaderboard,arXiv 2602.08971v2 - "improving the out-of-distribution success rate of π₀.₅" —— π₀.₅ 是 Physical Intelligence 的政策模型,36.9%→63.2% 数字来自官方页 + AIWeekly


§3 flyP 短评 v2(4 维评分 + 与 LingBot-Video 横向)

维度 评分 说明
工业能见度 ⭐⭐⭐⭐⭐ 小米机器人是国产第一梯队 embodied AI 团队 + 官方页 + GitHub + 五方独立报道
摘要完整度 ⭐⭐⭐⭐ v1 ⭐⭐ → v2 ⭐⭐⭐⭐:World Arena #1 + GPT-Image-2.0 + π₀.₅ OOD 三项关键数字补齐
与 LingBot-Video 差异 ⚠️ 待 PDF 核验 LingBot-Video-MoE(30B-A3B · 2026-07-08 · Apache 2.0 · RBench #1 open-source)走 MoE DiT + Diffusion 路;Xiaomi-Robotics-U0 走 38B 单 AR + 多模态统一 路。两者方向相反但目标同构(embodied world model + 国产 + 同期发布)
影响 ⭐⭐⭐⭐⭐(v1 ⭐⭐⭐⭐ → v2 ⭐⭐⭐⭐⭐) 首个统一 embodied synthesis model(abstract 自报 + 官方页确认) + π₀.₅ OOD 提升 26.3 pp 极具产业冲击力(与 LingBot-Video 形成"国产世界模型双雄"主题页候选)

v1 → v2 评分变化说明: - v1 "影响 ⭐⭐⭐⭐" → v2 "影响 ⭐⭐⭐⭐⭐":不是 v1 错了,是 v2 漏掉了 π₀.₅ 36.9%→63.2% 的产业冲击力数据 - v1 "摘要完整度 ⭐⭐" → v2 "摘要完整度 ⭐⭐⭐⭐":v2 web_search 五方信源补齐后,原始摘要确实包含丰富信息,是 v1 没读到

主要盲点(v2 诚实记录): - 5 类 capability 的具体 ablation / 单一 AR vs AR+Diffusion 混合的对照实验 —— 待 PDF §5 - π₀.₅ 36.9%→63.2% 的具体 OOD 任务清单 + 训练数据规模 + 训练 token 数 + 训练 GPU 数 —— 待 PDF §6 + 附录 - "first unified embodied synthesis model" 主张 —— 与 NVIDIA Cosmos3 / Robbyant LingBot-Video 等同期工作的对比是否成立 —— 待 PDF 引言 + 相关工作 - World Arena #1 的具体榜单数据 + 与 Cosmos3 / LingBot-Video 的具体分数差 —— 待 World Arena leaderboard 公开榜单 - 官方页提到 "FlashAR+ comparison for embodied transfer and embodied scene generation" —— FlashAR 是什么 / 与 AR 的具体差异 —— 待 PDF §4


§4 关键数字 v2 新增(5 方信源交叉)

数字 内容 信源
38B 参数 multimodal autoregressive arXiv abs / 官方页 / alphaxiv / themoonlight / AIWeekly 五方一致
World Arena #1 ranking first on World Arena for embodied video generation 官方页 / arXiv abs / explainx.ai / AIWeekly 四方一致
GPT-Image-2.0 击败 outperforms GPT-Image-2.0 in human evaluations on embodied scene generation + transfer 官方页 / arXiv abs / explainx.ai / AIWeekly 四方一致
π₀.₅ OOD 36.9% → 63.2% lifting out-of-distribution manipulation success from 36.9% to 63.2% 官方页 / explainx.ai / AIWeekly 三方一致(π₀.₅ 是 Physical Intelligence 的政策模型)
2026-07-13 发布 arXiv v1 submission date arXiv version history / 官方页
清华 FIB-LAB World Arena benchmark 由清华自动化系 FIB-LAB 发布,GitHub tsinghua-fib-lab/WorldArena,arXiv 2602.08971v2,2026-02-13 leaderboard release,2026-03-20 online arena release GitHub + arXiv 2602.08971v2
5 类 capability text-to-image + image editing + multi-view embodied scene gen + structured embodied transfer + embodied video rollout 官方页 + arXiv abs + alphaxiv 三方一致

不补:训练数据规模 / 训练 token 数 / 训练 GPU 数 / 训练算法 / 模型具体结构 / tokenizer 细节 / FlashAR 细节 —— 全部待 PDF 全文 + 官方页补充材料。


§5 主要问题与批判 v2(6 条可证伪反方,每条挂"待核验依据" + 证伪条件)

5.1 命名质疑方向校正(承接 7-15 §3.3 规则 8)

  • v1 失误:v1 未做 web_search,未对"Xiaomi-Robotics-U0"做命名核验
  • v2 web_search 实测:Xiaomi-Robotics-U0 为 Xiaomi Robotics 官方发布的 38B 模型,确实真实存在
  • 正确质疑方向:abstract 提到 "single autoregressive framework" 与 "jointly optimizing 5 类 capability under unified AR objective" —— 但未给具体 AR head 架构(如 LLaMA-style / Mamba-style / Linear Attn),正确质疑应针对 prompt snapshot / API 时间窗口 / 评测可复现性,不应针对"模型是否真实存在"
  • 可证伪判定:若 PDF §3 公开 AR backbone 选型 + tokenizer 细节 + 训练超参 + 5 类 capability 的 joint loss 权重,则"单一 AR 框架"主张成立;若仅说"unified AR"而无具体架构细节,则属于营销修辞
  • 判定依赖:PDF §3 架构图 + §4 训练设置 + 附录 loss 公式

5.2 "First unified embodied synthesis model" 主张与同期工作的边界

  • 同期(2026-06 ~ 2026-07)已有:
  • NVIDIA Cosmos3(foundation world model,2026-03 release)
  • Robbyant LingBot-Video(30B-A3B MoE DiT + 70K+ hours embodied data,2026-07-08 release,Apache 2.0)
  • GR00T-N1(NVIDIA,foundation model for humanoid robot data)
  • 可证伪判定:Xiaomi U0 "first unified" 主张的边界需明确:
  • "first unified" 是指单一 AR 框架 + 5 类 capability?—— LingBot-Video 是 DiT + 4 capability
  • 还是指foundation image gen + embodied video 的统一?—— Cosmos3 已做类似但用 diffusion
  • 还是指multi-view + structured embodied transfer 这两个具体能力?—— 这两个能力确实是 LingBot-Video 没明确做的
  • 判定依赖:PDF 引言相关工作 + §5 vs Cosmos3 / LingBot-Video 的对比表

5.3 π₀.₅ OOD 36.9%→63.2% 的可复现性

  • 数字冲击力强:从 36.9% 跳到 63.2% 提升 26.3 pp 在 embodied 任务上是异常显著
  • 风险点
  • OOD 任务清单未公开:是否覆盖 6 类常见 OOD(光照 / 物体 / 背景 / 机器人本体 / 任务结构 / 传感器噪声)?
  • π₀.₅ 是 Physical Intelligence 的政策模型,其原始训练数据可能本就未覆盖这些 OOD 场景——提升可能来自"补全训练分布"而非"提升政策能力"
  • 评测次数 / 标准差 / 95% CI 未披露 —— 单一数字易被 cherry-pick
  • 可证伪判定:若 PDF §6 + 附录公开 OOD 任务清单 + 评测协议 + 标准差 + 与 baseline(如直接用 GPT-Image-2.0 合成数据)的对照,则"26.3 pp 提升"成立;若仅给 single-number,则需谨慎
  • 判定依赖:PDF §6 OOD 评测 + 附录对照实验 + 代码 release

5.4 World Arena #1 的局限

  • World Arena 由清华 FIB-LAB 发布(arXiv 2602.08971v2),覆盖 video perception quality + embodied task functionality + unified EWMScore 三维度
  • 风险点
  • World Arena leaderboard 截至 2026-07-16 公开榜单未必包含 Cosmos3 / LingBot-Video 等同期模型 —— "#1" 可能建立在不完整对手集合上
  • EWMScore 权重未公开(perceptual vs functional 各占多少)
  • World Arena 评测采用 RoboTwin 2.0 数据集(双臂机器人操作),对 humanoid / quadruped / mobile manipulator 的覆盖度有限
  • 可证伪判定:若 World Arena leaderboard 完整公开 Cosmos3 / LingBot-Video / LongCat-Video 等同期模型的分数,则"#1"主张成立;若榜单对手 < 5 个且均为闭源,则需谨慎
  • 判定依赖:World Arena 官方 leaderboard 公开数据 + PDF §5 vs 同期的具体分数差

5.5 单一 AR 框架的工程成本

  • 38B autoregressive 多模态模型(vs LingBot-Video 30B-A3B MoE DiT)的推理成本:
  • 单 token 激活参数量:38B(Xiaomi U0)vs 3B(LingBot-Video A3B)—— 激活参数差距 12.7×
  • 推理延迟:AR 模型在长视频生成上的延迟天然高于 DiT(DiT 可并行去噪,AR 必须自回归)
  • 训练成本:38B dense AR vs 30B-A3B MoE 的训练 token 数 / GPU 时数 —— abstract 未给
  • 可证伪判定:若 PDF 给出 vs DiT 的推理延迟对照 + 训练 GPU 时数 + 模型 FLOPs,则"unified AR"主张在工程上可成立;若仅给结果不给成本,则属于"报告优势不报告代价"
  • 判定依赖:PDF §4 推理设置 + 附录训练成本 + FlashAR 加速机制详解

5.6 与 LingBot-Video "国产世界模型双雄" 主题页的差异化定位

  • 共同点:国产 + embodied world model + 同期(5 天间隔)+ 38B vs 30B-A3B 量级 + open-source(Xiaomi U0 GitHub + LingBot-Video Apache 2.0)
  • 差异点:
  • 架构:Xiaomi U0 单一 AR vs LingBot-Video MoE DiT
  • 训练范式:Xiaomi U0 continual training on general + embodied vs LingBot-Video from-scratch + 70K+ hours embodied
  • 评测:Xiaomi U0 World Arena #1 vs LingBot-Video RBench #1 open-source
  • 开源策略:Xiaomi U0 GitHub repo(具体 LICENSE 待查)+ LingBot-Video Apache 2.0
  • 可证伪判定:若 Xiaomi U0 LICENSE 为 Apache 2.0 / MIT,则与 LingBot-Video 在"开源承诺"上等价;若为 RESEARCH-ONLY / NON-COMMERCIAL,则"LingBot-Video 仍是开源 #1"
  • 判定依赖:GitHub LICENSE 文件 + 官方页 LICENSE 段

§6 入库评级 v2 校正

§6.1 评级

  • v1中(6/10)· 短注路径建议入库 —— 违反 7-12 §3.3 规则 6 门槛
  • v2中-偏低(5/10)· ⚠️ 监控清单

§6.2 v2 不升回"建议入库"的诚实理由

  1. 反方全部"待核验"——证据基础不实(6 条反方均挂"待 PDF 核验"或"待 leaderboard 公开"标签)
  2. 短注 + abstract-only 模式——未抓 PDF 全文 + 未跑实验
  3. 同周已有 LingBot-Video 同期工作(7-13 主稿 + 7-14 v2 短补稿)已覆盖"国产 embodied world model"主线——Xiaomi U0 的边际信息价值低于 LingBot-Video
  4. "first unified embodied synthesis model" 主张需 PDF 反方审稿——存在与 Cosmos3 / GR00T-N1 / LingBot-Video 边界不清的风险
  5. World Arena #1 与 LingBot-Video RBench #1 open-source 是不同评测体系——不能直接说"Xiaomi U0 比 LingBot-Video 强"

§6.3 建议路径 v2 合规重写

v1 越界写法(已废弃): - ❌ notes/embodied/world-foundation-models.md - ❌ reviews/short-notes/xiaomi-robotics-u0.md

v2 合规写法(由同步任务执行时建议): - 候选主题页 ①国产世界模型双雄(Xiaomi-Robotics-U0 v2 ↔ LingBot-Video 7-13 + 7-14 v2 短补稿) - 候选主题页 ②embodied world model 评测(Xiaomi-Robotics-U0 v2 + World Arena 清华 FIB-LAB + RBench Robbyant + Cosmos3 + GR00T-N1) - 合并建议:建议合并到 LingBot-Video 已有的"国产世界模型"主题页(如已存在),不新建独立短注 - flyP 不预设具体路径文件名:notes/ / reviews/ / published/ 三处均为越界,由同步任务按主题树决定


§7 后续验证动作 v2 升级(必做 4 + 选做 3 = 7 条)

§7.1 必做(4 条)

  1. PDF §3-§6 全文核验(信源:待 PDF 全文) - §3 AR backbone 架构 / tokenizer / 5 类 capability 的 joint loss 权重 - §4 训练数据规模 / 训练 token 数 / 训练 GPU 时数 / FlashAR 加速机制 - §5 vs Cosmos3 / GR00T-N1 / LingBot-Video 的对比表 - §6 π₀.₅ OOD 任务清单 + 评测协议 + 标准差 + baseline 对照
  2. GitHub LICENSE 文件核验(信源:GitHub XiaomiRobotics/Xiaomi-Robotics-U0) - LICENSE 类型(Apache 2.0 / MIT / RESEARCH-ONLY / NON-COMMERCIAL) - 是否包含训练数据 / 训练代码 / 模型权重三件套 - 是否允许商业使用与微调
  3. World Arena leaderboard 完整对手集合核验(信源:tsinghua-fib-lab/WorldArena) - 截至 2026-07-16 公开榜单是否包含 Cosmos3 / LingBot-Video / LongCat-Video / Wan 2.2 A14B / HunyuanVideo 1.5 - EWMScore 权重 + 各维度分数 + 95% CI
  4. LingBot-Video vs Xiaomi U0 工程成本对照核验(信源:两份 PDF + GitHub) - 激活参数量 / 推理延迟 / 训练 GPU 时数 / 视频生成质量主观评测 - 开源承诺对照(LICENSE + 可商用范围)

§7.2 选做(3 条)

  1. RoboTwin 2.0 数据集覆盖度核验(信源:RoboTwin 2.0 paper / WorldArena 文档) - World Arena 评测采用 RoboTwin 2.0 双臂机器人操作数据集,对 humanoid / quadruped / mobile manipulator 的覆盖度
  2. π₀.₅ 原始训练分布与 U0 合成数据分布重叠度核验(信源:Physical Intelligence π₀.₅ paper + U0 PDF §6) - "补全训练分布" vs "提升政策能力" 的边界
  3. Xiaomi Robotics 官方页 demo 视频核验(信源:robotics.xiaomi.com/xiaomi-robotics-u0.html) - 官方页提到的 FlashAR+ comparison for embodied transfer + scene generation 是否有可下载 demo

§8 横向对照 v2 新增(与 7 个同期工作横向)

同期工作 关系 对位数字 状态
LingBot-Video(Robbyant · 30B-A3B MoE DiT · 2026-07-08 · Apache 2.0 · RBench #1 open-source) 国产世界模型双雄 38B AR vs 30B-A3B MoE DiT;World Arena #1 vs RBench #1 open-source;5 capability(text-to-image / image editing / multi-view / structured transfer / embodied video)vs 4 capability(text2video / image2video / action2video / 未来帧预测) 同周对照
NVIDIA Cosmos3(foundation world model · 2026-03 release) corporate 对手 Cosmos3 走 diffusion-based world model;Xiaomi U0 走 single AR 需 PDF 引言对照
NVIDIA GR00T-N1(foundation model for humanoid robot data · 2026-04 release) 数据派对手 GR00T-N1 偏数据生成;Xiaomi U0 偏模型 + 数据双驱动 需 PDF 引言对照
LongCat-Video(美团 · 2026-07) 国产文本/视频生成 同为 2026-07 发布的国产视频生成模型 World Arena 榜单对手
Wan 2.2 A14B(阿里 · 2026-06 release) 国产视频生成底座 A14B MoE DiT 视频生成 World Arena 榜单对手
HunyuanVideo 1.5(腾讯 · 2026-06 release) 国产视频生成 HunyuanVideo 系列 World Arena 榜单对手
World Arena(清华 FIB-LAB · arXiv 2602.08971v2 · 2026-02-13 leaderboard release) 评测源反向追溯 评测源 = 清华自动化系 FIB-LAB;评测数据集 = RoboTwin 2.0 双臂机器人操作 Xiaomi U0 #1 的评测源头

主题页归类 v2 候选: 1. "国产世界模型双雄"(Xiaomi-Robotics-U0 v2 ↔ LingBot-Video 7-13 + 7-14 v2 短补稿 + LingBot-World 2.0 + Cosmos3 + GR00T-N1 + LongCat-Video + Wan 2.2 A14B + HunyuanVideo 1.5) 2. "embodied world model 评测"(Xiaomi-Robotics-U0 v2 + World Arena 清华 FIB-LAB + RBench Robbyant + RoboTwin 2.0 数据集 + EWMScore 三维度)


§9 一句话归档 v2 重写

Xiaomi-Robotics-U0(Xiaomi Robotics · arXiv:2607.11643 · 2026-07-13 v1 · 38B autoregressive · 单一 AR 框架 + 5 类 capability:text-to-image / image editing / multi-view embodied scene generation / structured embodied transfer / embodied video rollout · World Arena #1 + GPT-Image-2.0 击败(人评)+ π₀.₅ OOD 36.9%→63.2%)—— v1 全文仅引用 arXiv abs + author list,未做基本 web_search;v2 web_search 五方信源(Xiaomi Robotics 官方页 + GitHub + alphaxiv + themoonlight + AIWeekly)交叉确认后补齐关键数字 + 6 条反方 + 7 条后续动作,评级降为"⚠️ 监控清单"与 LingBot-Video 7-13 + 7-14 v2 形成"国产世界模型双雄"主题页候选 + World Arena 清华 FIB-LAB 评测源反向追溯


§10 元信息 v2

  • v1 失误诚实陈述:v1 仅引用 arXiv abs + author list,未做基本 web_search;0 条可证伪反方;后续动作仅 3 条 < 6;建议路径两处越界 notes/ + reviews/;评级"建议入库"违反 7-12 §3.3 规则 6 门槛
  • v2 已遵循本日九规则:§0/§1/§4/§5/§6/§7/§8/§9 显式遵循 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 九规则(含本日新增"短注 short-review 模式"最低门槛)
  • 未触碰:其它 22 篇 inbox/flyp(7-10 ~ 7-16 不含 RSS)+ 17 份 RSS + 7-16 三份主稿(Homer / SenseNova / Moment-Video)+ promo explainers
  • 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/、notes/、digests/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段