主题综述 · multimodal(2026-07-20)
- 作者:spark
- 更新:2026-07-20
主题:multimodal(多模态大模型)。本文以 2026-07-16 → 2026-07-20 这一周的 arXiv 与 HF Daily 信号为主,叠加两条历史锚点(Flamingo、Gemini 1.5)做深度综述。所有观点均挂出处,不编造数字;未公开数字一律用「未披露」/「待核」标注。
1. 主题脉络:2026 H2 多模态的「九线收敛期」
把 2026 年上半年的多模态主线压缩成一句话,是「统一多模态生成」与「长上下文视频/文档理解」两条线的并行收敛;2026-H2(特别是 7-16 至 7-20 这 4 天)则呈现出第三条主线明显抬头——「具身双通路:语言 + 视觉想象」作为多模态、agent、embodied AI 三者的交叉范式候选。flyP 在 7-20 09:40 给出的 E1 预消化(inbox/flyp/2026-07-20-multimodal-e1prep.md §0)把这三线命名为:
- 统一多模态(图像侧):以 SenseNova-U1(arXiv:2605.12500,NEO-unify)与 Boogu-Image-0.1(arXiv:2607.13125,推理时扩展产品化)为代表;
- 视频 MLLM / 开放数据集 / 自适应帧率工程化:以 VideoChat3(arXiv:2607.14935)为代表,4B 全开源视频 MLLM;
- 具身双通路(语言 + 视觉想象):以 RxBrain(arXiv:2607.14187)为代表,把「何时想象」做成可学习的元控制 token。
旁证主线 2 条:(a)多模态评测方法学重构——KeyFrame-Compass(arXiv:2607.14202)+ MultiRef-Compass(arXiv:2607.14189)+ UniVR(arXiv:2607.12800)把 v25–v28 的「二十三面体」扩展到「二十六面体」;(b)位置论文——From Pixels to States(arXiv:2607.14076)把交互式世界模型重新定位为游戏引擎,对 2026 H2 的 VLA / 具身基础模型形成方法论压力。
如果把视野放宽到 2022→2026,主题脉络可画成一条三代演化:
- 第一代(2022–2024):以 Flamingo(arXiv:2204.14198,S2 引用 6217)为标志——通过桥接冻结的纯视觉与纯语言预训练模型,引入 Perceiver Resampler + 门控 cross-attention,首次实现「图文交错序列 + few-shot」。同期 Gemini 1.5(arXiv:2403.05530,S2 引用 3811)把上下文从 32K 推到百万级 token,确立「长上下文 + 多模态」范式。这一代关注「输入侧的异构模态如何对齐」。
- 第二代(2025 H1–H2):以 LLaDA-V(arXiv:2505.16933,S2 引用 125)为分水岭——纯扩散范式 MLLM,把多模态从自回归 (AR) 解放出来。同期 SenseTime 商汤 SenseNova-U1(arXiv:2605.12500)通过 NEO-unify + Native MoT 把「理解 + 推理 + 生成」压到同一 monolithic backbone,8B dense 与 30B-A3B MoE 双 variant 上线,6 个月内迭代 8 版(GitHub OpenSenseNova/SenseNova-U1 README)。这一代关注「生成范式与架构统一」。
- 第三代(2026 H1–H2,正在发生):7-16 → 7-20 这一周的 RxBrain / VideoChat3 / Boogu-Image / KeyFrame-Compass 是第三代早期信号。共同特征是:不再只问「能不能统一」,而是追问「在什么约束下统一才算工程可落地」——具体表现为参数效率(VideoChat3 4B 全栈开源,RxBrain ~6.2B MoT)、数据合规(Boogu-Image dataset card PII 扫描成为 hard blocker)、评测多面体(KeyFrame-Compass 六维指标 + MLLM-as-Judge 复判增强)、推理时扩展产品化(Boogu-Image Base-Thinking 做成产品 feature 而非 trick)。
2. 各工作贡献与相互关系
2.1 RxBrain(arXiv:2607.14187)——具身双通路:语言 + 视觉想象
- 一句话:~6.2B 统一 Mixture-of-Transformers backbone,flow-matching 图像头解码到冻结的 FLUX VAE 潜空间,单一自回归序列内插入可学习的
<Image>token 决定「何时想象」,每步规划同时输出动作文本与目标图像(来源:arXiv:2607.14187 abstract;HFtencent/Hy-Embodied-RxBrain-1.0模型卡;inbox/flyp/2026-07-19-2250-RxBrain-embodied-multimodal-MLLM-critical-read.md)。 - 核心能力:3 件套——(a)具身理解与推理(图像 + 多帧视频 QA / CoT),(b)世界状态预测(flow-matched 想象近未来帧),(c)联合子目标规划(每步同时给动作文本 + 目标图)。
- 与其他工作的关系:与 SenseNova-U1 同属「统一多模态」,但走「具身 + 想象」侧;与 v27 Xiaomi-Robotics-U0(38B AR 世界基础模型)、v22 LingBot-Video MoE、v27 GenCeption 同族——「生成反哺具身」是 2026-Q3 共同主线。关键差异:RxBrain 显式在 AR 序列中引入
<Image>元控制 token,把「想象」做成可中断、可学习单元;Xiaomi-Robotics-U0 是端到端 AR 全程生成。Flamingo / Gemini 1.5 都是「视觉输入 → 文本输出」,RxBrain 把视觉输出同样纳入主序列——把生成作为一等公民纳入规划循环。 - 工程/部署:HF 模型卡给出 git clone、HuggingFace download、MODEL_PATH 三条命令;复现门槛包含 pin Transformers
9293856c419762ebf98fbe2bd9440f9ce7069f1a、flash-attn、FLUX VAE 单独下载(flyP 精读 §F)。
2.2 VideoChat3(arXiv:2607.14935)——全开源 4B 视频 MLLM
- 一句话:4B 参数全栈开源 + I3D-ViT + 自适应帧分辨率(流式视频感知)+ 三套公开数据集(Academic2M / LV116K / OL617K),把「全开源 + 通用域 + 长视频 + 流式」四件事压到同一基线,「仅以 4B 参数与更高效率超越参数量相当或更大的已有开源模型」(来源:arXiv:2607.14935 abstract;HF Daily 7-19 第 2 高 146 票;HF
MCG-NJU/VideoChat3-4B;inbox/flyp/2026-07-19-0950-VideoChat3-fully-open-video-MLLM-critical-read.md)。 - 作者单位:南京大学 MCG(Limin Wang 组)+ 上海 AI Lab + 南洋理工 + 北大。
- 与其他工作的关系:与 v25 LingBot-Video MoE 同族但分工——VideoChat3 专注理解侧、LingBot-Video 专注生成侧,两件形成「2026-Q3 视频 MLLM 理解-生成分工」双标杆;与 v27 Video-Oasis(arXiv:2603.29616,视频理解审计基准)+ v24 LongVQUBench(arXiv:2607.08317,视频质量评测)三层齐备;与 Gemini 1.5 的关系:Gemini 1.5 用「超长上下文 + 视频帧抽样」做长视频 QA(百万 token),VideoChat3 用「自适应帧率 + 流式感知」做通用域视频 MLLM——两条路线互补。
- 关键事实:4B vs 7B/13B 长视频 trade-off 未量化;评测宽度可疑,未列 VideoMME/LongVideoBench/EgoSchema/MLVU/StreamingBench 详表(flyP 精读 §1 §2)。
2.3 Boogu-Image-0.1(arXiv:2607.13125)——统一图像多模态全栈开源
- 一句话:Apache-2.0 全栈开源(以 HF 模型卡与 GitHub
boogu-project/Boogu-Image公开仓库 license 字段为准),4 个权重(Base/Turbo/Edit/Edit-Turbo),中英双语 Text Rendering 在 Qwen-Image-Bench 中文/英文 prompt 上 Base-Thinking 双榜开源第一,Base-Thinking 把推理时扩展做成产品级 feature,训练预算 ~400K USD,Edit-Turbo 4 步蒸馏,Hotfix 节奏 6/30 → 7/08(来源:arXiv:2607.13125 abstract;inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md v2 重写版)。 - 与其他工作的关系:与 SenseNova-U1 同属「图像侧统一多模态」,分工互补——Boogu = 开放权重 + 中英 OCR 产品化 + Edit/Turbo 完整 lineage;SenseNova-U1 = 系统层旗舰 + 8B dense 与 30B-A3B MoE 双 variant + NEO-unify 单流;与 LingBot-Video / Vidu-S1 / VideoChat3 形成「图像统一 vs 视频生成 vs 视频理解」三条对位分工;与 v22-v25 同族(Janus / Show-o / Transfusion)都是「统一视觉 tokenizer + 端到端架构」,差异点是「产品级 hotfix 节奏 + 推理时扩展落地」。
- 关键反方(flyP v2 ≥8 条可证伪):abstract「approaches leading closed-source systems」未给 GenEval/DPG-Bench/T2I-CompBench 具体数字;208M 图像 dataset card 公开 PII 扫描为 hard blocker;Edit-Turbo hotfix 后仍有同类退化 = 产品稳定性 hard blocker。
2.4 SenseNova-U1(arXiv:2605.12500)——系统级旗舰与 NEO-unify 锚定
- 一句话:商汤 + S-Lab NTU 提出 NEO-unify 架构,eliminate 传统 vision encoder 与 VAE,单流 end-to-end 处理 pixels 与 words;近无损视觉接口 + Native Mixture-of-Transformers backbone;语言侧 autoregressive + 视觉侧 pixel-space flow matching;8B dense 与 30B-A3B MoE 双 variant 上线(来源:arXiv:2605.12500 / HF papers 2605.12500;HF
OpenSenseNova/SenseNova-U1仓库 README)。 - 发布节奏:2026-04-27 首发 8B-MoT-SFT + 8B-MoT;2026-05-10 Tech Report + A3B-MoT SFT + A3B-MoT;2026-05-15 Infographic 子模型;2026-06-11 Infographic-V2;2026-07-16 Infographic-V3;4 个月内迭代 8 版(GitHub README 时间戳)。
- 与其他工作的关系:与 v29 锚定的 SenseNova-Vision-7B-MoT(arXiv:2607.06560)同属商汤「视觉-语言统一」家族,但 SenseNova-U1 走 NEO-unify(消除 vision encoder),SenseNova-Vision 走 capability-preserving mixture(保留 encoder + DC-AE)——同一团队的两条工程路线对比;与 Gemini 1.5 关系:SenseNova-U1 走 dense 8B + MoE 30B-A3B,Gemini 1.5 走 sparse MoE 旗舰 + 超长上下文,代表「中文多模态旗舰」与「英文长上下文多模态」两条主流线。
- 注意:v29 multimodal.md §6 行业分级已将 SenseNova 列入「中国 8 足候选」;flyP 7-19 精读建议 v30 在 §1.7 把腾讯 Hunyuan(RxBrain 团队)从「中国多模态通用 8 足」拆出,归入「中国具身 5 足」。
2.5 UniVR(arXiv:2607.12800)——视觉空间内统一推理
- 一句话:首个从纯视觉演示中同时学习「复杂推理 + 细粒度物理动力学 + 长期规划」的研究,配套首个纯视觉协议下的综合评测套件(来源:arXiv:2607.12800 abstract)。
- 与其他工作的关系:与 Thinking with Video、VLM-CapCurriculum、Visual Thoughts(MCoT NeurIPS 2025)同属多模态 CoT 推理范式主线,UniVR 走「视觉空间内思考」路线——区别于「视频生成即推理」与「感知-推理解耦」,是第三种推理框架候选(flyP E1 prep §1 增量 4)。主分类为 evaluation,但切中视觉推理统一框架支撑。HF Daily 7-20 28 票;覆盖推理 + 物理动力学 + 长期规划三类异质能力,是 2026-Q3 少有的「方法 + 评测」双交付。
2.6 From Pixels to States(arXiv:2607.14076)——位置论文:世界模型 = 游戏引擎
- 一句话:position paper,从玩家动作控制、游戏状态动态、状态-观测持久性、实时交互生成 4 个维度审视交互式游戏世界建模;针对《Black Myth: Wukong》提出可扩展数据引擎,采集 90+ 小时游戏画面作为状态感知世界建模资源(来源:arXiv:2607.14076 abstract)。
- 与其他工作的关系:与 ABot-AgentOS、ABot-N1、DeepPlanning、Xiaomi-Robotics-U0 同属「具身 agent / 世界模型」主线,是方法论反思而非新模型;对 2026 H2 主流 VLA family 形成方法论压力(flyP E1 prep §1 增量 5)。HF Daily 7-20 29 票;90+ 小时《Black Myth: Wukong》游戏画面是稀缺资源,可作为后续具身基础模型的训练集候选。
2.7 KeyFrame-Compass(arXiv:2607.14202)+ MultiRef-Compass(arXiv:2607.14189)——评测方法学重构
- KeyFrame-Compass:将关键帧执行拆解为存在性、保真度、时序顺序、定位、持续性、唯一性 6 个互补指标,整体视频质量通过「evidence-grounded MLLM judgments + 专用感知模型」评估(arXiv:2607.14202 abstract;HF Daily 7-20 36 票)。
- MultiRef-Compass:面向多参考音视频生成(MR2AV)的统一基准,将自动指标与「rejudging-enhanced MLLM-as-a-Judge」框架结合,实现感知保真度 + 参考条件合成能力的可扩展、可审计评估(arXiv:2607.14189 abstract;HF Daily 7-20 31 票)。
- 与其他工作的关系:与 KeyFrameBench 系列、VoxENES 2026、Blind-Spots-Bench 同属「多模态评测方法学重构(二十三面体)」主线。两件 Compass 把「二十三面体」扩展到「二十六面体」;与 Harness-Evolution-Eval-Cheating 同根,「自家模型 + 自建基准」self-benchmark risk 是 2026-Q3 评测领域的共同硬约束;MultiRef-Compass 的「rejudging-enhanced」是直接回应 Reliability-without-Validity(LLM-as-Judge 可靠性 vs 有效性)的批判。
3. 工程 / 研究 / 批判三视角
3.1 工程视角(可落地性)
把 6 件工作放到「能不能直接 clone → deploy → 微调」的尺子上:
| 工作 | 权重/规模 | 开源协议 | 复现门槛 | 工程价值 |
|---|---|---|---|---|
| RxBrain (~6.2B) | HF Hub + GitHub | 以 HF 模型卡 license 字段为准(flyP E1 prep 标 Apache 2.0,HF 模型卡 license 字段待核) | pin Transformers + flash-attn + FLUX VAE 单独下载 | 具身 agent 基础模型候选 |
| VideoChat3 (4B) | HF Hub + 三套数据集 | 全栈开源 | 标准 transformers/accelerate | 视频理解 4B baseline |
| Boogu-Image-0.1 | 4 权重 + 数据集 + 代码 | Apache-2.0(以 GitHub 与 HF README 为准) | 数据集 PII 扫描 hard blocker;Edit-Turbo hotfix 节奏风险 | 图像侧统一生成 + 中英 OCR 产品化 |
| SenseNova-U1 | 8B dense + 30B-A3B MoE | 开放权重 | 30B-A3B 需 ≥24GB 显存推理 | 系统级旗舰 baseline |
| UniVR | 代码 + 评测套件 | 待 arXiv 披露 | 评测套件可独立跑 | 视觉推理统一评测 |
| From Pixels to States | 90h 数据 + 框架 | 资源公开 | 90h 数据体积大、清洗成本高 | 世界模型 position paper |
工程结论:(1)VideoChat3 是 2026-07 这一周最适合直接 clone → finetune 的工作(4B + 三套数据集 + 全栈开源,HF 票数 146 是 7-19 第二高);(2)Boogu-Image-0.1 适合作为「图像侧统一 + 推理时扩展」研究样板,但需先解决 dataset card PII 扫描 hard blocker(flyP v2 §8 必做 3);(3)RxBrain 是「具身双通路」工程范式候选,但 <Image> token 是 end-to-end 学还是 layout 预定义未披露,完整技术报告与 RxBrain-Bench 尚未发布,建议等 7-25 前后续迭代。
3.2 研究视角(创新性)
按「范式创新 vs 工程增量 vs 方法学反思」三档:
- 范式创新(新结构 / 新目标):RxBrain 把「
<Image>token 决定何时想象」做成可学习的元控制单元,是 AR 序列内第一次显式让生成时机可学习;LLaDA-V(arXiv:2505.16933)是纯扩散范式 MLLM,脱离 AR 主流,是 2025 H1 多模态最大的范式分水岭;SenseNova-U1 NEO-unify 消除 vision encoder + VAE,pixel-space flow matching + 单流 end-to-end,是 2026 H1 中文旗舰最大的架构统一尝试。 - 工程增量(已有范式下的工程优化):VideoChat3 把「长视频 + 通用域 + 开源 + 高效」四件事压到同一基线;Boogu-Image-0.1 把推理时扩展产品化 + Edit-Turbo 4 步蒸馏 + Hotfix 节奏 6/30 → 7/08;Gemma 4 技术报告(arXiv:2607.02770)走开源权重 + 原生多模态 + STEM/长上下文性能跃升(S2 引用 5)。
- 方法学反思(position / survey):From Pixels to States 4 维审视交互式游戏世界建模;Reliability-without-Validity 批判 LLM-as-Judge 可靠性 vs 有效性;UniVR 在视觉空间内做统一推理,是「第三种推理框架候选」。
3.3 批判视角(局限)
按「硬约束 vs 软约束」分:
- 硬约束(必须解决才能持续):Boogu-Image-0.1 208M 图像 dataset card 公开 PII 扫描 = hard blocker;RxBrain RxBrain-Bench 自建 + 自家模型 = self-benchmark risk,完整技术报告 TODO;UniVR 纯视觉演示能否真正学到「物理动力学」是开放问题,纯视觉协议下的评估有效性未与 text-prompted protocol 做 head-to-head;KeyFrame-Compass + MultiRef-Compass 同样存在 self-benchmark risk,且 MLLM-as-Judge 的可靠性受 Reliability-without-Validity 批判约束(rejudging-enhanced 是部分回应)。
- 软约束(可改进但非阻断):VideoChat3 4B vs 7B/13B 长视频 trade-off 未量化;评测宽度未列 VideoMME/LongVideoBench/EgoSchema/MLVU/StreamingBench 详表;SenseNova-U1 8B dense 横扫 30B-A3B MoE 的「单点 baseline 对齐」需要在更广泛 VLM benchmark 上独立验证;From Pixels to States 90h 游戏画面训练的世界模型能否迁移到非游戏领域(如机器人 sim2real)未披露。
- 方法学层面的争议:(a)「统一」作为术语在 2026-Q3 已变成高歧义词——Boogu-Image 走 Base-Thinking 推理时扩展、SenseNova-U1 走 NEO-unify 单流、VideoChat3 走 I3D-ViT + 自适应帧率,三件工作都自称「统一」,但实现路径与「统一」定义都不同,需要在评测层建立 operational definition;(b)多模态的对齐路线在 2026-Q3 仍处于 SFT-dominant 阶段——7-19 HF Daily 上榜的 Boogu-Image / RxBrain 都没有公开 RL 阶段细节;同期 SenseNova-U1 走 SFT + capability-preserving mixture 而非 RLHF,与 Agent / LLM 主题里 RLHF 主流地位形成对比。
4. 趋势判断
4.1 已发生(2026-Q1 ~ Q2)
- 统一多模态生成成为旗舰标配:SenseNova-U1(arXiv:2605.12500)、Boogu-Image-0.1(arXiv:2607.13125)、Gemma 4(arXiv:2607.02770)三件工作在 5 月底至 7 月初集中发布,且都开放权重;
- 长上下文多模态确立为 baseline:Gemini 1.5(arXiv:2403.05530)百万 token、VideoChat3(arXiv:2607.14935)自适应帧率,长上下文不再是「加分项」而是「入场券」;
- 多模态评测从单点 benchmark 走向多面体:v25 KeyFrameBench 系列 + v27 VoxENES 2026 + v28 Blind-Spots-Bench + 7-20 KeyFrame-Compass + MultiRef-Compass 共 5+ 件评测方法学工作,「二十三面体 → 二十六面体」(flyP E1 prep §1 增量 6)。
4.2 进行中(2026-Q3)
- 具身双通路成为新范式候选:RxBrain + Xiaomi-Robotics-U0 + LingBot-Video MoE 形成「生成反哺具身」的同族三件套,MoT 架构在三个团队的独立实现说明「MoT for embodied」是 2026-Q3 多团队并进的方向,不是单一论文成果;
- 推理时扩展产品化:Boogu-Image Base-Thinking 把「推理时扩展」从研究 trick 推到产品 feature,与 LLM-side RL 推理时扩展形成跨模态对位;
- 评测方法学与 self-benchmark risk 的猫鼠游戏:KeyFrame-Compass / MultiRef-Compass 用「rejudging-enhanced MLLM-as-Judge」回应 Reliability-without-Validity 批判,但 self-benchmark risk 仍是未解硬约束。
4.3 即将发生(2026-Q4 → 2027 H1)
- 「统一」的 operational definition 会被提出:v29 multimodal.md §3.3 累计 43 维度反方中的「capability mixture 不透明」预计在 Q4 由独立评测机构(HF Leaderboard v3 / LMSys Arena v2)以「统一性 operational definition」形式部分回应;
- 具身基础模型形成独立 benchmark:参考 RxBrain-Bench + ABot-N1 + Vesta(arXiv:2606.20905)+ BAD-WAM(arXiv:2607.15207)等 7 件工作的同族信号,「世界-Action 模型」评测套件可能在 2026-Q4 出现;
- 多模态 + Agent 边界进一步模糊:SenseNova 6.7 Flash-Lite(HF OpenSenseNova/SenseNova README 描述「high-performance multimodal agent model for real-world workflows」)已经把多模态与 agent 合并为同一模型 SKU,预计 2026-Q4 更多厂商跟进「多模态原生 Agent」。
5. 开放问题
- 「统一」的 operational definition:以 SenseNova-U1 NEO-unify、Boogu-Image Base-Thinking、VideoChat3 自适应帧率为代表的「统一」路径分裂,亟需独立评测给出「统一性」的可量化指标;
- 多模态 RLHF 的有效性:2026-Q3 多模态生成旗舰仍以 SFT-dominant 为主,RLHF / RLAIF / RLVR 在多模态场景下的对齐效率尚无独立 head-to-head;
- 具身双通路的
<Image>token 是先验还是学习:RxBrain 论文摘要未明示,完整技术报告 TODO(flyP 精读 §C),这是「AR + flow matching」架构能否成为 embodied AI 主路线的关键设计选择; - 多模态 self-benchmark risk 的系统性缓解:KeyFrame-Compass / MultiRef-Compass / Harness-Evolution 都在局部回应 self-benchmark 风险,但「自家模型 + 自建基准 + 自家 MLLM-as-Judge」三位一体的循环问题尚无系统性解;
- 数据集合规与多模态生成的可信度:Boogu-Image dataset card PII 扫描 hard blocker 仅是个例,整个多模态生成阵营的 dataset card 透明度都需要提升——这与 v29 multimodal.md §3.3 反方 #6「50M 全量数据 license」同根。
6. 引用合规与边界
- 综合论文清单(arXiv 号列表,共 12 件):
- 2607.14187 RxBrain
- 2607.14935 VideoChat3
- 2607.13125 Boogu-Image-0.1
- 2607.12800 UniVR
- 2607.14076 From Pixels to States
- 2607.14202 KeyFrame-Compass
- 2607.14189 MultiRef-Compass
- 2605.12500 SenseNova-U1(历史锚定,旗舰参照)
- 2607.02770 Gemma 4 Technical Report(次级锚定,开源多模态参照)
- 2505.16933 LLaDA-V(次级锚定,扩散范式参照)
- 2204.14198 Flamingo(历史锚点 1,VLM 范式起点)
- 2403.05530 Gemini 1.5(历史锚点 2,长上下文多模态)
- 未引用但相关的 arXiv:2606.13141 V-RAGBench、2607.11862 E-VQA、2504.08748 多模态 RAG 综述、2603.29616 Video-Oasis、2607.08317 LongVQUBench(多模态 RAG 与评测旁证线,本文未展开)。
- 未做 head-to-head 数字核对:Boogu-Image-0.1 vs Qwen-Image-2512 / HunyuanImage-3.0 中英 OCR 双榜具体数字未核(flyP E1 prep §2 矛盾 #4 #5);RxBrain vs PaLM-E/RT-2/Chameleon/Show-o/Transfusion/Janus/RoboBrain/Embodied-CoT head-to-head 未核(精读 §E)。
- 本文未做的事:不重写 v29 multimodal.md 活文档(那是今晚活文档接手时的事,本稿仅做主题深度综述);不下「v30 立标」终局判断;不引用任何闭源、未公开、未授权材料;不输出密钥。
本稿仅做主题深度综述,所有数据 / 事实 / 出处均可回到上述 arXiv abstract、HF 模型卡、HF papers 页、inbox/flyp 精读与 v29 multimodal.md 锚定文件追溯;数字「未披露」一律明示。