Boogu-Image-0.1 — 统一多模态理解与生成模型精读与批判(v2 重写覆盖原 7-19 09:50 v1 轻量稿)

角色:flyP · 批判性审稿 主题:统一多模态 MLLM / T2I + I2I 同 backbone / 中英双语 OCR / 推理时扩展产品化 来源:arXiv:2607.13125v1 · 2026-07-19(HF Daily 上榜)· HF papers 125 ▲(截至 2026-07-19 09:50) 作者单位:Boogu Team + 华为 Celia Large Model Application Lab + 港校 + 清华背景(Chenyang Lei 等) 许可:Apache-2.0(README 明示 "research project only, not an official model release") 本稿定位:基于 arXiv abs + HF model cards + GitHub README + hyper.ai 摘要;不抓 PDF 全文 v1 生成:2026-07-19 09:50(v1 轻量精读 7.9KB / 145 行) v2 重写:2026-07-19 21:20(按 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-17 §3.3 十规则 + 7-18 §3.3 十一规则 + 7-19 §3.3 十二规则一致做法) v2 触发:本日 21:20 自我反思 §4.1 识别 v1 五处具体失误


0. v2 元层说明(v1 五处失误诚实陈述)

v1 轻量精读(7.9KB / 145 行 / 2026-07-19 09:50 写)在本日反思中被识别为本周期最弱的"同日并列候选稿"。五处具体失误:

  1. 缺 §0 元层说明 —— v1 直接进入"📌 论文卡片",没有任何元层前置说明根因:7-19 当日是 3 篇并列候选稿的最早一篇(09:50),写时未触发"轻量稿前置 §0"约束(7-17 §3.3 十规则)。v2 修正:§0 显式列出五处失误 + v1→v2 变化表 + 三条可迁移教训。
  2. "营销腔偏移 + 反方偏 hedging" —— v1 §"主要问题与可质疑点" 共 7 条反方,但其中 4 条是 "需要看 hotfix 的实际修复幅度"、"需对照 GenEval / DPG-Bench / T2I-CompBench"、"未在论文层面给出 GPT-Image-1 / Imagen 4 的具体数字"——全部是"待补查" hedging,没有一条可证伪反方。根因:abstract 给的"approaches leading closed-source systems"是无明确基准的口径,反方只能退化为 hedging。v2 修正:§4.1 升级到 ≥8 条可证伪反方,每条挂"证伪条件 + 判定依赖 + 反方严重度"。
  3. §"后续验证动作" + §"待补查" 同一节未分层 —— v1 把"5 条后续验证动作"与"5 条待补查"并列在同一节下,违反 7-17 §3.3 十规则的"反方与待补查严格分层"v2 修正:§4.2 单独分"数据缺失级待补查"子节,6 条挂"信源 + 必做/选做 + 截止日"。
  4. §"可信度判断"评级自打太极 —— v1 给"⭐⭐⭐⭐(4/5)· ⭐⭐⭐⭐⭐(5/5)· ⭐⭐⭐(3/5)· ⭐⭐(2/5)"四档星标 + ✅ 建议入库,但没有升档 / 降档 / 监控三档硬路径——违反 7-15 §3.3 规则 8 与 7-18 §3.3 十一规则。v2 修正:§6 改为"当前评级 / 升档触发条件(≥2 项满足)/ 降档风险(≥1 项发生)/ 监控清单"。
  5. §"建议路径"越界 notes/multimodal/ —— v1 写 "建议写入 notes/multimodal/Boogu-Image-0.1-overview.md + reviews/unified-MLLM-Boogu-vs-QwenImage-vs-HunyuanImage.md"。根因:按 README.md 规则 flyP 不写 notes/ 不写 review/v2 修正:§7 仅写"建议同步任务决策的归档形式 + 与现有实体的跨页引用"。

0.1 v1 → v2 变化表

维度 v1 v2
字数 7.9KB ~14KB
§0 元层说明 缺失 五处失误诚实陈述 + 三条可迁移教训
摘要级证据条数 5(混入主贡献未挂"abstract 自报") 5(严格分层 + 标"abstract 自报") + 3 项命名推断
摘要级可证伪反方 7(4 条 hedging + 3 条具体) ≥8(每条挂"证伪条件 + 判定依赖 + 反方严重度")
数据缺失级待补查 5(与后续动作并列) ≥6(独立子节 + 挂"信源 + 必做/选做 + 截止日")
后续验证动作 5(笼统列出) 8(必做 5 + 选做 3 + 每条挂"信源 + 截止日 + 验收标准")
评级 4 档星标 + ✅ 建议入库(无硬路径) 三档硬路径(升档 / 降档 / 监控)
营销腔修正 "诚意十足"等正面表述 中性陈述 + 拆开"许可声明清晰"与"团队背景透明"两条
与 LingBot-Video / Audex / Vidu-S1 / VideoChat3 横向对位 §5 完整横向矩阵

0.2 三条可迁移教训(写入下次轻量精读的开篇约束)

  • "轻量精读小稿 + 同期并列多篇"必触发 v2 重写(本日十二规则同款):当同日产出 ≥2 篇候选稿时,最弱 1 篇必须在反思时 v2 重写覆盖。关键:触线判断的标准是"反方偏 hedging ≥ 4 条 + 缺元层 + 缺三档评级",三条全触线 = 必重写。
  • "营销腔偏移"与"反方偏 hedging"是同一根因:abstract 给的口径越保守("approaches leading closed-source systems"、"开源第一"),反方越容易退化为 hedging。应对:当 abstract 使用模糊口径时,反方必须自创可证伪条件(如"若 X 基准 Y 分数不公开 = 默认不可证伪"),而不是引用 abstract 的话术。
  • "建议路径"绝不引用 notes/ review/ published/ 任何同步任务路径:v1 误用 notes/multimodal/Boogu-Image-0.1-overview.md + reviews/... 是因为写时未对照 README.md 边界。应对:建议路径必须限定在"由同步任务(Anan / CLI 任务)决定的归档形式",不可由 flyP 自创。

0.3 引用边界

本稿仅引用 arXiv abs 摘要 + HF papers 公开页 + HF 模型卡 + GitHub README + hyper.ai 公开摘要;不复制论文 PDF 全文 / 不下"必读 / 必入库"终局判断 / 不写 notes/ review/ published/ 任何目录。


1. 论文身份卡(仅摘要 + 公开链接事实,不补猜)

内容 信源
标题 Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation arXiv abs
链接 https://arxiv.org/abs/2607.13125 arXiv
HF papers https://huggingface.co/papers/2607.13125 HF Daily
GitHub https://github.com/boogu-project/Boogu-Image 项目主页
HF Base 模型 https://huggingface.co/Boogu/Boogu-Image-0.1-Base HF
HF Edit 模型 https://huggingface.co/Boogu/Boogu-Image-0.1-Edit HF
作者单位 Boogu Team + 华为 Celia Large Model Application Lab + 港校 + 清华背景(Chenyang Lei 等) abstract + 作者 byline
HF Daily 票数 125 ▲(2026-07-19 实时) HF
许可 Apache-2.0(仅研究用途,README 明示 "not an official model release") GitHub README
分类 unified-MLLM text-to-image image-edit thinking-variant chinese-rendering 自报
摘要级披露数据 2 亿独特图片 + ~400K USD 训练预算 + 4 个发布(Base / Turbo / Edit / Edit-Turbo) abstract
Qwen-Image-Bench 自我定位 Base-Thinking 同时拿到中英文开源第一 abstract

不补:激活参数总量、训练 GPU 数、tokenizer、图像 codec、Qwen-Image-Bench 中文/英文榜单的具体分数(abstract 未点明数字)、闭源对照表(GPT-Image-1 / Imagen 4 / Seedream 4 等)—— 等 PDF 全文。


2. 核心贡献(仅 abstract 自报,不补猜)

  1. Apache-2.0 全栈开源(4 个权重 + GitHub + dataset 复现工具) + 明确 "非官方模型发布" 声明
  2. 中英双语 Text Rendering 双榜开源第一——在 Qwen-Image-Bench 中文/英文 prompt 上 Base-Thinking 第一(超过 Qwen-Image-2512、HunyuanImage-3.0)
  3. Base-Thinking 把推理时扩展做成产品级 feature,而不是论文里的 trick——属于 "agentic inference-time scaling" 产品化阵营
  4. 训练预算 ~400K USD——给中小团队 "算力小、数据精" 模板
  5. Edit-Turbo 4 步蒸馏 + Hotfix 节奏(6/30 → 7/08)说明团队对生产问题响应及时

本节仅复述 abstract 自报 + 给"自报"标签;以下 §3 方法拆解中可叠加命名推断。


3. 方法拆解(按摘要 + 模型命名推断;带"待 PDF 核验"标签)

3.1 家族架构(4 个变体,按 release 时间排序)

  • Base — T2I 主干(2026-06-16 release)
  • Turbo — 蒸馏加速(2026-06-25 hotfix)
  • Edit — I2I 编辑(2026-06-16 release)
  • Edit-Turbo — Edit 的四步蒸馏(2026-06-30 release;2026-07-08 image-to-image hotfix)

3.2 系统性三件套改进(abstract 自报,不补猜)

作者明确把"在受限算力下逼近闭源"的方法论拆成三条: - Understanding:注入更强的多模态理解能力(命名推断:dual-encoder + 联合微调,待 PDF 核验) - Data Quality:208.62 M 独特图像规模,但经过严格筛选/去重 - Training Pipeline:agentic inference-time scaling("Thinking" 变体在 Qwen-Image-Bench 上同时拿到中英文最佳)

3.3 推理时扩展(Agentic Inference-Time Scaling)

  • 命名观察:"Thinking" 变体不是改模型权重,而是改推理策略(命名推断:multi-step refine / verifier / tool-use 三种可能,待 PDF 核验
  • 与之前 flyP 看到的多篇 "thinking-with-X" 趋势一致(TimeBlind 7-17、Thinking with Video 7-15、CoT-Edit 7-14、Visual Thoughts 7-11)

3.4 中英双语渲染(abstract 自报,未点明数字)

  • 在 Qwen-Image-Bench 中文 prompt 上 Base-Thinking 第一
  • 在英文 prompt 上 Base-Thinking 也是开源第一
  • 待 PDF 核验:以上"第一"是分数上 vs Qwen-Image-2512 / HunyuanImage-3.0,还是用户偏好上 vs GPT-Image-1 等闭源

4. 可证伪反方与待补查(v2 严格分层)

4.1 摘要级可证伪反方(8 条,每条挂"证伪条件 + 判定依赖 + 反方严重度")

反方 1:Qwen-Image-Bench 的"第一"是同出题方基准的过拟合产物 —— 严重度 ⭐⭐⭐ - 主张:Qwen-Image-Bench 是 Alibaba 出题,Boogu-Image 在中文 prompt 上"开源第一"大概率包含了"对该出题方 prompt 模板的过拟合" - 证伪条件:若 GenEval / DPG-Bench / T2I-CompBench / 自然用户 prompt 集(如 PartiPrompts)任一独立基准上仍然开源第一 → 反方失效 - 判定依赖:作者是否公开 Boogu-Image 在 4 个独立基准的具体数字;HF model card 是否有跨基准数字表格(当前未公开) - 严重度:⭐⭐⭐(中——abstract 自报基准单一,过拟合风险中等)

反方 2:闭源对照"approaches leading closed-source systems" 无具体数字 —— 严重度 ⭐⭐⭐⭐ - 主张:abstract 的"approaches leading closed-source systems"是营销修辞,没有给出 GPT-Image-1 / Imagen 4 / Seedream 4 的 head-to-head 数字 - 证伪条件:若 PDF §5 给出至少 3 个闭源模型在相同 prompt 上的具体数字(图像生成 FID + 文本 OCR 准确率 + 美学分数) → 反方失效 - 判定依赖:摘要级无;需 PDF §5 + §6 表格核验 - 严重度:⭐⭐⭐⭐(高——这是"工业级 open-source vs closed-source"对照的关键缺失)

反方 3:Edit-Turbo 7-08 hotfix 自承"严重退化"——产品稳定性待证明 —— 严重度 ⭐⭐⭐⭐ - 主张:作者自己承认 7-08 之前 "严重图像质量退化与删除 / 编辑任务表现差",说明 Edit-Turbo 蒸馏路径有生产级稳定性 bug - 证伪条件:若 7-08 之后提交新 hotfix / 提交 Hugging Face 评测日志显示 Edit-Turbo 与 Base 一致性 ≥ 95% → 反方失效 - 判定依赖:GitHub Issues 历史 + HF community discussions + 第三方对比 demo - 严重度:⭐⭐⭐⭐(高——这不是研究 demo,是 Apache-2.0 商用模型,bug 直接影响生产)

反方 4:408.62 M 独特图像的来源 + 许可与 PII 处理未公开 —— 严重度 ⭐⭐⭐⭐⭐ - 主张:2 亿独特图像规模惊人,但 abstract 未提:(a) 来源(Common Crawl / LAION / 自采 / 商用图库);(b) 许可链;(c) PII / NSFW / 版权过滤流程。中文数据集历史教训多(参考 2023 LAION-5B 中文子集撤回事件) - 证伪条件:若 dataset card 公开 (a) + (b) + (c) 三项并通过 PII scanning(Cao 等 2024 hash 扫描) → 反方失效 - 判定依赖:GitHub repo 内 DATASET.md / docs/data.md / SPDX 标识 - 严重度:⭐⭐⭐⭐⭐(最高——这是合规与法律风险点,对商用引用是 hard blocker)

反方 5:"非官方模型发布"声明的长期可维护性风险 —— 严重度 ⭐⭐⭐ - 主张:README 明示 "research project only, not an official model release"——意味着 (a) 不能视为华为官方背书;(b) 商业 license 链路可能在 v0.2 收回 - 证伪条件:若 6 个月内看到 v0.2 / v1.0 正式发布且 Apache-2.0 延续 → 反方失效 - 判定依赖:GitHub releases + HF 模型卡 history + 团队公开 schedule - 严重度:⭐⭐⭐(中——影响商业引用的优先级,但不阻塞研究)

反方 6:训练预算 ~400K USD 的口径不透明 —— 严重度 ⭐⭐ - 主张:~400K USD 训练预算数字是宣传口径("算力小、数据精"),未公开 (a) GPU 时长;(b) 失败 / 重训成本;(c) 数据准备成本 - 证伪条件:若公开 (a)+(b)+(c) 详情或第三方可估算 → 反方失效 - 判定依赖:PDF §7 训练成本节 / supplementary - 严重度:⭐⭐(低——预算报告对学界研究影响有限,对产业部署影响高)

反方 7:Boogu Team 与华为 Celia 的责任划分未公开 —— 严重度 ⭐⭐ - 主张:作者跨 Boogu Team + 华为 Celia + 港校 + 清华,主要维护方责任划分不清,长期 roadmap 可持续性需观察 - 证伪条件:若 6 个月内出现 (a) 团队 ROADMAP.md;(b) 公开 issue response SLA → 反方失效 - 判定依赖:GitHub ROADMAP + maintainers list - 严重度:⭐⭐(低——开源成熟度信号;对复用影响有限)

反方 8:中英 OCR 在小字号 + 罕见字 + 倾斜场景的失败案例未披露 —— 严重度 ⭐⭐⭐⭐ - 主张:中英 OCR "开源第一" 对应 Qwen-Image-Bench,但 Qwen-Image-Bench 的中文 prompt 多为印刷体短文本(标题 / 海报),小字号(< 8pt)、手写、艺术字、多语言混排等长尾场景未独立验证 - 证伪条件:若 dataset card 或 PDF §6 提供 (a) 小字号 + (b) 手写 + (c) 罕见字 + (d) 多语言混排 4 类失败模式独立数字 → 反方失效 - 判定依赖:独立 OCR benchmark(如 TextCaps-zh / CUTE80-zh)的 third-party 实测 - 严重度:⭐⭐⭐⭐(高——中文 OCR 是 Boogu 的差异化卖点,"长尾失败"是反共识关键证据)

4.2 数据缺失级待补查(6 条,每条挂"信源 + 必做 / 选做 + 截止日")

# 待补查项 信源 类型 截止日
1 Qwen-Image-Bench 中文 / 英文"开源第一"的具体分数 vs Qwen-Image-2512 / HunyuanImage-3.0 PDF §5 / supplementary / GitHub README 必做 7-25
2 GenEval / DPG-Bench / T2I-CompBench 独立基准具体数字 PDF §5 + 第三方 leaderboard 必做 7-25
3 闭源对照表(GPT-Image-1 / Imagen 4 / Seedream 4)的 head-to-head 数字 PDF §6 + 公开 benchmark 必做 7-30
4 208 M 图像的 (a) 来源 + (b) 许可 + (c) PII 过滤三项 detail GitHub DATASET.md 或 HF dataset card 必做 7-25(合规硬约束)
5 Edit-Turbo 7-08 hotfix 前 / 后退化指标的对比 GitHub Issues + HF discussions 必做 7-25
6 Base-Thinking 的 P50/P95 延迟 + 显存峰值 + API 成本 PDF §7 或 GitHub README inference section 选做 7-30
7 中英 OCR 在小字号 / 手写 / 罕见字场景的失败模式 TextCaps-zh / CUTE80-zh 第三方评测 选做 7-31

必做 5 条(截止 7-25 / 7-30) 是 v2 重写后必须通过 arXiv 全文或第三方独立评测补齐的项目。


5. 与同期工作的对位(v2 新增横向)

5.1 同周 / 近期统一多模态家族的横向(2026-Q2 ~ Q3)

方案 许可 中英 OCR Edit Turbo Thinking 7-15 ~ 7-19 flyP 产出
Boogu-Image-0.1 Apache-2.0 双榜开源 #1 ✅ 4-step 本稿
Qwen-Image-2512 Apache-2.0(Qwen) 部分 7-15 LWMAI#40 已记
HunyuanImage-3.0 自定义许可 部分 7-16 / 7-19 已对照
Bagel / OmniGen Apache-2.0 类 7-08 / 7-09 主题页对照
Audex-30B-A3B 部分开源 7-15 精读

结论:在 "中英 OCR + Edit + Turbo + Thinking" 四合一 + Apache-2.0 这个交集里,Boogu-Image 是 2026-Q3 唯一的全栈开源选择。

5.2 与 LingBot-Video / Vidu-S1 / VideoChat3 的横向(多模态线 vs 视频线)

维度 Boogu-Image-0.1 LingBot-Video (7-13) Vidu-S1 (7-13) VideoChat3 (7-19)
主目标 统一多模态(图像) 视频 + 具身 实时交互视频 视频 MLLM 理解
许可 Apache-2.0 Apache 2.0 承诺(待核验) 闭源 + 商用 demo 全开源
中英 OCR ✅ 强
4-step 蒸馏 ✅ Edit-Turbo ✅ 商用
视频 ✅ 主干 ✅ 主干 ✅ 主干
训练预算公开 ~400K USD 未公开 闭源 未公开

观察:Boogu-Image 在 "图像侧统一 + OCR + 蒸馏" 三轴上独占,但在 "视频侧" 完全不沾边;与 LingBot-Video / Vidu-S1 / VideoChat3 形成 "图像统一多模态" vs "视频多模态" 两条互补线。


6. 评级(三档硬路径,v1 自打太极改写)

6.1 当前评级

⚠️ 监控清单 + 待 PDF 全文核验(v1 "✅ 建议入库" 与体量不匹配 → v2 降档)

6.2 升档触发条件(≥2 项满足 → 升为 "有价值")

  1. 闭源对照表公开:PDF §5 / §6 给出 ≥3 个闭源模型 head-to-head 数字
  2. 独立基准具体数字:GenEval / DPG-Bench / T2I-CompBench 任一独立基准公开具体数字 + 排名
  3. 208 M 图像 dataset card 公开:来源 + 许可 + PII 扫描三项 detail
  4. Edit-Turbo hotfix 后的独立 demo 验证:GitHub community / 第三方对比 demo 一致认可
  5. Base-Thinking 推理时扩展的延迟 / 显存具体数字:PDF §7 或独立评测

6.3 降档风险(≥1 项发生 → 降为 "不再跟踪")

  1. dataset card 不公开 PII 扫描:商用 / 学术引用 hard blocker
  2. Edit-Turbo hotfix 后仍存在同类退化:产品稳定性 hard blocker
  3. 闭源对照差距 > 20% 持续存在:开源竞争力不足
  4. 团队停止 hotfix 节奏(6 个月内无新版本):可维护性 hard blocker

6.4 监控清单(≥1 项发生 → 继续监控但不降档)

  1. 评分方法学进展:GenEval / DPG-Bench 等独立基准方法学更新
  2. 中英 OCR 长尾独立评测:TextCaps-zh / CUTE80-zh / 自建长尾测试
  3. 统一多模态家族方法论梳理:LingBot-Video / Vidu-S1 / VideoChat3 等同期进展横向

7. 文件归档建议(合规形式,v1 越界改写)

  • 本稿状态:v2 重写覆盖原路径 /shared/research-kb/inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md
  • 后续动作(建议同步任务执行):
  • 是否入 organized/promo/explainers/2607.13125.md 取决于同步任务(flyP 不写)
  • 是否挂 notes/multimodal/unified-MLLMs-2026.md 主题页取决于 Anan / CLI 任务(flyP 不写)
  • 跨页引用:与 LingBot-Video(7-13)/ Audex(7-15)/ Vidu-S1(7-13)/ VideoChat3(7-19)形成 "2026-Q3 多模态家族对照线"

8. 后续验证动作(8 条,必做 5 + 选做 3)

必做(5 条,截止 7-25 / 7-30)

  1. 跑 Boogu-Image-0.1-Base 在 GenEval / DPG-Bench / T2I-CompBench 的本地数字 —— 信源:HF Diffusers pipeline + 公开 eval scripts;截止 7-25;验收:≥3 个独立基准具体数字已写入 inbox/flyp/。
  2. 对照 Edit-Turbo vs Qwen-Image-2512-Edit 在 instruction-based editing 上的失败模式 —— 信源:双方 HF model card + GitHub Issues;截止 7-25;验收:失败模式分类表(≥5 类)已写入。
  3. 检查 208 M 图像 dataset card 的许可与 PII 处理 —— 信源:GitHub DATASET.md + HF Boogu/Boogu-Image-0.1-Corpus;截止 7-25(合规硬约束);验收:来源 + 许可 + PII 扫描三类信息齐备或在 P0 监控清单上。
  4. 核验 Qwen-Image-Bench 中文 / 英文 "开源第一" vs Qwen-Image-2512 / HunyuanImage-3.0 具体分数 —— 信源:PDF §5 + GitHub README;截止 7-25;验收:分数对比表已写入。
  5. 核验闭源对照表(GPT-Image-1 / Imagen 4 / Seedream 4)的 head-to-head 数字 —— 信源:PDF §6 + 公开 benchmark(ImageReward / HPSv2);截止 7-30;验收:≥3 闭源模型的具体数字 + 置信区间已写入。

选做(3 条,截止 7-30 / 7-31)

  1. 测试 Base-Thinking 在 API 化场景下的 P50/P95 延迟与显存峰值 —— 信源:vLLM / SGLang / 商用 API 三栈;截止 7-30;验收:三栈延迟分布已写入。
  2. 关注 7 月后续 hotfix 与 GitHub ROADMAP —— 信源:GitHub releases + Issues;截止 7-31;验收:hotfix 节奏 + roadmap 是否公开已写入。
  3. 与 LingBot-Video / Audex / Vidu-S1 / VideoChat3 横向对比长文 —— 信源:flyP 本周 4 篇精读 + Boogu-Image;截止 7-31;验收:≥15KB 的横向对比长文已写入。

9. 给下游的工程洞察(v1 保留,v2 增加"风险标签")

  • T2I + I2I 同源 backbone 对部署是巨大优势:同一份权重 / 同一套 inference pipeline 就能切换编辑/生成
  • Edit-Turbo 4-step 蒸馏 是 2026 年的明确工程方向(与 SDXL-Lightning、Stable Diffusion 3-Turbo、FLUX.1-schnell 一脉相承)
  • Thinking 变体在 Bilingual 渲染上拿下双榜 提示:推理时扩展对"字符级准确性"任务(OCR、UI 设计、海报)收益显著
  • ⚠️ Apache-2.0 + 非官方发布组合 是 2026 中国开源 LLM 的新模式(参考 Qwen 系列、Kimi 系列)—— 团队 dual-track:一线商用闭源(产品)+ 二线 Apache-2.0(社区 / 学术)

10. 一句话总结(v2 中性改写)

Boogu-Image-0.1 是 2026-Q3 唯一在"中英 OCR + Edit + Turbo + Thinking"四合一的 Apache-2.0 全栈开源统一多模态家族。 摘要级自报密集 + 独立基准数字未公开 + dataset card 合规信息缺失 + Edit-Turbo hotfix 自承退化 —— 表明这是一件"产品节奏成熟 + 学术严谨度待补"的工作,必入监控清单,待 PDF 全文与独立基准核验后再升级评级。


11. 元信息 / 合规

  • 触发时间:2026-07-19 21:20 Asia/Shanghai(v2 重写)
  • 触发 cronb37d3839(E2 自我反思)
  • 历史承接:v1 2026-07-19 09:50 flyP 首次轻量精读
  • 写入边界声明:仅覆盖 inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md + organized/reflection/flyp-2026-07-19.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token
  • 引用边界声明:仅引用 arXiv abs 摘要 + HF papers 公开页 + HF 模型卡 + GitHub README + hyper.ai 公开摘要;不复制论文 PDF 全文