PANORAMA + UFO · 多模态 grounded captioning + omni-condition 评估 · 双短精读与批判
执行体:flyP · 2026-09-19 22:50 CST · research-kb · multimodal + evaluation · 精读棒第 N+2 期(本日第 6 棒,晚班) 承接: - 上午棒
inbox/flyp/2026-09-19-0950-Zing-0.5-playable-worlds-critical-read.md- 周六深度棒inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-reviews.md(Atria Dawn / Model-or-Harness / Orthrus 反方) - 下午棒inbox/flyp/2026-09-19-1550-LimiX2-and-MiniMax-H3-physical-world-eval-critical-read.md- 底本:inbox/flyp/2026-09-19-multimodal-e1prep.md增量 5(paper_cards 1410 / 1421)+ tom 9-19 0900 HF Daily + paper_cards 1410/1421 主分类 multimodal 性质:轻量精读(双篇组合),核心贡献 + 主要问题 + 可信度 + 入库建议 + 后续验证动作;不写全文综述、不做 Substack 多轮扩展 标签:multimodalgrounded-captioningpanoptic-segmentationevaluation-frameworkomni-condition-alignmentsubject-driven-customizationICML-2026ENS-WillowgPQ-metricPanoCapsUFO-Bench
〇、关键事实卡(只列必要元信息,避免原文复述)
A 篇 · PANORAMA · Panoptic Grounded Captioning via Mask Proposal Selection
- arXiv:
2609.19143(v1 / 2026-09-16 17:59:30 UTC 提交 / 15,171 KB / 15 页) - 分类:cs.CV(主)+ cs.CL(跨)
- 机构:ENS Paris / Inria Willow(Sara Pieri 等,第一作者);机构主页
di.ens.fr/willow/research/panorama/已声明 code / data / models release - paper_card:1410 ✓ 主分类 multimodal · 9-18 12:30 入库
- HF Daily:未入榜(暂未入立标池 · 与 Zing-0.5 等新立标同批但未进 HF Daily Top 15)
- 任务定义:panoptic grounded captioning —— VLM 同时(a)描述前景物体 + 背景区域 + (b)将每个 referring phrase 与 pixel-level mask 配对
- 三大贡献: 1. PanoCaps benchmark:基于 panoptic segmentation 数据集人工标注的 dense caption + entity-level 图像-文本对齐 + near-complete pixel coverage,同时支持训练 / 评估 2. phrase-mask matching protocol + 广义 Panoptic Quality (gPQ) metric:联合评估 text + mask agreement(不是分开的 PQ 也不是分开的 CIDEr) 3. PANORAMA 模型:把 phrase grounding 形式化为"phrase-conditioned mask proposal pool selection" —— VLM 用 contextualized phrase 表示条件化一个预训练 segmenter,学习在候选 mask 池中选择对应 phrase 的 mask,caption 生成 + grounding 联合训练
- 关键能力声明:允许单个 phrase 引用 single region 或 multiple instances(multi-instance grounding)
- 关键性能声明:在 PanoCaps 上整体 grounding 最佳;在多个 pixel-level grounding 任务上匹配或超过专用模型
- 开源状态:✅ code + data + models 全部公开(机构主页声明)
- 关键经济性数字(待核):无显式训练算力 / 推理延迟 / 数据规模数字
B 篇 · UFO · Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation
- arXiv:
2609.12397(v2 / 2026-09-17 13:13:59 UTC 更新 / 26,711 KB / 13 页 + 6 图) - 分类:cs.CV(主)+ cs.AI(跨)
- 会议:ICML 2026 accepted(Forty-Third International Conference on Machine Learning)
- 机构 / 作者:第一作者 Danning Zhang(待核机构主页);通讯作者未在 abstract 中确认
- paper_card:1421 ✓ 主分类 multimodal · 副 evaluation · 9-18 19:00 入库
- HF Daily:未入榜(与 PANORAMA 同批未进 HF Daily Top 15)
- 核心问题:multi-modal image generation(特别是 subject-driven customization)的评估滞后于生成;现有方法(embedding-based / MLLM-based)对每个 modal condition 单独评估对齐,与"同时多模态对齐"目标相矛盾 → 与人类判断一致性差
- 三大贡献: 1. UFO framework:首个 unified framework for omni-condition alignment simultaneous evaluation(不是分模态评估) 2. Atomized Chain-of-Evaluation (CoE) paradigm:把 omni-condition alignment 分解为 sequential chain of fine-grained, disentangled Atomic Evaluation Units (AEUs) + 按 modality-relevance 分类 + 用通用 / 专用 functional call 精确验证不同 AEU 类型 3. UFO-Bench:专用 benchmark,整体评估现有 customization model 在文本 + 视觉条件多种 mutual interaction 下的性能
- 关键数字:UFO 与人类评价偏好的相关性最高,平均提升 15.25%
- 开源状态:待核(ICML 2026 通常 release · abstract 未声明)
一、A 篇 · PANORAMA 核心贡献拆解
1.1 任务定义价值(为什么 panoptic grounded captioning 是新轴)
- 既有范式:dense captioning(CIDEr / SPICE 等文本指标)+ pixel grounding(mIoU / PQ 等 mask 指标)分开优化,导致"描述完整但 mask 不准"或"mask 准但描述不完整"两种退化共存
- 新任务:要求 VLM 同时做两件事 —— 单次 forward pass 内(a)输出 entity-level description(前景 + 背景),(b)为每个 phrase 输出 pixel-level mask
- 判断:🟢 高价值。这是把"image captioning + referring expression segmentation"合一的统一任务定义,符合 2026 年 VLM 从"输出文本"走向"输出结构化 + grounding"的主线
1.2 方法贡献:phrase-conditioned mask proposal pool selection
- 抽象:把 phrase grounding 形式化为 selection problem(不是 generation problem)
- 不让 VLM 直接生成 mask
- 而是让 VLM 用 phrase 表示条件化一个预训练 segmenter,生成 candidate mask pool
- VLM 学习在 pool 中选择对应 phrase 的 mask
- 架构隐含信号:VLM 需要与一个 SAM-style segmenter 形成对偶接口(conditioning interface + selection head),caption generation loss + mask selection loss 联合训练
- 优势:
- 复用现有强 segmenter(SAM-2 / Mask2Former / Mask2Former++) → 降低 VLM 直接预测 mask 的难度
- selection problem 允许 single phrase → multiple instances(重要:现有 dense captioning 假设一个 phrase 一个 region,PANORAMA 显式打破)
- 判断:🟡 中-高价值。selection formulation 比 generation 更易优化,但 phrase-conditioned segmenter 的接口训练稳定性、selection head 的可解释性、mask proposal pool 的大小都是工程关键,摘要级信息不足以判断。
1.3 评估方法学:PanoCaps + phrase-mask matching + gPQ
- PanoCaps:基于 panoptic segmentation 数据集(Cityscapes / COCO / ADE20K 等 panoptic 数据)人工标注
- "near-complete pixel coverage" 是关键声明 —— 与现有 captioning benchmark 相比,强调"每个像素都有对应 phrase"或"每个实体都有 mask"
- phrase-mask matching protocol:将 phrase 与 mask 配对的协议(Hungarian matching / IoU 阈值 / 多对一规则)
- gPQ (generalized Panoptic Quality):在 PQ 基础上联合评估 text + mask agreement —— 是对 PQ 的扩展
- PQ = (IoU-based segmentation quality × panoptic segmentation quality) 的一半
- gPQ = 把 text quality(CIDEr / CLIPScore)也纳入乘积
- 判断:🟢 高价值。评估方法学贡献是 PANORAMA 最稀缺的产出,因为 gPQ 可以独立于 PANORAMA 模型被任何 VLM-grounding 系统使用。这与本周已有的 MultihopSpatial(3D spatial eval)、MC-Search(agentic MM-RAG eval)、UXBench(UI/UX eval)、Φ-Bench(AI infra eval)、MiniMax-H3(physical world eval)形成"评估方法学"主轴的强扩展。
1.4 关键问题与待验证
| # | 问题 | 类型 | 严重度 |
|---|---|---|---|
| 1 | "PANORAMA 整体 grounding 最佳"是相对什么 baseline?现有 grounded captioning 模型(GLaMM / GroundMLLM / SAM4MLLM 等)有无 head-to-head? | 复现 / 对比 | 🟡 中 |
| 2 | "phrase-conditioned mask proposal pool" 的 pool 大小、selection 复杂度如何随 phrase 数量变化?推理时延是否可控? | 工程 | 🟡 中 |
| 3 | PanoCaps 标注规模(多少图 / 多少 phrase / 多少 instance)?人工标注成本 / 质量?标注员一致性(Cohen's κ / ICC)? | 数据 / 评测 | 🟡 中 |
| 4 | "matched or exceeded specialized models" 的 specialized models 列表(Grounded-SAM / SAM2Long / ref-SAM 等)? | 复现 / 对比 | 🟡 中 |
| 5 | gPQ 的具体公式(如何把 CIDEr / CLIPScore 与 IoU 联合)?与 PQ 的兼容性? | 方法学 | 🟡 中 |
| 6 | 训练算力 / 数据 / 推理延迟数字缺失 → 工程说服力打折 | 工程 | 🟡 中 |
| 7 | ENS Willow 团队的工业背景 / 是否会被商业公司(SAM 系列 / Meta / Apple)快速跟进? | 时效 | 🟢 低(学术价值优先) |
| 8 | 多语言支持(abstract 全英文,code 是否支持非英语 phrase)? | 覆盖 | 🟢 低 |
1.5 综合可信度
- 方法学:🟢 高(task definition + formulation + metric 三层都清晰)
- 模型:🟡 中(selection formulation 漂亮,但实际效果与 head-to-head 待验)
- 评估:🟢 高(PanoCaps + gPQ 是稀缺贡献)
- 开源:🟢 高(code + data + models 全公开)
- 综合:🟢 高,建议入库(multimodal 主轴立标候选)
二、B 篇 · UFO 核心贡献拆解
2.1 问题诊断:单模态独立评估 vs 同时对齐
- 现有方法的两条路径: 1. Embedding-based:CLIP / DINO 等 embedding 算 text-image alignment(一次算一对) 2. MLLM-based:GPT-4o / Qwen-VL 等 MLLM 给 holistic judgment(一次给一个打分)
- 根本缺陷:两条路径都假设每个 modal condition 可以单独评估,但 multi-modal customization 的目标是多个 condition 同时满足("主体 A 用风格 B 出现在场景 C 中"是 3 个 condition 的联合)
- 判断:🟢 高价值。这是把"评估目标"与"评估方法"对齐的诊断 —— 评估方法学的 first-principles 纠偏
2.2 方法贡献:Atomized Chain-of-Evaluation
- 三步范式: 1. Decompose:把 omni-condition alignment 分解为 sequential chain of fine-grained, disentangled Atomic Evaluation Units (AEUs) 2. Categorize:按 modality-relevance 分类(text-only / image-only / cross-modal / joint) 3. Verify:通用 / 专用 functional call 精确验证不同 AEU 类型(不是单一 MLLM 调用)
- 与 Chain-of-Thought 的关系:CoE 把"reasoning chain"用于"evaluation chain",把 evaluation 任务变成 reasoning 任务
- 关键工程信号:需要 MLLM + functional call framework(如 ToolBench / LangChain / DSPy 风格)支撑;functional call 的设计是关键
- 判断:🟢 高价值。CoE 是把 CoT 范式跨任务域迁移到 evaluation 的成功案例,与 V1 评估范式(end-to-end MLLM 打分)相比,可解释性 + 可调试性 + 可扩展性都更强
2.3 评估方法学:UFO-Bench
- 设计目标:整体评估现有 customization model 在文本 + 视觉条件 mutual interaction下的性能
- 关键特征:不是简单 subject-driven benchmark(已有 DreamBench / Subject-Drive / DreamBooth suite),而是专门测 multiple condition 同时满足的能力
- benchmark 规模(待核):abstract 未声明,需查正文 / 附录
- 判断:🟡 中-高。benchmark 名称 + ICML 2026 双重信号 = 学术价值高;但规模 / 覆盖度 / 与 DreamBench 等老 benchmark 的兼容性都需要正文确认
2.4 关键数字:与人类判断 +15.25% 相关性
- 声明:UFO 与人类评价偏好的相关性最高,平均提升 15.25%
- 判断:🟡 中-高数字可信度声明。待核:
- "相关性"用哪个指标(Spearman / Kendall / Pearson)?
- "平均提升 15.25%"是相对哪个 baseline(CLIPScore / GPT-4o scorer / 人类 pairwise preference)?
- 人类标注规模 / 标注员一致性?
- 在哪些 customization 任务上提升最大 / 最小?
2.5 关键问题与待验证
| # | 问题 | 类型 | 严重度 |
|---|---|---|---|
| 1 | functional call 设计细节(哪些 AEU 用通用 MLLM 调用、哪些用专用工具)?是否依赖外部工具(CLIP / DINO / 物体检测器)? | 方法 / 工程 | 🟡 中 |
| 2 | UFO-Bench 的实际 benchmark 规模 / 任务覆盖 / 与 DreamBench 等老 benchmark 的对照 | 数据 / 评测 | 🟡 中 |
| 3 | +15.25% 的具体计算方式、统计显著性、跨任务一致性 | 评测 | 🟡 中 |
| 4 | 是否开源 code / benchmark(ICML 2026 通常 release · 待核) | 开源 | 🟡 中 |
| 5 | AEU 的"原子性"如何保证(避免粒度太粗或太细)?是否有人工 ablation? | 方法学 | 🟢 低 |
| 6 | Chain-of-Evaluation 的推理成本(多次 MLLM 调用 vs 端到端一次)? | 工程 | 🟡 中 |
| 7 | 通用 MLLM backbone(GPT-4o / Qwen-VL / InternVL)的选择是否影响 UFO 性能? | 鲁棒性 | 🟡 中 |
| 8 | 在 real-world user prompt(vs curated benchmark)上的稳定性? | 实用性 | 🟢 低 |
2.6 综合可信度
- 方法学:🟢 高(CoE + AEU + functional call 三层抽象清晰)
- 模型 / 框架:🟡 中(UFO 本身是 evaluation framework 不是生成模型,"效果"需要 functional call backbone 支撑)
- 评估:🟢 高(ICML 2026 + 15.25% + UFO-Bench 三重信号)
- 开源:🟡 中(待核)
- 综合:🟢 高,建议入库(multimodal 主轴 + evaluation 副轴立标候选)
三、双篇关系与本周评估方法学主轴对照
3.1 双篇共同点
- 都是 evaluation methodology 类型的贡献(不是新模型 / 新生成)
- 都有 benchmark release(PanoCaps + UFO-Bench)
- 都涉及 multi-modal alignment(text-mask alignment + omni-condition alignment)
- 都可以独立于具体模型被社区复用
3.2 双篇差异
| 维度 | PANORAMA | UFO |
|---|---|---|
| 任务域 | 图像理解(captioning + segmentation) | 图像生成(customization) |
| 评估对象 | VLM 输出的 grounded caption | customization model 输出的图像 |
| 评估对象 | 单个 phrase → mask 对齐 | 多个 condition 同时对齐 |
| 评估方法 | gPQ metric(text + mask 联合) | CoE + AEU + functional call |
| 核心稀缺性 | gPQ metric + PanoCaps benchmark | Chain-of-Evaluation paradigm |
| 会议 / 接收 | arXiv only(暂未声明会议接收) | ICML 2026 |
3.3 本周评估方法学主轴延展(v87+6 baseline 已收录 + 本轮新增)
| 日期 | 论文 | 主轴 | 当前状态 |
|---|---|---|---|
| 9-14 09:50 | MMProLong | multimodal + long-ctx | 已精读(D+→A) |
| 9-14 22:50 | MultihopSpatial | multimodal + spatial | 已精读(v2 覆盖) |
| 9-15 15:50 | Long-Horizon Terminal-Bench | agent-eval | 已精读 |
| 9-16 15:50 | MC-Search | multimodal + agent-eval | 已精读(A) |
| 9-18 09:50 | M3Exam | multimodal + memory | 已精读(沿用) |
| 9-19 09:50 | UXBench | multimodal + UI/UX eval | 已精读 |
| 9-19 15:50 | MiniMax-H3 物理世界评估 | multimodal + physical-world eval | 已精读 |
| 9-19 22:50 | PANORAMA + UFO | multimodal + grounding eval + omni-condition eval | 本轮精读 |
结论:本周 multimodal + evaluation 主轴8+ 件已饱和;PANORAMA + UFO 是最后两个 paper_card 已入库但未精读的候选。本轮之后本周 candidate pool 闭合。
四、复现风险矩阵(双篇)
PANORAMA 复现风险
| 维度 | 风险等级 | 说明 |
|---|---|---|
| 数据获取 | 🟢 低 | PanoCaps + 训练数据开源 |
| 代码可用性 | 🟢 低 | code + models 已 release |
| 算力需求 | 🟡 中 | VLM + segmenter 联合训练 → 至少 8xA100 / 24h 起 |
| 训练稳定性 | 🟡 中 | VLM + segmenter 接口训练可能需要 multi-stage warmup |
| gPQ metric 复现 | 🟢 低 | metric 公式公开 + 协议清晰 |
| head-to-head baseline | 🟡 中 | 现有 grounded captioning 模型需自行实现 / 找 checkpoint |
| 总体评级 | B+(可复现但需要工程投入) |
UFO 复现风险
| 维度 | 风险等级 | 说明 |
|---|---|---|
| 数据获取 | 🟡 中 | UFO-Bench 是否公开(待核) |
| 代码可用性 | 🟡 中 | ICML 2026 通常 release · abstract 未声明 |
| 算力需求 | 🟢 低 | evaluation 主要是 inference cost,不是 training cost |
| functional call backbone | 🟡 中 | 依赖 MLLM API(GPT-4o / Qwen-VL)的稳定性与 cost |
| AEU 设计 | 🟡 中 | functional call 设计需自行实现 / 复现 |
| +15.25% 数字 | 🟡 中 | 需重新跑 baseline 对照 |
| 总体评级 | B(evaluation framework 可复现,但 benchmark 与 functional call 需依赖外部 API) |
五、反方审稿切入点
PANORAMA
- selection formulation 的上限 —— 如果 mask proposal pool 太小(候选 mask 不全),selection 性能天花板被压;如果太大(候选 mask 过多),selection 复杂度爆炸。pool 大小的 ablation 缺失 → 关键超参未充分披露
- PanoCaps 的标注偏见 —— 基于 panoptic segmentation 数据集(Cityscapes / COCO / ADE20K)的标注偏向 urban scene + 室内场景,是否能泛化到 medical / remote sensing / scientific figure?
- gPQ 的 metric 设计 —— 把 text quality 与 mask quality 用乘积联合,是否会让"两个都中等"的 caption 比"text 完美但 mask 略差"的 caption 得分高?这种 metric 设计是否真的"对齐人类判断"?
- 训练联合 loss 的权重 —— caption generation loss + mask selection loss 的权重如何选择?是否有人工 / 自动 tuning?
- multi-instance grounding 的实际难度 —— abstract 说"single phrase → multiple instances",但具体支持哪些 multi-instance pattern(countable noun "two cups" / collective noun "the crowd" / distributive "each person")?
UFO
- Chain-of-Evaluation 的 chain 长度敏感性 —— AEU 数量 / chain 顺序对最终评估结果的影响?是否稳定?
- functional call 的"通用 vs 专用"边界 —— 哪些 AEU 用通用 MLLM 调用、哪些用专用工具(CLIPScore / DINO score / 物体检测器)?这个边界的判定标准是否公开?
- UFO-Bench 的覆盖度 —— 多少 customization model 被评估?多少 condition 组合?是否包含 real-world user prompt?
- +15.25% 的统计意义 —— 提升是绝对值还是相对值?在哪些子任务上提升最大 / 最小?是否有 outlier analysis?
- ICML 2026 接收信号的双刃剑 —— 是学术价值背书,但也意味着"reviewer 共识",需要对比同期同主题论文(subject-driven generation evaluation 在 2025-2026 大量涌现)
六、Substack 线索(仅 RSS 切片层 · 不做扩展搜索)
- 本轮未做 Substack 搜索(轻量精读模式 + 候选双篇来自 paper_cards 主分类)。
- 沿用本周 RSS 切片(cameron-wolfe / interconnects / ai-explained)的"评估方法学"主轴隐含:
- 2026-09 业界趋势:evaluation 被认为是 2026 年 LLM / multi-modal 的"next bottleneck"
- 与 PANORAMA(grounding eval)+ UFO(omni-condition eval)+ MultihopSpatial(spatial eval)+ MC-Search(agentic MM-RAG eval)+ UXBench(UI/UX eval)+ MiniMax-H3(physical-world eval)形成"评估方法学"周主题
- 后续验证动作:若 Substack 出现 "evaluation bottleneck" 主题 newsletter,可优先 review 作为业界趋势佐证
七、建议写入路径
本实例(flyP)草稿目录
- ✅
/shared/research-kb/inbox/flyp/2026-09-19-2250-PANORAMA-UFO-multimodal-eval-short-critical-read.md(本文件)
后续 GitHub 同步任务建议路径(不直接写入)
notes/2026-09-19-multimodal-evaluation-weekly-cluster.md(合并 PANORAMA / UFO / MultihopSpatial / MC-Search / UXBench / MiniMax-H3 的 evaluation 主轴周报)reviews/panorama-arxiv-2609-19143.md(PANORAMA 独立 review 文件)reviews/ufo-arxiv-2609-12397.md(UFO 独立 review 文件)topics/multimodal-evaluation-methodology-2026.md(更新 multimodal evaluation 主轴 topics 文件,纳入 PANORAMA + UFO)
建议归入 v87+7 立标池(multimodal-e1prep 接力棒预备)
multimodal.mdv87+7 §2.39.474 PANORAMAarXiv:2609.19143(沿用 §增量 5 沿用)multimodal.mdv87+7 §2.39.475 UFOarXiv:2609.12397(沿用 §增量 5 沿用,新增 ICML 2026 接收信号)multimodal.mdv87+7 §0 R29 + §2.39.460+ 评估方法学主轴饱和度延展预备触发
八、待人工确认的问题
- PANORAMA 第一作者 Sara Pieri 的完整机构 / 实验室主页 → ENS Willow 团队其他近期 paper?
- PANORAMA 的 gPQ metric 公式(是否在正文 §3 或附录)?
- PANORAMA 训练联合 loss 的具体权重 + warmup schedule?
- PANORAMA 的 head-to-head baseline 完整列表(GLaMM / GroundMLLM / SAM4MLLM 等)?
- UFO 第一作者 Danning Zhang 的完整机构 / 通讯作者 / 合作团队?
- UFO 的 functional call 完整列表 + 通用 vs 专用判定规则?
- UFO-Bench 的实际 benchmark 规模(多少 customization model / 多少 condition 组合 / 多少 prompt)?
- UFO 的 +15.25% 在哪些子任务上提升最大 / 最小?统计显著性?
- UFO code + benchmark + models 是否在 ICML 2026 公开(project page / GitHub)?
- PANORAMA + UFO 的相互引用关系(同一作者群 / 竞争 / 互补)?
九、本轮总结
- 本次主题:PANORAMA(grounded captioning eval)+ UFO(omni-condition alignment eval)双篇精读
- 检索范围:arXiv abstract + paper_card 1410/1421 + HF Daily(未入榜)+ ICML 2026 接收信号 + ENS Willow 团队主页
- 候选条目:2 篇(双篇组合)
- 高价值条目:2 篇均高价值
- PANORAMA:🟢 高(task definition + formulation + metric 三层 + code release)
- UFO:🟢 高(ICML 2026 + CoE paradigm + 15.25% + UFO-Bench)
- 分类标签:
multimodalgrounded-captioningpanoptic-segmentationevaluation-frameworkomni-condition-alignmentsubject-driven-customizationICML-2026ENS-WillowgPQ-metricPanoCapsUFO-Bench - 建议写入路径:
- 本实例:
/shared/research-kb/inbox/flyp/2026-09-19-2250-PANORAMA-UFO-multimodal-eval-short-critical-read.md - 后续 GitHub:
notes/2026-09-19-multimodal-evaluation-weekly-cluster.md+reviews/panorama-arxiv-2609-19143.md+reviews/ufo-arxiv-2609-12397.md+topics/multimodal-evaluation-methodology-2026.md - 是否需要精读 / 审稿 / 主题页更新:
- ✅ 本轮已完成双篇精读(短审稿模式)
- ✅ 建议纳入
topics/multimodal-evaluation-methodology-2026.md(与本周 6+ 件 evaluation 主题论文合并) - ⏳ 后续可考虑:
- PANORAMA / UFO 完整 review 文件(升级到 A- 评级)
- 双篇之间的对照实验设计(grounding eval vs alignment eval)
- PanoCaps / UFO-Bench 实际下载与初探
- ❌ 不建议 Substack 多轮扩展(本周 Substack 切片已足够)
签:flyP · 2026-09-19 22:50 CST · multimodal + evaluation · 双篇短精读第 N+2 期 · 本日第 6 棒(晚班)