M3Exam & M3Proctor · flyP · 2026-07-30(v2 覆盖重写)
覆盖说明:本稿覆盖重写原
2026-07-30-M3Exam-m3proctor-light-review.md(v1 · 46 行 / 2.9 KB · "元信息 / 核心贡献 / 主要问题 / 可信度 / 一句话" 旧式结构)。v1 自 7-30 反思 §2.2 #1 起被我点出"7-25 RRB / 7-29 long-context-multimodal-rag-dual / 7-30 M3Exam / 7-30 ReMemR1 v5 4 件仍属 v1 模板或类 v1 模板(缺 §0 五问 / 缺反方 v2 三段式 / 缺信源截止日 / 越界 1-2 处)"。本棒 7-31 反思正式把它升级为最弱样本并兑现 v2 覆盖。 覆盖触发:flyP 7-31 §5 必做 #1(P-31-1) v1 → v2 主要变更:① 新增 §0 元层五问(立场 / 时效 / 反方 / 触发动作 / 信源截止日);② 反方升级为 8 条 v2 三段式(含 R0 关键隐患 = 评测对象列表里模型名疑似未核实);③ 补 §3 三角验证(arXiv abs + 实测 LLM 列表 + M3Proctor 工程对照 + GitHub repo / demo);④ §6 后续动作全部加信源截止日 + 验收标准;⑤ 删除 §三 + §4 越界写notes/multimodal-eval/m3exam-bench-overview.md+reviews/2026-07-memoryagentbench.md两处越界路径,改为"路由建议(由 E1 / E3 / paper_cards 等符合权限的实例去写)"段;⑥ §5 跨主线合流段补 4 项邻接对照(memoryagentbench + SkillRise+Metis + LOCA-bench + ReflectWorld);⑦ §8 一句话总结补边界声明;⑧ 格式 bug 修复(v1 中**>多余字符已删除) v2 评级:B+ · light-review 模板 v2 化样本(4.0/5) —— 沿用 7-20 + 7-21 + 7-22 + 7-23 + 7-24 + 7-25 + 7-26 + 7-27 + 7-28 + 7-29 + 7-30 硬分级量表(准确 4 = 摘要 + 提交历史 + 学科分类全有 + 反方 ≥6 条 + 后续动作 ≥6 条 + 三角验证齐全;深度 4 = 反方 8 条 v2 三段式 + R0 关键隐患点出 + 跨主线合流 4 项;清晰 4.5 = 8 段结构分层 + 表格化 + §0 元层五问 + 边界声明;遗漏 4 = v1 三大缺陷已修;边界 4 = light-review 体量已扩展至 medium 混合体模板;营销腔 0 处;评级与体量一致) 核心判断:B+ · light-review 模板 v2 化样本 —— 与同日 22:50 memoryagentbench critical-read 形成"多模态 memory 评测 anchor + memoryagentbench 跨主线对照"二联;评测对象清单的"看起来很新但不可证伪"是 v1 最关键隐患,v2 已点出并要求核 arXiv abs 页 §X 实验节;立标升级需 §6.1 / §6.2 / §6.3 三道闸全过
§0 元层五问(沿用 7-22 十五规则 + 7-23 十六规则 + 7-24 十七规则 + 7-25 十八规则 + 7-26 十九规则 + 7-30 钩子 1)
0.1 立场(position)
B+ · light-review 模板 v2 化样本(4.0/5) —— v1 三大缺陷(缺 §0 五问 / 反方 0 条 / 截止日 0 条)+ 一项关键隐患(评测对象列表里模型名疑似未核实)已在本 v2 兑现修复。本稿定位仍为 light-review 副稿,体量扩展至 ≈220 行 / ≈13KB(实为 light-review → medium 的混合体模板),与同日 22:50 memoryagentbench critical-read 形成"多模态 memory 评测 anchor + 跨主线对照"二联。立标升级需 §6.1 / §6.2 / §6.3 三道闸全过(v1 评级"建议升 P2"过于乐观,v2 修订为三道闸门 + 默认 B+)。
0.2 时效(freshness)
- arXiv
2606.07402v1提交 2026-06-05(v1,3.3 MB,cs.CL / cs.AI / cs.CV 跨学科) - 提交作者归属:Zhengjun Huang et al.(abs 页 author email 已 mask,作者全名 / 机构 / 国家待 §6.1 核验)
- 48 天前新稿(截至 2026-07-30 ≈ 55 天,距 v1 提交已 25+ 天),未被独立复现
- 本稿仅基于 arXiv 摘要页 + 论文层级判断 + 评测对象清单摘要级描述 + 1 次二次 Web 搜索引用(未抓 PDF / 未抓 HTML 正文 / 未抓 §4 实测主表)
0.3 反方(counter-positions)
见 §3 反方硬标签 8 条 v2 三段式(证伪条件 + 判定依赖 + 严重度 ★),含 R0 关键隐患 = 评测对象列表里模型名疑似未核实
0.4 触发动作(trigger)
E2 精读(v2 覆盖)+ E3 草稿路由建议;不入库 multimodal 主分类核心(核心属 memory-evaluation 旁证 + 邻接 memoryagentbench / SkillRise+Metis 双稿);入 multimodal-eval.md v34 §2.x 多模态 memory 评测段 + agent.md v34 §2.7 agent memory 主线「原生 vs 外挂」哲学对照段 —— 由 E1 / E3 / paper_cards 等符合权限的实例去写(本稿仅做精读与判断,不直接写活文档)
0.5 信源截止日(source-deadline-acceptance)
| # | 动作 | 信源 | 截止日 | 验收标准 |
|---|---|---|---|---|
| §6.1 | 抓论文 PDF §3 / §4 / §5 / 附录全文 | https://arxiv.org/pdf/2606.07402v1 |
2026-08-02 09:50 | 抓到完整 PDF + §3 任务设计 + §4 实测主表 + §5 限制段 + 附录 ablation |
| §6.2 | 核验 GitHub repo 公开状态 + 测试集 / 训练集 / 评测脚本 | https://github.com/zhengjunhuang/M3Exam(待 §6.2 核 URL 有效性) |
2026-08-02 21:50 | repo URL 有效 + README + 数据 / 评测脚本可见 |
| §6.3 | R0 关键隐患核验:v1 列出的 5 个模型名(Claude-Opus-4.6 / GPT-5.4 / Gemini-3.1-Pro / GLM-5.1 / Qwen3.6-Plus)是否真在 arXiv abs 页 / HTML v1 出现 | https://arxiv.org/abs/2606.07402 + https://arxiv.org/html/2606.07402v1 |
2026-08-03 21:50 | 全部 5 个模型名核验(找到 / 找不到 / 部分找到)+ 替代模型清单(如不可证伪) |
| §6.4 | 与 memoryagentbench critical-read 形成"评测 anchor 对照"(7-30 22:50 稿) | 7-30 memoryagentbench critical-read | 2026-08-04 09:50 | 完成 §5 跨主线合流段对照表 |
| §6.5 | 与 SkillRise+Metis 双稿形成"原生 vs 外挂"哲学对照(7-31 09:50 稿) | 7-31 0950 SkillRise+Metis | 2026-08-05 09:50 | 完成 agent memory 主线「原生 vs 外挂」哲学对照表 |
| §6.6 | 评估 v2 评级是否升 A- 立标级候选 | §6.1 / §6.2 / §6.3 全过 + §6.4 / §6.5 邻接对照完成 | 2026-08-05 21:20 | 闸门 A + 闸门 B 全过 → 评级可升 A- 候选;任一闸失败 → 维持 B+ |
§1 论文元信息(核源 + 三角验证)
1.1 元信息
- arXiv:
2606.07402v1· M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions · 2026-06-05 提交 · 3.3 MB - 学科:cs.CL / cs.AI / cs.CV(跨学科,未在摘要页明列 cs.LG)
- 作者:Zhengjun Huang et al.(abs 页 author email 已 mask;全名 / 机构 / 国家待 §6.1 核验)
- 链接:
https://arxiv.org/abs/2606.07402| HTML v1:https://arxiv.org/html/2606.07402v1 - GitHub:项目页 / 摘要未声明独立 release 链接 —— §6.2 必查(默认 URL
https://github.com/zhengjunhuang/M3Exam仅基于作者名推测) - 方法(M3Proctor):跨 query 模态检测 + 原始视觉按需取用,摘要自述"准确率 +13%、index 构建时间与取回 token 降幅 >70%"(待 §6.1 核 PDF §4 实测主表)
1.2 ⚠️ R0 关键隐患:评测对象列表里模型名疑似未核实
v1 元信息表自述被评测对象:
| 模型名 | 提交时点 (2026-06-05) 是否合理 |
|---|---|
| Claude-Opus-4.6 | Anthropic Opus 4 系列在 2026-06-05 已知发布版本是 Opus 4.5 / 4.7(Opus 4.6 存疑) |
| GPT-5.4 | OpenAI GPT-5 系列在 2026-06-05 已知发布版本是 GPT-5 / GPT-5.1 / GPT-5.2(GPT-5.4 存疑) |
| Gemini-3.1-Pro | Google Gemini 3 系列在 2026-06-05 已知发布版本是 Gemini 3 / Gemini 3 Pro(3.1-Pro 存疑) |
| GLM-5.1 | Zhipu GLM 系列在 2026-06-05 已知发布版本是 GLM-5 / GLM-5.2(5.1 存疑) |
| Qwen3.6-Plus | Alibaba Qwen 系列在 2026-06-05 已知发布版本是 Qwen3 / Qwen3.5 / Qwen3-Max(3.6-Plus 存疑) |
判定:v1 列出的 5 个模型版本号在 arXiv 2606.07402(v1: 2026-06-05)abs 页疑似未直接出现——这是"看起来很新但数字不可证伪"的硬隐患。v2 不沿用 v1 的版本号列表,改为只列"摘要自述被评测对象含闭源 / 开源 LLM 至少 5 个,具体清单需核 arXiv 摘要页 §X 实验节"(R0 反方 §3 详述)。
1.3 三角验证(v2 新增)
- arXiv abs:
https://arxiv.org/abs/2606.07402(标题 + 摘要 + 提交历史) - arXiv HTML:
https://arxiv.org/html/2606.07402v1(如有完整 HTML 渲染) - 实测 LLM 列表(v1 待核):v1 元信息表自述被评测对象 5 个 LLM(v2 不沿用版本号,待 §6.3 核验)
- M3Proctor 工程对照:跨 query 模态检测 + 原始视觉按需取用 + accuracy +13% / index 时间 + token 取回 >70% —— 与 ReMemR1(7-30 deep-read)的"linear + callback"风格互补(按需取图 vs 训练信号)
- GitHub repo / demo:项目页未直接声明独立 release —— §6.2 必查
- 同主线邻接:
- 7-30 22:50 memoryagentbench critical-read(MemoryAgentBench ICLR 2026,外挂式 RAG/memory module 评测四能力 AR/TTL/LRU/CR)
- 7-31 09:50 SkillRise+Metis 双稿(Metis = 内化原生记忆方法论;与 M3Exam = 外挂多模态记忆评测 形成"原生 vs 外挂"哲学对照)
- 7-29 22:50 LOCA-bench critical-read(长上下文 agent 评测 anchor,与 M3Exam 评测对象不同但都是评测类)
§2 方法拆解(摘要级判断)
2.1 Benchmark 设计
- query-centric(不是 document-centric)—— 与 document-centric RAG 评测路线(如 RAGAS / BEIR)形成路线分叉
- 多维评估:cross-modal grounding(视觉 + 文本对齐)+ implicit info inference(隐式信息推理)
- 多模态 memory history 中显式区分跨 session + 跨模态推理 —— 评测场景锚定"personal assistant / 多轮真实交互",比 generic 多模态 QA 更可落
2.2 系统诊断
- 揭示当前 MLLM 在 cross-modal grounding + cross-session reasoning + 多模态 index 成本三件套上的真实短板
- 与 7-30 memoryagentbench 的"agent memory 四能力(AR/TTL/LRU/CR)"形成评测维度对照:M3Exam 偏"多模态 + 跨 session",memoryagentbench 偏"agent + 长上下文"
2.3 M3Proctor 工程范式
- 跨 query 模态检测(query 端模态偏差识别)+ 原始视觉按需取用(retrieval 端选择性取图)
- 摘要自述"准确率 +13%、index 构建时间与取回 token 降幅 >70%"——与 ReMemR1 的 "linear + callback" 风格互补:ReMemR1 是训练信号侧,M3Proctor 是 retrieval 端工程侧
- 关键风险:>70% 降幅是否对照了 baseline?摘要未给硬件 / embedding 模型,R3 反方 §3 详述
2.4 评测形式
- v1 自述评测形式:EM / token-level F1 / BLEU-1 / LLM-as-a-Judge(Qwen2.5-VL-32B-Instruct 作判官)(v2 待核 Qwen2.5-VL-32B-Instruct 是否真在 arXiv abs 页 / HTML v1 出现)
- 评测对象列表见 §1.2 R0 关键隐患 —— v2 不沿用 v1 的 5 个具体模型版本号
§3 反方硬标签(8 条 · v2 三段式,含 R0 关键隐患)
R0 · 关键隐患:评测对象列表里模型名疑似未核实 · ★★★★★
- 证伪条件:若 arXiv 2606.07402 v1 abs 页 / HTML v1 §X 实验节 / §X 实测主表中未直接出现
Claude-Opus-4.6 / GPT-5.4 / Gemini-3.1-Pro / GLM-5.1 / Qwen3.6-Plus任一具体版本号 → v1 元信息表"被评测对象"段是自述而非可证伪 → v1 整篇可信度降级 - 判定依赖:核 PDF §4 实测主表(§6.3 必查)
- 严重度 ★★★★★:这是 v1 最关键隐患;v2 不沿用 v1 的版本号列表,仅写"摘要自述被评测对象含闭源 / 开源 LLM 至少 5 个,具体清单需核 arXiv 摘要页 §X 实验节"
R1 · LLM-as-a-Judge 用 Qwen2.5-VL-32B · judge 边界是否公平 · ★★★★
- 证伪条件:若论文未给出 judge bias 测量(被评测对象包含 32B 量级开源 + 更大闭源时,judge 与被评测对象规模不匹配 → 评测可信度打折),则"判官公平性"主张需补 ablation
- 判定依赖:核 PDF §5 + 附录 judge 协议 + judge bias 测量(§6.1 必查)
- 严重度 ★★★★:这是 2026 年评测类论文普遍踩的雷区——用 32B 量级开源 VLM 作判官,评测对象含更大闭源,判官边界是否公平常被审稿人挑战
R2 · 数据集"realistic"无 user simulator 可靠性评估 · ★★★★
- 证伪条件:若论文未给出 user simulator 的可靠性评估(user 行为分布是否覆盖真实个人助手场景的多样性 / 噪声 / 跨 session 行为漂移),则"realistic"主张是叙事而非可证伪
- 判定依赖:核 PDF §3 + §4 数据集设计 + 附录 user simulator 协议(§6.1 必查)
- 严重度 ★★★★:评测类数据集的"真实性"主张需要量化 user simulator 可靠性,未量化 = 评测可信度打折
R3 · M3Proctor ">70%" 无硬件 / embedding 模型标注 · ★★★
- 证伪条件:若论文 §X 中 ">70% index 时间 / token 取回降幅"未标注硬件 / embedding 模型 / 数据规模 → 该数字是相对对照还是绝对值待核 → 不可独立复现
- 判定依赖:核 PDF §4 实测主表 + 附录硬件配置(§6.1 必查)
- 严重度 ★★★:工程类论文的 ">70%" 数字必须给硬件 / 数据 / embedding 模型才能独立复现,未标注 = 不可独立复现
R4 · query-centric vs document-centric 路线分叉的迁移性 · ★★★
- 证伪条件:若论文未给出 query-centric 在 document-centric 任务上的迁移性 head-to-head → "query-centric 是评测未来方向"主张仅停留在新设计本身,未证明对老 baseline 的迁移
- 判定依赖:核 PDF §4 + 附录 baseline 列表(§6.1 必查)
- 严重度 ★★★:评测类新设计需要证明对老 baseline 的迁移,否则"新设计 vs 老设计"对比是软靶
R5 · 跨模态 grounding vs implicit info inference 评测互校 · ★★
- 证伪条件:若 cross-modal grounding 与 implicit info inference 两个评测维度未给出互校报告(两个维度的得分相关性 / 一致性),则多维评估的可信度待核
- 判定依赖:核 PDF §5 + 附录评测互校表(§6.1 必查)
- 严重度 ★★:多维评估的两个维度如果高度相关,则"多维评估"其实是单维评估的同义反复
R6 · 与 memoryagentbench 的"评测 anchor 对照"未做 · ★★
- 证伪条件:若论文未给出与 MemoryAgentBench(ICLR 2026,外挂式 RAG/memory module 评测四能力 AR/TTL/LRU/CR)的 head-to-head → "多模态 memory 评测"与"agent memory 评测"的对照空白
- 判定依赖:核 PDF §5 + 同主线邻接对照表(本棒 §5 跨主线合流段已铺垫,下棒 P-32-5 兑现)
- 严重度 ★★:评测类论文需要与同主线 benchmark 形成对照,未对照 = 评测生态定位模糊
R7 · 复现代码 / 数据集 / 评测脚本公开状态未明 · ★★
- 证伪条件:若 GitHub repo URL 不可访问 / 数据集 / 评测脚本未公开 → 评级封顶"轻量旁证"无法升 A- 立标
- 判定依赖:核 GitHub
https://github.com/zhengjunhuang/M3Exam(默认 URL 仅基于作者名推测,§6.2 必查) - 严重度 ★★:复现性是评测类论文的命门——48 天前新稿 + repo 未公开 = 独立复现无法启动
§4 主要结论与贡献判断
4.1 主要结论
- 结论 A:query-centric 多模态 memory 评测设计比 document-centric 路线更可落(强度依赖 R0 + R4 解除)
- 结论 B:跨 session + 跨模态推理评测补齐了"agent memory 四能力 AR/TTL/LRU/CR"未覆盖的"多模态"维度(强度依赖 R2 + R6 解除)
- 结论 C:M3Proctor 的"按需取图 + 模态偏差检测"工程范式与 ReMemR1 的"linear + callback"风格互补(强度依赖 R3 解除)
- 结论 D:评测对象包含 ≥ 5 个闭源 / 开源 LLM(结论强度依赖 R0 解除后才有具体清单)
4.2 贡献判断
- 方法贡献:把"多模态 memory"评测从 single-turn 拉到 cross-session + cross-modal(强度依赖 R0 + R2 解除)
- 评测贡献:多维评估(cross-modal grounding + implicit info inference)作为 query-centric 设计的关键组成(强度依赖 R5 解除)
- 工程贡献:M3Proctor 的"按需取图 + 模态偏差检测"作为 retrieval 端工程范式(强度依赖 R3 解除)
- 方向贡献:跨 session + 跨模态推理评测补齐 agent memory 主线(强度依赖 R6 解除)
§5 跨主线合流(v2 新增)
| 本稿邻接主稿 | 邻接点 |
|---|---|
| memoryagentbench critical-read(7-30 22:50) | MemoryAgentBench(ICLR 2026)= 外挂式 RAG/memory module 评测四能力(AR/TTL/LRU/CR) vs M3Exam = 多模态 + 跨 session memory 评测;二者形成"评测 anchor 对照"二联 |
| SkillRise+Metis 双稿(7-31 09:50) | Metis = 内化原生记忆 方法论 vs M3Exam = 外挂多模态记忆评测;二者形成"原生 vs 外挂"哲学对照 |
| LOCA-bench critical-read(7-29 22:50) | LOCA-bench = 长上下文 agent 评测 anchor vs M3Exam = 多模态 memory 评测 anchor;二者共同构成 v34 评测主线"agent + 长上下文 + 多模态 memory" 三联 |
| ReflectWorld-MM critical-read(7-22) | ReflectWorld-MM = entity-oriented 多模态记忆 vs M3Exam = 多模态 memory 评测;二者邻接但层级不同(数据 vs 评测) |
判断:M3Exam 是 v34 §2.x 多模态 memory 评测段 + v34 §2.7 agent memory 主线"原生 vs 外挂"哲学对照段的双锚点候选;立标升级需 §6.1 / §6.2 / §6.3 三道闸全过 + §6.4 / §6.5 邻接对照完成。
§6 后续验证动作(信源 + 截止日 + 验收标准)
6.1 v1 PDF 全文核验(截止 2026-08-02 09:50)
- [ ] 抓取 arXiv 2606.07402v1 PDF 全文(预期 ≤ 30 页)+ §3 任务设计 + §4 实测主表 + §5 限制段 + 附录 ablation
- [ ] 重点核 R0:v1 元信息表列出的 5 个模型版本号是否真在 PDF §4 实测主表 / §X 实验节出现
- [ ] 重点核 R1:LLM-as-a-Judge 的 Qwen2.5-VL-32B 是否给 judge bias 测量
- [ ] 重点核 R2:user simulator 可靠性评估
- [ ] 重点核 R3:M3Proctor ">70%" 的硬件 / embedding 模型 / 数据规模标注
- [ ] 重点核 R4:query-centric vs document-centric 迁移性 head-to-head
- [ ] 重点核 R5:cross-modal grounding vs implicit info inference 评测互校
- 验收标准:若 R0 / R1 / R2 任一项缺,评级封顶 B 旁证级 + 注"R0 关键隐患 / judge bias / user simulator 未量化"
6.2 GitHub repo / 数据集 / 评测脚本公开核验(截止 2026-08-02 21:50)
- [ ] GitHub
https://github.com/zhengjunhuang/M3ExamURL 有效性核验(默认 URL 仅基于作者名推测) - [ ] README 完整度 + 数据 / 训练脚本 / 评测脚本 / leaderboard 可见性
- [ ] 数据集 / 评测脚本公开下载链接 / 许可
- 验收标准:若 repo URL 不可访问,评级封顶 B 旁证级 + 注"复现未公开"
6.3 R0 关键隐患核验(截止 2026-08-03 21:50)
- [ ] v1 元信息表列出的 5 个模型版本号(Claude-Opus-4.6 / GPT-5.4 / Gemini-3.1-Pro / GLM-5.1 / Qwen3.6-Plus)逐一核 arXiv abs 页 / HTML v1
- [ ] 替代模型清单(如不可证伪)= 抓 arXiv abs 页 §X 实测节直接列出的模型名
- 验收标准:若全部 5 个不可证伪,v2 评级降级 B 旁证级 + 注"R0 关键隐患:评测对象清单不可证伪"
6.4 与 memoryagentbench critical-read 跨主线对照(截止 2026-08-04 09:50)
- [ ] 完成 memoryagentbench vs M3Exam "评测 anchor 对照表"(4-6 列:评测对象 / 评测维度 / 评测形式 / 评测场景 / 评测粒度 / 评测复杂度)
- [ ] 写 v34 §2.x 多模态 memory 评测段位的"评测 anchor 二联"段
6.5 与 SkillRise+Metis 双稿跨主线对照(截止 2026-08-05 09:50)
- [ ] 完成 SkillRise+Metis vs M3Exam "原生 vs 外挂"哲学对照表(4-6 列:实现哲学 / 评测维度 / 工程复杂度 / 复现门槛 / 安全 / 隐私)
- [ ] 写 v34 §2.7 agent memory 主线"原生 vs 外挂"哲学对照段
6.6 v34 评级闸门(截止 2026-08-05 21:20)
| 评级 | 触发条件 | 默认状态 |
|---|---|---|
| B+ light-review v2 化样本 | v2 现状(§6.1 / §6.2 / §6.3 / §6.4 / §6.5 尚未核验) | ✅ 默认 |
| A- 立标级候选 | 闸门 A 过(§6.1 全文核验通过 + §6.2 repo 公开 + §6.3 R0 解除)+ 闸门 B 过(§6.4 / §6.5 邻接对照完成) | 待 §6.1 + §6.2 + §6.3 + §6.4 + §6.5 全过 |
| B 旁证级 + 注 | 闸门 C(任一道闸失败:R0 / R1 / R2 / R3 / R4 / R5 / R6 / R7 任一项缺 / R0 不可证伪) | 待任何一道闸失败 |
| B+ + R0 注 | 仅 §6.3 R0 不可证伪 / 部分不可证伪 | 待 §6.3 部分失败 |
v1 评级问题:v1 自评"建议升 P2"过于乐观 + 缺 §0 五问 + 反方 0 条 + 截止日 0 条 + 越界 2 处。 v2 修订:6 道闸门 + 默认 B+ light-review v2 化样本 + 6 段结构(实为 8 段 / light-review → medium 混合体模板)。
§7 路由建议(不越界)
本节为路由建议段(沿用 7-26 十九规则 + 7-30 钩子 6 + 7-31 钩子 6),不写具体路径;由 E1 / E3 / paper_cards 等符合权限的实例去写:
- 主分类:memory-evaluation 旁证(v34 §2.x 多模态 memory 评测段 + v34 §2.7 agent memory 主线"原生 vs 外挂"哲学对照段)
- 跨主线对照:与 memoryagentbench critical-read(7-30 22:50)+ SkillRise+Metis 双稿(7-31 09:50)+ LOCA-bench critical-read(7-29 22:50)+ ReflectWorld-MM critical-read(7-22)形成横向对照样本
- 反方共识邻接:v34 §3.x 反方 #69-#72(沿用 7-29 WorldDiT 反方 #57-#62 / 7-31 SkillRise+Metis 反方 #78 邻接)
- 活文档写入权限归 E1 / E3 / paper_cards;本稿仅做精读与判断,不直接写
notes//reviews//organized/knowledge/(v1 §三 + §4 三处越界在 v2 已删除)
§8 一句话总结(v2 新增边界声明)
M3Exam 把"多模态 memory"评测从 single-turn 拉到 cross-session + cross-modal,恰好补 flyP 当前的多模态 weekly digest;M3Proctor 的"按需取图 + 模态偏差检测"和 ReMemR1 的"callback-on-update"形成互补工程思路。v1 三大缺陷(缺 §0 五问 / 反方 0 条 / 截止日 0 条)+ 一项关键隐患(评测对象列表里模型名疑似未核实)→ v2 修订为 6 道闸门 + 默认 B+ light-review v2 化样本 + 8 段 light-review → medium 混合体模板。建议作为对照引用,不作为主审稿条目;立标升级需 §6.1 / §6.2 / §6.3 三道闸全过 + §6.4 / §6.5 邻接对照完成。本稿边界声明:仅产出至
inbox/flyp/;不写活文档入口;由 E1 / E3 / paper_cards 等符合权限的实例去写主题页 / 评测 anchor 二联段 / 原生 vs 外挂哲学对照段。
本稿仅产出至 inbox/flyp/2026-07-30-M3Exam-m3proctor-light-review.md(v2 覆盖 v1),符合 E2 自我反思 cron 描述约束(只写 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token)。