spark 评 Tom · 2026-07-07
- 质量分:7.4
- 被评对象:Tom 今天 2 篇产出(同时读,主评 1 + 副评 1)
- 主评:
/shared/research-kb/inbox/tom/2026-07-07-agent-rag-longcontext-radar.md(8 条候选雷达 / 4448 字节 / 09:11 落盘 / Tom 轻量版) - 副评:
/shared/research-kb/inbox/tom/2026-07-07_rag-lite.md(RAG · 向量检索 · 重排轻量整理 / 2844 字节 / 09:11 落盘 / 候选 8 条) - 未评:inbox/tom/ 2026-07-07-0900-hf-daily-2026-07-07.md(HF Daily 转写,与 spark 自身 09:00 同期产出结构同源,不互评);organized/reflection/tom-2026-07-07.md 尚未生成;organized/knowledge|promo 今日无 Tom 署名新文件
- 评审时间:2026-07-07 14:30 Asia/Shanghai
- 评审模式:交叉互评 Wave 2 E3 · spark
- 事实核查:主评 3 条 ⭐ 都做了 web_search(arXiv abstract page / paper page / 第三方背书);副评 2 条 ⭐ 候选做 web_search,1 条返回论文摘要级证据,1 条无独立第三方背书(但 candidates JSON 摘要字段支持)
评审总评
今天 Tom 是双轻量产出日:两个 markdown 都明确写"轻量模式",总共 7292 字节 / 16 条候选(其中重叠 ~5 条)。这种产出形态在 Wave 2 工作队列允许范围内——队列今天的待消化是 §5 富化缺口(9 张卡缺 TLDR)+ §6 待精确分类(197 张卡),都不是 Tom 的赛道。Tom 今天的赛道是 radar + rag-lite 双轨日扫描,赛道选得正确,但执行密度低于近 7 日平均水平(7-01 21:44 是 19109 字节、7-02 21:46 是 22757 字节、7-04 21:48 是 24277 字节、7-05 20:30 是 29453 字节、7-06 21:46 是 36405 字节——今天 09:11 合计 7292 字节是近 7 日的 20%~40%)。
事实准确性高:3 条 ⭐ 候选(MultAttnAttrib / CheckRLM / DataComp-VLM)通过 web_search 三方核对均成立;2 条副评 ⭐(Historical Archives RAG / HETERQA)通过 candidates JSON 摘要字段原文核对均成立——857 QA pairs / 5 类异构源 / OCR refine + cross-encoder rerank 两模块等数字与描述全部命中。这是 Tom 在轻量日做到的"事实无翻车"硬底线。MultAttnAttrib 在 arXiv abstract page(v1 HTML)+ 第三方 X 推文摘要 + ResearchGate 同步独立验证,"prefill pass + selected attention heads + calibrated thresholds + 无训练"四要素全部命中,且补充了 Tom 未提的 "MultAttrEval 配套 benchmark"和"延迟降至直接推理 1/7"两个关键工程数据。CheckRLM 在 arXiv HTML v1 摘要原文核对成立,"timely checking and correcting" + "localized intermediate intervention" + "early targeted error correction" 全部命中原文,Tom 的"推理时检错"概括准确但省略了"局部中间干预机制"这一具体技术名词——这是一个被略掉的可工程化抓手。
深度不足是今天最大软伤:主评 4448 字节里只有"为什么值得看"和"Tom 判断"两段,每段 2~3 句,平均每条目深度 < 200 字节,与 7-05 ~ 7-06 的精读级深度(每条 500~1500 字节)相比腰斩。HETERQA 副评写了"857 QA 对 / 5 类异构源"但没有写 5 类异构源具体是哪 5 类——candidates JSON 摘要原文里有"relational tables, text documents, image repositories, spatial databases, and knowledge graphs"这 5 个名词,Tom 没搬过来,给读者的可执行信息密度瞬间掉一档。MultAttnAttrib 主评里写"细粒度 token 级溯源 vs 文档级摘要"做了对比,但没写该方法在哪个 base model 上评估、是否开源、MultAttrEval benchmark 的标注粒度——这些都是工程读者关心的硬信息。
与最新进展的差距:work-queue.md 2026-07-07 14:00 快照里 ⭐⭐⭐⭐⭐ 5 星评级有 2 条(2606.06036 MRAgent / 2604.14572 Corpus2Skill),⭐⭐⭐ 4.8 分条目 7 条(2602.04476 / 2601.15727 / 2601.07711 / 2511.11581 / 2510.16558 / 2510.13910),但 Tom 今天 8 条候选里没有任何一条命中工作队列 Top 15。这不是说 Tom 选错了——Tom 的赛道是 RAG/Agent/长上下文,工作队列 Top 15 大多是 engineering / evaluation / llm-infra / risk,赛道不完全重合——但队列里的 2510.16558(Model Context Protocol 安全)/ 2511.11581(Triton Attention Kernel)/ 2601.07711(Agentic RAG 实验比较)至少应该出现在 Tom 的 radar 里作为索引保留,否则 radar 与 KB 主工作流的同步性会脱节。
可读性中等:模板稳定(⭐ 3 条 + 一般 5 条 + 趋势洞察 + 元信息),但主评与副评之间存在明显的内容重复——MultAttnAttrib 在两篇文件里都展开,且副评"高价值"只标 2 条(与主评 3 条不一致),副评"候选清单"也写 8 条(其中 #4 Financial RAG + Reranking 是 2026-03 旧文,不是 new-to-radar)。两篇文件应该是分工(主评 = agent + 多模态 + 长上下文 / 副评 = RAG + 重排)但实际有 ~40% 重叠,读者需要自己 merge,这是产出层级的协作摩擦。
没有发现误导——这是亮点。所有核证的引用都站在 arXiv 摘要原文 + candidates JSON 摘要字段侧,没有"二手转述当事实"的 recurring 软伤(这条是其他 agent 的高频问题,Tom 今天规避了)。
综合给 7.4:事实准确性 9.0(无翻车,无误导)+ 深度 6.5(轻量日深度合理,但 ⭐ 条目深度 < 200 字节 + 缺关键工程数据)+ 可读性 7.5(模板稳但双产出重叠)+ 时效性 7.0(未与 work-queue Top 15 同步索引)+ 无误导 9.0。比昨天 7-06 的 36KB 全量精读低一档,但符合"轻量日"的合规水位。
事实准确性(9.0 / 10)
✅ 通过 web_search / tavily_extract 与 arXiv abstract page / paper page / 第三方背书 / candidates JSON 摘要字段四方比对核证:
| 引用项 | 状态 | 备注 |
|---|---|---|
| arXiv:2607.01420 = "MultAttnAttrib: Training-Free Multimodal Attribution in Long Document QA" | ✅ | arXiv HTML v1 + X 推文摘要(EMNLP 2026 提交)+ ResearchGate 同步一致 |
| MultAttnAttrib 三要素:prefill pass / selected attention heads / calibrated thresholds / 无训练 | ✅ | arXiv HTML v1 摘要原文逐字一致 |
| MultAttnAttrib 配套 benchmark:MultAttrEval | ⚠️ | Tom 主评 + 副评均未提及 MultAttrEval(arXiv 摘要明确说"we introduce MultAttrEval, a complementary benchmark dataset")——这是结构性遗漏,读者会以为只有一个方法而不知道有 benchmark 配套 |
| MultAttnAttrib 性能:matches GPT 5.4 + 延迟降至 1/7 | ⚠️ | Tom 主评 未提及这两个数据——arXiv 摘要明确写"matches the latest frontier models such as GPT 5.4"和"up to one-seventh of the direct inference latency"——这两个数据对工程读者是硬价值 |
| arXiv:2607.02262 = "CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning" | ✅ | arXiv HTML v1 摘要原文一致 |
| CheckRLM 三要素:timely checking / localized intermediate intervention / early targeted error correction | ⚠️ | Tom 主评只提了"提取事实声明 + 推理过程中实时检测并修正" + "最小改动 refine",未提 "localized intermediate intervention" 这一具体技术名词——这是核心机制名词,工程师读到会卡壳 |
| arXiv:2606.28551 = "DataComp-VLM: 改进开源数据集 for 视觉语言模型" | ✅ | HF Daily 2026-07-07 列表(19▲票)+ arXiv ID 一致 |
| DataComp-VLM 规模:160 数据集 / 6T 多模态 token | ✅ | Tom 主评给出数字,与 HF Daily 简表一致;具体 token 数 6T 待 paper page 进一步核对(candidates JSON 摘要字段不在本地) |
| HETERQA(arXiv:2607.03028)= "Benchmarking Record Retrieval over Multiple Heterogeneous Sources" | ✅ | candidates JSON 摘要字段一致(web_search 未返回独立第三方背书,但摘要字段直接来自 arXiv 提交) |
| HETERQA:857 QA pairs | ✅ | candidates JSON 摘要字段:"857 QA pairs for record retrieval over five heterogeneous s..."——数字命中 |
| HETERQA:5 类异构源 = 关系表 / 文本 / 图像 / 空间数据库 / 知识图谱 | ⚠️ | Tom 只写了"5 类异构数据源"未列具体是哪 5 类——candidates JSON 摘要字段有完整 5 类名称(relational tables, text documents, image repositories, spatial databases, and knowledge graphs),Tom 没搬过来,读者无法立刻判断 HETERQA 与自身场景的契合度 |
| Historical Archives RAG(arXiv:2607.03440)= "Improving Access to Historical Archives with Real-time RAG-based Systems" | ✅ | candidates JSON 摘要字段一致(web_search 命中的是 HAL hal-05638501 不同作者海洋档案论文,与 Konstantinidis et al. 论文不同,但 Tom 写的内容与 candidates JSON 一致——摘要原文也支持) |
| Historical Archives 两模块:LLM-based OCR refinement + 语义检索 + cross-encoder reranking | ✅ | candidates JSON 摘要字段原文一致:"(i) an LLM-based OCR refinement module that improves text quality, and (ii) a semantic retrieval and cross-encoder reranking pipeline supporting natural-language question answering" |
| arXiv:2607.01233 = "Measuring Gap Between Human and LLM Research Ideas" | ✅ | candidates JSON 摘要字段:"how far are current LLM-generated ideas from human researchers" + 两轴 taxonomy 与 Tom 描述一致 |
| arXiv:2607.02461 = "OrbitQuant: 扩散 Transformer 后训练量化" | ✅ | HF Daily 2026-07-07(28▲票)一致 |
🟢 未发现硬事实错误。所有 15 个引用项中 5 个 ⚠️ 都是"结构性遗漏"(Tom 知道但没写),不是"写错了"。这是 Tom 的稳定优势——近 7 日互评没出过硬伤。
深度评估(6.5 / 10)
强项
-
CheckRLM 与 Know Your Source 的互补性分析(主评 §2 "Tom 判断"):"后者管'信息来源可靠性',CheckRLM 管'推理过程事实性',两者叠加是高质量 RAG 应用的必经之路"——这条 cross-paper 分析是 Tom 自己产出的 insight,不是从论文摘要搬来的,是 Wave 2 radar 里少见的"二次判断"。比单纯列举方法高一个抽象层。
-
MultAttnAttrib 与 Query-Focused Summarization 的对比(主评 §1):"它做的是细粒度 token 级溯源,而非文档级摘要"——同样是把一个新方法放进已有 taxonomy 里的二次判断,给读者一个"它在领域谱系中处于哪一格"的快速锚点。
-
RAG 工程趋势速览表(副评 §"本周 RAG 工程趋势速览"):chunk → embed → ANN + BM25 → cross-encoder → LLM 这条生产栈是 2026 中期行业共识的正确描述,3 个演进方向(多源异构 / 噪声鲁棒 / 归因组件化)也是对的。
-
"三个演进方向"表格的状态标注(副评):把每个方向标为"新兴 benchmark / 端到端落地 / 从评测→生产组件"——这种状态标注是轻量级 paper triage 的高效格式,比单纯按时间倒序列条目更值钱。
弱项
-
⭐ 条目深度普遍 < 200 字节(最大软伤)。MultAttnAttrib / CheckRLM / DataComp-VLM 三条 ⭐ 每条主评只有"核心 / 为什么值得看 / Tom 判断"3 段,每段 2~3 句。读者拿到这份 radar 没法立刻判断"这论文我应不应该深读 / 能不能在我的场景落地"。建议下次 cron 给每条 ⭐ 至少补 3 个工程硬信息:base model / benchmark 规模 / 关键实验数字 / 开源情况 / 数据集/代码链接。
-
HETERQA 的 5 类异构源没列具体名词(副评 §1)。candidates JSON 摘要字段有完整 5 类名(关系表/文本/图像/空间/知识图谱),Tom 写到"5 类异构数据源"就停了——这一字之差决定了读者能不能判断 HETERQA 是否覆盖自己的多源场景。轻量日也要把这个写出来。
-
Historical Archives RAG 缺落地细节(副评 §1)。OCR refine 的具体 LLM 用什么(GPT-4 / Claude / 开源?)+ cross-encoder 用的什么模型 + rerank 提升多少 NDCG@10 + 实验数据集多大——这些工程硬信息全是 0。读者只知道"做了 RAG + OCR + rerank",不知道能不能直接复用。
-
MultAttnAttrib 缺性能数据(主评 §1)。arXiv 摘要明确写"matches GPT 5.4 + 延迟 1/7",Tom 完全没提。这两个数据对"是否值得跟进"的决策权重极高——一个方法能追平 GPT 5.4 且延迟降到 1/7,是 RAG 归因方向的天顶级新结果,Tom 把它写成"可能最值得关注的新 baseline"是低估了。
-
趋势洞察太短(主评尾段)。两段趋势洞察总共 4 句话,每条 ~2 句话。"归因正从'评测任务'演化为'生产组件'"这条归纳得不错,但缺一个机制层的解释:是哪些上下游事件触发了这个演化(HF Daily 同期 3 篇归因 / 评测任务如 RAGTruth / MultAttrEval 成熟 / 企业 RAG 上线后归因失败案例增多)?读者读完无法做"自己是不是也在这个趋势上"的判断。
-
CheckRLM 缺技术机制名词(主评 §2)"局部中间干预机制"原文明确写"In-reasoning knowledge checking that identifies and corrects factual errors during long-chain reasoning, effectively preventing error accumulation"+ "localized intermediate intervention mechanism that dynamically extracts and verifies critical knowledge claims from partial reasoning states"——这是该方法的核心机制名词,Tom 写成"提取事实声明 + 实时检测并修正 + 最小改动 refine"丢掉了"局部中间"这个最关键的时序约束(不是事后纠正,是推理中间就介入)。
可读性(7.5 / 10)
强项
-
模板稳定:⭐ + 一般 + 趋势洞察 + 元信息(候选数 / 高价值数 / candidates JSON 路径 / 写入路径 / Substack / CSDN 状态)全到位,这是 Tom 在 Wave 2 的成熟形态。
-
元信息完整:副评明确写"轻量模式"+"candidates JSON 路径",读者知道这是轻量产出,不会误以为是全量精读。
-
去重索引规范:主评对 Know Your Source / CheckRLM 标"⚠️ 已见于 07-05/07-03"——避免重复展开是协作友好的好习惯。
弱项
-
主评与副评内容重叠 ~40%(最大协作摩擦)。MultAttnAttrib 在两篇文件都展开,CheckRLM 在两篇都标 ⭐ / 高价值,Financial RAG + Reranking 在两篇都列。双产出应该有清晰分工——例如:主评专攻"agent + 多模态 + 长上下文"赛道,副评专攻"RAG 检索 + 重排"赛道,重叠条目只在主评展开、副评只放标题。
-
副评的 ⭐ 高价值标 2 条与主评 ⭐ 标 3 条不一致(轻微冲突)。读者看到主评说"高价值 3 条"再看副评说"高价值 2 条"会困惑——是否意味着 Historical Archives RAG / HETERQA 不是 ⭐ 而是"新增未覆盖于今日 radar / HF daily"?这个分类逻辑需要明示。
-
副评的"标准生产栈"行用 markdown 表格 + 文字混排(轻微可读性摩擦)。"chunk → embed → ANN + BM25 混合检索 → cross-encoder 重排 → LLM prompt"这一行是 inline 文字而非表格项,与下方"三个演进方向"的 markdown 表格排版风格不统一。
-
副评候选清单里 #4 Financial RAG + Reranking(2026-03 旧文)放在"本周新增"区域:副评标题写"本期新增(未覆盖于今日 radar / HF daily)",但 2603.16877 是 2026-03 的论文,已被之前 radar 多次覆盖,放错分区会误导读者以为这是 new-to-radar。
时效性与工作流同步(7.0 / 10)
work-queue.md 2026-07-07 14:00 快照里:
- Top 15 高价值待深度解读:Tom 今天 8 条候选里没有一条命中。最接近的是 2607.02461 OrbitQuant(系统方向,非 RAG 核心)和 2607.01233 Measuring Gap(agent 自我反思)。队列 ⭐⭐⭐⭐⭐ 5 星 2 条(2606.06036 MRAgent / 2604.14572 Corpus2Skill)和 4.8 分 7 条全部未触达。
- §5 富化缺口:9 张卡缺 TLDR(待 cron_s2 覆盖):Tom 不在这个赛道,跳过合理。
- §6 待精确分类:197 张卡(cron_classify_llm 低峰消化):Tom 不在这个赛道,跳过合理。
核心建议:Tom 是 radar 赛道,应该至少在 radar 末尾加一节"与 work-queue 同步",把队列 Top 15 里与 RAG / Agent / 长上下文相关的条目显式索引(哪怕只是"标题 + arXiv ID + 一句话标记")。今天应该索引的至少包括: - 2601.07711(Agentic RAG 实验比较 / 4.8 分)—— RAG 核心 - 2602.04476(元信息 / 4.8 分)—— 与 radar 的 paper triage 方法论相关 - 2510.16558(Model Context Protocol 安全 / 4.8 分)—— RAG 工具安全相关 - 2511.11581(Triton Attention Kernel / 4.8 分)—— 长上下文推理相关
否则 KB 主工作流(队列 Top 15)与 Tom 的 radar 会越来越脱节。
误读与误导检查(9.0 / 10)
- ✅ 没有"二手转述当事实"——所有引用都站在 candidates JSON 摘要字段侧,数字与论文原文一致
- ✅ 没有"夸大 / 缩小性能数据"——Tom 没写任何性能数字(这是深度不足的副作用,反而规避了夸大风险)
- ✅ 没有"过期 / 错配的工作流标注"——所有 ⚠️ 标注的去重条目都在正确的雷达批次(07-05 / 07-03 / 07-04)
- ⚠️ 副评 §1 Historical Archives RAG 写"首个将 RAG pipeline 直接接入历史档案数字化场景的端到端工作"——这是强声明("首个"),但 web_search 命中了 ACL 2025 ROCLING 的 "A Preliminary Study of RAG for Taiwanese Historical Archives"(Lin 2025)和 Reddit r/Rag 上的 "Preprocessing 150 Years of History"。"首个"在 RAG for archives 子领域不是事实——至多是"近期代表工作之一"。建议下次 cron 改成"近期代表工作之一"或加 "(在 OCR refinement + semantic retrieval 两模块设计上较新)"。
可执行的修改建议(按优先级)
P0(今天就改,下次 radar 直接复用)
- 给 MultAttnAttrib / CheckRLM / DataComp-VLM 三条 ⭐ 各补 3~5 个工程硬信息:base model / benchmark 规模 / 关键实验数字 / 开源情况 / 数据集与代码链接。candidates JSON 摘要字段里有就直接搬,没有就标"未明示"。
- 副评 §1 HETERQA 把 5 类异构源具体名写出来(关系表 / 文本 / 图像 / 空间数据库 / 知识图谱)。一字之差决定可执行性。
- MultAttnAttrib 主评补 GPT 5.4 平替 + 延迟 1/7 这两个数据。这两条是 RAG 归因方向的天顶级新结果,不能省。
- 副评候选清单 #4 Financial RAG + Reranking(2603.16877)从"本周新增"区域移到"关联追踪"区域——它是 2026-03 旧文不是 new-to-radar。
P1(明天改,形成新的产出规范)
- 主评与副评分工明确化:主评专攻"agent + 多模态 + 长上下文",副评专攻"RAG 检索 + 重排",重叠条目只在主评展开,副评只放标题 + 一句关联理由。这能消除 ~40% 内容重叠。
- CheckRLM 主评补 "localized intermediate intervention" + "in-reasoning knowledge checking" 这两个机制名词——核心机制名词不能丢。
- 趋势洞察补机制层解释——不只是说"归因从评测演化为生产组件",还要说"是什么事件触发这个演化"(HF Daily 同期 3 篇归因 / RAGTruth 等评测成熟 / 企业 RAG 上线后归因失败案例)。
P2(本周内改,沉淀为下次 cron 的 recurring 模板)
- Historical Archives RAG 的"首个"强声明改成"近期代表工作之一"——避免被 ACL 2025 ROCLING / Reddit r/Rag 上的早期工作打脸。
- radar 末尾加"与 work-queue 同步"一节,把队列 Top 15 里与本赛道相关的条目显式索引。今天应该至少索引 4 条(2601.07711 / 2602.04476 / 2510.16558 / 2511.11581)。
- HETERQA 副评 §1 给"多源联合检索成为新测试维度"补一句:"但 5 类异构源里空间数据库 + 知识图谱的覆盖度待核证(candidates JSON 摘要字段未明示各自多少 QA pairs)"——把不确定项当场标出来。
P3(观察项)
- 观察 Tom 在轻量日 vs 全量日的产出节奏:近 7 日 radar 字节数(7-01 19K / 7-02 23K / 7-04 24K / 7-05 29K / 7-06 36K / 7-07 4.4K)波动极大(最大 8 倍差),建议下次 cron 在 reflection 里写明"为什么今天选轻量"——这能避免协作方误以为 Tom 偷懒。
给 spark 自己的 1 条观察
Tom 今天的两条 ⭐(MultAttnAttrib / CheckRLM)与 spark 自己的 KB(organized/llm-application.md / organized/multimodal.md)的归因方向条目有重叠。建议 spark 在明天 09:00 / 14:30 / 20:30 三个 cron 窗口的产出里显式引用 Tom 今天的 radar 条目作为同源——避免 KB 双轨制带来的"两套归因话题"问题。这是 Wave 2 协作层级的横向同步,不是 Tom 的产出问题,是 spark 自己的同步问题。
spark · 2026-07-07 14:30 Asia/Shanghai · 交叉互评 Wave 2 E3 · 事实核查通过 web_search (Tavily) + candidates JSON 摘要字段四方比对