rag · E1 预消化简报(2026-08-02)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(2026-07-31 ~ 2026-08-02)+ paper_cards 近 3 天新卡 RAG 主分类/邻接抽查 本简报目的: 为今晚 RAG 活文档接力(R51 → R52)预习备料,聚焦尚未进入 knowledge/rag.md R51 基线的增量条目 背景说明: R51 于 2026-08-02 早间收官(BM25 Wins at Scale + Σ-Mem + ConMem + See2Think 四联协同)。本简报覆盖 2026-07-31 下午至 2026-08-02 早间增量,发现 RAG 主题 ArXiv 新鲜供给进入相对低谷期,无主分类为 rag 的新 arXiv 论文;主要增量来自 flyp 周六方法论文献对 BM25 Wins at Scale 的补深度分析(反方审稿 6 条证伪线),以及 Jay 傍晚档的 RAG 评估工具 2026 格局梳理(具体工程指标和工具对比框架)。OmniScope(2607.23193,HF Daily 3票)和 Fairness Pruning(2607.28319,HF Daily 2票)均为非 RAG 主分类,本简报仅在来源清单中标注,不计入增量。
检查过的来源清单
| 来源 | 文件 | 主要 RAG 增量 |
|---|---|---|
| Tom/inbox/tom | 2026-08-02-agent-rag-longcontext-radar.md | 今日 radar,8 条候选均已在 R51 收录范围内(Σ-Mem / Filesystem Memory / DualG-MRAG / GLM-RAG / See2Think / OmniScope / ConMem / Fairness Pruning) |
| Tom/inbox/tom | 2026-08-01-rag-e1prep.md | 昨日简报,3 条增量(Σ-Mem + ConMem + See2Think) |
| Tom/inbox/tom | 2026-08-01-agent-rag-longcontext-radar.md | 昨日 radar |
| Tom/inbox/tom | 2026-08-01T1440-agent-rag-longcontext-radar-v2.md | v2 radar,GLM-RAG 相邻方向(Graph RAG)已覆盖 |
| Tom/inbox/tom | 2026-08-01T2040-agent-rag-longcontext-radar.md | 晚间 radar,同日 v2 内容重复 |
| Tom/inbox/tom | 2026-08-01T1440-agent-rag-longcontext-radar-v2.md | v2 radar,4 高价值已入 R51 |
| flyp/inbox/flyp | 2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md | ⭐ 新增量 · BM25 Wins at Scale 方法论级精读(6 条反方证伪线 + R1-R5 复现档位 + 可信度打分 4.2/5)+ DualG-MRAG + Filesystem Memory 方法论精读(邻接 R51 双文已收,本简报仅用 BM25 部分) |
| flyp/inbox/flyp | 2026-08-01-1030-sat-adversarial-review-rag-filesystem-dualg-bm25.md | ⭐ 新增量 · BM25 Wins at Scale 反方审稿骨架(6 条证伪线),对 R51 BM25 条目的方法论补深度 |
| flyp/inbox/flyp | 2026-08-01-1030-sat-adversarial-review-rag-filesystem-dualg-bm25.md | 同上 |
| Jay/inbox/jay | 2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md | ⭐ 新增量 · RAG 评估工具 2026 格局(5 工具对比 + RAG 三元组 + MRR/Precision 公式 + 生产告警红帽设计) |
| Jay/inbox/jay | 2026-08-01T1220-jay-csdn-rag-agent-moe-2026.md | RAG 工程化总结(CSDN,VisionRAG / GraphRAG / Agentic RAG 选型,邻接 R51 §2.3/§4 工程化已有内容) |
| Jay/inbox/jay | 2026-08-02-csdn-llm-agent-rag-mlops.md | 2026-08-02 08:20 CST 生成(cron 08:50 执行后,文件生成于 00:20 UTC),内容为工程化 CSDN 总结,无新 arXiv |
| Jay/inbox/jay | 2026-08-01T1105-jay-five-category-briefing.md | 综合 briefing,RAG 邻接内容已在其他 Jay 文件覆盖 |
| spark/inbox/spark | 2026-08-01-agent-e1prep.md | agent 主分类,RAG 增量:CoMem(2607.28263)/ ShadowDancer(2607.28362)已入 R51 |
| spark/inbox/spark | 2026-08-01-llm-infra-e1prep.md | llm-infra 主分类,无 RAG 直接增量 |
| stephen/inbox/stephen | 2026-08-01-llm-application-e1prep.md | llm-application 主分类,RAG 邻接内容有限 |
| paper_cards/684-2607-28319.md | Fairness Pruning | 主分类 benchmark/systems,无 RAG 标签,不计入增量 |
| paper_cards/688-2607-23193.md | OmniScope | 主分类 multimodal,无 RAG 标签,不计入增量 |
| paper_cards/677-2607-27918.md | (待读) | 待确认主分类 |
| paper_cards/678-2607-28263.md | CoMem(与 flyp 8-1 精读同名) | 已入 R51 |
| paper_cards/679-2607-27816.md | (待读) | 待确认主分类 |
| paper_cards/680-2607-28374.md | (待读) | 待确认主分类 |
| paper_cards/681-2607-26627.md | (待读) | 待确认主分类 |
| paper_cards/682-2607-28362.md | ShadowDancer | 已入 R51(flyp 8-1 09:50 精读已覆盖) |
增量条目(4 条,含 2 条新维度 + 2 条工程量化补充)
增量 1 · ⭐⭐⭐⭐ 高 · BM25 Wins at Scale 方法论补深度:反方六条证伪线 + R1-R5 复现档位(flyp 8-1 精读)
来源: flyp/inbox/flyp/2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md + flyp/inbox/flyp/2026-08-01-1030-sat-adversarial-review-rag-filesystem-dualg-bm25.md(来源:flyp 周六方法论文献级精读 + 反方审稿;对应 arXiv 2607.26497) arXiv: 2607.26497 TLDR: R51 已收录 BM25 Wins at Scale 的结论(scale-dependent crossover + BM25 601M tokens 领先 ~20 分),但缺少方法论层面的六条反方证伪线和复现档位风险评估。flyp 的方法论文献填补了这一空白,将 R51 的"结论性引用"升级为"带控制变量的批判性引用"。 卡状态: ✅ R51 已收录(评测 40 件第 40 件),flyp 精读提供方法论补深度
要点(flyp 方法论级精读新增): - R51 缺失的核心方法论:R51 对 BM25 Wins at Scale 的引用停留在"28-tier / 450× / 同 reader / 同 judge / token-level cost metered"结论层面;flyp 精读补充了: - 28-tier 阶梯方法学:1.25× 每级,1,144 文档(1.7M tokens)→ 511,959 文档(601M tokens),28 级严格包含(T1 ⊂ T2 ⊂ ... ⊂ T27);问题集固定 - 同 reader + 同 judge + token-level cost metered 的方法学价值:消除 reader/judge/prompt 漂移混淆变量,首次系统对齐"成本/精度"两个维度 - judge robustness:独立 judge + 二值 protocol 验证主曲线排名(96.2% pooled agreement)
- 反方六条证伪线(flyp 新增,R51 无):
- L1(EnterpriseRAG-Bench 单一 benchmark 外推风险):所有数据点来自"虚构 LLM inference 公司"语料(wiki/聊天/工单/邮件/会议转录/CRM/code review),天然偏好 BM25 词法信号(人名、版本号、错误码、Jira ticket id);对学术/法律/医疗/专利等长文+概念检索语料,BM25 的"~20 点领先"是否仍成立未被验证——这是审稿必问的关键漏洞
- L2(File-System Agent 80-call 预算 = 伪天花板):80-call 预算在 1M tokens 内可能饱和;若给 200-call 或 turn-aware budget,File-Agent 可能在 10M-50M 区间夺回部分曲线——这是"是否真的输了还是被预算卡了"的核心控制变量
- L3(Graph-RAG 止步 = 实现失败而非范式失败):HippoRAG 2 止于 131,876 docs / MS-GraphRAG 止于 8,750 / LightRAG 止于 2,254——这是"实现截止"而非"范式天花板"的关键混淆,LinearRAG 给出可扩展变体但仍在共享层级低于 BM25
- L4(judge protocol 偏企业短答友好):holistic alignment + atomic fact entailment 对"高 level 总结/长答案生成"类问题可能模糊掉 graph-RAG 在"多文档归纳-连接"上的真正优势
- L5(File-System Agent 模型档位 ≠ 生产 coding agent):Qwen3.6-27B policy 与 Claude Opus 4/GPT-5.6/Claude 4 Sonnet 不在同一档;生产 harness 用顶级模型 + 大量 sub-agent + 大上下文,27B 单一 LLM 无法代表
-
L6(reader = Qwen3.6-27B 单点,未报 reader sensitivity):在更大 reader(70B+ / Claude Opus / GPT-5.6)下,agent 多步推理质量提升,ranked discovery + agentic rerank 可能反超纯 BM25
-
R1-R5 复现档位(flyp 新增,R51 无):
- R1(最小):BM25 + File-Agent 在 bedrock 1,144 文档上的 500 题 → 🟢 低难度,3-5 天
- R2(中等):28-tier 阶梯 + 7 种 pipeline head-to-head → 🟠 中-高难度,2-3 周
- R3(reader sensitivity):4B / 27B / 70B 三档 reader 重画主曲线 → 🟠 中-高难度,4-6 周
- R4(外推 benchmark):BEIR / COLIEE / MedRAG / 学术论文集 → 🟠 中-高难度,3-4 周
-
R5(File-Agent budget frontier):File-Agent 40/80/160/320 call Pareto frontier → 🟡 中难度,1 周
-
可信度打分(flyp 新增,R51 无): 4.2/5(动机清晰度 ⭐⭐⭐⭐⭐ / 方法严谨度 ⭐⭐⭐⭐⭐ / 结论可推广性 ⭐⭐⭐ / 工程落地度 ⭐⭐⭐⭐ / 影响力 ⭐⭐⭐⭐⭐)
与活文档 knowledge/rag.md R51 现有脉络的关系: R51 §2.5 评测 40 件第 40 件(BM25 Wins at Scale = 语料阶梯化基准化 = RAG 评测六件套)。flyp 的方法论补深度可将 R51 对 BM25 Wins at Scale 的引用从"结论性引用"升级为"带控制变量和反方风险的批判性引用"——对应 R51 §2.5 评测(新增反方审稿六线 + 复现档位风险评估)。R51 §3 争议 73(BM25 scalability-first vs 复杂图 RAG 通用性)已有框架,flyp 的六条证伪线可直接支撑 §3 争议的具体化。
归入节: §2.5 评测(补深度:BM25 Wins at Scale 反方六条证伪线 + R1-R5 复现档位风险 + 可信度打分 4.2/5)+ §3 争议(73 BM25 争议具体化:L1-L6 六线)
arXiv: 2607.26497
增量 2 · ⭐⭐⭐⭐ 高 · Graph-RAG construction wall 具体数字:HippoRAG 2 止于 131,876 docs / MS-GraphRAG 止于 8,750 / LightRAG 止于 2,254(flyp 精读新补充)
来源: flyp/inbox/flyp/2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md(对应 arXiv 2607.26497 方法论文献) arXiv: 2607.26497(同一来源) TLDR: R51 对 Graph-RAG construction wall 的描述停留在"graph-RAG 普遍遇 construction wall"定性描述;flyp 精读从原论文中提取了三个具体的截止数字——这是 R51 需要补全的工程量化细节。
要点: - 具体截止数字(R51 无): - HippoRAG 2:止步于 131,876 篇文档(construction wall 第 1 站) - MS-GraphRAG:止步于 8,750 篇文档(construction wall 第 2 站) - LightRAG:止步于 2,254 篇文档(construction wall 第 3 站) - 对比:BM25 在 601M tokens(~511,959 篇文档)仍正常运行,差距超过 2 个数量级
-
LinearRAG 的定位:给出"可扩展变体"但仍在共享层级低于 BM25——这意味着 Graph-RAG 的可扩展性问题不是线性 Scaling 而是某处存在结构性断裂
-
construction token 成本数据:Graph-RAG 在 155M tokens 时需要 724M token build(construction),vs BM25 约 41 分(低 15 点)——这是 token-level cost metered 首次量化 Graph-RAG 的工程不经济性
-
"Graph-RAG construction wall"作为 RAG 替代范式 8 件中的反面证据:R51 §2.12 RAG 替代范式 8 件(BM25 Wins at Scale 不增范式,BM25 胜出是评测结论而非新范式),Graph-RAG 的 construction wall 是该评测结论的核心证据
与活文档 knowledge/rag.md R51 现有脉络的关系: R51 §2.12 RAG 替代范式 8 件(无新增范式,BM25 是评测胜出而非新范式)。Graph-RAG construction wall 具体数字(131,876 / 8,750 / 2,254)可进入 §2.12(补全 Graph-RAG "具体止步节点"作为 BM25 评测胜出的反面证据)。R51 §3 争议 73(BM25 scalability-first vs 复杂图 RAG 通用性)已有框架,具体数字可强化该争议的工程量化维度。
归入节: §2.12 RAG 替代范式(补细节:Graph-RAG construction wall 具体截止数字 131,876 / 8,750 / 2,254 文档)+ §3 争议 73(补量化证据)
arXiv: 2607.26497
增量 3 · ⭐⭐⭐⭐ 高 · BM25 Wins at Scale scale-dependent crossover 具体数字:bedrock 77.4 vs 74.7 → ~10M crossover → 全量 50.5 vs 30.7 vs 29.9(flyp 精读新补充)
来源: flyp/inbox/flyp/2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md(对应 arXiv 2607.26497) arXiv: 2607.26497 TLDR: R51 对 BM25 Wins at Scale 的引用只停留在"BM25 在 601M tokens 领先 ~20 分";flyp 精读从原论文中提取了三个关键数字节点,构成完整的 scaling curve 叙事——这是 R51 需要补全的量化细节。
要点(具体数字节点,R51 无): - Bedrock 层级(1.7M tokens): File-Agent 77.4 / BM25 74.7(95% CI 重叠,两者无显著差异;DenseRAG 较低) - ~10M tokens: 曲线发生 scale-dependent crossover——BM25 从落后转为领先 - 全量级(601M tokens): BM25 50.5 / File-Agent 30.7 / DenseRAG 29.9,BM25 领先约 20 点 - Dense 检索:始终低于 BM25 和 File-Agent,没有 crossover 点 - crossover 本质:不是 BM25"无条件胜出",而是"语料扩张越来越偏向全局候选排序"——这解释了为什么 BM25 是 scaling 最稳健默认
与活文档 knowledge/rag.md R51 现有脉络的关系: R51 §0.5.1 现状观察 1(BM25 范式跃迁候选)+ §2.12 RAG 替代范式 8 件 + §3 争议 73。BM25 的具体数字节点(77.4 / 74.7 / 50.5 / 30.7 / 29.9 / ~10M crossover)是支撑 R51 "scale-dependent crossover"定性的量化基础——两者互补,构成 R51 对 BM25 Wins at Scale 的完整叙事。
归入节: §0.5.1 现状观察(补量化:BM25 三节点 scaling curve 77.4 → ~10M → 50.5)+ §2.12 RAG 替代范式(补数字证据)+ §3 争议 73(补量化证据)
arXiv: 2607.26497
增量 4 · ⭐⭐⭐ 中 · RAG 评估工具 2026 格局:5 工具对比 + RAG 三元组 + MRR/Precision 公式 + 生产告警红帽(Jay 8-1 傍晚档)
来源: Jay/inbox/jay/2026-08-01T1950-jay-kvcache-vecdb-rag-2026.md(来源:Substack(FutureAGI + Composable + Kalvad)+ 工程化整理;主分类 engineering) arXiv: 无(工程化来源) TLDR: R51 §2.5 评测(40 件)聚焦 benchmark 层面的评测方法论,但缺少对 RAG 评估工具生态(生产级 5 工具横向对比 + 具体指标公式 + 告警设计)的系统性梳理。Jay 傍晚档的工程化整理填补了这一空白,为 RAG 生产部署提供评估工具选型依据。 卡状态: ⚠️ paper_cards 未建(工程化来源,无单一 arXiv 对应)
要点(Jay 傍晚档新增,R51 无):
- 5 工具横向对比框架(FutureAGI Substack): | 工具 | 定位 | 适合场景 | 评估指标 | |------|------|---------|---------| | Ragas | 参考免费评估框架 | 快速起步,定制化需求强 | Faithfulness, AnswerRelevance, ContextPrecision/Recall | | DeepEval | pytest 风格测试 | CI/CD 集成,测试驱动 | 可自定义,单元测试风格 | | Phoenix (Arize) | 开源可观测性 | 视觉调试,向量检索分析 | Tracing + 可视化 | | LangSmith | LangChain 原生 tracing | 已有 LangChain 栈 | 深度集成,tracing 优先 | | FutureAGI Evaluate | 全生命周期平台 | 企业级,70+ 模板 | ContextAdherence, ChunkUtilization, DetectHallucination 等 |
-
注意:FutureAGI 自身是商业平台,对比有轻微倾向性,需与官方文档交叉验证
-
RAG 三元组(Composable RAG): Faithfulness / Context Precision / Answer Relevance = 生产评估最小集
- Context Relevance → 验证检索器是否找到正确文档
- Faithfulness → 检测幻觉,生成是否忠实于检索内容
-
Answer Relevance → 确保答案真正帮助用户
-
MRR 公式(Kalvad Blog):
python MRR = Average(1 / rank of first relevant doc) # first at rank 1: 1.0 (perfect) # first at rank 3: 0.33 # first at rank 10: 0.1 -
Precision 公式(Kalvad Blog):
python Precision = Relevant docs retrieved / Total docs retrieved # 1.0 = every doc was relevant # 0.2 = 80% was junk -
生产告警红帽设计(Kalvad Blog): | 红帽条件 | 说明 | |---------|------| | avg relevance scores 突然下降 | 检索质量退化 | | latency 上升 | 性能问题 | | answer length 异常(过长/过短) | 生成异常 | | "I don't know" 响应率上升 | 检索失败或模型拒绝 |
与活文档 knowledge/rag.md R51 现有脉络的关系: R51 §2.5 评测(40 件 benchmark 层面的评测方法论)缺失生产级工具生态对比。Jay 的 5 工具 + RAG 三元组 + 公式 + 告警设计可进入 §2.5 评测(新增生产评估工具选型框架,与 benchmark 件互补:benchmark 件关注"测什么",工具件关注"用什么测")。R51 §4 工程化 RAG 已有框架(FROAV 六阶段 pipeline / SpecFirst 规范获取 / Scheduler-Theoretic 五模式),Jay 的工具对比 + 告警设计可作为 §4 的生产监控层补充。
归入节: §2.5 评测(新增:RAG 评估工具 5 工具横向对比 + RAG 三元组 + MRR/Precision 公式 + 生产告警红帽 = 生产工具选型框架)+ §4 工程化 RAG(补充:生产监控告警设计)
arXiv: 无单一 arXiv(工程化来源整合)
值得警惕的矛盾或待核实说法
- BM25 Wins at Scale 的外推限制(L1 反方核心):该论文所有数据点来自 EnterpriseRAG-Bench("虚构 LLM inference 公司"),wiki/工单/邮件天然偏好词法检索信号;学术/法律/医疗/专利等长文+概念检索语料上 BM25 的"~20 点领先"是否仍成立——R51 在引用该论文时应明确标注语料限制,不宜泛化为"BM25 永远胜出"
- File-System Agent 80-call budget 的天花板问题(L2 反方核心):若给更大 call budget,File-Agent 可能在 10M-50M tokens 区间夺回部分优势;"BM25 赢了"可能本质上是"File-Agent 被预算卡了"——R51 在引用该结论时应标注 budget 控制变量
- Graph-RAG construction wall = 实现失败而非范式失败(L3 反方核心):HippoRAG 2 / MS-GraphRAG / LightRAG 止步于特定文档数量,是这些实现的工程瓶颈,不等于 Graph-RAG 范式不可扩展;LinearRAG 给出可扩展变体说明问题可解——R51 §2.12 在引用 construction wall 作为 BM25 胜出证据时,应区分"范式失败"与"实现失败"
- Jay RAG 评估工具来源的可信度:FutureAGI 是商业平台,其 5 工具对比有轻微倾向性;Kalvad Blog 和 Composable 是工程博客而非学术论文;R51 在引用这些工程化来源时应与官方文档交叉验证指标定义,标注"工程化来源,待核实"
- OmniScope(2607.23193,HF Daily 3票)和 Fairness Pruning(2607.28319,HF Daily 2票):主分类均非 rag(分别是 multimodal 和 benchmark/systems);R51 未收录是正确的;但 OmniScope 的"modality-decoupled token compression"对 RAG 的 context compression 邻接价值值得 future note——建议不作为 RAG 直接增量,但标注为邻接待跟进
- R51 对 BM25 Wins at Scale 的引用深度:R51 已收录该论文(评测 40 件第 40 件),但仅停留在结论层面("BM25 规模化胜出");本简报通过 flyp 方法论文献补充了六条反方证伪线和具体数字——今晚活文档更新应明确区分"论文结论"与"方法论批判",避免把"有争议的结论"当"已定论的事实"引用
可引用 arXiv 号列表
| arXiv 号 | 论文/工作 | 状态 |
|---|---|---|
| 2607.26497 | BM25 Wins at Scale(USTC + Metastone + BAAS) | ✅ R51 已收录(评测 40 件第 40 件);flyp 补方法论六线 + 具体数字 |
| 2607.27958 | Σ-Mem:多智能体可靠性记忆 | ✅ R51 已收录(Memory 第 19 条腿候选 K) |
| 2607.28126 | ConMem:贡献感知记忆(工业巡检) | ✅ R51 已收录(检索单元 34 件 + 多模态 RAG 第 22 垂直域) |
| 2607.26769 | See2Think:多模态视觉依赖诊断基准 | ✅ R51 已收录(评测 40 件邻接) |
| 2607.28580 | DualG-MRAG:宏微观解耦多模态 RAG | ✅ R51 已收录 |
| 2607.28397 | GLM-RAG:图语言模型 KG-RAG | ✅ R51 已收录 |
| 2607.26637 | Filesystem-Based Memory | ✅ R51 已收录 |
| 2607.26760v1 | Metis:记忆基础模型 | ✅ R51 已收录(Memory 候选 J) |
| 2607.26410 | Voice Memory | ⚠️ R51 未收录,R49 e1prep 已标注待核实 |
| 2607.27146 | MindForge:全生命周期软件工程训练环境 | ⚠️ R51 未收录,R49 e1prep 已标注待核实 |
| 2607.27167 | SpecFirst:规范获取作为程序合成一等公民 | ⚠️ R51 未收录,R49 e1prep 已标注待核实 |
| 无单一 arXiv | RAG 评估工具 5 工具对比(Ragas/DeepEval/Phoenix/LangSmith/FutureAGI) | ⚠️ 工程化来源(FutureAGI Substack / Composable / Kalvad Blog),待与官方文档交叉核实 |
归入活文档 knowledge/rag.md 的建议操作
| 增量 | 目标节 | 操作类型 |
|---|---|---|
| BM25 Wins at Scale 反方六线 + R1-R5 档位 + 4.2/5 可信度 | §2.5 评测(补深度)+ §3 争议 73 | 新增反方审稿六线 + 复现档位风险 + 可信度打分 |
| Graph-RAG construction wall 具体数字(131,876/8,750/2,254 文档) | §2.12 RAG 替代范式 + §3 争议 73 | 补全 Graph-RAG 止步节点量化证据 |
| BM25 scale-dependent crossover 具体数字(77.4/74.7/50.5/30.7/29.9/~10M crossover) | §0.5.1 现状观察 + §2.12 + §3 争议 73 | 补全 BM25 三节点 scaling curve 量化 |
| RAG 评估工具 5 工具 + RAG 三元组 + MRR/Precision 公式 + 告警红帽 | §2.5 评测(新增生产工具选型框架)+ §4 工程化 RAG | 新增生产评估工具生态对比 + 监控告警设计 |
无显著新增量时说明
本日 RAG 主题 ArXiv 新鲜供给处于相对低谷期——2026-08-02 candidates JSON 中 8 条候选均为 2026-07-27~30 的旧论文(Σ-Mem / See2Think / OmniScope / Fairness Pruning / DualG-MRAG / GLM-RAG / ConMem / Filesystem Memory),全部已在 R51 收录范围。OmniScope(2607.23193,主分类 multimodal)和 Fairness Pruning(2607.28319,主分类 benchmark/systems)均无 RAG 主分类标签,R51 未收录是正确的。
今日实质增量(共 4 条,2 条新维度 + 2 条工程量化补充): 1. flyp BM25 Wins at Scale 方法论补深度(反方六线 + R1-R5 复现档位 + 4.2/5 可信度打分)= 方法论层面补深度 2. Graph-RAG construction wall 具体数字(131,876 / 8,750 / 2,254 文档)= 量化层面补细节 3. BM25 scale-dependent crossover 具体数字(77.4/74.7 → ~10M → 50.5/30.7/29.9)= 量化层面补细节 4. Jay RAG 评估工具 2026 格局(5 工具 + RAG 三元组 + MRR/Precision 公式 + 告警红帽)= 生产工具层面补生态
与昨日(3 条新增 arXiv)相比:今日无新 arXiv RAG 论文,但通过跨实例方法论文献(flyp)和工程化梳理(Jay)补充了 R51 已有条目的方法论深度和工具生态全景。
本棒 R52 预消化关键议题
R51 四联协同(BM25 规模化重排序 + Σ-Mem 多智能体信任记忆 + ConMem 工业巡检贡献感知 + See2Think 视觉依赖诊断)收官后,R52 面临的核心问题是:R51 的四个方向下一步是什么?
- BM25 规模化重排序 → 下一步:flyp 六条反方证伪线(L1-L6)中最需要作者回应的 P0 是哪个?Reader sensitivity(70B+ 模型下的 crossover 是否反转)和 File-Agent budget frontier(160/320 call 下 File-Agent 是否夺回优势)是两个最短验证路径
- Σ-Mem 多智能体信任记忆 → 下一步:候选 K(记忆建模可信赖性)与候选 J(Metis 记忆内化)是否构成互补?Weyl 不等式谱变化约束在多模态/视频/音频场景下的适用性是否需要单独验证
- ConMem contribution scoring → 下一步:从工业巡检迁移到通用 RAG 的方法论可行性;与 KAMR 知识对齐的关系(KAMR 解决"检索什么",ConMem 解决"检索后哪个最有价值")
- See2Think 视觉依赖诊断 → 下一步:与 DualG-MRAG 宏微观解耦的交叉验证;VAoT 诊断结果对 MM-RAG pipeline 的实际改进建议;paper_cards/685 建卡状态待确认
- RAG 评估工具 2026 格局 → 下一步:Ragas / DeepEval / Phoenix / LangSmith / FutureAGI 五工具中,哪两个的指标体系最接近 R51 §2.5 评测的 benchmark 件(MisKnow-Agent / BM25 Wins at Scale / Agent Retrieval Bench / KAMR / BeyondUncertainty)
Tom · 2026-08-02 08:50 CST · E1 预消化简报 · 4 条增量(2 新维度 + 2 量化补充)· 涉及 arXiv:2607.26497 / 2607.27958 / 2607.28126 / 2607.26769