rag · E1 预消化简报(2026-09-04)
R80 E1 轮 · 窗口覆盖:2026-09-03 ~ 2026-09-04 08:50 CST 数据来源:Tom 9-04 0840 radar + Jay 9-04 0820 CSDN扫描 + Stephen 9-03 2245 协调检查 + paper_cards Sep 3 新卡核查 活文档基线:rag.md R79(2026-09-03 13:55 CST)
0. 概述与基线对齐
R79 状态确认:R79 统计的 3 件"RAG net-new"(BioMedRAG 2608.31139、ACToR 2609.01601、SMELT 2609.01343)全部来自 Tom 9-03 0852 rag-e1prep,均为 Sep 2 提交论文,paper_card 入库时间在 Sep 3,属于 R79 窗口确认无误。
本轮(R80)新发现:R79 结束后(Sep 3 ~ Sep 4 08:50),知识库新增 5 件主分类 rag 的 paper_card(均 Sep 3 入库,未被 R79 覆盖),另有 1 件 Tom Sep 4 radar 高价值 rag-adjacent(NeoMME),以及 Jay CSDN 工程邻接。
核心判断:R80 增量密度「密度中低,视觉文档 RAG + NER 按需检索 + 多语言重排三轨并行」,无高价值框架级论文,但垂域方法论有工程落地价值。
1. 增量条目(5 件 RAG net-new + 1 件 RAG-adjacent)
增量 ① ViSAR:视觉文档问答的无训练自适应 k 检索
- 来源:arXiv:2609.02486v1 + paper_card 1204 主分类 rag 副分类 engineering + Sep 3 入库 + 来源 Tom 9-03 _candidates
- 要点:DocVQA 现有方法无论查询复杂度均检索固定 top-k 页面,导致 LVLM 延迟升高且可能损害答案准确率。ViSAR(Visual Semantic Activation Retrieval)提出无训练自适应 k 检索方法,利用 LVLM 推理过程中的激活信号动态决定应检索的页面数,在 late-interaction 视觉文档检索场景实现训练-free 自适应。形态 method,工程导向。
- 与活文档现有脉络的关系:R76 ExtractBench 文档解析基准建立了"解析层"基准;R79 BioMedRAG 建立了"切分层"基准;ViSAR 在视觉文档 RAG 方向建立"检索页数自适应"第三维度,与"解析-切分-自适应页数"三垂直档形成视觉文档 RAG 三层基准雏形。与 §2.3 检索单元(视觉文档检索 late-interaction)邻接,与 §2.6 运行时(推理延迟优化)邻接。
- 建议归入节:§2.3 检索单元(视觉文档 late-interaction 检索)+ §2.6 运行时(推理延迟优化)
- 可信度:★★★★(arXiv 预印本,Sep 3 新入库,训练-free 方法论新颖度高)
增量 ② NE-R1:NER 的"检索按需"自适应框架
- 来源:arXiv:2609.02366v1 + paper_card 1205 主分类 rag 副分类 method + Sep 3 入库 + 来源 Tom 9-03 _candidates
- 要点:LLM 时代 NER 在长尾/领域特定实体上仍因参数化知识不足而具挑战性。RAG 可注入外部知识但对熟悉样本引入噪声和不必要成本。NE-R1 提出"检索按需"(retrieval-on-demand)机制,自适应决定何时触发检索并集成到 R1 风格推理框架。形态 method。
- 与活文档现有脉络的关系:与 R79 ACToR token 级粒度形成"按需-按token"双自适应脉络对照(ACToR 在解码过程中按 token 决定上下文需求;NE-R1 在 NER 场景按实体决定检索需求)。与 §2.3 检索单元(自适应检索时机)邻接,与 §2.14 RAG 24 范式邻接。
- 建议归入节:§2.3 检索单元(NER 场景自适应检索)+ §2.14 RAG 24 范式(adaptive retrieval 变体)
- 可信度:★★★(arXiv 预印本,Sep 3 新入库;R1 框架集成思路有价值但需核实端到端 NER 精度数据)
- 待核实:paper_card 1205 显示 TLDR 被截断,NER 精度提升具体数据未披露
增量 ③ BioNER+RAG:放射学大众化摘要的健康素养评估
- 来源:arXiv:2609.02396v1 + paper_card 1203 主分类 rag 副分类 evaluation + Sep 3 入库 + 来源 Tom 9-03 _candidates
- 要点:患者难以理解放射学报告的专业术语,常转向公开 LLM 解释但存在幻觉风险。本研究系统评估 BioNER 与 RAG 在放射学报告大众化摘要场景的有效性,建立评估基准。形态 benchmark。
- 与活文档现有脉络的关系:与 R76 ExtractBench(文档解析)+ R79 BioMedRAG(生物医学 chunking)形成"生物医学 RAG 三层验证":解析层(ExtractBench)→ 切分层(BioMedRAG)→ 评估层(BioNER+RAG)。与 §2.5 评测(63 件)邻接,与 §2.9 上下文工程(健康垂域)邻接。
- 建议归入节:§2.5 评测(放射学大众化摘要基准)+ §2.9 上下文工程(健康素养垂域)
- 可信度:★★★(arXiv 预印本,Sep 3 新入库;健康素养场景新颖但 TLDR 被截断,具体评估指标未完整披露)
增量 ④ LAMAR:多语言语言感知对齐重排器
- 来源:arXiv:2609.01925 + paper_card 1178 主分类 rag 副分类 risk + Sep 3 入库(paper_card 列表中标注为 2609-01925 同号重,即曾有重复提交)
- 要点:多语言对齐重排器,面向 RAG pipeline 中的 reranking 阶段。形态 unclear(paper_card 1178 内容需完整读取)。
- 与活文档现有脉络的关系:与 R79 AgentJudgeBench(LLM judge reranker 可靠性研究)形成"reranker 横向扩展":AgentJudgeBench 研究 judge/re-ranker 可靠性;LAMAR 提供多语言对齐重排能力。与 §2.5 评测(reranker 评测)邻接,与 §2.8 安全与治理(多语言安全对齐)邻接。
- 建议归入节:§2.5 评测(多语言 reranker)+ §2.8 安全与治理(多语言对齐)
- 可信度:★★★(paper_card 主分类 rag 副分类 risk;多语言场景有价值但 paper_card 1178 内容需核实完整 TLDR)
- ⚠️ 待核实:paper_card 1178 TLDR 未读取到;建议补充核验 paper_card 内容完整度
增量 ⑤ SimLoss:单遍细粒度图像描述(⚠️ 主分类 rag 疑似误标)
- 来源:arXiv:2609.00591 + paper_card 1198 主分类 rag 副分类 position + Sep 3 入库 + 来源 Tom 9-03 _candidates
- 要点:现代 VLGM 生成流畅高层描述但遗漏属性/数量/纹理/材质/空间关系;多阶段系统(生成-分解-验证-改写)恢复细节但延迟大幅上升。SimLoss 提出无参考嵌入空间目标函数,实现单遍细粒度图像描述。核心贡献是图像描述生成,不是 RAG。
- 与活文档现有脉络的关系:与 RAG 的关联仅限于"图文混合文档 RAG 需要细粒度图像描述作为前处理"这一间接场景。paper_card 主分类 rag 疑似误标,核心贡献与 RAG 核心关联薄弱。建议降为 llm-infra 邻接(VLM 图像描述生成),不写入 rag.md 主轴。
- 建议归入节:⚠️ 存疑——建议 paper_card 主分类改为 llm-infra;若保留 rag 主分类,仅写入 §2.7 多模态 RAG(图像理解前处理)邻接,不写入主轴
- 争议关联:与 R74 Procedura(rag 标签元审视)和 R79 SMELT(rag 标签元审视)形成"rag 标签泛化问题"系列
增量 ⑥ NeoMME:单塔多模态原生多语言基础编码器(RAG-adjacent)
- 来源:arXiv:2609.01657 + Tom 9-04 0840 radar #2 ⭐⭐ + HF Daily 22 票 + 2026-08-30
- 要点:现有 ColPali 等视觉文档检索模型复用 VLM 架构(因果 LM + 视觉编码器),参数和计算开销大。NeoMME 从头训练双向 Transformer Encoder,用 masked discrete-diffusion 目标,同时处理多语言文本和原始图像 patch。260M/800M 两档。非生成式检索场景(图文混合文档 RAG)的新架构候选,参数效率显著优于 ColPali 系列。
- 与活文档现有脉络的关系:R77 LINE 建立了图文混合检索的混合检索范式(embedding_text + BM25);NeoMME 提供图文混合文档 RAG 的新编码器架构。与 §2.7 多模态 RAG(视觉文档编码器选型)直接邻接,与 §2.3 检索单元(多模态检索编码器)邻接。
- 建议归入节:§2.7 多模态 RAG(视觉文档编码器选型)+ §2.3 检索单元(图文混合检索编码器)
- 可信度:★★★★(HF Daily 22 票,2026-08-30;架构创新度高,开源权重后可直接替代现有视觉编码器)
2. 工程邻接(Jay 9-04 CSDN 扫描)
邻接 A:向量数据库选型决策树(CSDN 工程)
- 来源:Jay 9-04 0820 CSDN 扫描 + blog.csdn.net/srk950606/article/details/156913534
- 要点:pgvector(最低成本 MVP)→ Qdrant(生产级)→ Milvus(百亿向量企业级);"向量数据库不是一步到位,而是阶段性最优解"——提供选型决策树方法论
- 与活文档现有脉络的关系:与 §2.1 选型决策树(v3.28 49 维)互补,提供 pgvector/Qdrant/Milvus 三阶段演进路径
- 建议归入节:§2.1 选型决策树(工程实践补充)
- 可信度:★★★(CSDN 工程博客,有 AI Service Desk MVP 背景;建议核验 2026 年版本特性)
邻接 B:Faiss vs Qdrant 全方位对比(CSDN 工程)
- 来源:Jay 9-04 0820 CSDN 扫描 + blog.csdn.net/huangmingleiluo/article/details/149409536
- 要点:Faiss(C++/MIT)vs Qdrant(Rust/Apache 2.0)部署方式、索引算法(HNSW/IVF/Flat)、API 接口对比;生产级 RAG → Qdrant;离线批量检索 → FAISS
- 与活文档现有脉络的关系:与 §2.1 向量数据库选型互补,提供具体技术选型维度(语言/许可证/索引类型)
- 建议归入节:§2.1 选型决策树(Faiss vs Qdrant 维度补充)
- 可信度:★★★(有实测数据;建议核验 2026 年 Qdrant 1.x 新版本特性)
3. 协调信号(Stephen 9-03 2245 coord-check)
Stephen 协调检查记录:RAG 从 +8 → +10 重大扩展标注 + token 级粒度预备触发。
解读:RAG 主轴在 Sep 3 evening 窗口(12:45 ~ 22:30)扩展了 2 个维度,从 8 扩展到 10,与 token 级粒度(ACToR,R79 已锚入)预备触发相互印证。说明 RAG 主轴在 R79 锚入 token 级粒度后,团队认知层面的覆盖广度同步扩展。
此信号不构成新的 paper_card 增量,但反映 RAG 主题在团队研究中的认知权重在上升。
4. 矛盾与待核实
矛盾 ① SimLoss 主分类 rag 误标(存疑)
- SimLoss 核心贡献是图像描述生成,paper_card 主分类标 rag 属误标概率高
- 类比 R79 SMELT(2609.01343,主分类 rag 但无显式 RAG 内容)和 R74 Procedura(rag 标签泛化)
- 建议:R80 活文档写入时将 SimLoss 降为 llm-infra 邻接;或建议 paper_card 团队修正主分类
矛盾 ② NE-R1 TLDR 截断导致核心数据缺失
- NE-R1 paper_card 1205 TLDR 被截断,"integrates it int" 后无完整数据
- 端到端 NER 精度提升、R1 框架具体集成方式均未披露
- 建议:补充核验 paper_card 1205 完整 TLDR 或直接查阅 arXiv:2609.02366
矛盾 ③ LAMAR paper_card 1178 内容完整度待核实
- 列表中标注"2609-01925 同号重"(重复提交)
- paper_card 1178 完整内容未读取到,无法确认 LAMAR 的具体 RAG 贡献
- 建议:补充读取 paper_card 1178 完整内容后再决定是否写入活文档
5. 可引用 arXiv 号列表
主分类 rag(5 件): - 2609.02486 — ViSAR(无训练自适应 k 视觉文档检索) - 2609.02366 — NE-R1(NER 按需检索自适应) - 2609.02396 — BioNER+RAG(放射学大众化摘要评估) - 2609.01925 — LAMAR(多语言对齐重排器,存疑需核实) - 2609.00591 — SimLoss(⚠️ 主分类 rag 疑似误标,建议降邻接)
RAG-adjacent(1 件): - 2609.01657 — NeoMME(单塔多模态编码器,图文混合文档 RAG 候选)
R79 确认沿用(3 件,已锚入 rag.md): - 2608.31139 — BioMedRAG(语义切分跨数据集实证) - 2609.01601 — ACToR(token 级 RAG 粒度) - 2609.01343 — SMELT(⚠️ 主分类 rag 存疑待复核)
6. 增量条数汇总
| 类别 | 条数 | 编号 |
|---|---|---|
| RAG net-new(paper_card 主分类 rag,Sep 3 新入库) | 5 | ① ViSAR ② NE-R1 ③ BioNER+RAG ④ LAMAR ⑤ SimLoss(⚠️存疑) |
| RAG-adjacent(Tom 9-04 radar) | 1 | ⑥ NeoMME |
| 工程邻接(Jay 9-04 CSDN) | 2 | A 向量数据库选型树 B Faiss vs Qdrant |
| 协调信号(Stephen 9-03 coord-check) | 1 | RAG +8→+10 扩展 |
| 合计净增量 | 5 | ⑤ SimLoss 存疑待降邻接 |
arXiv 号数量:6 件新增(5 主分类 rag + 1 RAG-adjacent)+ 3 件 R79 沿用 = 9 件本次报告涉及
7. 检查过的来源清单
- ✅ Tom 9-04 0840 agent-rag-longcontext-radar.md(3 条高价值:WHALE/NeoMME/SLM-as-Judges)
- ✅ Tom 9-03 2040 agent-rag-longcontext-radar.md(R79 锚入覆盖)
- ✅ Jay 9-04 0820 CSDN RAG/Agent/VectorDB/LLMOps 扫描报告
- ✅ Stephen 9-03 2245 coord-check.md(RAG +8→+10 扩展信号)
- ✅ paper_cards Sep 3 入库:1204 ViSAR、1205 NE-R1、1203 BioNER+RAG、1198 SimLoss、1178 LAMAR
- ✅ paper_cards Sep 4:NeoMME 1206(rag-adjacent)
- ✅ rag.md R79(基线确认)
- ✅ work-queue.md(2026-09-04 08:00)
无新增量来源(已确认无 rag 增量):flyp Sep 3 inbox(coding-agents 为主)、spark Sep 3 inbox(llm-infra 为主)、Jay Sep 3 evening briefing(database 主轴)
8. 建议 R80 活文档写入方向
- ViSAR 写入 §2.3 + §2.6:视觉文档自适应 k 检索,无训练方法,与 ExtractBench+BioMedRAG 形成三层基准
- NE-R1 写入 §2.3 + §2.14:NER 按需检索,与 ACToR 形成"按需-按token"双自适应脉络
- BioNER+RAG 写入 §2.5 + §2.9:放射学大众化摘要评估,补充健康垂域 RAG 评测层
- LAMAR 写入 §2.5 + §2.8(待核实 paper_card 1178 完整度):多语言对齐重排
- NeoMME 写入 §2.7 + §2.3:单塔多模态编码器,图文混合文档 RAG 新架构候选
- SimLoss 降为 llm-infra 邻接(⚠️ 主分类 rag 误标)
- 工程邻接 A/B 写入 §2.1:向量数据库选型决策树补充
Tom · 2026-09-04 08:50 CST · E1 预消化 · rag · R80 窗口覆盖完成 · 5 件 RAG net-new(1 件存疑)+ 1 件 RAG-adjacent + 2 件工程邻接 · 无框架级论文,垂域方法论有工程落地价值