rag · E1 预消化简报(2026-08-07)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(2026-08-05 下午 ~ 2026-08-07 早间)+ paper_cards 近 3 天新卡 RAG 主分类抽查 本简报目的: 为今晚 RAG 活文档接力(R54 → R55)预习备料,聚焦尚未进入 R54 基线的增量条目 背景说明: R54 于 2026-08-06 早间收官(LegalPincite + RestoreKV + ARCHead + PAST-Bench + Embedding/Rerank 选型表 + UEmbed/FromCloudToCrowd/TEngineDB-V 候选升级)。本期 ArXiv RAG 供给偏弱——新增 2 条 RAG 主分类 paper_cards(LegalPincite 确认升级 + Teaching Nemotron Greek 新增),另有关键工程数据更新(RAG 框架生态重排 + 向量数据库基准 + 评测三层架构 + VelesDB 本地记忆基础设施)。
检查过的来源清单
| 来源 | 文件 | 主要 RAG 增量 |
|---|---|---|
| Tom/inbox/tom | 2026-08-07T0840-agent-rag-longcontext-radar.md | 今日早间 radar;高价值 3 条(Self-Evolving Coding Agents / FinanceHarness / Teaching Nemotron Greek);Teaching Nemotron Greek paper_cards 767 已建(主分类 rag ✅) |
| Tom/inbox/tom | 2026-08-06T2040-agent-rag-longcontext-radar.md | 晚间 radar v2;GDPevo + FocusMem + ABSeeker;均为 agent 主分类 |
| Tom/inbox/tom | 2026-08-06-agent-rag-longcontext-radar.md | 早间 radar;LegalPincite + RestoreKV + ARCHead 为候选 |
| Tom/inbox/tom | 2026-08-06-rag-e1prep.md | 昨日简报,6 条增量;RestoreKV / ARCHead 主分类标注有误(实为 llm-infra) |
| Tom/inbox/tom | 2026-08-05-rag-e1prep.md | 前日简报,3 条增量(UEmbed / FromCloudToCrowd / TEngineDB-V) |
| Jay/inbox/jay | 2026-08-06-ai-engineering-rag-frameworks-hf.md | RAG 框架生态 star 排行(2026-08-06 更新);Dify 151k / LEANN 12.7k 新星;HF Blog LettucePrevent(RAG 幻觉实时防护) |
| Jay/inbox/jay | 2026-08-06-evening-brief.md | 向量数据库基准 2026(pgvectorscale 11x QPS vs Qdrant);推理引擎 SGLang vs vLLM;RAG 评测三层架构 |
| Jay/inbox/jay | 2026-08-06T0952-jay-github-hf-vecdb-agent-memory.md | VelesDB(~78 stars,Rust 融合引擎:向量+图+列式);markdown-vdb;Neuron(Hebbian 记忆 MCP) |
| Jay/inbox/jay | 2026-08-07-csdn-llm-agent-rag-research.md | 2026-08-07 新文件;多模态 Agentic RAG(Spotify/YouTube/Amazon Music);A-RAG / VimRAG / SoK Agentic RAG;Context Engineering 五组件 |
| flyp/inbox/flyp | 2026-08-06-long-context-128k-to-4m.md | 从 128K 到 4M 长上下文训练配方(ACL 2026 Findings);KV cache 规模扩大,对 RAG 长上下文架构有邻接价值 |
| paper_cards/760-2608-03756.md | LegalPincite | 主分类 rag ✅ 确认(Aug 7 04:00 更新);昨日候选升级 |
| paper_cards/767-2608-05138.md | Teaching Nemotron Greek | 主分类 rag ✅ 新卡(Aug 7 04:00);arXiv 2608.05138 |
| paper_cards/764-2608-02703.md | ARCHead | 主分类 llm-infra ❌(昨日 e1prep 误标为 rag) |
| paper_cards/765-2608-01247.md | RestoreKV | 主分类 llm-infra ❌(昨日 e1prep 误标为 rag) |
| work-queue.md | 2026-08-07 08:00 | 高价值待深度解读 Top 15 无 RAG;选题榜 1 件(2608.03994) |
增量条目(5 条,含 2 条新 arXiv 论文 + 3 条工程数据更新)
增量 1 · ⭐⭐⭐⭐ 高 · Teaching Nemotron Greek:BM25 在低资源语言 RAG 中优于稠密检索(arXiv 2608.05138)
来源: Tom/inbox/tom/2026-08-07T0840-agent-rag-longcontext-radar.md;paper_cards/767-2608-05138 ✅ 已建(Aug 7 04:00) arXiv: 2608.05138(2026-08-05 v1 提交) 主分类: rag;形态: benchmark;副分类: evaluation TLDR(来源:paper_cards): 现代希腊语缺席于 NVIDIA Nemotron 检索模型和主流多语言基准,但对法律/能源/金融/医疗 RAG 至关重要。论文对 Nemotron 检索栈做端到端现代希腊语适配(语料挖掘→合成监督→检索训练→重排→阅读器微调),并推出 HERA 基准。核心发现:无参数 BM25 基线在专业领域数据上优于多种现成多语言稠密检索模型。
要点(来源:paper_cards TLDR): - 端到端检索栈适配:语料挖掘 + 合成监督 + 检索模型微调 + reranker 适配 + reader 微调 + HERA 基准——完整的多语言 RAG 适配方法论 - 关键发现:BM25(无需训练)在专业希腊语语料上打败多种现成多语言稠密检索模型——与 BM25 Wins at Scale(R52 已收录)形成跨语言一致性验证 - HERA 基准:面向现代希腊语专业域的 RAG 评测基准,覆盖法律/能源/金融/医疗四领域 - 对低资源语言 RAG 的方法论价值:完整展示如何从零构建一个非英语语言的 RAG 系统;语料挖掘→合成监督→评测闭环可作为其他低资源语言 RAG 的参考模板
与活文档 knowledge/rag.md R54 现有脉络的关系: R52 §2.5(评测)收录 BM25 Wins at Scale(USTC + Metastone + BAAS,2607.26497)。Teaching Nemotron Greek 在不同语种(非英语)复现了 BM25 > 稠密检索的结论,形成跨语言一致性证据链——对 R52 BM25 Wins at Scale 是强化的跨语言佐证而非矛盾。可进入 §2.5(新增:低资源语言 RAG 完整适配方法论 + HERA 基准 + 跨语言 BM25 > 稠密检索证据链)。
归入节: §2.5 评测(新增:低资源语言 RAG 完整适配方法论;BM25 > 稠密检索跨语言一致性证据)
arXiv: 2608.05138
增量 2 · ⭐⭐⭐⭐ 高 · LegalPincite:段落级法律引用 RAG 数据集——填补粒度缺失(arXiv 2608.03756)
来源: Tom/inbox/tom/2026-08-06-rag-e1prep.md(候选升级);paper_cards/760-2608-03756 ✅ 已建(Aug 7 04:00 确认主分类 rag) arXiv: 2608.03756(2026-08-04 v1 提交) 主分类: rag;形态: method TLDR(来源:paper_cards): 现有法律 IR 数据集粒度缺失(文档级为主),无法评估段落级引用准确性;且存在数据泄露(训练/测试知识重叠)。LegalPincite 构建段落级(passage-level)法律引用 benchmark,填补法律 RAG 评测的粒度空白。
要点(来源:paper_cards TLDR): - 核心问题:现有法律引用数据集仅文档级粒度,无段落级评测能力;含段落标注的公开数据集存在数据泄露和语料覆盖不完整问题 - 构建目标:段落级法律引用 benchmark,逼真模拟法律 RAG 场景 - 评测价值:与 COLIEE(加拿大法律推理)、RegBench(法规理解)形成法律 RAG 评测矩阵;LegalPincite 聚焦段落引用粒度,是法律 RAG 评测体系的重要补充
与活文档 knowledge/rag.md R54 现有脉络的关系: R54 无专门法律 RAG 评测条目;LegalPincite 作为法律垂直域 RAG 评测数据集,补充 §2.5(垂直领域 RAG 评测分支)。与 Teaching Nemotron Greek(低资源语言 RAG benchmark)共同构成"领域 RAG 评测"双璧——法律 + 多语言两个维度。
归入节: §2.5 评测(法律垂直域 RAG 段落级引用 benchmark — LegalPincite + COLIEE + RegBench 三件套)
arXiv: 2608.03756
增量 3 · ⭐⭐⭐⭐ 高 · RAG 框架生态 2026 重排:Dify 151k / LEANN MLsys2026 新星 / TGI 退场(来源:jay 2026-08-06)
来源: Jay/inbox/jay/2026-08-06-ai-engineering-rag-frameworks-hf.md;Tom/inbox/tom/2026-08-06-evening-brief.md
要点(直接引用自 jay 文件):
RAG 框架生态 star 排行(2026-08-06): | 排名 | 项目 | Stars | 定位 | |------|------|-------|------| | 1 | Dify | ~151k | 低代码可视化 + MCP 集成,云/私有部署 | | 2 | LangChain | ~125k | 生态最广,LangGraph 覆盖多步 Agent | | 3 | RAGFlow | ~70k | 深度文档理解(表格/扫描件),企业文档 QA | | 4 | Pathway | ~50k | 实时数据 RAG,支持 Kafka/PostgreSQL/S3 同步 | | 5 | LlamaIndex | ~46.5k | 数据路由 + 子问题拆解 | | 6 | Flowise | ~39k | 低代码 LangChain UI | | 7 | LightRAG | ~27k | Graph RAG,跨文档全局推理 | | 8 | Haystack | ~24k | 企业级生产管道,内置 eval 机制 | | 9 | txtai | ~12.8k | 嵌入式向量 DB 全家桶,离线/本地优先 | | 10 | Cognita | ~8k | RAG + MLOps 模板 | | 🔥 | LEANN | ~12.7k | MLsys2026 新星:设备端 RAG,97% 存储节省 |
HF Blog 高价值条目(LettucePrevent — RAG 幻觉实时防护): - RAG 幻觉实时防护,实用工程方向 - Bekko Embedding:小型多语言 embedding 模型
关键工程信号(直接引用自 jay 文件):
TGI 正式进入维护模式:HuggingFace 官方确认 TGI 只接受 minor bug fix PR,建议新部署迁移至 vLLM 或 SGLang。
与活文档 knowledge/rag.md R54 现有脉络的关系: R54 §4(工程化 RAG)收录 Scheduler-Theoretic 五模式和 FROAV pipeline,但未包含 2026 年框架生态最新 star 数据和 LEANN 新星。RAG 框架 star 排行更新 + TGI 退场属于工程化 RAG 基础设施数据更新,可进入 §4(新增:2026 RAG 框架生态 star 排行 + LEANN 设备端 RAG 新星 + TGI 退场说明)。
归入节: §4 工程化 RAG(框架生态数据更新:star 排行 + LEANN 新星 + TGI 退场)
arXiv: 无(工程数据)
增量 4 · ⭐⭐⭐⭐ 高 · 向量数据库基准 2026:pgvectorscale 11x QPS vs Qdrant / RAG 评测三层架构(来源:jay 2026-08-06)
来源: Jay/inbox/jay/2026-08-06-evening-brief.md
要点(直接引用自 jay 文件):
pgvectorscale 性能突破(50M 向量 / 99% recall,AWS r6id.4xlarge): | 指标 | pgvector+pgvectorscale | Qdrant | 差距 | |---|---|---|---| | QPS | 471.57 | 41.47 | PostgreSQL 11.4x 更高 | | P95 延迟 | 60.42 ms | 36.73 ms | Qdrant P95 快 39% | | P99 延迟 | 74.60 ms | 38.71 ms | Qdrant P99 快 48% |
VectorDBBench 局限性: - VectorDBBench(Zilliz/Milvus 出品):偏向超大规模集群,惩罚单节点系统 - vector-db-benchmark(Redis/Qdrant 出品):偏向内存密集架构 - ANN-Benchmarks(学术):使用过时低维数据集(SIFT/GIST),不代表实际生产
2026 RAG 评测三层架构(benchmarkingagents.com): - BEIR:18 数据集 / 9 种检索任务 → NDCG@10(检索质量) - MTEB:Embedding 质量评测 - RAGAS 或自定义 Golden 数据集:端到端行为 - MultiHopRAG / HotPotQA:多跳推理场景
与活文档 knowledge/rag.md R54 现有脉络的关系: R53 §2.6(运行时与基础设施)收录向量数据库选型但不含 2026 年 pgvectorscale 新数据和基准局限性警告。pgvectorscale 11x QPS 数字对 RAG 生产部署选型有直接工程价值;VectorDBBench 局限性警示有助于避免错误依赖单一基准;RAG 评测三层架构(BEIR + MTEB + RAGAS)可进入 §2.5(评测)作为评测方法论补充。
归入节: §2.6 运行时与基础设施(向量数据库基准数据更新:pgvectorscale 11x QPS + 基准局限性警告);§2.5 评测(三层评测架构:BEIR + MTEB + RAGAS)
arXiv: 无(工程基准数据)
增量 5 · ⭐⭐⭐ 中 · VelesDB:Rust 融合向量+图+列式引擎——本地优先 AI Agent 记忆(来源:jay 2026-08-06)
来源: Jay/inbox/jay/2026-08-06T0952-jay-github-hf-vecdb-agent-memory.md;Jay/inbox/jay/2026-08-06-vecdb-velesdb-deepdive.md
要点(直接引用自 jay 文件):
VelesDB(~78 stars,Rust,v1.12.0)将三大存储引擎融合进单一嵌入式二进制(~9 MB): - 向量引擎:SIMD 加速 HNSW(768D 向量 47μs 检索),支持量化 - 图引擎:属性图,BFS/DFS 遍历,边标签,Cypher 风格 MATCH 查询 - 列式引擎:结构化数据存储,支持时序洞察
关键创新:VelesSQL 统一查询语言(向量 NEAR + 图 MATCH 混合);why() 可解释性召回(返回证据路径);零 API key / 零云依赖;LlamaIndex 集成
与 Mem0/Zep 对比:传统方案需独立 vector + graph + SQL 三套系统;VelesDB 单引擎统一,LlamaIndex 原生集成
与活文档 knowledge/rag.md R54 现有脉络的关系: R54 §2.6(运行时与基础设施)收录向量数据库选型但不含 VelesDB。VelesDB 作为融合型本地记忆基础设施,对 RAG 系统有双重价值:(1) 向量检索引擎(reranking 基础设施);(2) 可解释召回(why() 证据路径解决 RAG 幻觉溯源问题)。可进入 §2.6(新增:VelesDB 融合向量+图+列式引擎 — 本地优先 RAG/记忆基础设施)。
归入节: §2.6 运行时与基础设施(新增:VelesDB 融合引擎 — why() 可解释召回 + 本地优先 RAG 基础设施)
arXiv: 无(GitHub 项目)
待修正:昨日 e1prep 对 RestoreKV / ARCHead 主分类的误标
来源: 2026-08-06-rag-e1prep.md 增量 2-3
昨日简报将 RestoreKV(2608.01247)和 ARCHead(2608.02703)标注为"主分类 rag",但 paper_cards 实际主分类为 llm-infra。两篇论文与 RAG 有技术关联(RestoreKV 的 KV cache 恢复机制对 RAG 长上下文有价值;ARCHead 的 LM Head 压缩降低 RAG 推理成本),但主分类为 llm-infra,不应计入 RAG 主分类增量。建议在活文档中:
- RestoreKV:以邻接技术条目标注,不作为 RAG 方法论条目计入
- ARCHead:以邻接基础设施条目标注,不作为 RAG 主分类条目计入
建议在活文档中为 RestoreKV 和 ARCHead 开设"邻接技术"子节,既保留其工程价值,又明确其非 RAG 主分类的身份。
值得警惕的矛盾或待核实说法
- Teaching Nemotron Greek(2608.05138)BM25 结论的泛化性:paper_cards TLDR 表明 BM25 在专业希腊语数据上优于多种多语言稠密检索模型,但该结论是否可泛化到其他低资源语言(如阿拉伯语、越南语)需要原文确认;建议 R55 以"低资源语言 RAG 方法论参考"而非"BM25 普适胜利"标注
- pgvectorscale 11x QPS 数据的测试边界:471.57 vs 41.47 QPS 差距极大,但测试条件(50M 向量/99% recall)在实际 RAG 生产中的常见规模待确认;VectorDBBench 三大基准偏倚警告本身可信,但 Jay 文件未标注原始测试来源细节
- VelesDB 78 stars 的新鲜度:GitHub stars 仅 78(v1.12.0 已发布),属于早期项目;LlamaIndex 集成成熟度未经验证;生产可用性需进一步跟进
- LEANN(MLsys2026)论文尚未 paper_cards 建卡:LEANN 以"MLsys2026 新星"出现在 jay RAG 框架生态中,但 paper_cards 未收录;建议追踪 paper_cards 建卡后确认其学术支撑
- RestoreKV / ARCHead 主分类纠偏:昨日 e1prep 误将 llm-infra 主分类论文标为 rag;需在活文档中做邻接/基础设施标注而非主分类条目
可引用 arXiv 号列表
| arXiv | 论文 | 主分类 | 状态 | 建议归入节 |
|---|---|---|---|---|
| 2608.05138 | Teaching Nemotron Greek(BM25 > 多语言稠密检索;HERA benchmark;低资源语言 RAG 完整适配方法论) | rag ✅ | 本期新增 ✅ | §2.5 评测(跨语言 BM25 证据链 + HERA 基准) |
| 2608.03756 | LegalPincite(段落级法律引用 benchmark;填补粒度缺失) | rag ✅ | 候选升级确认 ✅ | §2.5 评测(法律 RAG 段落级引用数据集) |
| 2608.01247 | RestoreKV(KV cache 恢复式压缩;llm-infra 主分类,RAG 长上下文邻接) | llm-infra ⚠️ | 邻接条目(非 RAG 主分类) | §2.6 邻接(长上下文 RAG 基础设施) |
| 2608.02703 | ARCHead(LM Head 量化压缩 3.7–3.9×;llm-infra 主分类) | llm-infra ⚠️ | 邻接条目(非 RAG 主分类) | §2.6 邻接(RAG 推理部署优化) |
| 2608.02583 | UEmbed(Decoder-only 稀疏+密集统一 embedding) | rag ✅ | R54 已收录 | §2.3 检索单元优化 |
| 2608.00922 | From Cloud to Crowd(去中心化边缘 RAG 民主化) | rag ✅ | R54 已收录 | §4 工程化 RAG |
| 2608.00650 | TEngineDB-V(OLAP 原生大 k 向量搜索,145×) | rag ✅ | R54 已收录 | §2.3 基础设施 |
| 2607.26497 | BM25 Wins at Scale(USTC + Metastone + BAAS) | rag ✅ | R52 已收录 | §2.5 评测 |
| 2607.29402 | HyPE(假设提示嵌入) | rag ✅ | R53 已收录 | §2.5 评测 |
| 2607.29459 | CrossRAG(IoT 多变量时序预测) | rag ✅ | R53 已收录 | §2.5 评测 |
| 2608.04003 | PAST-Bench(Agent 记忆递归改进 benchmark;agent 主分类) | agent ⚠️ | R54 已收录(邻接) | §2.5 邻接 |
| 2607.23693 | Compute Globally, Materialize Locally(KV cache 语义漂移;agent 主分类) | agent ⚠️ | R54 已收录(邻接警示) | §2.6 邻接警示 |
总计: 2 条 RAG 主分类 arXiv 新增(2608.05138 + 2608.03756 升级确认)+ 2 条 llm-infra 邻接条目(RestoreKV / ARCHead 需重新标注)
R55 预消化关键议题
R54 → R55 面临的核心问题是:RAG ArXiv 供给进入相对低谷期(本期仅 2 条新 RAG 主分类 paper_cards),但工程数据更新丰富。
- Teaching Nemotron Greek → R55 下一步:完整适配方法论(语料挖掘→合成监督→检索训练→HERA benchmark)值得作为"低资源语言 RAG 建模模板"深入学习;与 BM25 Wins at Scale 的跨语言一致性证据链是 R55 §2.5 的重要补充
- LegalPincite → R55 下一步:法律 RAG 段落级评测数据集,与 COLIEE / RegBench 共同构成法律 RAG 评测矩阵;建议 R55 开设"法律 RAG 评测"子节
- RestoreKV / ARCHead 主分类纠偏 → R55:在活文档中将 RestoreKV 调整为"邻接:长上下文 RAG 基础设施",ARCHead 调整为"邻接:RAG 推理部署优化",明确其 llm-infra 主分类身份
- LEANN paper_cards 建卡跟进:MLsys2026 设备端 RAG 新星,paper_cards 尚未收录;建议 R55 追踪
- VelesDB 生产可用性跟进:78 stars 早期项目,但"why() 可解释召回"对 RAG 幻觉溯源有独特价值;建议以邻接基础设施条目标注,不急于纳入 RAG 主分类
无显著新增量时说明
本期 RAG ArXiv 供给偏弱:较 R54 收官时(LegalPincite + RestoreKV + ARCHead + PAST-Bench + Embedding/Rerank 选型表),本期 ArXiv 层面仅新增 1 条 RAG 主分类 paper_cards(Teaching Nemotron Greek,2608.05138);LegalPincite(2608.03756)由候选升级确认,但本质上不是新发现。RestoreKV 和 ARCHead 的 llm-infra 主分类纠偏反而导致 R54 的 2 条候选需降级为邻接条目。
工程数据是本期主要增量:RAG 框架生态 star 重排、向量数据库基准更新、评测三层架构、VelesDB 本地记忆基础设施——这些工程数据更新在 ArXiv 论文层面之外提供了丰富的 RAG 工程化认知刷新,是本期简报的主要内容来源。
RAG 主题 ArXiv 整体态势:R53 → R54 → R55,ArXiv 新鲜供给从温和复苏(3 条)→ 中等(6 条含候选升级)→ 本期偏弱(2 条);但工程化和评测数据持续积累,为 R55 的"工程化深化"提供了弹药。
检查过的来源清单(汇总)
| 来源 | 主要 RAG 增量 |
|---|---|
| Tom/inbox/tom/2026-08-07T0840-agent-rag-longcontext-radar.md | Teaching Nemotron Greek(新增 RAG 主分类 paper_cards 767) |
| Tom/inbox/tom/2026-08-06-rag-e1prep.md | LegalPincite(候选升级确认);RestoreKV/ARCHead 主分类纠偏 |
| Jay/inbox/jay/2026-08-06-ai-engineering-rag-frameworks-hf.md | RAG 框架生态 star 排行;LEANN MLsys2026 新星;TGI 退场;LettucePrevent RAG 幻觉防护 |
| Jay/inbox/jay/2026-08-06-evening-brief.md | pgvectorscale 11x QPS;向量数据库基准局限性;RAG 评测三层架构 |
| Jay/inbox/jay/2026-08-06T0952-jay-github-hf-vecdb-agent-memory.md | VelesDB 融合引擎;markdown-vdb;Neuron Hebbian 记忆 |
| Jay/inbox/jay/2026-08-07-csdn-llm-agent-rag-research.md | 多模态 Agentic RAG;A-RAG / VimRAG / SoK Agentic RAG;Context Engineering 五组件 |
| flyp/inbox/flyp/2026-08-06-long-context-128k-to-4m.md | 长上下文 128K→4M 训练配方(KV cache 规模扩大,RAG 邻接) |
| paper_cards/760-2608-03756.md | LegalPincite 主分类 rag 确认 |
| paper_cards/767-2608-05138.md | Teaching Nemotron Greek 主分类 rag ✅ |
| paper_cards/764-2608-02703.md | ARCHead 主分类 llm-infra(纠偏) |
| paper_cards/765-2608-01247.md | RestoreKV 主分类 llm-infra(纠偏) |
Tom · E1 预消化轮 · 2026-08-07 08:50 CST · 2 条 RAG 主分类增量(含 1 条新 arXiv + 1 条候选升级确认)+ 3 条工程数据更新 + 2 条主分类纠偏 · 涉及 arXiv:2608.05138(新增)/ 2608.03756(确认升级)/ 2608.01247(邻接纠偏)/ 2608.02703(邻接纠偏)