Jay · 研究知识库 · 五分类简报 · 2026-08-14 15:05

主题: KDD 2026 RAG 新范式 · Agentic Retrieval · Hugging Face Trending Aug Week2 · GLM-5.3 / DeepSeek V4 Pro · Cloud-Native eBPF 安全监控 时间: 2026-08-14 15:05 CST(下午场) 实例: Jay 分类标签: rag kdd2026 agentic-retrieval huggingface glm deepseek cloud-native ebpf arxiv graphrag


主题与检索范围

  • KDD 2026(2026-08-09~13,Jeju Island):RAG 新范式专场——GraphRAG、Multi-Agent RAG、多模态知识图谱 RAG
  • arXiv(2026-08 新提交):Agentic Retrieval 超越 Top-K、ForeSci AI-for-Science Agent 评测、Governed Memory OS、Agent 混沌工程
  • Hugging Face Trending(2026-08-12/13):ComBodied Agents、Co-Evolution Agent、NCP-Bench 长叙事 Agent、ByteDance Bernini 视频生成
  • AI HOT 精选(过去 24 小时):GLM-5.3 编程开源第一、DeepSeek V4 Pro 1M 上下文
  • Cloud-Native 安全:FedMon 联邦 eBPF 监控、eBPF-PATROL 运行时威胁检测

一、DATABASE · KDD 2026 RAG 新范式

1.1 ⭐⭐⭐⭐ Mixture-of-RAG:融合文本与表格的混合检索(KDD 2026)

  • 链接:https://arxiv.org/pdf/2504.09554
  • 来源:KDD '26 · August 9–13 · Jeju Island · ACM ISBN 979-8-4007-2258-5/2026/08
  • 核心内容
  • 提出 MoRAG(Mixture-of-RAG) 框架,将非结构化文本与结构化表格统一建模为混合检索 corpus
  • 解决传统 RAG 在需要数值推理(表格问答)场景下的根本缺陷:表格的行列语义在 flat chunk 切分后完全丢失
  • 关键步骤:(1) 表格结构识别;(2) 逻辑推理链显式公式化;(3) LLM 基于提取信息做数值计算
  • 超越纯文本 RAG 12~15%(具体数据集未列出)
  • 工程价值:⭐⭐⭐⭐ — 工业级 RAG 系统在金融、医疗、BI 场景下普遍需要同时检索文本+表格,MoRAG 提供了可直接参考的 pipeline 范式
  • 可信度:高(KDD 2026 正式论文)
  • 核验建议:需阅读原文对照数据集和评估指标;检查是否有开源实现

1.2 ⭐⭐⭐⭐ MKG-RAG-Bench:多模态知识图谱 RAG 评测基准(KDD 2026,arXiv:2606.26458)

  • 链接:https://arxiv.org/pdf/2606.26458
  • 来源:KDD '26 · August 9–13 · Jeju Island · Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma
  • 核心内容
  • 提出 MKG-RAG-Bench,首个针对多模态知识图谱增强 RAG(MKG-RAG)的系统性评测基准
  • 构建了 MarKG/MedMKG 等多模态 KG 数据集,涵盖图像+文本+知识三元组
  • 评测多模态 LLM 在知识图谱辅助下的生成质量,揭示当前模型在结构化知识理解上的差距
  • 核心挑战: Multimodal KG 的节点类型多样(图像/文本/实体),跨模态检索和对齐是未解决的难题
  • 工程价值:⭐⭐⭐⭐ — 为多模态 RAG 系统的评测提供了标准化框架;对构建医疗/电商/文博领域多模态知识库有直接指导意义
  • 可信度:高(KDD 2026 + Penn State / 工业界合作)
  • 核验建议:关注数据集构建方法论;检查是否有公开 leaderboard

1.3 ⭐⭐⭐⭐ MemGraphRAG:记忆驱动的多智能体 Graph RAG(KDD 2026,arXiv:2606.00610)

  • 链接:https://arxiv.org/html/2606.00610v1
  • 来源:KDD '26 · August 9–13 · Jeju Island · ACM ISBN 979-8-4007-2259-2/2026/08 · DOI: 10.1145/3770855.3818074
  • 核心内容
  • 提出 MemGraphRAG,融合长期记忆机制与多智能体协同的 Graph RAG 系统
  • 解决 Graph RAG 在大规模语料中"上下文稀疏+噪声积累"的核心痛点
  • 架构:多智能体分工(检索/推理/生成),各 Agent 维护私有记忆,通过图结构共享全局知识
  • 超越现有 GraphRAG、HippoRAG2 等基线方法(具体数据需阅读原文)
  • 工程价值:⭐⭐⭐⭐ — 多智能体 + 记忆 + 图谱的组合是 2026 年 RAG 的主流演进方向,KDD 2026 集中体现了这一趋势
  • 可信度:高(KDD 2026 正式论文 + DOI)
  • 核验建议:重点关注多 Agent 协调机制的具体实现;检查 GitHub 是否有代码

1.4 ⭐⭐⭐ LegalGraphRAG:多智能体图检索增强法律推理(arXiv:2605.28120,ACL 2026)

  • 链接:https://arxiv.org/abs/2605.28120
  • 来源:ACL 2026 Main Conference · 30 pages, 18 figures
  • 核心内容
  • 针对法律领域的 Multi-Agent Graph RAG 框架,解决法律推理的可信度问题
  • 多 Agent 分工:检索 Agent、推理 Agent、验证 Agent,Graph 结构表示法律条款间的逻辑关系
  • ACL 2026 会议论文,可信度高
  • 工程价值:⭐⭐⭐ — 法律 RAG 是高价值垂直场景;GraphRAG 在需要关系推理的领域(法律/合规/政策)有强需求
  • 核验建议:关注图谱构建的法律条款解析方法;ACL 2026 出版后可交叉验证

1.5 ⭐⭐⭐ OMD-GraphRAG:本体引导 + 多维聚类 + 双通道融合(arXiv:2603.25152)

  • 链接:https://arxiv.org/abs/2603.25152
  • 核心内容
  • 在 GraphRAG 基础上引入 Ontology 引导的实体抽取,提升图谱质量
  • Multi-Dimensional Clustering 对节点进行多视角聚类
  • Dual-Channel Fusion:结构化通道 + 非结构化通道并行融合
  • 工程价值:⭐⭐⭐ — 本体(Ontology)引导是提升知识图谱质量的可解释方法;与 MemGraphRAG 路线互补
  • 核验建议:v3 版本的状态;是否参与过 ACL/EMNLP 等顶会

二、BACKEND · Agentic Retrieval 与 LLM Agent 系统

2.1 ⭐⭐⭐⭐ Beyond Top-K:用可解释 Agent 操作替代黑盒向量检索(arXiv:2608.06305)

  • 链接:https://arxiv.org/html/2608.06305v2
  • 核心内容
  • 核心论点:向量检索(Top-K)的核心局限是 chunk 边界破坏语义——财务表格、跨页表格、代码块的语义完整性被固定切分摧毁
  • 提出将检索 API 替换为可解释的 Agent 操作(grep、scan、join 等 terminal primitives)
  • 实验发现:inline grep 在所有测试的 harness-model 组合上都优于向量检索
  • 框架:用 LLM 作为检索策略优化器,动态选择检索路径而非固定 Top-K
  • 引用 Sen et al. (2026a):inline grep 普遍优于向量检索;Li et al. (2026) 形式化了直接语料交互框架
  • 工程价值:⭐⭐⭐⭐⭐ — 这是对 RAG 范式本身的根本性挑战;生产系统中用 Agentic Retrieval 替代 naive vector search 是 2026 年下半年值得关注的方向
  • 可信度:高(arXiv,有具体实验数据)
  • 核验建议:重点阅读实验设置和数据集;对比 Naive RAG 基线;考虑在自己的 corpus 上做对比实验

2.2 ⭐⭐⭐⭐ ForeSci:面向 AI-for-Science Agent 的前瞻性评测基准(arXiv:2606.00644)

  • 链接:https://arxiv.org/html/2606.00644v2
  • 核心内容
  • 提出 ForeSci Benchmark,评测 LLM Agent 在"科研前瞻"任务上的能力——预测瓶颈方向、规划研究路线、判断顶会接受度
  • 预测时间窗口:2026-05-16 至 2026-08-15(与当前时间高度重叠,天然适合验证)
  • 释放了包含 12,124 条 LLM-agent 行和 12 个公开问题的 prospective package
  • 揭示:当前 LLM Agent 在"前瞻判断"上显著弱于"执行任务",与 AI Scientist 系列(Yamada et al. 2025)形成对比
  • 工程价值:⭐⭐⭐⭐ — 对 AI-for-Science 研究团队有直接参考价值;对"AI 研究员"类产品的能力边界评估有指导意义
  • 可信度:高(系统性 benchmark 设计,有开源 package)
  • 核验建议:下载 ForeSci package 验证 2026-05-16 至 2026-08-15 的预测准确率

2.3 ⭐⭐⭐ The Governed Memory Operating System:SLM 4.0 的记忆治理框架(arXiv:2608.08253)

  • 链接:https://arxiv.org/html/2608.08253v1
  • 核心内容
  • 提出 SLM 4.0 Memory OS,一个完整的 AI Agent 记忆治理操作系统
  • 核心理念:Agent 记忆配置本身应该被治理(Governed)——支持 skill 突变、能力演化、多租户隔离、合规控制
  • Stage → Confirm → Mutate → Blind-Verify → Persist 的五阶段 skill 演化 pipeline
  • 与 HyperMem(ACL 2026,长程对话记忆)形成互补:HyperMem 关注记忆内容,SLM 4.0 关注记忆治理
  • 工程价值:⭐⭐⭐ — 架构设计层面的论文;对构建企业级 AI Agent 平台(多租户、合规)有参考价值
  • 可信度:中(arXiv,2026-08 新提交,需出版验证)

2.4 ⭐⭐⭐ Resume Means Resume:Checkpoint/Interrupt/Resume 语义的形式化验证(arXiv:2608.03836)

  • 链接:https://arxiv.org/html/2608.03836v2
  • 核心内容
  • 对 LangGraph、CrewAI、LlamaIndex Workflows、AutoGen 的 Checkpoint/Interrupt/Resume 语义做机器可验证的合规测试
  • 发现:所有测试框架在 CheckpointConfig 处理上存在行为分歧(divergence at every release)
  • Pilot 环境:Python 3.12.3, Ubuntu 24.04; LangGraph 1.2.9; CrewAI 1.15.2; pydantic-graph 1.107.1
  • 长期深度覆盖 5 个 LangGraph releases + 6 个 CrewAI releases + 4 个 LlamaIndex releases
  • 工程价值:⭐⭐⭐ — 对生产环境中使用这些框架做 Agent 工作流的公司有直接影响;是"框架选型 + 风险评估"的重要参考
  • 可信度:高(形式化验证方法,测试严格)
  • 核验建议:关注具体分歧的 severity;是否影响生产工作流

2.5 ⭐⭐ AgentChaos:面向 Agent 系统的混沌工程(arXiv:2608.06790)

  • 链接:https://arxiv.org/pdf/2608.06790
  • 核心内容
  • 将混沌工程(Chaos Engineering)的思想引入 LLM Agent 系统
  • 对 Agent 系统注入故障(工具失效、网络延迟、内存压力),评估系统的鲁棒性
  • 引用 Google ADK (2026)、OpenAI Agent (2025)、TaintP2X 提示注入检测(2026)
  • 工程价值:⭐⭐ — 方向新颖,但混沌工程在 LLM Agent 领域的落地尚早
  • 核验建议:关注故障注入的具体方法论;是否与现有测试框架集成

三、CLOUD-NATIVE · eBPF 云原生安全监控

3.1 ⭐⭐⭐ FedMon:联邦 eBPF 监控 + 多集群云原生异常检测(arXiv:2510.10126)

  • 链接:https://arxiv.org/html/2510.10126v1
  • 来源:arXiv · Federated eBPF Monitoring for Distributed Anomaly Detection in Multi-Cluster Cloud Environments
  • 核心内容
  • FedMon = Federated Learning + eBPF 监控:在多 Kubernetes 集群环境中,用联邦学习协作检测跨集群安全异常
  • eBPF 工具链:Falco、Cilium、Tetragon、KubeArmor——在 syscall 层注入轻量级监控,不影响生产负载
  • 攻击面:容器逃逸、权限提升、跨集群横向移动;容器共享宿主机内核使 syscall 接口成为关键攻击面
  • 联邦学习:在不共享原始遥测数据的前提下,跨集群协同训练异常检测模型(隐私合规优势)
  • 工程价值:⭐⭐⭐ — 多集群 K8s + 统一安全监控是 2026 年云原生安全的主流需求;eBPF + FL 的组合兼顾了低开销和高隐私
  • 可信度:高(arXiv,有系统性设计)
  • 核验建议:关注 FedMon 与现有 CNCF 安全工具(Cilium, Falco)的集成成本

3.2 ⭐⭐ Wasm-bpf:WebAssembly 简化云原生 eBPF 部署(arXiv:2408.04856)

  • 链接:https://arxiv.org/html/2408.04856v1
  • 核心内容
  • eBPF 在异构云环境中部署的挑战:内核版本差异、操作系统差异、架构差异
  • 提出用 WebAssembly 作为 eBPF 程序的可移植运行时抽象层
  • 传统 eBPF 部署依赖容器或紧耦合应用;Wasm-bpf 实现了跨内核版本的 eBPF 可移植性
  • 工程价值:⭐⭐ — 技术方向有价值,但 Wasm+eBPF 的生产可行性仍需验证
  • 核验建议:关注 Wasm-eBPF 性能开销;是否与 Cilium/WasmEdge 等主流项目集成

3.3 ⭐⭐ eBPF-PATROL:面向 K8s 的运行时威胁检测与响应(arXiv:2511.18155)

  • 链接:https://arxiv.org/pdf/2511.18155
  • 核心内容
  • 提出 eBPF-PATROL,基于 eBPF 的 K8s 运行时安全代理
  • 核心能力: syscall 追踪、进程级追踪、文件描述符监控、跨节点协同防御
  • 未来方向:多租户隔离、ioctl/mmap/clone 等复杂 syscall 覆盖
  • 工程价值:⭐⭐ — 与 Falco/Tracee 功能重叠;差异化在于跨节点协同防御
  • 核验建议:与 Falco 的功能对比;多租户场景下的隔离保证

四、CSDN · 高价值技术条目光筛

4.1 ⭐⭐⭐⭐ 2026 年推理框架全解析:CSDN 精选横评

  • 链接:https://blog.csdn.net/Gaga246/article/details/155610267
  • 来源:CSDN 博客(Gaga246),2026 年初进入月度精选
  • 核心内容
  • 三分层框架:高性能(vLLM/LMDeploy/SGLang/TGI)、轻量化(Ollama/llama.cpp/LocalAI)、灵活部署(XInference/OpenLLM/LiteLLM)
  • SGLang 2026 最新:0.4.3+ 支持 DeepSeek-R1 FP8,Multi-token prediction,RadixAttention 前缀缓存
  • DeepSeek AI Open Infra:FlashMLA(Hopper MLA 内核)、DeepEP(MoE EP 通信)、DeepGEMM(FP8 GEMM)
  • 国产横评:vLLM 生态最全;SGLang 高并发结构化输出;LMDeploy 国产生态;TensorRT-LLM 吞吐最高但部署最贵
  • 工程价值:⭐⭐⭐⭐ — 选型决策树完整;含适用场景分类;已被多个实例收录为参考
  • 可信度:中高(综合编译,有实测)
  • 核验建议:与 Ollama 对比文章交叉验证 vLLM 实测数据

4.2 ⭐⭐⭐ Ollama/vLLM/llama.cpp 2026 实战对比

  • 链接:https://blog.csdn.net/shebao3333/article/details/160312355
  • 来源:CSDN 博客(hope_wisdom),2026-04-19,进入月度精选
  • 实测数据(Llama 4 Scout 17B, 50 并发):
  • Ollama:~155 tokens/s,p95 18.4s;5 用户即达平台上限
  • vLLM:~920 tokens/s,p95 2.1s;128 并发 100% 成功
  • llama.cpp:无并发批处理;Apple Silicon/CPU 边缘部署首选
  • 工程价值:⭐⭐⭐ — 实测数据可复现;benchmark 脚本可直接参考;结论直接影响生产选型
  • 可信度:高(实测命令完整,版本明确)
  • 复现建议:在 H100/A100 上重跑验证

五、REPRODUCTION · 高价值开源项目与复现线索

5.1 ⭐⭐⭐⭐ FunASR + OpenClaw 实时语音转录集成(modelscope/FunASR,2026-08-04)

  • 链接:https://github.com/modelscope/FunASR
  • 核心内容
  • openclaw-funasr 源包发布:连接自托管 FunASR 的 online/offline/2pass WebSocket 识别到 OpenClaw Talk 和 Voice Call
  • 技术细节:8 kHz G.711 mu-law 转换、60ms 帧、partial/final transcript 支持、断线重连限制
  • 验证环境:OpenClaw 2026.7.2
  • llama.cpp runtime v0.1.8:新增 Linux Vulkan GPU 包(SenseVoiceSmall),--backend vulkan 切换
  • 工程价值:⭐⭐⭐⭐ — 实时语音 + AI Agent 集成的完整参考;2pass 模式对生产转录质量有保障
  • 复现路径:pip install openclaw-funasr → 配置 WebSocket → 注册 OpenClaw runtime
  • 可信度:高(OpenClaw 官方集成文档)

5.2 ⭐⭐⭐ Atomic llma-cpp-turboquant:WHT 旋转 KV Cache + 权重量化(AtomicBot)

  • 链接:https://github.com/atomic-llama-cpp-turboquant
  • 核心内容
  • llama.cpp fork:TurboQuant = WHT-rotated KV cache + weight compression + Gemma 4 MTP + Qwen 3.6 NextN 投机解码
  • 宣称 +30-50% throughput 提升
  • 属 Atomic Bot(GitHub Organization)下的开源项目
  • 工程价值:⭐⭐⭐ — WHT 旋转 KV cache 是较新的量化方向;对推理吞吐量有追求的团队值得关注
  • 可信度:中(新项目,需独立验证性能claims)
  • 复现建议:在同等硬件上与原生 llama.cpp 对比 throughput
  • #1 ComBodied Agents:Human-Centric Agentic AI 新范式——将身体感知(embodiment)引入 Agent 设计
  • #2 Co-Evolution:Agent 系统的自导向演化,超越人类设计的边界
  • #3 Beyond Pixels:从视频先验到 4D 世界——视频生成 + 4D 重建
  • #4 ByteDance Bernini:统一视频生成与编辑的模型,Bernini 在视频编辑 benchmark 上 SOTA(Hugging Face 刚刚发布)
  • #5 ToolHazard:对抗性环境规模化扩展——LLM Agent 安全评测和对齐
  • 值得关注的评测:NCP-Bench(ICML 2026)——LLM Agent 在 100 轮长叙事一致性上的评测,最优模型 20 轮后存活率仅 42%

分类标签汇总

rag kdd2026 graphrag multimodal-kg agentic-retrieval huggingface glm deepseek-v4 cloud-native ebpf kubernetes inference-engine agent-framework arxiv csdn funasr llama.cpp benchmark


建议写入路径

/shared/research-kb/inbox/jay/2026-08-14T1505-jay-five-category-briefing.md

后续行动建议

  1. 精读:Beyond Top-K(2608.06305)——对 RAG 范式的根本性挑战,值得深度评估
  2. 精读:MemGraphRAG(KDD 2026)——多 Agent GraphRAG 最佳工程实践参考
  3. 审稿:Mixture-of-RAG(KDD 2026)——文本+表格混合 RAG pipeline
  4. 主题页更新:建议合并 RAG Paradigm 页面,补充 KDD 2026 RAG 专场趋势
  5. 复现线索:FunASR + OpenClaw 实时转录集成;ForeSci benchmark package 预测验证