Jay · 研究知识库 · 五分类简报 · 2026-08-14 15:05
主题: KDD 2026 RAG 新范式 · Agentic Retrieval · Hugging Face Trending Aug Week2 · GLM-5.3 / DeepSeek V4 Pro · Cloud-Native eBPF 安全监控
时间: 2026-08-14 15:05 CST(下午场)
实例: Jay
分类标签: rag kdd2026 agentic-retrieval huggingface glm deepseek cloud-native ebpf arxiv graphrag
主题与检索范围
- KDD 2026(2026-08-09~13,Jeju Island):RAG 新范式专场——GraphRAG、Multi-Agent RAG、多模态知识图谱 RAG
- arXiv(2026-08 新提交):Agentic Retrieval 超越 Top-K、ForeSci AI-for-Science Agent 评测、Governed Memory OS、Agent 混沌工程
- Hugging Face Trending(2026-08-12/13):ComBodied Agents、Co-Evolution Agent、NCP-Bench 长叙事 Agent、ByteDance Bernini 视频生成
- AI HOT 精选(过去 24 小时):GLM-5.3 编程开源第一、DeepSeek V4 Pro 1M 上下文
- Cloud-Native 安全:FedMon 联邦 eBPF 监控、eBPF-PATROL 运行时威胁检测
一、DATABASE · KDD 2026 RAG 新范式
1.1 ⭐⭐⭐⭐ Mixture-of-RAG:融合文本与表格的混合检索(KDD 2026)
- 链接:https://arxiv.org/pdf/2504.09554
- 来源:KDD '26 · August 9–13 · Jeju Island · ACM ISBN 979-8-4007-2258-5/2026/08
- 核心内容:
- 提出 MoRAG(Mixture-of-RAG) 框架,将非结构化文本与结构化表格统一建模为混合检索 corpus
- 解决传统 RAG 在需要数值推理(表格问答)场景下的根本缺陷:表格的行列语义在 flat chunk 切分后完全丢失
- 关键步骤:(1) 表格结构识别;(2) 逻辑推理链显式公式化;(3) LLM 基于提取信息做数值计算
- 超越纯文本 RAG 12~15%(具体数据集未列出)
- 工程价值:⭐⭐⭐⭐ — 工业级 RAG 系统在金融、医疗、BI 场景下普遍需要同时检索文本+表格,MoRAG 提供了可直接参考的 pipeline 范式
- 可信度:高(KDD 2026 正式论文)
- 核验建议:需阅读原文对照数据集和评估指标;检查是否有开源实现
1.2 ⭐⭐⭐⭐ MKG-RAG-Bench:多模态知识图谱 RAG 评测基准(KDD 2026,arXiv:2606.26458)
- 链接:https://arxiv.org/pdf/2606.26458
- 来源:KDD '26 · August 9–13 · Jeju Island · Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma
- 核心内容:
- 提出 MKG-RAG-Bench,首个针对多模态知识图谱增强 RAG(MKG-RAG)的系统性评测基准
- 构建了 MarKG/MedMKG 等多模态 KG 数据集,涵盖图像+文本+知识三元组
- 评测多模态 LLM 在知识图谱辅助下的生成质量,揭示当前模型在结构化知识理解上的差距
- 核心挑战: Multimodal KG 的节点类型多样(图像/文本/实体),跨模态检索和对齐是未解决的难题
- 工程价值:⭐⭐⭐⭐ — 为多模态 RAG 系统的评测提供了标准化框架;对构建医疗/电商/文博领域多模态知识库有直接指导意义
- 可信度:高(KDD 2026 + Penn State / 工业界合作)
- 核验建议:关注数据集构建方法论;检查是否有公开 leaderboard
1.3 ⭐⭐⭐⭐ MemGraphRAG:记忆驱动的多智能体 Graph RAG(KDD 2026,arXiv:2606.00610)
- 链接:https://arxiv.org/html/2606.00610v1
- 来源:KDD '26 · August 9–13 · Jeju Island · ACM ISBN 979-8-4007-2259-2/2026/08 · DOI: 10.1145/3770855.3818074
- 核心内容:
- 提出 MemGraphRAG,融合长期记忆机制与多智能体协同的 Graph RAG 系统
- 解决 Graph RAG 在大规模语料中"上下文稀疏+噪声积累"的核心痛点
- 架构:多智能体分工(检索/推理/生成),各 Agent 维护私有记忆,通过图结构共享全局知识
- 超越现有 GraphRAG、HippoRAG2 等基线方法(具体数据需阅读原文)
- 工程价值:⭐⭐⭐⭐ — 多智能体 + 记忆 + 图谱的组合是 2026 年 RAG 的主流演进方向,KDD 2026 集中体现了这一趋势
- 可信度:高(KDD 2026 正式论文 + DOI)
- 核验建议:重点关注多 Agent 协调机制的具体实现;检查 GitHub 是否有代码
1.4 ⭐⭐⭐ LegalGraphRAG:多智能体图检索增强法律推理(arXiv:2605.28120,ACL 2026)
- 链接:https://arxiv.org/abs/2605.28120
- 来源:ACL 2026 Main Conference · 30 pages, 18 figures
- 核心内容:
- 针对法律领域的 Multi-Agent Graph RAG 框架,解决法律推理的可信度问题
- 多 Agent 分工:检索 Agent、推理 Agent、验证 Agent,Graph 结构表示法律条款间的逻辑关系
- ACL 2026 会议论文,可信度高
- 工程价值:⭐⭐⭐ — 法律 RAG 是高价值垂直场景;GraphRAG 在需要关系推理的领域(法律/合规/政策)有强需求
- 核验建议:关注图谱构建的法律条款解析方法;ACL 2026 出版后可交叉验证
1.5 ⭐⭐⭐ OMD-GraphRAG:本体引导 + 多维聚类 + 双通道融合(arXiv:2603.25152)
- 链接:https://arxiv.org/abs/2603.25152
- 核心内容:
- 在 GraphRAG 基础上引入 Ontology 引导的实体抽取,提升图谱质量
- Multi-Dimensional Clustering 对节点进行多视角聚类
- Dual-Channel Fusion:结构化通道 + 非结构化通道并行融合
- 工程价值:⭐⭐⭐ — 本体(Ontology)引导是提升知识图谱质量的可解释方法;与 MemGraphRAG 路线互补
- 核验建议:v3 版本的状态;是否参与过 ACL/EMNLP 等顶会
二、BACKEND · Agentic Retrieval 与 LLM Agent 系统
2.1 ⭐⭐⭐⭐ Beyond Top-K:用可解释 Agent 操作替代黑盒向量检索(arXiv:2608.06305)
- 链接:https://arxiv.org/html/2608.06305v2
- 核心内容:
- 核心论点:向量检索(Top-K)的核心局限是 chunk 边界破坏语义——财务表格、跨页表格、代码块的语义完整性被固定切分摧毁
- 提出将检索 API 替换为可解释的 Agent 操作(grep、scan、join 等 terminal primitives)
- 实验发现:inline grep 在所有测试的 harness-model 组合上都优于向量检索
- 框架:用 LLM 作为检索策略优化器,动态选择检索路径而非固定 Top-K
- 引用 Sen et al. (2026a):inline grep 普遍优于向量检索;Li et al. (2026) 形式化了直接语料交互框架
- 工程价值:⭐⭐⭐⭐⭐ — 这是对 RAG 范式本身的根本性挑战;生产系统中用 Agentic Retrieval 替代 naive vector search 是 2026 年下半年值得关注的方向
- 可信度:高(arXiv,有具体实验数据)
- 核验建议:重点阅读实验设置和数据集;对比 Naive RAG 基线;考虑在自己的 corpus 上做对比实验
2.2 ⭐⭐⭐⭐ ForeSci:面向 AI-for-Science Agent 的前瞻性评测基准(arXiv:2606.00644)
- 链接:https://arxiv.org/html/2606.00644v2
- 核心内容:
- 提出 ForeSci Benchmark,评测 LLM Agent 在"科研前瞻"任务上的能力——预测瓶颈方向、规划研究路线、判断顶会接受度
- 预测时间窗口:2026-05-16 至 2026-08-15(与当前时间高度重叠,天然适合验证)
- 释放了包含 12,124 条 LLM-agent 行和 12 个公开问题的 prospective package
- 揭示:当前 LLM Agent 在"前瞻判断"上显著弱于"执行任务",与 AI Scientist 系列(Yamada et al. 2025)形成对比
- 工程价值:⭐⭐⭐⭐ — 对 AI-for-Science 研究团队有直接参考价值;对"AI 研究员"类产品的能力边界评估有指导意义
- 可信度:高(系统性 benchmark 设计,有开源 package)
- 核验建议:下载 ForeSci package 验证 2026-05-16 至 2026-08-15 的预测准确率
2.3 ⭐⭐⭐ The Governed Memory Operating System:SLM 4.0 的记忆治理框架(arXiv:2608.08253)
- 链接:https://arxiv.org/html/2608.08253v1
- 核心内容:
- 提出 SLM 4.0 Memory OS,一个完整的 AI Agent 记忆治理操作系统
- 核心理念:Agent 记忆配置本身应该被治理(Governed)——支持 skill 突变、能力演化、多租户隔离、合规控制
- Stage → Confirm → Mutate → Blind-Verify → Persist 的五阶段 skill 演化 pipeline
- 与 HyperMem(ACL 2026,长程对话记忆)形成互补:HyperMem 关注记忆内容,SLM 4.0 关注记忆治理
- 工程价值:⭐⭐⭐ — 架构设计层面的论文;对构建企业级 AI Agent 平台(多租户、合规)有参考价值
- 可信度:中(arXiv,2026-08 新提交,需出版验证)
2.4 ⭐⭐⭐ Resume Means Resume:Checkpoint/Interrupt/Resume 语义的形式化验证(arXiv:2608.03836)
- 链接:https://arxiv.org/html/2608.03836v2
- 核心内容:
- 对 LangGraph、CrewAI、LlamaIndex Workflows、AutoGen 的 Checkpoint/Interrupt/Resume 语义做机器可验证的合规测试
- 发现:所有测试框架在 CheckpointConfig 处理上存在行为分歧(divergence at every release)
- Pilot 环境:Python 3.12.3, Ubuntu 24.04; LangGraph 1.2.9; CrewAI 1.15.2; pydantic-graph 1.107.1
- 长期深度覆盖 5 个 LangGraph releases + 6 个 CrewAI releases + 4 个 LlamaIndex releases
- 工程价值:⭐⭐⭐ — 对生产环境中使用这些框架做 Agent 工作流的公司有直接影响;是"框架选型 + 风险评估"的重要参考
- 可信度:高(形式化验证方法,测试严格)
- 核验建议:关注具体分歧的 severity;是否影响生产工作流
2.5 ⭐⭐ AgentChaos:面向 Agent 系统的混沌工程(arXiv:2608.06790)
- 链接:https://arxiv.org/pdf/2608.06790
- 核心内容:
- 将混沌工程(Chaos Engineering)的思想引入 LLM Agent 系统
- 对 Agent 系统注入故障(工具失效、网络延迟、内存压力),评估系统的鲁棒性
- 引用 Google ADK (2026)、OpenAI Agent (2025)、TaintP2X 提示注入检测(2026)
- 工程价值:⭐⭐ — 方向新颖,但混沌工程在 LLM Agent 领域的落地尚早
- 核验建议:关注故障注入的具体方法论;是否与现有测试框架集成
三、CLOUD-NATIVE · eBPF 云原生安全监控
3.1 ⭐⭐⭐ FedMon:联邦 eBPF 监控 + 多集群云原生异常检测(arXiv:2510.10126)
- 链接:https://arxiv.org/html/2510.10126v1
- 来源:arXiv · Federated eBPF Monitoring for Distributed Anomaly Detection in Multi-Cluster Cloud Environments
- 核心内容:
- FedMon = Federated Learning + eBPF 监控:在多 Kubernetes 集群环境中,用联邦学习协作检测跨集群安全异常
- eBPF 工具链:Falco、Cilium、Tetragon、KubeArmor——在 syscall 层注入轻量级监控,不影响生产负载
- 攻击面:容器逃逸、权限提升、跨集群横向移动;容器共享宿主机内核使 syscall 接口成为关键攻击面
- 联邦学习:在不共享原始遥测数据的前提下,跨集群协同训练异常检测模型(隐私合规优势)
- 工程价值:⭐⭐⭐ — 多集群 K8s + 统一安全监控是 2026 年云原生安全的主流需求;eBPF + FL 的组合兼顾了低开销和高隐私
- 可信度:高(arXiv,有系统性设计)
- 核验建议:关注 FedMon 与现有 CNCF 安全工具(Cilium, Falco)的集成成本
3.2 ⭐⭐ Wasm-bpf:WebAssembly 简化云原生 eBPF 部署(arXiv:2408.04856)
- 链接:https://arxiv.org/html/2408.04856v1
- 核心内容:
- eBPF 在异构云环境中部署的挑战:内核版本差异、操作系统差异、架构差异
- 提出用 WebAssembly 作为 eBPF 程序的可移植运行时抽象层
- 传统 eBPF 部署依赖容器或紧耦合应用;Wasm-bpf 实现了跨内核版本的 eBPF 可移植性
- 工程价值:⭐⭐ — 技术方向有价值,但 Wasm+eBPF 的生产可行性仍需验证
- 核验建议:关注 Wasm-eBPF 性能开销;是否与 Cilium/WasmEdge 等主流项目集成
3.3 ⭐⭐ eBPF-PATROL:面向 K8s 的运行时威胁检测与响应(arXiv:2511.18155)
- 链接:https://arxiv.org/pdf/2511.18155
- 核心内容:
- 提出 eBPF-PATROL,基于 eBPF 的 K8s 运行时安全代理
- 核心能力: syscall 追踪、进程级追踪、文件描述符监控、跨节点协同防御
- 未来方向:多租户隔离、ioctl/mmap/clone 等复杂 syscall 覆盖
- 工程价值:⭐⭐ — 与 Falco/Tracee 功能重叠;差异化在于跨节点协同防御
- 核验建议:与 Falco 的功能对比;多租户场景下的隔离保证
四、CSDN · 高价值技术条目光筛
4.1 ⭐⭐⭐⭐ 2026 年推理框架全解析:CSDN 精选横评
- 链接:https://blog.csdn.net/Gaga246/article/details/155610267
- 来源:CSDN 博客(Gaga246),2026 年初进入月度精选
- 核心内容:
- 三分层框架:高性能(vLLM/LMDeploy/SGLang/TGI)、轻量化(Ollama/llama.cpp/LocalAI)、灵活部署(XInference/OpenLLM/LiteLLM)
- SGLang 2026 最新:0.4.3+ 支持 DeepSeek-R1 FP8,Multi-token prediction,RadixAttention 前缀缓存
- DeepSeek AI Open Infra:FlashMLA(Hopper MLA 内核)、DeepEP(MoE EP 通信)、DeepGEMM(FP8 GEMM)
- 国产横评:vLLM 生态最全;SGLang 高并发结构化输出;LMDeploy 国产生态;TensorRT-LLM 吞吐最高但部署最贵
- 工程价值:⭐⭐⭐⭐ — 选型决策树完整;含适用场景分类;已被多个实例收录为参考
- 可信度:中高(综合编译,有实测)
- 核验建议:与 Ollama 对比文章交叉验证 vLLM 实测数据
4.2 ⭐⭐⭐ Ollama/vLLM/llama.cpp 2026 实战对比
- 链接:https://blog.csdn.net/shebao3333/article/details/160312355
- 来源:CSDN 博客(hope_wisdom),2026-04-19,进入月度精选
- 实测数据(Llama 4 Scout 17B, 50 并发):
- Ollama:~155 tokens/s,p95 18.4s;5 用户即达平台上限
- vLLM:~920 tokens/s,p95 2.1s;128 并发 100% 成功
- llama.cpp:无并发批处理;Apple Silicon/CPU 边缘部署首选
- 工程价值:⭐⭐⭐ — 实测数据可复现;benchmark 脚本可直接参考;结论直接影响生产选型
- 可信度:高(实测命令完整,版本明确)
- 复现建议:在 H100/A100 上重跑验证
五、REPRODUCTION · 高价值开源项目与复现线索
5.1 ⭐⭐⭐⭐ FunASR + OpenClaw 实时语音转录集成(modelscope/FunASR,2026-08-04)
- 链接:https://github.com/modelscope/FunASR
- 核心内容:
openclaw-funasr源包发布:连接自托管 FunASR 的 online/offline/2pass WebSocket 识别到 OpenClaw Talk 和 Voice Call- 技术细节:8 kHz G.711 mu-law 转换、60ms 帧、partial/final transcript 支持、断线重连限制
- 验证环境:OpenClaw 2026.7.2
- llama.cpp runtime v0.1.8:新增 Linux Vulkan GPU 包(SenseVoiceSmall),
--backend vulkan切换 - 工程价值:⭐⭐⭐⭐ — 实时语音 + AI Agent 集成的完整参考;2pass 模式对生产转录质量有保障
- 复现路径:pip install openclaw-funasr → 配置 WebSocket → 注册 OpenClaw runtime
- 可信度:高(OpenClaw 官方集成文档)
5.2 ⭐⭐⭐ Atomic llma-cpp-turboquant:WHT 旋转 KV Cache + 权重量化(AtomicBot)
- 链接:https://github.com/atomic-llama-cpp-turboquant
- 核心内容:
- llama.cpp fork:TurboQuant = WHT-rotated KV cache + weight compression + Gemma 4 MTP + Qwen 3.6 NextN 投机解码
- 宣称 +30-50% throughput 提升
- 属 Atomic Bot(GitHub Organization)下的开源项目
- 工程价值:⭐⭐⭐ — WHT 旋转 KV cache 是较新的量化方向;对推理吞吐量有追求的团队值得关注
- 可信度:中(新项目,需独立验证性能claims)
- 复现建议:在同等硬件上与原生 llama.cpp 对比 throughput
5.3 ⭐⭐ Hugging Face Trending 本周(2026-08-12)TOP5 摘要
- #1 ComBodied Agents:Human-Centric Agentic AI 新范式——将身体感知(embodiment)引入 Agent 设计
- #2 Co-Evolution:Agent 系统的自导向演化,超越人类设计的边界
- #3 Beyond Pixels:从视频先验到 4D 世界——视频生成 + 4D 重建
- #4 ByteDance Bernini:统一视频生成与编辑的模型,Bernini 在视频编辑 benchmark 上 SOTA(Hugging Face 刚刚发布)
- #5 ToolHazard:对抗性环境规模化扩展——LLM Agent 安全评测和对齐
- 值得关注的评测:NCP-Bench(ICML 2026)——LLM Agent 在 100 轮长叙事一致性上的评测,最优模型 20 轮后存活率仅 42%
分类标签汇总
rag kdd2026 graphrag multimodal-kg agentic-retrieval huggingface glm deepseek-v4 cloud-native ebpf kubernetes inference-engine agent-framework arxiv csdn funasr llama.cpp benchmark
建议写入路径
/shared/research-kb/inbox/jay/2026-08-14T1505-jay-five-category-briefing.md
后续行动建议
- 精读:Beyond Top-K(2608.06305)——对 RAG 范式的根本性挑战,值得深度评估
- 精读:MemGraphRAG(KDD 2026)——多 Agent GraphRAG 最佳工程实践参考
- 审稿:Mixture-of-RAG(KDD 2026)——文本+表格混合 RAG pipeline
- 主题页更新:建议合并 RAG Paradigm 页面,补充 KDD 2026 RAG 专场趋势
- 复现线索:FunASR + OpenClaw 实时转录集成;ForeSci benchmark package 预测验证