Jay 学术研究知识库 · 午间简报 · 2026-07-24
时间:11:05 (UTC+8) 主题:KV Cache 推理优化 · RAG 评测基准 · 数据库内核 · GitHub Trending · Substack
今日主题
LLM 推理系统中的 KV Cache 工程优化(Resevaluation scheduling、Side-channel 安全、跨模型共享)、RAG 评测基准全景(金融/医疗/多模态/学术引文)、数据库内核研究(LSM-tree compaction eBPF 优化、NVM 存储引擎)、GitHub AI Agent 开源生态最新动态。
分类标签
KV-Cache LLM推理 Inference-Engine RAG-Evaluation Benchmark Database LSM-tree NVM Storage-Engine eBPF Side-Channel Agent GitHub-Trending Substack arXiv 2026
⭐ 必读 5 篇
1. SwiftCache:跨模型 KV Cache 共享,P99 TTFT 降低 69%
- 来源:arXiv
2606.16135v1 - 可信度:高——arXiv 预印本,有具体 benchmark 数据
- 核心观点:
- 多租户场景下,GPU 内存有限,KV cache 被迫 offload 到 CPU/SSD,context 增长后 reload 延迟急剧上升
- SwiftCache 核心思路:低 KV cache 需求的模型将闲置 GPU 内存"捐赠"给高需求模型,通过 NVLink 跨模型共享前缀缓存
- 进一步优化:仅在 GPU 本地保留当前活跃层的 KV cache,减少内存压力
- 实测:相比 vLLM 和 SGLang,P99 TTFT 降低 69%,最大上下文长度扩展 3.98 倍
- 行动建议:精读;评估在多租户推理场景的集成可行性
2. AsymCache:计算延迟感知的 KV Cache 管理,TTFT 提升 1.90-2.03×
- 来源:arXiv
2606.02964v1 - 可信度:高——与 vLLM/SGLang/Continuum 对比实验
- 核心观点:
- 现有 lossless KV cache 驱逐策略主要基于访问频率或位置启发,忽略不同 KV block 对 GPU attention kernel 执行效率的影响
- Multi-Segment Attention (MSA):高效处理非连续 KV 上下文
- 联合优化:cache hit rate + 位置感知重计算成本
- 自适应 chunking scheduler:高硬件利用率
- 实测:TTFT 提升 1.90-2.03×,TPOT 提升 1.62-1.71×
- 与 Continuum Agent serving 系统集成后,平均作业延迟降低 18.1%
- 行动建议:精读;KV cache 驱逐策略设计参考
3. RESYSTANCE:eBPF + io_uring 释放 LSM-tree Compaction 隐藏性能
- 来源:arXiv
2603.05162 - 可信度:高——RocksDB 基线对比,100% 可复现实验
- 核心观点:
- LSM-tree compaction 生成大量读系统调用,user-kernel 切换开销巨大
- RESYSTANCE 方案:利用 eBPF 将 compaction 完全卸载到内核,io_uring 处理 read I/O
- 无需修改 LSM-tree 结构或 compaction 算法
- 实测:compaction 期间系统调用减少 99%,compaction 时间缩短 50%;写密集负载吞吐量提升 75%,p99 延迟降低 40%
- 行动建议:归档;评估在内核版本支持 eBPF/io_uring 的生产环境可行性
4. T²-RAGBench + MKG-RAG-Bench + MRAG-Bench:RAG 评测三基准
- 来源:arXiv(三篇)
2506.12071→ T²-RAGBench(EACL 2026 录用,金融 QA,文本+表格)2606.26458v1→ MKG-RAG-Bench(多模态知识图谱 RAG,跨领域)2601.16503v1→ MRAG-Bench(医疗 RAG,英中双语,4 任务群组)- 可信度:高——EACL 录用 + 多数据集验证
- 核心观点:
- T²-RAGBench:金融文档 QA,含 23,088 question-context-answer 三元组,覆盖 FinQA/ConvFinQA/TAT-DQA
- MKG-RAG-Bench:多模态知识图谱 RAG,支持 structured/unstructured/graph 数据协同检索;跨 LLM 一致性验证(GPT/Qwen3.5/Gemini 2.5 Flash)
- MRAG-Bench:医疗领域,英文+中文,13 个测试数据集,14,816 样本;配套 MRAG-Toolkit 开源
- RAGe(
2605.27445v1):RAG 评测框架,支持 HuggingFace/Ollama,集成 Telemetry + Optimization Suggestion - 行动建议:浏览;评估各基准的适用场景,供 RAG 系统选型参考
5. SafeKV + PrefixWall:KV Cache Side-Channel 安全研究
- 来源:arXiv(两篇)
2508.08438v2→ SafeKV(选择性 KV cache 共享,隐私保护)2603.10726v2→ PrefixWall(Prefix Caching Side Channel 缓解)- 可信度:高——安全研究,有具体威胁模型
- 核心观点:
- SafeKV:全局 KV cache 共享引入 API 可感知的时序侧信道,攻击者可从 shared entries 推断敏感用户输入;提出三-tier 异步检测 pipeline + radix-tree 内存管理器 + RDR 运行时保护
- PrefixWall:APC(Automatic Prefix Cache)通过复用请求前缀加速,但多租户场景下攻击者可从 hit/miss 模式重建其他用户请求;关键洞察:无需隔离整个用户,只需保护共享前缀
- 两个工作共同揭示:2026 年多租户 LLM serving 安全是一个被低估的攻击面
- 行动建议:精读;纳入 AI 安全主题页;建议推动安全评估
高价值条目
6. Continuum:多轮 Agent 调度的 KV Cache TTL 机制
- 来源:arXiv
2511.02230(UC Berkeley + Stanford + Tsinghua) - 核心观点:多轮 agent 工作负载中,KV cache 保留策略(TTL)决定 job completion time;对于生成 tool calls 的请求,基于 reload cost 和驱逐诱导的排队延迟动态确定 TTL 值
- 工程价值:⭐⭐⭐⭐⭐
7. Kareto:KV Cache 自适应多层存储配置优化器
- 来源:arXiv
2603.08739v1 - 核心观点:GPU HBM / Host DRAM / Disk 三层 tier KV cache,提出 Pareto 前沿多目标优化(成本/吞吐/延迟);细粒度自适应调优器,根据访问模式分组管理
- 工程价值:⭐⭐⭐⭐
8. Tutti:SSD 后备 KV Cache 的 GPU 原生对象存储
- 来源:arXiv
2605.03375 - 核心观点:GPU-centric 两层(HBM-SSD)KV cache 对象存储,消除 HBM-SSD 关键路径的 GPU stall;相比 GDS-enabled LMCache,性能接近 DRAM-backed LMCache
- 工程价值:⭐⭐⭐⭐
9. Multi-Layer Scheduling for MoE LLM Reasoning
- 来源:arXiv
2602.21626v1 - 核心观点:在请求级(Shortest-Job-First)、引擎级(load-aware dispatching)、专家级(expert hotspot 均衡)三层调度 MoE LLM 推理;相比 vLLM:TTFT 降低 17.8%,TPOT 降低 13.3%
- 工程价值:⭐⭐⭐⭐
10. FlintKV:NVM 优化的 Skiplist 存储引擎
- 来源:arXiv
2607.02401 - 核心观点:字节寻址 NVM(非易失性内存)架构下,支持 snapshot isolation 等高级一致性条件;PMem-RocksDB 之外的另一种 NVM KV store 方案
- 工程价值:⭐⭐⭐(较早期工作,需核实落地情况)
11. OceanBase Mercury:分布式近实时 OLAP
- 来源:arXiv
2602.07584v1 - 核心观点:自适应列式存储格式 + 物化视图差分刷新 + 多态向量化引擎;petabyte 级 AP 负载,查询延迟比专用 OLAP 引擎快 1.3-3.1 倍
- 工程价值:⭐⭐⭐⭐
12. LSM-VEC:LSM-tree 存储 + 动态向量搜索
- 来源:arXiv
2505.17152v2 - 核心观点:将层次图索引与 LSM-tree 存储融合,实现 disk-based 动态向量索引;内存占用降低 66.2%,支持动态更新
- 工程价值:⭐⭐⭐⭐
GitHub Trending · AI Agent 生态(2026-07 上半月)
13. agent-skills(addyosmani)——AI 编码 Agent 工程技能标准化
- 来源:GitHub ·
addyosmani/agent-skills - 今日 +2554 stars(agents-radar 2026-07-10 报道)
- 核心观点:定义 AI 编码 Agent 的生产级工程技能集,目标是标准化和提升 Agent 能力;社区强烈需求对应 Claude Code 等高价工具的替代方案
- 工程价值:⭐⭐⭐⭐⭐
14. OfficeCLI——Agent-First Microsoft Office 自动化
- 来源:GitHub ·
iOfficeAI/OfficeCLI - 今日 +1929 stars
- 核心观点:原生 agent 自动化套件,绕过传统 GUI 依赖,直接操作 Office 文档;填补 Office 自动化在 AI Agent 场景的空白
- 工程价值:⭐⭐⭐⭐
15. system_prompts_leaks——系统提示词逆向工程
- 来源:GitHub ·
asgeirtj/system_prompts_leaks - 今日 +1125 stars
- 核心观点:提取和逆向主流 AI 模型系统提示词;社区对理解+定制模型基础行为的需求强烈
- 工程价值:⭐⭐⭐⭐(安全研究价值)
16. hallmark——反 AI 垃圾 CSS 技能
- 来源:GitHub · hallmark
- 核心观点:为 Claude Code/Cursor/Codex 提供反 AI 风格 CSS/主题技能,提升 AI 编码输出质量;代表 Agent 输出质量工程化方向
- 工程价值:⭐⭐⭐⭐
17. Vibe-Trading——个人金融 AI Agent
- 来源:GitHub · Vibe-Trading
- 今日 +1148 stars
- 核心观点:个人金融交易多 Agent 框架;结合 Mem0 等记忆层实现个性化交易辅助
- 工程价值:⭐⭐⭐
18. awesome-llm-apps——突破 100k stars
- 来源:GitHub · awesome-llm-apps
- 累计 126k+ stars,2026-07-14 +1006 today
- 核心观点:最全面的 AI Agent & RAG 应用开源集合;里程碑事件,代表 Agent 应用生态成熟度
- 工程价值:⭐⭐⭐⭐⭐
Substack 高价值
19. LLM Evaluation: The New Bottleneck(ML Frontiers)
- 来源:
mlfrontiers.substack.com - 可信度:高——AI 工程垂直领域深度 newsletter
- 核心观点:
- LLM 生成内容无处不在,但评估方法跟不上模型进化速度
- Chatbot Arena(众包人类判断)和 LLM-as-a-Judge(LLM 近似人类评估)成为主流,但都有重要局限性
- HELM:30 个模型 × 16 场景 × 7 基础评判维度(准确性、校准、鲁棒性、公平性、偏见、毒性、效率),最详尽的离线 LLM 评测工作之一
- 工程评价:AI 工程团队必读;评估方法论影响系统设计决策
- 行动建议:纳入「LLM 评测」主题页
20. 2026 June AI Evaluation Digest
- 来源:
aievaluation.substack.com - 可信度:高——AI 评测垂直 newsletter
- 核心观点:
- SuperARC:基于算法信息论的 AI 评测方法,惊讶发现前沿 LLM 在该测试上未变好(可能因为 RL for CoT 使模型压缩能力变差)
- OpenEval benchmark:倡导 item 级评测数据替代完整环境模拟
- 评测生态正从"温度计"(单一指标)向"法庭"(理解评估者本身)演进
- 工程评价:评测方法论研究值得工程团队关注
- 行动建议:浏览;关注 SuperARC 的发现是否影响特定场景评测设计
21. Simon Willison 2026 LLM 预测
- 来源:
simonw.substack.com(Simon Willison,AI 开发工具领域资深独立研究者) - 可信度:高——工程视角,有具体时间线和案例
- 核心观点:
- 1 年:LLM 写出好代码将变得不可否认
- 3 年:有人会用 AI 辅助编程构建新浏览器,且不会引起惊讶
- 核心洞察:近两个月 coding agent 的进步使他确信变化将显著,但不确定具体形态
- 工程评价:Simon Willison 是 AI 开发工具领域最有影响力的独立声音之一;预测具有参考价值
- 行动建议:浏览;关注 coding agent 工具链的快速迭代
精读/审稿/主题页更新建议
| 行动 | 条目 | 原因 |
|---|---|---|
| 精读 | SwiftCache(#1) | 跨模型 KV cache 共享是 2026 多租户推理的关键优化方向 |
| 精读 | AsymCache(#2) | 与 Continuum 集成数据(18.1% 延迟降低)直接可用于工程决策 |
| 精读 | SafeKV + PrefixWall(#5) | 多租户 LLM serving 安全是当前被低估的攻击面,高优先级 |
| 归档 | RESYSTANCE(#3) | eBPF/io_uring 在数据库内核的应用值得关注,评估落地门槛 |
| 浏览 | T²/MKG/MRAG RAG Benchmarks(#4) | 三基准各有所长,按需引用 |
| 浏览 | Simon Willison 2026 Predictions(#21) | 3 年预测影响技术选型长期规划 |
| 主题页更新 | LLM推理优化 ← SwiftCache + AsymCache + Kareto + Continuum + Tutti |
|
| 主题页更新 | AI安全 ← SafeKV + PrefixWall + HF 安全事件(上午简报已覆盖) |
|
| 主题页更新 | RAG-Evaluation ← T²-RAGBench + MKG-RAG-Bench + MRAG-Bench + RAGe |
|
| 主题页更新 | Agent系统设计 ← agent-skills + OfficeCLI + hallmark |
建议写入路径
/shared/research-kb/inbox/jay/2026-07-24-1105-noon-kv-rag-db-substack.md ✅(本文)
本次未覆盖领域(避免重复)
- Colibri、pi-mono、AI Agents Stack 2026、OWASP Top 10 Agent(上午
2026-07-24-ai-engineering-trending.md已覆盖) - HERA、HM-RAG、LangChain 0.3.20(上午
2026-07-24-csdn-langgraph-multimodal-rag-substack.md已覆盖) - Redis 大key/热key、PostgreSQL 17(上午
2026-07-24_engineering-database-csdn.md已覆盖) - HF 安全事件(上午简报高优先级条目已覆盖)