2026-07-18 Jay 分类简报 · database · backend · cloud-native · csdn · substack

执行实例: Jay
检索时间: 2026-07-18 11:05 (Asia/Shanghai)
检索范围: arXiv (database systems, distributed, cloud native, agents)、Substack、Tavily 行业综述
本轮新增: 聚焦上午简报未覆盖的数据库内核、云原生基础设施、Agent 规划论文


【database】数据库存储引擎


📦 条目 D1:Tidehunter — LSM-tree 写放大消除,Sui 生产落地

  • 来源: https://arxiv.org/pdf/2602.01873
  • arXiv ID: 2602.01873
  • 核心问题: LSM-tree 在随机写入时写放大高达 10×–30×,大量 compaction 对大 value 场景(内容寻址存储、去重系统、区块链 validator)代价极高
  • 解决方案: Tidehunter 将 WAL 视为永久存储而非临时恢复缓冲,彻底消除 value compaction
  • 实测数据(1 TB 数据集,1 KB values):
  • 写入吞吐:830K ops/s( vs RocksDB 8.4×,BlobDB 2.9×)
  • 点查:比 RocksDB 快 1.7×
  • 存在性检查:快 15.6×
  • 生产状态: 已在 Sui 区块链生产部署
  • 作者机构: Mysten Labs(专注 Sui 区块链)
  • 可信度: 高(arXiv 论文 + 生产验证)
  • 标签: #LSMtree #写放大 #存储引擎 #Sui #MystenLabs
  • 后续行动: 对比 RocksDB/WiredTiger 在向量存储场景的写放大问题;补充至"分布式存储引擎选型"页

📦 条目 D2:OceanBase Bacchus — LSM-tree + 对象存储协同设计

  • 来源: https://arxiv.org/pdf/2602.23571
  • arXiv ID: 2602.23571
  • 核心: 面向对象存储(append-only)特性自定义 LSM-tree 架构,避免对象存储随机读的高昂代价
  • 评价: 来自 OceanBase 团队(阿里/蚂蚁),是国产数据库在顶级学术系统的持续发声
  • 可信度: 高(OceanBase 官方团队)
  • 标签: #OceanBase #LSMtree #对象存储 #阿里
  • 后续行动: 关注是否与阿里云 OSS/OBS 有深度集成

📦 条目 D3:Bi-Channel Networking Paradigm — 数据库网络控制/数据通道分离

  • 来源: https://arxiv.org/html/2606.19969v1
  • arXiv ID: 2606.19969
  • 作者: G Kreuzmayr (2026)
  • 核心: 分布式数据库系统中将 control path 和 data path 在传输层分离的设计原则
  • 可信度: 中(2026 新论文,暂无引用数据)
  • 标签: #分布式数据库 #网络范式 #数据库内核
  • 后续行动: 等待更多引用数据;评估与 TiDB/Spanner 网络模型的关联

📦 条目 D4:ASIC-based Compression Accelerators for Storage Systems

  • 来源: https://arxiv.org/html/2509.23693v1
  • 核心: QAT(QuickAssist Technology)压缩卸载至 ASIC,对 LSM tree 深度影响(每 SSTable 存储更多数据,压缩率提升)
  • 评价: 面向专用硬件的存储优化,属于系统硬件协同设计方向
  • 可信度: 中(2025 年论文,有硬件基准)
  • 标签: #存储压缩 #ASIC #QAT #LSMtree
  • 后续行动: 可作为"数据库硬件加速"方向索引

【backend】后端·推理·Agent


⚡ 条目 B1:Why Reasoning Fails to Plan — LLM 推理≠规划的深层原因

  • 来源: https://arxiv.org/abs/2601.22311
  • arXiv ID: 2601.22311
  • 作者: Z Wang (2026) | 引用 11 次
  • 核心: 以"规划为中心"分析 LLM 在长时程决策中失败的根源,系统性解释为何 CoT/ToT 等推理技术不等于可靠的规划能力
  • 工程价值: 为 Agent 架构设计提供理论依据:不能简单用推理能力推断规划能力
  • 可信度: 高(arXiv 2026 新论文,已被引用)
  • 标签: #LLM推理 #规划失败 #Agent理论 #arXiv2026
  • 后续行动: 精读全文,提取失败模式的分类体系;补充至"Agent 规划能力评估"主题页

⚡ 条目 B2:Novelty-based Tree-of-Thought — 新奇性驱动 LLM 推理/规划

  • 来源: https://arxiv.org/html/2605.06040v1
  • arXiv ID: 2605.06040
  • 核心: 在 Tree-of-Thought 搜索中引入"新奇性"概念(节点与搜索树中已有节点的差异度),通过 LLM 估计新奇性以剪枝,减少 token 开销
  • 评价: 融合了 width-based 搜索与 LLM 的新方向,在长程规划任务上有 token 成本优势
  • 可信度: 中(2026 新论文,方法论完整)
  • 标签: #TreeOfThought #LLM规划 #搜索算法 #token优化
  • 后续行动: 与 B1 联合阅读,形成"LLM 规划失败与改进路线"完整图景

⚡ 条目 B3:WebUncertainty — 双层不确定性驱动的 Web Agent 规划

  • 来源: https://arxiv.org/html/2604.17821v1
  • arXiv ID: 2604.17821
  • 核心: 在 Web Agent 场景引入双重不确定性建模(输入不确定 + 环境影响不确定),驱动自适应规划策略
  • 适用场景: 自主 Web 导航、自动化测试、多步骤网页操作
  • 可信度: 中(2026-04 新论文)
  • 标签: #WebAgent #不确定性规划 #自主Agent
  • 后续行动: 关注与 OpenAI Operator/Anthropic Computer Use 的工程差距

⚡ 条目 B4:LLM-Guided Planning over Nuclear Regulatory Docs — 多跳推理+知识图谱

  • 来源: https://arxiv.org/html/2606.29399v1
  • arXiv ID: 2606.29399
  • 核心: 核电站监管文档多跳推理任务,LLM Agent 在无向量的文档树上用 browse/read/search 工具,维护动态知识图谱(KG)作为状态
  • 数据: 200 题基准,NuScale FSAR 文档,准确率 81.5%,RAGAS Faithfulness 0.93
  • 关键发现: 有规划 Agent(81.5%)vs 无规划(43.5%),差距 +38pp(p<0.001)
  • 工程意义: 证明"文档即环境 + 规划 Agent"在垂直领域 RAG 的巨大收益
  • 可信度: 高(具体 benchmark + 统计显著性)
  • 标签: #RAG #知识图谱 #多跳推理 #垂直领域RAG #Nuclear
  • 后续行动: 可复现方向:对标医疗/法律文档场景的 RAG 架构选型参考

⚡ 条目 B5:AI Planning Framework for LLM-Based Web Agents

  • 来源: https://arxiv.org/html/2603.12710v1
  • arXiv ID: 2603.12710
  • 核心: 将现代 Agent 架构映射到经典规划范式:Step-by-Step → BFS;Tree Search → Best-First;Full-Plan-in-Advance → DFS;WebArena 794 条人工标注轨迹验证
  • 关键发现: Step-by-Step 更接近人类轨迹(38.4% 成功率);Full-Plan-in-Advance 元素准确率更高(89%)
  • 可信度: 高(WebArena 数据集 + 人工标注)
  • 标签: #WebAgent #Agent架构 #规划理论 #WebArena
  • 后续行动: 结合 B1/B3,形成"Web Agent 架构选型决策树";纳入"Web Agent 评估"主题页

【cloud-native】云原生·基础设施


🛰️ 条目 CN1:eBPF 2026 云原生可观测性现状 — Cilium+Tetragon+Pixie+Parca 取代 Sidecar

  • 来源: https://www.birjob.com/blog/ebpf-application-observability-2026
  • 核心:
  • 500-pod Kubernetes 集群迁移前(标准 2024 栈):Datadog APM agents + Istio sidecar + Prometheus exporters → 12 GB RAM + 3–4 CPU cores
  • 迁移后(eBPF 栈):Cilium + Pixie + Parca + Tetragon → 同覆盖,资源大幅降低
  • 具体工具栈:Cilium(网络)+ Tetragon(运行时安全)+ Pixie(自动仪表)+ Parca(持续分析)
  • KubeCon EU 2026 关键信号:
  • Kubernetes 12 年后成熟:BSD 支持(Project Lima)、Cilium mTLS(eBPF + ztunnel)替代 Istio sidecar
  • 82% Kubernetes adoption,Only 7% daily AI deployment(AI 执行落地差距仍巨大)
  • Isovalent 2026 预测:
  • VM on Kubernetes 真正落地(不再"天真")
  • 多云网络开始真实可行
  • 身份层向"人形"演进,策略需随之适应
  • 可信度: 高(生产案例 + 具体资源数据 + KubeCon 官方背景)
  • 标签: #eBPF #Kubernetes #Cilium #Tetragon #Pixie #Parca #KubeCon2026 #可观测性
  • 后续行动: 建议补充至"云原生可观测性"主题页;评估团队从 Istio 迁移至 Cilium 的路径

🛰️ 条目 CN2:arXiv · SPI — Query-Depth-Adaptive Indexing for Streaming RAG

  • 来源: https://arxiv.org/abs/2511.16681
  • arXiv ID: 2511.16681(2025 年 11 月,2026 年持续有更新)
  • 核心: 流式 RAG 场景下,查询深度自适应索引(Query-Depth-Adaptive Indexing),动态调整向量检索策略
  • 评价: 面向流式数据(新闻、金融、社交)的 RAG 系统,而非静态文档库
  • 可信度: 中(arXiv 预印本,生产验证数据待核验)
  • 标签: #流式RAG #向量检索 #自适应索引
  • 后续行动: 与 turbovec(今日上午条目)联合评估:流式场景 vs 静态私有化场景

【csdn】CSDN 高价值文章

本轮 Tavily 未检索到新的 CSDN 高价值条目(今日上午已有 4 篇 CSDN 草稿)。CSDN 筛选留待下一轮 RSS 或手动触发。


【substack】Substack 专栏亮点


📝 条目 S1:Simon Willison · Kimi K3 系统提示泄露事件

  • 来源: https://simonwillison.net/2026/Jul/17/kimi-k3/
  • 核心: Simon Willison 记录 Kimi K3 模型拒绝泄露系统提示的行为,涉及 AI 人格(AI personality)、模型安全边界
  • 评价: 反映 2026 年模型安全的新维度:不仅防外部攻击,还需防系统性提示词提取
  • 可信度: 高(Simon Willison 独立技术 blog,有代码/截图验证)
  • 标签: #AI安全 #提示词泄露 #Kimi #模型安全
  • 后续行动: 可纳入"LLM 安全边界"主题页;关注 K3 模型权重是否公开

📝 条目 S2:Nathan Benaich · 欧洲 AI 主权无法通过租赁获得

  • 来源: https://nathanbenaich.substack.com/p/europe-ai-sovereignty
  • 核心: "当华盛顿能在一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它"——AI 主权的核心是算力+数据+模型所有权,非租赁关系
  • 评价: 欧洲 AI 战略批评性分析,对理解全球 AI 地缘政治有价值
  • 可信度: 中(Nathan Benaich 是 AI 投资领域资深作者,但非技术工程层面)
  • 标签: #AI主权 #地缘政治 #欧洲AI
  • 后续行动: 低优先级,仅作行业背景参考

【reproduction】可复现资源清单

条目 复现难度 复现路径 关键依赖
Tidehunter 下载 arXiv PDF → 对照 Sui 代码仓 Rust toolchain
Tidehunter benchmark 已有具体数值,直接引用
WebUncertainty 需复现 Web Agent 环境 爬虫框架 + LLM API
LLM-Guided Planning (Nuclear) 需 NuScale FSAR 文档集 文档获取 + KG 工具
eBPF 迁移案例 参考 Cilium/Tetragon 官方文档 K8s 1.27+

分类标签汇总

#数据库 #LSMtree #Tidehunter #OceanBase #对象存储 #存储引擎
#写放大 #BiChannel #ASIC压缩 #QAT
#LLM推理 #规划失败 #TreeOfThought #WebAgent #不确定性规划
#RAG #知识图谱 #多跳推理 #垂直领域RAG #流式RAG
#云原生 #eBPF #Cilium #Tetragon #Pixie #Parca
#Kubernetes #KubeCon2026 #mTLS #可观测性
#AI安全 #提示词泄露 #Kimi #AI主权
#arXiv2026 #MystenLabs #OceanBase

本轮新增 — 建议写入路径

类别 文件路径
database /shared/research-kb/inbox/jay/2026-07-18-1105-database-backend-cloudnative-csdn-substack.md
(关联) 今日上午版 2026-07-18-ai-engineering-backend-db-deploy.md
(关联) 工程筛选 Round1 2026-07-18-1050-engineering-filter-round1-jul2026-substack-arxiv.md

行动优先级

优先级 行动 关联条目
🔴 高 精读 B1 (2601.22311) — LLM 推理失败规划原因 形成"Agent 规划能力"图景
🔴 高 精读 B4 (2606.29399) — Nuclear RAG benchmark 评估垂直领域 RAG 架构
🔴 高 评估 CN1 — eBPF 栈迁移方案 补充至云原生可观测性主题页
🟡 中 精读 D1 (Tidehunter) — 提取 LSM 优化方法 对比 RocksDB 写放大问题
🟡 中 精读 B5 (2603.12710) — Web Agent 架构分类 纳入 Web Agent 评估体系
🟢 低 扫描 CSDN 2026 数据库/后端高价值文章 补全本轮 csdn 分类

Jay · 2026-07-18 11:05 CST · 分类简报草稿 v1