Jay 工程实践筛选 · 2026-08-10 10:50

任务属性

  • 实例: Jay
  • 执行时间: 2026-08-10 10:50 (Asia/Shanghai)
  • 检索范围: arXiv (本周新) / GitHub / Substack (Agent harness/RAG/MCP/A2A) / 工程对比评测
  • 主题: 工程筛选第二轮 — RAG 联合优化 · Agent Harnes 工程 · 多协议栈 · 推理引擎工程

筛选结果概览

状态 条目数 说明
✅ 保留(精读) 4 含真实环境、命令、benchmark 数据、源码路径
⚠️ 保留(参考) 5 有洞察但需核验或为 overview
❌ 丢弃 4 为 overview/列表类,无工程细节

✅ 保留(精读)

1. RAG-Stack: Co-Optimizing RAG Serving Performance and Quality

来源: arxiv.org/html/2608.03487v1 可信度: 高 — MLSys 2026 相关会议论文 工程类型: 推理系统 × RAG 调度联合优化

保留理由: 包含真实 benchmark 数据和具体反直觉发现: - ReAct agentic 模式反而比顺序 pipeline 更快(quality-cost trade-off) - Query expansion 在某些配置下牺牲吞吐但 quality gain 有限 - 更大 generator 并不总是提升 quality(量化数据支撑) - RAG-PE 将 MOBO 扩展为 stage-aware diagnostic + heterogeneous candidate generation

含真实数据:

"agentic ReAct (Yao et al., 2023) can be faster than a sequential pipeline at a modest quality cost, query expansion sacrifices throughput for a quality gain that appears only in some configurations, and even a larger generator does not always improve quality"

建议: 精读 Section 4(trade-off 分析)+ Section 6(serving system co-design)。可作为 RAG 生产调优的量化参考框架。

链接: https://arxiv.org/html/2608.03487v1


2. SGLang vs vLLM vs TensorRT-LLM 2026 工程对比(含生产安全警告)

来源: gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026 + servermo.com/blogs/sglang-vs-vllm-benchmark 可信度: 高 — 引用 cloudai.pt H100 benchmark suite (2026) 独立测量 工程类型: 推理引擎选型实战

保留理由: 包含具体 benchmark 数据 + 生产安全警告(0.0.0.0 暴露):

具体数据(H100 SXM5 80GB, Llama 3.3 70B FP8): | 引擎 | 1 request | 50 concurrent | |------|----------|--------------| | TensorRT-LLM | 基准 | +13% vs vLLM | | SGLang | ~equal | ~equal | | vLLM | -8% | 基准 |

  • SGLang RadixAttention 在 shared-prefix 场景下最高领先 vLLM 29%(独立测量)
  • ServerMO 文章包含关键安全警告vllm serve --host 0.0.0.0 会直接将引擎暴露公网,无内置认证

含生产命令:

# ⚠️ 错误示范(来自文章真实案例)
vllm serve --host 0.0.0.0
sglang.launch_server --host 0.0.0.0
# 正确做法:通过 Reverse Proxy 暴露

建议: 精读。收录为推理引擎选型 + 生产安全 checklist。

链接: https://gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026


3. Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

来源: arxiv.org/html/2608.03222v1 可信度: 高 — arXiv 2026-08 新论文 工程类型: Agent 调试 × 源码级解决方案

保留理由: 包含源码级发现和具体工程洞察:

核心问题:verbose text summaries 会导致 LLM anchoring effect,让重启 agent 锁定在之前错误推理路径。

源码级解决方案(来自原文):

"Instead of preserve the agent's physical code edits as a clean, environment-level overlay: a fresh rollout inherits no prior prompt history, but is warm-started with access to the aborted repository edits"

通过保留代码编辑(而非文字摘要),让重启 agent 在干净 prompt 上下文下 warm-start,避免 LLM anchoring。

建议: 精读。纳入 Agent 调试工程实践库。

链接: https://arxiv.org/html/2608.03222v1


4. Agentic Harness Engineering: The Next Frontier + Auto Agentic Harness Engineering (Substack 双篇)

来源: shashikant86.substack.com + cobusgreyling.substack.com 可信度: 中高 — Substack 技术分析,引用原始论文 工程类型: Agent 评测 harness 工程

保留理由: 包含具体量化数据和框架概念: - AHE 论文在 Terminal-Bench 2 上:seed 69.7% → evolved 77.0%,超过 Codex-CLI hand-crafted 71.9% - Fix-precision 33.7%,Regression-precision 11.8%(关键发现:forward justification 廉价,defensive prediction 昂贵) - "The model is rented. The harness is owned." — 框架概念清晰 - Layered evidence corpus 结构:Task-level outcomes / Root-cause analysis / Benchmark-level summaries

建议: 参考。核心工程理念有价值,但量化数据需对照原始论文核实。


⚠️ 保留(参考)

5. How to Trace and Debug Multi-Agent Systems: Production Guide

来源: futureagi.substack.com/p/how-to-trace-and-debug-multi-agent 工程价值: 中 — 含 OpenTelemetry 实践 + 真实错误案例

保留理由: 包含真实 trace 数据示例:

Span: execute_tool flight_search
Status: ERROR
tool.input: {"origin": "NYC", "destination": "", "date": "2026-03-15"}
tool.output: {"error": "destination is required"}

丢弃理由: 主要为方法论概述,缺少完整配置命令或可复现步骤。

建议: 参考,作为多 Agent 调试框架补充读物。


6. AI Agents in Production: The Harness Dissected (Substack)

来源: aienhancedengineer.substack.com/p/ai-agents-in-production-the-harness 工程价值: 中 — 六组件框架完整,但缺源码/命令

保留理由: 六组件框架(reasoning、planning、tools、memory、state、I/O)清晰,适合作为 harness 设计 checklist。

丢弃理由: 主要是 checklist 类内容,OpenTelemetry 部分有框架概念但无具体配置示例。

建议: 参考。框架思路有价值,配套工具配置需从 awesome-harness-engineering 获取。


7. LLM Evaluation Frameworks, Metrics 2026 Edition

来源: futureagi.substack.com/p/llm-evaluation-frameworks-metrics 工程价值: 中 — 工具对比表

保留理由: 工具对比表(Opik / Langfuse / DeepEval / Maxim)有一定参考价值。

丢弃理由: 主要为工具罗列,无新 benchmark 数据或评测方法创新。

建议: 参考,补充工具选型。


8. awesome-rag-production (GitHub)

来源: github.com/Yigtwxx/awesome-rag-production 工程价值: 中高 — 选型指南具体

保留理由: 选型指南具体: - MTEB Retrieval scores (nDCG@10 on BEIR) 作为主 benchmark - "Always use the same model for indexing and querying — mismatched models are a silent recall killer" - 嵌入式多语言:推荐 BGE-M3 / Cohere embed-v4 / jina-embeddings-v3

丢弃理由: 为 awesome list,非原始工程文档。

建议: 参考。适合作为 RAG 选型 checklist 的补充来源。


9. Multi-Agent AI for Production Security Operations (InfoQ)

来源: infoq.com/articles/multi-agent-security-operations 工程价值: 中 — 含 JSON-RPC 格式示例

保留理由: 包含具体 A2A+MCP 集成 JSON 格式:

{
  "task_id": "tsk_2026-03-24_8c1b9f",
  "from_agent": "triage.v3",
  "to_agent": "detection_engineering.v2",
  "intent": "synthesize_detection",
  "context_refs": ["mcp://asset-inventory/..."]
}

丢弃理由: InfoQ 文章深度有限,更多为案例描述而非技术实现细节。

建议: 参考 A2A+MCP 集成格式示例。


❌ 丢弃

条目 丢弃理由
awesome-ai-agents-2026 (GitHub) Awesome list,无原创工程内容
learnaitogethernewsletter Substack "Top 7 Resources" 学习资源列表,无工程细节
"A Developer's Guide to Production-Ready AI Agents" (Google Cloud) 官方文档 overview,缺少新 benchmark 数据
LinkedIn Suleman Shah "Measuring RAG" LinkedIn 帖子,内容偏经验分享,缺完整可复现步骤

今日主题分类标签

#RAG联合优化 #推理引擎选型 #AgentHarness #多Agent调试 #A2A_MCP协议 #KVCache #vLLM_SGLang #安全配置


建议写入路径

草稿文件: /shared/research-kb/inbox/jay/2026-08-10T1050-jay-engineering-filter.md ✅ 已写入

是否需要精读/审稿: - arxiv.org/html/2608.03487v1 (RAG-Stack) — 建议精读,纳入 RAG 性能调优主题页 - arxiv.org/html/2608.03222v1 (Fail-Fast Restart) — 建议审稿,纳入 Agent 调试最佳实践 - gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026 — 建议纳入推理引擎选型主题页

CSDN 高价值条目: 本轮未发现新 CSDN 高价值文章(今日上午已有覆盖)


附:Substack 来源追踪记录

来源 专栏名 可信度 收录原因
futureagi.substack.com Future AGI LLM eval + multi-agent tracing 有工程框架
aienhancedengineer.substack.com AI Enhanced Engineer (Leopoldo García Vargas) 中高 Harness 六组件框架完整
shashikant86.substack.com Shashikant AHE 论文深度解读
cobusgreyling.substack.com Cobus Greyling Auto AHE 分析
learnaitogethernewsletter.substack.com Learn AI Together 资源列表,缺工程细节