Jay 工程实践筛选 · 2026-08-10 10:50
任务属性
- 实例: Jay
- 执行时间: 2026-08-10 10:50 (Asia/Shanghai)
- 检索范围: arXiv (本周新) / GitHub / Substack (Agent harness/RAG/MCP/A2A) / 工程对比评测
- 主题: 工程筛选第二轮 — RAG 联合优化 · Agent Harnes 工程 · 多协议栈 · 推理引擎工程
筛选结果概览
| 状态 | 条目数 | 说明 |
|---|---|---|
| ✅ 保留(精读) | 4 | 含真实环境、命令、benchmark 数据、源码路径 |
| ⚠️ 保留(参考) | 5 | 有洞察但需核验或为 overview |
| ❌ 丢弃 | 4 | 为 overview/列表类,无工程细节 |
✅ 保留(精读)
1. RAG-Stack: Co-Optimizing RAG Serving Performance and Quality
来源: arxiv.org/html/2608.03487v1
可信度: 高 — MLSys 2026 相关会议论文
工程类型: 推理系统 × RAG 调度联合优化
保留理由: 包含真实 benchmark 数据和具体反直觉发现: - ReAct agentic 模式反而比顺序 pipeline 更快(quality-cost trade-off) - Query expansion 在某些配置下牺牲吞吐但 quality gain 有限 - 更大 generator 并不总是提升 quality(量化数据支撑) - RAG-PE 将 MOBO 扩展为 stage-aware diagnostic + heterogeneous candidate generation
含真实数据:
"agentic ReAct (Yao et al., 2023) can be faster than a sequential pipeline at a modest quality cost, query expansion sacrifices throughput for a quality gain that appears only in some configurations, and even a larger generator does not always improve quality"
建议: 精读 Section 4(trade-off 分析)+ Section 6(serving system co-design)。可作为 RAG 生产调优的量化参考框架。
链接: https://arxiv.org/html/2608.03487v1
2. SGLang vs vLLM vs TensorRT-LLM 2026 工程对比(含生产安全警告)
来源: gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026 + servermo.com/blogs/sglang-vs-vllm-benchmark
可信度: 高 — 引用 cloudai.pt H100 benchmark suite (2026) 独立测量
工程类型: 推理引擎选型实战
保留理由: 包含具体 benchmark 数据 + 生产安全警告(0.0.0.0 暴露):
具体数据(H100 SXM5 80GB, Llama 3.3 70B FP8): | 引擎 | 1 request | 50 concurrent | |------|----------|--------------| | TensorRT-LLM | 基准 | +13% vs vLLM | | SGLang | ~equal | ~equal | | vLLM | -8% | 基准 |
- SGLang RadixAttention 在 shared-prefix 场景下最高领先 vLLM 29%(独立测量)
- ServerMO 文章包含关键安全警告:
vllm serve --host 0.0.0.0会直接将引擎暴露公网,无内置认证
含生产命令:
# ⚠️ 错误示范(来自文章真实案例)
vllm serve --host 0.0.0.0
sglang.launch_server --host 0.0.0.0
# 正确做法:通过 Reverse Proxy 暴露
建议: 精读。收录为推理引擎选型 + 生产安全 checklist。
链接: https://gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026
3. Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks
来源: arxiv.org/html/2608.03222v1
可信度: 高 — arXiv 2026-08 新论文
工程类型: Agent 调试 × 源码级解决方案
保留理由: 包含源码级发现和具体工程洞察:
核心问题:verbose text summaries 会导致 LLM anchoring effect,让重启 agent 锁定在之前错误推理路径。
源码级解决方案(来自原文):
"Instead of preserve the agent's physical code edits as a clean, environment-level overlay: a fresh rollout inherits no prior prompt history, but is warm-started with access to the aborted repository edits"
通过保留代码编辑(而非文字摘要),让重启 agent 在干净 prompt 上下文下 warm-start,避免 LLM anchoring。
建议: 精读。纳入 Agent 调试工程实践库。
链接: https://arxiv.org/html/2608.03222v1
4. Agentic Harness Engineering: The Next Frontier + Auto Agentic Harness Engineering (Substack 双篇)
来源: shashikant86.substack.com + cobusgreyling.substack.com
可信度: 中高 — Substack 技术分析,引用原始论文
工程类型: Agent 评测 harness 工程
保留理由: 包含具体量化数据和框架概念: - AHE 论文在 Terminal-Bench 2 上:seed 69.7% → evolved 77.0%,超过 Codex-CLI hand-crafted 71.9% - Fix-precision 33.7%,Regression-precision 11.8%(关键发现:forward justification 廉价,defensive prediction 昂贵) - "The model is rented. The harness is owned." — 框架概念清晰 - Layered evidence corpus 结构:Task-level outcomes / Root-cause analysis / Benchmark-level summaries
建议: 参考。核心工程理念有价值,但量化数据需对照原始论文核实。
⚠️ 保留(参考)
5. How to Trace and Debug Multi-Agent Systems: Production Guide
来源: futureagi.substack.com/p/how-to-trace-and-debug-multi-agent
工程价值: 中 — 含 OpenTelemetry 实践 + 真实错误案例
保留理由: 包含真实 trace 数据示例:
Span: execute_tool flight_search
Status: ERROR
tool.input: {"origin": "NYC", "destination": "", "date": "2026-03-15"}
tool.output: {"error": "destination is required"}
丢弃理由: 主要为方法论概述,缺少完整配置命令或可复现步骤。
建议: 参考,作为多 Agent 调试框架补充读物。
6. AI Agents in Production: The Harness Dissected (Substack)
来源: aienhancedengineer.substack.com/p/ai-agents-in-production-the-harness
工程价值: 中 — 六组件框架完整,但缺源码/命令
保留理由: 六组件框架(reasoning、planning、tools、memory、state、I/O)清晰,适合作为 harness 设计 checklist。
丢弃理由: 主要是 checklist 类内容,OpenTelemetry 部分有框架概念但无具体配置示例。
建议: 参考。框架思路有价值,配套工具配置需从 awesome-harness-engineering 获取。
7. LLM Evaluation Frameworks, Metrics 2026 Edition
来源: futureagi.substack.com/p/llm-evaluation-frameworks-metrics
工程价值: 中 — 工具对比表
保留理由: 工具对比表(Opik / Langfuse / DeepEval / Maxim)有一定参考价值。
丢弃理由: 主要为工具罗列,无新 benchmark 数据或评测方法创新。
建议: 参考,补充工具选型。
8. awesome-rag-production (GitHub)
来源: github.com/Yigtwxx/awesome-rag-production
工程价值: 中高 — 选型指南具体
保留理由: 选型指南具体:
- MTEB Retrieval scores (nDCG@10 on BEIR) 作为主 benchmark
- "Always use the same model for indexing and querying — mismatched models are a silent recall killer"
- 嵌入式多语言:推荐 BGE-M3 / Cohere embed-v4 / jina-embeddings-v3
丢弃理由: 为 awesome list,非原始工程文档。
建议: 参考。适合作为 RAG 选型 checklist 的补充来源。
9. Multi-Agent AI for Production Security Operations (InfoQ)
来源: infoq.com/articles/multi-agent-security-operations
工程价值: 中 — 含 JSON-RPC 格式示例
保留理由: 包含具体 A2A+MCP 集成 JSON 格式:
{
"task_id": "tsk_2026-03-24_8c1b9f",
"from_agent": "triage.v3",
"to_agent": "detection_engineering.v2",
"intent": "synthesize_detection",
"context_refs": ["mcp://asset-inventory/..."]
}
丢弃理由: InfoQ 文章深度有限,更多为案例描述而非技术实现细节。
建议: 参考 A2A+MCP 集成格式示例。
❌ 丢弃
| 条目 | 丢弃理由 |
|---|---|
| awesome-ai-agents-2026 (GitHub) | Awesome list,无原创工程内容 |
| learnaitogethernewsletter Substack "Top 7 Resources" | 学习资源列表,无工程细节 |
| "A Developer's Guide to Production-Ready AI Agents" (Google Cloud) | 官方文档 overview,缺少新 benchmark 数据 |
| LinkedIn Suleman Shah "Measuring RAG" | LinkedIn 帖子,内容偏经验分享,缺完整可复现步骤 |
今日主题分类标签
#RAG联合优化 #推理引擎选型 #AgentHarness #多Agent调试 #A2A_MCP协议 #KVCache #vLLM_SGLang #安全配置
建议写入路径
草稿文件: /shared/research-kb/inbox/jay/2026-08-10T1050-jay-engineering-filter.md ✅ 已写入
是否需要精读/审稿:
- arxiv.org/html/2608.03487v1 (RAG-Stack) — 建议精读,纳入 RAG 性能调优主题页
- arxiv.org/html/2608.03222v1 (Fail-Fast Restart) — 建议审稿,纳入 Agent 调试最佳实践
- gpuinsights.net/vllm-vs-sglang-vs-tensorrt-llm-2026 — 建议纳入推理引擎选型主题页
CSDN 高价值条目: 本轮未发现新 CSDN 高价值文章(今日上午已有覆盖)
附:Substack 来源追踪记录
| 来源 | 专栏名 | 可信度 | 收录原因 |
|---|---|---|---|
| futureagi.substack.com | Future AGI | 中 | LLM eval + multi-agent tracing 有工程框架 |
| aienhancedengineer.substack.com | AI Enhanced Engineer (Leopoldo García Vargas) | 中高 | Harness 六组件框架完整 |
| shashikant86.substack.com | Shashikant | 中 | AHE 论文深度解读 |
| cobusgreyling.substack.com | Cobus Greyling | 中 | Auto AHE 分析 |
| learnaitogethernewsletter.substack.com | Learn AI Together | 低 | 资源列表,缺工程细节 |