Jay 工程实践二次筛选 · 2026-08-09上午

筛选标准

  • 真实环境、命令、错误、源码、性能数据、可复现步骤
  • 排除:纯概述/列表/Vendor软文/付费门槛高的 Substack

✅ 保留条目

1. Agentic AI Benchmarks: The 2026 Enterprise Evaluation Guide

  • 来源: Automation Anywhere (vendor blog,但含实测数据)
  • URL: https://www.automationanywhere.com/company/blog/ai-agent-benchmarks
  • 保留理由: 含GBA-Bench实测数据——memory-augmented agent轨迹准确率提升20~47个百分点,客服流失预防agent轨迹准确率从0.12→0.59(4.9×),目标完成率提升32个百分点;工具调用减少~20%。列出τ-bench(pass^k可靠度指标)、AgentBench、WebArena、SWE-bench、MedAgentBench的对比维度说明。
  • 丢弃风险: Vendor文,需交叉验证数据来源;适合作为 benchmark 选型参考而非直接引用。
  • 标签: agent-eval benchmark production
  • 可复现: 部分(GBA-Bench场景描述有,完整命令缺失)

2. Stanford AI Index 2026 Benchmark Performance Gains (Dave Costenaro LinkedIn)

  • 来源: LinkedIn (二次引用 Stanford AI Index 2026)
  • URL: https://www.linkedin.com/posts/davidcostenaro_benchmarks-in-agentic-ai-showed-remarkable-activity-7457587035407691776-wAl8
  • 保留理由: 2025→2026性能提升具体数字:OSWorld 12%→66%、WebArena 15%→74%、Cybench 15%→93%、GAIA 15%→75%、MLE-bench 17%→65%。提出"jagged frontier"概念——能力足够部署但不可靠。Google 75%新代码AI生成且需工程师审核,Anthropic报90%。数据点可作为知识库量化依据。
  • 丢弃风险: LinkedIn二次引用,需核验Stanford原文。
  • 标签: agent-eval benchmark jagged-frontier
  • 可复现: 否(二次引用数字,但来源方向可信)

3. arxiv 2606.26959 — The Shift to Agentic AI: Evidence from Codex

  • 来源: arxiv (学术论文)
  • URL: https://arxiv.org/html/2606.26959v1
  • 保留理由: 来自OpenAI内部的真实部署数据——Codex自2026年1月至4月将日运行时长降低88%;各职能部门在5月从~20% agent使用率快速升至75%。说明从对话AI到agentic工具的内部迁移速度和模式。含具体时间线和百分比。
  • 丢弃风险: OpenAI内部数据,作者与机构利益相关;缺乏具体技术实现细节。
  • 标签: agentic-ai production-data openai
  • 可复现: 否(内部数据)

4. arxiv 2502.20969 — TeleRAG: Efficient RAG Inference with Lookahead Retrieval (MLSys 2026)

  • 来源: arxiv (MLSys 2026 peer-reviewed)
  • URL: https://arxiv.org/pdf/2502.20969
  • 保留理由: 含Artifact附录——源码、评估脚本、数据集全部公开;实验覆盖单GPU延迟(RTX4090)、单GPU吞吐(H100)、多GPU扩展(H200)、prefetch集群命中率;GNU Make + Docker容器化保证可复现;pipeline阶段(pre-retrieval generation / retrieval / post-retrieval generation / judgment)描述清晰。
  • 丢弃风险: 低。学术顶会 + 完整artifact。
  • 标签: RAG inference-optimization mlsys-2026 reproducible
  • 可复现: 是(Docker + Makefile)

5. arxiv 2512.05411v2 — MetaRAG: Enterprise Knowledge Retrieval with LLM-Generated Metadata

  • 来源: arxiv (IEEE CAI 2026accepted)
  • URL: https://arxiv.org/html/2512.05411v2
  • 保留理由: 3×3因子设计(3种chunking × 3种embedding);三种metadata集成方法对比(content-only / TF-IDF weighted / prefix-fusion);prefix-fusion consistently outperforms;明确消融实验结论;技术文档RAG场景具体。
  • 丢弃风险: 低。IEEE CAI 2026正式接收,有方法论。
  • 标签: RAG metadata chunking evaluation
  • 可复现: 是(因子设计可复现)

6. AI Agents Roadmap 2026 [Ship or Die] (Himanshu Ramchandani, Substack)

  • 来源: himanshuramchandani.substack.com
  • URL: https://himanshuramchandani.substack.com/p/ai-agents-architect-2026-ship-or
  • 保留理由: 阶段二包含可执行工程路径:FastAPI动态服务路由器分类请求并路由到专用ReAct循环;完整Docker化;pytest真实测试。提出多agent编排是2026年企业默认需求。Gartner 40% agentic AI项目将取消(因demo到生产gap)。实操路线图而非泛泛而谈。
  • 丢弃风险: 中(Substack免费内容有限,完整内容付费);但免费部分已有足够工程细节。
  • 标签: agentic-ai multi-agent production-path fastapi react
  • 可复现: 部分(架构描述有,具体命令需订阅)

7. TinyCommand — Best Open Source AI Agent Frameworks in 2026 (Compared)

  • 来源: tinycommand.com
  • URL: https://tinycommand.com/ai-agents/open-source-ai-agent-frameworks
  • 保留理由: 7个框架逐一给出真实评价(非列表),指出LangGraph 1.0(2025年10月)经过Uber/LinkedIn/Klarna生产验证,OS-level难度但stateful生产agent最强;n8n有400+集成但AI Agent node是附加层非核心。对框架选型有实操指导价值。
  • 丢弃风险: 低。评价框架真实,不止于GitHub stars。
  • 标签: agent-frameworks langgraph n8n production
  • 可复现: 否(对比分析,非执行步骤)

8. Future AGI — Top 5 Agentic AI Frameworks to Watch in 2026

  • 来源: futureagi.substack.com
  • URL: https://futureagi.substack.com/p/top-5-agentic-ai-frameworks-to-watch
  • 保留理由: CrewAI、AutoGen、LangGraph、Microsoft Agent Framework、MetaGPT逐一对比;指出BabyAGI适合实验但缺observability和error handling;Gartner预测2027年1/3 agentic AI部署将运行multi-agent;MarketsandMarkets数据——AI agents市场2025年$7.84B→2030年$52.62B,CAGR 46.3%。
  • 丢弃风险: 低。行业数据 + 框架选型建议。
  • 标签: agent-frameworks crewai autogen langgraph market-data
  • 可复现: 否(行业分析)

❌ 丢弃条目

条目 丢弃理由
Agentifying Agentic AI (arxiv 2511.17332) 概念性论文,缺乏工程细节/命令/代码
arxiv 2605.08956 — Agentic AI Scientists Not Built 学术批评,无实现/性能数据
SF-RAG (arxiv 2602.13647) snippet截断,无法判断实际工程价值
AI Engineering Blueprint for On-Premises RAG (arxiv 2604.01395) snippet截断,标题有工程感但内容不可见
AutothinkRAG (arxiv 2603.05551) snippet仅框架描述,无性能数据
FT-RAG (arxiv 2605.01495) snippet仅方法名罗列,无可复现步骤
aiamastery.substack.com — Production AI Engineering 付费课程推广,公开内容不足以评估
breakingthebottleneck.substack.com — 2026 Manufacturing 制造业AI,非LLM/Agent工程实践
alexeyondata.substack.com — AI Engineer Role 2026 行业趋势分析,无命令/代码/性能
ByteByteGo — What's Next in AI 2026 免费内容单薄,Orkes Conductor软文
jakobnielsenphd.substack.com — 18 Predictions 2026 UX/预测类,无工程内容
techwithibrahim.medium.com — Top 10 GitHub Stars AI Frameworks 仅stars列表,无内容深度
github.com/topics/agent-framework 索引页,非可消费内容

建议写入路径

  • 主要写入: /shared/research-kb/inbox/jay/2026-08-09T1050-jay-engineering-filter.md
  • 精读/审稿建议: 1. TeleRAG artifact (MLSys 2026) — 建议精读源码和Makefile,用于复现RAG推理优化 2. MetaRAG — 建议审稿,3×3因子设计对RAG调优有直接参考价值 3. TinyCommand LangGraph评价 — 建议纳入agent框架选型参考页
  • 不需要写入: 其他条目作为mental cache保留,不写文件

本次检索范围回顾

  • site:arxiv.org — agentic AI systems evaluation, RAG technical implementation, AI engineering on-prem
  • site:github.com — trending AI engineering (结果全为索引页/平台页,无实质内容)
  • site:substack.com — AI agents engineering production 2026
  • Tavily Search — agent benchmarks, framework comparisons
  • GitHub Topics agent-framework — haasteam/haystack/pydantic-ai/openfang/eigent/microsoft/agent-framework

Substack 覆盖率: 8个候选,4个保留(FutureAGI、himanshuramchandani);其余4个因付费墙/内容单薄丢弃。