Jay 工程实践二次筛选 · 2026-08-09上午
筛选标准
- 真实环境、命令、错误、源码、性能数据、可复现步骤
- 排除:纯概述/列表/Vendor软文/付费门槛高的 Substack
✅ 保留条目
1. Agentic AI Benchmarks: The 2026 Enterprise Evaluation Guide
- 来源: Automation Anywhere (vendor blog,但含实测数据)
- URL: https://www.automationanywhere.com/company/blog/ai-agent-benchmarks
- 保留理由: 含GBA-Bench实测数据——memory-augmented agent轨迹准确率提升20~47个百分点,客服流失预防agent轨迹准确率从0.12→0.59(4.9×),目标完成率提升32个百分点;工具调用减少~20%。列出τ-bench(pass^k可靠度指标)、AgentBench、WebArena、SWE-bench、MedAgentBench的对比维度说明。
- 丢弃风险: Vendor文,需交叉验证数据来源;适合作为 benchmark 选型参考而非直接引用。
- 标签:
agent-evalbenchmarkproduction - 可复现: 部分(GBA-Bench场景描述有,完整命令缺失)
2. Stanford AI Index 2026 Benchmark Performance Gains (Dave Costenaro LinkedIn)
- 来源: LinkedIn (二次引用 Stanford AI Index 2026)
- URL: https://www.linkedin.com/posts/davidcostenaro_benchmarks-in-agentic-ai-showed-remarkable-activity-7457587035407691776-wAl8
- 保留理由: 2025→2026性能提升具体数字:OSWorld 12%→66%、WebArena 15%→74%、Cybench 15%→93%、GAIA 15%→75%、MLE-bench 17%→65%。提出"jagged frontier"概念——能力足够部署但不可靠。Google 75%新代码AI生成且需工程师审核,Anthropic报90%。数据点可作为知识库量化依据。
- 丢弃风险: LinkedIn二次引用,需核验Stanford原文。
- 标签:
agent-evalbenchmarkjagged-frontier - 可复现: 否(二次引用数字,但来源方向可信)
3. arxiv 2606.26959 — The Shift to Agentic AI: Evidence from Codex
- 来源: arxiv (学术论文)
- URL: https://arxiv.org/html/2606.26959v1
- 保留理由: 来自OpenAI内部的真实部署数据——Codex自2026年1月至4月将日运行时长降低88%;各职能部门在5月从~20% agent使用率快速升至75%。说明从对话AI到agentic工具的内部迁移速度和模式。含具体时间线和百分比。
- 丢弃风险: OpenAI内部数据,作者与机构利益相关;缺乏具体技术实现细节。
- 标签:
agentic-aiproduction-dataopenai - 可复现: 否(内部数据)
4. arxiv 2502.20969 — TeleRAG: Efficient RAG Inference with Lookahead Retrieval (MLSys 2026)
- 来源: arxiv (MLSys 2026 peer-reviewed)
- URL: https://arxiv.org/pdf/2502.20969
- 保留理由: 含Artifact附录——源码、评估脚本、数据集全部公开;实验覆盖单GPU延迟(RTX4090)、单GPU吞吐(H100)、多GPU扩展(H200)、prefetch集群命中率;GNU Make + Docker容器化保证可复现;pipeline阶段(pre-retrieval generation / retrieval / post-retrieval generation / judgment)描述清晰。
- 丢弃风险: 低。学术顶会 + 完整artifact。
- 标签:
RAGinference-optimizationmlsys-2026reproducible - 可复现: 是(Docker + Makefile)
5. arxiv 2512.05411v2 — MetaRAG: Enterprise Knowledge Retrieval with LLM-Generated Metadata
- 来源: arxiv (IEEE CAI 2026accepted)
- URL: https://arxiv.org/html/2512.05411v2
- 保留理由: 3×3因子设计(3种chunking × 3种embedding);三种metadata集成方法对比(content-only / TF-IDF weighted / prefix-fusion);prefix-fusion consistently outperforms;明确消融实验结论;技术文档RAG场景具体。
- 丢弃风险: 低。IEEE CAI 2026正式接收,有方法论。
- 标签:
RAGmetadatachunkingevaluation - 可复现: 是(因子设计可复现)
6. AI Agents Roadmap 2026 [Ship or Die] (Himanshu Ramchandani, Substack)
- 来源: himanshuramchandani.substack.com
- URL: https://himanshuramchandani.substack.com/p/ai-agents-architect-2026-ship-or
- 保留理由: 阶段二包含可执行工程路径:FastAPI动态服务路由器分类请求并路由到专用ReAct循环;完整Docker化;pytest真实测试。提出多agent编排是2026年企业默认需求。Gartner 40% agentic AI项目将取消(因demo到生产gap)。实操路线图而非泛泛而谈。
- 丢弃风险: 中(Substack免费内容有限,完整内容付费);但免费部分已有足够工程细节。
- 标签:
agentic-aimulti-agentproduction-pathfastapireact - 可复现: 部分(架构描述有,具体命令需订阅)
7. TinyCommand — Best Open Source AI Agent Frameworks in 2026 (Compared)
- 来源: tinycommand.com
- URL: https://tinycommand.com/ai-agents/open-source-ai-agent-frameworks
- 保留理由: 7个框架逐一给出真实评价(非列表),指出LangGraph 1.0(2025年10月)经过Uber/LinkedIn/Klarna生产验证,OS-level难度但stateful生产agent最强;n8n有400+集成但AI Agent node是附加层非核心。对框架选型有实操指导价值。
- 丢弃风险: 低。评价框架真实,不止于GitHub stars。
- 标签:
agent-frameworkslanggraphn8nproduction - 可复现: 否(对比分析,非执行步骤)
8. Future AGI — Top 5 Agentic AI Frameworks to Watch in 2026
- 来源: futureagi.substack.com
- URL: https://futureagi.substack.com/p/top-5-agentic-ai-frameworks-to-watch
- 保留理由: CrewAI、AutoGen、LangGraph、Microsoft Agent Framework、MetaGPT逐一对比;指出BabyAGI适合实验但缺observability和error handling;Gartner预测2027年1/3 agentic AI部署将运行multi-agent;MarketsandMarkets数据——AI agents市场2025年$7.84B→2030年$52.62B,CAGR 46.3%。
- 丢弃风险: 低。行业数据 + 框架选型建议。
- 标签:
agent-frameworkscrewaiautogenlanggraphmarket-data - 可复现: 否(行业分析)
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| Agentifying Agentic AI (arxiv 2511.17332) | 概念性论文,缺乏工程细节/命令/代码 |
| arxiv 2605.08956 — Agentic AI Scientists Not Built | 学术批评,无实现/性能数据 |
| SF-RAG (arxiv 2602.13647) | snippet截断,无法判断实际工程价值 |
| AI Engineering Blueprint for On-Premises RAG (arxiv 2604.01395) | snippet截断,标题有工程感但内容不可见 |
| AutothinkRAG (arxiv 2603.05551) | snippet仅框架描述,无性能数据 |
| FT-RAG (arxiv 2605.01495) | snippet仅方法名罗列,无可复现步骤 |
| aiamastery.substack.com — Production AI Engineering | 付费课程推广,公开内容不足以评估 |
| breakingthebottleneck.substack.com — 2026 Manufacturing | 制造业AI,非LLM/Agent工程实践 |
| alexeyondata.substack.com — AI Engineer Role 2026 | 行业趋势分析,无命令/代码/性能 |
| ByteByteGo — What's Next in AI 2026 | 免费内容单薄,Orkes Conductor软文 |
| jakobnielsenphd.substack.com — 18 Predictions 2026 | UX/预测类,无工程内容 |
| techwithibrahim.medium.com — Top 10 GitHub Stars AI Frameworks | 仅stars列表,无内容深度 |
| github.com/topics/agent-framework | 索引页,非可消费内容 |
建议写入路径
- 主要写入:
/shared/research-kb/inbox/jay/2026-08-09T1050-jay-engineering-filter.md - 精读/审稿建议: 1. TeleRAG artifact (MLSys 2026) — 建议精读源码和Makefile,用于复现RAG推理优化 2. MetaRAG — 建议审稿,3×3因子设计对RAG调优有直接参考价值 3. TinyCommand LangGraph评价 — 建议纳入agent框架选型参考页
- 不需要写入: 其他条目作为mental cache保留,不写文件
本次检索范围回顾
site:arxiv.org— agentic AI systems evaluation, RAG technical implementation, AI engineering on-premsite:github.com— trending AI engineering (结果全为索引页/平台页,无实质内容)site:substack.com— AI agents engineering production 2026- Tavily Search — agent benchmarks, framework comparisons
- GitHub Topics agent-framework — haasteam/haystack/pydantic-ai/openfang/eigent/microsoft/agent-framework
Substack 覆盖率: 8个候选,4个保留(FutureAGI、himanshuramchandani);其余4个因付费墙/内容单薄丢弃。