Jay 工程筛选・下午第 3 轮(Oct 2, 2026)

检索时间: 2026-10-02 14:50 CST
检索范围: arXiv · GitHub Trending · Substack · Medium · Hugging Face
角色: Jay 工程二次筛选——真实环境、命令、错误、源码、性能数据、可复现步骤


一、保留条目

🔷 条目 1:agent-framework-benchmark — 多框架 Agent 基准测试

来源: GitHub | 作者: LukaszGrochal
链接: https://github.com/LukaszGrochal/agent-framework-benchmark
类型: 代码仓库 + 基准测试
可信度: 高(有 CI/命令、量化对比数据)

工程价值

  • 同一任务(Company Research Agent)在 5 个框架下实现:CrewAI 1.9.x / LangGraph 1.0.x / AutoGen 0.7.x / MS Agent Framework 1.0.0b / OpenAI Agents SDK
  • 提供真实命令和环境: bash ollama pull qwen3:14b # 本地模型拉取 uv run pytest # 测试执行 uv run jupyter notebook notebooks/analysis.ipynb # 结果分析
  • 重要发现:CrewAI 和 MS Agent Framework 依赖冲突(openai SDK 版本互斥),必须隔离环境
  • 量化结果:LangGraph 成功率 62% vs CrewAI 54%(复杂多步任务),AutoGen 进入维护模式
  • 45 runs × 3 iterations = 完整基准框架,可复现

保留理由

✅ 包含真实安装命令、环境依赖冲突警告、pytest 执行、量化对比结果

后续行动

→ 精读:notebooks/analysis.ipynb 分析结果
→ 关注:MS Agent Framework GA 时间(2026-03)及对 AutoGen 维护模式的影响


🔷 条目 2:GROUNDED — Production RAG 架构工程检查清单

来源: Medium | 作者: Vishal Mysore
链接: https://medium.com/@visrow/production-rag-architecture-in-2026-the-grounded-framework-guide-9074c2255167
类型: 工程方法论文章
可信度: 中(2026-09 发布,工程 checklist 框架)

工程价值

  • 提出 GROUNDED 8 字母 RAG 生产设计审查框架(G–R–O–U–N–D–E–D)
  • 关键指标锚点:
  • RAGAS Hit@5 > 80% 才允许上线
  • Faithfulness > 0.85 作为保真度门槛
  • RagEval4Java:Spring AI + VectorStore 上的 RAG 评估工具,支持 Precision/Recall/F1/MRR/nDCG/Hit@k
  • 提到 hybrid search + reranking 是"先测量再优化"的工程原则

保留理由

✅ 提供可量化的生产门槛指标(RAGAS),具有工程约束价值

后续行动

→ 核实:RAGAS Hit@5 / Faithfulness 指标在不同场景下的适用性
→ 关注:GROUNDED 各字母代表的 8 项工程决策具体内容


🔷 条目 3:LLM-Engineering 路线图 — Context Engineering 全景

来源: GitHub | 作者: tal7aouy
链接: https://github.com/tal7aouy/LLM-Engineering
类型: 路线图 + 知识整理
可信度: 中高(社区维护,整合多个 2026 方向)

工程价值

  • 明确 Context Engineering 是 2026 年"Prompt Engineering"的后继学科
  • Phase 6 Security & Advanced Topics 涵盖:
  • MCP(Model Context Protocol)
  • A2A(Agent-to-Agent Protocol)
  • Reasoning Models & Test-Time Compute
  • Computer-Use & Agent Runtimes
  • Modern Fine-Tuning & Post-Training
  • Inference Engines & Serving
  • 与 Substack 洞察互补:上下文管理 + MCP 工具生态

保留理由

✅ 系统化整理 context engineering 2026 全貌,可作为知识索引

后续行动

→ 归档至 context engineering 主题页


🔷 条目 4:ACE — Agentic Context Engineering(ICLR 2026)

来源: GitHub + arXiv | 作者: Qizheng Zhang 等(UCI + 多机构)
链接: https://github.com/rrahimi-uci/agentic-context-engineering | arXiv:2510.04618v3
类型: 学术实现 + 代码
可信度: 高(ICLR 2026 录用,GitHub 有完整实现)

工程价值

核心问题:Context Collapse(上下文压缩导致的准确率崩溃)

量化基准数据:

方法 准确率 Playbook 数量 备注
Base LLM(无上下文) 44.4% 0 基线
ACE(离线→评估) 83.3% 5 +38.9 pts
Monolithic rewrite(在线) 72.2% 4 2 次崩溃
ACE(在线) 88.3% 6 +46.6 pts
离线预热 + 在线 34.5% — ACE → 96.6% +62.1 pts
  • 核心发现:context rewrite 不要全量压缩,渐进式 playbook 演化更稳定
  • 提供 OpenAI Agents SDK 支持的 Faithful 实现

保留理由

✅ ICLR 2026 学术支撑 + 可复现 GitHub 代码 + 量化工程指标

后续行动

→ 精读 ACE GitHub README 中的 Live Demo 命令
→ 对比本文与 arXiv:2606.10209(Less Context, Better Agents)的工程权衡


🔷 条目 5:The AI Agents Stack 2026 — Substack 行业洞察

来源: Substack(The AI Engineer)
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
类型: 行业分析
可信度: 中(行业技术博客,高频更新)

工程洞察摘要

  1. Context Engineering 替代 Prompt Engineering:架构师设计 agent 每轮调用时"看到"什么信息,而非单纯写更好的 prompt
  2. Memory Blocks 出现:结构化命名字段,agent 可自行管理状态(保留/更新/丢弃)
  3. Agent Guardrails 成为独立学科:2024 年护栏 = 输入/输出过滤;2026 年护栏 = 工具调用授权 + 速率限制 + 行为验证
  4. Memory-first 架构:学习型 agent(跨 session 记忆偏好)+ 向量 DB + eval

保留理由

✅ 与本知识库已有的 context engineering 主题高度互补,提示词工程 → 上下文工程的工程范式转移

后续行动

→ 合并至已有的 context engineering 主题页更新


🔷 条目 6:agent-skill-evaluation — Agent Skill 2026 分类体系

来源: GitHub | 作者: Ding Kexin 等(UCI/NUIST)
链接: https://github.com/Cassie07/AgentSkill_Survey
类型: 综述 + 引用整理
可信度: 中高(arXiv:2606.11435)

工程价值

  • 2026 年 Agent Skill 评估体系分类:
  • Skill Utility: SkillsBench, SkillCraft
  • Skill Generation: SkillLearnBench
  • Retrieval & Routing: SkillRouter, SRA-Bench, AgentSkillOS Benchmark
  • Safety & Security: SkillTester, SkillGuardBench
  • Evolution: SkillForge, CoEvoSkills, EmbodiSkill, Skills-Coach
  • 引用 arXiv:2606.11435,来自学术机构

保留理由

✅ 系统化整理 2026 年 agent skill 评估体系,可作为 benchmark 索引

后续行动

→ 归档至 agent evaluation 主题页参考


二、丢弃条目

条目 来源 丢弃理由
LLM Agents Stack: Context is What You Need(Paulsen 2026) arXiv 实证研究描述性内容,无命令/代码/可复现步骤
HYVE: Hybrid Views for LLM Context Engineering over Machine Data arXiv:2604.05400 Cisco 研究,机器数据上下文工程,无公开可复现命令
awesome-evals GitHub 纯资源列表,无原创工程内容,仅链接合集
MLOps Learning Road / Coursera roadmap Coursera/商业课程 课程导览,无源码/命令,不符合"真实环境"标准
harish303118/MLOps-Engineering-with-Roadmap GitHub Star 21,低活跃度;内容为资源聚合,无原创代码

三、分类标签

  • context-engineering — 条目 3, 4, 5
  • agent-framework — 条目 1
  • rag-production — 条目 2
  • agent-evaluation — 条目 1, 6
  • benchmark — 条目 1, 4, 6

四、本次写入路径

建议写入:

/shared/research-kb/inbox/jay/2026-10-02T1450-jay-engineering-filter.md

五、后续行动建议

优先级 行动 对应条目
高 精读 agent-framework-benchmark 的 analysis.ipynb 完整结果 条目 1
高 对比 ACE 与 Less Context Better Agents 的 context 压缩策略 条目 4
中 将 The AI Engineer Substack 洞察合并至 context engineering 主题页 条目 5
中 核实 GROUNDED 框架 RAGAS 指标在不同 corpora 的适用性 条目 2
低 更新 agent evaluation 主题页:纳入 AgentSkill_Survey 分类体系 条目 6