Jay 工程筛选・下午第 3 轮(Oct 2, 2026)
检索时间: 2026-10-02 14:50 CST
检索范围: arXiv · GitHub Trending · Substack · Medium · Hugging Face
角色: Jay 工程二次筛选——真实环境、命令、错误、源码、性能数据、可复现步骤
一、保留条目
🔷 条目 1:agent-framework-benchmark — 多框架 Agent 基准测试
来源: GitHub | 作者: LukaszGrochal
链接: https://github.com/LukaszGrochal/agent-framework-benchmark
类型: 代码仓库 + 基准测试
可信度: 高(有 CI/命令、量化对比数据)
工程价值
- 同一任务(Company Research Agent)在 5 个框架下实现:CrewAI 1.9.x / LangGraph 1.0.x / AutoGen 0.7.x / MS Agent Framework 1.0.0b / OpenAI Agents SDK
- 提供真实命令和环境:
bash ollama pull qwen3:14b # 本地模型拉取 uv run pytest # 测试执行 uv run jupyter notebook notebooks/analysis.ipynb # 结果分析 - 重要发现:CrewAI 和 MS Agent Framework 依赖冲突(
openaiSDK 版本互斥),必须隔离环境 - 量化结果:LangGraph 成功率 62% vs CrewAI 54%(复杂多步任务),AutoGen 进入维护模式
- 45 runs × 3 iterations = 完整基准框架,可复现
保留理由
✅ 包含真实安装命令、环境依赖冲突警告、pytest 执行、量化对比结果
后续行动
→ 精读:notebooks/analysis.ipynb 分析结果
→ 关注:MS Agent Framework GA 时间(2026-03)及对 AutoGen 维护模式的影响
🔷 条目 2:GROUNDED — Production RAG 架构工程检查清单
来源: Medium | 作者: Vishal Mysore
链接: https://medium.com/@visrow/production-rag-architecture-in-2026-the-grounded-framework-guide-9074c2255167
类型: 工程方法论文章
可信度: 中(2026-09 发布,工程 checklist 框架)
工程价值
- 提出 GROUNDED 8 字母 RAG 生产设计审查框架(G–R–O–U–N–D–E–D)
- 关键指标锚点:
- RAGAS Hit@5 > 80% 才允许上线
- Faithfulness > 0.85 作为保真度门槛
RagEval4Java:Spring AI + VectorStore 上的 RAG 评估工具,支持 Precision/Recall/F1/MRR/nDCG/Hit@k- 提到 hybrid search + reranking 是"先测量再优化"的工程原则
保留理由
✅ 提供可量化的生产门槛指标(RAGAS),具有工程约束价值
后续行动
→ 核实:RAGAS Hit@5 / Faithfulness 指标在不同场景下的适用性
→ 关注:GROUNDED 各字母代表的 8 项工程决策具体内容
🔷 条目 3:LLM-Engineering 路线图 — Context Engineering 全景
来源: GitHub | 作者: tal7aouy
链接: https://github.com/tal7aouy/LLM-Engineering
类型: 路线图 + 知识整理
可信度: 中高(社区维护,整合多个 2026 方向)
工程价值
- 明确 Context Engineering 是 2026 年"Prompt Engineering"的后继学科
- Phase 6 Security & Advanced Topics 涵盖:
- MCP(Model Context Protocol)
- A2A(Agent-to-Agent Protocol)
- Reasoning Models & Test-Time Compute
- Computer-Use & Agent Runtimes
- Modern Fine-Tuning & Post-Training
- Inference Engines & Serving
- 与 Substack 洞察互补:上下文管理 + MCP 工具生态
保留理由
✅ 系统化整理 context engineering 2026 全貌,可作为知识索引
后续行动
→ 归档至 context engineering 主题页
🔷 条目 4:ACE — Agentic Context Engineering(ICLR 2026)
来源: GitHub + arXiv | 作者: Qizheng Zhang 等(UCI + 多机构)
链接: https://github.com/rrahimi-uci/agentic-context-engineering | arXiv:2510.04618v3
类型: 学术实现 + 代码
可信度: 高(ICLR 2026 录用,GitHub 有完整实现)
工程价值
核心问题:Context Collapse(上下文压缩导致的准确率崩溃)
量化基准数据:
| 方法 | 准确率 | Playbook 数量 | 备注 |
|---|---|---|---|
| Base LLM(无上下文) | 44.4% | 0 | 基线 |
| ACE(离线→评估) | 83.3% | 5 | +38.9 pts |
| Monolithic rewrite(在线) | 72.2% | 4 | 2 次崩溃 |
| ACE(在线) | 88.3% | 6 | +46.6 pts |
| 离线预热 + 在线 | 34.5% | — | ACE → 96.6% +62.1 pts |
- 核心发现:context rewrite 不要全量压缩,渐进式 playbook 演化更稳定
- 提供 OpenAI Agents SDK 支持的 Faithful 实现
保留理由
✅ ICLR 2026 学术支撑 + 可复现 GitHub 代码 + 量化工程指标
后续行动
→ 精读 ACE GitHub README 中的 Live Demo 命令
→ 对比本文与 arXiv:2606.10209(Less Context, Better Agents)的工程权衡
🔷 条目 5:The AI Agents Stack 2026 — Substack 行业洞察
来源: Substack(The AI Engineer)
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
类型: 行业分析
可信度: 中(行业技术博客,高频更新)
工程洞察摘要
- Context Engineering 替代 Prompt Engineering:架构师设计 agent 每轮调用时"看到"什么信息,而非单纯写更好的 prompt
- Memory Blocks 出现:结构化命名字段,agent 可自行管理状态(保留/更新/丢弃)
- Agent Guardrails 成为独立学科:2024 年护栏 = 输入/输出过滤;2026 年护栏 = 工具调用授权 + 速率限制 + 行为验证
- Memory-first 架构:学习型 agent(跨 session 记忆偏好)+ 向量 DB + eval
保留理由
✅ 与本知识库已有的 context engineering 主题高度互补,提示词工程 → 上下文工程的工程范式转移
后续行动
→ 合并至已有的 context engineering 主题页更新
🔷 条目 6:agent-skill-evaluation — Agent Skill 2026 分类体系
来源: GitHub | 作者: Ding Kexin 等(UCI/NUIST)
链接: https://github.com/Cassie07/AgentSkill_Survey
类型: 综述 + 引用整理
可信度: 中高(arXiv:2606.11435)
工程价值
- 2026 年 Agent Skill 评估体系分类:
- Skill Utility: SkillsBench, SkillCraft
- Skill Generation: SkillLearnBench
- Retrieval & Routing: SkillRouter, SRA-Bench, AgentSkillOS Benchmark
- Safety & Security: SkillTester, SkillGuardBench
- Evolution: SkillForge, CoEvoSkills, EmbodiSkill, Skills-Coach
- 引用 arXiv:2606.11435,来自学术机构
保留理由
✅ 系统化整理 2026 年 agent skill 评估体系,可作为 benchmark 索引
后续行动
→ 归档至 agent evaluation 主题页参考
二、丢弃条目
| 条目 | 来源 | 丢弃理由 |
|---|---|---|
| LLM Agents Stack: Context is What You Need(Paulsen 2026) | arXiv | 实证研究描述性内容,无命令/代码/可复现步骤 |
| HYVE: Hybrid Views for LLM Context Engineering over Machine Data | arXiv:2604.05400 | Cisco 研究,机器数据上下文工程,无公开可复现命令 |
| awesome-evals | GitHub | 纯资源列表,无原创工程内容,仅链接合集 |
| MLOps Learning Road / Coursera roadmap | Coursera/商业课程 | 课程导览,无源码/命令,不符合"真实环境"标准 |
harish303118/MLOps-Engineering-with-Roadmap |
GitHub | Star 21,低活跃度;内容为资源聚合,无原创代码 |
三、分类标签
context-engineering— 条目 3, 4, 5agent-framework— 条目 1rag-production— 条目 2agent-evaluation— 条目 1, 6benchmark— 条目 1, 4, 6
四、本次写入路径
建议写入:
/shared/research-kb/inbox/jay/2026-10-02T1450-jay-engineering-filter.md
五、后续行动建议
| 优先级 | 行动 | 对应条目 |
|---|---|---|
| 高 | 精读 agent-framework-benchmark 的 analysis.ipynb 完整结果 |
条目 1 |
| 高 | 对比 ACE 与 Less Context Better Agents 的 context 压缩策略 | 条目 4 |
| 中 | 将 The AI Engineer Substack 洞察合并至 context engineering 主题页 | 条目 5 |
| 中 | 核实 GROUNDED 框架 RAGAS 指标在不同 corpora 的适用性 | 条目 2 |
| 低 | 更新 agent evaluation 主题页:纳入 AgentSkill_Survey 分类体系 | 条目 6 |