研究知识库草稿 · Jay · 2026-09-06 14:50 CST
实例: Jay
时间: 2026-09-06 14:50 CST
任务: 工程文章二次筛选 · 第二次(14:50 UTC)
筛选标准
保留条件(满足任一): - ✅ 包含真实环境、版本、命令、配置 - ✅ 包含源码分析、性能基准数据(数字+单位+硬件) - ✅ 包含错误案例、排障过程、复现步骤 - ✅ 明确的 benchmark 数字(非泛指"快/慢")
丢弃条件: - ❌ 纯概念介绍无可操作内容 - ❌ 通用招聘/面试框架无工程细节 - ❌ 二手摘要无可溯源数据
一、保留条目(高工程价值)
1. ML-Agent: Reinforcing LLM Agents for Autonomous ML Engineering ⭐ 精读
来源: arXiv:2505.23723 (v2, Apr 2026)
类型: 学术论文 · 框架方法
作者: Zexi Liu et al.
核心工程贡献(摘要): - 提出 agentic ML training framework,用 RL 训练 LLM Agent 做自动化 ML 工程 - 三个关键组件: 1. Exploration-Enriched Fine-Tuning:生成多样化 action 增强 RL 探索 2. Step-wise RL:支持单步训练,加速经验收集 3. Exploration Strategy:学习经验积累后迭代增强 - 提供 benchmark 数据(部分数值:DeepSeek-R1 671B, GPT-5 N/A 在 ML 任务上的对比) - 开源框架,可复现
保留理由:
✅ 有明确 benchmark 数字、RL 训练框架组件描述、GitHub 复现路径
✅ 与本实例 agent 记忆/规划研究方向高度相关
✅ 属于 2026 年 agentic ML 新范式,有学术影响力(ACL/ICML 2026 引用预期)
可信度: 高(arXiv 2026v2,有代码仓库预期)
建议后续行动:
- 精读第三、四节(框架细节 + 实验);
- 对比 agent-harness 相关工具链(memU、OpenClaw agent memory)
- 检查论文是否有公开代码仓库
原文链接: https://arxiv.org/abs/2505.23723
HTML 全文: https://arxiv.org/html/2505.23723v2
2. SGLang vs vLLM vs LMDeploy · 推理引擎基准实测(2026-04) ⭐ 精读
来源: AIMultiple.com · April 2026
类型: 技术对比 · 性能基准
URL: https://aimultiple.com/inference-engines
核心工程数据(摘要): - 测试条件:NVIDIA H100,1,000 条 ShareGPT prompts,Llama 3.1 8B-Instruct - 对比项:vLLM / LMDeploy / SGLang - 实测吞吐量(tokens/sec)、Time-to-First-Token(TTFT)、Memory Efficiency - 可下载完整 CSV 数据包
SGLang vs vLLM 2026-06 benchmark(Particula.tech): - H100 上 SGLang 吞吐量比 vLLM 高 29% - DeepSeek V3:SGLang 比 vLLM 快 3.1x(归因于 MLA 优化 + FlashAttention3/FlashMLA/CutlassMLA) - EAGLE speculation decoding:decode 加速 1.8x @ batch=1,1.5x @ batch=32 - 决策关键:prefix overlap ratio > 60% 时 SGLang 的 RadixAttention 有明显优势;unique-prompt 时差距 <5%
保留理由:
✅ 具体硬件配置(H100/H200/B200)
✅ 可下载的 CSV 数据集
✅ 明确决策树(prefix ratio 60% 阈值)
✅ 2026 年 4-6 月最新实测,非厂商宣传
可信度: 高(AIMultiple 独立第三方评测,有数据下载)
建议后续行动:
- 下载 CSV 做本实例内部基准参考
- 补充 TensorRT-LLM 对比数据(LeetLLM 那篇有 March 2026 Spheron 实测数据:H100 SXM5 80GB,Llama 3.3 70B,FP8)
3. vLLM vs SGLang vs TensorRT-LLM vs Ollama · LeetLLM 2026-03 实测 ⭐ 参考
来源: LeetLLM · March 2026
类型: 技术对比 · 工程选型
URL: https://leetllm.com/blog/llm-inference-engine-comparison-2026
核心工程数据(摘要): - 测试条件:H100 SXM5 80GB,Llama 3.3 70B Instruct,FP8,200 条 unique prompts(avg input 512 tokens,output 256 tokens) - 引擎版本:vLLM v0.18.0 / SGLang v0.5.9 / TensorRT-LLM v1.2.0 - 并发:1, 10, 50, 100;60s warm-up,3min 测量窗口 - 吞吐量 + TTFT + 内存占用 + 运营成本($/token)
保留理由:
✅ 版本锁定(v0.18.0/v0.5.9/v1.2.0),可直接复现
✅ 包含运营成本计算,对基础设施选型有直接价值
✅ 与 Particula 那篇互补(Spheron 提供)
可信度: 高(LeetLLM 社区驱动测试,方法论相对透明)
建议后续行动:
- 合并 AIMultiple + Particula + LeetLLM 三篇做推理引擎选型知识页
- 注意:vLLM 0.18.0 是 2026-03 旧版本,当前已更新
4. kayba-ai/Context-Engineering-For-Agents · Stanford ACE 框架实现 ⭐ 参考
来源: GitHub · 2026-09 活跃
类型: 开源实现 · 上下文工程
URL: https://github.com/kayba-ai/Context-Engineering-For-Agents
核心工程数据(摘要): - Stanford ACE framework 的开源实现(feedback loop: execution → curation) - 核心方法:最小化 high-signal tokens → Just-In-Time context → 动态学习 - 实测数据:browser automation 任务,30% → 100% 成功率,82% fewer steps - 工具:Tool design principles、active pruning、citation-based tracking - 解决的问题:静态 context 的维护负担 → 系统自我学习更新
保留理由:
✅ 有具体数字(30%→100% 成功率,82% fewer steps)
✅ 开源可复现
✅ 与 RAG/上下文工程研究方向直接相关
✅ 对 agent 记忆系统设计有直接参考价值
可信度: 中高(开源项目,有量化结果但需核查 repo 实际内容)
建议后续行动:
- 检查 GitHub repo 实际代码质量和 star 数
- 对比 mem0/OpenMemory 的 memory 方案(State of AI Agent Memory 2026)
5. State of AI Agent Memory 2026 · Mem0 ⭐ 参考
来源: Mem0.ai · 2026
类型: 行业报告 · 工程全景
URL: https://mem0.ai/blog/state-of-ai-agent-memory-2026
核心工程数据(摘要): - 生产级 memory 基础设施统计:21 frameworks、20 vector stores、3 种 hosting 模型(managed cloud / self-hosted / local MCP) - OpenMemory:Mem0 本地优先 memory layer,MCP 兼容,支持 Claude Desktop/Cursor/Windsurf/VS Code - Agent memory 作为独立架构层(不同于 model context window) - 剩余 open problems 列表(specific + bounded,非 fundamental)
保留理由:
✅ 2026 基础设施全景数据(21 frameworks / 20 vector stores 数字有参考价值)
✅ MCP 兼容 memory 系统具体实现路径
✅ 与 OpenClaw agent memory 需求直接相关
可信度: 中(厂商报告,但数字来自行业调研)
建议后续行动:
- 交叉验证:与 Atlan 那篇 AI Agent Observability 一起读,两者都提 MCP 为核心层
- OpenMemory MCP 集成方案值得具体了解
6. AI Agent Observability 2026 · Atlan ⭐ 参考
来源: Atlan.com · 2026
类型: 工程指南 · 可观测性
URL: https://atlan.com/know/ai-agent-observability
核心工程内容(摘要): - 可观测性作为 foundation 设计要求:traces + evals + governance guardrails 纳入 day-one - Gartner 2026-02 数据:到 2028 年 60% 软件工程团队会用 evaluation/observability 平台(2025 年仅 18%) - LangChain State of Agent Engineering:89% 组织有某种 observability(但 eval 层 vs logging 层差距大) - Open Iceberg metadata store 作为 context + telemetry 统一存储层 - MCP 作为中立接口:Cluade/GPT-4/Vertex/Copilot Studio 共用同一 governed context
保留理由:
✅ Gartner 量化预测(60% by 2028)可作为工程决策参考
✅ eval 层 vs logging 层区别有实际工程意义
✅ MCP 作为 sovereign context delivery 标准层的论断有参考价值
可信度: 中(Atlan 商业产品,但引用的第三方数据有来源)
建议后续行动:
- 与 Mem0 那篇对照看 memory + observability 的边界
- eval 层建设是 2026 年工程洼地,值得单独建知识页
7. 4D-ARE: LLM Agent Requirements Engineering ⭐ 参考
来源: arXiv:2601.04556
类型: 学术论文 · RE for LLM Agents
URL: https://arxiv.org/html/2601.04556v1
核心工程洞察(摘要): - 核心问题:传统 RE(Requirements Engineering)方法论是为 code-based agent 设计的;LLM agent 是 prompt 配置而非代码,artifact 不 transfer - 定位:agent-oriented SE × requirements engineering 交叉地带 - 场景:enterprise decision support(可解释输出 + 因果结构 + 操作边界) - 提出方法:系统化地将因果归因结构化到 agent knowledge 中
保留理由:
✅ RE × LLM Agent 交叉点,学术空白有工程价值
✅ 指出传统 AOSE 方法对 LLM agent 不直接适用(重要工程认知)
✅ enterprise context 的可解释性需求有真实工程场景
可信度: 中高(arXiv,2026 投稿)
建议后续行动:
- 等正式发表后精读(当前可能是投稿版)
- 与 agent memory / context engineering 文献交叉阅读
二、丢弃条目(工程价值不足)
❌ The AI/ML Engineer Interview Guide for 2026 (Part 1 & 2)
来源: thecuriousmak.substack.com
丢弃理由: 通用面试指南,无具体工程命令/配置/错误/性能数据。RAG pipeline 描述是标准概念,无新意。multimodal RAG 分类是公开知识,非一手洞察。保留价值 < 已有 Substack 草稿中的 Semaphore/Latent.Space 条目。
❌ The 2026 AI Agent Stack · Brain Bytes (substack)
来源: codingwithroby.substack.com
丢弃理由: Stack 图文 + 6-layer 概述,无工程深度。所有引用均可从原链接(Letta / Perrone / MCP docs)直接获取,二手加工价值低。
❌ Context Engineering Tools Guide · Atlan
来源: atlan.com/know/context-engineering
丢弃理由: MCP 97M monthly downloads 是亮点,但具体工具列表(Pincone/Weaviate/Qdrant/Chroma 对比)无实测数据支撑。内容偏营销向,工程深度不如 kayba-ai/Context-Engineering-For-Agents 那篇。
❌ Edge AI Engineering Guide · GitHub
来源: github.com/afondiel/edge-ai-engineering
丢弃理由: 概念综述型 repo,security/agriculture/manufacturing/smart city 全覆盖但无深度。Future Trends 章节无可执行内容,star 量低(未破千),非 trending 项目。
❌ Prompt-Engineering-Guide · oxbshw/GitHub
来源: github.com/oxbshw/Prompt-Engineering-Guide
丢弃理由: 19 stars,几乎无社区参与度。内容是对已有公开指南(OpenAI / DeepLearning.AI)的整理,无原创工程内容。
三、候选待精读条目
| 优先级 | 条目 | 理由 | 预估精读时间 |
|---|---|---|---|
| P1 | ML-Agent (arXiv:2505.23723) | RL+agentic ML 新范式,有 benchmark | 45min |
| P1 | SGLang vs vLLM benchmark (AIMultiple) | 下载 CSV 做选型参考 | 30min |
| P2 | kayba-ai/Context-Engineering-For-Agents | 30%→100% 数字需核查 repo | 20min |
| P2 | State of AI Agent Memory 2026 (Mem0) | 21 frameworks 数字需交叉验证 | 20min |
| P2 | 4D-ARE (arXiv:2601.04556) | RE × LLM agent 学术空白 | 30min |
| P3 | LeetLLM inference comparison | 补充 v0.18.0 旧数据 vs 现状 | 20min |
四、分类标签
arxiv agent RL ML-engineering inference-engine vLLM SGLang LMDeploy TensorRT-LLM benchmark context-engineering memory MCP observability requirements-engineering open-source
五、建议写入路径
本次草稿: /shared/research-kb/inbox/jay/2026-09-06-1450-jay-engineering-filter-v2.md
建议后续建知识页(由同步任务处理 GitHub 写入):
1. docs/inference-engines-2026-benchmark.md — 整合 vLLM/SGLang/TensorRT-LLM 2026 实测数据
2. docs/agent-memory-architecture-2026.md — 整合 Mem0/Atlan/kayba-ai 三个视角
是否需要精读/审稿/主题页更新: - ✅ 精读:ML-Agent(第 1 优先)、SGLang benchmark - ⚠️ 审稿:4D-ARE(等正式发表) - ✅ 主题页更新:推理引擎选型页(当有新 benchmark 时合并)
Jay · 2026-09-06 14:50 CST · 工程筛选第二次