Jay 工程筛选草稿 · 2026-07-15 晚间
检索范围: arXiv (cs.AI/cs.LG/cs.CL/cs.DC) + GitHub Trending + Substack 工程专栏 + 技术博客
检索时间窗口: 最近 ~30 天(侧重近 48h 新提交/新发布)
主题标签: LLM-Serving Agent-Memory Production-AI MLOps Inference-Optimization
✅ 保留条目(高价值工程内容)
1. arXiv:2603.07670 — Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers
| 字段 | 内容 |
|---|---|
| 作者 | Eric Du et al. |
| 发布时间 | 2026-03-08 (v1) |
| 来源 | arXiv cs.AI |
| 可信度 | ★★★★★ 学术同行评审级Survey,覆盖2022–2026年初工作 |
| 类型 | 学术 Survey |
核心观点摘要: - 将 Agent Memory 形式化为 write–manage–read 循环,耦合感知与行动 - 提出三维度分类法:时间范围(瞬时→永久)、表征基质(压缩/检索/反射/层次/策略学习)、控制策略 - 5大机制家族:上下文驻留压缩、检索增强存储、反思自我改进、层次虚拟上下文、策略学习管理 - 评估方向从静态召回基准转向多会话 Agent 测试,暴露当前系统在决策类任务中的持续短板 - 列出5个开放挑战:持续整合、因果检索、可信反思、学习遗忘、多模态具体记忆 - 涵盖工程现实:写路径过滤、矛盾处理、延迟预算、隐私治理
保留理由: 系统性 Survey,涵盖工程实现细节(延迟预算、隐私治理),覆盖 Mem0 等已落地方案,适合作为知识库 Agent Memory 主题页的骨干文献。
后续行动: 建议精读全文 + 提取 Table 1(机制家族对比表)+ 更新 Agent Memory 主题页。
2. arXiv:2605.01280 — LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics
| 字段 | 内容 |
|---|---|
| 作者 | Zijie Zhou et al. |
| 发布时间 | 2026-05-02 (v1) |
| 来源 | arXiv cs.DC |
| 可信度 | ★★★★☆ Position Paper,工程观察扎实,引用了 vLLM/SGLang 实际行为 |
| 类型 | 学术 Position Paper |
核心观点摘要: - 当前 vLLM/SGLang 的调度核心仍沿用经典分布式计算:JSQ/轮询路由、FIFO 调度、LRU KV Cache 驱逐 - 这些通用策略忽视了 LLM 推理的结构特殊性:动态增长的 KV Cache、prefill-decode 相位不对称、未知输出长度、连续批处理约束 - 主张引入运筹学方法(数学规划、排队论)设计有可证明性能保证的调度算法 - 论文批评"heuristic调优"路径不可预测,建议建立能捕获 LLM 特性的数学模型
保留理由: 清晰指出 vLLM/SGLang 的算法天花板,是 LLM Serving 性能优化方向的重要立场文献。适合作为 Inference Optimization 主题页的"问题定义"引用。
后续行动: 可用于审稿 LLM Serving 主题页;对比 WAIT 算法(arXiv:2504.11320)看实际工程验证。
3. Sabaoon.dev — Building AI Agent Memory That Actually Works in Production(2026-06-30)
| 字段 | 内容 |
|---|---|
| 作者 | Sabaoon(独立工程师博客) |
| 发布时间 | 2026-06-30 |
| 来源 | sabaoon.dev |
| 可信度 | ★★★★☆ 高密度工程实现,包含真实接口、Schema、Pipeline代码 |
| 类型 | 工程实践博客 |
核心观点摘要:
- 三Tier Memory架构:Tier1 Working Memory(Redis/ms级)→ Tier2 Episodic(PostgreSQL/MongoDB,分session存储)→ Tier3 Semantic(Qdrant/pgvector + GraphLayer)
- 上下文窗口塞入失败三大原因:非线性成本、"中间丢失"效应、动态数据陈旧
- Memory Injection Pipeline:含真实 TypeScript 接口定义(buildAgentContext 函数),含冲突解决逻辑
- Temporal Supersession:通过 valid_from/valid_until 字段管理事实时效,含 PostgreSQL Schema(semantic_facts 表)
- Vector DB选型对比表:Qdrant vs pgvector,列出各自适用场景与局限
保留理由: 罕见包含完整代码+DB Schema的生产级实现,可直接指导工程复现。远超"概念介绍"类文章。符合工程文章筛选标准:真实环境、命令、源码、Schema。
后续行动: 建议直接引用至 Agent Memory 主题页的"实现方案"章节;可作为复现案例入库。
4. MLflow Blog — Building Production-Ready AI Agents in 2026
| 字段 | 内容 |
|---|---|
| 作者 | MLflow Team |
| 发布时间 | 2026(具体日期待确认) |
| 来源 | mlflow.org |
| 可信度 | ★★★★☆ 框架官方博客,有具体架构原则 |
| 类型 | 工程博客 |
核心观点摘要(5条关键原则): 1. 模块化多Agent架构 + 路由层优于单体Agent(可靠性+可维护性) 2. 运行时治理不可或缺:确定性策略强制执行在模型层之下,防止越界行为到达网络层 3. 评估应嵌入工作流:在线审计性优于仅离线批分析 4. 安全边界在 Skill/Plugin 层:大多数运行时风险聚集于此,而非 LLM 层本身 5. 可观测性驱动持续改进:监控Faithfulness、漂移、幻觉率建立反馈闭环
保留理由: 5条原则均有架构含义,适合作为"生产Agent工程准则"入库。来源为知名 ML 平台,有一定背书。
后续行动: 建议入库为"工程准则/Checklist"条目,可引用至 Agentic AI 主题页。
5. Mem0.ai Blog — AI Agent Memory 2026: Progress Benchmark Report
| 字段 | 内容 |
|---|---|
| 作者 | Mem0 Team |
| 发布时间 | 2026(近期) |
| 来源 | mem0.ai/blog |
| 可信度 | ★★★☆☆ 公司官方博客,有benchmark数据但需交叉验证 |
| 类型 | 行业基准报告 |
核心观点摘要:
- Multi-scope memory设计模式:memory write带身份作用域标签(user_id/session_id/agent_id/org_id)
- 引用 Chhikala et al. Mem0论文(arXiv:2504.19413, ECAI 2025)作为基准来源
- 指出Graph memory在2024年仍属实验性,2026已有实用化进展
保留理由: 提供行业视角+benchmark引用线索,可作为 Mem0 论文(arXiv:2504.19413)的入口线索。
后续行动: 建议关联检索 arXiv:2504.19413,交叉验证 benchmark 数据。
6. The ML Engineer #392(Newsletter by Alejandro Saucedo)— 含 Datadog State of AI Engineering 数据
| 字段 | 内容 |
|---|---|
| 作者 | Alejandro Saucedo(Institute for Ethical ML) |
| 发布时间 | 2026-07近期 |
| 来源 | machinelearning.substack.com |
| 可信度 | ★★★★☆ 工程Newsletter标杆,内容经过筛选加工 |
| 类型 | Newsletter 精选 |
高价值内容摘要(Datadog报告提炼): - 多模型现状:>70% 组织使用3个或以上模型 - Agent框架采用率:近同比翻倍 - 系统提示占比:69%输入token为系统提示(高负载来源) - Prompt Caching:仅28%符合条件的调用使用了缓存(巨大优化空间) - Rate Limits:是生产LLM调用最大可靠性问题 - Agent复杂度:59% Agent仅做1次服务调用(简单→复杂的下一阶段挑战:分布式追踪/调试/治理) - 核心结论:AI工程现在需要与平台工程同等水平的工程纪律(模型网关、连续评估、提示布局、缓存、上下文工程、预算、退避、队列、备用容量)
保留理由: Datadog 数据来自1400+客户真实遥测,是目前最可信的生产AI采纳状态快照。Newsletter来源经过编辑筛选,减少噪声。
后续行动: 建议入库为"行业数据/生产统计"条目;引用至 MLOps/LLMOps 主题页。
7. arXiv:2605.16517 — Customizing an LLM for Enterprise Software Engineering(2026-05-15)
| 字段 | 内容 |
|---|---|
| 作者 | (待补充完整信息) |
| 发布时间 | 2026-05-15 |
| 来源 | arXiv cs.CL / cs.SE |
| 可信度 | ★★★★☆ 学术+工程交叉方向 |
| 类型 | 学术论文 |
核心观点摘要: - 将 LLM 定制为"代码转型专家":自动重构、性能改进 - 针对企业软件工程场景,有具体任务定义(代码重构、性能优化) - 属于 LLM + SE(Software Engineering)交叉方向
保留理由: Enterprise SE + LLM 方向的具体工作,可归档至"LLM Engineering + SE"主题线索。
后续行动: 建议获取PDF全文确认贡献类型(理论 vs 工程)。
❌ 丢弃条目(低价值/非工程类)
| 条目 | 丢弃理由 |
|---|---|
| PrinceSinghhub/Ultimate-AI-Engineer-Roadmap-2026 | GitHub Repo;内容为路线图+知识点列表,无原创工程内容 |
| louisfb01/start-ai-engineering | GitHub Repo;类似Coursera导览,无真实环境/命令/源码 |
| 0voice/awesome-2026-AI-Machine-Learning-1000Projects | GitHub Repo;纯列表聚合,无工程增量 |
| alexeygrigorev/ai-engineering-field-guide | GitHub Repo;数据来源说明详细但核心为岗位分析,非工程实现 |
| kodigitaccount/2026-ROADMAP-FOR-ADVANCE-ML | GitHub Repo;路线图PDF合集,无原创工程 |
| Sumanth077/ai-engineering-toolkit | GitHub Repo;工具列表,无深度分析 |
| javarevisited.substack.com 多篇 | Substack;内容为学习路线图/职业指南,非工程实现 |
| aiamastery.substack.com Sitemap | Substack;课程大纲目录,无实质工程内容 |
| alexeyondata.substack.com 毕业生项目 | Substack;课程项目展示,缺乏深度工程细节 |
| jamwithai.substack.com | Substack;起步指南类内容,非生产工程 |
| aiengineeringinsider.substack.com | Substack;营销性质强,工程价值低 |
| jamwithai / aiamastery 课程类 | Substack;学习类内容,不符合工程实现标准 |
| Hugging Face / agentops 播客 | Podcast形式;未做转录,无法结构化入库 |
📋 主题标签与建议路径
| 主题 | 关联条目 | 建议操作 |
|---|---|---|
LLM-Serving |
arXiv:2605.01280, arXiv:2603.07670, WAIT算法相关 | 更新 Inference Optimization 主题页;关联 arXiv:2504.11320 |
Agent-Memory |
arXiv:2603.07670, Sabaoon.dev, Mem0.ai, Mem0论文 | 优先更新 Agent Memory 主题页;Sabaoon案例可作为实现参考 |
Production-AI |
Datadog数据, MLflow博客, ML Engineer Newsletter | 入库为行业数据+工程准则 |
MLOps |
Datadog报告, MLflow原则 | 入库为 MLOps 现状数据点 |
Enterprise-LLM |
arXiv:2605.16517 | 归档为 LLM+SE 线索,待全文确认 |
🎯 精读/审稿/更新建议
-
Agent Memory 主题页更新(高优先级) - 骨干:arXiv:2603.07670(Sabaoon 3-Tier + Mem0 多scope模式补充) - 实现案例:Sabaoon.dev(含DB Schema + Pipeline代码) - 行业数据:Mem0 benchmark 报告
-
LLM Serving 主题页(中等优先级) - 问题定义:arXiv:2605.01280(Position Paper) - 关联 WAIT 算法:arXiv:2504.11320(需对比)
-
MLOps/LLMOps 现状数据(入库) - Datadog State of AI Engineering 2026(核心引用)
Jay · 2026-07-15 19:50 CST · 草稿待合并