Jay 工程筛选草稿 · 2026-07-15 晚间

检索范围: arXiv (cs.AI/cs.LG/cs.CL/cs.DC) + GitHub Trending + Substack 工程专栏 + 技术博客 检索时间窗口: 最近 ~30 天(侧重近 48h 新提交/新发布) 主题标签: LLM-Serving Agent-Memory Production-AI MLOps Inference-Optimization


✅ 保留条目(高价值工程内容)


1. arXiv:2603.07670 — Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers

字段 内容
作者 Eric Du et al.
发布时间 2026-03-08 (v1)
来源 arXiv cs.AI
可信度 ★★★★★ 学术同行评审级Survey,覆盖2022–2026年初工作
类型 学术 Survey

核心观点摘要: - 将 Agent Memory 形式化为 write–manage–read 循环,耦合感知与行动 - 提出三维度分类法:时间范围(瞬时→永久)、表征基质(压缩/检索/反射/层次/策略学习)、控制策略 - 5大机制家族:上下文驻留压缩、检索增强存储、反思自我改进、层次虚拟上下文、策略学习管理 - 评估方向从静态召回基准转向多会话 Agent 测试,暴露当前系统在决策类任务中的持续短板 - 列出5个开放挑战:持续整合、因果检索、可信反思、学习遗忘、多模态具体记忆 - 涵盖工程现实:写路径过滤、矛盾处理、延迟预算、隐私治理

保留理由: 系统性 Survey,涵盖工程实现细节(延迟预算、隐私治理),覆盖 Mem0 等已落地方案,适合作为知识库 Agent Memory 主题页的骨干文献。

后续行动: 建议精读全文 + 提取 Table 1(机制家族对比表)+ 更新 Agent Memory 主题页。


2. arXiv:2605.01280 — LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

字段 内容
作者 Zijie Zhou et al.
发布时间 2026-05-02 (v1)
来源 arXiv cs.DC
可信度 ★★★★☆ Position Paper,工程观察扎实,引用了 vLLM/SGLang 实际行为
类型 学术 Position Paper

核心观点摘要: - 当前 vLLM/SGLang 的调度核心仍沿用经典分布式计算:JSQ/轮询路由、FIFO 调度、LRU KV Cache 驱逐 - 这些通用策略忽视了 LLM 推理的结构特殊性:动态增长的 KV Cache、prefill-decode 相位不对称、未知输出长度、连续批处理约束 - 主张引入运筹学方法(数学规划、排队论)设计有可证明性能保证的调度算法 - 论文批评"heuristic调优"路径不可预测,建议建立能捕获 LLM 特性的数学模型

保留理由: 清晰指出 vLLM/SGLang 的算法天花板,是 LLM Serving 性能优化方向的重要立场文献。适合作为 Inference Optimization 主题页的"问题定义"引用。

后续行动: 可用于审稿 LLM Serving 主题页;对比 WAIT 算法(arXiv:2504.11320)看实际工程验证。


3. Sabaoon.dev — Building AI Agent Memory That Actually Works in Production(2026-06-30)

字段 内容
作者 Sabaoon(独立工程师博客)
发布时间 2026-06-30
来源 sabaoon.dev
可信度 ★★★★☆ 高密度工程实现,包含真实接口、Schema、Pipeline代码
类型 工程实践博客

核心观点摘要: - 三Tier Memory架构:Tier1 Working Memory(Redis/ms级)→ Tier2 Episodic(PostgreSQL/MongoDB,分session存储)→ Tier3 Semantic(Qdrant/pgvector + GraphLayer) - 上下文窗口塞入失败三大原因:非线性成本、"中间丢失"效应、动态数据陈旧 - Memory Injection Pipeline:含真实 TypeScript 接口定义(buildAgentContext 函数),含冲突解决逻辑 - Temporal Supersession:通过 valid_from/valid_until 字段管理事实时效,含 PostgreSQL Schema(semantic_facts 表) - Vector DB选型对比表:Qdrant vs pgvector,列出各自适用场景与局限

保留理由: 罕见包含完整代码+DB Schema的生产级实现,可直接指导工程复现。远超"概念介绍"类文章。符合工程文章筛选标准:真实环境、命令、源码、Schema。

后续行动: 建议直接引用至 Agent Memory 主题页的"实现方案"章节;可作为复现案例入库。


4. MLflow Blog — Building Production-Ready AI Agents in 2026

字段 内容
作者 MLflow Team
发布时间 2026(具体日期待确认)
来源 mlflow.org
可信度 ★★★★☆ 框架官方博客,有具体架构原则
类型 工程博客

核心观点摘要(5条关键原则): 1. 模块化多Agent架构 + 路由层优于单体Agent(可靠性+可维护性) 2. 运行时治理不可或缺:确定性策略强制执行在模型层之下,防止越界行为到达网络层 3. 评估应嵌入工作流:在线审计性优于仅离线批分析 4. 安全边界在 Skill/Plugin 层:大多数运行时风险聚集于此,而非 LLM 层本身 5. 可观测性驱动持续改进:监控Faithfulness、漂移、幻觉率建立反馈闭环

保留理由: 5条原则均有架构含义,适合作为"生产Agent工程准则"入库。来源为知名 ML 平台,有一定背书。

后续行动: 建议入库为"工程准则/Checklist"条目,可引用至 Agentic AI 主题页。


5. Mem0.ai Blog — AI Agent Memory 2026: Progress Benchmark Report

字段 内容
作者 Mem0 Team
发布时间 2026(近期)
来源 mem0.ai/blog
可信度 ★★★☆☆ 公司官方博客,有benchmark数据但需交叉验证
类型 行业基准报告

核心观点摘要: - Multi-scope memory设计模式:memory write带身份作用域标签(user_id/session_id/agent_id/org_id) - 引用 Chhikala et al. Mem0论文(arXiv:2504.19413, ECAI 2025)作为基准来源 - 指出Graph memory在2024年仍属实验性,2026已有实用化进展

保留理由: 提供行业视角+benchmark引用线索,可作为 Mem0 论文(arXiv:2504.19413)的入口线索。

后续行动: 建议关联检索 arXiv:2504.19413,交叉验证 benchmark 数据。


6. The ML Engineer #392(Newsletter by Alejandro Saucedo)— 含 Datadog State of AI Engineering 数据

字段 内容
作者 Alejandro Saucedo(Institute for Ethical ML)
发布时间 2026-07近期
来源 machinelearning.substack.com
可信度 ★★★★☆ 工程Newsletter标杆,内容经过筛选加工
类型 Newsletter 精选

高价值内容摘要(Datadog报告提炼): - 多模型现状:>70% 组织使用3个或以上模型 - Agent框架采用率:近同比翻倍 - 系统提示占比:69%输入token为系统提示(高负载来源) - Prompt Caching:仅28%符合条件的调用使用了缓存(巨大优化空间) - Rate Limits:是生产LLM调用最大可靠性问题 - Agent复杂度:59% Agent仅做1次服务调用(简单→复杂的下一阶段挑战:分布式追踪/调试/治理) - 核心结论:AI工程现在需要与平台工程同等水平的工程纪律(模型网关、连续评估、提示布局、缓存、上下文工程、预算、退避、队列、备用容量)

保留理由: Datadog 数据来自1400+客户真实遥测,是目前最可信的生产AI采纳状态快照。Newsletter来源经过编辑筛选,减少噪声。

后续行动: 建议入库为"行业数据/生产统计"条目;引用至 MLOps/LLMOps 主题页。


7. arXiv:2605.16517 — Customizing an LLM for Enterprise Software Engineering(2026-05-15)

字段 内容
作者 (待补充完整信息)
发布时间 2026-05-15
来源 arXiv cs.CL / cs.SE
可信度 ★★★★☆ 学术+工程交叉方向
类型 学术论文

核心观点摘要: - 将 LLM 定制为"代码转型专家":自动重构、性能改进 - 针对企业软件工程场景,有具体任务定义(代码重构、性能优化) - 属于 LLM + SE(Software Engineering)交叉方向

保留理由: Enterprise SE + LLM 方向的具体工作,可归档至"LLM Engineering + SE"主题线索。

后续行动: 建议获取PDF全文确认贡献类型(理论 vs 工程)。


❌ 丢弃条目(低价值/非工程类)

条目 丢弃理由
PrinceSinghhub/Ultimate-AI-Engineer-Roadmap-2026 GitHub Repo;内容为路线图+知识点列表,无原创工程内容
louisfb01/start-ai-engineering GitHub Repo;类似Coursera导览,无真实环境/命令/源码
0voice/awesome-2026-AI-Machine-Learning-1000Projects GitHub Repo;纯列表聚合,无工程增量
alexeygrigorev/ai-engineering-field-guide GitHub Repo;数据来源说明详细但核心为岗位分析,非工程实现
kodigitaccount/2026-ROADMAP-FOR-ADVANCE-ML GitHub Repo;路线图PDF合集,无原创工程
Sumanth077/ai-engineering-toolkit GitHub Repo;工具列表,无深度分析
javarevisited.substack.com 多篇 Substack;内容为学习路线图/职业指南,非工程实现
aiamastery.substack.com Sitemap Substack;课程大纲目录,无实质工程内容
alexeyondata.substack.com 毕业生项目 Substack;课程项目展示,缺乏深度工程细节
jamwithai.substack.com Substack;起步指南类内容,非生产工程
aiengineeringinsider.substack.com Substack;营销性质强,工程价值低
jamwithai / aiamastery 课程类 Substack;学习类内容,不符合工程实现标准
Hugging Face / agentops 播客 Podcast形式;未做转录,无法结构化入库

📋 主题标签与建议路径

主题 关联条目 建议操作
LLM-Serving arXiv:2605.01280, arXiv:2603.07670, WAIT算法相关 更新 Inference Optimization 主题页;关联 arXiv:2504.11320
Agent-Memory arXiv:2603.07670, Sabaoon.dev, Mem0.ai, Mem0论文 优先更新 Agent Memory 主题页;Sabaoon案例可作为实现参考
Production-AI Datadog数据, MLflow博客, ML Engineer Newsletter 入库为行业数据+工程准则
MLOps Datadog报告, MLflow原则 入库为 MLOps 现状数据点
Enterprise-LLM arXiv:2605.16517 归档为 LLM+SE 线索,待全文确认

🎯 精读/审稿/更新建议

  1. Agent Memory 主题页更新(高优先级) - 骨干:arXiv:2603.07670(Sabaoon 3-Tier + Mem0 多scope模式补充) - 实现案例:Sabaoon.dev(含DB Schema + Pipeline代码) - 行业数据:Mem0 benchmark 报告

  2. LLM Serving 主题页(中等优先级) - 问题定义:arXiv:2605.01280(Position Paper) - 关联 WAIT 算法:arXiv:2504.11320(需对比)

  3. MLOps/LLMOps 现状数据(入库) - Datadog State of AI Engineering 2026(核心引用)


Jay · 2026-07-15 19:50 CST · 草稿待合并