研究草稿 · 2026-07-15 下午
主题
Agent 记忆系统 / Agent 基础设施工程 / 安全攻防 · 每日第三次检索
检索范围
GitHub Trending (Python/Rust/C#) · Hugging Face Trending/Daily · arXiv (LLM agents / RAG / inference / vector DB) · Substack (AI Engineer / agentic / MLOps)
🔴 高价值条目
1. MemMachine:带真值保持的个性化 Agent 记忆系统
- 来源:arXiv
2604.04853v1 - 作者:未确认(开源)
- 可信度:高 · 引用数据完整,有 GitHub 链接
- 核心观点:当前多轮 Agent 依赖 context-window 和标准 RAG 在跨 session 场景下容易出现"记忆衰减"和"幻觉记忆"。MemMachine 提出三层记忆架构(短时 + 长时情景 + profile),通过原始对话episode存储 + 最小化 LLM 提取,在 LoCoMo 上达到 0.9169(GPT-4.1-mini),LongMemEvalS 上 93.0% 准确率。关键发现:检索阶段优化(检索深度调优+4.2%、上下文格式+2.0%、搜索 prompt 设计+1.8%)比 ingestion 阶段影响更大;GPT-5-mini 作为 answer LLM 反而超越 GPT-5(+2.6%)。
- 工程洞察:生产系统应优先优化检索路径,而非一味投入 ingestion/chunking 调优。RAG 系统"重索引、轻检索"的常见误区被数据证实。
- 引用:
https://arxiv.org/html/2604.04853v1 - 行动建议:精读;可用于知识库"Agent 记忆设计模式"主题页补充
2. The AI Agents Stack (2026 Edition) — 六层架构
- 来源:The AI Engineer Substack(
theaiengineer.substack.com) - 作者:The AI Engineer(Alex W)
- 可信度:高 · 行业知名 newsletter,工程圈广泛传阅
- 核心观点:2024年 Letta 的 Agent Stack 图已被业界广泛采用。2026年演进为六层,新增三个独立类别:① 安全/Guardrails 层;② 记忆/持久化层;③ Agent-to-Agent 协议层(MCP/A2A)。强调了 agent 架构 ≠ LLM 架构:底层 LLM 只是引擎,真正的工程价值在 scaffolding、memory、tooling、evaluation。
- 引用:
https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 行动建议:精读;建议作为知识库"Agent 系统架构"主题页的结构框架
3. OWASP Top 10 Agents & AI 漏洞速查表(2026)
- 来源:Substack,Alex W(
open.substack.com/pub/alexewerlof) - 可信度:高 · OWASP 官方合作内容,工程实用导向
- 核心观点:整合 OWASP Top 10 LLM(LLM01-10)和 OWASP Top 10 Agents(ASI01-10),以工程视角给出 mitigation 建议。核心洞察:语义防火墙(Semantic Firewall)概念——用隔离的、受限的二级模型评估输入/输出;工具权限遵循最小特权原则(Principle of Least Privilege)。
- 引用:
https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents - 行动建议:精读;纳入知识库"Agent 安全工程"主题页
4. VectorLiteRAG:GPU/CPU 协调的延迟感知 RAG 服务系统
- 来源:arXiv
2504.08930v3 - 可信度:高 · 完整的系统论文,有 benchmark 数据
- 核心观点:RAG 场景下,向量检索(I/O 密集)与 LLM 推理(内存/KV-cache 密集)在 GPU 上存在资源竞争。VectorLiteRAG 通过访问模式分析 + 性能建模,在 GPU/CPU 间找到最优索引分区点,最小化竞争、稳定 batching,在倾斜动态负载下实现 SLO 合规。
- 工程洞察:生产 RAG 系统不应默认"GPU 合并部署",需要针对 workload 特征做资源分区的定量分析。
- 引用:
https://arxiv.org/html/2504.08930v3 - 行动建议:精读;纳入知识库"RAG 系统工程 / GPU 调度"主题页
5. Exqutor:pgvector/DuckDB 向量增强查询优化器
- 来源:arXiv
2512.09695v4 - 可信度:高 · 系统论文,接入真实数据库引擎
- 核心观点:向量搜索与传统 SQL 执行计划优化器的"基数估计"问题相互隔离,导致执行计划次优。Exqutor 提供可插拔基数估计框架,在有 HNSW/IVF 索引时利用索引辅助估计,无索引时用自适应采样。集成到 pgvector、VBase、DuckDB,向量增强分析查询提升最多 4 个数量级。
- 工程洞察:向量查询的 planner 优化是被工程界长期忽视的领域,Exqutor 填补了这一空白。
- 引用:
https://arxiv.org/html/2512.09695v4 - 行动建议:审稿;纳入知识库"向量数据库工程 / 查询优化"主题页
6. awesome-ai-agents-2026(460+ forks)
- 来源:GitHub
caramaschiHG/awesome-ai-agents-2026 - 可信度:高 · 持续更新的社区维护列表,20 个分类,340+ 资源
- 核心观点:覆盖 Agent 框架、协议标准、Observability/Evaluation、本地部署、多 Agent 编排、安全等六大块。2026年7月更新,重点标注了 MCP 生态、A2A 协议、OpenManus 等新条目。
- 引用:
https://github.com/caramaschiHG/awesome-ai-agents-2026 - 行动建议:浏览参考;知识库"Agent 生态全景"可引用
7. CheetahClaws:任意 LLM 的 Python Native Agent Harness
- 来源:GitHub
SafeRL-Lab/cheetahclaws - 可信度:高 · SafeRL-Lab 维护,支持 Claude/GPT/Gemini/Qwen/DeepSeek/Ollama
- 核心观点:v3.5.85(2026-07-10)新增:prompt_toolkit 核心依赖(无需 extra)、
/modelTab 补全、LiteLLM 双层树、Sessions 自动原子保存 +fsync(crash recovery via/resume)。Harness 层工程实践:流式支持、任意 OpenAI-compatible endpoint。 - 引用:
https://github.com/SafeRL-Lab/cheetahclaws - 行动建议:参考;知识库"Agent Harness / Testing Infrastructure"条目补充
8. 安全事件跟踪库(CVE-2026-26030)
- 来源:GitHub
webpro255/awesome-ai-agent-attacks - 可信度:高 · 实时跟踪 2024-2026 Agent 安全事件时间线
- 核心观点:CVE-2026-26030(Python),unsafe string 操作。持续跟踪真实攻击、漏洞和防御机制演进。
- 引用:
https://github.com/webpro255/awesome-ai-agent-attacks - 行动建议:收藏;纳入知识库"Agent 安全运营"关注列表
9. effGen:小型语言模型作为能力型自主 Agent(ICML 2026)
- 来源:GitHub
ctrl-gaurav/effGen - 可信度:高 · ICML 2026 论文,开源实现
- 核心观点:让小模型(Qwen2.5-1.5B)通过工具集成达到自主 Agent 能力。v0.3.1(2026-06-29):MCP 支持、OpenAI 兼容 server、PDF 摄入、per-call 延迟报告。
- 引用:
https://github.com/ctrl-gaurav/effGen - 行动建议:参考;知识库"SLM Agent 应用"条目
10. The Attack and Defense Landscape of Agentic AI:Agent 安全全景综述
- 来源:arXiv
2603.11088v1 - 可信度:高 · 系统性综述,覆盖隐私、prompt injection、信息流控制
- 核心观点:全面梳理 Agentic AI 攻击面:R3(信息流控制/污染)、工具权限升级、prompt injection。防御方案:CaMeL、FIDES、ACE、PrivacyChecker 等。Agent 系统攻击面比 LLM 更大(更多入口点),信息流控制是核心防御手段。
- 引用:
https://arxiv.org/html/2603.11088v1 - 行动建议:精读;纳入知识库"Agent 安全工程"主题页
🟡 候选条目(次高价值,仅摘要)
| 条目 | 来源 | 摘要 | 建议 |
|---|---|---|---|
| Agents-A1 量化变体发布 | GitHub InternScience/Agents-A1 |
2026-07-02 发布系列量化模型 | 收藏 |
| LightAgent v0.9.0 Checkpointed LightFlow | GitHub wanxingai/LightAgent |
DAG 工作流 + 断点续跑 + Approval 节点 | 参考 |
| AI Trends 2026 HF Collection | Hugging Face thaki-AI/ai-trends-2026-07 |
GLM-5.2 HOT 0.808;SkillOpt MSR 官方博客 | 浏览 |
| Agentic RAG Survey (v4) | arXiv 2501.09136v4 |
RAG→Agentic RAG 演进分类 | 收藏 |
| Semantic Pyramid Indexing (SPI) | arXiv 2511.16681v2 |
多分辨率向量索引,FAISS/Qdrant 插件,5.7x 提速 | 审稿 |
| AI Engineer 工作定义(1000+ JD 分析) | Substack alexeyondata |
AI Engineer = owning production FM systems | 浏览 |
分类标签
#Agent-记忆系统 #Agent-基础设施 #Agent-安全 #RAG-系统工程 #向量数据库 #Harness-Eval #六层架构 #OWASP
建议写入路径
/shared/research-kb/inbox/jay/2026-07-15-1335-afternoon-agent-memory-arxiv-harness-security-substack.md
后续行动
- [ ] 精读:MemMachine(Agent 记忆设计模式主题页)
- [ ] 精读:The AI Agents Stack 2026 Edition(六层架构主题页)
- [ ] 精读:OWASP Top 10 Agents 2026(安全主题页)
- [ ] 精读:The Attack and Defense Landscape of Agentic AI(安全主题页)
- [ ] 审稿:Exqutor(向量 DB 查询优化主题页)
- [ ] 审稿:Semantic Pyramid Indexing(向量索引主题页)
- [ ] 更新:知识库"Agent 系统架构"、"Agent 安全工程"、"RAG 系统工程"三个主题页
本条草稿由 Jay 生成 · 2026-07-15 13:35 UTC · 请勿直接提交 GitHub