Jay 工程筛选报告 · 2026-10-11 第三次

时间: 2026-10-11 23:50(北京时间) 本次主题:** Substack 高价值工程洞察 · arXiv Oct 2026 新条目 · Hugging Face 生态 · GitHub Trending


候选条目总览

# 条目 来源 类型 工程价值
1 The AI Agents Stack 2026 Edition theaiengineer.substack.com Substack ⭐⭐⭐
2 2026 Roadmap: Production AI/ML Systems jamwithai.substack.com Substack ⭐⭐⭐
3 Open-Source AI Agent Toolkit 2026 theaiengineer.substack.com Substack ⭐⭐⭐
4 Agentic RAG vs CUA vs A2A theaiengineer.substack.com Substack ⭐⭐
5 How I'd Learn AI Engineering 2026 louisbouchard.substack.com Substack ⭐
6 RIT-RAG: Retrieval-Induced Tree RAG arXiv cs.AI Paper ⭐⭐⭐
7 Secure RAG: SLOT Taxonomy(135篇) arXiv cs.AI Paper ⭐⭐⭐
8 WebFovea: Vision Web Agent (WebRetriever 2026 #2) arXiv cs.AI Paper ⭐⭐
9 SkillForge: Co-Evolving Skills & Agents arXiv cs.AI (NeurIPS 2026) Paper ⭐⭐
10 Hugging Face State of OS Spring 2026 huggingface.co/blog Blog ⭐⭐
11 nanochat: E2E LLM Training (57.5K stars) github.com/ak двух GitHub ⭐⭐
12 Hugging Face Transformers 2026 Model Support Various guides Overview ⭐

详细筛选

⭐⭐⭐ 保留 1 — The AI Agents Stack 2026 Edition

来源: theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 作者: The AI Engineer(高质量作者/机构专栏) 发布时间: 2026(推测近月)

核心工程观点: - Memory 分层: 2024 年 memory = vector DB + RAG;2026 年 memory = 三层第一类架构原语,而非外挂检索 - Agent Guardrails vs LLM Guardrails: 2024 年 guardrails = I/O 过滤;2026 年 guardrails = 工具调用授权 + 速率限制 + 行为验证 - Agent Stack ≠ LLM Stack: Agent 需要状态管理、多步执行工具访问、跨会话持久化、自主演绎循环,与 LLM Stack 有本质区别

保留理由: - 明确的工程分代(2024 vs 2026)框架,适合作为知识库架构演进参照 - 三层 memory tier 的提法值得进入知识库概念索引 - Guardrail 演进路径有实际工程指导价值

是否需要精读: 中——建议提取关键分层框架写入架构主题页


⭐⭐⭐ 保留 2 — 2026 Roadmap: Production AI/ML Systems

来源: jamwithai.substack.com/p/the-2026-roadmap-production-aiml 作者: Javarevisited(Javin Paul) 发布时间: 2026

核心工程观点(snippet 提取): - Evaluation 阶段: RAGAS + LLM-as-judge 代替"凭感觉测 RAG" - Graph RAG: Neo4j + 多跳查询,弥补 vector search 无法处理跨文档关系问题 - ColPali/VLM: 视觉文档检索生产路径 - 演进路径: Build basic RAG → Measure it → Add relationship understanding → Handle multimodal content

保留理由: - 增量演进路线(iterative)有真实工程节奏感,不是"一步到位"路线图 - RAGAS + LLM-as-judge 的组合值得进入 RAG 评估主题页 - Graph RAG with Neo4j 有具体技术选型参考价值

是否需要精读: 中——Graph RAG 部分可提取工程决策点


⭐⭐⭐ 保留 3 — Open-Source AI Agent Toolkit 2026

来源: theaiengineer.substack.com/p/the-open-source-agent-toolkit-in 发布时间: 2026-10

核心工程观点(snippet 提取): - Evals & Observability Layer: 记录每个 LLM 调用、工具调用、成本;replay 完整上下文 - Evals = 可重复测试套件(固定输入 + 通过/失败标准,每次相同评分) - Browser Use vs Playwright: - Browser Use:50K+ GitHub stars,增长最快的开源 AI 项目之一(2025-2026),适合 novel tasks - Playwright:适合 repeated workflows,deterministic 浏览器自动化 - 80/20 split:生产团队将重复的 80% 放在 Playwright,将 novel 20% 放在 Browser Use

保留理由: - 80/20 浏览器自动化策略是非常具体的生产工程建议 - Evals vs Tracing 的区分有工具选型指导价值 - Layer 1 orchestration 的框架描述清晰(推理循环:LLM picks → runtime executes → LLM picks again)

是否需要精读: 中高——Evals/Observability layer 和 Browser Use 80/20 策略值得进入 agent 工具选型页


⭐⭐ 保留 4 — Agentic RAG vs CUA vs A2A: Which Pattern Do You Need?

来源: theaiengineer.substack.com/p/agentic-rag-vs-cua-vs-a2a 发布时间: 2026-10

核心工程观点(snippet 提取): - A2A 的局限性: A2A 是互操作性协议,不是编排框架;spec 尚未 1.0,跨厂商 A2A 协调在 2026 年底前不现实 - 三个关键决策问题: 1. Integration boundary:agent 触及什么?(自有数据 / 他人 GUI / 其他 agent) 2. Autonomy level:agent 在征询人类前做多少决策? 3. Maturity for production:本季度能上线还是 2027 年的赌注? - Enterprise 系统示例(2026 年底): orchestrator 用 MCP 查内部 DB(Agentic RAG)+ CUA 子 agent 填表(legacy portal)+ A2A 协调供应商采购 agent

保留理由: - 三个决策问题框架非常实用,适合进入架构决策页 - A2A 局限性判断有工程诚信,值得引用 - Enterprise 示例有架构演进参考价值

是否需要精读: 中


⭐ 丢弃 5 — How I'd Learn AI Engineering 2026

来源: louisbouchard.substack.com/p/how-id-learn-ai-engineering-in-2026 作者: Louis-François Bouchard

丢弃理由: - 本质是学习路线图,非工程实践文章 - 核心五问框架(do we need LLM / prompt vs RAG vs fine-tune vs agent 等)有价值但已被更多深度来源覆盖 - 无具体命令、环境、性能数据或可复现步骤


⭐⭐⭐ 保留 6 — RIT-RAG: Retrieval-Induced Tree RAG

来源: https://x.com/SciFi(引用 arXiv,内容来自 EMNLP 2026 Findings) Paper ID 推断: 2610.11363 相关

核心工程观点(snippet 提取): - 核心问题: 现有 Agentic RAG 暴露的是 isolated chunks,没有文档结构;LLM 难以区分"相关内容"和"只是形似的块" - 解决方案: Offline 为每个文档从目录或 sitemap 构建树;Query 时检索一批 chunk,用位置信息诱导 manageable 子树(可能跨多个文档);LLM agent 在子树中导航,选择性读取节点 - 对比: PageIndex 可导航文档结构但无法 scale 到大规模语料库(不能 fit in LLM context);RIT-RAG 在粗粒度检索后用子树结构解决 scale 问题

保留理由: - RIT-RAG 解决了 Agentic RAG 的核心工程痛点(isolated chunks + 结构缺失) - 跨文档子树导航的思路有创新性 - EMNLP 2026 Findings 背书,有学术可信度

是否需要精读: 高——建议直接访问原论文,有复现价值


⭐⭐⭐ 保留 7 — Secure RAG: SLOT Taxonomy

来源: https://arxiv.org/list/cs.AI/new(snippet 提取) 主题: RAG 安全攻击与防御综述

核心工程观点(snippet 提取): - 135 篇系统调研,涵盖 attacks、defenses、security evaluation - SLOT Taxonomy: 按攻击表面(Surface, S)+ 防御层(Layer, L)组织 - RAG 的安全风险与纯 prompt-only 或纯参数模型有本质不同

保留理由: - 135 篇综述规模说明这是 RAG 安全领域的系统性梳理 - SLOT taxonomy 如果质量高,可进入 RAG 安全主题页 - 需要验证:论文质量、SLOT 可操作性、防御措施可部署性

是否需要精读: 高——需要找到原始论文链接验证


⭐⭐ 保留 8 — WebFovea: Vision Web Agent

来源: https://arxiv.org/list/cs.AI/new 背景: WebRetriever Challenge 2026 第 2 名,Score 57.0/100

核心工程观点(snippet 提取): - 问题: 能跑 multimodal LLM 不足以做 web agent;模型决策需要触及 live website 的实际界面操作 - 挑战: Protocol III(从入口 URL 开始,操作网站自身界面,返回可验证答案)的端到端评测 - 位置感知对视觉 web agent 的重要性

保留理由: - WebRetriever Challenge 的工程评测场景有参考价值 - Web agent 从"能看"到"能做"的 gap 分析值得进入 agent 评测主题页 - 第 2 名的方案有架构参考价值

是否需要精读: 中——找原论文看具体方案


⭐⭐ 保留 9 — SkillForge: Co-Evolving Skills and Agents

来源: https://arxiv.org/list/cs.AI/recent,NeurIPS 2026 arXiv ID: 2610.09832

核心工程观点(snippet 提取): - 技能生命周期动态共演化框架 - NeurIPS 2026 主 Poster 接收

保留理由: - NeurIPS 2026 接收,有学术背书 - Skills 作为 inference-time 插件的工程化思路有实际应用场景 - 精读价值:需要看具体 skill lifecycle 定义和 co-evolution 机制

是否需要精读: 中——找原论文


⭐ 丢弃 10 — Hugging Face State of Open Source Spring 2026

来源: huggingface.co/blog/huggingface/state-of-os-hf-spring-2026 发布时间: 2026 年春(可能已过期)

丢弃理由: - 数据为 2026 年春季快照,10 月已过期约 6 个月 - 数据点(13M 用户、2M 模型、500K 数据集)在 2026 年 10 月的时间点需重新验证 - 建议:如果需要 HF 生态数据,应查找 2026 年秋季最新报告


⭐⭐ 保留 11 — nanochat: End-to-End LLM Training (57.5K stars)

来源: https://www.firecrawl.dev/blog/best-github-repos(引用) 原始 repo: nanochat by Andrej Karpathy

核心工程观点(snippet 提取): - 57.5K stars,定位与大多数 AI repo 相反:不是抽象封装,而是暴露一切 - 单处可见完整 pipeline:tokenization、pretraining、finetuning、evaluation、inference、working chat UI - 每一步都 visible and modifiable

保留理由: - Andrej Karpathy 作品,工程声誉极高 - 57.5K stars 说明社区强烈需求(透明化训练 pipeline) - 与当前 trend(抽象封装)相反,有反向思考价值

是否需要精读: 中——建议看 repo 本身评估实际可用性


本次未入库条目(需后续关注)

条目 原因 后续行动
System Switch (arXiv cs.AI) 快慢决策模型切换,有代码/数据 待找原 paper
How Do Agentic LLMs Decide to Call Tools (arXiv 2610.09624) NeurIPS 2026,有工具调用机制分析 待找原 paper
UniData: Universal Multimodal Instruction Generation (EMNLP 2026 Findings) 多模态指令生成流水线 待找原 paper

分类标签

#LLM-Agent #RAG #RAG-Eval #Graph-RAG #Agentic-RAG #SLOT-Taxonomy #HuggingFace #Substack #arXiv-2026 #Observability #Browser-Automation #Production-AI #Stack-2026


建议写入路径

/shared/research-kb/inbox/jay/2026-10-11T2350-jay-evening-engineering-filter.md


后续行动建议

  1. RIT-RAG 原论文精读(最高优先级):找 EMNLP 2026 Findings 原文,评估子树导航机制可复现性
  2. SLOT Taxonomy 原论文:找 arXiv ID,验证 Secure RAG 分类可操作性
  3. nanochat repo 评估:确认 Andrej Karpathy 的端到端训练代码质量
  4. Hugging Face 最新生态数据:查找 2026 年秋季最新 State of OS 报告

Jay · 2026-10-11T23:50 CST · 本次未执行任何 GitHub 写入操作