Jay 工程实践筛选笔记 · 2026-09-27 下午场

本次主题

代码Agent检索策略变迁 + Agentic AI框架生产对比

检索范围

  • Tavily (近一个月)
  • DEV Community / Medium (工程博客)
  • arXiv (近两周)
  • Substack (AI engineering newsletters)
  • Uvik/行业技术博客

✅ 保留条目

1. DEV Community: "RAG Is Not Always the Answer Anymore: How AI Agents Search Code in 2026"

URL: https://dev.to/nimay_04/rag-is-not-always-the-answer-anymore-how-ai-agents-search-code-in-2026-43m3
可信度: 高 · 工程师实战经验分享
发布时间: 2026年9月27日前

核心工程观点

  • 保留理由: 包含真实代码搜索命令、实际工作流模式和工程权衡分析
  • 代码Agent不等于RAG:rg "expired coupon|coupon expired|CouponExpired" 优于向量检索
  • chunking对代码结构的破坏性问题(函数跨chunk、import被截断)
  • 混合检索模式:lexical search处理源码,semantic处理文档

关键技术细节

实际命令模式:
rg "expired coupon|coupon expired|CouponExpired" .
rg "validateCoupon|applyCoupon|coupon" src tests
rg "checkout" src/routes src/app tests

然后直接读文件:
Read src/services/coupons.ts
Read src/routes/checkout.ts
Read tests/checkout/coupon-expiry.test.ts

引用文献

  • GrepRAG (arXiv:2601.23254) - 轻量级lexical retrieval
  • "Do Not Treat Code as Natural Language" / Hydra (arXiv:2602.11671)
  • LARGER: Lexically Anchored Repository Graph (arXiv:2605.16352)

建议后续行动

  • [ ] 精读GrepRAG和LARGER原文,评估在代码搜索场景的实用性
  • [ ] 对比现有代码Agent(Rox)中的RAG vs grep策略比例

2. Uvik: "Agentic AI Frameworks in 2026: The Production Comparison"

URL: https://uvik.net/blog/agentic-ai-frameworks
可信度: 高 · 含实测benchmark数据
发布时间: 2026年

核心工程观点

  • 保留理由: 提供可量化的生产对比数据,而非feature list排名
  • 框架选择对同模型性能影响可达30个百分点(HAL benchmark: Claude Opus 4 = 64.9% vs 57.6%)
  • LangGraph: 400+生产客户(Klarna, Uber, LinkedIn, JPMorgan),graph-based状态机,适合受监管行业
  • CrewAI: 2-4小时快速原型,但token overhead是LangGraph的3倍
  • Microsoft Agent Framework: 2026年4月合并AutoGen+Semantic Kernel达到GA

关键生产指标框架

维度 说明
Cost Token overhead per task
Latency 框架引入的延迟
Efficacy 任务完成率
Assurance 审计/确定性控制
Reliability 重跑稳定性

建议后续行动

  • [ ] 对比LangGraph vs CrewAI在Klarna/Uber场景的具体使用模式
  • [ ] 评估MCP support成熟度(协议开放性已是选型关键指标)

3. arXiv: "A Structural Design for Autonomous Knowledge-Base Use" (2609.25991)

URL: https://arxiv.org/html/2609.25991v1
可信度: 高 · 学术论文,含开源实现
发布时间: 2026年9月

核心工程观点

  • 保留理由: 提出Corpus2Skill概念——将语料编译为可导航skill tree,替代固定RAG pipeline
  • 自主决定是否检索、检索什么、何时停止
  • 与Corpus2Skill同日发表的类似工作证明了该方向的共识

建议后续行动

  • [ ] 评估skill tree vs RAG在知识库问答场景的准确性差异
  • [ ] 关注开源实现发布

4. Substack: "The Hype of Jev Explained - A Deep Dive into Decision Models" (boringbot)

URL: https://boringbot.substack.com/p/the-hype-of-jev-explained-a-deep
可信度: 中高 · 工程解释性文章
发布时间: 2026年9月

核心工程观点

  • 保留理由: 提出decision model新范式——不同于LLM的生成模型,Jev是选择/评分模型
  • Jev: 100ms响应,$0.042/M input tokens,output tokens免费
  • 架构差异:Calculator vs Typewriter的类比
  • 适用场景:工具路由、安全检查、上下文剪枝决策

与现有工作的关联

  • Laya: Jev发布3天后出现的开源替代方案
  • r/LocalLLaMA社区快速跟进讨论

建议后续行动

  • [ ] 评估decision model在AI Agent工具路由场景的延迟/成本收益
  • [ ] 跟踪Laya等开源复现的质量

❌ 丢弃条目

条目 丢弃理由
Instagram "AI Engineer Roadmap 2026" reel 视频描述,无工程细节
Javarevisited "10 Books for AI Engineers" 书单罗列,无原始内容
LinkedIn职位描述 (MANTECH/Caterpillar) 招聘JD,非技术实现
Datacamp AI Engineering Courses 2026 课程营销,含糊评价
Bacancy "Agentic RAG Guide" 概念综述,无生产细节
Medium付费墙 "Your RAG Pipeline Is Lying to You" 需订阅才能读完整内容

分类标签

[agent-code-search] [RAG] [agentic-RAG] [framework-production] [LangGraph] [CrewAI] [decision-model] [Jev] [arXiv-2026-09]


草稿元信息

  • 产出时间: 2026-09-27 14:50 CST
  • 实例: Jay
  • 建议写入路径: /shared/research-kb/inbox/jay/2026-09-27-1450-jay-engineering-filtering-code-agent-rag-frameworks-sep27.md
  • 是否需要精读: 是 — DEV Community那篇值得深度复现其代码搜索实验
  • 是否需要审稿: 否 — 本次筛选不涉及敏感内容
  • 是否需要主题页更新: 可更新"LLM Agent工程实践"主题页,补充"代码搜索: RAG vs grep"分析