Jay 工程实践筛选 · 第三轮(2026-07-28 10:50 AM)
筛选结论
本轮保留条目(A级)共 5 条,B级 3 条(选择性参考),C级 3 条(丢弃)。
✅ 保留条目(A级)
条目 1:Harness Engineering for LLM-Driven GPU Kernel Generation
- 来源:arXiv:2607.17979v1,MLSys 2026 FlashInfer AI Kernel Generation Contest
- 时间:2026-07-20
- 可信度:高 — MLSys 会议级,同场比赛官方论文,GitHub: github.com/syhya/mlsys26-flashinfer-contest
- 核心观点:
- 将 evaluation harness 与 profile-backed optimization controller 分离
- CUDA Skills 框架(通用 CUDA skill + FlashInfer B200 specific skill)
- Torch Profiler + NVIDIA Nsight Compute (NCU) 分析脚本集成
- 两阶段搜索(编译验证 → latency profile → 选择)
- 工程价值:竞争级 CUDA kernel 优化 harness 设计,含真实 B200 GPU 实验床
- 是否需要核验:需核对 GitHub repo 具体命令和 skills YAML 定义格式
- 标签:
harness-engineeringcudamlsys2026kernel-optimization
条目 2:Your KV Caching Is Broken — LMCache 实战分析
- 来源:Akshay Pachaar (@akshay_pachaar),Twitter/X,2026-07-27;GitHub: github.com/LMCache/LMCache
- 可信度:高 — 独立工程师,附 GitHub 和详细图解
- 核心观点:
- vLLM/SGLang/TensorRT-LLM 的 KV cache 管理在 crash 后存在漏洞(engine 崩溃时 KV cache 无 fallback)
- LMCache 直接插接上述三个 engine,crash 后 engine 侧 fallback 到 uncached inference直至 cache 重连
- 实测:input token 成本削减 90%,推理速度提升至 14x
- startup time 从 >3 分钟降至约 30 秒(via LMCache 直接 Plug)
- 工程价值:真实命令级集成方案(vLLM/SGLang/TensorRT-LLM 插件机制)
- 后续行动:建议审阅 LMCache GitHub 的
README.md和 example 目录,提取集成命令 - 标签:
kv-cacheinference-optimizationproductionvllmsglanglmcache
条目 3:awesome-harness-engineering GitHub 更新条目(2026年3月批次)
- 来源:github.com/ai-boost/awesome-harness-engineering
- 子条目 A — Characterizing Faults in Agentic AI:
- 挖掘 AutoGen、CrewAI、OpenAI Agents SDK、LangChain、CAMEL、DB-GPT 共 375 个 GitHub issues
- 首个 grounded 故障分类:初始化失败、角色偏离、内存/状态不足、编排失败、工具集成错误
- 架构级故障检查清单,可作为 harness 调试入口
- 子条目 B — Design Patterns for Deploying AI Agents with MCP:
- 三个协议级缺口:missing identity propagation(请求来源追踪)、absent adaptive tool budgeting、unstructured error semantics
- 缓解模式:JWT-enriched tool calls、per-tool timeout contracts、standardized error-action mappings
- 企业 MCP 部署必读
- 子条目 C — State of Agent Engineering 2026:
- LangChain 行业调查,1300+ 专业人士
- 57.3% 已有 agents 在生产环境(2025 年 51%)
- Top barrier: quality(32%);89% 实现可观测性,仅 52% 运行评估
- 最有代表性的 2026 中期行业成熟度快照
- 工程价值:A/B 为真实 issue 分析,C 为行业数据,都值得进入知识库
- 标签:
agent-engineeringharnessmcpfault-analysisindustry-survey
条目 4:Trace-Driven Optimization for Customer-Service LLM Agents
- 来源:arXiv:2607.18039v1,2026-07
- 可信度:中 — arXiv 预印本,无明确会议
- 核心观点:
- Evidence-Grounded Customer-Service Agent Workflow(基于 LangChain)
- trace-driven 优化:clarification bounds、human handoff、memory/protocols 显式建模
- 引用 Shinn et al. 2023 + Zhou et al. 2026,强调 external memory 和 feedback harness 比 model weights 更重要
- 工程价值:LangChain 生产客服 agent 设计参考,但论文描述为主,无源码/命令
- 保留理由:workflow 设计模式有价值,可对照 LangChain 官方文档做交叉验证
- 标签:
agent-workflowlangchaincustomer-servicetrace-driven
条目 5:Multi-Agent Debugging: 7 Failure Modes and Fixes [2026]
- 来源:Atlan (atlan.com),2026-07
- 可信度:高 — 工程博客,有具体工具对比(LangSmith vs AgentOps vs Arize Phoenix)
- 核心观点:
- LangSmith:LangChain/LangGraph 专用,最小配置自动日志,exact-step replay
- AgentOps:400+ 框架覆盖( CrewAI、AutoGen、OpenAI Agents SDK),time-travel 调试
- Arize Phoenix:开源 OpenTelemetry,支持大多数框架,agent graph 可视化
- 共同盲区:无法原生判断 context 是否 stale 或 unauthorized
- 无限循环调试:结构化日志(correlation/trace IDs)+ 非生产环境复现 + 30-60 分钟 focused 排障
- 工程价值:生产多 agent 系统排障操作手册,含工具选型矩阵
- 标签:
multi-agentdebuggingobservabilitylangsmithagentopsproduction
⚠️ B级(选择性参考,无需写入知识库核心条目)
B1:Inference Engines for LLMs & Local AI Hardware (2026)
- 来源:youmind.com 摘要版,完整内容付费
- 选型规则(已收录):
- SGLang:复杂 serving 场景,prefill-decode disaggregation,路由/多用户复杂 workload
- vLLM:灵活性和通用性优先
- TensorRT-LLM:NVIDIA datacenter 极致性能
- Apple Silicon:MLX 原生,llama.cpp GGUF,统一内存是容量超能力
- 工程价值:中等,规则有价值但无命令/源码;建议作为内部参考,不单独写条目
- 标签:
inference-servinghardwarevllmsglangtensorrt-llm
B2:The 2026 AI Agent Stack, Drawn from Scratch
- 来源:codingwithroby.substack.com,2026-07
- 核心内容:六层栈(Microsoft Foundry 例),when-to-add-layer 决策矩阵
- 工程价值:框架选型思路有价值,但具体内容来自 Letta 2024 + O'Reilly 2026,无新命令
- 标签:
agent-stackframework-selection
B3:Graph Engineering 新范式(Flowtivity,2026-07-25)
- 来源:flowtivity.ai,2026-07-25
- 核心观点:Loop Engineering → Graph Engineering 演进,5阶段方法论,typed edges
- 工程价值:新兴概念,但缺乏具体命令/实现细节;作为趋势观察保留
- 标签:
graph-engineeringagent-paradigm
❌ 丢弃条目(C级)
C1:Substack "Prompt Engineering 书单/课程推荐" 批次
- 来源:javarevisited.substack.com、reactjava.substack.com 等
- 丢弃理由:书单/课程列表,无源码、无命令、无真实复现步骤;属于资讯类内容,不符合工程筛选标准
- 涉及条目:
- "11 Must-Read AI and LLM Engineering Books for Developers in 2026"
- "I Tried 20+ AI Courses: Here are The Top 5..."
- "The Complete Machine Learning Engineer Roadmap (2026)"
- "Every AI Prompting Technique That Works on Reasoning Models (2026)"
C2:YouTube "6 Agentic AI Projects"
- 丢弃理由:纯概念性项目推荐,无工程命令、源码或实现路径;视频形式无法提取结构化工程数据
C3:Medium "LangChain Is Dead?" 类文章
- 丢弃理由:已有多轮 morning 草稿覆盖 LangChain vs LangGraph 对比;本文属于观点类,无新命令/源码
本轮新增知识库条目建议
| 条目 | 建议写入路径 | 是否需要精读 |
|---|---|---|
| Harness Engineering arXiv:2607.17979 | /shared/research-kb/inbox/jay/2026-07-28-harness-kernel-flashinfer-mlsys2026.md |
是,建议对照 GitHub skills YAML |
| LMCache KV Caching | /shared/research-kb/inbox/jay/2026-07-28-kvcache-lmcache-production.md |
是,建议提取 README 命令 |
| awesome-harness-engineering 2026更新 | /shared/research-kb/inbox/jay/2026-07-28-harness-engineering-fault-survey-2026.md |
是 |
| Multi-Agent Debugging 7 Failure Modes | /shared/research-kb/inbox/jay/2026-07-28-multiagent-debugging-7-failures.md |
中,可做摘要 |
分类标签汇总
harness-engineering cuda kernel-optimization kv-cache vllm sglang lmcache agent-engineering mcp fault-analysis industry-survey agent-workflow langchain multi-agent debugging observability production mlsys2026
Jay · 2026-07-28 10:50 · 第三轮工程筛选