Jay 工程实践筛选 · 2026-10-10 晚间批次

筛选标准:真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤 检索范围:GitHub Trending · Substack · inferenceengineering.tech · theaiengineer · ai-boost awesome lists 注意:本批次重点聚焦今日早间/下午批次未覆盖的新条目(早间已覆盖推理引擎 benchmark、VectorDB;下午已覆盖 Agent Memory failure modes、Multi-Agent 框架矩阵)


✅ KEEP(通过筛选)


1. SGLang · 生产规模里程碑:400,000+ GPU / 万亿 tokens/天(2026-10)

URL: https://github.com/sglang-project/sglang | https://inference.net/content/sglang-complete-guide 质量评分: 9/10 分类标签: inference-engineering sglang production-scale radixattention

质量信号: - 生产规模:400,000+ GPU,生成万亿 tokens/天(2026年10月) - 部署厂商:xAI (Grok)、NVIDIA、AMD、LinkedIn、Cursor、Oracle Cloud - SGLang v0.5.11(2026-05-05)已发布 - RadixAttention 实际命中率:固定 system prompt + tool definitions,75-95% cache hit rate(multi-turn 对话) - SGLang 的优势不是数学计算快,而是编排层(orchestration)效率高 - TensorRT-LLM 劣势:高并发下表现弱,编译时间 ~28min,动态批处理支持差

新增工程洞察: - SGLang 实际瓶颈在编排(orchestration),不在数学运算(SGLang vs vLLM 同样 kernels 差距 29% 来自调度) - 生产前缀缓存命中判断:75-95% 是固定 system prompt 场景,实际 RAG 场景需要实测 - NCCL inter-GPU 通信在 NVLink 上 <5μs(这是 SGLang 多卡 TP 开销极小的原因)

保留理由:生产规模数据是工程选型硬指标,400K GPU 规模证明可靠性;早间批次仅有 benchmark 数字,缺少规模验证


2. ai-boost / awesome-harness-engineering · Agent Harness 工程全景知识库(2026-10)

URL: https://github.com/ai-boost/awesome-harness-engineering 质量评分: 8.5/10 分类标签: agent-engineering harness eval observability mcp memory benchmarks

质量信号: - 4.7k stars(2026-10-04 更新),持续活跃 - Agent Evaluation Framework 2026:AgentBench + Terminal Bench 2.0 + WebArena + SWE-bench Verified + NIST AI Agent Standards(Feb 2026) - STATE-Bench(Microsoft, May 2026):首个把 memory 作为独立变量评测的 benchmark,450 个企业任务(客服/旅行/购物),memory 有独立学习轨迹 - VoltAgent/awesome-ai-agent-papers:363+ 篇 2026 年 arXiv 论文,分 5 类(Multi-Agent 51 / Memory & RAG 56 / Eval & Observability 79 / Agent Tooling 95 / AI Agent Security 82) - OpenLIT:OTel-native agent harness 平台(trace/eval/guard)

新增工程洞察: - Agent Harness 已成为独立工程学科(2026年出现多个awesome list) - 关键判断:memory architecture 评测必须独立于 task quality 评测(STATE-Bench 的核心贡献) - 早间/下午批次未覆盖 agent harness 工程化内容

保留理由:首个将 agent harness 工程化的系统性资源库;纳入知识库 agent-engineering 主题页;早间/下午批次均未覆盖


3. Inference Engineering Tech · vLLM vs SGLang vs TensorRT-LLM 决策树(Oct 2026)

URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm 质量评分: 8/10 分类标签: inference-engineering decision-tree production vllm sglang tensorrt-llm

质量信号: - 2026年三引擎 feature gap 已大幅收窄,均为 production-grade - 决策核心:你能吸收多少运维复杂度来换取多少性能收益 - TensorRT-LLM 固定 batch at compile time → 动态批处理场景劣势明显 - 所有三引擎共享 OpenAI 兼容 API → 混用模式(Ollama 开发 + vLLM/SGLang 生产) - vLLM/SGLang 均可处理 variable arrival 无性能下降

新增工程洞察(对比早间 Spheron 数据): - Spheron 测的是 H100 固定条件;InferenceEngineering.tech 提供决策框架而非单纯数字 - 混用模式实用:dev 用 Ollama,prod 用 vLLM/SGLang,endpoint URL 改一行代码

保留理由:补充早间批次的数字 benchmark,提供决策框架层面的工程指导


4. theaiengineer · The AI Agents Stack 2026 Edition(Oct 2026)

URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 质量评分: 7.5/10 分类标签: agent-engineering architecture guardrails mcp production

质量信号: - 2024 → 2026 关键转变:guardrails 从 LLM 输入/输出过滤 → 独立 Agent 授权 discipline - 2024 guardrails = input/output filter - 2026 guardrails = tool call 授权 + 速率限制 + Agent 实际行为验证 - Layer 3 (Memory):codebase-aware retrieval with reranking,agent 不读全 repo 只检索相关文件 - Layer 6 (Deployment):LangGraph Cloud / Bedrock Agents 存在,但大多数生产团队仍用 FastAPI + 自建 infra - 实际生产模式:Cursor 在 Claude/GPT-4/自有微调模型间路由

新增工程洞察: - Agent guardrails 已成为独立工程问题(比 LLM guardrails 更复杂) - Deployment 层是生产中 unplanned engineering time 最多的地方 - Model routing 是成本控制关键(分类用小模型,复杂推理用 frontier 模型)

保留理由:更新了 2024 guardrails 认知;Agent 架构分层图是稀缺内容;下午批次的多 Agent 框架矩阵侧重框架对比,本文侧重架构层次


5. Mem0 / MemOS / Cognee · Agent Memory 基础设施选型(2026-10)

URL: https://github.com/topics/agent-memory | https://github.com/mem0ai/mem0 质量评分: 7/10 分类标签: agent-engineering memory infrastructure production

质量信号: - Mem0:AI Agent 的 memory layer,drop-in production infrastructure,持久化上下文 - MemOS:自进化 memory OS,35.24% token 节省 + DeepSeek Harness 支持 - Cognee:图结构 memory,支持多源知识融合 - MemSearch(Zilliz):Markdown + Milvus,支持跨 Agent(Claude Code/Codex/DSH)memory - MemSearch = user-owned,local-first,Markdown-native,跨 app/tools/workflows 自进化 - MemOS = ultra-persistent memory + hybrid-retrieval + cross-task skill reuse

新增工程洞察: - Agent memory 基础设施在 2026 年已分化出多个专用层(不是 RAG,不是向量数据库) - 选型判断:Mem0 适合通用生产;MemOS 适合 DeepSeek 生态;MemSearch 适合 Markdown-native 偏好

保留理由:下午批次覆盖了 Agent Memory failure modes(理论),本条目覆盖基础设施选型(工程),互补


⚠️ BORDERLINE(边界,需人工判断)


6. TrueFoundry · SGLang vs vLLM vs TensorRT-LLM(Oct 8, 2026)

URL: https://www.truefoundry.com/blog/sglang-vs-vllm-vs-tensorrt-llm 评分: 6.5/10 DROP/保留理由:内容与早间 Spheron 数据高度重叠(同一批 benchmark 来源);Oct 8 发布略新;决策树框架有参考价值但无新实测数据;建议:降级为补充参考,不单独入库

7. AlexeyData · 1000+ Job Descriptions 分析 AI Engineer 角色定位

URL: https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal 评分: 6/10 DROP/保留理由:职业定位分析有参考价值(95.6% 生产级 / 70% AI-first / 28.5% AI-support),但非工程技术内容;建议:纳入 AI 工程职业研究线索,不入库工程知识库


❌ DROP


来源 标题 丢弃理由
CoddyKit "Future of AI Agents: October 2026 GitHub Trends" 综述性文章,无新原始数据;已有 betterharnesses/Tsinghua awesome lists 覆盖
Awesome-Harness-Engineering (Jiaaqiliu) 资源列表 内容与 ai-boost/awesome-harness-engineering 重叠;后者 stars 更多且更新
Facebook OPC 5 trending GitHub repos 非技术文章,社交媒体摘要
Javarevisited AI Engineer Roadmap 2026(付费课程) 商业课程推广,非原创工程内容

📋 分类标签

inference-engineering sglang vllm tensorrt-llm agent-engineering harness eval memory state-bench openlit guardrails mcp production-scale radixattention agent-observability


📋 本次筛选统计

类别 数量
KEEP 5
BORDERLINE 2
DROP 4
合计 11

💡 建议写入路径

精读/主题页更新建议: - agent-engineering 主题页 → 纳入 ai-boost/awesome-harness-engineering(eval 知识库)+ STATE-Bench(memory 独立评测) - agent-engineering 主题页 → 纳入 theaiengineer Agent Stack 2026(guardrails 独立学科 + Layer 架构图) - agent-engineering 主题页 → 纳入 Mem0/MemOS/Cognee/MemSearch 选型(memory 基础设施层) - inference-engineering 主题页 → 补充 SGLang 400K GPU 生产规模数据(规模验证)

建议草稿路径(可合并写入): - /shared/research-kb/inbox/jay/2026-10-10-agent-harness-engineering-eval-memory-infrastructure.md(来自 KEEP #2, #4, #5 合并) - /shared/research-kb/inbox/jay/2026-10-10-sglang-production-scale-400k-gpus.md(来自 KEEP #1, #3 补充)


筛选时间: 2026-10-10 19:50 CST | 筛选工具: Tavily search | 未执行 Git 写入