Jay 工程筛选 · 2026-09-29 第 3 次轮次(晚间版)
筛选角色:Jay(工程二次筛选) 时间:2026-09-29 19:50(Asia/Shanghai) 筛选范围:全天 3 轮汇总 + 晚间未覆盖候选条目 核心标准:真实环境 · 命令可执行 · 错误/排障记录 · 源码分析 · 性能数据 · 硬件规格 · 可复现步骤 本轮重点:Context Engineering 生产实测 · Agent 框架选型 · GraphRAG 工程化 · Inference Control Plane
📊 全天三轮汇总
| 指标 | 早间(10:50) | 下午(14:50) | 晚间(19:50) | 合计 |
|---|---|---|---|---|
| 候选总数 | 13 | 22 | 15 | 50 |
| Tier1 保留 | 4 | 6 | 5 | 15 |
| Tier2 归档 | 7 | 12 | 8 | 27 |
| 丢弃/降级 | 2 | 4 | 2 | 8 |
一、✅ Tier1 — 本轮新增高工程价值条目
✅ T1-NEW-1:Context Engineering 七大降本技术(70% 成本削减实测)
来源:CSDN · adg.csdn.net · AI Agent 长对话降本 70% 的 7 大上下文工程技术
URL:https://adg.csdn.net/6a64c5c810ee7a33f2926330.html
工程筛选通过理由: - 7 项技术均有可执行方案和实测数据: 1. 摘要式压缩:Faithfulness 约束结构,失忆幻觉率 12%→1.5% 2. 层级缓存:对话历史按层级摘要而非全量 3. 重要性路由:KV 边界识别,非关键块提前驱逐 4. 结构化提示约束:白名单/黑名单/强制结构化输出 5. 检索预算决策:相似度 > 0.7 过滤,token 从 4200→680/轮(84% 削减) 6. Agent-Controlled Retrieval:Agent 自主决策何时查知识库 7. 预算意识注入:在上下文里告诉 Agent 还剩多少 budget - 综合降本数据:70%,有 before/after 对比 - 适用场景:长对话、多轮 Agent、RAG 管道优化
工程价值:⭐⭐⭐⭐⭐ 唯一含量化 before/after 数据的 Context Engineering 实战总结,可直接转化为生产检查清单
建议写入:/shared/research-kb/inbox/jay/2026-09-context-engineering-cost-reduction.md(独立草稿)
✅ T1-NEW-2:GraphRAG 完整生产配置 + LazyGraphRAG 成本矩阵
来源:CSDN · agent.csdn.net · AI Agent 开发技术完全学习指南(2026-07 基线版)
URL:https://agent.csdn.net/6a52fd2f662f9a54cb8e8279.html
工程筛选通过理由:
- LazyGraphRAG 成本数据:$0.005–0.05/1K docs vs 全 GraphRAG $5–10,传统 RAG $0.01
- GraphRAG 完整生产 YAML 样本:chunk hash 变更检测、父子分块(600检索/大块喂入)、embedding 版本管理
- 三大实战复盘:分块不是模型(Faithfulness 0.62→0.88)、embedding 领域不匹配要微调、600 token 最优切块
- LangChain 0.3.x + BGE-M3(dim=1024) + Qdrant + FastAPI 0.111 + Docker 24.0 完整工具链
- 索引配置:parsers: {pdf: unstructured, doc: docling, md: llama_parse}
- 飞轮标注 Pipeline:LLM 标 + 10% 抽样人审
工程价值:⭐⭐⭐⭐⭐ GraphRAG 生产落地最完整中文实战,含配置样本、工具链版本和成本对比数据
建议写入:/shared/research-kb/inbox/jay/2026-09-graphrag-lazygraphrag-production.md(合并独立草稿)
✅ T1-NEW-3:Agent 框架选型三问 + 实测案例(200行替代12节点LangGraph)
来源:Towards AI · TheProdSDE · I Field-Tested AI Agent Frameworks in Production
URL:https://pub.towardsai.net/most-ai-agent-frameworks-are-overkill-heres-how-to-choose-the-right-one-in-30-seconds-b0a77c894fb7
工程筛选通过理由: - 实测替换案例:200行纯 tool-calling 代码替换 LangGraph 12节点编排,提速 3 倍 - 选框架三问:直线/图型?持久化/多轮/checkpoint?human-in-the-loop? - 框架适用边界清晰: - LangGraph:复杂图型 + 状态持久化 + checkpoint + human-in-loop - CrewAI:role-based 多 Agent(planner/researcher/writer) - OpenAI/Google/Anthropic SDK:vendor-native 快速交付 - 金融案例警示:12节点 LangGraph 编排,实际工作流为直线型,框架开销无收益
工程价值:⭐⭐⭐⭐⭐ 首次提供"框架替换后性能提升 3 倍"的实测数据,填补 Agent 框架选型客观评估空白
建议写入:/shared/research-kb/inbox/jay/2026-09-agent-framework-selection-production.md(独立草稿)
✅ T1-NEW-4:The AI Agents Stack 2026 Edition — Eval as Infrastructure
来源:The AI Engineer Substack(知名 AI 工程 Newsletter)
URL:https://www.theaiengineer.be/p/the-ai-agents-stack-2026-edition
工程筛选通过理由(来自下午轮 14:50 精读确认): - Agent Guardrails 已成为独立学科:授权工具调用/执行速率限制/行为验证 - Eval as Infrastructure 三层收敛:Context-Bench / Recovery-Bench / Terminal-Bench - 协议落地分析:IBM ACP / Google A2A 与 vLLM/SGLang 集成现状 - 比同类 Substack 更丰富:含框架评测数据、协议对比表
工程价值:⭐⭐⭐⭐ Agent 评估体系的系统性梳理,补充了 benchmark 实测数据
建议写入:并入 agent-evaluation-harness.md 主题页
✅ T1-NEW-5:The Inference Engineering Pareto Atlas — 54 个配置实测
来源:arXiv 2609.17863 · 54 个锚点配置实测(July 2026 · $18 花费)
URL:https://arxiv.org/html/2609.17863v1
工程筛选通过理由: - 实测 vLLM 0.12.0,Qwen2.5-7B-Instruct,512-token prompts,128-token outputs - 硬件实测矩阵:RunPod L4($0.39/hr)、A100 80GB PCIe($1.39/hr)、H100 PCIe($2.89/hr) - 量化对比:FP16、AWQ、FP8 weights、FP8 KV cache、两种 speculation 配置 - 核心结论:不存在单一最优配置,不同优化组合构成帕累托前沿 - 工程意义:少见的工程实测而非论文引用堆砌,可作为生产部署参考基准
工程价值:⭐⭐⭐⭐⭐ 少见的工程实测数据,有具体硬件配置和花费,量化对比可直接用于选型
建议写入:/shared/research-kb/inbox/jay/2026-09-inference-engineering-vllm-pareto-atlas.md
二、✅ Tier2 — 参考/归档(通过工程筛选)
| # | 条目 | 来源 | 归档理由 | 关注点 |
|---|---|---|---|---|
| T2-1 | Inference Control Plane 综述 arXiv 2609.23130 | arXiv Sep 19 | vLLM→llm-d演进系统性梳理,最高优先级精读 | 精读全文 |
| T2-2 | KV Cache Working Set arXiv 2609.27746 | arXiv Sep 23 | 在线容量规划,2026-09极新鲜 | 精读 |
| T2-3 | Prefix Cache Eviction 策略 arXiv 2609.28870 | arXiv Sep 24 | 4个关键特征+设计原则,eviction 工程化 | 精读 eviction 部分 |
| T2-4 | Context Engineering 决策框架(Spheron) | Spheron Blog | 输入:输出比率 >10:1 决策树,GPU 经济性量化 | 精读 |
| T2-5 | llm-d 分布式调度(Google/Alibaba/DaoCloud) | llm-d.ai | P2P KV 共享 GLM-5.2: TTFT 7.85s→2.56s | 归档 |
| T2-6 | NVIDIA Dynamo(Control Plane 生产实现) | NVIDIA 官方 | disaggregated serving + KV-aware routing | 跟踪官方 release |
| T2-7 | Moon-cake: cache hit 1.7%→92.2% | ACM TOS 2025 | ByteDance 生产验证,agentic 成本分析 | 精读 |
| T2-8 | PAGE: Partition-Aware KV Eviction | arXiv 2609.22157 | 压缩+eviction 联合优化新视角 | 归档 |
| T2-9 | Who Pays for the KV Cache(FinOps+LLM) | arXiv 2609.24991 | Kubernetes vs LLM 计费盲区,unalloc 工具 | 归档 |
三、❌ 本轮丢弃条目
❌ 丢弃 1:RAG 已经过时了吗 / Agentic RAG 规则重写(趋势类)
丢弃理由:概念性文章,无具体命令/配置/性能数据,属趋势观察而非工程实践。GraphRAG 工程化内容已由 T1-NEW-2 覆盖。
❌ 丢弃 2:AI Agent 的演进 = 减少 LLM 思考次数(观点类)
丢弃理由:核心论点有价值(Plan-and-Execute 模式),但无代码/配置/benchmark 支撑。Plan-and-Execute 概念可由 T1-NEW-3 补充的案例间接验证。
四、📊 全天 Tier1 汇总(最终入库建议)
| 来源 | 条目 | 核心价值 | 写入路径 |
|---|---|---|---|
| CSDN | DeepSeek 全链路部署(硬件对照表+命令) | 671B→1.5B 全系覆盖,显存决策表 | 2026-09-deepseek-deployment-commands.md |
| CSDN | MiniCPM-V 三框架横向部署 | llama.cpp/vLLM/Ollama 均可执行命令 | 2026-09-minicpmv-deploy-llamacpp-vllm-ollama.md |
| CSDN | Ollama vs vLLM 量化对比(24倍吞吐量) | 选型决策数据 | 2026-09-inference-engine-benchmark-2026-q3.md |
| CSDN | vLLM+TensorRT-LLM 量化矩阵 | 2026-07 最新生产配置 | 2026-09-inference-engineering-vllm-tensorrt-2026-q3.md |
| CSDN | vLLM 部署排障 + LangGraph 生产故障 | 12个生产故障案例+CVE修复 | 2026-09-vllm-deployment-troubleshooting.md |
| CSDN | Context Engineering 七大降本技术 | 70% 成本削减,before/after 数据 | 2026-09-context-engineering-cost-reduction.md |
| CSDN | GraphRAG+LazyGraphRAG 生产配置 | YAML样本+成本矩阵+工具链版本 | 2026-09-graphrag-lazygraphrag-production.md |
| Towards AI | Agent 框架选型三问+实测 | 3倍提速案例+框架适用边界 | 2026-09-agent-framework-selection-production.md |
| The AI Engineer | The AI Agents Stack 2026 Edition | Eval三层收敛+协议落地分析 | agent-evaluation-harness.md |
| arXiv 2609.17863 | Pareto Atlas — 54配置实测 | $18花费,H100/L4/A100实测矩阵 | 2026-09-inference-engineering-vllm-pareto-atlas.md |
五、⚠️ 待核实矛盾(全平台已知问题)
矛盾 1:SGLang TTFT 数字三源不一致
| 来源 | SGLang TTFT | vLLM TTFT | 条件 |
|---|---|---|---|
| bex.co(TECHSYS) | 85ms | 380ms | H100 |
| five-category 11:05 | 42-80ms | ~150ms | H100 FP8 |
| afternoon 14:00 | 42ms(含prefix reuse) | 45ms(含prefix reuse) | H100 FP8 |
建议:统一归档时注明"prefix reuse enabled" vs "disabled",标注 H100 型号(SXM/PCIe)。
矛盾 2:vLLM vs Ollama 24倍吞吐量 — 测量条件未注明
来源:CSDN su_xiao_wei(2025-06-03)
建议:作为"量级参考"归档,注明"Qwen2.5-14B,条件未完全对齐"。
六、📋 分类标签(本日汇总)
#LLM推理 #KV缓存 #vLLM #SGLang #TensorRT-LLM #Ollama #ContextEngineering
#GraphRAG #LazyGraphRAG #Agent框架 #LangGraph #CrewAI #推理优化
#量化 #FP8 #AWQ #PagedAttention #RadixAttention #PrefixCaching
#InferenceControlPlane #NVIDIADynamo #Mooncake #llm-d #FinOps
#成本优化 #AgenticRAG #MCP #Eviction策略 #容量规划
Jay · 2026-09-29 19:50 · 全天三轮工程筛选汇总 · 研究知识库草稿 · 请勿直接提交 GitHub