Jay 工程文章筛选 · 2026-09-30 下午

筛选原则

保留含真实环境、命令、错误、源码、性能数据的条目。丢弃无工程细节的概述/营销内容。


✅ 保留条目


1. HyperQwen: Qwen3.8-27B 单卡优化 Serving 仓库

来源: GitHub · syv-ai/HyperQwen · github.com/syv-ai/HyperQwen 日期: 2026-09(持续更新) 主题: vLLM Patched + Requant Pipeline + Benchmark 保留理由: - 含真实 benchmark 表格:RTX 3090 单卡 Qwen3.8-27B,127 tok/s 单用户,262k context - 含真实命令:INT8_ACT=int8、CTX=huge、MTP speculative decoding 参数 - 含 docs/optimizations.md(每步增量测量)、docs/gotchas.md(真实踩坑记录) - 含多并发数据:64 并发 ~1,035 tok/s decode - 可复现步骤明确,硬件具体(RTX 3090 @ 250W) 标签: vLLM Qwen3.8 benchmark production-commands speculative-decoding 行动建议: 精读 docs/gotchas.md,提取 vLLM 实际 OOM/错误模式


2. Unsloth Qwen3.8 本地运行文档(含 vLLM/SGLang 命令)

来源: Unsloth 官方文档 · unsloth.ai/docs/models/qwen3.8 日期: 2026-09(最新) 主题: Qwen3.8 FP8/NVFP4 量化运行命令 保留理由: - 真实 vLLM 安装命令:pip install vllm,Serving 命令含 --enforce-eager 等参数 - SGLang 命令:sglang.launch_server(),要求 v0.5.19(lm_head FP8 兼容问题) - 含 Torchcodec issue 解决命令 - 含 MTP(Speculative Decoding)启用命令:--enable-mtp - 含 NVFP4 量化分析:1.5× 加速,保留 92-97% 精度 - benchmark 数据具体(Benchmark 表格,MMLU-Pro / AIME 2025 / GPQA) 标签: vLLM SGLang Qwen3.8 quantization commands benchmark 行动建议: 提取 NVFP4 vs FP8 量化精度对比数据入知识库


3. Rethinking Cache Replacement For LLM Prefix Reuse

来源: arXiv · arxiv.org/abs/2609.28870 日期: 2026-09 主题: KV cache 替换策略工程优化 保留理由: - 专注 prefix caching 场景的 cache replacement policy - 学术平台来源,可溯源 - 与 vLLM/SGLang prefix cache 生产实践直接相关 标签: KV-cache prefix-caching arXiv inference-optimization 行动建议: 扫描是否有配套代码仓库,验证基准数据集


4. Shared Global KV with Layer-Specific Local History

来源: arXiv · arxiv.org/abs/2609.28006 日期: 2026-09-23 主题: 新的 KV cache 共享架构(上层复用下层 KV) 保留理由: - 新鲜(9月23日),架构级别 KV cache 优化 - 附图和具体 layer 分工描述 - 128 entries 对比设计,有硬件感知细节 - 与 vLLM PagedAttention 家族优化路线相关 标签: KV-cache architecture arXiv long-context 行动建议: 与 vLLM/SGLang 工程师讨论落地可行性


5. Multi-Bin Batching for Increasing LLM Inference Throughput

来源: ACM · HotStorage '26 · dl.acm.org/doi/full/10.1145/3843225 日期: 2026 主题: 新 batching 策略工程论文 保留理由: - 被引用 20 次,有一定社区认可度 - 与 vLLM continuous batching 直接竞争 - 学术来源,可查源代码 标签: batching inference-optimization ACM throughput 行动建议: 查是否有开源实现


6. awesome-harness-engineering: AI Agent Eval/Harness 精选列表

来源: GitHub · github.com/ai-boost/awesome-harness-engineering 日期: 持续更新 主题: Eval harness 工具、模式、记忆、MCP、权限、可观测性 保留理由: - Claw-Eval:300 human-verified 任务,9 类别,Meta/Kimi/Qwen/Tencent 引用 - RealReplicaBench:Alibaba 107 任务,CLI/browser/file/MCP 工作流,有容器元数据 - AgentDebug(ICLR 2026):Agent Error Taxonomy,+24% all-correct accuracy - 系统性梳理,来源可靠,适合做主题页 标签: agent-harness evaluation benchmark MCP observability 行动建议: 更新 Agent Eval 主题页,补充 Claw-Eval 和 RealReplicaBench


7. SWE-bench Verified Context Compression Ablation(17 Sep 2026)

来源: Towards AI · pub.towardsai.net/we-read-20-agent-harnesses 日期: 2026-09-22 测量 主题: 20 个 Agent Harness 的上下文压缩控制能力 保留理由: - 实证性研究:20 个 harness,15 个自动压缩,10 个暴露阈值设置 - 含真实代码查询命令:git clone --depth 1 <repo> h && grep -rniE 'auto[_-]?compact' h - 核心发现:单一 context-management 设置将 SWE-bench Verified 从 6.40% 拉升至 58.40%(52 点! - 属于极罕见的"单一变量大影响"案例 标签: context-engineering agent-harness compression swe-bench empirical 行动建议: 补充入 Agent eval 主题页,作为配置敏感度案例


8. DeepSeek V4.1-Flash: KV Cache 降至 1/4

来源: Local AI Zone 月度汇总 · local-ai-zone.github.io/blog/September_2026_AI_Model_Updates.html 日期: 2026-09-10 主题: 深度优化 KV cache 的 Agent 高效 serving 保留理由: - 真实数字:100K token session,KV cache 从 ~40GB 降至 ~10GB - 4 项技术组合(GQA + 动态头剪枝 + 选择性层缓存 + 自适应压缩) - 与生产 agent 场景直接相关 - MIT license + open weights - Engineering verdict 明确:适合长 session、多轮对话 标签: KV-cache DeepSeek inference-optimization agent long-context 行动建议: 入 inference 工程主题页,作为 2026-09 标志性事件


9. Oracle Developer Blog: Context Engineering 四操作

来源: Oracle · blogs.oracle.com/developers/what-is-context-engineering 日期: 2026-09-28(最新) 主题: Context Engineering 生产失败率和治理 Decay 数据 保留理由: - 含 ConstraintRot benchmark(2026-06,1323 runs,7 model families):governance decay 38% - 含 MCP tool descriptions smell 数据:856 tools on 103 servers,defect rate 高 - 4 operations 框架(路由、缓存、压缩、写入)有工程实践价值 - 来源权威(Oracle Developer Blog),叙事扎实 标签: context-engineering governance MCP production benchmark 行动建议: 补充入 context engineering 主题页,引用 ConstraintRot 数据


10. AI Engineering Insider: Senior LLM Inference Engineer 面试题

来源: Substack · aiengineeringinsider.substack.com/p/inference-serving-senior-llm-inference 日期: 2026-09(最新) 主题: vLLM/SGLang/TensorRT-LLM/TGI 面试要点 保留理由: - TGI 2026-03 进入维护状态,仓库 archived,这是重要拐点信息 - 面试领域覆盖全面(batching/scheduling/memory/replicas/autoscaling) - 工程细节丰富(TTFT/TPOT/ITL/GPU utilization 区分) - 可作为 inference 工程能力图谱检查清单 标签: inference-engineering interview vLLM SGLang TensorRT-LLM career 行动建议: 入 inference 工程主题页,作为 2026-09 技能路线图参考


11. Dataiku: LLM Output Quality Monitoring 生产实践

来源: Dataiku Blog · dataiku.com/blog/llm-output-quality-monitoring 日期: 2026-09-25 主题: 生产 LLM 质量监控 保留理由: - 聚焦生产监控盲区(系统健康但答案错误) - 含 RAG + LLM 综合质量失效案例(政策过时 vs 正确来源矛盾) - 实用监控指标讨论 标签: llmops production-monitoring quality RAG observability 行动建议: 入 LLMops 主题页


12. Cognee: 5 开源 LLM/Agent Eval 工具对比

来源: Cognee Blog · cognee.ai/llm-agent-evaluation-tools 日期: 2026-09-23 主题: DeepEval / Ragas / 等工具生产横向对比 保留理由: - 清晰工具对比表格 - 含 Ragas trajectory metrics(Task Completion / Step Efficiency / Plan Adherence / Plan Quality) - 含 Tool Correctness / Argument Correctness 单独评估 - 实用选型参考 标签: evaluation deepeval ragas agent-eval production 行动建议: 入 agent eval 主题页工具对比部分


13. Jev / Laya: Decision Model 新类别

来源: BoringBot Substack · boringbot.substack.com/p/the-hype-of-jev-explained-a-deep 日期: 2026-09-15/18 主题: Decision Model vs LLM(闭源 Jev + 开源 Laya) 保留理由: - 新兴类别:从固定列表评分并返回概率,而非生成文本 - 性能数字:70-500ms vs LLM pipeline 秒级 - 适合规则/逻辑类决策,与 RAG pipeline 对比鲜明 - 2026-09 新出,值得跟踪 标签: decision-model agentic architecture new-category 行动建议: 入 agent architecture 主题页跟踪项


❌ 丢弃条目

条目 丢弃理由
HyperQwen GitHub 主页摘要 信息重复,详细内容已在 docs 中保留
Qwen3.8 benchmark 表格(Unsloth 页面) 已在条目 2 覆盖
"Master Inference Engineering" Substack(Opinion AI) 营销性质,无具体命令或数据
AI Engineer Interview Part 2(Medium) 面试攻略,非工程操作指南
Context Engineering 各博客(TierZero/Trantor/CallSphere/Metamindz) 框架概述,无新数据,统计数字在其他来源已覆盖
DataCamp: Best LLM for Coding 2026 模型排名,非工程操作指南
FUNDA: Tiered Model Pricing 定价分析,非工程内容
Cobus Greyling: Six Key Elements of Agent Prompt 概念性,无工程细节
Himanshu Ramchandani: LLM Inference Pipeline Workshop 营销导流,无实质工程内容
Yeyu Huang: Multi-agent + OpenRouter 示例代码级别,无深度工程数据
Arawg AI Agent RAG Benchmark 2026-08 数据偏旧,方法论已收录

主题分布

  • Inference 工程(vLLM/SGLang/batch/KV-cache): 8 条
  • Agent/Eval/Harness: 5 条
  • Context Engineering: 2 条
  • LLMOps/生产监控: 2 条
  • 新兴类别(Decision Model): 1 条

建议写入路径

  • 主草稿: 2026-09-30-jay-engineering-filter-sep30.md(本文件)
  • 后续精读: docs/gotchas.md(HyperQwen)、ConstraintRot paper(Governance Decay)

本轮写入

  • ✅ 已写入:/shared/research-kb/inbox/jay/2026-09-30-jay-engineering-filter-sep30.md