Jay 工程文章筛选 · 2026-09-30 下午
筛选原则
保留含真实环境、命令、错误、源码、性能数据的条目。丢弃无工程细节的概述/营销内容。
✅ 保留条目
1. HyperQwen: Qwen3.8-27B 单卡优化 Serving 仓库
来源: GitHub · syv-ai/HyperQwen · github.com/syv-ai/HyperQwen
日期: 2026-09(持续更新)
主题: vLLM Patched + Requant Pipeline + Benchmark
保留理由:
- 含真实 benchmark 表格:RTX 3090 单卡 Qwen3.8-27B,127 tok/s 单用户,262k context
- 含真实命令:INT8_ACT=int8、CTX=huge、MTP speculative decoding 参数
- 含 docs/optimizations.md(每步增量测量)、docs/gotchas.md(真实踩坑记录)
- 含多并发数据:64 并发 ~1,035 tok/s decode
- 可复现步骤明确,硬件具体(RTX 3090 @ 250W)
标签: vLLM Qwen3.8 benchmark production-commands speculative-decoding
行动建议: 精读 docs/gotchas.md,提取 vLLM 实际 OOM/错误模式
2. Unsloth Qwen3.8 本地运行文档(含 vLLM/SGLang 命令)
来源: Unsloth 官方文档 · unsloth.ai/docs/models/qwen3.8
日期: 2026-09(最新)
主题: Qwen3.8 FP8/NVFP4 量化运行命令
保留理由:
- 真实 vLLM 安装命令:pip install vllm,Serving 命令含 --enforce-eager 等参数
- SGLang 命令:sglang.launch_server(),要求 v0.5.19(lm_head FP8 兼容问题)
- 含 Torchcodec issue 解决命令
- 含 MTP(Speculative Decoding)启用命令:--enable-mtp
- 含 NVFP4 量化分析:1.5× 加速,保留 92-97% 精度
- benchmark 数据具体(Benchmark 表格,MMLU-Pro / AIME 2025 / GPQA)
标签: vLLM SGLang Qwen3.8 quantization commands benchmark
行动建议: 提取 NVFP4 vs FP8 量化精度对比数据入知识库
3. Rethinking Cache Replacement For LLM Prefix Reuse
来源: arXiv · arxiv.org/abs/2609.28870
日期: 2026-09
主题: KV cache 替换策略工程优化
保留理由:
- 专注 prefix caching 场景的 cache replacement policy
- 学术平台来源,可溯源
- 与 vLLM/SGLang prefix cache 生产实践直接相关
标签: KV-cache prefix-caching arXiv inference-optimization
行动建议: 扫描是否有配套代码仓库,验证基准数据集
4. Shared Global KV with Layer-Specific Local History
来源: arXiv · arxiv.org/abs/2609.28006
日期: 2026-09-23
主题: 新的 KV cache 共享架构(上层复用下层 KV)
保留理由:
- 新鲜(9月23日),架构级别 KV cache 优化
- 附图和具体 layer 分工描述
- 128 entries 对比设计,有硬件感知细节
- 与 vLLM PagedAttention 家族优化路线相关
标签: KV-cache architecture arXiv long-context
行动建议: 与 vLLM/SGLang 工程师讨论落地可行性
5. Multi-Bin Batching for Increasing LLM Inference Throughput
来源: ACM · HotStorage '26 · dl.acm.org/doi/full/10.1145/3843225
日期: 2026
主题: 新 batching 策略工程论文
保留理由:
- 被引用 20 次,有一定社区认可度
- 与 vLLM continuous batching 直接竞争
- 学术来源,可查源代码
标签: batching inference-optimization ACM throughput
行动建议: 查是否有开源实现
6. awesome-harness-engineering: AI Agent Eval/Harness 精选列表
来源: GitHub · github.com/ai-boost/awesome-harness-engineering
日期: 持续更新
主题: Eval harness 工具、模式、记忆、MCP、权限、可观测性
保留理由:
- Claw-Eval:300 human-verified 任务,9 类别,Meta/Kimi/Qwen/Tencent 引用
- RealReplicaBench:Alibaba 107 任务,CLI/browser/file/MCP 工作流,有容器元数据
- AgentDebug(ICLR 2026):Agent Error Taxonomy,+24% all-correct accuracy
- 系统性梳理,来源可靠,适合做主题页
标签: agent-harness evaluation benchmark MCP observability
行动建议: 更新 Agent Eval 主题页,补充 Claw-Eval 和 RealReplicaBench
7. SWE-bench Verified Context Compression Ablation(17 Sep 2026)
来源: Towards AI · pub.towardsai.net/we-read-20-agent-harnesses
日期: 2026-09-22 测量
主题: 20 个 Agent Harness 的上下文压缩控制能力
保留理由:
- 实证性研究:20 个 harness,15 个自动压缩,10 个暴露阈值设置
- 含真实代码查询命令:git clone --depth 1 <repo> h && grep -rniE 'auto[_-]?compact' h
- 核心发现:单一 context-management 设置将 SWE-bench Verified 从 6.40% 拉升至 58.40%(52 点!
- 属于极罕见的"单一变量大影响"案例
标签: context-engineering agent-harness compression swe-bench empirical
行动建议: 补充入 Agent eval 主题页,作为配置敏感度案例
8. DeepSeek V4.1-Flash: KV Cache 降至 1/4
来源: Local AI Zone 月度汇总 · local-ai-zone.github.io/blog/September_2026_AI_Model_Updates.html
日期: 2026-09-10
主题: 深度优化 KV cache 的 Agent 高效 serving
保留理由:
- 真实数字:100K token session,KV cache 从 ~40GB 降至 ~10GB
- 4 项技术组合(GQA + 动态头剪枝 + 选择性层缓存 + 自适应压缩)
- 与生产 agent 场景直接相关
- MIT license + open weights
- Engineering verdict 明确:适合长 session、多轮对话
标签: KV-cache DeepSeek inference-optimization agent long-context
行动建议: 入 inference 工程主题页,作为 2026-09 标志性事件
9. Oracle Developer Blog: Context Engineering 四操作
来源: Oracle · blogs.oracle.com/developers/what-is-context-engineering
日期: 2026-09-28(最新)
主题: Context Engineering 生产失败率和治理 Decay 数据
保留理由:
- 含 ConstraintRot benchmark(2026-06,1323 runs,7 model families):governance decay 38%
- 含 MCP tool descriptions smell 数据:856 tools on 103 servers,defect rate 高
- 4 operations 框架(路由、缓存、压缩、写入)有工程实践价值
- 来源权威(Oracle Developer Blog),叙事扎实
标签: context-engineering governance MCP production benchmark
行动建议: 补充入 context engineering 主题页,引用 ConstraintRot 数据
10. AI Engineering Insider: Senior LLM Inference Engineer 面试题
来源: Substack · aiengineeringinsider.substack.com/p/inference-serving-senior-llm-inference
日期: 2026-09(最新)
主题: vLLM/SGLang/TensorRT-LLM/TGI 面试要点
保留理由:
- TGI 2026-03 进入维护状态,仓库 archived,这是重要拐点信息
- 面试领域覆盖全面(batching/scheduling/memory/replicas/autoscaling)
- 工程细节丰富(TTFT/TPOT/ITL/GPU utilization 区分)
- 可作为 inference 工程能力图谱检查清单
标签: inference-engineering interview vLLM SGLang TensorRT-LLM career
行动建议: 入 inference 工程主题页,作为 2026-09 技能路线图参考
11. Dataiku: LLM Output Quality Monitoring 生产实践
来源: Dataiku Blog · dataiku.com/blog/llm-output-quality-monitoring
日期: 2026-09-25
主题: 生产 LLM 质量监控
保留理由:
- 聚焦生产监控盲区(系统健康但答案错误)
- 含 RAG + LLM 综合质量失效案例(政策过时 vs 正确来源矛盾)
- 实用监控指标讨论
标签: llmops production-monitoring quality RAG observability
行动建议: 入 LLMops 主题页
12. Cognee: 5 开源 LLM/Agent Eval 工具对比
来源: Cognee Blog · cognee.ai/llm-agent-evaluation-tools
日期: 2026-09-23
主题: DeepEval / Ragas / 等工具生产横向对比
保留理由:
- 清晰工具对比表格
- 含 Ragas trajectory metrics(Task Completion / Step Efficiency / Plan Adherence / Plan Quality)
- 含 Tool Correctness / Argument Correctness 单独评估
- 实用选型参考
标签: evaluation deepeval ragas agent-eval production
行动建议: 入 agent eval 主题页工具对比部分
13. Jev / Laya: Decision Model 新类别
来源: BoringBot Substack · boringbot.substack.com/p/the-hype-of-jev-explained-a-deep
日期: 2026-09-15/18
主题: Decision Model vs LLM(闭源 Jev + 开源 Laya)
保留理由:
- 新兴类别:从固定列表评分并返回概率,而非生成文本
- 性能数字:70-500ms vs LLM pipeline 秒级
- 适合规则/逻辑类决策,与 RAG pipeline 对比鲜明
- 2026-09 新出,值得跟踪
标签: decision-model agentic architecture new-category
行动建议: 入 agent architecture 主题页跟踪项
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| HyperQwen GitHub 主页摘要 | 信息重复,详细内容已在 docs 中保留 |
| Qwen3.8 benchmark 表格(Unsloth 页面) | 已在条目 2 覆盖 |
| "Master Inference Engineering" Substack(Opinion AI) | 营销性质,无具体命令或数据 |
| AI Engineer Interview Part 2(Medium) | 面试攻略,非工程操作指南 |
| Context Engineering 各博客(TierZero/Trantor/CallSphere/Metamindz) | 框架概述,无新数据,统计数字在其他来源已覆盖 |
| DataCamp: Best LLM for Coding 2026 | 模型排名,非工程操作指南 |
| FUNDA: Tiered Model Pricing | 定价分析,非工程内容 |
| Cobus Greyling: Six Key Elements of Agent Prompt | 概念性,无工程细节 |
| Himanshu Ramchandani: LLM Inference Pipeline Workshop | 营销导流,无实质工程内容 |
| Yeyu Huang: Multi-agent + OpenRouter | 示例代码级别,无深度工程数据 |
| Arawg AI Agent RAG Benchmark | 2026-08 数据偏旧,方法论已收录 |
主题分布
- Inference 工程(vLLM/SGLang/batch/KV-cache): 8 条
- Agent/Eval/Harness: 5 条
- Context Engineering: 2 条
- LLMOps/生产监控: 2 条
- 新兴类别(Decision Model): 1 条
建议写入路径
- 主草稿:
2026-09-30-jay-engineering-filter-sep30.md(本文件) - 后续精读:
docs/gotchas.md(HyperQwen)、ConstraintRot paper(Governance Decay)
本轮写入
- ✅ 已写入:
/shared/research-kb/inbox/jay/2026-09-30-jay-engineering-filter-sep30.md