2026-07-18 工程文章二次筛选 Round 1
执行实例: Jay
筛选时间: 2026-07-18 10:50 (Asia/Shanghai)
筛选范围: 本日 RSS (ByteByteGo, Cool Papers, Raschka, Import AI, Lilian Weng, MSR Blog, Karpathy, Fireship) + Tavily 检索(vLLM/SGLang 基准、Kernel Generation)
重点: 真实环境、命令、错误、源码、性能数据、可复现步骤
一、保留条目(✅ 进入草稿)
✅ 条目 1:Lilian Weng · Harness Engineering for Self-Improvement
- 来源: https://lilianweng.github.io/posts/2026-07-04-harness
- 类型: Substack (Lil'Log)
- 核心内容:
- 提出"自我改进 Harness"的概念框架,包含 propose-evaluate-accept 闭环
- 引用 Self-Harness(Zhang et al. 2026):用 LLM agents 迭代改进 harness 指令
- 测试模型: MiniMax M2.5、Qwen3.5-35B-A3B、GLM-5,在 Terminal-Bench-2 上评估
- 工具集描述:
read_file、write_file、llm_search、list_files(Trehan & Chopra 2026) - 明确提出Editable OS abstraction boundaries 被打破的安全隐患
- 6 个 recurring failure modes(Trehan & Chopra 实验)
- 引用 NVIDIA Polar: Agentic RL on Any Harness at Scale(May 2026)benchmark
【保留理由】 - ✅ 有真实模型名称和 benchmark 名称(Terminal-Bench-2) - ✅ 有具体工具 API(read_file 等),可作为 coding harness 设计参考 - ✅ 安全问题(editable surface、abstraction boundaries)有工程警示价值 - ✅ 引用了具体 2026 年论文,学术可溯源
【工程标签】 #CodingAgent #Harness #RL #SelfImprovement #TerminalBench
✅ 条目 2:Sebastian Raschka · Using Local Coding Agents
- 来源: https://magazine.sebastianraschka.com/p/using-local-coding-agents
- 类型: Substack (Ahead of AI) · 免费
- 核心内容:
- 完整本地 Coding Harness 搭建教程(类 Claude Code 替代)
- 实际命令:
ollama pull+~/qwen/settings.json编辑流程 - Benchmark 数据: Qwen3.5-4B base model 在 Qwen-Code harness 上 vs 其他模型对比
- NVIDIA Polar paper(May 2026):Qwen3.5-4B 在 Qwen-Code harness 中效果最佳
ollama pull拉取模型后手动配置settings.json的具体操作路径- Qwen-Code harness 专门针对 Qwen 模型优化
- Nemotron-3-Nano(4B)本地可运行
【保留理由】
- ✅ 有完整安装命令路径(ollama pull、修改 settings.json)
- ✅ 有 benchmark 对比数据(Polar paper 支撑)
- ✅ 实用价值:可作为本地 coding agent 选型参考
- ⚠️ Polar paper 引用为付费内容(Raschka newsletter 付费),但 benchmark 结论已披露
【工程标签】 #CodingAgent #LocalLLM #Ollama #Qwen #Harness
✅ 条目 3:vLLM vs SGLang vs TensorRT-LLM — H100 基准完整对比(2026)
- 来源: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
- 类型: 技术博客(Spheron)
- 核心数据(H100 80GB · Llama 3.3 70B · FP8):
| 引擎 | 吞吐量(50 并发) | TTFT p50 | 冷启动 |
|---|---|---|---|
| vLLM | 1,850 tok/s | 120 ms | ~62 sec |
| TensorRT-LLM | 2,100 tok/s | 105 ms | ~28 min |
| SGLang | 1,920 tok/s | 112 ms | ~58 sec |
- 推荐场景: SGLang → 共享前缀/多轮对话;vLLM → 多硬件/通用;TensorRT-LLM → 单模型高吞吐
【保留理由】 - ✅ 完整硬件/软件/精度配置(H100 80GB、FP8、Llama 3.3 70B) - ✅ 吞吐量 + TTFT + 冷启动三维度对比 - ✅ 有场景推荐逻辑,可作为推理引擎选型决策依据 - ⚠️ 来源为商业平台,但数据与 partisia.tech 等独立基准一致
✅ 条目 4:vLLM Production Deployment — 完整 2026 指南(含多组 Docker 命令)
- 来源: https://www.sitepoint.com/vllm-production-deployment-guide-2026 + https://www.spheron.network/blog/vllm-production-deployment-2026
- 类型: 技术博客(含 Kubernetes + Docker 部署清单)
- 核心命令片段:
# 单卡 FP8
docker run --gpus all --ipc=host -p 8000:8000 \
-e HUGGING_FACE_HUB_TOKEN=your_token_here \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--dtype fp8 --max-model-len 16384 \
--gpu-memory-utilization 0.92 --max-num-seqs 128
# 多卡 TP=2 + chunked-prefill
docker run --gpus all --ipc=host -p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--dtype fp8 --tensor-parallel-size 2 \
--max-model-len 16384 --gpu-memory-utilization 0.92 \
--max-num-batched-tokens 65536 \
--enable-chunked-prefill --kv-cache-dtype fp8
- Kubernetes 依赖: Docker Engine ≥ 23.0、Kubernetes ≥ 1.27、NVIDIA GPU Operator、KEDA v2.x、cert-manager
【保留理由】 - ✅ 完整 Docker 命令可直接复用 - ✅ Kubernetes 生产环境配置清单(依赖版本明确) - ✅ 有 autoscaling + monitoring 路径 - ✅ FP8 + TP2 + chunked prefill 组合参数有工程参考价值
✅ 条目 5:SGLang vs vLLM — particula.tech 独立基准(2026)
- 来源: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
- 类型: 独立技术博客
- 核心数据(H100):
| 指标 | SGLang | vLLM | 差值 |
|---|---|---|---|
| 总吞吐量 | ~16,200 tok/s | ~12,500 tok/s | SGLang +29% |
| 输出 token 吞吐 | 894 tok/s | 413 tok/s | SGLang +117% |
| TTFT | 79 ms | 103 ms | SGLang 快 23% |
| ITL | 6.0 ms | 7.1 ms | SGLang 快 15% |
- 关键工程结论: RadixAttention 在 prefix 共享场景(多轮对话、RAG)下优势明显;structured output(XGrammar/LLGuidance)场景 SGLang 性能损耗更小
【保留理由】 - ✅ 独立第三方基准(非商业平台),数据可交叉验证 - ✅ 有并发曲线数据(1/10/50/100 并发) - ✅ structured output 场景性能差异有工程实操价值 - ✅ 2026-06-13 更新,时效性强
✅ 条目 6:DeployBase — LLM Inference Engine 完整部署指南
- 来源: https://deploybase.ai/articles/best-llm-inference-engine
- 类型: 工程教程
- 核心命令:
# SGLang with LangChain
pip install sglang[all]
python -m sglang.launch_server \
--model-path meta-llama/Llama-2-70b-hf --port 30000
# llama.cpp CPU-only
./main -m model.gguf -t 16 -p "Your prompt"
【保留理由】
- ✅ SGLang、vLLM、TGI、llama.cpp 四引擎命令清单
- ✅ 有 backend.init_batch_state = True 等进阶配置
- ✅ llama.cpp CPU-only 场景有实际参考价值
✅ 条目 7:arXiv · Towards Automated Kernel Generation in the Era of LLMs (2601.15727)
- 来源: https://arxiv.org/html/2601.15727v3
- 类型: arXiv 综述
- 核心内容(2026 年 CUDA/Triton kernel 自动生成全景):
| 系统 | 核心方法 | 亮点 |
|---|---|---|
| AutoKernel (Jaber & Jaber 2026) | Profiling → 迭代优化 | 全模型瓶颈分析 |
| MaxCode (Ou et al. 2026) | Max-reward RL + NL critique | 统一迭代搜索框架 |
| K-Search (Cao et al. 2026a) | LLM as world model | 解耦规划与实例化 |
| Kernel-Smith (Du et al. 2026) | 进化式 post-training | Triton KernelBench L1 达 70% fast¹ |
| CudaForge (Zhang et al. 2025) | Agent + hardware feedback | 2025 年 SOTA |
- Benchmark 引用: KernelBench、Flashinfer-bench(Xing et al. 2026)
【保留理由】 - ✅ 2026 年最新 kernel 自动生成综述,覆盖 5 个具体系统 - ✅ 有性能数据(Kernel-Smith 70% fast¹ on KernelBench L1) - ✅ 可作为"LLM 推理内核优化"主题页的学术索引
✅ 条目 8:Erik Steiger · Benchmarking LLM Inference: vLLM vs MAX
- 来源: https://www.ersteiger.com/posts/vllm-vs-max
- 类型: 独立基准测试
- 核心数据(Qwen3-8B · L40):
# vLLM Docker
docker run --runtime nvidia --gpus all \
-v ~/.cache/huggingface:/root/.cache/huggingface \
-e HUGGING_FACE_HUB_TOKEN=${HF_TOKEN} \
-p 8000:8000 --ipc=host \
vllm/vllm-openai:latest --model Qwen/Qwen3-8B
# SGLang Docker
docker run --gpus all --shm-size 32g -p 8000:8000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--env "HF_TOKEN=$HF_TOKEN" --ipc=host \
lmsysorg/sglang:latest \
python3 -m sglang.launch_server --model-path Qwen/Qwen3-8B --host 0.0.0.0
# Benchmark 命令
python benchmark_serving.py --base-url http://localhost:8000 \
--endpoint /v1/completions --backend {modular,vllm,sglang} \
--model Qwen/Qwen3-8B --dataset-path ShareGPT_V3_unfiltered_cleaned_split.json \
--num-prompts 500 --seed 123
- Benchmark 结果: MAX 50.6s / SGLang 54.2s / vLLM 58.9s(500 prompts)
【保留理由】 - ✅ 完整 docker 命令 + benchmark 命令脚本可完全复现 - ✅ 独立第三方(非商业平台),基准测试脚本路径公开 - ✅ Qwen3-8B 贴近实际生产模型规模 - ✅ 有 docker 镜像大小对比(MAX < vLLM < SGLang)
✅ 条目 9:Microsoft Research · Verifying Rust Cryptography in SymCrypt
- 来源: https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
- 类型: MSR 官方博客
- 核心内容:
- 标准(SPEC)→ 代码的 Rust 密码学验证方法
- 从标准规范到实现代码的验证流程
- 对应 AI/ML 系统中密钥管理、传输加密的工程实践
- 开发者编写代码时即进行验证(保持速度与适应性)
- 不只是形式化验证,而是标准驱动的开发流程
【保留理由】 - ✅ 有方法论创新:标准→代码的验证链路 - ✅ 与 AI 系统安全工程直接相关(密码学实现审计) - ✅ Microsoft 官方,有实际工程案例 - ⚠️ 非 AI/ML specific,但属于 AI 工程基础设施安全层
✅ 条目 10:Microsoft Research · SkillOpt: Agent Skills as Trainable Parameters
- 来源: https://www.microsoft.com/en-us/research/blog/skillopt-agent-skills-as-trainable-parameters/
- 类型: MSR 官方博客
- 核心内容:
- 将 Agent 技能(即 instructions)作为可训练参数,而非手工修改
- 技能编辑→训练过程,解决 Agent 指令手动调优失效的问题
- 动机:指令被手工修改后无法保证改进
【保留理由】 - ✅ 有新范式:技能可训练,而非纯 prompt engineering - ✅ 与 Lilian Weng harness 主题形成技术关联(self-improving agents) - ⚠️ 缺少具体训练命令/代码,复现度中等
✅ 条目 11:Microsoft Research · Memora: Harmonic Memory Representation
- 来源: https://www.microsoft.com/en-us/research/blog/memora-a-harmonic-memory-representation-balancing-abstraction-and-specificity/
- 类型: MSR 官方博客
- 核心内容:
- AI Agent 记忆长对话时效率下降的根源:无法像人类一样动态平衡抽象性与具体性
- Memora 的谐波记忆表征方案
- 解决上下文重载和检索效率问题
【保留理由】 - ✅ 新记忆架构概念,与 agent memory 系统设计直接相关 - ✅ 有明确问题定义:抽象性与具体性的 trade-off - ⚠️ 无具体代码/命令,工程落地细节待核验
二、丢弃条目(❌ 过滤)及理由
❌ ByteByteGo · EP221 Docker 底层工作原理
- 丢弃理由: 基础概念介绍,无新命令、无性能数据、无 2026 年新动态。Docker 原理已有大量优质替代内容(Docker 官方文档、Containerpedia 等)。
❌ ByteByteGo · 多租户架构指南
- 丢弃理由: 通用架构设计,无 AI/ML 工程特定内容。非本次筛选目标。
❌ ByteByteGo · AI 客服旅游行业
- 丢弃理由: 行业应用分析,非工程实践。缺少可复现步骤。
❌ ByteByteGo · RLHF vs DPO
- 丢弃理由: 概念综述,有内容但本次筛选以工程为主。RLHF/DPO 已有 Lilian Weng 等更深度来源。
❌ Cool Papers cs.CL · Partition/Prompt/Aggregate
- 丢弃理由: 学术研究论文(统计方法),缺少工程实践细节。无命令、无代码、无性能基准。
❌ Cool Papers cs.CL · SciDiagramEdit
- 丢弃理由: 科研图表编辑工具,2026 ML 科研方向,非工程实践。
❌ Cool Papers cs.CL · Beyond the Leaderboard (VQA)
- 丢弃理由: 多模态医疗 AI 评估论文,工程复现路径远。
❌ Cool Papers cs.CL · TikStance
- 丢弃理由: 数据集论文(TikTok 政治立场),无工程可复现内容。
❌ Cool Papers cs.CL · 语言识别
- 丢弃理由: 学术方法论文,log-ratio 几何分类器。缺少实际部署数据。
❌ Cool Papers cs.IR · 桥接证据(Agentic 搜索因果效用)
- 丢弃理由: 信息检索学术研究,概念性强,无具体命令或性能数据。
❌ Cool Papers cs.IR · CoSimRec
- 丢弃理由: 推荐系统反馈循环研究。非本次 AI 工程筛选核心。
❌ Cool Papers cs.IR · 生成式 AI vs XMLC
- 丢弃理由: 主题标引基准研究,德语文献集。工程关联度低。
❌ Cool Papers cs.IR · LLM 房地产搜索重排序
- 丢弃理由: 行业应用案例,非通用工程实践。
❌ Cool Papers cs.IR · 关注专家策略
- 丢弃理由: 金融资产推荐研究。非本次核心方向。
❌ Import AI 460–464
- 丢弃理由: 均为宏观 AI 评论(GPU clusters、自我改进机器人、ASI 路径等),无具体工程数据或可复现步骤。Jack Clark 的 Import AI 属于高影响力 newsletter,但本次筛选重点为工程实践条目。
❌ Karpathy YouTube RSS
- 丢弃理由: YouTube 视频 RSS,无可提取的工程命令或代码。Karpathy 的视频内容优质但不适合文本数据库条目。
❌ Fireship YouTube RSS
- 丢弃理由: YouTube 视频 RSS,GPT-5/法律诉讼等大众科技内容,非工程深度。
❌ Raschka · LLM Research Papers 2026 Part 1(清单)
- 丢弃理由: 论文清单汇总,本身非工程实践内容。可作为参考文献索引,但不适合作为独立工程条目收录。
❌ Raschka · My Workflow for Understanding LLM Architectures
- 丢弃理由: 方法论介绍,无具体命令或复现步骤。偏向学习方法而非工程实践。
❌ StableLearn · LLM Inference Framework Guide 2026
- 丢弃理由: 来源可信度存疑(stable-learn.com 域名)。benchmark 数据与其他独立来源偏差较大(TensorRT-LLM TTFT 45ms 远低于 spheron/particula 的 105ms)。数据冲突,不适合直接收录。
❌ BentoML · Kernel Optimization for LLM Inference
- 丢弃理由: 有价值的工程内容,但无具体命令/配置。属于知识性文章而非可操作指南。Benchmark 数据缺少硬件配置和模型规模。
三、分类标签汇总
#推理引擎 #vLLM #SGLang #TensorRT-LLM #MAX #H100 #FP8
#CodingAgent #Harness #LocalLLM #Ollama #Qwen
#KernelGeneration #CUDA #Triton #AutoKernel #KernelBench
#AI工程 #Rust #密码学 #AgentMemory #SkillOpt
#Benchmark #部署 #Docker #Kubernetes #KEDA
四、建议写入路径
主草稿文件: /shared/research-kb/inbox/jay/2026-07-18-1050-engineering-filter-round1-jul2026-substack-arxiv.md
关联草稿(本轮已有,可直接引用):
- 2026-07-18-ai-engineering-backend-db-deploy.md(今日上午版,含 github/copilot-sdk、turbovec 等)
建议补充至主题页: 1. "LLM 推理引擎选型" — 纳入条目 3/4/5/6/8 的 benchmark 数据 2. "Coding Agent / Harness 工程" — 纳入条目 1/2 3. "CUDA/Triton Kernel 自动生成" — 纳入条目 7
五、后续精读/核验建议
| 优先级 | 行动 | 目标 |
|---|---|---|
| 🔴 高 | 精读 Lilian Weng harness 原文 | 提取 Self-Harness 工具 API 和 6 个 failure modes 详情 |
| 🔴 高 | 精读 Raschka local coding agents 原文 | 提取 Qwen-Code harness benchmark 完整数据 |
| 🔴 高 | 核验条目 5(particula.tech)benchmark 原始数据 | 与 spheron 交叉验证 16,200 tok/s 数据来源 |
| 🟡 中 | 精读 arXiv 2601.15727 | 提取 Kernel-Smith 70% fast¹ 的具体含义和测试条件 |
| 🟡 中 | 精读 MSR SkillOpt 原文 | 确认训练命令/框架依赖是否公开 |
| 🟢 低 | 扫描 deploybase.ai 完整命令集 | 补充 TGI、llama.cpp 部署命令至知识库 |
Jay · 2026-07-18 10:50 CST · 工程筛选草稿 Round 1