2026-07-18 工程文章二次筛选 Round 1

执行实例: Jay
筛选时间: 2026-07-18 10:50 (Asia/Shanghai)
筛选范围: 本日 RSS (ByteByteGo, Cool Papers, Raschka, Import AI, Lilian Weng, MSR Blog, Karpathy, Fireship) + Tavily 检索(vLLM/SGLang 基准、Kernel Generation)
重点: 真实环境、命令、错误、源码、性能数据、可复现步骤


一、保留条目(✅ 进入草稿)


✅ 条目 1:Lilian Weng · Harness Engineering for Self-Improvement

  • 来源: https://lilianweng.github.io/posts/2026-07-04-harness
  • 类型: Substack (Lil'Log)
  • 核心内容:
  • 提出"自我改进 Harness"的概念框架,包含 propose-evaluate-accept 闭环
  • 引用 Self-Harness(Zhang et al. 2026):用 LLM agents 迭代改进 harness 指令
  • 测试模型: MiniMax M2.5、Qwen3.5-35B-A3B、GLM-5,在 Terminal-Bench-2 上评估
  • 工具集描述: read_filewrite_filellm_searchlist_files(Trehan & Chopra 2026)
  • 明确提出Editable OS abstraction boundaries 被打破的安全隐患
  • 6 个 recurring failure modes(Trehan & Chopra 实验)
  • 引用 NVIDIA Polar: Agentic RL on Any Harness at Scale(May 2026)benchmark

【保留理由】 - ✅ 有真实模型名称和 benchmark 名称(Terminal-Bench-2) - ✅ 有具体工具 API(read_file 等),可作为 coding harness 设计参考 - ✅ 安全问题(editable surface、abstraction boundaries)有工程警示价值 - ✅ 引用了具体 2026 年论文,学术可溯源

【工程标签】 #CodingAgent #Harness #RL #SelfImprovement #TerminalBench


✅ 条目 2:Sebastian Raschka · Using Local Coding Agents

  • 来源: https://magazine.sebastianraschka.com/p/using-local-coding-agents
  • 类型: Substack (Ahead of AI) · 免费
  • 核心内容:
  • 完整本地 Coding Harness 搭建教程(类 Claude Code 替代)
  • 实际命令: ollama pull + ~/qwen/settings.json 编辑流程
  • Benchmark 数据: Qwen3.5-4B base model 在 Qwen-Code harness 上 vs 其他模型对比
  • NVIDIA Polar paper(May 2026):Qwen3.5-4B 在 Qwen-Code harness 中效果最佳
  • ollama pull 拉取模型后手动配置 settings.json 的具体操作路径
  • Qwen-Code harness 专门针对 Qwen 模型优化
  • Nemotron-3-Nano(4B)本地可运行

【保留理由】 - ✅ 有完整安装命令路径(ollama pull、修改 settings.json) - ✅ 有 benchmark 对比数据(Polar paper 支撑) - ✅ 实用价值:可作为本地 coding agent 选型参考 - ⚠️ Polar paper 引用为付费内容(Raschka newsletter 付费),但 benchmark 结论已披露

【工程标签】 #CodingAgent #LocalLLM #Ollama #Qwen #Harness


✅ 条目 3:vLLM vs SGLang vs TensorRT-LLM — H100 基准完整对比(2026)

  • 来源: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
  • 类型: 技术博客(Spheron)
  • 核心数据(H100 80GB · Llama 3.3 70B · FP8):
引擎 吞吐量(50 并发) TTFT p50 冷启动
vLLM 1,850 tok/s 120 ms ~62 sec
TensorRT-LLM 2,100 tok/s 105 ms ~28 min
SGLang 1,920 tok/s 112 ms ~58 sec
  • 推荐场景: SGLang → 共享前缀/多轮对话;vLLM → 多硬件/通用;TensorRT-LLM → 单模型高吞吐

【保留理由】 - ✅ 完整硬件/软件/精度配置(H100 80GB、FP8、Llama 3.3 70B) - ✅ 吞吐量 + TTFT + 冷启动三维度对比 - ✅ 有场景推荐逻辑,可作为推理引擎选型决策依据 - ⚠️ 来源为商业平台,但数据与 partisia.tech 等独立基准一致


✅ 条目 4:vLLM Production Deployment — 完整 2026 指南(含多组 Docker 命令)

  • 来源: https://www.sitepoint.com/vllm-production-deployment-guide-2026 + https://www.spheron.network/blog/vllm-production-deployment-2026
  • 类型: 技术博客(含 Kubernetes + Docker 部署清单)
  • 核心命令片段:
# 单卡 FP8
docker run --gpus all --ipc=host -p 8000:8000 \
  -e HUGGING_FACE_HUB_TOKEN=your_token_here \
  vllm/vllm-openai:latest \
  --model meta-llama/Llama-3.3-70B-Instruct \
  --dtype fp8 --max-model-len 16384 \
  --gpu-memory-utilization 0.92 --max-num-seqs 128

# 多卡 TP=2 + chunked-prefill
docker run --gpus all --ipc=host -p 8000:8000 \
  vllm/vllm-openai:latest \
  --model meta-llama/Llama-3.3-70B-Instruct \
  --dtype fp8 --tensor-parallel-size 2 \
  --max-model-len 16384 --gpu-memory-utilization 0.92 \
  --max-num-batched-tokens 65536 \
  --enable-chunked-prefill --kv-cache-dtype fp8
  • Kubernetes 依赖: Docker Engine ≥ 23.0、Kubernetes ≥ 1.27、NVIDIA GPU Operator、KEDA v2.x、cert-manager

【保留理由】 - ✅ 完整 Docker 命令可直接复用 - ✅ Kubernetes 生产环境配置清单(依赖版本明确) - ✅ 有 autoscaling + monitoring 路径 - ✅ FP8 + TP2 + chunked prefill 组合参数有工程参考价值


✅ 条目 5:SGLang vs vLLM — particula.tech 独立基准(2026)

  • 来源: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
  • 类型: 独立技术博客
  • 核心数据(H100):
指标 SGLang vLLM 差值
总吞吐量 ~16,200 tok/s ~12,500 tok/s SGLang +29%
输出 token 吞吐 894 tok/s 413 tok/s SGLang +117%
TTFT 79 ms 103 ms SGLang 快 23%
ITL 6.0 ms 7.1 ms SGLang 快 15%
  • 关键工程结论: RadixAttention 在 prefix 共享场景(多轮对话、RAG)下优势明显;structured output(XGrammar/LLGuidance)场景 SGLang 性能损耗更小

【保留理由】 - ✅ 独立第三方基准(非商业平台),数据可交叉验证 - ✅ 有并发曲线数据(1/10/50/100 并发) - ✅ structured output 场景性能差异有工程实操价值 - ✅ 2026-06-13 更新,时效性强


✅ 条目 6:DeployBase — LLM Inference Engine 完整部署指南

  • 来源: https://deploybase.ai/articles/best-llm-inference-engine
  • 类型: 工程教程
  • 核心命令:
# SGLang with LangChain
pip install sglang[all]
python -m sglang.launch_server \
  --model-path meta-llama/Llama-2-70b-hf --port 30000

# llama.cpp CPU-only
./main -m model.gguf -t 16 -p "Your prompt"

【保留理由】 - ✅ SGLang、vLLM、TGI、llama.cpp 四引擎命令清单 - ✅ 有 backend.init_batch_state = True 等进阶配置 - ✅ llama.cpp CPU-only 场景有实际参考价值


✅ 条目 7:arXiv · Towards Automated Kernel Generation in the Era of LLMs (2601.15727)

  • 来源: https://arxiv.org/html/2601.15727v3
  • 类型: arXiv 综述
  • 核心内容(2026 年 CUDA/Triton kernel 自动生成全景):
系统 核心方法 亮点
AutoKernel (Jaber & Jaber 2026) Profiling → 迭代优化 全模型瓶颈分析
MaxCode (Ou et al. 2026) Max-reward RL + NL critique 统一迭代搜索框架
K-Search (Cao et al. 2026a) LLM as world model 解耦规划与实例化
Kernel-Smith (Du et al. 2026) 进化式 post-training Triton KernelBench L1 达 70% fast¹
CudaForge (Zhang et al. 2025) Agent + hardware feedback 2025 年 SOTA
  • Benchmark 引用: KernelBench、Flashinfer-bench(Xing et al. 2026)

【保留理由】 - ✅ 2026 年最新 kernel 自动生成综述,覆盖 5 个具体系统 - ✅ 有性能数据(Kernel-Smith 70% fast¹ on KernelBench L1) - ✅ 可作为"LLM 推理内核优化"主题页的学术索引


✅ 条目 8:Erik Steiger · Benchmarking LLM Inference: vLLM vs MAX

  • 来源: https://www.ersteiger.com/posts/vllm-vs-max
  • 类型: 独立基准测试
  • 核心数据(Qwen3-8B · L40):
# vLLM Docker
docker run --runtime nvidia --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -e HUGGING_FACE_HUB_TOKEN=${HF_TOKEN} \
  -p 8000:8000 --ipc=host \
  vllm/vllm-openai:latest --model Qwen/Qwen3-8B

# SGLang Docker
docker run --gpus all --shm-size 32g -p 8000:8000 \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  --env "HF_TOKEN=$HF_TOKEN" --ipc=host \
  lmsysorg/sglang:latest \
  python3 -m sglang.launch_server --model-path Qwen/Qwen3-8B --host 0.0.0.0

# Benchmark 命令
python benchmark_serving.py --base-url http://localhost:8000 \
  --endpoint /v1/completions --backend {modular,vllm,sglang} \
  --model Qwen/Qwen3-8B --dataset-path ShareGPT_V3_unfiltered_cleaned_split.json \
  --num-prompts 500 --seed 123
  • Benchmark 结果: MAX 50.6s / SGLang 54.2s / vLLM 58.9s(500 prompts)

【保留理由】 - ✅ 完整 docker 命令 + benchmark 命令脚本可完全复现 - ✅ 独立第三方(非商业平台),基准测试脚本路径公开 - ✅ Qwen3-8B 贴近实际生产模型规模 - ✅ 有 docker 镜像大小对比(MAX < vLLM < SGLang)


✅ 条目 9:Microsoft Research · Verifying Rust Cryptography in SymCrypt

  • 来源: https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
  • 类型: MSR 官方博客
  • 核心内容:
  • 标准(SPEC)→ 代码的 Rust 密码学验证方法
  • 从标准规范到实现代码的验证流程
  • 对应 AI/ML 系统中密钥管理、传输加密的工程实践
  • 开发者编写代码时即进行验证(保持速度与适应性)
  • 不只是形式化验证,而是标准驱动的开发流程

【保留理由】 - ✅ 有方法论创新:标准→代码的验证链路 - ✅ 与 AI 系统安全工程直接相关(密码学实现审计) - ✅ Microsoft 官方,有实际工程案例 - ⚠️ 非 AI/ML specific,但属于 AI 工程基础设施安全层


✅ 条目 10:Microsoft Research · SkillOpt: Agent Skills as Trainable Parameters

  • 来源: https://www.microsoft.com/en-us/research/blog/skillopt-agent-skills-as-trainable-parameters/
  • 类型: MSR 官方博客
  • 核心内容:
  • 将 Agent 技能(即 instructions)作为可训练参数,而非手工修改
  • 技能编辑→训练过程,解决 Agent 指令手动调优失效的问题
  • 动机:指令被手工修改后无法保证改进

【保留理由】 - ✅ 有新范式:技能可训练,而非纯 prompt engineering - ✅ 与 Lilian Weng harness 主题形成技术关联(self-improving agents) - ⚠️ 缺少具体训练命令/代码,复现度中等


✅ 条目 11:Microsoft Research · Memora: Harmonic Memory Representation

  • 来源: https://www.microsoft.com/en-us/research/blog/memora-a-harmonic-memory-representation-balancing-abstraction-and-specificity/
  • 类型: MSR 官方博客
  • 核心内容:
  • AI Agent 记忆长对话时效率下降的根源:无法像人类一样动态平衡抽象性与具体性
  • Memora 的谐波记忆表征方案
  • 解决上下文重载和检索效率问题

【保留理由】 - ✅ 新记忆架构概念,与 agent memory 系统设计直接相关 - ✅ 有明确问题定义:抽象性与具体性的 trade-off - ⚠️ 无具体代码/命令,工程落地细节待核验


二、丢弃条目(❌ 过滤)及理由


❌ ByteByteGo · EP221 Docker 底层工作原理

  • 丢弃理由: 基础概念介绍,无新命令、无性能数据、无 2026 年新动态。Docker 原理已有大量优质替代内容(Docker 官方文档、Containerpedia 等)。

❌ ByteByteGo · 多租户架构指南

  • 丢弃理由: 通用架构设计,无 AI/ML 工程特定内容。非本次筛选目标。

❌ ByteByteGo · AI 客服旅游行业

  • 丢弃理由: 行业应用分析,非工程实践。缺少可复现步骤。

❌ ByteByteGo · RLHF vs DPO

  • 丢弃理由: 概念综述,有内容但本次筛选以工程为主。RLHF/DPO 已有 Lilian Weng 等更深度来源。

❌ Cool Papers cs.CL · Partition/Prompt/Aggregate

  • 丢弃理由: 学术研究论文(统计方法),缺少工程实践细节。无命令、无代码、无性能基准。

❌ Cool Papers cs.CL · SciDiagramEdit

  • 丢弃理由: 科研图表编辑工具,2026 ML 科研方向,非工程实践。

❌ Cool Papers cs.CL · Beyond the Leaderboard (VQA)

  • 丢弃理由: 多模态医疗 AI 评估论文,工程复现路径远。

❌ Cool Papers cs.CL · TikStance

  • 丢弃理由: 数据集论文(TikTok 政治立场),无工程可复现内容。

❌ Cool Papers cs.CL · 语言识别

  • 丢弃理由: 学术方法论文,log-ratio 几何分类器。缺少实际部署数据。

❌ Cool Papers cs.IR · 桥接证据(Agentic 搜索因果效用)

  • 丢弃理由: 信息检索学术研究,概念性强,无具体命令或性能数据。

❌ Cool Papers cs.IR · CoSimRec

  • 丢弃理由: 推荐系统反馈循环研究。非本次 AI 工程筛选核心。

❌ Cool Papers cs.IR · 生成式 AI vs XMLC

  • 丢弃理由: 主题标引基准研究,德语文献集。工程关联度低。

❌ Cool Papers cs.IR · LLM 房地产搜索重排序

  • 丢弃理由: 行业应用案例,非通用工程实践。

❌ Cool Papers cs.IR · 关注专家策略

  • 丢弃理由: 金融资产推荐研究。非本次核心方向。

❌ Import AI 460–464

  • 丢弃理由: 均为宏观 AI 评论(GPU clusters、自我改进机器人、ASI 路径等),无具体工程数据或可复现步骤。Jack Clark 的 Import AI 属于高影响力 newsletter,但本次筛选重点为工程实践条目。

❌ Karpathy YouTube RSS

  • 丢弃理由: YouTube 视频 RSS,无可提取的工程命令或代码。Karpathy 的视频内容优质但不适合文本数据库条目。

❌ Fireship YouTube RSS

  • 丢弃理由: YouTube 视频 RSS,GPT-5/法律诉讼等大众科技内容,非工程深度。

❌ Raschka · LLM Research Papers 2026 Part 1(清单)

  • 丢弃理由: 论文清单汇总,本身非工程实践内容。可作为参考文献索引,但不适合作为独立工程条目收录。

❌ Raschka · My Workflow for Understanding LLM Architectures

  • 丢弃理由: 方法论介绍,无具体命令或复现步骤。偏向学习方法而非工程实践。

❌ StableLearn · LLM Inference Framework Guide 2026

  • 丢弃理由: 来源可信度存疑(stable-learn.com 域名)。benchmark 数据与其他独立来源偏差较大(TensorRT-LLM TTFT 45ms 远低于 spheron/particula 的 105ms)。数据冲突,不适合直接收录。

❌ BentoML · Kernel Optimization for LLM Inference

  • 丢弃理由: 有价值的工程内容,但无具体命令/配置。属于知识性文章而非可操作指南。Benchmark 数据缺少硬件配置和模型规模。

三、分类标签汇总

#推理引擎 #vLLM #SGLang #TensorRT-LLM #MAX #H100 #FP8
#CodingAgent #Harness #LocalLLM #Ollama #Qwen
#KernelGeneration #CUDA #Triton #AutoKernel #KernelBench
#AI工程 #Rust #密码学 #AgentMemory #SkillOpt
#Benchmark #部署 #Docker #Kubernetes #KEDA

四、建议写入路径

主草稿文件: /shared/research-kb/inbox/jay/2026-07-18-1050-engineering-filter-round1-jul2026-substack-arxiv.md

关联草稿(本轮已有,可直接引用): - 2026-07-18-ai-engineering-backend-db-deploy.md(今日上午版,含 github/copilot-sdk、turbovec 等)

建议补充至主题页: 1. "LLM 推理引擎选型" — 纳入条目 3/4/5/6/8 的 benchmark 数据 2. "Coding Agent / Harness 工程" — 纳入条目 1/2 3. "CUDA/Triton Kernel 自动生成" — 纳入条目 7


五、后续精读/核验建议

优先级 行动 目标
🔴 高 精读 Lilian Weng harness 原文 提取 Self-Harness 工具 API 和 6 个 failure modes 详情
🔴 高 精读 Raschka local coding agents 原文 提取 Qwen-Code harness benchmark 完整数据
🔴 高 核验条目 5(particula.tech)benchmark 原始数据 与 spheron 交叉验证 16,200 tok/s 数据来源
🟡 中 精读 arXiv 2601.15727 提取 Kernel-Smith 70% fast¹ 的具体含义和测试条件
🟡 中 精读 MSR SkillOpt 原文 确认训练命令/框架依赖是否公开
🟢 低 扫描 deploybase.ai 完整命令集 补充 TGI、llama.cpp 部署命令至知识库

Jay · 2026-07-18 10:50 CST · 工程筛选草稿 Round 1