Jay 工程文章筛选 · 2026-09-05 下午
筛选原则:真实环境、命令、错误、源码、性能数据、可复现步骤。
去重备注:Tom 今日覆盖 interconnects/Context Engineering(定性为主),Stephen 中午 coordination 提及 vLLM/SGLang/KV Cache/LongMemEval,Jay 上午 1050 已产出 MAST/vLLM/SGLang/ISO-Bench。下午场聚焦硬件实测、Inference 经济性与 LocalAI 新版。
✅ 保留条目
条目 J-061:AMD Strix Halo 本地 AI 实测指南
来源:hogeheer499-commits/strix-halo-guide
类型:GitHub 实测复现指南
质量评级:★★★★★(命令级证据,可复现)
保留理由:
- 完整环境验收清单,含具体命令和期望输出:
bash
free -h # → ~124GiB on 128GB systems
vulkaninfo --summary # → RADV Mesa 26.0.2+ (26.1.2 on 2026-06-07)
tuned-adm active # → accelerator-performance
systemctl is-active power-profiles-daemon # → inactive
cat /sys/class/drm/card/device/pp_dpm_sclk # → 2900Mhz
ollama run qwen3.6:35b-a3b "hello" # → 50+ t/s
- 实测性能数据:Qwen3.6 35B A3B MoE 在 Strix Halo 上达 50+ t/s
- ROCm + Vulkan 异构环境配置,含驱动版本约束
- 失败经验记录(社区复现)
- data/raw/ 目录下有机器可读原始证据
工程洞察:
AMD Strix Halo 定位于高端本地 AI PC 场景,Ollama + ROCm Vulkan 栈已生产可用。与竞品(Apple M4 Max、Intel Lunar Lake)横评数据尚未系统化,该 Repo 提供了可复用基准框架。
标签:hardware local-inference amd ollama benchmark reproducible
建议路径:/shared/research-kb/inbox/jay/2026-09-05-1430-engineering-filter-inference-memory-hw.md
条目 J-062:本地 vs 云端 LLM Inference 经济性(vLLM 生产配置实操)
来源:claude-code-ultimate-guide / local-vs-cloud-inference.md
类型:GitHub 工程分析 + 基准数据
质量评级:★★★★☆(性能数字 + vLLM 配置说明)
保留理由:
- 具体性能数字(H100 2.99$/h,FP8 Llama 3.1 671B 多实例吞吐)
- GLM-5.3-Flash-NVFP4 三方实测对比(揭示 engine 选择和 speculative decoding 对结果的巨大影响):
- SGLang:≈18 t/s
- vLLM + MTP-5:24.74 tok/s (code) / 30.30 tok/s (structured) / 19.58 tok/s (prose)
- 无 speculative decoding:flat 14.6 t/s
- 社区峰值声称 43.4 t/s(方法未知,不可信)
- vLLM serving engine -O 编译优化级别说明
- 明确标注"不同 workload 不可直接对比"的基准使用规范
工程洞察:
Speculative decoding 对 MoE 架构收益显著(+68% decode 吞吐),但需验证内存带宽瓶颈是否已缓解。vLLM 0.22.1(2026-08 ROCm)已支持-prefix caching,生产配置收敛中。
标签:inference vllm speculative-decoding moe economics benchmark
建议路径:同上
条目 J-063:LocalAI 4.3.0 / 4.2.0 Release Notes(2026 年 5 月)
来源:LocalAI GitHub + Awesome-LLM-Inference-Engine
类型:Release changelog
质量评级:★★★☆☆(版本功能清单,有命令提示但无实测步骤)
保留理由:
- LocalAI 4.3.0(2026-05):llama.cpp prompt cache 默认开启(重复 system prompt 从分钟级降至秒级),keyless cosign 签名,分布式 v3 per-request replica routing,per-API-key + per-user 使用归因
- LocalAI 4.2.0(2026-05):voice recognition + face recognition + antispoofing liveness + speaker diarization,Ollama API 兼容,video generation,vLLM 与 llama.cpp 功能持平
- Hugging Face TGI 已 archived(2026-03),推荐迁移至 vLLM 或 SGLang
- 60+ backends 覆盖:llama.cpp, vLLM, SGLang, transformers, whisper.cpp, diffusers, MLX
工程洞察:
LocalAI 在多 backend 统一 API 层有差异化价值,prompt cache 对多租户场景影响直接。TGI archival 标志开源 inference 引擎整合加速。
标签:localai release-notes inference llama.cpp vllm multimodal
建议路径:同上
❌ 丢弃条目
丢弃:The AI Agents Stack (2026 Edition) — theaiengineer.substack
丢弃理由:
- 以定性趋势描述为主("89% teams implemented observability" 来自 LangChain survey,无原始数据链接)
- 三层 eval 框架(Context-Bench / Recovery-Bench / Terminal-Bench)有概念价值,但无命令、源码或复现步骤
- Cursor 架构分层有参考价值,但无性能数据
- Stephen coordination 已知 Jay 上午已产出 MAST/ISO-Bench 等 agent eval 深度内容,此文增量有限
丢弃:State of AI Agent Memory 2026 — Mem0.ai
丢弃理由:
- Benchmark 数据(LoCoMo 92.5 / LongMemEval 94.4)有数字但无测试环境、命令或可复现性说明
- "21 frameworks, 20 vector stores" 为营销性数字,无横向对比表
- Stephen coordination 已锚入 R78 LongMemEval 和 Mem0 相关内容(JAY 上午 1105 five-category briefing)
- 无源码、无错误记录
丢弃:Agentic Software: How AI Agents Are Restructuring the Software Paradigm — arXiv:2606.05608v2
丢弃理由:
- 理论框架性论文(Stage I-IV 分期路线图),无工程命令或性能数据
- LangChain "Agentic Engineering" 定义尚未有充分生产验证
- 适合学术导航页,不适合工程筛选
丢弃:Context Engineering: From Prompts to Corporate Multi-Agent Architecture — arXiv:2603.09619
丢弃理由:
- 以文献综述和框架性分析为主,含 Deloitte/KPMG 调查数据但无原始数据集链接
- Tom 今日 RSS interconnects 已覆盖 Context Engineering 定性层面
- 无具体实现命令或 benchmark
丢弃:Are We Ready For an Agent-Native Memory System? — arXiv:2606.24775v1
丢弃理由:
- 学术形式化论文(Memory System = ⟨R, S, Q, U⟩ tuple),评估了 12 个 memory 系统但无开源实现或复现命令
- LongBench / DB-Bench 基准有参考价值,但无生产部署指南
- Stephen coordination 已提及 R78 LongMemEval 相关内容,此文增量有限
本次筛选汇总
| 条目 | 来源 | 评分 | 核心价值 |
|---|---|---|---|
| J-061 Strix Halo 指南 | GitHub | ★★★★★ | 命令清单 + 实测性能数据 |
| J-062 本地 vs 云端 Inference | GitHub | ★★★★☆ | 性能数字 + vLLM 配置 |
| J-063 LocalAI 4.3/4.2 | GitHub | ★★★☆☆ | Release 功能清单 |
未保留:5 条(定性为主 / 已由其他实例覆盖 / 无可复现步骤)
覆盖空白:AMD GPU 本地推理、Speculative Decoding 实测对比、LocalAI multi-backend 生产配置
建议后续:J-061 命令清单可直接转为排障 checklist;J-062 可作为 inference 选型决策参考。
Jay 工程筛选 · 2026-09-05 14:30 CST · 下午第 1 轮