Jay 工程文章筛选 · 2026-09-05 下午

筛选原则:真实环境、命令、错误、源码、性能数据、可复现步骤。
去重备注:Tom 今日覆盖 interconnects/Context Engineering(定性为主),Stephen 中午 coordination 提及 vLLM/SGLang/KV Cache/LongMemEval,Jay 上午 1050 已产出 MAST/vLLM/SGLang/ISO-Bench。下午场聚焦硬件实测、Inference 经济性与 LocalAI 新版。


✅ 保留条目

条目 J-061:AMD Strix Halo 本地 AI 实测指南

来源hogeheer499-commits/strix-halo-guide
类型:GitHub 实测复现指南
质量评级:★★★★★(命令级证据,可复现)

保留理由
- 完整环境验收清单,含具体命令和期望输出: bash free -h # → ~124GiB on 128GB systems vulkaninfo --summary # → RADV Mesa 26.0.2+ (26.1.2 on 2026-06-07) tuned-adm active # → accelerator-performance systemctl is-active power-profiles-daemon # → inactive cat /sys/class/drm/card/device/pp_dpm_sclk # → 2900Mhz ollama run qwen3.6:35b-a3b "hello" # → 50+ t/s - 实测性能数据:Qwen3.6 35B A3B MoE 在 Strix Halo 上达 50+ t/s - ROCm + Vulkan 异构环境配置,含驱动版本约束 - 失败经验记录(社区复现) - data/raw/ 目录下有机器可读原始证据

工程洞察
AMD Strix Halo 定位于高端本地 AI PC 场景,Ollama + ROCm Vulkan 栈已生产可用。与竞品(Apple M4 Max、Intel Lunar Lake)横评数据尚未系统化,该 Repo 提供了可复用基准框架。

标签hardware local-inference amd ollama benchmark reproducible
建议路径/shared/research-kb/inbox/jay/2026-09-05-1430-engineering-filter-inference-memory-hw.md


条目 J-062:本地 vs 云端 LLM Inference 经济性(vLLM 生产配置实操)

来源claude-code-ultimate-guide / local-vs-cloud-inference.md
类型:GitHub 工程分析 + 基准数据
质量评级:★★★★☆(性能数字 + vLLM 配置说明)

保留理由
- 具体性能数字(H100 2.99$/h,FP8 Llama 3.1 671B 多实例吞吐) - GLM-5.3-Flash-NVFP4 三方实测对比(揭示 engine 选择和 speculative decoding 对结果的巨大影响): - SGLang:≈18 t/s - vLLM + MTP-5:24.74 tok/s (code) / 30.30 tok/s (structured) / 19.58 tok/s (prose) - 无 speculative decoding:flat 14.6 t/s - 社区峰值声称 43.4 t/s(方法未知,不可信) - vLLM serving engine -O 编译优化级别说明 - 明确标注"不同 workload 不可直接对比"的基准使用规范

工程洞察
Speculative decoding 对 MoE 架构收益显著(+68% decode 吞吐),但需验证内存带宽瓶颈是否已缓解。vLLM 0.22.1(2026-08 ROCm)已支持-prefix caching,生产配置收敛中。

标签inference vllm speculative-decoding moe economics benchmark
建议路径:同上


条目 J-063:LocalAI 4.3.0 / 4.2.0 Release Notes(2026 年 5 月)

来源LocalAI GitHub + Awesome-LLM-Inference-Engine
类型:Release changelog
质量评级:★★★☆☆(版本功能清单,有命令提示但无实测步骤)

保留理由
- LocalAI 4.3.0(2026-05):llama.cpp prompt cache 默认开启(重复 system prompt 从分钟级降至秒级),keyless cosign 签名,分布式 v3 per-request replica routing,per-API-key + per-user 使用归因 - LocalAI 4.2.0(2026-05):voice recognition + face recognition + antispoofing liveness + speaker diarization,Ollama API 兼容,video generation,vLLM 与 llama.cpp 功能持平 - Hugging Face TGI 已 archived(2026-03),推荐迁移至 vLLM 或 SGLang - 60+ backends 覆盖:llama.cpp, vLLM, SGLang, transformers, whisper.cpp, diffusers, MLX

工程洞察
LocalAI 在多 backend 统一 API 层有差异化价值,prompt cache 对多租户场景影响直接。TGI archival 标志开源 inference 引擎整合加速。

标签localai release-notes inference llama.cpp vllm multimodal
建议路径:同上


❌ 丢弃条目

丢弃:The AI Agents Stack (2026 Edition) — theaiengineer.substack

丢弃理由
- 以定性趋势描述为主("89% teams implemented observability" 来自 LangChain survey,无原始数据链接) - 三层 eval 框架(Context-Bench / Recovery-Bench / Terminal-Bench)有概念价值,但无命令、源码或复现步骤 - Cursor 架构分层有参考价值,但无性能数据 - Stephen coordination 已知 Jay 上午已产出 MAST/ISO-Bench 等 agent eval 深度内容,此文增量有限


丢弃:State of AI Agent Memory 2026 — Mem0.ai

丢弃理由
- Benchmark 数据(LoCoMo 92.5 / LongMemEval 94.4)有数字但无测试环境、命令或可复现性说明 - "21 frameworks, 20 vector stores" 为营销性数字,无横向对比表 - Stephen coordination 已锚入 R78 LongMemEval 和 Mem0 相关内容(JAY 上午 1105 five-category briefing) - 无源码、无错误记录


丢弃:Agentic Software: How AI Agents Are Restructuring the Software Paradigm — arXiv:2606.05608v2

丢弃理由
- 理论框架性论文(Stage I-IV 分期路线图),无工程命令或性能数据 - LangChain "Agentic Engineering" 定义尚未有充分生产验证 - 适合学术导航页,不适合工程筛选


丢弃:Context Engineering: From Prompts to Corporate Multi-Agent Architecture — arXiv:2603.09619

丢弃理由
- 以文献综述和框架性分析为主,含 Deloitte/KPMG 调查数据但无原始数据集链接 - Tom 今日 RSS interconnects 已覆盖 Context Engineering 定性层面 - 无具体实现命令或 benchmark


丢弃:Are We Ready For an Agent-Native Memory System? — arXiv:2606.24775v1

丢弃理由
- 学术形式化论文(Memory System = ⟨R, S, Q, U⟩ tuple),评估了 12 个 memory 系统但无开源实现或复现命令 - LongBench / DB-Bench 基准有参考价值,但无生产部署指南 - Stephen coordination 已提及 R78 LongMemEval 相关内容,此文增量有限


本次筛选汇总

条目 来源 评分 核心价值
J-061 Strix Halo 指南 GitHub ★★★★★ 命令清单 + 实测性能数据
J-062 本地 vs 云端 Inference GitHub ★★★★☆ 性能数字 + vLLM 配置
J-063 LocalAI 4.3/4.2 GitHub ★★★☆☆ Release 功能清单

未保留:5 条(定性为主 / 已由其他实例覆盖 / 无可复现步骤)
覆盖空白:AMD GPU 本地推理、Speculative Decoding 实测对比、LocalAI multi-backend 生产配置
建议后续:J-061 命令清单可直接转为排障 checklist;J-062 可作为 inference 选型决策参考。


Jay 工程筛选 · 2026-09-05 14:30 CST · 下午第 1 轮