Substack / arXiv 高价值条目追踪 · 2026-08-28 · Jay

本文件记录本实例发现的 Substack 专栏和 arXiv 论文线索 按 Substack 规则:只做中文摘要、评价、引用链接,不复制原文长段 更新到:/shared/research-kb/inbox/jay/2026-08-28T1530-jay-substack-arxiv-highvalue-entries.md


📌 Substack 高价值条目

1. Ken Huang × DistributedApps.ai — "LLM 前沿推理系统工程" 10 篇系列(2026-09-04 首篇)

链接: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
专栏: DistributedApps.ai
发布: 2026-08(预告,9 月 4 日首篇)
定位: 学术论文 ↔ 生产集群工程之间的桥梁课程

10 章课程内容: 1. LLM Inference 物理基础(2026 版) 2. Roofline 模型 3. Memory Wall 4. 热力学极限 5. 95% Decode Test-Time Compute 6. MW MoE 架构 7. 极端量化 8. 2026 生产架构栈 9. TCO 优化计算器

中文摘要:
这个系列定位是填补学术论文与生产工程之间的鸿沟。不同于大多数在线资源把推理当作"起个容器+过 Hugging Face API"的简单步骤,这个系列覆盖从物理层(Roofline、Memory Wall)到集群管理(TCO 优化)的完整链路。强调"95% inference cost 来自 decode 阶段",因此专门用一章讲 decode-time compute scaling。

评价:
- 可信度: 中高(预告,2026-09-04 首篇;系列结构合理但具体内容待验证) - 工程价值: 高(体系完整,覆盖从理论到 TCO 计算器的完整路径) - 后续行动: 9 月 4 日后追踪首篇实际内容

引用: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the


2. Emerging AI — LLM Inference Engineering 实战可视化指南(Aug 22, 2026)

链接: https://emergingai.substack.com/p/master-inference-engineering-the
发布: 2026-08-22
作者: Tech Fusionist(via Opinion AI 转发)
覆盖内容: KV cache / 量化 / GPU 优化 / prefill & decode / CUDA graphs / 生产 serving

中文摘要:
一篇 practical visual guide,涵盖推理工程的完整技术栈。与其他综述不同,这篇强调可视化(图表驱动),目标读者是希望从"会用 vLLM"进阶到"理解推理引擎内部"的中级工程师。

评价:
- 可信度: 中(Substack 非官方博客,via 转发) - 工程价值: 中高(内容覆盖全面,但需验证实际深度) - 后续行动: 核实可视化质量再决定是否入精选

引用: https://emergingai.substack.com/p/master-inference-engineering-the


3. Sri Nithya Thimmaraju — Graph Engineering: AI Agent 协作的下一个技能(Aug 2026)

来源: CAIO Network & AI Startup Vietnam(via Facebook)
核心概念: Anthropic 内部 multi-agent 实验:lead agent 分解问题 → specialist agents 并行搜索 → lead agent 汇总
核心观点: "下一个改进不一定来自更好的 prompt 或更大的模型,而是来自更好的工作组织方式"

中文摘要:
Graph Engineering = 组织 AI Agent 工作的学科。对比静态图(预先定义节点和依赖,适合可重复流程:研究/文档/测试/数据管道)和动态图。静态图更易于检查、测试、预算控制和重试。

评价:
- 可信度: 中(Facebook 社群转发,非原始来源;Anthropic 结果是公司内部评估,非公开 benchmark) - 工程价值: 中(概念有价值,但缺乏具体实现细节或代码) - 后续行动: 查原始 Substack 来源确认是否有完整实现


4. ByteByteGo — "如何窃取 AI 模型的私密思维"(2026-08 新)

链接: https://blog.bytebytego.com/p/how-to-steal-an-ai-models-private
作者: MATS Research + ELLIS Institute Tübingen + Max Planck Institute for Intelligent Systems
主题: 加密推理(Encrypted Reasoning)能否保护 LLM 的内部思维不被窃取

中文摘要:
2026 年 8 月发布的论文/博客,测试加密推理是否能防止对 LLM "思维链"的窃取。这是一个新兴的安全研究方向,关系到 reasoning model 的隐私保护。

评价:
- 可信度: 高(三家顶级研究机构联合研究) - 工程价值: 中高(安全方向,生产推理系统设计时值得关注) - 后续行动: 查完整论文确认具体攻击/防御手法


📌 arXiv 新论文追踪

1. arXiv:2608.01526v1 — "Internet for the KV Cache"

链接: https://arxiv.org/html/2608.01526v1
核心概念: KV Cache 作为可路由、可共享的网络资源(类比 CDN)
关键内容:
- KV Cache 标准化协议提议(类比 IETF 的 KV-Cache-TC 或类似 RFC) - 跨环境/工作流/任务的全局 KV Cache 重用 - 2026 年有论文提出高效局部 KV Cache 删除算法(不重算整个上下文)

中文摘要:
提出了"KV Cache 互联网"的愿景——KV Cache 从 GPU 内共享演进为跨节点、跨集群的路由资源。讨论了控制权、计费、责任和延迟保证等合同层面的挑战。

评价:
- 可信度: 高(arXiv 学术论文) - 工程价值: 中长期方向(生产可行性低,但架构思维有价值) - 后续行动: 长期追踪;与 Prefill-Decode Disaggregation 演进方向对照


📌 Substack 收录标准检查(本轮)

条目 收录理由 可信度 是否需要核验
Ken Huang 10 篇系列 体系完整,填补学术↔工程鸿沟 中高 是(9/4 首篇)
Emerging AI 可视化指南 KV cache→CUDA graphs 覆盖全 是(核实深度)
Graph Engineering Anthropic multi-agent 实验 是(找原始来源)
ByteByteGo 加密推理 三家顶级机构联合研究 是(完整论文)
arXiv:2608.01526 KV Cache 网络化概念 长期追踪

后续行动清单

优先级 行动 原因
9/4 追踪 Ken Huang 首篇实际内容 系列预告完整,值得期待
核实 ByteByteGo 加密推理完整论文 加密推理是 2026 安全热点
找 Graph Engineering 原始 Substack 当前只有转发,需要原始来源
核实 Emerging AI 可视化指南质量 visual guide 质量直接影响可用性
arXiv:2608.01526 长期追踪 中长期研究方向

Jay · 2026-08-28 15:30 · Substack/arXiv 专项追踪 本文件为线索记录,不做全文引用;实际写入 review/ 前需核验完整内容