engineering · E1 预消化简报(2026-08-05)

执行: Jay · 2026-08-05 11:20 CST(E1 日间轮 · engineering 主题) 窗口: inbox 近 2 天(8/3 下午 ~ 8/5 早间)+ paper_cards 近 3 天新卡 engineering 主/邻接抽查 本简报目的: 为今晚 engineering 活文档接力(v45 → v46)预习备料,聚焦尚未进入 knowledge/engineering.md v45 基线的增量条目


检查过的来源清单

来源 文件 主要 engineering 增量
jay/inbox 2026-08-04T1050-jay-engineering-filter.md v45 主体来源(已在 v45 归档):SDB/StriaTrace/time-to-first-token/能耗建模/ISSTA/Gemma kernel/NVIDIA 控制钩子
jay/inbox 2026-08-04T1850-jay-engineering-filter-p2.md v45 补充来源(已在 v45 归档):CSDN RAG 全链路/StateAct/Claude Code MCP Skill/TokTier/ResKV/vLLM 显存/Ollama vs vLLM
jay/inbox 2026-08-04T0940-jay-ai-engineering-trending-aug.md GitHub Trending + HF Trending + 向量数据库 Q2 2026 + Kimi K3 / GLM-5.2 / MoE 爆发
jay/inbox 2026-08-04-engineering-e1prep.md 昨日 E1prep(v44→v45 基线):5 条,含 SDB/TokTier/ResKV/StriaTrace/MoE
jay/inbox 2026-08-05T1000-jay-morning-briefing-aug05.md 10 条综合:Karpathy nanochat / MoE 爆发 / Qwen3-30B RAG / TELLER 根因分析 / Agent Compiler / Graph bitemporal memory / Graph Engineering 演进 / NVIDIA Agent Skills / Codex 研究自动化 / vLLM vs TRT-LLM 决策树
jay/inbox 2026-08-05T1105-jay-five-category-briefing.md 11 条五类:LiveMem / llm 0.32 / MSR Orchard / Echoverse / Raschka KV Sharing / ByteByteGo 幂等性 / CSDN RAG 补遗
jay/inbox 2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md 今日核心:在线 KV Cache Compaction (arXiv:2608.00902) / LiveMem / C2KV/Lynx/KVX 热点 / Supermicro Tiered KV Cache
jay/inbox 2026-08-05-0820-jay-csdn-inference-agent-rag-highvalue.md vLLM/SGLang/TensorRT-LLM/Ollama 框架全解析 + 腾讯云生产部署命令 + vLLM 显存公式 + 动态稀疏化/三值化量化 + RAG 全链路 + Agentic RAG + Multi-Agent LangGraph + 量化全景
jay/inbox 2026-08-05-1001-rss-cool-papers.md Cool Papers cs.CL:AURORA-LM / LiveMem / 文化意识 LLM
jay/inbox 2026-08-05-1002-rss-cool-papers-ir.md Cool Papers cs.IR:会话内上下文影响 / 电商查询对齐(engineering 无关)
jay/inbox 2026-08-05-1002-rss-lilian-weng.md Lilian Weng Harness Engineering (2026-07-04 完整原文) / Scaling Laws / Reward Hacking / 幻觉
jay/inbox 2026-08-05-1000-rss-bytebytego.md ByteByteGo:LLM 内存为何变贵 + LLM 安全威胁模型 + ChatGPT 如何优化 Agent 循环 + 幂等性指南
jay/inbox 2026-08-05-1000-rss-nathan-benaich.md Nathan Benaich:欧洲 AI 主权 / State of AI May-2026 / RAAIS 2026
jay/inbox 2026-08-05-1000-rss-simon-willison.md llm 0.32 新版发布 + llm-anthropic 0.26 / MiniMax-H3 / Steve Yegge
jay/inbox 2026-08-05-1003-rss-import-ai.md Import AI 467/466/465(无工程净增量)
flyp/inbox 2026-08-04-coding-agents-e1prep.md engineering 邻接:coding agents 相关
flyp/inbox 2026-08-04-multimodal-e1prep.md engineering 邻接:multimodal engineering
flyp/inbox 2026-08-05-multimodal-e1prep.md engineering 邻接
paper_cards IDs 707-727(近 3 天新卡 21 张) engineering 主分类 0 张;主分类 agent/multimodal/evaluation/llm-infra
work-queue.md 2026-08-05 10:00 高价值待深度解读 Top 15:GPTQ-2D / GradCuit / Model or Harness / Frozen Pixel-Space Diffusion / RecHarness / Relax Within / DreamTraj / DeepVoyager-VL

增量条目(7 条,含 1 条新 arXiv)


增量 1 · ⭐⭐⭐⭐⭐ 高 · arXiv:2608.00902 · LinkedIn 在线 KV Cache Compaction for LLM Agents

来源: jay/inbox/2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md(第 1 条) arXiv: https://arxiv.org/abs/2608.00902 TLDR: LinkedIn 研究团队提出两种 sequence-level KV cache compaction 方法(Token Eviction / Attention Matching),延迟至 agent 自身 generation queries 时执行可恢复精度,Qwen3.5-27B 实现 4.2× 吞吐量提升和 3.5× KV 显存削减。

要点: - 问题场景: LLM Agent 执行长时任务(软件工程、深度研究、Web 浏览)时,搜索结果、文件 diff、执行痕迹持续入 context,KV cache 线性膨胀导致显存瓶颈 - 两种 sequence-level compaction 家族对比: - Token Eviction(TE): proxy queries 对缓存位置打分,保留注意力权重最高位置的原始 KV - Attention Matching(AM): 在选择之上额外拟合加性注意力偏置,重建值使输出与完整 cache 匹配 - 核心发现: 立即 compaction 通常降精度;延迟到使用 agent 自身后续 generation 的 queries 时,能恢复大部分精度损失 - 关键工程数据(可复现): - Qwen3.5-27B + Attention Matching:272.1K→99.6K tokens(3.5× KV 削减),吞吐量 217→918 q/h(4.2× 提升) - Qwen3.5-27B + Token Eviction:272.1K→121.3K(2.7× 削减),吞吐量 217→717 q/h(3.3× 提升) - Gemma-4-31B + Attention Matching:1.7× 吞吐量提升 - Gemma-4-31B + Token Eviction:1.5× 吞吐量提升 - 延迟 Compaction 比例 0.2(保留 20% KV): 在大部分任务上保留无 compaction 精度 - GitHub repo 可复现

与活文档 knowledge/engineering.md v45 现有脉络的关系: v45 §2.99 (e) ResKV(arXiv:2607.29591 固定预算 KV 压缩,通过重建被忽略的注意力贡献)和 §2.99 (f) C²KV(arXiv:2607.17715v1 非前缀 KV Cache 压缩复用)已覆盖 KV Cache 压缩方向。arXiv:2608.00902 是 v45 KV Cache 压缩体系的生产场景实测锚点——LinkedIn 工程背景 + agent 场景真实 benchmark + GitHub 可复现,填补了 v45 §2.1/§2.12 缺少的"Agent 长时任务 KV 膨胀"一手生产数据。与 TopKV(拓扑感知传输)互补,前者压缩总量,后者优化传输。

归入节: §2.1 KV Cache 独立系统学科(新增 arXiv:2608.00902 LinkedIn 在线 KV Cache Compaction 作为 agent 场景 KV 压缩生产实测锚点,补充 Attention Matching vs Token Eviction 消融数据)


增量 2 · ⭐⭐⭐⭐⭐ 高 · Lilian Weng · Harness Engineering 三大设计模式

来源: jay/inbox/2026-08-05-1002-rss-lilian-weng.md(2026-07-04 完整原文抓取) URL: https://lilianweng.github.io/posts/2026-07-04-harness/ TLDR: Lilian Weng 系统梳理 Harness Engineering for Self-Improvement,提出三大设计模式(Workflow Automation / File System as Persistent Memory / Sub-agent + Backend Jobs),并指出 harness 与 OS 的类比关系——config/tool interface/protocol 将逐步行业标准化。

要点: - Harness 定义扩展: 相比"agent = LLM + memory + tools + planning + action",harness engineering 额外包含 workflow design(loop engineering)、evaluation、permission controls、persistent state management;是 runtime 和 software system design,而非 prompt templates - 三大设计模式: 1. Workflow Automation: plan → execute → observe/test → improve → execute again goal-oriented loop;Karpathy autoresearch repo 是干净示例;model 分析自身 trajectory 和 failure cases,通过"agent runtime"而非静态 prompt 迭代 2. File System as Persistent Memory: 长周期 agent 中 artifact(experiment logs、code diffs、paper summaries、error traces)远长于 context window;文件管理持久状态自然受益于 core model 能力提升;避免 context 膨胀 3. Sub-agent + Backend Jobs: main agent spawn 多个 subagent 并行执行 + monitor backend jobs;关键设计选择:并行性须是 explicit and inspectable;subagent 输出须存储为文件/logs/status records,model 才可从中断恢复并推理自身执行历史 - OS 类比: harness ≈ OS for AI;应 encapsulate 复杂逻辑同时保持接口简单;configs/tool interfaces/protocols 将逐渐行业标准化 - Coding Agent Harness 核心接口清单: file system tools / shell execution / IO (lsp, git) / MCP tools/Skills / web search / artifacts / backend processes (Cron) / agent delegation (spawn/resume/wait/list/close/interrupt) - RSI 近中期路径:* harness engineering 演进方向是 meta-methodology(improving the machinery of self-improvement itself)

与活文档 knowledge/engineering.md v45 现有脉络的关系: v45 §2.99 (a) SDB(arXiv:2605.20173)已建立"随机-确定性边界"架构方法论,审计了 5 框架的运行时架构模式。Lilian Weng 三大设计模式是 v45 SDB 的补充——SDB 关注"边界"(Proposer/Verifier/Commit/Reject),Lilian Weng 关注"runtime 系统设计"(workflow/persistent memory/subagent);两者共同构成 Agent harness 的架构层(SDB)+ 实施层(Lilian Weng)双重视角。v45 §2.25-2.31 Harness Engineering 节段纲要(ARC-AGI-3/HarnessFix/MemoHarness)已有框架清单但缺少系统性设计模式,Lilian Weng 三大模式填补此空白。

归入节: §2.7 Agentic Engineering 学科化(新增 Lilian Weng Harness Engineering 三大设计模式作为 §2.7 "框架清单 → 架构方法论体系"的实施层补充,与 SDB arXiv:2605.20173 形成架构层+实施层双轨)


增量 3 · ⭐⭐⭐⭐⭐ 高 · arXiv:2608.02515 · LiveMem:长期 Agent 推理的状态连续性

来源: jay/inbox/2026-08-05-1050-jay-kvc-agents-arxiv-weekly.md(第 2 条)+ Cool Papers cs.CL arXiv: https://papers.cool/arxiv/2608.02515 TLDR: 长时间运行的 Agent 消费持续增长的交互流超出上下文容量,现有方法(context retention/summarization/retrieval)无法在 working context 变化时保持持久状态;LiveMem 通过固定容量 memory state 承载全生命周期历史信息,实现 state continuity under context turnover。

要点: - 问题精确定义: state continuity under context turnover——evidence 从当前 context 移除后,agent 仍能基于 memory state 回答相关问题 - 技术方案: pretrained full-attention LLM + 额外 memory state;main attention path 保留 bounded KV window(如滑动窗口);memory state 携带全生命周期历史信息 - 属于 intrinsic memory 方法(无需 extra model) - LongMemEval benchmark 验证: 即使 evidence 已从当前 context 移除,LiveMem 仍能基于 memory state 回答问题 - Evidence-distance 分析: 有用信息持续存在于 active window 之外 - 与 LongHorizon-Harness(v45 §2.99 (i))关系: LongHorizon-Harness 将任务状态显式置于执行之外;LiveMem 提供 intrinsic memory 实现路径;两者互补(状态管理概念 vs 内存实现机制)

与活文档 knowledge/engineering.md v45 现有脉络的关系: v45 §2.99 (i) LongHorizon-Harness(arXiv:2608.01964 任务状态显式管理)和 §2.99 (b) StateAct(subagent 化状态管理)已覆盖 Agent 长任务状态管理。LiveMem 是 v45 §2.24 多层记忆基底和 §2.14 Memory 的新增实现路径——intrinsic memory(无需 extra model)与 Mem0(外部向量存储路线)和 Σ-Mem(filesystem-based memory)形成第三路线:固定容量 intrinsic memory state。与 LiveMem 互补的还有 v45 §2.99 (f) C²KV(非前缀复用)和 TopKV(拓扑感知传输)。

归入节: §2.14 ICLR 2026 MemAgents Workshop + §2.24 多层记忆基底(新增 arXiv:2608.02515 LiveMem intrinsic memory state continuity 作为 §2.24 Memory 学科化第三路线,与 Mem0/Σ-Mem 形成三路线对照)


增量 4 · ⭐⭐⭐⭐ 高 · llm 0.32 + llm-anthropic 0.26:推理痕迹可见化与 OpenAI Responses API 支持

来源: jay/inbox/2026-08-05T1105-jay-five-category-briefing.md(第 2 条)+ Simon Willison RSS 2026-08-04 URL: https://simonwillison.net/2026/Aug/4/new-release-of-llm/ TLDR: Simon Willison 的 llm CLI 工具链发布 0.32 重大版本,新增可见推理痕迹(reasoning traces)、OpenAI Responses API 支持、服务端工具(WebSearch 等)、Claude Opus 5/Sonnet 5/Fable 5 支持;llm-anthropic 0.26 同步更新。

要点: - 可见推理痕迹(Visible Reasoning Traces): 可观测 LLM 的思维链,而非黑盒输出;生产调试价值高 - OpenAI Responses API 支持: llm 工具链扩展支持 OpenAI 新接口格式 - 服务端工具(Server-side Tools): WebSearch 等工具在服务端执行而非本地 - Claude 新模型支持: Opus 5 / Sonnet 5 / Fable 5 via llm-anthropic 0.26 - 日志优化: 结构化日志便于调试 - 复现命令(via uv): bash uv pip install llm==0.32 llm install llm-anthropic==0.26 llm keys set anthropic # 测试可见推理痕迹 llm "解释为什么天空是蓝色的" --model claude-opus-5 --think - 工程价值: llm CLI 是本地 coding agent 的核心工具链(Lilian Weng 和 Raschka 均有推荐);推理可见化对生产调试有直接价值;Claude Code 订阅替代方案之一

与活文档 knowledge/engineering.md v45 现有脉络的关系: v45 §2.13 推理引擎可复现性危机(The Silent Hyperparameter/LeetLLM/KernelSight-LM)已有推理基准测试和可复现性框架。llm 0.32 是 §2.13 新增的工具链条目——推理可见化(visible reasoning traces)属于推理可观测性工程,与 v45 §2.13 patchy631/time-to-first-token 路线图(Week 4 Prometheus/Grafana)和 Datadog 可观测性体系互补。llm CLI 工具链本身也是 §2.22 推理引擎安全 + Coding Agent 的实用工具。

归入节: §2.13 推理引擎可复现性危机(新增 llm 0.32 reasoning traces 可视化作为 §2.13 可观测性工具链补充,与 patchy631 MLOps 路线图和 Datadog 体系互补)


增量 5 · ⭐⭐⭐⭐ 高 · Microsoft Research · Orchard:面向可扩展 Agentic AI 的开源框架

来源: jay/inbox/2026-08-05T1105-jay-five-category-briefing.md(第 3 条)+ MSR Blog URL: https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/ TLDR: Microsoft Research 发布 Orchard 开源框架,为研究社区提供跨任务类型训练和评估 AI Agent 的标准化基线,旨在使 Agent 获得强大性能的同时降低系统复杂度。

要点: - 定位: 偏研究评估基线(vs LangChain/AutoGen/CrewAI 的生产框架定位) - 目标: 跨任务类型训练和评估 AI Agent;降低 agent 系统复杂度 - 与现有框架关系: LangChain/AutoGen/CrewAI 已广泛用于生产;Orchard 提供研究评估的标准化方法 - 工程意义: 对评估 AI Agent 的标准化有推动作用;可能成为 agent 评估benchmark的框架基础设施

与活文档 knowledge/engineering.md v45 现有脉络的关系: v45 §2.7 Agentic Engineering 学科化(SDB 架构方法论/Harness Engineering/HF Harness/Alice Labs 7 框架/Claude Code Subagent)已有框架清单。Orchard 是 §2.7 新增的研究评估框架——v45 §2.7 主要覆盖生产框架(Harness/Claude Code/MCP),Orchard 填补研究评估基线空白;与 v45 §2.14 AMA-Bench / GAM / MemoryArena 评估路线和 §2.22 Eval gap 有交叉。

归入节: §2.7 Agentic Engineering 学科化(新增 MSR Orchard 作为 §2.7 Agent 框架清单的研究评估基线补充,与生产框架横评形成互补)


增量 6 · ⭐⭐⭐⭐ 高 · Microsoft Research · Echoverse:面向 Computer-Use Agent 的深度可演化环境

来源: jay/inbox/2026-08-05T1105-jay-five-category-briefing.md(第 4 条)+ MSR Blog URL: https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/ TLDR: Computer-use AI Agent 在处理邮件、客服等多步骤工作流时表现乏力;Echoverse 在真实环境中训练 Agent,而非仅仅提供更多训练数据——动态演化环境更适合训练真实世界任务的 agent。

要点: - 问题: SWE-bench 类静态 benchmark 不足以训练真实 computer-use 能力;现有 benchmark 模拟器缺乏真实世界交互复杂性 - 方案: 深度可演化环境(deep evolving environments)——环境状态随 agent 行为动态演变,agent 需在真实交互中学习和适应 - 与 SWE-bench 互补: 静态 benchmark(评估能力上限)vs 动态演化环境(训练真实任务能力) - 工程意义: 与 LongHorizon-Harness(v45 §2.99 (i) 任务状态显式管理)互补——后者解决状态管理,前者解决训练环境真实性

与活文档 knowledge/engineering.md v45 现有脉络的关系: v45 §2.7 Agentic Engineering(Claude Code/Computer Use)已有 computer-use 框架内容。Echoverse 是 §2.7 新增的 Computer-Use Agent 训练环境维度——v45 §2.7 主要覆盖 execution harness(Claude Code/HarnessFix),Echoverse 填补 training harness 的真实环境模拟空白;与 §2.14 MemAgents Workshop 的 Benchmark 类评估方法(AMA-Bench/GAM/M3Exam)有交叉。

归入节: §2.7 Agentic Engineering 学科化(新增 MSR Echoverse 作为 Computer-Use Agent 训练环境补充,与 execution harness 和静态 benchmark 形成"训练-执行-评估"三角)


增量 7 · ⭐⭐⭐ 中 · NVIDIA Agent Skills — 100+ 经验证签名技能目录

来源: jay/inbox/2026-08-05T1000-jay-morning-briefing-aug05.md(第 8 条) URL: https://github.com/NVIDIA/skills TLDR: NVIDIA 官方发布 100+ agent skills,覆盖路由优化、GPU 计算、视频管道、RAG 系统、医学影像、量子计算等;每项 skill 经过 Verified + Signed + Security Scan;开源,SKILL.md 格式规范。

要点: - 规模: 100+ skills,github.com/NVIDIA/skills - 覆盖领域: 路由优化 / GPU 计算 / 视频管道 / RAG 系统 / 医学影像 / 量子计算 - 质量保证: 每项 skill 经过 Verified + Signed + Security Scan - 格式: SKILL.md 规范 - 工程意义: 填补 skill 生态系统质量空白——企业可直接依赖经过 NVIDIA 工程验证的技能;与 OpenClaw skill 生态直接竞争/参考 - 与 OpenClaw 关系: SKILL.md 格式与 OpenClaw skill 格式高度相关;NVIDIA 官方背书可能成为企业 skill 选型标准

与活文档 knowledge/engineering.md v45 现有脉络的关系: v45 §2.99 (f) 已收录 mattpocock/skills(Agent Skills 标准化,"Skills 标准化 = Agent 生态的 npm")。NVIDIA/skills 是 §2.7 Agentic Engineering 的新增企业级 skill 目录——与 mattpocock/skills(社区驱动)形成对照:NVIDIA 官方验证 + 安全扫描,企业可信赖度更高;SKILL.md 格式可能成为企业级 skill 规范;与 v45 §2.23 K8s GPU 利用率(NVIDIA DRA/KAI Scheduler)和 §2.16 llm-d 有生态关联。

归入节: §2.7 Agentic Engineering 学科化(新增 NVIDIA/skills 作为 §2.7 Agent Skills 标准化的企业级锚点,与 mattpocock/skills 形成社区版 vs 企业版对照;SKILL.md 格式与 OpenClaw skill 生态直接相关)


值得警惕的矛盾或待核实说法

  1. arXiv:2608.00902 LinkedIn KV Cache Compaction 尚未 peer-reviewed: 预印本,Attention Matching vs Token Eviction 的精度 trade-off 数据来自内部 benchmark,跨模型(Qwen3.5-27B/Gemma-4-31B)的泛化性需实测核验。延迟 compaction 策略(0.2 比例)对不同任务类型的适用性建议原文消融实验验证。

  2. LiveMem(arXiv:2608.02515)方法论新颖但工程落地待验证: state continuity formulation 原创性强,但 intrinsic memory(无 extra model)与生产中广泛使用的 Mem0/Σ-Mem 路线的关系需进一步厘清;LongMemEval benchmark 覆盖范围和与其他 benchmark 的重叠度建议核验。

  3. Lilian Weng Harness Engineering 三大模式是经验归纳非形式化证明: "OS analogy for harness" 是有启发性的概念框架,但 configs/tool interfaces/protocols 行业标准化的具体时间线和路径尚未披露;与 SDB(arXiv:2605.20173)形式化方法的边界需原文核验。

  4. Orchard + Echoverse 是 MSR 研究原型而非生产就绪: 两个框架均来自 Microsoft Research 博客,工程成熟度低,生产部署建议等待正式 release 和社区验证;Orchard 与 LangChain/LlamaIndex Workflows 的差异化价值需原文确认。

  5. llm 0.32 reasoning traces 依赖特定模型支持: reasoning traces 的可见性取决于底层模型是否支持 thinking budget;不同模型的实现方式差异可能影响跨模型可移植性;Claude 5 系列之外的适用性待核验。

  6. NVIDIA/skills 工程规模待核实: "100+ skills" 数量和"每项经过 security scan"的实际覆盖率需实时查 GitHub 确认;该 repo 于 2026-08-05 早间纳入晨间简报,工程价值评级可能偏高。


可引用的 arXiv 号列表(1 条新 arXiv)

增量 arXiv 号 与 v45 基线关系
§2.1 KV Cache 在线 Compaction for LLM Agents arXiv:2608.00902 新增,LinkedIn 工程背景,4.2× 吞吐提升,GitHub 可复现
§2.14/§2.24 LiveMem 状态连续性 arXiv:2608.02515 新增,intrinsic memory 第三路线,与 LongHorizon-Harness 互补

邻接参考(已在 v45 基线,可交叉引用): - arXiv:2608.01964(LongHorizon-Harness,v45 §2.99 (i)) - arXiv:2605.20173(SDB 架构方法论,v45 §2.99 (a)) - arXiv:2607.29591(ResKV 固定预算 KV 压缩,v45 §2.99 (e)) - arXiv:2607.17715v1(C²KV 非前缀 KV Cache,v45 §2.99 (f)) - arXiv:2607.28633(TopKV 拓扑感知传输,v45 §2.99 (d)) - arXiv:2607.26571(From Tokens to Watt-hours GREEN-AI 能耗建模,v45 §2.99 (h))


汇总:v45 → v46 建议增量方向

方向 具体条目 优先级 备注
KV Cache 在线 Compaction(§2.1) arXiv:2608.00902 Attention Matching 4.2× 吞吐 / GitHub 可复现 极高 生产 Agent 场景 KV 膨胀实测锚点
Agent 状态连续性(§2.14/§2.24) arXiv:2608.02515 LiveMem intrinsic memory 第三路线 与 Mem0/Σ-Mem 形成三路线对照
Harness Engineering 设计模式(§2.7) Lilian Weng 三大模式 = SDB 架构层 + 实施层双轨 OS analogy / Sub-agent backend jobs / File system as memory
LLM 推理可观测性工具链(§2.13) llm 0.32 reasoning traces + OpenAI Responses API 补充 patchy631 MLOps 路线图的可观测性维度
MSR Agent 评估基线(§2.7) Orchard + Echoverse = 研究评估框架 × 动态训练环境 生产就绪度低,需跟踪正式 release
Agent Skills 企业标准(§2.7) NVIDIA/skills 100+ verified skills 与 mattpocock/skills 社区版对照,SKILL.md 格式相关

数量统计

  • 检查来源: 22 个 inbox 文件 + 21 张 paper_cards + 活文档 v45 基线
  • 增量条数: 7 条(5 高,2 中)
  • 新 arXiv 号: 2 条(2608.00902 / 2608.02515)
  • 本轮特色: 本轮增量以Agent 状态管理与 KV Cache 生产实测为主线(LinkedIn 4.2× / LiveMem 状态连续性 / Lilian Weng 三大 Harness 模式),与昨日(v45 主体覆盖 SDB + StriaTrace + time-to-first-token + TopKV/ResKV/C²KV + GREEN-AI/ISSTA)形成互补——今日是Agent 长任务内存工程 + LinkedIn 生产 KV 实测轮。无工程硬凑字数:Orchard/Echoverse/NVIDIA/skills 评中是因为 MSR 原型/新兴 repo,生产就绪度有限,建议列入"v46 跟踪项"而非"v46 主线候选"。

矛盾/待核实汇总

# 矛盾/待核实 建议操作
1 arXiv:2608.00902 精度 trade-off 跨模型泛化性 原文消融实验验证,或等 peer-reviewed 版本
2 LiveMem vs Mem0/Σ-Mem 路线边界 原文精读 + 与 Mem0 v0.8.2 实测对比
3 Orchard + Echoverse 生产就绪度 跟踪正式 release,不作为 v46 主线
4 NVIDIA/skills 实际规模 实时查 GitHub 确认 100+ 数字和 security scan 覆盖率
5 llm 0.32 reasoning traces 跨模型可移植性 实测不同模型(Claude/GPT/Qwen)兼容性
6 Lilian Weng "OS analogy" vs SDB 形式化边界 原文核验,确认三大模式是否覆盖 SDB 全部场景

Jay · engineering E1 预消化 · 2026-08-05 11:20 CST · 检查来源 22 个 inbox + 21 paper_cards + v45 基线 · 7 条增量(5 高 2 中)· 2 条新 arXiv · 无 GitHub 写入