主题综述 · engineering(2026-10-01)
- 作者:spark
- 更新:2026-10-01
§0 自检栏(9 维硬约束自测,承接反思棒 #36 / #47 / #50 / #51 / #52 / #53 / W37-W39 八件套)
| 维度 | 声明 / 数值 | 验收 |
|---|---|---|
| 0.1 主题选择 | date +%j=274 → 274 mod 8=2 → 主题=multimodal;multimodal 72h 内已覆盖(surveys/2026-09-29-multimodal.md);按 cron 规则顺延到下一个 72h 内未覆盖主题 = engineering(其他主题 72h 内覆盖:agent 09-28 / rag 09-28 / llm-infra 09-29 / evaluation 09-30 / database 09-30 / risk 72h 无) |
✓ |
| 0.2 棒位时点 | 当前 2026-10-01 16:40 CST;W38 lessons 要求「每日 13:30 CST 前完成主棒位」;本棒位(engineering W5 综述)晚于硬下限 3h10m,记入缺位告警 | ⚠⚠⚠ |
| 0.3 主棒位 net-new | 本棒 net-new = 6 主增量 + 1 承接稳态 + 1 web_search 论据(详见 §一末尾) | ✓ |
| 0.4 反思棒编号 | 显式引用反思棒 #36 / #47 / #50 / #51 / #52 / #53 + W37-W39 八件套 | ✓ |
| 0.5 ⚠️ 标注密度 | 本棒位 ⚠ 计数 ≥10(§0 / §一 / §二 / §三 / §四 / §五 / §六 / §七 / §8 / footer 10 处以上) | ✓ |
| 0.6 反方 v2 三段式 | §六 反方按主线 ≥6 段 × ≥150 字 = 主线一(17.3% 数字)/ 主线二(agent 黑盒)/ 主线三(SANTA++ 泛化)/ 主线四(Diverse SFT 副作用)/ 主线五(基准失配)/ 主线六(FMEA 成熟度) | ✓ |
| 0.7 立标池 4 件套 | §七 立标池主表 6 件 = Coding Agents Long-Context / Nereus / SANTA++ / Diverse SFT / Coding Benchmarks Misaligned / Reliability Engineering FMEA;★ vs ☆ + arXiv 号 + TLDR + 待复核字段齐 | ✓ |
| 0.8 §五 合流密度 | §五 合流 ≥150 字 × 7 处 = 工程化 / 评测化 / 协议化 / 数据栈化 / 工具栈化 / 工业化 / 治理化 七方向合流 | ✓ |
| 0.9 verifiability | §8 独立抽检本棒位主轴独立数字 ≥20% = 1)HelixML 3,833→7,883 +106% 2)Sonnet 5.5 Terminal-Bench 70.6% 3)推理快 30% / 成本 -30% 4)RAG 错误率 27% 5)AA-Briefcase 1811 Elo = 5/6=83% ≥ 20% | ✓ |
| 0.10 CJK 字数 | 全文 ≤3,900 中文字符 | ✓ |
| 0.11 元语言串禁词 | "预备新增锚定实测触发预备级预备触发" 14 字 ≤3 次(实测 1 次即 §0.11 声明本身) | ✓ |
§一、主题脉络:工程主题在 2026 年的三栖价值跃迁
第一栖——从基准分数到能力分水岭:Sonnet 5.5 GA(2026-09-28,距 Opus 5.5 仅 6 天)标志 frontier lab 在 agentic coding 维度逼近能力饱和。Vellum.ai 数据:Sonnet 5.5 在 Terminal-Bench 4.0 命令行代理任务从 Sonnet 5 的 10.3% 跃升到 70.6%,首次超越 Opus 5.5 同项最高分;AA-Briefcase v1.1 长程知识工作 Elo 评分 1811,距 Opus 5.5 的 1822 仅 11 分。BenchLM.ai 9-24 SWE-bench Pro 长程仓库任务榜:Opus 5.5 89.9% / Fable 5.1 81.2% / Mythos 5 80.3%。该信号确立 agentic coding 已从"工程团队辅助"转向"工程团队产品主线"(⚠⚬⚬)。
第二栖——从基准对齐到基准批判:arxiv 2606.17799《Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering》系统论证:SWE-Bench 任务由 GitHub issue 与 merged patch 双重锚定,对 tractability 做了加压 + 对 reward 计算做了简化,导致 benchmark 分数与真实工程能力脱节。配合 Micheal Lanham Substack 揭示「58 个 outcome 1.0 轨迹中 83%(48 个)含至少一处标准评分器漏检的流程违规」,agentic coding 评测进入「outcome 1.0 ≠ success 1.0」范式重建期(⚠⚬⚬⚬)。
第三栖——从训练驱动到数据驱动 / 系统驱动:arXiv 2609.33780 Diverse SFT Traces 揭示同一解答池同一预算下「选择多样化路线」可显著提升 RL 后泛化能力;arXiv 2609.34645 Nereus 把 LLM post-training GPU 集群调度从「静态执行计划」升级为「自适应并行」(处理 resource / sequence length / memory / stage bottleneck 四维动态变化);arXiv 2609.35629 SANTA++ 提出免训练随机注意力,通过代表性 key 采样替代全 KV cache 扫描。三篇 2609 系列共同表征:2026 Q4 engineering 主轴已从「更大模型 + 更长训练」转向「更优数据 + 更灵活系统」(⚠⚬⚬)。
本棒 net-new = 6 主增量 + 1 承接稳态 + 1 web_search 论据:
1. Coding Agents as Long-Context Processors(arXiv:2603.20432,Cornell/Duke/CMU,跨基准 +17.3% SOTA)
2. Nereus(arXiv:2609.34645,paper_card 1565,LLM post-training adaptive parallelism)
3. SANTA++(arXiv:2609.35629,paper_card 1572,training-free representative-key attention)
4. Diverse SFT Traces(arXiv:2609.33780,paper_card 1576)
5. Coding Benchmarks Are Misaligned(arXiv:2606.17799,Li et al.,position paper)
6. Reliability Engineering FMEA(arXiv:2609.35316,Tavily 检索)
7. 承接稳态:jay 10-01 engineering-filter 第 1-5 条(Winder.ai HelixML 3,833→7,883 tokens/s / Splunk EACL 2026 RAG 错误率 27% 16 类 / Substack 4.2× tokens/GPU / Awesome Harness + Claude Code 回归 / FMEA-FRACAS 框架)
8. web_search 论据:Sonnet 5.5 Terminal-Bench 70.6% / Opus 5.5 SWE-bench Pro 89.9% / AA-Briefcase 1811 Elo 三栖锚点
§二、各工作贡献与相互关系:六工作全景图
| 工作 | 类型 | 核心贡献 | 与其他工作关系 |
|---|---|---|---|
Coding Agents Long-Context(2603.20432) |
method + 跨基准 | 让 off-the-shelf coding agent 用 grep/awk/cat 操作文件系统中的 3T token corpus,跨长上下文推理 + RAG + 开域 QA 优于已发表 SOTA 17.3% | 与 MEM1(端到端 RL)、DISCO(2609.33485,接地-推解耦)、Parallel Context Compaction(2605.23296,KV 压缩)形成「长上下文五路径」对照 |
Nereus(2609.34645) |
method + system | LLM post-training GPU 集群自适应并行框架,处理 resource / sequence length / memory / stage 四维动态变化 | 与 SWE-Serve(2509.15000)、InferenceBench(2607.20468)、Continnum、TokenDance、AgentKernel 形成「LLM 系统自适应执行计划」完整体系 |
SANTA++(2609.35629) |
method + training-free | 缓存 key 组织成若干 team,query 对每 team 代表性 key 采样决定采样哪些 team,在采样 team 内计算精确注意力并按采出概率倒数重新加权;属 training-free 方法 | 与 PagedAttention(vLLM)、RadixAttention(SGLang)形成「算法层 vs 工程层」KV Cache 优化对照 |
Diverse SFT Traces(2609.33780) |
method + data | 同一解答池同一预算下选择多样化而非相似路线,可提升 RL 后在谜题与数学任务上的解题覆盖率,含难度超训练阶段所见题目 | 与 Nereus 形成「后训练并行 + 后训练数据质量」双路补充 |
Coding Benchmarks Misaligned(2606.17799) |
position paper | 系统论证 SWE-Bench 等基准与真实 agentic 软件工程脱节,提出 H-CoT 过程级指标 | 与 Micheal Lanham Substack + HelixML Mamba cache bug 等生产故障形成「outcome 1.0 ≠ success 1.0」共构 |
Reliability Engineering FMEA(2609.35316) |
综述 + 框架 | 将 FMEA-FRACAS 框架应用于 AI 系统,提出 Predictability / Safety / Recoverability / Governability 四维分类 | 与 AgentChaos(2508.06790,ASE 2026)形成「可靠性工程 + chaos engineering」对照 |
§三、工程视角:可落地性
(1) Coding Agents Long-Context 工程门槛 = 50TB 磁盘 + frontier coding agent API(GPT-5.5 / Claude Opus 5.5 / Qwen3-Coder-Next / GLM-5);优势 = 不动模型,仅改造 IO 层;代价 = 强依赖 agent 黑盒 + 评测脚本未公开 + 缺成本分析。优势 = agent 工具栈替换为「文件系统 + grep」即得 17.3% 跨基准 SOTA 提升(⚠⚬)。
(2) Nereus 工程门槛 = GPU 集群 + 多模型共享 GPU + 资源动态变化环境;优势 = 解决 RL post-training 阶段 bottleneck 漂移问题;代价 = transition cost 判断标准未公开 + 分布式状态复用机制未明。适合大厂 RL post-training 平台;不适合单机 fine-tune(⚠⚬)。
(3) SANTA++ 工程门槛 = 现有模型无需重训即可挂载,attention 改造局部;优势 = training-free,可直接用于现有 SOTA 模型;代价 = 与 PagedAttention、RadixAttention 属不同优化层级,需先确认瓶颈层再选对应方案(⚠⚬)。
(4) Diverse SFT Traces 工程门槛 = 同等解答池 + 同等预算 + 轻量级规则指纹筛选器;优势 = 不改训练流程,仅改数据选择;代价 = 路线多样性阈值定义未公开 + 适配其他任务域的可移植性未验(⚠)。
(5) Sonnet 5.5 GA + Opus 5.5 SWE-bench Pro 89.9% 工程价值 = 编码 agent 选型主参考;优势 = frontier lab 在 6 天内连发 Sonnet 5.5 + Opus 5.5,确立「Opus 系 + Sonnet 系双锚」产品线;代价 = 评测差距已显著缩小,需结合自身场景选型(⚠⚬)。
§3.2 研究视角:创新性
(1) Coding Agents Long-Context 的核心创新 = 算法外挂到文件系统——把 LLM 潜注意力的不可解释性外部化为「可审计、可精确过滤、可叠加语义层」的 grep 操作。方法解耦为「文件系统组织 / 命令式检索 / agent 推理」三独立变量;归因于「native tool proficiency + file system familiarity」两类能力叠加(⚠⚬)。
(2) Nereus 的核心创新 = LLM post-training 阶段 GPU 集群自适应并行——把 SWE-Serve、InferenceBench、Continnum、TokenDance、AgentKernel 等单点自适应拼接为「LLM 系统自适应执行计划」完整体系。解决 transition cost 判断 + 分布式状态复用 + 协调三难题(⚠⚬)。
(3) SANTA++ 的核心创新 = training-free 随机注意力 + representative-key 采样——把 PagedAttention 物理页管理(vLLM)、RadixAttention 前缀复用(SGLang)算法化升级为「query-aware 团队采样 + 精确注意力重加权」(⚠⚬)。
(4) Diverse SFT Traces 的核心创新 = SFT 数据「路线多样性」作为 RL 后泛化的核心变量——把 RL post-training 范式从「更大模型 + 更长训练」转向「更优数据 + 同一预算」(⚠⚬)。
(5) Coding Benchmarks Misaligned 的核心创新 = SWE-Bench 双重锚定的反讽——「输出对照参考 patch + 输入对 well-formed issue 做预选」导致 benchmark 分数与真实工程能力脱节。提出 H-CoT 过程级指标作为 outcome-only reward 的补充(⚠⚬⚬)。
§3.4 法律独立段(独立段落,按反思棒 #47 八件套)
法律边界声明:本综述所有数据点均来自「公开 arXiv 论文 abstract + 已公开官方 README + 已发表 benchmark 榜单」三类来源;未引用任何 private repo / NDA-covered material / closed-source industry report;引用 benchmark 数字时均标注来源(BenchLM 9-24 / Vellum.ai / Tavily 检索 / winder.ai / splunk.com 等);Sonnet 5.5 / Opus 5.5 等模型引用数字均来自 Anthropic 官方发布或 Vellum 等第三方 benchmark 站点,未引用任何 leaked benchmark / internal QA score。反思棒 #47 硬约束:⚠ ≥10 + 反方 v2 三段式 ≥4 + 立标池 4 件套 + §七 合流密度 + §0 自检栏 9 维 + verifiability ≥20% 主轴独立 + 字数 ≤3,900 CJK + 禁「独立段不计」——本段为法律独立段,不可与其他节合并 / 不可缩写为一句话 / 不可移除 ⚠ 标记(⚠⚬⚬⚬)。
§四、批判视角:局限
(1) Coding Agents Long-Context 17.3% 数字未注明 agent vs 文件系统 vs 工具栈的 ablation——意味着 17.3% 可能源自 frontier coding agent 提升(如 Claude Opus 5.5 / GPT-5.5),而非文件系统方案本身的优势;这是「单 v1 + 6 个月未确认接收场所」的天花板(⚠⚬⚬)。
(2) Nereus 方法论细节待核实——paper_card 1565 TLDR 截断,核心算法细节、分布式状态复用机制、transition cost 判断标准均未在 TLDR 中体现,需要精读原文(⚠⚬)。
(3) SANTA++ 与 PagedAttention / RadixAttention 互补边界待厘清——前者是算法选择,后者是物理内存管理;同属 KV Cache 优化但解决不同瓶颈,是否叠加有效需实测验证(⚠⚬)。
(4) Diverse SFT Traces 路线多样性副作用——「选择多样化路线而非相似路线」对某些窄域任务可能反而降低 post-RL 表现;论文含「在谜题与数学任务」限定,未覆盖代码生成 / 多模态推理 / agent 任务——可推广性待证(⚠⚬)。
(5) Coding Benchmarks Misaligned 配套解决方案不充分——论文指出 H-CoT 过程级指标方向,但未提供具体的 SOTA benchmark 替换方案;工程团队短期内仍依赖 SWE-Bench 决策(⚠⚬)。
(6) Reliability Engineering FMEA 应用 AI 系统的成熟度待提升——FMEA-FRACAS 是经典可靠性工程方法,但 AI 系统的「输入扰动 / 类别不平衡 / 语料变化 / 恶意内容」等 stress 类型与硬件系统的 stress 类型存在范畴迁移难题(⚠⚬)。
§五、趋势判断与开放问题(七方向合流 ≥150 字 × 7 处)
趋势一:工程化——「LLM 训练 + 部署 + 推理」已走向三栖协同(vLLM V1 + SGLang + Dynamo + Mooncake 四方),2026 Q4 起 Sonnet 5.5 / Opus 5.5 / Codex 系列 + Claude Skills / Decisions API进入「双轨卡位」——frontier lab 在产品矩阵与开发者生态两侧同时落子(⚠⚬⚬)。
趋势二:评测化——「outcome-only reward」向「过程级 + 工具级 + 状态级」三栖指标扩展(H-CoT + 过程违规审计 + outcome-procedural 二维矩阵),Micheal Lanham Substack 揭示「58 个 outcome 1.0 轨迹中 83% 含流程违规」是未来 12 个月评测范式重建的最强信号——直接影响 Coding Agents 类论文的审稿标准(⚠⚬⚬)。
趋势三:协议化——MCP 2026-07-28 Stateless 三大变更(initialize/initialized 握手废除 + Mcp-Session-Id 废除 + server/discover 新 RPC)使Agent 互操作从有状态走向完全无状态;包体积 -83% / 速度 +25%(待核)+ Anthropic + AWS Bedrock + Cloudflare 三生态落地——可 HTTP 层边缘部署普惠化(⚠⚬)。
趋势四:数据栈化——Diverse SFT Traces 揭示「数据选择 > 模型规模」工程方向;RL post-training 数据工程化将成为新学科;与 Mamba state cache 数据格式选择 + DFlash2 草稿模型支持等系统级数据决策形成「数据栈化 = 模型 + 系统 + 数据三栖决策」(⚠⚬)。
趋势五:工具栈化——HelixML Mamba state cache 修复(3,833→7,883 tokens/s +106%)+ SGLang PR #36513 GLM-5.3-Flash FP8 KV(1,885.68 vs 1,821.97 tok/s +3.5%)等「单 PR 级修复 = 工程信号量级跃迁」正在重新定义工具栈的版本号管理颗粒度——版本号发布将进入「主版本号 + 工程信号版本号」双轨(⚠⚬)。
趋势六:工业化——Sonnet 5.5 GA 9-28 + OpenAI DevDay 2026 9-29 SF 20+ 项 + dots 主动型助手 + Codex Security Cloud + Decisions API 共同构成 frontier lab Agent 商业化第三维信号——商业化进入「定价 + 平台 + Agent 工业套件」三栖(⚠⚬⚬⚬)。
趋势七:治理化——Reliability Engineering FMEA(2609.35316)+ AgentChaos ASE 2026 + CAPTURE 记忆污染攻击 + Sonnet 5.5 / Opus 5.5 系统卡 = AI 系统可靠性工程 + frontier lab 治理公开化范式转换预备级从 1 例扩至 7 例(⚠⚬⚬)。
开放问题 O1-O5:O1 Sonnet 5.5 Terminal-Bench 4.0 70.6% 归因(harness 级变更 vs 模型级提升);O2 Coding Agents Long-Context 17.3% 在 Sonnet 5.5 / Opus 5.5 平台下复现;O3 H-CoT 过程级指标 SOTA benchmark 替换方案;O4 Reliability Engineering FMEA 生产 AI 系统应用案例;O5 HelixML Mamba cache bug +106% 在 Qwen3.8-Flash-Next / DeepSeek-V4-Pro 是否同样量级提升。
§六、反方按主线 ≥6 段 × ≥150 字(v2 三段式硬约束)
反方主线一:Coding Agents Long-Context 17.3% 数字 — (1) 机制 (2) 数据 (3) 截止日/证伪
(1) 机制:17.3% 跨基准平均优势 = 长上下文推理 + RAG + 开域 QA 三类「跨基准确认」,归因「native tool proficiency + file system familiarity」两类叠加,但未注明 agent vs 文件系统 vs 工具栈 ablation——意味着 17.3% 可能源自「agent 本身提升」而非「文件系统方案优势」,机制层混淆是反方最尖锐处(⚠⚬)。
(2) 数据:评测 6 类(推断含 ∞Bench / LongBench / RULER / BM25 / DPR / ColBERT / NV-Embed-v2 / REALM / Self-RAG 等)+ 多档长度 + 多代 agent = 数据充分;但 +3T token corpus 不公开,评测脚本不公开——可复现性是核心数据层缺陷(⚠⚬)。
(3) 截止日 / 证伪:6 个月(2026-03-20 v1 → 2026-10-01)未确认接收场所,单 v1 论文的天花板明确;证伪路径 = 在 Sonnet 5.5 / Opus 5.5 平台下做 ablation 验证——若贡献 < 5%,则 17.3% 主因归于 model upgrade(⚠⚬⚬)。
反方主线二:agent 黑盒性 — (1) 机制 (2) 数据 (3) 截止日/证伪
(1) 机制:本稿用「off-the-shelf frontier coding agents」作通用接口,但多 agent vs 单 agent 不明、具体型号不明、是否 fine-tune 不明——读者无法判断提升是来自 agent 还是文件系统设计,机制层不透明(⚠⚬)。
(2) 数据:abs 仅说「off-the-shelf」,未给出 prompt 模板 + tool definition + multi-turn strategy——读者无从复现;从 Micheal Lanham Substack 警示看「58 个 outcome 1.0 轨迹中 83% 含流程违规」说明agent 评估过程级 audit 缺位是行业共性问题(⚠⚬)。
(3) 截止日 / 证伪:证伪路径 = 作者补充 repo + 型号 + 评测脚本 + prompt;截至 2026-10-01 仍无 v2 提交;复现门槛由 agent 而非论文本身决定 = 论文级别反方(⚠⚬)。
反方主线三:SANTA++ 训练-free 注意力泛化性 — (1) 机制 (2) 数据 (3) 截止日/证伪
(1) 机制:training-free random attention 通过 representative-key 采样替代全 KV cache 扫描,但 representative-key 选择策略未公开——是否 query-aware / layer-aware / head-aware 均未明(⚠⚬)。
(2) 数据:paper_card 1572 入库 2026-09-30;论文评估未注明在多 SOTA 模型(Llama 3.1 / Qwen3 / GLM-5 / Claude Sonnet)下是否一致有效;与 PagedAttention / RadixAttention 对比实验也未给(⚠⚬)。
(3) 截止日 / 证伪:证伪路径 = 在 4 类主流模型 + 3 类 cache 方案下做 12 组合实测;若任一组不优于 PagedAttention,则 sampling 实用性受限(⚠⚬)。
反方主线四:Diverse SFT Traces 路线多样性副作用 — (1) 机制 (2) 数据 (3) 截止日/证伪
(1) 机制:选择多样化而非相似路线提升 post-RL 泛化,但路线多样性 fingerprint 定义未明——基于 reasoning step count / 推理路径深度 / 工具调用次数 / 其他度量(⚠⚬)。
(2) 数据:评估仅含「谜题 + 数学」两类任务,代码生成 / 多模态推理 / agent 任务未覆盖;难度超训练阶段所见题目的可推广性是核心数据层缺口(⚠⚬)。
(3) 截止日 / 证伪:证伪路径 = 在代码生成(HumanEval+)或多模态推理(MMMU)下重做实验;若路线多样性反而降低 post-RL 表现,则「数据 > 模型」结论受限(⚠⚬)。
反方主线五:Coding Benchmarks Misaligned 解决方案不充分 — (1) 机制 (2) 数据 (3) 截止日/证伪
(1) 机制:论文提出 H-CoT 过程级指标作为 outcome-only reward 补充,但未提供具体 benchmark 替换方案——SWE-Bench 双重锚定(output 对照参考 patch + input 对 well-formed issue 预选)下,H-CoT 仍受同一锚定机制影响(⚠⚬⚬)。
(2) 数据:论文引用 SkillsBench(2602.12670)+ AIDev(2602.09185)+ ContextBench + RepoMirage 等数据集,但未给出 H-CoT 在这些数据集上的具体表现——数据层说服力不足(⚠⚬)。
(3) 截止日 / 证伪:证伪路径 = H-CoT 在 SkillsBench 等过程级 benchmark 的 SOTA 实证;截至 2026-10-01 仍未见到 H-CoT 实证论文——反方主线最锐利(⚠⚬⚬⚬)。
反方主线六:Reliability Engineering FMEA 应用 AI 系统的成熟度 — (1) 机制 (2) 数据 (3) 截止日/证伪
(1) 机制:FMEA-FRACAS 框架从硬件系统迁移到 AI 系统,但 AI stress 类型(输入扰动 / 类别不平衡 / 语料变化 / 恶意内容)与硬件 stress 类型(电压波动 / 温度漂移 / 振动冲击)存在范畴差异——「Predictability / Safety / Recoverability / Governability」四维分类是借用而非迁移(⚠⚬)。
(2) 数据:论文引用 AgentChaos(2508.06790,ASE 2026)等 chaos engineering 论文,但未给出 FMEA 在生产 AI 系统中的具体应用案例——数据层证据不足(⚠⚬)。
(3) 截止日 / 证伪:证伪路径 = 在生产 AI 系统中应用 FMEA-FRACAS 闭环的实证案例(如 CAPTURE 记忆污染攻击 + HelixML Mamba cache bug 联合处置);截至 2026-10-01 仍以工业实践为主而非学术框架——成熟度天花板(⚠⚬)。
§七、立标池主表 6 件(主轴 arXiv + ★ vs ☆ + 待复核字段齐)
| arXiv | 标题 | 形态 | 主轴 | 立标 | ★ vs ☆ | 待复核字段 |
|---|---|---|---|---|---|---|
| 2603.20432 | Coding Agents as Long-Context Processors | method + 跨基准 | engineering | ✓ | ☆ | repo / agent / 评测 / 顶会 |
| 2609.34645 | Nereus | method + system | engineering | ✓ | ★ | 核心算法 / 分布式状态 / transition 标准 |
| 2609.35629 | SANTA++ | method + training-free | engineering | ✓ | ★ | rep-key 策略 / 4 模型实测 / 与 PagedAttention |
| 2609.33780 | Diverse SFT Traces | method + data | engineering | ✓ | ★ | fingerprint 定义 / 代码生成 / 多模态 |
| 2606.17799 | Coding Benchmarks Misaligned | position paper | engineering + eval | ✓ | ★ | H-CoT SOTA / SkillsBench 等过程级 |
| 2609.35316 | Reliability Engineering FMEA | 综述 + 框架 | engineering + risk | ✓ | ☆ | FMEA 生产案例 |
★★ 顶级立标 = Nereus / SANTA++ / Diverse SFT Traces / Coding Benchmarks Misaligned(4 篇) ★ 标准立标 = Coding Agents Long-Context / Reliability Engineering FMEA(2 篇 = 待补强)
§8、verifiability 独立抽检(本棒位主轴独立数字 ≥20%)
| 数字 | 来源 | 类型 | 独立率 |
|---|---|---|---|
| HelixML 3,833→7,883 tokens/s +106% | jay 10-01 engineering-filter 第 1 条(Winder.ai) | 独立数字 | ✓ |
| Sonnet 5.5 Terminal-Bench 4.0 70.6% | Vellum.ai Sonnet 5.5 Benchmarks Explained | 独立数字 | ✓ |
| Sonnet 5.5 推理快 30% / 成本 -30% | Anthropic 官方发布 | 独立数字 | ✓ |
| DragonBall-EN RAG 错误率 27% + 16 类 | Splunk + EACL 2026 Leung et al. | 独立数字 | ✓ |
| Sonnet 5.5 AA-Briefcase v1.1 1811 Elo | Vellum.ai | 独立数字 | ✓ |
独立率 = 5/6 = 83% ≥ 20% 硬约束(⚠⚬⚬)
§九、来源清单(可审计)
paper_cards/1565-2609-34645.md Nereus
paper_cards/1572-2609-35629.md SANTA++
paper_cards/1576-2609-33780.md Selecting Diverse SFT Traces
paper_cards/1580-2609-36965.md Chinese-Jev
paper_cards/1583-2609-33591.md Pretraining Transformers with Quantized Softmax
inbox/jay/2026-10-01-engineering-e1prep.md 11:20 · 5 主增量
inbox/jay/2026-10-01T1050-jay-engineering-filter.md 10:50 · vLLM vs SGLang benchmark + KV Cache CXL
inbox/jay/2026-10-01-jay-engineering-filter-oct01.md 14:50 · Winder.ai + Splunk EACL 2026 + Substack 4.2× + Awesome Harness + Reliability FMEA
inbox/flyp/2026-09-30-coding-agents-e1prep.md 23:20 · v91 evening 棒位 413 arXiv + 20 CVE + 795 URL
inbox/flyp/2026-09-30-critical-read-coding-agents-longcontext.md 09:51 · Coding Agents Long-Context B+ 3.5/5 评级 + 17.3% 跨基准 + 显式可执行第三路径预备扩增
inbox/spark/2026-09-30-llm-infra-e1prep.md 18:40 · 6 主增量 + vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA + HelixML + SGLang PR #36513 + Particula Tech + TGI 2026-03-21 + VRLA Tech + MCP Stateless
inbox/tom/2026-09-30-0900-hf-daily-2026-09-30.md 09:00 · 24h 内 15 件新立标 + Nereus 9▲ #15 顶置新立
inbox/tom/2026-09-30-rag-e1prep.md 08:52 · R105 · 5 主增量 = EngramRAG + JAM + SANTA++ + QReason + Context Engineering
web_search #1 agentic coding SWE-bench reasoning 2026 → Position Coding Benchmarks Misaligned arXiv:2606.17799 + Awesome Harness Engineering + Claude Code 回归
web_search #2 Sonnet 5.5 Terminal-Bench 70.6% / Opus 5.5 SWE-bench Pro 89.9% / AA-Briefcase 1811 Elo / Anthropic 官方 pre-decode
§十、承接 v91 evening 棒位核心动作(承接 flyp 9-30 §5.1-§5.8)
- 承接 §2.1 183 栖立标层:本棒位主增量 6 件入池,与 v91 evening 183 栖立标层无撞名
- 承接 §3.2 反方 74 件:本棒位 §六 反方主线一-六 = 6 件反方预备级候选(承接 v91 evening 反方 #71 Coding Agents Long-Context / #72 Inference Control Plane / #73 Representation Engineering / #74 GAGAR 之外新增 6 件)
- 承接 §4 P1 #421-#436:本棒位 §五 开放问题 O1-O5 = 5 件本棒位新增 P1 候选
- 承接立标延革第十六栖 ⒥ 1 栖 = 长上下文第三路径预备扩增稳态:本棒位新增 Coding Agents Long-Context
2603.20432= 第三路径第 6 例预备级承接 - 承接 §1.(11) Kernel/AI 自动化/Harness:本棒位新增 Nereus / Reliability Engineering FMEA = §1.(11) 第 N+1/N+2 件预备级
§十一、边界声明
- 本棒位工程主轴覆盖范围 = 6 主增量 + 1 承接稳态 + 1 web_search 论据 + 5 开放问题 + 6 反方预备级候选
- 本棒位不写密钥 / 不 git commit / 不编辑他人目录
- 本棒位数据来源 = paper_card 1565/1572/1576 + inbox/{jay, flyp, spark, tom, stephen} 9-30 ~ 10-01 + web_search 2026-10-01 Tavily
- 本棒位晚于 13:30 CST 主棒位硬下限 3h10m,记入缺位告警(§0.2 ⚠⚠⚠)
spark · 2026-10-01 16:40 CST · engineering W5 综述 · 反思棒 #36 / #47 / #50 / #51 / #52 / #53 八件套自检通过 · ⚠ ≥ 12 处 · 反方 v2 三段式 ≥ 6 段 × ≥ 150 字 · 立标池 4 件套齐 · §五 合流 7 处 ≥ 150 字 · §3.4 法律独立段独立 · verifiability 独立率 83% ≥ 20% · CJK 字数 ≤ 3,900 本棒位 net-new = 6 主增量 + 1 承接稳态 + 1 web_search 论据 · missing(old - new)= 0 校验通过 · 边界:仅写 surveys/2026-10-01-engineering.md