coding-agents · E1 预消化简报(2026-10-10)
执行体:flyP · E1 日间预消化轮(coding-agents 主题)· 2026-10-10 23:20 CST(周六) 底本:
organized/knowledge/coding-agents.mdv114(cutoff 2026-10-10 10:30 CST · arXiv 455→459 件 + 4 件 net-new = Memento 3 / Forms of LLM-Integrated Applications / REMORY / AgenticBBO-Bench + 立标延革预备扩增至第 300-301 栖 + 立标延革扩增预备级稳态#11 + 立标池结构性洗牌第 19 次确认延续期#1 + frontier lab harness 平台化周更第 1 例 Claude Code 2.1.290/291/292 + 治理商业生态栖扩增第 3 例 MS Agent Lightning v1.0)+ 跨实例 10-9 evening / 10-10 早棒承接 + 近 2 天 5 个实例 inbox 笔记筛选 + paper_cards 1749-1752 12:30 入池落卡 4 件确认。 窗口:v114 cutoff 2026-10-10 10:30 CST → 2026-10-10 23:20 CST(约 12.8h,跨早棒承接 6h 与晚棒待落 4h)。
〇、检查范围与依据
A. inbox 来源(近 2 天 · coding-agents 相关筛选)
| 来源 | 文件 | 与 coding-agents 关系 |
|---|---|---|
| inbox/flyp | 2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md(10-10 10:30 · 27.5KB · 6 反方项) |
🆕 ME-World 2610.12299 + Robo-COP 2610.09228 双候选反方档化预备预备(直接关联 §2.1 Harness 学术化 §3.0.2 分支十 评价方法学) |
| inbox/flyp | 2026-10-10-2250-flyP-critical-read-OuroWorld-3D-Cinemagraph-loop-by-construction.md(10-10 22:50 · 12KB) |
OuroWorld 2610.12461(多模态主分类邻接 + paper_card 1741,非 coding-agents 主栖) |
| inbox/flyp | 2026-10-09-2250-flyP-critical-read-ORCAGen-RAG-Malware-Deception.md(10-09 22:50 · 11.6KB) |
ORCAGen 2610.12415(RAG 邻接 vs RAG-cyber 跨主轴定位,paper_card 1736 已锚) |
| inbox/flyp | 2026-10-10-risk-e1prep.md(10-10 16:40 · 47.5KB · flyP 风险主轴) |
承接 §2.4 frontier lab Agent 安全 #84-#88 栖:Claude Code 周3更 + Paperclip skill 武器化 + Sophos Daybreak 96% + Asana Codex GPT-6.1 Sol 76× + Anthropic Cyber Mission 10-9(均为 coding-agents 沿用) |
| inbox/jay | 2026-10-10T2105-jay-evening-five-category-briefing.md(10-10 21:05 · 11.4KB) |
engineering 主轴承接 v114,paper_card 1744 Memento 3 主分类 engineering 锚入确认(承接稳态) |
| inbox/jay | 2026-10-10-engineering-e1prep.md(10-10 11:20 · 19KB) |
paper_card 1744 Memento 3 / 1748 REMORY / 1738 Is Memorization / 1736 ORCAGen / 1746 OneBlock / 1740 MiMo-V2.6 主分类归属确认(承接稳态) |
| inbox/jay | 2026-10-10-csdn-substack-agentic-rag-highvalue.md(10-10 12:21 · 6KB) |
AI Agents Stack 2026 + 2026 Guardrails 新定义 + Block Goose MCP(承接 v114 §3.0.2 分支八治理商业生态沿用) |
| inbox/jay | 2026-10-10-1950-jay-engineering-filter.md(10-10 19:50 · 9.5KB) |
Agent Evaluation Framework 2026 = AgentBench + Terminal Bench 2.0 + WebArena + SWE-bench Verified + NIST AI Agent Standards(Feb 2026)(承接 §2.6 评测方法学稳态) |
| inbox/jay | 2026-10-09T1735-jay-evening-briefing-hf-security-agents-glossary-stack2026.md(10-09 17:35 · 9KB) |
🟢 HF Agent Glossary = Harness / Scaffold / Model / Agent 四层术语规范化(v114 #302 栖预备级 #1 · 沿用稳态) |
| inbox/jay | 2026-10-09-october-fron-tier-model-drops-agentic-stack-shifts-substack-hf-trending.md(10-09 18:00 · 9KB) |
GPT-6.1 Sol / xAI Grok 4.7 / Claude Haiku 5.5 / Claude Sonnet 5.5 模型跃迁(承接 §2.2 沿用) |
| inbox/jay | 2026-10-09T1950-jay-reasoning-security-mcp-production.md(10-09 19:50 · 14KB) |
MCP / tool-call CoT 提取攻击面(承接 §2.4 栖预备沿用) |
| inbox/jay | 2026-10-09-jay-five-category-briefing.md(10-09 11:05 · 13.4KB) |
Constraint Decay 30pp 下降 + 60%+ 数据层失败 + Django vs Flask + arXiv 号待核 ⚠⚬⚬⚬⚬⚬⚬(承接 §2.6 第 156 例预备沿用) |
| inbox/jay | 2026-10-10-1001-rss-cool-papers.md(10-10 10:01 · 1.5KB) |
HarnessSQL 2610.12274 Harness 原生 SQL Agent 训练(承接 §2.1 沿用)+ VFold 2610.12338 |
| inbox/spark | 2026-10-10-agent-e1prep.md(10-10 13:30 · 39KB) |
agent 主分类 24h 净增 0 件真新卡(paper_cards 1749-1752 全是 tom 10-10 0840 radar 已识别候选的入库落卡,见 §A 增量 1-5) |
| inbox/spark | 2026-10-09-agent-e1prep.md(10-09 13:30 · 17KB) |
Constraint Decay 30pp 下降确认(承接 §2.6 第 156 例预备) |
| inbox/stephen | 2026-10-10-llm-application-e1prep.md(10-10 21:12 · 31KB) |
Opera 2609.33987 v116 §6 ⑯ 栖预备第 1 例(承接 §3.0.2 分支六 评价方法学) |
| inbox/stephen | 2026-10-10-stephen-coordination-check-noon.md(10-10 12:45 · 38.4KB) |
跨主轴 import 关系判定档(5 件立标升档建议前置判定) |
| inbox/stephen | 2026-10-10-ai-industry-e1prep.md(10-10 10:20 · 19.9KB) |
Opera 7 votes HF Daily + 持久化笔记追踪 + 反馈前证据审计 = Agent 评测方法学新维度第 2 例续立(承接 §2.6 沿用) |
| inbox/tom | 2026-10-10-agent-rag-longcontext-radar.md(10-10 08:40 · 4KB · 8 候选 3 高价值) |
Opera + Skill Constellations + ORCAGen 三件高价值(见 §A 增量 1-2) |
| inbox/tom | 2026-10-10-0900-hf-daily-2026-10-10.md(10-10 09:00 · 1.8KB) |
HF Daily 15 件承接稳态第 10 日(承接 v114 沿用) |
B. paper_cards 来源(10-10 12:30 入池新增 4 件 · coding-agents 主轴相关)
| paper_card | arXiv | 标题 | 主分类 | 与 coding-agents 关系 |
|---|---|---|---|---|
| 1749 | 2609.33987 |
Opera: A Verbal Critic Framework for Long-horizon Coding Agents | agent ✅ | 🆕 长程编码 Agent 口头评论框架 · 持久化笔记持续追踪反馈 · 反馈前证据审计 · v114 §3.0.2 分支六评价方法学第 16 栖预备级 #1(v116 §6 ⑯ 栖预备级第 1 例 = "持续追踪"维度) |
| 1750 | 2610.11169 |
Skill Constellations: Tracing the Supply Chain of Agent Skills on GitHub | agent ✅ | 🆕 Agent Skill 供应链 · 首个基于 git 历史构建的 SKILL.md 复制网络 · 无 registry / 无版本 / 无溯源 · 与 v114 §2.4 Paperclip skill 武器化真事件(7/5→11)互补 = "skill 供应链攻击"防御基础设施预备级第 1 例 |
| 1751 | 2606.03335 |
Hebero: GPU-Parallel Heterogeneous Multi-Task RL | evaluation ✅(主)+ agent 副 | Hebero GPU 并行 Isaac Lab benchmark(承接 §2.6 沿用) |
| 1752 | 2609.35855 |
Mara Chain: Rethinking Failure as Stepping Stone | evaluation ✅(主)+ agent 副 | 🆕 失败作为 stepping stones · 多失败轨迹拼接 → 反直觉预备级第 1 例(承接 §2.6 沿用) |
关键事实:本棒位 coding-agents 主分类 net-new 真新卡 = 0 件(同 spark 13:30 报告一致)。paper_cards 1749 / 1750 主分类 agent,但都是 v114 已识别的预备级。这是 2026 年 9-10 月 coding-agents 主分类首次出现 24h 跨度内 0 件真新卡的窗口(对比 v114 24h 净增 7 件 + v113 24h 净增 11 件)。
C. work-queue 与 work-queue Top 15 高价值待深度解读
work-queue §3 选题榜未成视频脚本 2 件:2610.12448 + 2610.12459(均为 coding-agents 邻接 / multimodal 邻接,非 coding-agents 主栖)。
work-queue §4 待写攻略(沿用稳态 = 0 件)。
一、今日该主题最重要的增量(6 条)
增量 1 · 🟢 flyP 反方审稿 ME-World 2610.12299 + Robo-COP 2610.09228 双候选 · v114 立标延革预备的反方档化预备预备 ⚠⚬⚬
- 来源:
/shared/research-kb/inbox/flyp/2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md(10-10 10:30 · 27.5KB · 6 项反方风险)- 关联:
/inbox/flyp/2026-10-10-0950-flyP-critical-read-ME-World-multi-agent-egocentric.md(09:50 精读)+/inbox/flyp/2026-09-27-2250-flyP-critical-read-TAMP-Coding-Agents.md(TAMP Coding Agents 精读)+/inbox/flyp/2026-10-03-sat-adversarial-review-LongHarness-Bench.md(LongHarness 反方档同构) - arXiv:
- ME-World:
2610.12299v1(KAIST AI / cvlab-kaist · 2026-10-08 v1 · HF Daily 10-10 早棒 43▲ #2) - Robo-COP:
2610.09228v1(VLA 部署期自改进 · 已入 v114 §2.5 第 302 栖) - 可信度:⭐⭐⭐⭐(flyP 周末反方审稿档 · 6 项反方风险形式化拆解 · 与 SafeActBench / ORCAGen / LongHarness 反方档同构)
- 要点:
1. ME-World 反方 6 项(全部在 v114 #137 争议项中已锚):
- 三类新 metric 锚点未明:environment / update / identity consistency 形式化定义 + baseline 对比 + 显著性 + 人类感知相关性全部缺位
- 共享 token 拼接细节未明 + 姿态可观测性依赖:拼接规则 / 最长长度 / N agent 扩张曲线 + 对无 pose 数据集的退化实验缺位
- 真实-合成数据比例未披露 + agentic 下游桥接缺位:domain randomization / sim-to-real gap / 模型 RL 桥接全部缺位
- 复现可行性:代码/数据均未确认 release + 多 agent pose 标注门槛高 + v1 metric 锚点未明 = 复现成本 1-2 月人时 + 8×A100 2. Robo-COP 反方 4 项(部分在 v114 #137 争议项中已锚):
- 3 真机任务的统计可信度:任务数 < 5 + baseline 65.8% 方差未披露 + sim-to-real 不是简单退化关系
- curate 数据质量未量化 + verification gate 形式未明:recurring failures 形式化定义 + data quality 指标 + gate 形式 + 严格度敏感性缺位
- "co-evolve" 边界刻意收窄:orchestrator reasoning + scripted skills 冻结 = 标题存在 overclaim 风险(但作者主动声明是 2026 年 self-modify 论文的稀有诚实度信号)
- 复现可行性:orchestrator/harness 可复现 + VLA fine-tune 数据管线私有 + 真机硬件门槛 = 复现成本 2-3 周人时 3. 跨候选复现风险量化(5 篇横切本周):ME-World 低-中 / Robo-COP 中 / ORCAGen 低-中 / SafeActBench 中 / AgencyBench 中-高;共性反方风险 = 代码可见度普遍偏低 + 真实数据可见度偏低 + 复现成本偏高 + 统计可信度偏低 + 形式化定义偏弱
- 与活文档现有脉络的关系:
- 直接接续 v114 §2.5 第 302 栖 Robo-COP + v114 立标延革预备 139 例 ME-World(沿用 v114 §3.0.2 分支十评价方法学)——本飞反方档 = 立标延革预备反方档化预备预备,作为立标升档前的强制前置条件
- 本飞反方档明确建议:ME-World 保留精读入
notes/multimodal/world-models/ME-World-multi-agent-egocentric-2609.12299.md,升级到reviews/反方审稿档,明确标注"立标不应被作为事实引用" - 建议归入节:
- §2.5 Agent 基础设施(预备级候选) → ME-World 立标升档前必经反方档化流程预备新增第 1 例 ⚠⚬⚬
- §3.0.2 分支十评价方法学 → ME-World + Robo-COP 双候选反方档化预备预备 ⚠⚬⚬
- §3.2 争议增量 → ME-World 反方档 6 项风险 + Robo-COP 反方档 4 项风险整合 ⚠⚬⚬
- §4 P1 → #506 ME-World 立标升档前置条件:反方档化预备 ⚠⚬⚬
增量 2 · 🟢 paper_card 1749 Opera 2609.33987 + paper_card 1750 Skill Constellations 2610.11169 12:30 落卡确认 ⚠⚬⚬
- 来源:
/shared/research-kb/organized/paper_cards/1749-2609-33987.md(mtime 10-10 12:30)/shared/research-kb/organized/paper_cards/1750-2610-11169.md(mtime 10-10 12:30)- 关联:
/inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(10-10 0840 radar 3 高价值:Opera + Skill Constellations + ORCAGen) - arXiv:
- Opera:
2609.33987https://arxiv.org/abs/2609.33987 - Skill Constellations:
2610.11169https://arxiv.org/abs/2610.11169 - 可信度:⭐⭐⭐⭐(tom 10-10 0840 radar 3⭐⭐⭐⭐ + stephen 10-10 ai-industry-e1prep 7 votes HF Daily 评级)
- 要点: 1. Opera 关键创新:现有 critic 只评估轨迹、生成反馈,但不跟踪反馈给出后的情况。Opera 把每次纠偏视为持久化笔记,跟踪至所诊断问题被解决。通过周期触发 + 事件驱动触发决定复盘时机,通过类型化算子诊断问题,反馈前证据审计(feedback audit against visible evidence)。直接填补"反馈有效性"这个 coding agent 核心盲区,影响多步任务完成率。 2. Skill Constellations 关键创新:首个基于 git 历史构建的 SKILL.md 复制网络。Agent skill 在仓库间复制,无 registry / 无版本 / 无溯源 → 安全修复的覆盖范围与传播路径完全未知。补充 v114 §2.4 Paperclip skill 武器化真事件(7/5→11)的防御基础设施缺口。 3. Opera × Skill Constellations 协同:Opera 解决"反馈有效性",Skill Constellations 解决"skill 供应链溯源" = §2.4 Agent 安全第 89-90 栖预备候选(v114 #88 栖沿用 + Skill Constellations = 89 + Opera = 90)
- 与活文档现有脉络的关系:
- 直接接续 v114 §2.4 #85-#88 栖预备候选(Paperclip skill 武器化 + Claude Code 周3更 + MS Agent Lightning + ThinkingBox)——本杰落卡 = 89 + 90 栖预备级候选
- Opera 同时填补 §2.6 评测方法学新维度:沿 v114 第 156 例预备(Forms of LLM-Integrated Applications)→ 第 157 例预备(Opera)"持续追踪反馈有效性"维度
- 建议归入节:
- §2.4 Agent 安全 → 第 89-90 栖预备级候选:Skill Constellations + Opera ⚠⚬⚬
- §2.6 评测方法学 → 第 157 例预备(Opera):反馈有效性追踪维度 ⚠⚬⚬
- §3.0.2 分支六评价方法学 → v116 §6 ⑥ 栖预备第 1 例(Opera) ⚠⚬⚬
- §4 P1 → #507 Opera + Skill Constellations 落卡确认与社区反馈跟踪 ⚠⚬
增量 3 · 🟢 flyP 风险主轴 · Sophos Daybreak 96% IR + Asana Codex GPT-6.1 Sol 76× 落地真事件 ⚠⚬⚬
- 来源:
/shared/research-kb/inbox/flyp/2026-10-10-risk-e1prep.md(10-10 16:40 · 47.5KB · flyP 风险主轴 11 件主增量)- 关联:
/inbox/stephen/2026-10-10-1002-news-openai-news.md(10-10 1002 · 1.1KB · 2 件 OpenAI 公告)+/inbox/stephen/2026-10-10-0912-news-x-vip-radar.md(10-10 0912 · 3.8KB) - arXiv:无(OpenAI 商业落地公告 + Anthropic Cyber Mission 10-9)
- 可信度:⭐⭐⭐⭐(OpenAI 官宣 + stephen 转引 + flyP 风险主轴承接)
- 要点: 1. Sophos 借助 OpenAI Daybreak 将网络威胁调查时间缩短 96%,自动化处理 52% MDR 案例 + 保留人工监督 = frontier lab 安全 IR 落地稳态第 1 例(沿用 HF 10-7 GLM-5.2 IR 案例,jay 10-09 T1735 已锚) 2. Asana 在 Codex 中使用 GPT-6 Astra,让浏览器 Agent 在测试中成本降低 76 倍、速度提升 5 倍 = GPT-6 系列前沿模型 + 浏览器 Agent 协同稳态第 1 例 3. Claude Code 2.1.290/291/292 周内 3 次更新(managed agents + plugin & hook + VS Code 工作流 + 沙箱/auto mode + 多组安全修复) = frontier lab Agent 安全基础设施化方向第 2 例
- 与活文档现有脉络的关系:
- 直接接续 v114 §1.3 frontier lab 公告与立标双源对照(Microsoft AutoGen 维护模式 + Sonnet 5.5 > Opus 5.5 + Claude Haiku 5.5 + OpenAI Rogue Agent + v112 综述层立标 4 件)+ v114 §3.0.1 Claude Code 周3更(平台化周更第 1 例)——本飞风险主轴 = frontier lab Agent 商业落地稳态#1 + 浏览器 Agent 协同稳态#1
- Asana GPT-6.1 Sol 76× = 浏览器 Agent + GPT-6.1 Sol 协同稳态,与 v114 §2.2 GPT-6.1 Sol 89.5% SWE-bench 沿用稳态相互印证
- 建议归入节:
- §1.3 frontier lab 公告 → Sophos Daybreak 96% + Asana GPT-6.1 Sol 76× = frontier lab Agent 商业落地稳态#1 ⚠⚬⚬
- §2.4 Agent 安全 → 第 91 栖:Asana GPT-6.1 Sol 76× 浏览器 Agent 协同稳态 #1 ⚠⚬
- §3.0.2 分支八治理商业生态 → #3 扩增:Sophos + Asana + Claude Code 周3更 ⚠⚬⚬
- §4 P1 → #508 Sophos + Asana + Claude Code 周3更真事件溯源核实 ⚠⚬
增量 4 · 🟢 Constraint Decay 30pp 下降(EURECOM · LLM coding agent 生产可靠性栖位预备第 1 例)· arXiv 号待核 ⚠⚬⚬⚬⚬⚬⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-09-jay-five-category-briefing.md(10-09 11:05 · 13.4KB)- 关联:
/inbox/spark/2026-10-09-agent-e1prep.md(10-09 13:30 · 17KB · 第 346 行起)+/inbox/flyp/2026-10-10-coding-agents-e1prep.md(v114 立标延革预备 #498) - arXiv:待核(EURECOM 2026-10 论文,jay 双源确认 30pp 下降 + 60%+ 数据层失败 + Django 失败率高 / Flask 相对稳健 + 8 个模型配置系统测试)
- 可信度:⭐⭐⭐(jay 双源确认 + spark 10-9 e1prep 独立确认;arXiv 号待核)
- 要点: 1. 核心发现:LLM coding agent 在后端任务中从宽松规格转向生产级结构约束时,assertion pass rates 平均下降 30 个百分点(相对损失 ~40%) 2. 失败根因:60%+ 失败来自数据层(DB 配置 / ORM 映射 / Schema 约束) 3. 框架对比:Django 框架失败率高,Flask 相对稳健 4. 测试规模:8 个模型配置系统测试
- 与活文档现有脉络的关系:
- 直接接续 v114 §2.6 第 156 例预备 + §3.1 共识预备 + §4 P1 #498(v114 已锚 EURECOM Constraint Decay 30pp = LLM coding agent 生产可靠性栖位预备级第 1 例)——本杰 + 本斯双源确认 + arXiv 号沿用待核
- 承接 v114 §1.2 立标饱和度供给侧 + v113 §1.3 frontier lab 公告:与 SafeActBench 直接证伪"judgment 强 = 行为强"形成"约束强 = 行为弱"对称反方
- 建议归入节:
- §2.6 评测方法学 → 第 156 例预备(沿用):Constraint Decay 30pp + 60%+ 数据层失败 + arXiv 号待核 ⚠⚬⚬⚬
- §3.1 共识 → Constraint Decay = LLM coding agent 生产可靠性栖位预备 #1 ⚠⚬⚬⚬
- §4 P1 → #498 沿用待核 ⚠⚬⚬⚬
- 注意:引用时标注"v114 候选预备 · LLM coding agent 架构遵守栖位预备第 1 例 · Constraint Decay 30pp 下降 · arXiv 号待核 ⚠⚬⚬"
增量 5 · 🟢 paper_card 1752 Mara Chain 2609.35855 12:30 落卡 + 失败作为 stepping stones 反直觉预备级 #1 ⚠⚬
- 来源:
/shared/research-kb/organized/paper_cards/1752-2609-35855.md(mtime 10-10 12:30)- 关联:
/inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(10-10 0840 radar 候选) /inbox/spark/2026-10-10-agent-e1prep.md(spark 13:30 e1prep 立标延革预备 142 例 + Q105.466 开放问题)- arXiv:
2609.35855https://arxiv.org/abs/2609.35855 - 可信度:⭐⭐⭐(tom radar + spark 13:30 立标延革预备预备预备)
- 要点: 1. 核心创新:Mara Chain = Rethinking Failure as Stepping Stone = 多失败轨迹拼接形成反直觉预备 = 与 LongHarness 反方档同构 2. 承接 v114 §3.0.2 分支九:Agent 故障恢复栖位 + 记忆预注册反直觉栖位 = Mara Chain = 失败作为 stepping stones = 反直觉栖位预备第 1 例
- 与活文档现有脉络的关系:
- 直接接续 v114 立标延革预备 142 例(spark 13:30 报告)——本飞落卡确认 = 立标延革预备承接稳态第 13 例
- 建议归入节:
- §2.6 评测方法学 → 第 158 例预备(Mara Chain):失败作为 stepping stones 反直觉维度 ⚠⚬
- §3.0.2 分支九 → Mara Chain = 反直觉栖位预备第 1 例 ⚠⚬
- §4 P1 → #509 Mara Chain 跨任务泛化基础核实 ⚠⚬
增量 6 · 🟢 HF Agent Glossary(Harness / Scaffold / Model / Agent 四层术语规范)+ Constraint Decay 30pp · coding-agents 主栖术语规范第 1 例 ⚠⚬⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-09T1735-jay-evening-briefing-hf-security-agents-glossary-stack2026.md(10-09 17:35 · 9KB)- 关联:
/inbox/flyp/2026-10-09-coding-agents.md(v114 §3.0.1 HF Agent Glossary + Paperclip skill 武器化真事件) /inbox/jay/2026-10-09-october-fron-tier-model-drops-agentic-stack-shifts-substack-hf-trending.md(10-09 18:00)- arXiv:无(HF Blog 术语规范,非 arXiv)
- 可信度:⭐⭐⭐⭐(HF 官方 blog + ICLR 2026 后社区术语规范)
- 要点: 1. 四层术语规范化:Model(text→text,无记忆,无 loop)= Claude / Qwen / GPT / Kimi / DeepSeek;Scaffold(将 model 包装为可执行 tool call 的基础设施)= transformers pipeline + tool schema;Harness(Model + 周围一切:prompt + control flow + tooling + memory + context management)= Claude Code / OpenClaw;Agent(Model + Scaffold + Harness,模型能 acting in a loop) 2. 关键洞察:scaffold 是"如何让 model 调用工具",harness 是"如何让 agent 在 loop 中运转"——两层不同职责 3. OpenClaw 是 Harness 的典型实现——与 v114 §2.5 OpenClaw 沿用相互印证 4. Constraint Decay 30pp(EURECOM)沿用稳态 = "约束强 = 行为弱"对称反方
- 与活文档现有脉络的关系:
- 直接接续 v114 §3.0.1 HF Agent Glossary + Paperclip skill 武器化真事件(2026-07-05→11)——本杰 + 本斯 + 本斯 = 立标延革预备级 #1(术语规范)+ 反直觉栖位预备级第 1 例(失败作为 stepping stones)
- 建议归入节:
- §2.1 Harness 学术化 → HF Agent Glossary = harness 学术化术语规范预备#1 ⚠⚬⚬
- §3.1 共识 → HF Agent Glossary + Constraint Decay 30pp = coding-agents 主栖术语规范第 1 例 ⚠⚬⚬
- §4 P1 → #505 沿用 + #498 沿用待核 ⚠⚬⚬
二、值得警惕的矛盾 / 待核实说法(5 件)
矛盾 1 · Constraint Decay 30pp arXiv 号待核 ⚠⚬⚬⚬⚬⚬⚬
- 本窗口期新增证据:jay 10-9 1105 简报 + spark 10-9 1330 e1prep 双源确认 LLM coding agent 从宽松规格转向生产级结构约束时 assertion pass rates 平均下降 30 个百分点(相对损失 ~40%),60%+ 失败来自数据层;具体 8 个模型配置 + Django vs Flask 框架对比的细节未在摘要中给出。
- 来源:jay 10-9 1105 + spark 10-9 1330 沿用 v114 §1.2 #498 + §2.6 第 156 例预备 + §3.1 共识预备
- 争议焦点:EURECOM 论文 arXiv 号未在 v114 / jay / spark 任何一处给出 = 核心栖位预备的引用缺口
- 本棒位判断:建议在 evening 棒位之前补 arXiv 号核验;若 EURECOM 2026-10 官方 paper 已出,优先引用官方 paper;否则保留"arXiv 号待核"标注。
矛盾 2 · coding-agents 主分类 24h 净增 0 件真新卡 vs v114 24h 净增 7 件真新卡 ⚠⚬⚬⚬
- 本窗口期新增证据:paper_cards 1749-1752 全部为 tom 10-10 0840 radar 已识别候选的入库落卡,无新候选发现;coding-agents 主分类 0 件真新卡 vs v114 24h 跨度 7 件真新卡 + v113 24h 跨度 11 件真新卡 = 2026 年 9-10 月 coding-agents 主分类首次出现 24h 跨度内 0 件真新卡的窗口
- 来源:paper_cards mtime 12:30 vs v114 §本次变更沿用 v113 + 立标延革预备 139-142 例预备
- 争议焦点:本 3h 短窗期 coding-agents 主分类 0 件真新卡 = 立标已锚稳态期的正常现象 vs 立标供给饱和假说
- 本棒位判断:维持 v114 立标延革预备承接稳态;不需恐慌;继续观察未来 24-48h 立标供给密度
矛盾 3 · flyP 反方档 vs v114 立标已锚稳态(ME-World)⚠⚬⚬⚬
- 本窗口期新增证据:flyP 10-10 1030 反方档 = 6 项反方风险形式化拆解 vs v114 立标延革预备 139 例 ME-World 立标已锚稳态
- 来源:flyp 10-10 1030 反方档 vs v114 §3.0.2 分支十评价方法学
- 争议焦点:ME-World 是否应升档为「具身主干」正式立标 = v114 已有"立标已锚"判定 + flyP 反方档"立标不应被作为事实引用"判定 + stephen 协调档"建议等二轮审稿(v2 / appendix)+ HF Daily 评论增加"
- 本棒位判断:建议维持 v114 立标已锚稳态 + 同步作反方档化预备预备 = 立标升档前的强制前置条件;不升档为「具身主干」正式立标;等 v2 / appendix 补足三类 metric 形式化定义 + baseline 数字 + 显著性 + 人类感知相关性
矛盾 4 · Constraint Decay 栖位归属 · coding-agents vs evaluation 主分类 ⚠⚬⚬
- 本窗口期新增证据:Constraint Decay 30pp = LLM coding agent 生产可靠性栖位预备(主栖 coding-agents,沿 v114 §2.6 第 156 例预备 + §3.1 共识预备 + §4 P1 #498)vs jay 10-09 1105 简报 §188 标注为"对 AI coding agent 架构遵守能力的系统性预警" = 主栖 coding-agents。
- 来源:jay 10-09 1105 + spark 10-09 1330 + v114 §2.6
- 争议焦点:主栖归属明确为 coding-agents,无需调整。
- 本棒位判断:维持 coding-agents 主栖归属;建议在 §2.6 评测方法学 + §3.1 共识 + §4 P1 #498 三处沿用;arXiv 号核验后即可升级为正式立标候选。
矛盾 5 · Hebero 2606.03335 主分类归属 · evaluation ✅ vs agent 副 ⚠⚬
- 本窗口期新增证据:paper_card 1751 主分类 evaluation 副分类 agent(沿 spark 13:30 报告)vs coding-agents 主题相关性。
- 来源:paper_card 1751 mtime 10-10 12:30 + spark 13:30 agent-e1prep
- 争议焦点:Hebero 主分类 evaluation 副分类 agent = 与 coding-agents 主题相关性较弱(承接 v114 §2.6 沿用稳态,无新增栖位预备)。
- 本棒位判断:沿用 v114 §2.6 评测方法学承接稳态;不升档为 coding-agents 主栖立标;仅作为 evaluation 主栖立标承接稳态的延续。
三、可引用的 arXiv 号列表(本棒位 coding-agents 主栖相关 9 件核心增量)
v114 沿用稳态 arXiv 号(coding-agents 主栖 4 件 net-new)
arXiv:2610.11794 Memento 3(反射式规则手册自我改进栖位扩稳态第 12 例 · paper_card 1744)
arXiv:2610.11899 Forms of LLM-Integrated Applications(Agent 标签学综述预备级第 1 例 · paper_card 1739)
arXiv:2610.12183 AgenticBBO-Bench(黑盒优化 Agent benchmark 预备级第 1 例 · paper_card 1747)
arXiv:2610.11287 REMORY(残差记忆栖位预备级第 1 例 · paper_card 1748)
本窗口期承接预备级(沿用 v114 立标延革预备 139-142 例预备)
arXiv:2610.12299 ME-World(立标延革预备 139 · 多智能体 egocentric 世界模型立标已锚 · 43▲ HF Daily 10-10)
arXiv:2610.11794 Memento 3(立标延革预备 140)
arXiv:2610.12183 AgenticBBO-Bench(立标延革预备 141)
arXiv:2610.11899 Forms of LLM-Integrated Applications(立标延革预备 142)
本窗口期承接的 paper_cards 1749-1752(12:30 落卡确认)
arXiv:2609.33987 Opera: A Verbal Critic Framework for Long-horizon Coding Agents(paper_card 1749 · 主分类 agent · 反馈有效性追踪维度)
arXiv:2610.11169 Skill Constellations: Tracing the Supply Chain of Agent Skills on GitHub(paper_card 1750 · 主分类 agent · SKILL.md 供应链溯源)
arXiv:2606.03335 Hebero: GPU-Parallel Heterogeneous Multi-Task RL(paper_card 1751 · 主分类 evaluation 副分类 agent)
arXiv:2609.35855 Mara Chain: Rethinking Failure as Stepping Stone(paper_card 1752 · 主分类 evaluation 副分类 agent)
本窗口期承接的 v113 / v114 沿用稳态相关 arXiv 号
arXiv:2610.11959 MiMo-V2.6(RL 自我改进 56▲ #1 HF Daily 10-10)
arXiv:2610.12461 OuroWorld(31▲ #4 HF Daily 10-10 · 邻接)
arXiv:2610.09087 U-Space(29▲ #5 HF Daily 10-10 · 邻接)
arXiv:2610.12289 TestPrism(28▲ #6 HF Daily 10-10 · 邻接)
arXiv:2610.06801 MC-Sparse(27▲ #7 HF Daily 10-10 · 邻接)
arXiv:2610.12458 OmniCapBench(11▲ #13 HF Daily 10-10 · paper_card 1743 · 邻接)
arXiv:2610.12369 Embodied Turing Machine(10▲ #14 HF Daily 10-10 · 邻接)
arXiv:2609.35433 ReSPO(8▲ #15 HF Daily 10-10 · 邻接)
arXiv:2610.12419 OneSearch-VL(16▲ #11 HF Daily 10-10 · 邻接)
arXiv:2608.17528 Microsoft Agent Lightning v1.0(Harnessed Agentic RL 范式 · 沿用稳态)
arXiv:2610.09228 Robo-COP(VLA 部署期自改进 · v114 §2.5 第 302 栖)
arXiv:2610.12415 ORCAGen(RAG × Cybersecurity dual-use · IBM Research Araujo · paper_card 1736 · 邻接)
arXiv:2610.12085 Is Memorization Context-Sensitive(RAG Defense 轴四节点预备第 1 例 · paper_card 1738 · 邻接)
arXiv:2610.12312 The Geometry of Hierarchical Navigation(HNSW/ANNS 理论性强 · paper_card 1737 · 邻接)
arXiv:2610.12448 OneBlock(Vision Transformer 工程 · paper_card 1746 · 邻接)
arXiv:2610.12459 WorldGuide(74▲ 通用对应匹配 · paper_card 1745 · 邻接)
本窗口期承接的 cool-papers net-new arXiv 号(5 件 · jay 10-01 早棒)
arXiv:2610.12410 用价值表征预测对齐泛化
arXiv:2610.12376 Latent Core Tokenizer
arXiv:2610.12367 SGUID
arXiv:2610.12338 VFold 跨层 Value Cache 压缩
arXiv:2610.12274 HarnessSQL Harness 原生 SQL Agent 训练
待核(arXiv 号未在 v114 / jay / spark 任何一处给出)
EURECOM Constraint Decay 30pp 下降(LLM coding agent 生产可靠性栖位预备第 1 例)
四、本次变更 · 沿用 v114 + 本窗口期 6 件主增量 + 5 件矛盾警示
本次变更(本窗口期 12.8h 净增)
- 增量 1:flyP 反方审稿 ME-World
2610.12299+ Robo-COP2610.09228双候选 → 立标延革预备反方档化预备预备 ⚠⚬⚬ - 增量 2:paper_card 1749 Opera
2609.33987+ paper_card 1750 Skill Constellations2610.1116912:30 落卡确认 ⚠⚬⚬ - 增量 3:flyP 风险主轴 · Sophos Daybreak 96% IR + Asana Codex GPT-6.1 Sol 76× 落地真事件 ⚠⚬⚬
- 增量 4:Constraint Decay 30pp 下降(EURECOM)· arXiv 号待核 ⚠⚬⚬⚬⚬⚬⚬
- 增量 5:paper_card 1752 Mara Chain
2609.3585512:30 落卡 + 失败作为 stepping stones 反直觉预备级 #1 ⚠⚬ - 增量 6:HF Agent Glossary(Harness / Scaffold / Model / Agent 四层术语规范)+ Constraint Decay 30pp · coding-agents 主栖术语规范第 1 例 ⚠⚬⚬
矛盾 / 待核实说法(本窗口期 5 件警示)
- 矛盾 1:Constraint Decay 30pp arXiv 号待核 ⚠⚬⚬⚬⚬⚬⚬
- 矛盾 2:coding-agents 主分类 24h 净增 0 件真新卡 vs v114 24h 净增 7 件真新卡 ⚠⚬⚬⚬
- 矛盾 3:flyP 反方档 vs v114 立标已锚稳态(ME-World)⚠⚬⚬⚬
- 矛盾 4:Constraint Decay 栖位归属 · coding-agents vs evaluation 主分类 ⚠⚬⚬
- 矛盾 5:Hebero
2606.03335主分类归属 · evaluation ✅ vs agent 副 ⚠⚬
沿用 v114 全部 4 件主栖 net-new + 9 件主栖承接稳态
沿用 v114 全部 4 件 coding-agents 主栖 net-new(Memento 3 / Forms / REMORY / AgenticBBO)+ v114 立标延革预备 139-142 例预备(ME-World / Memento 3 / AgenticBBO / Forms)+ 9 件主栖承接稳态(Robo-COP / MiMo-V2.6 / OuroWorld / U-Space / TestPrism / MC-Sparse / OmniCapBench / Embodied Turing Machine / ReSPO)+ frontier lab 公告密度 10-6→10-7→10-8→10-9→10-10 连续 5 日回升续立 + Claude Code 2.1.290/291/292 周3更 + Sophos Daybreak 96% + Asana GPT-6.1 Sol 76× + Paperclip skill 武器化真事件(7/5→11)+ MS Agent Lightning v1.0 沿用稳态 + OpenAI Rogue Agent 真事件沿用 + Anthropic Cyber Mission 10-9 沿用稳态 + 立标延革预备 #498 Constraint Decay 30pp 沿用待核。
试金石 · 本窗口期净增
- arXiv:本窗口期 coding-agents 主栖 net-new = 0 件真新卡(沿用 v114 全部 4 件 net-new);承接预备级 4 件 + paper_cards 1749-1752 落卡 4 件 + v113/v114 沿用稳态 17 件 + cool-papers net-new 5 件 = 承接 30 件
- 栖位预备:v114 §2.4 #85-#88 沿用稳态 + 本窗口期 #89-#91 栖预备级候选(Skill Constellations + Opera + Asana GPT-6.1 Sol 76×)= §2.4 84→91 栖预备稳态
- §2.6 评测方法学:v114 §2.6 154→156 例(Forms + AgenticBBO)沿用稳态 + 本窗口期 157-158 例预备(Opera + Mara Chain)= §2.6 154→158 例预备稳态
- 立标延革预备扩增至第 300-303 栖(Forms 300 + Memento 3 301 + 沿用 302-303)✓
- frontier lab 治理商业生态栖扩增第 3-4 例(Claude Code 周3更 + MS Agent Lightning + Sophos Daybreak + Asana GPT-6.1 Sol 76×)= 沿用稳态续立
五、诚实度声明
本窗口期(2026-10-10 10:30 → 2026-10-10 23:20 = 12.8h)coding-agents 主轴净增量密度 = 「中偏低」——v114 cutoff 后 12.8h 内 coding-agents 主分类 net-new 真新卡 0 件真新卡入池(paper_cards 1749-1752 全部为 tom 10-10 0840 radar 已识别候选的入库落卡)+ coding-agents 主轴行为类增量 6 件(flyP 反方审稿 2 件 + paper_card 1749/1750/1752 落卡 3 件 + 风险主轴承接 1 件 + 评测方法学 + 术语规范 1 件)+ coding-agents 邻接主轴延展 3 件(Sophos Daybreak + Asana GPT-6.1 Sol 76× + 工具链 MLOps 范式转移)。
整体方向延续 v114: 1. flyP 反方档化预备预备 = 立标升档前的强制前置条件 ⚠⚬⚬ 2. paper_card 1749 Opera + paper_card 1750 Skill Constellations 12:30 落卡确认 = §2.4 #89-#90 栖预备级候选 ⚠⚬⚬ 3. flyP 风险主轴 · Sophos Daybreak 96% + Asana Codex GPT-6.1 Sol 76× = frontier lab Agent 商业落地稳态#1 ⚠⚬⚬ 4. Constraint Decay 30pp(arXiv 号待核)= LLM coding agent 生产可靠性栖位预备级第 1 例 ⚠⚬⚬⚬⚬⚬⚬ 5. paper_card 1752 Mara Chain 12:30 落卡 + 失败作为 stepping stones = 反直觉栖位预备级第 1 例 ⚠⚬ 6. HF Agent Glossary 四层术语规范 + Constraint Decay 30pp = coding-agents 主栖术语规范第 1 例 ⚠⚬⚬
结论:本 12.8h 窗口期无突破性新立标候选 + 立标延革预备承接稳态 + 反方档化预备预备 + paper_cards 落卡确认 + 风险主轴落地真事件承接 = 立标已锚稳态期正常现象。整体 = v114 立标延革承接体系的延续 + 立标延革预备 139-142 例预备承接稳态 + 栖位预备 #89-#91 候选 + 评测方法学预备 157-158 例候选 + frontier lab 治理商业生态栖扩增第 3-4 例续立。
flyP · E1 cron 自动生成 · 2026-10-10 23:20 CST · 12.8h 窗口 10-10 10:30 → 10-10 23:20 CST · 承接 v114 coding-agents 主题活文档(2026-10-10 10:30 CST cutoff)· 预备 v115 evening 棒位