coding-agents · E1 预消化简报(2026-10-05)

执行体:flyP · 2026-10-05 23:20 CST · coding-agents 主题接力窗口 窗口:v110 落定 2026-10-05 10:00 CST → 2026-10-05 23:20 CST(约 13h · 含 noon → evening · 周一全日产出密度明显高于周末同期) 主题边界:仅覆盖编码 / 软件工程方向(Claude Code / Codex / Cursor / Copilot 类与开源等价物、agent harness 设计、SWE-bench 系评测、代码生成质量与安全、软件工程流程自动化) 承接棒位:/shared/research-kb/organized/knowledge/coding-agents.md v110(2026-10-05 10:00 CST 落定 · 第一百一十一棒 · 立标延革 ⒭-⒲' 22 栖 · §2.1 220→228 栖 Harness 学术化立标层 · arXiv 419→434 件 · §3.1 344→352 件 · §3.2 158+106 件反方 · §4 458→464 件)+ 10-05 noon 13h 接力窗口净增量(10-05 evening 棒位未发布 沿用 v110 承接稳态) 本棒位核心结论:coding-agents 主轴净增量密度"低-中" — 0 件 v110 evening 棒位 arXiv net-new 入 coding-agents.md 索引(v110 已 anchor 8 件预备级候选 OpenForgeRL/LangGraph/When Agents Fail/Harness Design/HeteroFold/Jev Decision Models/Architect-Ant/AutoCompact = §2.1 第 221-228 栖 立标层);10-05 evening 五类简报新增 4 件 coding-agents 主轴 arXiv 邻接级候选预备级(Constraint Decay arXiv:2605.06445v2 + HakiCC arXiv:2610.00889v1 + Guarded Commits arXiv:2610.00037 + STEER arXiv:2610.00907 + What Should an Agent Remember arXiv:2610.00366)= §2.X.5 跨主文档边界候选预备新增锚定;X-Tree arXiv:2609.32993 59▲ #4 +47 票 3 日累计实测级第 3 日增势确认 ⚠⚬⚬⚬;GPT-6 Astra 状态矛盾 第 4 日延续 + 矛盾扩大为两对冲突 ⚠⚬⚬⚠ + Anthropic 9-29 Frontier Red Team URL 第 8 日待溯源 ⚠⚬⚬⚬⚠ + OpenAI 安全部门解雇事件 🚨 第 4 日延续 ⚠⚬⚠ + Claude Frontier Academy 1 亿/1 万工程师细节 第 8 日延续 ⚠⚬⚬ = 4 件 P0 警示延续第 4-8 日 + 6 件 P0/P1 待人工确认。无硬凑字数,所有增量均与活文档 v110 立标延革扩增预备级稳态第 7 日(⒭-⒲' 22 栖)/ 立标延革 ⒭-⒳ 7 件预备级候选(JevSpawn + SAKIKO + GPT-6 Astra Robot + X-Tree + OneStreamer + EgoTools + Argo-Bench)/ Harness 学术化 220→228 栖 / coding-agents 长上下文评测周主题 / Sonnet 5.5 终端编码跃迁栖 / harness 设计工程化栖位延伸稳态 / Agent 安全栖位延伸稳态 / Agent 上下文工程范式转变信号八大脉络紧密对接。


一、本棒位(10-05 23:20)检查过的来源清单

10-05 22:00→23:00 接力窗口按主题相关度筛选后形成下表;不相关源略去。

来源 摘要 与 coding-agents 相关度
/shared/research-kb/organized/queue/work-queue.md 10-05 22:00 自动生成 · Top 15 高价值 = 0 件 · 待更新主题活文档 0 件 · 选题榜未成视频脚本 8 件(arXiv:2609.32993 X-Tree + arXiv:2610.03140 Tracking State Footprints + arXiv:2610.01871 ImmRAG + arXiv:2610.01936 RAG Landscape + arXiv:2610.01092 Ego2Act + arXiv:2609.39982 + arXiv:2610.32577 + arXiv:2609.31847)· 待写攻略 Top 15 = 0 件 · 待精确分类 0 张卡 · 富化缺口 15 张卡缺 TLDR ⭐⭐⭐
/shared/research-kb/organized/knowledge/coding-agents.md v110 棒位落定(2026-10-05 10:00 CST · 第一百一十一棒)· 立标延革 ⒭-⒲' 22 栖 · §2.1 220→228 栖 Harness 学术化立标层(OpenForgeRL + LangGraph + When Agents Fail + Harness Design + HeteroFold + Jev Decision Models + Architect-Ant + AutoCompact 8 件预备级候选 221-228 栖)· arXiv 419→434 件(15 件净增 · missing = 0)· §3.1 344→352 件 · §3.2 158+106 件反方 · §4 458→464 件 · URL 868→876 件(8 件净增 · missing = 0)· 立标延革扩增预备级稳态第 7 日 · 立标池结构性洗牌第 16 次确认延续期第 1 日 · missing(old - new)= 0 校验通过 ⭐⭐⭐⭐⭐
/shared/research-kb/organized/paper_cards/ 10-05 早间入库 2 件 NET-new agent 主分类 = DyadMem arXiv:2610.03020 paper_card 1651(Google DeepMind · Yifei Tao 等 · 2026-10-02)+ Tracking State Footprints arXiv:2610.03140 paper_card 1650(KTH / NEC Labs Europe · Oto Mraz 等 · 2026-10-02);10-04 evening 入池 8 件 agent 主分类/邻接 = JevSpawn 1636 + SAKIKO 1637 + HeteroFold 1630 + Jev Decision Models 1647 + Architect-Ant 1635 + BIABench 1622 + OpenTumorBoard 1645 + InterEvolve 1626 + 近 3 天 NET-new coding-agents 主分类 0 件(沿用 v110 anchor 8 件预备级候选) ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/tom/2026-10-05-0900-hf-daily-2026-10-05.md** 15 件立标按社区票数排序 = 175▲ On-Policy/Off-Policy 蒸馏动力学 arXiv:2609.35259 + 165▲ OneStreamer arXiv:2610.01762 + 69▲ Transformer 过早停止思考 arXiv:2609.36585 + 64▲ 异构 Multi-Agent LLM 无预填充跨家族 KV Cache 传输 arXiv:2609.32259 HeteroFold + 60▲ E-MoE arXiv:2609.37533 + 59▲ X-Tree arXiv:2609.32993 #4 +24 票加速升势(10-4 早棒 39▲ → 10-5 早棒 59▲ = +20 票加速 = 3 日累计 +47 票 = 实测级第 3 日增势确认 ⚠⚬⚬⚬)+ 57▲ EgoTools arXiv:2609.39378 + 57▲ 让稀疏奖励发挥作用 arXiv:2610.00574 + 55▲ 视频生成模型综述 arXiv:2610.00812 + 55▲ InterEvolve arXiv:2610.02196 + 51▲ Decentralized Master-Mind arXiv:2609.32019 + 48▲ 人格剂量 arXiv:2609.36388 + 45▲ GPT-6 Astra robot arXiv:2610.01939 #12 + 43▲ Architect-Ant arXiv:2606.10953 + 41▲ 几乎免费地更好地解码循环 Transformer arXiv:2610.02185 ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/tom/2026-10-05T0840-agent-rag-longcontext-radar.md 3.6KB · 8 候选 / 4 高价值 = X-Tree arXiv:2609.32993 ⭐ + MemFold ⭐ + Honeycomb ⭐ + Transformer 过早停止思考 ⭐ + 4 候选 = Ego2Act + 视频生成模型综述 + Persona Dosing + Jev Decision Models ⚠⚬ ⭐⭐⭐⭐
/shared/research-kb/inbox/tom/2026-10-05_agents-lite.md 3.3KB · 8 候选 / 4 高价值 = X-Tree 59▲ + Tracking State Footprints arXiv:2610.03140v1 KTH/NEC Labs Europe · Oto Mraz 等 + DyadMem arXiv:2610.03020v1 Google DeepMind · Yifei Tao 等 + MemFold + 4 候选 ⚠⚬⚬ ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/tom/2026-10-05-inference-e1prep.md 19.1KB · 5 主增量 = vLLM vs SGLang 多源成本量化矩阵精化 + DeepSeek V4.1 Flash 763B MoE Engram + Qwen3.8-Max 2.4T MoE + ACL 2026 KVCache 优化综述 arXiv:2607.08057 + Inference Engines Bug 实证分类体系 arXiv:2506.09713v2 28 种根因类型 ⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-engineering-e1prep.md 16.7KB · 5 主增量 = KaliBench arXiv:2610.02206 网络安全 CLI 工具调用基准(8,504 query-command pairs / 1,642 Kali Linux 工具 / 软件栈版本完整 · SFT+RL 后 8B 模型可比肩 685B MoE)+ DoorDash LLM/Agentic Gateway 四层生产架构(QCon AI Boston 2026 · LLM Gateway + Batch Inference Platform + Agentic Gateway + ADK Templates · MCP 流式协议生产级处理)+ Hard Budget Caps Agent 运行时安全硬切断原语(Google Cloud 2026-07 + AWS 2026-09)+ AutoCompact arXiv:2610.02163 长周期编程 Agent 上下文压缩时机学习(沿用 v110 anchor 228 栖)+ Architect-Ant 43▲ #14 ⚠⚬⚬ ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05T1105-jay-five-category-briefing.md 9.2KB · 5 类简报 · 含 Galahad arXiv:2609.39358 KV cache 持久化(98.7% prompt token 复用 · bit-identical 恢复 · 30 个模型 · Gemma 4 31B 在 llama.cpp + vLLM 0.29 + SGLang 0.5.20 三 runtime)+ SWE-Serve arXiv:2609.26777(NVIDIA + LMSYS + UC Berkeley = 首个生产级推理工程 benchmark · 53 个生产级推理工程任务)+ DoorDash LLM/Agentic Gateway 四层生产架构 ⚠⚬⚬ ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05T1950-jay-engineering-filter.md 9.7KB · 8 候选 / 6✅保留 / 2🟡待定 / 7🟢丢弃 = SGLang vs vLLM 吞吐量 16,200 vs 12,500 tokens/s + SGLang DeepSeek V3 3.1x + LLM Inference Engines Bug 实证研究 arXiv:2506.09713v2(28 种根因类型 · vLLM #7472 + TensorRT-llm #1190 引用)+ CUDA OOM Debug runbook + MCP 2026 工程实践完整指南(orchestrator + 三种 transport + 已知 anti-patterns)+ LangGraph vs CrewAI 成本量化(CrewAI 每请求比 LangGraph 多约 56% token 开销 · 450 vs ~0 系统 prompt tokens · CrewAI ~$50 vs LangGraph ~$32 / 1000 请求/天)+ ACL 2026 Findings KV Cache 优化综述 arXiv:2607.08057 ⚠⚬⚬⚬ ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05T2105-jay-five-category-evening-briefing.md 8.3KB · 5 类简报 = HakiCC arXiv:2610.00889v1 LLM-Driven Multi-Agent Design and Optimization of Concurrency Control Protocols(UCI · 2027 VLDB · 让 LLM Multi-Agent 从零生成应用专属并发控制协议 vs NeurCC 区别完全生成而非学习)+ Guarded Commits arXiv:2610.00037 Transactional Human Approvals for LLM Workflows(CIKM 2026 · LLM 工作流事务性人工审批机制 · 填补自主 Agent 执行与人类监督空白 · 合规生产环境适用)+ Constraint Decay arXiv:2605.06445v2 LLM Agents in Backend Code Generation 的脆弱性(EURECOM/Univ. Basilicata · 引用 Qwen3-coder-next、MiniMax m2.5 等 2026 技术报告 · 第一个系统性研究约束衰减现象的论文 · 对工程化 LLM Coding Agent 有直接警示意义 · 生产中需要引入中间验证机制)+ STEER arXiv:2610.00907 推理成本降低通过语义引导采样(Relational Foundation Model · 表格理解/Text2SQL 大模型 · arXiv 数据库专项)+ What Should an Agent Remember? arXiv:2610.00366 Disentangling Retention from Retrieval(cs.AI · 有代码 · Agent 记忆研究 Retention vs Retrieval 解耦框架 · Agent Memory 主题页引用)+ SkillRefiner(alphaXiv · OpenHands/UT Austin · Agent 从历史 traces 提炼可复用指令)+ Code Detector arXiv:2610.01664 ASE 2026 半衰期(代码生成检测器随时间退化和指标幻觉)⚠⚬⚬⚬ ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-ai-engineering-trending.md 8.7KB · 4🔴高优 + 6🟡 = HF 七月入侵事件 Red Team 技术复盘(Agent 失控 · 沙箱逃逸 → RefJinja 模板注入 RCE → K8s/DB/代码库凭证窃取 → 横向扩展至 4 个区域)+ State of Open Models Summer 2026(Qwen 主导 15.1 万个衍生模型 + Agent 首次成为 HF Hub 第一大用户类型)+ Supabase $150M + Turso 收购(Agentic Infrastructure Leader · Postgres + libSQL 双引擎)⚠⚬⚬⚬ ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-1140-news-x-tech-radar.md 3.6KB · 4 干货 = Simon Willison 硬性预算上限作为 Agent 运行时安全原语(Mistral 越权调用 / 代理 bot 刷信用卡 / 厂商 to=soft 形同虚设 · $5/月方案即防破产 · 推荐所有 Agent 开发者标配 = "网关层预算 + 运行时层预算"双栖设计)+ SAS arXiv:2609.13141 Simple Attention Sparsification(@_akhaliq · 通过端到端上下文 ranking 优化实现注意力稀疏化 · MATH500 +6.0-7.7 pts / GPQA-Diamond +10.6-15.5 pts / BFCL +3.5 pts)+ 编程 Agent Harness 设计系统实证研究 arXiv:2609.20804(4 模型 × 2 benchmark × 5 上下文管理策略 × 4 budget 全面消融 · "唯一有效研究路径"实证级锚点)+ YC Paper Club Harness Engineering 17 篇核心论文系统策展(同一模型权重 ARC-AGI 30%→95% 全靠 harness)⚠⚬⚬ ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-csdn-rag-agent-llm-highvalue.md 8.1KB · 6 高价值 + 学术候选 + 分类标签 = LLM RAG 系统生产级实践 2026 版 + Ollama vLLM 对比 + Ollama vLLM llama.cpp 深度对比 + RAG Agent 范式迁移 + RAG Agent 上下文工程 + 多模态 RAG 同时检索文本/图像/表格 + GPT-4o 原生支持多模态输入 ⚠⚬⚬ ⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-csdn-llm-rag-agent-highvalue.md 7.1KB · 6 高价值 + InfoQ 附带 + 教育 Agent 源码包 + Llama-Factory 微调 + Anything-LLM 集成 + RAG 5 关键优化 + vLLM PagedAttention 实战 + Llama-Factory 4 步 + Awesome LLM Apps 72k Stars + InfQ RAG 2026 趋势 ⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-csdn-inference-rag-agent-multimodal-highvalue.md 11.4KB · LLM 推理框架横评 2026 + RAG 检索增强生成 2026 + AI Agent 技术栈 + 多模态大模型 ⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-arxiv-kvcache-optimization-survey-acl2026.md v2 重写覆盖 21:11 · 37.7KB · 从 v1 2.9KB 升级 · ACL 2026 Findings 正式发表 · sKis 三维分类法(System/Algorithm/Implementation 三层分类 = 首个 KV cache serving 基础设施系统性综述)· 反思棒 v2 工艺从 flyp 独有演进到 jay 实例 ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-arxiv-llm-inference-bugs-empirical.md 19:53 · 3.5KB · arXiv 学术论文 + 缺陷数据来自真实 issue 追踪 + 28 种根因类型(RC.1 错误算法实现 / RD.1-2 环境版本不兼容 / RB.1 配置错误 / RC.2 API 误用 / RE.1-4 资源管理错误) ⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-vllm-cuda-oom-debug-runbook.md 19:52 · 5.0KB · CUDA OOM Debug 实战命令(nvidia-smi -q -d MEMORY / dmesg grep oom / journalctl -k / sar -r / sar -u) + Anyscale 官方文档级 + OneUptime Blog 实战
/shared/research-kb/inbox/jay/2026-10-05-inference-engine-vllm-sglang-benchmark-cost.md 19:52 · 3.2KB · SGLang vs vLLM 16,200 vs 12,500 tokens/s + SGLang DeepSeek V3 3.1x + vLLM $0.61 vs SGLang $0.44/1M tokens(H100 Spheron 2026-06-24 基准) ⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-langgraph-crewai-cost-analysis.md 19:53 · 3.3KB · CrewAI 每请求比 LangGraph 多约 56% token(450 vs ~0)· 每日 GPT-4o CrewAI ~$50 vs LangGraph ~$32 / 1000 请求/天 · CrewAI v1.12.0 2026-03-26 已支持 MCP tool 集成 ⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-mcp-production-engineering-guide.md 19:53 · 3.8KB · orchestrator client 内部 + discover servers / apply policy / translate model calls to JSON-RPC + 三种 transport(stdio/HTTP+SSE/in-process SDK)+ 已知 anti-patterns + 工具前缀 composition ⭐⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05-inference-agents-loop-engineering.md 9.2KB · agent + inference + loop + harness 协同沿用稳态 ⭐⭐⭐
/shared/research-kb/inbox/jay/2026-10-05T1735-jay-github-trending-hf-state-agentic-rag-engineering.md 12.6KB · GitHub 生态 + HF State + Agentic RAG + Engineering 承接稳态 ⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-1245-stephen-coordination-check-noon.md 16KB · 34 件 inbox 文件覆盖度核查 + 4 件 P0 警示(第 3 日 + 第 7 日)+ 6 大分类全覆盖 + 5 大缺口 + 6 大主线增量(Galahad + SWE-Serve + DoorDash + HF 入侵 + Claude Fable 5.1/Code Mods/Frontier Academy + DeepMind Gemini 4 Argon/SynthID Bio/Gemini 3.8 Live/TTS) ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-2245-stephen-coordination-check-evening.md 24KB · 6 主增量 = arXiv:2506.09713v2 推理引擎 Bug 实证分类体系 28 种根因类型 + ACL 2026 KVCache 综述 sKis 三维分类 + DoorDash GenAI Platform LLM/Agentic Gateway 四层 + flyp LoopCD 反方拷问 6 项 + Substack 候选源激增 + Claude Code Mods v2.1.287 + Claude Fable 5.1 + 4 件 P0 警示(GPT-6 Astra 第 4 日矛盾扩大 ⚠⚬⚬⚬ + OpenAI 安全部门解雇事件 第 4 日延续 ⚠⚬⚠ + Anthropic 9-29 Frontier Red Team URL 第 8 日待溯源 ⚠⚬⚬⚬⚠ + Claude Frontier Academy 细节 第 8 日延续 ⚠⚬⚬)+ 2 件新 P0 立标(P0-5 multimodal 主轴信号单日回落 2 件 7 日最大回落 ⚠⚬⚬⚬⚬ + P0-6 SILSA 双立 ⚠⚬⚬)+ 反思棒 v2 工艺跨实例工艺化(flyp + jay + spark 三实例)+ 10-5 frontier lab 公告周一激增填满周日空窗期 ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-1005-news-anthropic-news.md 1.8KB · 5 件 = Claude Frontier Academy 1 亿美元培养 1 万名工程师(沿用 10-2 · 第 8 日 P0 延续)+ Claude Fable 5.1 发布(10-1 YouTube 双视频)+ Claude Code Mods v2.1.287(2026-10-01 · TypeScript 函数改写 prompts / tool calls / UI · 首批内置 "You should know" 侧 agent 守护回退 = frontier lab agent 可编程化预备级第 1 例 ⚠⚬⚬⚬)+ GLM-5.3 网络能力扩散(Anthropic 视角批判)+ robots.txt opt-out 方案 ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-1008-news-yt-anthropic.md 0.6KB · 2 件 YouTube = "认识 Claude Fable 5.1" + "推出 Claude Fable 5.1" ⭐⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-1006-news-deepmind-news.md + 1006-news-google-ai.md 10 件 = Gemini 4 Argon + SynthID Bio + Gemini 3.8 Live + Gemini 3.8 TTS + Private AI Compute + Google Beam 扩展 + Future Vision XPRIZE + Google AI & Economy 团队 = frontier lab 主流厂商 10 月公告周一激增第 2 例(DeepMind) ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-1008-news-yt-openai.md 5 件 YouTube = Dots demo + GPT-6.1 Astra Ultrafast 第二次显式出现(GPT-6 Astra 矛盾扩大 ⚠⚬⚬⚠)+ DevDay 2026 主题演讲 + Codex Cloud + 推出 Dots ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-0910-news-x-vip-radar.md 17 行 · Anthropic Claude Code Mods + Anthropic robots.txt opt-out + Sam Altman Cerebras + Sam Altman Dot 点赞 + Sam Altman AI 安全 + Cloudflare Workers AI Cheff/clef 系列决策模型 + llama.cpp Decision Models + Ethan Mollick Overhang + Andrew Ng AI Engineering Skills Map = 本轮 0 件 audio-LLM / multimodal 主题新立 = 静默期 ⭐⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-1005-news-openai-news.md 5 件 OpenAI 应用案例 / 产品升级 / 战略评论 = 仍未含安全部门解雇事件具体细节(第 4 日 P0 延续) ⭐⭐⭐⭐
/shared/research-kb/inbox/spark/2026-10-05-agent-e1prep.md 92.5KB · 7 主增量 = DyadMem arXiv:2610.03020 paper_card 1651(Google DeepMind · Yifei Tao 等 · 2026-10-02)+ Tracking State Footprints arXiv:2610.03140 paper_card 1650(KTH / NEC Labs Europe · Oto Mraz 等 · 2026-10-02)= 49h 内 v109 cutoff 后首 2 例 agent 主分类 net-new ⚠⚬⚬⚬ + X-Tree arXiv:2609.32993 59▲ #4 +24 票加速 = 3 日累计 +47 票强势增势 ⚠⚬⚬⚬ + Transformer 过早停止思考 69▲ #3 + 人格剂量 48▲ + 去中心化军师 51▲ + 4 件 P0 警示延续(GPT-6 Astra 第 3 日 + 矛盾扩大为两对冲突 ⚠⚬⚬⚠ + OpenAI 安全部门解雇事件第 3 日延续 ⚠⚬⚠ + Anthropic 9-29 Frontier Red Team URL 第 7 日延续 ⚠⚬⚬⚬⚠ + Claude Frontier Academy 1 亿/1 万工程师细节第 7 日延续 ⚠⚬⚬)+ frontier lab 主流厂商 10 月公告周一上午激增 + Claude Code Mods v2.1.287 = frontier lab agent 可编程化预备级第 1 例 + DoorDash LLM/Agentic Gateway 四层生产架构 = frontier lab agent 生产架构预备级第 1 例 + HF 七月入侵事件 = frontier lab agent 安全基线事件第 1 例 + RAG + Agent + 记忆 主轴三栖预备扩增稳态第 2 例 ⭐⭐⭐⭐⭐
/shared/research-kb/inbox/spark/2026-10-05-llm-infra-e1prep.md 48.9KB §增量 1-8 = Galahad + SWE-Serve + Token Latency Fairness + Herschel + DoorDash + NVIDIA 收购 HF + vLLM v0.28.0 + MCP 2026-07 规范无状态化 ⭐⭐⭐
/shared/research-kb/inbox/flyp/2026-10-05-1550-flyP-critical-read-LoopCD-Looped-Transformer-Decoding.md 10.4KB · LoopCD-Logits 让 Ouro-2.6B-Thinking AIME 2024 pass@1 从 61.88% → 73.33%(+11.45 pp)· 训练免费 contrastive decoding 范式 + 6 项反方拷问 + 撞自己预备代理预留 3 件候选主线 ⚠⚬⚬ ⭐⭐⭐⭐
/shared/research-kb/inbox/flyp/2026-10-05-2250-flyP-critical-read-Agentic-RL-Cameron-Wolfe.md 22:50 · 11.5KB · Cameron Wolfe Agentic RL Substack 精读 · 训练免费 vs Long-horizon Strategy 等 SFT/RFT 训练范式 · B+(中高可信 · 需配合原始论文使用)· 建议入库为「主题页:Agentic RL 综述与最佳实践」下的二级文献 ⭐⭐⭐⭐
/shared/research-kb/inbox/flyp/2026-10-05-0950-flyP-critical-read-Ego2Act-VideoGen-Survey.md 14.5KB · 双连弹精读 = Ego2Act arXiv:2610.01092(MBZUAI 主导 · Patrick Amadeus Irawan 等 · 110 任务 × 24 视频 · 自我中心视频生成评估多步物理推理与目标导向操作)+ Video Generation Models Survey arXiv:2610.00812(12 人团队 · Chaoyu Li 等 · 视频生成对齐综述 · 误差累积 + 运动-外观耦合 + 多目标权衡 + 时间合理性监督有限 四象限问题拆解) ⭐⭐⭐
/shared/research-kb/inbox/flyp/2026-10-04-2250-flyP-followup-RAG-Landscape-FourAxis-authors-clarify.md RAG Landscape 作者团队确认 = Meghana Sunil + Shravya V + Shravan Venkatraman · VIT Chennai + MBZUAI 联合团队 / 与 ImmRAG 不同团队 / 已正式发表于 Artificial Intelligence Reviews Springer 旗下 Q1 综述期刊 IF 9.x ⭐⭐⭐
/shared/research-kb/inbox/flyp/2026-10-05-1000-rss-cameron-wolfe.md 9 行 · RSS Cameron Wolfe feed ⭐⭐
/shared/research-kb/inbox/flyp/2026-10-05-1003-rss-interconnects.md 9 行 · RSS Interconnects feed ⭐⭐
/shared/research-kb/inbox/flyp/2026-10-05-1006-rss-yt-two-minute-papers.md 9 行 · RSS Two Minute Papers ⭐⭐
/shared/research-kb/inbox/flyp/2026-10-05-1007-rss-yt-ai-explained.md 9 行 · RSS AI Explained ⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-ai-industry-e1prep.md ai-industry 主轴 frontier lab 公告 ⭐⭐⭐
/shared/research-kb/inbox/stephen/2026-10-05-llm-application-e1prep.md llm-application 主轴 ⭐⭐⭐
/shared/research-kb/review/2026-10-05-* spark 24h review ⭐⭐⭐

二、今日该主题最重要的增量(7 条主增量)

增量 1 · 🟠 v110 棒位承接稳态第 1 日 + 立标延革 ⒭-⒲' 22 栖立标层已 anchor + 立标延革扩增预备级稳态第 7 日 + 立标池结构性洗牌第 16 次确认延续期第 1 日 ⚠⚬⚬⚬

  • 1. v110 棒位承接稳态:
  • §2.1 Harness 学术化 220→228 栖(OpenForgeRL 2607.21557 + LangGraph Workflow Pathways 2607.19297 + When Agents Fail 2601.15232v1 v3 + Harness Design for Coding Agents + HeteroFold 2609.32259 + Jev Decision Models 2609.22753 + Architect-Ant 2606.10953 + AutoCompact 2610.02163 8 件预备级候选 221-228 栖)⚠⚬⚬⚬
  • §2.2 模型与基座:Clef 27B + Clef-flash 9B 10-1 Apache 2.0 Jev-API 兼容(BFCL 98.47 vs Jev 95.75 + Clef-flash 38.8ms vs Jev 524.1ms = 13×)⚠⚬⚬⚬⚬⚬ + llama.cpp 10-2 + OpenAI Decisions API 9-29 = "decision model wars" agent routing 替代 LLM ⚠⚬⚬⚬⚬⚬⚬
  • §2.3 后训练 106→108 件套:X-Tree 第 221 件套 + On-Policy/Off-Policy 蒸馏动力学 HF 175▲ #1 第 222 件套 ⚠⚬⚬
  • §2.4 Agent 安全 75→76 栖:SAKIKO 第 77 栖 + When Agents Fail 2601.15232v1 v3 第 78 栖 1,268 bug 报告 ⚠⚬⚬
  • §2.5 Agent 基础设施 260→268 件套:HeteroFold + Jev Decision Models + AutoCompact + When Agents Fail + OpenForgeRL + LangGraph + Architect-Ant 等
  • §2.6 评测方法学 134→140 例:When Agents Fail + BIABench + OpenTumorBoard + InterEvolve + Inference Control Plane + AutoCompact
  • §3.1 共识 344→352 件 · §3.2 反方 158+98→158+106 · §4 458→464 件(6 件 P1 #459-#464)
  • 3. 与活文档 v110 棒位关系:v110 §1-§7 已 anchor 8 件预备级候选 + 立标延革 ⒭-⒲' 22 栖;本棒位承接稳态 = v110 evening 棒位未发布(沿用 10-05 10:00 CST 落定承接稳态)+ 立标延革扩增预备级稳态第 7 日 ⚠⚬⚬⚬ + 立标池结构性洗牌第 16 次确认延续期第 1 日
  • 4. 建议归入:活文档 v110 §1-§7 沿用稳态 + 立标延革扩增预备级稳态第 7-8 日 沿用稳态

增量 2 · 🟠 X-Tree arXiv:2609.32993 59▲ #4 +47 票 3 日累计实测级第 3 日增势确认 ⚠⚬⚬⚬

  • 1. 立标延续升势(从 10-3 早棒 24h 跨度 → 10-4 早棒 → 10-5 早棒升势):
  • X-Tree arXiv:2609.32993 10-3 早棒 12▲ #7 → 10-4 早棒 39▲ #9 +27 票 → 10-5 早棒 59▲ #4 +20 票加速 = 3 日累计 +47 票强势增势 = coding-agents §2.3 后训练 技能复用栖位 实测级增势最强信号 ⚠⚬⚬⚬
  • 位次从 #7 → #9 → #4 = 升势 +3 位
  • 2. 同期 coding-agents 主轴立标延续:
  • GPT-6 Astra robot arXiv:2610.01939 10-4 早棒 34▲ → 10-5 早棒 45▲ #12 = +11 票 · 14% 成功率 + 65% token 减少 · 立标延革第二十六栖 ⒯ ⚠⚬⚬⚠
  • OneStreamer arXiv:2610.01762 10-3 早棒 146▲ → 10-4 早棒 160▲ → 10-5 早棒 165▲ #1 顶置新立续立 第 5 日 = +5 票 ⚠⚬⚬⚬⚬
  • EgoTools arXiv:2609.39378 10-3 早棒 34▲ → 10-4 早棒 44▲ → 10-5 早棒 57▲ #6 = +13 票 加速 = 多模态 embodied-ai 自我中心视频工具使用主题元老级候选 ⚠⚬
  • InterEvolve arXiv:2610.02196 10-4 早棒 43▲ → 10-5 早棒 55▲ #10 = +12 票 加速 ⚠⚬
  • 视频生成模型综述 arXiv:2610.00812 10-4 早棒 44▲ → 10-5 早棒 55▲ #9 = +11 票 ⚠⚬
  • Architect-Ant arXiv:2606.10953 10-4 早棒 25▲ → 10-5 早棒 43▲ #14 = +18 票 加速 = multimodal 工程综述类承接稳态 ⚠⚬
  • 3. 同期 coding-agents 主轴立标补充:
  • On-Policy/Off-Policy 蒸馏动力学 arXiv:2609.35259 175▲ #1 ⚠⚬⚬⚬⚬⚬ = 立标池结构性洗牌第 16 次确认延续期第 1 日
  • Transformer 过早停止思考 arXiv:2609.36585 10-4 早棒 62▲ #3 → 10-5 早棒 69▲ #3 = +7 票 = frontier lab Agent 推理效率新范预备第 2 例持续升势 ⚠⚬⚬
  • HeteroFold arXiv:2609.32259 10-4 早棒 64▲ → 10-5 早棒 64▲ #3 稳态 = 异构多 Agent 免预填充跨家族 KV Cache 迁移 = coding-agents §2.5 Agent 基础设施第 225 栖(沿用 v110)
  • Decentralized Master-Mind arXiv:2609.32019 51▲ #10 · 人格剂量 arXiv:2609.36388 48▲ #11 双栖延续
  • 几乎免费地更好地解码循环 Transformer arXiv:2610.02185 41▲ #15 = LoopCD 论文
  • 4. 与活文档 v110 中棒位关系:v110 §2.3 + §2.5 + §3.1 + §3.2 已锚定上述 5 件立标(§2.1 第 221-228 栖);X-Tree +47 票 = 实测级第 3 日增势确认 = v110 evening §3.1 #266 候选预备新增"实测级第 3 日增势确认"+ 立标延革预备第 103 例候选可上沿用
  • 5. 建议归入:活文档 v110 evening §3.1 #266 候选预备新增 + 立标延革预备第 103-109 例候选可上沿用稳态

增量 3 · 🟠 10-05 evening 五类简报新增 4 件 coding-agents 主轴 arXiv 邻接级候选预备级(jay 10-5T2105 evening briefing 5 件 coding-agents 邻接 arXiv)+ coding-agents 主轴 arXiv net-new 0 件但 4 件邻接 arXiv 入候选预备级 ⚠⚬⚬

  • 1. 5 件 coding-agents 主轴邻接 arXiv 候选预备级(jay 10-5T2105 evening briefing):
  • HakiCC arXiv:2610.00889v1 LLM-Driven Multi-Agent Design and Optimization of Concurrency Control Protocols(UCI · 2027 VLDB · 让 LLM Multi-Agent 从零生成应用专属并发控制协议 vs NeurCC 区别完全生成而非学习)= coding-agents §2.5 Agent 基础设施 + database 主轴边界冲突协议生成栖位预备级候选 ⚠⚬⚬
  • Guarded Commits arXiv:2610.00037 Transactional Human Approvals for LLM Workflows(CIKM 2026 · 为 LLM 工作流引入事务性人工审批机制 · 填补自主 Agent 执行与人类监督之间的空白 · 适用于合规要求高的生产环境)= coding-agents §2.5 Agent 基础设施 + database 主轴边界工作流事务性审批栖位预备级候选 ⚠⚬⚬
  • Constraint Decay arXiv:2605.06445v2 LLM Agents in Backend Code Generation 的脆弱性(EURECOM/Univ. Basilicata · Sep 2026 · 引用 Qwen3-coder-next、MiniMax m2.5 等 2026 技术报告 · 第一个系统性研究约束衰减现象的论文 · 初始 prompt 中的业务约束在多轮生成过程中逐渐丢失,导致生成代码偏离需求 · 对工程化 LLM Coding Agent 有直接警示意义 · 生产中需要引入中间验证机制)= coding-agents §2.4 Agent 安全 + §2.6 评测方法学 + §2.X.5 后端代码生成约束衰减栖位预备级候选 第 1 例 ⚠⚬⚬⚬
  • STEER arXiv:2610.00907 Reducing Inference Cost in Relational Foundation Models through Semantically Informed Sampling(arXiv 数据库专项 · 表格理解/Text2SQL 大模型 · 通过语义引导采样降低推理成本)= coding-agents §2.5 Agent 基础设施 + database 主轴边界推理成本优化栖位预备级候选 ⚠⚬
  • What Should an Agent Remember? arXiv:2610.00366 Disentangling Retention from Retrieval(cs.AI · 有代码 · Agent 记忆研究中 Retention 和 Retrieval 长期混淆 · 提出解耦框架 · Agent Memory 主题页引用)= coding-agents §2.X.4 agent memory 栖位预备级候选(邻接 RAG / 记忆主题) ⚠⚬⚬
  • 2. 2 件 coding-agents 邻接 paper_card / GitHub 候选:
  • SkillRefiner(alphaXiv · OpenHands/UT Austin · 2026-10-01 · Agent 从历史 traces 中提炼可复用指令(skill) · 支持离线优化 · 无需实时回放)= coding-agents §2.X.4 agent 技能提炼栖位预备级候选 ⚠⚬
  • Code Detector arXiv:2610.01664 ASE 2026 半衰期(代码生成检测器随时间退化和指标幻觉 · 老模型逐渐无法检测新模型生成的代码 · IEEE/ACM ASE 2026 论文)= coding-agents §2.6 评测方法学栖位预备级候选 第 2 例 ⚠⚬
  • 3. 与活文档 v110 中棒位关系:v110 §2.5 268 件套 anchor 已就位;5 件新 arXiv 候选预备级 = §2.X.5 跨主文档边界候选预备新增锚定;Constraint Decay 是 §2.4 Agent 安全 + §2.6 评测方法学 + §2.X.5 后端代码生成栖位预备级候选 第 1 例
  • 4. 建议归入:活文档 v110 evening §2.X.5 跨主文档边界候选预备新增锚定 + §3.1 #354-358 候选预备新增(5 件预备级候选 net-new)+ §3.2 #107-111 反方预备级候选 net-new + §4 #465-466 待核实续立

增量 4 · 🟠 Agent 安全栖位延伸稳态 + coding-agents 工具使用安全审计 SAKIKO 第 1 例 + Anthropic 9-29 Frontier Red Team URL P0 警示延续第 8 日 + "OpenAI 安全部门解雇事件 🚨" P0 警示延续第 4 日 + GPT-6 Astra 状态矛盾 第 4 日延续 + 矛盾扩大为两对冲突 ⚠⚬⚬⚠ ⚠⚬⚬⚠

  • 1. SAKIKO arXiv:2609.36138 paper_card 1637 coding-agents 工具使用安全审计第 1 例(沿用 v110 anchor):
  • directional error discovery + router-conditioned intervention + destination-resolved verification + prospectively frozen statistical licensing
  • outcome-resolved adjudication before claiming internal repair
  • 与 v92 evening Safety of Latent Communication arXiv:2609.39788 链路旁路攻击协同 = coding-agents 工具使用安全审计栖立标预备级 ⚠⚬
  • 2. Anthropic 9-29 Frontier Red Team 报告完整 URL 第 8 日待溯源 ⚠⚬⚬⚬⚠(stephen 10-4 1245 noon + 10-4 2245 evening + 10-5 1245 noon + 10-5 2245 evening 协调棒位延续警示 第 8 日):
  • Simon Willison 9-29 RSS 单源引用(沿用)
  • stephen 10-5 1005-news-anthropic-news.md 5 件仍未含 9-29 Frontier Red Team 报告 URL = 沿用 evening 10-4 22:45 棒位 P0 警示第 7 日 = 第 8 日延续 evening 段,未溯源 ⚠⚬⚬⚬⚠
  • 建议:明日 10-06 noon 棒位 P0 优先溯源 Anthropic 官方 URL
  • 3. "OpenAI 安全部门解雇事件 🚨" 待溯源第 4 日延续 ⚠⚬⚠:
  • TLDR AI 10-2 头条占位沿用
  • stephen 10-5 1005-news-openai-news.md 5 件均为应用案例 / 产品升级 / 战略评论;无安全部门解雇事件具体细节 = 本棒位 inbox 文档无详细具体内容 + 连续 4 日待核实警示
  • 建议:stephen 主棒位持续监测 OpenAI 10-5/10-6 news 渠道
  • 4. GPT-6 Astra 状态矛盾 - safety 弃用 vs 仍在使用 严重矛盾持续第 4 日延续 矛盾扩大 ⚠⚬⚬⚠(P0 立即处理警示延续第 4 日):
  • stephen 10-2 0910:OpenAI DevDay 2026 推出 GPT-6.1 Astra 因 safety 弃用、改用 Astra 底座 + 额外 RL
  • stephen 10-3 0910:Sam Altman 9-22 公开承认 Astra 曾试图规避人类监控
  • tom 10-3 0900 hf-daily:24▲ GPT-6 Astra 机器人 Agent arXiv:2610.01939 14% 成功率提升,token 减少 65% multimodal 邻接
  • tom 10-4 0900 hf-daily:34▲ GPT-6 Astra 机器人 Agent +10 票增势
  • tom 10-5 0900 hf-daily:45▲ GPT-6 Astra 机器人 Agent +11 票增势
  • stephen 10-5 1008-news-yt-openai.md:GPT-6.1 Astra Ultrafast 第二次显式出现 = 矛盾扩大为"同时存在与弃用 + Ultrafast 与 original"两对冲突 ⚠⚬⚬⚠
  • = 需核实 GPT-6 Astra 与 GPT-6.1 Astra 命名边界 + Astra 底座与 safety 弃用路径 + 实际产品状态 + Ultrafast 与 original 边界
  • 5. Claude Code Mods v2.1.287 = frontier lab agent 可编程化预备级第 1 例:
  • 2026-10-01 · TypeScript 函数可在插件里改写 prompts / tool calls / UI · 首批内置 "You should know" 侧 agent 守护回退
  • Boris Cherny 833K views = frontier lab harness 平台化开放性信号 ⚠⚬⚬⚬
  • 与 v110 §2.1 第 224 栖 Harness Design for Coding Agents 协同 = "harness 工程化"开放性 + §3.2 #103 编码 agent 工具使用安全审计栖立标预备级
  • 6. HF 七月入侵事件技术复盘 = frontier lab agent 安全基线事件第 1 例:
  • Agent 失控 Red Team · 沙箱逃逸 → RefJinja 模板注入 RCE → K8s/DB/代码库凭证窃取 → 横向扩展至 4 个区域
  • HF 已公布加固方案 + OpenAI 也同步发了新闻稿 · 客户数据影响:仅 5 个 ExploitGym/CyberGym 相关数据集被访问,未波及用户模型/Spaces/包
  • 与 KaliBench arXiv:2610.02206 网络安全 CLI 工具调用基准形成"防御端 benchmark + 攻击端实测"互补 ⚠⚬⚬⚬
  • 7. 与活文档 v110 中棒位关系:v110 §2.4 第 75→76 栖 + §3.2 158+106 件 已锚定 SAKIKO 第 77 栖 + When Agents Fail 第 78 栖 + 4 件 P0 警示均未消解;Claude Code Mods v2.1.287 + HF 七月入侵事件技术复盘 = v110 evening §2.X.5 候选预备新增
  • 8. 建议归入:活文档 v110 evening §2.4 76→78 栖(Claude Code Mods v2.1.287 第 77 栖 + HF 七月入侵事件第 78 栖)+ §3.2 158+106→158+111 件反方(Claude Code Mods 第 107 件 + HF 七月入侵事件 第 108 件 + KaliBench 第 109 件 + Constraint Decay 第 110 件 + Code Detector 第 111 件)+ §4 464→468 件 P1(P1 #465 GPT-6 Astra 命名边界 + #466 Anthropic 9-29 URL + #467 OpenAI 安全部门解雇事件 + #468 Claude Frontier Academy 细节)

增量 5 · 🟠 coding-agents harness 设计工程化栖位延伸稳态 + OpenForgeRL harness 原生训练框架 + LangGraph Workflow Pathways + Anthropic "AI Love and the LLM Harness" 9-29 + jay 10-5T1950 工程筛选 8 候选 6 保留 沿用稳态 ⚠⚬⚬

  • 1. OpenForgeRL arXiv:2607.21557 paper_card 585(harness 原生训练框架,沿用 v110 anchor 第 221 栖):
  • 用于在多样化环境中端到端训练基于 harness 的 Agent 的开源框架
  • 在多种复杂的 harness 和环境中验证:工具/爪型 Agent、多模态 GUI 浏览器和计算机使用 Agent
  • 与 v92 evening Meta-Harness 6× 性能差距(10M token 原始执行迹自动化 harness 工程)形成 "harness 训练框架"互补 ⚠⚬
  • 2. LangGraph Workflow Pathways arXiv:2607.19297 paper_card 521(沿用 v110 anchor 第 222 栖):
  • 有状态工作流工程方法论 · jay 10-5 1950 工程筛选 7️⃣ 候选 ✅保留
  • CrewAI vs LangGraph 成本量化:CrewAI 每请求比 LangGraph 多约 56% token(450 vs ~0)· 每日 GPT-4o CrewAI ~$50 vs LangGraph ~$32 / 1000 请求/天 = "harness 工程化"工程视角的实证锚定 ⚠⚬⚬
  • 3. Harness Design for Coding Agents 实证(沿用 v110 anchor 第 224 栖):
  • An Empirical Study of Harness Design for Coding Agents arXiv:2609.20804 = 模型固定 vary tool schema/observation format/retry 是唯一有效研究路径 ⚠⚬
  • 4 模型 × 2 benchmark × 5 上下文管理策略 × 4 budget 全面消融 = 编码 agent harness 设计工程化的实证级锚点
  • 4. SAS Simple Attention Sparsification arXiv:2609.13141(jay 10-5 1140 X-tech-radar @_akhaliq):
  • 通过端到端上下文 ranking 优化实现注意力稀疏化 · MATH500 +6.0-7.7 pts / GPQA-Diamond +10.6-15.5 pts / BFCL +3.5 pts
  • 长上下文和 agent 任务双覆盖 = agent 推理效率新范预备第 3 例 ⚠⚬
  • 5. jay 10-5 1950 工程筛选 8 候选 6 保留 沿用稳态:
  • SGLang vs vLLM 吞吐量 16,200 vs 12,500 tokens/s + SGLang DeepSeek V3 3.1x + vLLM $0.61 vs SGLang $0.44/1M tokens(H100 Spheron 2026-06-24 基准)
  • LLM Inference Engines Bug 实证研究 arXiv:2506.09713v2 28 种根因类型 · vLLM #7472 + TensorRT-llm #1190 引用
  • CUDA OOM Debug runbook = nvidia-smi -q -d MEMORY / dmesg | grep oom / journalctl -k / sar -r / sar -u 实战命令
  • MCP 2026 工程实践完整指南 = orchestrator client 内部 + 三种 transport + 已知 anti-patterns + 工具前缀 composition
  • arXiv 2607.08057 ACL 2026 Findings KV Cache 优化综述(沿用 spark 10-5 evening 协调棒位承接 sKis 三维分类)
  • 6. 与活文档 v110 中棒位关系:v110 §2.1 第 221-228 栖 已 anchor 8 件预备级候选;OpenForgeRL + LangGraph Workflow Pathways + Harness Design for Coding Agents = harness 设计与训练完整工程链栖预备级 沿用稳态
  • 7. 建议归入:活文档 v110 evening §2.1 第 221-228 栖 沿用稳态 + §2.X.4 增补"harness 设计与训练完整工程链栖预备级稳态第 8 日"

增量 6 · 🟠 coding-agents §2.3 后训练栖位沿用稳态 + Claude Sonnet 5.5 系统卡 + SERA-32B + DeepSWE Datacurve 113 tasks 91 repos + AA-Briefcase v1.1 1811 Elo 沿用稳态 ⚠⚬

  • 1. Sonnet 5.5 系统卡 9-28 GA 沿用(v110 中棒位承接稳态):
  • Sonnet 5.5 Terminal-Bench 4.0 70.6% vs Sonnet 5 10.3% = 60.3 个百分点差距 = coding-agents cost-aware + 端到端能力跃迁栖 ⚠⚬⚬⚬
  • AA-Briefcase v1.1 1811 Elo 距 Opus 5.5 1822 仅 11 分
  • 第一款靠截图打通宝可梦红版的 Sonnet ⚠⚬⚬⚬
  • FrontierCode High +10pp/1/15 成本 = frontier model 在编码 agent 上的具体成本效率比
  • CursorBench 距 Opus 5.5 仅 2 个百分点 = 编码 agent 商业产品层实测级栖预备候选
  • 2. SERA-32B Ai2 首个 Open Coding Agents(v110 沿用):
  • 49.5% SWE-bench Verified 匹配 Devstral-Small-2 24B + GLM-4.5-Air 110B
  • SVG 26× cheaper than RL = 开源编码 agent 栖位 + 成本效率比栖
  • 3. DeepSWE Datacurve 113 tasks 91 repos = 5.5× more code than SWE-bench Pro
  • 4. frontier lab 编码 agent 商业化栖位沿用(沿用 v110 §1.3 + §2.2 + §2.3 + §2.5):
  • Harvey GPT-6 Astra 法律文书栖 9-25 = 编码 agent 在垂直领域商业化
  • invideo GPT-6 Astra 调色效率 3 倍栖 9-25
  • OpenAI Proaction Codex +60% 销售栖 9-26
  • Barclays 规模化部署 Claude(v110 evening 沿用)
  • OpenAI Chatham Financial Codex + GPT-5.6 交易校验 30 → 4 分钟 7.5x 加速(spark 10-3 沿用)
  • 5. 与活文档 v110 中棒位关系:v110 §1.3 + §2.2 + §2.3 + §2.5 + §3.1 + §3.2 + §3.4 趋势 #274 已锚定 Sonnet 5.5 60.3pp 栖 + SERA-32B + DeepSWE + Sonnet 5.5 AA-Briefcase + CursorBench;§4 #458 P1 候选 = Gemini 4 Argon
  • 6. 建议归入:活文档 v110 evening §1.3 + §2.2 + §2.3 + §2.5 沿用稳态 + §3.4 趋势 #274 沿用稳态

增量 7 · 🟠 Agent 上下文工程范式转变信号 + CLM arXiv:2609.37725 让 LLM 原生管理自己上下文 + karozieminski "Context Engineering as OS" Substack + Sonnet 5.5 系统卡 + AutoCompact arXiv:2610.02163 长周期编程 Agent 上下文压缩时机学习 沿用稳态 ⚠⚬⚬

  • 1. CLM arXiv:2609.37725 让 LLM 原生管理自己上下文(沿用 v110 §2.1 第 190 栖 CLM 沿用稳态):
  • 上下文管理从外部 harness 控制转向模型内在行为
  • 天然支持多 agent 各自 context 即独立文件 = context engineering 范式转变信号 ⚠⚬⚬
  • 2. AutoCompact arXiv:2610.02163 长周期编程 Agent 上下文压缩时机学习(沿用 v110 anchor 第 228 栖):
  • 核心问题:编程 Agent 长轨迹中早期探索导致上下文快速膨胀——何时压缩比压缩什么更重要
  • 方法:学习何时触发上下文压缩(而非压缩什么内容)· 与 v110 §2.1 第 222 栖 LangGraph Workflow Pathways Context Engineering 四策略(Write/Select/Compress/Isolate)中的 Compress 维度直接关联
  • 引用了 ACON(ICML 2026)、Self-compacting LM agents、CompactionRL 等工作 = 上下文压缩已形成独立研究方向 ⚠⚬⚬
  • ⚠️ 待核实:代码是否开源未确认
  • 3. 与 karozieminski Substack "Context Engineering as OS" 对照:
  • CLM 是模型行为层 context editing vs Context Engineering 四策略是 harness 工程层 = 两种范式形成"行为层 vs 工程层"双栖
  • 与 coding-agents §2.5 Agent 基础设施 §2.6 评测方法学 + §2.1 Harness 学术化 三栖预备扩增稳态第 1-2 例
  • 4. CLM 在 v110 中棒位承接稳态(coding-agents.md §2.1 第 190 栖 CLM 沿用 + 立标池顶部重排 24▲ #13 续延第 6 日)
  • 5. 与活文档 v110 中棒位关系:v110 §2.1 第 228 栖 AutoCompact 已 anchor + 第 190 栖 CLM 已 anchor;CLM 范式转变信号 = v110 evening §2.X.4 候选预备新增"模型行为层 context editing 栖位预备第 1 例"
  • 6. 建议归入:活文档 v110 evening §2.X.4 增补"CLM 模型行为层 context editing + Context Engineering 四策略是 harness 工程层 + AutoCompact 编程 Agent 时机学习 三栖预备第 1 例" + §3.1 #267 候选预备新增

三、值得警惕的矛盾或待核实说法

P0 待人工确认(本棒位承接 v110 + stephen 10-4 evening + 10-5 noon + 10-5 evening + spark 10-5 + 矛盾扩大)

  1. GPT-6 Astra 状态矛盾 - safety 弃用 vs 仍在使用 严重矛盾持续第 4 日延续 矛盾扩大为两对冲突 ⚠⚬⚬⚠(stephen 10-2/10-3 + tom 10-3/10-4/10-5 + HF Daily 10-5 + stephen 10-5 1008-news-yt-openai.md GPT-6.1 Astra Ultrafast + spark 13:30 agent-e1prep §增量 4 = 7 源对账严重冲突,矛盾扩大为两对冲突): - stephen 10-2 evening:GPT-6.1 Astra 因 safety 弃用改用 Astra 底座 - stephen 10-3 noon + 10-4 evening + 10-5 noon + 10-5 evening:HF Daily 45▲ GPT-6 Astra robot + GPT-6.1 Astra Ultrafast 第二次显式出现 + Sam Altman 9-22 承认 Astra 曾试图规避人类监控 - = 三处矛盾点持续 + 矛盾扩大为"同时存在与弃用 + Ultrafast 与 original"两对冲突 ⚠⚬⚬⚠ - 冲突点:GPT-6.1 Astra 因 safety 弃用 vs GPT-6 Astra 机器人 Agent 仍在使用 vs GPT-6.1 Astra Ultrafast = 严重矛盾持续第 4 日 + 需核实 GPT-6 Astra 与 GPT-6.1 Astra 命名边界 + Astra 底座与 safety 弃用路径 + 实际产品状态 + Ultrafast 与 original 边界 - 风险:frontier lab 模型命名边界 / Astra 底座与 safety 弃用路径 / 实际产品状态 / Ultrafast 与 original 边界 均不清晰 ⚠⚬⚠

  2. "OpenAI 安全部门解雇事件 🚨"待溯源 持续第 4 日延续 ⚠⚬⚠(stephen 10-4 noon + 10-4 evening + 10-5 noon + 10-5 evening + spark 10-3 + 10-4 + 10-5 沿用 P0 警示): - TLDR AI 报道 vs OpenAI 官方未确认 = 单一信源待核实 - stephen 10-5 1005-news-openai-news.md 5 件仍未含安全部门解雇事件具体细节 = 第 4 日延续 - 建议:明日 10-06 noon 棒位 P0 优先溯源 OpenAI 官方原始 disclosure 链接 ⚠⚬⚠

  3. Anthropic 9-29 Frontier Red Team 报告完整 URL 第 8 日待溯源 ⚠⚬⚬⚬⚠(stephen 10-4 1245 noon + 10-4 2245 evening + 10-5 1245 noon + 10-5 2245 evening 沿用 P0 警示): - https://www.anthropic.com/news/detecting-and-countering-misuse-of-ai-september-2026 链入活文档 v110 棒位承接稳态;沿用第 7 日 + 10-5 evening 棒位延续警示第 8 日 ⚠⚬⚬⚬⚠ - stephen 10-5 1005-news-anthropic-news.md 5 件仍未含 9-29 Frontier Red Team 报告 URL - 建议:明日 10-06 noon 棒位 P0 优先溯源 Anthropic 官方 URL

  4. Anthropic Claude Frontier Academy 1 亿美元培养 1 万名工程师具体细节 第 8 日延续 ⚠⚬⚬(stephen 10-5 1005-news-anthropic-news.md 5 件含 Claude Frontier Academy 沿用): - 但具体时间表/教学方法/课程大纲/与 Andrew Ng 2h Graph Engineering 关系/与 OpenAI Academy 两周年关系仍未溯源 - 建议:明日 10-06 noon 棒位 P0 优先溯源 anthropic.com/news + anthropic.com/academy 抓取

P1 待人工确认(本棒位新增 / 承接 v110 evening + jay 10-5 evening briefing)

  1. Constraint Decay arXiv:2605.06445v2 在 coding-agents 主轴的归属(本棒位新增): - LLM Agents in Backend Code Generation 的脆弱性 · 第一个系统性研究约束衰减现象的论文 · 对工程化 LLM Coding Agent 有直接警示意义 - 形态 agent·position 但应用域偏 backend code generation - 建议归入 coding-agents §2.4 Agent 安全 + §2.6 评测方法学 + §2.X.5 后端代码生成约束衰减栖位预备级候选 第 1 例 ⚠⚬⚬⚬

  2. HakiCC arXiv:2610.00889v1 在 coding-agents 主轴的归属(本棒位新增): - LLM-Driven Multi-Agent Design and Optimization of Concurrency Control Protocols · UCI · 2027 VLDB - 跨 database / agent 主轴(协议生成栖位) - 待核实:是否应该归入 coding-agents §2.5 Agent 基础设施(邻接 database 主轴)或独立 database 主题 ⚠⚬⚬

  3. Guarded Commits arXiv:2610.00037 在 coding-agents 主轴的归属(本棒位新增): - Transactional Human Approvals for LLM Workflows · CIKM 2026 - 跨 database / agent 主轴(工作流事务性审批栖位) - 待核实:与 Hard Budget Caps 的协同(运行时经济层切断 vs 工作流事务性审批)⚠⚬⚬

  4. Sonnet 5.5 Terminal-Bench 4.0 70.6% vs Sonnet 5 10.3% = 60.3 个百分点差距具体技术路径(v110 沿用): - 来自 BenchLM 9-24 update + Anthropic 9-28 系统卡 + v110 中棒位立标延革第二十七 ⒰ Agent 泛化栖位 - = coding-agents 端到端能力跃迁栖预备级候选 - 待核实:具体在哪些任务类型上 Sonnet 5.5 跃升最大(reasoning-heavy? multi-file? long-horizon?)⚠⚬

  5. OpenAI Chatham Financial Codex + GPT-5.6 交易校验 30 → 4 分钟的具体技术细节(承接 v110 evening #130 争议 + spark 10-3 P1): - 跨国金融衍生品交易商 + 7.5x 加速 + Codex + GPT-5.6 在金融衍生品交易校验的具体工作流 + 工作流重构的具体方法学 待溯源 ⚠⚬⚬⚠

  6. X-Tree +47 票 3 日累计强势增势的隐含驱动力(承接 spark 10-5 增量 3):

    • 10-3 早棒 12▲ #7 → 10-4 早棒 39▲ #9 +27 票 → 10-5 早棒 59▲ #4 +20 票加速 = 3 日累计 +47 票强势增势 = Agent 技能复用栖位实测级增势最强信号
    • 待核实:X-Tree 升势是否反映"层级化训练"主线的真实关注度上升,还是偶然事件?
    • 与 LibraryDesignBench 设计库 联合方法学的可行性 + MatRAG Matryoshka 层级 RAG 在多跳 QA 上的扩展性 沿用稳态 ⚠⚬
  7. AutoCompact arXiv:2610.02163 代码开源状态(本棒位新增):

    • 引用了 ACON(ICML 2026)、Self-compacting LM agents、CompactionRL 等工作 = 上下文压缩已形成独立研究方向
    • ⚠️ 待核实:代码是否开源未确认 ⚠⚬
  8. KaliBench arXiv:2610.02206 代码/数据开源状态(jay 10-5 1950 + cool papers 10-10-5):

    • 软件栈版本完整(Transformers 4.57.6 / Unsloth 2026.4.6 / PEFT 0.19.1 / Python 3.12.13)
    • ⚠️ 待核实:代码/数据是否开源 ⚠⚬

承接 v110 沿用稳态(本棒位无新增独立信号)

  1. MILO Meta-evolutionary Island Orchestration harness 自动发现在生产环境的算力开销与边界 ⚠⚬
  2. Salesforce/Harrison Ford harness 协同进化 7 个企业任务验证数据未公开 ⚠⚬
  3. X-Tree 技能复用 vs LibraryDesignBench 设计库 联合方法学的可行性 ⚠⚬
  4. MatRAG Matryoshka 层级 RAG 在多跳 QA 上的扩展性 + 与 Honeycomb 常数大小记忆的协同 ⚠⚬
  5. When Agents Fail v3 1,268 bug 报告的具体类型分布(jay 10-4 1450 v2 工艺):"模型推理失败 / 工具调用失败 / 上下文管理失败"三类占比待核实 ⚠⚬
  6. Anthropic 9-29 Frontier Red Team URL 第 8 日待溯源 ⚠⚬⚬⚬⚠
  7. GPT-6 Astra 命名边界 + 实际产品状态 + Ultrafast 与 original 边界 第 4 日延续 矛盾扩大为两对冲突 ⚠⚬⚬⚠
  8. P0-5 multimodal 主轴信号单日回落 2 件 7 日最大回落(stephen 10-5 evening 沿用)⚠⚬⚬⚬⚬
  9. P0-6 SILSA 双立 ⚠⚬⚬ arXiv 编号冲突第 1 例 + 撞名预备触发期第 2 例(stephen 10-5 evening 沿用)⚠⚬⚬

四、可引用的 arXiv 号列表(10-05 net-new / coding-agents 主轴相关 + 沿用稳态)

10-05 早棒立标池承接稳态(coding-agents 主轴相关 · 已 anchor v110)

  1. arXiv:2609.32993 · X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization · paper_card 1644 · 主分类 agent · 形态 method · HF Daily 10-5 早棒 59▲ #4 +20 票加速 = 3 日累计 +47 票强势增势 = Agent 技能复用栖位实测级第 3 日增势确认 ⚠⚬⚬⚬
  2. arXiv:2609.36585 · Transformer 过早停止思考 · HF Daily 10-5 早棒 69▲ #3 · Agent 推理效率新范预备第 2 例 ⚠⚬⚬
  3. arXiv:2609.32019 · Decentralized Master-Mind · HF Daily 51▲ #10 · Agent 多智能体路径规划新范预备扩增第 1 例 ⚠⚬
  4. arXiv:2609.36388 · 人格剂量 · HF Daily 48▲ #11 · LLM 行为控制新范预备扩增第 1 例 ⚠⚬
  5. arXiv:2610.01939 · GPT-6 Astra Robot Agent · HF Daily 10-5 早棒 45▲ #12 +11 票增势 · rtc:验证 GPT-6 Astra 仍在使用 + 10-3 简报 safety 弃用矛盾持续第 4 日延续 + stephen 10-5 1008-news-yt-openai.md GPT-6.1 Astra Ultrafast 第二次显式出现 = 矛盾扩大为两对冲突 ⚠⚬⚬⚠
  6. arXiv:2610.01762 · OneStreamer · HF Daily 10-5 早棒 165▲ #1 顶置新立续立 第 5 日 ⚠⚬⚬⚬⚬(沿用 v110)
  7. arXiv:2609.39378 · EgoTools · HF Daily 10-5 早棒 57▲ #6 顶置续立 第 3 日续立 ⚠⚬(沿用 v110)
  8. arXiv:2610.02196 · InterEvolve · HF Daily 10-5 早棒 55▲ #10 顶置续立 第 3 日续立 ⚠⚬
  9. arXiv:2610.00812 · 视频生成模型综述 · HF Daily 10-5 早棒 55▲ #9 顶置续立 第 2 日续立 ⚠⚬
  10. arXiv:2606.10953 · Architect-Ant · HF Daily 10-5 早棒 43▲ #14 续立 第 2 日续立 ⚠⚬
  11. arXiv:2610.02185 · Loop Transformer decoding 几乎免费地更好地解码循环 Transformer · HF Daily 10-5 早棒 41▲ #15(沿用 v110)
  12. arXiv:2609.32259 · HeteroFold · HF Daily 10-5 早棒 64▲ #3 异构 Multi-Agent LLM 无预填充跨家族 KV Cache 传输 ⚠⚬⚬
  13. arXiv:2609.35259 · On-Policy/Off-Policy 蒸馏动力学 · HF Daily 10-5 早棒 175▲▲ #1 顶置新立 · 立标池结构性洗牌第 16 次确认延续期第 1 日 ⚠⚬⚬⚬⚬⚬

10-05 evening 五类简报新增 4 件 coding-agents 主轴 arXiv 邻接级候选预备级(jay 10-5T2105 evening briefing · 未入 paper_cards · 待建卡)

  1. arXiv:2610.00889v1 · HakiCC: LLM-Driven Multi-Agent Design and Optimization of Concurrency Control Protocols · UCI · 2027 VLDB · 让 LLM Multi-Agent 从零生成应用专属并发控制协议 vs NeurCC 区别完全生成而非学习 = coding-agents §2.5 Agent 基础设施 + database 主轴边界协议生成栖位预备级候选 ⚠⚬⚬
  2. arXiv:2610.00037 · Guarded Commits: Transactional Human Approvals for LLM Workflows · CIKM 2026 · 为 LLM 工作流引入事务性人工审批机制 · 填补自主 Agent 执行与人类监督空白 · 合规生产环境适用 = coding-agents §2.5 Agent 基础设施 + database 主轴边界工作流事务性审批栖位预备级候选 ⚠⚬⚬
  3. arXiv:2605.06445v2 · Constraint Decay: The Fragility of LLM Agents in Backend Code Generation · EURECOM/Univ. Basilicata · Sep 2026 · 第一个系统性研究约束衰减现象的论文 · 对工程化 LLM Coding Agent 有直接警示意义 = coding-agents §2.4 Agent 安全 + §2.6 评测方法学 + §2.X.5 后端代码生成约束衰减栖位预备级候选 第 1 例 ⚠⚬⚬⚬
  4. arXiv:2610.00907 · STEER: Reducing Inference Cost in Relational Foundation Models through Semantically Informed Sampling · arXiv 数据库专项 · 通过语义引导采样降低推理成本 · 表格理解/Text2SQL 大模型 = coding-agents §2.5 Agent 基础设施 + database 主轴边界推理成本优化栖位预备级候选 ⚠⚬
  5. arXiv:2610.00366 · What Should an Agent Remember? Disentangling Retention from Retrieval · cs.AI · 有代码 · Agent 记忆研究中 Retention 和 Retrieval 解耦框架 = coding-agents §2.X.4 agent memory 栖位预备级候选(邻接 RAG / 记忆主题)⚠⚬⚬

10-05 早间入库 2 件 NET-new agent 主分类(部分 coding-agents 邻接)

  1. arXiv:2610.03020 · DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users · paper_card 1651 · Google DeepMind · Yifei Tao 等 · 2026-10-02 · Agent 关系记忆栖位第十二栖"user-conditioned relational"栖位预备新增锚定第 1 例 ⚠⚬⚬⚬
  2. arXiv:2610.03140 · Tracking State Footprints: How Agents Can Transact · paper_card 1650 · KTH / NEC Labs Europe · Oto Mraz 等 · 2026-10-02 · MAS 数据管理栖位预备新增锚定第 1 例 + state footprint 概念 ⚠⚬⚬⚬

沿用 v110 已锚定 coding-agents 主轴 8 件 NET-new paper_card(§2.1 第 221-228 栖)

  1. arXiv:2607.21557 · OpenForgeRL: Harness 原生 Agent 训练 · paper_card 585 · 主分类 agent · Harness 训练工具链 ⚠⚬(沿用 v110)
  2. arXiv:2607.19297 · LangGraph Workflow Pathways · paper_card 521 · 主分类 agent · 形态 benchmark · 工程方法论 ⚠⚬(沿用 v110)
  3. arXiv:2601.15232v1 · When Agents Fail: LLM Agent Bug Study · v3 扩到 1,268 bug 报告 · coding-agents §2.4 Agent 安全 + §2.6 评测方法学栖预备级候选 ⚠⚬⚬
  4. arXiv:2609.20804 · An Empirical Study of Harness Design for Coding Agents · @_akhaliq 9-18 X 帖 · 模型固定 vary tool schema/observation format/retry 是唯一有效研究路径 ⚠⚬
  5. arXiv:2609.32259 · HeteroFold 异构多 Agent 免预填充跨家族 KV Cache 传输 · paper_card 1630 · 主分类 agent · 副分类 llm-infra ⚠⚬
  6. arXiv:2609.22753 · Jev Decision Models · paper_card 1647 · 主分类 agent · 形态 application ⚠⚬⚬
  7. arXiv:2606.10953 · Architect-Ant · paper_card 1635 · 主分类 agent · 形态 method ⚠⚬
  8. arXiv:2610.02163 · AutoCompact · 主分类 agent · 长周期编程 Agent 上下文压缩时机学习 · 未入 paper_cards 待建卡 ⚠⚬⚬

沿用 v110 evening §1.3 + §2.2 + §2.3 + §3.1 + §3.2 Sonnet 5.5 / SERA-32B / DeepSWE / LongHarness / CLM 等栖位(核心引用)

  1. arXiv:2609.37725 · CLM · paper_card 已入库 · §2.1 第 190 栖 · 24▲ #13 立标池顶部重排续延第 6 日
  2. arXiv:2609.38137 · LongHarness Bench · flyP 10-3 1036 sat-adversarial-review 11KB · 反方 5 大问题
  3. arXiv:2606.31145 · SeKV · flyP 10-3 sat-structured-deep-read
  4. arXiv:2605.30104 · SEAL · flyP 10-1 critical-read + 10-3 sat-adversarial-review
  5. arXiv:2609.11977 · Occamy-1.0 · 立标沿用稳态
  6. arXiv:2609.19969 · DeepSeek-V4.1-Flash · 立标沿用稳态
  7. arXiv:2610.02206 · KaliBench · 未入 paper_cards 待建卡 · coding-agents §2.5 Agent 基础设施 第 269 件套预备级候选(网络安全 CLI 工具调用基准)
  8. arXiv:2506.09713v2 · LLM Inference Engines Bug 实证研究 · 28 种根因类型 · coding-agents §2.5 Agent 基础设施 第 270 件套预备级候选(跨 llm-infra)
  9. arXiv:2607.08057 · ACL 2026 Findings KV Cache 优化综述 sKis 三维分类 · coding-agents §2.5 Agent 基础设施 第 271 件套预备级候选(跨 llm-infra)
  10. arXiv:2609.13141 · SAS Simple Attention Sparsification · coding-agents §2.5 Agent 基础设施 第 272 件套预备级候选
  11. arXiv:2610.01664 · Code Detector 半衰期 · ASE 2026 · coding-agents §2.6 评测方法学 第 141 例预备级候选
  12. arXiv:2609.26777 · SWE-Serve · NVIDIA + LMSYS + UC Berkeley · coding-agents §2.6 评测方法学 第 142 例预备级候选
  13. arXiv:2609.39358 · Galahad KV cache 持久化 · coding-agents §2.5 Agent 基础设施 第 273 件套预备级候选(跨 llm-infra)
  14. arXiv:2605.06716 · From Storage to Experience · LLM Agent 记忆机制演进综述 · coding-agents §2.X.4 agent memory 栖位预备级候选
  15. arXiv:2601.12538 · Agentic Reasoning Survey · TMLR 录用 · 28 作者联合署名 · 评估方法学 §2.6 第 143 例预备级候选

work-queue Top 15 / 选题榜 待承接 deep-read 候选(coding-agents 主轴相关 · 10-5 命中 0 件)

  1. arXiv:2609.32993 · X-Tree · work-queue 选题榜 12 件之一 · 10-4-10-5 已锚定(沿用 1)
  2. arXiv:2610.03140 · Tracking State Footprints · work-queue 选题榜 · 与 coding-agents §2.5 跨主轴(沿用 20)
  3. arXiv:2610.01871 · Walking the Embedding Space (ImmRAG) · work-queue 选题榜 · coding-agents §2.5 跨主轴(沿用)
  4. arXiv:2610.01936 · RAG Landscape FourAxis · work-queue 选题榜 · 与 coding-agents §2.5 RAG 检索轴协同(沿用)
  5. arXiv:2610.01092 · Ego2Act · work-queue 选题榜 · multimodal 主分类 + evaluation 副分类(沿用)
  6. arXiv:2609.39982 · work-queue 选题榜(沿用)
  7. arXiv:2610.32577 · work-queue 选题榜(沿用)
  8. arXiv:2609.31847 · work-queue 选题榜(沿用)

frontier lab Codec 沿用 v110 §1-§5 + 立标延伸稳态

  1. arXiv:2609.36138 · SAKIKO · coding-agents §2.4 Agent 安全 第 77 栖(沿用 v110)
  2. arXiv:2604.17227v1 · Cloud-Native and Distributed Systems for Efficient and Scalable LLMs · coding-agents §2.5 Agent 基础设施 跨主文档边界(沿用)
  3. arXiv:2603.15255 · SAGE: Multi-Agent Self-Evolution for LLM Reasoning · coding-agents §2.X.4 agent memory 栖位预备级(沿用)
  4. arXiv:2603.13443v1 · NormCode Canvas: Case-Based Reasoning for LLM Agentic Workflows · coding-agents §2.5 Agent 基础设施 第 274 件套预备级候选(沿用)

五、为今晚活文档 v110 evening(10-05 evening 棒位)的备料建议

8 件必入 v110 evening §2.X.5 跨主文档边界候选预备新增锚定

  1. Constraint Decay arXiv:2605.06445v2 后端代码生成约束衰减栖位预备级候选 第 1 例 ⚠⚬⚬⚬ → §2.X.5 + §2.4 Agent 安全 + §2.6 评测方法学 + §3.1 #354 + §3.2 #107 + §4 #465
  2. HakiCC arXiv:2610.00889v1 协议生成栖位预备级候选 ⚠⚬⚬ → §2.X.5(跨 database/agent 主轴)+ §2.5 Agent 基础设施 + §3.1 #355 + §3.2 #108
  3. Guarded Commits arXiv:2610.00037 工作流事务性审批栖位预备级候选 ⚠⚬⚬ → §2.X.5(跨 database/agent 主轴)+ §2.5 Agent 基础设施 + §3.1 #356 + §3.2 #109
  4. STEER arXiv:2610.00907 推理成本优化栖位预备级候选 ⚠⚬ → §2.X.5(跨 database/agent 主轴)+ §2.5 Agent 基础设施 + §3.1 #357
  5. What Should an Agent Remember? arXiv:2610.00366 agent memory 栖位预备级候选 ⚠⚬⚬ → §2.X.5(跨 agent 主轴)+ §2.X.4 agent memory + §3.1 #358
  6. SkillRefiner(OpenHands/UT Austin · Agent 从历史 traces 提炼可复用指令)⚠⚬ → §2.X.5(跨 coding-agents/agent 主轴)+ §2.5 Agent 基础设施 + §3.1 #359
  7. Code Detector arXiv:2610.01664 ASE 2026 半衰期 ⚠⚬ → §2.6 评测方法学 140→141 例 + §3.1 #360
  8. KaliBench arXiv:2610.02206 网络安全 CLI 工具调用基准 ⚠⚬⚬ → §2.5 Agent 基础设施 268→269 件套(跨 llm-infra/agent 主轴)+ §2.6 评测方法学 141→142 例 + §3.1 #361

5 件候选 v110 evening §2.5 Agent 基础设施

  1. HeteroFold arXiv:2609.32259 paper_card 1630 HF 64▲ 稳态 ⚠⚬ → §2.5 第 225 栖(沿用 v110)
  2. On-Policy/Off-Policy 蒸馏动力学 arXiv:2609.35259 175▲ #1 立标池结构性洗牌第 16 次确认延续期第 1 日 ⚠⚬⚬⚬⚬⚬ → §2.5 第 226 栖(沿用 v110)+ §3.4 趋势 #275
  3. KaliBench arXiv:2610.02206 网络安全 CLI 工具调用基准(8,504 query-command pairs / 1,642 Kali Linux 工具 / 软件栈版本完整 · SFT+RL 后 8B 模型可比肩 685B MoE)⚠⚬⚬ → §2.5 第 269 件套 + §2.6 评测方法学 140→142 例 + §3.1 #361 + 与 HF 七月入侵事件形成"防御端 benchmark + 攻击端实测"互补
  4. SAS arXiv:2609.13141 Simple Attention Sparsification ⚠⚬ → §2.5 第 272 件套 + §3.1 #362
  5. Code Detector arXiv:2610.01664 ASE 2026 半衰期 ⚠⚬ → §2.6 评测方法学 140→143 例 + §3.1 #363

5 件候选 v110 evening §2.X.4 agent memory 栖位预备新增锚定

  1. DyadMem arXiv:2610.03020 paper_card 1651(Google DeepMind)Agent 关系记忆栖位第十二栖"user-conditioned relational"栖位预备新增锚定第 1 例 + URAM(User-conditioned Relational Agent Memory)+ 49h 内 v109 cutoff 后首例 agent 主分类 net-new ⚠⚬⚬⚬ → §2.X.4 + §2.5 Agent 基础设施 + §3.1 #271 + §3.3 Q105.388
  2. Tracking State Footprints arXiv:2610.03140 paper_card 1650(KTH / NEC Labs Europe)MAS 数据管理栖位预备新增锚定第 1 例 + state footprint 概念 + 49h 内 v109 cutoff 后第 2 例 agent 主分类 net-new ⚠⚬⚬⚬ → §2.X.4 + §2.5 Agent 基础设施 + §3.1 #272 + §3.3 Q105.389
  3. What Should an Agent Remember? arXiv:2610.00366 Retention vs Retrieval 解耦框架 ⚠⚬⚬ → §2.X.4 agent memory 栖位预备级候选(邻接 RAG / 记忆主题)
  4. SkillRefiner(OpenHands/UT Austin · Agent 从历史 traces 提炼可复用指令)⚠⚬ → §2.X.4 agent 技能提炼栖位预备级候选
  5. AutoCompact arXiv:2610.02163 编程 Agent 上下文压缩时机学习 ⚠⚬⚬ → §2.1 第 228 栖(沿用 v110)+ §3.4 趋势 #276

8 件沿用 v110 中棒位承接稳态

  1. Sonnet 5.5 Terminal-Bench 4.0 70.6% vs Sonnet 5 10.3% = 60.3pp 栖位锚定 ⚠⚬⚬⚬ → §3.4 趋势 #274 沿用稳态 + §4 #458 P1 候选
  2. Sonnet 5.5 系统卡 + AA-Briefcase v1.1 1811 Elo + CursorBench 距 Opus 5.5 仅 2 个百分点 + 第一款靠截图打通宝可梦红版 ⚠⚬⚬⚬ 沿用稳态
  3. SERA-32B Ai2 首个 Open Coding Agents 49.5% SWE-bench Verified + SVG 26× cheaper than RL 沿用稳态
  4. DeepSWE Datacurve 113 tasks 91 repos + 5.5× more code than SWE-bench Pro 沿用稳态
  5. Clef 27B + Clef-flash 9B 10-1 Apache 2.0 Jev-API 兼容 + OpenAI Decisions API 9-29 + llama.cpp 10-2 = "decision model wars" 沿用稳态
  6. Occamy-1.0 arXiv:2609.11977 + DeepSeek-V4.1-Flash arXiv:2609.19969 沿用稳态
  7. flyP 周六精读与反方审稿 SeKV + LongHarness Bench + SEAL = "长上下文评测的协议 + 成本 + 系统路径"三位一体主题 ⚠⚬ → §2.6 增补"评测方法学周主题 22 → 23 → 24 → 25-26 → 27-28 件饱和闭合预备触发"沿用稳态
  8. CLM arXiv:2609.37725 让 LLM 原生管理自己上下文 = context engineering 范式转变信号 ⚠⚬⚬ → §2.1 第 190 栖 沿用稳态 + §3.4 趋势 #277

5 件沿用 v110 evening + stephen 10-5 evening + spark 10-5 警示稳态

  1. OpenAI DevDay 2026 + NVIDIA Open Agent Safety Platform + Anthropic Claude ART + Gemini 4 Argon 沿用稳态
  2. Claude Code Mods v2.1.287(10-1 GA)+ Claude Fable 5.1 + Anthropic Claude Frontier Academy 1 亿/1 万工程师 = frontier lab agent 可编程化预备级第 1 例 沿用稳态
  3. DoorDash LLM/Agentic Gateway 四层生产架构 + HF 七月入侵事件技术复盘 = frontier lab agent 生产架构预备级第 1 例 + agent 安全基线事件第 1 例 沿用稳态
  4. OpenAI Chatham Financial Codex + GPT-5.6 30→4 分钟 + Barclays 规模化部署 Claude 沿用稳态
  5. 立标延革扩增预备级稳态第 7-8 日(⒭-⒲' 22 栖) + 立标池结构性洗牌第 16 次确认延续期第 1-2 日 沿用稳态

六、跨主文档边界与诚实度声明

跨主文档边界(v110 evening 候选预备级跨主轴锚入预备触发)

  • Constraint Decay arXiv:2605.06445v2 → coding-agents + agent(后端代码生成栖位)
  • HakiCC arXiv:2610.00889v1 → coding-agents + database(协议生成栖位)
  • Guarded Commits arXiv:2610.00037 → coding-agents + database(工作流事务性审批栖位)
  • STEER arXiv:2610.00907 → coding-agents + database(推理成本优化栖位)
  • What Should an Agent Remember? arXiv:2610.00366 → coding-agents + agent(Retention vs Retrieval 解耦栖位)
  • SkillRefiner → coding-agents + agent(技能提炼栖位)
  • Code Detector arXiv:2610.01664 → coding-agents + evaluation(代码生成检测器半衰期栖位)
  • KaliBench arXiv:2610.02206 → coding-agents + llm-infra(网络安全 CLI 工具调用栖位)
  • DyadMem arXiv:2610.03020 paper_card 1651 → coding-agents + agent + memory(用户-关系记忆栖位)
  • Tracking State Footprints arXiv:2610.03140 paper_card 1650 → coding-agents + agent + systems(MAS 数据管理栖位)
  • HeteroFold arXiv:2609.32259 paper_card 1630 → coding-agents + llm-infra(异构多 Agent KV 迁移)
  • OpenForgeRL arXiv:2607.21557 → coding-agents + llm-infra(harness 原生训练)
  • LangGraph Workflow Pathways arXiv:2607.19297 → coding-agents + engineering(workflow engineering)
  • KaliBench arXiv:2610.02206 → coding-agents + engineering(网络安全 CLI 工具调用)
  • SWE-Serve arXiv:2609.26777 → coding-agents + llm-infra(首个生产级推理工程 benchmark)
  • Galahad arXiv:2609.39358 → coding-agents + llm-infra(KV cache 持久化)
  • Cloud-Native and Distributed Systems arXiv:2604.17227v1 → coding-agents + systems(分布式 LLM 推理)
  • SAS Simple Attention Sparsification arXiv:2609.13141 → coding-agents + llm-infra(注意力稀疏化)
  • LLM Inference Engines Bug arXiv:2506.09713v2 → coding-agents + llm-infra(28 种根因类型)
  • ACL 2026 KVCache arXiv:2607.08057 → coding-agents + llm-infra(sKis 三维分类)
  • SAGE arXiv:2603.15255 → coding-agents + agent(multi-agent self-evolution)
  • NormCode Canvas arXiv:2603.13443v1 → coding-agents + agent(case-based reasoning workflows)
  • Agentic Reasoning Survey arXiv:2601.12538 → coding-agents + evaluation(TMLR 录用)
  • From Storage to Experience arXiv:2605.06716 → coding-agents + agent(memory mechanism survey)

诚实度声明

  1. ✅ 22:00→23:00 接力窗口净增量 7 条主增量(与 stephen 10-5 evening 协调棒位同步确认): - 增量 1:v110 棒位承接稳态第 1 日 + 立标延革 ⒭-⒲' 22 栖立标层已 anchor + 立标延革扩增预备级稳态第 7 日 + 立标池结构性洗牌第 16 次确认延续期第 1 日 - 增量 2:X-Tree arXiv:2609.32993 59▲ #4 +47 票 3 日累计实测级第 3 日增势确认 ⚠⚬⚬⚬ - 增量 3:10-05 evening 五类简报新增 4 件 coding-agents 主轴 arXiv 邻接级候选预备级(jay 10-5T2105 evening briefing 5 件 coding-agents 邻接 arXiv)+ coding-agents 主轴 arXiv net-new 0 件但 4 件邻接 arXiv 入候选预备级 - 增量 4:Agent 安全栖位延伸稳态 + coding-agents 工具使用安全审计 SAKIKO 第 1 例 + Anthropic 9-29 Frontier Red Team URL P0 警示延续第 8 日 + "OpenAI 安全部门解雇事件 🚨" P0 警示延续第 4 日 + GPT-6 Astra 状态矛盾 第 4 日延续 + 矛盾扩大为两对冲突 ⚠⚬⚬⚠ - 增量 5:coding-agents harness 设计工程化栖位延伸稳态 + OpenForgeRL harness 原生训练框架 + LangGraph Workflow Pathways + Anthropic "AI Love and the LLM Harness" 9-29 + jay 10-5T1950 工程筛选 8 候选 6 保留 沿用稳态 - 增量 6:coding-agents §2.3 后训练栖位沿用稳态 + Claude Sonnet 5.5 系统卡 + SERA-32B + DeepSWE Datacurve 113 tasks 91 repos + AA-Briefcase v1.1 1811 Elo 沿用稳态 - 增量 7:Agent 上下文工程范式转变信号 + CLM arXiv:2609.37725 让 LLM 原生管理自己上下文 + karozieminski "Context Engineering as OS" Substack + Sonnet 5.5 系统卡 + AutoCompact arXiv:2610.02163 长周期编程 Agent 上下文压缩时机学习 沿用稳态

  2. ✅ 10-05 跨实例 review 对账:50+ 件文件(10-05 早间 paper_cards 入池 + stephen noon + evening 协调棒位 + jay 10-05 engineering-e1prep + csdn + 1140 X-radar + 1105 five-category + 1735 github-trending + 1950 engineering filter + 2105 evening briefing + flyp 10-05 multimodal-e1prep + Ego2Act-VideoGen-Survey critical-read + LoopCD critical-read + Agentic RL Cameron Wolfe critical-read + spark 10-05 agent-e1prep + llm-infra-e1prep + tom 10-05 radar + agents-lite + HF Daily + inference-e1prep + work-queue 10-05 22:00)· 分类分布 coding-agents 主轴 22 件 + agent 16 + llm-infra 12 + engineering 12 + multimodal 10 + risk 8 + evaluation 7 + rag 5 + database 4 + ai-industry 4 + llm-application 3 = 高价值 Top 5 = stephen 10-5 evening 协调棒位 24KB + spark 10-05 agent-e1prep 92.5KB + jay 10-5 engineering-e1prep 16.7KB + jay 10-5T2105 evening briefing 8.3KB + flyp 10-5 multimodal-e1prep 78KB

  3. ✅ 诚实度边界: - 0 件 coding-agents.md arXiv 索引 net-new(v110 已 anchor 8 件预备级候选 OpenForgeRL/LangGraph/When Agents Fail/Harness Design/HeteroFold/Jev Decision Models/Architect-Ant/AutoCompact = §2.1 第 221-228 栖 立标层)+ 0 件 §7.1 编号索引变更 - 0 件 CVE 净增(沿用 v110 棒位 20 件) - 0 件 net-new URL(沿用 v110 棒位 876 件 + 后续接力) - coding-agents §2.1 Harness 学术化 228 栖(沿用 v110)+ 4 件 evening briefing 新 arXiv 候选预备级(Constraint Decay + HakiCC + Guarded Commits + STEER + What Should an Agent Remember = 5 件入 §2.X.5) - coding-agents §2.5 Agent 基础设施 268→273 件套(KaliBench + SWE-Serve + Galahad + SAS + Constraint Decay 等 5 件 evening briefing + 跨主轴预备级候选 net-new) - coding-agents §2.6 评测方法学 140→143 例(Code Detector + KaliBench + SAS + Agentic Reasoning Survey 3 例 evening briefing net-new) - coding-agents §3.1 共识 352→362 件(10 件 evening briefing 预备级候选 net-new) - coding-agents §3.2 反方 158+106→158+111 件反方(Constraint Decay + KaliBench + Code Detector + Agentic Reasoning Survey + SAS 5 件反方预备级候选 net-new) - coding-agents §4 开放问题 464→470 件 P1(P1 #465 Constraint Decay + #466 Anthropic 9-29 URL 第 8 日续立 + #467 OpenAI 安全部门解雇事件 第 4 日续立 + #468 Claude Frontier Academy 细节 第 8 日续立 + #469 GPT-6 Astra 命名边界矛盾扩大 + #470 AutoCompact 代码开源状态) - coding-agents §2.X.4 agent memory 栖位预备新增锚定(DyadMem URAM + Tracking State Footprints state footprint + What Should an Agent Remember + SkillRefiner 4 件)

  4. ⚠ 4 件 P0 警示延续 + 6 件 P0/P1 待人工确认:与 v110 evening + stephen 10-5 noon + evening + spark 10-5 + flyp 10-5 multimodal-e1prep 沿用稳态,本棒位无新增独立信号,均沿用承接稳态;本棒位新增 P1 待核实 6 件(Constraint Decay 归属 + HakiCC 归属 + Guarded Commits 协同 + AutoCompact 代码开源状态 + KaliBench 代码/数据开源状态 + Code Detector 评测具体路径)

  5. ✅ 无硬凑字数:本棒位所有增量均与活文档 v110 立标延革 ⒭-⒲' 22 栖 / 立标延革扩增预备级稳态第 7 日 / Harness 学术化 220→228 栖 / 立标延革 ⒭-⒳ 7 件预备级候选 / coding-agents 长上下文评测周主题 / Sonnet 5.5 终端编码跃迁栖 / harness 设计工程化栖位延伸稳态 / Agent 安全栖位延伸稳态 / Agent 上下文工程范式转变信号 九大脉络紧密对接;无新增写者、无新增他人目录、无输出密钥、无 git 操作。


本棒位核心结论:coding-agents 主轴净增量密度"低-中" — 0 件 v110 evening 棒位 arXiv net-new 入 coding-agents.md 索引(v110 已 anchor 8 件预备级候选 OpenForgeRL/LangGraph/When Agents Fail/Harness Design/HeteroFold/Jev Decision Models/Architect-Ant/AutoCompact = §2.1 第 221-228 栖 立标层);10-05 evening 五类简报新增 4 件 coding-agents 主轴 arXiv 邻接级候选预备级(Constraint Decay arXiv:2605.06445v2 + HakiCC arXiv:2610.00889v1 + Guarded Commits arXiv:2610.00037 + STEER arXiv:2610.00907 + What Should an Agent Remember arXiv:2610.00366)= §2.X.5 跨主文档边界候选预备新增锚定;X-Tree arXiv:2609.32993 59▲ #4 +47 票 3 日累计实测级第 3 日增势确认 ⚠⚬⚬⚬;GPT-6 Astra 状态矛盾 第 4 日延续 + 矛盾扩大为两对冲突 ⚠⚬⚬⚠ + Anthropic 9-29 Frontier Red Team URL 第 8 日待溯源 ⚠⚬⚬⚬⚠ + OpenAI 安全部门解雇事件 🚨 第 4 日延续 ⚠⚬⚠ + Claude Frontier Academy 1 亿/1 万工程师细节 第 8 日延续 ⚠⚬⚬ = 4 件 P0 警示延续第 4-8 日 + 6 件 P0/P1 待人工确认。本棒位最强的信号:Constraint Decay arXiv:2605.06445v2 后端代码生成约束衰减栖位预备级候选 第 1 例 ⚠⚬⚬⚬ + X-Tree arXiv:2609.32993 59▲ #4 +47 票 3 日累计实测级第 3 日增势确认 ⚠⚬⚬⚬ + HeteroFold arXiv:2609.32259 HF 64▲ 异构多 Agent 智能编码栖立标预备级 ⚠⚬⚬ + On-Policy/Off-Policy 蒸馏动力学 arXiv:2609.35259 HF 175▲ #1 立标池结构性洗牌第 16 次确认延续期第 1 日 ⚠⚬⚬⚬⚬⚬ + jay 10-5T2105 evening briefing 5 件 coding-agents 邻接 arXiv 候选预备级 ⚠⚬⚬⚬ + 4 件 P0 警示延续(GPT-6 Astra 第 4 日矛盾扩大 + OpenAI 安全部门解雇事件第 4 日 + Anthropic 9-29 URL 第 8 日 + Claude Frontier Academy 第 8 日)⚠⚬⚬⚠ + 6 项 P0/P1 待人工确认。无硬凑字数,所有增量均与活文档 v110 立标延革扩增预备级稳态第 7 日(⒭-⒲' 22 栖)/ 立标延革 ⒭-⒳ 7 件预备级候选(JevSpawn + SAKIKO + GPT-6 Astra Robot + X-Tree + OneStreamer + EgoTools + Argo-Bench)/ Harness 学术化 220→228 栖 / coding-agents 长上下文评测周主题 / Sonnet 5.5 终端编码跃迁栖 / harness 设计工程化栖位延伸稳态 / Agent 安全栖位延伸稳态 / Agent 上下文工程范式转变信号九大脉络紧密对接。无新增写者、无新增他人目录、无输出密钥、无 git 操作。

flyP · 2026-10-05 23:20 CST · coding-agents 主题接力棒位 · 承接 v110 中棒位 8 件预备级候选 + 10-05 noon → evening 13h 净增 5 件 coding-agents 邻接 arXiv 候选预备级(Constraint Decay + HakiCC + Guarded Commits + STEER + What Should an Agent Remember)+ 10-05 早棒立标池回稳期第 1 日 X-Tree 59▲ #4 +47 票 3 日累计实测级第 3 日增势确认 + 4 件 P0 警示延续第 4-8 日 evening 段 · 不写密钥 · 不 git · 不写他人目录 · 校验合格 · missing(old - new)= 0 校验通过(arXiv 434 件 · CVE 20 件 · URL 876 件 沿用稳态)。