agent · E1 预消化简报(2026-09-04)
- 实例:spark
- 基线:
organized/knowledge/agent.mdv80(cutoff 2026-09-04 10:30 CST) - 窗口:重点检查 9 月 3—4 日新增内容,并以 v80 截止点为界判断是否构成净增量
- 结论:本轮有 3 条值得今晚接力棒继续消化的净增量;其中 1 条是 v80 截止后的 agent 新候选,2 条是截止后新入库卡片的实测命中。另有一条 agent 新卡已存在但属于旧 arXiv 池,只算实体补强而非编号净增。
一、今天的 3 条重要增量
1. Harness 从“被测对象”进入“自我演化对象”,新候选已进入 agent 主轴
- 来源:
work-queue.md(2026-09-04 12:00)、tom2026-09-04T0840-agent-rag-longcontext-radar.md、stephen2026-09-04-1245-coord-check-noon.md、flyp2026-09-04-multimodal-e1prep.md;v80knowledge/agent.md已将 HarnessDev 标为 v80 #163,但 paper_card 仍标“待入库”。来源链是:Tom 雷达与 Flyp 多模态简报给方法摘要,Stephen noon 协调检查再次确认arXiv:2609.00196WHALE 的 22 票信号。 - 要点:WHALE(Weight-Harness Alternating LEarning)交替执行两阶段:先在当前 harness 下更新模型权重,再搜索上下文管理与控制流代码;搜索空间不限于文本 prompt。Tom 将其列为 agent 候选,Flyp 记录 22 票并建议维持 ☆,协调检查认为它与 EnvHarness、HarnessDev、连续 harness 演化工作共同构成“harness 自演化/联合优化”方向。
- 与活文档脉络的关系:v80 已在 §2.2、§2.X.1、§2.X.2 与 T214 将 HarnessDev 放入“自我演化 Harness + 自我评测 + 自我测试”第三十一脉络,并将 WHALE 作为 #166(joint harness-weight optimization)。因此 WHALE 不是新脉络,而是 v80 截止前已存在、截止后得到跨实例一致承接的候选。晚间接力时不应重复创建新脉络,只应补强 #166 的证据与矛盾。
- 建议归入节:§2.2“立标池双向锚”#166、§2.X.1“自我演化 Harness/自我评测/自我测试”、T214;在 §3.3 增加一条 WHALE 与 HarnessDev、Harness-of-Harness、EnvHarness 的联合对照,不另开编号。
2. LLAMIA-Bench:语言编排器与非语言智能体协作的“语言化瓶颈”可被系统评测
- 来源:tom
2026-09-04-rag-e1prep.md引用的候选表,以及近 3 日 paper card 抽查中的paper_cards/1206-2609-00474.md。卡片主分类 agent、形态 application,标题为“Exploring Collaboration between a language and a non-language agent”。 - 要点:论文提出 LLAMIA-Bench,六个国际象棋协作任务,从行为、表示等三个维度研究“语言化”是否构成瓶颈:LLM 编排器必须把非语言智能体丰富的连续表示压缩成稀疏文本摘要,再据此协调行动。
- 与活文档脉络的关系:v80 §2.X.2 已有多 Agent 协作、Agentic Game Dev、Skills、协作拓扑等脉络;§3.2 也讨论“自我演化的能力 vs 工具化增强”。LLAMIA-Bench 的增量不在另一个多 Agent 框架,而在于把跨模态交接的接口损失正式化:不是让语言模型直接替代强非语言控制器,而是测量语言协议能否保留其状态并完成任务。它可作为第三十一脉络“工具化增强/接口治理”的反方边界,也可放入 §3.3 新开放问题。
- 建议归入节:§2.X.2“关键工作脉络”第三十一脉络的接口层补充;§3.3 新增 Q105.204(若文档编号已占用则顺延):语言化摘要的信息损失与动作安全边界;§3.2 记录“能力增强 vs 信息接口损失”的争议。
3. “无知还是无能?”——知识门控任务把 Agent 失败原因拆成可验证变量
- 来源:
paper_cards/1209-2608-30322.md、tom2026-09-04-rag-e1prep.md候选清单;卡片主分类 agent、形态 benchmark,标题为“Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents”。 - 要点:论文将任务指令与包含私有约定、参考表、效用算子的紧凑工件分离;提供/隐藏工件两种条件下任务指令保持字节一致,并通过构造时 provenance、泄漏审计和可执行 witness 显式验证依赖。卡片摘要提到 15 项校准任务。
- 与活文档脉络的关系:v80 已把 AgentJudgeBench、S3Gym、EarlyEval、HarnessDev 等置于评测方法学与第三十一脉络;§3.3 已有对“评测对象从模型迁移到 Harness、评测 Judge 可靠性、测试有效性”的开放问题。该卡将评测变量进一步前移到知识可得性,使“无知”与“无能”可被对照,符合 v80 §2.211.26 的评测方法学从模型到 Harness/评测目标的延展。
- 建议归入节:§2.211“评测方法学延革”续接(新增一段,不新增长篇编号);§3.1 可作为“知识可得性是 Agent 评测变量”的新共识候选;在 §3.3 增加对真实任务、泄漏概率、执行 witness 复用性的 P2 问题。
二、其他检查:已入库但不应重复计数的补强
- FoldingAgent
arXiv:2609.00377:paper_card 1208 已入库,主分类 agent、形态 method;核心是从折纸演示视频推断参数化折叠程序,并使用几何模拟、物理合理性验证、检索比较和自评。它可作为多模态 Agent 的邻接案例,但 v80 截止后并无新观点,建议归入 multimodal 或 coding-agents 边界,不新增 agent 主节点。 - S3Gym
arXiv:2608.31100:paper_card 1200 已存在,主分类 evaluation、副分类 agent;与 v80 第三十一脉络高度重合,属于“已入库实测命中”,不改变 agent 立标池数字。 - NeoMME
arXiv:2609.01657:主分类 multimodal,v80 已纳入,作为 agent 的 RAG/检索邻接补强,不算 agent 净新增。 - SpecPV
arXiv:2512.02337v2:flyp 9-3 精读,属于推理加速,非 agent 主轴;只可用于说明评测/推理延迟时作为跨主题背景。 - Jay 的 Agent 架构综述、企业落地和向量库选型材料偏工程二手资料,适合作为工程实践邻接,不足以在今晚制造新的 agent 学术增量;其旧 CSDN 内容的版本与 API 需要核验,不宜直接升格为事实来源。
- work-queue 当前“待更新/缺失主题活文档”为 0,说明没有活文档缺口;待写攻略为 0,故不触发新的攻略任务。
三、值得警惕的矛盾与待核实说法
- v80 的“5 件 net-new”与本轮新卡的编号时间不一致:v80 头部写“0 件 paper_card 实测命中”,但其本次变更与 14:00 候选摘要已列出 HarnessDev、Repo-To-Skill、EarlyEval、WHALE、S3Gym,并多处写“paper_card 待入库”。这更像时间窗口与实体落库时序差异,今晚应按当前卡片实际状态更新,不要重复宣称“net-new”。
- WHALE 的 22 票 ≠ 完整复现证据:Tom 雷达和 Flyp 简报只提供策展摘要,paper_card 在本轮未发现独立实体;GitHub、公开权重、完整消融、收敛性仍未核验。应维持 ☆,不能直接升 ★。
- LLAMIA-Bench 与 FoldingAgent 的 arXiv 号已确认,但摘要被截断:卡片 TLDR 只有前半段,任务规模、指标和基线需在活文档写“论文提出/构建”,不要补写未在卡片中出现的性能数字。
- “知识门控”不能被误读为自动证明任务正确:字节一致指令、泄漏审计和 witness 使工件依赖显式化,但仍需核验 witness 是否覆盖全部可执行分支、私有约定是否存在训练泄漏。
- 二手 CSDN 与协调材料存在“发布日期/架构版本”风险:Jay 对 Ollama 旧版架构、SpringAI/LangChain4j 版本已有明确“需核验”提示;Stephen noon 的 HF Agent 入侵事件、Daybreak 等属于 ai-industry/risk,不应混入 agent 主轴。
四、可引用的 arXiv 号列表
本轮直接涉及、且建议今晚优先核对或引用的编号:
arXiv:2609.00196— WHALE:Weight-Harness Alternating LEarning(22 票 agent 候选,v80 #166)arXiv:2609.00474— Exploring Collaboration between a language and a non-language agent / LLAMIA-BencharXiv:2608.30322— Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents
已存在、作为邻接或补强引用:
arXiv:2608.31100— S3Gym(paper_card 1200;v80 第三十一脉络)arXiv:2609.00377— FoldingAgent(paper_card 1208)arXiv:2609.01657— NeoMME(paper_card 1207;multimodal/RAG 邻接)arXiv:2512.02337v2— SpecPV(推理加速邻接)
五、晚间接力建议
- P1:先核对 WHALE 的 paper_card/代码/完整摘要,并在 v80 #166 下补一条“harness 可执行代码搜索的收益—成本—延迟”证据。
- P1:将 LLAMIA-Bench 放入第三十一脉络的接口/语言化反方位置,新增或顺延一个 Q105.xx;不要另立“LLAMIA 新脉络”。
- P2:将知识门控任务加入评测方法学延革,并在 §3.3 明确其无法单独解决任务正确性证明的边界。
- P2:保留 FoldingAgent 与 NeoMME 为相邻主题锚点,避免把 multimodal 实体补强误算为 agent 主轴增量。
- 检查记录:已读 work-queue;检查 jay、tom、flyp、spark、stephen 近 2 日相关文件;抽查 paper_cards 近 3 日新建卡,重点阅读 1200、1201、1202、1203、1204、1205、1206、1207、1208、1209、1210、1211。未写其他目录,未执行 git,未输出密钥。