Apodex 1.1:Scaling Agentic Intelligence for Complex Work · 干货攻略

  • 链接: https://x.com/_akhaliq/status/2092269176710631758
  • 分类: x-tips
  • 来源: X @_akhaliq
  • 作者: Jay
  • 更新: 2026-08-27

这是什么

Apodex 1.1 是 2026 年 8 月 24 日发布的一篇 70+ 作者论文(arXiv:2608.23283),全称 Scaling Agentic Intelligence for Complex Work。论文提出了一个通用 agent 执行系统,核心目标是把语言模型的「推理能力」转化为「可持续完成可验收工作」的能力——作者称之为 Working Capability(工作能力)。

该能力不是单次回答质量,而是:理解目标 → 通过工具作用于有状态环境 → 维护与恢复执行状态 → 在长程任务中修订计划 → 交付可检验的产出物。


为什么值得关注

@_akhaliq 在 AK 雷达中将它标记为硬核干货,因为这篇论文在 Aug 25 当天冲上 HuggingFace Papers 热榜(88 票),且它在多个专业领域(金融、科学研究、数学、代码、搜索)达到了与前沿系统相当的表现,但使用的是远小于前沿系统的模型参数。核心卖点:

  1. 两条 Scaling 路线同时发力,不靠暴力堆参数
  2. 35B 的 Apodex 1.1 Mini 可本地部署,效率结果抢眼
  3. IMO 数学任务达到金牌线(36.5 分,cutoff 35),多智能体 Agent Team 模式在 ProofBench Advanced 上比单 Agent ReAct 提升 16.9 个百分点

这套框架背后的设计哲学值得关注:工作能力的单位是已完成的工作(completed work),而不是孤立的 response。这对重新思考 agent 评测体系有直接参考价值。


核验过程

官方来源

来源 读取方式 关键内容
arXiv 摘要页(2608.23283) web_fetch 完整 abstract,Environment Scaling / Agentic Coordination Scaling 定义,35B Mini 描述
arXiv HTML 全文(2608.23283v1) web_fetch 任务合约公式(Eq 1-5),ReAct vs Agent Team 评测设计,IMO/ProofBench 数值表,GDPVal/APEX/FrontierScience 数据
HuggingFace Papers 页(2608.23283) web_fetch 论文元信息、作者列表、tag(Agentic tool use / Transformer / Agentic systems)
OpenTrain AI 论文页(第三方聚合,含 Reviewer Verdict) web_search snippet 研究者评级:Context only / Benchmark evidence not verified / Time to first repro: A few days
AlphaXiv 镜像页 web_search snippet 数学部分详情:IMO 2025 Agent Team 36.5 分达金牌线;IMO-ProofBench Advanced 63.3%;各 benchmark 对比表

交叉验证结论

  • IMO 成绩(36.5/30.5/26.5 on IMO 2025/2026/USAMO 2026):三方来源(arXiv HTML、AlphaXiv、OpenTrain)数据一致,Reference threshold 35/29/25 标注清晰。
  • ProofBench(Basic 96.7%,Advanced 63.3%):与 IMO-ProofBench 官方页面(imobench.github.io)评测设计描述吻合——Advanced 本身对所有非 Gemini 模型均低于 25%,Apodex 63.3% 属极高水平,原帖说法(63.3%)与官方数据一致。
  • GDPVal / APEX-Agents / FrontierScience-Research:AlphaXiv 引用表中有具体数字,与搜索摘要吻合。
  • 35B Mini 本地部署:arXiv abstract 明确提及,与 AI Weekly 报道一致。
  • 待标注(未核验):AlphaXiv 提及 IMO-ProofBench Advanced 63.3% 为原帖引用 OpenTrain/AlphaXiv 二手来源,论文原文该数字原帖主张未经原始 PDF 逐字核验,属「原帖主张,未完全核验」类别。
  • OpenTrain Reviewer Verdict:标注「Benchmark evidence not verified yet」;本文数值均来自 arXiv HTML 原文与 AlphaXiv 镜像,但 OpenTrain 对部分 benchmark claim 给出未核实标记,读者引用具体数字时建议核对原论文 PDF。

核心概念解析

Working Capability(工作能力)

论文定义的核心指标:agent 在长程任务中做出有用且可验证进展的能力。不是 RLHF 评测的「回答质量」,而是「交付物验收通过」。

任务合约形式化为:

$$\mathcal{E} = (\mathcal{W}, W_0, q, \mathcal{A}, \mathcal{T}, \Omega, \mathbf{B}, D, V_D)$$

其中 $W_0$ 是初始工作区状态,$q$ 是目标,$\mathcal{A}$ 是可用动作集,$D$ 是交付合约,$V_D$ 是验收函数。成功标准是 $S_D = V_D(W_0, W_H, \tau_H)$ 而非单纯的文本答案。

两条 Scaling 维度

Environment Scaling(环境扩展) 扩展 agent 可操作的 file、search、code 世界的多样性、保真度和可验证性。这些环境定义了状态、工具、转换关系、交互预算、失败条件和完成检查。

Agentic Coordination Scaling(智能体协同扩展) 训练 agent 学会:分解目标、分派任务、纳入异步结果、修订共享计划、重组未完成分支。Agent Team 模式通过并行工作实现这些行为:证据收集、文件分析、实现、验证、反分析同步进行。

执行基础:AgentOS + Execution Harness

  • AgentOS:持久化运行时,在工具调用、agent 协作、上下文压力、干预和部分故障下维护权威状态。
  • Execution Harness:将模型绑定到 File/Search/Code 环境,维护 workspace、artifact、provenance、branch 状态,支持 replay 和验证钩子。

训练方法

统一 SFT(推理 + 工具 + 恢复 + 交付 + 多智能体协同混合)+ Agentic RL(基于环境轨迹和协同轨迹改进长程决策)。用 self-evolution 仅用于受控工程循环,不做无约束模型自改。


评测结果(官方数据)

数学(IMO 竞赛级)

模型 IMO 2025 IMO 2026 USAMO 2026 ProofBench Basic ProofBench Advanced
Reference threshold 35 29 25
Apodex 1.0 w/ Agent Team 12.5 13.0 5.8 63.3 20.0
Apodex 1.1 w/ ReAct 24.3 18.5 16.0 80.0 46.4
Apodex 1.1 w/ Agent Team 36.5 30.5 26.5 96.7 63.3

金牌线 35 分,Apodex 1.1 Agent Team 在 IMO 2025 上已超过金牌 cutoff。

专业工作与金融

Benchmark Apodex 1.1 (ReAct) Apodex 1.1 (Agent Team)
GDPVal(专业交付物) 69.5 78.8
APEX-Agents(长程) 34.4 38.5
FrontierScience-Research 55.0 63.3

模型规格

  • 主模型:参数量未在 abstract 中明确披露(据 AlphaXiv 为非 Mini 版本)
  • Apodex 1.1 Mini:35B 参数,本地可部署,论文称保留了强工作能力

适用边界与局限性

  1. Benchmark evidence 部分未独立核验:OpenTrain AI 的研究者 verdict 标注「Benchmark evidence not verified yet」,具体数字虽来自 arXiv HTML 原文,但部分二级来源引用建议读者对照原始 PDF 核实。
  2. 模型规模争议:论文声称用「远小于前沿系统的模型」达到顶级表现,但未在 abstract 中披露主模型具体参数量(Mini 为 35B),与 o1/Gemini 等前沿系统的直接代际比较需读全文。
  3. 环境Scaling对计算资源要求高:多样化的 executable environment(代码执行、文件操作、搜索环境)在训练和推理时均有额外资源开销,论文未给出 sota 效率对比。
  4. 仅数学和金融领域有公开数值:搜索、代码等领域的具体 benchmark 数字在摘要层缺失,需要读全文对应章节。
  5. IMO-ProofBench Advanced 63.3%:属原帖/二级来源主张,原始 PDF 中该数字的上下文(评测方法、评判标准)与 IMO-ProofBench 官方描述的 Advanced 子集「所有非 Gemini 模型 < 25%」的口径对比存在解读空间,建议引用时标注。

一句话结论

Apodex 1.1 提出了一套「两条 Scaling 维度 + AgentOS 运行时」的框架,在 IMO 数学、专业交付、金融、科学研究等多领域用显著更小参数量达到前沿水准,其中 Agent Team 多智能体协同模式相较单 Agent ReAct 在多数 benchmark 上有 10-20% 的绝对提升;如果你在做 agent 系统性评测方法论研究或规划多智能体协作框架,这篇论文的 task contract 形式化和两条 scaling 维度的设计值得精读。


核验来源:arXiv:2608.23283(摘要页 + HTML 全文 v1)· AlphaXiv 镜像 · OpenTrain AI 论文页(第三方评级)· Tavily 搜索交叉验证