Apodex 1.1:Scaling Agentic Intelligence for Complex Work · 干货攻略
- 链接: https://x.com/_akhaliq/status/2092269176710631758
- 分类: x-tips
- 来源: X @_akhaliq
- 作者: Jay
- 更新: 2026-08-27
这是什么
Apodex 1.1 是 2026 年 8 月 24 日发布的一篇 70+ 作者论文(arXiv:2608.23283),全称 Scaling Agentic Intelligence for Complex Work。论文提出了一个通用 agent 执行系统,核心目标是把语言模型的「推理能力」转化为「可持续完成可验收工作」的能力——作者称之为 Working Capability(工作能力)。
该能力不是单次回答质量,而是:理解目标 → 通过工具作用于有状态环境 → 维护与恢复执行状态 → 在长程任务中修订计划 → 交付可检验的产出物。
为什么值得关注
@_akhaliq 在 AK 雷达中将它标记为硬核干货,因为这篇论文在 Aug 25 当天冲上 HuggingFace Papers 热榜(88 票),且它在多个专业领域(金融、科学研究、数学、代码、搜索)达到了与前沿系统相当的表现,但使用的是远小于前沿系统的模型参数。核心卖点:
- 两条 Scaling 路线同时发力,不靠暴力堆参数
- 35B 的 Apodex 1.1 Mini 可本地部署,效率结果抢眼
- IMO 数学任务达到金牌线(36.5 分,cutoff 35),多智能体 Agent Team 模式在 ProofBench Advanced 上比单 Agent ReAct 提升 16.9 个百分点
这套框架背后的设计哲学值得关注:工作能力的单位是已完成的工作(completed work),而不是孤立的 response。这对重新思考 agent 评测体系有直接参考价值。
核验过程
官方来源
| 来源 | 读取方式 | 关键内容 |
|---|---|---|
| arXiv 摘要页(2608.23283) | web_fetch | 完整 abstract,Environment Scaling / Agentic Coordination Scaling 定义,35B Mini 描述 |
| arXiv HTML 全文(2608.23283v1) | web_fetch | 任务合约公式(Eq 1-5),ReAct vs Agent Team 评测设计,IMO/ProofBench 数值表,GDPVal/APEX/FrontierScience 数据 |
| HuggingFace Papers 页(2608.23283) | web_fetch | 论文元信息、作者列表、tag(Agentic tool use / Transformer / Agentic systems) |
| OpenTrain AI 论文页(第三方聚合,含 Reviewer Verdict) | web_search snippet | 研究者评级:Context only / Benchmark evidence not verified / Time to first repro: A few days |
| AlphaXiv 镜像页 | web_search snippet | 数学部分详情:IMO 2025 Agent Team 36.5 分达金牌线;IMO-ProofBench Advanced 63.3%;各 benchmark 对比表 |
交叉验证结论
- IMO 成绩(36.5/30.5/26.5 on IMO 2025/2026/USAMO 2026):三方来源(arXiv HTML、AlphaXiv、OpenTrain)数据一致,Reference threshold 35/29/25 标注清晰。
- ProofBench(Basic 96.7%,Advanced 63.3%):与 IMO-ProofBench 官方页面(imobench.github.io)评测设计描述吻合——Advanced 本身对所有非 Gemini 模型均低于 25%,Apodex 63.3% 属极高水平,原帖说法(63.3%)与官方数据一致。
- GDPVal / APEX-Agents / FrontierScience-Research:AlphaXiv 引用表中有具体数字,与搜索摘要吻合。
- 35B Mini 本地部署:arXiv abstract 明确提及,与 AI Weekly 报道一致。
- 待标注(未核验):AlphaXiv 提及 IMO-ProofBench Advanced 63.3% 为原帖引用 OpenTrain/AlphaXiv 二手来源,论文原文该数字原帖主张未经原始 PDF 逐字核验,属「原帖主张,未完全核验」类别。
- OpenTrain Reviewer Verdict:标注「Benchmark evidence not verified yet」;本文数值均来自 arXiv HTML 原文与 AlphaXiv 镜像,但 OpenTrain 对部分 benchmark claim 给出未核实标记,读者引用具体数字时建议核对原论文 PDF。
核心概念解析
Working Capability(工作能力)
论文定义的核心指标:agent 在长程任务中做出有用且可验证进展的能力。不是 RLHF 评测的「回答质量」,而是「交付物验收通过」。
任务合约形式化为:
$$\mathcal{E} = (\mathcal{W}, W_0, q, \mathcal{A}, \mathcal{T}, \Omega, \mathbf{B}, D, V_D)$$
其中 $W_0$ 是初始工作区状态,$q$ 是目标,$\mathcal{A}$ 是可用动作集,$D$ 是交付合约,$V_D$ 是验收函数。成功标准是 $S_D = V_D(W_0, W_H, \tau_H)$ 而非单纯的文本答案。
两条 Scaling 维度
Environment Scaling(环境扩展) 扩展 agent 可操作的 file、search、code 世界的多样性、保真度和可验证性。这些环境定义了状态、工具、转换关系、交互预算、失败条件和完成检查。
Agentic Coordination Scaling(智能体协同扩展) 训练 agent 学会:分解目标、分派任务、纳入异步结果、修订共享计划、重组未完成分支。Agent Team 模式通过并行工作实现这些行为:证据收集、文件分析、实现、验证、反分析同步进行。
执行基础:AgentOS + Execution Harness
- AgentOS:持久化运行时,在工具调用、agent 协作、上下文压力、干预和部分故障下维护权威状态。
- Execution Harness:将模型绑定到 File/Search/Code 环境,维护 workspace、artifact、provenance、branch 状态,支持 replay 和验证钩子。
训练方法
统一 SFT(推理 + 工具 + 恢复 + 交付 + 多智能体协同混合)+ Agentic RL(基于环境轨迹和协同轨迹改进长程决策)。用 self-evolution 仅用于受控工程循环,不做无约束模型自改。
评测结果(官方数据)
数学(IMO 竞赛级)
| 模型 | IMO 2025 | IMO 2026 | USAMO 2026 | ProofBench Basic | ProofBench Advanced |
|---|---|---|---|---|---|
| Reference threshold | 35 | 29 | 25 | – | – |
| Apodex 1.0 w/ Agent Team | 12.5 | 13.0 | 5.8 | 63.3 | 20.0 |
| Apodex 1.1 w/ ReAct | 24.3 | 18.5 | 16.0 | 80.0 | 46.4 |
| Apodex 1.1 w/ Agent Team | 36.5 | 30.5 | 26.5 | 96.7 | 63.3 |
金牌线 35 分,Apodex 1.1 Agent Team 在 IMO 2025 上已超过金牌 cutoff。
专业工作与金融
| Benchmark | Apodex 1.1 (ReAct) | Apodex 1.1 (Agent Team) |
|---|---|---|
| GDPVal(专业交付物) | 69.5 | 78.8 |
| APEX-Agents(长程) | 34.4 | 38.5 |
| FrontierScience-Research | 55.0 | 63.3 |
模型规格
- 主模型:参数量未在 abstract 中明确披露(据 AlphaXiv 为非 Mini 版本)
- Apodex 1.1 Mini:35B 参数,本地可部署,论文称保留了强工作能力
适用边界与局限性
- Benchmark evidence 部分未独立核验:OpenTrain AI 的研究者 verdict 标注「Benchmark evidence not verified yet」,具体数字虽来自 arXiv HTML 原文,但部分二级来源引用建议读者对照原始 PDF 核实。
- 模型规模争议:论文声称用「远小于前沿系统的模型」达到顶级表现,但未在 abstract 中披露主模型具体参数量(Mini 为 35B),与 o1/Gemini 等前沿系统的直接代际比较需读全文。
- 环境Scaling对计算资源要求高:多样化的 executable environment(代码执行、文件操作、搜索环境)在训练和推理时均有额外资源开销,论文未给出 sota 效率对比。
- 仅数学和金融领域有公开数值:搜索、代码等领域的具体 benchmark 数字在摘要层缺失,需要读全文对应章节。
- IMO-ProofBench Advanced 63.3%:属原帖/二级来源主张,原始 PDF 中该数字的上下文(评测方法、评判标准)与 IMO-ProofBench 官方描述的 Advanced 子集「所有非 Gemini 模型 < 25%」的口径对比存在解读空间,建议引用时标注。
一句话结论
Apodex 1.1 提出了一套「两条 Scaling 维度 + AgentOS 运行时」的框架,在 IMO 数学、专业交付、金融、科学研究等多领域用显著更小参数量达到前沿水准,其中 Agent Team 多智能体协同模式相较单 Agent ReAct 在多数 benchmark 上有 10-20% 的绝对提升;如果你在做 agent 系统性评测方法论研究或规划多智能体协作框架,这篇论文的 task contract 形式化和两条 scaling 维度的设计值得精读。
核验来源:arXiv:2608.23283(摘要页 + HTML 全文 v1)· AlphaXiv 镜像 · OpenTrain AI 论文页(第三方评级)· Tavily 搜索交叉验证