Apodex 1.1 是 2026 年 8 月 24 日发布的一篇 70+ 作者论文(arXiv:2608.23283),全称 Scaling Agentic Intelligence for Complex Work。论文提出了一个通用 agent 执行系统,核心目标是把语言模型的「推理能力」转化为「可持续完成可验收工作」的能力——作者称之为 Workin…
仓库攻略
54 篇 · 54 个项目 · Agent 智能体 · jay · 评测基准
SmolVM(smolmachines/smolvm)是一个开源的轻量级 microVM 运行时,专门解决 AI Agent 执行 LLM 生成代码时的隔离问题。由 Aniket Maurya 与 Celesto AI 团队开发,Apache 2.0 开源协议,2026 年 4 月 21 日正式发布,GitHub 发布首日即获得 482 个 HN 点。 官方…
CAID(Centralized Asynchronous Isolated Delegation)是一个面向长程软件工程任务的多 Agent 协调范式,由卡内基梅隆大学(CMU)研究团队提出,发表在 arXiv 2603.21489。核心思路是:将人类软件工程中的成熟协作基础设施(git worktree、branchandmerge、测试验证)直接映射到…
x64dbgMCPServer 是一个将 x64dbg 调试器通过 MCP(Model Context Protocol) 协议暴露为 HTTP 服务的原生插件。使用 Zig 语言编写,零外部依赖,一个插件文件同时支持 x32 和 x64 架构。连接任何 MCP 兼容的 AI 助手(如 Claude Code),即可通过自然语言控制 x64dbg:设置断点、…
SynaLinks/synalinksskills 是一套面向 AI 编程 Agent 的 SKILL.md 技能包,专门教 Claude Code、Codex、OpenCode、pi 等主流 coding agent 如何写出符合 SynaLinks 框架规范的代码。技能本身是一个标准化的 SKILL.md 文件,基于 Anthropic 主导的 Agen…
Artificial Analysis Search Index(搜索 API 指数)是一个专门针对 AI Agent 搜索工具 的评测基准,由 AI 数据分析平台 Artificial Analysis(AA)于 2026 年 8 月 18 日正式发布。它的核心思路非常干净——用同一个 Agent 环境(模型、工具调用上限、评测任务完全相同),只替换底层的…
TrueForge 是 TrueFoundry 于 2026 年 8 月开源的 MIT 许可证 Agent Harness——运行在 LLM 周围的运行时层,把一个语言模型变成可真正跑在生产环境里的 Agent。它不挑模型、不绑云、不锁供应商,可以本地单进程(SQLite)运行,也可以 Docker Compose / Kubernetes 部署高可用集群。…
本攻略核验了所有数字与说法:准确率来自 ExtractBench 官方论文(arXiv:2607.29677)及 GitHub README;FTX 矩阵案例来自 Jerry Liu 原文;各 tier 定价来自 ExtractBench GitHub 页;与原帖说法一致处直接引用,与官方文档冲突处以官方为准并注明。 LlamaExtract Agentic…
MinerU 是由 OpenDataLab(上海人工智能实验室关联开源组织)开发的高精度文档解析引擎,于 2024 年开源。其核心能力是:将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂文档,转换为 LLM 可直接消费的 Markdown 或 JSON 格式,同时保留阅读顺序、标题层级、表格结构、公式 LaTeX 等语义信息。 MinerU 最早服…
Codex CLI 是 OpenAI 官方推出的轻量级终端编程智能体(coding agent),于 2025 年 4 月开源发布。与面向 IDE 插件的 Codex(Codex for IDE)不同,Codex CLI 是完全运行在终端的独立工具,支持 macOS、Linux、Windows 全平台。它由 OpenAI 的编码专用模型驱动,能理解代码库、读…
Nerve(The Simple Agent Development Kit)是一个用 YAML + CLI 构建、运行、评测和编排 LLM Agent 的轻量框架。它的核心理念是声明式 Agent:用 YAML 定义 system prompt、task、tools 和 variables,一个文件搞定一个 Agent,再通过 nerve CLI 驱动执行…
MedSci Skills 是面向临床研究与医学人工智能的开源 Agent Skills 合集(MIT 许可证),由韩国首尔峨山医疗中心放射科医生兼研究员 Yoojin Nam, MD 构建,在真实出版物上测试通过。截至 v5.0 版本共包含 59 项技能,覆盖从文献检索、统计图表、报告指南合规审查到 AI 模型工程的全链路。 它并非通用 AI 科学家平台,…
RSIBenchData(Evolvent AI × 新加坡国立大学,arXiv:2607.25886,cs.SE,2026 年 7 月 28 日)是首个专门评测 LLM Agent 作为数据研究员(datacentric researcher)进行递归自我改进的受控基准。 它的核心问题:给一个固定的模型和训练基础设施,LLM Agent 能否自主诊断能力短…
Meta Muse Glimmer 是 Meta 超级智能实验室(Meta Superintelligence Lab)于 2026 年 8 月 开源发布的 ~29.6B 参数多模态推理模型,权重基于 Apache 2.0 许可证,完全开放商用。它是 Meta 自 Llama 时代之后首次重新发布开源权重,被 @rasbt 形容为「Llama 时代以来 Me…
Moli 是一个用 Rust 从零构建的浏览器引擎,专为 AI Agent 场景设计。它不依赖 Chromium,却又完整实现了 V8 JavaScript 引擎、原生 DOM、CSS 渲染、网络请求(Fetch/XHR/WebSocket)、Cookie、localStorage/IndexedDB/OPFS 等 Web 运行时。与传统浏览器自动化工具最大…
2026 年,AI 社区出现了一个重要认知转向:Agent 的表现瓶颈不在模型本身,而在包裹模型的那层工程结构——Harness(驾驭层)。Harness 由 @omarsar0(Elvis,研究机构 DAIR.AI 联合创始人)提出,核心主张是:Agent 的工具调用行为由 Harness 决定,而非工具数量;Harness 的核心能力是决定何时不调用工具…
Prime Agent 是 Prime Intellect(2026 年 8 月 5 日开源)的自改进 Agent 编程框架,围绕两个核心抽象构建: RLM(Recursive Language Model):将上下文视为变量,把子 Agent 调用变成 REPL 内的函数调用(rlm(...)),替代传统的固定工具 schema + 上下文压缩方案。 Co…
texttocad 是一个面向 AI 编程 Agent(Claude Code、Codex 等)的 CAD/CAE/CAM 技能库——给 AI Agent 安装这些 Skills 后,你可以用自然语言让 Agent 直接生成 STEP、STL、DXF、URDF 等工程文件,甚至驱动 3D 打印和数控加工。 项目包含 11 个独立 Skills,覆盖从"文本/…
本攻略核验了原帖中的所有关键数字,均来自 OSWorld 2.0 官方 GitHub(xlangai/OSWorldV2)、arXiv 论文摘要页(2606.29537)及 arXiv HTML 版本原始表格数据。Benchmark leaderboard 动态更新,当前 SOTA 已随新模型提交变化,文中标注了原始 paper 结果与最新榜单的区别。 OS…
Cameron R. Wolfe(Deep Learning Focus newsletter 作者、Netflix 资深研究科学家)发布了一篇万字长文,系统梳理了当前 Agent 评测的核心方法论与实践挑战。 传统 LLM 评测用静态问答或短对话就能完成——输入问题,输出答案,对比参考答案。但 Agent 系统是长时间运行、主动操作外部环境、与工具反复交互…
davidondrej/skills 是一个面向 AI 编程 Agent、研究 Agent 和工作流 Agent 的可复用技能包。每个技能(skill)将一类重复性工作流打包成指令集,Agent 在任务需要时直接加载使用。与纯粹的理论框架不同,这里的技能来自 David Ondrej 本人的实际工作栈,经过真实场景验证。 仓库规模不大(Stars 3250,…
StateAct 是 Salesforce AI Research(2026 年 7 月 24 日)发表的一篇 arXiv 论文提出的代码优先(codefirst)多智能体架构,核心洞察是:不要教 Agent 看截图,要让它直接读写程序状态。 传统 computeruse agent 路线是:截图 → 模型"看懂"像素 → 决定点击/输入 → 执行 → 再截…
FAEA(Frontier Agent as Embodied Agent)是一种无需任何演示数据、无需微调的机器人操控新范式——直接把现成的 LLM Agent SDK(如 Claude Agent SDK)当作机器人的"大脑",让 Agent 自己写代码、调试、再尝试,直到任务成功。 核心思路一句话:机器人策略(π)负责动,LLM Agent 负责想,各…
LongHorizonTerminalBench(LHTB)是一个评测 Agent 在长时序终端任务上持续工作能力的基准测试,2026 年 7 月由来自腾讯(Tencent HY LLM Frontier)、Lehigh University、University of Maryland、University of Georgia、University of…
ECHO(Environment Crossentropy Hybrid Objective)是一个让 CLI Agent 在 RL 训练过程中同时学习预测环境响应(terminal 输出)的混合目标函数,来自论文 arXiv:2605.24517(2026 年 5 月),由 Microsoft Research AI Frontiers 和 Prime I…
一个长期被忽视的事实是:语言模型被训练来执行动作,但从未被显式训练来建模它们所处的环境。 标准 Agent 强化学习(如 GRPO)只在动作 token 上计算梯度,用稀疏的二元结果奖励(成功/失败)驱动学习。环境中返回的所有观测——stdout、stderr、文件内容、错误信息、工具响应——虽然在 rollout 中已经存在,却不参与训练,被白白丢弃。 工…
LlamaParse Retrieval Harness(发布于 2026 年 6 月 29 日)是 LlamaIndex 在 LlamaParse Index v2 中推出的一套面向 Agent 的文档检索工具集。它不再把文档库当成一个静态向量数据库让 Agent 做一次语义搜索,而是把整个索引暴露为一组类文件系统接口——Agent 可以主动 list、g…
OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。 它于 2026 年 7 月 5 日正式发布,定位是 Claude Sci…
DataFlowHarness 是北京大学联合中关村 Academy 于 2026 年 7 月 18 日发布的一个代码 Agent 平台(技术报告 arXiv:2607.16617),核心解决一个实际问题:LLM 代码 Agent 生成的往往是「一次性脚本」而非可持续编辑的生产级数据流水线——作者将此称为 NL2Pipeline Gap(自然语言到流水线之间…
NemoClaw for LangChain Deep Agents Blueprint(简称 NemoClaw)是 LangChain 与 NVIDIA 联合发布的企业级 Agent 参考架构,发布时间为 2026 年 7 月 8 日(PRNewswire)。 该 Blueprint 不是一款独立产品,而是把三层开源组件打包成一套可落地、可自托管的完整 A…