AgentSky(agentsky.dev)是 2026 年上线的世界首个 Agent Market(Agent 聚合分发平台),核心理念是「把 OpenRouter 对模型的作用复制到 Agent 层」——用一张 API key 统一接入 Claude Code、Codex、Hermes、OpenCode、Kimi Code、OpenClaw 等多款主流 …
仓库攻略
244 篇 · 241 个项目 · Agent 智能体 · jay
这篇论文(arXiv:2609.20804,2026 年 9 月 17 日)是首批对 Coding Harness 进行组件级拆解实证研究的工作之一。 论文作者(RunZe Fan 等,来自 UMass Amherst、Emory、UNC Charlotte 和 Zoom)构建了一个模块化的轻量 Coding Harness,将执行循环固定,仅对三个组件进行…
Stellar Colosseum 是 Google Research 推出的一种多 Agent 协作 Harness 系统,用于在数学与理论计算机科学领域执行长程研究任务(longhorizon research)。由 Honghao Lin、David P. Woodruff(cofirst authors)、Yuan Deng、Jieming Mao、…
SkillRanker(命令 sr)是一个独立运行的 Rust CLI 工具,核心作用是在 AI 编码代理(Claude Code、Codex 等)的技能库中,根据当前会话的实时上下文,智能挑选最适合下一步的技能。它由 TypeSafe.ai 的 Jev 模型提供决策引擎,支持 Claude Code Hooks 集成、结构化 JSON 输出、主动弃权(ab…
Procedural Graphs(过程图)是 Google 团队(Yuxing Lu、Yicheng Chen、Shanchan Wu、Sercan Ö. Arık)2026 年 9 月 8 日发表在 arXiv(2609.09153)的论文提出的 LLM Agent 执行结构框架。 其核心思想类比清晰: 知识图谱(Knowledge Graph)→ 用(…
SoLPi(Scaling of Language — Pi)是 NVIDIA NVlabs 开源的一个 Pi Agent 引擎扩展包,通过四个可插拔的 Token 节省机制,在保持原有任务完成质量的前提下,大幅削减长时运行编码 Agent 的 token 流量和 API 成本。 它不是一个独立的 Agent,而是以插件形式叠加在 Pi(@earendilw…
GPT6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的旗舰模型,定位为「AI 工程师」级 Agent 主力引擎。本攻略聚焦其 API 接入成本 与 编码类 Agent 任务性价比,为有实际落地需求的开发者提供一份可复现的参考。 核心事实(均来自官方来源,详见「核验过程」): | 维度 | 数据 | ||| | API 模型名 | gp…
dairai/dairacademyplugins 是 DAIR.AI 维护的一个 Claude Code 插件市场,涵盖 AI 课程助教、X 情报流、论文策展、图像生成、LLM Council 等多个垂直场景。其中 xagentintelligence 插件(v1.4.0)解决了一个实际问题:如何把 X(Twitter)上关注的 AI / Agent 账号…
CodexBoard 是一个 macOS 桌面应用,将项目任务看板与本机 Codex 连接起来。它的核心用途是:让你用看板(Kanban)的方式管理任务,把任务提交给本机 Codex 执行,然后在看板里实时查看进度、处理审批和补充信息——相当于给 Codex 加了一层任务管理层。 项目支持两种接入方式:Web 浏览器( HTTPS 登录) 和 飞书(Lark…
PIDesktop 是一个本地优先(Localfirst)的 AI 编程 Agent 桌面工作空间。它的核心理念是:大多数编程 Agent 活在终端、编辑器插件或托管服务里,而 PIDesktop 给它们一个真正属于自己的独立桌面环境。 项目选用 Electron(前端界面)+ Rust Host Core(特权操作核心)+ pi Agent Sidecar…
Jev Ultrafast 是 browseruse 团队在 2026 年 9 月发布的一个开源浏览器 Agent 框架,核心创新是将 TypeSafe Jev 决策模型与动态索引式动作空间结合,实现超快决策循环。 与传统的截图+视觉推理路线不同,它用原子化 DOM 快照替代视觉输入:JavaScript 一次性读取页面可见控件(按钮、输入框、下拉框等),按…
Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses 是一篇 2026 年 9 月 4 日提交、已被 EMNLP 2026 接收的论文,第一作者为 Airbnb 的 Mia Zhao。论文研究的核心问题是: 在模型权重固定的前提下,如何系统性地优化 agent 的运行时控制层(har…
多子 Agent 并行存在收益递减边界——当并发子 Agent 数量超过某个阈值后,增加更多 Agent 不仅无法继续提升效果,反而会因协调开销、Token 浪费和上下文重叠导致整体效率下降。 核心反直觉结论: 来源分享者 @omarsar0(Omar Sánchez)是 AI 工程领域活跃的独立研究员,以梳理长文摘要和架构分析著称。 多 Agent 系统是…
JustinTime(JIT)Agentic OCR 是 LlamaIndex 联合创始人 Jerry Liu 在 2026 年 9 月提出的一种两遍文档处理范式,核心思想是: 不要对每个文档一开始就做昂贵的 VLMOCR,而是在需要的时候才精准放大(zoom in)到相关页面。 传统方案(全量 VLMOCR)的问题:贵、慢、没必要。JITOCR 的答案:先…
2026 年 9 月 11 日,Simon Willison 和 Alex Garcia 联合发布 Datasette 两个安全补丁版本——1.0a39(当前 alpha 系列)和 0.65.4(stable 系列),修复了一批权限相关漏洞。这批漏洞由 Sevban Dönmez 提交 AI 辅助报告后,触发了一次完整的 coding agent 安全审计,…
NeoHorse1 是 TokenRhythm 发布的一个 Agent 原生语言模型家族,包含 4B 和 9B 两个规模,均从 Qwen3.5 后训练而来,定位是「递归自改进(RSI)」路径上的初始原型。 官方将其描述为「agentnative」——模型从一开始就不是为通用对话设计的,而是专门针对工具调用、编码、Agent Harness 场景、指令遵循这四…
Rodney 是 Simon Willison 用 Go 编写的命令行浏览器自动化工具,基于 gorod/rod 库实现。与 Playwright/Puppeteer 等面向人类开发者的工具不同,Rodney 从第一天起就是为 coding agent 和 shell 脚本设计的。 核心设计:Chrome 以长驻进程运行(通过 Chrome DevTools…
Pentest Swarm AI 是一个基于真实群智(Swarm)架构的开源渗透测试引擎,由 Go 语言编写,支持 Claude、GLM、Qwen、DeepSeek、Gemini、Ollama 等任意具备 functioncalling 能力的 LLM。与传统多 Agent 工具「单 Planner 按固定顺序调用各阶段」不同,Pentest Swarm A…
Xberg 是用 Rust 编写的多格式文档智能提取引擎,下一代 Kreuzberg v4。声称支持 107 种文档格式 / 141 种文件扩展名 / 371 种编程语言,提供 15 种语言绑定(Python、Node.js、Rust、Go、Java、C#、Ruby、PHP、Elixir、Dart、Swift、Zig、WASM、Kotlin、C FFI),零…
论文 "Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses"(arXiv:2609.05736,EMNLP 2026)来自 Airbnb 团队,核心贡献有两层: 第一层:量化评估协议。 论文指出,对 harness(围绕固定模型的运行时控制层)的优化效果不能只看均值提升,必须在预算…
Open Science Desktop(简称 OSD,原名"Open Science",v0.5.2 为当前最新版)是一个本地优先、模型无关的 AI 科研工作台,面向 macOS、Windows 和 Linux。它用 Tauri 构建桌面外壳,内嵌 OpenCode 运行时,通过 MCP 协议连接科学数据库和 agent 技能,可以完成从文献调研、实验设计…
Webcmd 是一个面向 AI 编程 agent 的自学习浏览器基础设施。它的核心思路很直接:让 agent 在真实浏览器中完成任务,同时把网站的结构知识(sitemap、action space、pitfalls)留在本地,下次同类任务不再重复探测,直接从记忆启动。据 README 描述,理论上可将浏览器 agent 的 token 消耗降低 90%。 它…
Neo.mjs 是一个自演进软件有机体——一支专业端到端 AI 工程团队,跨模型(Claude / Gemini / GPT 等) swarm 协同,通过 Neural Link(神经链接)进驻实际应用,在内存核心(Memory Core)、知识库(Knowledge Base)、Native Edge Graph、A2A 协调层上自主完成从构思到构建到交叉…
AI Research Preference Models(RPMs)是 Meta FAIR 团队(联合牛津大学、UCL)提出的一种新方法,核心问题是:AI 研究 Agent 能提出远多于能跑实验的候选方案,但 GPU 预算有限,如何在跑之前就知道哪个最值得跑? RPM 的思路是:不预测绝对分数(论文发现 LLM 在预测具体指标上不可靠),而是用预训练冻结的…
⚠️ 仓库说明:原帖链接指向 ByteDanceSeed/HarnessDev,但该 GitHub 仓库不存在(404)。官方资源为 arXiv 论文及项目页,以下内容均来自这两个来源。 HarnessDev 是 ByteDance Seed(联合新加坡理工大学、佐治亚理工、MAP、TokenWave.AI 等机构)于 2026 年 9 月 1 日发布在 a…
academicwritingskills 是一个面向学术写作后期的 AI 辅助工具集,基于 Agent Skills 协议 安装,专为已存在初稿的论文提供「审稿人视角」的诊断与精修。不是从零写论文,而是对已有稿件做格式校验、文献核查、语法抛光、去 AI 味编辑和同行评议式审查。 覆盖 LaTeX(英文 / 中文学位论文)、Typst 和 PDF 三种格式。…
openJiuwen 是一个开源的 Agent 评测 Harness(测试框架),专门针对长程编程任务设计,发表在 arXiv(论文 2608.27969,2026 年 8 月 28 日提交)。 它的核心论文标题已经点明主题:Beyond Static Harnesses for LongHorizon Coding Agents(超越静态 Harness …
OpenExecutive 是一个 AI 虚拟高管团队系统——用一套系统扮演你公司的完整高管层(CSO、CFO、CHRO、GC、COO、CMO、CPO、董事会秘书),用户始终只和一个连贯的"Executive"声音对话,内部则由 8 个专业 Agent 并行协作,从 ChromaDB 检索知识、SQLite 记录决策记忆、Anthropic Claude 作…
HarnessofHarness(简称 HoH)是一个让现有编码 Agent 框架(harness)获得「持续自我改进」能力的上层封装框架,由上海人工智能实验室(Shanghai Artificial Intelligence Laboratory)的研究者提出,2026 年 9 月 2 日发表于 arXiv(arXiv:2609.01481)。 它的核心洞…
Autonomous LongRunning Coding Agents(自主长时运行编码智能体)是一种从"人类逐轮驱动"转向"目标合同驱动"的编码 Agent 新范式。其核心思想来自 DAIR.AI 联合创始人 Omar Sarwar(@omarsar0)于 2026 年 6 月 11 日在 DAIR.AI Academy 开设的同名直播课(165 人报名…