CodexBoard 是一个 macOS 桌面应用,将项目任务看板与本机 Codex 连接起来。它的核心用途是:让你用看板(Kanban)的方式管理任务,把任务提交给本机 Codex 执行,然后在看板里实时查看进度、处理审批和补充信息——相当于给 Codex 加了一层任务管理层。 项目支持两种接入方式:Web 浏览器( HTTPS 登录) 和 飞书(Lark…
仓库攻略
405 篇 · 395 个项目 · jay · Agent 智能体
PIDesktop 是一个本地优先(Localfirst)的 AI 编程 Agent 桌面工作空间。它的核心理念是:大多数编程 Agent 活在终端、编辑器插件或托管服务里,而 PIDesktop 给它们一个真正属于自己的独立桌面环境。 项目选用 Electron(前端界面)+ Rust Host Core(特权操作核心)+ pi Agent Sidecar…
Jev Ultrafast 是 browseruse 团队在 2026 年 9 月发布的一个开源浏览器 Agent 框架,核心创新是将 TypeSafe Jev 决策模型与动态索引式动作空间结合,实现超快决策循环。 与传统的截图+视觉推理路线不同,它用原子化 DOM 快照替代视觉输入:JavaScript 一次性读取页面可见控件(按钮、输入框、下拉框等),按…
Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses 是一篇 2026 年 9 月 4 日提交、已被 EMNLP 2026 接收的论文,第一作者为 Airbnb 的 Mia Zhao。论文研究的核心问题是: 在模型权重固定的前提下,如何系统性地优化 agent 的运行时控制层(har…
WHALE(WeightHarness Alternating LEarning)是 KRAFTON AI 与斯坦福大学联合提出的一种联合优化配方,核心思路极为简洁:将 Agent 系统拆成两个独立模块——模型权重(weights)和Harness 代码,交替优化,每次只动一个、固定另一个,循环往复逼近联合最优解。 官方定义(arXiv 2609.00196…
多子 Agent 并行存在收益递减边界——当并发子 Agent 数量超过某个阈值后,增加更多 Agent 不仅无法继续提升效果,反而会因协调开销、Token 浪费和上下文重叠导致整体效率下降。 核心反直觉结论: 来源分享者 @omarsar0(Omar Sánchez)是 AI 工程领域活跃的独立研究员,以梳理长文摘要和架构分析著称。 多 Agent 系统是…
JustinTime(JIT)Agentic OCR 是 LlamaIndex 联合创始人 Jerry Liu 在 2026 年 9 月提出的一种两遍文档处理范式,核心思想是: 不要对每个文档一开始就做昂贵的 VLMOCR,而是在需要的时候才精准放大(zoom in)到相关页面。 传统方案(全量 VLMOCR)的问题:贵、慢、没必要。JITOCR 的答案:先…
2026 年 9 月 11 日,Simon Willison 和 Alex Garcia 联合发布 Datasette 两个安全补丁版本——1.0a39(当前 alpha 系列)和 0.65.4(stable 系列),修复了一批权限相关漏洞。这批漏洞由 Sevban Dönmez 提交 AI 辅助报告后,触发了一次完整的 coding agent 安全审计,…
NeoHorse1 是 TokenRhythm 发布的一个 Agent 原生语言模型家族,包含 4B 和 9B 两个规模,均从 Qwen3.5 后训练而来,定位是「递归自改进(RSI)」路径上的初始原型。 官方将其描述为「agentnative」——模型从一开始就不是为通用对话设计的,而是专门针对工具调用、编码、Agent Harness 场景、指令遵循这四…
Rodney 是 Simon Willison 用 Go 编写的命令行浏览器自动化工具,基于 gorod/rod 库实现。与 Playwright/Puppeteer 等面向人类开发者的工具不同,Rodney 从第一天起就是为 coding agent 和 shell 脚本设计的。 核心设计:Chrome 以长驻进程运行(通过 Chrome DevTools…
commitrewriter 是 Simon Willison(@simonw)9 月 14 日发布的本地 Web 应用,用于批量编辑 Git 仓库的提交信息。核心使用场景是:Coding Agent 生成的提交记录往往带有大量"机器腔"——冗长的内部 ID 引用、不适合公开的 issue 编号、重复的 agent 生成 boilerplate。Simon …
Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses 是 Airbnb 团队(Cen Mia Zhao、Haibo Ruan、Wenjie Chen 等)发表在 EMNLP 2026 的论文,核心命题: 给定一个固定模型,Agent 的质量提升来源不是换模型,而是优化它周围的 har…
一个由 GPT6 Astra(Medium)+ OpenAI Codex 模式驱动的 AI 编码智能体,在 macOS 上自动调用本地已安装的 Blender 桌面应用,通过 Blender Python API 生成可编辑的 .blend 三维场景文件,并渲染出成品图像。 整个过程完全由自然语言驱动——用户只给了三句提示词,AI 自己: 1. 写 Pyth…
Extract Turbo 是 LlamaIndex(LlamaParse / LlamaExtract)平台在 2026 年 9 月发布的全新文档抽取 tier,处于 beta 阶段,主打极致低延迟,目标场景是 extraction 位于用户响应路径上的实时工作流。 LlamaParse 是 LlamaIndex 的核心商业产品,提供 Parse(文档解析…
Pentest Swarm AI 是一个基于真实群智(Swarm)架构的开源渗透测试引擎,由 Go 语言编写,支持 Claude、GLM、Qwen、DeepSeek、Gemini、Ollama 等任意具备 functioncalling 能力的 LLM。与传统多 Agent 工具「单 Planner 按固定顺序调用各阶段」不同,Pentest Swarm A…
Uno(发音「乌诺」)是 IFM(Institute of Foundation Models)团队开源的离散扩散增强型 LLM 推理框架,核心思想是:不让扩散模型取代自回归模型,而是让扩散模型辅助自回归模型并行生成多个 token,从而在保持输出无损的前提下显著提升吞吐。 传统 LLM 推理慢在「串行」——每个 token 必须等前一个 token 生成完…
Xberg 是用 Rust 编写的多格式文档智能提取引擎,下一代 Kreuzberg v4。声称支持 107 种文档格式 / 141 种文件扩展名 / 371 种编程语言,提供 15 种语言绑定(Python、Node.js、Rust、Go、Java、C#、Ruby、PHP、Elixir、Dart、Swift、Zig、WASM、Kotlin、C FFI),零…
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails 是 Salesforce AI 团队(Zhou Yu、Bin Bi 等)的研究,核心研究问题: 在企业级 Agent 场景下,Harness 演化(优化…
2026 年 9 月 8 日,Salesforce AI 研究团队发布了论文 "CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails"(arXiv:2609.09134)。论文研究了一个核心问题:当小模型配…
论文 "Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses"(arXiv:2609.05736,EMNLP 2026)来自 Airbnb 团队,核心贡献有两层: 第一层:量化评估协议。 论文指出,对 harness(围绕固定模型的运行时控制层)的优化效果不能只看均值提升,必须在预算…
Open Science Desktop(简称 OSD,原名"Open Science",v0.5.2 为当前最新版)是一个本地优先、模型无关的 AI 科研工作台,面向 macOS、Windows 和 Linux。它用 Tauri 构建桌面外壳,内嵌 OpenCode 运行时,通过 MCP 协议连接科学数据库和 agent 技能,可以完成从文献调研、实验设计…
Webcmd 是一个面向 AI 编程 agent 的自学习浏览器基础设施。它的核心思路很直接:让 agent 在真实浏览器中完成任务,同时把网站的结构知识(sitemap、action space、pitfalls)留在本地,下次同类任务不再重复探测,直接从记忆启动。据 README 描述,理论上可将浏览器 agent 的 token 消耗降低 90%。 它…
ChromaFs 是 Mintlify 在 2026 年 3 月发布的一种虚拟文件系统(Virtual Filesystem)实现,它把 Chroma 向量数据库包装成 Agent 可用 ls、cat、grep、find、cd 等 UNIX 命令操作的"文件系统",从而替代传统的 naive RAG 方案。 核心洞察来自 Mintlify 工程师 Dens …
Neo.mjs 是一个自演进软件有机体——一支专业端到端 AI 工程团队,跨模型(Claude / Gemini / GPT 等) swarm 协同,通过 Neural Link(神经链接)进驻实际应用,在内存核心(Memory Core)、知识库(Knowledge Base)、Native Edge Graph、A2A 协调层上自主完成从构思到构建到交叉…
AI Research Preference Models(RPMs)是 Meta FAIR 团队(联合牛津大学、UCL)提出的一种新方法,核心问题是:AI 研究 Agent 能提出远多于能跑实验的候选方案,但 GPU 预算有限,如何在跑之前就知道哪个最值得跑? RPM 的思路是:不预测绝对分数(论文发现 LLM 在预测具体指标上不可靠),而是用预训练冻结的…
DisCo(Distillation & Composition)是北京人工智能研究院(BAAI)等团队提出的研究智能体,它不只做研究,还自己构建可执行技能——然后用这些技能反过来提升研究能力。配套产物是 AREXSkill Library:从 1,000+ 个热门 ML 仓库中自动蒸馏出 5,000+ 条已验证技能,覆盖 20 个研究领域和 178 个能力…
⚠️ 仓库说明:原帖链接指向 ByteDanceSeed/HarnessDev,但该 GitHub 仓库不存在(404)。官方资源为 arXiv 论文及项目页,以下内容均来自这两个来源。 HarnessDev 是 ByteDance Seed(联合新加坡理工大学、佐治亚理工、MAP、TokenWave.AI 等机构)于 2026 年 9 月 1 日发布在 a…
Claude Fable 5.1 使用的是与 Claude Fable 5 相同的 tokenizer(该 tokenizer 首次随 Claude Opus 4.7 引入)。相比 Opus 4.7 之前的模型(如 Fable 4、Sonnet 4.6 等),相同文本会多产生约 30% 的 token。 这不是 API 接口的变化——请求格式、流式事件结构完…
academicwritingskills 是一个面向学术写作后期的 AI 辅助工具集,基于 Agent Skills 协议 安装,专为已存在初稿的论文提供「审稿人视角」的诊断与精修。不是从零写论文,而是对已有稿件做格式校验、文献核查、语法抛光、去 AI 味编辑和同行评议式审查。 覆盖 LaTeX(英文 / 中文学位论文)、Typst 和 PDF 三种格式。…