openJiuwen 是一个开源的 Agent 评测 Harness(测试框架),专门针对长程编程任务设计,发表在 arXiv(论文 2608.27969,2026 年 8 月 28 日提交)。 它的核心论文标题已经点明主题:Beyond Static Harnesses for LongHorizon Coding Agents(超越静态 Harness …
仓库攻略
405 篇 · 395 个项目 · jay · Agent 智能体
Exo 是 a16z 支持的 exoharness/exo 开源框架,定位是「recursive self improvement(RSI,递归自我改进)」的完整 agent + harness 系统。 它本质上是一个完整的 AI agent harness(类似 OpenClaw、Pi 或 Hermes),核心理念是让模型能够看到并修改自己的全部代码和运行…
OpenExecutive 是一个 AI 虚拟高管团队系统——用一套系统扮演你公司的完整高管层(CSO、CFO、CHRO、GC、COO、CMO、CPO、董事会秘书),用户始终只和一个连贯的"Executive"声音对话,内部则由 8 个专业 Agent 并行协作,从 ChromaDB 检索知识、SQLite 记录决策记忆、Anthropic Claude 作…
2026年8月,AI 开发者 @abacaj 在 X 上发了一条简短而犀利的观察: "they need to make models that think less, seems to be the only lever they have is how many tokens it generates while thinking" 这条帖获得 4.5K…
Blip 是一个在 Linux 桌面上收发 iMessage 的工具,通过让同一局域网(或 Tailscale 网络)内的 Mac 充当"网关"来实现——Mac 保持登录你的 Apple ID、运行 AppleScript 脚本处理消息,Linux 端只是一个轻薄的客户端界面(Omarchy 面板插件 + 独立 App)。 ⚠️ 前提条件:必须有一台 Mac…
2026年9月1日,开发者 Simon Willison 在整理磁盘空间时(使用 OmniDiskSweeper 扫描 ~/.cache/)偶然发现:OpenAI 的桌面版 ChatGPT(由原 Codex 桌面应用 rebranding 而来)在用户本地静默捆绑了约 1.7GB 的完整运行时环境,位于: ~/.cache/codexruntimes/cod…
OpenInference 是一个基于 OpenTelemetry 标准的 AI 应用追踪(tracing)工具集,由 Arize 团队维护。它定义了 LLM 调用、向量检索、工具使用等场景的语义约定(semantic conventions),并提供各主流 AI 框架的插桩(instrumentation)库,让 AI 应用能像传统微服务一样输出标准化的 …
ECommerce Bench 是 QwenLM 团队发布的首个长周期 AI 智能体评测基准(arXiv:2608.30730,2026),核心思路是: 给每个 LLM Agent 发放 ¥100,000 启动资金,让它同时经营最多 4 家网店整整 365 个模拟日,涵盖采购谈判、库存管理、定价策略、订单履约、退货处理和现金流运作,最终以年末总资产衡量胜负。…
HarnessofHarness(简称 HoH)是一个让现有编码 Agent 框架(harness)获得「持续自我改进」能力的上层封装框架,由上海人工智能实验室(Shanghai Artificial Intelligence Laboratory)的研究者提出,2026 年 9 月 2 日发表于 arXiv(arXiv:2609.01481)。 它的核心洞…
Autonomous LongRunning Coding Agents(自主长时运行编码智能体)是一种从"人类逐轮驱动"转向"目标合同驱动"的编码 Agent 新范式。其核心思想来自 DAIR.AI 联合创始人 Omar Sarwar(@omarsar0)于 2026 年 6 月 11 日在 DAIR.AI Academy 开设的同名直播课(165 人报名…
cass(Coding Agent Session Search)是一个用 Rust 编写的本地会话搜索工具,支持统一索引和检索来自 23 种 AI 编程工具的历史会话记录,包括 Codex、Claude Code、Claude Code(移动版)、Gemini CLI、Cline、OpenCode、Amp、Cursor、ChatGPT、Aider、PiAg…
LangSmith Messages View 是 LangSmith 轨迹查看器的三种视图模式之一(Messages / Turns / Details),目前处于 Beta 阶段。它将原本以结构化树状图呈现的 Agent 执行轨迹,转译为对话气泡式的聊天界面,让工程师无需理解 trace 术语也能快速定位问题。 根据官方文档(View traces La…
2026 年 8 月底,LangChain 官方在 langchain==1.4.0a2 中正式加入了基于 FastMCP 协议的 MCP(Model Context Protocol)适配层,使 LangChain/LangGraph Agent 能够直接调用任何兼容 MCP 标准的外部工具服务器。该功能通过独立包 langchainmcpadapters…
Reverify 是一个AI 辅助逆向工程工具包,核心解决 AI 在二进制逆向场景下"一本正经地胡说八道"的问题。它将语言模型置于确定性 RE 工具链的裁判之下:模型提出假设,工具链在真实二进制上验证,只有在 disassemble、patternmatch 或 emulator 执行后确认的结论才对外报告。 MIT 许可证,当前版本 v0.3.0,纯 Py…
pi_agent_rust 是一个从零用 Rust 编写的原生 AI 编程 Agent CLI,脱胎于 Mario Zechner(badlogic)开源的 Pi Agent 项目,并在架构上做了根本性重构。它是一个单二进制文件,内置 35 个工具(默认开启 19 个),支持流式响应、多会话管理,核心设计目标是极低启动延迟、极低运行时内存开销,以及可审计的扩…
Reef 是持续学习基础设施,让 AI Agent 在真实任务中不断自我改进。它在推理端点之上叠加了「记录 → 反馈 → 训练 → 发布」四步闭环:模型每次响应都被记录为"收据"(receipt),外部评判系统(测试套件、验证器、人工评分等)可以针对收据提交报告(report),Reef 的配方(recipe)消费足够报告后触发训练步骤,产出新模型权重或 A…
2026 年 8 月 20 日,OpenRouter 上悄然出现一个匿名模型 Ox Alpha:无所属、无模型卡、免费使用、1M token 上下文、支持图文视频输入。六天后,它成了 OpenRouter 有史以来最热门的模型,吞吐量是第二名的 2.3 倍。8 月 26 日,Bloomberg 证实其真身——GLM5.3Flash,来自智谱 AI(Zhipu…
AG2(前身为 Microsoft AutoGen)是一个开源多智能体编程框架,用于构建 AI Agent 并协调多个 Agent 协作完成任务。2026 年 4 月 3 日,微软将 AutoGen 与 Semantic Kernel 合并,推出 Microsoft Agent Framework(MAF),AutoGen 团队转向独立维护,品牌更名为 AG…
scitechlibrarian 是一个可复现学术文献检索工具:用一条结构化查询同时打穿 8 个学术数据库(OpenAlex、NASA ADS、arXiv、INSPIREHEP、Scopus、Semantic Scholar、Crossref、Web of Science),自动将查询语法转译为各数据库的原生检索式,每次运行结果全部存档,并最终生成 PRIS…
The Handoff Tax: Continuing NonNative Trajectories in LLM Agents 是 AWS Agentic AI 团队 Roy Ganz、Mor Shpigel Nacson、Adi Kalyanpur、Ron Litman 四人于 2026 年 8 月 25 日发表在 arXiv(2608.24358)的研…
Agent Seer 是苹果机器学习研究团队(Harish Karumuri、Mahesh Vemula、David Lopes Pegna)2026 年 6 月发表的一篇论文(arXiv:2608.26133,同年 8 月被 GEM@ACL 2026 接收),核心主张是:只需一个 MCP 协议规范文件,无需任何示例对话、无需真实工具调用、无需领域调优,就能…
LangSmith 的 Trace 级成本可观测性(Cost Tracking at Trace Level) 是一套将 LLM/Agent 每次运行的费用直接绑定到执行链路的技术能力。传统 AI 应用只知道「这个月 API 账单是 X 美元」,而 trace 级成本追踪让你知道「是哪个 workflow、哪次 tool call、哪条 prompt pat…
SAM(Sovereign Agent Mesh)是由 Google 开发的一个零配置、零信任的 P2P 网络,专为自主 AI Agent 设计。它让 AI Agent 节点自动发现彼此、互相认证,并通过标准 MCP(Model Context Protocol)协议跨节点调用工具——不依赖将内部脚本或 API 暴露到公网。 当前状态:公开测试网(banan…
Strata 是一个为现代 Linux 桌面打造的高速、键盘优先文件管理器,核心设计面向 Omarchy 发行版,同时兼容标准 GTK4 Linux 环境。它将空间 Miller 列(多栏导航)+ 网格视图 + 资源管理器视图三合一,配合即时模糊搜索、丰富预览和原生桌面集成,适合重度键盘用户替代 Nautilus/Dolphin。 Linux 桌面文件管理器…
Tons of Skills 是一个面向 Claude Code 的开源插件技能市场,由 Jeremy Longshore(Intent Solutions)维护。它将散落在各处社区的 Claude Code 技能(Skill)打包成可发现、可安装、可评级的插件集合,通过 npm 包 + Web 界面双通道分发。截至 20260819 数据:471 个插件、…
2026 年上半年,两家科技巨头先后因 AI 编码工具成本失控被迫踩刹车: 这不是两个孤立事件。《FinOps Foundation》数据显示,2026 年有 98% 的从业者需要管理 AI 支出,而一年前这个比例是 63%——AI 成本管理是史上普及最快的成本管控领域。Gartner 预测,到 2027 年底超过 40% 的 Agentic AI 项目将因…
LLM CLI 是 Simon Willison 用 Python 写的命令行工具,同时也是一个 Python 库,用于对接 OpenAI、Anthropic、Google Gemini、Qwen、Gemma、Mistral 等数十家模型厂商的 API,并支持本地模型(通过 Ollama、LM Studio 等兼容端点)。8 月 4 日发布的 0.32 是该…
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工薪层(workhorse)模型,主打编码和 Agent 场景,定位为"有史以来最智能的工作负载模型"。它基于 Gemini 3.6 Flash 的算法改进版(model card 将所有架构细节指向 3.6 Flash),上下文窗口 1,048,576 tokens…
BTL3(Bad Theory Labs 3)是 Bad Theory Labs 发布的一个后训练 PEFT LoRA 适配器,基座为 Qwen/Qwen3.627B,定位于编程 Agent、仓库级工具调用、长程多轮执行场景。 核心规格(均来自 Hugging Face 官方模型卡与 GitHub README): | 项目 | 规格 | ||| | 基座模…
Luxas 是一个开源的多 Agent 自主科研系统,输入一个研究主题(Research.md),它能自动完成:文献爬取(OpenAlex、arXiv、CrossRef,含反检测浏览器绕过付费墙)→ 阅读论文 → 设计并运行实验(多个 Agent 盲写代码和测试)→ 产出可发表级别的图表 → 撰写 LaTeX 报告 → 对抗性内容+图表+排版审查 → 最终输…