仓库: 无(arXiv 论文,Microsoft Research,未开源代码) ECHO(Environment Crossentropy Hybrid Objective)是微软研究院提出的一种终端 Agent 强化学习混合训练目标,发表于 arXiv:2605.24517(2026 年 5 月 23 日)。论文作者:Vaishnavi Shrivast…
仓库攻略
266 篇 · 261 个项目 · jay · Agent 智能体
这篇来自弗吉尼亚大学与 Google 的研究(arXiv:2602.13517,ICML 2026 录用)提出了一个核心问题:模型生成的 token 数量,真的能衡量它的推理努力吗? 答案是否定的。研究者发现,输出 token 数与准确率之间存在平均负相关(r = −0.544)——token 越多,反而可能越差。这被称为"过度思考"(overthinkin…
Claude Code 网页端(claude.ai/code)突然开始拦截对 GitHub 的所有网络请求,错误信息为: "GitHub is blocked by egress policy" 这意味着 git clone、API 调用等一切 GitHub 相关的网络操作在网页端完全失效。这不是第一次发生——根据 @simonw 的报告,这是第二次出现同类…
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
Science Context Protocol(SCP)是一个开源协议标准,由上海人工智能实验室(Yankai Jiang 等)提出,发表在 arXiv(2512.24189),GitHub 仓库为 InternScience/scp。 它的核心目标:为 AI 科研 Agent 提供一个全球性的协议层,让工具、模型、数据集乃至实验仪器能够跨平台、跨机构互联…
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
Sebastian Raschka(AI 研究者、前威斯康星大学麦迪逊分校教授)在 2026 年 7 月 18 日发表了一篇深度技术博文,系统解释了 LLM 如何在推理时切换低/中/高三种「精力」(effort)推理模式,以及这些能力在训练阶段是如何被注入的。 这不是一篇泛泛的科普文,而是从 RLVR 训练机制、思维链格式的真正作用,到 Qwen3 的「思维…
利用 X MCP(Model Context Protocol)工具让 AI 代理自动抓取指定高信噪比账号的 X 帖子,生成一份自包含的 HTML Artifact(或存为知识库),构建属于你自己的个性化 AI 资讯日报。 核心思路是:把 X 变成一个结构化的 AI 新闻 API,由代理自动完成「筛选账号 → 抓取内容 → 渲染输出」的全流程,每天早上打开浏…
2026 年 7 月 14 日上传至 arXiv 的一篇97 页大survey(arXiv:2607.13104),由 DAIR.AI 团队(Zhe Ren、Yimeng Chen 等)联合 Jürgen Schmidhuber 等人撰写。配套 GitHub 仓库 selfimprovingagent/awesomeSelfImprovingAgents 提…
LangChain 于 2026 年 7 月 18 日在 X 宣布将其内部「软件工程 Agent 全链路工具栈」完全开源,CEO Harrison Chase 表示:「我们已经在内部建好了一整套软件工程 Agent 工厂,并把每个组件都开源了。」 这套体系由四个独立但可协同的工具组成: | 组件 | 定位 | 入口 | |||| | Dcode (Deep …
GPT5.6 是 OpenAI 于 2026 年 7 月 9 日正式发布的第五代 GPT 主线模型,采用了与前代完全不同的三级档位 + 多档推理努力度矩阵: 三档(Tier) | 档位 | 定位 | 输入价格 ($/1M tokens) | 输出价格 ($/1M tokens) | ||||| | Sol | 前沿旗舰,对应此前不带后缀的 GPT5 | $5…
Sakana Fugu 是 Sakana AI 在 2026 年发布的多智能体编排系统,其核心是一个 7B 参数的 Conductor 模型。该模型不自己解题,而是像"管理者"一样动态决定: 调用哪些专家模型(worker pool 包含 GPT5.5、Gemini 3.1 Pro、Claude Opus 4.8 等) 每个 worker 分配什么任务 wo…
Sakana AI 在 ICLR 2026 发表了一篇非常有意思的论文:让一个小模型学会当「指挥家」,而不是自己下场干活。 传统多智能体系统的做法是:人类预先写好流水线(planner → coder → verifier),然后让模型按这个固定流程走。问题在于:不同任务复杂度差异巨大——简单事实问答根本不需要 5 步 pipeline,而复杂编程题可能需要…
LibreCode 是一个完全本地运行的开源 AI 代码编辑器,基于 .NET 10 和 Avalonia UI 构建,声称是"Ollama 版 Cursor"。它不依赖 Electron、不跑 Web View,直接调用 Ollama 的本地大模型完成 AI 辅助编程,同时内置了一个专业级逆向工程工具包,支持 .NET 程序集、WebAssembly(.w…
astridruntime/book 是 Unicity Astrid OS 的权威技术参考文档,同样基于 mdBook 构建。它是理解 Astrid 操作系统内部设计的完整手册,面向构建 Capsule(胶囊)或深入理解系统架构的开发者。 Astrid OS 是一个专为 AI Agent 设计的操作系统,它的核心设计哲学是:像操作系统对待进程一样对待 AI…
unicityastrid/handbook(当前托管于 astridruntime/handbook)是 Unicity Astrid OS 贡献者手册,一本用 mdBook 构建的电子书籍,面向直接在 Astrid 操作系统源码层面工作的开发者,而非使用 Astrid 构建 AI 应用的终端用户。 如果你在构建一个 Capsule(胶囊,即 Astrid…
ZenML 是一个面向 ML/AI 工程师的统一 AI 平台,核心价值主张是:一次编写,随处运行——用 Python 装饰器定义管道(pipelines)和步骤(steps),ZenML 自动处理容器化、追踪、部署和基础设施抽象,让你无需改动代码即可在本地、Kubernetes、云端之间切换。 ZenML 的定位介于实验追踪工具(MLflow、W&B)和完整…
unicityastrid/book(仓库实际重定向至 astridruntime/book)是 Unicity Astrid OS 的权威参考文档,以 mdBook 格式编写,涵盖内核(kernel)、胶囊模型(capsule model)、宿主 ABI(host ABI)、事件总线(the bus)和安全模型(security model)五大主题。它不…
Zerolang(zero)是 Vercel Labs 出品的实验性图原生(graphnative)编程语言,专为 AI Agent 设计。它的核心思路是:程序不是文本文件,而是一张语义图(semantic graph);Agent 通过查询图、提交经过检查的编辑来构建程序,而非直接操作原始文本。这样 Agent 的每次修改都会经过编译器的语义校验,从根本上…
Void 是一个基于 VS Code 的开源 AI 代码编辑器,由 YC 支持的初创公司 Glass Devtools 开发。它在 VS Code 基础上引入了 AI Agent 能力——支持在代码库上运行 AI Agent、Checkpoint 可视化、以及任意模型或 API 的本地接入。数据直接发送给提供商,不在 Void 侧留存。 ⚠️ 重要状态:Vo…
DocsGPT 是一个开源的私有 AI 知识库与 Agent 构建平台,专注于让团队在完全私有化的环境下,对文档、代码库、内部知识进行 AI 问答与智能搜索。它融合了 RAG(检索增强生成)、多模型支持、Deep Research 模式和低代码 Agent 可视化构建器,适合企业和开发者私有部署。 核心定位:把 LangChain + RAG + Agent…
ClearML 是一个开源的 ML/DL/GenAI 全栈开发与生产平台,涵盖实验管理(Experiment Manager)、数据管理与版本控制(HyperDatasets)、MLOps/LLMOps 编排(Agent + Orchestration)、模型服务(Model Serving)、报表与可视化(Reports)五大模块。用作者自己的话说:解决的…
NapMem(Navigate over Pyramid Memory)是阿里巴巴 Qwen 团队与多所高校在 2026 年 7 月 7 日联合发布的论文提出的框架,核心思想是:把长期用户记忆从被动检索变成 Agent 可主动探索的结构化动作空间。 目前主流的记忆系统(如 Mem0、Zep、MemoryBank)都是被动 RAG 模式——检索组件从数据库捞取…
Agent Squad 是一个轻量级的多 Agent 编排框架,核心思路是把用户请求通过分类器(Classifier)路由到最合适的专属 Agent,同时维护跨 Agent 的对话上下文。它最早托管于 AWS Labs(awslabs/agentsquad,原名 multiagentorchestrator),现由 2FastLabs 维护。 框架有三个运行…
awesomejavascript 是由前端知名技术博主 sorrycc(子溯)维护的 JavaScript 库精选列表,目前 GitHub 星标 35,000+,是前端领域最有影响力的 awesome 系列清单之一。 它的本质是一份分类清晰、精选校对过的浏览器端 JavaScript 资源目录,覆盖从包管理器、模块加载器、构建工具,到框架、UI 组件、可视…
Coze Loop 是字节跳动 Coze(扣子)平台推出的AI Agent 全生命周期运营平台,最近将核心模块开源(Apache 2.0)。它解决的是 AI Agent 开发过程中"写 Prompt → 调试 → 评估效果 → 上线监控"这一整条链路的工程化问题。 开源版提供三大核心能力:Prompt 开发和调试(Playground)、自动化评估(Eval…
mcpuse 是一个全栈 MCP(Model Context Protocol)开发框架,帮助开发者快速构建 MCP Servers(工具服务器)和 MCP Apps(可交互的 AI 应用组件),同时提供 MCP Client / MCP Agent 客户端实现,内置 Web 版 Inspector 调试工具,并支持一键部署到 Manufact MCP Cl…
Nacos(Name and Configuration Service)是阿里巴巴开源的动态服务发现、配置管理和服务管理平台,专为云原生应用和微服务架构设计。它于 2018 年开源,2020 年成为 Apache 顶级项目(TLP),是 Java 微服务生态中最为流行的注册中心与配置中心之一。 Nacos 官方站: 核心四大能力: 1. 服务发现与健康检查…
SurfSense 是开源的竞争情报(Competitive Intelligence)平台,专为 AI Agent 设计,可以理解为「面向 AI Agent 的 NotebookLM + 实时数据抓取」。 它让 AI Agent 能够实时抓取 Reddit、YouTube、Instagram、TikTok、Google Maps、Google Search…