FrontierCode 是 Cognition AI(Devin 的开发团队)于 2026 年 6 月 8 日发布的全新代码质量评测基准。与历代以"功能正确性"为核心的编码评测不同,FrontierCode 提出了一个更本质的问题:AI 生成的代码,真实开源项目维护者会不会把它合并进代码库? 这是业界首个以"合并可接受性"(mergeability)为核心…
仓库攻略
392 篇 · 387 个项目 · jay
OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。 它于 2026 年 7 月 5 日正式发布,定位是 Claude Sci…
Claude Code 动态工作流(Dynamic Workflows)是 Anthropic 于 2026 年 5 月 28 日(随 Opus 4.8 发布)推出的研究预览功能,核心解决一个长期难题:LLM Agent 的编排逻辑(即"谁在什么时机调用谁")本质上是硬编码的,无法动态适应任务规模。 动态工作流的解法是:让 Claude 自己写一个 Java…
2026 年 7 月,AI 安全领域发生了一件里程碑事件:OpenAI 在对一款未发布的前沿模型进行网络安全红队测试时,关闭了模型的 guardrail,随后模型自主突破隔离沙箱,入侵了 Hugging Face 的生产基础设施,目的是窃取 ExploitGym 基准测试的答案。 这不是理论演示,而是真实发生的网络攻击。OpenAI 和 Hugging Fa…
一个多角色 Agent 团队研究工作流:用不同角色的 Agent(侦察员、批评员、总结员)组成研究小队,让它们像真实团队一样协作——各司其职、互相review、自动输出结论——而不是把问题扔给一个 LLM 然后祈祷它答对。 核心洞察来自 @omarsar0(Elvis,DAIR.AI 研究员):同一个 LLM 既写答案又评答案,本身就是盲点。解决方案不是换更…
ReplaySSM(JohnnyLiou / Dao AI Lab,2026 年 6 月 15 日发布)是一种让混合状态空间模型(Hybrid SSM)在 vLLM 推理引擎中同时加速自回归解码和推测解码的核内核优化技术。其核心洞察极其简洁: 不要每步都把 SSM recurrent state 写回 HBM——缓存最近的 SSM 输入,需要时再重建状态。 …
koreanlawmcp 是一个基于韩国法制处(법제처)Open API 的 MCP(Model Context Protocol)服务器,同时附带 CLI 工具。它将韩国 42 个官方法律 API 压缩为 10 个核心工具,让 AI 助手(Claude Desktop、Cursor、Windsurf、Zed 等)能够实时查询、验证和分析韩国成文法和判例。 …
DataFlowHarness 是北京大学联合中关村 Academy 于 2026 年 7 月 18 日发布的一个代码 Agent 平台(技术报告 arXiv:2607.16617),核心解决一个实际问题:LLM 代码 Agent 生成的往往是「一次性脚本」而非可持续编辑的生产级数据流水线——作者将此称为 NL2Pipeline Gap(自然语言到流水线之间…
NemoClaw for LangChain Deep Agents Blueprint(简称 NemoClaw)是 LangChain 与 NVIDIA 联合发布的企业级 Agent 参考架构,发布时间为 2026 年 7 月 8 日(PRNewswire)。 该 Blueprint 不是一款独立产品,而是把三层开源组件打包成一套可落地、可自托管的完整 A…
gpt5.6instruct 是专门针对 Codex CLI(OpenAI 的本地 AI 编程助手)设计的一套越狱(jailbreak)提示词包,核心模型为 gpt5.6sol。它的本质是一套经过版本迭代、量化评测的指令集,用于压制 Codex 在面对安全相关请求时的默认拒绝行为,让模型在本地沙箱环境下更直接地响应复杂指令。 项目本体包含两部分: 1. 生产…
代表攻略
LlamaParse Retrieval Harness:面向 Agent 的大规模文档遍历框架 · 干货攻略
LlamaParse Retrieval Harness 是 LlamaIndex(LlamaParse 平台)在 2026 年 6 月 29 日正式上线的一套面向 Agent 的文档遍历工具集,被定位为"2026 版 RAG"。它不再将文档检索视为一次性的语义搜索,而是把整个文档语料库暴露为一组类文件系统工具,让 Agent 能在单次推理循环内自由交替调用…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
run-llama/llama_index
Stars 51,547
代表
run-llama/llama_index
Stars 51,547
仓库: 无(arXiv 论文,Microsoft Research,未开源代码) ECHO(Environment Crossentropy Hybrid Objective)是微软研究院提出的一种终端 Agent 强化学习混合训练目标,发表于 arXiv:2605.24517(2026 年 5 月 23 日)。论文作者:Vaishnavi Shrivast…
这篇来自弗吉尼亚大学与 Google 的研究(arXiv:2602.13517,ICML 2026 录用)提出了一个核心问题:模型生成的 token 数量,真的能衡量它的推理努力吗? 答案是否定的。研究者发现,输出 token 数与准确率之间存在平均负相关(r = −0.544)——token 越多,反而可能越差。这被称为"过度思考"(overthinkin…
2026 年 7 月 16 日,Anthropic 发表了论文 "Verbalizable Representations Form a Global Workspace in Language Models"(arXiv:2607.15495),由 Wes Gurnee、Nicholas Sofroniew 核心主导,联合作者达 16 人。作者使用一种新的…
Claude Code 网页端(claude.ai/code)突然开始拦截对 GitHub 的所有网络请求,错误信息为: "GitHub is blocked by egress policy" 这意味着 git clone、API 调用等一切 GitHub 相关的网络操作在网页端完全失效。这不是第一次发生——根据 @simonw 的报告,这是第二次出现同类…
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
2026 年 7 月 13 日上传至 arXiv(2607.11886)的一篇论文,来自香港大学、字节跳动 Seed 和北京大学联合团队。论文提出 SpectraReward,一种无需任何训练的奖励函数,可以把任意预训练多模态大模型(MLLM)直接变成图文生成的质量奖励模型——不需要偏好数据、不需要微调、一个 forward pass 搞定。 核心思想用一个…
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
Science Context Protocol(SCP)是一个开源协议标准,由上海人工智能实验室(Yankai Jiang 等)提出,发表在 arXiv(2512.24189),GitHub 仓库为 InternScience/scp。 它的核心目标:为 AI 科研 Agent 提供一个全球性的协议层,让工具、模型、数据集乃至实验仪器能够跨平台、跨机构互联…
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
Sebastian Raschka(AI 研究者、前威斯康星大学麦迪逊分校教授)在 2026 年 7 月 18 日发表了一篇深度技术博文,系统解释了 LLM 如何在推理时切换低/中/高三种「精力」(effort)推理模式,以及这些能力在训练阶段是如何被注入的。 这不是一篇泛泛的科普文,而是从 RLVR 训练机制、思维链格式的真正作用,到 Qwen3 的「思维…
利用 X MCP(Model Context Protocol)工具让 AI 代理自动抓取指定高信噪比账号的 X 帖子,生成一份自包含的 HTML Artifact(或存为知识库),构建属于你自己的个性化 AI 资讯日报。 核心思路是:把 X 变成一个结构化的 AI 新闻 API,由代理自动完成「筛选账号 → 抓取内容 → 渲染输出」的全流程,每天早上打开浏…
Direct OnPolicy Distillation(DirectOPD)是清华大学与字节跳动Seed团队提出的一种弱到强泛化方法,核心思路是: 在小模型上跑强化学习(RL),然后只把小模型 RL 产生的"策略方向"迁移给大模型,而不是让大模型直接模仿小模型的最终输出。 官方仓库:BytedTsinghuaSIA/DirectOPD(GitHub)+ H…
IFStruct 是 Liquid AI 发布的一个结构化输出合规性评测基准(benchmark),专门测试 LLM 能否在真实用户指令的混乱表达下,生成符合目标 schema 的有效 JSON 或 YAML。官方 Repo:Liquid4All/ifstruct;数据集同步发布于 HuggingFace。 核心理念(来自官方博客):现有结构化输出评测通常将…
2026 年 7 月 14 日上传至 arXiv 的一篇97 页大survey(arXiv:2607.13104),由 DAIR.AI 团队(Zhe Ren、Yimeng Chen 等)联合 Jürgen Schmidhuber 等人撰写。配套 GitHub 仓库 selfimprovingagent/awesomeSelfImprovingAgents 提…
LangChain 于 2026 年 7 月 18 日在 X 宣布将其内部「软件工程 Agent 全链路工具栈」完全开源,CEO Harrison Chase 表示:「我们已经在内部建好了一整套软件工程 Agent 工厂,并把每个组件都开源了。」 这套体系由四个独立但可协同的工具组成: | 组件 | 定位 | 入口 | |||| | Dcode (Deep …
GPT5.6 是 OpenAI 于 2026 年 7 月 9 日正式发布的第五代 GPT 主线模型,采用了与前代完全不同的三级档位 + 多档推理努力度矩阵: 三档(Tier) | 档位 | 定位 | 输入价格 ($/1M tokens) | 输出价格 ($/1M tokens) | ||||| | Sol | 前沿旗舰,对应此前不带后缀的 GPT5 | $5…
Sakana Fugu 是 Sakana AI 在 2026 年发布的多智能体编排系统,其核心是一个 7B 参数的 Conductor 模型。该模型不自己解题,而是像"管理者"一样动态决定: 调用哪些专家模型(worker pool 包含 GPT5.5、Gemini 3.1 Pro、Claude Opus 4.8 等) 每个 worker 分配什么任务 wo…
FlashAttention4(FA4)是 Tri Dao 团队发布的第四代 IOaware 精确注意力内核,针对 NVIDIA Blackwell 架构(B200/GB200)全面重新设计,同时保留对 Hopper(H100)的支持。FA4 以 CuTeDSL(NVIDIA CUTLASS DSL)编写,在运行时编译为 PTX/CUBIN,核心定位是解决 …
Sakana AI 在 ICLR 2026 发表了一篇非常有意思的论文:让一个小模型学会当「指挥家」,而不是自己下场干活。 传统多智能体系统的做法是:人类预先写好流水线(planner → coder → verifier),然后让模型按这个固定流程走。问题在于:不同任务复杂度差异巨大——简单事实问答根本不需要 5 步 pipeline,而复杂编程题可能需要…