The Handoff Tax: Continuing NonNative Trajectories in LLM Agents 是 AWS Agentic AI 团队 Roy Ganz、Mor Shpigel Nacson、Adi Kalyanpur、Ron Litman 四人于 2026 年 8 月 25 日发表在 arXiv(2608.24358)的研…
仓库攻略
581 篇 · 569 个项目 · jay
Agent Seer 是苹果机器学习研究团队(Harish Karumuri、Mahesh Vemula、David Lopes Pegna)2026 年 6 月发表的一篇论文(arXiv:2608.26133,同年 8 月被 GEM@ACL 2026 接收),核心主张是:只需一个 MCP 协议规范文件,无需任何示例对话、无需真实工具调用、无需领域调优,就能…
LangSmith 的 Trace 级成本可观测性(Cost Tracking at Trace Level) 是一套将 LLM/Agent 每次运行的费用直接绑定到执行链路的技术能力。传统 AI 应用只知道「这个月 API 账单是 X 美元」,而 trace 级成本追踪让你知道「是哪个 workflow、哪次 tool call、哪条 prompt pat…
SAM(Sovereign Agent Mesh)是由 Google 开发的一个零配置、零信任的 P2P 网络,专为自主 AI Agent 设计。它让 AI Agent 节点自动发现彼此、互相认证,并通过标准 MCP(Model Context Protocol)协议跨节点调用工具——不依赖将内部脚本或 API 暴露到公网。 当前状态:公开测试网(banan…
Strata 是一个为现代 Linux 桌面打造的高速、键盘优先文件管理器,核心设计面向 Omarchy 发行版,同时兼容标准 GTK4 Linux 环境。它将空间 Miller 列(多栏导航)+ 网格视图 + 资源管理器视图三合一,配合即时模糊搜索、丰富预览和原生桌面集成,适合重度键盘用户替代 Nautilus/Dolphin。 Linux 桌面文件管理器…
Tons of Skills 是一个面向 Claude Code 的开源插件技能市场,由 Jeremy Longshore(Intent Solutions)维护。它将散落在各处社区的 Claude Code 技能(Skill)打包成可发现、可安装、可评级的插件集合,通过 npm 包 + Web 界面双通道分发。截至 20260819 数据:471 个插件、…
2026 年上半年,两家科技巨头先后因 AI 编码工具成本失控被迫踩刹车: 这不是两个孤立事件。《FinOps Foundation》数据显示,2026 年有 98% 的从业者需要管理 AI 支出,而一年前这个比例是 63%——AI 成本管理是史上普及最快的成本管控领域。Gartner 预测,到 2027 年底超过 40% 的 Agentic AI 项目将因…
VGIBench(Visual General Intelligence Benchmark)是一个用于探测视频生成模型视觉智能的标准化评测基准,于 2026 年 8 月 20 日在 arXiv 发布(arXiv:2608.19583),目标投稿 EMNLP 2026 Main。论文来自伊利诺伊大学香槟分校、清华大学、滑铁卢大学、MIT 等机构联合团队。 传…
TexLite 是西南财经大学 DB 研究组开源的轻量级自托管协作 LaTeX 编辑器,旨在为小型可信研究团队提供 Overleaf 的本地替代方案。核心技术栈:React 前端 + CodeMirror 编辑器 + Fastify API + SQLite 本地持久化 + Yjs 实时协作 + PM2 进程管理。默认配置仅需 Node.js 进程、SQLi…
LLM CLI 是 Simon Willison 用 Python 写的命令行工具,同时也是一个 Python 库,用于对接 OpenAI、Anthropic、Google Gemini、Qwen、Gemma、Mistral 等数十家模型厂商的 API,并支持本地模型(通过 Ollama、LM Studio 等兼容端点)。8 月 4 日发布的 0.32 是该…
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工薪层(workhorse)模型,主打编码和 Agent 场景,定位为"有史以来最智能的工作负载模型"。它基于 Gemini 3.6 Flash 的算法改进版(model card 将所有架构细节指向 3.6 Flash),上下文窗口 1,048,576 tokens…
BTL3(Bad Theory Labs 3)是 Bad Theory Labs 发布的一个后训练 PEFT LoRA 适配器,基座为 Qwen/Qwen3.627B,定位于编程 Agent、仓库级工具调用、长程多轮执行场景。 核心规格(均来自 Hugging Face 官方模型卡与 GitHub README): | 项目 | 规格 | ||| | 基座模…
Fess 是一款开源的、自托管的企业级搜索服务器,基于 OpenSearch 构建。通过浏览器管理界面配置,无需深入了解 OpenSearch 本身。内置爬虫支持网站、文件系统、数据库等多种数据源,支持全文检索、分面搜索、搜索建议、权限过滤等企业级功能。 本质上是「开源版 Google Search Appliance / Elasticsearch Sit…
Luxas 是一个开源的多 Agent 自主科研系统,输入一个研究主题(Research.md),它能自动完成:文献爬取(OpenAlex、arXiv、CrossRef,含反检测浏览器绕过付费墙)→ 阅读论文 → 设计并运行实验(多个 Agent 盲写代码和测试)→ 产出可发表级别的图表 → 撰写 LaTeX 报告 → 对抗性内容+图表+排版审查 → 最终输…
Gold Band 是一款面向本地 AI Coding Agent 的桌面客户端(Developer Preview),通过 ACP(Agent Client Protocol) 协议连接 Claude Code、Codex 等本地 Agent,在统一的桌面界面中管理会话、工作流、权限、附件、历史和运行时可观测性。 解决的核心问题是:本地 Agent 虽然强…
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自 Raschka 官方 LLM Architecture Gallery(sebastianraschka.com/llmarchitecturegallery)及其杂志文章「A Dream of Spring for OpenWeight LLMs: 10 Architectures f…
AutoSaddler 是微软研究院提出的自动 Agent Harness 优化框架,将 Harness 的改进建模为离线学习问题,用"失败信号"指导迭代更新。简单说:它让 AI 自动分析 Agent 的执行失败记录,像程序员修 Bug 一样给 Harness 打补丁——区别在于它打的是结构化补丁(prompt 规则、工具定义、中间件逻辑),并通过验证选择泛…
gadak 是一个把 Jira 和 Confluence 同步到本地 SQLite 文件的开发者工具。它的核心价值主张很简单:把远程 API 调用变成本地 SQL 查询,让"哪个 Epic 实际卡住了?"这种需要 GROUP BY 的问题,从"无法回答"变成一条 SQL。 支持 macOS 桌面 App、Web UI、CLI 和 MCP 服务器(供 AI 编…
Trigger.dev 是一个用 TypeScript/JavaScript 构建和部署 AI Agent 与工作流的开源平台。它让你在现有代码库里写任务(tasks),然后一键部署到 Trigger.dev 托管基础设施,获得无超时、持久化、带重试和队列的长期运行任务,同时自带完整的链路追踪、日志和可观测性。 核心定位:解决"大模型 Agent 需要跑很长…
一个在 2× NVIDIA GB10(DGX Sparks) 上通过 vLLM 以 EXL3 4bit 量化Serving zaiorg/GLM5.3Flash 的开源配方。核心目标是用 ~164 GiB 的量化权重在消费级双 GB10 机器上跑起百万 token 上下文的 GLM5.3Flash,并附带 DFlash2 投机解码(k=7)加速。 简单说:让…
BDHCQ(Bayesian Dragon Hatchling – Contextual Query)是 Pathway Research 于 2026 年 8 月发表的一种后 Transformer 推理架构,全称「InContext Learning with Recurrent Latent Reasoning」(通过递归潜在推理实现上下文学习)。 核…
SCoPE(SightlineCoordinate Positional Encoding)是腾讯 ARC Lab 与港大、港科大联合提出的视频生成相机控制方法,发表在 2026 年。其核心思想极为优雅:将每条相机视线(camera ray)作为 token 的第二类位置坐标,注入预训练视频 Diffusion Transformer(DiT)的注意力机制,…
codeindexmcp 是一个面向 AI Agent 的代码智能搜索 MCP 服务器。用 treesitter 把代码解析为 AST,把符号、调用关系、元数据存入 SQLite,让 Agent 用 32 个 MCP 工具对代码库进行精确导航——查询延迟约 10ms,全量索引 8.8 万文件耗时 6 分钟。 一句话概括:让 AI Agent 的代码搜索能力,…
Rome 是 agentic OS——一个以 AI Agent 为中心、人类与 Agent 长期协同工作的守卫(guardrailed)环境。与普通对话式 AI 不同,Rome 中的 Agent 不仅执行单次任务,还会随着使用积累工具、SOP、记忆和工作流,每一次交互都在抬高下一次的天花板。 核心哲学来自其 VISION.md:AI 进步的主流叙事在 sca…
SWEBench ProMax 是一个多语言代码重构评测基准,收录 170 个真实 GitHub commit 实例,涵盖 7 种编程语言(Python、Java、TypeScript、Go、C、C++、Rust),于 COLM 2026 发表。 核心定位:填补现有 coding agent 评测体系在大规模跨文件重构任务上的空白。与 SWEbench Ve…
Cameron R. Wolfe(@cwolferesearch,Deep Learning Ph.D.,Netflix 高级研究科学家)于 2026 年 8 月在 Substack 发布的 20,000+ 词 RL for LLMs 终极指南,是他在该话题上所有单篇研究的系统性整合。目标读者是想从第一性原理深入理解 RL 在 LLM 训练中如何工作的工程师…
Perplexity 在 2026 年 8 月 25 日联合 NVIDIA 发布了 Portable Computer——一个将整个 Perplexity Computer Agent 平台完整移植到本地的产品。它不是一个「本地聊天界面加文件选择器」,而是一套把模型、推理引擎、Agent Harness、工具沙盒和应用连接器全部打包在一起的独立系统。 官方原…
mu(读作 /mjuː/)是一个面向人类、AI 代理和服务的通用协议网络。它用一套协议栈(SMTP 收件、IMAP 读件、HTTP 服务、MCP 对接 Agent、XMPP 聊天、x402 支付)把邮件、工具、日历、文件、搜索等 100+ 项能力统一起来,让一个 AI Agent 可以像真人一样拥有自己的邮箱、联系人、日历和文件系统。 它的核心哲学是「地址即…
Apodex 1.1 是 2026 年 8 月 24 日发布的一篇 70+ 作者论文(arXiv:2608.23283),全称 Scaling Agentic Intelligence for Complex Work。论文提出了一个通用 agent 执行系统,核心目标是把语言模型的「推理能力」转化为「可持续完成可验收工作」的能力——作者称之为 Workin…
SmolVM(smolmachines/smolvm)是一个开源的轻量级 microVM 运行时,专门解决 AI Agent 执行 LLM 生成代码时的隔离问题。由 Aniket Maurya 与 Celesto AI 团队开发,Apache 2.0 开源协议,2026 年 4 月 21 日正式发布,GitHub 发布首日即获得 482 个 HN 点。 官方…