2026 年 9 月 11 日,Simon Willison 和 Alex Garcia 联合发布 Datasette 两个安全补丁版本——1.0a39(当前 alpha 系列)和 0.65.4(stable 系列),修复了一批权限相关漏洞。这批漏洞由 Sevban Dönmez 提交 AI 辅助报告后,触发了一次完整的 coding agent 安全审计,…
仓库攻略
581 篇 · 569 个项目 · jay
NeoHorse1 是 TokenRhythm 发布的一个 Agent 原生语言模型家族,包含 4B 和 9B 两个规模,均从 Qwen3.5 后训练而来,定位是「递归自改进(RSI)」路径上的初始原型。 官方将其描述为「agentnative」——模型从一开始就不是为通用对话设计的,而是专门针对工具调用、编码、Agent Harness 场景、指令遵循这四…
Rodney 是 Simon Willison 用 Go 编写的命令行浏览器自动化工具,基于 gorod/rod 库实现。与 Playwright/Puppeteer 等面向人类开发者的工具不同,Rodney 从第一天起就是为 coding agent 和 shell 脚本设计的。 核心设计:Chrome 以长驻进程运行(通过 Chrome DevTools…
commitrewriter 是 Simon Willison(@simonw)9 月 14 日发布的本地 Web 应用,用于批量编辑 Git 仓库的提交信息。核心使用场景是:Coding Agent 生成的提交记录往往带有大量"机器腔"——冗长的内部 ID 引用、不适合公开的 issue 编号、重复的 agent 生成 boilerplate。Simon …
Mannered Prose(花哨文体) 是 Anthropic 在 2026 年 9 月发布的 Prompting Claude Fable 5.1 官方指南 中定义的一种写作风格缺陷——用比喻和修饰取代直接陈述。Anthropic 给出了一段精确的定义,DAIR.AI 创始人 elvis(@omarsar0)于 9 月 7 日在 X 上分享后,引发社区大…
Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses 是 Airbnb 团队(Cen Mia Zhao、Haibo Ruan、Wenjie Chen 等)发表在 EMNLP 2026 的论文,核心命题: 给定一个固定模型,Agent 的质量提升来源不是换模型,而是优化它周围的 har…
一个由 GPT6 Astra(Medium)+ OpenAI Codex 模式驱动的 AI 编码智能体,在 macOS 上自动调用本地已安装的 Blender 桌面应用,通过 Blender Python API 生成可编辑的 .blend 三维场景文件,并渲染出成品图像。 整个过程完全由自然语言驱动——用户只给了三句提示词,AI 自己: 1. 写 Pyth…
Extract Turbo 是 LlamaIndex(LlamaParse / LlamaExtract)平台在 2026 年 9 月发布的全新文档抽取 tier,处于 beta 阶段,主打极致低延迟,目标场景是 extraction 位于用户响应路径上的实时工作流。 LlamaParse 是 LlamaIndex 的核心商业产品,提供 Parse(文档解析…
Marigold V2 是一套将预训练图像生成扩散 Transformer(DiT)低成本改造为单目深度估计器的完整方案——包括模型族和可复现微调协议。2026 年 9 月 8 日由华为苏黎世实验室( Huawei Bayer Lab)、EPFL 和博洛尼亚大学联合开源,已被 ACM Transactions on Graphics 接收(SIGGRAPH …
Pentest Swarm AI 是一个基于真实群智(Swarm)架构的开源渗透测试引擎,由 Go 语言编写,支持 Claude、GLM、Qwen、DeepSeek、Gemini、Ollama 等任意具备 functioncalling 能力的 LLM。与传统多 Agent 工具「单 Planner 按固定顺序调用各阶段」不同,Pentest Swarm A…
Uno(发音「乌诺」)是 IFM(Institute of Foundation Models)团队开源的离散扩散增强型 LLM 推理框架,核心思想是:不让扩散模型取代自回归模型,而是让扩散模型辅助自回归模型并行生成多个 token,从而在保持输出无损的前提下显著提升吞吐。 传统 LLM 推理慢在「串行」——每个 token 必须等前一个 token 生成完…
AuK(发音接近 "auk",一种海鸟)是腾讯混元(Tencent Hunyuan)于 2026 年 9 月 9 日 开源的多任务语音生成与编辑统一模型,arXiv 论文编号 2609.08936,MIT 许可证,代码与权重全部公开。 核心定位:一个模型、一套指令格式,覆盖 5 大类 20+ 任务,不再需要为每个子任务部署独立模型。 传统语音系统把 TTS、…
Xberg 是用 Rust 编写的多格式文档智能提取引擎,下一代 Kreuzberg v4。声称支持 107 种文档格式 / 141 种文件扩展名 / 371 种编程语言,提供 15 种语言绑定(Python、Node.js、Rust、Go、Java、C#、Ruby、PHP、Elixir、Dart、Swift、Zig、WASM、Kotlin、C FFI),零…
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails 是 Salesforce AI 团队(Zhou Yu、Bin Bi 等)的研究,核心研究问题: 在企业级 Agent 场景下,Harness 演化(优化…
Sebastian Raschka(@rasbt)在 2026 年 9 月 6 日发布的视频与博客文章,属于其「从零手写推理模型(Reasoning from Scratch)」系列第 2 期。核心内容是从零用 PyTorch 实现 KV Cache(KeyValue 缓存),让 LLM 在逐 token 自回归生成时跳过重复计算,从而大幅提升推理速度。 这…
2026 年 9 月 8 日,Salesforce AI 研究团队发布了论文 "CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails"(arXiv:2609.09134)。论文研究了一个核心问题:当小模型配…
论文 "Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses"(arXiv:2609.05736,EMNLP 2026)来自 Airbnb 团队,核心贡献有两层: 第一层:量化评估协议。 论文指出,对 harness(围绕固定模型的运行时控制层)的优化效果不能只看均值提升,必须在预算…
wllama 是 ngxson(XuanSon Nguyen)维护的 WebAssembly + WebGPU 绑定库,让 llama.cpp 可以在浏览器内直接运行大语言模型推理,2026 年 9 月 5 日他发布了 首个浏览器内微调(finetuning)PoC,证明在 WebGPU 上训练 LLM 是可行的。@maximelabonne(Liquid …
Open Science Desktop(简称 OSD,原名"Open Science",v0.5.2 为当前最新版)是一个本地优先、模型无关的 AI 科研工作台,面向 macOS、Windows 和 Linux。它用 Tauri 构建桌面外壳,内嵌 OpenCode 运行时,通过 MCP 协议连接科学数据库和 agent 技能,可以完成从文献调研、实验设计…
Webcmd 是一个面向 AI 编程 agent 的自学习浏览器基础设施。它的核心思路很直接:让 agent 在真实浏览器中完成任务,同时把网站的结构知识(sitemap、action space、pitfalls)留在本地,下次同类任务不再重复探测,直接从记忆启动。据 README 描述,理论上可将浏览器 agent 的 token 消耗降低 90%。 它…
Sebastian Raschka(@rasbt)在 X 上分享的 LLM Memory Calculator,是一个基于 his LLM Architecture Gallery 构建的在线交互计算器。 它的核心价值在于:把 LLM 推理时的内存估算拆成两个互不相关的部分——模型权重内存和 KV Cache 增长——让你可以独立调节上下文长度或批量大小,观…
STAIR(STructure Aware Information Retriever)是 IBM Research 在 2026 年 9 月发表的一篇论文(arXiv:2609.03874)提出的检索系统,核心思路是: 用文档的目录(Table of Contents,ToC)替代传统的固定长度 chunk,作为 RAG 的检索单元。 现有 RAG 系统将…
ChromaFs 是 Mintlify 在 2026 年 3 月发布的一种虚拟文件系统(Virtual Filesystem)实现,它把 Chroma 向量数据库包装成 Agent 可用 ls、cat、grep、find、cd 等 UNIX 命令操作的"文件系统",从而替代传统的 naive RAG 方案。 核心洞察来自 Mintlify 工程师 Dens …
Compile by Training(CbT)是 ProgramasWeights(PAW) 范式的第二代编译器,由 Yuntian Deng、Pengyu Nie、Stuart Shieber 三位作者在 EMNLP 2026 System Demonstrations 会上发布。它做的事情很直接:把你用自然语言描述的模糊文本函数,编译成一个可以完全离线…
Looped Transformer(循环 Transformer),也称 Recurrent Depth 或 Looped Depth Sharing,是一种在训练和推理时将同一组 Transformer 层重复应用多次的架构设计。与传统 Transformer 每个 token 只经过一层 stack 一次不同,Looped Transformer 会让…
LLMAPIKeyProxy 是一个自托管的统一 LLM 网关,通过单个 OpenAI / Anthropic 兼容端点,接入所有主流 LLM 提供商(Gemini / OpenAI / Anthropic / OpenRouter / Groq / Mistral / NVIDIA / Cohere 等)。所有请求通过模型的 provider/model_…
Neo.mjs 是一个自演进软件有机体——一支专业端到端 AI 工程团队,跨模型(Claude / Gemini / GPT 等) swarm 协同,通过 Neural Link(神经链接)进驻实际应用,在内存核心(Memory Core)、知识库(Knowledge Base)、Native Edge Graph、A2A 协调层上自主完成从构思到构建到交叉…
AI Research Preference Models(RPMs)是 Meta FAIR 团队(联合牛津大学、UCL)提出的一种新方法,核心问题是:AI 研究 Agent 能提出远多于能跑实验的候选方案,但 GPU 预算有限,如何在跑之前就知道哪个最值得跑? RPM 的思路是:不预测绝对分数(论文发现 LLM 在预测具体指标上不可靠),而是用预训练冻结的…
浏览器内 LLM 微调(Inbrowser Finetuning on WebGPU)指的是不依赖任何服务器端 GPU,直接在浏览器 Tab 内通过 WebGPU API 对语言模型进行反向传播训练(backpropagation),输出可用的 LoRA 适配器权重。 这一进展由独立开发者 XuanSon Nguyen(@ngxson)在 2026 年 9 …