commitrewriter 是 Simon Willison(@simonw)9 月 14 日发布的本地 Web 应用,用于批量编辑 Git 仓库的提交信息。核心使用场景是:Coding Agent 生成的提交记录往往带有大量"机器腔"——冗长的内部 ID 引用、不适合公开的 issue 编号、重复的 agent 生成 boilerplate。Simon …
仓库攻略
133 篇 · 129 个项目 · 其它 · jay
Mannered Prose(花哨文体) 是 Anthropic 在 2026 年 9 月发布的 Prompting Claude Fable 5.1 官方指南 中定义的一种写作风格缺陷——用比喻和修饰取代直接陈述。Anthropic 给出了一段精确的定义,DAIR.AI 创始人 elvis(@omarsar0)于 9 月 7 日在 X 上分享后,引发社区大…
Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses 是 Airbnb 团队(Cen Mia Zhao、Haibo Ruan、Wenjie Chen 等)发表在 EMNLP 2026 的论文,核心命题: 给定一个固定模型,Agent 的质量提升来源不是换模型,而是优化它周围的 har…
一个由 GPT6 Astra(Medium)+ OpenAI Codex 模式驱动的 AI 编码智能体,在 macOS 上自动调用本地已安装的 Blender 桌面应用,通过 Blender Python API 生成可编辑的 .blend 三维场景文件,并渲染出成品图像。 整个过程完全由自然语言驱动——用户只给了三句提示词,AI 自己: 1. 写 Pyth…
Extract Turbo 是 LlamaIndex(LlamaParse / LlamaExtract)平台在 2026 年 9 月发布的全新文档抽取 tier,处于 beta 阶段,主打极致低延迟,目标场景是 extraction 位于用户响应路径上的实时工作流。 LlamaParse 是 LlamaIndex 的核心商业产品,提供 Parse(文档解析…
Marigold V2 是一套将预训练图像生成扩散 Transformer(DiT)低成本改造为单目深度估计器的完整方案——包括模型族和可复现微调协议。2026 年 9 月 8 日由华为苏黎世实验室( Huawei Bayer Lab)、EPFL 和博洛尼亚大学联合开源,已被 ACM Transactions on Graphics 接收(SIGGRAPH …
Uno(发音「乌诺」)是 IFM(Institute of Foundation Models)团队开源的离散扩散增强型 LLM 推理框架,核心思想是:不让扩散模型取代自回归模型,而是让扩散模型辅助自回归模型并行生成多个 token,从而在保持输出无损的前提下显著提升吞吐。 传统 LLM 推理慢在「串行」——每个 token 必须等前一个 token 生成完…
AuK(发音接近 "auk",一种海鸟)是腾讯混元(Tencent Hunyuan)于 2026 年 9 月 9 日 开源的多任务语音生成与编辑统一模型,arXiv 论文编号 2609.08936,MIT 许可证,代码与权重全部公开。 核心定位:一个模型、一套指令格式,覆盖 5 大类 20+ 任务,不再需要为每个子任务部署独立模型。 传统语音系统把 TTS、…
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails 是 Salesforce AI 团队(Zhou Yu、Bin Bi 等)的研究,核心研究问题: 在企业级 Agent 场景下,Harness 演化(优化…
2026 年 9 月 8 日,Salesforce AI 研究团队发布了论文 "CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails"(arXiv:2609.09134)。论文研究了一个核心问题:当小模型配…
wllama 是 ngxson(XuanSon Nguyen)维护的 WebAssembly + WebGPU 绑定库,让 llama.cpp 可以在浏览器内直接运行大语言模型推理,2026 年 9 月 5 日他发布了 首个浏览器内微调(finetuning)PoC,证明在 WebGPU 上训练 LLM 是可行的。@maximelabonne(Liquid …
Compile by Training(CbT)是 ProgramasWeights(PAW) 范式的第二代编译器,由 Yuntian Deng、Pengyu Nie、Stuart Shieber 三位作者在 EMNLP 2026 System Demonstrations 会上发布。它做的事情很直接:把你用自然语言描述的模糊文本函数,编译成一个可以完全离线…
Looped Transformer(循环 Transformer),也称 Recurrent Depth 或 Looped Depth Sharing,是一种在训练和推理时将同一组 Transformer 层重复应用多次的架构设计。与传统 Transformer 每个 token 只经过一层 stack 一次不同,Looped Transformer 会让…
浏览器内 LLM 微调(Inbrowser Finetuning on WebGPU)指的是不依赖任何服务器端 GPU,直接在浏览器 Tab 内通过 WebGPU API 对语言模型进行反向传播训练(backpropagation),输出可用的 LoRA 适配器权重。 这一进展由独立开发者 XuanSon Nguyen(@ngxson)在 2026 年 9 …
DisCo(Distillation & Composition)是北京人工智能研究院(BAAI)等团队提出的研究智能体,它不只做研究,还自己构建可执行技能——然后用这些技能反过来提升研究能力。配套产物是 AREXSkill Library:从 1,000+ 个热门 ML 仓库中自动蒸馏出 5,000+ 条已验证技能,覆盖 20 个研究领域和 178 个能力…
Claude Fable 5.1 使用的是与 Claude Fable 5 相同的 tokenizer(该 tokenizer 首次随 Claude Opus 4.7 引入)。相比 Opus 4.7 之前的模型(如 Fable 4、Sonnet 4.6 等),相同文本会多产生约 30% 的 token。 这不是 API 接口的变化——请求格式、流式事件结构完…
Exo 是 a16z 支持的 exoharness/exo 开源框架,定位是「recursive self improvement(RSI,递归自我改进)」的完整 agent + harness 系统。 它本质上是一个完整的 AI agent harness(类似 OpenClaw、Pi 或 Hermes),核心理念是让模型能够看到并修改自己的全部代码和运行…
j anosh/diagrams 是一个开放的学术图表开源仓库,收集了大量物理、化学、机器学习等领域的概念示意图,以 LaTeX (TikZ) 和 Typst 源码形式保存。每个图表配有一个 diagram.yml 元数据文件,仓库附带渲染脚本,可将 .tex / .typ 文件导出为 PDF / SVG / PNG 格式。 作者 Janosh Riebes…
2026年8月,AI 开发者 @abacaj 在 X 上发了一条简短而犀利的观察: "they need to make models that think less, seems to be the only lever they have is how many tokens it generates while thinking" 这条帖获得 4.5K…
一条朴素的二进制考古技巧:用 strings 和 grep 从 Claude Code 的可执行文件中挖出它内置 Bun 运行时的版本号,从而确认 Claude Code 已经切换到 Rust 重写的 Bun(v1.4.0)而非旧的 Zig 版。 核心两行命令: strings ~/.local/bin/claude | grep m1 'Bun v1' c…
2026年9月1日,开发者 Simon Willison 在整理磁盘空间时(使用 OmniDiskSweeper 扫描 ~/.cache/)偶然发现:OpenAI 的桌面版 ChatGPT(由原 Codex 桌面应用 rebranding 而来)在用户本地静默捆绑了约 1.7GB 的完整运行时环境,位于: ~/.cache/codexruntimes/cod…
2026 年 8 月底,LangChain 官方在 langchain==1.4.0a2 中正式加入了基于 FastMCP 协议的 MCP(Model Context Protocol)适配层,使 LangChain/LangGraph Agent 能够直接调用任何兼容 MCP 标准的外部工具服务器。该功能通过独立包 langchainmcpadapters…
2026 年 8 月 20 日,OpenRouter 上悄然出现一个匿名模型 Ox Alpha:无所属、无模型卡、免费使用、1M token 上下文、支持图文视频输入。六天后,它成了 OpenRouter 有史以来最热门的模型,吞吐量是第二名的 2.3 倍。8 月 26 日,Bloomberg 证实其真身——GLM5.3Flash,来自智谱 AI(Zhipu…
LangSmith 的 Trace 级成本可观测性(Cost Tracking at Trace Level) 是一套将 LLM/Agent 每次运行的费用直接绑定到执行链路的技术能力。传统 AI 应用只知道「这个月 API 账单是 X 美元」,而 trace 级成本追踪让你知道「是哪个 workflow、哪次 tool call、哪条 prompt pat…
2026 年上半年,两家科技巨头先后因 AI 编码工具成本失控被迫踩刹车: 这不是两个孤立事件。《FinOps Foundation》数据显示,2026 年有 98% 的从业者需要管理 AI 支出,而一年前这个比例是 63%——AI 成本管理是史上普及最快的成本管控领域。Gartner 预测,到 2027 年底超过 40% 的 Agentic AI 项目将因…
LLM CLI 是 Simon Willison 用 Python 写的命令行工具,同时也是一个 Python 库,用于对接 OpenAI、Anthropic、Google Gemini、Qwen、Gemma、Mistral 等数十家模型厂商的 API,并支持本地模型(通过 Ollama、LM Studio 等兼容端点)。8 月 4 日发布的 0.32 是该…
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工薪层(workhorse)模型,主打编码和 Agent 场景,定位为"有史以来最智能的工作负载模型"。它基于 Gemini 3.6 Flash 的算法改进版(model card 将所有架构细节指向 3.6 Flash),上下文窗口 1,048,576 tokens…
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自 Raschka 官方 LLM Architecture Gallery(sebastianraschka.com/llmarchitecturegallery)及其杂志文章「A Dream of Spring for OpenWeight LLMs: 10 Architectures f…
BDHCQ(Bayesian Dragon Hatchling – Contextual Query)是 Pathway Research 于 2026 年 8 月发表的一种后 Transformer 推理架构,全称「InContext Learning with Recurrent Latent Reasoning」(通过递归潜在推理实现上下文学习)。 核…