reflex 是一个小型、可在自有 GPU 上跑的「决策模型」(decision model)。它把一段输入(工单、文档、照片、JSON 状态)和若干固定选项的问题一次给到基于 Qwen3.54B 的推理后端,同时输出每个选项的校准概率,并直接告诉你置信度(confidence)。它不输出自由文本,只输出数字,所以结果永远落在你给定的选项里——结构上不可能「…
仓库攻略
154 篇 · 150 个项目 · 其它
ChessFly 是 Liquid AI 研究员 Maxime Labonne 开源的一个实验项目:把果蝇(Drosophila melanogaster)雄性成虫全脑连接组(connectome) 作为神经网络骨架,训练它下棋。 连接组(connectome)是什么?简单说就是神经元之间所有连接的完整 wiring diagram——相当于大脑的"电路图"…
ChessFly 是一个用真实果蝇(_Drosophila melanogaster_)全脑连接组(Connectome)驱动的神经网络下棋项目。作者 Maxime Labonne 将 FlyWire 的果蝇神经系统重建数据训练成了一个可以下棋的神经网络,并开源了模型权重和浏览器在线 Demo。 核心数据(来源:Hugging Face 官方模型卡,下方有核…
WHALE(WeightHarness Alternating LEarning)是 KRAFTON AI 与斯坦福大学联合提出的一种联合优化配方,核心思路极为简洁:将 Agent 系统拆成两个独立模块——模型权重(weights)和Harness 代码,交替优化,每次只动一个、固定另一个,循环往复逼近联合最优解。 官方定义(arXiv 2609.00196…
commitrewriter 是 Simon Willison(@simonw)9 月 14 日发布的本地 Web 应用,用于批量编辑 Git 仓库的提交信息。核心使用场景是:Coding Agent 生成的提交记录往往带有大量"机器腔"——冗长的内部 ID 引用、不适合公开的 issue 编号、重复的 agent 生成 boilerplate。Simon …
Mannered Prose(花哨文体) 是 Anthropic 在 2026 年 9 月发布的 Prompting Claude Fable 5.1 官方指南 中定义的一种写作风格缺陷——用比喻和修饰取代直接陈述。Anthropic 给出了一段精确的定义,DAIR.AI 创始人 elvis(@omarsar0)于 9 月 7 日在 X 上分享后,引发社区大…
Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses 是 Airbnb 团队(Cen Mia Zhao、Haibo Ruan、Wenjie Chen 等)发表在 EMNLP 2026 的论文,核心命题: 给定一个固定模型,Agent 的质量提升来源不是换模型,而是优化它周围的 har…
一个由 GPT6 Astra(Medium)+ OpenAI Codex 模式驱动的 AI 编码智能体,在 macOS 上自动调用本地已安装的 Blender 桌面应用,通过 Blender Python API 生成可编辑的 .blend 三维场景文件,并渲染出成品图像。 整个过程完全由自然语言驱动——用户只给了三句提示词,AI 自己: 1. 写 Pyth…
Extract Turbo 是 LlamaIndex(LlamaParse / LlamaExtract)平台在 2026 年 9 月发布的全新文档抽取 tier,处于 beta 阶段,主打极致低延迟,目标场景是 extraction 位于用户响应路径上的实时工作流。 LlamaParse 是 LlamaIndex 的核心商业产品,提供 Parse(文档解析…
Marigold V2 是一套将预训练图像生成扩散 Transformer(DiT)低成本改造为单目深度估计器的完整方案——包括模型族和可复现微调协议。2026 年 9 月 8 日由华为苏黎世实验室( Huawei Bayer Lab)、EPFL 和博洛尼亚大学联合开源,已被 ACM Transactions on Graphics 接收(SIGGRAPH …
Uno(发音「乌诺」)是 IFM(Institute of Foundation Models)团队开源的离散扩散增强型 LLM 推理框架,核心思想是:不让扩散模型取代自回归模型,而是让扩散模型辅助自回归模型并行生成多个 token,从而在保持输出无损的前提下显著提升吞吐。 传统 LLM 推理慢在「串行」——每个 token 必须等前一个 token 生成完…
AuK(发音接近 "auk",一种海鸟)是腾讯混元(Tencent Hunyuan)于 2026 年 9 月 9 日 开源的多任务语音生成与编辑统一模型,arXiv 论文编号 2609.08936,MIT 许可证,代码与权重全部公开。 核心定位:一个模型、一套指令格式,覆盖 5 大类 20+ 任务,不再需要为每个子任务部署独立模型。 传统语音系统把 TTS、…
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails 是 Salesforce AI 团队(Zhou Yu、Bin Bi 等)的研究,核心研究问题: 在企业级 Agent 场景下,Harness 演化(优化…
2026 年 9 月 8 日,Salesforce AI 研究团队发布了论文 "CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails"(arXiv:2609.09134)。论文研究了一个核心问题:当小模型配…
wllama 是 ngxson(XuanSon Nguyen)维护的 WebAssembly + WebGPU 绑定库,让 llama.cpp 可以在浏览器内直接运行大语言模型推理,2026 年 9 月 5 日他发布了 首个浏览器内微调(finetuning)PoC,证明在 WebGPU 上训练 LLM 是可行的。@maximelabonne(Liquid …
Compile by Training(CbT)是 ProgramasWeights(PAW) 范式的第二代编译器,由 Yuntian Deng、Pengyu Nie、Stuart Shieber 三位作者在 EMNLP 2026 System Demonstrations 会上发布。它做的事情很直接:把你用自然语言描述的模糊文本函数,编译成一个可以完全离线…
Looped Transformer(循环 Transformer),也称 Recurrent Depth 或 Looped Depth Sharing,是一种在训练和推理时将同一组 Transformer 层重复应用多次的架构设计。与传统 Transformer 每个 token 只经过一层 stack 一次不同,Looped Transformer 会让…
浏览器内 LLM 微调(Inbrowser Finetuning on WebGPU)指的是不依赖任何服务器端 GPU,直接在浏览器 Tab 内通过 WebGPU API 对语言模型进行反向传播训练(backpropagation),输出可用的 LoRA 适配器权重。 这一进展由独立开发者 XuanSon Nguyen(@ngxson)在 2026 年 9 …
DisCo(Distillation & Composition)是北京人工智能研究院(BAAI)等团队提出的研究智能体,它不只做研究,还自己构建可执行技能——然后用这些技能反过来提升研究能力。配套产物是 AREXSkill Library:从 1,000+ 个热门 ML 仓库中自动蒸馏出 5,000+ 条已验证技能,覆盖 20 个研究领域和 178 个能力…
⚠️ 存疑/待核:① 仓库 GitHub Releases 页面截至抓取时为空,故无法锚定具体 release tag 版本号;下文安装命令中的版本号一律按"无版本约束"或"PyPI 最新"处理,使用前请 pip index versions toppermcp 自行确认。② PyPI 详情页因反爬未拿到,只在 README 自述与 GitHub 源文件层面…
Claude Fable 5.1 使用的是与 Claude Fable 5 相同的 tokenizer(该 tokenizer 首次随 Claude Opus 4.7 引入)。相比 Opus 4.7 之前的模型(如 Fable 4、Sonnet 4.6 等),相同文本会多产生约 30% 的 token。 这不是 API 接口的变化——请求格式、流式事件结构完…
Exo 是 a16z 支持的 exoharness/exo 开源框架,定位是「recursive self improvement(RSI,递归自我改进)」的完整 agent + harness 系统。 它本质上是一个完整的 AI agent harness(类似 OpenClaw、Pi 或 Hermes),核心理念是让模型能够看到并修改自己的全部代码和运行…
j anosh/diagrams 是一个开放的学术图表开源仓库,收集了大量物理、化学、机器学习等领域的概念示意图,以 LaTeX (TikZ) 和 Typst 源码形式保存。每个图表配有一个 diagram.yml 元数据文件,仓库附带渲染脚本,可将 .tex / .typ 文件导出为 PDF / SVG / PNG 格式。 作者 Janosh Riebes…
2026年8月,AI 开发者 @abacaj 在 X 上发了一条简短而犀利的观察: "they need to make models that think less, seems to be the only lever they have is how many tokens it generates while thinking" 这条帖获得 4.5K…
一条朴素的二进制考古技巧:用 strings 和 grep 从 Claude Code 的可执行文件中挖出它内置 Bun 运行时的版本号,从而确认 Claude Code 已经切换到 Rust 重写的 Bun(v1.4.0)而非旧的 Zig 版。 核心两行命令: strings ~/.local/bin/claude | grep m1 'Bun v1' c…
2026年9月1日,开发者 Simon Willison 在整理磁盘空间时(使用 OmniDiskSweeper 扫描 ~/.cache/)偶然发现:OpenAI 的桌面版 ChatGPT(由原 Codex 桌面应用 rebranding 而来)在用户本地静默捆绑了约 1.7GB 的完整运行时环境,位于: ~/.cache/codexruntimes/cod…
sballi/latexeditor 是一个基于 PyQt6 的轻量级桌面 LaTeX 编辑器,定位为 Notepad++ 风格 + 实时 PDF 预览 的离线替代方案,目标是摆脱 Overleaf 的浏览器标签和云端依赖。项目明确支持 Windows(通过 WSL)和 Linux(AppImage)两大平台,无云服务、无需注册账号,安装后完全离线运行。 核…
2026 年 8 月底,LangChain 官方在 langchain==1.4.0a2 中正式加入了基于 FastMCP 协议的 MCP(Model Context Protocol)适配层,使 LangChain/LangGraph Agent 能够直接调用任何兼容 MCP 标准的外部工具服务器。该功能通过独立包 langchainmcpadapters…
2026 年 8 月 20 日,OpenRouter 上悄然出现一个匿名模型 Ox Alpha:无所属、无模型卡、免费使用、1M token 上下文、支持图文视频输入。六天后,它成了 OpenRouter 有史以来最热门的模型,吞吐量是第二名的 2.3 倍。8 月 26 日,Bloomberg 证实其真身——GLM5.3Flash,来自智谱 AI(Zhipu…