2026年8月,AI 开发者 @abacaj 在 X 上发了一条简短而犀利的观察: "they need to make models that think less, seems to be the only lever they have is how many tokens it generates while thinking" 这条帖获得 4.5K…
仓库攻略
89 篇 · 85 个项目 · 其它 · Agent 智能体
2026年9月1日,开发者 Simon Willison 在整理磁盘空间时(使用 OmniDiskSweeper 扫描 ~/.cache/)偶然发现:OpenAI 的桌面版 ChatGPT(由原 Codex 桌面应用 rebranding 而来)在用户本地静默捆绑了约 1.7GB 的完整运行时环境,位于: ~/.cache/codexruntimes/cod…
2026 年 8 月底,LangChain 官方在 langchain==1.4.0a2 中正式加入了基于 FastMCP 协议的 MCP(Model Context Protocol)适配层,使 LangChain/LangGraph Agent 能够直接调用任何兼容 MCP 标准的外部工具服务器。该功能通过独立包 langchainmcpadapters…
2026 年 8 月 20 日,OpenRouter 上悄然出现一个匿名模型 Ox Alpha:无所属、无模型卡、免费使用、1M token 上下文、支持图文视频输入。六天后,它成了 OpenRouter 有史以来最热门的模型,吞吐量是第二名的 2.3 倍。8 月 26 日,Bloomberg 证实其真身——GLM5.3Flash,来自智谱 AI(Zhipu…
LangSmith 的 Trace 级成本可观测性(Cost Tracking at Trace Level) 是一套将 LLM/Agent 每次运行的费用直接绑定到执行链路的技术能力。传统 AI 应用只知道「这个月 API 账单是 X 美元」,而 trace 级成本追踪让你知道「是哪个 workflow、哪次 tool call、哪条 prompt pat…
2026 年上半年,两家科技巨头先后因 AI 编码工具成本失控被迫踩刹车: 这不是两个孤立事件。《FinOps Foundation》数据显示,2026 年有 98% 的从业者需要管理 AI 支出,而一年前这个比例是 63%——AI 成本管理是史上普及最快的成本管控领域。Gartner 预测,到 2027 年底超过 40% 的 Agentic AI 项目将因…
LLM CLI 是 Simon Willison 用 Python 写的命令行工具,同时也是一个 Python 库,用于对接 OpenAI、Anthropic、Google Gemini、Qwen、Gemma、Mistral 等数十家模型厂商的 API,并支持本地模型(通过 Ollama、LM Studio 等兼容端点)。8 月 4 日发布的 0.32 是该…
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工薪层(workhorse)模型,主打编码和 Agent 场景,定位为"有史以来最智能的工作负载模型"。它基于 Gemini 3.6 Flash 的算法改进版(model card 将所有架构细节指向 3.6 Flash),上下文窗口 1,048,576 tokens…
DSpark(Decoding Spark)是 Liquid AI 为 LFM2.5 系列模型发布的推测解码(Speculative Decoding)draft 模型系列,覆盖三个尺寸: | Draft 模型 | 目标模型 | Draft 参数量 | |||| | LFM2.51.2BInstructDSpark | LFM2.51.2BInstruct …
主题 slug: xtip20260826promptinducedwasteharnesscost(论文无独立 GitHub 仓库,故按无主仓库命名规范) 论文全称:PromptInduced Waste in Coding Agents: Reasoning, Effort, Harness Design, and EndtoEnd Cost (arXi…
dairai/wikisft 是一个配套仓库,完整复现了 @omarsar0(elvis)发表在 X 上的文章《Automating LLM FineTuning with Fireworks Agent》的数据构建流程。 核心思路来自 Andrej Karpathy 的 LLM Wiki 概念:把个人知识库的"输出风格"通过 SFT 微调蒸馏进模型权重,而…
LFM2.5 QAD(QuantizationAware Distillation)是 Liquid AI 发布的一种训练时量化蒸馏技术,原理是让一个高精度 teacher 模型直接蒸馏到一个量化后的 student 模型,而非先训练好再事后量化(PTQ,PostTraining Quantization)。 4 个 LFM2.5 尺寸均发布 QAD Q4_…
SmolForge(forge.smol.ai)是专为 coding agent 设计的 Git 远程托管平台,与传统 GitHub/GitLab 的「人类协作优先」设计理念不同,它把 AI agent 作为第一等公民来构建整个系统。平台由 smolai 组织开发维护,基于 Cloudflare Workers 基础设施构建。 官网定位: A Git rem…
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工作负载模型,基于 Gemini 3.6 Flash 的算法改进版,主打编码和 Agent 场景。官方标称上下文窗口为 1,048,576 tokens(约 1M),最大输出 65,536 tokens(64K),支持文本、图像、音频、视频、PDF 多模态输入。 本攻…
Cursor Origin 是 Cursor(SpaceX 旗下 AI 编程 IDE)于 2026 年 8 月 17 日 推出的代码托管平台,直接内置于 Cursor 编辑器中,不需要切换工具即可完成建库、浏览代码、PR 管理和 AI Agent 操作。 官方定位:"A git forge for the agentic era"——专为 AI Agent …
MetaHarness 是一个自动化 harness 工程的框架,来自斯坦福 IRIS Lab、Cornell 和 MIT,发表在 COLM 2026(arXiv:2603.28052)。 LLM 系统的性能不仅取决于模型权重,还取决于 harness——即围绕固定基础模型运行的代码,决定存储什么信息、检索什么信息、向模型展示什么。Harness 包括:系统…
代表攻略
无需微调:VLM 调度层填平"编排差距",真实机器人 16.7% → 97.3% · 干货攻略
Pigey(Physical Agency orchestrator)是一个闭环 VLM 调度层,驱动已有的冻结机器人技能(frozen skills),无需任何新数据或微调,即可在仿真和真实机器人上大幅提升推理密集型任务的成功率。 核心论文:"Addressing the Orchestration Gap in Generalist Robots via…
2026 年 8 月 10 日,一支由 8 位安全研究者组成的团队(包括来自 ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、MATS Research 等机构的学者)在 arXiv 上发表了一篇震惊业界的论文:"Stealing Reasoning Traces f…
Governance Decay(治理衰减)是一种新型智能体安全失效模式,由论文 Governance Decay: How Context Compaction Silently Erases Safety Constraints in LongHorizon LLM Agents(arXiv:2606.22528,2026 年 6 月)正式命名并系统量化…
⚠️ 本稿数字与命令以 README 与 docs.privategpt.dev 抓取为准;命令中 qwen3.5:35b、mxbaiembedlarge 等具体模型名取自 README Quickstart,未经独立复现,请按你的硬件与显存重新核对。 PrivateGPT 是 Zylon 公司在 2023 年那个"本地聊天 PDF"爆款脚本基础上重写出来的…
LFM2.52.6B 是 Liquid AI 在 2026 年 8 月初开源的一个 2.6B 参数端侧 Agent 模型,DeepSeekV4Flash0731 是 DeepSeek 同月发布的一个 284B 总参数 / 13B 激活参数 MoE 推理优化模型(20260731 发布)。2026 年 8 月 6 日,atomic.chat 在 4× RTX …
2026 年 7 月 28 日,Model Context Protocol(MCP)正式发布了有史以来最大的一次协议版本更新,版本号 20260728。核心变化:MCP 从有状态的双向协议彻底改为请求/响应式的无状态协议。 附带 HTTP 路由增强、缓存指令、企业级授权加固、长任务扩展,以及一个正式的废弃政策窗口。 根据 MCP 官方博文,MCP 在各 T…
Faraday 是伦敦 AI 创业公司 Inherent(2026年8月14日刚从 stealth 模式浮出水面,Index Ventures 与 Radical Ventures 联合注资 $50M seed round)发布的 27B 参数"AI Scientist"智能体。其核心能力是复现学术论文中的图表——给定一篇论文(不带原图),Faraday 需…
2026 年 8 月 7 日,知名 AI 工程博主 Simon Willison(@simonw)用 Codex Desktop 跑了 GPT5.6 Sol Ultra,一次提示词,52 分钟,零人工干预,直接生成一个完整可玩的 3D 浣熊偷盗游戏「Moonlight & Mayhem」。 游戏特点: 博物馆场景,三只浣熊组队潜入 需要解救同伴、叠罗汉偷取「…
MOPD(MultiDomain OnPolicy Distillation,多域同策略蒸馏) 是一种将多个领域专家模型的能力整合到单一模型中的后训练范式。它由小米 MiMo 团队提出(论文 arXiv:2606.30406),核心做法是:先在各自领域独立训练 RL specialist teacher(数学、代码、Agent 等),再通过同策略蒸馏将所有 …
⚠️ 重要说明:原帖候选将本工作仓库写作 SakanaAI/Conductor,经核验该 GitHub 仓库返回 404(不存在或未公开)。本文以 arXiv:2512.04388 论文页面和 Sakana AI 官方博客 为权威来源;代码/模型权重是否公开 Release 需以上述官方渠道为准,本文不替代官方公告。 Sakana AI Conductor …
Native SDK(项目原名 ZeroNative)是 Vercel Labs 出品的原生桌面应用开发工具链,用 Zig 做运行时引擎、TypeScript 或 Zig 写业务逻辑、.native 声明式标记写界面,编译后输出不含任何浏览器 runtime 的单个本地二进制。核心理念:开发者喜欢 Web 技术的表达力,但 Electron 的重量(Chro…
MaplePreview 是 DeepGrove(@deepgrove_ai)于 2026 年 8 月初开源的一个 20BA1B 三元权重组合专家(ternaryweight MoE)推理模型。所谓"三元权重",即权重值仅使用 {1, 0, +1} 三个离散值,而非常见的 INT4/INT8 量化——这意味着权重本身已经是极端低精度状态,但仍从零开始以三元格…
SpyRL 是 RLSVR(Reinforcement Learning with SelfVerifiable Rewards)的具体实现,由 Duke 大学、Adobe、NUS、Penn State 等机构联合提出,已被 COLM 2026 接收。 核心思想一句话:把开放域任务变成一个「谁是卧底」游戏,让游戏的投票结果自动成为可验证的 RL 奖励信号——…
Mamba3 是由 Tri Dao 和 Albert Gu 联合团队发布的第三代 Mamba 模型(ICLR 2026 Oral),核心定位是在推理效率优先的前提下推进性能效率帕累托前沿。它基于上一代 Mamba2 的架构做了三项核心方法改进,并将 SSM(状态空间模型)与线性注意力彻底融合为同一套理论框架(Structured State Space Du…