Jev 是 TypeSafe AI(2026 年 9 月中旬发布)的首个 "System One" 模型——它不是语言模型,不生成任何文本,只做一件事:输入一段结构化 state,加上类型化的问题,得到带概率的决策答案。 这个定位恰好精确命中了 Agent 评测的核心形状:给定 agent 的 trace 和状态,判断这次行为是否合规、是否安全、评分几分。 …
仓库攻略
89 篇 · 85 个项目 · 其它 · Agent 智能体
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
表格中存在 blank cell(空单元格)时,大多数文档 OCR / 解析工具在输出 markdown 表格时,会将该行后续所有数值整体左移一格,从而导致数值进入错误的列,造成静默的数据错位。这种错误不抛异常、只静默错位——下游 Agent 若直接使用这组数值去做判断,就会产生错误决策。 LlamaIndex 联合创始人 Jerry Liu(@jerryj…
代表攻略
LiteParse:空间布局优先的本地文档解析——表格空白格错位的根本解法 · 干货攻略
LiteParse 是 LlamaIndex 于 2026 年 3 月开源的本地文档解析 CLI 和 TypeScript 原生库,核心理念是「保留布局,而非检测结构」——将 PDF、Office 文档、图片中的文本投影到空间网格(spatial grid),以相对位置关系输出文本,而不是先将文档结构检测并转换为 Markdown 表格。 这直接回应了 @j…
代表攻略
SAS:端到端优化上下文排名的稀疏注意力机制 · 干货攻略
SAS(Simple Attention Sparsification via EndtoEnd Optimization of Context Ranking) 是腾讯混元(Hunyuan)团队提出的一种后训练稀疏注意力机制,核心贡献是让选择器(selector)能够直接被语言建模损失端到端反向更新,从而在固定注意力预算下学会最有效地排列和选择上下文块。 …
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
2026 年 9 月 27 日,AI 领域知名独立开发者 Simon Willison 在 WeAreDevelopers World Congress North America(圣何塞)发表了闭幕 Keynote,题目为「2026 in LLMs (so far)」。这是一篇按时间线串联 2026 年 AI 领域所有重大事件的超长综述,涵盖从 GPT5.…
2026 年 9 月,LlamaIndex 联合创始人 & CEO Jerry Liu(@jerryjliu0)在 X 上发布了一项系统性评测结果:对 16 款前沿 VLM(视觉语言模型) 进行文档解析能力的横向对比。测试覆盖 Opus 5.5、GPT6 Sol/Luna 等最新模型,评测基准为 LlamaIndex 自建的 ParseBench。 核心发现…
ProgramDistill 是微软研究院(Microsoft Research Montréal)与韩国科学技术院(KAIST)于 2026 年 9 月发布的代码智能基准。它的核心思路不同于传统 SWEbench——不依赖 GitHub Issue 或人工撰写的任务描述,而是让 AI Agent 通过与一个功能完整的参考应用交互,自行推断出缺失的功能,再在…
onPanda(全称 onPolicy alignment data annotator)是 StepFun 与厦门大学联合开源的交互式 LLM 对齐数据标注工具,论文链接 arXiv 2609.24983。核心创新是token 级修正(tokenlevel correction)交互范式——标注员不再手动编辑完整回复,而是在模型生成过程中定位第一个出错 t…
Ember1 是 Fireworks Research(Fireworks AI 的研究团队)于 2026 年 9 月 23 日发布的推理专用模型,本质是对 Moonshot AI 的开源推理模型 Kimi K3 做后训练压缩——让它学会用更少的思考 token 到达同等质量的答案。 这不是新架构,也不是新基座模型,而是 K3 的一次 specialized…
本攻略解读 @simonw(Simon Willison)于 2026 年 9 月 15 日发布的实操教程,展示如何用纯浏览器原生 API(Web Audio API + WebSocket)零依赖接入 Google Gemini 3.8 Live 语音对话 API,全程不用任何第三方 npm 包。 分享者 Simon Willison 是 Python/W…
一篇 2026 年 8 月 10 日提交的学术论文(arXiv:2608.09867,cs.CR),由来自 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Snyk 的研究人员撰写。论文发现:Anthropic、OpenAI、Google …
2026 年 8 月 10 日,一支来自 ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、MATS Research 的研究团队(含 Alexander Panfilov、David Schmotz、Ilia Shumailov 等人)在 arXiv 发布论文 "St…
JEPAAnything 是一个领域无关(domainagnostic)的通用世界模型学习框架,发表在 arXiv (2609.20800),由 GenVerse 团队开源。它的核心创新叫做 Orthogonal Predictive Factorization(OPF,正交预测因子分解)——把 JEPA(联合嵌入预测架构)的单一目标表征替换为一组互补的、正…
⚠️ 本文基于仓库 README 实测(GitHub 已验 · 200 OK · 抓取于 20260923),未 clone 源码、未跑构建;版本号、依赖均来自 README 声明,未独立交叉核实。仓库项目方明确声明「与 Herdr / herdr.dev 无关的非官方项目」。 penso/herdrgpui 是一个用 Rust + GPUI 写的 macO…
代表攻略
Skill Entropy:衡量并训练 LLM 跨技能切换能力 · 干货攻略
Skill Entropy 是普林斯顿大学(联合 CMU、UToronto、UIUC、Stanford、Oxford)团队提出的一套跨技能长程推理评测与训练框架,包含三个核心组件: 1. Skill Entropy(技能熵):一种度量技能切换难度的有向成对指标。当参考模型(Claudeopus4.7)分别处理两个技能时表现良好,但在连续执行两者时失败,则该技…
XGrammar 是 MLC AI 开源的高效、灵活、可移植的结构化生成引擎。它把 LLM 的解码过程约束在一个上下文无关文法(contextfree grammar)内,保证输出 100% 符合给定 schema(JSON、正则、自定义 CFG 等),同时把约束解码的开销压到接近零——在 JSON 生成场景下做到「nearzero overhead」,是目…
WHALE(WeightHarness Alternating LEarning)是 KRAFTON AI 与斯坦福大学联合提出的一种联合优化配方,核心思路极为简洁:将 Agent 系统拆成两个独立模块——模型权重(weights)和Harness 代码,交替优化,每次只动一个、固定另一个,循环往复逼近联合最优解。 官方定义(arXiv 2609.00196…
commitrewriter 是 Simon Willison(@simonw)9 月 14 日发布的本地 Web 应用,用于批量编辑 Git 仓库的提交信息。核心使用场景是:Coding Agent 生成的提交记录往往带有大量"机器腔"——冗长的内部 ID 引用、不适合公开的 issue 编号、重复的 agent 生成 boilerplate。Simon …
Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses 是 Airbnb 团队(Cen Mia Zhao、Haibo Ruan、Wenjie Chen 等)发表在 EMNLP 2026 的论文,核心命题: 给定一个固定模型,Agent 的质量提升来源不是换模型,而是优化它周围的 har…
一个由 GPT6 Astra(Medium)+ OpenAI Codex 模式驱动的 AI 编码智能体,在 macOS 上自动调用本地已安装的 Blender 桌面应用,通过 Blender Python API 生成可编辑的 .blend 三维场景文件,并渲染出成品图像。 整个过程完全由自然语言驱动——用户只给了三句提示词,AI 自己: 1. 写 Pyth…
Extract Turbo 是 LlamaIndex(LlamaParse / LlamaExtract)平台在 2026 年 9 月发布的全新文档抽取 tier,处于 beta 阶段,主打极致低延迟,目标场景是 extraction 位于用户响应路径上的实时工作流。 LlamaParse 是 LlamaIndex 的核心商业产品,提供 Parse(文档解析…
Uno(发音「乌诺」)是 IFM(Institute of Foundation Models)团队开源的离散扩散增强型 LLM 推理框架,核心思想是:不让扩散模型取代自回归模型,而是让扩散模型辅助自回归模型并行生成多个 token,从而在保持输出无损的前提下显著提升吞吐。 传统 LLM 推理慢在「串行」——每个 token 必须等前一个 token 生成完…
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails 是 Salesforce AI 团队(Zhou Yu、Bin Bi 等)的研究,核心研究问题: 在企业级 Agent 场景下,Harness 演化(优化…
2026 年 9 月 8 日,Salesforce AI 研究团队发布了论文 "CoEvolving Harnesses and Models: OnPolicy Correction Helps Weaker Models Catch Up Where Imitation Fails"(arXiv:2609.09134)。论文研究了一个核心问题:当小模型配…
DisCo(Distillation & Composition)是北京人工智能研究院(BAAI)等团队提出的研究智能体,它不只做研究,还自己构建可执行技能——然后用这些技能反过来提升研究能力。配套产物是 AREXSkill Library:从 1,000+ 个热门 ML 仓库中自动蒸馏出 5,000+ 条已验证技能,覆盖 20 个研究领域和 178 个能力…
Claude Fable 5.1 使用的是与 Claude Fable 5 相同的 tokenizer(该 tokenizer 首次随 Claude Opus 4.7 引入)。相比 Opus 4.7 之前的模型(如 Fable 4、Sonnet 4.6 等),相同文本会多产生约 30% 的 token。 这不是 API 接口的变化——请求格式、流式事件结构完…
Exo 是 a16z 支持的 exoharness/exo 开源框架,定位是「recursive self improvement(RSI,递归自我改进)」的完整 agent + harness 系统。 它本质上是一个完整的 AI agent harness(类似 OpenClaw、Pi 或 Hermes),核心理念是让模型能够看到并修改自己的全部代码和运行…