研究库 实战攻略
Guides · organized/guides

仓库攻略

85 篇 · 81 个项目 · 其它 · jay · Agent 智能体

Jev-as-a-Judge:把评分跑进每一个生产 Trace · 干货攻略
Jev 是 TypeSafe AI(2026 年 9 月中旬发布)的首个 "System One" 模型——它不是语言模型,不生成任何文本,只做一件事:输入一段结构化 state,加上类型化的问题,得到带概率的决策答案。 这个定位恰好精确命中了 Agent 评测的核心形状:给定 agent 的 trace 和状态,判断这次行为是否合规、是否安全、评分几分。 …
Jay 2026-10-09
Liquid AI d1 决策模型:零输出 Token 跑分类/路由/评分 · 干货攻略
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
无(主产品为 Liquid AI 托管 API,非开源权重) Jay 2026-10-08
VeriHarness:让同一模型既当选手又当裁判 · 干货攻略
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
google-research/veriharness Jay 2026-10-06
LlamaParse 表格 blank cell 导致数值静默错位的根因与防护 · 干货攻略
表格中存在 blank cell(空单元格)时,大多数文档 OCR / 解析工具在输出 markdown 表格时,会将该行后续所有数值整体左移一格,从而导致数值进入错误的列,造成静默的数据错位。这种错误不抛异常、只静默错位——下游 Agent 若直接使用这组数值去做判断,就会产生错误决策。 LlamaIndex 联合创始人 Jerry Liu(@jerryj…
Jay 2026-10-03
代表攻略
LiteParse:空间布局优先的本地文档解析——表格空白格错位的根本解法 · 干货攻略
LiteParse 是 LlamaIndex 于 2026 年 3 月开源的本地文档解析 CLI 和 TypeScript 原生库,核心理念是「保留布局,而非检测结构」——将 PDF、Office 文档、图片中的文本投影到空间网格(spatial grid),以相对位置关系输出文本,而不是先将文档结构检测并转换为 Markdown 表格。 这直接回应了 @j…
run-llama/liteparse Jay 2026-10-02
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

代表攻略
SAS:端到端优化上下文排名的稀疏注意力机制 · 干货攻略
SAS(Simple Attention Sparsification via EndtoEnd Optimization of Context Ranking) 是腾讯混元(Hunyuan)团队提出的一种后训练稀疏注意力机制,核心贡献是让选择器(selector)能够直接被语言建模损失端到端反向更新,从而在固定注意力预算下学会最有效地排列和选择上下文块。 …
Tencent-Hunyuan/Simple-Attention-Sparsification Jay 2026-10-01
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

VLM 文档解析:effort 越高 ≠ 效果越好 · 干货攻略
2026 年 9 月,LlamaIndex 联合创始人 & CEO Jerry Liu(@jerryjliu0)在 X 上发布了一项系统性评测结果:对 16 款前沿 VLM(视觉语言模型) 进行文档解析能力的横向对比。测试覆盖 Opus 5.5、GPT6 Sol/Luna 等最新模型,评测基准为 LlamaIndex 自建的 ParseBench。 核心发现…
Jay 2026-09-30
ProgramDistill:将网页应用交互转化为可验证 SWE 任务的基准 · 干货攻略
ProgramDistill 是微软研究院(Microsoft Research Montréal)与韩国科学技术院(KAIST)于 2026 年 9 月发布的代码智能基准。它的核心思路不同于传统 SWEbench——不依赖 GitHub Issue 或人工撰写的任务描述,而是让 AI Agent 通过与一个功能完整的参考应用交互,自行推断出缺失的功能,再在…
huggingface.co/datasets/microsoft/ProgramDistill Jay 2026-09-29
Ember-1 · 40% 思考 token 压缩实战攻略 · 干货攻略
Ember1 是 Fireworks Research(Fireworks AI 的研究团队)于 2026 年 9 月 23 日发布的推理专用模型,本质是对 Moonshot AI 的开源推理模型 Kimi K3 做后训练压缩——让它学会用更少的思考 token 到达同等质量的答案。 这不是新架构,也不是新基座模型,而是 K3 的一次 specialized…
Jay 2026-09-28
加密推理链可被跨 API 漏洞窃取 · 干货攻略
一篇 2026 年 8 月 10 日提交的学术论文(arXiv:2608.09867,cs.CR),由来自 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Snyk 的研究人员撰写。论文发现:Anthropic、OpenAI、Google …
无 Jay 2026-09-26
加密推理链可被跨 API 漏洞窃取 · 干货攻略
2026 年 8 月 10 日,一支来自 ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、MATS Research 的研究团队(含 Alexander Panfilov、David Schmotz、Ilia Shumailov 等人)在 arXiv 发布论文 "St…
Jay 2026-09-26
JEPA-Anything:跨不同世界学习的通用世界模型框架 · 干货攻略
JEPAAnything 是一个领域无关(domainagnostic)的通用世界模型学习框架,发表在 arXiv (2609.20800),由 GenVerse 团队开源。它的核心创新叫做 Orthogonal Predictive Factorization(OPF,正交预测因子分解)——把 JEPA(联合嵌入预测架构)的单一目标表征替换为一组互补的、正…
Gen-Verse/JEPA-Anything Jay 2026-09-26
代表攻略
Skill Entropy:衡量并训练 LLM 跨技能切换能力 · 干货攻略
Skill Entropy 是普林斯顿大学(联合 CMU、UToronto、UIUC、Stanford、Oxford)团队提出的一套跨技能长程推理评测与训练框架,包含三个核心组件: 1. Skill Entropy(技能熵):一种度量技能切换难度的有向成对指标。当参考模型(Claudeopus4.7)分别处理两个技能时表现良好,但在连续执行两者时失败,则该技…
Gen-Verse/Skill-Entropy-RL Jay 2026-09-22
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

WHALE:权重与 Harness 联合交替优化 · 干货攻略
WHALE(WeightHarness Alternating LEarning)是 KRAFTON AI 与斯坦福大学联合提出的一种联合优化配方,核心思路极为简洁:将 Agent 系统拆成两个独立模块——模型权重(weights)和Harness 代码,交替优化,每次只动一个、固定另一个,循环往复逼近联合最优解。 官方定义(arXiv 2609.00196…
krafton-ai/WHALE Jay 2026-09-18
commit-rewriter · 干货攻略
commitrewriter 是 Simon Willison(@simonw)9 月 14 日发布的本地 Web 应用,用于批量编辑 Git 仓库的提交信息。核心使用场景是:Coding Agent 生成的提交记录往往带有大量"机器腔"——冗长的内部 ID 引用、不适合公开的 issue 编号、重复的 agent 生成 boilerplate。Simon …
simonw/commit-rewriter Jay 2026-09-15
Harness 工程的关键战场:工具边界拦截 · 干货攻略
Beyond Prompts: Measuring and Optimizing LLM ToolAgent Harnesses 是 Airbnb 团队(Cen Mia Zhao、Haibo Ruan、Wenjie Chen 等)发表在 EMNLP 2026 的论文,核心命题: 给定一个固定模型,Agent 的质量提升来源不是换模型,而是优化它周围的 har…
airbnb/agent-harness-optimizer Jay 2026-09-14
GPT-6 Astra + Codex + Blender:让 AI 亲手渲染一只骑自行车的鹈鹕 · 干货攻略
一个由 GPT6 Astra(Medium)+ OpenAI Codex 模式驱动的 AI 编码智能体,在 macOS 上自动调用本地已安装的 Blender 桌面应用,通过 Blender Python API 生成可编辑的 .blend 三维场景文件,并渲染出成品图像。 整个过程完全由自然语言驱动——用户只给了三句提示词,AI 自己: 1. 写 Pyth…
simonw/gpt-6-astra-blender-pelican-bicycle Jay 2026-09-14
LlamaParse Extract Turbo:极速文档抽取新 tier 深度解读 · 干货攻略
Extract Turbo 是 LlamaIndex(LlamaParse / LlamaExtract)平台在 2026 年 9 月发布的全新文档抽取 tier,处于 beta 阶段,主打极致低延迟,目标场景是 extraction 位于用户响应路径上的实时工作流。 LlamaParse 是 LlamaIndex 的核心商业产品,提供 Parse(文档解析…
Jay 2026-09-14
Uno: 离散扩散加速 LLM 推理,无损兼高速 · 干货攻略
Uno(发音「乌诺」)是 IFM(Institute of Foundation Models)团队开源的离散扩散增强型 LLM 推理框架,核心思想是:不让扩散模型取代自回归模型,而是让扩散模型辅助自回归模型并行生成多个 token,从而在保持输出无损的前提下显著提升吞吐。 传统 LLM 推理慢在「串行」——每个 token 必须等前一个 token 生成完…
ifm-ai/uno Jay 2026-09-13
Miles v0.1 · 干货攻略
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
radixark/miles Jay 2026-09-12
Repo-To-Skill: 把 GitHub 仓库蒸馏成 AI 可执行技能 · 干货攻略
DisCo(Distillation & Composition)是北京人工智能研究院(BAAI)等团队提出的研究智能体,它不只做研究,还自己构建可执行技能——然后用这些技能反过来提升研究能力。配套产物是 AREXSkill Library:从 1,000+ 个热门 ML 仓库中自动蒸馏出 5,000+ 条已验证技能,覆盖 20 个研究领域和 178 个能力…
VectorSpaceLab/AREX-Skill Jay 2026-09-07
Exo:全量暴露 harness 代码的递归自我改进框架 · 干货攻略
Exo 是 a16z 支持的 exoharness/exo 开源框架,定位是「recursive self improvement(RSI,递归自我改进)」的完整 agent + harness 系统。 它本质上是一个完整的 AI agent harness(类似 OpenClaw、Pi 或 Hermes),核心理念是让模型能够看到并修改自己的全部代码和运行…
exoharness/exo Jay 2026-09-06