研究库 实战攻略
Guides · organized/guides

仓库攻略

154 篇 · 150 个项目 · 其它

OctLLM:用八叉树作为显式 3D 语言的多模态 LLM · 干货攻略
OctLLM(Octrees as an Explicit 3D Language)是 2026 年 10 月 5 日发布于 arXiv(2610.02388)的一篇多模态 LLM 论文,来自北京大学与独立研究者团队。它提出了用稀疏八叉树(SOctree)作为 3D 几何的显式序列语言,配合一种双流 token 路由 transformer,让同一个 LLM…
Jay 2026-10-10
Jev-as-a-Judge:把评分跑进每一个生产 Trace · 干货攻略
Jev 是 TypeSafe AI(2026 年 9 月中旬发布)的首个 "System One" 模型——它不是语言模型,不生成任何文本,只做一件事:输入一段结构化 state,加上类型化的问题,得到带概率的决策答案。 这个定位恰好精确命中了 Agent 评测的核心形状:给定 agent 的 trace 和状态,判断这次行为是否合规、是否安全、评分几分。 …
Jay 2026-10-09
CODA: 把 Transformer Block 重写成 GEMM-Epilogue 程序 · 干货攻略
CODA 是一套 GPU kernel 抽象框架,核心主张是:Transformer 里那些看似必须单独启动 kernel 的内存密集型算子(normalization、activation、residual update、reduction),可以通过数学重参数化,全部塞进 GEMM 的 epilogue 阶段执行——在 GEMM 输出 tile 还在芯片…
Jay 2026-10-08
Liquid AI d1 决策模型:零输出 Token 跑分类/路由/评分 · 干货攻略
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
无(主产品为 Liquid AI 托管 API,非开源权重) Jay 2026-10-08
VeriHarness:让同一模型既当选手又当裁判 · 干货攻略
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
google-research/veriharness Jay 2026-10-06
Finetuning with Sampling:标准 SFT 打赢 RL 的新范式 · 干货攻略
哈佛团队(Aayush Karan、Sitan Chen、Yilun Du)提出 Projection Sampling(投影采样):在 SFT 训练前,用 MCMC(MetropolisHastings)把离策略(offpolicy)的专家轨迹逐步重写为贴近基础模型分布的轨迹,再送进标准 SFT。论文标题开宗明义——SFT Learns Better Th…
aakaran/finetuning-with-sampling Jay 2026-10-05
Claude Sonnet 5.5 进入免费层——为什么这值得关注 · 干货攻略
2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5(模型 ID:claudesonnet55),这是 Claude 5.5 系列的第二款模型,第一款是同年 9 月 22 日的旗舰款 Opus 5.5。Sonnet 5.5 定位于「高质量日常任务」,定位在 Opus 5.5 之下,但在多项编码评测中超越了 Opus 5…
Jay 2026-10-03
LlamaParse 表格 blank cell 导致数值静默错位的根因与防护 · 干货攻略
表格中存在 blank cell(空单元格)时,大多数文档 OCR / 解析工具在输出 markdown 表格时,会将该行后续所有数值整体左移一格,从而导致数值进入错误的列,造成静默的数据错位。这种错误不抛异常、只静默错位——下游 Agent 若直接使用这组数值去做判断,就会产生错误决策。 LlamaIndex 联合创始人 Jerry Liu(@jerryj…
Jay 2026-10-03
代表攻略
LiteParse:空间布局优先的本地文档解析——表格空白格错位的根本解法 · 干货攻略
LiteParse 是 LlamaIndex 于 2026 年 3 月开源的本地文档解析 CLI 和 TypeScript 原生库,核心理念是「保留布局,而非检测结构」——将 PDF、Office 文档、图片中的文本投影到空间网格(spatial grid),以相对位置关系输出文本,而不是先将文档结构检测并转换为 Markdown 表格。 这直接回应了 @j…
run-llama/liteparse Jay 2026-10-02
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

代表攻略
SAS:端到端优化上下文排名的稀疏注意力机制 · 干货攻略
SAS(Simple Attention Sparsification via EndtoEnd Optimization of Context Ranking) 是腾讯混元(Hunyuan)团队提出的一种后训练稀疏注意力机制,核心贡献是让选择器(selector)能够直接被语言建模损失端到端反向更新,从而在固定注意力预算下学会最有效地排列和选择上下文块。 …
Tencent-Hunyuan/Simple-Attention-Sparsification Jay 2026-10-01
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

VLM 文档解析:effort 越高 ≠ 效果越好 · 干货攻略
2026 年 9 月,LlamaIndex 联合创始人 & CEO Jerry Liu(@jerryjliu0)在 X 上发布了一项系统性评测结果:对 16 款前沿 VLM(视觉语言模型) 进行文档解析能力的横向对比。测试覆盖 Opus 5.5、GPT6 Sol/Luna 等最新模型,评测基准为 LlamaIndex 自建的 ParseBench。 核心发现…
Jay 2026-09-30
ProgramDistill:将网页应用交互转化为可验证 SWE 任务的基准 · 干货攻略
ProgramDistill 是微软研究院(Microsoft Research Montréal)与韩国科学技术院(KAIST)于 2026 年 9 月发布的代码智能基准。它的核心思路不同于传统 SWEbench——不依赖 GitHub Issue 或人工撰写的任务描述,而是让 AI Agent 通过与一个功能完整的参考应用交互,自行推断出缺失的功能,再在…
huggingface.co/datasets/microsoft/ProgramDistill Jay 2026-09-29
Ember-1 · 40% 思考 token 压缩实战攻略 · 干货攻略
Ember1 是 Fireworks Research(Fireworks AI 的研究团队)于 2026 年 9 月 23 日发布的推理专用模型,本质是对 Moonshot AI 的开源推理模型 Kimi K3 做后训练压缩——让它学会用更少的思考 token 到达同等质量的答案。 这不是新架构,也不是新基座模型,而是 K3 的一次 specialized…
Jay 2026-09-28
Open-MOPD:多教师同策略蒸馏全流程开源复现 · 干货攻略
OpenMOPD(Open MultiTeacher OnPolicy Distillation)是清华大学AIR学院与字节跳动Seed团队开源的多教师同策略蒸馏完整配方,发布于 2026 年 8 月 19 日(arXiv:2608.19098)。它解决了一个 2026 年后训练领域公认难题:如何把多个领域专精的 RL 教师(如数学、代码、指令遵循)的能力,…
BytedTsinghua-SIA/Open-MOPD Jay 2026-09-27
加密推理链可被跨 API 漏洞窃取 · 干货攻略
一篇 2026 年 8 月 10 日提交的学术论文(arXiv:2608.09867,cs.CR),由来自 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Snyk 的研究人员撰写。论文发现:Anthropic、OpenAI、Google …
无 Jay 2026-09-26
加密推理链可被跨 API 漏洞窃取 · 干货攻略
2026 年 8 月 10 日,一支来自 ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、MATS Research 的研究团队(含 Alexander Panfilov、David Schmotz、Ilia Shumailov 等人)在 arXiv 发布论文 "St…
Jay 2026-09-26
JEPA-Anything:跨不同世界学习的通用世界模型框架 · 干货攻略
JEPAAnything 是一个领域无关(domainagnostic)的通用世界模型学习框架,发表在 arXiv (2609.20800),由 GenVerse 团队开源。它的核心创新叫做 Orthogonal Predictive Factorization(OPF,正交预测因子分解)——把 JEPA(联合嵌入预测架构)的单一目标表征替换为一组互补的、正…
Gen-Verse/JEPA-Anything Jay 2026-09-26
FlyOCR:用果蝇全神经连接组做 PDF 文字识别 · 干货攻略
FlyOCR(jerryjliu/fly_ocr)是 LlamaIndex 联合创始人 Jerry Liu 在 2026 年 9 月发布的一个探索性项目:将成年雄性果蝇(_Drosophila melanogaster_)全中枢神经系统(CNS)连接组 MaleCNS v1.0 的固定神经回路,用来做印刷体文字识别。 核心原理一句话:把 PDF 页面切成单个…
jerryjliu/fly_ocr Jay 2026-09-25
Jev + DeepSeek V4 Flash:AI 论文批量打标流水线 · 干货攻略
这是一个生产级论文分类流水线,使用 Jev(TypeSafe AI 出品的 System One 模型)对 DAIRAI 维护的 ~2.3K 篇 AI 论文进行重新打标。总成本仅 $0.14,耗时约 83 秒。 核心思路:用便宜的 DeepSeek V4 Flash 先生成初稿标签,再用 Jev 做高质量核验与修正——这是 System One(快思考)+ …
Jay 2026-09-24
ayaka-notes/ayakaleaf-pro · 上手攻略
⚠️ 本文基于仓库 serverpro 分支 README、官网文档站 GitHub Releases 元信息(GitHub 已验 · 200 OK · 抓取于 20260923)撰写,未 clone 源码、未跑通部署。功能列表、依赖均按官方声明。 ayakanotes/ayakaleafpro 是一个对 Overleaf Community Edition…
`ayaka-notes/ayakaleaf-pro` spark 2026-09-24
penso/herdr-gpui · 上手攻略
⚠️ 本文基于仓库 README 实测(GitHub 已验 · 200 OK · 抓取于 20260923),未 clone 源码、未跑构建;版本号、依赖均来自 README 声明,未独立交叉核实。仓库项目方明确声明「与 Herdr / herdr.dev 无关的非官方项目」。 penso/herdrgpui 是一个用 Rust + GPUI 写的 macO…
`penso/herdr-gpui` spark 2026-09-24
代表攻略
Skill Entropy:衡量并训练 LLM 跨技能切换能力 · 干货攻略
Skill Entropy 是普林斯顿大学(联合 CMU、UToronto、UIUC、Stanford、Oxford)团队提出的一套跨技能长程推理评测与训练框架,包含三个核心组件: 1. Skill Entropy(技能熵):一种度量技能切换难度的有向成对指标。当参考模型(Claudeopus4.7)分别处理两个技能时表现良好,但在连续执行两者时失败,则该技…
Gen-Verse/Skill-Entropy-RL Jay 2026-09-22
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

mlc-ai/xgrammar · 上手攻略
XGrammar 是 MLC AI 开源的高效、灵活、可移植的结构化生成引擎。它把 LLM 的解码过程约束在一个上下文无关文法(contextfree grammar)内,保证输出 100% 符合给定 schema(JSON、正则、自定义 CFG 等),同时把约束解码的开销压到接近零——在 JSON 生成场景下做到「nearzero overhead」,是目…
[mlc-ai/xgrammar](https://github.com/mlc-ai/xgrammar) spark 2026-09-21