OctLLM(Octrees as an Explicit 3D Language)是 2026 年 10 月 5 日发布于 arXiv(2610.02388)的一篇多模态 LLM 论文,来自北京大学与独立研究者团队。它提出了用稀疏八叉树(SOctree)作为 3D 几何的显式序列语言,配合一种双流 token 路由 transformer,让同一个 LLM…
仓库攻略
154 篇 · 150 个项目 · 其它
Jev 是 TypeSafe AI(2026 年 9 月中旬发布)的首个 "System One" 模型——它不是语言模型,不生成任何文本,只做一件事:输入一段结构化 state,加上类型化的问题,得到带概率的决策答案。 这个定位恰好精确命中了 Agent 评测的核心形状:给定 agent 的 trace 和状态,判断这次行为是否合规、是否安全、评分几分。 …
CODA 是一套 GPU kernel 抽象框架,核心主张是:Transformer 里那些看似必须单独启动 kernel 的内存密集型算子(normalization、activation、residual update、reduction),可以通过数学重参数化,全部塞进 GEMM 的 epilogue 阶段执行——在 GEMM 输出 tile 还在芯片…
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
这是一篇由独立开发者 Giles Thomas 撰写的实操复盘(2026年9月10日发布),记录了如何从 Sebastian Raschka 的书《Build a Large Language Model (from Scratch)》中的 GPT2 代码出发,添加 MoE(MixtureofExperts,稀疏专家混合)支持,并在单张 RTX 3090(2…
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
哈佛团队(Aayush Karan、Sitan Chen、Yilun Du)提出 Projection Sampling(投影采样):在 SFT 训练前,用 MCMC(MetropolisHastings)把离策略(offpolicy)的专家轨迹逐步重写为贴近基础模型分布的轨迹,再送进标准 SFT。论文标题开宗明义——SFT Learns Better Th…
这是一条关于 LLM 开发策略的硬核判断,来自 Sebastian Raschka(Sebastian Raschka,AI 教育者、《Build a Large Language Model (From Scratch)》作者)。 在被播客问到「如果有 xx 百万美元预算,怎么从头开发一个 frontier 级别 LLM」时,他的答案是: 用现有开源模型,…
2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5(模型 ID:claudesonnet55),这是 Claude 5.5 系列的第二款模型,第一款是同年 9 月 22 日的旗舰款 Opus 5.5。Sonnet 5.5 定位于「高质量日常任务」,定位在 Opus 5.5 之下,但在多项编码评测中超越了 Opus 5…
表格中存在 blank cell(空单元格)时,大多数文档 OCR / 解析工具在输出 markdown 表格时,会将该行后续所有数值整体左移一格,从而导致数值进入错误的列,造成静默的数据错位。这种错误不抛异常、只静默错位——下游 Agent 若直接使用这组数值去做判断,就会产生错误决策。 LlamaIndex 联合创始人 Jerry Liu(@jerryj…
Looped Transformer(循环 Transformer)是一种通过复用同一组层权重、多次遍历来增加有效计算深度的架构设计。与传统 Transformer 堆叠 N 层独立权重不同,Looped Transformer 将同一组权重作用于输入多次,等效于用更少参数实现更深网络。 典型案例: OuroThinking 2.6B:全部层循环 4 次,产…
代表攻略
LiteParse:空间布局优先的本地文档解析——表格空白格错位的根本解法 · 干货攻略
LiteParse 是 LlamaIndex 于 2026 年 3 月开源的本地文档解析 CLI 和 TypeScript 原生库,核心理念是「保留布局,而非检测结构」——将 PDF、Office 文档、图片中的文本投影到空间网格(spatial grid),以相对位置关系输出文本,而不是先将文档结构检测并转换为 Markdown 表格。 这直接回应了 @j…
代表攻略
SAS:端到端优化上下文排名的稀疏注意力机制 · 干货攻略
SAS(Simple Attention Sparsification via EndtoEnd Optimization of Context Ranking) 是腾讯混元(Hunyuan)团队提出的一种后训练稀疏注意力机制,核心贡献是让选择器(selector)能够直接被语言建模损失端到端反向更新,从而在固定注意力预算下学会最有效地排列和选择上下文块。 …
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
2026 年 9 月 27 日,AI 领域知名独立开发者 Simon Willison 在 WeAreDevelopers World Congress North America(圣何塞)发表了闭幕 Keynote,题目为「2026 in LLMs (so far)」。这是一篇按时间线串联 2026 年 AI 领域所有重大事件的超长综述,涵盖从 GPT5.…
核验说明:本文数学推导基于 Cameron R. Wolfe, Ph.D. (@cwolferesearch) Substack 原文;重要性采样的定义与 PPO 论文(Schulman et al., 2017, arXiv:1707.06347)交叉一致;具体公式形式经 RLHF Book(Nathan Lambert)与 HuggingFace Dee…
2026 年 9 月,LlamaIndex 联合创始人 & CEO Jerry Liu(@jerryjliu0)在 X 上发布了一项系统性评测结果:对 16 款前沿 VLM(视觉语言模型) 进行文档解析能力的横向对比。测试覆盖 Opus 5.5、GPT6 Sol/Luna 等最新模型,评测基准为 LlamaIndex 自建的 ParseBench。 核心发现…
ProgramDistill 是微软研究院(Microsoft Research Montréal)与韩国科学技术院(KAIST)于 2026 年 9 月发布的代码智能基准。它的核心思路不同于传统 SWEbench——不依赖 GitHub Issue 或人工撰写的任务描述,而是让 AI Agent 通过与一个功能完整的参考应用交互,自行推断出缺失的功能,再在…
onPanda(全称 onPolicy alignment data annotator)是 StepFun 与厦门大学联合开源的交互式 LLM 对齐数据标注工具,论文链接 arXiv 2609.24983。核心创新是token 级修正(tokenlevel correction)交互范式——标注员不再手动编辑完整回复,而是在模型生成过程中定位第一个出错 t…
Ember1 是 Fireworks Research(Fireworks AI 的研究团队)于 2026 年 9 月 23 日发布的推理专用模型,本质是对 Moonshot AI 的开源推理模型 Kimi K3 做后训练压缩——让它学会用更少的思考 token 到达同等质量的答案。 这不是新架构,也不是新基座模型,而是 K3 的一次 specialized…
本攻略解读 @simonw(Simon Willison)于 2026 年 9 月 15 日发布的实操教程,展示如何用纯浏览器原生 API(Web Audio API + WebSocket)零依赖接入 Google Gemini 3.8 Live 语音对话 API,全程不用任何第三方 npm 包。 分享者 Simon Willison 是 Python/W…
OpenMOPD(Open MultiTeacher OnPolicy Distillation)是清华大学AIR学院与字节跳动Seed团队开源的多教师同策略蒸馏完整配方,发布于 2026 年 8 月 19 日(arXiv:2608.19098)。它解决了一个 2026 年后训练领域公认难题:如何把多个领域专精的 RL 教师(如数学、代码、指令遵循)的能力,…
一篇 2026 年 8 月 10 日提交的学术论文(arXiv:2608.09867,cs.CR),由来自 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Snyk 的研究人员撰写。论文发现:Anthropic、OpenAI、Google …
2026 年 8 月 10 日,一支来自 ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、MATS Research 的研究团队(含 Alexander Panfilov、David Schmotz、Ilia Shumailov 等人)在 arXiv 发布论文 "St…
JEPAAnything 是一个领域无关(domainagnostic)的通用世界模型学习框架,发表在 arXiv (2609.20800),由 GenVerse 团队开源。它的核心创新叫做 Orthogonal Predictive Factorization(OPF,正交预测因子分解)——把 JEPA(联合嵌入预测架构)的单一目标表征替换为一组互补的、正…
FlyOCR(jerryjliu/fly_ocr)是 LlamaIndex 联合创始人 Jerry Liu 在 2026 年 9 月发布的一个探索性项目:将成年雄性果蝇(_Drosophila melanogaster_)全中枢神经系统(CNS)连接组 MaleCNS v1.0 的固定神经回路,用来做印刷体文字识别。 核心原理一句话:把 PDF 页面切成单个…
这是一个生产级论文分类流水线,使用 Jev(TypeSafe AI 出品的 System One 模型)对 DAIRAI 维护的 ~2.3K 篇 AI 论文进行重新打标。总成本仅 $0.14,耗时约 83 秒。 核心思路:用便宜的 DeepSeek V4 Flash 先生成初稿标签,再用 Jev 做高质量核验与修正——这是 System One(快思考)+ …
⚠️ 本文基于仓库 serverpro 分支 README、官网文档站 GitHub Releases 元信息(GitHub 已验 · 200 OK · 抓取于 20260923)撰写,未 clone 源码、未跑通部署。功能列表、依赖均按官方声明。 ayakanotes/ayakaleafpro 是一个对 Overleaf Community Edition…
⚠️ 本文基于仓库 README 实测(GitHub 已验 · 200 OK · 抓取于 20260923),未 clone 源码、未跑构建;版本号、依赖均来自 README 声明,未独立交叉核实。仓库项目方明确声明「与 Herdr / herdr.dev 无关的非官方项目」。 penso/herdrgpui 是一个用 Rust + GPUI 写的 macO…
代表攻略
Skill Entropy:衡量并训练 LLM 跨技能切换能力 · 干货攻略
Skill Entropy 是普林斯顿大学(联合 CMU、UToronto、UIUC、Stanford、Oxford)团队提出的一套跨技能长程推理评测与训练框架,包含三个核心组件: 1. Skill Entropy(技能熵):一种度量技能切换难度的有向成对指标。当参考模型(Claudeopus4.7)分别处理两个技能时表现良好,但在连续执行两者时失败,则该技…
XGrammar 是 MLC AI 开源的高效、灵活、可移植的结构化生成引擎。它把 LLM 的解码过程约束在一个上下文无关文法(contextfree grammar)内,保证输出 100% 符合给定 schema(JSON、正则、自定义 CFG 等),同时把约束解码的开销压到接近零——在 JSON 生成场景下做到「nearzero overhead」,是目…