OctLLM(Octrees as an Explicit 3D Language)是 2026 年 10 月 5 日发布于 arXiv(2610.02388)的一篇多模态 LLM 论文,来自北京大学与独立研究者团队。它提出了用稀疏八叉树(SOctree)作为 3D 几何的显式序列语言,配合一种双流 token 路由 transformer,让同一个 LLM…
仓库攻略
581 篇 · 569 个项目 · jay
Jev 是 TypeSafe AI(2026 年 9 月中旬发布)的首个 "System One" 模型——它不是语言模型,不生成任何文本,只做一件事:输入一段结构化 state,加上类型化的问题,得到带概率的决策答案。 这个定位恰好精确命中了 Agent 评测的核心形状:给定 agent 的 trace 和状态,判断这次行为是否合规、是否安全、评分几分。 …
JustinTime Agentic OCR(JIT OCR)是 LlamaIndex CEO Jerry Liu(@jerryjliu0)命名并系统阐述的一种文档解析模式,官方博客完整阐述见 llamaindex.ai/blog/justintimeagenticocr。 核心思想很简单:不要一开始就对所有文档跑昂贵的 VLM OCR,先用轻量免费工具快速…
FineEnvs MultiHarness RL 是 Adithya S K(@adithya_s_k)于 2026 年 10 月 1 日发布的一套开源实践,完整仓库位于 adithyask/FineEnvs,配套文章见 HF Space · multiharnessrl。 它的核心命题是:训练数据和算法不是瓶颈,Harness(智能体框架)才是。 所谓 H…
代表攻略
Raschka《从零搭推理模型》第3-6期:数学 Verifier + RLVR + GRPO 完整解读 · 干货攻略
这是一条关于 Raschka《Build a Reasoning Model (From Scratch)》第 3–6 期系列的实战解读。 该系列第 3 期(20260913 发布)聚焦如何从零实现一个数学 Verifier,用于: 第 6 期(20261003 发布)则把这个 Verifier 复用为 RLVR 训练的奖励信号,驱动 GRPO(Group …
同类项目 3展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
rasbt/reasoning-from-scratch
Stars 4,951
代表
rasbt/reasoning-from-scratch
Stars 4,951
rasbt/reasoning-from-scratch
Stars 4,951
CODA 是一套 GPU kernel 抽象框架,核心主张是:Transformer 里那些看似必须单独启动 kernel 的内存密集型算子(normalization、activation、residual update、reduction),可以通过数学重参数化,全部塞进 GEMM 的 epilogue 阶段执行——在 GEMM 输出 tile 还在芯片…
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
CorpusMap 是微软 + KAIST 联合论文 Follow the Entities: A Corpus Map for Agentic Search(arXiv:2609.37226,2026 年 9 月 29 日提交)提出的离线实体导航层。 核心问题:企业文档集合里,答案所需的证据散落在多份文档中(一份记录审批、一份记录需求、一份记录最新状态),…
Pixeltable 是一个将数据库、编排层和服务层合一的 Python 库,专为多模态 AI 数据应用设计。它的核心主张是:传统 AI 应用需要协调 Postgres(存储)+ 对象存储(文件)+ 向量数据库( Embedding)+ 消息队列(编排)+ API 服务层(HTTP),而 Pixeltable 将这些全部压缩到一个 app.py 文件中——声…
REA(Reverse Engineer Anything)是一个连接 AI Coding Agent 与逆向工程工具链的 MCP(Model Context Protocol)中间件。它的核心价值是:让 AI 代理在不了解源码的情况下,通过 Hopper、Ghidra、IDA Pro 等二进制分析引擎,理解和复现目标应用的行为。 支持的被分析目标包括: J…
注意:仓库名称有一定迷惑性——它并非自动交易机器人,而是一个纯终端界面的 Ethereum 智能合约部署与管理工具。 核心功能是:本地编译 Solidity、实时预览 gas 费用、部署到 Ethereum Mainnet,并通过交互式菜单调用合约函数。内置可选的前置运行(frontrunning)示例逻辑和一个独立的 mempool 监控进程,用途更偏向"…
这是一篇由独立开发者 Giles Thomas 撰写的实操复盘(2026年9月10日发布),记录了如何从 Sebastian Raschka 的书《Build a Large Language Model (from Scratch)》中的 GPT2 代码出发,添加 MoE(MixtureofExperts,稀疏专家混合)支持,并在单张 RTX 3090(2…
2026年9月,LlamaIndex CEO Jerry Liu 在 AI Engineer World's Fair 2026(AI工程师世界博览会)发表了一场21分钟演讲,标题为 "Building the Document Context Layer for AI Agents"(为 AI Agent 构建文档上下文层)。这场演讲的核心论点是: RAG…
ScholarEvolve 是 2026 年 9 月 30 日在 arXiv(2610.00972)发表的一篇论文提出的框架,核心解决一个问题:当新的 Agent 论文发表后,如何让 Harness 自动跟着演进,而不是等人类工程师手动实现? 它把论文翻译成 Harness 改进分成四步:研究 Agent 审计失败 → 检索相关论文 → 写变异蓝图 → 编码…
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
哈佛团队(Aayush Karan、Sitan Chen、Yilun Du)提出 Projection Sampling(投影采样):在 SFT 训练前,用 MCMC(MetropolisHastings)把离策略(offpolicy)的专家轨迹逐步重写为贴近基础模型分布的轨迹,再送进标准 SFT。论文标题开宗明义——SFT Learns Better Th…
AI Engineering Course 是由 Amit Shekhar(Outcome School 创始人)维护的免费、完整、自包含的 AI 工程学习路径。目前 18 个模块、146+ 节课,每节课都是一篇图文并茂的博客,部分附视频。从机器学习基础讲到 LLM 微调、RAG、AI Agent、推理工程、AI Safety 和系统设计,适合想从零建立完整…
Data Peek 是一款轻量、键盘优先的 SQL 客户端桌面应用,支持 PostgreSQL、MySQL、Microsoft SQL Server,正在开发 SQLite 支持(约 1,677 Stars,单人维护)。核心理念:打开就用,用完就走,不拖泥带水。两秒启动、不跑 splash、不装插件、内存占用低——面向需要随时瞄一眼数据但不打算对付复杂 DB…
365 Skills 是面向 AI 编码智能体的生产级技能集合(Agent Skills),由独立开发者社区 Agents365ai 维护。不同于单点工具,它以"插件市场"的形态一口气提供 30+ 款专项技能,覆盖开发设计、科研、绘图、媒体创意等多个维度。最大特点:与 Agent 无关——兼容 Claude Code、Cursor、Copilot、OpenC…
2026 年 10 月 3 日,Simon Willison(Django 联合创始人、DataSette 作者)在 simonwillison.net 发文,系统阐述了 LLM API 与 AI Agent 必须在服务层面默认开启硬性预算上限 这一工程原则。 核心主张:一切按量付费的 API 和云服务,都应该让用户能设置"月度消费超 $X 后直接返回错误、…
2026 年 10 月 1 日,Hugging Face 与 Liquid AI 联合发布了 OpenEnv 多 Harness 同步 RL 训练栈,核心方法论见"The ultimate guide to multiharness RL"(Adithya S Kolavi 等 8 位作者)。该工作的核心洞察是: 同一个模型权重,在不同 Agent Harn…
FPF(First Principles Framework)是一套 AI 原生的声明式模式语言(pattern language)体系,面向系统工程、研究和管理的知识框架。 FPF 的核心思想是:为工程师和 AI Agent 提供一套共享、精确的语言,用来描述系统(System)、方法(Method)、工作(Work)、证据(Evidence)、决策(De…
这是一个社区维护的下游 fork,专注于为 DeepSeek Harness(DeepSeek 官方桌面端)提供一等公民级的 Linux 打包支持。 官方 DeepSeek Harness 桌面端目前只发布 macOS 和 Windows 安装包,Linux 用户要么退而求其次用 Web 版,要么自己从源码编译。本项目填补了这个缺口:以 AppImage /…
Lime 是一个开源全栈 AI Agent,同时提供桌面 GUI(Electron)和 CLI/TUI 两种界面。它把 Agent 循环、文件系统、终端进程、代码编辑、工具调用、MCP 扩展、Skill 机制、多模态输入输出、模型路由和多 Agent 协作,整合到一条可追踪的任务链(Thread)中。 定位上与 Claude Code、WorkBuddy、C…
这是一条关于 LLM 开发策略的硬核判断,来自 Sebastian Raschka(Sebastian Raschka,AI 教育者、《Build a Large Language Model (From Scratch)》作者)。 在被播客问到「如果有 xx 百万美元预算,怎么从头开发一个 frontier 级别 LLM」时,他的答案是: 用现有开源模型,…
OmniIO Skills 是由新加坡国立大学(NUS)与牛津大学(Oxford)联合发布的开源 Agent 外挂框架(Agent Harness),通过即插即用的 MCP Skill 机制,让已有的 Coding Agent(Codex、Claude Code 等)无需更换底层模型,即可原生支持图像、视频、音频、文档、3D 资产、代码、网页七大模态的理解与…
2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5(模型 ID:claudesonnet55),这是 Claude 5.5 系列的第二款模型,第一款是同年 9 月 22 日的旗舰款 Opus 5.5。Sonnet 5.5 定位于「高质量日常任务」,定位在 Opus 5.5 之下,但在多项编码评测中超越了 Opus 5…
表格中存在 blank cell(空单元格)时,大多数文档 OCR / 解析工具在输出 markdown 表格时,会将该行后续所有数值整体左移一格,从而导致数值进入错误的列,造成静默的数据错位。这种错误不抛异常、只静默错位——下游 Agent 若直接使用这组数值去做判断,就会产生错误决策。 LlamaIndex 联合创始人 Jerry Liu(@jerryj…
MCP(Model Context Protocol)是 Anthropic 于 2024 年末开源的 AI Agent 工具调用协议,旨在标准化"大模型如何调用外部工具"这件事。2026 年 7 月 28 日,MCP 发布重大版本(规范代号 20260728),核心变化是彻底移除会话层,将协议改造为纯请求/响应无状态架构。 这次变化直接影响:使用 MCP …
Looped Transformer(循环 Transformer)是一种通过复用同一组层权重、多次遍历来增加有效计算深度的架构设计。与传统 Transformer 堆叠 N 层独立权重不同,Looped Transformer 将同一组权重作用于输入多次,等效于用更少参数实现更深网络。 典型案例: OuroThinking 2.6B:全部层循环 4 次,产…