研究库 实战攻略
Guides · organized/guides

仓库攻略

581 篇 · 569 个项目 · jay

OctLLM:用八叉树作为显式 3D 语言的多模态 LLM · 干货攻略
OctLLM(Octrees as an Explicit 3D Language)是 2026 年 10 月 5 日发布于 arXiv(2610.02388)的一篇多模态 LLM 论文,来自北京大学与独立研究者团队。它提出了用稀疏八叉树(SOctree)作为 3D 几何的显式序列语言,配合一种双流 token 路由 transformer,让同一个 LLM…
Jay 2026-10-10
Jev-as-a-Judge:把评分跑进每一个生产 Trace · 干货攻略
Jev 是 TypeSafe AI(2026 年 9 月中旬发布)的首个 "System One" 模型——它不是语言模型,不生成任何文本,只做一件事:输入一段结构化 state,加上类型化的问题,得到带概率的决策答案。 这个定位恰好精确命中了 Agent 评测的核心形状:给定 agent 的 trace 和状态,判断这次行为是否合规、是否安全、评分几分。 …
Jay 2026-10-09
代表攻略
Raschka《从零搭推理模型》第3-6期:数学 Verifier + RLVR + GRPO 完整解读 · 干货攻略
这是一条关于 Raschka《Build a Reasoning Model (From Scratch)》第 3–6 期系列的实战解读。 该系列第 3 期(20260913 发布)聚焦如何从零实现一个数学 Verifier,用于: 第 6 期(20261003 发布)则把这个 Verifier 复用为 RLVR 训练的奖励信号,驱动 GRPO(Group …
工程化 rasbt/reasoning-from-scratch Stars 4,951 Jay 2026-10-08
同类项目 3展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

CODA: 把 Transformer Block 重写成 GEMM-Epilogue 程序 · 干货攻略
CODA 是一套 GPU kernel 抽象框架,核心主张是:Transformer 里那些看似必须单独启动 kernel 的内存密集型算子(normalization、activation、residual update、reduction),可以通过数学重参数化,全部塞进 GEMM 的 epilogue 阶段执行——在 GEMM 输出 tile 还在芯片…
Jay 2026-10-08
Liquid AI d1 决策模型:零输出 Token 跑分类/路由/评分 · 干货攻略
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
无(主产品为 Liquid AI 托管 API,非开源权重) Jay 2026-10-08
pixeltable/pixeltable · 上手攻略
Pixeltable 是一个将数据库、编排层和服务层合一的 Python 库,专为多模态 AI 数据应用设计。它的核心主张是:传统 AI 应用需要协调 Postgres(存储)+ 对象存储(文件)+ 向量数据库( Embedding)+ 消息队列(编排)+ API 服务层(HTTP),而 Pixeltable 将这些全部压缩到一个 app.py 文件中——声…
Agent 智能体 pixeltable/pixeltable Stars 1,638 Jay 2026-10-07
morluto/rea · 上手攻略
REA(Reverse Engineer Anything)是一个连接 AI Coding Agent 与逆向工程工具链的 MCP(Model Context Protocol)中间件。它的核心价值是:让 AI 代理在不了解源码的情况下,通过 Hopper、Ghidra、IDA Pro 等二进制分析引擎,理解和复现目标应用的行为。 支持的被分析目标包括: J…
Agent 智能体 morluto/rea Stars 10,286 Jay 2026-10-07
yoge7388095s/eth-trading-bot · 上手攻略
注意:仓库名称有一定迷惑性——它并非自动交易机器人,而是一个纯终端界面的 Ethereum 智能合约部署与管理工具。 核心功能是:本地编译 Solidity、实时预览 gas 费用、部署到 Ethereum Mainnet,并通过交互式菜单调用合约函数。内置可选的前置运行(frontrunning)示例逻辑和一个独立的 mempool 监控进程,用途更偏向"…
Agent 智能体 yoge7388095s/eth-trading-bot Stars 156 Jay 2026-10-07
ScholarEvolve:让论文自动演化 Agent Harness · 干货攻略
ScholarEvolve 是 2026 年 9 月 30 日在 arXiv(2610.00972)发表的一篇论文提出的框架,核心解决一个问题:当新的 Agent 论文发表后,如何让 Harness 自动跟着演进,而不是等人类工程师手动实现? 它把论文翻译成 Harness 改进分成四步:研究 Agent 审计失败 → 检索相关论文 → 写变异蓝图 → 编码…
Agent 智能体 Jay 2026-10-06
VeriHarness:让同一模型既当选手又当裁判 · 干货攻略
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
google-research/veriharness Jay 2026-10-06
Finetuning with Sampling:标准 SFT 打赢 RL 的新范式 · 干货攻略
哈佛团队(Aayush Karan、Sitan Chen、Yilun Du)提出 Projection Sampling(投影采样):在 SFT 训练前,用 MCMC(MetropolisHastings)把离策略(offpolicy)的专家轨迹逐步重写为贴近基础模型分布的轨迹,再送进标准 SFT。论文标题开宗明义——SFT Learns Better Th…
aakaran/finetuning-with-sampling Jay 2026-10-05
amitshekhariitbhu/ai-engineering-course · 上手攻略
AI Engineering Course 是由 Amit Shekhar(Outcome School 创始人)维护的免费、完整、自包含的 AI 工程学习路径。目前 18 个模块、146+ 节课,每节课都是一篇图文并茂的博客,部分附视频。从机器学习基础讲到 LLM 微调、RAG、AI Agent、推理工程、AI Safety 和系统设计,适合想从零建立完整…
Agent 智能体 amitshekhariitbhu/ai-engineering-course Stars 500 Jay 2026-10-05
Rohithgilla12/data-peek · 上手攻略
Data Peek 是一款轻量、键盘优先的 SQL 客户端桌面应用,支持 PostgreSQL、MySQL、Microsoft SQL Server,正在开发 SQLite 支持(约 1,677 Stars,单人维护)。核心理念:打开就用,用完就走,不拖泥带水。两秒启动、不跑 splash、不装插件、内存占用低——面向需要随时瞄一眼数据但不打算对付复杂 DB…
数据与向量库 Rohithgilla12/data-peek Stars 1,677 Jay 2026-10-05
Agents365-ai/365-skills · 上手攻略
365 Skills 是面向 AI 编码智能体的生产级技能集合(Agent Skills),由独立开发者社区 Agents365ai 维护。不同于单点工具,它以"插件市场"的形态一口气提供 30+ 款专项技能,覆盖开发设计、科研、绘图、媒体创意等多个维度。最大特点:与 Agent 无关——兼容 Claude Code、Cursor、Copilot、OpenC…
Agent 智能体 Agents365-ai/365-skills Stars 66 Jay 2026-10-05
LLM API 与 AI Agent 必须上硬性默认预算上限 · 干货攻略
2026 年 10 月 3 日,Simon Willison(Django 联合创始人、DataSette 作者)在 simonwillison.net 发文,系统阐述了 LLM API 与 AI Agent 必须在服务层面默认开启硬性预算上限 这一工程原则。 核心主张:一切按量付费的 API 和云服务,都应该让用户能设置"月度消费超 $X 后直接返回错误、…
Agent 智能体 Jay 2026-10-05
ailev/FPF · 上手攻略
FPF(First Principles Framework)是一套 AI 原生的声明式模式语言(pattern language)体系,面向系统工程、研究和管理的知识框架。 FPF 的核心思想是:为工程师和 AI Agent 提供一套共享、精确的语言,用来描述系统(System)、方法(Method)、工作(Work)、证据(Evidence)、决策(De…
工程化 ailev/FPF Stars 512 Jay 2026-10-04
Zhou-Yujing114514/deepseek-harness-linux · 上手攻略
这是一个社区维护的下游 fork,专注于为 DeepSeek Harness(DeepSeek 官方桌面端)提供一等公民级的 Linux 打包支持。 官方 DeepSeek Harness 桌面端目前只发布 macOS 和 Windows 安装包,Linux 用户要么退而求其次用 Web 版,要么自己从源码编译。本项目填补了这个缺口:以 AppImage /…
评测基准 Zhou-Yujing114514/deepseek-harness-linux Stars 59 Jay 2026-10-04
limecloud/lime · 上手攻略
Lime 是一个开源全栈 AI Agent,同时提供桌面 GUI(Electron)和 CLI/TUI 两种界面。它把 Agent 循环、文件系统、终端进程、代码编辑、工具调用、MCP 扩展、Skill 机制、多模态输入输出、模型路由和多 Agent 协作,整合到一条可追踪的任务链(Thread)中。 定位上与 Claude Code、WorkBuddy、C…
Agent 智能体 limecloud/lime Stars 1,482 Jay 2026-10-04
Omni-IO Skills:将 Coding Agent 变成全模态原生 Agent 的即插即用 MCP Skill 框架 · 干货攻略
OmniIO Skills 是由新加坡国立大学(NUS)与牛津大学(Oxford)联合发布的开源 Agent 外挂框架(Agent Harness),通过即插即用的 MCP Skill 机制,让已有的 Coding Agent(Codex、Claude Code 等)无需更换底层模型,即可原生支持图像、视频、音频、文档、3D 资产、代码、网页七大模态的理解与…
Agent 智能体 any2any-mllm/Omni-IO-Skill Jay 2026-10-04
Claude Sonnet 5.5 进入免费层——为什么这值得关注 · 干货攻略
2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5(模型 ID:claudesonnet55),这是 Claude 5.5 系列的第二款模型,第一款是同年 9 月 22 日的旗舰款 Opus 5.5。Sonnet 5.5 定位于「高质量日常任务」,定位在 Opus 5.5 之下,但在多项编码评测中超越了 Opus 5…
Jay 2026-10-03
LlamaParse 表格 blank cell 导致数值静默错位的根因与防护 · 干货攻略
表格中存在 blank cell(空单元格)时,大多数文档 OCR / 解析工具在输出 markdown 表格时,会将该行后续所有数值整体左移一格,从而导致数值进入错误的列,造成静默的数据错位。这种错误不抛异常、只静默错位——下游 Agent 若直接使用这组数值去做判断,就会产生错误决策。 LlamaIndex 联合创始人 Jerry Liu(@jerryj…
Jay 2026-10-03