研究库 实战攻略
Guides · organized/guides

仓库攻略

22 篇 · 21 个项目 · 其它 · 多模态

OctLLM:用八叉树作为显式 3D 语言的多模态 LLM · 干货攻略
OctLLM(Octrees as an Explicit 3D Language)是 2026 年 10 月 5 日发布于 arXiv(2610.02388)的一篇多模态 LLM 论文,来自北京大学与独立研究者团队。它提出了用稀疏八叉树(SOctree)作为 3D 几何的显式序列语言,配合一种双流 token 路由 transformer,让同一个 LLM…
Jay 2026-10-10
Liquid AI d1 决策模型:零输出 Token 跑分类/路由/评分 · 干货攻略
d1 是 Liquid AI 于 2026 年 9 月 29 日发布的决策模型(Decision Model),2026 年 10 月 5 日追加视觉支持后正式对外。 核心设计思路与语言模型相反:不给文字答案,而是对同一个输入直接输出概率分布——每道题一次前向传播,零 Token 生成。 d1 的官方定位是替代那些「本不需要 LLM 做的事情」:分类、路由、…
无(主产品为 Liquid AI 托管 API,非开源权重) Jay 2026-10-08
VeriHarness:让同一模型既当选手又当裁判 · 干货攻略
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading…
google-research/veriharness Jay 2026-10-06
Jev + DeepSeek V4 Flash:AI 论文批量打标流水线 · 干货攻略
这是一个生产级论文分类流水线,使用 Jev(TypeSafe AI 出品的 System One 模型)对 DAIRAI 维护的 ~2.3K 篇 AI 论文进行重新打标。总成本仅 $0.14,耗时约 83 秒。 核心思路:用便宜的 DeepSeek V4 Flash 先生成初稿标签,再用 Jev 做高质量核验与修正——这是 System One(快思考)+ …
Jay 2026-09-24
Tencent Hunyuan AuK 语音生成与编辑全攻略 · 干货攻略
AuK(发音接近 "auk",一种海鸟)是腾讯混元(Tencent Hunyuan)于 2026 年 9 月 9 日 开源的多任务语音生成与编辑统一模型,arXiv 论文编号 2609.08936,MIT 许可证,代码与权重全部公开。 核心定位:一个模型、一套指令格式,覆盖 5 大类 20+ 任务,不再需要为每个子任务部署独立模型。 传统语音系统把 TTS、…
Tencent-Hunyuan/AuK Jay 2026-09-12
Miles v0.1 · 干货攻略
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
radixark/miles Jay 2026-09-12
浏览器内 LLM 微调:wllama WebGPU 训练 PoC 解析 · 干货攻略
wllama 是 ngxson(XuanSon Nguyen)维护的 WebAssembly + WebGPU 绑定库,让 llama.cpp 可以在浏览器内直接运行大语言模型推理,2026 年 9 月 5 日他发布了 首个浏览器内微调(finetuning)PoC,证明在 WebGPU 上训练 LLM 是可行的。@maximelabonne(Liquid …
ngxson/wllama Jay 2026-09-10
GLM-5.3-Flash 架构拆解:KDA + 稀疏 MLA 双效混合注意力 · 干货攻略
2026 年 8 月 20 日,OpenRouter 上悄然出现一个匿名模型 Ox Alpha:无所属、无模型卡、免费使用、1M token 上下文、支持图文视频输入。六天后,它成了 OpenRouter 有史以来最热门的模型,吞吐量是第二名的 2.3 倍。8 月 26 日,Bloomberg 证实其真身——GLM5.3Flash,来自智谱 AI(Zhipu…
Jay 2026-09-02
SCoPE: 视线坐标位置编码实现视频生成相机控制 · 干货攻略
SCoPE(SightlineCoordinate Positional Encoding)是腾讯 ARC Lab 与港大、港科大联合提出的视频生成相机控制方法,发表在 2026 年。其核心思想极为优雅:将每条相机视线(camera ray)作为 token 的第二类位置坐标,注入预训练视频 Diffusion Transformer(DiT)的注意力机制,…
TencentARC/SCoPE Jay 2026-08-28
Qwen3.8-27B 默认推理设置过度思考 · 干货攻略
Qwen3.827B 是阿里巴巴 Qwen 团队发布的 Apache 2.0 开源多模态大模型(27B 参数,视觉+推理能力,原生上下文 256K,可扩展至 1M),Hugging Face GGUF 量化版本约 17GB(Q4_K_M),适合在中高端笔记本或迷你主机本地运行。 该模型的 reasoning_effort 参数控制隐藏推理 token 的用量…
Jay 2026-08-22
代表攻略
无需微调:VLM 调度层填平"编排差距",真实机器人 16.7% → 97.3% · 干货攻略
Pigey(Physical Agency orchestrator)是一个闭环 VLM 调度层,驱动已有的冻结机器人技能(frozen skills),无需任何新数据或微调,即可在仿真和真实机器人上大幅提升推理密集型任务的成功率。 核心论文:"Addressing the Orchestration Gap in Generalist Robots via…
lianegalanti/Pigey Jay 2026-08-19
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

SpyRL:用「谁是卧底」游戏为开放域任务生成自验证 RL 奖励 · 干货攻略
SpyRL 是 RLSVR(Reinforcement Learning with SelfVerifiable Rewards)的具体实现,由 Duke 大学、Adobe、NUS、Penn State 等机构联合提出,已被 COLM 2026 接收。 核心思想一句话:把开放域任务变成一个「谁是卧底」游戏,让游戏的投票结果自动成为可验证的 RL 奖励信号——…
wangqinsi1/RLSVR(代码在 `SpyRL` 分支) Jay 2026-08-11
MiniMax-H3 MLX 本地跑通攻略 · 干货攻略
MiniMaxH3 是 MiniMax 发布的一个全模态生成系统(omnimodal generative system),不是语言模型,也不是单纯的文生视频——它接收文本、图片、音频、视频作为输入,统一编码为一个 packed 序列,再由一个 33B 的 diffusion transformer 联合去噪生成视频 + 立体声音频,输出最长 15 秒、分辨…
PipeNetwork/minimax-h3-mlx Jay 2026-08-07
Sebastian Raschka LLM Architecture Gallery 七月更新:6 款新开源模型架构解析 · 干货攻略
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。 Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 …
Jay 2026-07-29
LingBot-World 2.0:开源交互式世界模型的_hour-long_无漂移生成 · 干货攻略
LingBotWorld 2.0(又称 LingBotWorldInfinity)是蚂蚁集团具身智能团队 Robbyant 于 2026 年 7 月 9 日开源发布的交互式世界模型。它能根据用户输入的动作流(摄像头位姿 + 文本指令)逐帧生成视频,充当实时的可交互世界模拟器。 相比 1.0 版本分钟级稳定生成,2.0 实现了小时级连续输出,同时支持 720p…
Robbyant/lingbot-world-v2 Jay 2026-07-27
ABot-World-0:单卡消费级 GPU 无限交互世界推演 · 干货攻略
ABotWorld0 是阿里巴巴 AMAP 计算机视觉实验室(Alibaba AMAP CV Lab)发布的一款动作条件视频世界模型,目标是让单个消费级桌面 GPU 也能实现实时、长时、闭环的交互式世界推演——换句话说,把一块 RTX 5090 变成一个可以无限探索的虚拟世界模拟器。 核心技术规格(全部来自 GitHub README 与 arXiv 摘要)…
amap-cvlab/ABot-World Jay 2026-07-27
Inkling · 干货攻略
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
thinkingmachines/Inkling Jay 2026-07-22
openvinotoolkit/openvino · 上手攻略
OpenVINO™(Open Visual Inference and Neural Network Optimization)是 Intel 开源的 AI 推理优化与部署工具包,核心目标是把训练好的深度学习模型快速部署到 Intel 硬件上,并获得接近硬件上限的推理性能。它并非训练框架,而是推理runtime + 模型优化工具链的组合。 其支持硬件覆盖 x…
[openvinotoolkit/openvino](https://github.com/openvinotoolkit/openvino) Jay 2026-07-13