Guides · organized/guides

仓库攻略

11 篇 · 10 个项目 · 其它 · jay · 多模态

Qwen3.8-27B 默认推理设置过度思考 · 干货攻略
Qwen3.827B 是阿里巴巴 Qwen 团队发布的 Apache 2.0 开源多模态大模型(27B 参数,视觉+推理能力,原生上下文 256K,可扩展至 1M),Hugging Face GGUF 量化版本约 17GB(Q4_K_M),适合在中高端笔记本或迷你主机本地运行。 该模型的 reasoning_effort 参数控制隐藏推理 token 的用量…
Jay 2026-08-22
代表攻略
无需微调:VLM 调度层填平"编排差距",真实机器人 16.7% → 97.3% · 干货攻略
Pigey(Physical Agency orchestrator)是一个闭环 VLM 调度层,驱动已有的冻结机器人技能(frozen skills),无需任何新数据或微调,即可在仿真和真实机器人上大幅提升推理密集型任务的成功率。 核心论文:"Addressing the Orchestration Gap in Generalist Robots via…
lianegalanti/Pigey Jay 2026-08-19
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

SpyRL:用「谁是卧底」游戏为开放域任务生成自验证 RL 奖励 · 干货攻略
SpyRL 是 RLSVR(Reinforcement Learning with SelfVerifiable Rewards)的具体实现,由 Duke 大学、Adobe、NUS、Penn State 等机构联合提出,已被 COLM 2026 接收。 核心思想一句话:把开放域任务变成一个「谁是卧底」游戏,让游戏的投票结果自动成为可验证的 RL 奖励信号——…
wangqinsi1/RLSVR(代码在 `SpyRL` 分支) Jay 2026-08-11
MiniMax-H3 MLX 本地跑通攻略 · 干货攻略
MiniMaxH3 是 MiniMax 发布的一个全模态生成系统(omnimodal generative system),不是语言模型,也不是单纯的文生视频——它接收文本、图片、音频、视频作为输入,统一编码为一个 packed 序列,再由一个 33B 的 diffusion transformer 联合去噪生成视频 + 立体声音频,输出最长 15 秒、分辨…
PipeNetwork/minimax-h3-mlx Jay 2026-08-07
Sebastian Raschka LLM Architecture Gallery 七月更新:6 款新开源模型架构解析 · 干货攻略
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。 Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 …
Jay 2026-07-29
LingBot-World 2.0:开源交互式世界模型的_hour-long_无漂移生成 · 干货攻略
LingBotWorld 2.0(又称 LingBotWorldInfinity)是蚂蚁集团具身智能团队 Robbyant 于 2026 年 7 月 9 日开源发布的交互式世界模型。它能根据用户输入的动作流(摄像头位姿 + 文本指令)逐帧生成视频,充当实时的可交互世界模拟器。 相比 1.0 版本分钟级稳定生成,2.0 实现了小时级连续输出,同时支持 720p…
Robbyant/lingbot-world-v2 Jay 2026-07-27
ABot-World-0:单卡消费级 GPU 无限交互世界推演 · 干货攻略
ABotWorld0 是阿里巴巴 AMAP 计算机视觉实验室(Alibaba AMAP CV Lab)发布的一款动作条件视频世界模型,目标是让单个消费级桌面 GPU 也能实现实时、长时、闭环的交互式世界推演——换句话说,把一块 RTX 5090 变成一个可以无限探索的虚拟世界模拟器。 核心技术规格(全部来自 GitHub README 与 arXiv 摘要)…
amap-cvlab/ABot-World Jay 2026-07-27
Inkling · 干货攻略
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
thinkingmachines/Inkling Jay 2026-07-22
openvinotoolkit/openvino · 上手攻略
OpenVINO™(Open Visual Inference and Neural Network Optimization)是 Intel 开源的 AI 推理优化与部署工具包,核心目标是把训练好的深度学习模型快速部署到 Intel 硬件上,并获得接近硬件上限的推理性能。它并非训练框架,而是推理runtime + 模型优化工具链的组合。 其支持硬件覆盖 x…
[openvinotoolkit/openvino](https://github.com/openvinotoolkit/openvino) Jay 2026-07-13