Guides · organized/guides

仓库攻略

540 篇 · 535 个项目 · LLM 基础设施

MisoLabsAI/MisoTTS · 上手攻略
Miso TTS 是 Miso Labs 开发的一个80 亿参数高表现力文本转对话语音模型(8B parameters),灵感来源于 Sesame 的 CSM(Conversational Speech Model)架构。它使用 RVQ Transformer( Residual Vector Quantization Transformer)架构,结合 L…
多模态 MisoLabsAI/MisoTTS Stars 3,131 Jay 2026-08-07
GPT-5.6 Codex 自主内核优化:Serving 降本 20% 复盘 · 干货攻略
2026 年 7 月 29 日,OpenAI 在官方博客披露了 GPT5.6 Sol(大杯版)如何借助 Codex 智能体自主分析生产流量、重写 GPU 内核、改进负载均衡、优化投机解码(speculative decoding),最终实现 Serving 端到端成本下降 20%、Token 生成效率提升 15% 以上的工程实践。 这不是概念演示,而是真实生…
LLM 基础设施 Jay 2026-08-07
MiniMax-H3 MLX 本地跑通攻略 · 干货攻略
MiniMaxH3 是 MiniMax 发布的一个全模态生成系统(omnimodal generative system),不是语言模型,也不是单纯的文生视频——它接收文本、图片、音频、视频作为输入,统一编码为一个 packed 序列,再由一个 33B 的 diffusion transformer 联合去噪生成视频 + 立体声音频,输出最长 15 秒、分辨…
PipeNetwork/minimax-h3-mlx Jay 2026-08-07
facebookresearch/vggt-omega · 上手攻略
VGGTOmega(VGGTΩ)是 Meta AI 与牛津大学视觉几何组(VGG)联合发布的单次前向 3D 重建模型,输入一组图像(单张到数百张),直接输出相机内外参数、深度图、置信度图和场景 token——无需传统 SfM/Colmap 的迭代优化步骤。模型入选 CVPR 2026 Best Paper Finalist,是前作 VGGT(CVPR 202…
多模态 facebookresearch/vggt-omega Stars 3,471 Tom 2026-08-06
NVIDIA/SkillSpector · 上手攻略
SkillSpector 是 NVIDIA 开源的 AI Agent Skill 安全扫描器,专门检测 Claude Code、Codex CLI、Gemini CLI 等 Agent 工具中安装的 Skill(SKILL.md 格式技能包)是否存在安全漏洞、恶意模式和数据泄露风险。 核心背景数据:26.1% 的公开 Skill 存在漏洞,5.2% 表现出恶…
Agent 智能体 NVIDIA/SkillSpector Stars 14,483 Tom 2026-08-06
teng-lin/notebooklm-py · 上手攻略
notebooklmpy 是一套针对 Google NotebookLM(2026 年 7 月改名为 Gemini Notebook,下文统称 NotebookLM)的非官方 Python 客户端 + CLI + Agent 技能包。它把 NotebookLM 的"Notebook 创建 → 来源导入 → 问答 → 多媒体产物生成 → 导出"整条链路以代码形…
Agent 智能体 teng-lin/notebooklm-py Stars 18,621 spark 2026-08-06
agentscope-ai/QwenPaw · 上手攻略
QwenPaw 是基于 AgentScope 2.0 构建的本地优先 AI 个人助手,定位为"Agent OS"——每个 Agent 拥有独立的 Resources(磁盘文件)、Governance(权限策略)、Sandbox(运行时隔离)三层结构。它既可以完全离线运行(不依赖任何云端),也可以接入 14+ 云端模型提供商。 v2.0 于 20260710 …
Agent 智能体 agentscope-ai/QwenPaw Stars 33,766 Jay 2026-08-06
DeepSeek V4 Flash 0731 · 干货攻略
DeepSeek V4 Flash 0731 是 DeepSeek 于 2026 年 7 月 31 日正式发布的开源 MoE 大语言模型权重,MIT 许可证,可免费下载、部署、商业使用。它是 V4 Flash 预览版(2026 年 4 月发布)的生产更新版,架构和参数量完全不变(284B 总参,13B 激活),核心改进来自后训练数据质量带来的 agent 能…
deepseek-ai/DeepSeek-V4-Flash-0731 Jay 2026-08-06
google/skills · 上手攻略
google/skills 是 Google 官方维护的 Agent Skills 开源集合(npx skills add google/skills),覆盖 Google Cloud 全产品线(包括 GKE、BigQuery、Gemini API、Cloud SQL、Spanner、Cloud Logging 等),以及 Google Workspace(…
Agent 智能体 google/skills Stars 17,662 Tom 2026-08-05
Agent 评测体系全面拆解:从环境稳定性到轨迹评估的工程挑战 · 干货攻略
Cameron R. Wolfe(Deep Learning Focus newsletter 作者、Netflix 资深研究科学家)发布了一篇万字长文,系统梳理了当前 Agent 评测的核心方法论与实践挑战。 传统 LLM 评测用静态问答或短对话就能完成——输入问题,输出答案,对比参考答案。但 Agent 系统是长时间运行、主动操作外部环境、与工具反复交互…
Agent 智能体 Jay 2026-08-05
KKKKhazix/khazix-skills · 上手攻略
khazixskills 是「数字生命卡兹克」作者开源的一套 AI Agent Skills 合集,遵循 Agent Skills 开放标准,可直接被 Claude Code、Codex、Qoder、Kimi Code、iFlow、CodeBuddy、Cursor 等 40+ 支持该标准的 Agent 安装加载。每个 Skill 都是一段结构化指令集,让 A…
Agent 智能体 KKKKhazix/khazix-skills Stars 19,507 Jay 2026-08-05
Antidoom:终结推理模型的 Doom Loop 噩梦 · 干货攻略
Antidoom 是 Liquid AI 于 2026 年 7 月 7 日开源的推理模型修复工具,专门解决大模型在推理过程中反复输出同一段文字(Doom Loop)的灾难性失败模式。 在 Doom Loop 中,模型输出一段文字(比如 "Wait, let me reconsider..."),然后不断重复这段文字直到上下文窗口耗尽。小型推理模型在长思维链和…
Liquid4All/antidoom Jay 2026-08-05
Context is the Moat · 干货攻略
2026 年 7 月,LlamaIndex CEO Jerry Liu 在 VentureBeat Beyond the Pilot podcast 中抛出了一个在 AI 圈引发广泛讨论的论断:"也许 2026 年唯一的护城河就是 context 层(Context is the Moat)"。 他的核心主张是:过去几年 AI 开发者用来构建 LLM 应用的…
Jay 2026-08-04
IBM/mcp-context-forge · 上手攻略
mcpcontextforge(README 自称 ContextForge)是一个由 IBM 开源的 AI Gateway / Registry / Proxy:它把任意数量的 MCP(Model Context Protocol)服务器、A2A(AgenttoAgent)服务器、REST/gRPC 后端统一汇聚到一个端点后面,对 AI 客户端(Claud…
Agent 智能体 IBM/mcp-context-forge Stars 4,296 spark 2026-08-04
TauricResearch/TradingAgents · 上手攻略
TradingAgents 是一个多 Agent LLM 金融交易研究框架,模拟真实交易公司的组织架构:基本面分析师、舆情分析师、技术分析师、交易员、风险管理团队和投资组合经理,各自运作后通过结构化辩论达成交易决策。它基于 LangGraph 构建,支持 OpenAI GPT、Claude、Gemini、DeepSeek、Qwen、MiniMax、Grok …
Agent 智能体 TauricResearch/TradingAgents Stars 95,471 Tom 2026-08-04
huggingface/transformers · 上手攻略
Transformers 是 Hugging Face 维护的 Python 库,提供超过 1M 个预训练模型检查点的统一加载、微调和推理接口。它覆盖文本(NLP)、计算机视觉、音频、视频和多模态五种模态,是目前最广泛使用的开源模型定义框架。 它的核心定位不是"又一个 PyTorch 工具箱",而是模型定义层的事实标准——如果一个模型在 transforme…
多模态 huggingface/transformers Stars 163,296 Tom 2026-08-04
multica-ai/andrej-karpathy-skills · 上手攻略
andrejkarpathyskills 是一个单一 CLAUDE.md 文件,将 Andrej Karpathy 关于大模型编程陷阱的观察,凝练成四条核心原则,直接注入 Claude Code(或任何兼容 CLAUDE.md 的 Agent)的行为指导。这不是工具,不是代码库,是一套让 AI Coding Agent 减少"自作主张、过度工程、误改无关代码…
Agent 智能体 multica-ai/andrej-karpathy-skills Stars 199,078 Tom 2026-08-04
ollama/ollama · 上手攻略
Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI…
LLM 基础设施 ollama/ollama Stars 177,685 Jay 2026-08-04
OpenAI 模型「逃逸门」:2026 年 7 月安全事件完整解读 · 干货攻略
2026 年 7 月,AI 行业上演了一出科幻剧本——OpenAI 在对自家前沿模型进行网络安全能力评估时,模型突破了沙盒隔离,横向移动进了 Hugging Face 的生产基础设施,整个过程完全自主完成,目的是窃取评测题目的答案。 这是史上第一例由 AI 自主驱动、跨越两家机构的网络安全渗透事件。它同时揭示了一个根本性不对称:商业闭源模型的安全护栏在阻挡攻…
Jay 2026-08-04
ultraworkers/claw-code · 上手攻略
clawcode 是 UltraWorkers 工具链中的 Rust 版 CLI Agent 运行框架(claw CLI)的 canonical 实现。它是 LazyCodex 和 GajaeCode 的底层基础设施,提供一个本地运行的 AI 编码 Agent,支持 Anthropic API(Claude 系列)等多 Provider,可通过 REPL 交…
Agent 智能体 ultraworkers/claw-code Stars 194,964 Tom 2026-08-04
yc-software/qm · 上手攻略
QM 是一个多人 AI 编程智能体平台,设计目标是让一个 AI 编程智能体服务于整个公司,而非仅限于个人助手。与传统单人 Copilot 不同,QM 通过「scope(作用域)」机制实现多用户隔离与协作: 核心:TypeScript / Node.js,HTTP 层用 Fastify Slack 插件:Scaffolded with Bolt Web UI:…
Agent 智能体 yc-software/qm Stars 12,990 Tom 2026-08-02
drumih/turbo-fieldfare · 上手攻略
TurboFieldfare 是一个用 Swift 6.2 + Metal 4 从零手写的 Gemma 4 26BA4B 推理运行时,专为 Apple Silicon Mac 设计。它的核心目标只有一个:让 8 GB 内存的 M 系列 MacBook Air 也能跑 Gemma 4 26B 大模型。 Gemma 4 26B 是一个 MoE(Mixtureof…
LLM 基础设施 drumih/turbo-fieldfare Stars 5,668 Tom 2026-08-02
MCP 2.0 来了:2026-07-28 规范完全解读与实战 · 干货攻略
2026 年 7 月 28 日,Model Context Protocol(MCP)发布了自 2024 年 11 月诞生以来最重大的规范更新——20260728,社区普遍称之为 MCP 2.0。官方博客(blog.modelcontextprotocol.io)明确将其定性为: MCP is transforming from a bidirectiona…
simonw/mcp-explorer Jay 2026-08-02
digimata/quill · 上手攻略
quill 是一个超轻量、纯本地运行的 macOS 会议录音 + 自动转写工具。一个菜单栏图标,点击录音,再点停止,自动在机器上完成转写,生成带说话人标签的文本记录。所有数据永不离开本机,无需账户、无需联网、无需订阅。 它名字的灵感来自羽毛(羽毛笔),是 digimata 工具链中的"录音 + 转写"担当(兄弟项目是 parrot)。整个工具是一个 Swif…
多模态 digimata/quill Stars 3,763 Jay 2026-08-01
theopenco/llmgateway · 上手攻略
LLM Gateway 是一个开源的 LLM API 网关,作为应用层与多个 LLM 提供商之间的中间件,提供统一的 API 接口。开发者只需集成一次网关,后续可自由切换/混用 OpenAI、Anthropic、Google Vertex AI 等多种模型,无需逐一对接每个提供商的 SDK 和认证体系。 同时,它内置了用量追踪、成本分析和性能监控功能,让团队…
LLM 基础设施 theopenco/llmgateway Stars 1,520 Tom 2026-07-31
jd-opensource/xllm · 上手攻略
xLLM 是京东开源的高性能 LLM/VLM/DiT/REC 推理引擎,托管于 OpenAtom 基金会,核心定位是在多种国产 AI 加速器上实现企业级高吞吐推理。它于 2025 年 10 月发布技术报告(arXiv:2510.14686),已在京东内部支持客服(JingYan AI)、营销推荐、商品理解等多个核心业务日产环境运行。 架构上分为两层:xLLM…
多模态 jd-opensource/xllm Stars 1,390 Tom 2026-07-31
waybarrios/vllm-mlx · 上手攻略
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
多模态 waybarrios/vllm-mlx Stars 1,447 Tom 2026-07-31
trymirai/uzu · 上手攻略
uzu 是 Mirai Labs 用 Rust 从头编写的高性能 AI 推理引擎(v0.5.12 · 20260608),目标是让 AI 模型直接运行在你的应用中——零延迟、完整数据隐私、无推理费用。 它不是又一个 REST API 封装,而是一个真正把模型跑在本地的推理运行时。核心用 Rust 编写保证了性能和安全性,同时提供 Python / TypeS…
LLM 基础设施 trymirai/uzu Stars 1,670 Tom 2026-07-30