Guides · organized/guides

仓库攻略

67 篇 · 66 个项目 · 其它 · jay

FlashAttention-4 · 干货攻略
FlashAttention4(FA4)是 Tri Dao 团队发布的第四代 IOaware 精确注意力内核,针对 NVIDIA Blackwell 架构(B200/GB200)全面重新设计,同时保留对 Hopper(H100)的支持。FA4 以 CuTeDSL(NVIDIA CUTLASS DSL)编写,在运行时编译为 PTX/CUBIN,核心定位是解决 …
Dao-AILab/flash-attention Jay 2026-07-18
ThinkingCap-Qwen3.6-27B:推理 Token 减半、精度不降的微调攻略 · 干货攻略
ThinkingCapQwen3.627B 是由 BottleCap AI 发布的推理效率优化微调模型,基于 Qwen 团队 2026 年 4 月开源的 Qwen3.627B(稠密 27B 参数多模态模型,支持思维链推理与非思维推理双模式)进行微调,核心目标是:在保持答案质量和风格完全不变的前提下,系统性削减推理时的"思考 Token"数量。 原帖分享者 @…
bottleapai/ThinkingCap-Qwen3.6-27B Jay 2026-07-15
NapMem:将记忆变为结构化动作空间 · 干货攻略
NapMem(Navigate over Pyramid Memory)是阿里巴巴 Qwen 团队与多所高校在 2026 年 7 月 7 日联合发布的论文提出的框架,核心思想是:把长期用户记忆从被动检索变成 Agent 可主动探索的结构化动作空间。 目前主流的记忆系统(如 Mem0、Zep、MemoryBank)都是被动 RAG 模式——检索组件从数据库捞取…
Jay 2026-07-14
fla-org/flash-linear-attention · 上手攻略
Flash Linear Attention(简称 fla)是一个专注于高效线性注意力(Linear Attention)机制实现的开源库,底层基于 Triton 编写,在 NVIDIA / AMD / Intel 硬件上均做过硬件对齐验证。 它的核心价值在于:把学术界和工业界近年来提出的各种次二次复杂度(Subquadratic)序列建模架构——线性注意力…
[fla-org/flash-linear-attention](https://github.com/fla-org/flash-linear-attention) Jay 2026-07-13
rockbenben/ChatGPT-Shortcut · 上手攻略
ChatGPTShortcut(品牌名 AiShort)是一个开源的 AI 提示词管理工具,GitHub 标星 8,600+,收录 5,000+ 条精选提示词,覆盖写作、编程、办公、学习、设计、营销等常见场景。其核心理念是:把「写好提示词」这件事从用户身上转移到社区,让任何人都能通过「复制 → 粘贴」直接获得专业级 AI 输出。 项目由个人开发者 rockb…
[rockbenben/ChatGPT-Shortcut](https://github.com/rockbenben/ChatGPT-Shortcut) Jay 2026-07-13
openvinotoolkit/openvino · 上手攻略
OpenVINO™(Open Visual Inference and Neural Network Optimization)是 Intel 开源的 AI 推理优化与部署工具包,核心目标是把训练好的深度学习模型快速部署到 Intel 硬件上,并获得接近硬件上限的推理性能。它并非训练框架,而是推理runtime + 模型优化工具链的组合。 其支持硬件覆盖 x…
[openvinotoolkit/openvino](https://github.com/openvinotoolkit/openvino) Jay 2026-07-13