NVIDIA/GenerativeAIExamples 是 NVIDIA 官方的生成式 AI 参考工作流仓库,针对加速基础设施(GPU/NIM 微服务)做了深度优化,涵盖 RAG 管道、Agentic 工作流、知识图谱、视觉 NIM 工作流、Data Flywheel 完整闭环等场景。当前最新 release 为 v0.8.x(2025 年),目录结构已完成…
仓库攻略
308 篇 · 307 个项目 · 评测基准
长程推理(longhorizon reasoning)要求模型在一个回答链内反复切换不同技能:比如先做数学推导,再用结果来规划日程。现有评测基准往往只考单个技能,无法衡量模型在技能之间灵活切换的能力。 SkillNative LLMs 是普林斯顿、CMU、MIT 等机构在 2026 年 8 月发表的论文(arXiv:2608.05139),从评测和训练两个方…
Agent Research Copilot (ARC) 是一套面向理论物理研究的 LLMAgent 工作流,由 Yanjiao Ma、Yi Wang、Xingkai Zhang 三人署名,已发布 ChinaXiv:202606.00234(v1,202606)。它本身不是单一 CLI,而是「7 个可独立复用的 Python 包 + 一层对 coding a…
humanizetext 是 lynoteai 维护的「AI 文本人类化」开源 Python 工具包。它本质上是把「让 AI 生成文本读起来更像人写的」这件事拆成两条路径: 4 套参考实现(v1.0 沉淀):翻译链、多轮 LLM 改写、检测器反馈循环、混合引擎翻译。 1 套标准流水线(v1.5.1 现行生产推荐版):把方法 1(翻译链)+ 方法 2(LLM …
SpyRL 是 RLSVR(Reinforcement Learning with SelfVerifiable Rewards)的具体实现,由 Duke 大学、Adobe、NUS、Penn State 等机构联合提出,已被 COLM 2026 接收。 核心思想一句话:把开放域任务变成一个「谁是卧底」游戏,让游戏的投票结果自动成为可验证的 RL 奖励信号——…
EvalScope 是魔搭社区(ModelScope)打造的一站式大模型评测框架,用一行命令即可对 LLM、VLM、Embedding、Reranker、AIGC 等多类型模型进行能力评估、推理性能压测和结果可视化。 核心场景:评测模型效果(能力基准)、压测推理性能(TTFT/TPOT 等指标)、Agent 轨迹回放、多模型对战(Arena)。 ⚠️ Eva…
harshaneel/humanize 是一个面向 LLM 编程代理(Claude Code、Codex CLI、ChatGPT Desktop、Gemini CLI、Cursor、Aider、OpenCode 等)的"AI 文本去机器味"技能包。它以 纯静态 SKILL.md 规则文件(无 Python 运行时、无模型权重、无 API 调用)的形式提供两个…
FlashRAG 是中国人民大学 NLPIR 实验室开源的 RAG(检索增强生成)研究 Python 工具包,已被 WWW 2025 Resource Track 接收。 核心理念:RAG 研究门槛高——需要分别找数据集、实现各算法、搭评估流程,碎片化严重。FlashRAG 提供一站式解决方案:36 个预处理基准数据集 + 23 个 SOTA RAG 算法(…
Mamba3 是由 Tri Dao 和 Albert Gu 联合团队发布的第三代 Mamba 模型(ICLR 2026 Oral),核心定位是在推理效率优先的前提下推进性能效率帕累托前沿。它基于上一代 Mamba2 的架构做了三项核心方法改进,并将 SSM(状态空间模型)与线性注意力彻底融合为同一套理论框架(Structured State Space Du…
Future AGI 是一个开源 AI Agent 全生命周期管理平台,将评估(Evaluation)、追踪(Tracing)、防护(Guardrails)、仿真(Simulation)、网关路由(Gateway)、提示优化(Optimization)六大能力整合在同一个反馈闭环中,支持自托管(Docker Compose)和云端两种部署方式,核心定位是"让…
AssetOpsBench 是 IBM 研究院推出的工业资产运维 AI Agent 基准测试框架,已正式接收为 KDD 2026 Datasets & Benchmarks Track 论文。它模拟真实工业环境(工厂、车间设施),覆盖 9 大资产类别、141+ 运维场景、5 类领域专家 Agent(IoT/FMSR/TSFM/WO/Vibration),提供…
Prime Agent 是 Prime Intellect(2026 年 8 月 5 日开源)的自改进 Agent 编程框架,围绕两个核心抽象构建: RLM(Recursive Language Model):将上下文视为变量,把子 Agent 调用变成 REPL 内的函数调用(rlm(...)),替代传统的固定工具 schema + 上下文压缩方案。 Co…
OptiLLM 是一个OpenAI API 兼容的推理优化代理(inference proxy),通过在推理时(inferencetime)应用 20+ 种推理优化技术,在不需要任何训练或微调的情况下,将 LLM 在数学、代码、逻辑推理任务上的准确率提升 210 倍。 它的核心思路是:在现有 API 调用层加一层代理,对请求进行后处理(优化推理路径),再转发…
WhoDB 是一个浏览器端数据库工作空间,支持探索数据库表结构、编辑数据、运行查询、理解 schema 关系图。它用 Docker 一行命令启动、自托管免费(Apache 2.0)、也提供桌面 App 和终端 CLI。对 AI 编程场景,它还内置了 Ollama / OpenAI / Anthropic / LM Studio 的自然语言查询能力——用英文提…
devbrowser 是一个让 AI Agent(如 Claude Code、Codex)直接控制浏览器的 Claude Skill。它通过在 QuickJS WASM 沙箱中执行 JavaScript 脚本,实现浏览器自动化操作,同时保证宿主系统安全——脚本没有文件系统或网络访问权限。 核心定位:在 AI Coding 场景下,提供比传统 Playwrig…
⚠️ commit 时戳:本攻略基于 main 分支 SHA c2fe93deedfd0d1bd9fe7ef0601ea1b9c20ea24a(20260505 03:23 UTC,commit message "Make serenity output example more concrete")。仓库卡片显示「最近提交 20260505」,与 API …
⚠️ commit 时戳:本攻略基于 main 分支 SHA 89f82b3a96fb3e25a357a24bfd13b16e7fe4bf4e(20260805 15:41 UTC,commit message "Merge pull request #119 … 更新特别致谢与 Star History 图片")。仓库卡片显示「Stars 4939 / 周…
tRPCAgentGo 是一个 Go 原生的生产级 AI Agent 开发框架,GitHub 星标约 1647(截至 20260809,周增 +21),Apache2.0 许可证,最近一次提交 20260808(高度活跃)。 核心定位:让 AI Agent 应用符合 Go 服务的要求——并发安全、可观测、易部署,同时支持 A2A、AGUI、MCP 等主流协议…
《三年面试五年模拟》是一份中文开源 AIGC / 大模型 / AI Agent 算法工程师面试百科全书,由 AIGCmagic 社区维护,GitHub 星标 4276(截至 20260809,周增 +21)。内容分为算法岗和开发岗两大方向:算法岗覆盖 AIGC、LLM 大模型、AI Agent、具身智能、传统深度学习、计算机视觉、自然语言处理、强化学习、自动…
一个专注于 Context Engineering(上下文工程) 的 Agent Skills 合集,共 17 个 skills,涵盖上下文基础、注意力退化机制、多智能体架构、记忆系统、工具设计、评测框架、自优化循环等核心主题。这套 skills 的核心理念是:上下文窗口的限制不是靠"增加 Token 数"就能解决的,而是需要系统性地管理信息流入的质量和结构…
xixume/awesomepersonadistillskills 是一个围绕人格蒸馏(Persona Distillation)的 Agent Skills 精选列表。它不直接提供某个具体的 skill,而是收录了 GitHub 上所有"将人物、关系、纪念性场景或方法论蒸馏为 Agent Skill"的项目,形成一个人格 Skill 的 awesome …
@omarsar0 在 2026 年 8 月初发帖指出:"Token efficiency on these models are underestimated"——DeepSeek V4Flash 每 token 价格之低掩盖了一个关键事实:单任务总成本(pertask cost)并不等同于每 token 单价(pertoken price)。当模型为完成…
humanizerru 是一个面向 Claude(以及兼容 Agent Skills 标准的其他 coding agent)的俄文文本「去 AI 味」技能。它不解决英文场景——作者明确说「英文 humanizer(blader/humanizer 等)对俄文无效」,因为俄文 AI 指纹和英文指纹几乎没有重叠。仓库当前版本 v3.15.2(20260724 r…
⚠️ 核验说明:原帖标题含有"Claude Opus 5 自主取消 ChatGPT Pro 订阅"一说,该具体说法未在 AISI 官方报告中出现,AISI 报告仅涉及 Mythos 5 与 GPT5.6Sol两款模型。本攻略以 AISI 官方披露为准,该子 claim 标注为「原帖主张,未核验」。 2026 年 7 月 25–28 日,英国 AI 安全研究所…
一个 Agent Skill 集合,把"在终端里讲不清的复杂图表/表格/对比"从 ASCII art / monospace 字符画升级为自包含 HTML 页面或幻灯片,直接在浏览器中打开阅读。支持架构图、Mermaid 流程图、数据表、幻灯片、diff 评审、plan 对比、project recap 等多种形态。 与单一 harness 锁定不同,它同时…
academichumanizer 是一个针对学术论文和基金申请书的 AI 写作风格修订 skill,专为 Claude Code、Codex、MorphMind 等 AI coding/prose agent 设计。它的核心目标不是"检测 AI 生成内容",而是消除 AI 辅助写作中的机械腔、模板腔,让文字回到作者自己的声音,同时严格保持学术严谨性。 与市…
elementalsouls/ClaudeOSINT 是一套专为 Claude Code / Claude 环境设计的进攻型 OSINT(开源情报搜集)Skill 库。它将约 10,000 行结构化情报搜集方法论、Payload、正则模式封装成 8 个可热插拔的 SKILL.md 文件,让 Claude 在授权的 Red Team / Bug Bounty …
VGGTOmega(VGGTΩ)是 Meta AI 与牛津大学视觉几何组(VGG)联合发布的单次前向 3D 重建模型,输入一组图像(单张到数百张),直接输出相机内外参数、深度图、置信度图和场景 token——无需传统 SfM/Colmap 的迭代优化步骤。模型入选 CVPR 2026 Best Paper Finalist,是前作 VGGT(CVPR 202…
PostTrainBench 是一个衡量 AI Agent 能否自主完成 LLM 后训练(posttraining)的评测基准,由 aisagroup(马克斯·普朗克研究所 & ELLIS)发布,arXiv:2603.08640。 其核心设计:给 AI Agent 一块 H100 GPU、10 小时、一个小基座模型,让它自主做完整的 posttraining…
texttocad 是一个面向 AI 编程 Agent(Claude Code、Codex 等)的 CAD/CAE/CAM 技能库——给 AI Agent 安装这些 Skills 后,你可以用自然语言让 Agent 直接生成 STEP、STL、DXF、URDF 等工程文件,甚至驱动 3D 打印和数控加工。 项目包含 11 个独立 Skills,覆盖从"文本/…