Guides · organized/guides

仓库攻略

22 篇 · 22 个项目 · 评测基准 · 评测基准

AMAP-ML/LongHorizon-Harness · 上手攻略
LongHorizonHarness 是一个长周期计算机使用(Computer Use)Agent 执行框架。它不训练新模型,而是围绕已有的 Agent(如 Claude Code、OpenCode、DeepSeek Harness)构建一个可靠的"执行验证恢复"循环,让 AI Agent 能在桌面应用和 CLI 环境中连续工作数十小时、可靠地完成复杂工作流…
评测基准 AMAP-ML/LongHorizon-Harness Stars 571 Tom 2026-08-27
0xsline/awesome-deepseek-harness · 上手攻略
DeepSeek Harness(DSH)是 DeepSeek 官方推出的 AI Agent 运行时,而 0xsline/awesomedeepseekharness 是一个精选生态导航库——它汇总了来自官方 dshexternal/hub 目录和 GitHub dshplugin 公开话题的所有插件、工具与基础设施,按功能分成 20 个分类,方便使用者快速…
评测基准 0xsline/awesome-deepseek-harness Stars 778 Jay 2026-08-20
DiG-bench:纯文本科学发现能力评测基准 · 干货攻略
DiGbench(Discovery in Games)是 2026 年 8 月 12 日由 James C.R. Whittington(牛津大学)联合多位学者发布的新型 AI 评测基准,全称 Discovery in Games。 核心设计:70 个纯文本互动游戏,每个游戏内部有隐藏的「变换规则」,AI 智能体必须通过主动交互和实验来发现这些规则,然后将…
评测基准 discos-research/dig-bench Jay 2026-08-19
Sushegaad/Claude-Skills-Governance-Risk-and-Compliance · 上手攻略
这是面向 Claude Code CLI 的一套 GRC(Governance, Risk, and Compliance)领域 Skill 合集,共覆盖 30+ 部法规框架,包括 ISO 27001、SOC 2、FedRAMP、GDPR、HIPAA、NIST CSF、PCI DSS、EU AI Act、ISO 42001、ISO 27701、DORA、CS…
评测基准 Sushegaad/Claude-Skills-Governance-Risk-and-Compliance Stars 814 Tom 2026-08-16
ExtractBench:企业文档结构化提取基准评测 · 干货攻略
ExtractBench 是由 LlamaIndex 团队发布的企业文档结构化提取基准评测(GitHub: runllama/ExtractBench,论文: arXiv:2607.29677,数据集: HuggingFace)。 它的评测任务是:给定一份企业文档(PDF/图片)和一个用户定义的 JSON Schema,提取出符合 Schema 的结构化数据…
评测基准 run-llama/ExtractBench Jay 2026-08-15
modelscope/evalscope · 上手攻略
EvalScope 是魔搭社区(ModelScope)打造的一站式大模型评测框架,用一行命令即可对 LLM、VLM、Embedding、Reranker、AIGC 等多类型模型进行能力评估、推理性能压测和结果可视化。 核心场景:评测模型效果(能力基准)、压测推理性能(TTFT/TPOT 等指标)、Agent 轨迹回放、多模型对战(Arena)。 ⚠️ Eva…
评测基准 modelscope/evalscope Stars 3,218 Jay 2026-08-11
smevals 轻量评测框架:目录即评测 · 干货攻略
smevals(全称 "small evals")是 Prime Radiant 实验室推出的开源 Python CLI 评测框架,主打轻量、可复制、以目录为评测单元的设计理念。MIT 许可证,由 Simon Willison 主导开发,定位是帮助开发者在小模型与高性价比方案中做出选择——而不必总是跑最贵的 frontier 模型。 核心理念来自官方博客原文…
评测基准 prime-radiant-inc/smevals Jay 2026-08-02
ParseBench 文档解析评测基准 · 干货攻略
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
评测基准 run-llama/ParseBench Jay 2026-07-22
ianarawjo/ChainForge · 上手攻略
ChainForge 是一个给 LLM prompt 做对抗测试的开源可视化编程环境(visual programming environment),学术出身 —— 作者 Ian Arawjo 在 Harvard HCI 组做博后期间发表(CHI 2024 论文 "ChainForge: A Visual Toolkit for Prompt Enginee…
评测基准 ianarawjo/ChainForge Stars 3,023 spark 2026-07-17
Agenta-AI/agenta · 上手攻略
Agenta 是一个开源的 LLMOps 平台,把 LLM 应用从原型到生产所需的四件事压在一个工作流里:Prompt Playground(交互式调试)、Prompt/Cofig 管理(带版本和分支)、LLM 评估(人评 + 自动评估 + LLMasjudge)、可观测性(Tracing、成本、延迟)。代码以 TypeScript 为主、许可 NOASSE…
评测基准 Agenta-AI/agenta Stars 4,303 spark 2026-07-17
open-compass/VLMEvalKit · 上手攻略
VLMEvalKit(Python 包名 vlmeval)由上海人工智能实验室 OpenCompass 团队开源,是大型视觉语言模型(LVLM / VLM)的事实标准评估工具包。它的口号是 "一命令评测 220+ LVLM、80+ benchmark" —— 用户只写一个 generate_inner(),剩下的数据下载、预处理、推理、metric 全部由框…
评测基准 open-compass/VLMEvalKit Stars 4,345 spark 2026-07-16
evidentlyai/evidently · 上手攻略
Evidently 是一个开源的 ML 和 LLM 可观测性(Observability)框架,用 Python 编写,用于评估、测试和监控 AI 系统——从传统机器学习模型到生成式 LLM 应用均可覆盖。 核心能力: 离线评测(Reports):一次性评估模型或数据质量,输出交互式 HTML 报告或 JSON。 测试套件(Test Suites):在 CI…
评测基准 evidentlyai/evidently Stars 7,797 Tom 2026-07-15
fighting41love/funNLP · 上手攻略
funNLP 是一个中文 NLP 工具与资源的大集合,由 NLP 从业者「fighting41love」整理维护。GitHub Stars 超过 81k,周增 +77(数据截至 20260713),最后提交 20240510。仓库并非一个独立的 Python 包,而是按主题分类的资源索引:每个条目都是一个真实的开源项目、数据集或工具,包含名称、描述和 Git…
评测基准 fighting41love/funNLP Stars 82,399 Jay 2026-07-13
Helicone/helicone · 上手攻略
Helicone 是一个开源的 LLM 可观测性(Observability)与 AI 网关(AI Gateway)平台,定位是帮助 AI 工程师一站式完成模型调用监控、成本分析、流量路由、Prompt 版本管理和微调数据准备。它诞生于 Y Combinator W23 批次,GitHub Stars 已超过 5,900(数据截至 202607),是 LLM…
评测基准 Helicone/helicone Stars 6,051 Tom 2026-07-12
Arize-ai/phoenix · 上手攻略
Phoenix 是 Arize 开源的可观测性平台,专为 LLM 应用设计,提供追踪(Tracing)、评估(Evaluation)、数据集管理和实验对比四大核心能力。 在 LLM 应用开发中,最大的痛点之一是「看不见内部」——你不知道 RAG 检索到了什么文档、Token 消耗了多少、哪次调用拖慢了整体响应。Phoenix 用 OpenTelemetry …
评测基准 Arize-ai/phoenix Stars 10,982 Tom 2026-07-11
MemPalace/mempalace · 上手攻略
MemPalace 是一个本地优先的 AI 记忆系统,核心卖点是:原文逐字存储(不摘要、不压缩)、可插拔向量后端、96.6% R@5(LongMemEval 基准)以及完全零 API 调用。数据永远留存在本机,通过语义搜索而非总结来召回历史上下文。 它的组织模型借用了"记忆宫殿"的隐喻: 官方文档: | PyPI:mempalace ⚠️ 防骗警告:MemP…
评测基准 MemPalace/mempalace Stars 58,289 Jay 2026-07-10
tensorzero/tensorzero · 上手攻略
⚠️ 重要注意:该仓库已于 2026 年 6 月 12 日被官方归档(readonly)。本文档如实记录其功能与用法;后续是否由社区 fork 延续请关注 GitHub。已生产使用的项目请评估替代方案(如 Langfuse、vLLM Gateway 等)。 TensorZero 是一个开源 LLMOps 平台,用 Rust 编写,以单一 Docker 容器交…
评测基准 tensorzero/tensorzero Stars 11,724 Jay 2026-07-09
langfuse/langfuse · 上手攻略
Langfuse 是一个开源 LLM 工程平台,帮助团队协作地开发、监控、评测和调试 AI 应用。2026 年 1 月,Langfuse 团队加入 ClickHouse,继续深耕开源可观测性领域。它同时提供 Langfuse Cloud(托管版,有慷慨的免费额度)和私有化部署(Docker Compose,一键起立)。 核心功能覆盖 LLM 应用全生命周期:…
评测基准 langfuse/langfuse Stars 33,761 Jay 2026-07-09
Andyyyy64/whichllm · 上手攻略
whichllm 是一个本地大模型硬件适配工具,一条命令帮你找出"在你的电脑上真正能跑且表现最好"的本地 LLM。它不是模型本身,而是一个智能选型引擎:读取你机器的 GPU/CPU/RAM 配置,去 HuggingFace 实时拉模型列表和基准测试数据,然后给你一份排名。 核心哲学:参数量不等于性能。一个 27B Q5 量化模型可能比 32B Q2 更快更准…
评测基准 Andyyyy64/whichllm Stars 6,205 Tom 2026-07-09
deepseek-ai/DeepSpec · 上手攻略
DeepSpec 是 DeepSeek 于 2026 年 6 月 26 日 开源的全栈代码库,用于训练和评估推测解码(Speculative Decoding)的 Draft 模型。MIT 许可证,Stars 6k+。 推测解码的核心逻辑:用一个小而快的 Draft 模型批量生成候选 token,再由目标大模型并行验证——被接受的 token 直接采纳,被拒…
评测基准 deepseek-ai/DeepSpec Stars 6,919 Tom 2026-07-05