Guides · organized/guides

仓库攻略

14 篇 · 14 个项目 · 评测基准 · RAG 检索增强

sandbaseai/deepseek-harness-handbook · 上手攻略
DeepSeek Harness Handbook 是一个独立维护的权威实战手册,面向在生产环境或日常工作中使用 DeepSeek Harness(DSH)的开发者、运维和 AI 爱好者。它不是命令列表,而是一部覆盖完整 Agent 边界的操作指南——从模型路由、工具调用、权限审批、沙盒隔离、持久化 Session、插件体系、MCP(Model Contex…
评测基准 sandbaseai/deepseek-harness-handbook Stars 67 Tom 2026-08-21
内容待复核
Zhiyuan-Fan/Awesome-DeepSeek-Harness-Plugins · 上手攻略
DeepSeek Harness(DSH)是 DeepSeek 官方开源的 Agent 执行框架,其核心理念是"一切皆插件"——每个能力(模型供应商、工具、记忆、调度、UI 客户端)都是可插拔的组件。AwesomeDeepSeekHarnessPlugins 是由 ZhiyuanFan 维护的每日精选目录,收录 DSH 生态中公开可用的插件、扩展、技能、工具…
评测基准 Zhiyuan-Fan/Awesome-DeepSeek-Harness-Plugins Stars 134 Tom 2026-08-18
dataelement/dsh-desktop · 上手攻略
DSH Desktop 是 DeepSeek Harness 的跨平台桌面包装器(Electron),把本地运行的 DeepSeek Harness Web UI 封装为 macOS / Windows 原生桌面应用,让用户无需手动启动 CLI、无需管理本地端口,在桌面窗口中直接使用完整的 Harness Agent Runtime 体验。 本质上是一个 E…
评测基准 dataelement/dsh-desktop Stars 196 Jay 2026-08-15
modelscope/evalscope · 上手攻略
EvalScope 是魔搭社区(ModelScope)打造的一站式大模型评测框架,用一行命令即可对 LLM、VLM、Embedding、Reranker、AIGC 等多类型模型进行能力评估、推理性能压测和结果可视化。 核心场景:评测模型效果(能力基准)、压测推理性能(TTFT/TPOT 等指标)、Agent 轨迹回放、多模型对战(Arena)。 ⚠️ Eva…
评测基准 modelscope/evalscope Stars 3,218 Jay 2026-08-11
yb2460/harness-anything · 上手攻略
Harness Anything 是一个开源的 AI Agent 控制中枢,通过 CLI 封装,将一系列闭源商业软件(WPS Office、Microsoft Office、Adobe 全家桶、Zotero)变成 AI Agent 可编程操控的目标。核心思路借鉴 CLIAnything 的 Harness 方法论,但后者只支持 GIMP、Blender 等开…
评测基准 yb2460/harness-anything Stars 1,419 Tom 2026-07-28
ParseBench 文档解析评测基准 · 干货攻略
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
评测基准 run-llama/ParseBench Jay 2026-07-22
Agenta-AI/agenta · 上手攻略
Agenta 是一个开源的 LLMOps 平台,把 LLM 应用从原型到生产所需的四件事压在一个工作流里:Prompt Playground(交互式调试)、Prompt/Cofig 管理(带版本和分支)、LLM 评估(人评 + 自动评估 + LLMasjudge)、可观测性(Tracing、成本、延迟)。代码以 TypeScript 为主、许可 NOASSE…
评测基准 Agenta-AI/agenta Stars 4,303 spark 2026-07-17
open-compass/VLMEvalKit · 上手攻略
VLMEvalKit(Python 包名 vlmeval)由上海人工智能实验室 OpenCompass 团队开源,是大型视觉语言模型(LVLM / VLM)的事实标准评估工具包。它的口号是 "一命令评测 220+ LVLM、80+ benchmark" —— 用户只写一个 generate_inner(),剩下的数据下载、预处理、推理、metric 全部由框…
评测基准 open-compass/VLMEvalKit Stars 4,345 spark 2026-07-16
evidentlyai/evidently · 上手攻略
Evidently 是一个开源的 ML 和 LLM 可观测性(Observability)框架,用 Python 编写,用于评估、测试和监控 AI 系统——从传统机器学习模型到生成式 LLM 应用均可覆盖。 核心能力: 离线评测(Reports):一次性评估模型或数据质量,输出交互式 HTML 报告或 JSON。 测试套件(Test Suites):在 CI…
评测基准 evidentlyai/evidently Stars 7,797 Tom 2026-07-15
Arize-ai/phoenix · 上手攻略
Phoenix 是 Arize 开源的可观测性平台,专为 LLM 应用设计,提供追踪(Tracing)、评估(Evaluation)、数据集管理和实验对比四大核心能力。 在 LLM 应用开发中,最大的痛点之一是「看不见内部」——你不知道 RAG 检索到了什么文档、Token 消耗了多少、哪次调用拖慢了整体响应。Phoenix 用 OpenTelemetry …
评测基准 Arize-ai/phoenix Stars 10,982 Tom 2026-07-11
MemPalace/mempalace · 上手攻略
MemPalace 是一个本地优先的 AI 记忆系统,核心卖点是:原文逐字存储(不摘要、不压缩)、可插拔向量后端、96.6% R@5(LongMemEval 基准)以及完全零 API 调用。数据永远留存在本机,通过语义搜索而非总结来召回历史上下文。 它的组织模型借用了"记忆宫殿"的隐喻: 官方文档: | PyPI:mempalace ⚠️ 防骗警告:MemP…
评测基准 MemPalace/mempalace Stars 58,289 Jay 2026-07-10
langfuse/langfuse · 上手攻略
Langfuse 是一个开源 LLM 工程平台,帮助团队协作地开发、监控、评测和调试 AI 应用。2026 年 1 月,Langfuse 团队加入 ClickHouse,继续深耕开源可观测性领域。它同时提供 Langfuse Cloud(托管版,有慷慨的免费额度)和私有化部署(Docker Compose,一键起立)。 核心功能覆盖 LLM 应用全生命周期:…
评测基准 langfuse/langfuse Stars 33,813 Jay 2026-07-09
coleam00/Archon · 上手攻略
Archon 是一个面向 AI 编程智能体的工作流引擎——用 YAML 定义开发流程(计划→实现→验证→审查→PR),让 AI 编程行为从"随机发挥"变成可复现的确定性过程。 它的类比是:Dockerfile 解决了基础设施的可复现,GitHub Actions 解决了 CI/CD 的可复现,而 Archon 解决的是 AI 编程工作流的可复现。 核心思想:…
评测基准 coleam00/Archon Stars 22,832 Tom 2026-07-08
bytedance/deer-flow · 上手攻略
DeerFlow(Deep Exploration and Efficient Research Flow)是字节跳动开源的 Super Agent Harness,于 2026 年 2 月 28 日凭借 2.0 重写版本登上 GitHub Trending 第 1 名。它将 SubAgent、Memory(记忆)、Sandbox(沙盒)和可扩展 Skill…
评测基准 bytedance/deer-flow Stars 79,697 Tom 2026-07-06