Guides · organized/guides

仓库攻略

10 篇 · 10 个项目 · 评测基准 · 多模态

myYangyunfan/dsh_desktop · 上手攻略
DSH Desktop(DeepSeek Harness Desktop)是将 DeepSeek 官方 CLI 工具 dsh(DeepSeek Harness)封装为开箱即用桌面客户端的项目。打包内置完整 Node.js 运行时 + npm CLI + 全部官方插件,双击即启动 dsh web UI,无需用户自行安装任何环境。适合不想折腾命令行、直接在 Wi…
评测基准 myYangyunfan/dsh_desktop Stars 463 Tom 2026-08-19
DiG-bench:纯文本科学发现能力评测基准 · 干货攻略
DiGbench(Discovery in Games)是 2026 年 8 月 12 日由 James C.R. Whittington(牛津大学)联合多位学者发布的新型 AI 评测基准,全称 Discovery in Games。 核心设计:70 个纯文本互动游戏,每个游戏内部有隐藏的「变换规则」,AI 智能体必须通过主动交互和实验来发现这些规则,然后将…
评测基准 discos-research/dig-bench Jay 2026-08-19
内容待复核
Zhiyuan-Fan/Awesome-DeepSeek-Harness-Plugins · 上手攻略
DeepSeek Harness(DSH)是 DeepSeek 官方开源的 Agent 执行框架,其核心理念是"一切皆插件"——每个能力(模型供应商、工具、记忆、调度、UI 客户端)都是可插拔的组件。AwesomeDeepSeekHarnessPlugins 是由 ZhiyuanFan 维护的每日精选目录,收录 DSH 生态中公开可用的插件、扩展、技能、工具…
评测基准 Zhiyuan-Fan/Awesome-DeepSeek-Harness-Plugins Stars 134 Tom 2026-08-18
huiliyi37/dsh-tianshu-tui · 上手攻略
dshtianshutui(npm 包名 @huiliyi37/dshtianshutui)是 DeepSeek Harness(官方 CLI @deepseekai/dsh)的交互式终端极简风格 UI 插件。它以自研 ANSI 渲染为核心,在官方 Web UI 之外提供类 Claude Code 风格的纯终端对话界面,并叠加了 TDD 工作流、证据门、视觉…
评测基准 huiliyi37/dsh-tianshu-tui Stars 165 Tom 2026-08-16
zhu1090093659/dsh-web-ui · 上手攻略
dshwebui 是给 DeepSeek Harness(以下简称 DSH)Web GUI 的一站式插件与皮肤全家桶,通过官方 profile 机制挂载,不改 DSH 源码。所有插件以 npm 包发布(@linxin666/ scope),可逐个安装也可一次性装齐。 仓库包含 11 个子包,核心能力如下: | 能力 | 说明 | ||| | 梁神模式 | 面…
评测基准 zhu1090093659/dsh-web-ui Stars 4,541 Tom 2026-08-16
modelscope/evalscope · 上手攻略
EvalScope 是魔搭社区(ModelScope)打造的一站式大模型评测框架,用一行命令即可对 LLM、VLM、Embedding、Reranker、AIGC 等多类型模型进行能力评估、推理性能压测和结果可视化。 核心场景:评测模型效果(能力基准)、压测推理性能(TTFT/TPOT 等指标)、Agent 轨迹回放、多模型对战(Arena)。 ⚠️ Eva…
评测基准 modelscope/evalscope Stars 3,218 Jay 2026-08-11
ParseBench 文档解析评测基准 · 干货攻略
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
评测基准 run-llama/ParseBench Jay 2026-07-22
open-compass/VLMEvalKit · 上手攻略
VLMEvalKit(Python 包名 vlmeval)由上海人工智能实验室 OpenCompass 团队开源,是大型视觉语言模型(LVLM / VLM)的事实标准评估工具包。它的口号是 "一命令评测 220+ LVLM、80+ benchmark" —— 用户只写一个 generate_inner(),剩下的数据下载、预处理、推理、metric 全部由框…
评测基准 open-compass/VLMEvalKit Stars 4,345 spark 2026-07-16
fighting41love/funNLP · 上手攻略
funNLP 是一个中文 NLP 工具与资源的大集合,由 NLP 从业者「fighting41love」整理维护。GitHub Stars 超过 81k,周增 +77(数据截至 20260713),最后提交 20240510。仓库并非一个独立的 Python 包,而是按主题分类的资源索引:每个条目都是一个真实的开源项目、数据集或工具,包含名称、描述和 Git…
评测基准 fighting41love/funNLP Stars 82,399 Jay 2026-07-13
Andyyyy64/whichllm · 上手攻略
whichllm 是一个本地大模型硬件适配工具,一条命令帮你找出"在你的电脑上真正能跑且表现最好"的本地 LLM。它不是模型本身,而是一个智能选型引擎:读取你机器的 GPU/CPU/RAM 配置,去 HuggingFace 实时拉模型列表和基准测试数据,然后给你一份排名。 核心哲学:参数量不等于性能。一个 27B Q5 量化模型可能比 32B Q2 更快更准…
评测基准 Andyyyy64/whichllm Stars 6,205 Tom 2026-07-09