Deepseek Harness EAC(EAC = Embracing All Creation,揽尽万象)是一个将官方 deepseekai/deepseekharness(@deepseekai/dsh)封装为开箱即用桌面客户端的项目,内置完整 Node.js 运行时 + dsh CLI,提供 Windows/Linux 安装版、便携版和 Tauri …
仓库攻略
18 篇 · 17 个项目 · 评测基准 · jay
DSHLauncher 是一个 DeepSeek Harness(DSH)Windows 桌面启动器,基于 Electron + 内置 Node.js 运行时实现"一键部署、多实例并行"的 DeepSeek Harness 使用体验。无需安装 Node.js 或任何其他运行时环境,下载 exe 后点两下即可启动完整的 DSH Web 界面。支持多实例并行(不…
代表攻略
0xsline/awesome-deepseek-harness · 上手攻略
DeepSeek Harness(DSH)是 DeepSeek 官方推出的 AI Agent 运行时,而 0xsline/awesomedeepseekharness 是一个精选生态导航库——它汇总了来自官方 dshexternal/hub 目录和 GitHub dshplugin 公开话题的所有插件、工具与基础设施,按功能分成 20 个分类,方便使用者快速…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
0xsline/awesome-deepseek-harness
Stars 778
代表
Dominic789654/awesome-deepseek-harness
Stars 133
DiGbench(Discovery in Games)是 2026 年 8 月 12 日由 James C.R. Whittington(牛津大学)联合多位学者发布的新型 AI 评测基准,全称 Discovery in Games。 核心设计:70 个纯文本互动游戏,每个游戏内部有隐藏的「变换规则」,AI 智能体必须通过主动交互和实验来发现这些规则,然后将…
hairyf/deepseekharnessdesktop 是 DeepSeek Harness(DSH) 的 Tauri 桌面版封装,由 hairyf 个人维护。它将 DSH 这套「插件化 Agent 执行框架」的 Web UI 打包成无需 Node.js / pnpm / Docker 即可运行的本地桌面应用,安装包仅约 5 MB,首次启动自动下载 No…
DSH Desktop 是 DeepSeek Harness 的跨平台桌面包装器(Electron),把本地运行的 DeepSeek Harness Web UI 封装为 macOS / Windows 原生桌面应用,让用户无需手动启动 CLI、无需管理本地端口,在桌面窗口中直接使用完整的 Harness Agent Runtime 体验。 本质上是一个 E…
ExtractBench 是由 LlamaIndex 团队发布的企业文档结构化提取基准评测(GitHub: runllama/ExtractBench,论文: arXiv:2607.29677,数据集: HuggingFace)。 它的评测任务是:给定一份企业文档(PDF/图片)和一个用户定义的 JSON Schema,提取出符合 Schema 的结构化数据…
2026 年 2 月,SWEbench 官方团队对主流大模型做了一次非自报告的独立评测(官方 leaderboard 批量运行),Simon Willison 对此做了详细分析笔记。 这次的核心数据是 Bash Only 赛道的榜单——所有模型在相同系统提示词下、用相同的 minisweagent(约 9,000 行 Python)跑 SWEbench Ve…
EvalScope 是魔搭社区(ModelScope)打造的一站式大模型评测框架,用一行命令即可对 LLM、VLM、Embedding、Reranker、AIGC 等多类型模型进行能力评估、推理性能压测和结果可视化。 核心场景:评测模型效果(能力基准)、压测推理性能(TTFT/TPOT 等指标)、Agent 轨迹回放、多模型对战(Arena)。 ⚠️ Eva…
PostTrainBench 是一个衡量 AI Agent 能否自主完成 LLM 后训练(posttraining)的评测基准,由 aisagroup(马克斯·普朗克研究所 & ELLIS)发布,arXiv:2603.08640。 其核心设计:给 AI Agent 一块 H100 GPU、10 小时、一个小基座模型,让它自主做完整的 posttraining…
smevals(全称 "small evals")是 Prime Radiant 实验室推出的开源 Python CLI 评测框架,主打轻量、可复制、以目录为评测单元的设计理念。MIT 许可证,由 Simon Willison 主导开发,定位是帮助开发者在小模型与高性价比方案中做出选择——而不必总是跑最贵的 frontier 模型。 核心理念来自官方博客原文…
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
funNLP 是一个中文 NLP 工具与资源的大集合,由 NLP 从业者「fighting41love」整理维护。GitHub Stars 超过 81k,周增 +77(数据截至 20260713),最后提交 20240510。仓库并非一个独立的 Python 包,而是按主题分类的资源索引:每个条目都是一个真实的开源项目、数据集或工具,包含名称、描述和 Git…
aijobsearch 是一个本地运行的 AI 求职框架,以 Claude Code 为核心引擎,把求职的全套流程自动化:搜索职位 → 评估匹配度 → 定制 CV → 写求职信 → 面试准备,全部在你自己机器上跑,数据不经过任何第三方服务器。 核心思路是"drafterreviewer"双 Agent 流水线:drafter 生成内容,reviewer 批判…
MemPalace 是一个本地优先的 AI 记忆系统,核心卖点是:原文逐字存储(不摘要、不压缩)、可插拔向量后端、96.6% R@5(LongMemEval 基准)以及完全零 API 调用。数据永远留存在本机,通过语义搜索而非总结来召回历史上下文。 它的组织模型借用了"记忆宫殿"的隐喻: 官方文档: | PyPI:mempalace ⚠️ 防骗警告:MemP…
⚠️ 重要注意:该仓库已于 2026 年 6 月 12 日被官方归档(readonly)。本文档如实记录其功能与用法;后续是否由社区 fork 延续请关注 GitHub。已生产使用的项目请评估替代方案(如 Langfuse、vLLM Gateway 等)。 TensorZero 是一个开源 LLMOps 平台,用 Rust 编写,以单一 Docker 容器交…
Langfuse 是一个开源 LLM 工程平台,帮助团队协作地开发、监控、评测和调试 AI 应用。2026 年 1 月,Langfuse 团队加入 ClickHouse,继续深耕开源可观测性领域。它同时提供 Langfuse Cloud(托管版,有慷慨的免费额度)和私有化部署(Docker Compose,一键起立)。 核心功能覆盖 LLM 应用全生命周期:…