Guides · organized/guides

仓库攻略

5 篇 · 5 个项目 · 评测基准 · jay · RAG 检索增强

dataelement/dsh-desktop · 上手攻略
DSH Desktop 是 DeepSeek Harness 的跨平台桌面包装器(Electron),把本地运行的 DeepSeek Harness Web UI 封装为 macOS / Windows 原生桌面应用,让用户无需手动启动 CLI、无需管理本地端口,在桌面窗口中直接使用完整的 Harness Agent Runtime 体验。 本质上是一个 E…
评测基准 dataelement/dsh-desktop Stars 196 Jay 2026-08-15
modelscope/evalscope · 上手攻略
EvalScope 是魔搭社区(ModelScope)打造的一站式大模型评测框架,用一行命令即可对 LLM、VLM、Embedding、Reranker、AIGC 等多类型模型进行能力评估、推理性能压测和结果可视化。 核心场景:评测模型效果(能力基准)、压测推理性能(TTFT/TPOT 等指标)、Agent 轨迹回放、多模型对战(Arena)。 ⚠️ Eva…
评测基准 modelscope/evalscope Stars 3,218 Jay 2026-08-11
ParseBench 文档解析评测基准 · 干货攻略
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
评测基准 run-llama/ParseBench Jay 2026-07-22
MemPalace/mempalace · 上手攻略
MemPalace 是一个本地优先的 AI 记忆系统,核心卖点是:原文逐字存储(不摘要、不压缩)、可插拔向量后端、96.6% R@5(LongMemEval 基准)以及完全零 API 调用。数据永远留存在本机,通过语义搜索而非总结来召回历史上下文。 它的组织模型借用了"记忆宫殿"的隐喻: 官方文档: | PyPI:mempalace ⚠️ 防骗警告:MemP…
评测基准 MemPalace/mempalace Stars 58,289 Jay 2026-07-10
langfuse/langfuse · 上手攻略
Langfuse 是一个开源 LLM 工程平台,帮助团队协作地开发、监控、评测和调试 AI 应用。2026 年 1 月,Langfuse 团队加入 ClickHouse,继续深耕开源可观测性领域。它同时提供 Langfuse Cloud(托管版,有慷慨的免费额度)和私有化部署(Docker Compose,一键起立)。 核心功能覆盖 LLM 应用全生命周期:…
评测基准 langfuse/langfuse Stars 33,761 Jay 2026-07-09