LongHorizonHarness 是一个长周期计算机使用(Computer Use)Agent 执行框架。它不训练新模型,而是围绕已有的 Agent(如 Claude Code、OpenCode、DeepSeek Harness)构建一个可靠的"执行验证恢复"循环,让 AI Agent 能在桌面应用和 CLI 环境中连续工作数十小时、可靠地完成复杂工作流…
仓库攻略
7 篇 · 7 个项目 · 评测基准 · tom · 评测基准
这是面向 Claude Code CLI 的一套 GRC(Governance, Risk, and Compliance)领域 Skill 合集,共覆盖 30+ 部法规框架,包括 ISO 27001、SOC 2、FedRAMP、GDPR、HIPAA、NIST CSF、PCI DSS、EU AI Act、ISO 42001、ISO 27701、DORA、CS…
Evidently 是一个开源的 ML 和 LLM 可观测性(Observability)框架,用 Python 编写,用于评估、测试和监控 AI 系统——从传统机器学习模型到生成式 LLM 应用均可覆盖。 核心能力: 离线评测(Reports):一次性评估模型或数据质量,输出交互式 HTML 报告或 JSON。 测试套件(Test Suites):在 CI…
Helicone 是一个开源的 LLM 可观测性(Observability)与 AI 网关(AI Gateway)平台,定位是帮助 AI 工程师一站式完成模型调用监控、成本分析、流量路由、Prompt 版本管理和微调数据准备。它诞生于 Y Combinator W23 批次,GitHub Stars 已超过 5,900(数据截至 202607),是 LLM…
Phoenix 是 Arize 开源的可观测性平台,专为 LLM 应用设计,提供追踪(Tracing)、评估(Evaluation)、数据集管理和实验对比四大核心能力。 在 LLM 应用开发中,最大的痛点之一是「看不见内部」——你不知道 RAG 检索到了什么文档、Token 消耗了多少、哪次调用拖慢了整体响应。Phoenix 用 OpenTelemetry …
whichllm 是一个本地大模型硬件适配工具,一条命令帮你找出"在你的电脑上真正能跑且表现最好"的本地 LLM。它不是模型本身,而是一个智能选型引擎:读取你机器的 GPU/CPU/RAM 配置,去 HuggingFace 实时拉模型列表和基准测试数据,然后给你一份排名。 核心哲学:参数量不等于性能。一个 27B Q5 量化模型可能比 32B Q2 更快更准…
DeepSpec 是 DeepSeek 于 2026 年 6 月 26 日 开源的全栈代码库,用于训练和评估推测解码(Speculative Decoding)的 Draft 模型。MIT 许可证,Stars 6k+。 推测解码的核心逻辑:用一个小而快的 Draft 模型批量生成候选 token,再由目标大模型并行验证——被接受的 token 直接采纳,被拒…