Guides · organized/guides

仓库攻略

54 篇 · 54 个项目 · Agent 智能体 · jay · 评测基准

SmolVM 沙箱化 AI Agent 非受信代码 · 干货攻略
SmolVM(smolmachines/smolvm)是一个开源的轻量级 microVM 运行时,专门解决 AI Agent 执行 LLM 生成代码时的隔离问题。由 Aniket Maurya 与 Celesto AI 团队开发,Apache 2.0 开源协议,2026 年 4 月 21 日正式发布,GitHub 发布首日即获得 482 个 HN 点。 官方…
Agent 智能体 Jay 2026-08-26
duty1g/x64dbg-mcp-server · 上手攻略
x64dbgMCPServer 是一个将 x64dbg 调试器通过 MCP(Model Context Protocol) 协议暴露为 HTTP 服务的原生插件。使用 Zig 语言编写,零外部依赖,一个插件文件同时支持 x32 和 x64 架构。连接任何 MCP 兼容的 AI 助手(如 Claude Code),即可通过自然语言控制 x64dbg:设置断点、…
Agent 智能体 duty1g/x64dbg-mcp-server Stars 526 Jay 2026-08-25
SynaLinks/synalinks-skills · 上手攻略
SynaLinks/synalinksskills 是一套面向 AI 编程 Agent 的 SKILL.md 技能包,专门教 Claude Code、Codex、OpenCode、pi 等主流 coding agent 如何写出符合 SynaLinks 框架规范的代码。技能本身是一个标准化的 SKILL.md 文件,基于 Anthropic 主导的 Agen…
Agent 智能体 SynaLinks/synalinks-skills Stars 906 Jay 2026-08-23
TrueForge:开源 Agent Harness,75% 降本实战攻略 · 干货攻略
TrueForge 是 TrueFoundry 于 2026 年 8 月开源的 MIT 许可证 Agent Harness——运行在 LLM 周围的运行时层,把一个语言模型变成可真正跑在生产环境里的 Agent。它不挑模型、不绑云、不锁供应商,可以本地单进程(SQLite)运行,也可以 Docker Compose / Kubernetes 部署高可用集群。…
Agent 智能体 truefoundry/trueforge Jay 2026-08-21
opendatalab/MinerU · 上手攻略
MinerU 是由 OpenDataLab(上海人工智能实验室关联开源组织)开发的高精度文档解析引擎,于 2024 年开源。其核心能力是:将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂文档,转换为 LLM 可直接消费的 Markdown 或 JSON 格式,同时保留阅读顺序、标题层级、表格结构、公式 LaTeX 等语义信息。 MinerU 最早服…
Agent 智能体 opendatalab/MinerU Stars 76,653 Jay 2026-08-17
openai/codex · 上手攻略
Codex CLI 是 OpenAI 官方推出的轻量级终端编程智能体(coding agent),于 2025 年 4 月开源发布。与面向 IDE 插件的 Codex(Codex for IDE)不同,Codex CLI 是完全运行在终端的独立工具,支持 macOS、Linux、Windows 全平台。它由 OpenAI 的编码专用模型驱动,能理解代码库、读…
Agent 智能体 openai/codex Stars 103,608 Jay 2026-08-17
evilsocket/nerve · 上手攻略
Nerve(The Simple Agent Development Kit)是一个用 YAML + CLI 构建、运行、评测和编排 LLM Agent 的轻量框架。它的核心理念是声明式 Agent:用 YAML 定义 system prompt、task、tools 和 variables,一个文件搞定一个 Agent,再通过 nerve CLI 驱动执行…
Agent 智能体 evilsocket/nerve Stars 1,318 Jay 2026-08-16
Aperivue/medsci-skills · 上手攻略
MedSci Skills 是面向临床研究与医学人工智能的开源 Agent Skills 合集(MIT 许可证),由韩国首尔峨山医疗中心放射科医生兼研究员 Yoojin Nam, MD 构建,在真实出版物上测试通过。截至 v5.0 版本共包含 59 项技能,覆盖从文献检索、统计图表、报告指南合规审查到 AI 模型工程的全链路。 它并非通用 AI 科学家平台,…
Agent 智能体 Aperivue/medsci-skills Stars 269 Jay 2026-08-14
Meta Muse Glimmer 30B 本地 Agent 攻略 · 干货攻略
Meta Muse Glimmer 是 Meta 超级智能实验室(Meta Superintelligence Lab)于 2026 年 8 月 开源发布的 ~29.6B 参数多模态推理模型,权重基于 Apache 2.0 许可证,完全开放商用。它是 Meta 自 Llama 时代之后首次重新发布开源权重,被 @rasbt 形容为「Llama 时代以来 Me…
Agent 智能体 Jay 2026-08-13
lexmount/moli · 上手攻略
Moli 是一个用 Rust 从零构建的浏览器引擎,专为 AI Agent 场景设计。它不依赖 Chromium,却又完整实现了 V8 JavaScript 引擎、原生 DOM、CSS 渲染、网络请求(Fetch/XHR/WebSocket)、Cookie、localStorage/IndexedDB/OPFS 等 Web 运行时。与传统浏览器自动化工具最大…
Agent 智能体 lexmount/moli Stars 399 Jay 2026-08-12
Harness 工程决定 Agent 工具调用行为,而非工具数量 · 干货攻略
2026 年,AI 社区出现了一个重要认知转向:Agent 的表现瓶颈不在模型本身,而在包裹模型的那层工程结构——Harness(驾驭层)。Harness 由 @omarsar0(Elvis,研究机构 DAIR.AI 联合创始人)提出,核心主张是:Agent 的工具调用行为由 Harness 决定,而非工具数量;Harness 的核心能力是决定何时不调用工具…
Agent 智能体 Jay 2026-08-12
Prime Agent:自改进 RLM harness 编程式 Agent 全攻略 · 干货攻略
Prime Agent 是 Prime Intellect(2026 年 8 月 5 日开源)的自改进 Agent 编程框架,围绕两个核心抽象构建: RLM(Recursive Language Model):将上下文视为变量,把子 Agent 调用变成 REPL 内的函数调用(rlm(...)),替代传统的固定工具 schema + 上下文压缩方案。 Co…
Agent 智能体 PrimeIntellect-ai/prime-agent Jay 2026-08-10
earthtojake/text-to-cad · 上手攻略
texttocad 是一个面向 AI 编程 Agent(Claude Code、Codex 等)的 CAD/CAE/CAM 技能库——给 AI Agent 安装这些 Skills 后,你可以用自然语言让 Agent 直接生成 STEP、STL、DXF、URDF 等工程文件,甚至驱动 3D 打印和数控加工。 项目包含 11 个独立 Skills,覆盖从"文本/…
Agent 智能体 earthtojake/text-to-cad Stars 13,238 Jay 2026-08-06
Agent 评测体系全面拆解:从环境稳定性到轨迹评估的工程挑战 · 干货攻略
Cameron R. Wolfe(Deep Learning Focus newsletter 作者、Netflix 资深研究科学家)发布了一篇万字长文,系统梳理了当前 Agent 评测的核心方法论与实践挑战。 传统 LLM 评测用静态问答或短对话就能完成——输入问题,输出答案,对比参考答案。但 Agent 系统是长时间运行、主动操作外部环境、与工具反复交互…
Agent 智能体 Jay 2026-08-05
davidondrej/skills · 上手攻略
davidondrej/skills 是一个面向 AI 编程 Agent、研究 Agent 和工作流 Agent 的可复用技能包。每个技能(skill)将一类重复性工作流打包成指令集,Agent 在任务需要时直接加载使用。与纯粹的理论框架不同,这里的技能来自 David Ondrej 本人的实际工作栈,经过真实场景验证。 仓库规模不大(Stars 3250,…
Agent 智能体 davidondrej/skills Stars 3,570 Jay 2026-08-04
无需微调:LLM Agent 做机器人"大脑",零训练达 4x SOTA · 干货攻略
FAEA(Frontier Agent as Embodied Agent)是一种无需任何演示数据、无需微调的机器人操控新范式——直接把现成的 LLM Agent SDK(如 Claude Agent SDK)当作机器人的"大脑",让 Agent 自己写代码、调试、再尝试,直到任务成功。 核心思路一句话:机器人策略(π)负责动,LLM Agent 负责想,各…
Agent 智能体 robiemusketeer/faea-sim Jay 2026-07-31
工具输出训练为何让 Agent 更强:世界模型视角的理论解析 · 干货攻略
一个长期被忽视的事实是:语言模型被训练来执行动作,但从未被显式训练来建模它们所处的环境。 标准 Agent 强化学习(如 GRPO)只在动作 token 上计算梯度,用稀疏的二元结果奖励(成功/失败)驱动学习。环境中返回的所有观测——stdout、stderr、文件内容、错误信息、工具响应——虽然在 rollout 中已经存在,却不参与训练,被白白丢弃。 工…
Agent 智能体 Jay 2026-07-29
synthetic-sciences/openscience · 上手攻略
OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。 它于 2026 年 7 月 5 日正式发布,定位是 Claude Sci…
Agent 智能体 synthetic-sciences/openscience Stars 3,147 Jay 2026-07-26
DataFlow-Harness:让代码 Agent 构建可编辑的 DAG 数据流水线 · 干货攻略
DataFlowHarness 是北京大学联合中关村 Academy 于 2026 年 7 月 18 日发布的一个代码 Agent 平台(技术报告 arXiv:2607.16617),核心解决一个实际问题:LLM 代码 Agent 生成的往往是「一次性脚本」而非可持续编辑的生产级数据流水线——作者将此称为 NL2Pipeline Gap(自然语言到流水线之间…
Agent 智能体 OpenDCAI/DataFlow(DataFlow-Harness 为其子项目,暂无独立仓库) Jay 2026-07-24