NemoClaw Blueprint:开源 Agent 栈如何用 1/10 成本击败闭源方案 · 干货攻略
- 链接: https://x.com/hwchase17/status/2074874140776169485
- 分类: x-tips
- 来源: X @hwchase17
- 作者: Jay
- 更新: 2026-07-24
- 仓库: langchain-ai/deepagents
这是什么
NemoClaw for LangChain Deep Agents Blueprint(简称 NemoClaw)是 LangChain 与 NVIDIA 联合发布的企业级 Agent 参考架构,发布时间为 2026 年 7 月 8 日(PRNewswire)。
该 Blueprint 不是一款独立产品,而是把三层开源组件打包成一套可落地、可自托管的完整 Agent 技术栈:
| 层级 | 组件 | 定位 |
|---|---|---|
| 模型层 | NVIDIA Nemotron 3 Ultra | 可自定义的开放权重模型 |
| Harness 层 | LangChain Deep Agents Code(dcode) | 包含规划、工具调用、记忆、任务执行的开源 Agent 框架 |
| 安全运行时 | NVIDIA OpenShell | 沙箱化安全执行 Agent 生成代码的运行时 |
Blueprint 包含一份针对 Nemotron 3 Ultra 专门调优过的 Harness Profile(系统提示词、工具描述、中间件配置的集合),企业可以直接复用或在此基础上继续调优。
为什么值得关注
核心硬核点:Harness Engineering 而非 Fine-tuning
X 帖(@hwchase17)提到"Deep Agents 完全开源 + 调优 Nemotron 3 Ultra 实现 benchmark 领先、推理成本降 10 倍"。但这里的"调优"并非改模型权重,而是调 Harness 配置。
NVIDIA 开发者博客详细记录了这个过程:
团队在 LangChain 的公开评测基准上跑 Nemotron 3 Ultra,发现
read_file工具存在分页截断问题——模型读完第一页就停止了,没有继续翻页。通过添加ReadFileContinuationNoticeMiddleware中间件提示模型"文件可能还没读完",Read file 测试从 0/3 通过提升到 3/3,整体评测分从 94/127 提升到 96/127。整个过程没有重训模型,只是改了 Harness 配置。
这揭示了一个重要范式:对于能在工具调用框架内工作的模型,Agent 性能提升的主要杠杆在 Harness 层面,而不是模型本身。
数字说话
以下数据均来自官方来源(LangChain 官方博客、NVIDIA 官方博客):
- 评测得分:LangChain Agent 评测套件中,Nemotron 3 Ultra + Deep Agents 达到 0.86 聚合分,是开源模型中的最高分
- 成本对比:同样评测下,Nemotron 3 Ultra 推理成本约 $4.48/run,而表现次优的模型(据 cross-validation 来源为闭源方案)约 $43.48/run,相差约 10 倍
- 开源模型横向对比:Nemotron 3 Ultra 86.6% > DeepSeek V4 Pro 83.4% > Kimi K2.6 82.7%(来源: Crusoe 博客,技术细节引用自 NVIDIA)
- 发布日期:2026 年 7 月 8 日(PRNewswire)
谁在用
Abridge、Amdocs、Box 已在平台上嵌入专业化 Agent,系统集成商 EY 正在围绕 NemoClaw 构建实施实践。此外 Baseten、Crusoe、DeepInfra、Fireworks、Nebius、Together AI 等六家云厂商已上线 Nemotron 3 Ultra 的托管端点,企业可直接在生产环境调用。
核验过程
官方来源(已读)
-
X @hwchase17 原帖 - 确认:NemoClaw Blueprint 由 LangChain × NVIDIA 联合发布 - 确认:Deep Agents 为完全开源的 Agent Harness
-
NVIDIA 官方博客(blogs.nvidia.com) - 确认:Benchmark 数字(0.86 aggregate score,$4.48 vs $43.48 cost) - 确认:三组件构成(Nemotron 3 Ultra + Deep Agents Code + OpenShell) - 确认:Jensen Huang 与 Harrison Chase 对话引用
-
LangChain 官方博客(langchain.com/blog) - 确认:Blueprint 定位为企业级开源 Agent 栈完整参考架构 - 确认:生态合作伙伴列表(EY、Baseten 等 6 家) - 确认:Harness Profile 调优为本次核心工程方法论
-
NVIDIA 开发者技术博客(developer.nvidia.com) - 确认:
ReadFileContinuationNoticeMiddleware实操代码示例 - 确认:评测基准数字(94→96/127,Read file 0/3→3/3) - 确认:自动化 Harness Profile 创建的 "Ralph Loop" 流程
交叉验证结论
10x 成本优势在 LangChain 博客、NVIDIA 博客、Crusoe 技术博客三方交叉一致,官方说法可信度高。86.6% / 83.4% / 82.7%开源模型对比数据来自 Crusoe 博客对 NVIDIA 技术细节的引用,与 NVIDIA 博客的"最高分开源模型"描述吻合。Harness Profile调优方法论在 NVIDIA 开发者博客有详细代码示例(ReadFileContinuationNoticeMiddleware),与 X 帖描述一致。- 待标注:X 帖提到"benchmark 领先"——官方说法是"开源模型中最高分",两者不矛盾但范围不同,攻略以官方表述为准。
上手步骤
快速安装 Deep Agents Code
Deep Agents Code(dcode)是 Blueprint 中面向开发者的终端编码 Agent,支持任何 LLM 提供方:
# 安装并启动
curl -LsSf https://langch.in/dcode | bash
dcode
获取 NVIDIA Nemotron 3 Ultra API
- 测试阶段:访问 build.nvidia.com 获取免费 API 访问
- 生产阶段:通过 Baseten、Crusoe Cloud、DeepInfra、Fireworks、Nebius、Together AI 任选一家托管端点
应用 NemoClaw Harness Profile
调优后的 Harness Profile 已发布,Deep Agents 支持直接注册使用:
from deepagents import create_deep_agent, register_harness_profile, HarnessProfile
from deepagents.profiles.harness import ReadFileContinuationNoticeMiddleware
# 注册针对 Nemotron 3 Ultra 的 Profile
profile = HarnessProfile(
extra_middleware=[
ReadFileContinuationNoticeMiddleware(),
]
)
register_harness_profile("nvidia:nemotron-ultra", profile)
# 创建 Agent
agent = create_deep_agent(
model="nvidia:nemotron-ultra",
harness_profile="nvidia:nemotron-ultra",
)
自定义 Harness Profile(进阶)
如果需要针对自身场景继续调优,参考 NVIDIA 开发者博客的迭代循环:
- 用开源评测基准建立基线:
uv run pytest tests/evals/ - 分析失败案例,找到 Harness 可优化的环节(提示词、工具描述、中间件)
- 修改 Profile 并验证改进
- 重复直到满意
LangChain 的官方文档提供了 Capabilities 完整列表(远程沙箱、目标评分、子 Agent、记忆、MCP 工具等)。
通过 Blueprint 获取完整栈
不想自己拼装?直接使用 NemoClaw Blueprint:
https://build.nvidia.com/nvidia/nemoclaw-for-langchain-deep-agents-code
该 Blueprint 包含 Nemotron 3 Ultra + 已调优 Deep Agents Harness + OpenShell 安全运行时,是最完整的起点。
坑与适用边界
适用场景
- 企业需要自托管、可控的 Agent 系统,不希望依赖单一闭源供应商
- 任务为长时序多步骤工作流(代码编写、数据分析、文件处理),这些场景 Deep Agents 有成熟工具链
- 团队已有能力进行 Harness 调优,愿意投入工程资源持续迭代
边界与局限
- 评测基准的代表性:0.86 分是在 LangChain 自有评测套件上测得的,该套件是否代表你的业务场景需要自行判断。NVIDIA 开发者博客也强调"benchmark 和测试都是随机的,需要多次运行取平均"。
- 10x 成本优势的情境性:$4.48 vs $43.48 的对比来自 LangChain 评测套件,实际业务场景的 token 消耗模式不同,成本差距也会变化。
- OpenShell 的适用范围:OpenShell 提供代码执行沙箱,但如果你的 Agent 不需要运行生成的代码(如纯分析类 Agent),OpenShell 的安全护栏价值有限。
- Nemotron 3 Ultra 的国产化限制:NVIDIA 芯片受出口管制,在中国大陆环境下使用可能面临硬件合规问题,需自行评估。
- "开源模型最高分" ≠ 全面超越:在 LangChain 评测中超过其他开源模型,不代表在所有任务类型上优于 Claude Opus 等顶级闭源模型。
一句话结论
NemoClaw Blueprint 的核心价值不是"换了个模型",而是证明了在 Agent 场景下,Harness Engineering(调 Harness 而非调模型)可以同时带来性能提升和成本数量级下降——这是企业自建可控 Agent 系统的务实路径。