ysr666/dsh-vision-router · 上手攻略

  • 仓库:ysr666/dsh-vision-router
  • 链接:https://github.com/ysr666/dsh-vision-router
  • 分类:Tools & Capabilities · DeepSeek Harness Plugin
  • 作者:Tom
  • 更新:2026-08-17

这是什么

dsh-vision-router 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段文字描述喂给大模型。

区别于其他 DSH 视觉插件的"描述桥"方案(图片 → VLM 描述 → 文字消息 → DeepSeek),本插件走的是"路由桥"路线:图片轮直接发给视觉模型原生推理,保留像素级保真度,内置免 Key 免费兜底。


解决什么问题

纯文本 Agent(如只支持文字的 DeepSeek 模型)在遇到截图、UI、图纸、数据曲线、代码截图等视觉信息时,要么报错"不支持图片",要么靠 OCR 插件转成文字——信息大量丢失。

dsh-vision-router 解决这个问题的完整方案:

  • 免 Key 视觉链:内置 OVHcloud 匿名免费视觉端(Qwen2.5-VL-72B-Instruct),不注册、不付费、直接可用,速率约 2 req/min/IP/模型(见下"免费视觉 Key 渠道"可换更大额度)。
  • 11 个像素工具:vision_describe(图文问答)、vision_ground(目标定位)、vision_crop(裁剪)、vision_pixel_diff(像素对比)、vision_colors(取色)、vision_ocr(OCR)、vision_svg_trace(矢量追踪)、vision_cutout(抠图)、vision_screenshot(HTML 截图)、vision_qa、vision_ground_auto。
  • 多步迭代:Agent 可以链式调用多个视觉工具形成 pipeline,直到完成复杂视觉任务。
  • DeepSeek 仍是大脑:文字轮完全不变,视觉模型只当"眼睛",按需调且答案按图缓存,不影响原模型上下文与 Token 成本。

快速安装

Node.js ≥22 是前置条件,请先确认 node --version

方式一:npm/npx(推荐)

npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router

安装完成后,启动或重载 DSH Web 即可。

方式二:从源码工作区

cd deepseek-harness          # DSH 源码目录
pnpm dsh plugin --profile web add dsh-vision-router

方式三:第三方 dshpm

dshpm add dsh-vision-router   # 需要 dshpm v0.4.2+

核心配置与工具使用

1. 选择带「+ 自动识图」的模型组

插件加载后会自动在 Settings → 模型 中为每个已启用模型组新增一个同名的"自动识图"入口。例如:

  • opencode-go — 原纯文本模型组,不变
  • opencode-go + 自动识图 — 发图片时选这个

⚠️ 不要在聊天页右下角单独选择视觉模型;那里选的是会话大脑,视觉模型由插件内部路由链决定。

2. 直接往对话里贴图

选择"自动识图"模型组后,直接粘贴图片即可触发视觉工具链。Agent 可在同一次对话里调用任意视觉工具。

3. 关键配置项(Settings → 插件 → 视觉路由)

配置项 说明
视觉后端链 按优先级排列可用视觉模型;最底部可留空走 OVH 免费匿名兜底
隐身模式(默认关) 开启后不接管官方 DeepSeek 路由
extraVisionModels 可选能力标记覆盖,不再是解锁模型的前置条件

4. 免费视觉 Key 渠道(2026 年 8 月快照)

OVH 内置匿名兜底速率有限(约 2 req/min/IP/模型)。如需更大额度,以下渠道免费额度更大,全部免注册/免 Key 或注册即免费:

渠道 免费视觉模型 免费额度 大陆直连
OVHcloud AI Endpoints(access key) Qwen2.5-VL-72B-Instruct 400 次/分钟/项目
智谱(bigmodel.cn) glm-4.6v-flash · glm-4.1v-thinking-flash · glm-4v-flash token 不限量
阿里云百炼 qwen3-vl-flash 新用户 100 万 token/90 天
Intern AI internvl-latest · internvl3.5-latest 30 RPM,9000 万 token/月
Groq llama-4-scout-17b-16e-instruct 30 RPM / 14400 次/天,免卡
NVIDIA NIM llama-3.2-11b-vision-instruct 40 RPM,免卡 ⚠️

⚠️ 免费政策随时可能调整,Cerebras 已于 2026 年 7 月取消免费档(改为 $5 赠金)。以上为快照,依赖前请以各控制台为准。


典型适用场景

  1. 代码截图/架构图问答:Agent 直接看架构图,而不是读 OCR 后的残缺文字。
  2. UI 还原与对比:设计师贴图,Agent 用 pixel_diff 量化改动前后差异。
  3. 数据图表解读:折线图、柱状图直接由视觉模型解读数字,无需 OCR。
  4. 多步视觉任务 pipeline:ground → crop → describe → screenshot 多轮迭代。
  5. 免 Key 快速体验:不想注册任何 API 的场景,内置 OVH 免费链开箱即用。

坑与注意

  1. 模型组没选对:如果仍选着原来的纯文本模型组,DSH 会先报错"不支持图片"——这不是插件坏了,只是没切到"自动识图"入口。
  2. OVH 匿名兜底速率极低:2 req/min/IP/模型 ≈ 理论最多 10 req/min(5 个模型合计),正式使用建议配置 Key 渠道。
  3. Python 不可用:本插件完全基于 Node.js/sharp/potrace/tesseract/Chrome,不支持 Python 环境。
  4. 长图/高分辨率图:自动缩放以保护延迟与额度,非破坏性。
  5. 隐身模式默认关:默认会介入 DSH 路由;如需完全隔离官方路由,开启隐身模式。
  6. 免费政策不稳定:Groq/Cerebras 等免费档在 2026 年中频繁变动,不建议作为主力视觉后端依赖。

与同类对比

方案 像素保真 免 Key 开箱 自动路由 多步视觉
描述桥方案(dsh-vision-sidecar 等) ❌ 只有文字描述
MCP 视觉桥 部分
dsh-vision-router(本文) ✅ 内置 OVH 匿名 ✅ 11 工具
modlens

dsh-vision-router 的差异化优势:一条命令安装 + 内置免费兜底 + 整轮自动路由,不需要额外部署外部服务器或注册任何 Key,适合快速尝鲜与正式使用两相宜。


一句话推荐

DeepSeek Harness 用户如果需要看图能力,先装 dsh-vision-router——免 Key 开箱、11 像素工具、自动路由链,粘贴图片就能用,上手成本最低。