ysr666/dsh-vision-router · 上手攻略
- 仓库:ysr666/dsh-vision-router
- 链接:https://github.com/ysr666/dsh-vision-router
- 分类:Tools & Capabilities · DeepSeek Harness Plugin
- 作者:Tom
- 更新:2026-08-17
这是什么
dsh-vision-router 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段文字描述喂给大模型。
区别于其他 DSH 视觉插件的"描述桥"方案(图片 → VLM 描述 → 文字消息 → DeepSeek),本插件走的是"路由桥"路线:图片轮直接发给视觉模型原生推理,保留像素级保真度,内置免 Key 免费兜底。
解决什么问题
纯文本 Agent(如只支持文字的 DeepSeek 模型)在遇到截图、UI、图纸、数据曲线、代码截图等视觉信息时,要么报错"不支持图片",要么靠 OCR 插件转成文字——信息大量丢失。
dsh-vision-router 解决这个问题的完整方案:
- 免 Key 视觉链:内置 OVHcloud 匿名免费视觉端(Qwen2.5-VL-72B-Instruct),不注册、不付费、直接可用,速率约 2 req/min/IP/模型(见下"免费视觉 Key 渠道"可换更大额度)。
- 11 个像素工具:vision_describe(图文问答)、vision_ground(目标定位)、vision_crop(裁剪)、vision_pixel_diff(像素对比)、vision_colors(取色)、vision_ocr(OCR)、vision_svg_trace(矢量追踪)、vision_cutout(抠图)、vision_screenshot(HTML 截图)、vision_qa、vision_ground_auto。
- 多步迭代:Agent 可以链式调用多个视觉工具形成 pipeline,直到完成复杂视觉任务。
- DeepSeek 仍是大脑:文字轮完全不变,视觉模型只当"眼睛",按需调且答案按图缓存,不影响原模型上下文与 Token 成本。
快速安装
Node.js ≥22 是前置条件,请先确认 node --version。
方式一:npm/npx(推荐)
npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router
安装完成后,启动或重载 DSH Web 即可。
方式二:从源码工作区
cd deepseek-harness # DSH 源码目录
pnpm dsh plugin --profile web add dsh-vision-router
方式三:第三方 dshpm
dshpm add dsh-vision-router # 需要 dshpm v0.4.2+
核心配置与工具使用
1. 选择带「+ 自动识图」的模型组
插件加载后会自动在 Settings → 模型 中为每个已启用模型组新增一个同名的"自动识图"入口。例如:
opencode-go— 原纯文本模型组,不变opencode-go + 自动识图— 发图片时选这个
⚠️ 不要在聊天页右下角单独选择视觉模型;那里选的是会话大脑,视觉模型由插件内部路由链决定。
2. 直接往对话里贴图
选择"自动识图"模型组后,直接粘贴图片即可触发视觉工具链。Agent 可在同一次对话里调用任意视觉工具。
3. 关键配置项(Settings → 插件 → 视觉路由)
| 配置项 | 说明 |
|---|---|
| 视觉后端链 | 按优先级排列可用视觉模型;最底部可留空走 OVH 免费匿名兜底 |
| 隐身模式(默认关) | 开启后不接管官方 DeepSeek 路由 |
| extraVisionModels | 可选能力标记覆盖,不再是解锁模型的前置条件 |
4. 免费视觉 Key 渠道(2026 年 8 月快照)
OVH 内置匿名兜底速率有限(约 2 req/min/IP/模型)。如需更大额度,以下渠道免费额度更大,全部免注册/免 Key 或注册即免费:
| 渠道 | 免费视觉模型 | 免费额度 | 大陆直连 |
|---|---|---|---|
| OVHcloud AI Endpoints(access key) | Qwen2.5-VL-72B-Instruct | 400 次/分钟/项目 | ✅ |
| 智谱(bigmodel.cn) | glm-4.6v-flash · glm-4.1v-thinking-flash · glm-4v-flash | token 不限量 | ✅ |
| 阿里云百炼 | qwen3-vl-flash | 新用户 100 万 token/90 天 | ✅ |
| Intern AI | internvl-latest · internvl3.5-latest | 30 RPM,9000 万 token/月 | ✅ |
| Groq | llama-4-scout-17b-16e-instruct | 30 RPM / 14400 次/天,免卡 | ❌ |
| NVIDIA NIM | llama-3.2-11b-vision-instruct | 40 RPM,免卡 | ⚠️ |
⚠️ 免费政策随时可能调整,Cerebras 已于 2026 年 7 月取消免费档(改为 $5 赠金)。以上为快照,依赖前请以各控制台为准。
典型适用场景
- 代码截图/架构图问答:Agent 直接看架构图,而不是读 OCR 后的残缺文字。
- UI 还原与对比:设计师贴图,Agent 用 pixel_diff 量化改动前后差异。
- 数据图表解读:折线图、柱状图直接由视觉模型解读数字,无需 OCR。
- 多步视觉任务 pipeline:ground → crop → describe → screenshot 多轮迭代。
- 免 Key 快速体验:不想注册任何 API 的场景,内置 OVH 免费链开箱即用。
坑与注意
- 模型组没选对:如果仍选着原来的纯文本模型组,DSH 会先报错"不支持图片"——这不是插件坏了,只是没切到"自动识图"入口。
- OVH 匿名兜底速率极低:2 req/min/IP/模型 ≈ 理论最多 10 req/min(5 个模型合计),正式使用建议配置 Key 渠道。
- Python 不可用:本插件完全基于 Node.js/sharp/potrace/tesseract/Chrome,不支持 Python 环境。
- 长图/高分辨率图:自动缩放以保护延迟与额度,非破坏性。
- 隐身模式默认关:默认会介入 DSH 路由;如需完全隔离官方路由,开启隐身模式。
- 免费政策不稳定:Groq/Cerebras 等免费档在 2026 年中频繁变动,不建议作为主力视觉后端依赖。
与同类对比
| 方案 | 像素保真 | 免 Key 开箱 | 自动路由 | 多步视觉 |
|---|---|---|---|---|
| 描述桥方案(dsh-vision-sidecar 等) | ❌ 只有文字描述 | ✅ | ❌ | ❌ |
| MCP 视觉桥 | ✅ | ❌ | ✅ | 部分 |
| dsh-vision-router(本文) | ✅ | ✅ 内置 OVH 匿名 | ✅ | ✅ 11 工具 |
| modlens | ✅ | ❌ | ❌ | ✅ |
dsh-vision-router 的差异化优势:一条命令安装 + 内置免费兜底 + 整轮自动路由,不需要额外部署外部服务器或注册任何 Key,适合快速尝鲜与正式使用两相宜。
一句话推荐
DeepSeek Harness 用户如果需要看图能力,先装 dsh-vision-router——免 Key 开箱、11 像素工具、自动路由链,粘贴图片就能用,上手成本最低。