工具与能力
给纯文本编码智能体装上眼睛:多图理解、长截图 OCR、前端 UI 还原与 GUI 自动化,以视觉工具箱+技能形式提供,可无缝接入 Codex、Claude Code 等主流智能体。
给纯文本 DeepSeek Harness 智能体装上眼睛:内置免费视觉链路(无需密钥)+ 像素级视觉工具(问答、定位、裁剪、像素对比、OCR 等)。
能力感知 Auto 路由。 想要确定性就继续按配置顺序;想自动选择时再显式开启 Auto,只在已配置模型和已有实测证据上调整优先级。不会通过模型名猜能力,单纯开启 Auto 也不会自动发起测评。 - 可验证的模型测评。 「测试识图」只向当前精确模型发一次请求;Quick / Full 分别测 OCR、通用理解,以及结构化、文档、定位等能力。后台能力数据是独立授权,并会给真实前台识图让路。 - 原图像素,真实答案。 视觉链按原始分辨率读图(仅为保护延迟/额度自动缩放);你的问题随图一起发送,答案围绕 你的问题 ,而不是一段泛泛的描述。 - 自动降级 + 分类报错。 地区限制、ToS 风控、402 额度、429 限流、上下文超长、网络故障——链路逐供应商尝试,全部失败才报错并给出可操作的建议。遇到 429 会立即尝试下一后端,并按 Retry-After 开启冷却,不会在单次请求内睡眠等待。 - 图片记忆。 视觉答案按附件内容哈希缓存;后续文字轮用记录的描述替换历史图片(标注为不可信证据),DeepSeek 真正“记得”之前发过的图,且不重复消耗视觉调用。 - 可验证的像素闭环。 参照图 → vision html screenshot → vision pixel diff(差异率 + 红色热力图 + 最差区域排行)→ 修复 → 再对比,直到差异收敛。UI 还原从“目测”变成“实测”。 - 稳定工具 schema。 默认从会话开始就注册完整 14 个深看工具,避免图片轮中途扩展工具列表导致长上下文的 KV / prefix cache 失效。仍保留 progressiveTools: true 作为高级启动期 opt-in;开启后才使用 vision activate 按需挂载。详见 docs/progressive-tools-cache.md。 - 选择性代理。 只有配置的视觉供应商域名走本地代理;DeepSeek 保持直连。
Agent 仅根据参考图复刻 UI,再用 vision pixel diff 验证最终结果: 最终差异 2.54% (32,939 / 1,296,000 个差异像素,threshold 16/channel)。
dsh-vision-router 是 DeepSeek Harness 生态中的资源,由 ysr666 维护。给纯文本 DeepSeek Harness 智能体装上眼睛:内置免费视觉链路(无需密钥)+ 像素级视觉工具(问答、定位、裁剪、像素对比、OCR 等)。
项目源码与使用说明位于 GitHub 仓库 https://github.com/ysr666/dsh-vision-router。请以仓库 README 中的安装或使用步骤为准。
dsh-vision-router 是社区开源项目,采用 MIT 许可证。使用前请查看仓库中的许可证和项目说明。
工具与能力
给纯文本编码智能体装上眼睛:多图理解、长截图 OCR、前端 UI 还原与 GUI 自动化,以视觉工具箱+技能形式提供,可无缝接入 Codex、Claude Code 等主流智能体。
工具与能力
开源版锤子便签:复刻锤科美学,一键 Docker 私有化部署,支持 skill 调用与 dsh 插件,还能一键生成公众号格式。
工具与能力
在 DeepSeek Harness 里检测并下载网页中的视频和音频。