DeepSeek 不能识图?装个开源 Skill 就能看

大家好,我是晓凡

一、 DeepSeek 性价比突出,却存在视觉盲区

DeepSeek 的用户群体正在持续扩大。原因很直观——成本效益突出,且能力迭代迅速。

V4-Flash 正式版推出后,性能指标再度跃升,而 V4-Pro 正式版也于近日正式亮相。

据平台统计,DeepSeek 的 Token 消耗量已突破 8 万亿,这表明用户是实际投入资源使用,而非仅停留在尝试阶段。

然而,长期使用者普遍会遇到一个共同障碍:无法处理图像内容。

当你上传截图时,系统会直接反馈“我无法处理图片”。这对日常对话影响有限,但在实际工作场景中便显得颇为不便。

以典型场景为例。前端开发时设计稿就在手边,希望让模型参照生成界面。由于无法识别图像,你只能口头描述:左侧放置按钮,右侧安排输入框,主色调为蓝色……耗费大量精力描述后,效果仍可能与预期存在偏差。

另一种常见情况是代码调试。遇到报错需要协助排查,截图发送后系统无法读取。你不得不将错误信息逐字复制为文本,并详细说明具体文件及行号。若遇到格式混乱的报错堆栈,复制粘贴过程极易产生混淆。

这些问题的根源在于它缺乏视觉感知能力,并非多模态模型。

实际上,不仅 DeepSeek,许多专注于文本生成的模型都存在类似局限。只是凭借庞大的用户基数和极具竞争力的价格,DeepSeek 被广泛应用于实际任务中,这一不足便显得尤为突出。

幸运的是,目前已存在成熟的解决方案来弥补这一缺陷,且实施成本极低,下文将详细说明。

二、 开源 Skill 实现视觉能力扩展

无需等待官方功能更新,开源社区已开发出相应解决方案,其名称为 claude-vision-skill。

不必因“Claude”字样而产生顾虑。

虽然该工具最初为 Claude 设计,但可集成至任意 Agent 平台,安装后 Agent 将自动完成适配。

该项目目前获得的 star 数量已达到 1.9k。

github地址:

其实现逻辑较为直观:首先将图像传输至具备视觉识别能力的模型,由该模型将图像内容转化为文字描述,然后将这些描述文本反馈给 DeepSeek。由于 DeepSeek 接收的是文本信息,自然能够“理解”图像内容。

简而言之,相当于引入一个具备视觉能力的“翻译”模型,将图像信息转换为文字描述,再转交给 DeepSeek 处理。

DeepSeek 自身无需具备图像识别功能,只需能够解读翻译结果即可。

因此,你需要额外配置一个支持视觉识别的模型。

项目默认推荐阿里千问系列中的 qwen3.5-omni-plus 和 qwen-vl-max。

选择千问的原因在于其经济性。阿里云为新用户提供 100 万 Token 的免费额度,折算后单次图像识别成本约为两分钱,几乎可以忽略不计。

当然,如果你已拥有其他支持 OpenAI 兼容接口的视觉识别模型,同样可以接入使用,不存在兼容性限制。

该 Skill 本质上扮演着“信息中转”角色,底层的识别模型可根据需求灵活替换。

三、 部署配置

只需将以下内容提交给 Codex,后续流程将自动完成,无需手动执行命令或修改配置文件。

按照 的 README 帮我配置识图

整个过程将自动完成代码拉取与配置编写,你只需观察进度即可。

安装结束后,还需完成最后一项设置:配置视觉识别模型的 API Key。

默认使用阿里千问服务,需要前往千问AI平台:

创建并获取API Key。

新用户享有的 100 万免费 Token 额度,大约可支持 7000 次图像识别操作。

即使每天使用,也足以维持数月之久。待免费额度耗尽后,继续充值成本依然低廉,单次仅需两分钱,日常使用几乎不会产生经济负担。

有两个细节需要特别注意。首次使用图像识别功能时,Agent 可能会弹出提示,要求 给 DeepSeek 补上识图能力,成本几乎可以忽略,效果却立竿见影。原理不复杂,就是借一个会看的模型,把图片变成文字再转给它。装起来也就一句话的事,前后几分钟。有需要的小伙伴,值得一试。

0

评论0

请先
显示验证码
没有账号?注册  忘记密码?