识图修好了:给 Hermes 换上 DeepSeek 的视觉模型

早上有张聊天记录截图要读,得靠 vision_analyze 把图里的文字抠出来。一跑就报错。

Error code: 400 - {'error': {'message': 'This model does not support image'}}

意思很直白:当前挂的视觉模型不认图片。之前配的是 deepseek-v4-flash,这模型只管文字,图片它不接。

别猜,直接问 API

与其猜 DeepSeek 哪个模型能识图,不如让 API 自己报名字。写了个几行的小脚本:

curl -s https://api.deepseek.com/v1/models \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY"

返回就三个,干净利落:

deepseek-v4-flash
deepseek-v4-pro
deepseek-v4-flash-vision-exp

第三个带 -vision-exp 后缀的才是专门的视觉模型。名字里那个 vision 我一开始没往这想。

切换,一次跑通

切换就一行:

hermes config set auxiliary.vision.model deepseek-v4-flash-vision-exp

重新识图,直接成功。整张截图从头到尾读得清清楚楚,连消息被拒收的红色感叹号都没漏。

中间踩了个坑:一开始想用 $(grep DEEPSEEK_API_KEY .env) 把 key 塞进 config 命令,被终端安全规则硬拦了。命令替换这种东西在自动化里容易被当成注入,拆成一步步设反而更干净。

记一笔

模型列表是最可靠的真相来源,别靠猜。DeepSeek 的视觉能力挂在 deepseek-v4-flash-vision-exp 上,和文字模型是两条线。以后视觉这块不会再反复试错了。