Skip to content

给文字模型添加看图和生图能力

2026-08-15 · 用 Hermes + Gemini 免费档 / 硅基流动 Qwen3-VL 给纯文字模型配一双"眼睛"

灵感来源

使用 Hermes Agent 工具解决

1、本人因为使用的 Hermes Agent 工具,是有免费自带的生图能力

  • 也可以使用 GPT Image
  • 或者第三方生图模型,API:硅基流动

2、所以我们需要解决看图的能力

配置命令(重装电脑恢复用)

看图模型(Gemini 免费档,key 在 aistudio.google.com 免费拿):

bash
hermes config set auxiliary.vision.provider gemini
hermes config set auxiliary.vision.model gemini-3.7-flash
# .env 文件加一行(Windows: %LOCALAPPDATA%\hermes\.env;Linux/macOS: ~/.hermes/.env):
# GOOGLE_API_KEY=<你的key>

看图模型方案二:硅基流动 Qwen3-VL-32B-Instruct(无免费档 RPM 墙,注册送额度,现主力):

bash
hermes config set auxiliary.vision.provider custom
hermes config set auxiliary.vision.model "Qwen/Qwen3-VL-32B-Instruct"
hermes config set auxiliary.vision.base_url "https://api.siliconflow.cn/v1"
hermes config set auxiliary.vision.api_key "sk-xxx"   # 硅基流动控制台创建

注意:custom provider 的 key 写在 api_key 字段(不是 .env);从 gemini 换过来时 base_url 要一并换成硅基流动地址。

生图:无需配置,Hermes 订阅自带 FLUX(Nous Portal 登录即可),不用 key

踩坑

  • auxiliary.vision.provider 不能留 auto:auto 会解析到主模型的纯文本供应商(如 deepseek-v4-flash),看图报错 unknown variant image_url, expected text,必须显式写 gemini

查看 / 更换

bash
hermes config get auxiliary.vision          # 查看当前看图模型
hermes config set auxiliary.vision.model <模型>   # 更换模型
# 换完用 vision_analyze 测一张图确认

提醒

  • Gemini 免费档有限额(RPM/TPM/RPD,每天太平洋时间重置),实时额度查看:aistudio.google.com/rate-limit
  • 免费档只够轻量任务(看图/查资料),撑不住写代码的 token 消耗
  • 谷歌封 IP 会报 429/403 → 换 clash 节点