本文要点

截图、UI、图表或中文文档图片驱动任务时,需要多模态。纯文本编程冠军不等于视觉冠军。确认控制台哪些模型 ID 收图,从海外测延迟,并预算更大 payload。

负载地图

截图报 bug → 视觉对话。中文扫描 PDF → 常 RAG+OCR,而非一张超大图。纯代码 → coding-assistant。看图+行动的 Agent → 联测 tools。

厂商提示

Qwen/DashScope 常进多模态短名单。GLM 企业栈可能有视觉变体。模型名以控制台为准。

POC 清单

10 张生产真实图 → 各厂商同一问题 → 评准确、中英文回答、延迟、大图失败 → 估成本 → 规划视觉故障时的纯文本 failover。

在 Swift Horse 上的下一步

模型库 → 对比表 → SDK → best-chinese-llm-2026。

常见问题

看图哪个国产模型最好?

无 universal 答案——在 Qwen/GLM 控制台筛多模态 ID,跑 10 图 POC。

PDF 能当图片发送吗?

有时可以,但大扫描件贵且易损——文档更建议 OCR/RAG。

OpenAI 兼容 SDK 支持视觉吗?

多数厂商在 chat 消息中接受图片部分——请测 SDK 版本。见 openai-compatible-sdk。

这是厂商官方视觉文档吗?

否——Swift Horse 独立指南。图片限制以厂商文档为准。