本文要点
截图、UI、图表或中文文档图片驱动任务时,需要多模态。纯文本编程冠军不等于视觉冠军。确认控制台哪些模型 ID 收图,从海外测延迟,并预算更大 payload。
负载地图
截图报 bug → 视觉对话。中文扫描 PDF → 常 RAG+OCR,而非一张超大图。纯代码 → coding-assistant。看图+行动的 Agent → 联测 tools。
厂商提示
Qwen/DashScope 常进多模态短名单。GLM 企业栈可能有视觉变体。模型名以控制台为准。
POC 清单
10 张生产真实图 → 各厂商同一问题 → 评准确、中英文回答、延迟、大图失败 → 估成本 → 规划视觉故障时的纯文本 failover。
在 Swift Horse 上的下一步
模型库 → 对比表 → SDK → best-chinese-llm-2026。
常见问题
看图哪个国产模型最好?
无 universal 答案——在 Qwen/GLM 控制台筛多模态 ID,跑 10 图 POC。
PDF 能当图片发送吗?
有时可以,但大扫描件贵且易损——文档更建议 OCR/RAG。
OpenAI 兼容 SDK 支持视觉吗?
多数厂商在 chat 消息中接受图片部分——请测 SDK 版本。见 openai-compatible-sdk。
这是厂商官方视觉文档吗?
否——Swift Horse 独立指南。图片限制以厂商文档为准。