本文要点

海外延迟 = 区域 RTT + 厂商排队 + 生成时间。用 P95 预算定 SLO,不要看平均 demo。Failover 需提前备好第二厂商密钥与用例。合规可能要求自托管或区域限制。

延迟清单

分别测 TTFB 与完整完成 → 从真实用户区域测 → 有近端用近端 → 用 RAG 缩短 prompt → 流式改善体感 → 可安全缓存的答案做缓存。

多厂商 failover 模式

主厂商(如 DeepSeek)→ 遇 5xx/超时/限流 → 退避重试 → 经 OpenAI 兼容客户端切到次厂商(Qwen/GLM)→ 对 failover 率告警。文档化能力差(tools、上下文)。

何时自托管优于 failover

数据不能出 VPC 或公有 API 不合规 → 自托管开源权重。否则多厂商云 API 通常更好运维。

在 Swift Horse 上的下一步

定价 → 接入总览 → 编程选型 → 场景匹配 /match。

常见问题

为什么从美国调中国大模型 API 慢?

跨区 RTT 叠加生成时间。从您的区域测 P95,并考虑近端 endpoint 或流式体验。

Failover 需要几个厂商?

多数团队两个即可:主用 + 次用,并测过 tool/上下文对等性。

重试要一直打同一厂商吗?

不要——限制重试次数后切换。无限重试会放大故障与成本。

厂商接入从哪开始?

见各厂商 quickstart 与 china-llm-openai-compatible-sdk-2026。