本文要点

公开榜单是信号,不是采购单。很少覆盖你的 tool schema、双语产品语气、负载下 P95 或 token 账单。用榜单筛 2–3 个候选,再跑私有评测。Swift Horse 不发布实时「最强模型」排名。

榜单常漏什么

tool calling 对等性、流式+tools、海外限流、中英混排、RAG 引用忠实度、每次成功任务成本。Agent 成本远超聊天榜——见 agent 与定价文。

私有评测配方

冻结 20–50 个生产任务 → 同一 system prompt → 记录通过/失败、人工偏好、token、延迟 → 含 5 个 tool 任务 → 估月成本 → 定主用+failover。

在 Swift Horse 上的下一步

短名单 best-chinese-llm-2026 → 矩阵 → /services → /models。

常见问题

公开榜上谁第一?

随套件与日期轮换。把第一名当短名单提示,不当合同。

可以跳过私有评测吗?

生产环境不行。榜单漏掉 tools、延迟与成本形态。

榜单和 API 定价有何关系?

高分但 output 贵可能输在 TCO——见定价文。

Swift Horse 有排行榜吗?

无实时排名榜——仅结构化模型页与选型指南。