本文要点
Agent 场景失败点多在 tool calling 兼容性而非对话质量。选 DeepSeek/Qwen/Kimi/GLM 前需测:schema、并行 tool、流式+tools、错误 payload、每次成功任务的 output 成本。Swift Horse 仅索引公开 API 标签,不保证与 OpenAI 完全一致。
为什么各家 tool calling 表现不同
中国实验室的 OpenAI 兼容接口在 JSON mode、strict schema、tool_choice、流式 tool delta 上差异大。聊天强的模型可能在嵌套对象上失败。对候选跑相同 50 次调用套件;接入见 access-china-llm-api-overseas。
厂商快照(2026)
DeepSeek:推理 Agent 常见;区分 reasoner/chat 模型 ID。Qwen/DashScope:生态工具多;国际站模型名另查。GLM:企业 function calling 稳定。Kimi:长文档+tools 联测。签约前以官方文档为准。
50 次 Agent POC 清单
5 组 tool schema × 10 prompt → 记录成功、延迟、畸形 JSON、重试 → 统计每次成功 output token → 按真实量估算月成本(见 china-llm-api-pricing-2026)→ 文档化 failover。通过线:schema 成功率 >95%,P95 延迟满足产品预算。
在 Swift Horse 上的下一步
对比 /services → 矩阵 top-chinese-ai-models-2026 → API access-china-llm-api-overseas → Kimi vs GLM kimi-vs-glm-selection-guide-2026。
常见问题
哪个国产大模型 tool calling 最好?
无 universal 答案;GLM/Qwen 常进企业 Agent 名单,DeepSeek 偏推理 tool。跑 50 次 POC;Swift Horse 不排名实时成功率。
国产 API 与 OpenAI tools 兼容吗?
多家声明兼容,但不保证完全一致。上线前自测流式 tools、strict JSON 与错误格式。
Agent 如何影响 API 成本?
Agent 放大 output 与 tool 轮次。用真实 trace 预算——见 china-llm-api-pricing-2026。
能用 LangChain 接国产模型吗?
多数厂商可通过 OpenAI 兼容 base URL 接入 LangChain。工具绑定需用控制台最新模型 ID 验证。