本文要点

China LLM 优化不是一句 magic prompt——而是路由、上下文纪律与度量。最大节省来自更短上下文(RAG)、简单任务用小模型、流式改善体感、有限重试的 failover。配合定价与延迟指南。

优化杠杆

路由:分类/抽取用小快模型,难推理用大模型。上下文:分块+检索而非硬塞 PDF。输出上限:批任务限 max_tokens。缓存:可安全缓存的 system 与检索片段。Agent:减少 tool 轮次。

7 天优化冲刺

基线 P95 与 token spend → 找最贵 3 条路径 → 加路由或 RAG → 复测 → runbook 写清模型 ID。单路径优化后再比厂商。

在 Swift Horse 上的下一步

定价 → SDK → 编程选型 → /match。

常见问题

China LLM 优化指什么?

在保持质量前提下降延迟、token 与成本的工程手段——路由、RAG、缓存与上限。

哪个国产模型最容易优化成本?

看负载——DeepSeek 常在编程 $/任务领先;Qwen/GLM 在其他轴更强。用 trace 度量。

优化能替代选型吗?

不能——在已按场景筛出的短名单内优化。见 china-ai-llm-guide-2026。

这是某一家厂商的调参文档吗?

否——Swift Horse 厂商无关指南;限制以各 API 控制台为准。