本文要点
China LLM 优化不是一句 magic prompt——而是路由、上下文纪律与度量。最大节省来自更短上下文(RAG)、简单任务用小模型、流式改善体感、有限重试的 failover。配合定价与延迟指南。
优化杠杆
路由:分类/抽取用小快模型,难推理用大模型。上下文:分块+检索而非硬塞 PDF。输出上限:批任务限 max_tokens。缓存:可安全缓存的 system 与检索片段。Agent:减少 tool 轮次。
7 天优化冲刺
基线 P95 与 token spend → 找最贵 3 条路径 → 加路由或 RAG → 复测 → runbook 写清模型 ID。单路径优化后再比厂商。
在 Swift Horse 上的下一步
定价 → SDK → 编程选型 → /match。
常见问题
China LLM 优化指什么?
在保持质量前提下降延迟、token 与成本的工程手段——路由、RAG、缓存与上限。
哪个国产模型最容易优化成本?
看负载——DeepSeek 常在编程 $/任务领先;Qwen/GLM 在其他轴更强。用 trace 度量。
优化能替代选型吗?
不能——在已按场景筛出的短名单内优化。见 china-ai-llm-guide-2026。
这是某一家厂商的调参文档吗?
否——Swift Horse 厂商无关指南;限制以各 API 控制台为准。