本文要点
国产 RAG 分 embedding(检索)与 chat(生成)。语料偏中文常看 Qwen/GLM 路径;维度与限流以控制台为准。本文在 rag-selection 选型之上补搭建步骤,非又一榜单。
最小 RAG 流水线
入库 → 分块(500–1k token 重叠)→ 向量化 → 存储 → 取 top-k → 注入 chat prompt → 主模型生成。记录引用与失败。配合 optimization 指南。
厂商提示
Qwen/DashScope 等提供 embedding 端点——与对话 ID 分开确认。勿假设与 OpenAI embedding 完全一致——测中英 query-doc 对。敏感文档见合规指南。
在 Swift Horse 上的下一步
RAG 选型 → SDK → JSON 指南。
常见问题
哪个国产 embedding 最好?
无 universal 答案——用双语语料评 recall@k。
能用 OpenAI embedding + 国产 chat 吗?
混合栈可以——注意语言对齐与向量存储合规。
RAG 还是 Kimi 长上下文?
大语料 RAG 更省;少量超大文档可看 Kimi 长上下文。
这是官方 embedding 文档吗?
否——Swift Horse 独立搭建指南。