本文要点

国产 RAG 分 embedding(检索)与 chat(生成)。语料偏中文常看 Qwen/GLM 路径;维度与限流以控制台为准。本文在 rag-selection 选型之上补搭建步骤,非又一榜单。

最小 RAG 流水线

入库 → 分块(500–1k token 重叠)→ 向量化 → 存储 → 取 top-k → 注入 chat prompt → 主模型生成。记录引用与失败。配合 optimization 指南。

厂商提示

Qwen/DashScope 等提供 embedding 端点——与对话 ID 分开确认。勿假设与 OpenAI embedding 完全一致——测中英 query-doc 对。敏感文档见合规指南。

在 Swift Horse 上的下一步

RAG 选型 → SDK → JSON 指南。

常见问题

哪个国产 embedding 最好?

无 universal 答案——用双语语料评 recall@k。

能用 OpenAI embedding + 国产 chat 吗?

混合栈可以——注意语言对齐与向量存储合规。

RAG 还是 Kimi 长上下文?

大语料 RAG 更省;少量超大文档可看 Kimi 长上下文。

这是官方 embedding 文档吗?

否——Swift Horse 独立搭建指南。