本文要点

POC 是难推理或编程、且在意调用成本时,选 DeepSeek-V4-Pro。需要同样的 100 万 token 窗口和 384K 最大输出、但请求量更高时,选 DeepSeek-V4-Flash。需要把思维链展示出来做数学和逻辑时,选 DeepSeek-R1。DeepSeek-V3 仍是更早的高性价比系列;本目录未公开它的参数量和上下文长度。

可以引用的公开规格

DeepSeek-V4-Pro:总参数 1.6 万亿,每次推理激活约 490 亿,100 万 token 上下文,最大输出 384K。页面:/zh-CN/models/deepseek-v4-pro。DeepSeek-V4-Flash:总参数 2840 亿,激活约 130 亿,同样是 100 万上下文和 384K 最大输出。页面:/zh-CN/models/deepseek-v4-flash。两者的知识截止日期均未公开。不要凭记忆填这个空。

DeepSeek-R1 是带可见思考过程的推理模型,面向数学、代码和复杂逻辑。本页未写参数量和上下文:/zh-CN/models/deepseek-r1。更长的说明见 /zh-CN/articles/deepseek-r1-reasoning-guide-2026。

一小时对照

用同样的 10 条编程 prompt 跑 V4-Pro 和 V4-Flash。记录答案质量、工具成功率(如果用了工具)、P95 延迟和输出 token。只有需要思考过程时才加 R1。然后用 /zh-CN/articles/best-chinese-llm-2026 把胜出者和一家非 DeepSeek 模型对照。境外 API 步骤:/zh-CN/articles/deepseek-api-overseas-quickstart-2026。

常见问题

DeepSeek-V4-Pro 是什么?

本索引中的 V4 高性能版:总参数 1.6 万亿 / 激活约 490 亿,100 万上下文,最大输出 384K,面向极低调用成本下的复杂推理。

V4-Flash 有什么不同?

它是速度和成本档:总参数 2840 亿 / 激活约 130 亿,上下文和最大输出与 Pro 相同,都是 100 万和 384K。

还要用 DeepSeek-R1 吗?

产品必须展示思维链时用 R1。只需要旗舰推理、不需要展示过程时用 V4-Pro。

这些是深度求索官方规格吗?

这是 Swift Horse 收录的公开数字。签约前再核对深度求索控制台。