核心规格

厂商deepseek
版本v3
发布日期2024-12-26
上下文窗口64000 tokens
输入模态text
输出模态text
许可DeepSeek License
文档https://api-docs.deepseek.com/

基准测试表现

基准得分单位评测日期备注来源
MMLU88.5%2024-12-265-shot查看
HUMANEVAL82.6pass@12024-12-26查看
GSM8K89.3%2024-12-260-shot CoT查看
MATH61.6%2024-12-260-shot CoT查看
BBH84.9%2024-12-263-shot CoT查看

定价

项目价格币种
输入$0.27 / MtokUSD
输出$1.1 / MtokUSD
缓存读$0.07 / MtokUSD
缓存写$0.27 / MtokUSD

数据来源: https://api-docs.deepseek.com/quick_start/pricing · 截至 2024-12-26

合规性

  • 数据驻留: CN
  • SOC2: ✗
  • HIPAA: ✗
  • GDPR: ✗
  • ISO 27001: ✗

DeepSeek V3

模型概述

DeepSeek V3 是 DeepSeek 于 2024 年 12 月 26 日发布的开源权重混合专家旗舰模型。架构总参数 671B、每 token 激活 37B,训练数据达 14.8 万亿 token。DeepSeek V3 以极低的价格提供前沿级性能——API 定价 $0.27/$1.10 每百万 token,约为同级闭源旗舰的十分之一。模型在 MMLU(88.5 vs 88.7)与 BBH(84.9 vs 83.1)上与 GPT-4o 接近或反超,支持 64K 上下文窗口。模型以较为宽松的 DeepSeek License 发布,迅速成为成本敏感型生产部署的首选,尤其在中文与中英双语场景中。模型还引入了多头潜在注意力(MLA),显著提升长上下文推理效率。

核心规格

属性数值
厂商DeepSeek
版本v3
发布日期2024-12-26
上下文窗口64,000 tokens
输入模态文本
输出模态文本
许可证DeepSeek License
文档地址https://api-docs.deepseek.com/

基准测试表现

基准得分单位备注
MMLU88.5%5-shot
HumanEval82.6pass@1
GSM8K89.3%0-shot CoT
MATH61.6%0-shot CoT
BBH84.9%3-shot CoT

定价

档位价格(每百万 token)
输入$0.27
输出$1.10
缓存读取$0.07
缓存写入$0.27

定价来源:https://api-docs.deepseek.com/quick_start/pricing (截至 2024-12-26)。DeepSeek License 亦允许自托管。

优势

  • 前沿级性能,成本约为闭源旗舰的 10%。
  • 开源权重,可自托管与定制。
  • 中英文双语能力突出。
  • 高效 MoE 架构 + MLA,长上下文推理效率高。

劣势

  • 64K 上下文窗口短于 Llama 3.1 405B(128K)与 Qwen2.5 72B(131K)。
  • 厂商生态与工具链成熟度不及 Meta/Mistral 等老牌开源厂商。
  • 671B 参数体量使自托管对 GPU 资源要求较高。

适用场景

  • 高吞吐生产部署,API 成本是首要约束。
  • 中英双语客服与内容生成。
  • 需要 MMLU/BBH 级能力的推理密集型应用。
  • 需要权重级访问前沿 MoE 模型的研究项目。

参考文献