DeepSeek 发布 V3 大模型:671B MoE 基座,性能对标 GPT-4o 与 Claude 3.5

2024 年 12 月 26 日,DeepSeek 发布 671B 参数的 MoE 基座模型 DeepSeek-V3,单 token 激活约 37B,新增多 token 预测并采用 FP8 混合精度训练,性能对标 GPT-4o 与 Claude 3.5 Sonnet,并以极低训练成本引发业界关注。

2024 年 12 月 26 日,DeepSeek 发布 ,一款 671B 参数的 MoE 基座模型,奠定了后续系列的能力基础。

DeepSeek-V3 671B MoE 开源大模型发布概览

图:DeepSeek 官网对话界面。V3 在 14.8T tokens 多语言语料上预训练,采用 FP8 混合精度并在 H800 集群上训练,官方披露总训练成本约 557.6 万美元(约 278.8 万 GPU 小时)。

版本速览

| 项目 | 内容 | |

版权声明:本文内容来自 DeepSeek 官方 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...