DeepSeek 发布 V3 大模型:671B MoE 基座,性能对标 GPT-4o 与 Claude 3.5
2024 年 12 月 26 日,DeepSeek 发布 671B 参数的 MoE 基座模型 DeepSeek-V3,单 token 激活约 37B,新增多 token 预测并采用 FP8 混合精度训练,性能对标 GPT-4o 与 Claude 3.5 Sonnet,并以极低训练成本引发业界关注。
2024 年 12 月 26 日,
DeepSeek 发布
图:DeepSeek 官网对话界面。V3 在 14.8T tokens 多语言语料上预训练,采用 FP8 混合精度并在 H800 集群上训练,官方披露总训练成本约 557.6 万美元(约 278.8 万 GPU 小时)。
版本速览
| 项目 | 内容 | |
版权声明:本文内容来自
DeepSeek 官方
。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。
用户评价