DeepSeek が V3 大型モデルをリリース: 671B MoE ベース、パフォーマンス ベンチマーク GPT-4o および Claude 3.5

2024 年 12 月 26 日、DeepSeek は、1 トークンのアクティベーションが約 37B の 671B パラメータ MoE ベース モデル DeepSeek-V3 をリリースしました。マルチトークン予測を追加し、FP8 混合精度トレーニングを採用しました。そのパフォーマンスは GPT-4o および Claude 3.5 Sonnet のベンチマークとなり、非常に低いトレーニング コストで業界の注目を集めました。

2024 年 12 月 26 日、DeepSeek は、671B パラメータ MoE 基本モデルである をリリースしました。これは、後続のシリーズの機能の基礎を築きました。

DeepSeek-V3 671B MoE オープンソース大型モデルリリース概要

※写真:DeepSeek公式サイトの対話インターフェース。 V3 は、FP8 混合精度を使用して 14.8T トークンの多言語コーパスで事前トレーニングされ、H800 クラスターでトレーニングされています。公式に開示されている総トレーニング費用は約 557 万 6000 米ドル (約 278 万 8000 GPU 時間) です。 *

バージョンの概要

プロジェクト コンテンツ
著作権:コンテンツソース ディープシーク公式 。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。

レビュー

  • レビューを読み込み中...