DeepSeek 发布 V2 开源大模型:首创 MLA 架构,236B MoE 主打高性价比

2024 年 5 月,DeepSeek 发布 DeepSeek-V2 系列开源大模型,首次引入多头潜在注意力(MLA)与 MoE 稀疏架构,236B 总参数、单 token 激活约 21B,以极低推理成本对标主流模型,奠定后续 V3、R1 的高效路线。

2024 年 5 月,DeepSeek 发布 系列开源大模型。作为 AI 智能助手 赛道的代表性开源模型,V2 首次将多头潜在注意力(MLA)与 Mixture of Experts(MoE)结合,成为 DeepSeek 系列演进的关键技术里程碑。

DeepSeek-V2 开源大模型 MLA 与 MoE 架构概览

图:DeepSeek 官网首页与对话入口。V2 预训练语料约 8.1T tokens,采用 YaRN 将上下文从 4K 扩展至 128K,并以 MLA 压缩 KV 缓存,据《金融时报》报道其每百万输出 token 价格低至 2 元人民币。

版本速览

| 项目 | 内容 | |

版权声明:本文内容来自 DeepSeek 官方 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...