DeepSeek 发布 V2 开源大模型:首创 MLA 架构,236B MoE 主打高性价比
2024 年 5 月,DeepSeek 发布 DeepSeek-V2 系列开源大模型,首次引入多头潜在注意力(MLA)与 MoE 稀疏架构,236B 总参数、单 token 激活约 21B,以极低推理成本对标主流模型,奠定后续 V3、R1 的高效路线。
2024 年 5 月,
DeepSeek 发布
图:DeepSeek 官网首页与对话入口。V2 预训练语料约 8.1T tokens,采用 YaRN 将上下文从 4K 扩展至 128K,并以 MLA 压缩 KV 缓存,据《金融时报》报道其每百万输出 token 价格低至 2 元人民币。
版本速览
| 项目 | 内容 | |
版权声明:本文内容来自
DeepSeek 官方
。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。
用户评价