DeepSeek 发布 V3.1:引入混合推理架构,思考/非思考双模式一键切换

2025 年 8 月 21 日,DeepSeek 以 MIT 协议发布 V3.1,采用思考/非思考双模式混合架构,在 V3 基础上额外训练超 800B tokens,在 SWE-bench、Terminal-bench 等基准上较前代大幅提升,并增强 Agent 能力。

2025 年 8 月 21 日,DeepSeek 以 MIT 协议发布 ,带来混合推理架构。

DeepSeek-V3.1 混合推理架构双模式发布概览 *图:DeepSeek 官网对话界面。V3.1 在 V3 基础上额外训练超 800B tokens,采用思考/非思考双模式混合架构,在 SWE-bench、Terminal-bench 等基准上较前代提升逾 40%,并于 9 月 22 日更新为 V3.1-Terminus。* ## 版本速览

| 项目 | 内容 | |

版权声明:本文内容来自 DeepSeek 官方 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...