DeepSeek
免费
DeepSeek是幻方量化旗下深度求索自主研发的开源大模型和AI智能助手,专注于通用人工智能(AGI)底层模型与技术研发。推出了 DeepSeek-V3 和 DeepSeek-R1 等多个开源模型,分别对标 GPT-4o 和 OpenAI o1,在推理、数学和编程能力方面表现出色。首个以极低成本实现顶级推理能力的开源模型,应用覆盖智能对话、文本生成、代码生成、联网搜索、深度思考等领域。
DeepSeek — 深度求索开源大模型与 API 平台
核心参数与统计
DeepSeek 最新 V4 系列在同一架构下提供了两条产品线:以性能为核心的 Pro 版和以成本效率为核心的 Flash 版。二者共享 1M token 上下文窗口与 384K token 最大输出,但在参数规模、激活密度和训练数据量上拉开梯度,形成互补的覆盖策略。
| 项目 | 规格 |
|---|---|
| 模型/API 名称 | DeepSeek V4 系列 |
| 开发方 | 杭州深度求索人工智能基础技术研究有限公司 |
| 产品类型 | AI 模型 / API |
| 交付形态 | API / Web 对话(chat.deepseek.com)/ iOS & Android App / 开源模型权重 |
| 上下文长度 | 1M tokens |
| 最大输出 | 384K tokens |
| 参数规模 | Pro: 1.6T 总参(激活 ~49B)/ Flash: 284B 总参(激活 ~13B) |
| 架构 | 混合专家模型(MoE)+ 混合注意力(Hybrid Attention) |
| 支持模态 | 文本、代码、图片(基础 VLM)、文件(PDF/Word/Excel/PPT/TXT) |
| 支持语言 | 中文、英文 |
| 安全框架 | 开源 + 内容过滤 |
| 定价模式 | C 端完全免费;API 按量极低价 |
| 开源许可 | MIT |
| TTFT(参考) | V4-Flash ~200-400ms / V4-Pro ~400-800ms(第三方抽样) |
效率提升的实际含义:处理 1M 上下文时,V4-Pro 的算力需求(FLOPs)仅为上一代 V3.2 的 27%,KV 缓存占用仅 10%;V4-Flash 两项指标更低至 10% 和 7%。这意味着在相同硬件条件下,V4 系列可以承载更长对话、更大文档分析而不会触及显存天花板。对于高频 API 调用者,这直接反映为更低的单位成本和更少的超时重试。
推理强度三档设计:提供 Non-think(直出模式)、Think High(常规深度思考)和 Think Max(最大深度思考)三级推理模式。直出模式适合信息检索、翻译等对延迟敏感的任务;深度思考模式在数学证明、竞赛编程、逻辑推理等需要逐步展开链式推理的场景中释放上限能力。Think Max 的输出 token 量约为 Non-think 的 3-8 倍,API 调用时需提前评估成本冲击。
用户与市场认可
DeepSeek 的市场声量呈现"C 端话题起伏、B 端持续渗透"的双轨格局。
C 端市场:2025 年春节期间,DeepSeek 日活跃用户一度突破 3,000 万,成为史上最快达成该里程碑的 AI 应用,下载量超越豆包登顶免费榜。但随后 APP 活跃度出现回落,部分用户反馈模型存在"幻觉"输出和"AI 味儿"过重的问题。核心用户画像偏向 25-44 岁高线城市职场人群。
B 端市场:据公开信息,接入 DeepSeek 模型的企业已超过 3 万家,覆盖金融、医疗、工业、政务等 12 个行业领域。中国银联、国家管网集团等国字号企业已将模型推入营销、智能调控、管道安全审核等核心业务流程。B 端采用的核心驱动力是 API 价格相比竞品低 10-100 倍的成本优势和开源自托管的合规灵活性。
行业基准表现:第三方评测显示,V4-Pro 在 Agent 能力维度达到开源模型最佳水平,体验优于 Claude Sonnet 4.5,交付质量接近 Claude Opus 4.6 非思考模式;推理性能超越所有已公开评测的开源模型,在数学、STEM 和竞赛型代码等任务上比肩世界顶级闭源模型。但在世界知识覆盖面上仍稍逊于 Gemini-3.1-Pro。
成本优势
DeepSeek 的成本优势不是阶段性促销,而是通过架构创新和技术工程化实现的系统性成本下降,正在把大模型的调用价格从"每百万 token 数十美元"推向"每百万 token 几元人民币"的量级。
C 端:完全免费且不限量。网页版和官方 App 对所有用户免费开放,无使用次数、无对话轮次限制。
API 定价深度对比:
| 服务类型 | 组件 | DeepSeek-V4-Flash | DeepSeek-V4-Pro (2.5折优惠) | GPT-5.5 Pro(参考价) |
|---|---|---|---|---|
| 输入 | 缓存命中 | 0.02 元/百万 token | 0.025 元/百万 token | ~3.4 元/百万 token |
| 缓存未命中 | 1 元/百万 token | 3 元/百万 token | ~210 元/百万 token($30) | |
| 输出 | — | 2 元/百万 token | 6 元/百万 token | ~1,260 元/百万 token($180) |
成本优势的链式影响:早期 V2 训练成本仅 460 万美元,相较 GPT-4(约 7,800 万)和 GPT-4o(约 1.2 亿),优势达两个数量级。低训练成本使 DeepSeek 可以 2-3 个月为周期推送重大版本更新。
企业/私有化部署成本考量:License 层面开源(MIT),基础设施成本需自担。V4-Flash 单卡 A100-80G 即可运行推理,高并发场景仍需多卡集群。企业总成本应综合对比"API 年费 vs 私有化部署三年 TCO",并考虑模型版本迭代带来的更新成本。
成本推演详细场景:以一个日均处理 200 万输入 token + 80 万输出 token 的 SaaS 应用为例(如 AI 客服、内容生成平台),使用不同模型的月成本对比如下:
| 场景 | DeepSeek V4-Flash | DeepSeek V4-Pro | GPT-5.5 Pro | Claude Sonnet 4.5 |
|---|---|---|---|---|
| 月输入 token 量 | 6,000 万 | 6,000 万 | 6,000 万 | 6,000 万 |
| 月输出 token 量 | 2,400 万 | 2,400 万 | 2,400 万 | 2,400 万 |
| 月 API 费用(估算) | ~84 元 | ~252 元 | ~$7,200(约 5 万元) | ~$1,200(约 8,400 元) |
| 年成本 | ~1,008 元 | ~3,024 元 | ~60 万元 | ~10 万元 |
| 相对 DeepSeek 倍数 | 1x | 3x | ~600x | ~100x |
以上为基于公开定价的估算,实际费用因缓存命中率、批量折扣和地区差异而浮动。此对比不考虑输出质量差异——如果应用场景需要 GPT-5.5 Pro 级别的创意质量,仅用成本对比做选型决策可能误导。
风险披露:C 端免费模式的可持续性取决于广告、企业服务和 API 收入的交叉补贴能力。如果补贴策略调整,可能影响 C 端服务的可用性和响应质量。API 频控和 SLA 透明度不够,对于关键业务场景可能构成风险。高频场景下频控限制和阶梯定价需提前与商务沟通。此外,DeepSeek 作为中国公司,其 API 服务可能受限于跨境网络延迟和合规要求,海外开发者需评估区域加速节点可用性。
主要功能
-
超长上下文(1M tokens):V4 系列最具差异化的能力。可一次性处理《三体》三部曲体量的文本,适用于超长文档分析、大规模代码库审计和复杂对话历史全局理解。限制披露:上下文越长,推理延迟和 KV 缓存开销越大。建议日常任务使用 128K 以内上下文窗口,真正需要跨章节关联的场景再启用 1M 模式。1M 上下文的极端场景下首字延迟可能达到 3-5 秒。
-
联网搜索:突破静态训练数据知识截止限制,实时获取最新资讯。搜索结果作为上下文注入模型推理过程。V4 系列引用准确性较 V3 有改善,但仍建议对关键事实做二次核验。
-
文件上传与多模态处理:支持 PDF、Word、Excel、PPT、TXT 及图片。表格类 PDF 和扫描件主要依赖 OCR 后文本理解,复杂表格结构还原能力仍有提升空间。图片理解适用于图表解读和物体识别,不适合精细版面布局还原。
-
智能 Agent 能力:开源模型中 Agent 能力的 SOTA 水平,支持 Function Calling、多步骤任务规划和工作流编排。Agent 场景推荐使用 Think High 模式平衡规划质量与响应速度。
-
思维链推理(Thinking Mode):三档可调推理深度。Non-think 适合确定性任务;Think High 适合日常推理;Think Max 适合数学证明和竞赛编程等需要穷尽推理路径的场景。
-
上下文缓存(Context Caching):V4 系列支持服务端缓存,重复相同前缀内容时大幅降低延迟和成本。适合 system prompt 固定的生产场景,动态内容频繁变更时命中率下降。
模型与版本演进
V2 系列:MoE 架构奠基(2024-05 至 2024-12)
- DeepSeek-V2(2024-05):正式引入 MoE 架构
- DeepSeek-V2.5(2024-09):融合 Chat 与 Coder 能力
- DeepSeek-V2.5-1210(2024-12):稳定性与任务通用性提升
V3 与 R1 系列:推理强化与规模跃升(2024-12 至 2025-12)
- DeepSeek-V3(2024-12-26):671B MoE 基座模型,多 token 预测(MTP)
- DeepSeek-R1(2025-01-20):推理特化旗舰,RL 驱动,引发纯 RL 推理路线讨论
- DeepSeek-V3-0324(2025-03-24):推理、代码与中文写作通用优化
- DeepSeek-R1-0528(2025-05-28):AIME 2025 显著提升,更高效 RL 管线
- DeepSeek-V3.1(2025-08-21):混合推理架构,128K 上下文
- DeepSeek-V3.1-Terminus(2025-09-22):语言一致性 + Agent 能力优化
- DeepSeek-V3.2-Exp(2025-09-29):稀疏注意力实验版本
- DeepSeek-V3.2(2025-12-01):知识库更新至 2025 年 5 月
V4 系列:架构重构与超长上下文(2026-04 至今)
- DeepSeek-V4-Pro Preview(2026-04-24):1.6T 总参(激活 49B),混合注意力架构
- DeepSeek-V4-Flash Preview(2026-04-24):284B 总参(激活 13B),单卡 A100 可运行
API 端点映射
| 时间 | deepseek-chat | deepseek-reasoner |
|---|---|---|
| 2026-04-24起 | 指向 V4-Flash 非思考 | 指向 V4-Flash 思考 |
DeepSeek 公司于 2023-07 成立,2024-01 发布首个大模型 DeepSeek LLM。
技术优势
-
MoE 创新路由:V4-Pro 总参数 1.6T 但每次推理仅激活约 49B(~3% 激活率)。推理时只用"少量专家组合"回答问题,海量参数存储更广泛的知识分布。限制披露:对于需要多领域知识交叉的长尾问题,路由策略可能遗漏相关专家,这是"世界知识"维度稍逊于闭源模型的潜在技术原因。
-
混合注意力架构(Hybrid Attention):V4 系列核心突破。通过 CSA(压缩稀疏注意力)和 HCA(重压缩注意力)配合,在 1M 超长上下文中将计算量和显存占用降至传统 full attention 的 10%-27%。之前需要 8 卡 A100 处理的超长文档,现在单卡即可运行。
-
训练效率革新:多 token 预测(MTP)训练目标提升训练信号密度;FP8 混合精度训练将显存占用和计算量降低近半;GRPO(Group Relative Policy Optimization)简化 RL 训练管线,不依赖 Critic 模型。
-
国产算力深度适配:已实现与华为昇腾 NPU 的深度协同,可在昇腾平台完成全流程训练与推理。对于有国产化替代需求的政务、金融、能源等行业具有重要意义。限制披露:昇腾 910B 上的推理吞吐和稳定性仍弱于同代 NVIDIA GPU,企业选型时需根据实际负载做压力测试。
适配边界与限制
- 推荐使用场景:代码生成与审查(竞赛编程、复杂算法)、数学与 STEM 推理、Agent 应用(Function Calling)、超长文档分析(1M 上下文)、性价比优先的通用问答。
- 不推荐场景:对输出风格有极高原创性要求的品牌文案撰写(创意写作"自然度"弱于 Claude 系列);对实时知识新鲜度要求极严的新闻摘要场景(需配合联网搜索);需要 100% 事实准确率的长尾知识问答(世界知识覆盖精度低于 Gemini-3.1-Pro)。
- 已知限制:C 端活跃度在爆发后回落,产品粘性有待验证;API 频控和 SLA 透明度不够;长上下文场景推理延迟仍需优化;C 端免费模式无 SLA 保障,高峰时段可能出现响应延迟。
如何使用
| 使用方式 | 适合人群 | 特点 | 费用 |
|---|---|---|---|
| 网页版 | 所有用户 | chat.deepseek.com,无需注册可直接对话 | 完全免费 |
| 手机 App | 移动端用户 | iOS/安卓,支持语音输入 | 完全免费 |
| API 调用 | 开发者与企业 | platform.deepseek.com 创建 API Key | 按量付费 |
| 私有化部署 | 数据合规要求高 | 开源模型 MIT 许可,自托管 | 基础设施 + 运维 |
API 快速入门(OpenAI 兼容接口):
from openai import OpenAI
client = OpenAI(api_key="<YOUR_API_KEY>", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-chat",
messages=[
{"role": "system", "content": "你是一个专业的代码助手。"},
{"role": "user", "content": "用 Python 实现快速排序。"}
],
temperature=0.7, max_tokens=4096, stream=True
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
关键参数:temperature 0.0-1.0(代码 0.1-0.3,创意 0.7-0.9);max_tokens 最高 384K;stream=True 降低首字延迟;response_format={"type":"json_object"} 强制 JSON。
产品定价
| 层级 | 价格 | 额度 / 内容 |
|---|---|---|
| C 端免费 | ¥0 | 网页版和 App 无限制使用 |
| API 免费额度 | ¥0 | 每月 10 万次调用(约 1000 万输入 token) |
| API 按量(V4-Flash) | 缓存命中 0.02 元/输出 2 元 | 每百万 token |
| API 按量(V4-Pro 2.5折) | 缓存命中 0.025 元/输出 6 元 | 每百万 token |
| 企业私有化 | 硬件 + 运维 | MIT 开源,无许可费 |
轻量应用(日均 100 万输入/50 万输出 token)使用 V4-Flash 月费约 60 元人民币。8×A100-80G 服务器月租赁约 5-8 万元。
应用场景
- 金融与风控:中国银联等国字号企业已投入营销文案生成、智能客服。R1 系列在逻辑推理上的优势适合合规审查——合同条款比对、异常交易模式识别。落地提示:金融场景对输出准确率要求极高,模型输出作为辅助参考,关键判断需设人工复核点。
- 地质勘探与能源:国家管网集团应用于地质报告信息抽取、遥感影像解译。信息抽取准确率达 83%,人工整理时间减少超 60%。落地提示:地质专业术语密集,建议在 prompt 中注入领域词汇表。
- 政务与智慧办公:公文写作辅助、拟办意见自动生成、政策文件对比分析。国产算力适配在政务场景中构成核心竞争力——可在昇腾平台完成全链路部署,满足信创合规要求。
- 软件研发与个人生产力:代码生成、单元测试补全、日志异常分析。1M 上下文窗口适合大型代码库审计。落地提示:代码生成场景推荐 Think High 模式。
适用人群
- 个人用户与科技爱好者:免费网页版或 App。不适配边界:对回答风格有强个性化要求的用户,或对隐私有极高要求的用户,需考虑付费 API 或自部署。
- 学生与研究人员:1M 上下文适合长文献综述。不适配边界:学术论文引用格式需人工逐条核验,模型输出引用可能不实。
- 开发者与初创团队:API 和开源权重可低成本集成。V4-Flash 单卡可运行降低硬件门槛。建议:先 API 验证产品概念,再按成本模型决策是否转自托管。需关注频控限制和模型版本切换兼容性。
- 企业与中大型机构:私有化部署满足数据主权和合规需求。采购前提:应有明确 AI 落地方向和可量化效率指标。采购前确认商用授权条款、GPU 支撑能力、模型版本向后兼容性。
竞品对比
| 对比维度 | DeepSeek V4 Pro | GPT-5.5 Pro | Claude Sonnet 4.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| 开发方 | 深度求索 | OpenAI | Anthropic | |
| 上下文长度 | 1M | 256K | 200K | 2M |
| 参数规模(激活) | 1.6T(49B) | 未公开 | 未公开 | 未公开 |
| 多模态 | ✅ 基础 VLM | ✅ | ❌ | ✅ |
| Agent 能力(开源模型) | SOTA | N/A(闭源) | N/A(闭源) | N/A(闭源) |
| 推理深度(数学/代码) | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 创意写作质量 | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 世界知识覆盖 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| API 定价 | ⭐⭐⭐⭐⭐(极低) | ⭐⭐(高) | ⭐⭐⭐(中等) | ⭐⭐⭐⭐(较低) |
| 开源 | ✅ MIT | ❌ | ❌ | ❌ |
| 国产算力适配 | ✅ 昇腾 | ❌ | ❌ | ❌ |
选型建议:预算极度敏感或需要自托管/国产算力的场景,DeepSeek 是最优选择;需要极致创意写作质量,优先评估 Claude;需要最大上下文窗口(2M),Gemini 是唯一选择;需要最成熟的生态和工具链,GPT 系列仍是安全牌。
总结与展望
DeepSeek 通过"架构创新驱动成本下降、开源策略扩大生态覆盖、双版本满足分层需求"的组合策略,建立了中国 AI 大模型领域中独特的竞争位势——它不是参数最多的模型,但很可能是单位算力产出最高的模型。
核心优势:V4 系列在推理、代码和 Agent 能力上达到开源模型最佳水平;API 价格较国际竞品低 10-100 倍;C 端全免费策略降低了市场教育成本;B 端 3 万+ 家企业接入验证了生产可用性;国产算力适配为政企市场渗透提供了不可替代的合规价值。
当前限制:世界知识覆盖精度仍低于顶级闭源模型;C 端活跃度在爆发后回落,产品粘性有待验证;API 频控和 SLA 透明度不够;长上下文场景推理延迟仍需优化。
后续观察点:V4 正式版发布后能否在知识精度和创意能力上进一步接近闭源竞品;API 服务是否引入更细致的频控分级和区域加速节点;开源社区生态(微调框架、部署工具、Agent 框架集成)能否形成正向飞轮。
采购/采用风险评估:个人和开发者零成本试错无实质风险。企业建议先在非关键流程验证能力,再逐步扩展。合规敏感行业私有化部署前应完成昇腾平台的性能对标测试,并将模型版本更新条款写入采购合同以规避 API 模型切换导致的业务中断风险。
版本信息
- DeepSeek-V4-Pro Preview :V4 预览版旗舰模型,1.6T 总参数(激活约49B),代表新一代基础模型能力上限。
- DeepSeek-V4-Flash Preview :V4 预览版高性价比模型,284B 总参数(激活约13B),强调经济高效与吞吐。
- DeepSeek-V3.2 :通用能力进一步增强,性能对标前沿模型,知识库更新至 2025 年 5 月。
- DeepSeek-V3.2-Exp :实验性迭代,重点验证新的稀疏注意力机制。
- DeepSeek-V3.1-Terminus :重点优化语言一致性(缓解中英文混杂)与 Agent 能力。
- DeepSeek-V3.1 :引入混合推理架构,支持快速响应与深度思考模式切换,上下文扩展至 128K。
- DeepSeek-R1-0528 :R1 重大升级,推理能力显著提升,数学基准(如 AIME 2025)表现明显增强。
- DeepSeek-V3-0324 :V3 小幅增强版,提升推理、代码生成与中文写作能力。
- DeepSeek-R1 :推理特化旗舰版本,强化学习驱动,数学、编程与逻辑推理能力突出。
- DeepSeek-V3 :671B MoE 基座模型,生成速度相较 V2 明显提升,奠定后续系列基础。
- DeepSeek-V2.5-1210 :V2.5 系列后续完善版本,融合 Chat 与 Coder 能力并持续优化。
- DeepSeek-V2.5 :V2 系列融合版,整合 V2 Chat 与 Coder V2 能力。
- DeepSeek-V2 :早期关键里程碑,正式引入 MoE 架构,为后续版本演进奠定技术路线。
用户评价