DeepSeek 开源 OCR-2:用"视觉因果流"重新理解长文档
DeepSeek 在 GitHub 发布新一代开源 OCR 模型 DeepSeek-OCR-2,以 Apache-2.0 协议开源,技术方案采用"Visual Causal Flow(视觉因果流)",在长文档 OCR 与复杂版面识别上较初代更优;初代项目累计已获约 2.37 万星标。
在大模型军备竞赛的喧嚣之外,
DeepSeek 用一次低调的开源把视线拉回了"文档智能"这条最贴近生产的地面战场。DeepSeek-OCR-2 于 2 月 3 日上线 GitHub,以 Apache-2.0 协议开源,技术关键词是"Visual Causal Flow(视觉因果流)"——一套对视觉信息进行更高效因果建模与压缩的新方案。
从"光学压缩"到"因果流"
初代 DeepSeek-OCR 的技术亮点是"Contexts Optical Compression(上下文光学压缩)",自开源以来累计获得约 23,700 星标、2,187 forks,是当前最受欢迎的 OCR 开源项目之一。二代在它的基础上演进:强调对视觉信息更高效的因果建模与压缩,在长文档 OCR、复杂版面识别等场景表现更佳。截至 2026 年年中,仓库已累计约 3,200 星标并持续迭代。
开源不是零散动作,而是一条技术栈
把 DeepSeek 过去一年的开源动作摊开看,OCR 只是拼图一角:推理基础设施方面,DeepEP(专家并行通信)、DeepGEMM(GPU BLAS 内核)、FlashMLA(多头潜在注意力内核)、3FS(AI 训练/推理分布式文件系统)先后开源,覆盖"算法-内核-通信-存储"全链路。这种"不仅给权重、更给工程"的策略,正在构筑 DeepSeek 在开源社区独特的信任资产。
从行业视角看,OCR 看似"老赛道",实则是 RAG、文档智能与多模态落地的入口级能力。DeepSeek 以 Apache-2.0 协议而非更宽松的商业许可开源,既维护了生态影响力,也为商业闭源留了余地。对国内做文档解析、知识库、票据识别的团队而言,DeepSeek-OCR-2 提供了一个可直接商用的中文场景友好底座——这恰恰是不少海外 OCR 模型在中文长文档上翻车的短板。
后续值得跟踪的几个方向:
- DeepSeek-OCR-2 在中文长文档基准上的表现:官方未披露完整 benchmark,社区实测是判断成色的关键。
- 与多模态模型(Qwen2.5-VL 等)的协同:OCR 与视觉语言模型的边界正在模糊,DeepSeek 是否会顺势推出配套 VLM。
- "视觉因果流"能否外溢到视频理解:同一套因果建模思路在时间维度的延伸值得观察。
- 开源协议与商业化平衡:Apache-2.0 后续是否引入更严格条款,将影响企业采用决策。
用户评价