ByteDance Dolphin 免费

-

ByteDance Dolphin 是字节跳动开源的文档解析模型,围绕 PDF、扫描件和复杂版面文档做结构识别、内容提取和 Markdown/JSON 输出,核心优势是两阶段文档理解与并行解析效率。

ByteDance Dolphin 产品界面

ByteDance Dolphin

核心参数与统计

【一句话简评】:它不是“又一个 OCR 模型”,而是把版面理解、阅读顺序、元素裁剪和内容解析拆成两阶段执行的文档结构化引擎。

【宣传核验】:官方仓库把 Dolphin-v2 描述成 universal document parsing model,这个表述并不算夸张,因为它确实明确区分 digital-born 和 photographed 两类文档,并针对不同文档路径采取不同解析策略。但“通用”不等于“无脑通吃”,复杂扫描件、跨页逻辑和极端表格仍然需要额外验证。

项目 公开信息
当前主线 Dolphin-v2
参数规模 v1/v1.5 为 0.3B,v2 升级到 3B
论文状态 ACL 2025 接收
开源入口 GitHub、Hugging Face、arXiv
支持输出 JSON、Markdown、元素级结果
关键能力 布局分析、阅读顺序预测、表格/公式/代码解析、多页 PDF
公开性能 OmniDocBench 上 Dolphin-v2 指标显著优于 v1.5 和 v1
社区规模 GitHub 约 9k stars、772 forks

专家视点:Dolphin 值得看的不是“比谁分高”,而是它把“先理解版面,再解析内容”做成了工程路线。这直接决定它在复杂文档场景里,比只做端到端 OCR 的方案更容易得到结构化、可下游消费的结果。

用户与市场认可

GitHub 约 9k stars、772 forks,说明 Dolphin 已经获得明显的开发者关注。对于一个文档解析开源模型来说,这个体量已经足够说明它不是实验室内部临时项目,而是会被真实团队试用和二次集成的工具链组件。

用户与市场认可:官方还同步发布了 ACL 论文Hugging Face 模型卡和 demo,意味着它既面向研究者,也面向工程团队。尤其对做文档数字化、知识库清洗、票据/报告处理的团队,这类“能落成 JSON/Markdown”的模型比单纯识别文字更实用。

宣传核验:如果把它理解成“上来就替代所有商业 OCR 套件”,这显然过头;但如果把它定位成开源文档解析中台的核心引擎,官方给出的能力边界是可信的。

隐性收益:相比只返回整页纯文本的 OCR,Dolphin 的结构化输出可以显著减少后处理规则和人工清洗成本,这在长文档、表格和公式场景特别明显。

成本优势

免费的真相:Dolphin 本体开源免费,但免费不等于低门槛。v2 升到 3B 后,虽然效果更强,推理资源、模型下载和部署复杂度也会上升。对于只做轻量 OCR 的团队,真正要比较的是“总系统成本”而不是许可证价格。

成本层 公开情况 实际含义
C 端/个人 无独立消费产品 更像研发组件,而不是普通用户 App
开发者/API 开源免费,可自行部署 成本落在算力、模型下载、推理框架和维护
企业 无公开商业套餐 若进生产,需自行补权限、审计、弹性和 SLA

隐性成本:第一是模型与推理框架选择。vLLM、TensorRT-LLM、Transformers 方案各有工程权衡。第二是文档前处理成本,图片质量差、旋转、阴影和多语言混排都会放大误差。第三是下游 schema 对齐,能识别出结构不等于能直接无损写入业务系统。

隐性收益:如果企业现在还在用“OCR 识别全文 + 一堆规则硬拆”的老办法,Dolphin 这类结构化模型最能省的就是规则维护成本和人工返工成本。

主要功能

  • 两阶段文档解析:先分类和做版面分析,再按元素或整页解析内容。
  • 阅读顺序预测:不仅识别元素,还试图恢复自然阅读顺序,这对 Markdown 输出特别重要。
  • 多粒度解析:支持 page-level 和 element-level 两类处理方式。
  • 复杂元素抽取:覆盖文本、表格、公式、代码等元素。
  • 多页 PDF 支持:官方 changelog 已公开多页 PDF 解析能力。
  • 推理加速适配:vLLM、TensorRT-LLM 等支持说明它面向真实部署,而非纯论文复现。

专家视点:这里最关键的隐藏联动,是“布局 -> 元素裁剪 -> 专门提示词解析”。它意味着不同元素不再共用同一解析语气和输出模版,这正是复杂文档质量提升的核心来源。

模型与版本演进

首发阶段

Dolphin 1.0:2025-05-20 公开预训练模型与推理代码,奠定了开源入口。

轻量增强阶段

Dolphin-1.5:2025-10-16 在保持 0.3B 架构的情况下提升解析表现,说明团队先把“轻量可用”打磨到位。

能力扩展阶段

Dolphin-v2:2025-12-12 升级到 3B,新增 21 元素检测、属性提取、拍照文档能力、公式和代码专门解析。这是从“轻量实用”走向“更通用、更强结构化”的关键版本。

当前限制:仓库无 GitHub Releases 机制,版本演进更多依赖 README changelog,适合接入前自行钉住 commit 或分支,而不是盲跟 master。

技术优势

ByteDance Dolphin 属于【RAG / 知识库 / 数据中台】和文档解析基础组件的交叉类型,这里以其主交付形态“文档解析基础设施”来评估。

数据边界:官方明确同时考虑 digital-born 与 photographed 文档,说明它不只盯 PDF 文本层,而是面向更复杂的现实文档图像。优势在于能处理扫描件和拍照文档;限制在于极端模糊、严重透视畸变、低分辨率扫描仍会显著掉质。

召回痛点:文档解析的真正难点不只在识别字符,而在多语种混排、专业术语、表格跨页、公式嵌套和版面断裂。Dolphin 在这些有节虽然比传统 OCR 更强,但一旦进入 RAG 或知识库链路,仍然建议配合 Hybrid Search、metadata 过滤、页面级与元素级混合 chunking 来减少检索偏差。

安全合规:官方公开仓库未披露 RBAC、租户隔离、数据是否用于二次训练等企业治理信息。开源自部署最大的好处是数据可控,最大的代价也是这些治理能力要自己补。

如何使用

官方仓库已经给出最核心的安装与推理路径。

git clone https://github.com/ByteDance/Dolphin.git
cd Dolphin
pip install -r requirements.txt
git lfs install
git clone https://huggingface.co/ByteDance/Dolphin-v2 ./hf_model
python demo_page.py --model_path ./hf_model --save_dir ./results --input_path ./demo/page_imgs/page_1.png

入口说明

使用方式 适合对象 说明
demo_page.py 做整页解析的团队 直接输出页面级结构结果
demo_element.py 做精细元素抽取的团队 适合表格、公式、代码单独处理
demo_layout.py 做版面理解与预分析的团队 适合前置版面诊断

人机协作边界:批量抽取可以自动化,但高价值合同、医学文档、财务报表和复杂学术 PDF 上线前仍要做人审抽检,重点盯表格对齐、公式遗漏和跨页关系断裂。

产品定价

公开定价不存在,因为它是开源模型,不是现成 SaaS。

C 端/个人:无面向普通用户的购买入口。

开发者/API:最主要成本是模型下载、推理部署、显存和吞吐优化。

企业:如果要做内部解析平台,除了推理成本,还要把权限、缓存、任务队列、结果校验和日志治理一起算进去。

免费的真相:开源节省的是许可费,不是系统成本。文档解析一旦走到生产有境,算力和数据治理永远绕不过去。

应用场景

  • 知识库入库前处理:把 PDF、报告和论文先结构化,再送入检索和问答链路。
  • 学术文档与公式解析:尤其适合公式、表格和文本混排的科研材料。
  • 企业文档数字化:合同、技术文档、业务报告的结构化抽取。
  • 多页 PDF 批处理:把大量历史文档转为可索引、可下游消费的结构数据。

降维打击场景:当团队已经因为表格、公式和阅读顺序问题被传统 OCR 折磨得很严重时,用它会有非常明显的结构质量提升。

当前限制:如果企业只需要普通票据 OCR 或单列文档文本抽取,它未必是最划算的选择,因为工程复杂度更高。

适用人群

  • 做知识库/RAG 的平台团队:需要高质量文档预处理。
  • 文档 AI 产品团队:想把 OCR 从纯文本识别升级到结构理解。
  • 研究与教育团队:处理论文、教材、试卷和带公式资料时更有价值。

劝退场景

  • 只想低门槛开箱即用的人:它更像模型组件,不是现成 SaaS。
  • 没有 GPU 或模型部署经验的团队:部署与加速配置会带来不小门槛。
  • 把它当“万能无错 OCR”的团队:复杂文档解析仍然需要抽检和下游纠偏。

总结与展望

ByteDance Dolphin 的竞争力,在于它把文档理解从“整页识字”推进到“结构先行、内容后解”。这对知识库、企业文档和研究材料处理非常关键,因为真正决定下游可用性的往往不是字符准确率,而是表格、公式、代码块和阅读顺序是否仍然保真。

【采购/采用风险评估】:采用前最该评估的是你的文档类型,而不是只看榜单分数。如果大量文档是复杂学术 PDF、多页报表、混合表格与公式,Dolphin 很有价值;如果只是轻量文字 OCR,则可能出现“能力过剩、工程过重”的问题。后续值得继续观察的是 v2 后续推理加速生态、对拍照文档的稳定性,以及社区围绕 schema 标准化和企业化治理的补位速度。

版本信息

  • Dolphin-v2 :官方仓库 changelog 公开的最新主线版本,升级到 3B 参数,增加 21 类元素检测、属性字段提取、专门的公式与代码解析,以及更强的拍照文档处理能力。
  • Dolphin-1.5 :在保持 0.3B 轻量架构的同时显著提升解析效果,是从首发版本走向实用化的重要节点。
  • Dolphin 1.0 :官方首次公开预训练模型与推理代码,建立完整的文档解析开源入口。

用户评价

  • 加载评价中...