Jina AI ReaderLM-v2 强化发布:HTML 到 Markdown/JSON 的转换质量再上台阶,Agent 检索底座升级

Jina AI 在 Reader 中强化 HTML 到 Markdown/JSON 的转换质量并扩展搜索能力,ReaderLM-v2 让网页内容更可靠地成为 LLM 与 Agent 的输入。

Jina AI ReaderLM-v2 强化发布:HTML 到 Markdown/JSON 的转换质量再上台阶,Agent 检索底座升级

Jina AI 在 2026 年 6 月发布 ReaderLM-v2 强化版,核心是把 Reader 中 HTML 到 Markdown/JSON 的转换质量再提升一个台阶,并持续扩展搜索相关能力。作为以 r.jina.ai 与 s.jina.ai 为核心的 Agent 检索底座,这版更新直接关系到 RAG 系统与 AI Agent 获取网页信息的可靠性与保真度。

  • 转换质量强化:ReaderLM-v2 提升 HTML 到 Markdown/JSON 的转换准确度,减少信息丢失与结构错乱。
  • 搜索能力扩展:Search 端点持续增强,支撑 Agent 的实时信息获取。
  • 组件化检索底座:Reader、Embeddings、Reranker、DeepSearch 等能力可独立调用、自由组合。
  • 面向 LLM 友好输出:把网页内容转为 LLM 友好文本,是 RAG 与 Agent 的关键预处理层。

版本背景

Jina AI 的定位不是又一个向量数据库或搜索引擎,而是一套以"组件化检索"为核心理念的开源搜索基础设施层。它将网页读取(Reader)、语义向量化(Embeddings)、相关性重排(Reranker)、多模态理解与深度搜索推理(DeepSearch)拆解为可独立调用、可自由组合的 API 模块。Reader API 自 2023-01 公开 r.jina.ai URL 读取能力以来持续演进,ReaderLM-v2 则是这一演进中转换质量的关键升级。

本次版本亮点

ReaderLM-v2 转换强化

  • HTML 到 Markdown:更准确地还原网页结构,去除导航、广告等噪音,保留正文语义。
  • HTML 到 JSON:结构化提取页面信息,便于程序化消费与数据入库。
  • 保真度提升:表格、代码块、列表等复杂结构在转换中更少失真,减少下游解析成本。

搜索与检索组件

  • s.jina.ai 搜索:面向 Agent 的实时搜索能力,与 Reader 协同完成"搜索—读取"闭环。
  • Embeddings 与 Reranker:语义向量化与相关性重排,提升检索质量。
  • DeepSearch:深度搜索推理能力,支撑多步检索场景。

对开发者的意义

从行业视角看,Jina AI 的 ReaderLM-v2 升级指向 Agent 基建的确定性需求:网页信息是 Agent 最重要的外部数据源之一,而"网页到结构化文本"的转换质量直接决定 RAG 应用的答案质量。对国内开发者而言,这意味着构建文档问答、信息聚合与 Agent 应用时,可以先把"可靠的网页读取"作为基础设施打通,再叠加向量化与重排。

对构建 LlamaIndex 等 RAG 框架应用的团队来说,Reader 提供了"网页加载器"的高质量实现,可显著减少自建爬取与清洗的工作量。

上手建议

  • RAG 应用:用 Reader 端点替代自建网页解析,验证转换质量对答案准确率的提升。
  • Agent 开发:组合 s.jina.ai 搜索与 Reader,构建"实时搜索—网页读取—结构化输出"的 Agent 信息链路。
  • 评估标准:以"结构化转换的准确率"与"检索结果的相关性"两个维度衡量底座质量。

后续值得留意的方向

  1. 转换质量的边界:复杂动态页面、反爬页面与多语言内容的转换表现。
  2. 搜索能力的实时性:对实时性与地区差异的覆盖,影响 Agent 落地范围。
  3. 与国产检索组件的对比:中文网页与中文搜索场景下,与国内检索方案的实测对比。
版权声明:本文内容来自 Jina AI 官方发布 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...