Nuclia(Progress Agentic RAG)

-

Nuclia(现 Progress Agentic RAG)提供 NucliaDB 内核驱动的 AI 知识层平台,支持 30+ 文件格式自动解析、语义搜索Agentic RAG 工作流与多 LLM 切换,具备 SOC 2/ISO 27001/GDPR 合规认证。核心价值在于一次构建知识层即可支撑企业搜索AI 助手、客服自助、工程文档等所有 AI 场景。

Nuclia(Progress Agentic RAG) 产品界面

Nuclia(Progress Agentic RAG)

Nuclia 的核心参数与统计

Nuclia 最初以 NucliaDB 为核心产品进入市场——这是全球最早一批专为 RAG(检索增强生成)设计的 AI 搜索数据库。2024 年被 Progress Software 收购后,其核心能力被整合为 Progress Agentic RAG 产品线,官方定位为 "Build an Agentic Knowledge Layer Once to Power Every AI Use Case"。当前产品形态以 SaaS 云服务为主,同时保留开源 NucliaDB 引擎供开发者自托管。

项目 公开信息
产品定位 Agentic Knowledge Layer——一次构建知识层支撑所有 AI 场景
核心引擎 NucliaDB(AI Search database for RAG)
文件格式支持 30+ 类型:文本文档PDF、Word、HTML、Markdown、JSON、图片、视频、音频
支持 LLM 数量 40+ 模型(OpenAI、Azure OpenAI、Anthropic Claude、Google Gemini 等)
检索形态 语义搜索Hybrid Search、Agentic RAG、多源路由检索
部署方式 SaaS 云服务、开源 NucliaDB 自托管
合规认证 SOC 2 Type II、ISO 27001、GDPR
安全能力 AES-256 静态加密TLS 传输加密RBAC、PII 匿名化
开源仓库 nucliadb(718 stars, 58 forks)、frontend(56 stars)
奖项 2026 AI Excellence Award in RAG、2025 Global Tech Awards

知识层架构:Nuclia 与通用向量数据库的关键区别在于它不只做向量存储与检索。它从文件摄入到 QA 生成提供了一条完整管道:自动解析 30+ 格式内容、执行 OCR 与语音转文本、生成向量 + 文本双表示、通过检索代理实现跨源推理。这意味着团队不需要在 OpenAI/Claude 之外再自行搭建解析、分块、嵌入和质量监控四套独立系统。

收购后的产品演进:被 Progress 收购后,Nuclia 的能力被嵌入 Progress 更大的数字体验平台(Sitefinity CMS)体系中,同时保留了独立的 Agentic RAG 产品线。对现有用户而言,这意味着更稳定的企业级支持与合规背书,但也意味着产品路线图不再完全由原 Nuclia 团队独立决策。

Nuclia 的用户与市场认可

Nuclia(现 Progress Agentic RAG)的市场认可主要体现在开源社区基础、行业奖项背书以及被 Progress 收购后获得的企业级渠道三个方面。

开源社区基础:核心引擎 NucliaDB 在 GitHub 拥有约 718 stars 和 58 forks,虽然相比 Pinecone、Weaviate 等竞品规模较小,但它属于面向特定场景(RAG-first 数据库)的精准定位,社区讨论和 issue 反馈集中在文档解析精度、多模态检索与 Agent 工作流集成上。配套的 frontend 前端项目(56 stars)和 Python SDK nuclia.py(7 stars)表明其技术栈以 Python/TypeScript 为主,适合 AI 应用开发者入手。

行业奖项与认可:产品于 2026 年获得 Globee Awards 的 AI Excellence Award in RAG,2025 年获得 Global Tech Awards,并在 2026 年 1 月被 Forrester Wave 在数字体验平台类别中提及。这些第三方认可在一定程度上验证了其 RAG 技术路线的成熟度。

企业生态整合:被 Progress Software(一家拥有 40 年以上历史的上市企业软件公司)收购后,Nu-clia 的产品可直接接触到 Progress 现有的 Sitefinity CMS、Corticon BRM、DataDirect 等产品的客户群。这种渠道协同对其企业级推广有实际帮助,但同时也意味着产品的独立创新节奏可能受母公司产品矩阵策略影响。

落地前提:Nuclia 的典型客户已经有一定规模的数字化内容资产(文档库、知识库、媒体文件)和明确的"用 AI 回答内部问题"场景,而非从零开始构建知识库。如果团队尚没有系统化整理的企业内容资产,Nuclia 的价值会大打折扣。

Nuclia 的成本优势

Nuclia 的成本优势不体现在"最便宜",而在于它把一条通常需要组合 3-5 家供应商(文件解析 + 向量数据库 + Embedding 模型 + LLM + 质量监控)才能完成的 RAG 管道压缩到一个平台中,从而降低了集成本和试错周期。

C 端/个人

官网提供 14 天免费试用,适合个人开发者和小型项目验证核心能力。免费试用期间的额度限制(文档量API 调用次数、存储空间)以官方注册页面为准。对于个人学习和小规模概念验证,这个门槛很低。

开发者/API

Nuclia 提供 REST API 和 Python SDK(nuclia.py),开发者可以通过 API Key 方式直接调用其文档解析、索引和检索能力。API 定价按文档处理量和检索次数计费,但官方未在公开页面展示具体的标准价目表,需要注册或联系销售获取。开源 NucliaDB 则提供了一条自托管路径——零订阅费但需要自行承担基础设施和维护成本,适合已有运维能力的团队。

企业

Nuclia(Progress Agentic RAG)的企业版通过 Progress 的销售渠道交付,支持 SSO、RBAC、审计日志、私有部署等企业级功能。定价需经过商务沟通,无公开刊例价。企业采购的实际成本应包括:

  • 显性费用:平台订阅费(按文档处理量/检索量/用户数计费,具体以商务合同为准)
  • 隐性成本:将现有内容迁移到 Nuclia 索引的清洗和格式适配工作量
  • LLM 调用费用:Nuclia 支持 40+ LLM,但模型推理费用由用户直接承担或通过平台代付,这部分在大规模使用时会成为主要成本项

对比分析:相比 Pinecone + LangChain + OpenAI 的三件套组合方案,Nuclia 的"一站式"模式省去了管道搭建和版本兼容性维护成本;但相比纯粹的向量数据库,它在检索定制灵活性上可能受限于平台的抽象层。选择时需要权衡的是"集成省时" vs "定制自由度"。

Nuclia 的主要功能

Nuclia(Progress Agentic RAG)的能力覆盖从数据摄入到 AI 答案生成的完整链路,核心可归纳为五个功能群组:

  • 多格式自动解析与索引:支持 30+ 文件格式,包括 PDF、Word、HTML、JSON、图片(JPEG/PNG/TIFF)、视频(MP4/AVI/MPEG)、音频(MP3/WAV)等。上传后自动执行 OCR(图片中文字识别)、ASR(语音转文本)、语义分块与向量化,无需手动预处理。这对于包含扫描件、会议录音、培训视频的企业内容库尤为重要——传统方案需要分两步走,这里一次到位。

  • 语义搜索与 Hybrid Search:基于向量相似度的语义搜索之外,支持结合关键词匹配的 Hybrid Search 策略。用户可以通过 Metadata 过滤、分块策略调整来针对特定业务场景(如法律合同检索 vs 技术文档检索)优化召回效果。

  • Agentic RAG 工作流:这是 Nuclia 与早期 RAG 方案的核心差异化能力。检索代理(Retrieval Agents)能够将一个问题自动拆解为子问题,同时查询多个 Knowledge Box、SQL 数据库、互联网搜索引擎和 MCP 服务器,然后将多源结果合并为综合答案。整个过程不需要用户手动指定每次路由,代理根据问题内容自动决策查询目标与顺序。

  • REMi 质量评估体系:内置的 RAG 评价模型(RAG Evaluation Metrics Intelligence)持续监控三个核心指标:答案相关性(是否回答用户问题)、上下文相关性(检索内容是否匹配)、Groundness(答案是否基于检索内容而非模型幻觉)。评估结果在仪表板中随时间趋势展示,便于在质量下降前介入调整。

  • 多 LLM 切换与治理:支持 40+ 大语言模型,包括 OpenAI GPT-4o、Anthropic Claude、Google Gemini 等。切换模型无需重新索引知识库或调整检索管道——只需在控制台进行一次配置变更。这在企业需要对比多家模型输出质量、或应对单一模型服务中断时提供了灵活性。

专家视点:Nuclia 的功能设计隐藏了一个协同效应——把"文档解析"和"检索质量监控"放在同一个平台,这使得团队可以在同一套仪表板中同时看到"哪些文档因格式问题未能正确索引"和"哪些问题的答案因上下文不足而质量偏低",从而形成闭有改进。而在传统多工具组合方案中,这两个故障域往往分属不同的工具和负责人,排查链条长、响应慢。

Nuclia 的模型与版本演进

Nuclia 的产品演进经历了"独立创业 → 被收购整合 → 品牌升级"三个阶段。以下按里程碑节点梳理其版本脉络。

独立阶段:NucliaDB 开源发布

Nuclia 最早以 NucliaDB 开源项目的身份进入市场,定位为"AI Search database for RAG"。这一阶段的核心目标是验证"用 AI 原生方式重新设计企业搜索"的技术路线。开源仓库在 GitHub 上吸引了约 718 stars,主要用户群体是 AI 应用开发者和 RAG 研究者。该阶段没有标准化的企业定价,功能迭代主要围绕文档解析精度、检索延迟和性能优化展开。

收购整合:Progress Software

2024 年,Progress Software 收购 Nuclia,将其技术整合到 Progress 的数字化体验平台体系中。收购后 Nuclia 的产品形态从独立的开源数据库演进为 Progress 旗下的 SaaS 产品线。这一阶段的主要变化包括:

  • 品牌更名为 Progress Agentic RAG
  • 补充企业级合规能力(SOC 2 Type II、ISO 27001 认证)
  • 在产品中引入 Agentic RAG 工作流和 REMi 评估体系
  • 与 Progress Sitefinity CMS 等产品建立集成

当前版本:Progress Agentic RAG(~2026-Q2)

当前产品以 SaaS 形式交付,注册后即可在 rag.progress.cloud 创建 Knowledge Box 并开始使用。具体版本号未以传统方式在公开页面标注,功能更新通过 Progress 官方发布渠道通知。核心能力包括:

  • Agentic RAG 工作流(多源检索代理)
  • REMi 质量评估与仪表板
  • 40+ LLM 切换支持
  • RBAC 与审计日志
  • 14 天免费试用

版本演进特点:Nuclia 没有像传统软件那样按语义版本号(如 v2.3.0)发布,而是作为一个持续更新的 SaaS 服务演进。对于企业评估来说,关注点不应是"哪个版本更稳定",而是"当前产品的功能成熟度和 SLA 承诺是否满足生产需求"。

Nuclia 的技术优势

Nuclia 的技术优势不是来自某个单一模型或算法的突破,而是来自其"围绕 RAG 全链路做垂直整合"的架构选择。

全管道一体化架构

Nuclia 的核心设计理念是用一个管道覆盖从原始文件到 AI 答案的全流程,而不是让用户自己拼接多个独立服务。它的技术栈包括:

  1. 文件解析层:内置 OCR(图片文字提取)和 ASR(语音转文本)能力,支持 30+ 格式的自动解析。这意味着视频中的口述内容、扫描 PDF 中的表格文字都可以被索引和检索,无需额外的前处理管道。

  2. 双表示索引:对每个文档同时生成向量表示(用于语义相似度检索)和文本表示(用于关键词匹配和 Hybrid Search)。这种设计在检索召回率上优于"仅向量"方案,尤其在专业术语密集或多语种混合的场景下表现更明显。

  3. 检索代理(Retrieval Agents):这是 Nuclia 最核心的技术差异化。传统的 RAG 是"一次检索、一次生成"的直线管道。检索代理则将这个过程改造为:分析问题 → 拆解子问题 → 动态选择数据源 → 并行检索 → 合成答案。这种设计显著提升了需要跨文档推理的复杂问题(如"对比去年 Q3 和今年 Q3 的营收,差异主要来自哪些业务线")的答案质量。

内置质量监控(REMi)

大多数 RAG 方案在上线后缺乏持续的检索质量监测,导致管道退化(数据更新、分布漂移)时无法被及时发现。Nuclia 内置的 REMi 评估模型持续计算三个指标:答案相关性、上下文相关性Groundedness。这些指标随时间变化趋势在仪表板中可视化,可以在用户察觉之前捕捉到质量下降。这是从"监控基础设施健康"到"监控检索质量"的一个关键演进。

模型无关的检索层

Nuclia 的知识层与 LLM 之间是松耦合关系。所有索引、分块、检索策略都与具体的生成模型无关。切换 LLM 时不需要重新处理任何文档或调整任何检索参数。这意味着企业可以在不中断知识层服务的情况下,随时将回答模型从 GPT-4 换为 Claude 或自托管的开源模型。这种设计在大语言模型快速迭代的当下具有实际成本价值——当新模型性价比更高时,只需更新配置即可享受收益。

工程踩坑指南

基于 Nuclia 的 Agentic RAG 架构特性,在实际落地中需要特别关注以下问题:

  1. 多源检索的 Token 成本暴涨:检索代理同时查询多个 Knowledge Box 和外部数据源时,检索结果总量可能远超单源 RAG 方案。如果不对每轮的上下文 Token 预算做上限限制,LLM 调用成本会线性增长。建议在配置检索代理时明确每个源的检索结果上限(如每个源 Top-K=5),并对总计上下文 Token 设定软硬限制。

  2. 多模态内容的解析质量差异:Nuclia 支持 30+ 格式,但不同格式的解析精度差异显著。清晰印刷体的 PDF OCR 准确率很高,但手写批注、低分辨率扫描件、带有复杂表格的文档解析结果可能不完整。建议在正式上线前对目标文档库进行抽样质量审计,对解析失败率高的文档类别提前做格式标准化预处理。

  3. Agent 循有与延迟控制:检索代理在面向复杂问题时可能执行多轮子查询和结果融合,导致端到端延迟从单轮 RAG 的 2-3 秒增加到 8-15 秒以上。对于实时对话场景(如客服在线助手),需要设置检索代理的最大步数(max_steps)和超时阈值,或对简单问题启用快速通道(直接跳过多源路由,使用单源 RAG 加速)。

Nuclia 的使用方式

Nuclia(Progress Agentic RAG)提供 SaaS 云服务和开源自托管两条主要使用路径,覆盖从快速验证到企业级部署的不同需求。

使用方式 适用场景 入口/方式 启动成本
SaaS 云服务(14 天免费试用) 快速评估与概念验证 rag.progress.cloud 注册 免费试用,之后按量/订阅付费
API / SDK 集成 开发者嵌入自有应用 REST API + Python SDK(nuclia.py) 按 API 调用量计费
开源 NucliaDB 自托管 数据主权要求高的企业 GitHub 仓库部署 基础设施 + 运维成本
Progress 企业版 规模化部署与合规需求 通过 Progress 销售团队获取 需商务确认

快速上手指南

  1. 访问 rag.progress.cloud,使用企业邮箱注册 14 天免费试用账户
  2. 创建一个 Knowledge Box(知识盒)——这是 Nuclia 中存储和索引内容的基本单元
  3. 上传文档或连接外部数据源——支持直接上传文件、配置连接器、或通过 API 推送数据
  4. 系统自动完成解析、分块、索引和向量化,无需手动配置管道
  5. 在搜索界面或 API 中测试检索效果,调整 Hybrid Search 权重和 Metadata 过滤条件
  6. 将检索 API 接入前端应用或嵌入 AI 助手 Widget

对于开发团队,也可以通过 pip 安装 nuclia.py SDK 直接调用 API:

# Nuclia Python SDK 基本用法(以官方文档为准)
from nuclia import Nuclia

# 初始化客户端
client = Nuclia(api_key="<YOUR_API_KEY>")

# 上传文档进行索引
client.upload(file_path="annual-report-2025.pdf")

# 执行语义搜索
results = client.search(query="2025 年营收增长率", top_k=10)

Nuclia 的产品定价

定价模式以官方实时页面为准。通常采用免费增值(Freemium)或订阅制,基础功能可免费使用,高级功能或高频使用需付费。

Nuclia 的应用场景

Nuclia(Progress Agentic RAG)的核心价值在于将企业分散的非结构化内容转化为 AI 可用的知识层。其典型应用场景覆盖五类:

  • 企业知识管理:将散落在内部文档库Wiki、SharePoint 和本地文件服务器中的 PDF、Word、PPT 等内容统一索引,员工可以通过自然语言提问直接获取基于内部知识的答案,而非只能搜索文件名或关键词。落地核验重点:是否需要跨文件推理、知识库的更新频率、以及权限隔离的精确度。

  • AI 驱动的企业搜索:在门户网站、内部网或客户自助门户中部署 AI 搜索,替代传统的关键词搜索体验。Nuclia 的语义搜索能力使访问者可以用"找一下去年关于合规培训的材料"这类自然语言查询而非精确关键词来查找内容。落地核验重点:搜索结果的点击率和用户满意度是否显著提升。

  • 客服自助与 AI 助手:基于 Nuclia 索引的产品文档FAQ 和知识库构建 AI 客服助手,用户提问后直接给出附有来源引用(Source Citation)的答案,而非简单的片段匹配。落地核验重点:答案的 Groundedness 评分、客户问题解决率、以及需要人工介入的转接率。

  • 工程与技术文档检索:开发者可以利用 Nuclia 索引 SDK 文档API 规范、设计文档和运维手册,通过一个统一的检索入口快速找到需要的技术信息。特别是在微服务架构和多仓库管理的大型工程团队中,免去了在多个 Wiki 和文档站点之间反复切换的成本。

  • 合规与审计查询:将合规文档、审计报告、监管文件索引到 Nuclia 平台后,审计人员和合规官可以用自然语言查询历史合规状态、对比不同时期的审计发现、追溯特定条款的出处。来源引用和审计日志功能在这里起到关键作用。

Nuclia 的适用人群

Nuclia(Progress Agentic RAG)的产品定位决定了它主要服务以下五类角色:

  • AI 应用开发者:需要通过 API 将企业知识检索嵌入已有应用(CRM、工单系统、内部工具)的开发者。Nuclia 提供的 REST API 和 Python SDK 使其可以作为"检索能力即服务"使用,省去了自行搭建 RAG 管道的开销。适合已具备 API 集成经验、但不想投入重复劳动做文档解析和索引的团队。

  • 企业知识管理者:负责公司内部知识库、文档管理和信息架构的运维人员。Nuclia 的全自动管道(上传即索引)大幅降低了手动维护知识库的人力成本。但他们需要关注的是:自动解析的分块粒度是否合理、以及是否需要针对特定文档类型自定义 Metadata 规则。

  • 产品与技术负责人:在规划和评估"AI + 知识库"产品路线的技术管理者。Nuclia 的"一次构建、多场景复用"架构使其在多元化 AI 需求(既要做内部搜索,又要做客户助手,还要做文档分析)下有明显的性价比优势。但需要在 POC 阶段验证长尾文档类型的解析覆盖率和检索准确率是否满足业务要求。

  • 合规与信息安全团队:对数据主权、合规认证、审计追溯有严格要求的企业合规人员。Nuclia 的 SOC 2 Type II、ISO 27001、GDPR 合规认证RBAC 和审计日志本身就是采购决策中的准入条件。但他们需要额外确认数据存储地、以及 Progress 的数据处理协议(DPA)是否覆盖所在行业的具体监管要求。

  • **不适配人群:以下情况不建议选择 Nuclia:

    • 只需要一个简单的关键词搜索,不需要 AI 问答能力——传统搜索引擎成本更低
    • 完全没有数字化文档资产,需要从零创建知识库——Nuclia 擅长索引已有内容,但不提供文档创作和知识库构建能力
    • 需要高度定制化的向量检索逻辑和极低延迟(<100ms)——专用向量数据库在定制和性能上更优
    • 团队没有基本的 API 集成或 SaaS 配置能力——全自动部署仍需一定的平台配置工作量

Nuclia 的总结与展望

Nuclia(Progress Agentic RAG)的核心竞争力在于它提供了一个从"文件摄入"到"AI 答案生成"的端到端知识层方案,将文档解析、向量索引Agentic 检索和质量监控整合进一个平台。对于已经拥有大量数字化内容资产、希望在多个业务场景中复用同一套 AI 检索基础设施的企业来说,这种"一站式"架构确实可以减少集成碎片化带来的隐性成本。被 Progress Software 收购后获得的合规认证和企业级渠道支持,进一步降低了它在受监管行业的准入门槛。

当前限制与不确定项

  1. 定价透明度不足:截至当前,公开页面未展示标准套餐价格和计费明细。企业在采购决策阶段需要与销售沟通,增加了横向对比竞品(如 Pinecone、Weaviate、Azure AI Search)的成本。
  2. 开源版本与 SaaS 版本的差异化定位:NucliaDB 开源版本的功能集与 SaaS 商业版之间的对比边界不清晰,自托管用户难以预判哪些高级功能(如 Agentic RAG 工作流REMi 评估)需要在商业授权下才能使用。
  3. 品牌过渡期的市场认知:从 Nuclia 到 Progress Agentic RAG 的品牌变更尚处于过渡期,nuclia.com 已重定向至 progress.com/agentic-rag,但在社区讨论和技术博客中,"Nuclia"仍然是主流搜索词。这种品牌双轨状态在短期内可能增加采购者的信息搜集成本。
  4. 多模态检索的大规模实际表现:虽然产品宣称支持 30+ 文件格式和视频/音频内容的语义检索,但在企业级大规模文档库(百万级以上文档)上的检索延迟和精度数据未公开披露。建议在 PoC 阶段使用目标规模的数据量做压力测试。

采购与采用建议

建议采用"先验证、后扩展"的路径。第一阶段(2-4 周):利用 14 天免费试用,选择一个业务场景(如客服知识库或 IT 文档检索),上传 500-1000 份代表性文档,手动测试语义搜索和 Agentic RAG 的回答质量,重点关注文件格式死角、多文档推理的准确率、以及 REMi 评分的可参考性。第二阶段(目标场景扩展):验证通过后,扩展至 2-3 个业务部门,接入 Production 级别的文档量,考察检索延迟和系统稳定性。第三阶段(商务采购):在确定 ROI 指标后,与 Progress 销售团队确认包含 SSO、审计SLA 和数据本地化的企业合同条款,特别关注超出套餐额度后的超额单价和数据迁移成本。

Nuclia(Progress Agentic RAG) 的 如何使用

  • Web 端:访问官网注册账号即可使用,多数功能无需安装。
  • API 接入:提供 RESTful API,开发者可获取 API Key 后集成到自有应用。

版本信息

  • Progress Agentic RAG(NucliaDB 驱动) :产品已整合至 Progress 平台体系,持续迭代 Agentic RAG 工作流REMi 评估指标与多源检索能力;具体版本号以官方实时页面为准。
  • Nuclia 独立版本(NucliaDB) :Nuclia 被 Progress 收购前的独立发布版本,提供 NucliaDB 开源引擎与 SaaS 服务。暂无官方精确日期。
  • NucliaDB 早期发布 :NucliaDB 作为专为 RAG 设计的 AI 搜索数据库公开发布,支持多模态数据索引与语义检索。暂无官方精确日期。

用户评价

  • 加载评价中...