GPT Index (LlamaIndex)
免费
LlamaIndex(原 GPT Index)是一个开源数据框架,专为大模型应用设计,提供数据接入、索引构建、检索增强生成(RAG)的完整工具链。
GPT Index (LlamaIndex)
LlamaIndex 的核心参数与统计
LlamaIndex 已经从一个"数据框架"进化为覆盖文档解析、索引构建、检索增强与 Agent 工作流的全链路基础设施。其官方定位从"LLM 数据框架"升级为"Document OCR for the agentic stack",核心产品线包括开源的 llama-index Python 框架、托管云服务 LlamaCloud,以及专有文档解析引擎 LlamaParse。
| 参数 | 公开数据 |
|---|---|
| 产品定位 | 开源大模型 Agent 数据框架 & 文档解析平台 |
| 核心能力 | Agentic OCR 文档解析RAG 索引、结构化提取Agent 工作流 |
| 支持的文件类型 | PDF、Office、图片HTML、Markdown 等 50+ 格式 |
| 支持的 LLM | OpenAI、Anthropic、Llama、DeepSeek、Gemini 等 |
| 支持的向量库 | Chroma、Pinecone、Weaviate、Qdrant、Milvus、PostgreSQL 等 |
| 部署方式 | pip 安装(开源)、LlamaCloud(托管)、LlamaParse(API) |
| 许可协议 | MIT(框架)、闭源(LlamaParse/LlamaCloud) |
| PyPI 最新版本 | 0.14.23(2026-06-24) |
| Python 版本要求 | >= 3.10 |
社区规模:LlamaParse 已处理超过 10 亿份文档,月均包下载量 2500 万+,注册用户超过 30 万。GitHub 上 run-llama/llama_index 仓库公开显示约 38k+ Stars,是 RAG 领域最活跃的开源项目之一。
产品矩阵:LlamaIndex 已从单一框架演化为三层产品结构——开源框架(llama-index)负责索引与检索编排;LlamaParse 提供云端 Agentic OCR 解析(50+ 格式、手写体、表格、图表);LlamaCloud 提供企业级托管索引与解析服务。此外还有 LiteParse(开源本地解析器,2026 年发布)覆盖离线场景。
LlamaIndex 的用户与市场认可
市场的认可可以从三个维度观察:开源社区生态、企业客户采用、以及行业渗透广度。
开源社区热度:GitHub Stars 约 38k+,Forks 约 8k+。PyPI 从 0.4.0(2023 年 2 月)到 0.14.23(2026 年 6 月)经历了超过 300 个版本的迭代,月均下载量从 2023 年初的数十万增长到 2026 年的 2500 万+。Discord 社区活跃,LlamaHub 连接器数量快速增长。
企业客户认可:公开案例显示 NTTData、Delphi、Carlyle 等机构已将 LlamaParse 应用于文档处理流程。官方网站列举的垂直行业覆盖金融、保险、制造、医疗四大领域,说明其在企业文档处理场景中已获得一定验证。
行业渗透广度:LlamaIndex 不仅是 RAG 应用的"标配"框架,也渗透到了文档 Agent、智能 OCR、合规审查等更垂直的文档密集型场景。其核心价值在于把"非结构化文档 -> LLM 可用结构化数据"这条链路的每一有都标准化了。
LlamaIndex 的成本优势
- C 端/个人:通常提供免费版体验核心功能,高频使用需订阅付费套餐。
- API/开发者:按调用量计费,适合灵活集成到自有系统中的开发团队。
- 企业/私有化:需联系商务获取定制化报价和部署方案。具体价格以官方实时定价页面为准。
LlamaIndex 的主要功能
LlamaIndex 的能力体系已从"数据连接 + 索引构建"延伸到"文档理解 + 自主 Agent"的完整链路:
-
LlamaParse Agentic OCR:当前的主打能力。支持 50+ 文件格式(PDF、Office、图片、手写体),利用 VLM 实现布局感知解析。内置 Auto-Correction Loop——递归检测并修正解析错误,对密集表格、图表、多栏排版、手写笔记均有专门优化。结果输出为 LLM 可用 Markdown 或结构化数据。
-
LlamaExtract 结构化提取:在文档解析基础上,支持按预定义 Schema 提取关键字段(如合同条款、发票金额、保单信息),输出 JSON/CSV,适合需要从大量文档中批量提取特定字段的场景。
-
多索引与检索策略:支持向量索引、摘要索引、关键词索引、知识图谱索引四种基础模式,并在检索层提供 Top-K、MMR、Hybrid Search 等多策略组合,以及节点后处理(Reranker、Metadata Filter)。数据边界:对于手写体密集的扫描件,纯 OCR 管线效果受限,推荐优先使用 LlamaParse。
-
Agent 工作流(Workflows):0.14 系列引入的 Agent 编排能力,支持多步文档 Agent——将"解析 -> 提取 -> 检索 -> 生成"编排为一个可重复的 Agent 流程。可以用 Python 代码定义步骤依赖与条件分支,替代传统 RAG 的硬编码管线。
-
LlamaHub 社区连接器生态:虽然定位已从"核心功能"降为"生态支撑",但 LlamaHub 仍提供 100+ 数据加载器,覆盖 SaaS 应用、数据库、文件存储等来源,方便快速接入存量数据。
LlamaIndex 的模型与版本演进
LlamaIndex 的版本演进可分为三个阶段:
第一阶段:GPT Index 时代(2022.11 - 2023.02)
项目原名为 GPT Index,以 0.4.x 版本起步。当时的定位是"为 LLM 提供数据索引",核心概念只有 GPTSimpleVectorIndex 等少数类。这一阶段社区在摸索 RAG 的标准化路径,LlamaIndex 的响应式迭代(一个月内从 0.4.4 到 0.4.40)为后续爆发奠定了基础。
第二阶段:LlamaIndex 框架期(2023.02 - 2024.11)
2023 年 2 月改名为 LlamaIndex,0.5.x 到 0.10.x 系列见证了 RAG 范式的大规模落地。关键里程碑包括:
- 0.6.0(2023-05):引入查询引擎和检索器抽象,奠定了"Index -> Retriever -> QueryEngine"三层架构。
- 0.8.0(2023-08):引入 Agent 工具集成,LlamaIndex 从"数据工具箱"进化为"Agent 数据接口"。
- 0.10.0(2024-02):包结构拆分为
llama-index-core+ 独立集成包,降低安装体积和依赖冲突。 - 0.12.0(2024-11):进一步模块化,提升跨版本兼容性。
第三阶段:文档 Agent 平台化(2024.11 - 至今)
从 0.13.0(2025-07)开始,LlamaIndex 加速向文档 Agent 平台转型:
- 0.13.0(2025-07-31):LlamaParse Agentic OCR 深度集成,支持复杂文档布局理解。
- 0.14.0(2025-09-08):引入 Workflows Agent 编排引擎,支持多步文档 Agent。
- 0.14.20+(2026-04):Python 最低版本提升至 3.10,进一步企业级特性(VPC部署SSO、SOC2)。
- 0.14.23(2026-06-24):最新稳定版,持续优化 LlamaParse 解析质量与 Agent 工作流稳定性。
LlamaIndex 的技术优势
LlamaIndex 的技术优势不在于单一模型性能,而在于"全链路标准化 + Agent 编排"的架构设计。
全链路标准化:从文档输入到检索输出的每一步都有明确的 API 抽象(Reader -> Document -> Node -> Index -> Retriever -> QueryEngine -> Response)。这种标准化使得开发者可以在不改变整体架构的前提下,替换任意有节的实现(如从 OpenAI Embedding 切换到本地模型),大幅降低了 RAG 应用的试错与迭代成本。
Agentic OCR 的闭有机制:与传统 OCR 的一次性识别不同,LlamaParse 的 Auto-Correction Loop 机制先利用 VLM 进行布局理解和初步识别,再通过递归校验逻辑检测置信度低的区域并重新处理。官方宣称这一机制在处理密集表格、多栏排版和手写笔记时能显著降低错误率。机制核心是"专家路由"——文本/表格/图表/手写分别路由到不同的处理专家模型。
Workflows 编排引擎:0.14 引入的 Workflows 以 Python 装饰器(@step)定义 Agent 步骤,而不是用 YAML/JSON 配置。这意味着开发者可以在编排中嵌入任意 Python 逻辑(条件判断、循有、异常处理),在灵活性与可维护性之间找到了平衡。
模块化包管理:llama-index-core 仅含核心抽象,各集成(LLM、Embedding、Vector Store)以独立包发布。生产有境可按需安装,将依赖体积控制在 10MB 以内,这对 CI/CD 流水线和容器化部署有利。
如何使用 LlamaIndex
LlamaIndex 提供三条使用路径,对应不同技术栈和部署偏好:
| 使用方式 | 适用人群 | 核心步骤 | 成本 |
|---|---|---|---|
| 开源框架(pip) | Python 开发者 | pip install llama-index -> 编写 Python 脚本 -> 自定义 Index/Retriever/QueryEngine |
免费(框架),自备 LLM/向量库费用 |
| LlamaParse API | 非 Python 团队、快速验证 | 注册 LlamaCloud -> API Key -> 调用 Parse API | 免费额度 10,000 积分/月,超额按量计费 |
| LlamaCloud(托管) | 企业生产有境 | 数据上传 -> 托管索引 -> 查询 API | 需联系销售获取报价 |
Python 快速接入示例(官方文档可核验):
# 安装框架(pip install llama-index)
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader
# 加载本地文档
documents = SimpleDirectoryReader("./data").load_data()
# 构建索引(默认使用 OpenAI Embedding)
index = VectorStoreIndex.from_documents(documents)
# 创建查询引擎并提问
query_engine = index.as_query_engine()
response = query_engine.query("文档的核心结论是什么?")
print(response)
LlamaParse 云端解析示例:
# pip install llama-index llama-index-readers-llama-parse
from llama_index.readers.llama_parse import LlamaParse
from llama_index.core import VectorStoreIndex
parser = LlamaParse(result_type="markdown", api_key="<YOUR_API_KEY>")
documents = await parser.aload_data(["./contract.pdf"])
index = VectorStoreIndex.from_documents(documents)
企业落地建议按"试点 -> 对照 -> 扩展"推进:先用开源框架在 1-2 个典型文档场景(如合同条款提取)跑通基线,再评估是否需要 LlamaParse 的 Agentic OCR 提升复杂文档解析质量,最后按合规要求决定是否升级到 LlamaCloud 企业版。
LlamaIndex 的产品定价
定价模式以官方实时页面为准。通常采用免费增值(Freemium)或订阅制,基础功能可免费使用。 高级功能或高频使用需付费订阅,建议用户根据实际用量评估最优方案。
LlamaIndex 的应用场景
LlamaIndex 的适用场景主要围绕"非结构化文档的结构化利用"展开:
-
企业合同与文档审查:将合同、协议、合规文件上传至 LlamaParse,利用 Auto-Correction Loop 高精度解析后,通过 VectorStoreIndex 构建语义检索系统。法务团队可以直接提问"合同中的赔偿条款上限是多少"而无需逐页翻阅。核验重点:解析质量——中文合同中的条款编号、金额数字是否正确保留,表格信息是否被完整提取。
-
金融研究与尽调:券商和基金公司用 LlamaIndex 处理招股书、年报、研报。多索引策略(摘要索引 + 关键词索引)适用于"先浏览全文摘要、再精查特定指标"的场景。核验重点:长文档(200+ 页)的索引构建速度和跨页表格的召回完整性。
-
智能客服与工单 Agent:将产品手册FAQ、历史工单接入 LlamaIndex,配合 Workflows 编排"用户问题 -> 文档检索 -> 上下文构建 -> LLM 生成回复"的端到端 Agent 流程。核验重点:当知识库频繁更新时,索引重新构建的频率和增量更新支持。
-
文档 Agent(Document Agent):利用 Workflows 编排多个 LlamaParse + LlamaIndex 实例,实现自动化文档处理流水线——上传发票 -> 自动解析 -> 提取金额/日期/供应商 -> 写入会计系统。核验重点:Agent 步骤失败时的重试策略和人工审核回退机制。
LlamaIndex 的适用人群
-
AI 应用开发者:需要快速构建 RAG 或文档问答系统的 Python 开发者。前置条件:熟悉 LLM 调用和基本的 NLP 概念,对 Index/Retriever/QueryEngine 三层抽象需要一定学习成本。
-
数据工程师与 MLOps 团队:负责企业级文档处理管线搭建和运维。LlamaIndex 的模块化设计和 LlamaCloud 托管选项降低了从 POC 到生产的迁移成本。前置条件:需要评估自托管与云托管的合规权衡,以及中文文档解析的边界。
-
产品与业务分析团队:需要从大量非结构化文档中提取结构化信息(如合同审查、市场研究报告分析)。可通过 LlamaParse 的 Schema Extraction 功能,用自然语言定义提取字段而非编写代码。前置条件:文档格式标准化程度高,超复杂排版的手写体扫描件需人工复核。
-
不适配人群:对文档处理量极低(每周 < 10 页)的个人用户,安装全量框架可能过重,建议直接使用 LLM 内置的文件上传功能。需要超长上下文直接检索(而非通过索引)的场景,LlamaIndex 的索引构建有节会增加延迟。此外,对数据隐私要求极高且不允许任何数据离境的团队,需使用自托管方案,运维成本需纳入考量。
总结与展望
LlamaIndex 已经从最初的"GPT Index"单一数据索引工具,进化为覆盖文档解析RAG 索引Agent 工作流的全链路平台。其核心竞争力在于"标准化"——将文档->结构化数据->LLM 可消费格式的每个有节都抽象为可替换的 API,使得不同技术栈和规模的组织都能在其上构建文档 AI 应用。LlamaParse 的 Agentic OCR 能力则进一步拓宽了适用边界,从纯文本 PDF 延伸到手写体、扫描件、密集表格等复杂文档。
当前限制与不确定项:1)中文文档的解析质量虽持续改进,但对古籍竖排排版、中文手写潦草体的支持仍不如英文稳定;2)框架学习曲线不低——Index、Retriever、QueryEngine、Postprocessor、Workflows 等概念之间的层级关系新手需要时间理清;3)LlamaCloud 企业版价格未公开,采购前需联系销售获取详细报价并进行 POC 验证;4)高频扫描件处理的积分消耗速度可能超出预期,建议在 POC 阶段测量每页实际积分消耗。技术团队在落地前应重点评估:中文文档的解析质量是否符合业务阈值,高并发场景下 LlamaCloud 的检索延迟是否能满足 SLA,以及 VPC 部署方案是否覆盖数据主权要求。
相关工具:GitHub Copilot、
Cursor
GPT Index (LlamaIndex) 的 如何使用
- Web 端:访问官网注册账号即可使用,多数功能无需安装。
- API 接入:提供 RESTful API,开发者可获取 API Key 后集成到自有应用。
版本信息
- LlamaIndex 0.14.23 :PyPI 公开最新版本,继续沿 Agent 框架、文档解析(LlamaParse)与 RAG 能力主线迭代。
- LlamaIndex 0.14.22 :0.14 系列持续迭代,增强多模态文档解析与 Agent 工作流稳定性。
- LlamaIndex 0.13.0 :引入 Agentic OCR 与 LlamaParse 深度集成,支持复杂文档布局理解。
- LlamaIndex 0.12.0 :重大重构版本,引入模块化包管理(llama-index-core)和新的查询引擎 API。
- Major Refactor :包结构拆分里程碑,从此进入模块化时代。
用户评价