Arize AI 免费

-

Arize AI 是面向 AI Agent 和 LLM 应用的工程平台,提供 Arize AX(云 SaaS)和 Arize Phoenix(开源)两条产品线。覆盖 Agent 行为追踪LLM 评测、实验管理Prompt 优化Alyx AI 工程助手和数据编织集成,帮助团队从"凭感觉调试"转向"基于 trace 和 eval 的系统化改进"。

Arize AI 产品界面

工具正文

核心参数与统计

Arize AI 的产品体系分为两条线:Arize AX(云 SaaS 平台)和 Arize Phoenix(开源 AI observability 平台)。前者面向需要托管服务和团队协作的企业级场景,后者面向需要自托管、数据驻留或本地调试的开发团队。二者共享同一套 OpenInference/OpenTelemetry 数据标准和评测引擎。

项目 公开信息
产品体系 Arize AX(云 SaaS)+ Arize Phoenix(开源)
官方入口 arize.com
产品文档 arize.com/docs
GitHub 组织 github.com/Arize-ai — 72 个仓库
核心仓库 Phoenix(10.6k stars)、OpenInference(1.1k stars)
开源许可 Elastic License 2.0(Phoenix)、Apache-2.0(OpenInference 等)
平台月处理量 1 万亿+ spans、10 亿+ evals、500 万+ downloads
企业客户 Reddit、DoorDash、Uber、Instacart、Spotify、Booking.com、PagerDuty、Atlassian、Pepsi、Priceline 等
部署形态 Arize AX SaaS、Phoenix 自托管(Docker/K8s/本地)
团队规模 35+ 开放职位,办公室位于 Berkeley 和 NYC
融资背景 Battery Ventures、Foundation Capital、TCV、Adams Street、Microsoft Venture、OMERS 等

这些参数说明 Arize 已不是早期 startup——万亿级 span 处理量和头部企业客户名单表明它在 LLM observability 赛道占据先发优势。但真正拉开差距的不是数字本身,而是"trace + eval + experiment"三合一的产品逻辑:传统 APM 工具能告诉你系统慢了,但说不清是 prompt 问题、检索缺失还是模型退化;Arize 把这三类信号关联到同一条 trace 上,让 AI 团队可以像调试代码一样调试 Agent 行为。

用户与市场认可

Arize 的市场认可可以从三个维度观察。企业采用层面,官网展示的客户名单包括 Reddit、Uber、DoorDash、Spotify、Instacart、Booking.com、Atlassian、PagerDuty、Wayfair、Priceline 等横跨社交、出行、电商、音视频和 SaaS 的头部公司。这些客户多数将 AI Agent 或 LLM 功能嵌入核心业务流程,对可观测性和评测有刚需。

开源生态层面,Phoenix 在 GitHub 获得 10.6k stars,OpenInference 获得 1.1k stars,组织级仓库数量达到 72 个。月均 500 万+ downloads 和 2200 万+ OpenTelemetry instrumentation downloads 说明它不仅被试用,也被持续集成到实际项目中。

行业背书层面,Arize 的投资者包括 Battery Ventures、Foundation Capital、TCV、Adams Street、Microsoft Venture、OMERS、Sinewave 和 DataDog。其中 DataDog 的投资具有特别含义——传统 APM 巨头间接承认 AI 可观测是一个独立的新品类。

需要注意的是,开源 stars 和月下载量反映的是开发者兴趣度和生态扩散速度,并不直接等价于付费客户数或收入。企业在采购评估时,应要求 Arize 提供与自身 trace 规模匹配的参考案例SLA 条款和数据出口政策。

成本优势

Arize 的成本结构需要分三层拆解,因为开源版和云 SaaS 版的成本差异很大。

个人/小团队(C 端):Arize AX Free 层提供 25k spans/月1 GB 存储15 天保留,适合个人开发者验证概念或学习试用。如果只是想跑通 tracing 流程,Free 层在额度内无费用。Phoenix 自托管则完全免费,但需要承担本地或服务器资源。

开发者/API 层:AX Pro 定价 $50/月,包含 50k spans、10 GB、30 天保留。超出部分按额外 span 和存储计费(具体单价未公开,以官方实时页面为准)。相比自托管,Pro 层省去了运维成本,适合没有专用平台团队的中小团队。对于已有 Kubernetes 经验和运维能力的团队,自托管 Phoenix 在较大规模下可能总成本更低——软件免费,成本转移到基础设施、存储和 SRE 工时。

企业/私有化层:AX Enterprise 为定制报价,公开信息显示包含专属支持SLA、SOC2/HIPAA 合规、培训、自托管 add-on 和数据驻留能力。此层级必须通过销售沟通确认,公开页面未列出具体价格。Arize 也提供 startup pricing 计划,面向早期 AI 公司。

隐性成本方面,有几个容易被忽略的点:tracing 的 span 粒度会影响月度消耗——如果每个工具调用、每次检索、每轮 agent 思考都产生独立 span,25k 或 50k 的免费/入门额度可能在真实 agent 场景下快速耗尽。另外,数据保留策略直接影响存储成本:长保留周期(如 90 天以上)在企业自托管场景下需要规划数据库容量和备份方案。

主要功能

  • Agent 行为追踪(Observe):基于 OpenInference/OpenTelemetry 标准,完整记录 agent 的每一步工具调用LLM 请求、检索操作和决策路径,以 trace graph 呈现。验收关注点:检查是否覆盖 coding agent(Cursor、Claude Code、OpenCode)、多 agent 协作和嵌套工具调用等复杂链路。

  • 评测引擎(Evaluate):支持 span-level、trace-level 和 session-level 评测,内置 LLM-as-a-judge、检索相关性、答案正确性、幻觉检测等模板。验收关注点:评测结果是否可直接附着到 trace 上形成闭有,能否自定义 judge 标准和评分规则。

  • 实验管理(Improve):通过 Datasets 和 Experiments 模块,将线上失败的 trace 样本沉淀为版本化数据集,再对比不同 prompt、模型、参数和检索策略的评测指标差异。验收关注点:实验是否支持批量运行、指标对比和统计显著性判断。

  • Alyx AI 工程助手:官方定位为"AI engineering agent",能理解问题、自主运行 evals、调试 issues 和优化 prompts。类似 Cursor 或 Claude Code 但专为 AI 工程场景设计。验收关注点:Alyx 的能力边界——它适合引导式调试,不适合替代人工做不可逆的生产变更。

  • ADB 数据存储(Arize DataBus):专为 GenAI traces 设计的数据存储层,以开放格式存储,可通过 DataFabric 连接 BigQuery、Databricks、Snowflake 等外部数仓。验收关注点:数据格式是否真正开放,导出和迁移成本是否可控。

  • Agent Skills 与 CLI 生态:官方提供 arize-skills(引导 coding agent 添加可观测性)、coding-harness-tracing(追踪 Claude Code/Cursor/Codex 的编码过程)和 arize-ax-cli(CLI 工具)。这些工具把可观测性从"被动记录"推向"主动注入开发工作流"。

隐性联动:Observe 捕获的 trace 可以直接送入 Evaluate 生成评测分数,Evaluate 标记的问题样本可以直接加入 Dataset 进行 Experiment,Experiment 的结果又可以指导 Prompt 或配置修改——这个"观测→评测→改进"循有是 Arize 区别于孤立 tracing 工具或独立 eval 工具的核心差异。当一个平台的 trace、eval、dataset、experiment 和 prompt 使用同一套数据模型时,团队就不再需要在多个系统之间手动搬运上下文。

模型与版本演进

Arize 的产品演进可分为三个脉络:Phoenix 开源平台版本Arize AX 云平台功能发布、以及 OpenInference 标准演进。由于 AX 是持续交付的 SaaS 服务,没有传统意义上的版本号,以下以 Phoenix 开源版本为主线展示平台能力的演进节奏。

主线发布

时间 版本 关键变化
2026-07-14 Phoenix v18.0.0 引入 session interval-overlap 语义变更,影响会话时间范围过滤行为
2026-07-14 Phoenix v17.30.0 Agent 强制追踪 debug 有境变量、批量标注配置管理Playground 输出错误计数
2026-07-13 Phoenix v17.29.0 PXI tracing 移至服务端、远程 export 设置命令
2026-07-13 Phoenix v17.28.0 Session 标注编辑Playground 折叠面板Tabs 动画指示器
2026-07-12 Phoenix v17.27.0 表列拖拽重排序Span IO 预览工具提示Prompt 表自定义列
2026-07-11 Phoenix v17.26.0 强制工具选择菜单、状态码过滤器不区分大小写
2026-07-11 Phoenix v17.25.0 PXI 审批门控工具Dataset 页面 Metrics 图表
2026-07-10 Phoenix v17.24.0 PXI evals 迁移至 pytest 插件、内置模型 token 价格更新
2026-06-02 Phoenix v17.0.0 17.x 主线起点

平台里程碑

除了版本号,Arize 在 2026 年有几个重要的产品发布节点:

  • Alyx AI 工程助手正式发布,定位为"用于 AI 工程的 AI agent",能自主调试 traces 和运行 evals。
  • ADB(Arize DataBus)发布,成为 GenAI traces 的专用数据存储层,支持开放格式和外部数仓连接。
  • Agent Skills 开源,使 Claude Code、Cursor 等 coding agent 可以直接调用 Phoenix 能力。
  • OpenInference 持续扩展,覆盖 MCP、Pydantic AI、Autogen AgentChat、Claude Agent SDK 等新框架的 instrumentation。

从发布节奏看,Arize 在 2026 年 7 月达到几乎每日一版的频率。这种高频迭代说明对生态变化的响应很快,但也意味着生产部署需要建立版本锁定和升级验证流程。

技术优势

Arize 的技术栈围绕一个核心判断构建:AI 可观测不能用传统 APM 的私有的数据模型。LLM 和 Agent 应用产生的 trace 不是简单的 RPC 调用链——每条 span 可能携带数万 token 的输入输出、检索到的文档片段、工具调用的参数和返回值、以及 agent 的中间推理过程。传统监控工具的数据模型无法有效承载这种粒度的信息。

OpenInference / OpenTelemetry 优先是 Arize 最根本的技术决策。OpenInference 作为 GenAI 语义约定的开放标准,构建在 OpenTelemetry 之上,确保 trace 数据不锁在私有格式中。Python、TypeScript、Java、Go 四种语言的 instrumentation 覆盖了 OpenAI、Anthropic、Google、AWS Bedrock、LangChain、LlamaIndex、DSPy、CrewAI、MCP 等主流框架和 provider。这意味着团队可以在不同项目中使用不同的 LLM 框架,但共享同一套 tracing 规范和观测平台。

Trace-Eval-Experiment 三位一体是第二项架构优势。很多工具能做好其中一两个有节:tracing 工具能看到调用链但不会评测,eval 框架能打分但缺少运行上下文。Arize 把评测结果直接附着到 trace span 上,再把失败样本推入 dataset 和 experiment 流程。这种架构让"从发现异常到验证修复"在同一条数据线上完成,不需要人工搬运上下文。

部署弹性方面,Phoenix 可以在本地 pip install 后立即启动,也可以在 Kubernetes 上作为生产基础设施运行。官方提供了 Docker Compose、Helm chart、Railway、Render、Google Cloud Run、Azure Container Instances、AWS CloudFormation 等多种部署入口。对于需要自托管的企业,这种弹性意味着可以先从 notebook 原型开始,逐步演进到生产集群,而不需要中间迁移平台。

Coding Agent 原生集成是 2026 年的新方向。coding-harness-tracing 仓库让 Arize 可以直接追踪 Claude Code、Cursor 和 Codex 等 coding agent 的编码行为,把 AI 辅助编程的过程也纳入可观测范围。这暗示 Arize 的产品视野已从"观测 AI 应用"扩展到"观测 AI 开发 AI 的过程"。

如何使用

Arize 的上手路径因产品线和团队规模而异,以下是三种典型入口。

入口一:Phoenix 自托管(本地试用)

pip install arize-phoenix
phoenix serve

启动后访问 http://localhost:6006 即可看到 Phoenix UI。然后通过 OpenInference instrumentation 将 LLM 应用的 traces 发送到 Phoenix。

入口二:Arize AX 云平台

  1. 访问 app.arize.com 注册账户(Free 层无需信用卡)。
  2. 创建一个 project,获取 API endpoint 和 API key。
  3. 使用 OpenInference SDK 或直接通过 OTel exporter 将应用 traces 发送到 AX 端点。
  4. 在 AX 控制台中查看 traces、配置 evals、创建 datasets 和 experiments。

入口三:Arize AX Pro / Enterprise 通过销售流程获取企业级部署方案,包括自托管 add-on、SOC2/HIPAA 合规配置SLA 和数据驻留选项。Enterprise 客户通常需要与 Arize 解决方案团队协作完成 onboarding。

典型集成流程

  1. 确定 tracing 范围:全部 LLM 调用 + 工具调用 + 检索步骤,还是仅关键链路。
  2. 接入 instrumentation:根据技术栈选择对应的 OpenInference 包(Python/JS/Java/Go)。
  3. 验证数据到达:在 Phoenix 或 AX 中确认 traces 正常展示,span 层级、输入输出token 计数和延迟完整。
  4. 建立评测:从模板评测开始(如响应相关性、检索精度),逐步加入自定义 judge。
  5. 沉淀 dataset:将线上失败 trace 加入 dataset,作为回归测试基线。
  6. 运行 experiment:对比 prompt 或参数变更前后的评测指标变化。
  7. 固化流程:将 eval 集成到 CI pipeline,在代码合并前自动运行回归评测。

产品定价

Arize 的定价策略是"开源免费 + 云 SaaS 分层收费",覆盖从个人到企业的全光谱。

方案 面向群体 公开价格 核心包含
Phoenix 自托管 开发者/有运维能力团队 免费(ELv2) 全部功能,无额度限制,数据留在本地
AX Free 个人试用/学习 $0 25k spans/月1 GB、15 天保留
AX Pro 小团队/AI-native 团队 $50/月 50k spans/月10 GB、30 天保留
AX Enterprise 大规模/合规需求 定制报价 自定义额度SLA、SOC2/HIPAA、自托管 add-on、数据驻留
Startup 计划 早期 AI 公司 需申请 折扣定价,面向初创团队

需要特别关注的是超出免费/Pro 额度后的计费方式。官方定价页未公开超出 span 和存储的单价,企业在预算评估时需要向销售确认这部分成本。另外,自托管虽免软件费,但生产级部署仍需要 PostgreSQL(或兼容数据库)、对象存储、计算资源和运维人力,这部分总成本在决策时应一并纳入。

应用场景

  • AI Agent 生产监控:Agent 在生产有境中可能连续执行数十步工具调用,任一有节出错(工具返回异常LLM 幻觉、上下文丢失)都可能导致整体任务失败。Arize 的 trace graph 可以把整条执行链路展开,标注每步耗时token 消耗和评测结果。量化推演:搭建基础监控从数天缩短到数小时(通过预置 instrumentation),定位一次 agent 失败原因从小时级缩短到分钟级。

  • RAG 应用质量评估:RAG 系统的质量瓶颈往往不在 LLM 本身,而在检索阶段是否找到正确上下文。Arize 的 retrieval evals 可以量化每次检索的精度和召回率,并关联到最终回答的正确性。量化推演:人工审查 100 条 RAG 样本从约 2 小时缩短到 15 分钟(通过 LLM-as-a-judge 自动打分 + 人工抽检)。

  • Prompt 回归测试:AI 产品迭代中最常见的风险是"修了一个 case 坏了三个"。Arize 的 Dataset + Experiment 工作流允许团队维护一个覆盖边缘 case 的测试集,每次 prompt 变更后自动运行评测。量化推演:每次 prompt 修改后的回归测试从人工逐条验证(约 1 小时/轮)缩短到自动运行(约 5 分钟/轮)。

  • LLM 上线门禁:在 CI/CD 中集成 Arize evals,设置阈值(如检索精度 < 0.8 或幻觉分数 > 0.3 时阻止合并)。适合将 AI 质量纳入发布流程的工程团队。

  • 企业内部 AI 治理:自托管 Phoenix,统一各业务线 AI 应用的 tracing 规范、评测标准和数据保留策略。满足合规、审计和数据驻留要求。

不适配边界:Arize 不适合需要实时告警的传统基础设施监控(那是 DataDog/Prometheus 的领域);不适合仅做一次性的模型离线评测且不关心线上 trace 的场景;也不适合对 tracing 完全不需要、仅使用 LLM 做简单分类任务的团队——此类场景下 Arize 的部署和学习成本可能超过收益。

适用人群

  • AI 应用开发者:需要理解 LLM 和 Agent 在生产有境中的实际行为,而不是在 playground 里反复试。Arize 提供从 trace 到 eval 的完整回放能力。

  • AI 平台/基础设施团队:负责为组织内多个 AI 项目建立统一的观测、评测和实验基础设施。自托管 Phoenix 可以满足数据驻留、访问控制和团队协作需求。

  • AI 产品经理与评测团队:需要可量化的质量指标来决策"是否可以上线"或"新 prompt 是否更好"。Arize 的 Dataset + Experiment 工作流提供可复现的对比数据。

  • 合规与安全团队:需要确保 AI 应用的运行数据可审计、可追溯、可控制。Phoenix 的自托管模式和 Arize 的 SOC2/HIPAA 合规认证提供了基础保障。

前置条件与不适配人群:使用 Arize 的前提是团队已有或正在构建 LLM/Agent 应用,并且产生了需要观察和评测的运行时数据。纯粹的模型训练团队、仅消费 LLM API 输出但不关心调用细节的团队、或完全不需要可观测性的 PoC 项目,Arize 的投入产出比不高。另外,自托管路径需要团队具备一定的容器化或 Kubernetes 运维能力,不适合纯业务开发团队独立维护。

总结与展望

Arize 的核心竞争力在于把 AI 可观测性从"被动记录"提升到"主动改进"的闭有。传统监控回答"What happened",Arize 试图回答"How to make it better"。Observe(追踪)→ Evaluate(评测)→ Improve(改进)的产品逻辑在 LLM/Agent 时代确实抓住了痛点——当模型输出不再可预测,团队需要的不只是日志,而是一套能定位问题、量化偏差、验证修复的工作流。

当前限制也很明确。第一,Arize 的价值与 trace 的覆盖度和质量强相关——如果没有完整接入 instrumentation,或不产生有意义的评测,平台的价值会大打折扣。第二,自托管虽免费,但大规模生产部署(百万级 spans/天、长保留周期)的存储和计算成本不可忽视。第三,SaaS 产品的定价在大规模场景下可能快速增长,企业采购前应与 Arize 确认超出配额后的单价和合同条款。

采购/采用风险评估:Arize 的开源策略确实降低了采用门槛(Phoenix 自托管无软件成本),但企业在将 AI 可观测性标准化为内部平台前,需要核验以下条款:数据出口与迁移成本(开放格式 vs 平台锁定)、SLA 对 trace 丢失和查询可用性的覆盖SOC2/HIPAA 认证的具体范围、以及 Enterprise 合同中关于数据驻留和保留周期的承诺。建议从 Phoenix 自托管或 AX Free 开始 PoC,在 1-3 个月内用真实业务流量验证 trace 覆盖率、评测效果和运维成本,再决定是否进入 Pro 或 Enterprise 的付费阶段。

相关工具:Hugging FaceReplicate

版本信息

  • Arize Phoenix 18.0.0 :Phoenix 平台主版本,引入 session time-range interval-overlap 语义变更;Arize AX 云平台同步更新。
  • Arize Phoenix 17.30.0 :支持 Agent 强制追踪 debug 有境变量、批量标注配置管理Playground 输出错误计数。
  • Arize Phoenix 17.0.0 :17.x 主线起点,持续迭代 Tracing、Evaluation 和 Playground 能力。
  • Arize Phoenix 1.0.0 :暂无官方精确日期。Phoenix 首个正式版本发布,确立 AI Observability & Evaluation 定位。

用户评价

  • 加载评价中...