ピスト 無料

-

Fixie は、AI エージェントを構築、ホスト、展開するためのフルスタック機能を提供し、自然言語対話とエンタープライズ システム統合をサポートするエンタープライズ グレードの会話型 AI エージェント プラットフォームです。

ピスト 製品インターフェース

フィクシー(ウルトラボックス)

Fixie のコアパラメータと統計

パラメータ データ
製品のポジショニング リアルタイム音声AIインフラ層+音声ネイティブマルチモーダル大規模モデル
コアテクノロジーロードマップ 音声ネイティブ マルチモーダル LLM (エンドツーエンドの音声理解、独立した ASR ステージなし)
最新モデルバージョン Ultravox v0.7 (2025-12)
ベースLLM Llama 3.3 70B / 8B、あらゆるオープンソースの重量モデルに適応可能
オープンソースライセンス MIT (GitHub)、Apache-2.0、カスタム (一部 SDK)
モデルの重量ホスティング ハグフェイス (fixie-ai 組織、24 モデル、37 データセット)
GitHub スター 4,500+ (ultrabox メイン リポジトリ)
GitHub フォーク 381
SDK 言語サポート JavaScript / Python / Android (Kotlin)
製品形態 ホスト型 API (Ultravox Realtime Platform) + オープンソース モデルの重み
呼び出しの同時実行制限 従量課金制の 5 ウェイ同時実行、Pro にはハード制限なし
価格モデル $0.05/分 (TTS 込み)、最初の 30 分は無料
コンプライアンス認証 SOC 2 (Delve Trust プラットフォーム経由)

Fixie は当初「会話型 AI エージェント プラットフォーム」としてスタートし、その後大きな戦略的変革を遂げました。製品の焦点を リアルタイム音声 AI に完全に移し、Ultravox 音声ネイティブ マルチモーダル大型モデルとサポート リアルタイム音声エージェント プラットフォームを発売しました。元の fixie.ai ドメインは、ultravox.ai にリダイレクトされます。同社の法人はFixie.AIのままとなり、製品ブランドはUltravoxに統一される。

Fixie のユーザーと市場での認知度

現場でのユーザー意識が徐々に高まり、コンテンツ作成者やチームは製品の機能を使用して作業効率を向上させます。特定のユーザー規模および業界での導入データは、公式リアルタイム ページの対象となります。

ピストのコスト上の利点

Fixie (Ultravox) のコスト構造は 3 層のユーザー モデルをカバーしており、価格戦略はリアルタイム音声 AI トラックにおいて大幅にコスト効率が高くなります。

C クライアント/個人開発者層:

  • 従量課金制プラン: 30 分間の無料通話割り当てを含む月額 $0、超過 $0.05/分 (TTS 料金を含む)、5 方向同時ハード制限、無制限のプレイグラウンド通話。
  • これは、現在市場にあるリアルタイム音声 AI API の無料参入障壁の中で最も低いものの 1 つです。 OpenAI Realtime API (オーディオ入力 0.06 ドル/分 + オーディオ出力 0.24 ドル/分) と比較すると、Ultravox のすべて込みの価格 0.05 ドル/分は、明らかにコスト上の利点があります。

API 呼び出し層:

  • スレッド価格 (テキスト/ツール呼び出し): $2.00/100 万入力トークン (非キャッシュ)、$15.00/100 万出力トークン、キャッシュされた入力トークンは無料です。
  • SIP トランキング: 0.5 セント/分 (従量課金制)、0.48 セント/分 (プロ)。
  • Pro プランは月額 100 ドルで、同時実行のハード制限が解除され、5 つのカスタム サウンド、20 の RAG コーパス、およびアウトバウンド ダイヤル スケジューラが含まれます。

エンタープライズ/プライベート展開層:

  • エンタープライズ版は、優先SLA、組織管理サポート、全機能カスタマイズなど、オンデマンドでカスタマイズ可能です。価格は非公開となっておりますので、営業担当者までお問い合わせください。
  • モデルの重みはオープンソース (MIT ライセンス) です。企業は API 料金を負担せずに推論を独自にデプロイできますが、独自の GPU インフラストラクチャを管理する必要があります。アダプターのトレーニングは、中程度のハードウェアしきい値を使用して、8xH100 で 2 ~ 3 時間で完了できます。

暗黙的なコストの考慮事項: 音声 AI の実際のコストには、API の単価だけでなく、会話の品質 (やり直し/労働移動率)、遅延 (ユーザー エクスペリエンスへの影響)、カスタマイズされた開発投資も含まれます。 Ultravox のエンドツーエンドの音声ネイティブ アーキテクチャは、「ASR + LLM + TTS」パイプライン ソリューションよりも遅延が 30 ~ 50% 低く、遅延によるユーザー チャーンのコストが間接的に削減されます。

Fixieの主な機能

  • 音声ネイティブ推論: Ultravox モデルは、別の ASR (音声からテキストへ) ステージを経由せずに、オーディオ空間で直接意味の理解を実行します。オーディオは、マルチモーダル プロジェクターを通じて LLM の高次元意味空間に直接マッピングされ、モデルは意味内容とパラ言語信号 (イントネーション、リズム、感情) を同時に理解します。これは、従来のカスケード アーキテクチャとの本質的な違いです。

  • リアルタイム会話管理: WebSocket と REST API の 2 つのアクセス方法を通じて、リアルタイムの音声対話機能を提供します。このプラットフォームは、通話のライフ サイクル (確立、保守、終了)、会話ステータスの追跡 VAD (音声アクティビティ検出)、およびエンドポイント検出 (エンドポインティング) を管理するため、開発者は基礎となるシグナリングに対処する必要がありません。

  • UltraVAD 音声アクティビティ検出: 発話完了確率、一時停止モード、反射一時停止、およびターン終了の区別に基づいた自社開発のニューラル VAD モデル (UltraVAD v0.1) により、より自然な対話リズム制御を実現し、中断や気まずい沈黙を軽減します。

  • マルチプラットフォーム SDK とテレフォニーの統合: JavaScript、Python、Android の 3 端末 SDK、主流の通信事業者 (Twilio など) との組み込み統合機能を提供し、PSTN 通話を送受信するための SIP トランクをサポートします。

  • RAG ナレッジ ベース アクセス: Pro プランは最大 20 コーパスをサポートし、音声エージェントは会話中に企業ナレッジ ベースのコンテンツを取得して、複雑なビジネスの質問と回答のシナリオをサポートできます。

  • アウトバウンド コール スケジューラ: Pro プラン以上では、顧客の再訪問、予約リマインダー、バッチ通知、その他のシナリオに適した自動アウトバウンド コール管理が提供されます。

  • プレイグラウンド サンドボックス テスト: 無料のオンライン プレイグラウンドを提供します。これにより、開発者はコードを書かずに音声エージェントの対話効果をテストでき、デバッグ コストを削減できます。

[専門家の見解]: Ultravox の核となる相乗効果は、「音声ネイティブ モデル + マネージド推論プラットフォーム + 通信統合」の三位一体にあります。各ノード (STT モデル → LLM → TTS エンジン → 通信プロバイダー) を個別に選択する必要がある従来のソリューションとは異なり、Ultravox はオーディオ入力からオーディオ出力までのフルマネージド リンクを提供し、システム統合の障害点を減らし、単一コンポーネントに限定されるのではなくスタック全体でレイテンシの最適化を実行できるようにします。

Fixie のモデルとバージョンの進化

Fixie のモデルの進化には明確な軌跡があり、すべて Ultravox ブランドでリリースされ、各バージョンはオープンソースのウェイトを提供します。

メインライン リリース

バージョン 日付 ベースモデル 主な変更点
ウルトラボックス v0.3 2024-08 初期バージョン 最初のバージョンのパブリック プレビュー、オーディオからテキストへのストリーミング推論をサポート
ウルトラボックス v0.4 2024-08 ラマ 3 最初の本番対応バージョン、8xH100 で 2 ~ 3 時間で 14K ステップのトレーニング
ウルトラボックス v0.4.1 2024-11 ラマ 3 安定性とパフォーマンスの向上
ウルトラボックス v0.5 2025-02 ラマ 3.2 1B 軽量版、HF ダウンロード数 118 万
ウルトラボックス v0.6 2025-06 ラマ 3.3 70B / ジェマ 3 27B / クウェン 3 32B 大規模な推論機能をサポートするマルチベース バリアント
ウルトラボックス v0.7 2025-12 GLM-4 6B Big Bench Audio SOTA (91.8% / 97% 思考あり)

製品プラットフォームの進化

  • 2023-2024: Fixie はユニバーサル会話型 AI エージェント プラットフォームとして動作し、エンタープライズ レベルのエージェント構築、ツール統合、およびマルチチャネル導入機能を提供します。現段階での製品の位置づけは、現在市場に出ているDifyやCozeなどのプラットフォームと同様です。
  • 2024-08: 音声 AI トラックに目を向け、Ultravox v0.3 のプレビュー バージョンをリリースし、Ultravox リアルタイム API の内部テスト アプリケーションをオープンします。
  • 2025 年から現在: 製品の焦点は完全に Ultravox ブランドに移行しました。元の fixie.ai ドメイン名は、ultravox.ai にリダイレクトされ、元の対話エージェント プラットフォームの関連機能は徐々に薄れていきました。同社は現在、中核となる製品提供形式として Ultravox Realtime Platform を使用しています。

フィクシーの技術的利点

アーキテクチャ設計: 音声ネイティブ マルチモーダル LLM

Ultravox の中核となるテクノロジーの選択は、オーディオを二次コンポーネントとしてではなく、最初の入力モダリティとして使用することです。モデル アーキテクチャは: オーディオ エンコーダー → マルチモーダル プロジェクター (アダプター) → 事前トレーニングされた LLM (凍結) → テキスト トークン出力 です。この設計により、次の 3 つの重要な効果がもたらされます。

  1. カスケード遅延の排除: 従来の音声 AI システムは、「音声アクティビティ検出 → ASR 認識 → LLM 推論 → TTS 合成」の 4 段階のパイプラインを通過する必要があり、各段階で数百ミリ秒の遅延が発生します。 Ultravox のエンドツーエンド アーキテクチャは、カスケード ソリューションよりも大幅に短い最初の単語までのレイテンシ (TTFT) でオーディオを意味空間に直接マッピングします。
  2. パラ言語情報の保持: イントネーション、強勢、話す速度、ポーズなどのパラ言語信号はテキスト変換プロセスで失われますが、Ultravox はこの情報をオーディオ表現で直接処理し、モデルがユーザーの感情や含意を認識できるようにします。
  3. 柔軟なベース適応: Adater アーキテクチャにより、Ultravox は単一のモデル エコシステムに束縛されることなく、オープンソースの加重 LLM (Llama、Mistral、Gemma、Qwen、GLM) にアクセスできます。 1B から 70B までのパラメーター サイズをカバーする 6 つのベース バリアントがリリースされました。

トレーニング効率: トレーニング中にアダプター層のみが更新され、LLM とオーディオ エンコーダーはフリーズされたままになります。 v0.4 では、8xH100 で 14K ステップをトレーニングするのにわずか 2 ~ 3 時間しかかかりません。このトレーニング コストの低さは、企業が独自のデータを使用して、手頃な予算で音声モデルを微調整できることを意味します。

推論インフラストラクチャ: Ultravox は独自の推論スタックを構築し、外部 LLM プロバイダーや共有推論プールに依存しないため、制御可能なレイテンシーとキュー ジッターのないことが保証されます。このプラットフォームは 5 から無制限の同時通話をサポートし、フルマネージド アーキテクチャにより運用とメンテナンスの負担が軽減されます。

評価の主な利点: Big Bench Audio は業界で認められた音声 AI 評価ベンチマークであり、Ultravox v0.7 の 91.8% (推論なし) と 97% (推論あり) は両方とも業界最高です。 GPT-4 リアルタイム (OpenAI のエンドツーエンド音声ソリューション) と比較して、Ultravox は同等またはより低い遅延でより高い理解精度を実現します。

フィクシーの使い方

Fixie (Ultravox) は 4 つのアクセス レベルを提供し、実験から実稼働までの完全なパスをカバーします。

入口 対象者 主な用途 コスト
Ultravox リアルタイム API 開発者 / ISV 実稼働グレードの音声エージェントの統合 0.05 ドル/分から
プレイグラウンド (app.ultrabox.ai) 非技術系スタッフ・製品評価 会話テストと経験 無料(無制限)
オープンソース モデルの重み (顔に抱きつく) ML エンジニア/研究者 自己ホスト型推論、微調整、学術研究 無料 (MIT ライセンス)
SDK(JS / Python / Android) フロントエンド / バックエンド / モバイル開発者 クライアントの統合 無料 (オープンソース)

一般的なアクセス プロセス:

  1. アカウントの登録: app.ultravox.ai にアクセスしてアカウントを作成すると、自動的に 30 分間の無料通話が利用できます。
  2. プレイグラウンド テスト: システム プロンプトを構成し、サウンドを選択し、プレイグラウンドで RAG コーパスをセットアップし、リアルタイムで対話効果をテストします。
  3. API キーの取得: REST API または WebSocket インターフェイス認証用の API キーをコンソールから取得します。
  4. SD​​K の統合: アプリケーション プラットフォーム (Web の場合は JS、Android の場合はバックエンド Kotlin の場合は Python) に応じて対応する SDK を選択し、アクセスについては公式ドキュメントを参照してください。
  5. テレフォニーの構成 (オプション): PSTN 通話機能が必要な場合は、SIP トランクを構成するか、Twilio などの通信プロバイダーに接続します。
  6. 運用展開: 運用のためにオンラインにするには、従量課金制 (低同時実行) または Pro (高同時実行) プランを選択します。

セルフホスト推論 (上級): Hugging Face からモデルの重みをダウンロードし、Docker イメージまたは Poetry を使用して推論サービスを開始します。公式には、BaseTen プラットフォームのマネージド展開オプションを提供し、カスタム GPU インフラストラクチャもサポートしています。

ピストの製品価格

Ultravox は「使用量 + サブスクリプション」のハイブリッド価格モデルを採用しており、価格ページはオープンかつ透明です。

請求の次元 従量課金制 プロ(年払い) エンタープライズ
月額料金 $0 $100/月 カスタム見積もり
通話料金 $0.05/分 $0.05/分 カスタマイズされた
SIP トランキング 0.5¢/分 0.48¢/分 カスタマイズされた
スレッド入力トークン $2.00/100 万 (キャッシュなし) $2.00/100 万 (キャッシュなし) カスタマイズ
スレッド出力トークン $15.00/100万 $15.00/100万 カスタマイズ
入力トークンをキャッシュする 無料 無料 無料
無料期間 30分 30分 カスタマイズされた
遊び場での通話 無制限 無制限 無制限
同時実行の上限 5ウェイ ハードキャップなし カスタマイズ
カスタムサウンド 1 5 カスタマイズされた
RAG コーパス 2 20 カスタマイズされた
アウトバウンド コール スケジューラ
優先 SLA
組織管理

無料割り当て戦略: 最初の 30 分間は完全に無料 (TTS 料金を含む)、プレイグラウンド コールの数に制限はなく、概念実証や小規模なトラフィックの試験運用に適しています。競合製品と比較すると、OpenAI Realtime API には無料の割り当てがありません。また、Gemini Live には同様の価格モデルがありますが、生態系が異なります。

コスト構造の控除: 1 日あたりの通話数が 1,000 件、平均通話時間が 3 分の顧客サービス シナリオを例にとると、月間通話量は約 90,000 分、コストは月額約 4,500 ドルになります (Pro サブスクリプション料金を除く)。従来の ASR + LLM + TTS ソリューションを同じ規模で使用すると、ASR コスト (ディープグラムなどは約 0.0059 ドル/分) に LLM 推論 (約 0.01 ~ 0.03 ドル/回) と TTS のみがかかり、総コストは約 5,000 ~ 8,000 ドル/月になります。 Ultravox のすべて込み価格 0.05 ドル/分は、現在の市場で競争力があります (公開データの控除、非公式の約束に基づく)。

修正アプリケーションのシナリオ

  • カスタマー サービス音声エージェント: 企業は、Ultravox をカスタマー サービス ホットラインに接続し、一般的な問い合わせ (注文状況、返品と交換、予約の確認) を処理する手動のエージェントに代わって、または支援します。音声ネイティブ アーキテクチャの自然なインタラクティブ エクスペリエンスにより、「機械による顧客サービス」に対するユーザーの抵抗感が軽減されます。通話が完了すると、概要が自動的に生成され、CRM に書き込まれることができます。 検証のポイント: シングルチャネル会話の初回解決率 (FCR) と手動転送率。

  • アウトバウンド マーケティングと再訪問: アウトバウンド コール スケジューラを使用して、顧客の再訪問、満足度調査、更新リマインダーなどのアウトバウンド コール タスクをバッチで実行します。エージェントは会話に基づいてリアルタイムで言葉を調整し、興味を持った顧客を手動販売にシームレスに転送できます。 検証のポイント: 従来の AI 発信ソリューションとの接続率、コンバージョン率、切断率の比較。

  • 健康診断の予約と事前相談: 診療所や病院は Ultravox に接続して、予約の登録、スケジュール変更、検査のリマインダーなどを処理します。エージェントは自然な対話を通じて患者の症状情報(事前相談)を収集し、医療スタッフの業務負担を軽減します。 検証キー: HIPAA レベルのデータ セキュリティ要件に準拠します。

  • 社内従業員サービス: 大企業は、IT サポート、人事相談、旅行申し込みなどの社内業務を処理するために、従業員ホットラインに音声エージェントを導入しています。従業員は音声を通じて自然に問題を説明でき、エージェントはバックエンド システム (ServiceNow、Workday など) を呼び出してアクションを実行します。 チェックすべき重要なポイント: 既存の SSO およびエンタープライズ システムとの統合の深さ。

  • 音声主導型 AI 教育コンパニオン: 言語学習、知識テスト、面接シミュレーションなどのシナリオでは、Ultravox のリアルタイム会話機能により、学習者に没入型のスピーキング練習体験を提供でき、また、パラ言語情報の保持により、発音やイントネーションの修正が可能になります。 検証の焦点: 英語以外の言語の認識精度。

ピストはこんな人に向いています

  • 音声 AI アプリケーション開発者: 音声エージェントを迅速に構築する必要がある独立系開発者またはスタートアップ チーム。 Ultravox のフルマネージド API により、音声 AI の統合時間が数週間から数日に短縮されます。独自の ASR/TTS パイプラインを構築する必要はなく、API を呼び出して SDK を組み込むだけです。 境界には適していません: ASR または TTS パラメータの詳細なカスタマイズ (特定のアクセントや方言に対する特別な最適化など) が必要なシナリオでは、Ultravox に基づくホスティング プラットフォームは、自社構築ソリューションほど柔軟性が低い可能性があります。

  • 中規模および大規模企業の AI チーム: AI インフラストラクチャ チームを持つ企業は、Ultravox を音声 AI レイヤーとして既存の顧客サービス、マーケティング、人事システムに統合できます。 Pro プランには同時実行制限がなく、規模のニーズを満たすエンタープライズ レベルの SLA がありません。 境界には適していません: 英語以外の言語 (特に中国語、日本語、アラビア語など) で高精度の意味理解を達成する必要がある企業は、購入を決定する前に、Playground を通じて現在の言語で Ultravox のパフォーマンスをテストすることを優先する必要があります。

  • AI 研究機関および学術ユーザー: Ultravox のオープンソース ウェイトと MIT ライセンス、および公開トレーニング コード (MosaicML / PyTorch に基づく) は、音声マルチモーダル研究のための再現可能なベースラインを提供します。 24 のモデルと 37 のデータセットが完全な研究エコシステムを構築します。 不適合な境界: 完全なエンドツーエンドの音声生成 (音声出力) を必要とする研究シナリオ - Ultravox は現在テキスト トークンのみを出力し、音声合成は外部 TTS コンポーネントに依存する必要があります。

  • AI プロダクト マネージャーおよび意思決定者: リアルタイム音声 AI テクノロジーを評価するテクノロジー選択チーム。 Ultravox は、開発コストをかけずに製品コンセプトを検証するために、Playground で無料のテストを提供しています。パイロットから拡張まで段階的に導入できる透明な従量課金制の価格設定。 不適切な境界: 非常に高い遅延要件 (エンドツーエンドで 200 ミリ秒未満) が必要なリアルタイム インタラクション シナリオの場合、検証のために実際の負荷テストを実施することをお勧めします。

概要と展望

Fixie (Ultravox) の核となる競争力は、音声ネイティブのマルチモーダル アーキテクチャによってもたらされる遅延と品質という 2 つの利点と、フルマネージド プラットフォームの統合の複雑さの軽減にあります。急速に成長するリアルタイム音声 AI 市場において、Ultravox は現在、オープンソース モデルの重み付けと運用グレードのマネージド API の両方を提供する数少ないエンドツーエンド ソリューションの 1 つです。 Big Bench Audio SOTA スコアとオープンソース エコシステム (4,500 以上のスター、24 モデル、数百万のダウンロード) により、技術的なルートの実現可能性が検証されます。

現在の制限と不確実性:

  1. 製品変革期間中の曖昧な位置付け: 一般的な対話エージェント プラットフォームから音声 AI 固有のプラットフォームへの変革の過程で、元の Fixie ブランド資産 (ドキュメント、ケース、コミュニティ意識) と新しいブランド Ultravox の間に断絶が生じます。訪問者は fixie.ai から入った後、Ultravox.ai に直接ジャンプするため、新規ユーザーは 2 社の関係について混乱する可能性があります。
  2. テキスト出力のみをサポート: 現在のモデル出力はテキスト トークンであり、音声合成は外部 TTS に依存する必要があり、真のエンドツーエンド音声出力 (つまり、オーディオ トークン → オーディオ デコード) はまだ実装されていません。公式ロードマップには「Speech Generation Coming Soon」と記載されていますが、具体的なスケジュールはまだありません。
  3. 英語以外のサポートの充実度: 評価データ (Big Bench Audio) とモデルのトレーニングは英語に基づいており、中国語や日本語などの非英語言語のサポートの深さは公的に検証されていません。アジア市場をターゲットとする企業には追加の評価が必要です。
  4. オープンソース戦略の商業的持続可能性: オープンソース モデルの重みと商用ホスティング API の 2 つのラインを維持しながら、長期的にはオープンソース バージョンと商用バージョンの間の機能差別化のプレッシャーに直面する可能性があります。

調達/採用リスク評価: 2026 年から 2027 年にリアルタイム音声 AI 機能の導入を計画している企業の場合、まず Playground を通じて特定のビジネス言語およびシナリオにおける Ultravox のパフォーマンスを検証することをお勧めします。満足度を確認した後、少量のトラフィック パイロット (1 ~ 3 か月間) で従量課金制プランを使用し、実際の通話品質、遅延、労働移動率に基づいて Pro プランまたは Enterprise プランにアップグレードするかどうかを決定します。 SLA 条件 (特に同時実行の上限、可用性の保証) とデータ トレーニングの使用ポリシー (モデルが二次トレーニングに企業通話データを使用するかどうか) を契約に明確に記載する必要があります。エンドツーエンドの音声出力 (オーディオからオーディオ) が必要なシナリオの場合は、音声生成機能における Ultravox の公式の進歩に注意を払うか、または Celebrities や Cartesia などの純粋な TTS ソリューションの補完的な統合を同時に評価することをお勧めします。

関連ツール: CrewAI、langchain

フィクシーの使い方

  • Webクライアント:公式Webサイトにアクセスし、アカウントを登録することで利用できます。ほとんどの機能はインストールする必要がありません。
  • API アクセス: RESTful API を提供し、開発者は API キーを取得して独自のアプリケーションに統合できます。

バージョン情報

  • 安定した :カスタム エージェント ツール セットとサードパーティ システムのより深い統合をサポートします。公式の正確な日付はまだありません。
  • 初期リリース :最初の公開バージョンは、会話型 AI エージェントの構築と展開をサポートします。公式の正確な日付はまだありません。

ユーザーレビュー

  • レビューを読み込み中...