HMA (異種マスク自己回帰)
無料
HMA (Heterogeneous Masked Autoregression) は、MIT、Meta FAIR、UIUC が共同で提案したロボットのアクションとビデオの動的モデリング手法です。異種マスクの自己回帰事前トレーニングを通じて、クロスオントロジーおよびクロスドメインのアクションビデオの結合分布が 40 以上のデータセットと 300 万以上の軌跡で学習され、リアルタイムの高忠実度ロボット ビデオ シミュレーションが実現します。以前の SOTA と比較して、推論速度が 15 倍向上し、戦略評価、合成データ生成、インタラクティブなビデオ シミュレーションに幅広く使用できます。
HMA: 現実世界のためのロボット アクション - ビデオ ダイナミック モデリング
コアパラメータと統計
| プロジェクト | 詳細 |
|---|---|
| 製品名 | HMA (異種マスク自己回帰) |
| 製品タイプ | オープンソース研究モデル / ロボット世界モデル |
| 納品形態 | オープンソース コード (GitHub) + 事前トレーニングされた重み (HuggingFace) |
| モデルスケール | HMA-MagVit: 362M パラメータ; HMA-MAR: 1B パラメータ |
| トレーニングデータ | 40 以上のデータセット、300 万以上の軌跡 |
| 推論速度 | SOTAより15倍高速(リアルタイム動作) |
| オープンソースライセンス | Apache-2.0 |
| サポートされている言語 | 英語 |
| 対象ユーザー | ロボット研究者、身体知能エンジニア、AI シミュレーション開発者 |
| コアペーパー | arXiv 2502.04296 (2025 年 2 月) |
| プロジェクトのホームページ | https://liruiw.github.io/hma |
パラメータの解釈: HMA のパラメータ サイズは「中~大」の範囲にあります。MagVit バージョン (362M) はシングル GPU 推論と高速反復に適しており、MAR バージョン (1B) はビデオの忠実度がさらに向上しています。以前の主流の拡散モデル ソリューション (UniPi や VideoPoet など) と比較して、HMA はマスクされた自己回帰ルートを採用しており、生成速度 (15 倍の加速) において桁違いの利点があります。これがその中核となるエンジニアリング価値です。初めて、ロボット ビデオ シミュレーションを「インタラクティブなリアルタイム」の閾値に押し上げます。
ユーザーと市場の認識
学術採用シグナル: HMA は、2025 年 2 月に arXiv で公開されてからすぐにロボット工学学習コミュニティの注目を集めました。論文の著者は MIT CSAIL、Meta AI (FAIR)、および UIUC の出身です。この組み合わせ自体が学術的に強い信頼性をもたらします。プロジェクトの GitHub リポジトリ (github.com/liruiw/HMA) には現在 41 個のスターが表示されています。これは大規模なコミュニティ プロジェクトではありませんが、その専門性 (ロボット ビデオ ダイナミック モデリング) を考慮すると、このデータは初期の研究プロジェクトの期待と一致しています。
サードパーティ通信: HMA は AI ツール セット ナビゲーション ステーション (ai-bot.cn) に含まれており、Bilibili などのプラットフォームに複数の技術解説ビデオ (「MIT の最新研究! HMA: 15 倍高速、高品質なロボット動作データ生成!」など) が公開されており、中国のテクノロジー コミュニティでも注目を集めていることがわかります。この論文は、arXiv では cs.RO (ロボティクス) に分類され、学際的な影響を反映して、cs.CV (コンピューター ビジョン) および cs.LG (機械学習) と相互参照されています。
ベンチマーク パフォーマンス: 複数の SOTA ビデオ生成モデルと比較して、HMA は視覚的な忠実性 (FVD インジケーター) と制御性 (アクション追跡精度) の両方でリードしています。この論文では、Bridge、Dobb-E、Kaist などの複数の実際のロボット データセットに関する定性的および定量的な結果が示されています。HMA によって生成されたビデオは、物理的合理性 (オブジェクトの相互作用、シャドウ、オクルージョンの処理) の点でベースライン手法よりも大幅に優れています。
現在の制限事項: HMA は学術研究プロジェクトであるため、商用バージョンやエンタープライズ レベルのサポートをまだ提供していません。そのユーザーベースは主に、深層学習トレーニングとロボット展開機能を備えた研究チームに限定されています。 GitHub スターの数とコミュニティ活動は初期段階にあり、完全なドキュメント エコシステムとユーザー コミュニティはまだ形成されていません。
コストメリット
HMA の完全にオープンソース モデルは、そのコスト構造が市販のロボット シミュレーション ツールとはまったく対照的です。
| コスト ディメンション | HMA (オープンソース) | 商用ロボット シミュレーター (NVIDIA Isaac Sim など) | クラウドビデオ生成API |
|---|---|---|---|
| Cサイド/研究者 | 完全に無料、コード + ウェイトのオープンソース | 無料のコミュニティバージョンは機能が制限されており、フルバージョンにはエンタープライズライセンスが必要です | トークン/秒で請求され、長いビデオは高価です |
| API / 開発者 | API レイヤーがないため、推論を自分でデプロイする必要があります | Python SDK が提供されます。GPU クラスターが必要です | リクエストに応じて請求されます。通常、1 秒あたり 0.01 ~ 0.10 ドル |
| エンタープライズ/プライベート | セルフホスト型、ライセンス料なし、GPU ハードウェアのみ | Isaac Sim Enterprise Edition の費用は年間 10,000 ドル以上 | 民営化には反対 |
C 側のコスト: 研究者は、GitHub を通じて直接リポジトリのクローンを作成し、事前トレーニングされた重み (0.4B/1B) を HuggingFace にダウンロードし、単一の RTX 3090/4090 で推論とインタラクティブなデモを実行できます。実際にかかる費用はハードウェアのコストのみです。
開発者のコスト: HMA は商用 API を提供しません。ワークフローに統合するには、チームは環境構成 (Python 3.10 以降、PyTorch、Accelerate、その他の依存関係)、モデルのデプロイメント、および推論パイプラインの構築を自分たちで完了する必要があります。初期導入コストは約 2 ~ 5 人日で、DL Ops 機能を持つチームに適しています。
エンタープライズコスト: 商用シミュレーター (NVIDIA Isaac Sim Enterprise Edition 10,000 ドル/年以上、Amazon RoboMaker は時間単位で請求) と比較すると、HMA には TCO が大幅に有利です。ソフトウェア ライセンスは不要ですが、モデルのデプロイメントとチューニングの能力を備えたチームが必要です。隠れたコストは主に、データの準備 (ロボットの軌跡データを RLDS 形式に変換する必要がある)、モデルのトレーニング後の適応 (特定のロボット オントロジーに対する実験の微調整)、および商用サポートの欠如に反映されます。
無料の真実: HMA は完全に無料でオープンソースですが、「無料」の前提は、ユーザーが Python ディープラーニング開発環境を構築する能力と、ロボットの動作データを取得する能力を持っていることです。ロボットデータを蓄積していないチームの場合、軌道を一から収集するコストは商用ツールの年間料金を超える可能性があります。
主な機能
-
異種マスク自己回帰ビデオ予測: 初期フレームとアクション シーケンスが与えられると、HMA は後続のビデオ フレームを自己回帰的に生成します。フレームごとに独立して生成される拡散モデルとは異なり、マスクされた自己回帰メカニズムはトークン レベルでタイミングの依存関係をモデル化し、単一のステップで複数の将来のトークンを予測できるため、推論効率が大幅に向上します。 適用可能なタスク: ロボット戦略の迅速なビデオ ロールバック評価と計画結果の視覚化。
-
クロスオントロジー、クロスドメイン異種事前トレーニング: HMA は 40 以上のデータセットで共同トレーニングされ、データ ソースには実際のロボット遠隔操作 (Bridge、Dobb-E、Kaist)、人間の操作ビデオ (EpicKitchens)、シミュレーション データ (RLBench、MetaWorld) などが含まれます。モデルはロボット オントロジーごとに個別にトレーニングする必要はなく、事前トレーニングされた重みを直接使用できます。見たことのないロボットの姿。 使用価値: 新しいロボット シナリオでのモデル展開のしきい値を下げ、数週間にわたるデータ収集を数週間後のトレーニングと適応に圧縮します。
-
デュアルモーダル生成 - 離散トークンと連続トークン: HMA-MagVit は、VQ-VAE 離散化 (362M パラメーター) を使用して、正確な制御と構造化された評価に適した離散ビデオ トークン シーケンスを生成します。 HMA-MAR は、マスクされた自己回帰連続表現 (1B パラメーター) を使用してソフト トークンを生成します。これにより、視覚的な品質が向上します。どちらも同じトレーニング フレームワークを共有しており、タスクの要件に応じて切り替えることができます。 値を使用: 精度重視のシナリオ (戦略評価) には離散モデルを選択し、ビジュアル品質を優先したシナリオ (デモ生成) には連続モデルを選択します。
-
インタラクティブなリアルタイム ビデオ シミュレーション デモ: このプロジェクトは、Pygame (
python -m sim.app) に基づいたインタラクティブなデモを提供します。ユーザーはギャラリーから初期画像を選択し、キーボードの矢印キーを使用してロボットの動きを制御し、ビデオ生成結果をリアルタイムで観察できます。 価値を使用: モデルの動作を直観的に理解し、アクションと視覚的なフィードバックの間の因果関係を迅速に検証します。 -
ポリシー評価および合成データ生成パイプライン: HMA には、FVD、PSNR、SSIM、および生成されたビデオと実際のビデオのその他の指標を計算できる完全な評価パイプラインが組み込まれています。また、データ強化またはポリシーの事前トレーニングのために、トレーニングされたモデルのサンプリングからの多数の合成軌跡の生成もサポートします。 使用値: ポリシーの反復サイクルを「実際の環境のロールアウト → データ収集 → 再トレーニング」から「シミュレーションのロールアウト → 合成データ → ポリシーの更新」に圧縮し、実際のロボット ハードウェアと手動のアノテーションへの依存を減らします。
-
トレーニング後のメカニズム: HMA は、特定のデータ セットで事前トレーニングされたモデルのトレーニング後の微調整をサポートしており、言語テーブル データ セット用の微調整スクリプト (
run_langtable_finetuning.sh) が提供されています。 使用価値: 最初からトレーニングすることなく、特定のロボット プラットフォームや特定のタスク (ブロックを押す、掴むなど) にすぐに適応します。
モデルとバージョンの進化
HMA のバージョン コンテキストは、紙のプレプリントとコード リリースに基づいています。
| バージョン | 日付 | 主要な変更点 |
|---|---|---|
| arXiv プレプリント | 2025-02-06 | この論文は初めて一般に公開され、オープンソースの GitHub コード リポジトリと HuggingFace モデルの重みを同期します。 |
| 最初のコードの提出 | 2025 年 2 月 (およそ) | 完全なトレーニング、生成、評価、視覚化パイプラインが含まれており、40 以上のデータ セットをサポートします。 |
| HMA-MagVit (362M) | 最初のコードと同じ | VQ-VAE + マスクされた自己回帰に基づく離散トークン モデル |
| HMA-MAR (1B) | 最初のコードと同じ | マスクされた自己回帰に基づく、より多くのパラメーターを備えた連続トークン モデル |
バージョンの進化の説明: HMA は現在、「ペーパー オープン ソース」段階にあります。コード リポジトリは 1 回限りの初回送信 (最初のコミット) であり、バージョン ラベルや正式リリースはまだありません。著者は README で「コードの品質: 疲れた大学院生」と述べており、コードが再現性を主な目標としており、エンジニアリング パッケージ化を行っていないことを示しています。その後の進化の方向性としては、より多くのデータセットの適応、モデルの定量化の高速化、より使いやすいパッケージング インターフェイス (ROS 統合、ジム環境のパッケージ化など) が含まれると予想されます。
技術的な利点
メカニズム→効果→シナリオの因果連鎖の解体:
-
マスクされた自己回帰が拡散モデルを置き換えます: 従来のロボット ビデオ生成方法 (UniPi など) は、拡散モデルを使用してフレームごとに生成します。各フレームには複数ステップのノイズ除去が必要であり、推論遅延が大きくなります。 HMA はマスクされた自己回帰戦略を採用しています。つまり、トレーニング中にビデオ トークンの一部をランダムにマスクし、モデルがマスクされたコンテンツを予測できるようにします。推論中にすべてのマスクされたトークンを一度に予測し、自己回帰的に反復的に改良します。 効果: 拡散モデルの推論ステップ数を 50 ~ 1000 ステップから 8 ~ 16 ステップに削減し、15 倍のエンドツーエンドの高速化を達成します。 適用可能なシナリオ: リアルタイムのフィードバックを必要とするインタラクティブなシミュレーションとオンライン戦略評価。
-
異種トレーニングでデータ不足を克服: ロボット工学分野は、分散したデータ ソース、異なるオントロジー、および多様なタスクの問題に長い間直面してきました。 HMA を使用すると、統合トークン化インターフェイス (異なる解像度のビデオと異なる周波数のアクション シーケンスを固定長のトークン シーケンスに統合エンコードする) を通じて、40 以上の異種データ セットでモデルを共同で事前トレーニングできます。 効果: 事前トレーニングされたモデルは、目に見えないロボットの本体とタスクに対するゼロサンプル スケジューリング機能を実証し、トレーニング後のトレーニングでは、わずか 200 の軌道を持つ新しいシーンで 100 フレームを超える有効なデータを生成できます。 適用可能なシナリオ: 新しいロボット プラットフォームの迅速な導入とオントロジーを越えた知識の移行。
-
アクション コンディショニングは、正確な制御性を実現します: HMA は、入力内のアクション トークンを結合するだけでなく、変調メカニズムを使用して、アクション信号を単に入力端に注入するのではなく、Transformer の各層の中間表現に影響を与えることができます。 効果: 生成されたビデオは、入力アクション シーケンスに厳密に従います。プッシュ ブロックの方向と強さ、ロボット アームの軌道などが、生成された結果に正確に反映されます。無条件ビデオ生成モデルと比較して、HMA の制御性が大幅に向上します。 適用可能なシナリオ: 正確な運動制約を必要とする戦略の検証 (「x 方向の力が加えられた場合、オブジェクトはどのように移動するか?」など)。
-
VQ-VAE + MAR デュアル パイプラインは精度と品質を考慮しています: 離散ブランチ (MagVit) は VQ-VAE を使用してビデオ フレームを離散トークンに圧縮し、生成プロセスの制御性と評価の再現性を保証します。連続ブランチ (MAR) は、連続潜在空間を直接操作して、より詳細な情報を保持します。どちらも同じ Transformer バックボーンを共有しており、スイッチング コストが低くなります。 効果: 離散モデルは FVD などの定量的指標に優れており、ベンチマーク比較に適しています。連続モデルは人間の視覚的評価においてより自然であり、デモンストレーションや視覚化に適しています。 適用可能なシナリオ: 学術論文の評価には離散を選択し、製品プロトタイプのデモンストレーションには連続を選択します。
使い方
環境設定
HMA には Python 3.10 以降と CUDA 環境が必要です。依存関係を管理するには Conda または venv を使用することをお勧めします。
「」バッシュ
リポジトリのクローンを作成する
git クローン https://github.com/liruiw/HMA.git cd HMA
依存関係をインストールし、データをダウンロードします (venv が自動的に作成されます)
./build.sh
Python環境をアクティブ化する
ソース venv/bin/activate 「」
インタラクティブなデモ
「」バッシュ
インタラクティブな GUI デモを開始する
Python -m sim.app 「」 起動後、ギャラリーから最初の画像を選択し、キーボードの矢印キーを使用してアクションを制御し、HMA によって生成されたビデオ フレームをリアルタイムで観察します。これは、モデルを事前トレーニングせずに HMA 機能を体験する最も速い方法です。
事前トレーニングされたモデルの推論
「」バッシュ
事前トレーニング済みモデルをダウンロードします (HuggingFace から手動で取得する必要があります)
ビデオを生成するための単一データセット推論
Python hma/generate.py \ --checkpoint_dir データ/モデル/step_100/ \ --val_data_dir データ/kaist_nonprehensile_converted_externally_to_rlds_magvit_max1000000_val 「」
モデルの評価
「」バッシュ
離散モデルの評価
hma/evaluate.py の起動を加速します \ --checkpoint_dir "データ/${RUN_NAME}/final_checkpt" \ --val_data_dir "データ/${データセット}_magvit_traj1000000_val" \ --wandb_run_name "${RUN_NAME}"
継続的なモデル評価
起動を加速する hma/evaluate_feature.py \ --checkpoint_dir "データ/${RUN_NAME}/final_checkpt" \ --val_data_dir "データ/${データセット}_magvit_traj1000000_val" 「」
事前トレーニング (複数のデータセット)
「」バッシュ
VQ トークン モデル (個別)
bash 実験/scripts/discrete_model/run_40datasets_waction.sh
ソフトトークンモデル (継続的)
bash 実験/scripts/continuous_model/run_30datasets_mar_waction.sh 「」
エントリーの概要
| 入口 | 目的 | 技術的要件 |
|---|---|---|
| GitHub リポジトリ | ソースコード、トレーニングスクリプト、評価パイプライン | Python 3.10+、CUDA、PyTorch |
| ハグフェイスモデルライブラリ | トレーニング前のウェイトのダウンロード | なし (ダウンロードは推論に使用できます) |
| プロジェクトのホームページ (デモ) | オンラインインタラクティブデモンストレーション | ブラウザアクセス、ローカル環境不要 |
| arXiv 論文 | 技術原理と実験の詳細 | なし |
| インタラクティブなデモ (ローカル) | ローカルでのリアルタイムシミュレーション体験 | Python 3.10+、Pygame、GPU を推奨 |
製品の価格設定
HMA は純粋なオープンソース プロジェクトであり、価格構造は非常にシンプルです。
- モデルの重み: 無料、MIT ライセンスに基づく Apache-2.0 ライセンス
- ソース コード: 無料、Apache-2.0 ライセンス
- 論文: arXiv で無料、オープンアクセス
- オンライン デモ: 無料、プロジェクトのホームページで HuggingFace Spaces のオンライン エクスペリエンスが提供されます
現在、有料レベルはありません。商用ライセンスに関しては、Apache-2.0 では自由な使用、変更、再配布が許可されています。ただし、モデルの重みにサードパーティ データ セットに対する追加の使用制限が含まれているかどうかについては、各データ セットの元のライセンス契約 (Bridge データ セットの使用条件など) を確認する必要があります。
競合製品との価格比較:
| プロジェクト | HMA | NVIDIA アイザック シム | Google ジーニー | 身体的知能 π0 |
|---|---|---|---|---|
| ソフトウェアの価格 | 無料 | Community Edition は無料、Enterprise Edition は年間 10,000 ドル以上 | 未公開 | 未公開 |
| 推論コスト | セルフホスト型シングル GPU | クラウド GPU オンデマンド | クラウド API の投機的請求 | 未公開 |
| データ要件 | 自己準備されたロボットの軌道 | 内蔵シミュレーション環境 | 外部データは必要ありません | 商業上の協力が必要です |
| カスタマイズ性 | フルオープン | モジュール式の部分的に閉じたソース | ブラックボックスAPI | ご協力いただけるお客様限定 |
アプリケーションのシナリオ
-
迅速なロボット戦略の評価と反復: 従来の戦略評価では、実際のロボットで繰り返し展開する必要があり、時間がかかり、ハードウェアの磨耗のリスクが伴います。 HMA を「ビデオ ワールド モデル」として使用すると、戦略によって出力されたアクション シーケンスを受け取り、対応するビデオ予測結果を生成し、戦略の定性的なパフォーマンス (目標が達成されたかどうか、アクションがスムーズかどうか、およびインタラクションが物理的に合理的かどうか) を迅速に検証できます。 減算メリット: 「各評価には実際のロボットのロールアウトが 30 分必要」から「HMA シミュレーション評価を完了するのに 2 分」に、1 回の反復サイクルが 90% 以上短縮され、戦略の初期の予備スクリーニング段階に特に適しています。
-
ポリシーの事前トレーニング用の合成データ生成: 実際のデータが限られている場合、HMA を使用して少数の実際の軌跡から開始し、ポストトレーニングを通じてターゲット シーンに適応し、大規模なサンプリングを通じて合成ビデオとアクションのペアを生成します。これらの合成データは、ポリシー モデルのバックエンド ビジュアル エンコーダーを事前トレーニングするため、またはデータ拡張の手段として使用できます。 実装のヒント: HMA の論文では、トレーニング後の実際の軌道を 200 個だけ使用するだけで、元のデータ分布では完全にはサンプリングされていないエッジ ケース (さまざまなオクルージョン モード、照明の変更など) をカバーする、100 フレームを超える効果的な合成データを生成できることが示されています。
-
インタラクティブなロボットの動作分析と教育: 科学研究や教育において、研究者は HMA のインタラクティブ デモを使用して、さまざまなアクション入力 (押す、引く、回転など) に対応する視覚的なフィードバックを直感的に実証し、ロボットと環境の相互作用の物理法則を理解できます。実際のロボット ハードウェアは必要なく、GPU を搭載したラップトップだけで済みます。 控除のメリット: ロボットの参入障壁を「ハードウェア プラットフォームの購入と維持が必要」から「ソフトウェア環境だけ」に引き下げ、大学の授業やリモート コラボレーションでのロボット指導のコストを桁違いに削減します。
-
クロスオントロジー知識移転の事前調査: チームが既存のロボット プラットフォーム (Franka など) から新しいプラットフォーム (UR5 など) に切り替える必要がある場合、HMA の異種事前トレーニング機能を使用して、新しいプラットフォームからの少量の軌跡データを使用して事後トレーニングを実行し、ハードウェア導入コスト全体に投資することなく、移行ソリューションが実現可能かどうかを迅速に評価できます。 控除のメリット: 新しいプラットフォームでの予備的な実現可能性検証を、数週間にわたるハードウェアとデータの準備から数日間のシミュレーション実験に短縮します。
-
マルチロボット協調シミュレーション: HMA のアクション条件付き設計は、マルチエンティティのインタラクション シナリオ (複数のロボット アームが協力して箱を押すなど) をサポートしているため、見通し線を超えたマルチロボットの協調戦略の検証に使用できます。現在のデモでは、複数のオブジェクトを同時に制御する対話型シミュレーション機能が実証されています。
該当する人
-
ロボット アルゴリズム研究者: HMA のコア ユーザー グループ。新しい戦略を評価したり、比較実験の視覚化を生成したり、アブレーション研究を実施したりする必要があるチーム。 HMA は、「実際のロールアウトの一部をシミュレーション ビデオに置き換える」パスを提供し、実験コストを直接削減します。 前提条件: PyTorch とディープ ラーニング トレーニング プロセスに精通していること。ロボットの軌跡データ (RLDS 形式) を読み取って処理する機能があります。
-
身体知能/ロボット工学の大学院生: 論文の複製、コース プロジェクト、またはオープン ソースへの貢献において、HMA は、研究ベースラインまたは比較方法として使用できる、すぐに使用できる事前トレーニング済みモデルと完全なトレーニング パイプラインを提供します。インタラクティブなデモは、教育用のデモンストレーション ツールとしても適しています。 前提条件: 基本的な Python および基本的な CUDA 環境構成機能を持っている。
-
ロボット工学スタートアップ企業のアルゴリズム チーム: 製品開発の初期段階では、HMA を戦略のラピッド プロトタイピング用の「自由世界モデル」として使用し、物理的なロボット ハードウェアへの依存を減らすことができます。 推奨される使用方法: まず、公開データ セットを使用して事前トレーニングされたモデルをロードし、デモを実行します。次に、トレーニング後の適応のために独自のロボット データを収集します。
-
AI シミュレーション プラットフォーム ビルダー: ロボットに多様なビジュアル シミュレーション環境を提供する必要がある技術チーム。 HMA の異種事前トレーニング機能と Apache-2.0 ライセンスにより、HMA は上位レベルのワークフロー プラットフォームへの統合に適しています。
-
群衆には適していません:
- 純粋なビジネス ユーザー (プログラミングの経験がない): HMA には GUI アプリケーションやコードなしのインターフェイスがなく、すべての操作はコマンド ラインと Python スクリプトに基づいています。
- 安定した商用サポートを必要とする産業ユーザー: HMA には SLA、技術サポート、エンタープライズ レベルのドキュメントがなく、運用環境のクリティカル パスには適していません。
- 非ロボット分野の一般開発者およびデザイナー: HMA はロボット アクション ビデオ モデリングに重点を置いており、一般的なビデオ生成、コンテンツ作成、その他のシナリオには使用できません。
概要と展望
コア コンピテンシー: HMA の中心的な貢献は、「マスクされた自己回帰パラダイムをロボット ビデオの動的モデリングに初めて導入し、異種データの事前トレーニングとリアルタイム推論速度の規模でブレークスルーを達成したこと」にあります。 15 倍の高速化により、「オフライン生成ツール」から「インタラクティブなリアルタイム シミュレーション」のカテゴリに進化しました。これは、以前の拡散モデル ソリューションとの本質的な違いです。完全にオープン ソース (Apache-2.0) ライセンス モデルにより、学術コミュニティでの普及に自然な利点がもたらされます。
現在の制限: (1) コード エンジニアリングの程度が低い - 著者は自己評価「コードの品質: 疲れた大学院生」、リリース バージョンなし、CI/CD なし、Docker イメージなし、デプロイメントには一定の技術的経験が必要です。 (2) 複雑なデータ セットの準備 - RLDS 形式のビデオ アクション データ セットには、特定のトークン化パイプラインが必要です。 (3) モデル スケールの制限 - 1B パラメーターはコンシューマー グレードの GPU で実行できますが、40 以上のデータ セットの完全な事前トレーニングには複数の GPU クラスターが必要です。 (4) 群集生態学はまだ形成されていません。ドキュメントは主に論文 + README であり、フォーラムはなく、サードパーティの統合も知られていません。
追跡観察ポイント: (1) ウェアハウスが正式リリース バージョンをリリースするかどうか、およびバージョン付きチェックポイントの更新頻度。 (2) ROS/Gym などのロボット標準インターフェースの統合サポートがあるかどうか。 (3) 作成者チームがより大きなモデルのバージョンをリリースするか、特定のシナリオ (器用な操作など) に合わせて重みを微調整するかどうか。 (4) 使用の敷居を下げるために、サードパーティ パッケージ (Docker イメージ、HuggingFace 推論 API、Colab ノートブックなど) がコミュニティに表示されるかどうか。
調達/採用リスク評価: HMA は「技術の事前調査および評価の高速化ツール」として適していますが、現段階では運用環境の唯一のシミュレーション依存関係としては推奨されません。次の戦略を採用することをお勧めします。(1) まず、インタラクティブなデモとプリセット データ セットを使用してプロセス全体を実行し、独自のシナリオにおけるモデルの実際の忠実度を評価します。 (2) データ フライホイール効果を定量化するために、トレーニング後の実験を行うために 200 の独自の軌道から開始します。 (3) 完全に検証する前に、実際のロボットのロールアウト用にバックアップ チャネルを維持します。商用グレードのサポートが必要な企業の場合は、コミュニティ バージョンが成熟するまで待つか、商用代替バージョン (NVIDIA Isaac Sim、Physical Intelligence の π0 など) を評価することをお勧めします。
関連ツール: CrewAI、langchain
バージョン情報
- HMA 初期バージョン :これには、HMA-MagVit (362M パラメーター) と HMA-MAR (1B パラメーター) の 2 つのモデル仕様が含まれており、離散トークンと連続トークンの 2 つの生成モードをサポートし、トレーニング前、トレーニング後、評価、視覚化の完全なプロセス コードを提供します。
- arXiv プレプリント :この論文は、オープン ソース コードとモデルの重みを同期させて、arXiv (2502.04296) で最初に公開されました。
ユーザーレビュー