HMA (Heterogene maskierte Autoregression) Kostenlos

-

HMA (Heterogeneous Masked Autoregression) ist eine dynamische Modellierungsmethode für Roboter-Action-Videos, die gemeinsam von MIT, Meta FAIR und UIUC vorgeschlagen wurde. Durch heterogenes maskenautoregressives Vortraining wird die Ontologie- und domänenübergreifende gemeinsame Verteilung von Aktionsvideos anhand von mehr als 40 Datensätzen und mehr als 3 Millionen Trajektorien erlernt, um eine Echtzeit-Robotervideosimulation mit hoher Wiedergabetreue zu erreichen. Im Vergleich zum vorherigen SOTA ist die Inferenzgeschwindigkeit um das 15-fache erhöht und kann in großem Umfang bei der Strategiebewertung, der Generierung synthetischer Daten und der interaktiven Videosimulation eingesetzt werden.

HMA (Heterogene maskierte Autoregression) Produktoberfläche

HMA: Roboteraktion für die reale Welt – Videodynamische Modellierung

Kernparameter und Statistiken

Projekt Einzelheiten
Produktname HMA (Heterogene maskierte Autoregression)
Produkttyp Open-Source-Forschungsmodell / Roboter-Weltmodell
Lieferform Open-Source-Code (GitHub) + vortrainierte Gewichte (HuggingFace)
Modellmaßstab HMA-MagVit: 362 Mio. Parameter; HMA-MAR: 1B Parameter
Trainingsdaten Über 40 Datensätze, über 3 Millionen Flugbahnen
Inferenzgeschwindigkeit 15-mal schneller als SOTA (Echtzeitbetrieb)
Open-Source-Lizenz Apache-2.0
Unterstützte Sprachen Englisch
Zielbenutzer Roboterforscher, Ingenieure für verkörperte Intelligenz, Entwickler von KI-Simulationen
Kernpapier arXiv 2502.04296 (Februar 2025)
Projekthomepage https://liruiw.github.io/hma

Parameterinterpretation: Die Parametergröße von HMA liegt im „mittleren bis großen“ Bereich – die MagVit-Version (362M) eignet sich für Einzel-GPU-Inferenz und schnelle Iteration, und die MAR-Version (1B) hat die Videotreue weiter verbessert. Im Vergleich zu früheren Mainstream-Diffusionsmodelllösungen (wie UniPi und VideoPoet) verwendet HMA die maskierte autoregressive Route, die einen Größenordnungsvorteil in der Generierungsgeschwindigkeit (15-fache Beschleunigung) bietet. Dies ist sein zentraler technischer Wert: Zum ersten Mal bringt es die Robotervideosimulation an die Schwelle der „interaktiven Echtzeit“.

Benutzer- und Markterkennung

Akademisches Akzeptanzsignal: HMA erregte schnell Aufmerksamkeit in der Robotik-Lerngemeinschaft, nachdem es im Februar 2025 auf arXiv veröffentlicht wurde. Die Autoren des Papiers kommen von MIT CSAIL, Meta AI (FAIR) und UIUC. Diese Kombination allein sorgt für eine starke akademische Glaubwürdigkeit. Das GitHub-Repository des Projekts (github.com/liruiw/HMA) zeigt derzeit 41 Sterne. Obwohl es sich angesichts seiner Professionalität (dynamische Modellierung von Robotervideos) nicht um ein großes Gemeinschaftsprojekt handelt, entsprechen diese Daten den Erwartungen für frühe Forschungsprojekte.

Kommunikation mit Dritten: HMA wurde in die AI-Tool-Set-Navigationsstation (ai-bot.cn) aufgenommen und auf Bilibili und anderen Plattformen sind mehrere technische Interpretationsvideos erschienen (z. B. „MITs neueste Forschung! HMA: 15-mal schnellere, qualitativ hochwertige Generierung von Roboteraktionsdaten!“), was darauf hinweist, dass es auch in der chinesischen Technologie-Community an Aufmerksamkeit gewonnen hat. Das Papier ist auf arXiv unter cs.RO (Robotics) klassifiziert und weist Querverweise auf cs.CV (Computer Vision) und cs.LG (Machine Learning) auf, was den interdisziplinären Einfluss widerspiegelt.

Benchmark-Leistung: Im Vergleich zu mehreren SOTA-Videogenerationsmodellen liegt HMA sowohl bei der visuellen Wiedergabetreue (FVD-Indikator) als auch bei der Steuerbarkeit (Aktionsverfolgungsgenauigkeit) an der Spitze. Das Papier zeigt qualitative und quantitative Ergebnisse für mehrere reale Roboterdatensätze wie Bridge, Dobb-E, Kaist usw. Das von HMA generierte Video ist hinsichtlich der physikalischen Rationalität (Objektinteraktion, Schatten, Okklusionsverarbeitung) deutlich besser als die Basismethode.

Aktuelle Einschränkungen: Da es sich um ein akademisches Forschungsprojekt handelt, verfügt HMA noch nicht über eine kommerzielle Version oder Unterstützung auf Unternehmensebene. Seine Benutzerbasis beschränkt sich hauptsächlich auf Forschungsteams mit Deep-Learning-Training und Robotereinsatzfähigkeiten. Die Anzahl der GitHub-Stars und die Community-Aktivitäten befinden sich in einem frühen Stadium, und ein vollständiges Dokumentations-Ökosystem und eine Benutzer-Community wurden noch nicht gebildet.

Kostenvorteil

Das vollständig Open-Source-Modell von HMA stellt seine Kostenstruktur in deutlichen Gegensatz zu kommerziellen Robotersimulationstools:

Kostendimension HMA (Open Source) Kommerzielle Robotersimulatoren (wie NVIDIA Isaac Sim) Cloud-Videogenerierungs-API
C-Seite/Forscher Völlig kostenlos, Code + Gewicht Open Source Die kostenlose Community-Version verfügt über eingeschränkte Funktionen, die Vollversion erfordert eine Unternehmenslizenz Abgerechnet nach Token/Sekunde, lange Videos sind teuer
API / Entwickler Keine API-Ebene, Inferenz muss selbst bereitgestellt werden Python SDK bereitgestellt, GPU-Cluster erforderlich Wird auf Anfrage in Rechnung gestellt, durchschnittlich 0,01–0,10 $/Sekunde
Unternehmen/Privat Selbstgehostet, keine Lizenzgebühren, nur GPU-Hardware Die Isaac Sim Enterprise Edition kostet über 10.000 US-Dollar pro Jahr Keine Unterstützung für Privatisierung

C-seitige Kosten: Forscher können das Repository direkt über GitHub klonen, die vorab trainierten Gewichte (0,4B/1B) auf HuggingFace herunterladen und Inferenz und interaktive Demo auf einer einzelnen RTX 3090/4090 ausführen. Die Hardwarekosten sind die einzigen wirklichen Kosten.

Entwicklerkosten: HMA stellt keine kommerzielle API bereit. Zur Integration in den Workflow muss das Team die Umgebungskonfiguration (Python 3.10+, PyTorch, Accelerate und andere Abhängigkeiten), die Modellbereitstellung und den Aufbau der Inferenzpipeline selbst abschließen. Die anfänglichen Bereitstellungskosten betragen etwa 2–5 Manntage und eignen sich für Teams mit DL Ops-Fähigkeiten.

Unternehmenskosten: Im Vergleich zu kommerziellen Simulatoren (NVIDIA Isaac Sim Enterprise Edition über 10.000 $/Jahr, Amazon RoboMaker wird stundenweise abgerechnet) hat HMA einen erheblichen TCO-Vorteil – keine Softwarelizenz, erfordert aber ein Team mit Funktionen zur Modellbereitstellung und -optimierung. Versteckte Kosten spiegeln sich hauptsächlich in der Datenvorbereitung (Roboterflugbahndaten müssen in das RLDS-Format konvertiert werden), der Modellanpassung nach dem Training (Feinabstimmungsexperimente für eine bestimmte Roboterontologie) und mangelnder kommerzieller Unterstützung wider.

Die kostenlose Wahrheit: HMA ist völlig kostenlos und Open Source, aber die Prämisse von „kostenlos“ ist, dass der Benutzer die Möglichkeit hat, eine Python-Deep-Learning-Entwicklungsumgebung aufzubauen und Roboterbetriebsdaten zu erhalten. Für Teams ohne Sammlung von Roboterdaten können die Kosten für die Erfassung von Flugbahnen von Grund auf die Jahresgebühr für kommerzielle Tools übersteigen.

Hauptfunktionen

  • Heterogene maskierte autoregressive Videovorhersage: Bei einem ersten Frame und einer Aktionssequenz generiert HMA autoregressiv nachfolgende Videoframes. Im Gegensatz zum Diffusionsmodell, das Frame für Frame unabhängig generiert wird, modelliert der maskierte autoregressive Mechanismus Zeitabhängigkeiten auf Token-Ebene und kann mehrere zukünftige Token in einem einzigen Schritt vorhersagen, was die Inferenzeffizienz erheblich verbessert. Anwendbare Aufgaben: Schnelle Video-Rollback-Bewertung von Roboterstrategien und Visualisierung von Planungsergebnissen.

  • Ontologieübergreifendes, domänenübergreifendes heterogenes Vortraining: HMA wird gemeinsam auf über 40 Datensätzen trainiert, und die Datenquellen umfassen reale Roboter-Teleoperationen (Bridge, Dobb-E, Kaist), Videos menschlicher Operationen (EpicKitchens), Simulationsdaten (RLBench, MetaWorld) usw. Das Modell muss nicht für jede Roboterontologie separat trainiert werden, und die vorab trainierten Gewichte können direkt für unsichtbare Roboterformen verwendet werden. Nutzungswert: Senken Sie den Schwellenwert für die Modellbereitstellung in neuen Roboterszenarien und verkürzen Sie die Datenerfassung von Wochen auf Training und Anpassung nach Stunden.

  • Dual-modale Generierung – diskreter Token und kontinuierlicher Token: HMA-MagVit nutzt VQ-VAE-Diskretisierung (362 Millionen Parameter), um diskrete Video-Token-Sequenzen zu generieren, die für eine präzise Steuerung und strukturierte Auswertung geeignet sind; HMA-MAR verwendet eine maskierte autoregressive kontinuierliche Darstellung (1B-Parameter), um Soft-Token zu generieren, was eine bessere visuelle Qualität aufweist. Beide nutzen das gleiche Trainingsgerüst und können je nach Aufgabenanforderung gewechselt werden. Wert verwenden: Wählen Sie das diskrete Modell für genauigkeitsempfindliche Szenarien (Strategiebewertung) und das kontinuierliche Modell für Szenarien mit visueller Qualitätspriorität (Demo-Generierung).

  • Interaktive Echtzeit-Videosimulation Demo: Das Projekt bietet eine interaktive Demo basierend auf Pygame („python -m sim.app“). Benutzer können das Ausgangsbild aus der Galerie auswählen, mit den Pfeiltasten der Tastatur die Bewegungen des Roboters steuern und die Ergebnisse der Videogenerierung in Echtzeit beobachten. Wert nutzen: Modellverhalten intuitiv verstehen und schnell den kausalen Zusammenhang zwischen Aktionen und visuellem Feedback überprüfen.

  • Richtlinienbewertung und Pipeline zur Generierung synthetischer Daten: HMA verfügt über eine integrierte vollständige Bewertungspipeline, die FVD, PSNR, SSIM und andere Indikatoren für generierte Videos und echte Videos berechnen kann; Es unterstützt auch die Generierung einer großen Anzahl synthetischer Trajektorien aus trainierten Modellstichproben zur Datenverbesserung oder zur Vorschulung von Richtlinien. Wert verwenden: Komprimieren Sie den Richtlinieniterationszyklus von „Rollout in der realen Umgebung → Daten sammeln → Neu trainieren“ zu „Rollout der Simulation → synthetische Daten → Richtlinienaktualisierung“, wodurch die Abhängigkeit von realer Roboterhardware und manueller Anmerkung verringert wird.

  • Post-Training-Mechanismus: HMA unterstützt die Feinabstimmung vorab trainierter Modelle an bestimmten Datensätzen nach dem Training, und es wurde ein Feinabstimmungsskript („run_langtable_finetuning.sh“) für den Sprachtabellen-Datensatz bereitgestellt. Nutzenwert: Passen Sie sich schnell an bestimmte Roboterplattformen und bestimmte Aufgaben an (wie das Schieben von Blöcken und das Greifen), ohne dass Sie von Grund auf trainieren müssen.

Modell- und Versionsentwicklung

Der Versionskontext von HMA basiert auf Papiervorabdrucken und Codefreigaben:

Version Datum Kernänderungen
arXiv-Vorabdruck 06.02.2025 Das Papier wird zum ersten Mal öffentlich veröffentlicht und synchronisiert das Open-Source-GitHub-Code-Repository und die HuggingFace-Modellgewichte
Erstmalige Codeübermittlung 2025-02 (ca.) Enthält vollständige Trainings-, Generierungs-, Auswertungs- und Visualisierungspipelines und unterstützt mehr als 40 Datensätze
HMA-MagVit (362M) Identisch mit Anfangscode Diskretes Token-Modell, basierend auf VQ-VAE + maskierter Autoregression
HMA-MAR (1B) Identisch mit dem ursprünglichen Code Kontinuierliches Token-Modell, basierend auf maskierter Autoregression, mit einer größeren Anzahl von Parametern

Beschreibung der Versionsentwicklung: HMA befindet sich derzeit im „Paper Open Source“-Stadium. Das Code-Repository ist eine einmalige Erstübermittlung (erstes Commit), und es gibt noch kein Versionslabel oder offizielle Veröffentlichung. Der Autor vermerkte in der README-Datei „Codequalität: müder Doktorand“, was darauf hinweist, dass der Code die Reproduzierbarkeit als Hauptziel ansieht und keine technische Verpackung durchführt. Zu den weiteren Entwicklungsrichtungen wird erwartet, dass sie Folgendes umfassen: stärkere Anpassung von Datensätzen, Beschleunigung der Modellquantifizierung und benutzerfreundlichere Verpackungsschnittstellen (z. B. ROS-Integration, Verpackung der Fitnessstudio-Umgebung).

Technische Vorteile

Abbau der Kausalkette von Mechanismus → Wirkung → Szenario:

  1. Maskierte Autoregression ersetzt das Diffusionsmodell: Herkömmliche Methoden zur Robotervideogenerierung (wie UniPi) verwenden das Diffusionsmodell, um Bild für Bild zu generieren. Jeder Frame erfordert eine mehrstufige Rauschunterdrückung und die Inferenzverzögerung ist hoch. HMA wendet eine maskierte autoregressive Strategie an, bei der ein Teil der Video-Tokens während des Trainings zufällig maskiert wird, sodass das Modell den maskierten Inhalt vorhersagen kann. Vorhersage aller maskierten Token auf einmal während der Inferenz und anschließende iterative autoregressive Verfeinerung. Effekt: Reduzieren Sie die Anzahl der Inferenzschritte von 50–1000 Schritten im Diffusionsmodell auf 8–16 Schritte, wodurch eine 15-fache End-to-End-Beschleunigung erreicht wird. Anwendbare Szenarien: Interaktive Simulation und Online-Strategiebewertung, die Echtzeit-Feedback erfordern.

  2. Heterogenes Training überwindet Datenknappheit: Der Robotikbereich ist seit langem mit den Problemen verstreuter Datenquellen, unterschiedlicher Ontologien und vielfältiger Aufgaben konfrontiert. Mit HMA können Modelle über eine einheitliche Tokenisierungsschnittstelle (einheitliche Kodierung von Videos unterschiedlicher Auflösung und Aktionssequenzen unterschiedlicher Frequenz in Tokensequenzen fester Länge) gemeinsam auf über 40 heterogenen Datensätzen vorab trainiert werden. Effekt: Das vorab trainierte Modell demonstriert Zero-Sample-Planungsfunktionen für unsichtbare Roboterkörper und -aufgaben, und nach dem Training können mehr als 100 Frames effektiver Daten für neue Szenen mit nur 200 Trajektorien generiert werden. Anwendbare Szenarien: Schnelle Bereitstellung neuer Roboterplattformen und ontologieübergreifende Wissensmigration.

  3. Aktionskonditionierung ermöglicht präzise Steuerbarkeit: HMA verbindet nicht nur Aktionstoken in der Eingabe, sondern verwendet auch einen Modulationsmechanismus, um zu ermöglichen, dass das Aktionssignal die Zwischendarstellung jeder Ebene des Transformers beeinflusst, anstatt es nur am Eingabeende einzuspeisen. Effekt: Das generierte Video folgt strikt der eingegebenen Aktionssequenz – die Richtung und Stärke des Schubblocks, die Flugbahn des Roboterarms usw. werden in den generierten Ergebnissen genau widergespiegelt. Im Vergleich zum bedingungslosen Videogenerierungsmodell ist die Steuerbarkeit von HMA deutlich verbessert. Anwendbare Szenarien: Strategieüberprüfung, die genaue Bewegungseinschränkungen erfordert (z. B. „Wenn eine Kraft in der x-Richtung angewendet wird, wie bewegt sich das Objekt?“).

  4. VQ-VAE + MAR-Dual-Pipeline berücksichtigt Genauigkeit und Qualität: Der diskrete Zweig (MagVit) verwendet VQ-VAE, um Videobilder in diskrete Token zu komprimieren und so die Steuerbarkeit des Generierungsprozesses und die Wiederholbarkeit der Auswertung sicherzustellen; Der kontinuierliche Zweig (MAR) betreibt direkt den kontinuierlichen latenten Raum, um detailliertere Informationen zu speichern. Beide nutzen das gleiche Transformer-Backbone und haben niedrige Switching-Kosten. Effekt: Das diskrete Modell ist bei quantitativen Indikatoren wie FVD besser und eignet sich für Benchmark-Vergleiche; Das kontinuierliche Modell ist für die visuelle Beurteilung durch den Menschen natürlicher und eignet sich zur Demonstration und Visualisierung. Anwendbare Szenarien: Wählen Sie „Diskret“ für die Bewertung wissenschaftlicher Arbeiten und „Kontinuierlich“ für die Demonstration von Produktprototypen.

Wie man es benutzt

Umgebungseinrichtung

HMA erfordert Python 3.10+ und eine CUDA-Umgebung. Es wird empfohlen, Conda oder venv zum Verwalten von Abhängigkeiten zu verwenden:

„Bash

Repository klonen

Git-Klon https://github.com/liruiw/HMA.git CD HMA

Abhängigkeiten installieren und Daten herunterladen (venv wird automatisch erstellt)

./build.sh

Python-Umgebung aktivieren

Quelle venv/bin/activate „

Interaktive Demo

„Bash

Starten Sie die interaktive GUI-Demo

python -m sim.app „ Wählen Sie nach dem Start das erste Bild aus der Galerie aus, steuern Sie die Aktionen mit den Pfeiltasten der Tastatur und beobachten Sie die von HMA generierten Videobilder in Echtzeit. Dies ist der schnellste Weg, HMA-Funktionen zu erleben, ohne das Modell vorab zu trainieren.

Vorab trainierte Modellinferenz

„Bash

Laden Sie das vorab trainierte Modell herunter (muss manuell von HuggingFace bezogen werden)

Einzeldatensatz-Inferenz zum Generieren von Videos

python hma/generate.py \ --checkpoint_dir data/model/step_100/ \ --val_data_dir data/kaist_nonprehensile_converted_externally_to_rlds_magvit_max1000000_val „

Modellbewertung

„Bash

Diskrete Modellbewertung

Beschleunigung des Starts hma/evaluate.py \ --checkpoint_dir "data/${RUN_NAME}/final_checkpt" \ --val_data_dir "data/${dataset}_magvit_traj1000000_val" \ --wandb_run_name "${RUN_NAME}"

Kontinuierliche Modellbewertung

Beschleunigung des Starts hma/evaluate_feature.py \ --checkpoint_dir "data/${RUN_NAME}/final_checkpt" \ --val_data_dir "data/${dataset}_magvit_traj1000000_val" „

Vortraining (mehrere Datensätze)

„Bash

VQ-Token-Modell (diskret)

bash experiments/scripts/discrete_model/run_40datasets_waction.sh

Soft-Token-Modell (kontinuierlich)

bash experiments/scripts/continuous_model/run_30datasets_mar_waction.sh „

Zusammenfassung der Beiträge

Eingang Zweck Technische Anforderungen
GitHub-Repository Quellcode, Trainingsskripte, Evaluierungspipeline Python 3.10+, CUDA, PyTorch
HuggingFace-Modellbibliothek Gewichte vor dem Training herunterladen Keine (Download kann für Rückschlüsse verwendet werden)
Projekthomepage (Demo) Interaktive Online-Demonstration Browserzugriff, keine lokale Umgebung erforderlich
arXiv-Papier Technische Grundlagen und experimentelle Details Keine
Interaktive Demo (lokal) Lokale Echtzeitsimulationserfahrung Python 3.10+, Pygame, GPU empfohlen

Produktpreise

HMA ist ein reines Open-Source-Projekt und die Preisstruktur ist denkbar einfach:

  • Modellgewichte: Kostenlos, Apache-2.0-Lizenz unter der MIT-Lizenz
  • Quellcode: Kostenlos, Apache-2.0-Lizenz
  • Aufsätze: Kostenloser, offener Zugang auf arXiv
  • Online-Demo: Kostenlos, die Projekt-Homepage bietet HuggingFace Spaces Online-Erlebnis

Derzeit gibt es keine kostenpflichtigen Stufen. Was die kommerzielle Lizenzierung betrifft, erlaubt Apache-2.0 die kostenlose Nutzung, Änderung und Weiterverbreitung. Ob die Modellgewichte jedoch zusätzliche Nutzungsbeschränkungen für Datensätze von Drittanbietern beinhalten, erfordert eine Überprüfung der ursprünglichen Lizenzvereinbarung jedes Datensatzes (z. B. der Nutzungsbedingungen des Bridge-Datensatzes).

Preisvergleich mit Konkurrenzprodukten:

Projekte HMA NVIDIA Isaac Sim Google Genie Physische Intelligenz π0
Softwarepreise Kostenlos Die Community Edition ist kostenlos, die Enterprise Edition kostet mehr als 10.000 $/Jahr Nicht bekannt gegeben Nicht bekannt gegeben
Inferenzkosten Selbstgehostete Einzel-GPU Cloud-GPU auf Abruf Spekulative Abrechnung der Cloud-API Nicht bekannt gegeben
Datenanforderungen Selbst vorbereitete Roboterbahn Integrierte Simulationsumgebung Keine externen Daten erforderlich Kommerzielle Zusammenarbeit erforderlich
Anpassbarkeit Vollständig geöffnet Modulare, teilweise geschlossene Quelle Black-Box-API Beschränkt auf kooperative Kunden

Anwendungsszenarien

  • Schnelle Bewertung und Iteration der Roboterstrategie: Die herkömmliche Strategiebewertung erfordert wiederholte Rollouts auf tatsächlichen Robotern, was zeitaufwändig ist und das Risiko von Hardware-Verschleiß birgt. HMA kann als „Videoweltmodell“ verwendet werden, um die von der Strategie ausgegebene Aktionssequenz zu empfangen, die entsprechenden Videovorhersageergebnisse zu generieren und die qualitative Leistung der Strategie schnell zu überprüfen (ob das Ziel erreicht wird, ob die Aktion reibungslos verläuft und ob die Interaktion physikalisch sinnvoll ist). Abzugsvorteile: Von „jede Bewertung erfordert einen 30-minütigen Rollout des realen Roboters“ bis zu „2 Minuten, um die HMA-Simulationsbewertung abzuschließen“ wird der einzelne Iterationszyklus um mehr als 90 % verkürzt, was besonders für die frühe vorläufige Screening-Phase der Strategie geeignet ist.

  • Synthetische Datengenerierung für das Richtlinien-Vortraining: Wenn reale Daten begrenzt sind, wird HMA verwendet, um von einer kleinen Anzahl realer Flugbahnen auszugehen, sich durch Nachtraining an die Zielszene anzupassen und dann durch groß angelegte Stichproben synthetische Video-Aktionspaare zu generieren. Diese synthetischen Daten können verwendet werden, um den visuellen Backend-Encoder des Richtlinienmodells vorab zu trainieren oder als Mittel zur Datenerweiterung. Implementierungstipp: Das HMA-Papier zeigt, dass die Verwendung von nur 200 realen Trajektorien für das Post-Training mehr als 100 Frames effektiver synthetischer Daten generieren kann und Randfälle abdeckt, die in der ursprünglichen Datenverteilung nicht vollständig abgetastet werden (z. B. unterschiedliche Okklusionsmodi, Beleuchtungsänderungen).

  • Interaktive Roboterverhaltensanalyse und -lehre: In der wissenschaftlichen Forschung oder Lehre können Forscher die interaktive Demo von HMA nutzen, um das visuelle Feedback, das verschiedenen Aktionseingaben (wie Drücken, Ziehen und Drehen) entspricht, intuitiv zu demonstrieren, um die physikalischen Gesetze der Roboter-Umwelt-Interaktion zu verstehen. Es ist keine echte Robotik-Hardware erforderlich, lediglich ein Laptop mit einer GPU. Abzugsvorteile: Senken Sie die Eintrittsbarriere für Roboter – von der Notwendigkeit, eine Hardwareplattform zu kaufen und zu warten, bis hin zu „nur einer Softwareumgebung“, wodurch die Kosten für den Roboterunterricht in Universitätskursen und die Remote-Zusammenarbeit um eine Größenordnung gesenkt werden.

  • Vorforschung zum ontologieübergreifenden Wissenstransfer: Wenn das Team von einer vorhandenen Roboterplattform (wie Franka) auf eine neue Plattform (wie UR5) wechseln muss, kann es die heterogenen Pre-Training-Funktionen von HMA nutzen, um ein Nachtraining mit einer kleinen Menge an Trajektoriendaten von der neuen Plattform durchzuführen und schnell zu bewerten, ob die Migrationslösung machbar ist, ohne in komplette Hardware-Bereitstellungskosten zu investieren. Abzugsvorteile: Komprimieren Sie die vorläufige Machbarkeitsprüfung auf der neuen Plattform von wochenlanger Hardware- und Datenvorbereitung auf mehrere Tage Simulationsexperimente.

  • Kollaborative Multi-Roboter-Simulation: Da das aktionsbedingte Design von HMA Interaktionsszenarien mit mehreren Entitäten unterstützt (z. B. die Zusammenarbeit mehrerer Roboterarme, um Kisten zu schieben), kann es zur Überprüfung der kollaborativen Strategie mit mehreren Robotern außerhalb der Sichtlinie verwendet werden. Die aktuelle Demo hat die interaktive Simulationsfähigkeit der gleichzeitigen Steuerung mehrerer Objekte demonstriert.

Anwendbare Personen

  • Roboteralgorithmus-Forscher: Die Kernbenutzergruppe von HMA. Teams, die neue Strategien bewerten, Visualisierungen von Vergleichsexperimenten erstellen oder Ablationsstudien durchführen müssen. HMA bietet einen Weg, „einen Teil des realen Rollouts durch Simulationsvideos zu ersetzen“ und so die experimentellen Kosten direkt zu senken. Voraussetzungen: Vertraut mit PyTorch und dem Deep-Learning-Trainingsprozess; über die Fähigkeit verfügen, Roboterbahndaten (RLDS-Format) zu lesen und zu verarbeiten.

  • Absolventen in verkörperter Intelligenz/Robotik: In Papierreproduktionen, Kursprojekten oder Open-Source-Beiträgen stellt HMA gebrauchsfertige vorab trainierte Modelle und vollständige Trainingspipelines bereit, die als Forschungsgrundlagen oder Vergleichsmethoden verwendet werden können. Auch interaktive Demos eignen sich als Lehrmittel zur Demonstration. Voraussetzungen: Verfügen über grundlegende Python- und grundlegende Konfigurationsfunktionen für die CUDA-Umgebung.

  • Algorithmenteam des Robotik-Startup-Unternehmens: In der frühen Produktentwicklungsphase kann HMA als „Free-World-Modell“ für das schnelle Prototyping von Strategien verwendet werden, wodurch die Abhängigkeit von physischer Roboterhardware verringert wird. Empfohlene Verwendung: Verwenden Sie zunächst den öffentlichen Datensatz, um das vorab trainierte Modell zu laden und die Demo auszuführen, und sammeln Sie dann Ihre eigenen Roboterdaten für die Anpassung nach dem Training.

  • Ersteller einer KI-Simulationsplattform: Ein technisches Team, das eine vielfältige visuelle Simulationsumgebung für Roboter bereitstellen muss. Aufgrund der heterogenen Pre-Training-Funktionen und der Apache-2.0-Lizenz eignet sich HMA für die Integration in übergeordnete Workflow-Plattformen.

  • Nicht für die Masse geeignet:

    • Reine Geschäftsanwender (kein Programmierhintergrund): HMA verfügt über keine GUI-Anwendung oder No-Code-Schnittstelle, alle Vorgänge basieren auf Befehlszeilen- und Python-Skripten.
    • Industrielle Benutzer, die stabilen kommerziellen Support benötigen: HMA hat kein SLA, keinen technischen Support, keine Dokumentation auf Unternehmensebene und ist nicht für kritische Pfade in Produktionsumgebungen geeignet.
    • Allgemeine Entwickler und Designer in Nicht-Roboterbereichen: HMA konzentriert sich auf die Roboter-Action-Video-Modellierung und kann nicht für die allgemeine Videogenerierung, Inhaltserstellung und andere Szenarien verwendet werden.

Zusammenfassung und Ausblick

Kernkompetenzen: Der Kernbeitrag von HMA liegt darin, „das maskierte autoregressive Paradigma zum ersten Mal in die dynamische Modellierung von Robotervideos einzuführen und Durchbrüche in der Größenordnung des Vortrainings heterogener Daten und der Echtzeit-Inferenzgeschwindigkeit zu erzielen“. Durch die 15-fache Beschleunigung wird es vom „Offline-Generierungstool“ zur Kategorie „interaktive Echtzeitsimulation“ befördert, was einen wesentlichen Unterschied zu früheren Diffusionsmodelllösungen darstellt. Das vollständig Open-Source-Lizenzmodell (Apache-2.0) verschafft ihm einen natürlichen Verbreitungsvorteil in der akademischen Gemeinschaft.

Aktuelle Einschränkungen: (1) Geringes Maß an Code-Engineering – der Autor schätzte die Codequalität selbst ein: „Codequalität: müder Doktorand“, keine Release-Version, kein CI/CD, kein Docker-Image, die Bereitstellung erfordert bestimmte technische Erfahrung; (2) Komplexe Datensatzvorbereitung – Videoaktionsdatensätze im RLDS-Format erfordern spezielle Tokenisierungspipelines; (3) Einschränkungen im Modellmaßstab – 1B Parameter können auf GPUs der Verbraucherklasse ausgeführt werden, aber das vollständige Vortraining von mehr als 40 Datensätzen erfordert mehrere GPUs-Cluster; (4) Die Gemeinschaftsökologie wurde noch nicht gebildet – die Dokumente bestehen hauptsächlich aus Papieren + README, es gibt kein Forum und es ist keine Integration Dritter bekannt.

Folgebeobachtungspunkte: (1) Ob das Lager eine offizielle Release-Version veröffentlicht und wie häufig versionierte Prüfpunkte aktualisiert werden; (2) Gibt es eine integrierte Unterstützung für Roboter-Standardschnittstellen wie ROS/Gym? (3) ob das Autorenteam eine größere Modellversion oder eine Feinabstimmung der Gewichte für bestimmte Szenarien (z. B. geschickte Bedienung) veröffentlichen wird; (4) ob Pakete von Drittanbietern (z. B. Docker-Images, HuggingFace-Inferenz-APIs, Colab-Notizbücher) in der Community erscheinen, um die Nutzungsschwelle zu senken.

Beschaffungs-/Einführungsrisikobewertung: HMA eignet sich als „Tool zur Beschleunigung der Technologievorforschung und -bewertung“ und wird in dieser Phase nicht als einzige Simulationsabhängigkeit für Produktionsumgebungen empfohlen. Es wird empfohlen, Strategien zu übernehmen: (1) Führen Sie zunächst den gesamten Prozess mit interaktiven Demo- und voreingestellten Datensätzen durch, um die tatsächliche Genauigkeit des Modells in seinem eigenen Szenario zu bewerten. (2) Beginnen Sie mit 200 eigenen Trajektorien, um Experimente nach dem Training durchzuführen und den Datenschwungradeffekt zu quantifizieren. (3) Pflegen Sie vor der vollständigen Überprüfung einen Backup-Kanal für den tatsächlichen Roboter-Rollout. Für Unternehmen, die kommerziellen Support benötigen, wird empfohlen, auf die Reife der Community-Version zu warten oder kommerzielle Alternativen zu prüfen (z. B. NVIDIA Isaac Sim, π0 von Physical Intelligence).

Verwandte Tools: CrewAI, langchain

Versionsinfo

  • Erste HMA-Version :Es umfasst zwei Modellspezifikationen: HMA-MagVit (362M Parameter) und HMA-MAR (1B Parameter), unterstützt zwei Generierungsmodi für diskrete Token und kontinuierliche Token und bietet vollständigen Prozesscode für Pre-Training, Post-Training, Auswertung und Visualisierung.
  • arXiv-Vorabdrucke :Das Papier wurde zuerst auf arXiv (2502.04296) veröffentlicht, wobei der Open-Source-Code und die Modellgewichte synchronisiert wurden.

Benutzerbewertungen

  • Bewertungen werden geladen...