Discussion infinie
Gratuit
InfiniteTalk est le cadre de recherche open source de Meituan pour le doublage vidéo audio et l'animation de personnages image en vidéo. La fonctionnalité principale est le doublage vidéo à images clairsemées - non seulement l'édition de la bouche, mais l'édition du mouvement du corps entier. Prend en charge la génération de longueur illimitée et l’inférence de streaming.
Revue complète de #InfiniteTalk
Paramètres et statistiques de base
| Projet | Spécifications |
|---|---|
| Positionnement du produit | Cadre de recherche pour la génération vidéo parlante basée sur l'audio |
| Agence de développement | Meituan Meigean IA |
| Licence Open Source | Apache-2.0 |
| Technologie de base | Doublage vidéo à trame clairsemée + inférence de streaming |
| Méthode de saisie | Vidéo + audio (doublage) / image + audio (animation de personnages) |
| Qualité de sortie | 480P/720P |
| Performances d'inférence | GPU unique / GPU multiples / Mémoire faible / Quantification |
| Durée de génération | Illimité (raisonnement de flux, théoriquement pas de limite supérieure de longueur) |
Reconnaissance des utilisateurs et du marché
InfiniteTalk est l'importante contribution open source de Meituan dans le domaine de l'animation de personnages audio. Contrairement à la plupart des solutions humaines numériques « bouche uniquement » sur le marché, InfiniteTalk adopte l'idée du doublage vidéo à images clairsemées - non seulement en éditant la zone de la bouche, mais en éditant l'ensemble du mouvement du corps. Cela signifie que la vidéo générée ne représente pas seulement « la bouche bouge », mais « la personne tout entière bouge » - y compris la posture de la tête, les mouvements du corps, les gestes, etc., coordonnés avec le contenu audio.
Vérification de la publicité : l'"infini" de la "génération de longueur infinie" est théoriquement établi (le raisonnement en streaming n'a pas de limite supérieure de longueur), mais dans la réalité, la cohérence sémantique et la cohérence identitaire des longues vidéos se dégraderont avec le temps. En prolongeant une vidéo de 30 secondes à 5 minutes, le degré de dégradation de la qualité dépend du contenu et de la complexité de la scène.
Avantage de coût
Un projet de recherche open source (Apache-2.0) avec des poids de code et de modèle accessibles au public. La déclaration officielle indique que le contenu généré est destiné à un usage académique uniquement et que l'utilisation commerciale nécessite la confirmation des termes de la licence. Le coût d'utilisation réel concerne principalement les ressources d'inférence GPU - la génération 720P nécessite une mémoire graphique plus élevée, mais le projet propose des modes de quantification et de mémoire graphique faible pour abaisser le seuil.
Free Truth : Apache-2.0 est open source et les poids des modèles sont également accessibles au public en téléchargement. Cependant, la page officielle du projet indique clairement que le contenu généré est uniquement destiné à un usage académique. Si vous avez besoin d'une utilisation commerciale, vous devez confirmer vous-même les limites de la licence. De plus, l'inférence 720P nécessite au moins 16 Go de mémoire vidéo, et les développeurs individuels peuvent toujours devoir louer des GPU cloud.
Fonctions principales
- Doublage vidéo à images clairsemées : recevez une vidéo existante + un nouvel audio et produisez une toute nouvelle vidéo avec un audio et une vidéo synchronisés. Contrairement aux méthodes traditionnelles qui remplacent uniquement la bouche, InfiniteTalk modifie l'intégralité de l'image vidéo, y compris les expressions faciales, les mouvements de la tête, la posture du corps et même la cohérence de l'arrière-plan.
- Animation image vers vidéo du personnage : à partir d'une image du personnage + d'un audio, générez une vidéo du personnage parlant/jouant. L’entrée peut être un personnage virtuel généré par l’IA à partir de photos réelles, ou même une image de dessin animé.
- Génération de streaming d'une durée illimitée : Grâce au raisonnement en streaming et au mécanisme de cadre de contexte temporel, des vidéos de n'importe quelle longueur peuvent théoriquement être générées. L'image de fin de chaque segment est automatiquement utilisée comme contexte du segment suivant pour garantir une transition fluide entre les segments.
- Convivial à faible mémoire : prend en charge les modes d'inférence quantitatifs et à faible mémoire, permettant aux développeurs disposant de ressources limitées d'exécuter des expériences.
Evolution du modèle et de la version
Version principale
- ~2026-06 : InfiniteTalk est publié pour la première fois en open source, offrant le doublage vidéo, la conversion d'image en vidéo, l'inférence de streaming et la prise en charge de l'inférence de mémoire faible.
Avantages techniques
- Optimisation de l'algorithme : une optimisation spéciale au niveau du modèle ou de l'algorithme a été réalisée pour le scénario correspondant afin d'atteindre un équilibre entre vitesse de réponse et qualité des résultats.
- Architecture à faible latence : adopte une architecture de traitement en continu ou asynchrone pour réduire le temps d'attente des utilisateurs et convient aux scénarios d'interaction à haute fréquence.
Comment utiliser
- Visitez le référentiel GitHub (https://github.com/meigen-ai/InfiniteTalk) pour télécharger le code
- Configurez le contexte Python et téléchargez le modèle pré-entraîné
- Sélectionnez le mode : doublage vidéo (entrée vidéo + audio) ou image vers vidéo (entrée image + audio)
- Exécutez le script d'inférence :
python infer.py --mode dub --input video.mp4 --audio Speech.wav - Facultatif : Exécuter en mode mémoire faible ou en mode quantifié
Prix des produits
| Projet | Descriptif |
|---|---|
| Licence de code | Apache-2.0 Open Source |
| Poids du modèle | Téléchargement public (usage académique) |
| Utilisation commerciale | Conditions de licence requises |
| Service API | Non fourni |
Limite de collaboration homme-machine : 100 % d'automatisation : génération vidéo intégrale basée sur l'audio, assemblage de vidéos longues avec inférence de streaming. Une intervention manuelle est requise : acceptation de la précision de la synchronisation labiale des résultats générés, cohérence de l'arrière-plan de la vidéo et échantillonnage de la cohérence de l'identité des personnages. Avant de publier, il est recommandé d'examiner le contenu vidéo segment par segment, en particulier les vidéos longues de plus de 2 minutes.
Scénarios d'application
- Doublage et traduction vidéo : remplacez les vidéos parlantes existantes par un doublage dans différentes langues ou différents personnages, en conservant la cohérence des mouvements et des arrière-plans des personnages dans la vidéo originale. Convient à la localisation multilingue du contenu vidéo.
- Production de contenu d'animation de personnages : générez une vidéo complète de discours/performance à partir d'un dessin de personnage + audio. Convient à la production par lots d'ancres virtuelles et de contenu humain numérique, du besoin d'équipement de capture de mouvement et de modélisation 3D à une seule image + audio.
- Expérience humaine numérique à des fins de recherche : étudiez l'animation de personnages pilotée par l'audio, la cohérence de la génération de vidéos longues, l'alignement multimodal, etc.
Personnes concernées
- Chercheur en vision par ordinateur : chercheurs engagés dans les domaines liés à l'animation audio, à la génération vidéo et à l'humain numérique.
- Créateur de contenu virtuel : créateurs humains numériques qui ont besoin de générer par lots des vidéos parlantes, la nature open source d'InfiniteTalk évite les coûts d'API et les limitations des plates-formes tierces.
- Développeur d'applications vidéo IA : développeurs qui intègrent des capacités de génération de vidéo parlante dans leurs produits ou services.
Résumé et Outlook
La voie technique d'InfiniteTalk - le doublage vidéo du corps entier en images clairsemées - offre une alternative à la solution « bouche uniquement » dans le domaine des humains numériques. Les vidéos qu'il produit sont plus naturelles et complètes, mais le montage complet est également plus difficile et plus coûteux en termes de calcul. En tant que projet open source, il fournit à la communauté des chercheurs une base de référence reproductible et de haute qualité. Pour les équipes qui souhaitent développer leurs propres capacités de génération humaine numérique, en contournant les API commerciales, il s'agit d'une solution open source qui mérite d'être envisagée.
Limites actuelles : Meituan est maintenu par son équipe interne, un produit non commercial et ne dispose d'aucun canal de support technique ; la charge de calcul de l'édition du corps entier est supérieure à celle de la solution de la bouche uniquement, et la génération en temps réel n'est pas encore réalisable ; les performances de la vidéo générée dans des arrière-plans complexes ou des scènes à plusieurs personnes doivent être vérifiées.
Scénario de dissuasion : si votre besoin est de générer rapidement une vidéo de création orale pour les réseaux sociaux, les coûts de déploiement et de configuration d'InfiniteTalk (environnement auto-construit, modèles de téléchargement, paramètres de débogage) peuvent dépasser la commodité de l'utilisation directe d'API commerciales (HeyGen, D-ID). La valeur des solutions open source réside principalement dans la personnalisation et les scénarios batch.
Avantages cachés : pour les équipes qui souhaitent créer leur propre pipeline de vidéo humaine numérique, le protocole open source Apache-2.0 d'InfiniteTalk permet une transformation commerciale et un développement secondaire basés sur le code, évitant ainsi la dépendance aux API et la facturation à l'utilisation sur des plateformes tierces.
Outils associés : runway, pika
Informations de version
- Discussion infinie :La première version open source, offrant le doublage vidéo, la conversion d'image en vidéo, le raisonnement en streaming et la prise en charge du raisonnement à faible mémoire.
- Discussion infinie :Il est open source pour la première fois et prend en charge le doublage vidéo à images clairsemées et l'animation de personnages image vers vidéo. Il n’y a pas encore de date officielle précise.
Avis des utilisateurs