Index AniSora
Gratuit
Index AniSora est le projet de génération de vidéo d'animation open source de Bilibili. Il est systématiquement construit autour de la génération vidéo de style animation, du contrôle spatio-temporel, de la cohérence des personnages et de critères d'évaluation spécialisés. L’objectif n’est pas la vidéo réaliste générale, mais la production de contenu d’animation.
Index AniSora
Paramètres et statistiques de base
[Un bref commentaire en une phrase] : Il ne s'agit pas d'un skin d'animation pour un modèle général de génération vidéo, mais d'un ensemble complet de données, de modèles et de systèmes d'évaluation spécialement établis par Bilibili pour la production vidéo d'animation.
[Vérification de la publicité] : L'entrepôt officiel s'écrit directement comme « le modèle de génération de vidéo animée open source le plus puissant ». Bien sûr, ce type de formulation a une composante promotionnelle, mais au moins la direction n'est pas fausse, car le projet, depuis les articles, les pipelines de données, les critères d'évaluation jusqu'aux droits d'auteur multiples, est en effet centré sur la « vidéo animée » plutôt que sur la génération pan-vidéo. Les problèmes qu'il touche sont clairs : les modèles vidéo réalistes se déplacent souvent de manière erratique dans le style anime, la logique physique et l'exagération artistique sont en conflit, et la cohérence des personnages est médiocre.
| Projets | Informations publiques |
|---|---|
| Positionnement officiel | Modèle et système de génération de vidéo d'animation open source |
| Ligne principale actuelle | V3.2 |
| Papier | IJCAI 2025 Accepté |
| Portail open source | GitHub, visage câlin, ModelScope |
| Échelle des données | Les articles et les modèles de cartes mentionnent publiquement 10 millions de niveaux de données d'animation de haute qualité |
| Référence | AniSora-Benchmark, comprenant 948 clips vidéo animés |
| Taille de la communauté | GitHub environ 2,5 000 étoiles, 147 forks |
Point de vue de l'expert : La chose la plus précieuse de ce projet n'est pas le point de contrôle unique du modèle, mais la « construction d'un système d'évaluation et de nettoyage des données spécifiquement pour les scènes d'animation ». En raison du style, des mouvements exagérés et de la stabilité de la modélisation des personnages des vidéos animées, il n'est pas approprié d'appliquer directement les références du monde réel.
Reconnaissance des utilisateurs et du marché
La reconnaissance actuelle d'AniSora vient davantage de la communauté open source et des cercles technologiques de contenu d'animation. GitHub compte environ 2,5 000 étoiles et Hugging Face compte environ 227 likes. Ce n'est pas un succès national, mais pour un projet de génération vidéo verticale, il est entré dans la phase de « certaines personnes continuent d'y prêter attention et certaines se préparent à un développement secondaire ».
Reconnaissance des utilisateurs et du marché : Les scénarios d'adaptation officiels sont très clairs, y compris des séries animées, des animations créées à l'échelle nationale, du contenu VTuber adapté aux bandes dessinées, des PV animés et des œuvres de fantômes et d'animaux. Cela montre qu’il ne s’adresse pas à toutes les équipes vidéo, mais mise clairement sur la chaîne de production de contenus d’animation.
Vérification de la publicité : Si vous souhaitez générer des publicités réalistes ou des vidéos d'action en direct de marque, AniSora n'a aucun avantage ; mais si vous souhaitez des mouvements de personnages d'animation, un contrôle de l'objectif d'animation et un transfert de style, le positionnement du produit est plus ciblé que le modèle vidéo général.
Avantages cachés : Ce que l'équipe d'animation craint le plus, c'est le coût élevé de la vérification précoce et la nécessité de nombreux tests manuels sur les mouvements des personnages. L'avantage d'AniSora est qu'il est moins coûteux de publier d'abord une version de plans animés.
Avantage de coût
Vérité gratuite : Le fait que le poids et le code du projet soient open source ne signifie pas que tout le monde peut l'utiliser à faible coût. La génération de vidéos publiques, en particulier les personnages 3D, le transfert de style et le contrôle des plans longs, nécessitent une mémoire, un temps d'inférence et des coûts de stockage élevés. Le soi-disant « open source et gratuit » permet d'économiser principalement les frais de licence, et non les coûts de formation et d'inférence.
| Couche de coûts | Divulgation | Ce que cela signifie réellement |
|---|---|---|
| Côté C/individuel | Pas de service fini pour les consommateurs ordinaires | Plus comme un projet prototype qu'un produit prêt à l'emploi |
| Développeur/API | Les poids sont open source et peuvent être téléchargés | Vous devez supporter vous-même le coût du déploiement du modèle, de la carte graphique, de l'inférence et de l'ajustement des paramètres |
| Entreprise | Pas de package commercial public | Si vous souhaitez vous lancer en production, vous devez créer votre propre plate-forme et votre propre processus de révision de contenu |
Coût caché : la génération de vidéos animées nécessite particulièrement une « cohérence du style » et une « contrôlabilité ». Les frais de licence que vous économisez sont souvent dépensés en cartes graphiques, en files d'attente d'inférence, en exploration de paramètres et en filtrage manuel.
Avantages cachés : pour les studios d'animation ou les équipes de contenu virtuel, le plus précieux est qu'ils peuvent vérifier les actions et les plans plus rapidement sans avoir à parcourir l'intégralité de l'art et du storyboard à chaque fois.
Fonctions principales
- Génération de vidéo d'animation : pour un style d'animation plutôt que des vidéos réalistes.
- Raisonnement arbitraire sur les images et contrôle du timing : plus adapté à la connexion d'objectifs d'animation et à la construction de cadres intermédiaires.
- Génération de vidéos 3D de personnages : générez des vidéos dynamiques multi-angles à partir d'images frontales de personnages pour aider à maintenir les personnages stables.
- Migration du style vidéo : migrez la vidéo originale vers le style d'animation cible.
- Guidage multimodal : prend en charge la pose, la profondeur, le dessin au trait, l'audio et d'autres méthodes de guidage pour contrôler les actions.
- Super-résolution vidéo ultra basse résolution : réduisez le coût d'échantillonnage, puis augmentez l'image à une résolution plus élevée.
Vue d'expert : Le plus grand lien caché entre ces fonctions est qu'ils placent à la fois la « cohérence des personnages » et le « contrôle des actions » dans la même chaîne de production. Le problème le plus courant avec les modèles vidéo universels est que les visages des personnages changent lorsqu'ils bougent, et le contenu d'animation en a le plus peur.
Evolution du modèle et de la version
Le rythme de la version d'AniSora est très clair et presque chaque étape résout un problème difficile dans la production d'animation.
Ligne principale de la version publique
V3 : 2025-08-27 Les poids sont divulgués et un raisonnement de trame arbitraire, une vidéo 3D de personnages, un transfert de style et un guidage multimodal sont ajoutés, ce qui est un nœud clé de « capable de générer » à « capable de contrôler ».
V3.1 : 04/09/2025 L'accent est mis sur le renforcement de l'amplitude de contrôle des mouvements, indiquant que l'équipe a commencé à traiter des problèmes de naturel dynamique plus détaillés.
V3.2 : 2025-09-23 Basé sur un entraînement de modèle de base plus solide, le nombre d'étapes d'inférence est réduit à 8, ce qui signifie qu'il recherche en même temps la vitesse et l'effet.
Limites actuelles : Bien que la gamme de versions soit très claire, il n'existe pas de support commercial stable ni de SLA du SaaS traditionnel. L'accès limité à la production est plus approprié pour fixer des versions de poids spécifiques, plutôt que pour rechercher les dernières jusqu'au bout.
Avantages techniques
Index AniSora est un croisement entre [l'infrastructure de base de grands modèles/API] et les outils de production vidéo verticale.
Performances et débit : la page publique ne donne pas de limites de concurrence TTFT, RPM ou cloud ; mais le responsable indique clairement que la V3 peut générer 5 secondes de séquence vidéo d'animation 360p en 8 secondes, ce qui est l'une des rares informations publiques pouvant refléter directement l'efficacité de l'inférence. Le débit réel pour les scénarios de contrôle haute résolution et complexes dépend toujours du contexte de déploiement.
Mécanique -> Effets -> Scènes :
Pipeline de données spécifiquement pour l'animation : construisez des données d'entraînement de haute qualité grâce à la détection de scènes, au flux optique, à la notation esthétique, etc. L'effet est que le modèle comprend mieux le langage d'animation et est plus adapté à VTuber, PV, modification de bande dessinée et contenu de deuxième génération.
Masque spatio-temporel et contrôle multimodal : l'effet est de permettre un contrôle plus détaillé des actions et des zones locales, plutôt que la génération aléatoire de l'ensemble du segment, adapté à la conception d'objectifs d'animation et aux démonstrations d'actions spécifiques.
Repères spécialisés alignés sur les préférences humaines : La valeur d'AniSora-Benchmark est qu'il évalue non pas un monde réaliste général, mais l'esthétique de l'animation et la cohérence de l'action.
Limite d'adaptation : il est le meilleur en matière d'animation et de contenu bidimensionnel ; il est moins bon pour les images commerciales réalistes et les vidéos sérieuses qui nécessitent de vraies formes de bouche et une vraie grammaire photographique.
Comment utiliser
clone git https://github.com/bilibili/Index-anisora.git
cd Index-anisora
# Sélectionnez le répertoire correspondant en fonction de la version cible, comme anisoraV3.2 ou anisoraV3
Remarque : L'entrepôt officiel et Hugging Face ont divulgué plusieurs répertoires de versions et entrées de poids. Le déploiement réel dépend des différentes versions. Les commandes spécifiques sont soumises au sous-répertoire correspondant README.
Mode d'entrée :
| Entrée | Objets applicables | Descriptif |
|---|---|---|
| Code de formation/inférence GitHub | Équipe R&D | Convient pour l'entraînement et l'inférence par vous-même |
| Étreindre les poids du visage | Équipe d'ingénierie des modèles | Convient au téléchargement et à l'expérimentation |
| ModèlePortée | Écosystème de développeurs chinois | Convient aux téléchargements nationaux et à l'intégration secondaire |
Limite de la collaboration homme-machine : les brouillons de plans et l'exploration de mouvements peuvent être automatisés, mais avant qu'ils ne soient réellement utilisés pour une animation commerciale ou du contenu IP de personnages, les films doivent toujours être examinés manuellement, en se concentrant sur la stabilité des personnages, la cohérence du style et les risques liés aux droits d'auteur.
Prix des produits
Il n’existe actuellement aucun formulaire d’abonnement commercial accessible au public. Son modèle de coût n'est pas un « frais mensuel », mais un coût typique d'un modèle vidéo open source : carte graphique, stockage, temps d'inférence, filtrage manuel et examen du contenu.
Côté/Personnel : il n'existe pas de version grand public légère et prête à l'emploi.
Développeur/API : Le code et les pondérations sont open source, mais le coût d'appel provient de la puissance de calcul.
Entreprise : si vous envisagez de créer une plate-forme interne de ressources d'animation, vous devez également inclure la gestion des files d'attente, les autorisations, la révision et la gestion des droits d'auteur sur le matériel dans votre budget.
La vérité sur la gratuité : Plus le contrôle de la vidéo d'animation est complexe, moins il est susceptible de résoudre le problème du coût total en s'appuyant uniquement sur les mots « open source et gratuit ».
Scénarios d'application
- VTuber et contenu de personnages virtuels : Forte demande en matière de stabilité des personnages et de contrôle des mouvements.
- PV d'anime et vidéo promotionnelle : testez rapidement les plans, testez l'élan et le style.
- Prototypes d'adaptation de bandes dessinées et d'animation secondaire : convient d'abord aux brouillons dynamiques et aux démonstrations de concepts.
- Recherche et évaluation sur les technologies d'animation : le projet est accompagné d'un benchmark spécial pour faciliter la comparaison verticale.
Scénario d'attaque par réduction de dimensionnalité : Lorsque la cible est une animation au lieu d'une vidéo panoramique, sa verticalité dépassera évidemment le modèle vidéo général de Vincent.
Limites actuelles : cette fonctionnalité n'est pas optimale pour les vidéos réalistes, les longs récits continus et les dialogues fortement synchronisés sur les lèvres.
Personnes concernées
- Animation Studio et Virtual Content Team : vous souhaitez accélérer la vérification des plans et l'exploration des mouvements.
- Équipe de recherche sur la génération vidéo : nécessite des pondérations publiques des catégories d'animation et des benchmarks dédiés.
- Créateurs indépendants et développeurs secondaires : J'espère essayer la génération de vidéos d'animation dans le système open source.
Scénario de persuasion :
- Les personnes qui souhaitent simplement produire rapidement de courtes vidéos marketing prêtes à l'emploi : il se concentre sur les projets de R&D et de prototypes.
- Personnes sans ressources de carte graphique : Le seuil de déploiement n'est pas bas.
- Personnes qui réalisent des vidéos réalistes de vraies personnes : Sa vision du monde n'est pas optimisée pour les vidéos réalistes.
Résumé et Outlook
La véritable valeur d'Index AniSora n'est pas aussi simple que de « prouver que l'animation peut également produire des vidéos », mais qu'elle transforme la génération de vidéos d'animation en un projet systématique avec des pipelines de données, des lignes principales de version et une évaluation dédiée. Pour la production de contenu vertical, ce type de construction spécialisée est plus significatif que des réparations mineures du modèle général.
[Évaluation des risques d'approvisionnement/d'adoption] : Si l'équipe réalise une animation VTuber, un PV, une création secondaire ou une vidéo de personnage, AniSora mérite une attention continue ; si l’objectif commercial est une publicité réaliste et une génération pan-vidéo, l’orientation des capacités peut ne pas correspondre. Avant l’adoption, concentrez-vous sur la vérification des ressources de la carte graphique, de l’adéquation du style cible, de la stabilité des caractères et des limites secondaires des droits d’auteur. Ne laissez pas le mot « open source » masquer les véritables coûts de mise en œuvre.
Outils associés : runway, pika
Informations de version
- Anisora V3.2 :La dernière ligne principale de poids divulguée dans la description officielle de la mise à jour est basée sur une formation Wan2.2 plus forte et compresse le nombre d'étapes d'inférence à 8 étapes, continuant à conserver les fonctions d'inférence d'image arbitraire et de génération de vidéo 3D de personnages.
- Anisora V3.1 :Améliore l'amplitude des capacités de mouvement et recommande que le score de mouvement soit réglé entre 2,0 et 4,0, ce qui constitue une version améliorée importante du contrôle de l'élan de l'animation.
- Anisora V3 :Les poids sont exposés dans Hugging Face et ModelScope, et de nouvelles inférences d'images arbitraires, une génération de vidéos 3D de personnages, un transfert de style vidéo, un guidage multimodal et une super-résolution vidéo ultra-basse résolution sont ajoutés.
Avis des utilisateurs