Flux vidéo de foule ComfyUI : Contrôler les personnes, le mouvement et l’occlusion

E
Emma Chen·13 min de lecture·Sep 13, 2026
Partager sur X
Flux vidéo de foule ComfyUI : Contrôler les personnes, le mouvement et l’occlusion

Aperçu IA

Quel est le workflow ComfyUI le plus sûr pour une vidéo de foule ?

Construisez d’abord une image fixe approuvée de foule, séparez le personnage principal des groupes d’arrière-plan, ajoutez un guidage de profondeur ou de pose, puis générez un court extrait. N’augmentez le mouvement de la foule qu’après avoir assuré la stabilité des identités, des trajectoires et des occultations.

Comment maintenir la cohérence de plusieurs personnes dans ComfyUI ?

Attribuez à chaque personne importante un rôle unique, un repère vestimentaire, une zone à l’écran et une action spécifique. Utilisez des références pour les personnages prioritaires, maintenez le mouvement de caméra simple, et examinez intégralement les extraits afin de détecter d’éventuels échanges ou doublons.

Pourquoi les vidéos IA de foule génèrent-elles des corps fusionnés ou des personnes supplémentaires ?

Les scènes de foule combinent de nombreux sujets superposés, des mouvements rapides, des visages réduits et une profondeur incertaine. Lorsque les prompts ne définissent pas explicitement les couches ou les trajectoires, le modèle peut interpréter une occultation comme un nouveau corps ou une nouvelle identité.

Prêt à essayer par vous-même ?

Crédits offerts à l'inscription. Forfaits à partir de $20/mois.

Essayer Seedance gratuitement

Une scène de foule doit-elle être générée en une seule passe ?

N’utilisez qu’une seule passe que pour un arrière-plan simple et légèrement animé. Pour des scènes plus denses, générez ou validez d’abord la couche principale (« hero layer »), contrôlez ensuite la foule comme une deuxième couche, puis effectuez une composition finale ou relancez uniquement la plus petite région ayant échoué.

Pourquoi les scènes de foule échouent-elles plus facilement que les plans individuels

Un plan individuel image-vers-vidéo demande au modèle de préserver une seule identité, un seul corps et une seule action principale. Un plan de foule multiplie ces exigences tout en y ajoutant des intersections : une personne traverse derrière le personnage principal, une autre quitte le cadre, deux bras se chevauchent, et plusieurs petits visages bougent sous compression. Le modèle doit décider, pour chaque image, à qui appartiennent tels pixels. C’est pourquoi une affiche convaincante peut encore produire un extrait inutilisable.

L’objectif pratique n’est pas « générer beaucoup de personnes », mais bien « maintenir une hiérarchie lisible ». Déterminez qui doit être reconnu par le spectateur, qui exécute une action narrative, et qui ne fait que contribuer à l’atmosphère. Accordez au personnage principal la référence la plus forte et la plus grande surface à l’écran. Traitez les figurants mis en avant comme des rôles nommés. Considérez le reste de la foule comme des groupes partageant direction, vitesse et profondeur communes, plutôt que comme vingt étrangers décrits individuellement.

Une répétition cinématographique sépare le personnage principal, le réalisateur et les interprètes d’arrière-plan en couches de profondeur lisibles

Examinez le personnage principal au premier plan, la direction au plan moyen et les marcheurs à l’arrière-plan comme des problèmes de contrôle distincts, plutôt que comme une foule indifférenciée.

Commencez par un bref contrat d’acceptation : le visage du personnage principal reste reconnaissable ; aucun corps n’est dupliqué ; les trajectoires au premier plan ne se heurtent pas ; les couleurs vestimentaires attribuées aux figurants restent stables ; les entrées et sorties n’ont lieu qu’une seule fois ; l’arrière-plan ne capte pas l’attention. Cela transforme l’affirmation vague « la foule a l’air étrange » en défaillances isolables et reproductibles.

Concevez un plan de rôles et de zones avant d’ouvrir le graphe

Attribuez une priorité d’identité

Utilisez trois niveaux. La priorité A concerne le héros ou l’orateur, qui reçoit l’image la plus nette ou une vidéo de référence claire. La priorité B comprend un à trois figurants mis en avant, dont la tenue et l’action sont significatives. La priorité C relève de l’atmosphère : silhouettes, spectateurs assis, voyageurs ou piétons lointains. N’appliquez pas une intensité de conditionnement égale à tous. Trop de références concurrentes peuvent réduire la clarté au lieu de l’améliorer.

Rédigez un manifeste concis avant de formuler le prompt :

Rôle Zone à l’écran Repère visuel Mouvement Doit rester vrai
Principal avant-gauche au centre manteau rouille, sac noir marche vers la caméra visage et manteau restent stables
Figurant A arrière-gauche casquette bleu marine traverse de gauche à droite passe une fois derrière le principal
Groupe B quai éloigné vêtements sombres de bureau monte lentement dans le train reste à l’échelle de l’arrière-plan

Ce tableau sert de contrôle de production, et non de texte à coller mot pour mot. Il vous oblige à résoudre les contradictions avant que le modèle ne doive deviner. Si vous devez conserver la même distribution dans des prises ultérieures, le workflow multi-images-clés explique comment valider et réutiliser les repères visuels.

Bloquez la profondeur et les voies de circulation

Esquissez la prise en zones de premier plan, plan moyen et arrière-plan. Définissez deux ou trois voies de déplacement avec des directions différentes. Évitez, lors du premier test, de faire passer plusieurs corps entiers par le même point central. Les traversées latérales sont plus faciles à évaluer qu’une foule sans limite circulant dans toutes les directions. Une caméra statique ou suivant doucement laisse davantage de capacité pour le mouvement des corps et la stabilité des identités.

Un voyageur vêtu d’un manteau rouille demeure la priorité visuelle tandis que des piétons d’arrière-plan traversent à différentes profondeurs

Utilisez un test d’occultation où certaines personnes passent devant et d’autres derrière, puis vérifiez si chaque corps quitte proprement le cadre au lieu de se fusionner.

Construisez le workflow vidéo de foule ComfyUI

1. Validez une image fixe de composition

Créez ou fournissez une image propre au format 16:9 ou 9:16, avec la hauteur finale de caméra, la densité de foule, les affectations vestimentaires et les voies de déplacement libres. Corrigez les visages dupliqués, les mains impossibles ou les pieds intersectés avant l’animation. L’image-vers-vidéo peut animer une image validée ; elle ne doit pas être attendue pour réparer une disposition de foule défectueuse. Pour un test direct hébergé, la route image-vers-vidéo Seedance vous permet d’évaluer la même source sans maintenir localement un graphe.

2. Extrayez uniquement les contrôles nécessaires à la prise

Choisissez le guidage en fonction de l’échec que vous anticipez. La profondeur aide à préserver l’ordre premier plan–arrière-plan. La pose facilite une action mise en avant. Les contours protègent l’architecture ou un grand accessoire. La segmentation ou les masques aident à isoler le personnage principal d’un groupe atmosphérique. Utilisez la combinaison la plus légère qui maintient la lisibilité de la scène. Empiler tous les prétraitements à forte intensité peut rigidifier le mouvement ou introduire des désaccords entre les contrôles.Pour les références en mouvement, découpez une séquence propre avec une caméra et un rythme corporel similaires. Normalisez la résolution et la fréquence d’images avant l’extraction. Vérifiez que les pistes de pose ne sautent pas d’une personne à une autre lorsqu’elles se croisent. Un squelette inversé produira inévitablement un mouvement inversé, quelle que soit la précision avec laquelle le prompt positif est rédigé.

3. Séparez le mouvement du personnage principal de celui de la foule

Construisez une version de base comportant uniquement le personnage principal et quelques figurants seulement. Conservez inchangés la graine (seed), le modèle, l’échantillonneur (sampler), les dimensions, le nombre d’images, ainsi que les instructions relatives à la caméra. Une fois que le personnage principal est validé, ajoutez progressivement la foule atmosphérique ou une deuxième branche de conditionnement. Si le flux de travail prend en charge le masquage ou la composition (compositing), maintenez les sorties du personnage principal et de l’arrière-plan indépendantes suffisamment longtemps pour pouvoir corriger l’une sans régénérer les deux.

src=https://r2.seedance.tv/blog/image-to-video-ai-with-prompt-online-free/social-motion-output-v1.mp4
poster=https://r2.seedance.tv/blog/image-to-video-ai-with-prompt-online-free/social-motion-output-poster-v1.jpg
label=Personne en déplacement avec des piétons traversant une gare

Cette séquence existante issue de la bibliothèque Seedance sert d’exemple d’inspection, et non d’un benchmark contrôlé sous ComfyUI. Observez attentivement le corps du personnage principal, les piétons qui passent, les contours du manteau, les pieds et les occultations tout au long du mouvement.

4. Enregistrez le graphe et sa traçabilité (provenance)

Enregistrez conjointement le fichier JSON du flux de travail, les noms des modèles utilisés, les versions des nœuds personnalisés, les hachages des entrées, la graine (seed), les dimensions, le nombre d’images, la fréquence d’images (FPS), les intensités des contrôles, ainsi que la sortie retenue. ComfyUI peut relancer uniquement les régions modifiées du graphe, mais cet avantage disparaît si la configuration approuvée n’est pas correctement documentée. Si l’exécution de la file d’attente (queue) se bloque après le rendu, suivez le guide de récupération après gel de ComfyUI avant de modifier les paramètres créatifs.

Générez plusieurs personnes dans le prompt sans créer le chaos

Rédigez le prompt dans l’ordre de la prise de vue : décor, sujet prioritaire, figurants mis en valeur, groupes de foule, caméra, puis exclusions. Nommez chaque personne importante une seule fois et conservez ses descripteurs stables. Décrivez collectivement les personnes en arrière-plan : « six voyageurs portant des manteaux sombres avancent vers le wagon ouvert » est plus clair qu’une longue liste de visages, d’âges et d’accessoires non liés entre eux.

Un modèle utile est le suivant :

Plateforme large sous la pluie, caméra à hauteur des yeux. La femme vêtue d’un manteau rouille marche de l’avant-gauche vers le centre, regard tourné vers l’avant. Un homme coiffé d’une casquette bleu marine passe derrière elle, de gauche à droite. Le groupe éloigné monte lentement dans le train à l’arrêt. Mouvement doux de la caméra vers l’avant ; allure naturelle de la marche ; visage en premier plan stable ; aucune duplication de personnes ; aucune collision ; aucune arrivée brutale.

Utilisez des instructions négatives uniquement pour les catégories d’échecs visibles, et non pour chaque objet imaginable. « Aucun corps dupliqué, aucun membre fusionné, aucun échange de visages, aucun piéton téléporté, aucune marche à reculons, aucune personne nouvelle n’entrant soudainement en premier plan » constitue une instruction opérationnelle. Si les visages échouent uniquement lorsque les sujets deviennent petits, le guide de réparation des visages à distance fournit un diagnostic ciblé plutôt que d’imposer une guidance globale renforcée.

Six danseurs occupent des voies distinctes tandis que des piétons ordinaires restent en arrière-plan lointain

Un test de chorégraphie doit préserver des corps et des gestes distincts, tandis que le trafic en arrière-plan reste subordonné.

Évaluez la cohérence de la foule à l’aide d’une petite échelle de stress

Ne commencez pas directement par la scène finale d’un festival, d’une bataille ou d’un concert. Utilisez une échelle en quatre étapes. Premièrement, animez trois personnes sans croisement. Deuxièmement, faites passer un figurant derrière le personnage principal. Troisièmement, introduisez une occultation en premier plan. Quatrièmement, ajoutez un groupe atmosphérique distant. Gardez la durée courte et examinez chaque étape avant d’augmenter la densité.

Évaluez la sortie à vitesse normale, puis image par image :

  • Identité : les visages, les cheveux et les tenues du sujet prioritaire restent correctement attribués.
  • Comptage : aucune nouvelle personne n’apparaît en premier plan, et aucune personne requise ne disparaît prématurément.
  • Anatomie : les membres se séparent correctement avant et après tout recouvrement.
  • Trafic : chaque entrée, croisement et sortie suit la voie spécifiée.
  • Profondeur : les personnes éloignées restent plus petites et ne sautent pas soudainement en premier plan.
  • Caméra : le mouvement ne provoque pas un décalage ou une « respiration » de l’ensemble du groupe.
  • Finition temporelle : les dernières images sont suffisamment stables pour permettre un montage ou une extension.

Notez la première image où une règle est violée. Ce point révèle souvent si la cause est un agencement initial défaillant, un échange de piste de pose, un mouvement excessif, un conditionnement d’identité trop faible ou un mouvement de caméra en conflit avec la foule.

Corrigez les échecs sans reconstruire entièrement la scène

Si des corps se fusionnent, augmentez l’espacement initial, simplifiez les trajectoires de croisement, renforcez la séparation par profondeur ou par masque, et raccourcissez la séquence. Si l’identité du personnage principal dérive, réduisez le niveau de détail de la foule dans le prompt et augmentez l’influence de la référence prioritaire, plutôt que d’augmenter tous les contrôles simultanément. Si l’arrière-plan est figé, ajoutez une action collective unique et un mouvement léger ; n’attribuez pas à chaque personne lointaine une performance individuelle.

Lorsque le mouvement présente des saccades, inspectez image par image les pistes de pose ou les guides optiques. Lissez une seule piste défectueuse, réduisez l’intensité du contrôle vers la fin, ou supprimez un conditionneur contradictoire. Lorsque des personnes apparaissent soudainement aux bords de l’image, commencez avec moins de corps adjacents aux bords et spécifiez explicitement leurs entrées. Conservez toujours un graphe de référence fonctionnel à côté de chaque expérience, afin qu’une mise à jour de nœud n’efface jamais la dernière configuration connue comme valide.

Un marché animé offre de nombreuses couches de profondeur sans faire de chaque client un personnage mis en avant

Pour une atmosphère dense, évaluez d’abord l’ordre de profondeur, la netteté des silhouettes et la crédibilité du trafic, avant d’exiger des performances individuelles pour les personnages en arrière-plan.

Pour générer de nombreuses variantes, séparez clairement la génération créative de l’orchestration des fichiers. Le guide de traitement par lots sous ComfyUI couvre les dossiers déterministes, les manifestes et les nouvelles tentatives ; ce flux de travail pour foules doit d’abord produire une seule séquence validée, digne d’être traitée par lot.

Lorsque Seedance Agent constitue la voie de production la plus simpleUn graphique ComfyUI local est précieux lorsque vous avez besoin de prétraitements précis, de masques personnalisés, d’un contrôle au niveau du modèle ou d’expériences reproductibles. Il vous rend également responsable des références, des versions des nœuds, de l’état de la file d’attente, de l’examen des sorties et des réexécutions partielles. Les scènes de foule amplifient cette coordination, car un seul élément supplémentaire rejeté peut invalider une prise par ailleurs solide.

Seedance Agent s’avère utile lorsque la mission de production importe davantage que la propriété du graphique. Fournissez les priorités des figurants, les ressources de référence, le manifeste des plans, les voies de circulation pour la foule, la durée, le format d’image (rapport hauteur/largeur) et les règles d’acceptation. Examinez le plan de tournage proposé avant la génération, approuvez le résultat le plus convaincant, et ne relancez que l’unité ayant échoué. L’avantage n’est pas la promesse que chaque foule sera parfaite ; il réside plutôt dans une délimitation plus claire entre la phase de planification, celle de génération, celle d’examen et celle de livraison.

Conclusion

Un flux de travail fiable pour la génération vidéo de foules avec ComfyUI commence par une composition validée, attribue une priorité d’identité, sépare les zones de profondeur et les voies de circulation, n’applique que les contrôles strictement nécessaires, et augmente progressivement la densité selon une échelle de stress mesurée. Évaluez l’intégralité de la séquence en tenant compte de l’identité, du nombre de figurants, de l’anatomie, des occlusions, du mouvement et de la qualité de la fin, puis réparez uniquement la couche la plus petite ayant échoué, plutôt que de tout redémarrer. Lorsque la gestion des références, des masques, des versions des nœuds, des examens et des réexécutions devient une tâche plus importante que la génération elle-même, planifiez et produisez la séquence de foule à l’aide de Seedance Agent tout en conservant ComfyUI pour les plans qui bénéficient réellement d’un contrôle local.

Prêt à essayer par vous-même ?

Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.

Crédits offerts à l'inscription. Forfaits à partir de $20/mois.