- Blog
- Flujo de trabajo de vídeo grupal para ComfyUI: control de personas, movimiento y oclusión
Flujo de trabajo de vídeo grupal para ComfyUI: control de personas, movimiento y oclusión

Resumen de IA
¿Cuál es el flujo de trabajo más seguro para vídeos con multitudes en ComfyUI?
Cree una imagen fija aprobada de la multitud, separe al personaje principal de los grupos de fondo, agregue orientación de profundidad o postura, y genere un plano corto. Aumente el movimiento de la multitud únicamente después de que las identidades, las trayectorias y las oclusiones permanezcan estables.
¿Cómo mantener la coherencia de múltiples personas en ComfyUI?
Asigne a cada persona importante un rol único, un elemento distintivo de vestuario, una zona de pantalla y una acción específica. Use referencias para los personajes prioritarios, mantenga el movimiento de cámara sencillo y revise clips completos para detectar intercambios o duplicados.
¿Por qué los vídeos con multitudes generados por IA crean cuerpos fusionados y personas adicionales?
Las multitudes combinan muchos sujetos superpuestos, movimiento rápido, rostros pequeños y profundidad incierta. Cuando los prompts no definen capas o trayectorias, el modelo puede reinterpretar una oclusión como un cuerpo o identidad nueva.
¿Listo para probarlo tú mismo?
Créditos gratis al registrarte. Planes desde $20/mes.
¿Debe generarse una escena con multitud en una sola pasada?
Use una sola pasada únicamente para un fondo simple con movimiento leve. Para acciones más densas, genere o apruebe primero la capa principal (hero layer), controle la multitud como segunda capa y luego componga o vuelva a ejecutar únicamente la región más pequeña que haya fallado.
Por qué las escenas con multitudes fallan más fácilmente que los planos individuales
Un plano individual de imagen-a-vídeo exige al modelo preservar una única identidad, un solo cuerpo y una acción principal. Un plano con multitud multiplica esas exigencias al añadir intersecciones: una persona cruza detrás del protagonista, otra sale del encuadre, dos brazos se solapan y varios rostros pequeños se mueven bajo compresión. El modelo debe decidir, en cada fotograma, a quién pertenecen los píxeles. Por eso, un póster convincente puede convertirse aún así en un clip inutilizable.
El objetivo práctico no es «generar muchas personas», sino mantener una jerarquía legible. Decida quiénes deben ser reconocidos por la audiencia, quiénes realizan una acción narrativa y quiénes simplemente aportan atmósfera. Asigne al personaje principal la referencia más fuerte y el área de pantalla más grande. Trate a los extras destacados como roles con nombre. Trate al resto de la multitud como grupos con dirección, velocidad y profundidad compartidas, en lugar de como veinte extraños descritos individualmente.

Inspeccione al protagonista en primer plano, a la dirección en plano medio y a los peatones de fondo como problemas de control independientes, en lugar de como una multitud indiferenciada.
Comience con un breve contrato de aceptación: el rostro del protagonista permanece reconocible; no hay duplicados corporales; las trayectorias en primer plano no colisionan; los colores asignados al vestuario destacado se mantienen; las entradas y salidas ocurren una sola vez; el fondo no roba atención. Esto transforma la observación «la multitud parece extraña» en fallos que pueden aislarse y volverse a ejecutar.
Diseñe un plan de roles y zonas antes de abrir el grafo
Asigne prioridad de identidad
Use tres niveles. La Prioridad A corresponde al héroe o orador y recibe la imagen más clara o un vídeo de referencia. La Prioridad B incluye uno a tres extras destacados cuyo vestuario y acción son relevantes. La Prioridad C es atmosférica: siluetas, espectadores sentados, viajeros o peatones lejanos. No aplique igual intensidad de condicionamiento a todas las personas. Demasiadas referencias en competencia pueden reducir la claridad en lugar de mejorarla.
Escriba un manifiesto conciso antes de formular el prompt:
| Rol | Zona de pantalla | Ancla visual | Movimiento | Debe permanecer cierto |
|---|---|---|---|---|
| Protagonista | izquierda frontal a centro | abrigo marrón rojizo, bolso negro | camina hacia la cámara | rostro y abrigo permanecen estables |
| Extra A | trasera izquierda | gorra azul marino | cruza de izquierda a derecha | pasa una vez detrás del protagonista |
| Grupo B | plataforma lejana | ropa oscura de oficina | sube lentamente | mantiene escala de fondo |
Esta tabla es un control de producción, no un texto que deba pegarse literalmente. Le obliga a resolver contradicciones antes de que el modelo tenga que adivinar. Si necesita mantener el mismo reparto en tomas posteriores, el flujo de trabajo multi-fotograma clave explica cómo aprobar y reutilizar anclas visuales.
Bloquee la profundidad y las vías de tráfico
Dibuje un esquema de la toma en zonas de primer plano, plano medio y fondo. Defina dos o tres vías de movimiento con direcciones distintas. Evite hacer pasar varios cuerpos completos por el mismo punto central durante la primera prueba. Los cruces laterales son más fáciles de evaluar que una multitud sin límites que fluye en todas direcciones. Una cámara estática o con seguimiento suave deja más capacidad para el movimiento corporal y la identidad.

Use una prueba de oclusión donde algunas personas pasen delante y otras detrás, y luego verifique si cada cuerpo sale limpiamente en lugar de fusionarse.
Construya el flujo de trabajo de vídeo con multitudes para ComfyUI
1. Apruebe una imagen fija de composición
Cree o proporcione una imagen limpia en formato 16:9 o 9:16 con la altura final de la cámara, la densidad de la multitud, las asignaciones de vestuario y las vías de movimiento libres. Corrija rostros duplicados, manos imposibles o pies entrelazados antes de la animación. La conversión de imagen a vídeo puede animar un fotograma aprobado; no debe esperarse que repare una disposición defectuosa de la multitud. Para una prueba directa alojada, la ruta de imagen-a-vídeo de Seedance le permite evaluar la misma fuente sin necesidad de mantener un grafo local.
2. Extraiga únicamente los controles que la toma requiere
Elija la orientación según el fallo que espere. La profundidad ayuda a preservar el orden de primer plano a fondo. La postura ayuda a una acción destacada. Los bordes pueden proteger la arquitectura o un gran elemento escénico. La segmentación o las máscaras ayudan a aislar al protagonista de un grupo atmosférico. Use la combinación más ligera que mantenga la escena legible. Apilar todos los preprocesadores con alta intensidad puede volver el movimiento rígido o introducir desacuerdos entre los controles.Para referencias en movimiento, recorte una sección limpia con una cámara y un ritmo corporal similares. Normalice la resolución y la frecuencia de fotogramas antes de la extracción. Confirme que las pistas de pose no salten entre personas vecinas cuando se crucen. Un esqueleto intercambiado dará lugar a un movimiento intercambiado, sin importar cuán cuidadosamente se redacte el prompt positivo.
3. Separe el movimiento del personaje principal del movimiento de la multitud
Construya una línea base con el personaje principal y solo unos pocos extras. Mantenga fijos la semilla (seed), el modelo, el muestreador (sampler), las dimensiones, el número de fotogramas y la instrucción de cámara. Una vez que el personaje principal funcione correctamente, agregue la multitud atmosférica o una segunda rama de condicionamiento. Si el flujo de trabajo admite enmascaramiento (masking) o composición, mantenga las salidas del personaje principal y del fondo independientes durante suficiente tiempo para reparar una sin tener que regenerar ambas.
src=https://r2.seedance.tv/blog/image-to-video-ai-with-prompt-online-free/social-motion-output-v1.mp4
poster=https://r2.seedance.tv/blog/image-to-video-ai-with-prompt-online-free/social-motion-output-poster-v1.jpg
label=Persona en movimiento con peatones cruzando en una estación
Este clip existente de la biblioteca Seedance es un ejemplo de inspección, no un punto de referencia controlado para ComfyUI. Observe atentamente el cuerpo principal, los peatones que pasan, los bordes del abrigo, los pies y las oclusiones a lo largo de todo el movimiento.
4. Guarde el grafo y su procedencia
Guarde conjuntamente el archivo JSON del flujo de trabajo, los nombres de los archivos de los modelos, las versiones de los nodos personalizados, los hashes de las entradas, la semilla, las dimensiones, el número de fotogramas, los FPS, las intensidades de los controles y la salida aceptada. ComfyUI puede volver a ejecutar únicamente las regiones del grafo que hayan cambiado, pero ese beneficio desaparece si no se registra la configuración aprobada. Si la ejecución en cola se bloquea tras la generación del video, utilice la guía de recuperación ante congelamientos de ComfyUI antes de modificar los controles creativos.
Genere prompts para múltiples personas sin crear caos
Redacte el prompt en orden de toma: escenario, sujeto prioritario, extras destacados, grupos de multitud, cámara y, por último, exclusiones. Nombre a las personas importantes una sola vez y mantenga estables sus descriptores. Describa colectivamente a las personas del fondo: «seis viajeros con abrigos oscuros avanzan hacia el vagón abierto» es más claro que una larga lista de rostros, edades y accesorios no relacionados entre sí.
Una plantilla útil es:
Plataforma amplia bajo la lluvia, cámara a la altura de los ojos. La mujer con el abrigo color óxido camina desde la parte frontal izquierda hacia el centro, mirando hacia adelante. Un hombre con gorra azul marino cruza detrás de ella de izquierda a derecha. El grupo lejano aborda lentamente el tren detenido. Movimiento suave de cámara hacia adelante; ritmo natural de caminata; rostro en primer plano estable; sin personas duplicadas; sin colisiones; sin apariciones repentinas.
Use instrucciones negativas para clases de fallos visibles, no para cada objeto imaginable. «Sin cuerpos duplicados, miembros fusionados, intercambios faciales, peatones que teletransportan, caminata invertida ni personas nuevas que ingresen al primer plano» es una instrucción operativa. Si los rostros fallan únicamente cuando los sujetos se reducen de tamaño, la guía de reparación de rostros a distancia ofrece un diagnóstico específico, en lugar de forzar una guía global más fuerte.

Una prueba de coreografía debe preservar cuerpos y gestos distintos, mientras el tráfico de fondo permanece subordinado.
Evalúe la coherencia de la multitud con una pequeña escalera de estrés
No comience con el festival final, la batalla o el concierto. Use una escalera de cuatro pasos. Primero, anime a tres personas sin cruces. Segundo, permita que un extra pase detrás del sujeto principal. Tercero, introduzca una oclusión en primer plano. Cuarto, agregue un grupo atmosférico lejano. Mantenga la duración corta y revise cada etapa antes de incrementar la densidad.
Evalúe la salida a velocidad normal y fotograma por fotograma:
- Identidad: los rostros, el cabello y la vestimenta prioritarios permanecen asignados correctamente.
- Conteo: no aparecen nuevas personas en primer plano ni desaparece prematuramente ninguna persona requerida.
- Anatomía: los miembros se separan correctamente antes y después de la superposición.
- Tráfico: cada entrada, cruce y salida sigue el carril especificado.
- Profundidad: las personas lejanas permanecen más pequeñas y no saltan al primer plano.
- Cámara: el movimiento no provoca que todo el grupo se deslice o respire.
- Finalización temporal: los últimos fotogramas son lo suficientemente estables como para cortar o extender.
Registre el primer fotograma en el que se rompa una regla. Ese punto revela con frecuencia si la causa es un diseño inicial deficiente, un intercambio de pista de pose, demasiado movimiento, un condicionamiento de identidad débil o un movimiento de cámara que compite con la multitud.
Repare fallos sin reconstruir toda la escena
Si los cuerpos se fusionan, aumente el espaciado inicial, simplifique las trayectorias de cruce, refuerce la separación por profundidad o por máscara, y acorte la toma. Si la identidad principal se desvía, reduzca el nivel de detalle de la multitud en el prompt y aumente la influencia de la referencia prioritaria, en lugar de incrementar todos los controles. Si el fondo permanece congelado, agregue una acción colectiva y un movimiento suave; no asigne una actuación individual a cada persona lejana.
Cuando el movimiento tiemble, inspeccione fotograma por fotograma las guías de pose u ópticas. Suavice una única pista defectuosa, reduzca la intensidad del control cerca del final o elimine un condicionador en conflicto. Cuando las personas aparezcan repentinamente en los bordes, comience con menos cuerpos adyacentes a los bordes y especifique explícitamente sus entradas. Mantenga un grafo de línea base exitoso junto a cada experimento, de modo que una actualización de nodo nunca borre la última configuración conocida como válida.

Para una atmósfera densa, evalúe primero el orden de profundidad, las siluetas limpias y el tráfico creíble, antes de exigir actuaciones individuales en el fondo.
Para muchas variaciones, separe la generación creativa de la orquestación de archivos. La guía de procesamiento por lotes de ComfyUI cubre carpetas deterministas, manifiestos y reintentos; este flujo de trabajo para multitudes debe producir primero una toma aceptada digna de ser procesada por lotes.
Cuando Seedance Agent es la ruta de producción más sencillaUn grafo local de ComfyUI resulta valioso cuando necesitas preprocesadores precisos, máscaras personalizadas, control a nivel de modelo o experimentos reproducibles. Asimismo, asumes la responsabilidad de gestionar las referencias, las versiones de los nodos, el estado de la cola, la revisión de las salidas y las ejecuciones parciales nuevamente. Las escenas con multitudes amplifican esa coordinación, ya que un extra rechazado puede invalidar una toma que, de otro modo, sería sólida.
Seedance Agent resulta útil cuando la tarea de producción importa más que la propiedad del grafo. Proporciona las prioridades del reparto, los recursos de referencia, el manifiesto de planos, los carriles para multitudes, la duración, la relación de aspecto y las reglas de aceptación. Revisa el plan de planos propuesto antes de la generación, aprueba el resultado más sólido y vuelve a ejecutar únicamente la unidad fallida. La ventaja no radica en la promesa de que cada multitud sea perfecta; sino en establecer un límite más claro entre la planificación, la generación, la revisión y la entrega.
Conclusión
Un flujo de trabajo fiable para vídeos de multitudes con ComfyUI comienza con una composición aprobada, asigna prioridad de identidad, separa zonas de profundidad y carriles de tráfico, aplica únicamente los controles necesarios e incrementa la densidad mediante una escalera de estrés medida. Evalúa el clip completo en función de la identidad, el recuento, la anatomía, las oclusiones, el movimiento y un final utilizable, y luego repara la capa fallida más pequeña en lugar de reiniciar todo desde cero. Cuando mantener referencias, máscaras, versiones de nodos, revisiones y ejecuciones parciales nuevamente se convierte en la tarea mayor, planifica y produce la secuencia de multitudes con Seedance Agent mientras conservas ComfyUI para los planos que realmente se benefician del control local.
¿Listo para probarlo tú mismo?
Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.
Créditos gratis al registrarte. Planes desde $20/mes.
Artículos relacionados
Más publicaciones en el mismo idioma que quizá quieras leer después.

Prueba de referencia de GPU en la nube MiniMax H3: velocidad, costo y VRAM
Compare las opciones de GPU en la nube para MiniMax H3 con un plan de pruebas reproducible que abarca el tiempo de renderizado, el costo por clip aprobado, el margen de VRAM disponible, los tiempos de arranque en frío (cold starts) y la fiabilidad.
Leer artículo
ComfyUI se congela después de la generación de video: Guía de recuperación
Diagnostique por qué ComfyUI se congela después de la generación de video, conserve los registros, reduzca la presión sobre la VRAM, aísle los nodos personalizados y recupere el sistema mediante un flujo de trabajo conocido y funcional.
Leer artículo
Mejor resolución para vídeos de IA en Facebook Reels (2026)
Usa la mejor resolución para vídeos de IA en Facebook Reels con un ajuste práctico de 1080×1920, zonas seguras de relación de aspecto 9:16, orientación sobre frecuencia de fotogramas y control de calidad previo a la subida.
Leer artículo