Fluxo de Trabalho de Vídeo com Multidão no ComfyUI: Controle de Pessoas, Movimento e Oclusão

E
Emma Chen·11 min de leitura·Sep 13, 2026
Fluxo de Trabalho de Vídeo com Multidão no ComfyUI: Controle de Pessoas, Movimento e Oclusão

Visão Geral de IA

Qual é o fluxo de trabalho mais seguro no ComfyUI para um vídeo de multidão?

Crie uma imagem estática aprovada de multidão, separe o personagem principal dos grupos de fundo, adicione orientação de profundidade ou pose e gere uma sequência curta. Aumente o movimento da multidão apenas após garantir que identidades, trajetórias e oclusões permaneçam estáveis.

Como manter múltiplas pessoas consistentes no ComfyUI?

Atribua a cada pessoa importante um papel único, um elemento visual fixo de vestuário, uma zona na tela e uma ação específica. Use referências para personagens prioritários, mantenha o movimento de câmera simples e revise clipes completos em busca de trocas ou duplicatas.

Por que vídeos de multidão gerados por IA criam corpos fundidos e pessoas extras?

Multidões combinam muitos sujeitos sobrepostos, movimento rápido, rostos pequenos e profundidade incerta. Quando os prompts não definem camadas ou trajetórias, o modelo pode reinterpretar uma oclusão como um novo corpo ou identidade.

Pronto para testar por conta própria?

Créditos grátis ao se cadastrar. Planos a partir de US$20/mês.

Experimente o Seedance grátis

Uma cena de multidão deve ser gerada em uma única passagem?

Use uma única passagem apenas para um fundo simples com movimento leve. Para ações mais densas, gere ou aprove primeiro a camada principal (hero layer), controle a multidão como segunda camada e, em seguida, faça composição ou reexecute apenas a menor região falhada.

Por Que Cenas de Multidão Falham Mais Facilmente do Que Tomadas Individuais

Uma tomada individual de imagem para vídeo exige que o modelo preserve uma única identidade, um único corpo e uma única ação principal. Uma tomada de multidão multiplica essas obrigações ao mesmo tempo que adiciona interseções: uma pessoa cruza atrás do personagem principal, outra sai do quadro, dois braços se sobrepõem e diversos rostos pequenos se movem sob compressão. O modelo deve decidir, em cada quadro, a qual pessoa pertencem quais pixels. É por isso que um pôster convincente ainda pode se tornar um clipe inutilizável.

O objetivo prático não é “gerar muitas pessoas”, mas sim manter uma hierarquia legível. Decida quem o público precisa reconhecer, quem executa uma ação narrativa e quem apenas fornece atmosfera. Dê ao personagem principal a referência mais forte e a maior área na tela. Trate os figurantes em destaque como papéis nomeados. Trate o restante da multidão como grupos com direção, velocidade e profundidade compartilhadas, em vez de vinte estranhos descritos individualmente.

Um ensaio cinematográfico separa o personagem principal, o diretor e os atores de fundo em camadas de profundidade legíveis

Analise o personagem principal em primeiro plano, a direção no plano médio e os pedestres ao fundo como problemas de controle distintos, em vez de uma multidão indiferenciada.

Comece com um breve contrato de aceitação: o rosto do personagem principal permanece reconhecível; não há duplicação de corpos; as trajetórias em primeiro plano não colidem; as cores atribuídas às roupas em destaque permanecem fixas; entradas e saídas ocorrem uma única vez; o fundo não rouba atenção. Isso transforma frases como “a multidão parece estranha” em falhas isoláveis e passíveis de reexecução.

Projete um Plano de Papéis e Zonas Antes de Abrir o Grafo

Atribua prioridade de identidade

Use três níveis. Prioridade A é o herói ou orador, recebendo a imagem mais nítida ou um vídeo de referência. Prioridade B contém um a três figurantes em destaque, cujos vestuários e ações são relevantes. Prioridade C é atmosférica: silhuetas, espectadores sentados, passageiros ou pedestres distantes. Não aplique força de condicionamento igual a todos. Muitas referências concorrentes podem reduzir, em vez de melhorar, a clareza.

Escreva um manifesto compacto antes de inserir o prompt:

Papel Zona na tela Âncora visual Movimento Deve permanecer verdadeiro
Principal frente-esquerda até centro casaco ferrugem, bolsa preta caminha em direção à câmera rosto e casaco permanecem estáveis
Figurante A fundo-esquerda boné azul-marinho cruza da esquerda para a direita passa uma única vez atrás do principal
Grupo B plataforma distante roupas escuras de escritório embarca lentamente mantém escala de fundo

Essa tabela é um controle de produção, não um texto que deva ser colado literalmente. Ela o obriga a resolver contradições antes que o modelo precise adivinhar. Se precisar manter o mesmo elenco em tomadas posteriores, o fluxo de trabalho multi-keyframe explica como aprovar e reutilizar âncoras visuais.

Defina profundidade e faixas de tráfego

Esboce a tomada como zonas de primeiro plano, plano médio e fundo. Defina duas ou três faixas de movimento com direções diferentes. Evite fazer vários corpos inteiros atravessarem o mesmo ponto central durante o primeiro teste. Cruzamentos laterais são mais fáceis de avaliar do que uma multidão ilimitada fluindo em todas as direções. Uma câmera estática ou com acompanhamento suave deixa mais capacidade para movimento corporal e identidade.

Um passageiro com casaco ferrugem permanece como prioridade visual enquanto pedestres ao fundo cruzam em diferentes profundidades

Use um teste de oclusão em que algumas pessoas passem à frente e outras atrás, então verifique se cada corpo sai limpo, sem fusão.

Construa o Fluxo de Trabalho para Vídeo de Multidão no ComfyUI

1. Aprove uma imagem estática de composição

Crie ou forneça uma imagem limpa em proporção 16:9 ou 9:16, com altura final da câmera, densidade da multidão, atribuições de vestuário e faixas de movimento livres. Corrija rostos duplicados, mãos impossíveis ou pés entrelaçados antes da animação. A conversão de imagem para vídeo pode animar um quadro aprovado; não se espera que ela repare um layout de multidão defeituoso. Para um teste hospedado direto, a rota de imagem para vídeo da Seedance permite avaliar a mesma fonte sem manter um grafo local.

2. Extraia apenas os controles necessários para a tomada

Escolha a orientação conforme a falha que você espera. Profundidade ajuda a preservar a ordem de primeiro plano para fundo. Pose auxilia uma ação em destaque. Bordas podem proteger arquitetura ou um grande adereço. Segmentação ou máscaras ajudam a isolar o herói de um grupo atmosférico. Use a combinação mais leve que mantenha a cena legível. Empilhar todos os pré-processadores com alta intensidade pode tornar o movimento rígido ou introduzir conflitos entre os controles.Para referências em movimento, recorte uma seção limpa com uma câmera e um ritmo corporal semelhantes. Normalize a resolução e a taxa de quadros antes da extração. Confirme que os rastreamentos de pose não saltam entre pessoas vizinhas quando elas se cruzam. Um esqueleto trocado resultará em um movimento trocado, independentemente de quão cuidadosamente a prompt positiva for redigida.

3. Separe o movimento do protagonista do movimento da multidão

Construa uma linha de base com o protagonista e apenas alguns figurantes. Mantenha fixos a semente (seed), o modelo, o sampler, as dimensões, a contagem de quadros e a instrução de câmera. Assim que o protagonista for aprovado, adicione a multidão atmosférica ou um segundo ramo de condicionamento. Se o fluxo de trabalho suportar máscaras ou composição, mantenha as saídas do protagonista e do fundo independentes por tempo suficiente para corrigir uma delas sem regenerar ambas.

src=https://r2.seedance.tv/blog/image-to-video-ai-with-prompt-online-free/social-motion-output-v1.mp4
poster=https://r2.seedance.tv/blog/image-to-video-ai-with-prompt-online-free/social-motion-output-poster-v1.jpg
label=Assunto em movimento com pedestres atravessando em uma estação

Este clipe existente da biblioteca Seedance é um exemplo de inspeção, não um benchmark controlado no ComfyUI. Observe atentamente o corpo principal, os pedestres que passam, as bordas do casaco, os pés e as oclusões ao longo de todo o movimento.

4. Salve o grafo e a proveniência

Salve em conjunto o JSON do fluxo de trabalho, os nomes dos arquivos de modelo, as versões dos nós personalizados, os hashes das entradas, a semente, as dimensões, a contagem de quadros, os FPS, as intensidades dos controles e a saída aprovada. O ComfyUI pode reexecutar apenas as regiões alteradas do grafo, mas esse benefício desaparece se a configuração aprovada não for registrada. Se a execução na fila travar após a renderização, use o guia de recuperação de congelamento do ComfyUI antes de modificar os controles criativos.

Gere múltiplas pessoas na prompt sem criar caos

Escreva a prompt na ordem da tomada: cenário, sujeito prioritário, figurantes em destaque, grupos de multidão, câmera e, por fim, exclusões. Nomeie as pessoas importantes uma única vez e mantenha seus descritores estáveis. Descreva as pessoas do fundo de forma coletiva: “seis passageiros com casacos escuros caminham em direção ao vagão aberto” é mais claro do que uma longa lista de rostos, idades e acessórios não relacionados.

Um modelo útil é:

Plataforma ampla sob chuva, câmera ao nível dos olhos. A mulher de casaco ferruginoso caminha da frente-esquerda em direção ao centro, olhando para frente. Um homem com boné azul-marinho cruza atrás dela, da esquerda para a direita. O grupo distante embarca lentamente no trem parado. Movimento suave da câmera para frente; ritmo natural de caminhada; rosto em primeiro plano estável; nenhuma pessoa duplicada; nenhuma colisão; nenhuma chegada repentina.

Use instruções negativas para classes visíveis de falha, não para todos os objetos que você possa imaginar. “Nenhum corpo duplicado, membros fundidos, trocas faciais, pedestres teletransportados, caminhada invertida ou novas pessoas entrando em primeiro plano” é uma instrução acionável. Se as falhas faciais ocorrerem apenas quando os sujeitos ficarem pequenos, o guia de correção de rostos à distância oferece um diagnóstico específico, em vez de impor orientações globais mais fortes.

Seis dançarinos ocupam faixas separadas, enquanto pedestres comuns permanecem ao fundo distante

Um teste de coreografia deve preservar corpos e gestos distintos, enquanto o tráfego de fundo permanece subordinado.

Teste a consistência da multidão com uma pequena escada de estresse

Não comece com o festival final, a batalha ou o concerto. Use uma escada de quatro etapas. Primeiro, anime três pessoas sem cruzamentos. Segundo, permita que um figurante passe atrás do sujeito principal. Terceiro, introduza uma oclusão em primeiro plano. Quarto, adicione um grupo atmosférico distante. Mantenha a duração curta e revise cada etapa antes de aumentar a densidade.

Avalie a saída em velocidade normal e quadro a quadro:

  • Identidade: rostos, cabelos e vestuário prioritários permanecem atribuídos corretamente.
  • Contagem: nenhuma nova pessoa em primeiro plano aparece, e nenhuma pessoa exigida desaparece precocemente.
  • Anatomia: membros se separam corretamente antes e após sobreposições.
  • Tráfego: toda entrada, cruzamento e saída segue a faixa especificada.
  • Profundidade: pessoas distantes permanecem menores e não saltam para o primeiro plano.
  • Câmera: o movimento não faz com que todo o grupo deslize ou “respire”.
  • Finalização temporal: os quadros finais são estáveis o suficiente para corte ou extensão.

Registre o primeiro quadro em que uma regra for violada. Esse ponto frequentemente revela se a causa é um layout inicial inadequado, uma troca de rastreamento de pose, excesso de movimento, condicionamento de identidade fraco ou um movimento de câmera que compete com a multidão.

Corrija falhas sem reconstruir toda a cena

Se os corpos se fundirem, aumente o espaçamento inicial, simplifique os trajetos de cruzamento, fortaleça a separação por profundidade ou máscara e encurte a tomada. Se a identidade principal se desviar, reduza os detalhes da multidão na prompt e aumente a influência da referência prioritária, em vez de aumentar todos os controles. Se o fundo ficar congelado, adicione uma única ação coletiva e um movimento suave; não atribua uma performance individual a cada pessoa distante.

Quando o movimento apresentar tremulações (jitter), inspecione quadro a quadro os guias de pose ou ópticos. Suavize uma única trilha defeituosa, reduza a intensidade do controle próximo ao final ou remova um condicionador conflitante. Quando pessoas surgirem abruptamente nas bordas, comece com menos corpos adjacentes às bordas e especifique explicitamente suas entradas. Mantenha um grafo de linha de base bem-sucedido ao lado de cada experimento, para que uma atualização de nó nunca apague a última configuração conhecida como funcional.

Um movimentado mercado de alimentos oferece muitas camadas de profundidade sem transformar cada cliente em um personagem em destaque

Para atmosfera densa, avalie a ordem de profundidade, os silhuetas limpas e o tráfego crível antes de exigir performances individuais no fundo.

Para muitas variações, separe a geração criativa da orquestração de arquivos. O guia de processamento em lote do ComfyUI cobre pastas determinísticas, manifestos e repetições; este fluxo de trabalho com multidão deve, primeiramente, produzir uma tomada aprovada digna de ser processada em lote.

Quando o Seedance Agent é a rota de produção mais simplesUm grafo local do ComfyUI é valioso quando você precisa de pré-processadores precisos, máscaras personalizadas, controle no nível do modelo ou experimentos reproduzíveis. Ele também o torna responsável pelas referências, versões dos nós, estado da fila, revisão das saídas e reexecuções parciais. Cenas com multidões amplificam essa coordenação, pois uma única unidade rejeitada pode invalidar uma tomada que, de outra forma, seria forte.

O Seedance Agent é útil quando a tarefa de produção importa mais do que a propriedade do grafo. Forneça as prioridades do elenco, os ativos de referência, o manifesto das tomadas, as faixas de multidão, a duração, a proporção de aspecto e as regras de aceitação. Revise o plano de tomadas proposto antes da geração, aprove o resultado mais forte e reexecute apenas a unidade falhada. A vantagem não é a promessa de que toda multidão ficará perfeita; é, sim, um limite mais claro entre planejamento, geração, revisão e entrega.

Conclusão

Um fluxo de trabalho confiável de vídeo de multidão no ComfyUI começa com uma composição aprovada, atribui prioridade de identidade, separa zonas de profundidade e faixas de tráfego, aplica apenas os controles necessários e aumenta a densidade por meio de uma escada de estresse controlada. Avalie o clipe completo quanto à identidade, contagem, anatomia, oclusão, movimento e final utilizável, então corrija a camada falhada menor em vez de reiniciar tudo. Quando manter referências, máscaras, versões dos nós, revisões e reexecuções se torna uma tarefa maior, planeje e produza a sequência de multidão com o Seedance Agent enquanto mantém o ComfyUI para as tomadas que realmente se beneficiam do controle local.

Pronto para testar por conta própria?

Coloque os passos desta guia em prática com Seedance e transforme prompts ou imagens em vídeos polidos em minutos.

Créditos grátis ao se cadastrar. Planos a partir de US$20/mês.