Tutorial do Wan Animate 2: Guia dos modos Move, Mix e do fluxo de trabalho no ComfyUI

E
Emma Chen·9 min de leitura·Aug 19, 2026
Tutorial do Wan Animate 2: Guia dos modos Move, Mix e do fluxo de trabalho no ComfyUI

Visão geral de IA

O que é o Wan Animate 2 e o que ele pode fazer?

O Wan-Animate-2 é um modelo de animação de personagens de código aberto que transfere o movimento corporal completo e a expressão facial de um vídeo condutor para uma imagem de referência de um personagem. Ele também suporta alterações de fundo e ponto de vista controladas por prompts.

Qual é a diferença entre o modo Move e o modo Mix no Wan Animate 2?

O modo Move anima uma imagem de referência com o movimento de um vídeo condutor e gera um novo fundo. O modo Mix substitui o intérprete dentro da cena original, mas esse modo pertence ao fluxo de trabalho anterior do Wan2.2 Animate.

Posso executar o Wan Animate 2 localmente no ComfyUI?

Sim. Os modelos atuais do ComfyUI suportam o Wan-Animate-2 por meio do nó WanAnimate2ToVideo, utilizando uma imagem de referência, um vídeo condutor bruto, arquivos de modelo e prompts de texto. Atualize primeiro o ComfyUI, pois as versões estáveis para desktop podem ficar atrás do suporte às versões noturnas.

Pronto para testar por conta própria?

Créditos grátis ao se cadastrar. Planos a partir de US$20/mês.

Experimente o Seedance grátis

Quais entradas o Wan Animate 2 exige?

O fluxo de trabalho atual no modo Move requer uma única imagem de referência nítida, um vídeo condutor e prompts para aparência/fundo. Recortes faciais, uma máscara sólida do personagem e quadros limpos de fundo aplicam-se ao fluxo de trabalho mais antigo de substituição no modo Mix.

O que o Wan Animate 2 realmente faz — e por que é diferente

O Wan-Animate-2 não é um modelo padrão de imagem para vídeo (I2V). Um I2V comum começa com uma imagem estática e inventa o movimento com base no seu prompt de texto. Já o Wan-Animate-2 consome uma segunda entrada — o vídeo condutor — e transfere seu ritmo, postura, gestos e expressão facial para o personagem presente na sua imagem.

O novo modelo lê diretamente os quadros brutos do vídeo condutor, em vez de depender de um extrator intermediário de esqueleto. Isso é importante quando uma performance inclui sincronizações sutis das mãos, movimentos dos ombros, mudanças faciais ou um ponto de vista de câmera que um mapa de pose simplificaria demais. O texto pode descrever separadamente o fundo e o ponto de vista da saída.

Arquitetura do Wan-Animate-2 mostrando a imagem de referência e o vídeo condutor entrando em um pipeline compartilhado de animação de personagens

Arquitetura oficial do Wan-Animate-2: a imagem de referência define a identidade, o vídeo condutor define a performance e o texto controla a aparência e a direção da cena.

Se você precisar apenas de uma imagem estática para definir o início ou o fim de uma sequência gerada, use o guia de primeiro e último quadro. Use o Wan-Animate-2 quando copiar uma performance específica for o objetivo principal da tarefa.

Modo Move versus modo Mix — Escolhendo o certo

Os nomes são fáceis de confundir porque duas gerações do projeto estão circulando simultaneamente. O Wan-Animate-2 usa o fluxo de trabalho de animação de personagens no estilo Move. O modo Mix é o modo de substituição de personagens no modelo anterior Wan2.2 Animate.

Modo Move Modo Mix
Geração do modelo Wan-Animate-2 atual Wan2.2 Animate anterior
Entradas Imagem de referência + vídeo condutor Imagem de referência + vídeo condutor + controles de máscara/fundo
Fundo Gerado a partir do prompt A cena original do vídeo é preservada
Ideal para Animar ilustrações, avatares ou personagens personalizados Substituir a pessoa dentro de gravações existentes
Regra em uma linha “Fazer esta imagem executar uma performance” “Substituir a pessoa neste vídeo”

Escolha Move para um mascote dançando em um cenário limpo, um apresentador ilustrado fazendo uma exposição ou um personagem executando uma rotina gravada. Escolha Mix quando a rua molhada, a iluminação, o movimento de câmera, os adereços e outras pessoas presentes no clipe original devem permanecer inalterados, enquanto apenas o intérprete é substituído.

O que você precisa antes de começar — Entradas e arquivos de modelo

Prepare o menor conjunto de entradas compatível com o seu modo:

  • Vídeo condutor: fonte da performance. Use movimento nítido, membros visíveis, mínima oclusão e enquadramento próximo ao da imagem de referência.
  • Imagem de referência: imagem nítida do personagem, frontal ou em três quartos. Filmagens do condutor em corpo inteiro funcionam melhor com uma imagem de referência em corpo inteiro.
  • Prompts: uma descrição de aparência/fundo e uma descrição concisa do movimento. Não inclua linguagem relacionada ao movimento no prompt de aparência.
  • Controles exclusivos do modo Mix: recortes faciais para maior precisão nas expressões, uma máscara sólida do personagem e quadros limpos de fundo para preservação da cena.

O pacote oficial do ComfyUI fornece o arquivo wan_animate_2_int8_convrot.safetensors para o modelo de difusão, além do codificador de texto UMT5, do codificador de visão CLIP, do Wan VAE e de um LoRA opcional de distilação por etapas LightX2V. O ponto de verificação oficial completo está em formato BF16; use-o somente se seu hardware puder lidar com sua exigência muito maior de memória. O pacote INT8 ConvRot é a escolha prática para uso no ComfyUI, com menor consumo de memória.

Imagem oficial de referência de um personagem prateado tipo tabby usando uniforme azul-marinho

Uma imagem de referência utilizável mantém o personagem sem obstruções e alinha-se ao recorte do vídeo condutor. Este exemplo oficial combina um personagem em corpo inteiro com movimento em corpo inteiro.

Pipelines locais de vídeo ainda exigem grande poder computacional. Se você estiver comparando o esforço de configuração com outro modelo local, a análise do LTX 2.5 explica o mesmo compromisso prático: pesos abertos são gratuitos, mas tempo de GPU e resolução de problemas não são.

Fluxo de trabalho passo a passo no ComfyUI1. Atualize o ComfyUI. Abra Workflow → Navegue por Modelos → Vídeo e carregue o modelo Wan Animate 2. A ausência dos nós WanAnimate2ToVideo ou WanAnimate2Cache geralmente indica que sua versão do ComfyUI está desatualizada em relação ao modelo.

  1. Coloque os arquivos de modelo. Coloque o modelo de difusão, o LoRA, o codificador de texto, o modelo de visão CLIP e o VAE nas pastas correspondentes indicadas pelo modelo. Reinicie o ComfyUI após adicioná-los.

  2. Carregue as entradas. Adicione a imagem de referência e o vídeo condutor (driver video). Primeiro, alinhe o recorte (crop): close-up com close-up ou corpo inteiro com corpo inteiro.

  3. Verifique os nós principais. O fluxo de trabalho atual usa WanAnimate2ToVideo e quadros brutos do vídeo condutor. Os nós WanVideoAnimateEmbeds, pré-processadores de pose, máscaras SAM 2, background_video e character_mask pertencem ao caminho mais antigo Wan2.2 Animate Mix.

  4. Defina tamanho e duração. Mantenha largura e altura divisíveis por 16. O modelo gera janelas de 81 quadros, cerca de 3,4 segundos a 24 fps; duplique e encadeie o subgrafo Motion Transfer para vídeos condutores mais longos.

  5. Escreva os prompts e gere amostras. Descreva o personagem e o fundo no prompt principal, depois descreva apenas a performance no prompt de movimento. Comece com as configurações de sampler do modelo; use o LoRA destilado quando a velocidade e iterações com menos passos forem mais importantes do que a fidelidade máxima.

  6. Enfileire e revise. Salve o vídeo gerado e, em seguida, inspecione identidade, mãos, rosto, contato dos pés com o solo, estabilidade do fundo e as junções entre quaisquer janelas encadeadas.

src=https://r2.seedance.tv/blog/wan-animate-2-tutorial/official-output.mp4
poster=https://r2.seedance.tv/blog/wan-animate-2-tutorial/official-output-poster.png
label=Saída oficial do Wan-Animate-2 no ComfyUI · movimento de dança de rua transferido

A prévia oficial do modelo posiciona a referência animada ao lado do vídeo condutor, permitindo comparar sincronia, movimento corporal, enquadramento e preservação da identidade ao longo do clipe.

Como Obter Melhores Resultados — Correções e Dicas Comuns

  • Deriva de identidade ou rosto: use uma referência mais nítida, com o mesmo enquadramento do vídeo condutor. Evite rostos muito pequenos, referências somente em perfil e mãos cruzando o rosto.
  • Deriva de fundo: mantenha o prompt de fundo literal e estável. Para preservação exata de uma cena existente, mude para o fluxo de trabalho legado Mix, usando um fundo limpo e uma máscara sólida.
  • Velocidade incorreta ou movimento trêmulo: reamostragem do vídeo condutor para aproximadamente 16–24 fps antes de carregá-lo. O fluxo de trabalho atual lê quadros diretamente, sem ajuste automático para todas as taxas de quadros de origem.
  • Membros desfocados ou distorcidos: simplifique o vídeo condutor, reduza a oclusão e teste uma janela mais curta. Giros rápidos, movimentos no chão e duas pessoas cruzando-se são muito mais difíceis do que uma performance solo sem obstruções.
  • Junção visível em clipe longo: sobreponha janelas encadeadas usando continue_motion, avance video_frame_offset e remova o primeiro quadro duplicado quando houver falhas na transição.
  • Erro de memória insuficiente (out-of-memory): reduza o tamanho da geração, use o checkpoint INT8 ConvRot, mova o cache para a CPU ou teste a configuração destilada antes de usar o modelo base BF16.

Se um LoRA melhorar a velocidade, mas alterar identidade ou estilo de movimento, compare um par fixo de vídeo condutor/referência antes de adotá-lo. O guia de treinamento de LoRA fornece um padrão útil de avaliação, mesmo que sua família de modelos seja diferente.

Casos de Uso — O Que Você Pode Criar com o Wan Animate 2

  1. Apresentador virtual por IA — Move. Grave uma apresentação humana clara e transfira-a para um apresentador ilustrado ou mascote. Como alternativa gerenciada, comece com Reference to Video.
  2. Variação de modelo para e-commerce — Mix. Preserve a loja, o produto, o movimento de câmera e a iluminação, substituindo apenas o performer no vídeo — utilizando o fluxo de trabalho Mix anterior.
  3. Animação personalizada de personagem de IP — Move. Faça um personagem de jogo, quadrinho ou marca executar uma dança, saudação ou ação, sem precisar animar articulação por articulação.
  4. Remake de movimento para conteúdo gerado por usuários (UGC) — Move. Transfira uma performance aprovada para uma nova imagem de personagem; para animações mais simples, que não exigem transferência precisa de movimento, use Image to Video.
  5. Variantes de anúncios para localização — Mix. Reutilize um shot já projetado, substituindo apenas o porta-voz, e finalize logotipos, legendas e textos legais na pós-produção.

Utilize apenas imagens de referência e vídeos condutores de sua propriedade ou para os quais você tenha permissão explícita de processamento. Trate qualquer renderização bem-sucedida como um rascunho até que um humano verifique identidade, reivindicações, continuidade e detalhes da cena.

Conclusão

A regra de decisão é simples: Move faz uma imagem executar um movimento; Mix substitui a pessoa em um vídeo. Para o fluxo de trabalho atual do Wan-Animate-2 no ComfyUI, use Move com uma imagem de referência e um vídeo condutor bem alinhados. Use o caminho anterior Wan2.2 Animate Mix apenas quando for essencial preservar integralmente a cena original.

Se você não deseja instalar modelos, gerenciar VRAM ou encadear janelas do ComfyUI, experimente a animação de personagens no Seedance →.

Pronto para testar por conta própria?

Coloque os passos desta guia em prática com Seedance e transforme prompts ou imagens em vídeos polidos em minutos.

Créditos grátis ao se cadastrar. Planos a partir de US$20/mês.