Wan Animate 2-Tutorial: Move-Modus, Mix-Modus und ComfyUI-Workflow-Leitfaden

E
Emma Chen·8 Min. Lesezeit·Aug 19, 2026
Auf X teilen
Wan Animate 2-Tutorial: Move-Modus, Mix-Modus und ComfyUI-Workflow-Leitfaden

KI-Überblick

Was ist Wan Animate 2 und was kann es leisten?

Wan-Animate-2 ist ein Open-Source-Modell für Charakteranimation, das die Ganzkörperbewegung und mimische Leistung eines Treiber-Videos auf ein Referenz-Bild eines Charakters überträgt. Es unterstützt zudem eine durch Text-Prompts gesteuerte Hintergrund- und Blickwinkeländerung.

Was ist der Unterschied zwischen dem Move-Modus und dem Mix-Modus in Wan Animate 2?

Der Move-Modus animiert ein Referenz-Bild mithilfe der Bewegung aus einem Treiber-Video und generiert einen neuen Hintergrund. Der Mix-Modus ersetzt dagegen den Darsteller innerhalb der ursprünglichen Szene – dieser Modus gehört jedoch zum älteren Wan2.2-Animate-Workflow.

Kann ich Wan Animate 2 lokal in ComfyUI ausführen?

Ja. Aktuelle ComfyUI-Vorlagen unterstützen Wan-Animate-2 über den Knoten WanAnimate2ToVideo, wobei ein Referenz-Bild, ein rohes Treiber-Video, Modell-Dateien und Text-Prompts benötigt werden. Aktualisieren Sie ComfyUI zunächst, da stabile Desktop-Versionen oft hinter den Nightly-Builds zurückbleiben.

Bereit, es selbst auszuprobieren?

Kostenlose Credits bei der Anmeldung. Tarife ab $20/Monat.

Seedance kostenlos testen

Welche Eingaben benötigt Wan Animate 2?

Der aktuelle Move-Workflow erfordert ein klares Referenz-Bild, ein Treiber-Video sowie Beschreibungen zum Erscheinungsbild und zum Hintergrund. Gesichtsausschnitte, eine präzise Charakter-Maske und saubere Hintergrund-Frames sind hingegen spezifisch für den älteren Mix-Ersetzungs-Workflow.

Was Wan Animate 2 tatsächlich tut – und warum es sich unterscheidet

Wan-Animate-2 ist kein Standard-Image-to-Video-Modell. Gewöhnliche I2V-Modelle beginnen mit einem Standbild und erfinden die Bewegung allein anhand Ihres Text-Prompts. Wan-Animate-2 hingegen nimmt eine zweite Eingabe entgegen – das Treiber-Video – und überträgt dessen Timing, Pose, Gestik und mimische Leistung auf den Charakter in Ihrem Bild.

Das neue Modell liest die Rohframes des Treiber-Videos direkt ein, statt auf einen zwischengeschalteten Skeleton-Extractor angewiesen zu sein. Das ist entscheidend, wenn eine Leistung feine Handbewegungen, Schulterbewegungen, mimische Veränderungen oder eine Kameraperspektive enthält, die durch eine Pose-Karte vereinfacht würde. Der Text beschreibt separat den gewünschten Hintergrund und Blickwinkel.

Wan-Animate-2-Architektur mit Referenz-Bild und Treiber-Video, die in eine gemeinsame Charakteranimations-Pipeline eintreten

Offizielle Wan-Animate-2-Architektur: Das Referenz-Bild definiert die Identität, das Treiber-Video definiert die Leistung, und der Text steuert Erscheinungsbild und Szenen-Richtung.

Falls Sie lediglich ein Standbild benötigen, um den Beginn oder das Ende einer generierten Aufnahme festzulegen, nutzen Sie den First-and-Last-Frame-Leitfaden. Verwenden Sie Wan-Animate-2, wenn das Kopieren einer konkreten Leistung im Mittelpunkt Ihrer Aufgabe steht.

Move-Modus vs. Mix-Modus – Den richtigen Modus wählen

Die Namen lassen sich leicht verwechseln, weil zwei Generationen des Projekts gleichzeitig kursieren. Wan-Animate-2 nutzt den Move-artigen Charakteranimations-Workflow. Mix ist der Charakterersetzungsmodus in der früheren Wan2.2-Animate-Vorlage.

Move-Modus Mix-Modus
Modell-Generation Aktuelles Wan-Animate-2 Frühere Wan2.2-Animate
Eingaben Referenz-Bild + Treiber-Video Referenz-Bild + Treiber-Video + Maske/Hintergrund-Steuerung
Hintergrund Wird aus dem Prompt generiert Die ursprüngliche Videoszene bleibt erhalten
Am besten geeignet für Animation von Illustrationen, Avataren oder benutzerdefinierten Charakteren Ersetzen der Person innerhalb bestehender Aufnahmen
Kurzregel „Lassen Sie dieses Bild eine Leistung vollziehen“ „Ersetzen Sie die Person in diesem Video“

Wählen Sie Move, wenn ein Maskottchen auf einer sauberen Bühne tanzt, ein illustrierter Moderator präsentiert oder ein Charakter eine aufgezeichnete Routine ausführt. Wählen Sie Mix, wenn nasse Straßen, Beleuchtung, Kamerabewegung, Requisiten und andere Personen im Originalclip erhalten bleiben müssen, während ausschließlich der Darsteller gewechselt wird.

Voraussetzungen vor Beginn – Eingaben und Modell-Dateien

Bereiten Sie die kleinste Eingabemenge vor, die zu Ihrem gewählten Modus passt:

  • Treiber-Video: die Quelle der Leistung. Verwenden Sie klare Bewegung, sichtbare Gliedmaßen, minimale Verdeckung und eine Bildkomposition, die dem Referenz-Bild nahekommt.
  • Referenz-Bild: ein scharfes, frontal oder dreiviertel gerichtetes Charakter-Bild. Vollkörper-Treiber-Aufnahmen funktionieren am besten mit einem Vollkörper-Referenz-Bild.
  • Prompts: eine Beschreibung des Erscheinungsbilds/Hintergrunds und eine prägnante Beschreibung der Bewegung. Fügen Sie keine Bewegungsbeschreibungen in den Erscheinungsbild-Prompt ein.
  • Nur-Mix-Steuerelemente: Gesichtsausschnitte für genaue Mimik, eine präzise Charakter-Maske und saubere Hintergrund-Frames zur Szenerhaltung.

Das offizielle ComfyUI-Paket enthält wan_animate_2_int8_convrot.safetensors als Diffusionsmodell sowie den UMT5-Text-Encoder, den CLIP-Vision-Encoder, den Wan-VAE und optional ein LightX2V-Schritt-Distillations-LoRA. Der vollständige offizielle Checkpoint liegt im BF16-Format vor; verwenden Sie ihn nur, wenn Ihre Hardware dessen deutlich höheren Speicherbedarf bewältigen kann. Das INT8-ConvRot-Paket ist die praktikable ComfyUI-Wahl bei geringerem Speicherverbrauch.

Offizielles Referenz-Bild eines silbernen Tabby-Charakters in einer dunkelblauen Uniform

Ein brauchbares Referenz-Bild zeigt den Charakter unverdeckt und passt zum Ausschnitt des Treiber-Videos. Dieses offizielle Beispiel kombiniert ein Vollkörper-Charakter-Bild mit Vollkörper-Bewegung.

Lokale Videopipelines sind nach wie vor hardwareintensiv. Falls Sie den Setup-Aufwand mit einem anderen lokalen Modell vergleichen möchten, erläutert die LTX 2.5-Übersicht denselben praktischen Kompromiss: Offene Gewichte sind kostenlos, doch GPU-Zeit und Fehlersuche kosten Zeit und Ressourcen.

Schritt-für-Schritt ComfyUI-Workflow1. ComfyUI aktualisieren. Öffnen Sie „Workflow“ → „Vorlagen durchsuchen“ → „Video“ und laden Sie die Vorlage Wan Animate 2 ein. Fehlende Knoten WanAnimate2ToVideo oder WanAnimate2Cache deuten in der Regel darauf hin, dass Ihre ComfyUI-Installation veraltet ist und nicht mit der Vorlage kompatibel ist.

  1. Modell-Dateien platzieren. Legen Sie das Diffusionsmodell, die LoRA, den Textencoder, das CLIP-Vision-Modell und die VAE in die entsprechenden Ordner ab, die von der Vorlage angezeigt werden. Starten Sie ComfyUI nach dem Hinzufügen neu.

  2. Eingaben laden. Fügen Sie das Referenzbild und das Treiber-Video hinzu. Passen Sie zunächst den Ausschnitt an: Nahaufnahme zu Nahaufnahme oder Ganzkörperaufnahme zu Ganzkörperaufnahme.

  3. Kernknoten prüfen. Der aktuelle Workflow nutzt WanAnimate2ToVideo und rohe Treiber-Frames. Die Knoten WanVideoAnimateEmbeds, Pose-Preprozessoren, SAM-2-Masken, background_video und character_mask gehören dagegen dem älteren Wan2.2 Animate Mix-Pfad an.

  4. Auflösung und Länge festlegen. Halten Sie Breite und Höhe durch 16 teilbar. Die Vorlage generiert Fenster mit 81 Frames – bei 24 fps entspricht das etwa 3,4 Sekunden; für längere Treiber-Videos duplizieren und verketten Sie den Motion Transfer-Subgraphen.

  5. Prompts schreiben und Sampling durchführen. Beschreiben Sie im Haupt-Prompt Charakter und Hintergrund; im Motion-Prompt beschreiben Sie ausschließlich die Darbietung. Beginnen Sie mit den Sampler-Einstellungen der Vorlage; verwenden Sie die distilled LoRA, wenn Geschwindigkeit und geringere Schrittanzahl wichtiger sind als maximale Bildqualität.

  6. In die Warteschlange stellen und überprüfen. Speichern Sie das Ausgabevideo und prüfen Sie anschließend Identität, Hände, Gesicht, Bodenkontakt der Füße, Hintergrundstabilität sowie Nahtstellen zwischen verketteten Fenstern.

src=https://r2.seedance.tv/blog/wan-animate-2-tutorial/official-output.mp4
poster=https://r2.seedance.tv/blog/wan-animate-2-tutorial/official-output-poster.png
label=Offizielle ComfyUI Wan-Animate-2-Ausgabe · übertragene Street-Dance-Bewegung

Die offizielle Vorlagen-Vorschau zeigt das animierte Referenzbild neben dem Treiber-Material, sodass Sie Timing, Körperbewegung, Bildausschnitt und Identitätsbewahrung während des gesamten Clips vergleichen können.

Bessere Ergebnisse erzielen – Häufige Korrekturen und Tipps

  • Identitäts- oder Gesichtsdrift: Verwenden Sie eine schärfere Referenz mit identischem Bildausschnitt wie beim Treiber. Vermeiden Sie sehr kleine Gesichter, Referenzen ausschließlich im Profil sowie Hände, die das Gesicht verdecken.
  • Hintergrunddrift: Halten Sie den Hintergrund-Prompt wörtlich und stabil. Für exakte Wiedergabe einer bestehenden Szene wechseln Sie zum veralteten Mix-Workflow mit sauberem Hintergrund und solider Maske.
  • Falsche Geschwindigkeit oder ruckelnde Bewegung: Resamplen Sie das Treiber-Video vor dem Laden auf ca. 16–24 fps. Der aktuelle Workflow liest Frames direkt ein, statt automatisch jede Quell-Framerate anzupassen.
  • Weiche oder gebrochene Gliedmaßen: Vereinfachen Sie das Treiber-Material, reduzieren Sie Verdeckungen und testen Sie ein kürzeres Fenster. Schnelle Drehungen, Bodenarbeit und zwei Personen, die sich kreuzen, sind deutlich anspruchsvoller als eine ungestörte Solo-Darbietung.
  • Sichtbare Naht in einem langen Clip: Überlappen Sie verkettete Fenster mittels continue_motion, erhöhen Sie video_frame_offset und schneiden Sie den doppelten ersten Frame ab, falls die Verbindung stockt.
  • Out-of-Memory-Fehler: Verringern Sie die Generierungsauflösung, verwenden Sie den INT8 ConvRot-Checkpoint, verschieben Sie den Cache auf die CPU oder testen Sie zunächst die distilled-Konfiguration vor dem BF16-Basismodell.

Falls eine LoRA die Geschwindigkeit verbessert, aber Identität oder Bewegungsstil verändert, vergleichen Sie stets ein festes Paar aus Treiber- und Referenzmaterial, bevor Sie sie endgültig übernehmen. Die LoRA-Trainingsanleitung bietet ein nützliches Bewertungsmuster – auch wenn ihre Modellfamilie sich unterscheidet.

Einsatzszenarien – Was Sie mit Wan Animate 2 erstellen können

  1. KI-Virtueller Moderator – Move. Nehmen Sie eine klare menschliche Präsentation auf und übertragen Sie diese auf einen illustrierten Moderator oder Maskottchen. Als verwaltete Alternative beginnen Sie mit Reference to Video.
  2. E-Commerce-Modellvariation – Mix. Bewahren Sie Laden, Produkt, Kamerabewegung und Beleuchtung, ersetzen Sie jedoch den vor der Kamera stehenden Darsteller im früheren Mix-Workflow.
  3. Benutzerdefinierte IP-Charakteranimation – Move. Lassen Sie einen Spiel-, Comic- oder Marken-Charakter tanzen, grüßen oder handeln – ohne jedes Gelenk einzeln keyframen zu müssen.
  4. UGC-Bewegungsremake – Move. Übertragen Sie eine bereits genehmigte Darbietung auf ein neues Charakter-Bild; für einfachere Animationen, bei denen keine exakte Bewegungsübertragung erforderlich ist, nutzen Sie Image to Video.
  5. Werbungsort-Anpassung (Ad localization) – Mix. Wiederverwenden Sie ein Shot-Design, ersetzen Sie lediglich den Sprecher und fügen Sie Logos, Untertitel und rechtliche Hinweise in der Postproduktion ein.

Verwenden Sie ausschließlich Referenzbilder und Treiber-Material, das Ihnen gehört oder für dessen Verarbeitung Sie die erforderliche Genehmigung besitzen. Behandeln Sie ein erfolgreich gerendertes Video bis zur manuellen Prüfung von Identität, inhaltlichen Ansprüchen, Kontinuität und Szenendetails als Entwurf.

Fazit

Die Entscheidungsregel ist einfach: „Move“ lässt ein Bild performen; „Mix“ ersetzt die Person in einem Video. Für den aktuellen Wan-Animate-2-ComfyUI-Workflow verwenden Sie Move mit einer gut abgestimmten Referenz und einem passenden Treiber-Video. Nutzen Sie den früheren Wan2.2 Animate Mix-Pfad nur dann, wenn die Erhaltung der Quellszene zwingend erforderlich ist.

Falls Sie keine Modelle installieren, VRAM verwalten oder ComfyUI-Fenster verketteten möchten, probieren Sie die Charakteranimation auf Seedance aus →.

Bereit, es selbst auszuprobieren?

Setzen Sie die Schritte aus diesem Leitfaden direkt in Seedance um und verwandeln Sie Prompts oder Bilder in wenigen Minuten in fertige Videos.

Kostenlose Credits bei der Anmeldung. Tarife ab $20/Monat.