Eine KI-Figur über mehrere Generierungen hinweg konsistent halten

Generiere zweimal mit demselben Figuren-Prompt, und du erhältst selten zweimal dieselbe Figur: Die Haarfarbe ändert sich, die Jacke bekommt einen zuvor nicht vorhandenen Kragen, das Gesicht wirkt wie eine völlig andere Person. Es gibt wirksame Techniken, die das reduzieren. Es lohnt sich, sowohl ihre Wirkung als auch ihre Grenzen zu kennen, denn die ehrliche Antwort lautet: Vollständige Konsistenz liefern aktuelle Werkzeuge nicht zuverlässig.

Warum sich die Figur zwischen Einzelbildern verändert

Ein Bildmodell behält zwischen Generierungen kein dauerhaftes internes Modell „deiner Figur“, wie ein Illustrator eine Figur im Kopf behält, während er eine zweite Pose zeichnet. Jede Generierung beginnt mit Rauschen und wird vom Prompt-Text, den Modellgewichten und einem zufälligen Seed geformt. Sie ist weitgehend unabhängig von früheren Generierungen, sofern du diese nicht ausdrücklich wieder als Eingabe verwendest. Zwei Prompts, die für dich identisch wirken – dieselben Wörter in derselben Reihenfolge –, können dennoch an verschiedenen Punkten im gelernten Modellraum für „eine Figur, die dieser Beschreibung entspricht“ landen. Die Beschreibung lässt eine enorme Zahl visueller Details offen, die das Modell selbst ergänzen muss, und es ergänzt sie jedes Mal anders.

Das ist weniger ein Fehler, der sich wegpatchen lässt, als eine strukturelle Eigenschaft der Bilderzeugung dieser Modelle. Jede der folgenden Techniken verringert, wie viel das Modell selbst ergänzen muss. Keine gibt ihm ein tatsächliches Gedächtnis für eine bestimmte Figur.

Was feste Seeds bewirken und wo sie nicht mehr helfen

Ein Seed ist der anfängliche Zufallszustand einer Generierung. Derselbe Seed mit exakt demselben Prompt und denselben Einstellungen erzeugt exakt dasselbe Bild. Das klingt nach einer vollständigen Lösung, bis du damit etwas anderes als ein identisches Bild erzeugen willst. Sobald du den Prompt auch nur etwas änderst – eine neue Pose, einen anderen Hintergrund oder selbst nur die Reihenfolge einiger Wörter –, verweist der Seed nicht mehr auf eine konsistente Variante deiner Figur. Er führt zu einem anderen Bild, das zufällig denselben anfänglichen Zufallszustand teilt. Das ist nicht dasselbe.

Feste Seeds helfen tatsächlich bei kleinen, kontrollierten Änderungen: dieselbe Komposition mit einer kleinen Änderung neu generieren oder vergleichen, wie zwei Prompt-Anpassungen eine ansonsten identische Ausgabe beeinflussen. Es ist ein Diagnosewerkzeug, um die Wirkung einer bestimmten Prompt-Änderung zu isolieren, kein Mechanismus für „dieselbe Figur bei einer anderen Tätigkeit“. Behandle es so, und es wird dich nicht so enttäuschen wie beim Einsatz als Hauptstrategie für Konsistenz.

Obere Zeile: vier generierte Versionen desselben Kriegers, dessen Rüstung von Blau zu Grün zu Bronze wechselt und dessen Umhang erscheint und verschwindet. Untere Zeile: vier Versionen mit gleichbleibenden Farben und Proportionen
Die obere Zeile zeigt denselben Prompt, viermal ausgeführt. Rüstungsfarbe, Umhang und Körperbau weichen jeweils ab. Das ist kein zufälliges Rauschen, das du durch Mittelung beseitigen könntest – jede Generierung ist einfach eine neue Interpretation.

Farbe und Material im Prompt festlegen

Die wirksamste einzelne Änderung ist, die Details, die dir wirklich gleichbleibend wichtig sind, deutlich genauer zu beschreiben. Vertraue nicht darauf, dass das Modell sie stets gleich erschließt. Vage Farbangaben wie „ein Ritter in blauer Rüstung“ lassen jedes Mal Raum für ein anderes Blau. Konkrete, wiederholte Vorgaben verringern diesen Spielraum:

  • Benenne exakte Farben jedes Mal gleich: „kobaltblaue Plattenrüstung, matte silberne Verzierungen, dunkelbraune Lederriemen“ statt „blaue Rüstung mit ein paar Metallteilen“. Verwende in jedem Prompt des Sets dieselbe Formulierung, statt sie zur Abwechslung umzuformulieren.
  • Gib neben der Farbe auch das Material an – „mattes Leder“, „gebürsteter Stahl“, „abgenutzter Canvas-Stoff“. Das Material beeinflusst, wie das Modell Schatten und Lichtreflexe darstellt. Unterschiedliche Materialdarstellungen wirken inkonsistent, selbst wenn der Farbton technisch ähnlich ist.
  • Führe ein schriftliches Figurenblatt mit den exakten verwendeten Formulierungen und kopiere daraus, statt die Beschreibung jedes Mal aus dem Gedächtnis neu einzugeben. Kleine unbewusste Umformulierungen zwischen Sitzungen sind eine häufige, vermeidbare Ursache für Abweichungen.

Das erzeugt keine pixelidentischen Ergebnisse. Es schränkt die Modellentscheidungen aber genug ein, damit die Figur über ein Set hinweg erkennbar dieselbe bleibt. Das ist für ein Projekt meist der tatsächliche Maßstab, nicht eine exakte Reproduktion.

Bild-zu-Bild und Referenzbilder

Statt ausschließlich aus Text zu generieren, beginnt die Bild-zu-Bild-Generierung mit einem vorhandenen Bild – deiner festgelegten Figurenreferenz. Der neue Prompt wird als begrenzte Transformation darauf angewendet, gesteuert durch einen Stärke- oder Denoising-Parameter. Eine niedrige Stärke hält die Ausgabe nah an Komposition und Farben der Referenz und verändert nur behutsam Pose oder Ausdruck. Bei hoher Stärke wird die Referenz eher als loser Ausgangspunkt denn als feste Vorgabe behandelt.

Um ein bestimmtes Designelement konsistent zu halten, ist das deutlich zuverlässiger als reine Text-Prompts. Das Modell hat tatsächliche Pixel als Referenz statt einer Textbeschreibung, die es jedes Mal neu interpretieren muss. Die Kehrseite ist, dass Bild-zu-Bild Pose und Komposition der Referenz stärker übernimmt als reine Text-zu-Bild-Generierung. Eine deutlich andere Pose zu verlangen und gleichzeitig die Stärke niedrig genug für die Beibehaltung des Figurendesigns zu halten, ist daher ein echter Zielkonflikt. Keine Einstellung beseitigt ihn; du kannst nur pro Generierung einen geeigneten Bereich abstimmen.

Manche Werkzeuge unterstützen außerdem eine eigene Referenz- oder Figurenbildeingabe, getrennt vom eigentlichen Generierungs-Prompt. Sie übernimmt Stil und Identität aus der Referenz, ohne dieselbe Komposition zu erzwingen. Wo verfügbar, erzielt das bei unterschiedlichen Posen und gleichbleibender Figurenidentität meist bessere Ergebnisse als einfache Bild-zu-Bild-Generierung. Die Ergebnisse hängen aber weiterhin vom Modell ab und sind nicht garantiert.

Weniger Posen pro Batch generieren

Es ist verlockend, ein vollständiges Sheet – acht Posen, vier Ausdrücke – in einem Prompt oder Batch anzufordern, in der Hoffnung, das Modell behandle sie als Set. In der Praxis macht das gleichzeitige Anfordern vieler Varianten die Figur nicht konsistenter. Es vervielfacht nur die Zahl unabhängiger Versuche, bei denen Abweichungen auftreten können, ohne zusätzlichen Konsistenzmechanismus, der sie verbindet.

Generiere jeweils eine oder zwei Posen, prüfe jede anhand deiner Referenz, bevor du zur nächsten übergehst, und verwirf oder regeneriere Ausreißer sofort. So erkennst du Abweichungen früh, wenn nur ein Bild neu erstellt werden muss, statt nach sechzehn Generierungen festzustellen, dass die Hälfte nicht zusammenpasst. Pro Bild ist das langsamer, insgesamt aber meist schneller, weil du keine großen Batches komplett wegwirfst.

Abweichungen nach der Generierung beheben: Palettenkorrektur

Selbst mit sorgfältigen Prompts sind gewisse Farbabweichungen innerhalb eines generierten Sets mit aktuellen Werkzeugen kaum zu vermeiden. Eine praktische Rückfalllösung ist die nachträgliche Korrektur, statt um perfekte Generierungen zu kämpfen: Wähle dein bestes, repräsentativstes Bild als Farbreferenz und wende dann einen Palettenabgleich oder eine Farbkorrektur auf den Rest des Sets an. So verwenden alle exakt dieselben Farbwerte statt nur ähnlicher.

Strukturelle Unterschiede behebt das nicht. Eine andere Kragenform oder ein Gesicht, das wie eine andere Person wirkt, muss neu generiert werden, nicht farbkorrigiert. Im häufigen Fall „Die Figur stimmt, nur die Jacke hat in drei Bildern einen leicht anderen Rotton“ gleicht eine Palettenkorrektur in jedem einfachen Bildeditor die Abweichung jedoch in Minuten aus. Das ist viel schneller als neue Generierungen mit der Hoffnung auf eine bessere Übereinstimmung.

Die ehrliche Grenze

Nichts davon garantiert Konsistenz, und das sollte klar gesagt werden: Aktuelle allgemeine Bildmodelle erhalten das exakte Design einer Figur über viele unabhängige Generierungen hinweg nicht zuverlässig, besonders bei unterschiedlichen Posen, Blickwinkeln oder Lichtverhältnissen. Manche Werkzeuge haben spezielle Funktionen für Figurenkonsistenz, die die Chancen verbessern. Auch sie erzeugen aber gelegentliche Abweichungen, die ein Mensch erkennen muss. Plane diesen Durchgang – Prüfung sowie Verwerfen oder Korrigieren von Ausreißern – als normalen Teil des Ablaufs ein, nicht als Ausnahme. So bleibt der Prozess realistisch, statt dem Werkzeug Ergebnisse abzuringen, die es noch nicht garantieren kann.

Häufig gestellte Fragen

Bleibt die Figur konsistent, wenn ich für jede Pose denselben Seed nutze?

Nein. Der Seed reproduziert nur bei identischem Prompt eine identische Ausgabe. Änderst du den Prompt für eine neue Pose, ist er kein sinnvoller Anker mehr. Er hilft, die Wirkung kleiner Prompt-Änderungen zu isolieren, nicht dabei, Varianten derselben Figur zu erzeugen.

Ist Bild-zu-Bild für Konsistenz immer besser als Text-zu-Bild?

Es erhält bestimmte visuelle Details zuverlässiger, zieht die Ausgabe aber auch zur bestehenden Pose und Komposition der Referenz. Wenn du eine wirklich andere Pose brauchst, kann Bild-zu-Bild mit geringer Stärke die Änderung verhindern. Du musst dann Posenfreiheit gegen Konsistenz abwägen, statt beides automatisch zu erhalten.

Wie viele Referenzdetails sollte ich in den Prompt aufnehmen?

Genug, um die wirklich wichtigen Details festzulegen: Haarfarbe, Kleidungsfarben und Materialien sowie besondere Merkmale. Beschreibe nicht jedes kleine Detail zu genau. Das kann Prompts störanfällig machen und dazu führen, dass das Modell Teile einer zu langen Beschreibung ignoriert. Eine gezielte, wiederverwendete Figurenbeschreibung ist besser als eine erschöpfende, deren Formulierung sich jedes Mal ändert.

Kann ich ein völlig anderes Gesicht nachträglich korrigieren?

Nicht mit Farbkorrektur. Sie behebt nur Farb- und Tonwertabweichungen. Ein strukturell anderes Gesicht oder Outfit ist ein Generierungsproblem und muss neu generiert werden, idealerweise mit stärkerem Referenzbild oder genauer festgelegtem Prompt, statt nachträglich bearbeitet zu werden.

Weitere Leitfäden für KI-Bildarbeitsabläufe entdecken

Unser Kreativbereich behandelt praktische Arbeitsabläufe für KI-generierte Bildserien – von der Prompt-Erstellung bis zur Nachbearbeitung.

Kreativbereich öffnen