Start / Realistische KI-Avatare erstellen

Produktion

Realistische KI-Avatare erstellen, woran der Realismus scheitert und wie Sie eine Serie abnehmen

Die vier Stellen, an denen ein Ergebnis unecht wirkt, was davon nach dem Termin noch zu retten ist, die Aufteilung eines Aufnahmevormittags und fünf Kriterien für die Abnahme.

AIAIdentical Redaktion19. August 202615 Minuten
Filmkamera auf einem Stativ, dahinter unscharf eine sprechende Person im Aufnahmeraum
Der Realismus entscheidet sich an diesem Vormittag. Danach lässt sich nur noch die Hälfte davon ändern.
Kurz beantwortet

Realismus entsteht am Aufnahmetag und nicht im Werkzeug. Vier Stellen entscheiden darüber, wie ein Ergebnis wirkt, nämlich die Blickachse, die Lippen zum Ton, der Sprechrhythmus und der Übergang zwischen zwei Abschnitten. Von diesen vier lassen sich nach dem Termin nur die letzten zwei verbessern, die ersten hängen am Material. Der Termin kostet die Zeit der Person, die am wenigsten davon hat, deshalb legen Sie die Reihenfolge der Maßnahmen vorher fest. Für die Abnahme genügen fünf Kriterien mit einer Entscheidungsregel, eine Ansicht ohne Ton und eine vereinbarte Zahl von Korrekturrunden. Wer ohne diese Regel abnimmt, verhandelt Geschmack und braucht dafür drei Runden.

Woran Zuschauer ein Ergebnis erkennen, und was davon reparierbar ist

Vier Stellen, geordnet nach dem, was eine Ablehnung kostet.

Die häufigste Rückmeldung nach einer ersten Runde lautet, das Video wirke unecht. Sie kommt meist von mehreren Personen gleichzeitig und fast immer ohne Begründung, und in dieser Form lässt sie sich nicht bearbeiten. Wer eine Serie abnehmen muss, braucht deshalb zuerst eine Ordnung. Welche Stelle im Bild oder im Ton hat die Rückmeldung ausgelöst, und lässt sich diese Stelle nach dem Aufnahmetag überhaupt noch ändern.

Vier Stellen, an denen sich Realismus entscheidet. Die rechte Spalte sagt, was eine Ablehnung kostet.
Stelle Woran es auffällt Ursache im Material Nach dem Termin noch zu ändern
Blickachse Der Blick geht wenige Grad neben die Linse, das Gegenüber fühlt sich nicht angesprochen Abgelesener Text, Vorlage neben der Kamera statt unter ihr Nein, dafür braucht es einen neuen Termin
Lippen zum Ton An schnellen Stellen liegt der Mund vor oder hinter der Stimme Hohes Sprechtempo in der Aufnahme, schmaler Bewegungsspielraum Teilweise, mit kürzeren Abschnitten und ruhigerem Text
Sprechrhythmus Die Betonung bleibt über Minuten gleich, das Zuhören wird mühsam Liegt nicht im Material, sondern im Skript Ja, das Skript entsteht nach der Aufnahme
Übergänge Beim Wechsel zwischen zwei Abschnitten springt Haltung oder Kopfstellung Zu lange Stücke, kein Schnittbild vorgesehen Ja, mit kürzeren Stücken und einem Schnitt

Die Reihenfolge folgt dem Preis und nicht der Häufigkeit. Zwei der vier Stellen hängen am Termin, zwei am Skript und am Schnitt. Eine Ablehnung, die eine der ersten beiden Zeilen benennt, führt zu einem neuen Aufnahmetermin und damit zur teuersten Nacharbeit des Vorhabens. Eine Ablehnung, die nur „unecht“ sagt, führt zu einer weiteren Runde, in der niemand weiß, was sich ändern soll, und danach zu einer dritten.

Diese Seite behandelt den Weg dorthin, also den Aufnahmetag und die Abnahme. Warum ein Zuschauer überhaupt so genau hinsieht und was an der Rede vom Deepfake belegt ist, steht auf der Seite zu den fotorealistischen KI-Avataren. Welche Einstellung im Werkzeug welche Wirkung hat, steht auf der Seite zum AI Avatar Generator. Beide Fragen sind wichtig und beide entscheiden weniger als der Vormittag vor der Kamera.

Wer den Realismus verantwortet, und wer die Zeit dafür hergibt

Zwei Rollen mit gegenläufigen Größen, und ein Tausch, der offen gehört.

In fast jedem Vorhaben sitzen zwei Rollen am Tisch, die nichts gemeinsam haben außer dem Ergebnis. Die Leitung Unternehmenskommunikation soll eine Serie von zehn oder zwölf Videos abnehmen. Sie hat Video nie gelernt, sie kann ein Ergebnis nicht in Fachbegriffen beschreiben, und sie wird daran gemessen, ob die Serie ohne dritte Runde freigegeben wird und ob aus der Geschäftsführung keine Rückfrage kommt. Was sie aufhält, ist die fehlende Sprache für den Befund.

Die zweite Rolle ist die Person vor der Kamera, meist aus der Geschäftsführung. Sie will einen Vormittag geben und danach nicht mehr gebraucht werden. Was sie aufhält, ist jeder Nachdreh, weil er ihren Kalender ein zweites Mal öffnet. Ihr Erfolg ist ein einziger Termin mit einem Ergebnis, das zwei Jahre trägt, und ein Kalender, in dem danach kein zweiter Termin auftaucht.

Zwischen diesen beiden Rollen liegt der Tausch, um den es an diesem Tag geht. Mehr Aufnahmezeit bringt mehr Realismus, weil der Vorrat an Haltungen, Gesten und Mundstellungen wächst. Genau diese Zeit gehört der Person, die am wenigsten davon hat. Wir bügeln das nicht glatt, sondern planen dagegen. Die Minuten werden nach Wirkung geordnet, und die Varianten, die einen zweiten Termin ersparen, stehen vor allem, was nur schöner wäre.

Richtwerte aus eigenen Aufnahmeterminen, Stand August 2026. Die rechte Spalte ist vor dem Termin zu vereinbaren und nicht während.
Abschnitt des Vormittags Dauer Ist die Person nötig Entfällt zuerst
Aufbau von Licht, Kamera und Ton etwa 60 Minuten Nein Nichts, sonst kostet es später mehr
Einrichten der Blickachse und Probeaufnahme 15 Minuten Ja Nichts, das ist die wirksamste Viertelstunde
Kernaufnahme des Aufnahmetexts 30 bis 40 Minuten Ja Nichts
Varianten in Haltung und Kleidung 30 Minuten Ja Die Fassung im Stehen, dann das zweite Oberteil
Kontrolle am großen Bildschirm 15 Minuten Ja Nichts, sie entscheidet über den zweiten Termin

Die letzte Zeile ist die, die am häufigsten gestrichen wird, und sie ist die einzige, die den zweiten Termin verhindert. Solange die Person im Haus ist, kostet eine Wiederholung Minuten. Am nächsten Tag kostet sie einen Kalendereintrag, den niemand bekommt.

3 Stundengenügen für eine Aufnahme, aus der eine Serie über zwei Jahre entstehtRichtwert aus eigenen Aufnahmeterminen, Stand August 2026
4 Stellenentscheiden darüber, ob ein Ergebnis echt wirkt oder abgelehnt wirdOrdnung dieser Seite, nach Häufigkeit der Rückmeldungen
2 RundenKorrektur gehören in den Auftrag, die dritte kostet einen neuen TerminEmpfehlung dieser Seite
Kamera auf einem Stativ richtet sich auf eine sprechende Person in einem Aufnahmeraum
Der Aufbau braucht die längste Zeit und die Person am kürzesten. Genau so planen Sie den Vormittag.

Blickachse, Abstand und Höhe der Linse

Drei Größen am Aufnahmeplatz, die stärker wirken als jede Kamera.

Zuschauer sehen zuerst die Augen, und sie merken schneller als jede Messung, wenn ein Blick sie nicht trifft. Der häufigste Grund ist harmlos und lässt sich in einer Viertelstunde beheben. Die Person liest ihren Text von einem Bildschirm ab, der neben der Kamera steht, und blickt damit einige Grad vorbei. Gehört der Text unter die Linse und möglichst nah an sie, verschwindet der Effekt, ohne dass jemand ihn benennen könnte.

Der zweite Punkt ist der Abstand. Steht die Kamera nah an der Person und arbeitet mit weitem Bildwinkel, wachsen Nase und Stirn gegenüber dem Rest des Gesichts. Das ist keine Frage der Bildqualität, sondern der Optik, und es bleibt im Modell. Zwei Meter Abstand mit einer längeren Brennweite zeigen dieselbe Person in vertrauteren Verhältnissen. Der dritte Punkt ist die Höhe. Die Linse gehört auf Augenhöhe, weil ein Blick von unten belehrend wirkt und ein Blick von oben unterwürfig.

Vier Größen am Aufnahmeplatz. Alle vier stecken danach im Modell und sind nur mit einem neuen Termin zu ändern.
Größe am Aufnahmeplatz Wirkung im Ergebnis Prüfung vor der Aufnahme
Lage der Textvorlage Entscheidet, ob der Blick das Gegenüber trifft Direkt unter die Linse legen, aus zwei Metern gegenlesen
Abstand und Brennweite Bestimmt die Verhältnisse im Gesicht, bleibt im Modell Etwa zwei Meter, Bildausschnitt über die Brennweite setzen
Höhe der Linse Ein Blick von unten belehrt, einer von oben schwächt Augenhöhe der sitzenden Person, mit dem Stativ einstellen
Stuhl und Sitzhaltung Ein Drehstuhl erzeugt langsame Drehung, die das Modell übernimmt Stuhl ohne Rollen, Füße am Boden, leichte Neigung nach vorn

Kleidung, die zwei Jahre trägt

Kleidung ist im Modell festgeschrieben und steht damit in jedem späteren Video. Das macht sie zu einer Entscheidung über die Haltbarkeit der Serie und nicht über den Geschmack eines Vormittags. Einfarbig, mittlerer Farbwert und matter Stoff sind die ruhige Wahl. Wer zwei Oberteile aufnimmt, hat später zwei Anlässe abgedeckt, das förmliche und das offene.

Blickachse, Abstand, Höhe und Kleidung kosten am Vormittag zusammen eine halbe Stunde. Nachträglich kosten sie einen zweiten Termin.

Wie der Raum eingerichtet wird, wie Licht ohne Studio aussieht und welche Fehler beim Ton nicht mehr zu beheben sind, steht als Anleitung auf der Seite zum eigenen Avatar. Diese Seite wiederholt das nicht, sondern behandelt, welche dieser Punkte im Zeitbudget zuerst kommen und woran Sie das Ergebnis später abnehmen.

Sprechtempo, Pausen und der Vorrat an Bewegungen

Was die Person in diesen Minuten tut, ist alles, was das Modell später hat.

Ein Avatar zeigt keine neue Bewegung. Er setzt aus dem zusammen, was in der Aufnahme vorkam, und deshalb ist der Aufnahmetext kein Nebenschauplatz. Er ist die Bestellung des Bewegungsvorrats. Eine Person, die vier Minuten gleichmäßig liest, liefert ein Modell, das vier Minuten gleichmäßig liest, und daran ändert später kein Skript etwas.

  1. Aussagesätze und Fragen mischen, weil Fragen die Kopfhaltung verändern und damit den Vorrat vergrößern.
  2. Zwei oder drei Stellen bewusst betonen, damit das Modell überhaupt weiß, wie diese Person betont.
  3. Zweimal deutlich atmen und absetzen, denn Pausen ohne Vorlage wirken später wie Aussetzer.
  4. Die Hände in eine Ruhelage bringen und dort lassen, weil wandernde Hände aus dem Bild laufen und im Modell als Sprung erscheinen.
  5. Am Ende zehn Sekunden schweigen und in die Linse sehen, das ergibt die ruhige Haltung für Übergänge und Abblenden.

Beim Tempo liegt der brauchbare Bereich breiter, als Sprechende vermuten, und beim Ablesen wird er fast immer nach oben verlassen. Ein Text vom Blatt läuft schneller als dieselbe Aussage in einer Besprechung, weil das Auge vorausliest. Die Anweisung, die am besten wirkt, lautet deshalb nicht langsamer sprechen, sondern eine Besprechung mit sechs Personen vorstellen. Das trifft das Tempo und die Betonung in einem Schritt.

Die Stimme ist eine getrennte Entscheidung mit eigenen Folgen. Ein Klon der eigenen Stimme braucht eine eigene Einwilligung und eine Regel, wer ihn freischalten darf. Eine Bibliotheksstimme ist beim Anbieter lizenziert und kommt ohne diese Fragen, klingt aber nie wie die Person im Bild. Näheres auf der Seite zum Voice Cloning. Wer dieselbe Aufnahme in mehreren Sprachen ausspielen will, findet die Betriebsfragen auf der Seite zum mehrsprachigen KI-Avatar.

Standbild aus dem Demovideo, ein Mann spricht in die Kamera, links eingeblendet Flaggen für Chinesisch, Englisch und Italienisch mit Untertitel
Eine Aufnahme, drei Sprachen. Der Bewegungsvorrat aus dem Vormittag trägt alle drei Fassungen.

Lippensynchronität, und warum sie am härtesten beurteilt wird

Die Stelle, an der Menschen am meisten Übung haben.

Menschen lesen Münder, seit sie sprechen lernen, und sie tun es ohne Anstrengung. Deshalb fällt ein Versatz von wenigen Hundertstelsekunden auf, während dieselbe Person eine unruhige Hand im Hintergrund übersieht. Für die Abnahme heißt das, der Mund braucht eine eigene Prüfung und verträgt keine Sammelnote.

Es gibt drei Stellen, an denen die Synchronität zuerst bricht, und alle drei sind vorhersehbar. Schnell gesprochene Passagen sind die erste, weil dort viele Mundstellungen in kurzer Zeit gebraucht werden. Zahlen und Abkürzungen sind die zweite, weil sie oft gehetzt gesprochen werden. Eine andere Sprache ist die dritte, weil Laute vorkommen, die in der Aufnahme nie gebildet wurden. Wer diese drei Stellen kennt, prüft in fünf Minuten, was sonst eine Stunde dauert.

Wirksam gegen einen Versatz sind kürzere Abschnitte, ein ruhigeres Tempo im Skript und ausgeschriebene Zahlen. Nicht wirksam ist der Wechsel des Werkzeugs, und das ist die Maßnahme, die in dieser Lage am häufigsten vorgeschlagen wird. Der Abstand zwischen zwei Werkzeugen ist kleiner als der Abstand zwischen zwei Skripten, und ein Wechsel bringt einen neuen Vertrag, eine neue Freigabe und dieselbe Stelle im Video.

Die Prüfung selbst braucht keine Fachkenntnis. Sehen Sie das Video zuerst ohne Ton und achten Sie darauf, ob der Mund für sich betrachtet ruhig aussieht. Dann mit Ton, und halten Sie an einer schnellen Stelle, an einer Zahl und an einem Eigennamen an. Geben Sie es einer Person, die das Skript nicht gelesen hat, denn wer den Text kennt, hört, was er erwartet. Wie man ein vorgeführtes Beispiel liest, ohne sich täuschen zu lassen, steht auf der Seite zur Beurteilung eines Beispiels.

Die Abnahme einer Serie, fünf Kriterien und eine Entscheidungsregel

Schriftlich, vor der ersten Runde, mit einer abnehmenden Person.

Eine Abnahme ohne aufgeschriebene Kriterien wird zur Geschmacksfrage, und Geschmacksfragen entscheidet im Haus die Ausdauer. Fünf Kriterien genügen, und jedes braucht neben der Prüfung eine Regel, wann es als nicht erfüllt gilt. Diese Regel ist der Teil, der meist fehlt, und sie ist der Grund, warum manche Serien in der dritten Runde liegen bleiben.

Fünf Kriterien für die Abnahme. Die dritte Spalte gehört in den Auftrag, sonst wird sie im Gespräch verhandelt.
Kriterium Wie geprüft wird Wann es als nicht erfüllt gilt
Blickachse Zehn Sekunden aus der Mitte, auf einem großen Bildschirm Der Blick geht sichtbar vorbei, in mehr als einem Abschnitt
Lippen zum Ton Einmal ohne Ton, dann an drei schnellen Stellen anhalten Der Versatz ist an zwei der drei Stellen zu sehen
Sprechrhythmus Die ersten dreißig Sekunden mit geschlossenen Augen anhören Die Betonung ist über den ganzen Abschnitt gleich
Bild und Ton technisch Auf dem Gerät ansehen, auf dem später zugeschaut wird Blockbildung um den Mund, Hall oder Rauschen im Ton
Kennzeichnung Beschreibung, Abspann und Ablage prüfen Der Hinweis auf die künstliche Erzeugung fehlt an einer Stelle

Die Kennzeichnung in der letzten Zeile ist keine Höflichkeit. Artikel 50 der Verordnung (EU) 2024/1689 verlangt, dass künstlich erzeugte Bild- und Tonaufnahmen als solche erkennbar sind, und verpflichtet ist, wer veröffentlicht. Praktisch heißt das ein Satz in der Beschreibung, ein Hinweis im Abspann und ein Vermerk in der Ablage, damit die Angabe auch beim zweiten Verwenden noch mitgeht.

Person nimmt sich vor einer Kamera auf und hält dabei ein Produkt in die Linse
Ein Produktvideo ist der ruhige erste Fall für eine Abnahme, weil der Text ohnehin steht und das Ergebnis sofort zu zeigen ist.

Zur Regel gehören zwei Festlegungen über die Kriterien hinaus. Erstens nimmt eine Person ab, und die anderen kommentieren. Wird das nicht vorher benannt, entsteht eine Sammlung von Wünschen ohne Rangfolge. Zweitens stehen zwei Korrekturrunden im Auftrag, und beide haben einen Termin. Wer die Zahl offen lässt, bekommt keine bessere Serie, sondern eine späte.

Der Leitung Unternehmenskommunikation nimmt diese Liste die Sprachnot ab, und genau darin liegt ihr Wert. Nebenbei erfüllt eine kurze Einweisung in diese fünf Punkte einen Teil dessen, was Artikel 4 der KI-Verordnung in der Fassung der Änderungsverordnung (EU) 2026/1744 verlangt, nämlich Maßnahmen zur Kompetenzentwicklung bei den Menschen, die mit solchen Systemen arbeiten. Ein Nachweis je Person ist dort nicht gefordert.

Wann ein Avatar für diesen Anlass die falsche Wahl ist

Vier Lagen, in denen mehr Realismus das Problem nicht löst.

Die Frage nach dem Realismus setzt voraus, dass ein Avatar der richtige Weg ist. Das ist er häufig, aber nicht immer, und die Fälle dagegen sind gut abgrenzbar. In allen vier folgenden Lagen hilft ein besseres Ergebnis nicht, weil der Einwand nicht an der Bildqualität hängt.

Vier Anlässe, in denen die Antwort Nein lautet. Die letzten zwei sind Rechenfälle, die ersten zwei sind es nicht.
Anlass Warum ein Avatar hier nicht trägt Was stattdessen trägt
Anteilnahme, Entschuldigung, Krisenmeldung Wer sich entschuldigt, haftet mit seiner Anwesenheit. Ein Abbild nimmt genau die zurück Ein Auftritt in Person, notfalls ein Brief mit Unterschrift
Personelle Entscheidungen Betroffene lesen die Wahl des Mittels als Aussage über ihre Bedeutung Ein Gespräch, danach eine schriftliche Fassung
Einmaliger Text und verfügbare Person Der Aufnahmetag kostet mehr Zeit als das einmalige Abfilmen Eine gewöhnliche Aufnahme mit Kamera und Mikrofon
Wöchentlich wechselnder Inhalt ohne Zuständige Ein Modell ohne Pflege veraltet und wird nach Monaten peinlich Ein Text im Intranet, bis die Pflege benannt ist

Dazu kommt eine fünfte Lage, die keine Frage der Wirkung ist. Fehlt die Einwilligung der gezeigten Person nach Paragraf 22 des Kunsturhebergesetzes, oder ist die Mitbestimmung nach Paragraf 87 Absatz 1 Nummer 6 Betriebsverfassungsgesetz nicht geklärt, dann steht das Vorhaben unabhängig vom Ergebnis. Diese Klärung dauert Wochen und wird in Zeitplänen am seltensten eingetragen. Sie gehört vor den Aufnahmetermin und nicht vor die Veröffentlichung.

Ein offener Verzicht kostet in diesen Lagen wenig und bringt viel. Wer einmal sagt, dass ein Anlass sich für ein Abbild nicht eignet, wird beim nächsten Vorhaben gefragt, ob es passt. Wer alles annimmt, wird nach dem ersten unpassenden Video nicht mehr gefragt.

Videoschnittplatz mit zwei Bildschirmen, eine Person bearbeitet Aufnahmen
Schnitt und Untertitel entstehen nach der Erzeugung. Was am Vormittag fehlte, entsteht hier nicht mehr.

Nächste Schritte

Wohin es von hier weitergeht.

Wenn Sie einen Aufnahmetermin planen, ist die Einrichtung des Ortes der nächste Schritt. Sie steht auf der Seite zum eigenen Avatar, mit Raum, Licht und Ton im Einzelnen. Wer noch nicht entschieden hat, ob eine bestimmte Person gezeigt wird, findet die vier Wege im Vergleich auf der Seite zum Avatar erstellen mit KI.

Wenn die Aufnahme steht und es um das Werkzeug geht, führt der Weg zur Seite zum AI Avatar Generator. Was ein Vorhaben im ersten Jahr kostet und welche Posten laufend anfallen, steht in der Preisübersicht für Geschäftsführer. Der Aufnahmetag selbst lässt sich in einer halben Stunde durchsprechen, und dabei zeigt sich meist schon, ob ein Vormittag reicht.

Häufige Fragen zum Realismus in der Aufnahme

Warum sieht mein KI-Avatar unecht aus?

In den meisten Fällen an einer von vier Stellen, und keine davon liegt im Werkzeug. Der Blick geht wenige Grad neben die Linse, weil die Person abliest. Der Mund liegt an schnellen Stellen vor oder hinter der Stimme. Die Betonung bleibt über Minuten gleich, weil das Skript aus langen Schachtelsätzen besteht. Oder die Haltung springt beim Übergang zwischen zwei Abschnitten. Prüfen Sie in dieser Reihenfolge, dann wissen Sie, ob ein neuer Termin nötig ist oder eine neue Ausgabe genügt.

Welche Aufnahme brauche ich für einen realistischen KI-Avatar?

Eine, in der die Person ruhig sitzt, in die Linse spricht und dabei so viel Bewegung zeigt, wie sie später brauchen soll. Der Vorrat an Kopfhaltungen, Gesten und Mundstellungen entsteht in diesen Minuten und wächst danach nicht mehr. Wichtiger als die Kamera sind die Blickachse, ein ruhiges Licht von vorn und ein Mikrofon in der Nähe der Person. Wie der Aufnahmeort dafür eingerichtet wird, steht auf der Seite zur Aufnahme.

Wie viel Zeit muss die Person vor der Kamera einplanen?

Rechnen Sie mit drei Stunden am Stück, davon etwa eine Stunde für den Aufbau, in der die Person nicht gebraucht wird. Die Kernaufnahme selbst dauert selten länger als vierzig Minuten. Der Rest geht in Varianten, also eine zweite Sitzhaltung, ein zweites Oberteil, eine Fassung im Stehen. Sie sind der Grund, einen Termin nicht knapp zu planen, denn sie ersparen den zweiten.

Welches Sprechtempo ist für einen KI-Avatar richtig?

Etwa das Tempo, in dem Sie in einer Besprechung mit sechs Personen sprechen, also merklich langsamer als bei einem Vortrag. Schnelle Passagen sind die Stellen, an denen die Lippen sichtbar hinterherkommen, und sie fallen auch dann auf, wenn der Ton stimmt. Zu langsam wirkt gleichförmig und schläfrig. Der brauchbare Bereich ist breiter, als Sprechende vermuten, und er wird beim Ablesen fast immer nach oben verlassen.

Wie nehme ich eine Serie ab, wenn ich Video nicht beurteilen kann?

Mit fünf schriftlichen Kriterien und einer Regel, wann ein Kriterium als nicht erfüllt gilt. Sehen Sie jedes Video einmal ohne Ton an, dann einmal mit Ton auf dem Gerät, auf dem später zugeschaut wird. Halten Sie an drei Stellen an und sehen Sie auf den Mund. Notieren Sie zu jedem Befund, welche der vier Stellen gemeint ist. Damit ist die Rückmeldung bearbeitbar, auch ohne Erfahrung im Videoschnitt.

Woran erkenne ich, ob ein Nachdreh nötig ist oder eine neue Ausgabe genügt?

An der Art des Befunds. Blickachse, Licht, Kleidung und Sitzhaltung stecken im Material und lassen sich nur mit einem neuen Termin ändern. Sprechrhythmus, Länge der Abschnitte, Untertitel und Übergänge hängen am Skript und am Schnitt und kosten eine neue Ausgabe, also Stunden statt eines Termins. Diese Trennung vor der ersten Runde aufzuschreiben spart die längste Diskussion des Vorhabens.

Realistische KI-Avatare erstellen, wenn die Geschäftsführung nur einen Vormittag Zeit hat

Dann legen Sie die Reihenfolge vorher fest, und zwar nach Wirkung je Minute. Zuerst die Blickachse, weil sie am stärksten wirkt und am wenigsten Zeit kostet. Danach zwei ruhige Durchgänge des Aufnahmetexts. Danach die Varianten, die einen zweiten Termin ersparen. Was am Ende entfällt, ist die Fassung im Stehen und der Wechsel des Oberteils. Was nie entfällt, ist die Kontrolle auf einem großen Bildschirm, bevor die Person geht.

Wie prüfe ich die Lippensynchronität ohne Fachkenntnis im Videoschnitt?

Sehen Sie das Video zuerst ohne Ton. Wenn der Mund für sich betrachtet ruhig und sinnvoll aussieht, ist die Grundlage in Ordnung. Dann mit Ton, und halten Sie an drei Stellen an, an denen schnell gesprochen wird, an einer Zahl und an einem Eigennamen. Genau dort bricht die Synchronität zuerst. Eine dritte Person, die das Skript nicht gelesen hat, findet in fünf Minuten mehr als eine Stunde in der Zeitlupe.

Welche Kleidung trägt die Person, wenn die Videos zwei Jahre laufen sollen?

Einfarbig, mittlerer Farbwert, matter Stoff, keine feinen Muster und kein Logo, das sich ändern kann. Der Grund ist weniger die Bildqualität als die Haltbarkeit, denn Kleidung und Frisur stecken im Modell und stehen in jedem späteren Video. Ein Weihnachtspullover datiert die ganze Serie, und ein Streifenhemd erzeugt an Kanten ein Störmuster. Was das Modell aus dem Material übernimmt, steht auf der Seite zum Modell.

Was tun, wenn drei Personen im Haus dasselbe Video unterschiedlich beurteilen?

Eine Person nimmt ab, die anderen kommentieren. Diese Rolle wird vor der ersten Runde benannt, sonst entscheidet die Ausdauer. Kommentare ohne Bezug zu einem der fünf Kriterien werden gesammelt und nicht umgesetzt. Vereinbaren Sie außerdem zwei Korrekturrunden im Auftrag. Die dritte Runde ist der Punkt, an dem ein Vorhaben still liegen bleibt, weil niemand mehr eine Entscheidung treffen will.

Wem gehört das Gesicht, wenn die aufgenommene Person das Haus verlässt?

Das Recht am eigenen Bild bleibt bei der Person. Nach Paragraf 22 des Kunsturhebergesetzes braucht die Verbreitung ihre Einwilligung, und diese Einwilligung gehört schriftlich, mit benanntem Zweck und mit einer Regelung für den Austritt. Klären Sie vor der Aufnahme, ob veröffentlichte Videos weiterlaufen dürfen, wer den Avatar sperren kann und in welcher Frist das Modell gelöscht wird. Der Fall ist selten und dann dringend.

Muss der Betriebsrat der Aufnahme zustimmen?

Sobald Beschäftigte aufgenommen werden und die Technik geeignet ist, Verhalten oder Leistung zu überwachen, greift die Mitbestimmung nach Paragraf 87 Absatz 1 Nummer 6 Betriebsverfassungsgesetz. In der Praxis wird der Betriebsrat auch dort beteiligt, wo diese Frage offen ist, weil eine spätere Klärung den Termin wiederholt. Eine kurze Vereinbarung über Zweck, Dauer und Löschung ist der schnellere Weg als eine Diskussion nach der Aufnahme.

Wo wird das Material verarbeitet, wenn wir in Deutschland aufnehmen?

Der Ort der Aufnahme sagt nichts über den Ort der Berechnung. Wer in Metzingen aufnimmt und ein Werkzeug mit Rechenzentrum außerhalb der EU nutzt, übermittelt in ein Drittland. Die Einwilligung der Person nach Artikel 6 Absatz 1 Buchstabe a DSGVO deckt das nicht ab. Ob daneben Artikel 9 DSGVO greift, hängt davon ab, ob die Verarbeitung der eindeutigen Identifizierung dient, was bei einem Avatarmodell nicht der Regelfall ist. Diese Frage gehört vor die erste Aufnahme.

Zum Mitnehmen

  • Vier Stellen entscheiden über den Realismus, nämlich Blickachse, Lippen zum Ton, Sprechrhythmus und Übergänge zwischen zwei Abschnitten.
  • Zwei dieser vier stecken im Material und kosten einen neuen Termin, die anderen zwei hängen am Skript und kosten eine neue Ausgabe.
  • Der Vorrat an Kopfhaltungen und Gesten entsteht in den Minuten vor der Kamera und wächst danach nicht mehr.
  • Mehr Aufnahmezeit bringt mehr Realismus und kostet die Zeit der Person, die am wenigsten davon hat. Diese Rechnung geht nur mit einer vorher festgelegten Reihenfolge auf.
  • Eine Abnahme braucht fünf schriftliche Kriterien, eine abnehmende Person und zwei vereinbarte Korrekturrunden.
  • Für Anteilnahme, Entschuldigung und Krisenmeldungen ist ein Avatar die falsche Wahl, und zwar unabhängig davon, wie echt er wirkt.

Ihren Aufnahmetag einmal durchsprechen

Schildern Sie, wer vor der Kamera steht, wie viel Zeit diese Person hat und wer die Serie abnehmen muss. Wenn ein Vormittag für Ihr Vorhaben nicht reicht, sagen wir das vorher, auch wenn daraus kein Auftrag wird. Sie gehen mit einer Reihenfolge für den Termin aus dem Gespräch.

Termin vereinbaren

Wählen Sie einen Zeitpunkt, der Ihnen passt. Das Gespräch dauert dreißig Minuten und findet als Videokonferenz statt.

Die Terminbuchung läuft über Calendly. Beim Laden des Kalenders werden Daten an Calendly übertragen, unter anderem Ihre IP-Adresse. Näheres in der Datenschutzerklärung.

Anfrage stellen

Wenn Ihnen ein Termin zu früh ist, schildern Sie hier kurz Ihr Vorhaben. Sie bekommen eine Einschätzung, ob sich die Rechnung bei Ihrem Aufkommen trägt.

Wir antworten in der Regel am selben Werktag.

AIdentical Redaktion, Video- und Avatarproduktion der sensified AI GmbH. Die Angaben zum Aufnahmeweg sind Richtwerte aus eigenen Terminen und keine gemessenen Ergebnisse. Wo eine Zahl steht, steht ihre Herkunft daneben. Rechtsauskunft ist diese Seite nicht. Stand August 2026. Mehr zur Redaktion

Die auf dieser Seite gezeigten Bilder sind ganz oder teilweise künstlich erzeugt. Kennzeichnung nach Artikel 50 der Verordnung (EU) 2024/1689. Weitere Angaben unter Transparenz.

Aufnahmetag durchsprechen30 Minuten, ohne Vorbereitung

Termin