Start / Digitale Sprecher
Stimme
Digitale Sprecher, was an die Stelle einer Sprecherbuchung tritt und was dabei verloren geht
Welche Teile einer Sprecherbuchung sich hinterlegen lassen, wie Betonung im Text entsteht, was in eine Aussprachetabelle gehört und wann ein Mensch am Mikrofon bleibt.

Ein digitaler Sprecher übernimmt nicht die Sprecherleistung, sondern ihren hinterlegbaren Teil. Klangfarbe, Deutlichkeit und Verfügbarkeit lassen sich speichern, die Regie am Text nicht. Sie wandert vom Aufnahmestudio an den Schreibtisch, denn Betonung, Pausen und Aussprache werden künftig geschrieben statt gesagt. Der Gewinn liegt vor allem im Kalender, weil eine Textänderung Minuten kostet statt eines Termins. Vor der ersten Aufnahme klären Sie zwei Dinge, nämlich den Zweck, für den die Stimme sprechen darf, und die Frist, in der sie zurückgegeben wird. Für Texte, die Anteilnahme tragen sollen, bleibt ein Mensch am Mikrofon die richtige Wahl.
Was in einer Sprecherbuchung steckt, und welcher Teil sich hinterlegen lässt
Sechs Leistungsteile, und die Trennlinie mitten hindurch.
Wer ein Sprecherbüro anruft, bestellt selten eine Stimme. Bestellt wird ein Bündel aus sechs Leistungen, das im Angebot als ein Posten erscheint und deshalb auch als ein Posten ersetzbar wirkt. Daran scheitern die ersten Vorhaben. Die Trennlinie zwischen dem, was eine gespeicherte Stimme übernimmt, und dem, was künftig jemand im Haus tut, verläuft mitten durch dieses Bündel.
| Leistungsteil | Was der gebuchte Sprecher mitbringt | Was eine hinterlegte Stimme davon übernimmt | Wo die Arbeit stattdessen liegt |
|---|---|---|---|
| Klangfarbe und Deutlichkeit | Geschulte Stimme, ruhige Atmung, saubere Artikulation | Vollständig, sofern das Material sauber aufgenommen wurde | Einmalig, am Aufnahmetag |
| Interpretation | Liest den Text und entscheidet dabei, was betont und wo abgesetzt wird | Nichts davon | Beim Schreiben des Textes, bei jedem Video neu |
| Aussprache von Eigennamen | Fragt vor der Aufnahme nach und behält es für den Termin | Nur das, was in einer Liste steht | In der Aussprachetabelle, dauerhaft gepflegt |
| Verfügbarkeit | Ein Termin im Kalender, meist mit Vorlauf von Tagen | Vollständig, zu jeder Uhrzeit | Entfällt |
| Technische Aufnahme | Raum, Mikrofon und der Schnitt der Versprecher | Vollständig | Entfällt |
| Rechte an der Verwendung | Nutzung nach Medium, Gebiet und Dauer, im Honorar abgebildet | Nichts davon, die Frage wird größer | Im Vertrag, vor der ersten Aufnahme |
Zwei Zeilen sind der eigentliche Gewinn. Die Verfügbarkeit fällt als Engpass weg, und die technische Aufnahme entfällt nach dem ersten Termin. Zwei andere Zeilen sind der Preis dafür. Die Interpretation wandert an den Schreibtisch dessen, der den Text verfasst, und die Rechte werden aufwendiger, weil eine gespeicherte Stimme Sätze sagen wird, die bei der Aufnahme niemand kannte.
Diese Seite behandelt die Stimme als Gegenstand, also Aufnahme, Betonung, Aussprache, Vertrag und Grenzen. Ob ein Haus überhaupt eine eigene Markenstimme führen sollte, steht auf der Seite zum Voice Cloning. Der Weg in viele Sprachen steht auf der Seite zum mehrsprachigen KI-Avatar.
Zwei Rollen am Tisch, und der Kalender zwischen ihnen
Die eine wartet auf Termine, die andere will wissen, was mit ihr geschieht.
In fast jedem dieser Vorhaben sitzen zwei Personen mit gegenläufigen Interessen am Tisch. Die Marketingleitung will, dass ein geändertes Datenblatt am selben Tag ein geändertes Video ergibt. Aufgehalten wird sie vom Vorlauf einer Buchung und von Mindestbeträgen für Nachaufnahmen. Gemessen wird sie an der Zeit zwischen Textfreigabe und fertiger Tonspur.
Die zweite Person ist die, deren Stimme aufgenommen wird, häufig aus der Geschäftsführung oder aus dem Produktmanagement. Sie will wissen, welche Sätze ihre Stimme künftig sagt und wer das entscheidet. Aufgehalten wird sie von einer Einwilligung, die den Zweck offen lässt. Ihr Erfolg ist eine schriftliche Grenze und eine benannte Stelle, bei der sie die Stimme abschalten lassen kann.
| Anlass im Jahresverlauf | Weg mit gebuchtem Sprecher | Weg mit hinterlegter Stimme | Was sich am Kalender ändert |
|---|---|---|---|
| Neues Produktvideo | Anfrage, Angebot, Termin, Aufnahme, Schnitt | Text schreiben, Aussprache prüfen, ausgeben | Tage statt Wochen |
| Eine geänderte Zahl in einem laufenden Video | Nachbuchung, häufig mit Mindestbetrag | Den betroffenen Abschnitt neu ausgeben | Minuten statt einer Woche |
| Zwölf Unterweisungen in einer Reihe | Ein Aufnahmetag, danach liegt die Reihe fest | Jederzeit ergänzbar, in gleicher Anmutung | Ein zweiter Termin entfällt |
| Telefonansage nach einer Umstellung | Eigene Buchung, oft mit eigenem Nutzungsrecht | Dieselbe Stimme, sofern das Medium geregelt ist | Der Engpass wandert in den Vertrag |
| Dringende Meldung am Freitagnachmittag | Nicht darstellbar, kein Sprecher verfügbar | In einer halben Stunde, wenn der Text steht | Der Anlass wird überhaupt erst bedienbar |
Zwischen diesen beiden Rollen liegt der Tausch, um den es hier geht. Eine hinterlegte Stimme ist in Minuten verfügbar und klingt am Freitagabend wie am Montagmorgen. Diese Gleichmäßigkeit ist der ganze Gewinn und zugleich der Verlust. Anteilnahme hören Menschen an der Tagesform, also an einer belegten Stimme, an einer zu langen Pause, an einem Satz, der abbricht. Eine gespeicherte Stimme hat davon nichts, auch mit besseren Modellen nicht.
Wir bügeln das nicht glatt, sondern teilen die Anlässe. Die Stimme wird für Serien hinterlegt, also für Unterweisungen, Produkterklärungen und Ansagen. Wo es auf die Person ankommt, geht dieselbe Person ans Mikrofon, und das dauert dann eine Viertelstunde.
Das Stimmmaterial, und was in diesen Minuten festgelegt wird
Welche Sprechweisen vorkommen müssen, damit später überhaupt betont wird.
Eine synthetische Stimme klingt nach dem Material, das ihr vorgelegt wurde, und nach nichts sonst. Wer eine Viertelstunde nüchtern abliest, erhält ein Modell, das nüchtern abliest, auch bei der Begrüßung einer neuen Kollegin. Der Aufnahmetext ist deshalb kein Nebenschauplatz, sondern die Bestellung der späteren Sprechweisen. Sechs Dinge gehören hinein, und sie kosten zusammen keine zusätzliche halbe Stunde.
- Einen sachlichen Abschnitt, wie er für Datenblätter und Unterweisungen gebraucht wird, ruhig und ohne Betonung am Satzende.
- Einen freundlichen Abschnitt, etwa eine Begrüßung, weil sonst jede Anmoderation später ernst klingt.
- Einen ernsten Abschnitt mit kurzen Sätzen, für Sicherheitshinweise und Bedienfehler.
- Fragen und Ausrufe, weil beide eine eigene Melodie haben, die aus Aussagesätzen nicht abzuleiten ist.
- Die zwanzig Wörter, die in Ihrem Haus täglich vorkommen, also Produktnamen, Abteilungen und Standorte, jeweils in einem vollständigen Satz.
- Zahlen, ein Datum, eine Uhrzeit und eine Telefonnummer, laut in der Form gelesen, in der Sie sie später hören wollen.
Für den Raum gilt eine einzige Regel, und sie wiegt schwerer als die Wahl des Mikrofons. Hall lässt sich nachträglich nicht entfernen. Er steckt danach in jedem Satz, den die Stimme jemals sagen wird, und macht sie in einer Telefonansage unbrauchbar. Ein Zimmer mit Teppich, Vorhängen und einer Bücherwand genügt meistens. Ein leerer Besprechungsraum mit Glasfront genügt nie.
Der Raum entscheidet über die Verwendbarkeit, das Mikrofon über die Feinheit. In dieser Reihenfolge lohnt sich auch der Aufwand.
Wie viel Material ein brauchbares Stimmmodell braucht und wie ein Widerruf wirkt, behandelt die Seite zum Voice Cloning. Die Einrichtung des Aufnahmeorts steht auf der Seite zum eigenen Avatar.

Betonung, Pausen und Tempo, die Regie wandert in den Text
Was früher im Studio gesagt wurde, steht künftig im Skript.
Im Aufnahmestudio steht neben dem Sprecher jemand, der eingreift. Diese Person heißt Regie, und sie taucht in keinem Angebot als eigener Posten auf. Ihre Arbeit verschwindet nicht, wenn der Sprecher verschwindet. Sie verlagert sich an den Schreibtisch dessen, der den Text schreibt, und dort ist sie zunächst niemandem zugewiesen. Das ist der häufigste Grund, aus dem eine erste Tonspur flach klingt.
| Wirkung im Ohr | Was die Regie zum Sprecher sagt | Was stattdessen im geschriebenen Text steht |
|---|---|---|
| Eine Aussage tritt hervor | Das Wichtige liegt am Ende | Das tragende Wort ans Satzende stellen und den Nebensatz davor kürzen |
| Eine hörbare Pause | Nach diesem Satz eine Sekunde | Einen Punkt setzen, wo im Geschriebenen ein Komma stünde |
| Ruhigeres Tempo bei einer Zahl | Langsamer, das ist eine Zahl | Den Satz teilen und die Zahl allein stehen lassen |
| Ein freundlicher Einstieg | Lächeln beim ersten Satz | Eine kurze Anrede voranstellen, danach ein Hauptsatz ohne Einschub |
| Ein ernster Abschnitt | Weniger Melodie, gleichmäßiger | Aufzählungen auflösen, Nebensätze streichen, Sätze auf acht Wörter kürzen |
| Fremde Rede oder ein Zitat | Das ist nicht von dir | Die Rede ankündigen und danach absetzen, statt Anführungszeichen zu setzen |
Zwei Eigenheiten der Synthese gehören dazu. Die Modelle leiten die Melodie aus dem Satzbau ab, weshalb ein Satz mit drei Nebensätzen gleichförmig klingt, gleichgültig wie er gemeint war. Und die Betonung hält selten über mehr als drei Sätze, weshalb ein Absatz ohne Gliederung nach zwanzig Sekunden in eine gleichbleibende Tonlage fällt. Gesprochene Texte werden deshalb kürzer geschrieben als gelesene.
Steuerzeichen sind der zweite Griff, nicht der erste
Die meisten Werkzeuge nehmen Angaben im Text entgegen, etwa eine Pause in Sekunden oder eine Betonung an einem Wort. Diese Angaben helfen und haben zwei Nachteile. Sie sind je Anbieter verschieden und gehen beim Wechsel verloren, und sie verstellen den Blick auf den Satz, der auch ohne sie besser wäre. Wer zuerst umstellt und danach steuert, behält einen Text, der in jedem Werkzeug trägt.
Ein Hinweis zur Länge. Ein Abschnitt von vierzig bis sechzig Sekunden ist die Einheit, in der sich später ändern lässt, ohne alles neu auszugeben. Wer ein Video am Stück erzeugt, zahlt jede spätere Korrektur mit einem vollständigen Durchlauf. Die Einstellungen dazu stehen auf der Seite zum AI Avatar Generator.

Produktnamen, Abkürzungen und Zahlen, die Liste mit der längsten Haltbarkeit
Fünf Sorten Wörter, an denen jede synthetische Stimme scheitert.
Eine synthetische Stimme liest, was dasteht, nach den Regeln, die sie gelernt hat. Das geht bei gewöhnlicher Prosa gut und bei allem schief, was in Ihrem Haus eine eigene Lesart hat. Ein gebuchter Sprecher fragt in diesem Fall nach und merkt es sich für den Termin. Eine gespeicherte Stimme fragt nicht, und deshalb tritt an die Stelle der Nachfrage eine Liste.
| Sorte | Was regelmäßig schiefgeht | Was je Eintrag in die Liste gehört |
|---|---|---|
| Produkt- und Markennamen | Die Stimme liest nach deutschen Leseregeln oder betont die falsche Silbe | Eine Behelfsschreibung, die der Lesart folgt, dazu die betonte Silbe |
| Abkürzungen | Mal buchstabiert, mal als Wort gelesen, gelegentlich beides in einem Video | Die Entscheidung je Abkürzung, buchstabiert oder gelesen |
| Zahlen, Datum und Uhrzeit | Ein Datum in Ziffern wird zur Bruchzahl, eine Uhrzeit zum Zahlenpaar | Die ausgeschriebene Form, so wie sie gesprochen werden soll |
| Maßeinheiten | Die Einheit wird als Buchstabenfolge gelesen statt als Wort | Die volle Bezeichnung im Text, Kurzformen nur in der Bildeinblendung |
| Personen- und Ortsnamen | Falsche Silbe betont, besonders bei Nachnamen und bei Ortsteilen | Eine Behelfsschreibung, von der genannten Person selbst abgenommen |
Diese Liste ist die einzige Arbeit an einer synthetischen Stimme, die sich über Jahre auszahlt. Jeder Eintrag wirkt in jedem künftigen Video, auch in denen, die eine andere Abteilung erzeugt. Dazu gehört eine Zuständigkeit mit Namen. Ohne sie pflegt die Liste beim ersten Mal jemand aus dem Vorhaben und danach niemand, und ein Vierteljahr später korrigiert eine zweite Person dieselben Wörter noch einmal von Hand.
Zwei Listen werden dabei regelmäßig verwechselt. Die Aussprachetabelle regelt, wie ein Wort klingt. Das Glossar der Übersetzung regelt, welches Wort in einer anderen Sprache steht. Beide gehören verschiedenen Personen und werden zu verschiedenen Zeitpunkten gepflegt. Wie das Glossar entsteht, steht auf der Seite zum mehrsprachigen KI-Avatar.
Die Prüfung dauert je Video wenige Minuten. Hören Sie das fertige Stück einmal ganz, ohne den Text mitzulesen, und notieren Sie jede Stelle, an der Sie stutzen. Hören Sie es danach mit einem Ausdruck in der Hand und ordnen Sie jede Stelle einer von drei Ursachen zu, also Aussprache, Betonung oder Tempo. Was in die erste Gruppe fällt, wandert in die Liste. Was in die anderen beiden fällt, ändert der Text.

Der Sprechervertrag, und was bei einer hinterlegten Stimme dazukommt
Medium, Gebiet und Dauer bleiben. Zweck, Sperre und Rückgabe kommen hinzu.
Ein Sprecherhonorar ist im Markt üblicherweise zweigeteilt, nämlich in die Aufnahme selbst und in die Nutzung. Die Nutzung wird nach Medium, Gebiet und Dauer eingeräumt, weshalb ein Werbespot mehr kostet als eine interne Schulung, obwohl beide gleich lang sind. Diese drei Größen bleiben auch bei einer hinterlegten Stimme sinnvoll. Sie reichen dort nicht mehr aus, weil die Aufnahme nicht mehr feststeht.
| Regelungspunkt | Übliche Fassung bei einer Buchung | Was bei einer hinterlegten Stimme dazugehört |
|---|---|---|
| Medium | Die Kanäle, in denen die Aufnahme laufen darf | Die Aufzählung wird länger, weil neue Kanäle ohne neue Aufnahme bedient werden |
| Gebiet und Sprache | Meist ein Land und eine Sprache | Übersetzungsfassungen sind eine eigene Nutzung und gehören ausdrücklich geregelt |
| Dauer | Eine Laufzeit, danach Verlängerung gegen Honorar | Zusätzlich eine Frist für die Löschung des Modells, mit Nachweis |
| Vergütung | Aufnahme und Nutzung getrennt ausgewiesen | Eine Regel für Sätze, die erst nach dem Termin entstehen |
| Textänderungen | Eine Nachbuchung mit Termin und Mindestbetrag | Technisch keine Hürde, weshalb der Zweck die Grenze setzt statt des Kalenders |
| Sperre und Rückgabe | Kommt nicht vor, weil die Aufnahme unveränderlich vorliegt | Eine benannte Stelle, die die Stimme innerhalb eines Tages abschaltet |
Der wichtigste dieser Punkte ist der Zweck, und er ist zugleich der unbequemste. Wer seine Stimme hergibt, will wissen, was sie künftig sagt. Eine Einwilligung, die alle Zwecke des Unternehmens umfasst, beantwortet das nicht und wird spätestens beim ersten heiklen Video zum Streit. Tragfähig ist eine kurze Aufzählung erlaubter Textsorten mit einigen ausdrücklich ausgenommenen Fällen.
- Erlaubt sind zum Beispiel Produkterklärungen, Unterweisungen, Ansagen und interne Mitteilungen ohne Personenbezug.
- Ausgenommen sind politische Aussagen, Werbung für Dritte und alles, was eine personelle Entscheidung mitteilt.
- Ausgenommen ist außerdem jede Aussage, die die Person mit einer Zusage bindet, also Preise, Fristen und Kulanz.
- Für alles, was nicht in der Aufzählung steht, entscheidet die Person selbst, und zwar vor der Ausgabe.
Rechtlich ist die Lage bei der Stimme weniger geordnet als beim Bild. Die Aufnahme ist eine Verarbeitung personenbezogener Daten, und bei Beschäftigten ist die Einwilligung nach Artikel 6 Absatz 1 Buchstabe a DSGVO der übliche Weg. Sie muss freiwillig sein, was im Beschäftigungsverhältnis begründet werden will. Welche Fragen daran hängen, führt die Seite zum Voice Cloning aus, und was daneben für das Gesicht gilt, steht auf der Seite zum Avatar von mir.
Die Kennzeichnung gilt auch dann, wenn nur die Stimme künstlich ist. Artikel 50 der Verordnung (EU) 2024/1689 nennt Tonaufnahmen ausdrücklich und fragt nicht danach, ob das Bild aus einer echten Aufnahme stammt. Verpflichtet ist, wer veröffentlicht. Bei einem reinen Tonstück gehört die Angabe an die Stelle, an der Hörende sie wahrnehmen, also in die Ansage selbst oder in deren Beschreibung.
Wann ein Mensch am Mikrofon die richtige Wahl bleibt
Fünf Anlässe, bei denen eine bessere Stimme nichts ändert.
Die Frage nach der besseren Stimme setzt voraus, dass eine gespeicherte Stimme für den Anlass überhaupt passt. Das tut sie oft und keineswegs immer. In den fünf folgenden Lagen hilft ein besseres Modell nicht, weil der Einwand nicht an der Klangqualität hängt.
| Anlass | Warum eine hinterlegte Stimme hier nicht trägt | Was stattdessen trägt |
|---|---|---|
| Beileid, Entschuldigung, Krisenmeldung | Gehört werden soll die Tagesform der Person. Eine gleichmäßige Stimme nimmt genau sie zurück | Die Person selbst, notfalls eine Aufnahme mit dem Telefon |
| Werbung mit einer Charakterstimme | Gebucht wird dort eine Eigenart, und die ist der Gegenstand des Auftrags | Der Mensch, mit einem Vertrag über Medium, Gebiet und Dauer |
| Ein einziger Text, Sprecher verfügbar | Aufnahme, Liste und Vertrag kosten mehr Zeit als die Buchung selbst | Eine gewöhnliche Buchung, ohne jede Umstellung |
| Lange Formate über eine Stunde | Die Gleichmäßigkeit fällt mit der Dauer auf und ermüdet beim Zuhören | Ein Mensch, oder ein Wechsel der Stimme je Kapitel |
| Verbindliche Ansagen mit Rechtsfolge | Eine falsch betonte Zahl ist hier keine Unschönheit, sondern eine falsche Auskunft | Ein Mensch, oder die geschriebene Form mit Bestätigung |
Dazu kommt eine sechste Lage, die von der Wirkung unabhängig ist. Fehlt die schriftliche Einwilligung der Person, oder ist unklar, wer die Stimme abschalten darf, dann steht das Vorhaben, gleich wie gut das Ergebnis klingt. Diese Klärung dauert in größeren Häusern mehrere Wochen und gehört vor den Aufnahmetermin.
Eine kurze Regel im Haus beendet die Diskussion dauerhaft. Steht schriftlich, welche Textsorten die hinterlegte Stimme sprechen darf, fällt die Entscheidung künftig in einem Satz. Ohne diese Regel wird sie bei jedem Anlass neu geführt, und zwar von denen, die gerade Zeitdruck haben.

Nächste Schritte
Wohin es von hier weitergeht.
Wenn die Stimme geklärt ist, liegt die nächste Frage beim Bild. Wie der Aufnahmeort eingerichtet wird, steht auf der Seite zum eigenen Avatar. Was ein sprechendes Kopfbild leistet, steht auf der Seite zum Talking Head Avatar. Wer die Videos insgesamt vergeben will, findet den Ablauf auf der Seite zur KI-Video-Produktion.
Vor einer Anbieterauswahl hilft die Prüfliste auf der Seite zu den Kriterien der Agenturauswahl, und die Posten einer Rechnung stehen auf der Seite zu den KI-Avatar-Preisen. Den Überblick über das Feld bietet der Überblick zu KI-Avataren. Ob sich eine eigene Stimme bei Ihrem Aufkommen trägt, lässt sich in einer halben Stunde klären.
Häufige Fragen zu digitalen Sprechern
Was ist ein digitaler Sprecher?
Eine gespeicherte Stimme, die aus geschriebenem Text eine Tonspur erzeugt. Sie entsteht aus der Aufnahme einer echten Person oder stammt aus der Bibliothek eines Anbieters. Eine Bibliotheksstimme ist lizenziert und sofort einsetzbar, klingt aber nach niemandem aus Ihrem Haus. Eine eigene Stimme kostet einen Aufnahmetermin und einen Vertrag und trägt danach Wiedererkennung über alle Videos hinweg.
Welcher digitale Sprecher klingt am natürlichsten?
Die Frage entscheidet sich seltener am Anbieter als am Text. Zwischen den gepflegten Diensten liegen im Deutschen kleine Abstände, und sie verschwinden hinter dem Unterschied zwischen gesprochenem und geschriebenem Satzbau. Prüfen Sie mit einem eigenen Absatz aus einem laufenden Vorhaben, mit zwei Produktnamen, einer Zahl und einer Abkürzung.
Ersetzt ein digitaler Sprecher einen professionellen Sprecher?
Er übernimmt vier von sechs Teilen der Leistung, nämlich Klangfarbe, technische Aufnahme, Verfügbarkeit und gleichbleibende Qualität. Die Interpretation übernimmt er nicht, und die Rechtefrage wird größer statt kleiner. Wer die Buchung streicht und niemanden benennt, der künftig Betonung und Aussprache verantwortet, bekommt eine schnelle Tonspur, die flach klingt.
Wie bekomme ich Betonung in eine synthetische Stimme?
Über den Satzbau, und erst danach über die Oberfläche. Die Modelle leiten die Melodie aus der Wortstellung ab, weshalb ein Satz mit drei Nebensätzen gleichförmig klingt. Wirksam sind drei Griffe, nämlich kürzere Hauptsätze, ein Punkt dort, wo im Geschriebenen ein Komma stünde, und Zahlen, die allein in einem Satz stehen. Steuerzeichen für Pausen helfen zusätzlich und gehen beim Wechsel des Anbieters verloren.
Wie bringe ich einem digitalen Sprecher unsere Produktnamen bei?
Mit einer Aussprachetabelle, die einmal entsteht und danach für jedes weitere Video gilt. Je Eintrag gehören zwei Angaben hinein, nämlich eine Behelfsschreibung, die der Lesart folgt, und die betonte Silbe. Wichtiger als das Format ist die Zuständigkeit, denn ohne eine benannte Person pflegt die Liste beim ersten Mal jemand und danach niemand.
Wie spricht ein digitaler Sprecher Abkürzungen und Zahlen aus?
So, wie es im Text steht, und deshalb im Zweifel falsch. Eine Abkürzung wird mal buchstabiert und mal als Wort gelesen, gelegentlich beides im selben Video. Ein Datum in Ziffern wird zur Bruchzahl. Zuverlässig ist die ausgeschriebene Form im Text, also der dritte Juni statt der Ziffernfassung. Was mehrfach vorkommt, wandert in die Aussprachetabelle.
Digitale Sprecher für Produktvideos, wenn sich der Text monatlich ändert
Das ist der Fall, in dem sich die Umstellung am deutlichsten rechnet. Bei einer Buchung kostet ein geändertes Wort eine Nachbuchung, oft mit Mindestbetrag und mit Wartezeit auf den nächsten freien Termin. Mit einer hinterlegten Stimme wird der betroffene Abschnitt neu ausgegeben, während der Rest unverändert bleibt. Voraussetzung ist ein Schnitt in Abschnitten.
Was kostet ein digitaler Sprecher im Vergleich zu einer Buchung?
Die beiden Wege haben verschiedene Kostenformen, weshalb ein Vergleich über Stundensätze in die Irre führt. Eine Buchung ist ein Betrag je Aufnahme und je Nutzung. Eine hinterlegte Stimme kostet einmalig Aufnahme und Vertrag, danach einen laufenden Tarif und die Pflege der Liste. Ab welcher Zahl von Videos im Jahr sich das dreht, hängt an Ihrem Aufkommen. Die Posten stehen auf der Seite zu den KI-Avatar-Preisen.
Wem gehört die Stimme, wenn wir sie einmal aufgenommen haben?
Die Aufnahme gehört dem, der sie bezahlt, die Stimme selbst niemandem. Geregelt wird deshalb die Nutzung, und zwar nach Medium, Gebiet und Dauer wie in einem gewöhnlichen Sprechervertrag. Neu ist der Zweck, denn eine hinterlegte Stimme sagt künftig Sätze, die bei der Aufnahme niemand kannte. Diese Grenze gehört ins Papier, sonst zieht sie später die Person, die gerade ein Video braucht.
Was passiert mit meiner Stimme, wenn ich das Haus verlasse?
Ohne Regelung spricht sie weiter. Drei Punkte gehören deshalb vor die Aufnahme. Eine benannte Stelle kann die Stimme innerhalb eines Tages sperren. Eine Frist regelt die Löschung des Modells, mit Nachweis. Und es steht fest, ob veröffentlichte Videos weiterlaufen dürfen. Die rechtliche Seite behandelt die Seite zum Voice Cloning.
Muss der Betriebsrat beteiligt werden, wenn wir die Stimme einer Mitarbeiterin aufnehmen?
Die Aufnahme allein löst die Mitbestimmung nach Paragraf 87 Absatz 1 Nummer 6 Betriebsverfassungsgesetz nicht aus, weil ein Stimmmodell niemanden überwacht. Sie greift, sobald der spätere Einsatz Rückschlüsse auf Verhalten oder Leistung erlaubt. In der Praxis wird der Betriebsrat auch dort früh beteiligt, wo die Frage offen ist, weil eine späte Klärung den Aufnahmetermin wiederholt.
Muss ein Video gekennzeichnet werden, in dem nur die Stimme synthetisch ist?
Ja. Artikel 50 der Verordnung (EU) 2024/1689 nennt Tonaufnahmen ausdrücklich und fragt nicht danach, ob das Bild echt ist. Verpflichtet ist, wer veröffentlicht. Praktisch genügt ein Satz in der Beschreibung und ein Hinweis im Abspann. Ein reines Tonstück braucht die Angabe dort, wo Hörende sie wahrnehmen können.
Können wir denselben digitalen Sprecher für Telefonansagen verwenden?
Technisch ja, und es ist einer der ruhigsten Fälle, weil Ansagen kurz sind und selten Anteilnahme tragen. Prüfen Sie zwei Punkte. Eine Telefonanlage ist ein eigenes Medium und steht in Sprecherverträgen oft nicht drin. Und Telefonie überträgt einen schmalen Frequenzbereich, in dem manche Stimmen deutlich flacher wirken als im Video.
Zum Mitnehmen
- Eine Sprecherbuchung besteht aus sechs Leistungsteilen. Vier lassen sich hinterlegen, die Interpretation wandert an den Schreibtisch und die Rechtefrage wird größer.
- Betonung entsteht im Satzbau. Ein umgestellter Satz wirkt stärker als jeder Regler und bleibt beim Wechsel des Anbieters erhalten.
- Die Aussprachetabelle für Produktnamen, Abkürzungen und Zahlen ist die einzige Arbeit an einer synthetischen Stimme, die sich über Jahre auszahlt.
- Ein Sprechervertrag regelt Medium, Gebiet und Dauer. Bei einer hinterlegten Stimme kommen der Zweck, eine Sperrmöglichkeit und eine Rückgabefrist hinzu.
- Eine hinterlegte Stimme trägt keine Tagesform. Das ist der Gewinn bei zwölf Unterweisungen und der Verlust bei einer Nachricht, die Anteilnahme braucht.
- Wer die Stimme einer Beschäftigten hinterlegt, klärt vorher Zweck, Sperre und Frist. Diese Klärung dauert Wochen und steht in Zeitplänen am seltensten.
Ihre Textsorten, in einer halben Stunde sortiert
Bringen Sie die Videos und Ansagen eines Jahres mit, grob nach Anlass geordnet. Wir sagen Ihnen, welche davon eine hinterlegte Stimme sprechen kann und für welche ein Mensch am Mikrofon bleibt. Wenn der hinterlegbare Teil zu klein ist, sagen wir das, auch wenn daraus kein Auftrag wird.
Termin vereinbaren
Wählen Sie einen Zeitpunkt, der Ihnen passt. Das Gespräch dauert dreißig Minuten und findet als Videokonferenz statt.
Die Terminbuchung läuft über Calendly. Beim Laden des Kalenders werden Daten an Calendly übertragen, unter anderem Ihre IP-Adresse. Näheres in der Datenschutzerklärung.
Anfrage stellen
Wenn Ihnen ein Termin zu früh ist, schildern Sie hier kurz Ihr Vorhaben. Sie bekommen eine Einschätzung, ob sich die Rechnung bei Ihrem Aufkommen trägt.
Ihre Anfrage ist angekommen. Wir melden uns in der Regel am selben Werktag.
Die Anfrage ließ sich nicht zustellen. Schreiben Sie uns bitte an info@aidentical.de.
AIdentical Redaktion, Video- und Avatarproduktion der sensified AI GmbH. Die Angaben zum Ablauf sind Richtwerte aus eigenen Vorhaben und keine zugesagten Werte. Wo eine Zahl steht, steht ihre Herkunft daneben. Rechtsauskunft ist diese Seite nicht. Stand August 2026. Mehr zur Redaktion
Die auf dieser Seite gezeigten Bilder sind ganz oder teilweise künstlich erzeugt. Kennzeichnung nach Artikel 50 der Verordnung (EU) 2024/1689. Weitere Angaben unter Transparenz.
Textsorten sortieren lassen30 Minuten, ohne Vorbereitung