Start / Anbietervergleich

Vergleich

Tavus und wir, entlang der veröffentlichten Unterlagen

Bei einem sprechenden Avatar wird über die Antwortzeit gestritten, und für diese Zeit gibt es keine veröffentlichte Messvorschrift. Diese Seite trägt zusammen, was am 17. August 2026 in den Unterlagen von Tavus stand, mit Fundstelle und Abrufdatum, und beantwortet dieselben Fragen für uns. An zwei Stellen fällt die Antwort für uns schlechter aus.

AIAIdentical Redaktion17. August 202622 Minuten
Monitor auf einem Schreibtisch zeigt eine sprechende Person mit Chatfenster, davor eine Person an der Tastatur
Wie schnell ein Avatar antwortet, entscheidet sich an einer Messvorschrift, die niemand veröffentlicht hat.
Beispielrechnung, keine Kundenreferenz

Alle Angaben zu Tavus stammen aus veröffentlichten Unterlagen des Anbieters, abgerufen am 17. August 2026. Eigene Messungen im Produkt liegen dieser Seite nicht zugrunde: Nummer 4.2 Buchstabe g der Nutzungsbedingungen und Nummer 4.15 der Nutzungsrichtlinie untersagen den Zugriff auf den Dienst zum Aufbau eines ähnlichen oder konkurrierenden Angebots. Ein ausdrückliches Verbot von Vergleichen enthalten die Werke nicht. Preise ändern sich am schnellsten, wir sehen sie monatlich nach, Vertrags- und Registerangaben zum Quartal. Wer eine Entscheidung darauf stützt, sollte die genannten Seiten selbst öffnen.

Kurz beantwortet

Für die Strecke vom Ende Ihrer Äußerung bis zum Beginn der Antwort veröffentlicht Tavus in der Produktdokumentation keine Zahl. Die eine Zahl auf der Glossarseite nennt weder Messvorschrift noch Stichprobe, die übrigen Werte messen einzelne Glieder der Kette. Verarbeitet wird in den Vereinigten Staaten, alle dreiundzwanzig Unterauftragsverarbeiter tragen diesen Ort, im Verzeichnis des US-Handelsministeriums steht kein Eintrag. Die Bedingungen der Selbstbedienung räumen eine unbefristete Lizenz an Kundeninhalten ein, die Enterprise-Fassung nicht, und Nummer 4.16 der Nutzungsrichtlinie untersagt dem Kunden Hochrisiko-Anwendungen wie die Vorauswahl von Bewerbern. Unser Verarbeitungsort hängt am Auftrag, ein Zertifikat nach ISO 27001 haben wir nicht.

Woraus diese Seite gemacht ist

Aus veröffentlichten Unterlagen mit Nummer und Abrufdatum. Nicht aus eigenen Messungen, und dafür gibt es einen vertraglichen Grund.

Eine Seite, die einen Wettbewerber beim Namen nennt, ist vergleichende Werbung. Erlaubt ist sie unter Bedingungen: Verglichen werden dürfen nur Eigenschaften, die objektiv, wesentlich, relevant, nachprüfbar und für die Leistung typisch sind. Nachprüfbar heißt dabei nicht „zutreffend abgeschrieben“, sondern dass ein Dritter die Angabe selbst überprüfen oder überprüfen lassen kann. An dieser Hürde scheitert bei einem Thema wie Antwortgeschwindigkeit fast jede Zahl, und deshalb steht auf dieser Seite keine.

Eigene Messungen liegen dieser Seite nicht zugrunde. Ein ausdrückliches Verbot von Vergleichen, wie es andere Anbieter in ihre Bedingungen schreiben, enthalten die Werke von Tavus nicht. Untersagt ist etwas anderes, und es trifft uns genauso: Nummer 4.2 Buchstabe g der Nutzungsbedingungen verbietet den Zugriff auf den Dienst, um ein ähnliches oder konkurrierendes Angebot aufzubauen. Wortgleich steht das in den Enterprise-Bedingungen, und die Nutzungsrichtlinie nimmt es in Nummer 4.15 noch einmal in den Katalog der untersagten Handlungen auf. Wir betreiben ein Angebot derselben Gattung. Ein Konto, das wir eröffnen, um daraus eine Zahl für die eigene Vermarktung zu gewinnen, fiele darunter.

Was hier ebenfalls nicht steht, ist eine Bewertung der Rechtmäßigkeit fremder Verarbeitung. Ob ein Einsatz der Datenschutz-Grundverordnung entspricht, hängt vom konkreten Verantwortlichen und vom konkreten Zweck ab. Es ist keine Eigenschaft eines Werkzeugs, und niemand kann es einem Werkzeug ansehen.

Zwei Abschnitte fallen gegen uns aus, und sie stehen an ihrer Stelle und nicht im Kleingedruckten. Bei den Prüfnachweisen hat Tavus einen SOC-2-Bericht und wir haben keinen. Beim Mitschnitt landet die Aufnahme bei Tavus im Speicher des Kunden, was eine saubere Bauweise ist. Wer eine Vergleichsseite schreibt, auf der der Verfasser in jeder Zeile gewinnt, hat keine Vergleichsseite geschrieben.

Der Maßstab ist einfach: Was hier über Tavus steht, könnte Tavus selbst nachlesen und wiedererkennen. Was über uns steht, halten wir in derselben Tiefe aus.

Was Latenz bei einem sprechenden Avatar überhaupt misst

Drei verschiedene Strecken tragen denselben Namen. Wer sie durcheinanderbringt, vergleicht Zahlen, die nichts miteinander zu tun haben.

Wenn in einem Angebot eine Millisekundenzahl steht, lohnt die erste Rückfrage nicht dem Wert, sondern der Strecke. Bei einem sprechenden Avatar gibt es mindestens drei, und sie unterscheiden sich um Größenordnungen.

Drei Strecken, die im Sprachgebrauch alle „Latenz“ heißen
Strecke Was gemessen wird Wovon sie abhängt
Sitzungsaufbau Vom Klick auf „Gespräch starten“ bis zum ersten Bild Bereitstellung der Rechenleistung, Verbindungsaufbau, Laden des Modells. Tavus führt dafür eine eigene Dokumentationsseite mit dem Titel „Reducing Join Latency“, trennt die Größe also selbst ab
Äußerungsgrenze Vom Ende Ihres Satzes bis zum Beginn der Antwort Die gesamte Kette aus Wahrnehmung, Sprecherwechsel, Spracherkennung, Sprachmodell, Sprachsynthese, Bildberechnung und Übertragung
Einzelschritt Die Dauer eines Glieds der Kette, etwa der Wissensabfrage Nur das eine Glied. Für die erlebte Antwortzeit sagt der Wert nichts, solange die übrigen Glieder unbekannt sind

Tavus benennt die mittlere Strecke selbst und nennt sie „utterance-to-utterance“, die Strecke von Äußerung zu Äußerung. Das ist die für ein Gespräch richtige Größe, denn sie beschreibt die Pause, die Ihr Gegenüber tatsächlich erlebt. Die Dokumentation beschreibt die Kette in dieser Reihenfolge: Wahrnehmung, Gesprächsfluss, Spracherkennung, Sprachmodell, Sprachsynthese, Echtzeit-Darstellung, übertragen über WebRTC.

Person am Schreibtisch in einer Videokonferenz mit vielen zugeschalteten Teilnehmern
Die Pause, die zählt, ist die zwischen Ihrem letzten Wort und dem ersten der Antwort.

Eine Latenzangabe ohne Angabe der Strecke ist keine Angabe. Sie ist eine Zahl, die sich jeder so zurechtlegen kann, wie es passt.

Was Tavus zur Latenz veröffentlicht, und was nicht

In der Produktdokumentation keine Zahl für die Gesamtstrecke. Eine Zahl auf einer Glossarseite, ohne Messvorschrift.

Das ist der Befund, der uns beim Prüfen am meisten überrascht hat. Die Übersichtsseite zum Gesprächsrahmen nennt die Messgröße ausdrücklich und lässt die Zahl weg. Sie sagt, man erreiche eine niedrige Latenz von Äußerung zu Äußerung, und beschreibt diese als den vollständigen Umlauf von dem Moment, in dem ein Teilnehmer spricht, bis zu dem, in dem der Agent antwortet. Daneben steht eine Karte mit der Überschrift „World’s lowest latency“. Eine Suche über den vollständigen Volltextabzug der Dokumentation, gut eine Million Zeichen, ergibt für „600“, „sub-600“ und „under 600“ keinen Treffer.

Eine Zahl für die Gesamtstrecke gibt es, und sie steht an genau einer Stelle: auf einer Glossarseite im Marketingbereich. Dort heißt es, die vollständige Kette laufe über WebRTC mit weniger als sechshundert Millisekunden von Äußerung zu Äußerung. Der Bezugspunkt ist damit immerhin sauber benannt. Was fehlt, ist alles, was die Zahl nachprüfbar machen würde: die Messvorschrift, die Serverregion, die Wahl des Sprachmodells, die Netzannahme, die Stichprobe und die Angabe, ob es sich um einen Mittelwert oder um ein Streuungsmaß handelt.

Die übrigen veröffentlichten Zahlen betreffen einzelne Schritte. Sie sind einprägsamer als die Zahl, die fehlt, und werden deshalb gern an ihre Stelle gesetzt. Das ist der häufigste Fehler in Texten über Gesprächs-Avatare.

Veröffentlichte Zahlen nach Strecke, Stand 17. August 2026
Angabe Was sie misst Fundstelle
unter 100 ms Wahrnehmung von Stimmung aus dem Tonsignal durch das Wahrnehmungsmodell Änderungsverzeichnis der Dokumentation
höchstens 300 ms Alter des Wahrnehmungskontexts, also wie veraltet die Einschätzung der Lage höchstens sein darf Beitrag zur Sicherheit von Gesprächs-KI, 1. Juni 2026
55 ms im Mittelwert Vorhersage, wann der Mensch aufhört zu sprechen, an achtundzwanzig eigenen Gesprächsbeispielen derselbe Beitrag
rund 30 ms Abruf aus der Wissensbasis, nach Anbieterangabe derzeit nur englischsprachig derselbe Beitrag und die Fragensammlung der Dokumentation
keine Angabe die Gesamtstrecke von Äußerung zu Äußerung in der Dokumentation nicht enthalten

Wer diese vier Werte addiert, kommt auf etwas unter fünfhundert Millisekunden und liegt damit scheinbar nahe an der Glossarzahl. Die Rechnung ist trotzdem falsch, denn in ihr fehlen Spracherkennung, Sprachmodell, Sprachsynthese, Bildberechnung und Übertragung, also gerade die Schritte, die in jeder solchen Kette am längsten dauern. Zwei der vier Werte laufen zudem nebenher und nicht hintereinander.

Ein Negativbefund ist auch ein Befund, solange die Suchmethode dabei steht. Hier lautet er: In gut einer Million Zeichen Dokumentation steht keine Zahl für die Strecke, die ein Gespräch ausmacht.

Der menschliche Maßstab, und was er nicht hergibt

208 Millisekunden im Mittel, 100 im Median, null am häufigsten. Und 462 Millisekunden Abstand zwischen zwei Sprachen, die beide als unauffällig gelten.

Die einschlägige Arbeit stammt von Tanya Stivers und dreizehn Mitautoren, erschienen 2009 in den Proceedings of the National Academy of Sciences unter dem Titel „Universals and cultural variation in turn-taking in conversation“. Sie wird in Anbietertexten häufig zitiert und dabei fast immer falsch, weshalb wir sie im Volltext gegengelesen haben.

Die Arbeit nennt drei Lagemaße, und sie liegen weit auseinander. Der häufigste Wert liegt bei null Millisekunden, Antwort und Frage stoßen also unmittelbar aneinander. Der sprachübergreifende Median liegt bei plus hundert Millisekunden. Der Mittelwert über den gesamten Datensatz liegt bei 208 Millisekunden. Wer 200 Millisekunden als Median angibt, wie es in vielen Texten steht, verwechselt Mittelwert und Median.

Stivers u.a., PNAS 106(26), 2009, Seiten 10587 bis 10592
Lagemaß Wert Bedeutung
Häufigster Wert 0 ms Antwort schließt unmittelbar an, ohne hörbare Pause
Median über zehn Sprachen +100 ms Die Hälfte aller Antworten kommt schneller
Mittelwert über den Datensatz 208 ms Durch einzelne lange Pausen nach oben gezogen
Langsamste Sprache im Mittel 469 ms (Dänisch) Gilt als unauffälliges menschliches Verhalten
Schnellste Sprache im Mittel 7 ms (Japanisch) Gilt ebenso als unauffällig

Ebenso wichtig ist, was die Arbeit gemessen hat. Grundlage sind Videoaufnahmen ungezwungener Gespräche in zehn Sprachen von fünf Kontinenten, und der Vergleich ist aus Gründen der Vergleichbarkeit auf Entscheidungsfragen beschränkt, also auf Fragen, die ein Ja oder Nein erwarten. Gemessen wird der Abstand zwischen dem Ende der Frage und dem Beginn der Antwort, wobei negative Werte eine Überlappung bedeuten.

Daraus folgt, dass menschliche Sprecherwechsel im Bereich von null bis wenigen hundert Millisekunden stattfinden und dass diese Größenordnung über sehr verschiedene Sprachen hinweg erstaunlich stabil ist. Es folgt ein brauchbarer Maßstab für die Frage, ob eine Maschine überhaupt im Bereich menschlicher Gesprächsdynamik arbeitet. Nicht daraus folgt, dass ein System mit 208 Millisekunden menschlich wirkt und eines mit sechshundert nicht. Die Arbeit ist keine Messvorschrift für Maschinen, sie enthält keine Schwelle, ab der ein Gespräch als natürlich empfunden wird, und die Streuung zwischen zwei unauffälligen Sprachen ist größer als der Abstand, um den im Anbietermarketing gestritten wird.

Zwischen dem dänischen und dem japanischen Mittelwert liegen 462 Millisekunden. Beides sind Menschen, und beiden hört man zu.

Warum eine schnelle Antwort noch keine gute ist

Die Werkseinstellung senkt die gemessene Zeit, indem das Modell anfängt, bevor Sie fertig sind. Und ein Regler verschiebt zwei Eigenschaften gegeneinander.

In der Dokumentation zur Sprachmodellschicht steht ein Schalter für spekulatives Schließen, ab Werk eingeschaltet. Die Beschreibung ist offen und ehrlich: Bei eingeschaltetem Schalter beginne das Sprachmodell mit der Verarbeitung der Spracherkennung, bevor die Eingabe des Nutzers endet, was die Reaktionsfähigkeit verbessere. Das ist keine Schummelei, sondern ein üblicher und sinnvoller Kniff. Es erklärt aber, wie eine Zahl unterhalb der menschlichen Reaktionszeit überhaupt zustande kommt, und es zeigt, woran sie hängt.

Denn eine Vorwegnahme kann falsch liegen. Wenn sie falsch liegt, entsteht keine langsamere Antwort. Es entsteht eine Antwort auf eine Frage, die so nicht gestellt wurde. Für den Menschen davor ist das unangenehmer als eine Pause, weil er die Antwort erst prüfen muss, bevor er merkt, dass sie nicht passt.

Noch deutlicher wird der Zielkonflikt bei einem zweiten Regler. Die Dokumentation zum Gesprächsfluss beschreibt einen Wert dafür, wie bereitwillig der Agent das Wort ergreift, und hält dazu ausdrücklich fest, dass er auf zweierlei zugleich wirkt: auf die Antwortlatenz und auf die Wahrscheinlichkeit, in eine natürliche Sprechpause hineinzureden. Beides läuft gegeneinander. Wer die Zahl verbessert, verschlechtert die Gesprächsführung, und umgekehrt.

Derselbe Regler, zwei gegenläufige Wirkungen
Wenn Sie einstellen auf … gewinnen Sie verlieren Sie
schnelles Ergreifen des Worts eine kleinere Zahl in der Messung Ruhe in Denkpausen. Der Agent fällt ins Wort, wenn jemand nachdenkt oder eine Zahl nachschlägt
zurückhaltendes Ergreifen ein Gespräch, das Pausen aushält eine größere Zahl in der Messung, auch wenn das Erlebnis besser ist

Für einen Vergleich heißt das: Zwei Systeme mit derselben Latenzzahl können sich völlig unterschiedlich anfühlen, und dasselbe System fühlt sich je nach Einstellung unterschiedlich an. Eine Zahl, die sich durch einen Regler verschieben lässt, taugt nicht als Eigenschaft eines Produkts.

Eine schnelle falsche Antwort ist teurer als eine langsame richtige. Diesen Satz können wir schreiben, ohne über irgendeinen Anbieter etwas zu behaupten.

Was sich am Gesprächsverhalten einstellen lässt

Die am besten dokumentierte Achse, und für ein Gespräch die wichtigere. Mit zwei Einzelheiten, die man vor der Einführung kennen sollte.

Wenn eine Latenzzahl nichts über Gesprächsqualität sagt, stellt sich die Frage, woran man sie sonst festmacht. Die Antwort steht in der Dokumentation zum Gesprächsfluss, und sie ist nachprüfbar, weil sie aus Einstellwerten besteht und nicht aus Versprechen.

Einstellwerte nach der Dokumentation zum Gesprächsfluss
Einstellung Was sie steuert
Modell für den Sprecherwechsel Welches Verfahren erkennt, dass der Mensch fertig ist
Bereitschaft zum Wortergreifen Antwortlatenz und Neigung, in Pausen hineinzureden, zugleich
Unterbrechbarkeit Ob und wie sich der Agent im laufenden Satz stoppen lässt
Stimmentrennung Trennung des Sprechers von Nebengeräuschen und weiteren Stimmen
Weck- und Schlafwort Aktivierung und Stummschaltung über ein Schlüsselwort
Verhalten in Sprechpausen Was der Agent tut, wenn niemand spricht

Zwei Einzelheiten aus derselben Dokumentation sind für die Einführung in einem Unternehmen wichtiger als die ganze Liste, und beide stehen dort offen. Erstens hört der Agent auch im Schlafzustand mit: Alle Äußerungen werden nach der Beschreibung im Gesprächsprotokoll festgehalten, damit der Zusammenhang beim Aufwecken vollständig ist. Zweitens ist die Begrüßung nicht unterbrechbar. Was während der Begrüßung gesagt wird, erscheint nicht im Protokoll, aber die Dokumentation hält im selben Absatz fest, dass das Mikrofon offen bleibt und das Gesagte in Aufzeichnungen des Gesprächs enthalten ist.

Das ist keine Kritik, sondern eine Eigenschaft, die man kennen muss. Wer einen solchen Agenten an einem Empfangstresen oder in einem Besprechungsraum aufstellt, hat ein offenes Mikrofon in einem Raum, in dem Menschen miteinander reden. In Deutschland führt das zu Anforderungen an Aufklärung und Einwilligung, die bei einem reinen Textdialog nicht in dieser Form entstehen. Paragraf 201 des Strafgesetzbuchs schützt die Vertraulichkeit des nichtöffentlich gesprochenen Worts, und der Schutz hängt nicht daran, ob eine Aufnahme später gespeichert wird.

Zu Rückmeldesignalen, also den kurzen Einwürfen, mit denen Menschen signalisieren, dass sie noch zuhören, haben wir keine Aussage gefunden. Eine Suche über den Volltextabzug nach dem einschlägigen Fachbegriff ergibt keinen Treffer. Daraus folgt nicht, dass es das Verhalten nicht gibt; es folgt nur, dass es nicht dokumentiert ist.

Monitor auf einem Schreibtisch zeigt eine sprechende Person mit Chatfenster, davor eine Person an der Tastatur
Ein offenes Mikrofon im Raum ist eine organisatorische Frage, bevor es eine technische ist.

Wo die Gespräche verarbeitet werden

Dreiundzwanzig Unterauftragsverarbeiter, bei jedem einzelnen steht als Ort „United States“. Eine wählbare Region haben wir nicht gefunden.

Diese Liste ist der belastbarste Beleg dieser ganzen Seite, weil sie ohne jedes Werturteil auskommt. Sie ist datiert, vom Anbieter selbst veröffentlicht, vollständig und für jeden nachlesbar. Wir geben sie nach Leistung geordnet wieder, die Ordnung ist unsere, die Einträge und die Ortsangaben sind es nicht.

Zugelassene Unterauftragsverarbeiter, Fassung vom 27. April 2026, 23 Einträge
Leistung Genannte Unternehmen Ort nach Anbieterangabe
Rechenleistung und Datenhaltung Google Cloud Platform, Amazon Web Services, Cerebrium, Replicate, Fal, Mithril, Baseten, Modal, OpenAI United States
Spracherkennung Deepgram United States
Sprachsynthese ElevenLabs, Cartesia, InWorld United States
Betrieb der Sprachmodelle Cerebras, Groq United States
Bild und Echtzeitübertragung Daily, Mux United States
Auswertung, Kommunikation, Abrechnung Metabase, Slack, Pylon, Stripe, Orb, Salesforce United States

Eine einzelne Gesprächsminute läuft damit durch mehrere fremde Hände: Sie wird übertragen, in Text überführt, durch ein Sprachmodell geführt, wieder in Sprache gewandelt und als Bild berechnet. Die Liste trägt den Hinweis, dass je nach genutztem Produkt nicht alle Einträge einschlägig sind, was zutreffend und für jede solche Liste üblich ist.

Zur Region: Eine Wahlmöglichkeit oder eine Zusage zur Datenhaltung in der Europäischen Union haben wir in den öffentlichen Unterlagen nicht gefunden. Gesucht haben wir im Volltextabzug der Dokumentation nach den einschlägigen Begriffen; gefunden haben wir dabei einen Vorgabewert für eine US-Region in einem Hilfsskript und die europäischen Sprachen des Spracherkennungsmodells, das Deutsch einschließt. Bemerkenswert ist, dass der eigene Sicherheitsbeitrag des Anbieters Einkäufern rät, schriftliche Zusagen zum Verarbeitungsort zu verlangen, die sowohl die Verarbeitung als auch die Speicherung abdecken.

Ein öffentlicher Auftragsverarbeitungsvertrag ist nicht auffindbar. Die Sitemap führt die Nutzungsbedingungen, die Enterprise-Bedingungen, die Bedingungen für die Website, die Ergänzung für das Verbraucherangebot, die Datenschutzerklärung und die Nutzungsrichtlinie, aber keinen solchen Vertrag. Dass die Liste der Unterauftragsverarbeiter existiert, spricht dafür, dass es ihn gibt; öffentlich ist er nicht. Am Rande: Die Liste selbst steht ebenfalls nicht in der Sitemap. Wer nur der Sitemap folgt, findet das wichtigste Dokument dieses Abschnitts nicht.

Das Verzeichnis des US-Handelsministeriums

Null Treffer bei 7.558 Einträgen. Mit Gegenprobe, damit der Negativbefund etwas wert ist.

Die Datenschutzerklärung in der Fassung vom 12. November 2025 nennt das Data Privacy Framework als eine von mehreren Möglichkeiten, auf die eine Übermittlung gestützt werden kann. Sie behauptet dabei keine eigene Selbstzertifizierung. Genau diese Unterscheidung geht in Vergleichstexten regelmäßig verloren, weil aus der Erwähnung des Rahmens eine Teilnahme daran gelesen wird.

Wir haben deshalb selbst nachgesehen. Abgefragt wurde die Schnittstelle des amtlichen Verzeichnisses am 17. August 2026, mit leerem Statusfilter, damit auch erloschene und zurückgezogene Einträge erfasst werden. Ergebnis: null Treffer bei 7.558 erfassten Einträgen. Damit ein Negativbefund etwas wert ist, braucht er eine Gegenprobe, denn eine Abfrage, die nichts findet, kann auch schlicht kaputt sein. Wir haben im selben Durchlauf nach einem anderen Anbieter gesucht, den wir im Verzeichnis vermutet haben, und genau einen Treffer bekommen. Die Abfrage funktioniert also.

Abfrage der Schnittstelle dpfapi, Suchart „enthält“
Prüfung Ergebnis am 17.08.2026
Suche nach Tavus, Statusfilter leer 0 Treffer
Gegenprobe mit einem anderen Anbieter 1 Treffer
Erfasste Einträge im Verzeichnis insgesamt 7.558

Was daraus folgt, entscheidet Ihr Datenschutzbeauftragter und nicht diese Seite. Wir stellen den Registerbefund hin, nennen Datum und Methode und überlassen Ihnen die Bewertung. Eine Übermittlung in die Vereinigten Staaten ist auf mehrere Wege stützbar, und welcher davon in Ihrem Fall trägt, hängt an Ihrer Verarbeitung.

Ein fehlender Eintrag ist ein Befund, keine Bewertung. Wer daraus eine Rechtsfolge macht, behauptet mehr, als das Register hergibt.

Zwei Vertragswerke, und drei Wörter Unterschied

Wer über die offenen Stufen einkauft, räumt eine unbefristete Lizenz ein. Wer einen Enterprise-Vertrag schließt, nach dem Wortlaut nicht.

Tavus führt zwei Vertragswerke nebeneinander, und sie unterscheiden sich an einer Stelle, die für einen Einkäufer erheblich ist. Beide räumen dem Anbieter eine Lizenz an Kundeninhalten ein, und beide nennen dabei ausdrücklich die Verbesserung der eigenen Produkte als Zweck. Der Unterschied liegt in zwei Beifügungen.

Gegenüberstellung nach dem Wortlaut beider Werke
Punkt Nutzungsbedingungen (24.04.2025) Enterprise-Bedingungen (10.09.2025)
Lizenz zur Produktverbesserung mit Kundeninhalten ja, Nummer 6.5 ja, Abschnitt „License to Tavus“
Unbefristet („perpetual“) ja nicht genannt
Vollständig abgegolten („fully paid“) ja nicht genannt
Verbot, ein konkurrierendes Angebot aufzubauen Nummer 4.2 lit. g Abschnitt „Restrictions“ lit. g
Streitbeilegung Schiedsverfahren, Verzicht auf Sammelklage Gerichtsstand Santa Clara County, Kalifornien
Löschung über den Support, keine Frist in Tagen genannt über den Support, keine Frist in Tagen genannt

Beide Werke enthalten daneben eine Rückmeldeklausel, die dem Anbieter an Vorschlägen und Verbesserungswünschen eine unbefristete und unwiderrufliche Lizenz einräumt. Das ist branchenüblich und betrifft nicht Ihre Inhalte, sondern Ihre Anregungen. Wir nennen es, weil das Wort „perpetual“ darin ebenfalls vorkommt und man es sonst der falschen Klausel zuordnet.

Eine Löschfrist in Tagen steht in keinem der beiden Werke; beide verweisen auf eine Anfrage beim Support. Die Datenschutzerklärung nennt dagegen eine Frist für biometrische Daten, also für Stimmabdruck und Gesichtsgeometrie: Aufbewahrung bis zur Zweckerfüllung oder bis ein Jahr nach der letzten Interaktion, je nachdem, was früher eintritt, mit Löschung auf Verlangen. Für Gesprächsprotokolle aus verbundenen Google-Konten nennt sie bis zu neunzig Tage.

Für die Entscheidung heißt das: Die Frage, ob mit Ihrem Material trainiert werden darf, hat bei diesem Anbieter keine allgemeine Antwort. Sie hat eine Antwort je Vertrag. Wer beim Einkauf über die offene Stufe beginnt und später in einen Enterprise-Vertrag wechselt, sollte klären, was mit dem geschieht, was in der Zwischenzeit hochgeladen wurde.

Zwei Personen sitzen an einem Besprechungstisch vor einem aufgeklappten Laptop
Zwei Vertragswerke desselben Anbieters, und die Antwort auf die Trainingsfrage hängt daran, welches Sie unterschrieben haben.

Was die Nutzungsrichtlinie dem Kunden verbietet

Nummer 4.16 schließt die Nutzung in Hochrisiko-Anwendungen nach der KI-Verordnung aus. Das trifft einen Teil dessen, wofür solche Systeme angeboten werden.

Dieser Abschnitt ist aus unserer Sicht der wichtigste der ganzen Seite, und er hat mit Latenz nichts zu tun. Die Nutzungsrichtlinie in der Fassung vom 14. April 2026 enthält unter Nummer 4.16 eine Grenze, die in Vergleichstexten praktisch nie auftaucht: Der Kunde darf den Dienst nicht in einer Weise nutzen, die nach anwendbarem KI-Recht einschließlich der Verordnung (EU) 2024/1689 als verboten oder als hochriskant eingestuft ist. Derselbe Absatz ergänzt, es sei Sache des Kunden, seine Pflichten nach diesen Gesetzen selbst zu beurteilen.

Das ist keine Rechtsbewertung, die wir vornehmen, sondern eine vertragliche Zusage, die der Kunde gibt. Sie ist deshalb auch nicht verhandelbar über die Frage, ob man die Einstufung teilt. Wer den Dienst so nutzt, verstößt gegen die Richtlinie, unabhängig davon, wie eine Aufsichtsbehörde die Sache später sieht.

Welche Anwendungen darunter fallen, steht in Anhang III der Verordnung. Für ein mittelständisches Unternehmen sind vor allem drei Bereiche einschlägig, und alle drei sind Anwendungsfälle, für die Gesprächs-Avatare angeboten werden.

Nummer 4.16 der Nutzungsrichtlinie in Verbindung mit Anhang III der KI-Verordnung
Anwendung Einordnung nach Anhang III Folge für die Nutzung
Vorauswahl oder Bewertung von Bewerbern Nummer 4 Buchstabe a nach Nummer 4.16 der Nutzungsrichtlinie ausgeschlossen
Entscheidungen über Beförderung oder Beendigung, Zuweisung von Aufgaben nach Verhalten oder Eigenschaften Nummer 4 Buchstabe b ebenso ausgeschlossen
Zugang zu und Anspruch auf öffentliche Leistungen Nummer 5 Buchstabe a ebenso ausgeschlossen
Auskunft, Einarbeitung, Schulung, Produktberatung ohne Bewertung von Personen nicht in Anhang III von der Klausel nicht betroffen

Die frühere Fassung dieser Seite hat genau in diese Lücke hinein geworben. Sie behauptete, ab August 2026 gälten für konversationale Avatare die Vorgaben für Hochrisiko-Systeme, und verkaufte ein lückenloses Prüfprotokoll als Erfüllung dieser Pflicht. Beides war falsch, und wir haben es gestrichen. Richtig ist: Die Protokollierungspflicht steht in Artikel 12 und gehört zu Kapitel III Abschnitt 2, gilt also nur für Hochrisiko-Systeme. Und die Anwendung dieses Abschnitts ist durch die Änderungsverordnung vom 8. Juli 2026 auf den 2. Dezember 2027 verschoben worden. Seit dem 2. August 2026 gilt Artikel 50, und der verlangt Offenlegung, keine Prüfprotokolle.

Eine Pflicht zu erfinden, um ein eigenes Merkmal zu verkaufen, ist genau die Art von Aussage, die auf einer Seite über Regeltreue am wenigsten zu suchen hat.

Wer offenlegen muss, dass die Person nicht echt ist

Die Funktion stellt der Anbieter, die Pflicht trägt der Betreiber. Und die Werkseinstellung greift auf einem der beiden Wege nicht.

Artikel 50 Absatz 1 der KI-Verordnung verlangt, dass Menschen erfahren, wenn sie mit einem KI-System sprechen. Die Pflicht trifft den Betreiber, also Sie, und nicht den Anbieter des Werkzeugs. Tavus sagt das selbst und unmissverständlich: Die Einführungsseite zur KI-Verordnung beginnt mit dem Satz, der Einsatz von Gesprächs-KI in der Europäischen Union liege in der Verantwortung des Kunden. Die Nutzungsrichtlinie wiederholt es als Kundenpflicht, Endnutzern deutlich und an gut sichtbarer Stelle offenzulegen, dass sie mit KI und nicht mit einem Menschen sprechen.

Die Funktionen dafür sind dokumentiert und vorbelegt. Es gibt eine gesprochene und eine eingeblendete Offenlegung mit Vorgabetexten, dazu einen Schalter mit den Stellungen „immer“, „automatisch“ und „aus“, wobei „automatisch“ die Werkseinstellung ist. Genau hier liegt die Einzelheit, die man kennen muss.

Die Stellung „automatisch“ löst den Hinweis nur aus, wenn beim Anlegen des Gesprächs die Regionsangabe auf Europa gesetzt ist. Und die Dokumentation hält ausdrücklich fest, dass Tavus auf dem Weg über die Schnittstelle den Standort des Anrufers nicht ermittelt; der Wert muss übergeben werden. Auf den vom Anbieter selbst betriebenen Oberflächen kann die Region aus der Adresse des Besuchers gesetzt werden, auf dem Weg über die eigene Anwendung nicht.

Offenlegung nach Artikel 50 Absatz 1, nach der Dokumentation
Weg Wer setzt die Regionsangabe Was in der Werkseinstellung geschieht
Vom Anbieter betriebene Oberfläche kann aus der Adresse des Besuchers gesetzt werden Hinweis erscheint bei europäischen Besuchern
Eigene Anwendung über die Schnittstelle Sie, beim Anlegen des Gesprächs ohne Übergabe des Werts erscheint kein Hinweis

Das ist kein Mangel, den man dem Anbieter vorhalten müsste. Es ist eine dokumentierte Verteilung der Verantwortung, und sie ist sauber aufgeschrieben. Für Sie hat sie trotzdem eine Folge: Ein Häkchen in einer Vergleichstabelle bei „Offenlegung vorhanden“ sagt nichts darüber, ob die Offenlegung in Ihrem Aufbau tatsächlich erscheint. Das ist eine Zeile in Ihrem Code, nicht eine Eigenschaft des Produkts.

Zu Absatz 2, also zur maschinenlesbaren Kennzeichnung erzeugter Inhalte, ist der Befund negativ, und wir nennen die Methode dazu. Eine Suche über den Volltextabzug der Dokumentation nach den einschlägigen Begriffen für Herkunftsnachweise ergibt keinen Treffer. Das Wort „Wasserzeichen“ kommt ausschließlich auf der Preisseite vor, und dort in der Gegenrichtung, nämlich als Merkmal der bezahlten Stufen, die es entfernen. Ein sichtbares Wasserzeichen des Anbieters ist eine Markenkennzeichnung und kein Herkunftsnachweis. Für uns selbst haben wir an dieser Stelle ebenfalls nichts vorzuweisen.

Der Mitschnitt, und wo er landet

In Ihrem eigenen Speicher. Eine Bauweise, die wir für richtig halten, mit zwei Fristen und einem offenen Punkt.

Hier fällt der Vergleich zugunsten des Anbieters aus, und das gehört gesagt. Aufzeichnungen landen nach der Dokumentation im Speicher des Kunden, in Amazon S3, Google Cloud Storage oder Azure Blob Storage, über eine Vertrauensbeziehung und ohne dass ein Zugangsgeheimnis an den Anbieter übergeben wird. Wer die Aufnahmen später löschen will, muss dafür niemanden fragen.

Betrieben wird die Aufzeichnung nicht vom Anbieter selbst, sondern über den Dienstleister für die Echtzeitübertragung; die Dokumentation nennt dafür sogar die fremde Kontonummer beim Rechenzentrumsbetreiber, was eine ungewöhnlich offene Angabe ist. Bei fehlgeschlagener Auslieferung bleibt die Aufnahme rund dreißig Tage als Rückholfenster in der Aufzeichnungsinfrastruktur liegen.

Die Datumsangaben stammen aus dem Änderungsverzeichnis. Es führt nur Tagesmarken; die Jahre haben wir aus der durchgehend absteigenden Reihenfolge der zweiundfünfzig Einträge abgeleitet.
Vorgang Angabe nach der Dokumentation Datum der Fundstelle
Ablage der Aufzeichnung im Speicher des Kunden, über eine Vertrauensbeziehung laufend
Rückholfenster bei fehlgeschlagener Auslieferung rund 30 Tage laufend
Endgültige Löschung eines Gesprächs über die Schnittstelle mit einem eigenen Parameter 18. Dezember 2025
Verzicht auf Datenhaltung insgesamt auf Kontoebene und über die Schnittstelle wählbar 26. Juni 2026
Aufbewahrung des Gesprächsprotokolls beim Anbieter nicht auffindbar kein Eintrag

Transkripte laufen über eine Rückrufadresse, die Sie hinterlegen. Nach Gesprächsende schickt der Dienst ein Ereignis mit dem vollständigen Protokoll, inzwischen mit Zeitstempeln je Redebeitrag, und während des Gesprächs gibt es einen laufenden Strom einzelner Äußerungen. Wie lange der Anbieter Protokolle selbst aufbewahrt, haben wir nicht gefunden.

Für die Einführung im eigenen Haus ist der praktische Punkt ein anderer, und er wird über der Frage nach dem Speicherort gern übersehen. Bei einem Sprachdialog entsteht ein Tonsignal, das zwischengespeichert und von Dritten verarbeitet wird, hier von einem benannten Dienstleister für Spracherkennung mit Sitz in den Vereinigten Staaten. Zusammen mit der Eigenschaft, dass das Mikrofon während der Begrüßung und im Schlafzustand offen bleibt, ergibt das eine Lage, die man vor dem ersten Einsatz mit der Datenschutzbeauftragten und, wo es einen gibt, mit dem Betriebsrat bespricht. Nicht danach.

Wie abgerechnet wird, und warum hier keine Beträge stehen

Gesprächsminuten, gleichzeitige Sitzungen und Avatarplätze. Kein Preis je Nutzer, und deshalb auch keine Hochrechnung nach Kopfzahl.

Die frühere Fassung dieser Seite nannte an vier Stellen rund neunundneunzig US-Dollar je Nutzer und Monat und rechnete daraus bei fünfzig Mitarbeitenden etwa sechzigtausend Euro im Jahr. Auf der Preisseite steht dieser Betrag nicht, und einen Preis je Nutzer gibt es dort überhaupt nicht. Die Hochrechnung beschreibt damit nicht ein ungenaues Modell, sondern ein anderes.

Wir nennen an dieser Stelle bewusst keine Beträge, und der Grund gehört dazu, weil er selbst eine Auskunft ist. Die Preisseite führte am Abrufdatum zwei vollständige, einander widersprechende Stufentabellen im Quelltext, einmal mit vier und einmal mit sechs Stufen, mit unterschiedlichen Beträgen und einmal „30+“, einmal „42+ Sprachen“. Beide liegen in der beim Laden geöffneten Registerkarte, keine ist ausgeblendet. Wahrscheinlich läuft ein Umbau oder ein Test. Welche Fassung ausgeliefert wird, konnten wir nicht feststellen, und eine Zahl, bei der wir das nicht können, schreiben wir nicht hin.

Was in beiden Fassungen übereinstimmt, ist die Abrechnungseinheit, und die ist für eine Planung ohnehin wichtiger als der Betrag, weil sie sich langsamer ändert.

  • Abgerechnet werden Gesprächsminuten aus einem Inklusivvolumen, Überschreitung nach Verbrauch.
  • Jedes Gespräch wird mit mindestens dreißig Sekunden belastet, auch wenn es kürzer ist. Bei vielen kurzen Auskünften ist das der Posten, der die Rechnung bestimmt.
  • Je Stufe gilt eine Obergrenze für gleichzeitige Sitzungen. Sie entscheidet darüber, wie viele Menschen zur selben Zeit sprechen können, und nicht das Minutenvolumen.
  • Je Stufe ist eine Anzahl eigener Avatare enthalten, darüber hinaus fällt eine einmalige Pauschale je zusätzlichem Avatar an.
  • Die Wahrnehmungsschicht wird gesondert je Minute berechnet.
  • Gesprächsaufzeichnungen und der Wegfall der Gesprächszeitbegrenzung sind an eine höhere Stufe gebunden. Für einen Einsatz mit Dokumentationspflicht ist das entscheidender als der Grundpreis.

Getrennt davon führt der Anbieter ein Verbraucherangebot mit eigenen Stufen. Dessen ergänzende Bedingungen vom 29. Juli 2026 stellen es ausdrücklich auf die persönliche, nicht gewerbliche Nutzung und bezeichnen es als Erprobungsangebot ohne Gewährleistung, Unterstützung und Freistellung. Für einen betrieblichen Vergleich ist es ohne Belang, und seine Preise dürfen nicht mit den Entwicklerstufen vermischt werden. Genau das passiert in Vergleichstexten häufig, weil beide Tabellen auf derselben Seite liegen.

Prüfnachweise, und wo wir nichts vorzuweisen haben

SOC 2 Type 2 und HIPAA auf der einen Seite. Auf unserer kein Zertifikat, und die frühere Fassung dieser Seite hat das anders dargestellt.

Das Trust Center des Anbieters, im Quelltext mit dem Stand 8. Mai 2026, weist drei Marken aus: SOC 2 Type 2, HIPAA und DSGVO. Genannt werden außerdem jährliche Eindringtests und vierteljährliche Schwachstellenprüfungen. Eine Zertifizierung nach ISO/IEC 27001 ist dort nicht ausgewiesen. Prüfer und Prüfumfang des SOC-2-Berichts sind nicht öffentlich; der Bericht steht hinter einer Anforderung, und der eigene Sicherheitsbeitrag rät Einkäufern, ihn zu verlangen.

Zur Genauigkeit gehört, dass „DSGVO“ keine Zertifizierung im Sinne von Artikel 42 der Verordnung ist. In Trust Centern steht die Marke üblicherweise für eine Selbstauskunft. Wer die drei Marken in einer Zeile nebeneinandersetzt, zieht diesen Unterschied durch die Tabellenform ein, und deshalb steht er hier im Text.

Nun zu uns, und das ist der unangenehme Teil. Die frühere Fassung dieser Seite behauptete eine Zertifizierung nach ISO 27001, an einer Stelle sogar in der Formulierung, die Architektur sei nach ISO 27001 zertifiziert. Sie behauptete ein Architektur-Review nach BSI-Grundschutz, eine vollständige Konformität mit der Datenschutz-Grundverordnung und ein Hosting in deutschen Rechenzentren. Für keine dieser vier Aussagen haben wir ein Dokument.

Vier eigene Aussagen, die dieser Umbau gekostet hat
Aussage der früheren Fassung Warum sie nicht mehr dasteht
„ISO-27001-Zertifizierung“ Ein Zertifikat mit Nummer, Zertifizierungsstelle, Geltungsbereich und Laufzeit liegt nicht vor. Unsere eigene Transparenzseite sagt seit dem 11. August 2026, dass wir eine Zertifizierung nur nennen, wenn sie vorliegt
„Architektur-Review nach BSI-Grundschutz“ Eine Orientierung an einem Standard darf man nennen, aber nicht als Nachweis führen. Ein datierter Prüfbericht liegt nicht vor
„vollständige DSGVO-Konformität“ Kein prüfbarer Zustand. Die Formulierung sagt eine Gewähr zu, die niemand geben kann
„Hosting in deutschen Rechenzentren“ Unsere verbindliche Aussage lautet: innerhalb der Europäischen Union. Deutschland nennen wir nur dort, wo wir es je Auftrag vertraglich zusichern

Was bleibt, ist eine Aussage über unsere Struktur statt über unsere Abzeichen. Der Verarbeitungsort hängt bei uns am Auftrag, teils in der Europäischen Union, teils außerhalb. Wer eine reine Verarbeitung in der Europäischen Union braucht, sagt das vor der Beauftragung, dann steht es im Vertrag und wir benennen die beteiligten Unterauftragsverarbeiter mit Sitz und Leistung. Das ist weniger schmückend als ein Zertifikat und für Ihre Prüfung mehr wert, weil Sie es nachlesen können.

Zwei Personen sitzen vor einem Laptop und gehen gemeinsam Unterlagen durch
Ein Zertifikat prüft eine Organisation. Ob Ihre Verarbeitung zulässig ist, prüft es nicht.

Eine Vergleichsseite, auf der der Verfasser in jeder Zeile besser aussieht, ist keine Vergleichsseite. Sie ist eine Anzeige mit einem fremden Namen darin.

Was aus der früheren Fassung dieser Seite verschwunden ist

Sechs Zahlen, eine erfundene Gesetzespflicht, vier eigene Zusagen und eine Rechtsbewertung. Wir schreiben hin, was wir gestrichen haben.

Diese Seite stand seit Juni 2026 in einer Fassung online, die einer Prüfung nicht standhält. Wir nennen die Stellen einzeln, weil eine stille Überarbeitung dem Leser die Möglichkeit nimmt, unsere heutigen Aussagen an unseren früheren zu messen.

Gestrichen im Umbau vom 17. August 2026
Frühere Aussage Was die Prüfung ergeben hat
Ein Benchmark über 37 Modelle zeige Halluzinationsraten von 15 bis 52 Prozent Die Spur führt auf eine Statistikseite, die ihrerseits eine zweite Statistikseite als Quelle angibt. Eine Primärveröffentlichung, die 37 Modelle in einem einheitlichen Verfahren prüft, gibt es nicht
Selbst die zuverlässigsten Modelle erreichten bestenfalls 0,7 Prozent Der Wert existiert, misst aber die Treue von Zusammenfassungen gegenüber einem vorgelegten Text. Die 15 bis 52 Prozent stammen aus einer anderen Messfamilie. Der Fehler ist die Gegenüberstellung, nicht die einzelne Zahl
Rund 88 Prozent der Unternehmen könnten keinen finanziellen Erfolg vorweisen Als Herausgeber war ein Portal für Pressemitteilungen angegeben. Eine Studie mit dieser Zahl und dieser Aussage haben wir nicht gefunden
Vier von fünf deutschen Studienteilnehmern berichteten, KI bleibe hinter den Erwartungen Die Zahl gehört der Studie Digital Value 2026 der Managementberatung Horváth und misst, dass am Markt angebotene Anwendungen hinter Erwartungen an Reife und Funktionsumfang zurückbleiben. Nicht, dass eigene Vorhaben scheitern
Bis zu 95 Prozent der Pilotprojekte erreichten ihre Ziele nicht, nach MIT- und RAND-Studien Die Zahl stammt aus einer Veröffentlichung von Project NANDA am MIT, nicht von RAND, und besagt, dass kein messbarer Effekt in der Gewinn- und Verlustrechnung entsteht. Ein Vorhaben kann sein Ziel erreichen und trotzdem keinen Ergebnisbeitrag liefern
Ab August 2026 seien lückenlose Prüfprotokolle verpflichtend Artikel 12 gehört zu den Anforderungen an Hochrisiko-Systeme, und seine Anwendung ist auf den 2. Dezember 2027 verschoben. Seit dem 2. August 2026 gilt Artikel 50, der Offenlegung verlangt
Tavus optimiere weniger auf Faktentreue Eine Aussage über die Absichten eines Wettbewerbers. Nicht nachprüfbar, und durch die Dokumentation schlecht gedeckt
US-Plattformen seien primär auf englische Anwendungsfälle trainiert, die Fachsprache kippe in englische Idiome Zweiundvierzig Sprachen und ein deutschfähiges Spracherkennungsmodell sind dokumentiert. Belegt ist nur ein enger Punkt: Der Abruf aus der Wissensbasis ist nach Anbieterangabe derzeit englischsprachig
Rund 99 US-Dollar je Nutzer und Monat Diesen Betrag und einen Preis je Nutzer gibt es auf der Preisseite nicht. Abgerechnet werden Gesprächsminuten
Der US-Cloud Act greife bei uns nicht zu Eine Rechtsbewertung, die wir nicht erteilen dürfen. Die Norm knüpft an den Anbieter und dessen Gewahrsam über die Daten an; der Serverstandort ist im Wortlaut ausdrücklich unerheblich

Dazu kommen die vier eigenen Aussagen aus dem vorigen Abschnitt. Elf Streichungen auf einer Seite mit rund achtzehnhundert Wörtern sind viel, und der Befund ist unangenehm. Er hat aber eine einfache Ursache: Die Seite war aus Behauptungen gebaut, die niemand nachgesehen hat, und jede einzelne davon klang gut. Genau das ist das Muster, vor dem eine solche Seite eigentlich warnen soll.

Was wir stattdessen tun, steht im ersten Abschnitt: Hinter jeder Angabe steht ein Dokument mit Nummer und Abrufdatum, und wo wir nichts gefunden haben, steht das dort samt Suchmethode. Angaben über einen Wettbewerber müssen zum Zeitpunkt der Nutzung stimmen; eine ursprünglich richtige Angabe wird durch eine Änderung beim Anbieter irreführend. Wir sehen die Preisangaben deshalb monatlich nach und die Vertrags- und Registerangaben zum Quartal.

Häufige Fragen zum Vergleich mit Tavus

Wie schnell antwortet ein Tavus-Avatar?

Das lässt sich aus den veröffentlichten Unterlagen nicht beantworten, und das ist der ehrlichste Satz zu dieser Frage. Die Produktdokumentation benennt die Messgröße und lässt die Zahl weg. Eine Zahl für die Gesamtstrecke steht an genau einer Stelle, auf einer Glossarseite, und lautet dort auf weniger als sechshundert Millisekunden von Äußerung zu Äußerung. Eine Messvorschrift, eine Serverregion, eine Modellwahl, eine Netzannahme, ein Streuungsmaß oder eine Stichprobe stehen nicht dabei. Alle übrigen veröffentlichten Zahlen betreffen einzelne Schritte der Kette und nicht die Strecke.

Warum messen Sie es nicht einfach selbst?

Weil wir es nicht dürfen. Nummer 4.2 Buchstabe g der Nutzungsbedingungen untersagt den Zugriff auf den Dienst, um ein ähnliches oder konkurrierendes Angebot aufzubauen; wortgleich steht das in den Enterprise-Bedingungen, und die Nutzungsrichtlinie nimmt es in Nummer 4.15 noch einmal in den Katalog der untersagten Handlungen auf. Wir betreiben ein Angebot derselben Gattung. Ein Konto, das wir eröffnen, um daraus eine Zahl für unsere eigene Vermarktung zu gewinnen, fiele darunter.

Was ist der Unterschied zwischen den Zahlen, die es gibt?

Sie messen verschiedene Strecken. Weniger als hundert Millisekunden nennt der Anbieter für die Wahrnehmung von Stimmung aus dem Tonsignal. Fünfundfünfzig Millisekunden im Mittelwert nennt er für die Vorhersage, wann der Mensch aufhört zu sprechen, gemessen an achtundzwanzig eigenen Gesprächsbeispielen. Rund dreißig Millisekunden nennt er für den Abruf aus der Wissensbasis. Keine dieser Zahlen ist die Zeit, die zwischen Ihrer Frage und der Antwort vergeht. Wer sie addiert, bekommt trotzdem nicht die Gesamtstrecke, weil Spracherkennung, Sprachmodell, Sprachsynthese, Bildberechnung und Übertragung fehlen.

Ist eine Antwort unterhalb der menschlichen Reaktionszeit gut?

Sie ist erst einmal nur schnell. Menschen antworten in natürlichen Gesprächen im Mittel nach 208 Millisekunden, im Median nach 100, am häufigsten nach null; zwischen dem dänischen und dem japanischen Mittelwert liegen dabei 462 Millisekunden, und beides gilt als unauffällig. Eine Maschine, die schneller ist als das, hat damit nichts bewiesen. Sie hat vor allem früher angefangen, und häufig heißt das: bevor der Mensch ausgeredet hatte.

Wie kommt eine Maschine unter die menschliche Reaktionszeit?

Indem sie vorwegnimmt. Die Dokumentation kennt einen Schalter für spekulatives Schließen, ab Werk eingeschaltet, und beschreibt ihn so: Das Sprachmodell beginne mit der Verarbeitung der Spracherkennung, bevor die Eingabe des Nutzers endet. Das senkt die gemessene Zeit und erklärt sie zugleich. Wenn die Vorwegnahme falsch liegt, entsteht keine langsamere Antwort, sondern eine falsche.

Wo verarbeitet Tavus die Gespräche?

In den Vereinigten Staaten, nach den eigenen Unterlagen. Die Liste der zugelassenen Unterauftragsverarbeiter in der Fassung vom 27. April 2026 führt dreiundzwanzig Unternehmen, und bei jedem einzelnen steht als Ort „United States“. Eine wählbare Serverregion oder eine Zusage zur Datenhaltung in der Europäischen Union haben wir in den öffentlichen Unterlagen und im Volltextabzug der Dokumentation nicht gefunden.

Steht Tavus im Data Privacy Framework?

Nein. Wir haben das amtliche Verzeichnis des US-Handelsministeriums selbst abgefragt, mit leerem Statusfilter, damit auch erloschene und zurückgezogene Einträge erfasst werden. Bei 7.558 erfassten Einträgen null Treffer. Als Gegenprobe haben wir im selben Durchlauf nach HeyGen gesucht und genau einen Treffer bekommen, die Abfrage funktioniert also. Die Datenschutzerklärung nennt den Rahmen als eine von mehreren Möglichkeiten, ohne eine eigene Selbstzertifizierung zu behaupten. Was daraus für Ihre Übermittlung folgt, entscheidet Ihr Datenschutzbeauftragter, nicht diese Seite.

Nutzt Tavus mein Material zum Training?

Das hängt daran, welchen Vertrag Sie geschlossen haben, und der Unterschied besteht in drei Wörtern. Nummer 6.5 der allgemeinen Nutzungsbedingungen räumt eine Lizenz ein, die dort ausdrücklich als „perpetual“ und „fully paid“ bezeichnet ist, also als unbefristet und vollständig abgegolten. Der gleichlautende Abschnitt der Enterprise-Bedingungen enthält diese beiden Wörter nicht. Die Nutzung von Kundeninhalten zur Verbesserung der eigenen Produkte steht in beiden Werken.

Darf ich Tavus für die Vorauswahl von Bewerbern einsetzen?

Nach der Nutzungsrichtlinie nicht. Nummer 4.16 untersagt dem Kunden die Nutzung des Dienstes in einer Weise, die nach anwendbarem KI-Recht einschließlich der Verordnung (EU) 2024/1689 als verboten oder hochriskant eingestuft ist. Die Vorauswahl von Bewerbern steht in Anhang III Nummer 4 der Verordnung. Das ist keine Frage der Funktion, sondern des Vertrags: Die Funktion gibt es, die Erlaubnis nicht.

Wer muss offenlegen, dass die Person nicht echt ist?

Sie. Tavus stellt die Funktion bereit und weist die Pflicht ausdrücklich dem Kunden zu; die Einführungsseite zur KI-Verordnung beginnt mit dem Satz, der Einsatz von Gesprächs-KI in der Europäischen Union liege in der Verantwortung des Kunden. Wichtig ist dabei eine Einzelheit der Voreinstellung: Der Hinweis erscheint in der Werkseinstellung nur, wenn beim Anlegen des Gesprächs die Regionsangabe auf Europa gesetzt wird, und die Dokumentation hält fest, dass Tavus auf diesem Weg den Standort des Anrufers nicht ermittelt. Wer über die Schnittstelle anlegt und das Feld nicht setzt, bekommt keinen Hinweis.

Wo landet der Mitschnitt eines Gesprächs?

In Ihrem eigenen Speicher, und das ist eine bemerkenswerte Bauweise. Die Dokumentation beschreibt die Ablage in Amazon S3, Google Cloud Storage oder Azure Blob Storage über eine Vertrauensbeziehung, ohne dass ein Geheimnis an Tavus übergeben wird. Betrieben wird die Aufzeichnung nicht von Tavus selbst, sondern über Daily; die Dokumentation nennt dafür eine fremde AWS-Kontonummer. Bei fehlgeschlagener Auslieferung bleibt die Aufnahme rund dreißig Tage in der Aufzeichnungsinfrastruktur liegen.

Was kostet das?

Wir nennen hier keine Beträge, und der Grund gehört dazu. Die Preisseite führte am Abrufdatum zwei einander widersprechende Stufentabellen im Quelltext, einmal vier und einmal sechs Stufen, mit unterschiedlichen Beträgen und unterschiedlichen Sprachzahlen, beide in der beim Laden geöffneten Registerkarte und keine davon ausgeblendet. Welche ausgeliefert wird, konnten wir nicht feststellen. Was in beiden Fassungen gleich ist, ist die Abrechnungseinheit, und die ist für die Planung ohnehin wichtiger als der Betrag: abgerechnet werden Gesprächsminuten aus einem Inklusivvolumen mit einer Mindestbelastung von dreißig Sekunden je Gespräch, dazu eine Obergrenze für gleichzeitige Sitzungen, eine Anzahl eigener Avatare und eine Pauschale je zusätzlichem Avatar. Einen Preis je Nutzer gibt es nicht.

Welche Prüfnachweise gibt es auf beiden Seiten?

Das Trust Center von Tavus weist SOC 2 Type 2, HIPAA und DSGVO aus, dazu jährliche Eindringtests und vierteljährliche Schwachstellenprüfungen. Eine Zertifizierung nach ISO/IEC 27001 ist dort nicht ausgewiesen, Prüfer und Prüfumfang des SOC-2-Berichts sind nicht öffentlich. Zur Genauigkeit gehört, dass „DSGVO“ keine Zertifizierung nach Artikel 42 der Verordnung ist, sondern üblicherweise eine Selbstauskunft. Auf unserer Seite: Wir haben keine Zertifizierung nach ISO 27001 und keine nach Artikel 42. Die frühere Fassung dieser Seite hat beides anders dargestellt.

Greift der US-Cloud Act bei Ihnen nicht?

Diesen Satz sagen wir nicht mehr, weil er als Rechtsbewertung falsch aufgebaut ist. Die Norm knüpft an den Anbieter an, der der US-Rechtsordnung unterliegt, und an dessen Gewahrsam über die Daten; der Serverstandort ist im Wortlaut ausdrücklich unerheblich. Ein US-Unternehmen mit Rechenzentrum in Frankfurt ist erfasst. Was wir stattdessen sagen können, ist eine Aussage über unsere Struktur: wer Ihr Vertragspartner ist, wo verarbeitet wird und welche Unterauftragsverarbeiter mit welchem Sitz beteiligt sind. Das steht im Auftragsverarbeitungsvertrag und ist nachprüfbar, eine Rechtsauskunft ist es nicht.

Wo verarbeiten Sie selbst?

Das hängt am Auftrag, teils in der Europäischen Union, teils außerhalb. Wer eine reine Verarbeitung in der Europäischen Union braucht, sagt das vor der Beauftragung, dann steht es im Vertrag und wir benennen die beteiligten Unterauftragsverarbeiter mit Sitz. Eine pauschale Zusage „Hosting in deutschen Rechenzentren“, wie sie in der früheren Fassung dieser Seite stand, geben wir nicht.

Zum Mitnehmen

  • Tavus veröffentlicht in der Produktdokumentation keine Zahl für die Gesamtstrecke vom Ende Ihrer Äußerung bis zum Beginn der Antwort. Die einzige Zahl dafür steht auf einer Glossarseite, ohne Messvorschrift. Die Werte unter hundert, fünfundfünfzig und dreißig Millisekunden messen einzelne Schritte, nicht die Strecke.
  • Menschen antworten im Mittel nach 208 Millisekunden, im Median nach 100, am häufigsten nach null. Die Streuung zwischen Sprachen ist größer als die Unterschiede, um die im Anbietermarketing gestritten wird.
  • Dreiundzwanzig Unterauftragsverarbeiter, bei jedem steht als Ort „United States“. Eine wählbare Serverregion haben wir nicht gefunden.
  • Im Verzeichnis des US-Handelsministeriums null Treffer bei 7.558 Einträgen. Gegenprobe mit einem anderen Anbieter im selben Durchlauf: ein Treffer.
  • Die Selbstbedienungsbedingungen räumen eine unbefristete und vollständig abgegoltene Lizenz an Kundeninhalten ein, die Enterprise-Fassung nicht. Der Unterschied besteht in drei Wörtern.
  • Nummer 4.16 der Nutzungsrichtlinie untersagt dem Kunden die Nutzung in Hochrisiko-Anwendungen nach der KI-Verordnung. Die Vorauswahl von Bewerbern fällt darunter.
  • Unser Verarbeitungsort hängt am Auftrag, teils Europäische Union, teils außerhalb. Eine Zertifizierung nach ISO 27001 oder nach Artikel 42 DSGVO haben wir nicht.

Die Unterlagen an Ihrem Fall durchgehen

In einer halben Stunde klären wir, welche der hier genannten Angaben in Ihrem Haus über die Freigabe entscheidet, ob Ihr Anwendungsfall unter Anhang III fällt und welche Unterlagen Sie beim Anbieter Ihrer Wahl anfordern müssen. Wenn ein Abonnement in Selbstbedienung dafür ausreicht, sagen wir das auch.

Termin vereinbaren

Wählen Sie einen Zeitpunkt, der Ihnen passt. Das Gespräch dauert dreißig Minuten und findet als Videokonferenz statt.

Die Terminbuchung läuft über Cal.com. Beim Laden des Kalenders werden Daten an Cal.com übertragen, unter anderem Ihre IP-Adresse. Näheres in der Datenschutzerklärung.

Anfrage stellen

Wenn Ihnen ein Termin zu früh ist, schildern Sie hier kurz Ihr Vorhaben. Sie bekommen eine Einschätzung, ob sich die Rechnung bei Ihrem Aufkommen trägt.

Wir antworten in der Regel am selben Werktag.

AIdentical Redaktion, Video- und Avatarproduktion der sensified AI GmbH. Diese Seite ist eine Modellrechnung mit offengelegten Annahmen und keine Kundenreferenz. Wo Marktpreise genannt sind, stehen Herkunft und Stand dabei. Stand: August 2026. Mehr zur Redaktion

Die auf dieser Seite gezeigten Bilder sind ganz oder teilweise künstlich erzeugt. Kennzeichnung nach Artikel 50 der Verordnung (EU) 2024/1689. Weitere Angaben unter Transparenz.

Die Unterlagen durchgehen30 Minuten, ohne Vorbereitung

Termin