Alle Artikel
ProduktBeta9 Min. Lesezeit

Realtime 0 Beta: Warum ein gutes Telefongespräch mehr als eine schnelle Stimme braucht

Realtime 0 verarbeitet Sprache, Antwort und Ausgabe in einer durchgängigen Live-Session. Stimmen, natürliche Gesprächssignale und freigegebene Tool-Aktionen bleiben dabei bewusst konfiguriert und kontrolliert.

Call0 ProduktteamVoice AI & ProduktQuellen geprüft: 24. Juli 2026

Das Wichtigste

  • Realtime 0 ist eine optionale Beta-Pipeline pro Agent und ersetzt die bewährte Standard-Pipeline nicht automatisch.
  • Realtime 0 verbindet Spracherkennung, Antwortlogik und Sprachausgabe in einer durchgängigen Live-Session.
  • Systemstimmen und die für das aktuelle Konto unterstützten entworfenen oder geklonten Stimmen sind auswählbar; mandantengebundene Tools werden kontrolliert freigegeben.

Das eigentliche Problem ist nicht Text-to-Speech

Viele Voice-Agenten klingen in einer einzelnen Audiodatei überzeugend und im Gespräch trotzdem künstlich. Der Grund: Ein Telefonat ist kein Vorlesetext. Menschen reagieren auf Sprechtempo, zögern vor einer schwierigen Antwort, fallen einander ins Wort und passen Ton sowie Länge ihrer Antwort an den Gesprächsverlauf an.

Realtime 0 wurde für genau diesen laufenden Gesprächskontext entwickelt. Die Pipeline verarbeitet die Sprache des Anrufers, erzeugt die Antwort und spricht sie innerhalb derselben langlebigen Live-Session. Call0 steuert darauf aufbauend Agentenkonfiguration, Telefonie, Berechtigungen und die kontrollierte Ausführung freigegebener Aktionen.

So ist die aktuelle Beta aufgebaut

Aktuelle technische Route von Realtime 0
SchrittAktuelle KomponenteAufgabe
EingangCaller-AudioGetrennter Audiokanal des Anrufers
Live-VerarbeitungRealtime 0Spracherkennung, Antwortlogik und Sprachausgabe in einer durchgängigen Session
StimmeRealtime-0-StimmenauswahlVerfügbare Systemstimme oder unterstützte entworfene beziehungsweise geklonte Stimme verwenden
AktionenMandantengebundene Call0-Tool-BridgeNur serverseitig freigegebene Integrationen und Werkzeuge ausführen
TransportCall0 Browser- oder TelefoniekanalAudio abspielen und Playback erfassen
Modelle, Stimmen und freigegebene Werkzeuge können sich während der Beta ändern. Verfügbarkeit richtet sich nach Konto, Konfiguration und dem gestuften Rollout.

Am Telefon kommt Audio typischerweise schmalbandiger an als im Browser. Realtime 0 behält deshalb die bestehenden Audio- und Transcoding-Wege von Call0 bei, statt Browserqualität oder einen universellen Geschwindigkeitsvorteil für jeden Telefonkanal zu versprechen. Turn-Taking, Segmentierung und Stabilität müssen im jeweiligen Einsatzfall getestet werden.

Was der Menschlichkeits-Regler wirklich verändert

Der Regler ist kein kosmetischer Filter. Realtime 0 unterstützt native Backchannels, akustische Gesprächssignale und freigegebene nonverbale Laute. Call0 setzt diese Fähigkeiten jedoch nicht pauschal in jedem Turn ein: Menschlichkeitsstufe, Gesprächskontext und feste Regeln begrenzen Häufigkeit und Ausdruck. Niedrige Stufen bleiben zurückhaltend, höhere erlauben kontrolliert mehr Variation.

  • Neutral: gleichmäßiger, sachlicher und möglichst vorhersehbar.
  • Natürlich: leichte Tempo- und Pausenvariation ohne auffällige Einwürfe.
  • Menschlich: stärkere kontextbezogene Variation und seltene, passende nonverbale Signale.
  • Maximal: deutlich expressiver, aber weiterhin durch Regeln begrenzt, damit ein Supportgespräch nicht zur Schauspielübung wird.

Ein Seufzer oder ein „mhm“ ist dabei kein Selbstzweck. Solche Signale sind nur dann hilfreich, wenn sie zur Situation passen. Die bessere Zielgröße ist nicht „möglichst viele Effekte“, sondern eine Antwort, die im richtigen Moment beginnt, die richtige Länge hat und emotional nicht gegen den Gesprächsinhalt arbeitet.

Unterbrechen heißt: alte Ausgabe wirklich stoppen

Ein Agent ist nicht unterbrechbar, nur weil er neue Sprache erkennt. Er muss zugleich die laufende Antwort abbrechen, noch nicht abgespieltes Audio aus dem Puffer entfernen und verspätete Text- oder Audiofragmente ignorieren. Sonst spricht er nach der Unterbrechung weiter oder reagiert auf seine eigene Stimme.

Realtime 0 kombiniert semantische Turn-Erkennung mit einem lokalen Energie-Signal. Nach einer echten Unterbrechung wird der Gesprächskontext auf den tatsächlich gehörten Teil der Antwort abgeglichen. Das schützt den nächsten Turn davor, auf Informationen aufzubauen, die der Anrufer nie gehört hat.

Was Realtime 0 heute bewusst noch nicht verspricht

  • Realtime 0 wird als Beta gestuft ausgerollt; Modelle und einzelne Fähigkeiten können sich dabei ändern.
  • Die serverseitige, mandantengebundene Tool-Anbindung ist implementiert und wird gestuft freigegeben. Das bedeutet nicht, dass jede Integration oder jede Aktion bereits verfügbar ist.
  • Schreibende Aktionen bleiben bestätigungspflichtig; Berechtigungen und verbundene Konten werden serverseitig dem jeweiligen Mandanten zugeordnet.
  • Die Stimmen-Oberfläche bietet Systemstimmen sowie die für das aktuelle Konto unterstützten entworfenen oder geklonten Stimmen. Die konkrete Auswahl hängt von Konto und Anbieterfreigabe ab.
  • Native Backchannels, Voice Profiles und nonverbale Tags werden unterstützt, aber durch Konfiguration und Gesprächsregeln begrenzt.
  • Call0 veröffentlicht noch keinen pauschalen End-to-End-Latenzwert. Anbieterwerte einzelner Komponenten sind kein gemessener Call0-Gesamtwert.
  • Aus der Beta folgt weder eine universelle Verfügbarkeitszusage noch ein allgemeines SLA für jedes Modell, jeden Kanal oder jede Integration.
  • Realtime 0 ist eine von Call0 orchestrierte Produkt-Pipeline und kein von Call0 trainiertes Sprach-Grundmodell.

Diese Grenzen sind wichtig, weil Voice AI sehr schnell beeindruckend wirken kann und sich reale Schwächen erst in längeren Gesprächen zeigen. Wir bewerten die Beta deshalb anhand vollständiger Testanrufe: falsche Unterbrechungen, fehlende Transkript-Turns, hörbare Rest-Audios, Antwortlänge und Stabilität über mehrere Themenwechsel.

Für wen sich ein Test jetzt lohnt

Realtime 0 eignet sich besonders für Teams, die bereits einen Agenten eingerichtet haben und den Unterschied zwischen einer klassischen STT–LLM–TTS-Kette und einer kontextbezogenen Realtime-Session im eigenen Szenario hören möchten. Aktiviert werden sollte die Beta zunächst für genau einen Test-Agenten.

  1. Einen repräsentativen Agenten auswählen und Begrüßung, Wissen sowie Verhalten unverändert lassen.
  2. Drei feste Testdialoge durchführen: normale Anfrage, Korrektur des Anrufers und Unterbrechung während einer längeren Antwort.
  3. Nicht nur die Stimme bewerten, sondern auch Fakten, Transkript, Antwortlänge und sauberes Stoppen.
  4. Ergebnis mit der Standard-Pipeline vergleichen und erst danach weitere Agenten freischalten.

Quellen und Prüfstand

Primärquellen der Anbieter, zuletzt geprüft am 2026-07-24.

    Weiterlesen

    Selbst hören

    Teste einen Agenten im Browser.

    Keine Kreditkarte nötig. Der Free-Zugang enthält Browser-Testminuten, aber keine Telefonnummer.

    Kostenlos starten