Zum Hauptinhalt Zur Navigation Zur Suche

GPT-Live: OpenAI bringt Sprachmodell für echte Gespräche

Statt starrer Gesprächsrunden hört und antwortet GPT-Live gleichzeitig. Das neue Voice-Modell soll ChatGPT-Gespräche natürlicher wirken lassen als je zuvor.
/ Andreas Donath
4 Kommentare Auf Google folgen (öffnet im neuen Fenster)
GPT-Live (Bild: Pexels)
GPT-Live Bild: Pexels

OpenAI hat mit der Einführung von GPT-Live(öffnet im neuen Fenster), einer neuen Familie von Sprachmodellen, begonnen. Sie soll gesprochene Dialoge mit ChatGPT näher an ein echtes Gespräch zwischen zwei Menschen heranführen. Das System treibt ChatGPT Voice inzwischen weltweit auf iOS, Android und im Web an.

Das Unternehmen beschreibt GPT-Live als vollduplexfähig. Das bedeutet, das Modell kann gleichzeitig zuhören und antworten, statt zu warten, bis eine sprechende Person fertig ist. In der Praxis ermöglicht das kleine verbale Signale, Pausen zum Nachdenken und einen flüssigen Wechsel im Gespräch, ohne die spürbare Verzögerung früherer Sprachsysteme.

Zwei Varianten kommen zum Einsatz. GPT-Live-1 wird zum Standard für Abonnenten der Stufen Go, Plus und Pro. Eine kleinere Variante, GPT-Live-1 Mini, bedient Nutzer der kostenlosen Version. OpenAI plant zudem eine API.

Der Abschied von rundenbasierten Sprachsystemen

Frühere Sprachwerkzeuge, darunter das ursprüngliche ChatGPT Voice, verließen sich auf drei verkettete Modelle. Eines transkribierte Sprache, eines erzeugte die Antwort, ein drittes wandelte diese Antwort zurück in Audio. Laut OpenAI führte dieser mehrstufige Aufbau häufig zu Verzögerungen und Verlusten an sprachlicher Nuance zwischen den einzelnen Schritten.

Eine spätere Version, der Advanced Voice Mode, verarbeitete Audio innerhalb eines einzigen Modells. Das verringerte die Verzögerung, funktionierte aber weiterhin in klar abgegrenzten Gesprächsmustern. Weil das System das Ende einer Runde über Stille erkannte, konnten Hintergrundgeräusche oder eine kurze Pause laut OpenAI dazu führen, dass es zu einem ungünstigen Zeitpunkt unterbrach.

GPT-Live soll diese Schwäche durch kontinuierliche Verarbeitung beheben. Das Modell entscheidet dabei mehrmals pro Sekunde, ob es sprechen, schweigen oder einen Teil der Anfrage weiterreichen soll. Für Aufgaben, die Suche oder tiefere Denkprozesse erfordern, kann GPT-Live im Hintergrund auf das Modell GPT-5.5 von OpenAI zurückgreifen, während das Gespräch weiterläuft.

OpenAI veröffentlichte interne Auswertungen, denen zufolge menschliche Tester GPT-Live in vergleichbaren Gesprächen gegenüber dem Advanced Voice Mode bevorzugten, etwa bei Gesprächsfluss und Redeübergängen. Das Unternehmen berichtete zudem von Fortschritten bei Benchmarks zu Denkleistung und Suche, wobei diese Zahlen aus eigenen Tests von OpenAI stammen und nicht unabhängig überprüft wurden.


Relevante Themen