GPT‑Live‑1 bringt natürliche und bidirektionale Sprachgespräche in die API. Das Modell kann gleichzeitig zuhören und sprechen; für komplexeres Schlussfolgern und Aktionen kann es Aufgaben an die Modelle und Tools delegieren, mit denen es gekoppelt ist. Entwickler können das Spracherlebnis auf ihre Nutzer, Workflows und Ziele ausrichten.
Die Fähigkeit des Modells, Unterbrechungen zu handhaben, wurde von Speak in frühen Evaluierungen positiv bewertet. GPT‑Live‑1 reduzierte Unterbrechungen im Vergleich zu früheren sequenziellen Systemen um fast 80 %, indem es den Lernenden mehr Zeit zum Nachdenken gab, bevor die Sprachlehrkraft antwortete. Anders als herkömmliche Sprachagenten, die Gespräche in die Phasen Sprache-zu-Text, Schlussfolgern und Text-zu-Sprache aufteilen, vereint GPT‑Live‑1 Zuhören und Sprechen in einem einzigen Modell. Während es Antworten, Bestätigungen und Unterbrechungen in Echtzeit verwaltet, kann es komplexere Verarbeitung im Hintergrund fortsetzen.
Entwickler können Modelle, Tools und die Agenteninfrastruktur auswählen; bei Terminplanungen oder Bestellaktualisierungen mit hohem Volumen kann Luna eingesetzt werden, bei komplexen Kundenproblemen Astra. So lassen sich Geschwindigkeit, Kosten und der Grad des Schlussfolgerns an die jeweilige Aufgabe anpassen. GPT‑Live‑1 stellt ASR-Transkripte und Antworttext bereit und unterstützt alphanumerische Ausdrücke sowie die Priorisierung von Schlüsselwörtern. Obwohl es sich nicht um ein sequenzielles Modell handelt, ist auch eine integrierte Sprecherwechsel-Erkennung vorhanden.
In Evaluierungen steigerte GPT‑Live‑1 seine Leistung im Full Duplex Bench gegenüber GPT‑Realtime‑2.1 um 30 Punkte. Beim mittleren Grad des Schlussfolgerns belegte es in Tau3 zusammen mit GPT‑6 Astra den ersten Platz. Das Modell bietet eine größere Auswahl an Stimmen für unterschiedliche Akzente, Dialekte und Sprachen. Es ist heute in der API zum Preis von $0,05 pro Minute für die Audioebene des Frontends verfügbar. Es kann in Codex und OpenAI Presence integriert werden; für den Zugang zu individuellen Stimmen muss das Vertriebsteam kontaktiert werden.
Warum wichtig
Dieser Ansatz ist insbesondere für Bildungs- und Kundenservice-Szenarien relevant, in denen Interaktionen häufig unterbrochen werden, da er ermöglicht, den Gesprächsfluss in Sprach-Apps zu steuern, ohne ihn in separate Schritte für Erkennung, Verarbeitung und Sprachsynthese aufzuteilen. Die Fähigkeit, Zuhören, Antworten und Aufgaben im Hintergrund innerhalb derselben Struktur zu verarbeiten, ermöglicht es Entwicklern, anstelle eines einheitlichen Agenten unterschiedliche Komponenten entsprechend den Anforderungen an Geschwindigkeit, Kosten und Schlussfolgerungsfähigkeit zu entwickeln. Die Ergebnisse früher Evaluierungen zeigen, dass Leistungvergleiche nicht nur die technischen Kapazitäten messen, sondern auch die Natürlichkeit des Gesprächs und die Wartezeiten. Dass die API ein Transkript und den Antworttext bereitstellt, erleichtert die Anbindung sprachbasierter Interaktionen an bestehende Arbeitsabläufe. Allerdings bleiben die Gesamtkosten der minutenbasierten Abrechnung bei einer Nutzung in großem Umfang sowie die Tatsache, dass der Zugang zu individuellen Stimmen an einen Vertriebsprozess gebunden ist, offene Punkte, die Teams vor der Umsetzung zusätzlich bewerten müssen.
Hintergrund
GPT ist im FikirPilot-Archiv kein neuer Name: In den vergangenen 90 Tagen haben wir 2 Nachrichten veröffentlicht, in denen dieser Name vorkam; die jüngste stammt vom 13. September 2026.
Begriff: Agent
Ein KI-Agent ist eine Software, die Tools aufruft und mehrstufige Aufgaben ausführt, um ein Ziel zu erreichen, anstatt lediglich eine einzelne Antwort zu erzeugen.