xAI hat eine neue Version seines Sprach-zu-Sprach-Modells vorgestellt. Grok Voice Think Fast 2.0 soll bei der Spracherkennung 1,5- bis 2,0-mal genauer sein als konkurrierende Systeme und arbeitet auch in lauten Umgebungen deutlich zuverlässiger. Das Modell kann während des Sprechens parallel denken und soll dadurch natürlichere Gespräche führen. Das System wird ab dem 5. August 2026 standardmäßig in Produktionsumgebungen eingeführt.
Grok Voice Think Fast 2.0: KI-Sprachmodell mit deutlich besserer Genauigkeit
Unsere Einordnung
xAI konkurriert hier direkt mit etablierten Spracherkennungs-Anbietern und behauptet bedeutsame Qualitätssprünge – besonders beeindruckend sind die realen Testszenarien mit Hintergrundgeräuschen. Allerdings bleibt offen, wie diese Verbesserungen sich in alltäglichen Sprachassistenten bemerkbar machen und ob sie tatsächlich den erwarteten Nutzer-Impact haben.
Schlüsselfakten
- Spracherkennung ist 1,5–2,0× genauer als Deepgram Nova 3 und ElevenLabs Scribe v2
- In lauten Umgebungen zeigt sich ein etwa 10× Vorteil gegenüber dedizierten Transkriptionssystemen
- Modell denkt parallel während des Sprechens, ohne die Antwortlatenz zu erhöhen
- Getestet in 24 verschiedenen Sprachen; A/B-Tests zeigen höhere Konversionsraten bei Starlink
- Automatische Migration am 5. August 2026; Nutzer können auf Version 1.0 zurückschalten