✍️ Blog

Grok-Videogenerator erhält Bild- und Sprachreferenzen

12. August 2026·Quelle: xAI Blog (Grok)

xAI hat sein Videogenerator-Modell Imagine Video 1.5 um neue Funktionen erweitert. Das System kann nun Bilder und Stimmen als Referenzen nutzen, um konsistente Charaktere und Objekte über mehrere Szenen hinweg zu bewahren. Gleichzeitig unterstützt das Modell native 1080p-Auflösung und kann Videos direkt aus Textbeschreibungen generieren, ohne dass ein Ausgangsbild nötig ist. Die neuen Features sind zunächst für Premium-Nutzer in den USA verfügbar und rollen in den kommenden Tagen auf alle Nutzer aus. Auch über die xAI-API können Entwickler auf die erweiterten Funktionen zugreifen.

Unsere Einordnung

xAI setzt den Fokus auf praktische Kontrolle statt Pure-Scaling: Mit Bild- und Sprachreferenzen adressiert der Hersteller einen echten Schmerzpunkt professioneller Videogeneratoren — die Einhaltung visueller Konsistenz. Das Feature-Set wirkt zielgerichteter als die "mehr Token, mehr Parameter"-Strategie der Konkurrenz, könnte aber nur dann relevant werden, wenn die Qualität gegen OpenAI, Runway und Hugging Face mithalten kann.

Schlüsselfakten

  • Neue Bild- und Sprachreferenzen ermöglichen das Halten von Charakteren und Objekten über mehrere Szenen
  • Native 1080p-Auflösung bei Text-zu-Video und Bild-zu-Video Generation
  • Bis zu sieben Referenzen pro Generierung möglich
  • Features rollen für alle Nutzer-Tiers in den USA aus, API-Zugang für Entwickler verfügbar
  • Text-zu-Video ermöglicht Videogenerierung ohne Ausgangsbild

Artikel teilen