AgiBot hat mit seinem Modell WITA-Omni Preview einen bedeutenden Sieg auf dem Daily-Omni-Benchmark errungen. Das chinesische Unternehmen positioniert sich damit in der Konkurrenz um multimodale Sprachmodelle. Mit einer durchschnittlichen Genauigkeit von 85,21 Prozent übertrifft WITA-Omni Preview etablierte Konkurrenten wie Qwen3.5-Omni-Plus und Gemini 3.1 Pro. Das Modell zeigt sich besonders stark bei der gleichzeitigen Verarbeitung von Audio- und Videoinformationen – eine Fähigkeit, die für robotische Systeme essentiell ist.
Das Besondere am WITA-Omni-Ansatz liegt in seiner Architektur: Statt separate Module für Wahrnehmung, Sprache und Bewegung zu kombinieren, folgt das System einem integrierten "Thinker-Talker-Actor"-Framework. Der Thinker fungiert als Reasoning-Kern, der Text, Bilder und Audio in einem gemeinsamen Raum verarbeitet. Der Talker erzeugt natürlichklingende Sprache in Echtzeit, während der Actor physische Bewegungen und Gesichtsausdrücke koordiniert – eine zentrale Anforderung für Roboter in dynamischen Umgebungen.
Das Daily-Omni-Benchmark selbst wurde speziell entwickelt, um diese Integrationsfähigkeit zu testen. Mit 684 realen Videos und 1.197 Fragen across sechs Kategorien prüft es, ob ein Modell Geräusche mit visuellen Ereignissen verbinden kann, zeitliche Abläufe erfasst und kontextabhängig reagiert. Genau diese Fähigkeiten sind für Roboter essentiell, die in Mehrpersonen-Umgebungen agieren müssen – etwa um zu verstehen, wer spricht, welche Handlungen stattfinden und wann eine Reaktion angebracht ist.