Plaud AI hat eine überraschende Entdeckung gemacht: Audio, das für menschliche Ohren angenehm klingt, führt bei KI-Spracherkennungssystemen oft zu mehr Fehlern. Das Unternehmen löst dieses Dilemma durch einen zweispurigen Ansatz – unterschiedliche Audiobearbeitung je nachdem, ob Menschen zuhören oder KI transkribiert. In Tests schnitt Plauds Note Pro bei der Transkriptionsgenauigkeit deutlich besser ab als iPhones, obwohl die Aufnahmen weniger poliert klingen.
Der Grund liegt in der Funktionsweise von KI-Systemen: Rauschunterdrückung glättet Audiosignale, was sie für Ohren angenehmer macht, zerstört aber die feinen Details in der Sprache, die KI braucht, um Wörter zu unterscheiden. Plaud arbeitet mit vier Mikrofonen, die das Signal je nach Verwendungszweck unterschiedlich verarbeiten – für Menschen wird es bereinigt, für die KI bleibt es ungeglättet und präserviert die sprachlichen Nuancen.
Bei Tests in lauter Umgebung erreichte die Note Pro eine Fehlerquote von 23,4 Prozent, während das iPhone 30,3 Prozent erreichte. Ein praktisches Design-Dilemma, das zeigt: Das optimale Audio für menschliche Wahrnehmung und für maschinelle Verarbeitung sind zwei völlig unterschiedliche Anforderungen.