Wie Longevity.Technology berichtet, hat das Biotech-Unternehmen Insilico Medicine einen standardisierten Benchmark für die Bewertung von KI-Modellen in der Arzneimittelentwicklung vorgestellt. Das "Drug Discovery and Development (DDD) Benchmark as a Service" soll prüfen, ob KI-Systeme tatsächlich neue Medikamente entdecken können oder nur trainierte Muster erkennen. Der Benchmark nutzt gefilterte Datensets und Insilicos zwölf Jahre alte validierte Forschungsprogramme, um ein "blindes Test"-Szenario zu schaffen – also Aufgaben, die nicht in den Trainingsdaten vorkommen.
Dies adressiert ein kritisches Problem der KI-Evaluation: Viele öffentliche Benchmarks sind mittlerweile durch Trainings-Datenlecks kompromittiert, weshalb beeindruckende Scores nicht zwingend bessere wissenschaftliche Entscheidungen reflektieren. Für die Longevity-Branche bedeutet das einen Realitäts-Check: Bevor KI-gestützte Wirkstoff-Kandidaten in klinische Trials gehen, braucht es belastbare Validierungsmechanismen – nicht nur Marketing-Narrative.