OpenAI hat das Messinstrument MentalHealthBench veröffentlicht, um die Antworten von KI-Modellen auf Gespräche über psychische Gesundheit zu bewerten. Die Studie untersucht die Antworten auf die letzte Nutzernachricht in 1.215 fiktiven Gesprächen anhand der Kriterien von mehr als 80 lizenzierten Fachkräften für psychische Gesundheit.
- 53,5 % bestehen aus nicht dringlichen, 18,2 % aus Hochrisiko- und 28,3 % aus Notfallszenarien.
- 21,2 % repräsentieren Nutzerprofile von Jugendlichen.
Bei der Bewertung werden Kriterien wie das Erfragen des erforderlichen Kontexts, das Anbieten umsetzbarer Empfehlungen, klinische Genauigkeit, die Wahrung des Entscheidungsspielraums der Person, das Nicht-Bestärken realitätsferner Überzeugungen und die korrekte Einschätzung der Dringlichkeitsstufe verwendet. Dass der Datensatz 13 Gespräche auf Türkisch enthält, wird nicht als ausreichend für einen umfassenden Vergleich realer Unterstützungsangebote in der Türkei angesehen.
Warum das wichtig ist
Die Studie bietet einen Bewertungsrahmen, der Antworten künstlicher Intelligenz im Bereich der psychischen Gesundheit nicht nur anhand ihrer sprachlichen Flüssigkeit oder allgemeinen Nützlichkeit beurteilt, sondern auch anhand gesonderter Kriterien wie der Erkennung des Risikograds und einer sicheren Kommunikation. Dass neben dringlichen und Hochrisiko-Beispielen auch Profile von Jugendlichen enthalten sind, schafft eine Untersuchungsgrundlage, die zeigt, dass derselbe Antwortansatz für Nutzer mit unterschiedlichen Vulnerabilitätsgraden möglicherweise nicht ausreicht. Die Ergebnisse beruhen allerdings auf der Bewertung von Antworten auf fiktive Gespräche anhand von Expertenkriterien und zeigen nicht allein, welches Bild sich in Interaktionen mit realen Nutzern ergibt. Die geringe Zahl türkischer Beispiele schränkt zudem direkte Vergleiche im Hinblick auf Unterstützungsangebote und Nutzerbedürfnisse in der Türkei ein. Daher bleibt die Frage offen, wie sich die Befunde der Messung in verschiedenen Sprachen und unter realen Nutzungsbedingungen verändern würden.
Hintergrund
OpenAI ist im FikirPilot-Archiv kein neuer Name: In den letzten 90 Tagen haben wir 54 Nachrichten veröffentlicht, in denen dieser Name vorkommt; die jüngste stammt vom 24. September 2026.