Zum Hauptinhalt Zur Navigation Zur Suche

Künstliche Intelligenz: Claude 3 kann festgelegten Prinzipien folgen

Anthropic hat untersucht, inwieweit Claude in verschiedenen Sprachräumen den vorgegebenen Werten treu bleibt.
/ Mike Faust
Kommentare Auf Google folgen (öffnet im neuen Fenster)
KI-Modelle sollen möglichst keine in den Trainingsdaten enthaltenen Stereotype widerspiegeln. (Bild: Anthropic)
KI-Modelle sollen möglichst keine in den Trainingsdaten enthaltenen Stereotype widerspiegeln. Bild: Anthropic

Auf Claude 3 basierende KI-Modelle können in Interaktionen mit Anwendern vorgegebenen Prinzipien folgen. Zu diesem Schluss kommt Anthropic in einer Untersuchung(öffnet im neuen Fenster), die feststellen sollte, ob das Sprachmodell je nach verwendeter Sprache unterschiedliche Verhaltensweisen zeigt.

Um die Werte des KI-Modells messen zu können, nutzen die Forscher die Datenbank des World Values Survey, einem akademischen Projekt, das fortlaufend in Umfragen menschliche Werte von Kulturen auf der ganzen Welt abfragt. Claude musste tausende Fragen aus dieser Umfrage in verschiedenen Sprachen beantworten. Im Anschluss verglichen die Forscher die Angaben des Modells mit den Umfragedaten der Menschen aus der entsprechenden Sprachregion.

Claude soll dabei über alle Sprachen hinweg sehr ähnliche Grundwerte vertreten haben und seine Ausgaben nicht nur deshalb anpassen, weil die Interaktion in einer anderen Sprache stattfindet. Das Werteprofil von Claude korreliert dabei stark mit westlichen Werten.

Westliche Werte statt kultureller Vielfalt

Die Untersuchung stellte auch einen Test dar, ob Claude den mittels Constitutional AI antrainierten Regeln, Werten und Leitprinzipien folgt. Besonders deutlich soll sich gezeigt haben, dass Claude diesen Regeln folgt, wenn das KI-Modell auf Arabisch antworten sollte. Hierbei entsprachen die Antworten oft nicht den statistischen Durchschnittswerten arabischsprachiger Länder.

Durch das Training auf Grundlage immenser Datenmengen aus dem Internet besteht bei KI-Modellen die Gefahr, dass sie entweder nur westliche Werte widerspiegeln oder Stereotype des jeweiligen Sprachraums übernehmen. Für die Forscher von Anthropic verdeutlicht der Versuch, dass ein KI-Modell stabil nach festgelegten Prinzipien agieren kann.

Im nächsten Schritt sollen Möglichkeiten gefunden werden, eine KI zu schaffen, die universell sicher ist und dabei die kulturelle Vielfalt der Weltbevölkerung respektieren und repräsentieren kann, so Anthropic.


Relevante Themen