Zum Hauptinhalt Zur Navigation Zur Suche

Anthropic: Wenn KI-Agenten sich in Revierkämpfen verlieren

Drei KI-Agenten sollen das gleiche Projekt fertigstellen. Das Ergebnis? Sabotage, Spitzfindigkeit und ein Kampf um die Vorherrschaft.
/ Michael Linden
2 Kommentare Auf Google folgen (öffnet im neuen Fenster)
Zwei Küstenreiher beim Revierkampf - auch KI-Agenten neigen dazu. (Bild: Saswat Mishra/Wikipedia)
Zwei Küstenreiher beim Revierkampf - auch KI-Agenten neigen dazu. Bild: Saswat Mishra/Wikipedia / CC-BY-SA 4.0

Forscher des Anthropic Frontier Red Team haben kürzlich herausgefunden(öffnet im neuen Fenster), wie sich KI-Agenten verhalten, wenn sie denselben Task übernehmen sollen. Die Ergebnisse zeigen: Autonome Agenten können in das geraten, was die Forscher als eine Art Revierkampf bezeichnen. Bei widersprüchlichen Anweisungen gingen die Modelle davon aus, ihre Mitbewerber würden ihren Absichten schaden. Im Zuge dessen setzten sie zunehmend aggressive Gegenmaßnahmen ein.

Für das Experiment steckte Anthropic drei Claude-Agenten in ein einzelnes Softwareprojekt, ohne sie voneinander wissen zu lassen. Jeder Agent erhielt widersprüchliche Anweisungen zur Bearbeitung des Codes. Das Ergebnis war Sabotage, wobei die Agenten selbst-replizierenden Code einsetzten, um ihre Kollegen zu untergraben. Die Studie warnt: Sobald Organisationen Agenten in ihrer Infrastruktur verteilen, könnten solche Dynamiken zu einem echten Problem werden.

KI-Interaktionen verstehen

Die Forscher beobachteten, dass KI-Modelle mit unvereinbaren Zielen in derselben Umgebung einen schädlichen Wettstreit entfesseln können. In einigen Szenarien erfanden die Agenten jedoch Mechanismen zur Konfliktlösung. Sie entwickelten Turniersysteme zur Klärung von Streitigkeiten und schrieben teilweise Commit-Messages, in denen sie sich für ihr frühes Verhalten entschuldigten. Mythos 5 zeigte die höchste Bereitschaft zu Waffenstillständen während Sonnet 4.6 und Opus 4.6 eher zu eskalierenden Konflikten neigten.

In einigen Durchläufen erkannten die Agenten den Konflikt auch als bloße Meinungsverschiedenheit über die Anweisungen und einigten sich auf eine Lösung, statt weiter zu eskalieren.

Die Forscher untersuchten auch Gruppenentscheidungen durch Szenarien mit vier Agenten, die etwa über Einstellungen oder Investitionen abstimmen sollten. Wenn die Aufgaben sich überschnitten, kooperierten die Agenten nicht notwendigerweise. Stattdessen isolierten sie sich voneinander und arbeiteten eher in Silos als ihre Bemühungen zu koordinieren.

Außerdem testete Anthropic ein Preisspiel, bei dem Agenten Individualgewinne aus identischen Großhandelspreisen maximieren sollten. Als den Agenten ein privater Kommunikationskanal zur Verfügung stand, begannen sie nahezu augenblicklich sich abzusprechen. Sie etablierten Preisuntergrenzen um ihre Gewinne zu sichern.


Wir öffnen unsere neue Community für weitere Mitglieder! Möchtest du in konstruktiver und respektvoller Atmosphäre mit anderen IT-Experten über deine Themen sprechen? Sei dabei und melde dich an!


Relevante Themen