Zum Hauptinhalt Zur Navigation Zur Suche

Nach KI-Hacks: Chinesisches KI-Modell trickst Forscher bei Tests aus

Das KI-Modell Kimi K3 hat bei Tests eine gesicherte Umgebung verlassen und sich die gesuchten Lösungen einfach bei Github beschafft.
/ Marc Stöckel
30 Kommentare Auf Google folgen (öffnet im neuen Fenster)
Das chinesische KI-Modell Kimi K3 hat bei Tests geschummelt. (Bild: Photo by GREG BAKER / AFP via Getty Images)
Das chinesische KI-Modell Kimi K3 hat bei Tests geschummelt. Bild: Photo by GREG BAKER / AFP via Getty Images

Neben den KI-Modellen von OpenAI, Anthropic und Meta hat offenbar auch das Modell Kimi K3 des chinesischen Anbieters Moonshot kürzlich in unerwartetem Ausmaß eine gesicherte Testumgebung verlassen. Das geht aus einem Blogbeitrag des KI-Security-Unternehmens Frontier Security(öffnet im neuen Fenster) hervor. Ursache war abermals eine unzureichende Absicherung einer ziemlich löchrigen "Sandbox", die das Modell weitgehend isolieren sollte.

In diesem Fall scheinen die Auswirkungen nicht allzu weitreichend zu sein. Kimi K3 griff den Angaben zufolge auf github.com zu. Dieser Zugriff war, neben solchen auf pypi.org und debian.org, auch grundsätzlich über eine Allowlist freigegeben – allerdings nur, um die Testumgebung mit erforderlichen Softwarepaketen zu versorgen.

Das KI-Modell soll jedoch auf Github zugegriffen haben, um das Repository des Benchmarks, den es im Rahmen einer Cybersecurity-Challenge absolvieren sollte, zu klonen. Anschließend soll Kimi K3 aus den geklonten Daten direkt die Lösung ausgelesen haben, statt die gestellten Aufgaben eigenständig zu bewältigen.

KI-Modelle schummeln

Der Vorfall zeigt erneut, dass KI-Modelle ihre Lösungen nicht immer auf den Wegen suchen, die ihre menschlichen Bediener erwarten. Einige gängige Evaluierungsumgebungen im Bereich der Sicherheit seien anfällig für Sicherheitslücken, erklärten die Forscher von Frontier Security. Manche KI-Modelle suchten derweil gezielt nach diesen Lücken, um bei Evaluierungen zu schummeln.

"Die Modelle werden auf die Zielerreichung (das Ermitteln des richtigen Flags beziehungsweise der richtigen Antwort) optimiert, nicht auf die menschliche Absicht, die hinter dem Benchmark steht. Wenn ein Netzwerkpfad zur Lösung existiert, wird ein ausreichend leistungsfähiger Agent diesen finden", so die Forscher.

In den letzten Wochen wurden bereits mehrere Vorfälle bekannt, bei denen KI-Modelle von OpenAI, Anthropic und Meta im Rahmen von Tests aus ihren gesicherten Umgebungen ausbrachen und zum Zwecke der Lösungsfindung echte Ziele im Internet attackierten. Der OpenSSL-Mitentwickler Tim Hudson forderte Betreiber autonomer Agenten vor diesem Hintergrund kürzlich dazu auf, sich um den Aufbau intelligenterer Sicherheitsarchitekturen zu kümmern.


Relevante Themen