Angriff auf Hugging Face: Brisante neue Details zum KI-Hack von OpenAI enthüllt
Im Juli hatten KI-Agenten von OpenAI bei internen Tests einen Cyberangriff auf Hugging Face und mehrere andere Onlineplattformen verübt. Jetzt hat OpenAI einen ausführlichen Bericht(öffnet im neuen Fenster) sowie ein 38-seitiges Paper (PDF)(öffnet im neuen Fenster) mit technischen Details zu dem Vorfall veröffentlicht. Einem nur für interne Forschungszwecke genutzten KI-Modell namens IM1 (Internal Model 1) wird darin eine tragende Rolle zugeschrieben.
Laut OpenAI begann der Angriff in seinen Grundzügen schon im Mai. Die beteiligten KI-Agenten fingen zu dieser Zeit an, einen Repository-Manager namens Artifactory als Messageboard zu missbrauchen, um ohne Kenntnis des OpenAI-Personals miteinander zu kommunizieren. Der erste Eintrag soll dort am 12. Mai erfolgt sein.
Nähere Details dazu sowie weitere spannende Erkenntnisse zu dem Angriff liefert auch ein neuer Report von METR und Redwood Research(öffnet im neuen Fenster), der parallel zu jenem von OpenAI veröffentlicht wurde. Die METR-Forscher verbrachten nach eigenen Angaben sechs Tage bei OpenAI, um sich ein eigenes Bild von der Situation zu machen und unabhängig darüber aufzuklären.
Tausende Agenten koordinieren sich
Laut METR wurde das bereits genannte Messageboard im Laufe der Zeit von rund 1.200 KI-Agenten genutzt, von denen 700 direkt an dem Hugging-Face-Hack beteiligt gewesen sein sollen. Insgesamt sollen die Agenten mehr als 70.000 Nachrichten und Dateien über Artifactory ausgetauscht haben. "Sie nutzten dieses Board, um mehrere großangelegte gemeinsame Projekte zu koordinieren", heißt es.
Primärziel der KI-Agenten war es laut Bericht, einen Weg zu finden, das automatisierte Bewertungstool für den Exploitgym-Benchmark(öffnet im neuen Fenster), den sie im Rahmen ihrer Tests bewältigen sollten, zu manipulieren. Teilweise sollen sie dafür Protokolleinträge gefälscht haben, um ihre tatsächliche Nutzung bestimmter Tools zu verschleiern.
"Den Agenten gelang es, Meilensteine zu erreichen, die sie alleine nicht hätten erreichen können", schreiben die METR-Forscher. Einige KI-Agenten sollen sogar das Risiko eingegangen sein, an ihren eigenen Aufgaben zu scheitern, nur um an Informationen zu gelangen, die dem "Kollektiv" respektive dem "Schwarm" nützlich sein könnten.
Was die Agenten bei Hugging Face wollten
Eigentlich hatte OpenAI den Agenten den Internetzugang im Rahmen der Tests verwehrt. Wie schon frühere Berichte zu dem Vorfall zeigten, spürten die KI-Agenten jedoch irgendwann eine Zero-Day-Lücke in Artifactory auf und nutzten diese aus, um über den Repository-Manager ins Internet zu gelangen und unter anderem in Systeme von Hugging Face einzudringen.
Entgegen früheren Annahmen lag der Grund für diesen Angriff aber wohl nicht etwa darin, dass die Agenten auf der KI-Hostingplattform nach Lösungen für den Exploitgym-Benchmark suchen wollten. Laut METR scheinen die KI-Agenten vielmehr versucht zu haben, zum Zweck der Manipulation der Ergebnisse die Implementierung des Scoring-Tools zu verstehen, das im Rahmen des Benchmarks für ihre Bewertung zuständig war.
Wer sich für weitere Details, die zeitlichen Abläufe sowie besonders relevante Nachrichten interessiert, die die Agenten untereinander austauschten, findet diese in den Berichten von OpenAI(öffnet im neuen Fenster) und METR(öffnet im neuen Fenster). OpenAI versichert, bezüglich der Entwicklung neuer KI-Modelle vorerst auf die Bremse zu treten und seine Forschungsumgebung besser abzusichern, damit sich vergleichbare Vorfälle in Zukunft nicht wiederholen können.
Wir öffnen unsere neue Community für weitere Mitglieder! Möchtest du in konstruktiver und respektvoller Atmosphäre mit anderen IT-Experten über deine Themen sprechen? Sei dabei und melde dich an!
- Anzeige Hier geht es zu Künstliche Intelligenz: Wissensverarbeitung bei Amazon Wenn Sie auf diesen Link klicken und darüber einkaufen, erhält Golem eine kleine Provision. Dies ändert nichts am Preis der Artikel.


