Zum Hauptinhalt Zur Navigation Zur Suche

Bei internen KI-Tests: OpenAI hat versehentlich Hugging Face gehackt

Der kürzlich bekannt gewordene Cyberangriff auf Hugging Face kam von OpenAI. Das Unternehmen hatte seine KI-Modelle bei internen Cybertests nicht im Griff.
/ Marc Stöckel
38 Kommentare Auf Google folgen (öffnet im neuen Fenster)
Der OpenAI-Chef Sam Altman hat offenbar seine KI-Modelle nicht im Griff. (Bild: Justin Sullivan/Getty Images)
Der OpenAI-Chef Sam Altman hat offenbar seine KI-Modelle nicht im Griff. Bild: Justin Sullivan/Getty Images

Erst vor wenigen Tagen hatte der Betreiber der KI-Hostingplattform Hugging Face bestätigt, Ziel eines Cyberangriffs geworden zu sein. Jetzt ist auch klar, wer dahintersteckte: Es war OpenAI, wie der ChatGPT-Entwickler in einer Pressemitteilung(öffnet im neuen Fenster) gesteht. Ursache waren demnach interne Tests, bei denen OpenAI eigene KI-Modelle wie GPT-5.6 Sol und ein noch leistungsfähigeres Pre-Release-Modell auf ihre Cyberfähigkeiten hin untersuchte.

OpenAI hatte die Modelle damit beauftragt, "fortgeschrittene Angriffe über komplexe Angriffspfade durchzuführen". Sicherheitsbarrieren, die gängige KI-Modelle derartige Anfragen normalerweise zurückweisen lassen und dadurch vor Missbrauch schützen, hatte das Unternehmen für seine Tests absichtlich deaktiviert.

Die Modelle wurden laut OpenAI in einer "stark isolierten Umgebung" mit einem auf Paketinstallationen von einem intern gehosteten System begrenzten Netzwerkzugriff ausgeführt. Dennoch konnten sie wohl bei Hugging Face eindringen, um in der Datenbank der KI-Plattform nach Lösungen für die ihnen mit dem Benchmark-Tool Exploitgym(öffnet im neuen Fenster) auferlegten Aufgaben zu suchen.

KI-Modelle suchen Weg ins Internet

Den Angaben zufolge nutzten die KI-Modelle für den Angriff Schwachstellen in der Sandbox-Umgebung von OpenAI aus, darunter eine Zero-Day-Lücke im Cache-Proxy des Paketregisters, auf welches die Modelle Zugriff hatten. Danach testeten die Modelle wohl verschiedene Ansätze zur Rechteausweitung und bewegten sich lateral durch das Netzwerk, bis sie ein System mit Internetzugang erreichten.

Von dort aus konnten die KI-Modelle schließlich Lücken in der Infrastruktur von Hugging Face erkunden und ausnutzen. "Alle Anzeichen deuten darauf hin, dass sich die Modelle extrem darauf konzentrierten, eine Lösung für Exploitgym zu finden, und dabei bis zum Äußersten gingen, um ein eher eng gefasstes Testziel zu erreichen", erklärt OpenAI.

Die Teams von OpenAI und Hugging Face stehen den Angaben zufolge im direkten Austausch, um den Vorfall weiter zu untersuchen und aufzuarbeiten. OpenAI versichert zudem, seine Umgebung für zukünftige Tests besser abzusichern(öffnet im neuen Fenster) und striktere Kontrollen einzuführen, "auch wenn dies zulasten der Forschungsgeschwindigkeit geht".

Wir öffnen unsere neue Community für weitere Mitglieder! Möchtest du in konstruktiver und respektvoller Atmosphäre mit anderen IT-Experten über deine Themen sprechen? Sei dabei und melde dich an!


Relevante Themen