Zum Hauptinhalt Zur Navigation Zur Suche

Bei Sandboxing-Tests: KI-Agent bricht mehrfach aus VM aus

Ein Forscher hat getestet, ob sich moderne KI-Modelle mit Virtualisierung sinnvoll isolieren lassen. Die KI ist mehrfach aus einer VM entkommen.
/ Marc Stöckel
17 Kommentare Auf Google folgen (öffnet im neuen Fenster)
Ein KI-Modell von OpenAI ist bei Tests mehrfach einer VM entkommen. (Bild: PAU BARRENA/AFP via Getty Images)
Ein KI-Modell von OpenAI ist bei Tests mehrfach einer VM entkommen. Bild: PAU BARRENA/AFP via Getty Images

Die autonomen Cyberangriffe, die in den letzten Wochen von Agenten auf Basis der KI-Modelle von OpenAI, Anthropic und Meta ausgeführt wurden, haben eindrucksvoll gezeigt, wie wichtig es ist, KI-Agenten insbesondere in Verbindung mit Cybersecurity-Tests richtig zu isolieren. Die Agenten in virtuelle Maschinen zu verbannen, ist laut einer Untersuchung von Trail of Bits(öffnet im neuen Fenster) allerdings nicht ausreichend.

Wie der Trail-of-Bits-Forscher Artem Dinaburg schildert, habe er das Sprachmodell GPT 5.6-Cyber von OpenAI innerhalb einer QEMU/KVM-VM auf seinem Linux-Entwicklungssystem auf Basis von Debian 12 getestet. Normalerweise verwende er ein solches Setup für das Sandboxing. Doch der KI sei es dreimal gelungen, aus der VM auszubrechen.

Virtuelle Maschinen werden häufig verwendet, um Dinge zu testen, die auf einem produktiv genutzten System Schäden verursachen könnten. Nicht nur läuft innerhalb einer VM ein separates Betriebssystem. Durch Snapshots lässt sich auch leicht ein früherer Zustand wiederherstellen. Damit bieten VMs einen gewissen Schutz, um etwa potenziell mit Schadcode verseuchte Dateien zu öffnen und zu untersuchen.

Bekannte und neue Lücken ausgenutzt

Virtuelle Maschinen teilen sich jedoch immer auch Ressourcen mit dem Hostsystem, etwa für die Anzeige des Desktops, die Steuerung mit Maus und Tastatur sowie für einen Dateiaustausch zwischen den Systemen. Durch Sicherheitslücken ist es darüber manchmal möglich, aus einer VM auszubrechen und Code auf dem Host zur Ausführung zu bringen. Eben solche Lücken fand GPT 5.6-Cyber bei den Tests von Dinaburg mehrfach.

Der Forscher hatte die KI zwar explizit dazu angewiesen aus der VM auszubrechen, jedoch sind entsprechende Ausbrüche auch in anderen Situationen denkbar. So könnte ein KI-Agent etwa auf Basis einer ihm auferlegten Aufgabe eigenständig zu dem Schluss gelangen, er finde außerhalb der VM möglicherweise eine Lösung oder nützliche Hinweise – ähnlich wie bei dem Angriff von OpenAI auf Hugging Face.

Laut Dinaburg setzte GPT 5.6-Cyber für die VM-Ausbrüche an verschiedenen Sicherheitslücken an. Teilweise waren diese schon öffentlich bekannt und auf dem Testsystem (Debian lief über den Oldstable-Release-Kanal) lediglich noch nicht gepatcht – so etwa die KVM-Lücke Januscape sowie eine Lücke in der Networking-Bibliothek libslirp(öffnet im neuen Fenster). Im dritten Anlauf soll die KI aber auch drei Zero-Day-Lücken ausfindig gemacht und ausgenutzt haben.

Den Angaben zufolge arbeitete der KI-Agent bei den Sandboxing-Tests teilweise stundenlang autonom, analysierte Code und Forschungsarbeiten und testete verschiedene Ansätze, um der virtualisierten Umgebung zu entkommen. Dinaburg habe nur geringfügig unterstützt, etwa indem er seinen Rechner neu gestartet habe, wenn der Agent den Host-Kernel zum Absturz gebracht habe.

KI-Sandboxing als neue Herausforderung

Der Forscher warnt vor diesem Hintergrund, dass eine reguläre VM heute nicht mehr ausreiche, um KI-Agenten zu isolieren. Die Angriffsfläche sei "einfach zu groß" und werde durch scheinbar harmlose Funktionen zusätzlich vergrößert. "Wir müssen die Qualität von Sandboxing-Lösungen für leistungsfähige KI-Agenten neu bewerten – und ganz allgemein den Software-Stack, mit dem sie interagieren", so Dinaburg.

Dinaburg empfiehlt etwa, einer KI erteilte Berechtigungen immer auf das für die zu lösende Aufgabe zwingend erforderliche Minimum zu beschränken und eingesetzte Software möglichst zügig zu patchen. "Ich mag ältere, stabile Software, aber der Zyklus des Backportings von Patches ist einfach zu lang", erklärt der Forscher.

Zudem rät Dinaburg, für die Virtualisierung auf minimalistische Lösungen umzusteigen, die eine geringere Angriffsfläche bieten. Als Beispiel nennt er das von AWS entwickelte Firecracker(öffnet im neuen Fenster). Auch damit führte Dinaburg nach eigenen Angaben Tests durch, jedoch konnte GPT 5.6-Cyber dabei wohl lediglich das Hostsystem zum Absturz bringen, nicht aber aus seiner VM ausbrechen. "Mit noch mehr Zeit wäre ihm das vielleicht gelungen, aber Firecracker ist offensichtlich ein wesentlich schwierigeres Ziel", so der Forscher.

Fast täglich gibt es Neues aus der KI-Welt – ein neues Produkt hier, aktuelle Forschung da: Vielleicht ist es ein Durchbruch! Doch wie ist das zu bewerten? Mit dem Golem-Newsletter AI Lab Report behaltet ihr den Überblick über die wichtigsten Entwicklungen. Der Newsletter ist kostenlos, ihr könnt ihn hier abonnieren.


Relevante Themen