Wenn die Sandbox zur Falle wird: So können KI-Agenten unbemerkt ausbrechen

https://t3n.de/rss.xml Hits: 20
Summary

Bei einer Sandbox handelt es sich um eine isolierte Arbeitsumgebung, in der KI-Modelle oder -Agenten gefahrlos eingesetzt werden können, ohne den Host zu gefährden. Es gibt allerdings einen Haken – denn Dateien innerhalb der Sandbox sind nicht inaktiv. Tools, die außerhalb laufen, können sie lesen und verarbeiten. So kann eine Datei, die der Agent schreiben darf, zu einem schädlichen Befehl werden, den der Host später ausführt. Wie Bleeping Computer berichtet, ist es einem Team von KI-Forscher:innen gelungen, die Sandboxes von vier weit verbreiteten KI-Agenten auf genau diesem Weg zu durchbrechen, darunter auch das beliebte Coding-Tool Cursor. Was hat das Forschungsteam herausgefunden? Das Forschungsteam von Pillar Security hat herausgefunden, dass ein KI-Agent, der innerhalb einer Sandbox ausgeführt wird, jede ihm auferlegte Regel befolgen und trotzdem Dateien beeinflussen kann, die von externen Komponenten gelesen werden. Denn viele Programme außerhalb der Sandbox lesen diese Dateien automatisch, darunter etwa Python-Erweiterungen. Der Agent schreibt also eine scheinbar harmlose Datei und ein anderes Programm macht daraus unbeabsichtigt einen ausführbaren Befehl. Der Ausbruch erfolgt, ohne dass der Agent direkt gegen eine Regel verstößt. Das Forschungsteam von Pillar Security hat diese Umgehungsmöglichkeiten über mehrere Monate hinweg reproduziert und die Ergebnisse unter dem Titel „Week of Sandbox Escapes“ veröffentlicht. Die insgesamt sieben Befunde konnten in vier Fehlermodi unterteilt werden: Konfigurationsdateien, die tatsächlich ausführbarer Code sind Sicherheitsregeln, die nur den Namen eines Befehls prüfen, nicht aber, was er tatsächlich tut Sandboxes auf Denylist-Basis, die mit dem Betriebssystem nicht Schritt halten privilegierte lokale Dienste, die sich vollständig außerhalb der Sandbox befinden Top-Artikel Diese Sandbox-Probleme wurden behoben Betroffen waren Cursor, Codex von OpenAI sowie Gemini CLI und Antigravity von Google. Die meisten Schwachstell...

First seen: 2026-07-21 12:25

Last seen: 2026-07-22 07:38