Sandbox
Eine Sandbox ist eine isolierte Ausführungsumgebung, die den möglichen Zugriff eines Prozesses auf Daten, Netzwerk, Betriebssystemfunktionen und Rechenressourcen beschränkt. Bei KI-Agenten dient sie insbesondere dazu, von einem Modell erzeugten oder zusammengestellten Code auszuführen, ohne ihm stillschweigend Zugang zur produktiven Umgebung oder zu Zugangsdaten zu geben.1
Einordnung
Eine Sandbox ist eine Ausführungs-, keine Inhaltskontrolle. Sie entscheidet nicht, ob ein Modell eine Prompt Injection erkannt hat, ob eine Antwort wahr ist oder ob ein Tool-Aufruf fachlich sinnvoll ist. Sie begrenzt vielmehr die Folgen, wenn Modellcode fehlerhaft, manipuliert oder unnötig weitreichend ist. Damit ergänzt sie Sichere Ausgabeverarbeitung, Least Privilege und Netzwerkrichtlinien. OWASP beschreibt unsachgemäße Ausgabeverarbeitung als Übergangspunkt, an dem LLM-Ausgaben in nachgelagerten Systemen unter anderem XSS, serverseitige Request Forgery oder Remote Code Execution verursachen können.2
„Container“ und „Sandbox“ sind nicht synonym. Ein Container ist eine Verpackungs- und Virtualisierungstechnik; ob er tatsächlich wirksam isoliert, hängt von Konfiguration, Berechtigungen, Mounts, Netzwerk und Laufzeit ab. NIST beschreibt Container als Betriebssystemvirtualisierung mit Anwendungspaketierung und behandelt ihre Sicherheitsrisiken ausdrücklich als Gegenstand eigener Kontrollen.3 Für Agenten ist eine Sandbox ausreichend erst dann, wenn der reale Zugriffspfad begrenzt ist: temporäres Dateisystem, kein direktes ausgehendes Netz, keine übergebenen Secrets, feste CPU-, Speicher- und Laufzeitgrenzen sowie ein eng kontrollierter Vermittler für unvermeidliche Tool-Aufrufe.
Dokumentiertes Beispiel
Die MCP-Leitlinie zu programmgesteuerten Tool-Aufrufen beschreibt eine Architektur, in der modellgenerierter Code in einer Sandbox läuft, Tool-Funktionsaufrufe vom Host vermittelt werden und nur ein zusammengefasstes Ergebnis an das Modell zurückkehrt. Sie empfiehlt ausdrücklich, der Sandbox keinen direkten Netzwerkzugang zu geben und Zugangsdaten beim Host statt im generierten Code zu halten.1 Das ist ein dokumentiertes Entwurfsmuster der Protokoll-Dokumentation, kein Nachweis, dass jede Codeausführung automatisch sicher ist.
Bedeutung für die Abwehr
Eine wirksame Sandbox folgt dem Prinzip „default deny“. Der Prozess startet ohne Netzverbindung, produktive Dateisystem-Mounts, Cloud-Metadatenzugriff oder Umgebungsvariablen mit Secrets. Benötigte Aktionen laufen über einen Broker, der pro Aufruf Herkunft, Ziel, Parameter, Berechtigung und gegebenenfalls menschliche Freigabe prüft. Die MCP-Leitlinie fordert für diese Vermittlung zudem pro Tool-Aufruf Autorisierung, Begrenzung von Zeit und Speicher sowie Filterung der Konsolenausgabe.1 Eine Sandbox ersetzt nicht die Prüfung von Modelloutput vor der Übergabe an andere Systeme; sie macht jedoch aus einer möglichen Codeausführung einen begrenzten Vorgang. Gerade bei Agenten ist diese Trennung zentral: Das Modell darf planen, aber nicht unmittelbar über Infrastruktur und Geheimnisse verfügen.
Quellen
- Model Context Protocol Contributors, „Client Best Practices“, 28. Juli 2026, https://modelcontextprotocol.io/docs/2026-07-28/develop/clients/client-best-practices. ↩
- OWASP Foundation, „LLM10:2026 Improper Output Handling“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. ↩
- Murugiah Souppaya, John Morello und Karen Scarfone, „Application Container Security Guide (NIST SP 800-190)“, September 2017, https://csrc.nist.gov/pubs/sp/800/190/final. ↩