prompt injections.de
OWASP LLM Top 10

Unbegrenzter Ressourcenverbrauch (LLM06)

Unbegrenzter Ressourcenverbrauch liegt vor, wenn eine LLM-Anwendung übermäßige oder unkontrollierte Inferenz zulässt und dadurch Verfügbarkeit, Kosten oder Modellschutz gefährdet.1 OWASP nennt als Folgen Denial of Service, wirtschaftliche Verluste, Serviceverschlechterung und die Preisgabe von Modellinformationen beziehungsweise Modelldiebstahl.1 Anders als bei einem klassischen Auslastungsproblem ist die relevante Ressource nicht nur Rechenzeit: Bei nutzungsbasierten Modellen können auch Token, Agentenschritte, Tool-Aufrufe und Warteschlangen unmittelbar budgetwirksam sein.1

Worum es geht

LLM-Inferenz ist variabel teuer. Länge und Struktur der Eingabe, erwartete Antwortlänge, gewählte Modellklasse, parallele Aufrufe sowie agentische Folgeaktionen beeinflussen die Ressourcenaufnahme.1 OWASP führt deshalb Input-Floods variabler Länge, kontinuierliche Kontextüberläufe und besonders rechenintensive Abfragen als Risikomuster auf.1 Ein Risiko besteht auch ohne erkennbar böswilligen Text: Schlecht begrenzte Schleifen, Wiederholungen oder Fehlerpfade können in agentischen Anwendungen Arbeitsschritte immer weiter fortsetzen.1

Der Begriff „Denial of Wallet“ beschreibt die ökonomische Seite. Werden viele kostenpflichtige Operationen ausgelöst, kann die Rechnung steigen, während der Dienst für reguläre Nutzerinnen und Nutzer langsamer oder nicht erreichbar wird.1 Diese Wirkung ist nicht an einen bestimmten Cloud-Anbieter gebunden, sondern ergibt sich aus fehlenden technischen und organisatorischen Grenzen. Das BSI betont allgemein, dass generative KI neue Risiken erzeugen und bekannte IT-Sicherheitsbedrohungen verstärken kann; ein risikobasierter Betrieb muss daher Kosten, Verfügbarkeit und missbrauchsrelevante Zugriffsrechte gemeinsam betrachten.2

Typische Ausprägungen

Ein naheliegender Fall sind massenhafte, lange oder wiederholt abgebrochene Anfragen, die Kapazitäten oder Budget beanspruchen. OWASP empfiehlt als Reaktion Eingabegrenzen, Timeouts, Throttling, Ressourcenmanagement sowie umfassendes Logging und Anomalieerkennung.1 In agentischen Systemen kommen kumulative Risiken hinzu: Einzelne Tool-Aufrufe mögen begrenzt sein, doch eine große Zahl von Schritten oder wartenden Aktionen kann trotzdem unkontrolliert wachsen.1 Deshalb ist ein Limit pro API-Request allein keine hinreichende Schutzgröße.

Ein dokumentierter Vorfall zeigt zudem, wie leicht Limitkontrollen durch Privilegienfehler entwertet werden können. Sourcegraph berichtete 2023, dass ein Angreifer einen versehentlich veröffentlichten Site-Admin-Token nutzte, um API-Limits für wenige Benutzer zu erhöhen; nach der Mitteilung erlaubte eine Proxy-Anwendung Aufrufe der APIs und die Nutzung des zugrunde liegenden LLM.3 Das ist kein Beleg für einen generischen LLM-Denial-of-Wallet-Angriff. Der Fall illustriert aber, dass Rate Limits nur wirken, wenn Verwaltungszugänge, Tokens und die Logik zur Limitänderung gleichermaßen geschützt und überwacht werden.3

Modell-Extraktion ist eine zweite Dimension. Carlini und Mitautoren zeigten 2024 in einer Forschungsarbeit, dass sich bei typischem API-Zugang präzise, nicht triviale Informationen aus Black-Box-Sprachmodellen gewinnen lassen; sie berichteten unter anderem die Wiedergewinnung der Embedding-Projektionsschicht bis auf Symmetrien und konkrete Kostenschätzungen für damalige Modelle.4 Diese spezifische Demonstration beweist weder die vollständige Extraktion aller heutigen Modelle noch rechtfertigt sie die Offenlegung detaillierter Abfrageverfahren. Sie begründet jedoch, warum unkontrollierte API-Exposition zugleich Betriebs- und Schutzrisiko sein kann.4

Bezug zu Prompt Injection

Prompt Injection ist nicht identisch mit Ressourcenverbrauch, kann die Kostenwirkung aber verstärken. Wenn ein manipulierter Kontext ein Modell dazu bringt, unnötig viele Tool-Aufrufe anzustoßen oder seine Aufgabe ohne Abbruch fortzusetzen, wird aus einem Kontrollverlust in der Anwendungslogik ein Verbrauchsproblem.1 OWASP führt Prompt-Injection-Techniken im Zusammenhang mit API-basierter Modell-Extraktion als möglichen Faktor an und empfiehlt zugleich Sandboxing, Zugriffskontrollen und Begrenzungen der LLM-Umgebung.1 Die relevante Architekturgrenze liegt damit nicht im Prompt allein, sondern an Berechtigungen, Budgets und Zustandsübergängen des gesamten Workflows.1

Gegenmaßnahmen

Wirksame Kontrollen sind mehrschichtig und messbar. OWASP empfiehlt Rate Limits und nutzerbezogene Kontingente, Größenlimits für Eingaben, Timeouts, dynamische Ressourcensteuerung, Monitoring und eine kontrollierte Degradation unter Last.1 In der Praxis sollten diese Regeln je Identität, Mandant, API-Schlüssel und gegebenenfalls Zahlungs- oder Risikoklasse gelten. Zusätzlich braucht es harte Obergrenzen für Ausgabetoken, parallele Jobs, Tool-Aufrufe, Agentenschritte und Warteschlangen. Ein sichtbares Budget mit Alarm- und Sperrschwellen begrenzt nicht nur Missbrauch, sondern auch Fehlkonfigurationen.

Für Modellschutz rät OWASP, detaillierte Wahrscheinlichkeitswerte in API-Antworten nur im erforderlichen Umfang offenzulegen und Zugriffe nach dem Least-Privilege-Prinzip zu kontrollieren.1 Der Sourcegraph-Fall zeigt, dass diese Ebene auch administrative Mechanismen einschließen muss: Geheimnisse gehören nicht in Quellcode, Erhöhungen von Limits brauchen nachvollziehbare Freigaben, und ungewöhnliche Verbrauchsmuster müssen zeitnah untersucht werden.3 Schließlich ist ein Abbruchkriterium für Agenten kein Komfortmerkmal, sondern eine Sicherheitskontrolle. Eine Verbindung aus Schrittbudget, Zeitbudget, Kostenbudget, kontrollierter Tool-Zulassung und Schutz gegen unerwartete Eingaben bietet eine überprüfbare Verteidigung, ohne für einzelne Anbieter eine unbelegte Wirksamkeitsgarantie zu behaupten.1

Quellen

  1. OWASP GenAI Security Project, „LLM06:2026 Unbounded Consumption“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
  2. Bundesamt für Sicherheit in der Informationstechnik, „Generative KI-Modelle: Chancen und Risiken für Industrie und Behörden“, 21. Januar 2025, https://www.bsi.bund.de/SharedDocs/Downloads/DE/BSI/KI/Generative_KI-Modelle.html
  3. Sourcegraph, „Security update: Incident involving unauthorized admin access“, 30. August 2023, https://sourcegraph.com/blog/security-update-august-2023
  4. Nicholas Carlini et al., „Stealing Part of a Production Language Model“, 11. März 2024, https://arxiv.org/abs/2403.06634