prompt injections.de
Glossar

Halluzination

Eine Halluzination ist eine Ausgabe eines Sprachmodells, die plausibel klingt, aber sachlich falsch, unbegründet oder nicht durch die verfügbare Evidenz gedeckt ist. OWASP beschreibt den Fall als statistisches Auffüllen von Wissenslücken ohne tatsächliches Inhaltsverständnis.1 Eine Halluzination ist kein Angriff und beweist für sich genommen keine Prompt Injection.

Einordnung

Für die KI-Sicherheit ist die Abgrenzung zentral. Prompt Injection beschreibt eine unerwünschte Beeinflussung des Modellverhaltens durch Eingaben; Halluzination bezeichnet dagegen einen Fehler der erzeugten Antwort. Beide können im selben Vorfall auftreten: Unvertrauenswürdiger Kontext kann eine falsche Behauptung begünstigen, während die sprachliche Überzeugungskraft der Ausgabe die Ursachenanalyse erschwert. OWASP führt Misinformation deshalb als eigenes LLM-Risiko und unterscheidet die Modellfehler von menschlichem Übervertrauen in die Ausgabe.1

RAG kann Antworten mit überprüfbaren Quellen anreichern, beseitigt Halluzinationen aber nicht automatisch. Auch ein abgerufener Text kann unvollständig, veraltet, unberechtigt oder widersprüchlich sein. Die belastbare Frage lautet daher nicht, ob eine Antwort flüssig formuliert ist, sondern ob eine Behauptung auf eine passende, zulässige und nachvollziehbare Quelle zurückgeführt werden kann. Fehlt diese Grundlage, ist Unsicherheit auszuweisen statt durch erfundene Details zu überdecken.

Dokumentiertes Beispiel

Jiang und Kollegen untersuchten 2024 faktische Fragen, bei denen Sprachmodelle nach der Analyse der Autoren die richtige Antwortkenntnis repräsentierten, jedoch trotzdem falsche Antworten erzeugten. Die Arbeit fand Unterschiede in den Wahrscheinlichkeitsdynamiken der Ausgabetoken zwischen korrekten und halluzinierten Fällen; ein darauf trainierter Klassifikator erreichte im untersuchten Setting 88 Prozent Erkennungsrate.2 Das ist ein konkreter Forschungsbeleg dafür, dass falsche Ausgaben nicht nur aus fehlendem Trainingswissen folgen. Die Kennzahl ist nicht als universelle Qualitätsaussage über Halluzinationsdetektoren zu lesen.

Bedeutung für die Abwehr

Abwehrmaßnahmen verbinden Quellenbindung, faktische Prüfung und begrenzte Folgewirkung. In kritischen Arbeitsabläufen sollten Systeme Herkunft und Abrufgrundlage sichtbar machen, Behauptungen gegen vertrauenswürdige Quellen prüfen und bei fehlender Evidenz keine automatischen Folgeaktionen auslösen. OWASP empfiehlt dafür geprüfte externe Wissensquellen, menschliche Aufsicht und Faktenprüfung.3 Für die Vorfallanalyse müssen außerdem Prompt, abgerufener Kontext, Modellversion und Ausgabe nachvollziehbar protokolliert werden. So lässt sich unterscheiden, ob eine falsche Antwort aus fehlerhafter Evidenz, einer Kontextmanipulation oder aus dem Generierungsverhalten hervorging. Diese Unterscheidung schützt auch die Reaktion auf einen Vorfall: Nicht jede falsche Ausgabe verlangt denselben Fix, und nicht jede Injektion führt zwingend zu einer Halluzination.

Quellen

  1. OWASP, „LLM07:2026 Misinformation“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
  2. Jiang, Che et al., „On Large Language Models’ Hallucination with Regard to Known Facts“, Juni 2024, https://aclanthology.org/2024.naacl-long.60/
  3. OWASP, „LLM07:2026 Misinformation“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/