prompt injections.de
Glossar

Feintuning

Feintuning passt ein bereits vortrainiertes Modell mit zusätzlichen Daten an eine Aufgabe, Domäne oder Verhaltensvorgabe an. Anders als In-Context-Learning verändert dieser Prozess die Modellgewichte; die Wirkung bleibt deshalb über die einzelne Eingabe hinaus erhalten, bis das Artefakt erneut trainiert oder ersetzt wird. Für KI-Sicherheit ist Feintuning zweischneidig: Es kann Widerstand gegen Prompt Injection gezielt verbessern, kann bestehende Sicherheitsausrichtung aber auch schwächen.

Einordnung

Die entscheidende Abgrenzung lautet: Feintuning ist kein bloßes Umschreiben des Systemprompts, sondern Eingriff in das Modellartefakt. Das betrifft auch die Lieferkette, wenn Adapter, Trainingsdaten oder bereits angepasste Modelle von Dritten stammen. Qi und Kollegen berichten, dass wenige adversarial gestaltete Trainingsbeispiele die Sicherheitsausrichtung untersuchter Modelle beeinträchtigen konnten; sie fanden außerdem eine geringere, aber nachweisbare Verschlechterung nach Feintuning mit gutartigen, verbreiteten Datensätzen.1 Die Befunde sind evaluationsgebunden, widerlegen aber die Annahme, dass ein zuvor sicherheitsausgerichtetes Basismodell diesen Zustand automatisch vererbt.

Der Begriff ist auch von Datenvergiftung zu unterscheiden. Datenvergiftung bezeichnet die manipulierte oder unzuverlässige Datenbasis als Angriff oder Integritätsproblem. Feintuning ist dagegen zunächst ein legitimer Anpassungsprozess. Wird seine Datenbasis absichtlich manipuliert, kann Feintuning ein Einfallsweg für Datenvergiftung oder eine Backdoor sein. Umgekehrt kann defensives Feintuning das Modell darauf trainieren, legitime Instruktionen von instruktionsähnlichen Daten zu unterscheiden.

Dokumentiertes Beispiel

StruQ ist ein Beispiel für sicherheitsorientiertes Feintuning. Die Arbeit formatiert Prompt und Daten in separaten Bereichen und ergänzt Trainingsdaten um Fälle mit Instruktionen im Datenbereich; das Modell soll diese Dateninstruktionen ignorieren. Die Autoren berichten eine deutlich bessere Resistenz gegen ihre getesteten Prompt-Injection-Angriffe bei geringem oder keinem Nutzenverlust.2 SecAlign verfolgt einen anderen Weg: Es trainiert Präferenzen zwischen sicheren Ausgaben, die der legitimen Anweisung folgen, und unsicheren Ausgaben, die einer Injektion folgen. In der dort berichteten Evaluation lagen Erfolgsraten verschiedener Prompt-Injection-Angriffe unter zehn Prozent, auch für nicht im Training beobachtete Varianten.3

Bedeutung für die Abwehr

Aus diesen Arbeiten folgt weder, dass Feintuning ein endgültiger Schutz ist, noch dass es grundsätzlich vermieden werden sollte. Betreiber sollten Training, Adapter und Daten wie sicherheitskritische Artefakte behandeln: Herkunft und Version erfassen, Datensätze prüfen, das Modell vor und nach dem Training gegen denselben Testkatalog messen und Ergebnisse versioniert dokumentieren. Wichtig sind getrennte Metriken für Fachnutzen, normale Sicherheitsablehnungen und Injektionsresistenz. Werden Drittanbieter-Adapter oder -Modelle übernommen, gehört die Prüfung in die Lieferkette. Feintuning ist dann ein kontrollierter Sicherheitsbaustein – nicht der Beleg, dass eine Anwendung nachträglich automatisch sicher bleibt.

Quellen

  1. Xiangyu Qi et al., „Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!“, 5. Oktober 2023, https://arxiv.org/abs/2310.03693
  2. Sizhe Chen et al., „StruQ: Defending Against Prompt Injection with Structured Queries“, 25. September 2024, https://arxiv.org/abs/2402.06363
  3. Sizhe Chen et al., „SecAlign: Defending Against Prompt Injection with Preference Optimization“, 3. Juli 2025, https://arxiv.org/abs/2410.05451