Jatmo
Jatmo („Jack of all trades, master of one“) ist ein Forschungsansatz für eng abgegrenzte Sprachaufgaben wie Klassifikation, Zusammenfassung oder Übersetzung. Statt ein instruktionsfähiges Modell mit einer Aufgabe und unzuverlässigen Daten zu prompten, erstellt Jatmo ein Modell, das nur diese Aufgabe ausführt und keine allgemeine Instruktionsfähigkeit erhalten soll.1 Entwickelt wurde der Ansatz von Forschenden der UC Berkeley und der King Abdulaziz City for Science and Technology; die finale Konferenzfassung erschien 2024 bei ESORICS.2
Funktionsweise
Jatmo beginnt mit einem nicht instruktionsfeinabgestimmten Basismodell. Für eine festgelegte Aufgabe erzeugt ein instruktionsfähiges Lehrermodell zu harmlosen Eingaben Zielausgaben; anschließend wird das Basismodell auf diese Ein-/Ausgabe-Paare feinabgestimmt.1 Im Betrieb erhält das entstandene Spezialmodell nur die Daten, nicht mehr die allgemeine Aufgabenanweisung. Die Schutzidee lautet daher nicht, eine verdächtige Anweisung zu erkennen, sondern die Fähigkeit zum beliebigen Befolgen von Anweisungen gar nicht für den Laufzeitpfad vorzusehen.1
Wenn kein Datensatz vorhanden ist, beschreibt das Paper eine synthetische Erzeugung von Beispielen durch ein Lehrermodell, teils aus einem einzelnen Beispiel oder allein aus der Aufgabenbeschreibung.1 Die veröffentlichte Python-Implementierung bietet dafür die Funktionen jatmo für Eingabedaten und jatmo_synthetic für die synthetische Variante. Ihre Dokumentation verlangt Python 3.9 sowie einen OpenAI-API-Schlüssel.3 Damit ist Jatmo eher eine Trainingspipeline als ein Guardrail: Nach dem Training wird das spezialisierte Modell in den Anwendungspfad integriert.
Einsatz in der Praxis
Sinnvoll ist Jatmo dort, wo die Aufgabe stabil, testbar und eng definiert ist. Ein System zur Stimmungsanalyse, Klassifikation oder standardisierten Extraktion kann seine Aufgabe als Modellverhalten festschreiben und Eingabetext anschließend als Daten verarbeiten. Jede fachliche Erweiterung, jede neue Ausgabeform und jede weitere Aufgabe verlangt jedoch ein separates Modell samt Datensatz, Qualitätsabnahme und Betriebspfad.1 Für offene Assistenz, wechselnde Nutzerziele, mehrstufige Agenten oder Chat ist das Konzept ungeeignet, weil dort die Instruktion selbst zur Laufzeit variabel ist.1
Der Projektstand ist klar von einer Produktversion zu trennen: Die offizielle GitHub-API listet keine Releases, führt das Repository als nicht archiviert und nennt den letzten Push am 11. April 2024.4 Das README enthält ein Forschungs-Setup und historische Ergebnisbeispiele mit damaligen OpenAI-Modellbezeichnungen, aber keine aktuelle Support- oder Kompatibilitätszusage.3 Es gibt damit weder ein veröffentlichtes Preismodell noch einen dokumentierten Managed-Service; die Kosten ergeben sich vielmehr aus eigener Datenaufbereitung, Training, Inferenz und gegebenenfalls den verwendeten Lehrermodell-APIs.1
Grenzen
Die Verfasser:innen benennen die zentrale Grenze ausdrücklich: Pro einzigartiger Aufgabeninstruktion wird ein eigenes Modell benötigt, was einen anfänglichen Feinabstimmungsaufwand erzeugt und interaktive Chats ausschließt.1 Ihre Versuche über sieben Aufgaben berichten für die jeweils getesteten Angriffe weniger als 0,5 Prozent Erfolg gegenüber 87 Prozent bei GPT-3.5-Turbo; das ist eine Autor:innenangabe und keine allgemeine Immunitätsaussage.1 Die Metrik zählt zudem vor allem das Befolgen der eingeschleusten Aufgabe, nicht sämtliche Folgen einer falschen, unvollständigen oder qualitativ schwachen Ausgabe.
Eine unabhängige Preprint-Studie von 2025 testete Jatmo-artig feinabgestimmte LLaMA- und Qwen-Modelle auf einer Zusammenfassungsaufgabe mit systematisch variierten Eingaben. Sie fand gegenüber einem instruktionsfähigen Vergleichsmodell deutlich geringere, aber nicht verschwindende Erfolgsraten und berichtete zugleich einen Zielkonflikt zwischen Zusammenfassungsqualität und Widerstandsfähigkeit.5 Der Befund ist methodisch nicht deckungsgleich mit dem Originalpaper und kein Produkt-Audit, genügt aber als Warnung gegen die Annahme, Spezialisierung sei allein eine vollständige Abwehr. Externe Berechtigungsgrenzen, Output-Validierung und eine risikobasierte Architektur bleiben auch bei Jatmo erforderlich.
Lizenz und Bezug
Für das öffentliche Repository ist keine Lizenz ausgewiesen: Die offizielle Repository-Metadatenantwort enthält im Feld license keinen Eintrag, und in der gelisteten Wurzelebene erscheint keine Lizenzdatei.4 Das ist keine freie oder kommerzielle Lizenzangabe; vor einer Übernahme von Code oder Gewichten sollten Organisationen daher eine ausdrückliche Nutzungsfreigabe der Rechteinhaber einholen. Das wissenschaftliche Paper selbst steht auf arXiv unter CC BY-NC-SA 4.0, was nicht automatisch eine Softwarelizenz für das Repository ersetzt.1
Quellen
- Piet et al., „Jatmo: Prompt Injection Defense by Task-Specific Finetuning“, 08.01.2024, https://arxiv.org/html/2312.17673 ↩
- Piet et al., „Jatmo: Prompt Injection Defense by Task-Specific Finetuning“, 05.09.2024, https://link.springer.com/chapter/10.1007/978-3-031-70879-4_6 ↩
- Wagner Group, „wagner-group/prompt-injection-defense – README“, abgerufen am 20.08.2026, https://github.com/wagner-group/prompt-injection-defense ↩
- GitHub, „wagner-group/prompt-injection-defense – Repository metadata and releases“, abgerufen am 20.08.2026, https://api.github.com/repos/wagner-group/prompt-injection-defense und https://api.github.com/repos/wagner-group/prompt-injection-defense/releases ↩
- Suri und McCrae, „Securing Large Language Models (LLMs) from Prompt Injection Attacks“, 01.12.2025, https://arxiv.org/html/2512.01326v1 ↩