Ein KI-Agent kann ein Ticketsystem bedienen und trotzdem an einem bestimmten Ablauf scheitern: Er übersieht eine Berechtigung, ruft Werkzeuge in der falschen Reihenfolge auf oder meldet Erfolg, obwohl der Datensatz unverändert ist. Einzelne Fehler lassen sich untersuchen. Schwieriger ist es, daraus genug sinnvolle Aufgaben für ein gezieltes Nachtraining zu gewinnen.
ServiceNow CoreAI hat am 2. Oktober 2026 mit AutoSynthData ein Verfahren beschrieben, das genau dafür neue Trainingsaufgaben erzeugt. Es vergleicht die Fehlschläge eines Zielmodells mit den Lösungen eines stärkeren Lehrermodells, formuliert daraus neue Aufgaben und prüft, ob diese in einer ausführbaren Unternehmensumgebung tatsächlich lösbar sind. Als Testumgebung nutzt das Team EnterpriseOps Gym, einen schon im März vorgestellten Benchmark für Agenten in Unternehmensabläufen. Neu sind das Trainingsverfahren und die damit erzielten Ergebnisse.[1][2]
Fehler werden zu neuen Aufgaben
Zunächst lösen Ziel- und Lehrermodell diagnostische Aufgaben in derselben Umgebung. Aus den Unterschieden leitet das System ab, welche Fähigkeit dem Zielmodell fehlt und woran eine erfolgreiche Lösung zu erkennen wäre. Die Aufgaben des Tests gehen dabei nicht einfach als Kopie in den Trainingssatz ein: Der Generator erhält abstrahierte Beschreibungen der Fähigkeiten, aber nicht die ursprünglichen Aufgabenformulierungen, Entitäten oder Lösungswege.[1]
Aus einer solchen Beschreibung entstehen neue Aufgaben mit einer Systemvorgabe, einer Nutzeranfrage und einem Prüfer für den erreichten Zustand. Ein Beispiel wäre ein IT-Vorgang, bei dem ein Agent erst Berechtigungen prüfen und dann mehrere Einträge passend ändern muss. Für das überwachte Nachtraining liefert das Lehrermodell eine erfolgreiche Abfolge von Aktionen. Nach einer ersten Runde geprüfter Aufgaben erzeugt AutoSynthData weitere Varianten mit veränderten Ausgangszuständen, Formulierungen und Werkzeugkombinationen. Jede Variante muss erneut die Prüfungen bestehen.[1]
Entscheidend ist der Prüfer: Eine plausibel klingende Antwort darf nicht reichen, wenn der Agent die erforderliche Änderung nicht vorgenommen hat. AutoSynthData führt deshalb die vorgesehene Lösung aus und kontrolliert den resultierenden Zustand. Zusätzlich verändert es erwartete Ergebnisse gezielt, um festzustellen, ob der Prüfer auch falsche Zustände ablehnt. Fehlerhafte Aufgaben können nach einer Diagnose überarbeitet und nochmals getestet werden. Das System achtet außerdem darauf, dass der Trainingssatz nicht mit vielen ähnlichen Fällen aus einer einzigen Aufgabenklasse gefüllt wird.[1]
Diese Kontrollen kosten Aufwand, verhindern aber einen naheliegenden Fehler beim Training mit synthetischen Daten: Ein Modell soll keine Aufgaben lernen, deren vermeintliche Musterlösung in der betreffenden Umgebung gar nicht funktioniert. Im beschriebenen Versuchsaufbau bevorzugt ServiceNow Aufgaben, die das Zielmodell in höchstens einem von drei Anläufen löst, während der stärkere Löser mindestens zwei von drei Versuchen schafft. Die Schwierigkeit richtet sich damit nach dem aktuellen Modell und kann nach einer Trainingsrunde neu bestimmt werden.[1]
Verbesserungen in zwei Testumgebungen
In der Hybrid-Domäne von EnterpriseOps Gym trainierte das Team Gemma-4-26B-A4B-it mit 2.000 so erzeugten Beispielen nach; als Lehrer diente Qwen3.8-27B. Nach Angaben von ServiceNow stieg der mittlere Pass@1-Wert des besten Checkpoints um 7,2 Prozentpunkte. In der ITSM-Domäne entstanden 1.994 Beispiele mit DeepSeek-V4.1-Flash als Lehrer. Dort erhöhte sich der mittlere Pass@1-Wert von 18,77 auf 27,18 Prozent. Pass@1 beschreibt hier, wie oft eine Aufgabe beim ersten Versuch gelöst wird; die Zahlen stammen aus den Tests des entwickelnden Teams in dessen Benchmark-Umgebung.[1]
EnterpriseOps Gym simuliert zustandsabhängige Arbeitsabläufe mit Werkzeugen und Datenbankeinträgen. Das zugrunde liegende Paper erschien bereits im März 2026, und der zugehörige Benchmark-Datensatz ist öffentlich zugänglich. Der Link auf diesen Datensatz ist nicht mit einer Veröffentlichung der im AutoSynthData-Versuch neu erzeugten Trainingsbeispiele gleichzusetzen.[2][3]
Für Teams, die Agenten an interne Abläufe anpassen, ist vor allem die Kopplung von Datenerzeugung und ausführbarer Erfolgskontrolle interessant. Wer einen Agenten beispielsweise für Ticketbearbeitung nachtrainieren möchte, braucht mehr als realistisch formulierte Tickets: Die Testumgebung muss zulässige Aktionen, Ausgangszustände und überprüfbare Endzustände abbilden. Der ServiceNow-Beitrag zeigt Verbesserungen in zwei solchen Umgebungen, aber noch nicht, ob dieselben Gewinne bei anderen Systemen, Modellen oder im laufenden Unternehmensbetrieb auftreten. Auch die Qualität des Prüfers bleibt entscheidend: Wenn er falsches Verhalten akzeptiert, kann der Trainingsprozess gerade dieses Verhalten verstärken.[1]
Fazit
AutoSynthData macht aus beobachteten Schwächen eines Agenten neue, ausführbare Trainingsfälle. Die gemessenen Fortschritte in EnterpriseOps Gym sprechen dafür, dass dieser Ansatz beim gezielten Nachtraining helfen kann. Für den Einsatz im Unternehmen ist die eigentliche Hürde aber nicht allein das Erzeugen vieler Aufgaben. Die Umgebung und ihre Prüfer müssen zuverlässig unterscheiden können, ob der Agent den Auftrag tatsächlich erfüllt hat.[1]
Quellen
[1] ServiceNow CoreAI, „AutoSynthData: Generating Training Data for Enterprise Agents“, 2. Oktober 2026: https://huggingface.co/blog/ServiceNow-AI/autosynthdata
[2] Malay et al., „EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings“, arXiv, März 2026: https://arxiv.org/abs/2603.13594
[3] ServiceNow-AI, EnterpriseOps-Gym-Datensatz: https://huggingface.co/datasets/ServiceNow-AI/EnterpriseOps-Gym