ServiceNow CoreAI prezentuje AutoSynthData — system zamieniający słabości agentów AI w kontrolowane dane treningowe dla firmowych środowisk.

Źródło zdjęcia: huggingface.co
AutoSynthData to nowy system opracowany przez zespół ServiceNow CoreAI, który ma rozwiązać jeden z najbardziej palących problemów wdrażania agentów AI w firmach: modele mogą być ogólnie bardzo zdolne, ale wciąż zawodzić w konkretnym środowisku korporacyjnym — przy określonym workflow, kombinacji narzędzi albo regule, którą ignorują. Artykuł, opublikowany 2 października 2026 roku przez autorów Esakkivela Esakkiraję, Shruthana Radhakrishnę, Denisa Akhiyarova i Sagara Davasama, opisuje metodologię zamiany takich słabości w dane treningowe.
Problem, który rozwiązuje AutoSynthData, nie jest trywialny. Pojedynczy przypadek porażki agenta mówi coś o jego ograniczeniach, ale wytrenowanie modelu wymaga wielu nowych zadań, które ćwiczą tę samą umiejętność w różnych sytuacjach. Zadania te muszą jednocześnie być wykonalne w danym środowisku, przypominać realną pracę, o którą poprosiłby użytkownik, i mieć wiarygodny sposób weryfikacji, czy agent faktycznie się z nich wywiązał.
Autorzy definiują środowisko agentowe jako świat, w którym agent działa: stan, który może obserwować i modyfikować, narzędzia i API, które może wywoływać, oraz przejścia stanu wynikające z jego działań. Zadanie jest w tym środowisku instancjonowane jako trójka: specyfikacja systemu, prompt użytkownika i weryfikator.
Specyfikacja systemu definiuje ograniczenia, w których agent operuje — instrukcje systemowe, polityki środowiska oraz, gdy ma to zastosowanie, inicjalizację specyficzną dla zadania, na przykład zasiany stan bazy danych lub zestaw artykułów wiedzy. Musi być zgodna z narzędziami, stanem i wspieranymi akcjami środowiska, a jej instrukcje powinny być jasne i nie zawierać arbitralnych ograniczeń wprowadzonych wyłącznie po to, by zadanie było sztucznie trudniejsze.
Prompt skierowany do agenta musi spełniać trzy warunki. Pierwszy to wykonalność — musi istnieć przynajmniej jedna ścieżka w bieżącym środowisku, która realizuje prośbę użytkownika z zachowaniem specyfikacji systemu; to wyklucza zadania zależne od niedostępnych narzędzi czy zabronionych akcji. Drugi warunek to realizm — prompt powinien przypominać coś, co użytkownik rzeczywiście mógłby zlecić w docelowym środowisku, ponieważ przestrzeń możliwych do wykonania zachowań jest zwykle znacznie większa niż przestrzeń realistycznych zadań. Trzeci to trudność — zadanie powinno ujawniać słabość obecnego agenta, bo zadania już rozwiązywane niezawodnie dają niewielki nowy sygnał treningowy. Użyteczny obszar to więc zadania wykonalne i realistyczne, ale jeszcze nie rozwiązywane konsekwentnie.
Weryfikator, trzeci element trójki, musi być zgodny z promptem użytkownika, specyfikacją systemu i stanem środowiska specyficznym dla zadania (konsystencja), musi odrzucać trajektorie, które nie spełniają zadania lub naruszają istotne ograniczenia (rzetelność), oraz musi akceptować poprawne rozwiązania, a nie wymuszać jednej konkretnej trajektorii referencyjnej (kompletność). Te właściwości mają bezpośrednie znaczenie podczas treningu — zbyt pobłażliwy weryfikator może nagradzać błędne zachowanie, a zbyt restrykcyjny karać poprawne rozwiązania.
Mając środowisko i model docelowy, AutoSynthData generuje zadania treningowe złożone ze specyfikacji systemu, promptu użytkownika i weryfikatora, które są zakotwiczone w środowisku i wybrane tak, by dawały użyteczny sygnał treningowy dla aktualnej wersji modelu. System najpierw ocenia model docelowy w środowisku za pomocą zadań diagnostycznych i identyfikuje wzorce zadań, z którymi model sobie nie radzi. Silniejszy „nauczyciel” pomaga ustalić, które z tych zadań są w ogóle rozwiązywalne i jak wygląda poprawne zachowanie. AutoSynthData zamienia wykryte braki kompetencyjne w nowe, wykonywalne zadania, sprawdza każde z nich w środowisku i wykorzystuje zaakceptowane próbki do post-treningu. Ocena zaktualizowanego modelu pokazuje, które braki pozostały, i może kierować kolejną rundą generowania.
W eksperymencie na środowisku EnterpriseOps Gym autorzy uruchamiali zarówno model docelowy, jak i silniejszego nauczyciela na zadaniach ewaluacyjnych. Analizując te przebiegi, identyfikowali testowaną umiejętność, narzędzia i strukturę workflow, w którym model docelowy zawodzi, a nauczyciel odnosi sukces, właściwości, które musi spełniać poprawny stan końcowy, oraz wymiary, które mogą się zmieniać przy zachowaniu testowanej umiejętności.
Te ustalenia zostają skondensowane w „oczyszczone karty specyfikacji kompetencji” (sanitized capability specification cards). Istotne jest, że zadania ewaluacyjne wskazują, czego model powinien się nauczyć, ale generator nie otrzymuje ich oryginalnych promptów, encji, trajektorii czy szczegółów weryfikatora — dostaje tylko karty i na ich podstawie tworzy nowe zadania z innymi promptami, stanami i ścieżkami rozwiązania. To podejście pozwala uniknąć mechanicznego powielania wcześniejszych przypadków testowych i zamiast tego zbudować szerszy zestaw zadań ćwiczących tę samą kompetencję w nowych wariantach.
Podejście opisane przez ServiceNow CoreAI wpisuje się w szerszy trend budowania agentów AI, które potrafią się samodoskonalić na podstawie własnych błędów — podobny kierunek obrano w projekcie AREX-2, skupionym na zadaniach długoterminowych. Firmy wdrażające agentów we własnych środowiskach, z unikalnymi systemami, politykami i danymi, od dawna borykają się z tym, że ogólnie zdolne modele potrzebują dodatkowego dotrenowania do specyficznych workflow — problem, który dotyczy coraz szerszej fali agentów AI zalewających miejsca pracy, dla których firmy wciąż nie są w pełni przygotowane.
Zgodnie z opisem autorów, kluczową zaletą AutoSynthData jest to, że cykl generowania zadań nie jest statyczny — przesuwa się w stronę kompetencji, które model wciąż opanowuje słabo, zamiast powielać zadania już rozwiązane. Taka iteracyjna pętla ewaluacja-generowanie-trening może, w teorii, pozwolić przedsiębiorstwom skalować dostosowywanie agentów do własnych systemów bez konieczności ręcznego projektowania każdego nowego scenariusza testowego.
Podsumowując, AutoSynthData proponuje systematyczną metodę przekształcania konkretnych słabości agenta AI w środowisku korporacyjnym w kontrolowane, weryfikowalne dane treningowe, co może przyspieszyć praktyczne dostosowywanie modeli do realnych, firmowych workflow.

Asus ProArt z Nvidia RTX Spark ma uruchamiać lokalnie agentów AI, zastępując chmurowe usługi i płatne abonamenty na komputerze.

CATL i Tencent inwestują w rundę Deepseek wartą do 15 mld dolarów. Chiński startup AI planuje debiut giełdowy na początku 2027 roku.

Microsoft i Hugging Face udostępnili ThinkingBox — benchmark oceniający agentów AI na podstawie stanu bazy danych, nie treści odpowiedzi.