Lühike vastus: ServiceNow CoreAI AutoSynthData muudab agentide ebaõnnestumised ja õpetajate edusammud valideeritud sünteetilisteks SFT-ülesanneteks, kui ettevõtted vajavad keskkonnakompetentsi, mitte ainult laiaulatuslikke võrdlustulemusi. See puhastab lüngad võimekusspetsifikatsiooni kaartideks, korrutab kontrollitavat tööd ja seejärel hindab kvaliteeti enne peenhäälestamist. Autorite teatatud EnterpriseOps Gym tõstab tulemusi, kui õpetaja tugevus, kontrollija kvaliteet ja keskkonna täpsus on kooskõlas.
Peamised järeldused:
Võimekaardid: Salvestage vead kaartidele, et generaatorid ei näeks kunagi algseid ID-sid.
Kontrollija auditeeritavus: Eelista SQL-i lõppseisundi kontrolle, mis lükkavad tagasi muteerunud valed tulemused.
Raskusaste: Treeni ainult ülesandeid, mida sihtrühm harva lahendab ja millega õpetaja tavaliselt hakkama saab.
Inimlik ülevaade: Enne ümberõpet tehke inimese poolt läbivaatus oluliste poliitikate ja pöördumatute toimingute puhul.
Liikuv piir: Pärast SFT-d hinnake uuesti ja nihutage sihtfaasi ülejäänud lünkade suunas.
Ettevõtte tehisintellekti agendid ebaõnnestuvad harva üldteadmiste puudumise tõttu. Nad ebaõnnestuvad keskkonna spetsiifilise olemuse tõttu: piletipoliitikad, skeemi iseärasused, tööriistalepingud, lähtestatud andmebaasid, teadmusartiklid ja süsteemideülesed töövood, mis ei näe välja nagu õpikute demod. Mudel, mis avatud võrdlusalustel hästi punkte saab, võib ikkagi takerduda, kui järgmine samm peab arvestama muudatuste ajakava, CMDB seose või kontrollijaga, mis kontrollib lõppseisundit sujuva vestluse asemel.
ServiceNow CoreAI / ServiceNow-AI avaldas AutoSynthData , et seda lünka otseselt lahendada. Nimetatud autor Esakkivel Esakkiraja kirjeldab torujuhet, mis teisendab sihtagendi ebaõnnestumised – koos tugevama õpetaja edusammudega – valideeritud sünteetilisteks treeningülesanneteks, mis on kohandatud ettevõttekeskkondadele. Asi ei ole rohkemate vestluslogide kogumises, vaid keerulise ja kontrollitava töö mitmekordistamises, mis rakendab sama võimekust uutes tingimustes, et juhendatud peenhäälestus saaks keskkonnaspetsiifilisi lünki sulgeda.
See artikkel käsitleb EnterpriseOps Gymi põhiideed, ülesande abstraktsiooni, genereerimise ja kvaliteedikontrolli tsüklit, jagatud arhitektuuri ning autorite esitatud tulemusi hübriid- ja ITSM-keskkondades. See jääb uuringu kirjelduse juurde: sünteetiliste ülesannete liikuv õppekava, mitte väide, et mõni ettevõte on äkki lahendatud.
Miks keskkonnapädevus on parem kui laiaulatuslik võimekus
Ettevõtted vajavad agente, kes töötavad nende keskkonnas – nende süsteemides, reeglites ja andmete olekus. Laialdased võimalused ei ole sama mis keskkonnapädevus. Agent võib teada, kuidas IT-teenuste haldus tavaliselt toimib, kuid ikkagi mitte märgata kohalikku poliitikat, mis keelab teatud üleminekud, või tööriista, mis värskendab seotud tabelit alles pärast eeltingimuseks oleva kirje olemasolu.
Üksikud ebaõnnestumised on informatiivsed, kuid treeningandmetena õhukesed. Üks katkine trajektoor näitab nõrkust; see ei anna kümneid lähedalasuvaid olukordi, mis õpetaksid mudelit muutuste korral taastuma. Meeskonnad vajavad palju uusi ülesandeid, mis rakendavad sama võimekust erinevalt, jäävad keskkonnas täidetavaks, tunduvad realistlikud kasutaja küsimisel ja on tulemuste kontrollimise abil kontrollitavad.
See on AutoSynthData taga peituv disainirõhk. Ebaõnnestumised muutuvad signaalideks võimekuskaartide jaoks. Kaartidest saavad uute ülesannete generaatorid. Tugevam õpetaja demonstreerib edukaid trajektoore. Filtrid ja kontrollijad otsustavad, mis lisatakse juhendatud peenhäälestuskomplekti. Pärast treenimist nihutab hindamine piiri ülejäänud lünkade poole. Tsükkel on pigem õppekava-kujuline kui ühekordne andmeväljavõte.
Praktikute jaoks on raamistamine oluline. Kui salvestate ainult ebaõnnestunud ülesandeid, riskite nende täpsete üksuste ja fraasidega üle sobitamisega. Kui genereerite ainult piiranguteta sünteetilisi ülesandeid, riskite võimatute, ebareaalsete või kontrollimatute ülesannetega. AutoSynthData asub nende äärmuste vahel: puhastage ebaõnnestunud osa võimekuse spetsifikatsiooniks ja seejärel genereerige ülesanded, mis säilitavad põhituumiku, muutes samal ajal pinnavormi ja kontrollitavaid mõõtmeid.
Praktilise ülesande kuju: süsteem, ülesanne, kontrollija
Agentse töö jaoks on toimiv abstraktsioon järgmine: ülesanne võrdub süsteemi spetsifikatsiooni, kasutaja käsu ja kontrollijaga. Igal elemendil on piirangud, mis hoiavad sünteetilised andmed maandatud ja usaldusväärsed.
Süsteemi spetsifikatsioon hõlmab piiranguid, reegleid ja algseisundit – näiteks andmebaasi algväärtusi ja teadmusartikleid. See peab jääma ühilduvaks saadaolevate tööriistade ja olekuga. Suvalised raskusastmepiirangud, mis eiravad tööriistalepinguid või algväärtuste realismi, kipuvad looma hapraid ülesandeid, mis annavad vale õppetunni.
Kasutajaülesande kvaliteedil on kolm läätse. Teostatavus küsib, kas kehtiv trajektoor eksisteerib. Realism küsib, kas kasutaja seda usutavalt taotleks. Raskusaste küsib, kas ülesanne paljastab agendi praeguse nõrkuse, mitte midagi, mida sihtmärk juba usaldusväärselt lahendab. Sihtmärgi jaoks triviaalne ülesanne raiskab koolituseelarvet; võimatu ülesanne raiskab hindamise usaldust.
Kontrollija kvaliteet sõltub järjepidevusest, usaldusväärsusest ja täielikkusest. Liiga lõdvad ja nõrgad trajektoorid läbivad kontrolli. Liiga piiravad ühe trajektoori ja kehtivad alternatiivsed lahendused ebaõnnestuvad. Ettevõtted eelistavad sageli SQL-põhiseid või olekupõhiseid tulemuskontrolle, sest nad hindavad maailma pärast agendi tegusid, mitte täpset märgiteed, mille agent läbis.
AutoSynthData tugineb sellele kolmikule, nii et genereeritud töö jääb alusetuks. Generaatorid ei leiuta vabalt liikuvaid teste. Nad loovad ülesandeid, mida saab keskkonnaadapteris täita ja mida saab hinnata kontrollijate abil, kes hoolivad nõutavatest lõppseisundi omadustest.
Diagnostilisest hindamisest võimekusspetsifikatsiooni kaartideni
See protsess algab sihtgrupi diagnostilise hindamisega ja tugevama õpetaja kaasamisega vastavasse keskkonda. Kõrvuti toimuvad analüüsid näitavad, kus sihtgrupp ebaõnnestub ja kus õpetajal õnnestub. Need kontrastjuhtumid on õppekava koostamise tooraineks.
Järgmisena toimub destilleerimine puhastatud võimekusspetsifikatsiooni kaartideks. Kaart jäädvustab testitava võimekuse, asjakohased tööriistad või töövoo kuju, kus eesmärk ebaõnnestub ja õpetajal õnnestub, nõutavad lõppseisundi omadused ja mõõtmed, mis võivad uute ülesannete loomisel muutuda. Oluline on see, et generaator ei saa algseid viipasid, üksuseid, trajektoore ega kontrollija üksikasju – ainult kaarte.
See puhastamine on tahtlik ülekomplekteerimise vastane samm. Kui generaator näeks täpseid ebaõnnestunud piletinumbreid, teadmusartiklite ID-sid või õpetaja jälgi, tekiks kiusatus sama episoodi parafraseerida. Kaardid sunnivad abstraktsiooni: õpetatakse võimekust kontrollitava variatsiooni korral, mitte päheõpitud eksemplari.
Pärast kaartide loomist genereerib süsteem nende põhjal uusi ülesandeid. Seejärel demonstreerib õpetaja edukaid trajektoore juhendatud peenhäälestamiseks. Need demonstratsioonid ei ole vabas vormis nõuanded; need on keskkonnapõhised edusammud, mis läbivad samasuguse kontrolli, millest õppekava hoolib.
Kahefaasiline struktuuriskaala. Sihtmärgifaas keskendub lünkade ümbruses olevatele põhilistele kontrollitud valimitele – kõrgeima signaaliga ülesannetele nõrga agendi purunemiskoha lähedal. Korrutamisfaas loob aktsepteeritud sihtmärkidest uusi variante. Korrutatud valimid ei saa edasisi korrutamisringe külvata, mis piirab triivi. See reegel on väike, aga oluline: piiramatu rekursiivne variatsioon võib kaardi nimetatud võimekusest kõrvale kalduda.
Jagatud kontroller, keskkonnaadapter ja liikuv piir
Arhitektuuriliselt kasutab AutoSynthData jagatud kontrollerit ja keskkonnaadapterit. Kontroller juhib diagnoosimist, kaardistamist, genereerimist, õpetajate demosid, kvaliteedikontrolle ja partiide ülevaatamist. Adapter ühendab need etapid konkreetse ettevõtte liivakastiga – tööriistad, olek, poliitikad ja kontrollijad –, nii et sama juhtimisahel saab olla suunatud erinevatele valdkondadele ilma õppekava loogikat nullist ümber kirjutamata.
Pärast juhendatud peenhäälestust hinnatakse torujuhet uuesti. Seejärel liigub õppekava ülejäänud lünkade poole: liikuv piir, mitte staatiline andmestik. Töös kirjeldatud katsed keskenduvad juhendatud peenhäälestamisele. Sama tsükkel võiks hiljem toetada tugevdusõpet; see suund on märgitud planeerituks, mitte ei ole deklareeritud lõppenuks.
Ettevõtete meeskondade jaoks on arhitektuuritund modulaarne. Kontrollerid ei tohiks ühte piletiskeemi kõvakodeerida. Adapterid peaksid pakkuma piisavalt oleku ja tööriista täpsust, et verifitseerijad saaksid olla mõttekad. Õppekava peaks käsitlema hindamistulemusi järgmise sisendina, mitte ühekordse tulemustabelina.
EnterpriseOps Gym on keskkond, kus seda lähenemisviisi illustreeriti. See on suuremahuline ettevõtte agendi töölaud, millel on umbes 1150 ekspertide kureeritud ülesannet kaheksas domeenis, ligikaudu 512 tööriista, umbes 164 andmebaasi tabelit, konteinerdatud teostus, SQL-põhine tulemuste kontrollimine, poliitikapõhised toimingud, hübriidsed domeenidevahelised stsenaariumid, teostamatuse ja keeldumise testimine ning pika horisondi olekuga trajektoorid. AutoSynthData ei ole esitatud kui selle jõusaali leiutaja; jõusaal on sünteesitsükli stresstestimise keskkond.
Proovitaseme kvaliteedikontroll, mis hoiab sünteetilised ülesanded usaldusväärsed
Sünteetilise agendi andmete genereerimine ilma väravateta on see, kuidas need valesti lähevad. AutoSynthData kirjeldab valimi tasemel kvaliteedikontrolli mitmete täiendavate kontrollidega.
Lahendaja raskusastmefilter suunab hulga ülesannete poole, mis on sihtmudeli jaoks rasked ja õpetaja jaoks lahendatavad. Kirjeldatud konfiguratsioon eelistab ülesandeid, mille sihtmudel lahendab maksimaalselt ühel kolmest katsest, samas kui õpetajal õnnestub vähemalt kahel kolmest. Selles vahemikus saavad juhendatud demod õpetada midagi, mida nõrk mudel veel ei valda.
Positiivne verifitseerimine eeldab, et võrdlustrajektoor läbib verifitseerija. Negatiivne verifitseerimine eeldab, et muteerunud valed tulemused nurjuvad. Koos panevad need surve alla nii kontrollija aktsepteerimise kui ka tagasilükkamise poole. Kui kontrollitakse ainult positiivseid tulemusi, võib leebe verifitseerija lubada vale tulemuse. Kui kontrollitakse ainult negatiivseid tulemusi, võib liiga range verifitseerija kehtiva töö tagasi lükata.
Kriitika ja parandamise tsükkel, millel on uuestiproovimise piirang, püüab parandada ülesandeid, mis väravaid ei läbi, selle asemel, et kohe iga peaaegu ebaõnnestunud ülesannet kõrvale jätta. Uuestiproovimise piirang on oluline: lõputu parandamine võib kontrollnimekirja läbimiseks luua üha kunstlikumaid piiranguid.
Partii tasemel metaülevaatus vaatab seejärel kogu komplekti katvuse, mitmekesisuse, koondamise ja ebaõnnestunud eesmärkide osas. Näidisväravad hoiavad üksikute üksuste toimivuse; partii tasemel läbivaatamine hoiab ära õppekava koondumise ühe kitsa ebaõnnestumisviisi ümber või peaaegu duplikaatide kloonimise.
Need kontrollid selgitavad, miks torujuhe võib kulutada tunde tuhandete näidiste tootmisele ilma mahtu sobivuse asendajana käsitlemata. Kiirus erineb valdkonna ja õpetaja suuruse lõikes, kuid kvaliteedikontrolli lugu on järjepidev: raskusaste, positiivne ja negatiivne verifitseerimine, parandamine piirangutega ja seejärel metaülevaade.
Toored vead vs kaardid vs valideeritud SFT-komplektid
See aitab võrrelda, milleks iga artefakt hea on. Toored rikkelogid on diagnostilised. Võimekuskaardid on generatiivsed lepingud. Praktikas treenitakse valideeritud ja juhendatud peenhäälestuskomplektide peal.
| Artefakt | Mida see sisaldab | Tugevus | Risk isoleeritud kasutamisel |
|---|---|---|---|
| Toores rikkelogid | Õpetaja eduga seotud küsimused, seisundid, katkendlikud trajektoorid | Tuvastab tegelikud lüngad elukeskkonnas | Liiga vähe näidiseid; lihtne on üksusi ja fraseeringuid üle sobitada |
| Võimekusspetsifikatsiooniga kaardid | Võimekus, tööriistad või töövoog, ebaõnnestumise või õnnestumise kontrast, lõppseisundi vajadused, muutuvmõõtmed | Generaatorite puhastatud abstraktsioon ilma originaalide lekketa | Ilma kvaliteedikontrollita kaardid võivad ikkagi võimatuid või triviaalseid ülesandeid täita |
| AutoSynthData valideeritud SFT-komplekt | Uued ülesanded ja õpetaja demod, mis läbisid raskusastme, kontrolli ja arvustuse | Skaala realistlikkuse, teostatavuse ja tulemuste kontrollimisega | Sõltub ikkagi õpetaja tugevusest, kontrollija kvaliteedist ja keskkonna täpsusest |
EnterpriseOps Gymi hübriid- ja ITSM-hetktõmmistes kasutati autori teatatud katsetes sihtmärgina Gemma-4-26B-A4B-it. Hübriid sidus selle sihtmärgi õpetajana Qwen3.8-27B-ga ja tootis umbes 18 tunni jooksul umbes 2000 hübriidproovi, parima kontrollpunktiga 5. epohhil. Keskmine Pass@1 tõusis 7,2 protsendipunkti võrra – umbes 35 protsenti võrreldes eelmisega –, kusjuures verifitseerija edukus tõusis 63,01 protsendilt 68,55 protsendile, sulgedes umbes 59 protsenti Pass@1 erinevusest võrdlusmudeliga.
ITSM sidus sama sihtmärgi DeepSeek-V4.1-Flashiga õpetajana ja tootis umbes 1994 näidist umbes 66 tunni jooksul, mis on pikem aeg osaliselt suurema õpetaja ja mõnede torujuhtme optimeerimiste puudumise tõttu. Keskmine Pass@1 tõusis 18,77 protsendilt 27,18 protsendile.
| Domeen | Sihtmärk | Õpetaja | Näidised ja käitusaeg | Autori teatatud tulemus |
|---|---|---|---|---|
| Hübriid | Gemma-4-26B-A4B-it | Qwen3.8-27B | ~2000 proovi ~18 tunni jooksul; parim kontrollpunkti periood 5 | Keskmine tulemus läbitud 1. korral +7,2 pp (~35% suhteline); kontrollija edukus 63,01% kuni 68,55%; ~59% tulemusest läbitud 1. korral võrdlusväärtusega võrreldes suletud |
| IT-teenuste haldamine | Gemma-4-26B-A4B-it | DeepSeek-V4.1-Flash | ~1994 proovi ~66 tunni jooksul | Keskmine läbimise määr 1-l 18,77% kuni 27,18% |
Lugege neid numbreid kui ettevõtte uuringutulemusi selle spordisaali kohta testitud valdkondades – mitte kui sõltumatut kolmanda osapoole replikatsiooni ega universaalset ettevõtte garantiid. Kasu seisneb selles, kus õpetaja tugevus, kontrollija kvaliteet ja keskkonna täpsus on kooskõlas.
Mida praktikud peaksid tsüklist kopeerima
Isegi kui teie pinu ei ole ServiceNow' uurimisvoog, kandub muster üle. Alustage tootmislaadse sihtmärgi ja tugevama õpetaja paarishindamisega usaldusväärses liivakastis. Teisendage kontrastsed tõrked võimekuskaartideks, mis eemaldavad identifikaatorid ja trajektoorid. Genereerige ülesandeid, mis varieerivad lubatud mõõtmeid, säilitades samal ajal nõutavad lõppseisundi omadused. Laske õpetajal demonstreerida edusamme. Määrake raskusastmete, positiivse ja negatiivse verifitseerimise, piiratud paranduse ja partii mitmekesisuse ülevaatuse abil. Peenhäälestage, hinnake uuesti ja nihutage piire.
Pöörake erilist tähelepanu verifitseerija kujundusele. EnterpriseOps Gym-stiilis SQL-tulemuste kontrollid ja poliitikapõhised operatsioonid illustreerivad, miks vestluse rubriigid iseenesest on olekupõhise töö jaoks nõrgad. Kui teie verifitseerija ei suuda eristada muteerunud valesid tulemusi õigetest lõpptulemustest, võimendab sünteetiline skaala müra.
Samuti tuleb järgida korrutusreegli vaimu: aktsepteeritud eesmärkide variandid ei tohiks lõputult uusi variante külvata ilma kontrollitud tuumade juurde tagasi pöördumata. Triiv on vaikne. Õppekava, mis aeglaselt leiutab eksootilisemaid piiranguid, võib siiski läbida pealiskaudsed filtrid, jättes algse võimekuse treenimata.
Lõpuks, käsitle hübriidset valdkondadevahelist tööd esmaklassilise stressijuhtumina. Igapäevased kasutajad ei jää ühte tööriistade silosse kinni. Hübriidülesanded, pika horisondi trajektoorid ning keeldumis- või teostamatustestimine on kohad, kus keskkonnapädevus ilmneb – või ebaõnnestub valjult.
Hoiatused, piirangud ja kasu hoolikas lugemine
Autorite poolt EnterpriseOps Gymi kohta esitatud tulemused on informatiivsed signaalid, mitte üldine garantii. Avaldatud hübriid- ja ITSM-i eelised kehtivad kirjeldatud seadistuse korral nendele valdkondadele ja mudelipaaridele. Muud valdkonnad, nõrgemad õpetajad, mürarikkamad kontrollijad või madalam keskkonna täpsus võivad kasu vähendada või kaotada.
Kvaliteet sõltub kolmest sambast, mida ükski turundusnipp ei saa vahele jätta. Õpetaja tugevus seab demonstratsioonidele ülempiiri. Kontrollija kvaliteet määrab siltide ja filtrite usaldusväärsuse. Keskkonnatruudus määrab, kas õpitud käitumine jääb püsima kokkupuutel tootmissüsteemide, reeglite ja andmete olekuga.
AutoSynthData katsed rõhutavad juhendatud peenhäälestust. Tugevdusõpet on märgitud sama tsükli võimaliku hilisema kasutusena, mis on pigem planeeritud kui esitatud töös teostatud. Lugejad ei tohiks segamini ajada õppekava jaoks valmis andmemootorit lõpetatud RL-koolituse väitega.
Samuti ei tohiks lugejad sünteesitorustikku pingi endaga segi ajada. EnterpriseOps Gym pakub kureeritud ülesandeid, tööriistu, tabeleid, konteineriseerimist ja verifitseerimisstruktuuri. AutoSynthData kasutab sellist keskkonda, et muuta vead koolituskullaks. Mõlemat osa tuleb täpselt hinnata: jõusaal rõhutab agente; torujuhe mitmekordistab õpetatavaid ülesandeid diagnoositud lünkade põhjal.
Samuti pole liivakastis arvutusaja ja kalendriaja osas tasuta lõunat. Hübriidsüntees valmis umbes kahe tuhande näidise puhul tundide suurusjärgus; ITSM võttis kauem aega raskema õpetaja ja varasema torujuhtme kuju tõttu. Meeskonnad peaksid eelarvesse arvestama õpetaja järelduste, kriitika või paranduse uuesti proovimise ja iga õppekava etapi järel uuesti hindamise jaoks.
Õppekava läbimõtlemine ettevõtte agentide meeskondadele
AutoSynthData sügavaim idee on pigem õppekavapõhine kui puhtalt genereeriv. Ebaõnnestumised diagnoosivad. Kaardid abstrakteerivad. Genereerimine korrutab. Kvaliteedikontroll valideerib. SFT uuendab sihtmärki. Ümberhindamine nihutab piire. See jada käsitleb agendi täiustamist keskkonnapõhiste õppetundide jadana, mitte üheainsa võrguühenduseta jälgede kogumina.
Õppekava läbimõtlemine muudab seda, kuidas juhid jaotavad jõupingutusi. Selle asemel, et küsida ainult rohkem pileteid või rohkem inimlikke märkusi, küsige, millised võimed ebaõnnestuvad variatsioonide korral, kas neil võimetel on puhtad lõppseisundi omadused ja kas tugevam õpetaja suudab neid usaldusväärselt demonstreerida. Kui õpetaja ei suuda piisavalt sageli edu saavutada, õpetab sünteetiline SFT ebausaldusväärset käitumist. Kui lõppseisundi omadused on hägused, siis kontrollijad vaidlevad kehtivate strateegiatega.
See muudab ka seda, kuidas edust räägitakse. Hübriidplatvormil võrdlusmudeliga Pass@1 lünga osaline täitmine või autorite hinnangul ITSM Pass@1 taseme tõstmine 10ndate algusest 20ndate algusse on edasiminek mõõdetud keskkonnakompetentsi osas. See ei ole tõend selle kohta, et iga töövoog, iga poliitika või iga keeldumisjuhtum on lahendatud. Säilitage liikuv piiripealne keel: ülejäänud lüngad saavad järgmiseks Targeti etapiks, mitte järelmõtteks.
Programmi kujundamisel tuleks see tsükkel siduda inimese poolt läbivaadatava protsessiga valdkondades, kus panused on kõrged – ohutuspoliitikad, pöördumatud toimingud, reguleeritud andmed –, samal ajal lastes automatiseeritud väravatel täpselt määratletud olekukontrollide puhul kontrolli kanda. Sünteetilised andmed toimivad kõige paremini siis, kui keskkond saab SQL-laadse selgusega öelda jah või ei. See on keeruline, kui edu sõltub subjektiivsest maitsest.
Kujundusmärkmed raskusastme, realismi ja keeldumise kohta
Raskusastme määramine väärib teistkordset kaalumist. Ülesannete eelistamine, mida sihtrühm lahendab maksimaalselt kolmandiku ajast, hoiab koolituse eemal tühiasjadest. Õpetaja nõudmine, et ta saavutaks edu vähemalt kahel kolmandikul ajast, hoiab demod mündiviskest eemal. See vahemik on praktiline kompromiss väljakutse ja õppimise vahel.
Reaalsus on endiselt leebem kriteerium, kuid siiski oluline. Ettevõtte kasutajad küsivad asju, mis sobivad nende rollide ja süsteemidega. Ainult raskusastmest juhinduvad generaatorid suudavad välja mõelda keerukaid mitme piiranguga mõistatusi, mida ükski operaator ei küsiks. Muutuvaid dimensioone loetlevad võimekuskaardid aitavad, kuid inimesed või metaülevaatajad peavad ikkagi sürreaalseid ülesandeid tabama.
Keeldumise ja teostamatuse testimine, mis on osa EnterpriseOps Gymi laiemast disainist, tuletavad meeskondadele meelde, et pädevus hõlmab ka ei ütlemist. Ainult täidetavate ülesannete jaoks optimeeritud torujuhe võib keeldumist alatreenida. AutoSynthData-stiilis tsüklite laiendamisel lisage kaardid, mille õige lõplik omadus on poliitika alusel ohutu keeldumine, mitte ainult andmebaasi oleku edukas mutatsioon.
Pika horisondi olekuga trajektoorid tõstatavad veel ühe disainimärkuse. Õpetajate demod peavad jääma sidusaks paljude tööriistakõnede puhul. Kontrollijad, mis kontrollivad ainult viimast tabelirida, võivad vahele jätta vahepealsed poliitikakatkestused. Kontrollija disaini täielikkus tähendab omaduste katmist, mis tegelikult määravad selle võimekuse edukuse – sealhulgas piirangud, mis peavad jääma kehtima kogu protsessi vältel, mitte ainult lõpus.
Lõppkokkuvõte
AutoSynthData, mis pärineb ServiceNow CoreAI / ServiceNow-AI platvormilt ja mille avalikus artiklis kirjutas Esakkivel Esakkiraja, on kanal, mis muudab sihtagentide tõrked ja õpetajate edusammud valideeritud sünteetilisteks treeningülesanneteks ettevõttekeskkondade jaoks. See abstraheerib tõrked puhastatud võimekusspetsifikatsiooni kaartideks, genereerib uusi ülesandeid ilma algseid viipeid või trajektoore lekkimata, kogub õpetajate demonstratsioone ning jõustab enne juhendatud peenhäälestust näidis- ja partiitaseme kvaliteedikontrolli.
Praktiline mentaalne mudel on ülesanne kui süsteemi spetsifikatsioon, kasutajaküsimus ja kontrollija – kusjuures teostatavus, realistlikkus ja raskusaste on pinge all ning kontrollijad ei ole liiga lõdvad ega ühele rajale fikseeritud. Sihtmärk-siis-korruta etapid, edasise seemneta reegel korrutatud valimite jaoks, jagatud kontroller koos keskkonnaadapteriga ning SFT-järgne ümberhindamine loovad liikuva piiri ülejäänud lünkade kohal.
EnterpriseOps Gymis näitavad autori poolt Gemma-4-26B-A4B-it ja Qwen3.8-27B abil saadud hübriidtulemused umbes kaheksateistkümne tunni jooksul ligikaudu kahte tuhandet valimit ning märkimisväärset Pass@1 ja verifitseerija edukuse tõusu, mis vähendab oluliselt vahet võrdlusmudeliga. ITSM, kus õpetajana on DeepSeek-V4.1-Flash, näitab, et Pass@1 tõuseb pikema aja jooksul umbes 1994 valimi põhjal 18,77 protsendilt 27,18 protsendile. Käsitlege neid numbreid uuritud signaalidena konkreetsetes valdkondades, mis sõltuvad õpetajast, verifitseerijast ja keskkonna täpsusest – ning hoidke tugevdusõpet tsükli planeeritud pikendusena, mitte lõpliku väitena.
Kui mäletate ühte lauset: ettevõtteagendid arenevad siis, kui tõrked muutuvad abstraktseteks, korrutatuks ja kontrollitud õppetundidena süsteemides, mida nad peavad igapäevaselt kasutama – mitte siis, kui meeskonnad lihtsalt sama vigast piletit kordavad.
Praktiline näide: ITSM-i keeruliste juhtumite laiendamine külmutatud jõusaalilaadsest rikete komplektist
Stsenaarium
Suurbritannia ettevõtte platvormi meeskond – näiteks keskmise suurusega finantsteenuste operatsioonide rühm, mis käitab ServiceNow-stiilis ITSM-i koos muudatuste akende, CMDB-suhete ja poliitikapõhiste üleminekutega – kasutab tootmislaadset agenti, mis komistab pidevalt sama tööklassi otsa: risttabelite värskendused, mis peavad vastama kinnituseeltingimusele, teadmusartiklite otsingud, mis on vastuolus kohalike muudatuste külmumistega, ja hübriidpäringud, mis ületavad ITSM-i külgnevatesse operatsioonide tööriistadesse.
Nad külmutavad privaatse EnterpriseOps Gym-stiilis paketi (konteineriseeritud liivakast, SQL-i tulemuste kontrollid, seemnetabelid, poliitikareeglid), nii et tulemused on nädalate kaupa võrreldavad. Diagnostilised käivitamised näitavad, et sihtagent ebaõnnestub, samas kui tugevam õpetaja õnnestub. Juhtkond soovib rohkem koolitussignaali ilma samu piletinumbreid ja üksuste ID-sid uuesti esitamata. AutoSynthData (või samaväärne sünteesi-riketest-tsükkel, kui uurimistorustik on nende pinus suletud) on kandidaat: teisendab kontrastvead puhastatud võimekusspetsifikatsiooni kaartideks, genereerib uusi ülesandeid, kogub õpetajate demosid ja seejärel – enne ümberõpetamist – vaatab inimene kriitiliselt üle sünteetilised jäljed.
Gym Pass@1-ga ei kaasne midagi iseseisvalt. Sünteesitud andmeid käsitletakse kandidaatide õppekavana, mitte tasuta tõena.
Mida assistent vajab
- Juurdepääs külmutatud jõusaalilaadsele keskkonnaadapterile: tööriistad, algväärtus, poliitikad ja SQL-i (või samaväärsed olekupõhised) kontrollijad.
- Paarishindamise logid: eesmärkide ebaõnnestumised võrreldes õpetaja edusammudega samades ülesannetes.
- Kaardiskeem, mis jäädvustab võimekuse, tööriistade/töövoo kuju, ebaõnnestumise/edukuse kontrasti, nõutavad lõppseisundi omadused ja lubatud variatsioonimõõtmed – ilma algsete viipade, üksuste, trajektooride või kontrollija sisemiste osadeta.
- PII ja poliitikate puhastusreeglid (pileti ID-d, kasutajanimed, konfiguratsiooniandmete nimed, reguleeritud väljad) enne, kui midagi liivakastist lahkub või generaatori viibale jõuab.
- Inimese loodud sünteetiliste ülesannete ja õpetaja jälgede ülevaatamise järjekord (teostatavus, realism, kontrollija usaldusväärsus, keeldumise/teostamatuse juhtumid).
- Tühjad peatumistingimused: sihtimis- ja seejärel korrutamisfaasid; korrutatud proovid ei külva edasisi korrutamisringe.
Näidisjuhis
Platvormi müügivihje õppekava operaatorile (või orkestreerimisassistendile, kes ainult koostab kaarte ja vaatab pakette üle – ta ei koolita mudeleid ümber ega eduta neid):
„Käivitage külmutatud ITSM-i ja hübriidviilude diagnostika Pass@1 meie praeguse sihtmärgi ja määratud õpetaja suhtes. Iga kontrasti puhul, kus sihtmärk ebaõnnestub ja õpetaja õnnestub vähemalt kahel kolmest katsest, koostage puhastatud võimekusspetsifikatsiooni kaart: nimetage võimekus, loetlege asjakohased tööriistad, märkige nõutavad lõppseisundi omadused ja loetlege kontrollitavad mõõtmed (prioriteediriba, seotud CI-klass, muutmisakna lipp, teadmiste konflikti tüüp). Eemaldage piletinumbrid, kasutajaidentifikaatorid, CI-nimed ja toored trajektoorid. Genereerige ainult nende kaartide põhjal uute ülesannete sihtfaasi partii. Laske õpetajal demonstreerida edusamme. Rakendage raskusastet (sihtmärk ≤1/3, õpetaja ≥2/3), positiivset ja negatiivset verifitseerimist ning piiratud kriitikat/parandust. Koostage 5% kihistunud valimitest koosnev ülevaatepakett pluss iga keeldumise/teostamatuse kaart. Ärge alustage SFT-d enne, kui kaks retsensenti on paketi allkirjastanud ja PII puhastuskontrollid on läbinud. Pärast kandidaadi kontrollpunkti SFT-d hinnake uuesti külmutatud komplekti ja täpse vaste komplekti, mida me kunagi genereerimiseks ei kasutanud. Esitage aruanne rikkeklassi ja regressioonimäära järgi võrreldes eelmise tootmise kontrollpunktiga. Ärge reklaamige edasi.“ "Jõusaali punktisumma iseenesest."
Kuidas seda testida
- Baasjoone lukustus: salvestage külmutatud komplekti Pass@1 ja kinnitaja edukuse määrad veaklassi järgi (eeltingimuslik tellimine, muutmisakna keeldumine, hübriidne risttööriist, teadmiste konflikt). Hoidke komplekt ja seemned tsükli vältel muutmatuna.
- Kaardi audit: kontrollige pisteliselt, et generaatorid ei saaks kunagi originaalseid viipasid, üksusi ega õpetaja jälgi – ainult kaarte.
- Näidis-kvaliteedikontroll: Veenduge, et positiivsed trajektoorid läbivad kontrolle ja muteerunud valed tulemused ei läbi. Lükake tagasi ülesanded, mis on sihtmärgi jaoks triviaalsed või õpetaja jaoks mündiviske tüüpi.
- Inimeste poolt üle vaadatud: retsensendid märgivad iga näidise teostatavuse, realistlikkuse ja poliitikaohutuse alusel säilitatavaks/parandatavaks/mittearvestatavaks. Jälgige retsensentidevahelist kokkulepet jagatud alamhulga osas.
- Täpne vaste salvestusväljale: pärast kandidaadi SFT-d hinnake reaalsete (või eelnevalt külmutatud) ülesannete salvestusväljale vastamist, mida pole kunagi kaardistamise või genereerimise sisenditena kasutatud. Pindmise meeldejätmise tuvastamiseks hinnake eraldi treeningülesannete peaaegu parafraasitud versioone.
- Regressioonivärav: iga rikkeklass, mis eelmise tootmise kontrollpunktiga võrreldes halveneb, blokeerib edasiliikumise kuni selle selgitamiseni või parandamiseni.
Tulemus
Ära mõtle siin välja küpsetusprotsente. Kasuta mõõtmisplaani ja märgi avaldatud uurimistulemused tsiteerides ARTIKLILE PÕHINEVA VÄITENA.
Mõõtmisplaan (mida see meeskond peaks esitama):
- Veaklasside hõlmatus: diagnoositud lünkklasside osakaal, mis andsid pärast kvaliteedikontrolli ≥N aktsepteeritud sihtfaasi ülesannet (määrake N ette, nt 20 aktsepteeritud ülesannet klassi kohta).
- Täpne vaste kaitsest: Pass@1 / verifitseerija edu puutumata kaitsest enne ja pärast kandidaadi SFT-d (samad seemned, sama verifitseerija).
- Regressioonimäär: rikkeklasside arv, kus Pass@1 langeb võrreldes eelmise tootmise kontrollpunktiga; blokeerige, kui mõni ohutuskriitiline klass regressiooni esineb.
- Arvustuste saagis: säilita / paranda / langemismäärad inimeste arvustuspakis; kui langemismäär tõuseb, peata korrutamine ja paranda kaarte või kontrollijaid.
- Puhastusvead: enne ülevaatuse kinnitamist PII/poliitika kontrolli läbinud näidiste arv (eesmärk: SFT-komplekti ei pääse ükski näidis).
ARTIKLI VÄIDE (autori esitatud EnterpriseOps Gymi põhjal - mitte selle meeskonna mõõdetud tulemus): Hübriidtestid, mille sihtmärgiks oli Gemma-4-26B-A4B-it ja õpetajana Qwen3.8-27B, andsid umbes 18 tunni jooksul umbes 2000 näidist, kusjuures keskmine Pass@1 tõusis umbes 7,2 protsendipunkti ja kontrollija edukus langes 63,01%-lt 68,55%-le. ITSM, mille õpetajana oli DeepSeek-V4.1-Flash, tõstis pikema aja (~66 tunni) jooksul keskmise Pass@1 väärtuse 18,77%-lt 27,18%-le umbes 1994 näidise põhjal. Käsitlege neid uuritud signaalidena konkreetsete domeenide ja paaride kohta, mitte universaalse garantiina Ühendkuningriigi tootmispinu jaoks.
Illustreeriv programmi ülesehitus (eeldused, mitte mõõdetud kasum): kui meeskond aktsepteerib ühe ITSM-tsükli kohta ~2000 kvaliteedikontrolliga kontrollitud valimit, eelarvestab õpetaja järeldused ja ülevaatuse 5% kihistunud valimi alusel ning edendab ainult siis, kui õppetöö katkestamine ei mõjuta ohutuskriitilisi klasse, siis saavad nad otsekoheselt väita, et tulemuseks on protsessi küpsus – auditeeritud õppekava, puhastatud jäljed ja võrreldavad külmutatud komplektide deltad –, mitte lubatud protsentuaalne tõus.
Mis võib valesti minna
- Sünteesi käsitlemine vaba tõena: inimese poolt ülevaatamise või negatiivse kontrolli vahelejätmine võimaldab leebetel kontrollijatel prügi ulatuslikult tunnistada.
- Üksuse leke: originaalsete piletitunnuste või õpetaja jälgede sisestamine generaatorisse kutsub esile parafraaside ülepaigutamise; selle vältimiseks on olemas kaardid.
- Piiramatu korrutamine: Korrutatud valimite edasiste voorude käivitamine kaldub nimetatud võimekusest kõrvale.
- Jõusaali skoori saatmine: reklaamitakse, kuna külmutatud sviidi Pass@1 arv tõusis, samal ajal kui ooteaja või tootmise varikliikluse arv halvenes.
- Nõrk õpetaja lagi: kui õpetaja ei suuda ületada ≥2/3 eduvahemikku, õpetab SFT ebausaldusväärseid demosid.
- Hägusad kontrollijad: Vestlusrubriigid osariigipõhiste kontrollide asemel hindavad sujuvalt valesid lõputöid edukaks.
- Alatreeningust keeldumine: Ainult lõpuleviidavate mutatsioonide optimeerimine jätab muutuste akna ja poliitika langused hapraks.
- PII põgenemine: sünteetilised viipad, mis pärast pealiskaudset puhastamist uuesti päris CI-d või kasutajanimesid sisestavad.
Praktiline kaasavõetav toit
Kasutage AutoSynthData-stiilis tsükleid – või samaväärset sünteesi-riketest-mustrit, kui ServiceNow CoreAI konveier pole teie rendipinnal saadaval –, et korrutada diagnoositud lünkadest pärinevaid raskesti kontrollitavaid ITSM-juhtumeid. Puhastage võimekuskaartideks, suunake raskusastmete ja positiivse/negatiivse kontrolliga andmed, eemaldage isikuandmeid ja inimeste poolt läbivaadatud näidiseid enne SFT-d. Mõõtke rikkeklassi ulatust, täpset vastet ja regressioonimäära. Viidake ARTIKLI VÄITELE Gym-i arvudele ainult välise uurimistöö kontekstina. Sünteesiandmed on õppekava kütus, mitte garantii: auditeerige näidiseid, hoidke komplekt õiglase võrdluse tagamiseks külmutatult ja ärge kunagi saatke Gym-i skoori eraldi.
KKK
Mis on AutoSynthData ja millist probleemi see lahendab?
AutoSynthData on Esakkivel Esakkiraja kirjeldatud ServiceNow CoreAI / ServiceNow-AI torujuhe, mis koondab sihtagendi ebaõnnestumised ja tugevama õpetaja võidud valideeritud sünteetilisteks treeningülesanneteks ettevõttekeskkondades. See keskendub keskkonnapädevusele – kohalikele poliitikatele, skeemidele, tööriistadele ja olekule –, mitte laiadele üldteadmistele. Asi on selles, et mitmekordistada rasket ja kontrollitavat tööd, et juhendatud peenhäälestamine saaks parandada keskkonnaspetsiifilisi lünki, selle asemel et sama katkist piletit uuesti mängida.
Miks erineb keskkonnapädevus laiaulatuslikust mudelivõimekusest?
Ettevõtte agendid komistavad sageli keskkonna enda eripära tõttu: piletipoliitikad, skeemi iseärasused, tööriistalepingud, lähtestatud andmebaasid ja süsteemidevahelised töövood. Mudel, mis avatud võrdlusalustel tugev tundub, võib siiski hanguda muudatuste aknas, CMDB-suhtes või lõplikku olekut kontrollivas kontrollijas. Lai võimekus ei ole sama, mis teadmine, kuidas teie süsteemid, reeglid ja andmete olek käituvad poliitikaga reguleeritud üleminekute korral.
Millist ülesande kuju AutoSynthData praktises vormis kasutab?
Toimiv kuju on ülesanne, mis võrdub süsteemi spetsifikatsiooniga, kasutaja küsimusega ja kontrollijaga. Süsteemi spetsifikatsioon sisaldab piiranguid, poliitikaid ja algseisundit, näiteks andmebaasi algväärtusi ja teadmusartikleid. Kasutaja küsimused hinnatakse teostatavuse, realistlikkuse ja raskusastme järgi. Kontrollijad tuginevad ideaalis SQL-põhistele või olekupõhistele tulemuskontrollidele, et nad hindaksid maailma pärast agendi tegevust, mitte ainult täpset läbitud märgiteed.
Kuidas puhastatud võimekusspetsifikatsiooni kaardid takistavad ülepaigutamist?
Diagnostilised katsed võrdlevad sihtmärki ebaõnnestumise ja õpetaja eduga ning seejärel destilleerivad need juhtumid puhastatud võimekusspetsifikatsiooni kaartideks. Kaardile salvestatakse võimekus, tööriistad või töövoo kuju, ebaõnnestumise/edu võrdlus, nõutavad lõppseisundi omadused ja mõõtmed, mis võivad varieeruda. Generaator ei näe kunagi algseid viipasid, üksuseid, trajektoore ega kontrollija üksikasju – ainult kaarte –, seega avaldavad uued ülesanded survet südamikule ilma meelde jäetud episoodi parafraseerimata.
Millised on torujuhtme siht- ja korrutamisfaasid?
Sihtfaas keskendub lünkade ümbruses olevatele kontrollitud põhiproovidele – kõrgeima signaaliga ülesannetele nõrga agendi purunemiskoha lähedal. Korrutusfaas arendab aktsepteeritud sihtmärkide uusi variante. Korrutatud proovid ei saa edasisi korrutusringe käivitada, mis hoiab nimetatud võimekusest kõrvalekaldumise kontrolli all. Pärast juhendatud peenhäälestust nihutab ümberhindamine õppekava ülejäänud lünkade suunas liikuva piirina, mitte staatilise prügimäena.
Kuidas tagab valimi tasemel kvaliteedikontroll sünteetiliste ülesannete usaldusväärsuse?
Lahendaja raskusastme filter eelistab ülesandeid, mille sihtmärk lahendab maksimaalselt ühes kolmest katsest, samas kui õpetajal õnnestub vähemalt kahes kolmest. Positiivse verifitseerimise läbimiseks on vaja võrdlustrajektoori; negatiivse verifitseerimise läbikukkumiseks on vaja muteerunud valesid tulemusi. Kriitika- ja parandustsükkel uuesti proovimise limiidiga püüab parandada peaaegu ebaõnnestumisi ning partii tasemel metaülevaatus kontrollib ulatust, mitmekesisust, koondamist ja ebaõnnestunud eesmärke kogu komplektis.
Millist arhitektuuri AutoSynthData ettevõtte domeenides kasutab?
See seob jagatud kontrolleri keskkonnaadapteriga. Kontroller käivitab diagnostika, kaardistamise, genereerimise, õpetaja demod, kvaliteedikontrollid ja partiide ülevaatuse. Adapter ühendab need etapid konkreetse liivakastiga – tööriistad, olek, poliitikad ja kontrollijad –, nii et sama juhtimisahel saab osutada erinevatele valdkondadele ilma õppekava loogikat nullist ümber kirjutamata.
Mis on EnterpriseOps Gym selles uurimiskontekstis?
EnterpriseOps Gym on suurettevõtte agentide platvorm, mida kasutatakse stressitestimise platvormina, pakkudes umbes 1150 ekspertide kureeritud ülesannet kaheksas domeenis, ligikaudu 512 tööriista, umbes 164 andmebaasi tabelit, konteinerdatud teostust, SQL-põhist tulemuste kontrollimist, poliitikapõhist operatsioonisüsteemi, hübriidstsenaariume ja pika horisondi olekuga trajektoore. AutoSynthData ei ole müügil kui selle platvormi leiutaja; platvormil näidatakse sünteesitsüklit tegevuses.
Millised autorite teatatud tulemused kuvatakse hübriid- ja ITSM-sätete puhul?
EnterpriseOps Gymis töötab hübriid, mille sihtmärgiks on Gemma-4-26B-A4B-it ja õpetajana Qwen3.8-27B, ning tootis umbes 18 tunni jooksul umbes 2000 näidist, kusjuures keskmine läbilaskevõime (Pass@1) tõusis umbes 7,2 protsendipunkti ja kontrollija edukus langes 63,01%-lt 68,55%-le. ITSM, mille õpetajana on DeepSeek-V4.1-Flash, tõstis pikema aja jooksul umbes 1994 näidise põhjal keskmise läbilaskevõime (Pass@1) 18,77%-lt 27,18%-le. Neid tuleks käsitleda uuritud signaalidena konkreetsete paaride puhul, mitte universaalse tootmisgarantiina.
Milliseid vigu peaksid meeskonnad sünteesi-riketest-tsüklite kasutamisel vältima?
Ärge käsitlege sünteetilisi andmeid tasuta tõena ega jätke vahele inimeste ülevaatust ja negatiivset kontrolli. Vältige originaalpiletite ID-de või õpetajate jälgede sisestamist generaatorisse, mitmekordsete näidiste edasist levikut või Gym Pass@1-s iseseisvalt reklaamimist, samal ajal kui ooteaeg või varitsusliiklus halveneb. Jälgige ka nõrku õpetajaid edukuse vahemikus, hägusaid vestlusrubriike osariikide kontrollide asemel, alakoolituse saanud õpetajate keeldumisi ja isikuandmete pääsemist pärast pealiskaudset läbikukkumist.
Viited
- Kallistav Nägu — AutoSynthData — huggingface.co
- EnterpriseOpsi jõusaal — enterpriseops-gym.github.io
- arXiv — arxiv.org
- GitHub — EnterpriseOps-Gym — github.com