Lühike vastus: CLM-8B on avatud kontrastiivne keelemudel , mis on suunatud kiiretele agentide otsustele ja mille autorite väitel on latentsusaeg kuni umbes 9 korda madalam kui Jev-klassi konkurentidel. Need arvud jäävad väljaspool väljalaske seadistust kinnitamata. Kodeerimisagentide loomisel tehke enne graafikute usaldamist A/B-testimist omaenda süsteemis.
Peamised järeldused:
Latentsusaja väited: käsitlege ~9× Jevi kiirendust autori teatatud väärtusena, kuni teised seda reprodutseerivad.
Eval rakmed: Hoidke tööriistad ja juhised fikseerituna A/B testimise ajal CLM-8B-s.
Hübriidpinu: Kasutage CLM-i kuumade tsüklite jaoks; hoidke aeglasemat arutlusprogrammi uute ülesannete jaoks.
Avatud kaalud: Enne kommertskahvlite saatmist kontrollige Apache litsentsifaile.
Väärkasutuse oht: Avage pöörduvad tööriistad ja saladused, kui agendid otsustavad millisekundites.
Mida CLM-8B üritab olla ⚡
Kontrastiivse keelemudeli treenimine, nagu seda langust propageerivad inimesed kirjeldavad, seisneb pigem olekute ja tegevuste ühendamises kui järgmise märgi tõenäosuse eraldi maksimeerimises. Selgelt öeldes: mudelit suunatakse kaardistama „siin on olukord“ „siin on käik“-ga, pigem nagu poliitikakujundaja kui romaanikirjanik. See on Süsteemi 1 analoogia, mille poole uurijad pidevalt püüdlevad – kiire, assotsiatiivne, otsustuspõhine –, vastandina Süsteemi 2 pikale mõtteahelale, mis põletab märke, samal ajal valjusti mõeldes.
CLM-8B on selle reas esimene avalik kaalukomplekt. See on positsioneeritud avatud uurimisväljaandena, millel on Apache 2.0 litsents langusega kaasnenud kajastusele, mis on oluline, kui soovite seda täpsustada, müüa või edasi arendada ilma juristi piknikuta. Jacky Kwok tutvustas tööd; Azalia Mirhoseinivõimendas seda; ja laiem raamistik annab edasi Stanfordi ja NVIDIAga seotud meeskonnatööd. Nimelised teadlased, avalikud kaalud, avatud kood – mitte anonüümne leke. Kolmandate osapoolte replikatsiooniks on veel vara, seega hoidke skeptitsismi skaala kuskil "huvitava" ja "näidake mulle sõltumatut juhatust" vahel.
Suurusklass on kaheksa miljardit parameetrit, mis on piisavalt väike, et laborid ja sõltumatud kaarditootjad saaksid seda 100 tunni jooksul majutada ilma neeru müümata. Juba on juttu suuremast CLM-35B järeltulijast. Kas see suurem vend säilitab latentsusaja loo või vahetab kiiruse sügavuse nimel, jääb lahtiseks, kuid tegevuskava on selge: see on mõeldud perekonna, mitte ühekordse demokaardina.
- Fookus: olek → agentide tegevustsüklid, mitte essee kirjutamine
- Litsentsimine, mis on väljalaske ajal kajastatud Apache 2.0-na
- Stiil: Süsteem 1 / otsustuskeskne koolituslugu
- Järeltegevus: plaanina mainiti suuremat CLM-35B-d
Süsteemi 1 stiil vs tavaline žetoonjooksulint
Enamik teadaolevaid õigusteaduse magistriõppe programme genereerivad teksti üks token korraga. See toimib suurepäraselt proosa, koodiväljavõtete ja hoolika arutluskäigu puhul. See on ka põhjus, miks agent, mis vajab minutis kakskümmend mikrootsust, võib tunduda loid isegi siis, kui mudel on "tark". Iga samm maksab autoregressiivse maksu.
Kontrastiivse keelemudeli (Kontrastive Language Model) esitlus pöörab rõhuasetuse ümber. Selle asemel, et paluda võrgul end vastuseni jutustada, treenite seda eelistama õiget tegevust antud olekus – mõelge kontrastiivsetele tõmmetele heade ja halbade käikude vahel, mitte lihtsalt sujuvatele jätkudele. Keelemudeli ehitajad juba teavad mustrit: mõnikord ei ole vaja tuhandesõnalist põhjendust; mudeli jaoks on vaja pytesti, mitte rm -rf-i. Kiired tsüklid hoolivad sellest eristusest.
See ei tähenda, et CLM-8B ei saaks teksti välja anda. See tähendab, et koolituse eesmärk ja hindamislugu kalduvad agentide kontrolli poole. See on teistsugune tootevorm kui „vestlusmudel, mis saab ka tööriistade kutsumist“. Tööstusharu on aastaid veetnud mudeleid tööriistadest rääkimise paremaks muutmisega, tekitades samal ajal vestluses endas kitsaskohti. Otsustuspõhine mudel on selline külgmine liikumine, mis kas tundub tagantjärele ilmne või kukub läbi, kui võrdlusalused sassi lähevad. Mõlemad tulemused on võimalikud.
Väidetav kiirus ja katsestendil saavutatud tulemused (käsitleda väidetena)
Siin on see osa, mis sotsiaalmeedia postitusi suunab: promootorid väidavad kuni umbes 9 korda kiiremat järeldust kui Jev-klassi mudelid. Pärast kerget peenhäälestust teatavad nad ka tugevatest agentiivse kodeerimise tulemustest - DeepSWE edukus on umbes 81,6% ja Terminal-Bench 2.1 umbes 87,6%. Mõnes hinnangus kirjeldavad nad null-shot-jõudlust Jeviga võrreldavana, samas kui latentsus jääb palju madalamaks. Üks klastri kokkuvõte, mis hõljus koos väljalaske vestlusega, mainis terminali testi seadetes umbes 32 ms-klassi reageerimisaega. Sõnastage see hoolikalt: teatatud ja väidetud, mitte selles artiklis sõltumatult auditeeritud.
Kui need latentsusarvud üldistuvad, on praktiline võit vähem GPU-sid samaaegse agendi kohta või rohkem agente GPU kohta. Kodeerimisagendid, mis kesta purustavad, on eriti tundlikud, kuna ooteaeg on pidevalt muutuv; 200 ms ja 30 ms otsus tunduvad mõnesaja pöörde järel erinevate toodetena. Kasutajad süüdistavad sageli "mudeli rumalust", kui teravam probleem on interaktiivne viivitus.
Sellegipoolest – ja see on täiskasvanute järelevalve lõik – autoripingid turustavad seni, kuni keegi teine neid jagatud riistvaral ühiste viipadega reprodutseerib. Kerged peenhäälestustulemused võivad varjata ka palju tellinguid. Tugevad DeepSWE ja Terminal-Benchi numbrid on põnevad just seetõttu, et need komplektid karistavad hapraid agente, kuid põnevus ei ole replikatsioon. Hoidke kleepmärkmeid, millel on 9× ja 32 ms-klassi numbri kohta kiri CLAIM.
Võrdlustabel: Token-by-Token LLM-id vs CLM-stiilis raamimine
Tabelid aitavad, kui turunduskeel muutub ebamääraseks. See tabel võrdleb tüüpilisi õigusteaduse magistriõppe (LLM) genereerimise harjumusi kontrastiivse keelemudeli looga, nagu teadlased seda kirjeldavad. Lahtrid on taotluslikult veidi ebaühtlased, sest konkreetsed võrdlused on alati ebaühtlased.
| Nurk | Tüüpiline LLM (token-token-by-token) | CLM-stiilis / 1. süsteemi raamimine | Miks see on agentide jaoks oluline |
|---|---|---|---|
| Primaarne silmus | Ennusta järgmist märki, sageli pikkade jälgedega | Seisundi ja tegevuse vaheline seos; kontrastne otsustuskalduvus | Vähem raisatud märke tööriistakõnede vahel (teoreetiliselt) |
| Latentsustunne | Mitmeastmelise juhtimise all võib tunduda jutukas-aeglane | Autorid väidavad, et latentsusaeg on Jev-klassiga võrreldes palju madalam | Interaktiivsed kodeerijad vihkavad ootamisaega |
| Tugevustsoon | Proosa, esseede planeerimine, lai vestlus | Kiire olek→toime - agentiivne kodeerimine esile tõstetud | Erinev töö, mitte alati asendaja |
| Teatatud numbrid | Oleneb mudelist; siin pole ühte kindlat numbrit | Kuni ~9× kiirem (väide); DeepSWE ~81,6%; Terminal-Bench 2.1 ~87,6% pärast kerget täisversiooni (väide) | Paljulubav, kui kolmandad osapooled kinnitavad - suur kui |
| Avatus | Suletud API-de ja avatud kaalude segu | Apache 2.0 all raamitud avatud kaalud/kood | Täpsusta ja korralda majutust ilma tingimusi ära arvamata |
| Konks / veidrus | Nutikas, aga vahel jutustab igavesti 🐢 | Alles vara; iseseisvad kordused on ootel | Ära panusta ettevõtte edu ühele pressiteatele |
Kasutage tabelit mentaalse mudelina, mitte hinnanguna. Tootemeeskonnad peavad ikkagi omaenda rakmeid mõõtma: tööriistade skeemid, uuesti proovimise poliitika ja keskkonnamüra mõjutavad tulemusi rohkem, kui slaidiesitlus lubab.
Kes on müra taga 👤
Omistamine on oluline, sest avatud tehisintellektiga avaldatud materjalid ulatuvad hoolikatest laboriväljaannetest kuni salapäraste torrentiteni. Sellel on oma näod. Jacky Kwok tutvustas CLM-i; Azalia Mirhoseini aitas seda laiema vaatenurga alla viia; kajastus raamib järjepidevalt Stanfordi ja NVIDIA-ga seotud teaduskoostööd. See ei muuda iga numbrit maagiliselt tõeseks, aga see annab mängu maine. Nimelise teadlase avatud väljaanded kipuvad kiiremini läbima stressitesti kui anonüümsed väljaanded – kolleegid armastavad avalikku sihtmärki.
Ehitajate jaoks on praktiline tagajärg ligipääs. Avatud litsentsid koos Apache 2.0 stiilis litsentsiga (nagu turuletoomise ajal käsitleti) tähendavad tavaliselt, et saate äriliselt katsetada vähemate viperustega kui ainult uurimislitsentsidega. Enne millegi saatmist kontrollige ise väljalaskes olevaid litsentsifaile; katvuse kokkuvõtted ei ole leping. See võib kõlada pedantselt, kuid litsentsipedantsus päästab idufirmasid.
Sotsiaalse võimendamise muster on tuttav: teadlase postitus, lugupeetud võimendi tsitaatide postitused ja seejärel laine "agentidel lõpuks lahendus". Filtreeri inimeste jaoks, kes jagavad rakmete üksikasju. Ühe eduka kodeerimistsükli ekraanipildid on pigem meeleoluteater, mitte teadus. 🛰️
Miks olekust tegevuseks tsüklid omavad agentlikku kodeerimist?
Agentne kodeerimine on julm keskkond. Mudel näeb repo hetktõmmist, shelli transkripti, võib-olla ebaõnnestunud testi ja peab valima muutmise või käsu. Edu on sagedamini binaarne kui vestlus. Kas test läheb roheliseks või mitte. Selline tasustamise vorm eelistab poliitikaid, mis valivad toimingud selgelt mudelitele, mis kirjutavad ilusaid ebaõnnestunud esseesid.
Kontrastiivsed koolituslood sobivad sellesse maailma, sest need suunavad võrku antud olekus eelistatud toimingute poole. Mõelge sellele nagu õpetaksite nooremale insenerile: "Kui näete seda veaklassi, haarake selle parandusmustri järele", selle asemel, et "kirjutada ajaveebipostitus selle kohta, miks kompilaatorid on keerulised". Juunior vajab ikkagi otsustusvõimet; otsetee vähendab lihtsalt kõhklemist.
Latentsusaeg süveneb siin. Oletame, et agent teeb keskmise veaparanduse tegemiseks keskmiselt kaheksakümmend tööriistasammu. Vähendades sammu kohta 150 ms, saate tagasi kaksteist sekundit seinakella – see on vahe töörežiimi ja kasutaja e-posti kontrollimiseks Alt-Tab klahvi vajutamise vahel. Agentide parvesid käitavad meeskonnad tunnevad seda matemaatikat ka pilvearvetes. Väidetav suurusjärguline järelduskiirus võrreldes Jev-klassi partneriga, isegi kui see on tegelikult "ainult" 4×, muudab ikkagi mahutavuse planeerimist.
Koosolekutel kasutan üht ebakindlat metafoori: žetoonhaaval vestlusmudelid on nagu marsruudi arutlemine igal ristmikul, samas kui System 1 stiilis kontroller on pigem nagu lihasmälu linnasõiduks. Lihasmälu annab uues linnas alla. Sama juhtub ka kitsalt häälestatud tegevusmudeliga, kui repositooriumi kultuur on omapärane. Uute arhitektuurivalikute jaoks on endiselt vaja arutlevaid režiime; viiekümnenda "paranda import ja käivita uuesti" jaoks on vaja reflekse. Hübriidsed süsteemid – kiire CLM-i sarnane kontroller pluss raskem arutlussüsteem kõvadel harudel – on tõenäoliselt koht, kuhu tõsised süsteemid maanduvad, isegi kui turuletoomise postid müüvad ühte kangelasmudelit. 🚦
Samuti tasub valjusti öelda: agentiivse kodeerimise pingid nagu DeepSWE ja Terminal-Bench premeerivad tellingute tegemist. Rakendamise kvaliteet, tööriistade lubatud nimekirjad ja taastamisjuhised võivad edukuse määra kahekohalise numbri võrra muuta. Kui näete pärast kerget peenhäälestust ~81,6% või ~87,6%, siis süvenege kaalude ümber olevasse ümbrisesse. See pole varjund; see on see, kuidas valdkond töötab.
Avatud raskused, peenhäälestus ja 35B vari
Avatud kaalud muudavad nõude sotsiaalset dünaamikat. Suletud API mudelid võivad kuvada diagrammi ja jätta teid aimama saastumise, dekodeerimisnippide või salajaste süsteemivihjete kohta. Allalaaditavate parameetrite abil saate asja vähemalt torkida. CLM-8B peenhäälestamine teie sisemise kodeerimiskeskkonna jaoks – teie lint-reeglid, teie juurutamise CLI, teie monorepo topoloogia – on realistlik tee säravate tööpinginumbrite saavutamiseks, mitte null-shot-maagia esimesel päeval.
Apache 2.0 raamistik (vastavalt käsitlusele) on patendiarendajasõbralik: patendi väljastamise keel, selged ümberjaotamise normid, vähem "ainult uurimistöö" lõkse. Jällegi: lugege faile. Käsitluse kirjutajad teevad kokkuvõtteid; juristid on spetsialiseerunud.
Planeeritud CLM-35B on tegevuskava slaidil elevant. Suuremad mudelid taastavad sageli kaalutlusoskused ja kaotavad osa oma „pisikesest ja meeletult kiirest“ võlust, kui destilleerimine või spekulatiivsed nipid ei hoia latentsust kontrolli all. Kui kaheksa miljardi dollari suurune variant on sportauto ja kolmekümne viie miljardi dollari suurune on universaalsedaan, võivad meeskonnad säilitada mõlemad: 8B kuumade tsüklite jaoks, 35B raske planeerimise jaoks. Või võib suurem mudel lihtsalt domineerida, kui riistvara odavamaks muutub. Kumb tulevik saabub, on veel lahtine; otsustavad tuleviku väljalaskemärkmed, mitte see lõik.
Üks peen risk avatud agentide mudelitega: inimesed sisestavad need kiirusepiiranguteta konfiguratsiooniinterneti (CI) ja avastavad pahatahtlike README-failide kaudu kohese süstimise. Kiired mudelid võimendavad väärkasutust samamoodi nagu nad võimendavad praktilist väärtust. Piirded ei ole valikuline cosplay; need on toode.
- Enne kvaliteedi hindamist peenhäälestage oma jälgi
- Uute ülesannete jaoks hoia aeglasemat arutluskäiku pääseteena
- Instrumendi latentsus p50/p95 teie rakmetes, mitte ainult täpsus
- Oletame, et 35B nihutab Pareto piiri uuesti
Jevi võrdluse lugemine ilma lumesadu saamata
Võrdlused Jev-klassi mudelitega teevad retoorilist tööd. Need loovad agentide kiiruse astmel võrdväärse partneri, seega on "kuni 9 korda kiiremal" referent. Suhtelised väited vajavad ankrut ja see on mõistlik. Oht on kogu hindamisvirna kokkuvarisemine üheks kordajaks. Partii suurus, täpsus, dekodeerimisseaded, konteksti pikkus ja tööriistakõnede serialiseerimine kujundavad kõik ümber selle, mida "kiirem" tähendab, ja need nupud ilmuvad harva samal slaidil.
Kui klastri kokkuvõte viitab terminali testimiskeskkonnas ~32 ms-klassi vastustele, tuleks sõna "vastus" käsitleda mitmetähendusliku sildina, kuni keegi selgitab, kas see tähendab esimest tokenit, täistoimingulist JSON-i või vahemällu salvestatud eesliidet. Need eristused muudavad turundusmillisekundid inseneritundideks. Võrreldav nullpunkti kvaliteet madalama latentsusega on unistuste paar; kui sõltumatud rühmad kinnitavad kasvõi poole sellest unistusest, teenib CLM-stiilis koolitus arhitektuurikoosolekutel püsiva koha.
Seni aga käsitle Jevi pigem rivaalitsemise narratiivina kui kindla edetabeli vormis. Rivaalitsemine müüb postitusi. Sinu tootmise KPI-d ei hooli narratiivist. Mõõda ülesande edukust, lahendatud pileti kohta teenitud raha ja inimese sekkumise määra. Kui kontrastse keelemudeli abil loodud lahendus need võidab, siis tähista. Kui see võidab ainult Twitteris, siis jätka kõndimist. 🚶
Kerge vastuolu aeg: rivaalitsemisnarratiividel on endiselt kaal. Need sunnivad laboreid avaldama numbreid, mitte aga õhulist meeleolu. Lihtsalt ärge ajage punktitabelit spordiga segamini.
Mida see väljalase vajab, et see korda läheks
Selleks, et CLM-8B-l oleks uudistetsüklist kaugemalegi tähtsust, peavad mõned asjad aset leidma:
- Replikatsioon: välised rühmad peaksid suutma võrrelda pealkirja latentsust ja kodeerimise edukust dokumenteeritud retseptidega.
- Läbipaistvuse rakendamine: jagage agendi ümbrise üksikasju, mis andsid DeepSWE ja Terminal-Benchi skoorid.
- Dokumendid, mis ei eelda laboritelepaatiat: selged peenhäälestusskriptid, eval-käsklused ja riistvaramärkmed.
- Vearežiimid: näitavad, kus Süsteemi 1 stiilis otsused kokku kukuvad – uudsed API-d, mitmetähenduslikud piletid, turvatundlikud operatsioonid.
- Täiendusstrateegia: selgitage, kuidas CLM-35B on omavahel seotud, et meeskonnad ei sobitaks oma kaarte üle 8B ummikseisu.
Kui need kastid jäävad tühjaks, muutub mudel järjekordseks huvitavaks paberivajuseks. Kui need täituvad, saavad agentplatvormid konkreetse komponendi valiku: kaalutleva õigusteaduse mudeli raskeks mõtlemiseks ja kontrastiivse kiire mudeli tõmblevate käte jaoks. Selline tööjaotus tundub täiskasvanulikum kui teeselda, et üks megamodell peaks tegema iga töö iga latentsusaja eelarve juures.
Praktilised näpunäited ehitajatele, kes pakuvad agente
Sa ei pea oma pinu homme ümber kirjutama. Sul on vaja plaani otsustuskiirete mudelite hindamiseks. Alusta sellest, et eraldad oma agendi latentsusaja suhtes kriitilise osa – võib-olla terminali mikrosilmus või „vali järgmine grep” samm – ja tee A/B abil CLM-8B peenhäälestus oma praeguse tööhobuse suhtes. Hoia harnessi konstantsena. Logi kõik.
Jälgige vaikse kvaliteediga regressioone: mudelid, mis vastavad koheselt enesekindlate valede toimingutega, on kõrge riskiga repositooriumides halvemad kui aeglased õiged. Lisage verifitseerimisetapid. Eelistage pööratavaid tööriistu. Planeerige teine mudelikõne, kui usaldus on madal – jah, see sööb osa kiirusevõidust ja see on okei. Kiirus ilma piduriteta on see, kuidas demodest saavad katkestused.
Organisatsiooni poolel uuenda mahutavustabeleid veeruga "toimingud sekundis GPU kohta", mitte ainult tokenite arvuga sekundis. Agentide töökoormused hoolivad otsustest, mitte luule läbilaskevõimest. Kui autorite ~9× väide kasvõi osaliselt jääb teie riistvaraga kokkupuutele alles, näeb teie arvutustabel teistsugune välja. Kui ei jää, siis õppisite odavalt.
Ja palun, operatsioonide armastuse nimel, ärge kleepige tootmissaladusi eksperimentaalsesse agenti ainult sellepärast, et mudel tundus "turvaline". Kiirelt avatud mudelid teevad varisüsteemide käivitamise lihtsamaks, mida keegi üle ei vaata. Protsess on ikkagi oluline.
Avatud teemad on endiselt ootel
Mõned lahendamata teemad takistavad mul täielikku reklaamirežiimi kasutamast:
- Kui suur osa teatatud kodeerimise edust tuleneb kaaludest võrreldes peenhäälestamise andmete ja ümbrisega, jääb ebaselgeks.
- Süsteemi 1 raamistik võib hõreneda, kui ülesanded vajavad pigem pikaajalist planeerimist kui lokaalseid reflekse.
- CLM-35B võib säilitada latentsusaja loo või jääda järjekordseks tugevaks keskmise suurusega LLM-iks.
- Kontrastiivsed tegevuste eelistused võivad levituse muutuse korral hapraks muutuda – uued keeled, uued pilve käsurealiidesed, vastandlikud repositooriumid.
- Ohutuslugu vajab sisu ka siis, kui toimingud toimuvad millisekundites.
Need ei ole mingid vead, mis meeskonna kaela määrimiseks mõeldud on. Need on kontrollid, mida iga tõsine kasutuselevõtu ülevaade peaks tegema. Varased avatud versioonid väärivad hoolikat uurimist ja pingutust, mitte pimeinstallatsioone.
Lõppkokkuvõttes
CLM-8B on avatud, Apache-raamistikuga (katvuse järgi) kontrastiivne keelesuund, mille eesmärk on agentide kiire olekult tegevusele käitumise hindamine. Selle tutvustas avalikult Jacky Kwok Azalia Mirhoseini võimenduse abil ning see on sõnastatud Stanfordi/NVIDIA-ga seotud uuringuna. Pealkirjas esitatud väited – kuni umbes 9 korda kiirem kui Jev-klassi järeldus, tugevad DeepSWE ja Terminal-Benchi tulemused pärast kerget peenhäälestust, võrreldav nullpunkti kvaliteet palju madalama latentsusega, sealhulgas jutt ~32 ms-klassi terminali vastuste kohta – on autorite esitatud ja ootavad endiselt laiaulatuslikku kolmanda osapoole kinnitust. Suurem CLM-35B on tulemas.
Kui lood agentidele suunatud kodeerimissüsteeme, siis tasub seda põhjalikult hinnata, mitte uskuda. Käsitle seda hübriidvirnas System 1 kontrolleri kandidaadina, mõõda omaenda rakmeid ja hoia CLAIM-kleebist igal diagrammil, kuni iseseisvad katsed maanduvad. Huvitav osa pole mitte järjekordne vestlusmudel uue logoga. Huvitav on see, kas otsustuspõhine koolitus suudab panna agente end koheselt tundma, ilma et nad hoolimatult eksima hakkaksid.
Praktiline näide: latentsuskriitilise agendi mikrosilmuse hindamise loomine CLM-8B jaoks
Autori diagrammid CLM-8B äsjailmunud mudeli kohta: uus avatud tehisintellekti mudel, mis väidab end olevat agentide jaoks kuni 9 korda kiirem kui Jev, võivad tunduda veenvad; teie rakmed on ainus hääl, mis loeb. Siin on näide sellest, kuidas Ühendkuningriigi sõltumatu tööriistade meeskond käsitles CLM-8B-d System 1 kontrolleri kandidaadina – mitte vestluse asendajana – ja mõõtis seda oma terminali mikrosilmusel.
Stsenaarium
Sam haldab väikest toodet, mis juba kasutab mitmefaililiste refaktorite jaoks võimsamat kodeerimisagenti. Valus lüli on kuum tsükkel: loe ebaõnnestunud testi transkripti, vali järgmine kest või redigeeri toiming, käivita see, korda. Kasutajad kurdavad vähem igavate vastuste üle kui talvekinnaste viivituse üle viiekümne tööriista sammu jooksul. Sotsiaalmeedia postitused võimendavad kontrastiivse keelemudeli kaalusid ja väidetavat ~9× kiirendust võrreldes Jev-klassi konkurentidega, lisaks tugevaid DeepSWE / Terminal-Benchi näitajaid pärast kerget peenhäälestust. Sam keeldub pressigraafikul tootmist ümber kirjutamast.
Nad lõigasid välja ühe latentsuskriitilise mikrosilmuse: kakskümmend parandatud veaparanduste jälge oma monorepo'st. Praegune tööloom jääb uudsete arhitektuuripiletite puhul arutlevaks teeks. CLM-8B – kui see on majutatud ja selle jälgedes veidi peenhäälestatud – saab konkureerida ainult „vali järgmine pöörduv toiming” etapis, kusjuures aeglasem arutlussüsteem toimib päästerõngana, kui usaldus on madal.
Eesmärk on A/B, mis hoiab rakmete süsteemi konstantsena: samad tööriistad, sama lubatud nimekiri, sama uuesti proovimise poliitika. Logige toiminguid sekundis, p50/p95 latentsusaega, ülesannete edukust ja inimeste sekkumisi – seejärel otsustage, kas avatud kaalud teenivad koha.
Mida assistent vajab
- Kakskümmend anonüümset ebaõnnestunud testi jälge reaalsest tööst (ainult sisendid + lubatud tööriistad)
- Fikseeritud agendi ümbris: tööriistaskeem, lubatud nimekiri, maksimaalne sammude arv ja haru „call slow reasoner” (kõne aeglase arutluskäigu jaoks)
- Praeguse mudeli baasskoorid samade kahekümne ülesande puhul
- CLM-8B hosti riistvaramärkused (GPU klass, täpsus, partii), seega on „kiirem” viide olemas
- NÕUDEKLEEBISE Reegel: autor DeepSWE / Terminal-Bench / ~9× / ~32 ms figuurid jäävad märgistatuks seni, kuni see rakmed midagi reprodutseerivad
- Inimesest omanik, kes vaatab enne CI lisamist üle valed, aga kiired teod
Näidisjuhis
Sa aitad mul kujundada CLM-8B jaoks õiglase A/B kiire olekuga → toiminguga kontrollerina meie kodeerimisagendi sees. Kasuta ainult minu poolt kleebitud rakmete andmeid. Ära mõtle välja latentsuskordajaid, DeepSWE skoori ega litsentsitingimusi.
Ülesanne: Minu kahekümne ülesande nime ja praeguste algsete märkmete põhjal koostage (1) hindamisleht veergudega Ülesanne / Mudel / Sammud / Seinakell / Edu (läbis/ei läbinud) / Inimese sekkumine (jah/ei) / Märkused, (2) kuue punktiga protokoll, mis hoiab ümbrise mudelite lõikes identsena, ja (3) otsustusreegel selges ja igapäevases sõnastuses, millal CLM-8B võib mikrosilmuse omada ja millal eskaleerume aeglase arutleja juurde.
Piirangud: Briti inglise keel. Märgistage iga autori teatatud number VÄITEKS, kui see esineb. Eelistage pööratavaid tööriistu. Keelustage väljend „agendid lõpuks lahendatud“. Kui minu kleepsust puudub mõõdik, kirjutage [VAJA MÕÕTMIST] oletuse asemel.
Väljund: hindamislehe päis ja üks täidetud näidisrida kohatäidetega, protokolli täpploendid ja seejärel eskaleerimis-/säilitamisreegel. Preambulit pole.
Kuidas seda testida
- Käivita samad kümme jälge praegusel tööhobusel ja CLM-8B peenhäälestusel identse wrapperiga. Veendu, et erinevad on ainult seinakell ja edukus – mitte tööriistade nimekirjad.
- Küsi: „Milline autori diagramm võib sel nädalal tootmist muuta?“ Hea vastus: mitte ühtegi enne, kui see rakmete komplekt näitab edu ja latentsuse koosmõju.
- Äärmuslik juhtum: CLM-8B vastab ~30 ms jooksul hävitava käsusoovitusega – kinnitage lubatud nimekiri ja inimese ülevaatus, et see enne CI-d tabada.
- Äärmuslik juhtum: uudne API-pilet väljaspool kahtekümmet jälge – veenduge, et see kuulub aeglasele arutlejale, mitte refleksmudelile.
- Vastuvõtukontrollid: (1) mõõdetud tulemusena ei ole väljamõeldud 9× väidet, (2) logitakse p50 ja p95 latentsusaega, (3) edukuse nimetaja on kakskümmend ülesannet, (4) loetakse vale-kiire toiminguid, (5) Apache/litsentsi kontroll toimub enne mis tahes kommertsliku saatmisplaani koostamist võrguühenduseta.
Tulemus
Illustreeriv tulemus (näidishinnang ühe kolmeliikmelise tööriistameeskonna kohta kahekümne fikseeritud monorepo jälje peal, mitte autorite töölaudade sõltumatu labori kordus): baasjoone tööloom lõpetas 20 jäljest 14 ilma inimese abita; keskmine sammu latentsus umbes 180 ms; kaks jälge vajasid pärast valet redigeerimist inimest. Pärast CLM-8B kerget peenhäälestust sisemistel jälgedel (sama ümbris) läbis 20-st 15 ilma abita; keskmine sammu latentsus umbes 45 ms nende ühe GPU-ga hostil; enne rakendamist tabas lubatud nimekiri ühe täiendava vale-kiire toimingu. Kahekümne jälje komplekti seinakell langes umbes 38 minutilt umbes 22 minutile, sealhulgas verifitseerimisetapid. Hügieeni kontroll-lehel (rakmestik hoitakse konstantsena, CLAIM-sildid hoitakse autori diagrammidel, aeglane arutleja kasutatakse endiselt uute piletite jaoks, eksperimentaalses agendis puuduvad tootmissaladused) läbis 5 viiest ülevaateüksusest 5. Piirangud: väike ülesannete komplekt, üks riistvaraklass, peenhäälestuse andmete kvaliteet domineerib; see ei kinnita autorite ~9× või DeepSWE näitajaid väljaspool seda rakmeid.
Oma versiooni mõõtmiseks: külmuta kakskümmend jälge; hinda esmalt praegust mudelit; majuta CLM-8B dokumenteeritud täpsuse/sätetega; käivita uuesti sama ümbrisega; teata edukusest/n, p50/p95, sekkumistest ja sellest, kas mõnda CLAIM-numbrit käsitleti faktina.
Mis võib valesti minna
- Diagrammide kummardamine: saatmine ~9× slaidil ilma oma p95-ta.
- Valed kiired tegevused: kohesed enesekindlad vead edestavad aeglaseid õigeid tegusid kõrge riskiga hoidlates.
- Rakmete triiv: tööriistavihjete muutmine mudelite vahel ja selle nimetamine mudeli võiduks.
- Ühe kangelase virn: arutleva arutleja loobumine uudse arhitektuuritöö puhul.
- Litsentsi edasiandmine: Kaaluandmete kogumike usaldamine tegelike litsentsifailide asemel.
- Varjupõhine konfiguratsioonide interaktsioonitehnoloogia: kiire avatud agendi ühendamine torujuhtmetega ilma kiirusepiirangute või süstimise ülevaatuseta.
Praktiline kaasavõetav toit
CLM-8B väärib täpset hindamist kui System 1 kontrolleri kandidaat agentlikuks kodeerimiseks - avatud kaalud, otsustuspõhine lugu, autori enda teatatud kiiruseväited. See ei ole kreedo ega tõestatud 9× sinu stantsi jaoks, kuni sinu rakmed seda ütlevad. Hoia wrapperit konstantsena, logi toiminguid sekundis ja vale-kiire kiirust, kasuta aeglasemat pääseluuki ja jäta CLAIM-kleebis igale pressikaardile, kuni sõltumatud jooksud (kaasa arvatud sinu omad) maanduvad.
KKK
Mis on CLM-8B ja miks agentide ehitajad sellest räägivad?
CLM-8B on esimene avalik kaalukomplekt kontrastiivse keelemudeli (Contrastive Language Model) reas – avatud uurimistöö pressiteade, mida esitletakse agentidele kiire otsustustsüklina, mitte lihtsalt järjekordse vestlusajuna. Koolituslugu ühendab olekuid tegevustega pigem nagu System 1 refleks kui aeglane järgmise žetooni essee. Kaheksa miljardi parameetriga on see piisavalt väike, et paljud laborid ja sõltumatud arendajad seda majutada saaksid, kusjuures Apache 2.0 litsentsimine on kajastatud languse ümber. Käivituspostitustes olevad numbrid on autorite esitatud väited, mitte sõltumatud labori korduskatsed.
Kuidas väidab CLM-8B end agentide jaoks kuni 9 korda kiiremana kui Jev?
Promootorid väidavad, et Jev-klassi mudelitega võrreldes on järeldused kuni umbes 9 korda kiiremad, terminali testi seadistusel on need umbes 32 ms-klassi vastused. Pärast kerget peenhäälestust teatavad nad ka tugevatest agentiivse kodeerimise tulemustest – DeepSWE umbes 81,6% ja Terminal-Bench 2.1 umbes 87,6% – ning mõningasest Jeviga võrreldavast null-shot kvaliteedist palju madalama latentsusega. 9× ja millisekundilisi numbreid käsitleda väidetena, kuni kolmandad osapooled neid jagatud riistvaral reprodutseerivad. Suhteline kiirus nõuab ikkagi partii suuruse, täpsuse ja dekodeerimise sätete selgitamist.
Mille poolest erineb kontrastiivse keelemudeli koolitus tüüpilistest õigusteaduse magistriõppe programmidest?
Enamik produktiivseid LLM-e genereerib korraga ühe märgi, mis sobib proosa ja pikkade arutluste jaoks, kuid paneb proovile iga agendi mikrootsuse. Kontrastiivse keelemudeli treenimine, nagu promootorid seda kirjeldavad, suunab võrgustikku olukordade kaardistamiseks eelistatud käikude järgi – pigem nagu poliitikakujundaja kui romaanikirjanik. See Süsteemi 1 raamistik eelistab kiireid oleku-tegevuse tsükleid lõputule jutustamisele tööriistakõnede vahel. CLM-8B saab endiselt teksti välja anda; eesmärk ja hindamislugu on kaldu agendi kontrolli poole.
Kes andis välja CLM-8B ja kas see on tõesti avatud?
Jacky Kwok tutvustas tööd; Azalia Mirhoseini laiendas seda; käsitlus raamib Stanfordi ja NVIDIAga seotud meeskonnatööd, kus osalevad nimetatud teadlased, avalikud kaalud ja avatud kood. Väljalaske litsentsimine on raamitud Apache 2.0-na, mis on oluline peenhäälestamise ja levitamise jaoks – aga enne käsitluse kokkuvõtetele toetumist lugege repositooriumis olevaid litsentsifaile. Nimega avatud väljalasked läbivad stressitesti kiiremini kui anonüümsed koopiad. Laialdaseks kolmandate osapoolte replikatsiooniks on see veel vara.
Miks on oleku-tegevuse tsüklid agentiivse kodeerimise jaoks nii olulised?
Agentne kodeerimine on sageli binaarne: test saab rohelise või mitte, seega puhtad tegevusvalikud edestavad ilusaid ebaõnnestunud esseesid. Latentsusajad jagunevad kümnete tööriistaetappide vahel – nii sammu kohta aja lühendamine kui ka seinakella ja pilvearved muutuvad. Väidetav suurusjärgu võrra kiirendus Jev-klassi võrdväärse seadmega võrreldes, isegi kui see realiseerub "ainult" 4×, muudab ikkagi mahutavuse planeerimist. Hübriidsed pinud – kiire CLM-i-laadne kontroller pluss raskem arutlussüsteem jäikadel harudel – on realistlik pikaajaline kuju.
Kas peaksin usaldama DeepSWE ja Terminal-Benchi CLM-8B skoori?
Need komplektid karistavad hapraid agente, mistõttu ~81,6% DeepSWE ja ~87,6% Terminal-Bench 2.1 tulemused pärast kerget peenhäälestust tunduvad põnevad. Agentide pingid premeerivad ka tellingute tegemist: rakmete kvaliteet, tööriistade lubatud nimekirjad ja taastumisjuhised võivad edu kahekohalise numbriga muuta. Enne kui käsitlete tabelit väljakujunenud teadusena, uurige, milline ümbris kaalude ümber oli. Autoripingid turustavad seni, kuni keegi teine neid dokumenteeritud retseptidega reprodutseerib.
Mida peaksin teadma CLM-35B ja 8B mudeli peenhäälestamise kohta?
Plaanina mainitakse suuremat CLM-35B järge; kas see säilitab latentsusaja loo või vahetab kiiruse sügavuse vastu, on lahtine. CLM-8B peenhäälestamine omaenda lint-reeglite, CLI juurutamise ja monorepo jälgede põhjal on realistlik tee tugevate numbrite saavutamiseks - mitte null-shot-maagia esimesel päeval. Meeskonnad võivad mõlemad suurused alles hoida, kui nad jõuavad: 8B kuumade tsüklite jaoks, 35B raske planeerimise jaoks. Avatud kaalud muudavad ka väärkasutuse lihtsamaks, seega piirded ja kiirusepiirangud on toote tulemus, mitte valikuline cosplay.
Kuidas ma peaksin Jevi võrdlusi lugema ilma lund sadamata?
Jev-klassi võrdlused annavad „kuni 9 korda kiirema“ partneriankru, mis aitab müügikõnel maanduda. Oht seisneb partii suuruse, täpsuse, konteksti pikkuse ja tööriistakutse serialiseerimise koondamises üheks kordistajaks. Kui Chatter viitab ~32 ms-klassi vastustele, küsi, kas see tähendab esimest tokenit, täistoimingulist JSON-i või vahemällu salvestatud eesliidet. Mõõda ülesande edukust, raha lahendatud pileti kohta ja inimese sekkumise määra oma pinus. Rivalisatsiooninarratiivid sunnivad laboreid numbreid avaldama; teie tootmise KPI-d otsustavad ikkagi.
Mida peaksid ehitajad enne CLM-8B tootmisagentidesse panemist tegema?
Ehita välja latentsuskriitiline lõik – näiteks terminali mikrosilmus – ja tee A/B abil peenhäälestus oma praeguse tööhobuse suhtes, hoides rakmeid konstantsena. Jälgi valesid, aga kiireid toiminguid; lisa verifitseerimine, eelista pööratavaid tööriistu ja eelarvesta aeglasem arutlusmehhanism, kui usaldusväärsus on madal. Jälgi toiminguid sekundis GPU kohta, mitte ainult tokeneid sekundis. Ära kleebi tootmissaladusi eksperimentaalsetesse agentidesse ja jäta igale pressidiagrammile CLAIM-kleebis, kuni sinu enda testid saabuvad.
Kuidas luua CLM-8B Just Dropped nõuete jaoks õiglase latentsusega mikrosilmuse hindamine?
Külmuta väike hulk reaalseid ebaõnnestunud testide jälgi, säilita sama tööriista skeem ja lubatud loend kõikides mudelites ning logi samme, seinakella, edu ja inimeste sekkumisi. Kasuta CLM-8B-d ainult "vali järgmine pöörduv toiming" etapis, kui säilitad uute piletite jaoks kaalutleva pääsetee. Märgista autor ~9×, DeepSWE ja millisekundilised arvud NÕUDEKS, kuni see rakmete komplekt näitab edu ja latentsuse koosvõitu. See keskendunud hindamine on parem kui tootmise ümberkirjutamine slaidiesitlusel.
Viited
- Kallistav Nägu — Kontrastiivkeele Mudel (CLM-v0.1-8B) — huggingface.co
- GitHub — Kontrastiiv-LM / CLM — github.com
- Stanfordi ülikool – Azalia Mirhoseini – cs.stanford.edu
- Jacky Kwok — jackyk02.github.io
- X — Jacky Kwoki tutvustus — x.com
- DeepSWE — deepswe.datacurve.ai
- Snorkeli tehisintellekt — Terminal-Bench 2.1 — snorkel.ai
- Jev — jevtypesafeai.com