Claude Opus 5.5

Claude Opus 5.5 saavutas just Code Arenal esikoha – nüüd parimate kodeerimisalaste tehisintellekti pretendentide hulgas

Lühike vastus: Claude Opus 5.5 Max taseme kohta on Arena.ai Code Arena WebDevis teatatud 1818 punktiga esikohal ja see on Artificial Analysis'i kodeerimisagentide indeksi 66 punktiga. Need on avalikud termomeetrid, mitte teie mahajäämus. Kui elatiseks koodi postitad, tehke enne vaikesätete muutmist oma ülesannete kallal lühike eeltestimine.

Peamised järeldused:

Code Arena müügivihje: käsitle 1818 WebDev Elo-d eelistuse tugevusena, mitte tootmistõendina.

Agendi indeksi tipp: reserveerige maksimaalse pingutusega Opus kleepuvate piletite jaoks, mille ebaõnnestumine on kulukas.

Kulukompromiss: Logimisžetoonid ja seinakell; tippskoor ja odav skoor erinevad.

Esmalt eeltestimine: testi ise ühte kasutajaliidese järku, ühte ümbertegemist ja ühte pikka agendi seanssi.

Kroon pöörleb: Hoidke mahulise töö jaoks odavamat vaikeväärtust eri väljalasketsüklite vahel.

Edetabeli ülevõtmine, lihtsalt selgitatud

Arena.ai asetas Claude Opus 5.5 (Max) Code Arena WebDevi edetabelis esikohale 1818 punktiga. See on umbes 26 punkti võrra parem kui järgmine mudel samas edetabelis, GPT-6 Astra Max, ja tähistab märkimisväärset hüpet võrreldes eelmise Opus 5 Maxiga, mis oli umbes 1692 punkti. Need on teatatud plaadinumbrid, mitte midagi, mida ma iseseisvalt hermeetilises laboris uuesti arvutasin. Sellegipoolest on ~126-punktiline samm sama perekonna Maxi tasemel selline delta, mis paneb inimesi Elo edetabeleid värskendama nagu sporditulemusi.

Artificial Analysis teatab eraldi, et Opus 5.5 on nende kodeerimisagentide indeksi uus esinumber, kusjuures kõigis jälgitavates hindamistes on näha edusamme. Claude Code'i maksimaalse pingutuse korral sai mudel selles indeksis 66 punkti – see on kõrgeim tulemus, mida nad seni väidetavalt on mõõtnud. Märkuses on aga üks konks: ülesande maksumus on kõrgem, kui pingutust nii palju teha. Tipptulemus ja odav tulemus ei ole üks ja sama asi.

Pange need kaks signaali kokku ja saate loo kõige olulisema nurga: mitte "mudeli turuletoomine", vaid "kiiresti ümber pööratud kodeerimistahvlid". Turuletoomise teadaanded on pressiteated. Edetabelite ülevõtmised on see, mida äsjakasutajad ekraanipildid grupivestlustesse salvestavad vabal ajal.

  • Arena.ai kood Arena veebiarendus: Opus 5.5 (maksimaalne) teatatud 1818-l
  • Vahe järgmise nimetatud rivaali vastu katvuses: umbes +26 vs GPT-6 Astra Max
  • Hüpe võrreldes eelmise Opus 5 Maxiga: ~1692-lt 1818-le
  • Kunstliku analüüsi kodeerimisagendi indeks: uus nr 1; 66 maksimaalse pingutusega Claude'i koodis
  • Sama indeksimärkus: selle pingutusseadistuse korral on ülesande hind kõrgem

Teatatud hetktõmmis: Opus 5 Max vs Opus 5.5 Max Code Arenal

Võrdlustabelid on abiks, kui uudisvoog koosneb ainult meeleolust ja ekraanipiltidest. Allpool on lihtne hetktõmmise raamimine, mitte iseseisev kokkuvõte. Lahtrid on veidi ebaühtlased, sest avalikud foorumid on alati sellised – ja kuna „Max” nimetamine ajab juba pilgu pahaks.

Mudel (nagu teatatud) Laud / rada Punktid / tulemus Mida inimesed sellest välja loevad
Claude Opus 5 Max (eelnev) Arena.ai koodiareen - veebiarendus ~1692 (teatatud) Tugev, aga mitte enam pealkirjas
Claude Opus 5.5 (maksimaalne) Arena.ai koodiareen - veebiarendus 1818 (teatatud nr 1) Selge ülemine postitus; suur samm võrreldes eelmise Maxiga
GPT-6 Astra Max Sama Code Arena WebDev jutuvada ~1792, kui lahutada ~26 vahe (teatatud raamimine) Teisel kohal postide vahel ringide tegemisel
Opus 5.5 maksimaalse pingutusega Kunstliku analüüsi kodeeriva agendi indeks 66 (kõrgeim, mida nad oma aruande kohaselt mõõtsid) Agendi kodeerimise tippskoor - kulukas pool märgitud
Väiksema pingutusega / odavamad jooksud Sama laiem kodeerimispilt Siin pole ühtegi avalikku maagilist numbrit Kompromiss: "piisavalt hea" vs "graafiku maksimeerimine"

Mõne lugeja jaoks tundub tabel juba piisav, et võitja kroonida. See pole nii. Elo ja agentide indeksid on käepärased termomeetrid. Need ei ole teie tootmise mahajäämus.

Mida Code Arena mõõdab kapoti all?

Kui loed ainult edetabelit, siis ei saa testi olemusest aru. Code Arena, eriti see veebiarenduse maitse, mida inimesed mainivad, on üles ehitatud võrdlevale eelistusele kodeerimise ja liideste loomise ülesannetes. Inimesed (ja areeni hääletussüsteem) valivad mudeli väljundite hulgast võitjad. See premeerib koodi, mis näeb hea välja, töötab demodes laitmatult ja tundub pimesi võrreldes lihvitud – esiotsa struktuur, interaktiivsus, visuaalne sidusus, midagi sellist, mis paneb localhosti eelvaate karjuma "too see kohale".

See on teistsugune ala kui staatiline valikvastustega kodeerimise eksam. See erineb ka pika horisondiga agendi hindamisest, kus mudel peab kesta seanssi kümnete tööriistakõnede jaoks elus hoidma, ilma et see end nurka suruks. Mudel võib purustada ilusa kasutajaliidese väljakutse ja ikkagi komistada keerulise monorepo migratsiooni otsa, mis nõuab kolme kinnitatud teeki ja pantvangiolukorras läbiräägitud ebaühtlast testikomplekti.

Seega, kui Opus 5.5 on WebDevis 1818. kohal, siis tõlgenda seda eelistuse tugevusena Arena valijate poolt nähtavate versioonide osas. Kiired localhost rakendused, mängud, süžeeskeemid ja visuaalsed kasutajaliidesed sobivad sellele reale peaaegu liigagi hästi – mis sobib ka üleöö ilmunud demode ajajoontega. Eelistus Elo ei ole vale. See on teatud tüüpi tõde. Kohelge seda nagu degusteerimismenüüd, mitte täielikku toitumisalast paneeli.

Veel üks veidrus: maksimaalse taseme märgistamine. Suurema pingutuse/suurema mahutavuse sätted tähendavad sageli rohkem tokeneid, rohkem arvutusvõimsust ja rohkem kannatlikkust. Tahvlid, mis kuvavad maksimaalseid variante, näitavad lage, mitte igapäevast API-kõnet, mida teed pooleldi stand-up-saate vaadates. Lagi on oluline. Ka igapäevased draiverikulud on olulised. Pidage mõlemat meeles.

Kodeerimisagendi indeks ja kulude ja tipptaseme kompromiss

Artificial Analysis'i kodeerimisagentide indeks on selle hüppeloo teine ​​​​sammas. Nende aruanne asetab Opus 5.5 tipule, kus on paranemist kõigis jälgitavates hindamistes, millest silmapaistev on Claude'i koodis maksimaalse pingutuse juures 66. Kõrgeim, mida nad on mõõtnud, on tugev lause. Sellega kaasneb ka täiskasvanutele mõeldud joonealune märkus: ülesande hind tõuseb, kui gaasipedaali põhja vajutada.

See on parima mudeli argumendi tuum eelarvega meeskondade jaoks. Mudel, mis võidab maksimaalse pingutusega, võib ikkagi nädala kaotada, kui iga ülesanne põletab väikese varanduse tokenites. Ringlev jutt märgib juba, et mõned kasutajad näevad pikkade sessioonide ajal tokenite põletamist. See ei tühista skoori. See muudab tooteotsust: reserveerida maksimaalne pingutus ebameeldivate piletite jaoks ja hoida odavamat profiili liimikoodi, refaktorite ja "tee see nupp vähem kole" töö jaoks.

Mõtle sellele nagu terava töövõtja palkamine, kes esitab arved tunnipõhiselt ja räägib kiiresti. Sa tahad, et nad tegeleksid keerulise probleemiga. Sa ei taha, et nad kirjutaksid iga README-faili ümber. Agendi tippskoor on võimekuse väide. Ülesande maksumus on tegevuse väide. Parim tehisintellekti kodeerimine üksikult indie-ettevõttele, kes häkkib kell 1 öösel, ei ole automaatselt parim tehisintellekti kodeerimine ettevõttele, mis jälgib üksuse majandust. Mõlemad grupid karjuvad sama edetabeli ekraanipildi üle.

  • Kasutage maksimaalset pingutust, kui ülesanne on kleepuv, mitme failiga ja ebaõnnestumine on kulukas
  • Vähenda helitugevust, kui ülesanne on rutiinne ja vajad helitugevust
  • Jälgige omaenda kulu ühendatud PR-i kohta, mitte ainult avalikku Elo-d
  • Arvestage, et agentide indeksid ja areenil Elo on mõnikord eriarvamusel – erinevad spordialad

Arendaja reaktsioon üleöö: rakendused, mängud ja "Ära nõrgesta" energia

Numbrid selgitavad pealkirju. Demod selgitavad meeleolu. Arendajad postitavad kiireid localhosti rakendusi, pisikesi mänge, süžeeskeeme ja kasutajaliidese/visuaalseid versioone, mis näevad välja nagu oleksid eelmisel kvartalil nädalavahetuse võtnud. Osaliselt on see valiku kallutatus – inimesed jagavad võitjaid, mitte kolme esimesena tulnud ebaõnnestunud põlvkonda. Sellegipoolest on "oota, see jooksis puhtalt" postituste hulk üks põhjus, miks see tundub pigem hüppeliselt kui vaikse parandusmärkusena.

Naljatsükkel on juba küps: palun ärge nõrgestage Opus 5.5. See nali ilmub ainult siis, kui mudel tundub looduses peaaegu liiga hea või kui varasemad väljalasked on inimestele õpetanud, et ohutus- ja tooteuuendused mõnikord teravust nüristavad. See, kas nõrgestamist tuleb või mitte, pole oluline. Meem on pigem meeleolu kontroll. Praegu on see näitaja tuline.

Platvormid liiguvad samuti. Näiteks Questflow on olnud vestlustes, teatades Opus 5 versiooniuuendustest 5.5 versioonile. Kui tööriistade müüjad saadavad uuenduse kiiresti kohale, on see märk sellest, et nõudlus on käegakatsutav ja et eelmist taset peetakse juba eelmise nädala vaikevalikuks. Integratsiooni kiirus on omaette ülevaade: tootemeeskonnad ei kirjuta spordi jaoks mudelivalijaid ümber.

Anekdootlikud versioonid on arendaja reaktsioon, mitte kontrollitud auditid. Hoidke see eristus oma otsaesisele tätoveeritud. Kaunis süžeeskeemi demo ei tõesta ettevõtte usaldusväärsust. See tõestab, et loominguliste kodeerimistöövoogude areng on muutumas ärevaks – ja ärevaks muutumine muudab seda, mida inimesed järgmisena proovivad.

Miks number üks ei võrdu automaatselt parima kodeeriva tehisintellektiga igapäevatöös

Lühike vastus: mõne töö puhul, mõneks nädalaks. Pikem vastus: parim on portfooliosõna, mis teeskleb trofeed.

Kui teie päev on veebiarendusele omane – maandumislehed, interaktiivsed prototüübid, visuaalne viimistlus, kiired mängud, süžeeskeemilaadsed töövood –, on Code Arena veebiarenduse müügivihje väga asjakohane. Eelistuste võitjad näevad brauseris tavaliselt head välja ja brauseris hea väljanägemine on pool tööst. Kui teie päev on agentide kodeerimine sassis koodibaasis, kasutades tööriistu, kestasid ja pikki seansse, on kodeerija indeksi tipp huvitavam signaal – koos kulupiiranguga.

Kui teie päev hõlmab maailma kõige raskemaid ülesandeid – uudseid algoritme, ohutuskriitilisi süsteeme, sõlmelisi pärandvarapakke hõimuteadmistega –, siis ringlevate kasutajate märkmete kohaselt suudab Opus 5.5 endiselt kõige raskemate probleemide lahendamisel maha jääda ja seansside venimise korral tokeneid põletada. See pole mingi nali. See on tuttav piiripealne muster: keskmine juhtum hüppab, patoloogiline juhtum jääb patoloogiliseks. See on võib-olla kogu selle teose kõige vähem glamuurne lause ja võib-olla kõige praktilisem.

Samuti arvestage konkurentidega, kes saadavad välja samal nädalal. Chatter on maininud OpenAI GPT-6 Sol/Luna-klassi väljalasete ilmumist samas raundis. Kui mitu laborit langevad välja mõne päeva jooksul, muutuvad edetabelid pöörlevaks ukseks. Tänane esikoht võib olla homme "ikka suurepärane, aga vaadake seda teist edetabelit". Parim on ajutine. Võimekuste alampiirid kipuvad püsivamalt tõusma. Panusta hammasratta pöördele, mitte ekraanipildile.

Ringluses olevad tooteväited (käsitsege ettevaatlikult)

Lisaks teadetetahvlitele levib tavapärastes kanalites hulk tooteväiteid. Omistage need levivate väidete, mitte selle artikli kinnitatud laboritulemuste hulka:

Fable'i-klassi hinnaväide on eriti terav, kuna see püüab müüa korraga nii kvaliteeti kui ka säästlikkust. Kui see teie töökoormuse puhul kehtib, on see suur asi kõigile, kes varem arvasid, et Opuse-taseme kvaliteet on hinna poolest nagu uhke õhtusöök igal õhtul. Kui see teie küsimustele ei vasta, tunnete seda arvel enne, kui Elos. Isiklik töökoormus > turunduse külgnevus. Alati.

Väide, et tegemist on tugevama arvutikasutuse ja agentiivse kodeerimisega, sobib kõige selgemini tehisanalüüsi looga. Agendid, mis suudavad tööriistu juhtida, ringi klõpsata ja olekut sidusana hoida, on tootekuju, mida paljud arendajad soovivad. Eelistus Elo veebiarenduses ja agentide indeksi tipud võivad riimuda ilma identsed kaksikud olemata. Kui nad riimuvad, muutuvad inimesed valjuks. Kui nad hiljem lahknevad, muutuvad inimesed küüniliseks. Ela keskel.

Samal nädalal võidujooks: miks ajastus kõike võimendab

Opus 5.5 ei saabunud vaiksesse uudiste kõrbesse. See ilmus hiljuti samal nädalal kui konkureerivad mudeliväljalasked, mida lobisejad pidevalt ühte patta panevad – sealhulgas OpenAI GPT-6, mida Sol/Luna mainib. See rahvarohke olek on oluline. Rahvarohked nädalad loovad võrdlevaid ekraanipilte. Võrdlevad ekraanipildid loovad hõimulaagrid. Hõimulaagrid loovad illusiooni, et üks diagramm rajab tsivilisatsiooni.

See loob ka paljastava stresstesti. Kui mitu tugevat mudelit korraga tabavad, testivad arendajad neid samades mängurakendustes mõne tunni jooksul A/B-ga. Üleöö toimunud localhosti buum on osaliselt selle stresstesti lekkimine sotsiaalmeediasse. Sa vaatad hajutatud küpsetamist kohutava metoodika ja suurepärase meelelahutusväärtusega. See ei ole teadus. See võib ikkagi signaali edastada, kui silmi kissitada ja valiku kallutatust ei arvestata.

Anthropicu jaoks on Code Arenal ja Coding Agent Indexis esikohale jõudmine selle kiire tempo ajal suurepärane ajastus – või suurepärane mudeli kvaliteet, mis juhtumisi ajastuse järgi välja näeb. Igal juhul jäi narratiiv püsima: kodeerimise hüppeline tõus, mitte ainult postituse käivitamine.

Mida peaksid ehitajad sellega tegema

Praktiline käsiraamat, ilma müstikata:

  • Käivita oma kolmeülesandega bake-off: üks kasutajaliidese ehitus, üks mitme faili ümbertegemine, üks pikk agendi seanss
  • Logimärgid ja seinakell, mitte ainult "kas see toimis"
  • Käsitle Arena.ai-d ja Artificial Analysis'i edetabeliloo peamiste avalike termomeetritena
  • Suuremahuliste majapidamistööde jaoks kasutage odavamat vaikemudelit
  • Kui kasutate platvorme nagu Questflow, mis on juba 5.5-le üle läinud, jälgige enne kõige ümberkirjutamist, kuidas teie olemasolevad töövood muutuvad
  • Ignoreeri "parim igavesti" variante; vaata uuesti mõne väljalasketsükli pärast

Kui kasutajaliidese ülesanne ebaõnnestub ja pikk agendi seanss kalliks läheb, on vastus ühe pärastlõunaga olemas. Kui nii käivitus- kui ka maksumus sobivad teie skaalale, siis palju õnne – teil võib olla uus vaikeväärtus. Kui ka kõige raskem ülesanne ebaõnnestub, olete õppinud midagi, mida edetabelid teile kunagi ei räägiks. See ongi kogu mäng. Natuke kuiv. Äärmiselt praktiline.

Üks ebatäiuslik metafoor, sest kosmilise seaduse kohaselt peavad need artiklid selle omama: ühe Elo kontakti käsitlemine "parima kodeeriva tehisintellektina" on nagu maailma parima koka kroonimine magustoiduvõistluse võidu tõttu. Magustoidud on olulised. Nii on ka õhtusöögi valmistamine kaheteistkümnele pirtsakale sugulasele katkise ahjuga. Sinu hoidla on sugulased.

Kuidas see sobib laiema kodeerimise ja tehisintellekti vahelise võidurelvastumisega

Suumi välja ja muster on tuttav. Laborid laevad turule. Lauad liiguvad ringi. Arendajad tungivad uuele laele. Tööriistade müüjad uuendavad vaikeväärtusi. Keegi postitab vapustava minimängu. Keegi teine ​​postitab teate ebameeldiva vea kohta. Keskmine võimekus tõuseb isegi siis, kui kroon vahetab pead.

Värskem tundub siin kahe tahvli signaal pluss kulude allmärkus, mis kaasneb auhiilgusega. Oleme möödas ajastust, kus üks vestluse võrdlusalus võis kanda tervet narratiivi. Kodeerimistöö on praktikas multimodaalne: kirjuta, redigeeri, sirvi, klõpsa, käivita, proovi uuesti. Agentuurile toetuvad indeksid ja veebiarenduse eelistustele toetuvad areenid tabavad selle erinevaid lõike. Kui üks mudel juhib mõlemat lõiku korraga, kirjutab hüppeline jutt ennast ise.

Keegi selge pilguga kirjutaja ei tea, kas Opus 5.5 jääb tipule. Rival Maxi tasemed on WebDevi foorumis juba karjumise kaugusel, kui ~26-punktiline erinevus peab paika. Nii väikesed erinevused võivad muutuda. Võimekus, mis demodes tundub "üleöö parem", võib mõne nädala pärast, kui kõik kohanevad, ikkagi olla uus normaalsus. Huvitav püsiv küsimus pole kroon. See on see, kas agentide kodeerimise kvaliteet dollari kohta tavaliste programmeerimisprogrammide arendajate jaoks jätkuvalt tõuseb. Selle küsimuse puhul on uus mõõdetud kõrgeim punkt 66 koos selgesõnalise kuluhoiatusega selge ja turundusega seotud aruandlus. Au väärib siinkohal.

Lõppkokkuvõttes

Claude Opus 5.5 Maxi tase on Arena.ai Code Arena WebDevi edetabelis teadaolevalt esikohal 1818 punktiga, mis on umbes 26 punkti eespool järgmisest nimetatud rivaalist katvuse poolest ja tunduvalt kõrgem kui eelmine Opus 5 Max, mille tulemus oli lähedal 1692 punktile. Artificial Analysis teatab, et see on uus kodeerija indeksi esikoht, kus Claude Code'is on maksimaalse pingutusega saavutatud 66 punkti – nende seni kõrgeim – ning lisaks on märgitud, et ülesande maksumus selle pingutusega tõuseb. Arendajate reaktsioon on vali: kiired localhost rakendused, mängud, süžeeskeemid, kasutajaliidese versioonid, "ärge nõrgestage" naljad ja platvormiuuendused, näiteks Questflow kolimine Opus 5-lt 5.5-le. Ringluses olevad väited lisavad Fable-klassi madalama hinnaga loo, tugevama agentide/arvutikasutuse sentimendi ning tuttavad hoiatused raskete ülesannete ja žetoonide põletamise kohta.

Veebiarenduse-kujuliste eelistusülesannete ja suure pingutusega agentide kodeerimise puhul väidavad avalikud foorumid, et Opus 5.5 on praegu juhtival kohal. Teie konkreetse repositooriumi, eelarve ja õudusunenägude piletite jaoks peate ikkagi bake-off'i läbi viima. Kroonid pöörlevad. Tööriistad on kombineeritud. Kasutage hüpet, ärge kummardage seda. Ja võib-olla hoidke teist mudelit soojas, kui arve hakkab välja nägema nagu süžeepööre.

Praktiline näide: Kolme ülesandega Opus 5.5 bake-off'i läbiviimine enne vaikesätte muutmist

edetabeli ekraanipildid said just Code Arenal esikoha – nüüd parimate kodeerimisarendajate seas. Tehisintellekti pretendentide hulgas on termomeetrid, mitte teie mahajäämus. Siin on näide sellest, kuidas Ühendkuningriigi vabakutseline täisversiooniarendaja muutis üleöö toimunud Elo hüppe ühe pärastlõunaseks küpsetusvooruks – üks kasutajaliidese ehitus, üks mitme faili ümbertegemine, üks pikk agendi seanss – enne mis tahes vaikimisi mudelivalija sisselülitamist.

Stsenaarium

Riley saadab SaaS-i kõrvalprojekti jaoks kliendile maandumislehed ja laiaulatusliku React/Node monorepo. Pärast seda, kui Arena.ai Code Arena WebDev postitused ja Artificial Analysis'i Coding Agent Indexi vestlus kroonisid Opus 5.5 (Max) tasemele, täitus Slack energiaga, mida annab „kasuta lihtsalt Maxi kõige jaoks“. Riley arved teevad pikkade sessioonide ajal juba niigi haiget ja eelmise kvartali „parim igaveseks“ vahetus sundis neid kaks korda kuus ülesandeid ümber kirjutama.

Nad hoiavad avalikke tahvleid kontekstina – WebDevis teatati 1818-st, agentide indeksi tipphetk koos kulude allmärkusega – ja keelduvad käsitlemast Elot tootmisotsusena. Plaan: kolm fikseeritud ülesannet Opus 5.5-s tavalise pingutuse seadistusega ja ainult vajadusel üks maksimaalse/maksimaalse pingutusega läbimine kleepuval piletil. Logitokenid, seinakell ja see, kas muudatus jõudis põhiaknasse. Odavam mudel jääb liimimistööde jaoks soojaks.

Eesmärk on „parima” isiklik määratlus: kvaliteet iga ühendatud muudatuse kohta, mitte grupivestluse ekraanipilt.

Mida assistent vajab

  • Kolm külmutatud ülesannet: (1) väike interaktiivne veebiarenduse kasutajaliides, (2) mitme faili refaktor testidega, (3) pikk agendi stiilis seanss tööriistade/shelli sammudega
  • Hindamisleht: Ülesanne / Pingutuse seadistus / Žetoonid / Seinakell / Kas jooksis puhtalt? / Ühendatud? / Märkmed
  • Eelmise vaikemudeli baasmärkmed samade kolme lühiülevaate kohta (isegi ligikaudsed)
  • Eelarvereegel: maksimaalne pingutus ainult siis, kui ebaõnnestumine on kulukas; odavam vaikimisi suuremahuliste tööde puhul
  • Lingid või ekraanipildid avalikest tahvlitest, millel on märge „ainult termomeeter”, mitte vastuvõtukriteeriumid
  • Inimest omanik, kes otsustab vaikimisi pärast bake-off'i - mitte pärast esimest ilusat localhost demot

Näidisjuhis

Sa aitad mul enne kodeerimise vaikeväärtuste muutmist läbi viia Claude Opus 5.5 jaoks õiglase kolmeülesandelise konkursi. Kasuta ainult minu poolt kleebitud ülesannete kirjeldusi ja kasutusnumbreid. Ära mõtle välja Arena Elo't, agentide indeksi skoori ega kuluprotsente.

Ülesanne: Koostage minu punktitabel, mis on täidetud kolme ülesande kohatäitetega. Seejärel kirjutage kuuest punktist koosnev otsustusreegel: millal jätta Opus 5.5 vaikevalikuks, millal reserveerida Max/max pingutus ainult kleepuvate piletite jaoks ja millal jätta odavam mudel mahutöö jaoks. Kui minu kleebitavas tekstis kuvatakse avalik edetabeli number, pange sellele nimeks TERMOMEETER.

Piirangud: Briti inglise keel. Keelustada väljend „parim kodeeriv tehisintellekt igaveseks”. Eelistada ühinemisjärgse muutuse maksumust kõhutundele. Kui mõõdik puudub, kirjutada [VAJA MÕÕTMIST] selle asemel, et arvata Fable'i klassi või 40% väiteid.

Väljund: tabeli päis pluss kolm tühja rida minu ülesannete jaoks ja seejärel otsuste täpploendid. Preambulit pole.

Kuidas seda testida

  • Käivita kasutajaliidese ülevaade ja ümbertegemine sama pingutustasemega, mida kasutad igapäevaselt. Veendu, et logisid tokenid ja seinakella, mitte ainult, et „see nägi hea välja“
  • Küsi: „Kas Code Arena #1 iseenesest õigustas tootmise ümberpööramist?“ Hea vastus: ei – ainult bake-off'i tulemused õigustavad.
  • Äärmuslik juhtum: kasutajaliides hüppab üles, pikk agendi seanss põletab tokeneid ja vajab ikkagi inimest – veenduge, et Max on reserveeritud ja mitte pole liimimistöö vaikesäteteks tehtud.
  • Äärmuslik juhtum: kõige raskem patoloogiline pilet ikkagi ebaõnnestub – veenduge, et hoiate teist mudelit soojas ja ei kirjuta kogu pinu ümber.
  • Vastuvõtukontrollid: (1) mõõdetud punktisummaks ei ole välja mõeldud 1818 ega 66, (2) kolm ülesannet on täidetud või selgelt ebaõnnestunud koos märkustega, (3) kulu on registreeritud, (4) odavam vaikimisi variant on endiselt mahu järgi nimetatud, (5) mõne väljalasketsükli järel on määratud uus kuupäev uuesti vaadata.

Tulemus

Illustreeriv tulemus (näide ühe vabakutselise arendaja kohta kolme külmutatud ülesande puhul ühel pärastlõunal, mitte Arena.ai või Artificial Analysis iseseisev kordus): WebDev-stiilis kasutajaliidese ülesande puhul andis Opus 5.5 tavalise koormusega puhta localhost eelvaate ühe korraga (1/1 ühendati pärast kerget lihvimist; umbes 12 minutit seinakella abil). Mitmefaililise refaktori puhul muutus 1/1 testikomplektist roheliseks pärast ühte juhendatud uuesti proovimist; tokenid olid umbes 30% kõrgemad kui sama ülesande eelmine vaikeväärtus (enesehinnanguline kasutuseksport). Pika agendi seansi korral lõpetati kleepuv pilet inimese abiga pärast tokeni järsku tõusu - tugev suurema koormuse korral, liiga kulukas igapäevase vaikeväärtusena. Otsus pärast lõpueksponeerimist: Opus 5.5 sai kasutajaliidese ja keskmise suurusega refaktorite vaikeväärtuseks; maksimaalne koormus reserveeritud ebameeldivate piletite jaoks; odavam mudel jäeti README/liimitööde jaoks. Hügieeni kontroll-lehel (termomeetri sildid alles, tokenid logitud, teine ​​mudel soe, „parim igaveseks“ vahetust ei tehtud) läbis 4/4 ülesannet. Piirangud: n = 3 ülesannet, üks arendaja, valiku kallutatus jagatavate kasutajaliidese võitude suunas; avalikud Elo lüngad võivad järgmisel nädalal ümber pöörata.

Oma versiooni mõõtmiseks: külmuta samad kolm ülesannet; hinda esmalt oma praegust vaikeväärtust; käivita Opus 5.5 identsete ülesannetega; võrdle edukust, märke, seinakella ja ühendamise määra; seejärel määra pingutustasemed koos nimetajatega.

Mis võib valesti minna

  • Ekraanipildi kummardamine: Vaikimisi lülitab Code Arena edetabeli ümberpööramine sisse.
  • Max-for-everything: põletasime sümboolse eelarve liimkoodil, sest ülemmäära skoor nägi ilus välja.
  • Demo kallutatus: Süžeeskeemi võidu korral edastatakse meeleolu, samal ajal kui monorepo pilet ikka ebaõnnestub.
  • Kulupimedus: agendiindeksi tippude puhul ülesande maksumuse allmärkuste ignoreerimine.
  • Ühe mudeli lukustus: Sooja varumängija mahapanemine, kui rivaali Maxi astmed on hüüdeulatuses.
  • Igavene mõte: Jätan pärast järgmist rahvarohket turuletoomise nädalat ühegi külastuse vahele.

Praktiline kaasavõetav toit

Code Arena WebDev'i ja kodeerimisagentide indeksi juhtiv Opus 5.5 on tõeline tõususignaal – ja ikkagi vaid termomeeter. Käivita üks kasutajaliidese järk, üks mitmefaililine ümbertegemine ja üks pikk agendi seanss; logi tokeneid ja liitmisi; reserveeri maksimaalne töömaht kleepuvate tööde jaoks; säilita odavam vaikeväärtus mahu jaoks. Kroonid vahetuvad. Sinu ühendatud muudatuse hind on see, mis loeb.

KKK

Mida see tähendab, et Claude Opus 5.5 oli just Code Arenal esikohal?

Arena.ai asetas Claude Opus 5.5 (Max) Code Arena veebiarenduse edetabeli tippu 1818 punktiga – see on umbes 26 punktiga parem kui GPT-6 Astra Max katvuses ja märkimisväärne hüpe võrreldes eelmise Opus 5 Maxiga, mille tulemus oli ligi 1692. Artificial Analysis loetleb eraldi loos Opus 5.5 uueks esikohale oma kodeerimisagentide indeksis, sealhulgas Claude Code'i 66 punkti maksimaalse pingutusega. Need on teatatud tahvlite arvud, mitte sõltumatu laboriaudit. Jutt käib kodeerimisfoorumite kiirvahetusest, mitte ainult turuletoomise postitusest.

Kui suur on hüpe Opus 5 Maxilt Opus 5.5 Maxile Code Arenal?

WebDevi avaldatud hetktõmmise põhjal oli eelmine Claude Opus 5 Max 1692 lähedal, samas kui Opus 5.5 (Max) saavutas 1818 selge tippsisendina. See on umbes 126-punktiline samm edasi sama perekonna Max tasemega võrreldes – selline delta, mis paneb inimesi Elo edetabeleid värskendama nagu sporditulemusi. GPT-6 Astra Max on teisel kohal, umbes 26-punktilise vahega. Lugege tabelit eelistuse tugevuse termomeetrina, mitte oma tootmismahu hinnanguna.

Mida Code Arena veebiarendusrada praktikas mõõdab?

Code Arena WebDev on üles ehitatud võrdlevale eelistusele kodeerimise ja liideste loomise ülesannetes: valijad valivad võitjad mudeli väljundite hulgast. See premeerib koodi, mis näeb hea välja, töötab demodes laitmatult ja tundub viimistletud – esiotsa struktuur, interaktiivsus ja visuaalne sidusus. See on teistsugune spordiala kui staatiline valikvastustega eksam või pikaajaline agendi hindamine, mis peab kesta elus hoidma kümnete tööriistakõnede jaoks. 1818 WebDevi edumaa näitab eelistuse tugevust nendes versioonides, mitte iga repositooriumi täielikku toitumisalast paneeli.

Milline on Opus 5.5 tehisanalüüsi kodeerimisagendi indeksi skoor?

Artificial Analysis teatab, et Opus 5.5 on nende kodeerimisagentide indeksi uus esinumber, kusjuures tulemused on paranenud kõigis jälgitavates hindamistes. Claude Code'is maksimaalse pingutuse korral sai mudel 66 punkti – see on kõrgeim tulemus, mida nad seni on mõõtnud. Täiskasvanute joonealune märkus on see, et ülesande maksumus tõuseb gaasipedaali põhja vajutades. Agendi tippskoor on võimekuse väide; ülesande maksumus on tegevuse väide ja need ei ole sama asi.

Kas Claude Opus 5.5 on parim kodeerimise tehisintellekt igapäevatööks?

See sõltub sellest, mida „parim” teie jaoks tähendab: Elo avalikul areenil, agentide indeks maksimaalse pingutusega, maksumus lõpetatud ülesande kohta või see, kas teie sassis repo kompileerub reede õhtul. WebDev-tüüpi päevad – maandumislehed, prototüübid, visuaalne lihv – sobivad hästi kokku Code Arena WebDevi müügivihjega. Agentide päevad sassis koodibaasides muudavad kodeerija agentide indeksi huvitavamaks, kusjuures kulupiiranguga kaasneb endiselt probleem. Ringluses olevate teadete kohaselt võib see kõige raskemate ülesannete puhul siiski maha jääda ja pikkade seansside ajal tokeneid põletada.

Kuidas peaksid meeskonnad Opus 5.5 puhul hakkama saama kulude ja tippkoormuse vahelise kompromissiga?

Reserveeri maksimaalne pingutus kleepuvate, mitme failiga tööde jaoks, kus ebaõnnestumine on kulukas, ja vähenda mahtu rutiinse liimimiskoodi, refaktorite ja lihvimise jaoks, mis vajavad mahtu. Jälgi omaenda ühendatud PR-i maksumust, mitte ainult avalikku Elo-d. Mudel, mis võidab maksimaalse pingutusega, võib ikkagi nädala kaotada, kui iga ülesanne põletab varanduse tokenites. Indie-häkkerid ja ettevõtted, kes jälgivad ühikuökonoomikat, võivad sama ekraanipildi üle karjuda, vajades samal ajal erinevaid vaikesätteid.

Millised ringlevad tooteväited ümbritsevad Claude Opus 5.5 äsja esikohale jõudnud lobisemist?

Coverage levitab väiteid, et paljude ülesannete puhul on selle jõudlus ligikaudu võrdne „Fable 5.1” klassiga umbes 40% madalamate jooksukuludega, lisaks on agentide kodeerimine ja arvutikasutuskäitumine tugevam kui eelmistel Opuse tasemetel. Mõned kasutajad ütlevad, et see jääb kõige raskemate ülesannete puhul maha ja pikad seansid võivad tokeneid põletada rohkem, kui inimesed ootavad. Käsitlege neid levitatavate väidetena, mitte artiklist lähtuvate kinnitatud laboritulemustena. Arve saabudes on isiklik töökoormus turunduse omast parem.

Miks tundus arendajate üleöö reaktsioon sel nädalal nii vali?

Arendajad postitavad kiireid localhosti rakendusi, pisikesi mänge, süžeeskeeme ja kasutajaliidese versioone, mis näevad välja nagu eelmise kvartali nädalavahetuse projektid – valiku kallutatusega võitjate poole. „Palun ärge tehke nõrgemaid“ naljad on meeleolukontroll, kui mudel tundub vabas õhus peaaegu liiga hea. Platvormid nagu Questflow on olnud vestlustes Opus 5-lt 5.5-le uuendamise üle, mis annab märku käegakatsutavast nõudlusest. Anekdoodilised demod on reaktsioon, mitte kontrollitud auditid – hoidke see eristus selge.

Mida peaksid ehitajad tegema pärast Opus 5.5 plii kodeerimisplaatide nägemist?

Käivita ise kolmeülesandeline bake-up-projekt: üks kasutajaliidese ehitus, üks mitme faili ümbertegemine ja üks pikk agendi seanss. Logi sisse tokenid ja seinakell, mitte ainult „kas see toimis“. Käsitle Arena.ai-d ja Artificial Analysis'i avalike termomeetritena, jäta suuremahuliste tööde jaoks odavam vaikeseade alles ja jälgi, kuidas platvormid, mis on juba 5.5-l, muudavad olemasolevaid töövooge enne kõike ümberkirjutamist. Ignoreeri „parim igaveseks“ valikuid ja vaata need uuesti läbi pärast paari väljalasketsüklit – kroonid vahetuvad; võimekuse tasemed tõusevad.

Kuidas ma saan enne kodeerimise vaikesätete muutmist läbi viia õiglase kolmeülesandelise eelvooru?

Külmuta kolm ülesannet – väike interaktiivne veebiarenduse kasutajaliides, mitme failiga refaktor testidega ja pikk agenditüüpi seanss –, seejärel hinda ülesandeid, pingutust, märke, seinakella, puhast käitamist?, ühendamist? ja märkmeid. Võrdle oma eelmise vaikesättega samadel ülesannetel; kasuta maksimaalset pingutust ainult siis, kui ebaõnnestumine on kulukas. Märgista avalikud tahvlinumbrid termomeetriteks, mitte vastuvõtukriteeriumideks. Otsusta vaikesätte pärast eelmiste versioonide testimist, mitte pärast esimest ilusat localhost demot – ja hoia odavamat mudelit soojas mahuka töö jaoks.

Viited

  1. Antroopiline — anthropic.com
  2. Claude'i platvorm — platform.claude.com
  3. Arena.ai — Kood Arena — arena.ai
  4. Kunstlik analüüs — kodeeriva agendi register — artificialanalysis.ai
Viktoriin
1. Mida kirjutab artikkel Claude Opus 5.5 (Max) kohta Arena.ai Code Arena WebDevis?

2. Milline silmapaistev näitaja on seotud maksimaalse pingutusega tehisanalüüsi kodeerimisagendi indeksis?

3. Millal peaksid ehitajad peamiste järelduste kohaselt maksimaalse pingutusega Opuse reserveerima?

4. Millist eelvalikut soovitab artikkel enne oma vaikemudeli ümberpööramist?

5. Miks artiklis öeldakse, et „parim kodeerimise tehisintellekt” on igapäevaste meeskondade jaoks ajutine?


Tagasi blogisse