OpenAI jätab maha sadu tehisintellekti kirjutatud matemaatikatõestusi ja jätab väljaku segamini
OpenAI kopeeris just avaldamata piirimudelist 372 matemaatilist tulemust GitHubi repositooriumisse. The Verge loeb kokku 722 käsikirja 372 tulemuse perekonnast. Paljud tõestused on juba Lean-vormingus kontrollitud, seega on loogika ilmselt hea, isegi kui uudsus on veel selgitamisel.
Ettevõte väidab, et on saavutanud võite neljamõõtmelise Kakeya hüpoteesi osas, teinud muudatusi olulistes algoritmides ja isegi teinud Riemanni hüpoteesi suunas „tegelikku edu“. Pressiesindaja ütles ajakirjale Scientific American, et peaaegu iga tulemus tuli ühest küsimusest ühele agendile – mitte mitme miljoni dollari suurusest 10 000 agendi parvest, mis varem Navier-Stokesi teooria lahendas. Keskmine maksumus: umbes kolm tundi ChatGPT Pro mõtlemist.
Matemaatikud ei rõõmusta kõik. MIT-i Andrew Sutherland ütles põhimõtteliselt: näidake mudelit või käsitlege ühekordset lugu kontrollimatuna. OpenAI enda nõuanderühm soovis saada juhiseid, mudelinimesid ja arvutustulemusi. OpenAI avaldas selle asemel keskmised ja mõned Lean-formaliseeringud. „Me viskasime tõestused kõrvale, palun seedige need läbi” on julge uurimisstrateegia.
Mistral avalikustab Large 4, triljoni parameetriga "Le Chonki", mille eesmärk on avatud kaalukategooria ülemvõim
Prantsuse labor Mistral avas avaliku eelvaate Mistral Large 4-st – mitteametlikult ML4-st, "väga ametlikult: le Chonk". See on natiivselt multimodaalne segu, millel on kokku 1 triljon parameetrit ja 49 miljardit aktiivset parameetrit. Kaalud lubatakse kuu lõpuks pärast partnerite ja valitsustega koostööd.
Koolitus viidi läbi 3800 NVIDIA Grace Blackwelli graafikaprotsessoril Mistrali enda Euroopa andmekeskustes. Põhiteemaks on suveräänsus pluss otsene haare: küberturvalisus, rahandus, õigus, kiibidisain. Ühes tehisanalüüsi kübertestis, kus mudelil palutakse reaalset haavatavust reprodutseerida ja parandada, sai Mistrali sõnul ML4 82% – kõrgeim tulemus kõigi mudelite seas –, samas kui mõned suletud hiiglased keelduvad ja saavad peaaegu nulli.
Seega soovib Euroopa endiselt kolmandat teed USA suletud laborite ja Hiina avatud kaalude vahel. Kas see ka püsima jääb, on iseasi. Juba hüüdnimi viitab sellele, et nad teavad, kui absurdne parameetrite võidujooks väljastpoolt paistab.
Claude kolib Google Docsi, Sheetsi ja Slidesi esimese osapoole külgribana
Anthropicu Claude Google Workspace'i jaoks on tasulistes pakettides avalikus beetatestimises. Installige Marketplace'i lisandmoodul, avage fail ja Claude ilmub külgribale, kus ta saab dokumenti lugeda ja kohapeal redigeerida. Uued ühenduspesad võimaldavad teil ka Google'i faile Claude'i vestluse kaudu luua ja kohandada.
Docsis saab see parandada lause vormingut rikkumata või kuvada suuremaid ümberkirjutusi soovituskaartidena. Sheets saab kasutada valemeid, pöördepunkte, diagramme ja isegi Pythoni ümbersuunamist sassis ühenduste jaoks. Slaidid saavad teie olemasolevast teemast uusi slaide luua ja seejärel kattuva rämpsu märgistada. Vaikimisi režiim küsib enne redigeerimist nõusolekut. Kui teile meeldib ohtlikult elada, on olemas režiim „Nõustu kõik”.
Gemini on siin juba olemas ja Microsoft Copilot teeb Office'i versiooni – mõnikord antropoloogilistel mudelitel, mis on lõbus väike vastuolu. Claude püüab nüüd olla tehisintellekti kiht mõlemas ökosüsteemis. Nimetage seda tootestrateegiaks või lihtsalt poolt valimata jätmiseks. Tõenäoliselt mõlemaks.
Meta ja Sierra koostavad isikliku agendi protokolli, et poed saaksid häid roboteid halbadest eristada
Sierra ja Meta koos Genesysi, Instincti, Rocketi, Shopify, Stripe'i ja Walmartiga loovad avatud standardi, kuidas isiklikud tehisintellekti agendid ettevõtetega suhtlevad. Tarbijad valivad, millele nende agent ligi pääseb. Ettevõtted määravad, mida agendid veebisaitidel, API-des või ettevõtte agendi kaudu teha võivad. Seansid toimivad OAuthi alusel.
V0.1 spetsifikatsioon ja referentsiimitatsioon peaksid valmima selle kuu lõpus. Bret Taylori sõnastus on otsekohene: valitseb omamoodi kaos, kuni midagi sellist ei teki. Amazon on blokeerinud Meta Muse'i. Walmart teeb Muse'iga koostööd ja näeb endiselt, kuidas CAPTCHA hõõrdumine agende välja viskab. Lennufirmad ja teised tõmbavad rangemaid piire.
OpenAI ja Anthropic pole veel ruumis. Taylor ütleb, et ta oleks väga pettunud, kui konkurendid selle vahele jätaksid. Standardite turuletoomise osas avameelne. Samuti veidi ebamugav, kui OpenAI esimees on protokolli kaasautor.
OpenAI otsuste API läheb avalikuks beetaversiooniks kiirete jah-või-ei vastuste jaoks
OpenAI avaldas Decisions API avalikus beetaversioonis gpt-6-luna serveris POST /v1/decisions käsuga. Sisesta see teksti, piltide või mõlema abil ja saad trükitud vastuseid umbes 10 korda kiiremini kui Responses API-ga – tõenäosus, et tingimus on tõene, valik sinu loendist või skoor järjestatud tasemete alusel.
Mõelge kahekordselt tasutud kaebuse suunamisele arveldusele või tootefoto märgistamisele praona. Pildid peavad olema base64-põhised. Hind on 0,10 dollarit miljoni sisendtokeni kohta, ilma väljundtokeni tasuta selles lõpp-punktis. Abikõlblikele klientidele on olemas andmete nullsäilitus ja HIPAA teed.
See ilmus DevDay'l piiratud eelvaates ja on nüüd avatud. GA on "lähinädalatel". See on ebaseksikas torustikutoodete vajadus - klassifikaatorid ilma iga kord romaani kirjutamata.
Google DeepMindi EmbeddingGemma 2 pakib teksti, pilte, heli ja video ühte seadme vektorruumi
EmbeddingGemma 2 on 740 miljoni parameetriga Apache 2.0 mudel, mis kaardistab teksti, koodi, pildid, video ja heli ühisesse 768-mõõtmelisse ruumi. Ehitatud Gemma 4 baasil. Mõeldud telefonidele ja muule piiratud riistvarale, mitte järjekordsele hiiglaslikule pilvepõhisele manustamisplatvormile.
Laadi ainult see, mida vajad: 270M teksti jaoks, lisa visuaalne või heli või võta terve pinu. Matrjoška kärpimine võib vektoreid kahandada 128 mõõtmeni, mis annab kuni 6 korda vähem salvestusruumi. Kontekst on 8K tokeneid – sellest piisab umbes 5,5 minuti heli või kümnete kaadrite jaoks. Google'i sõnul hüppas MTEB kood esimese EmbeddingGemmaga võrreldes ligi 10 punkti.
Kvantimisega Pixel 11 Pro puhul vajavad ainult tekstipõhised kaalud umbes 191 MB aktiivset muutmälu; täis-multimodaalne kaalutus umbes 567 MB. Algset tekstimudelit on juba alla laaditud 20 miljonit korda. Vaiksemad Google'i turuletoomised on mõnikord olulisemad kui efektsed.
Lõuna-Korea teadusminister kahekordistab 3,5 miljardi dollari suuruse piiriala tehisintellekti raja pärast Mythos't
Parlamendiauditil ütles asepeaminister Bae Kyung-hoon, et Soul säilitab oma suveräänse sihtasutuse mudeli projekti ja lisab eraldi piiriala tehisintellekti programmi. Ta seostas 4,7 triljoni vonni (3,5 miljardi dollari) suuruse projekti Anthropici Claude Mythost ümbritseva "Mythose šokiga" ja küberturvaohtudega.
Riiklik projekt läbis teise hindamise ja on teel kolmandasse. Bae nimetas praeguseid tulemusi globaalselt keskpärasteks ja soovib midagi juhtivatele avatud kaaluga süsteemidele lähemale jõudvat. Samuti pakkus ta välja aasta lõpuks teenuse „Tehisintellekt kõigile” – tasuta ja ilma kasutuspiiranguteta – ning megaprojekte andmekeskuste, füüsilise tehisintellekti ja kiipide valdkonnas.
Seega pole jutt mitte "kodumudeli tühistamisest". Pigem on jutt "selle kõrvale suurema ja hirmutavama raja lisamisest". Riiklikud tehisintellekti võidusõidud lähevad aina kallimaks. Kas 3,5 miljardist dollarist piisab USA ja Hiina mastaabis, on lahtine. Bae näib arvavat, et paigalseismine on hullem.
KKK
Mida OpenAI oma avaldamata piirimatemaatika mudeliga GitHubisse pani?
OpenAI avaldas 372 matemaatilist tulemusperekonda – umbes 722 käsikirja – avaldamata piirimudelist. Paljud tõestused on juba Leanis saadaval. Ettevõte väidab, et on tehtud edusamme neljamõõtmelise Kakeya hüpoteesi osas, tehtud algoritmi muudatusi ja töötatud Riemanni hüpoteesi suunas. Pressiesindaja ütles, et peaaegu iga tulemus tuli ühest päringust ühele agendile, keskmiselt umbes kolm tundi ChatGPT Pro mõtlemist – see ei ole suur mitme agendi parv.
Miks suhtuvad matemaatikud OpenAI ühekordsete matemaatiliste tõestuste loosse skeptiliselt?
MIT-i Andrew Sutherland kutsus OpenAI-d üles mudelit näitama või käsitlema ühekordset väidet kontrollimata kujul. OpenAI enda nõuanderühm soovis saada juhiseid, mudelinimesid ja arvutustulemusi. Selle asemel avaldas ettevõte keskmised ja mõned Lean-formaliseeringud. Tõestused võivad küll formaalselt õiged olla, kuid uudsus ja ühe agendi narratiiv jäävad vaieldavaks kuni täielikumate tõendite ilmumiseni.
Mis on Mistral Large 4 ja millal kaalud saabuvad?
Mistral Large 4 – tuntud ka kui ML4 või "Le Chonk" – on natiivselt multimodaalne ekspertide segu mudel, millel on kokku 1 triljon parameetrit ja 49 miljardit aktiivset parameetrit. See treenis 3800 NVIDIA Grace Blackwelli graafikaprotsessoril Mistrali Euroopa andmekeskustes. Avalik eelvaade on saadaval; täielikud kaalud lubatakse kuu lõpuks pärast partnerite ja valitsustega koostööd. Mistral esitles kasutusjuhtumeid küberturvalisuse, rahanduse, õiguse ja kiipide disaini valdkonnas.
Kuidas Claude Google Docsis, Sheetsis ja Slidesis töötab?
Claude Google Workspace'i jaoks on avalikus beetatestimisjärgus tasulistes pakettides Marketplace'i lisandmooduli kaudu. See asub külgribal, mis suudab faili lugeda ja kohapeal redigeerida või luua ja kohandada Google'i faile Claude'i vestluse kaudu. Docsis saab see parandada lauseid või hõljutada soovituskaarte; Sheets saab valemeid, liigendusi, diagramme ja valikulise Pythoni; Slides saab teie teemast slaide luua. Vaikimisi küsitakse enne redigeerimist; režiim „Nõustu kõik” jätab küsimused vahele.
Millist probleemi püüab lahendada Meta ja Sierra isikliku agendi protokoll?
Isiklikud tehisintellekti agendid tabavad ostlemisel või äri API-dele helistades sageli CAPTCHA-sid või blokeerivad need täielikult. Sierra ja Meta koos partneritega, sealhulgas Genesys, Shopify, Stripe ja Walmart, koostavad avatud standardit, et tarbijad saaksid kontrollida agentide juurdepääsu ja ettevõtted määrata OAuthi kaudu lubatud toimingud. V0.1 spetsifikatsioon ja viidete rakendamine peaksid valmima selle kuu lõpus. OpenAI ja Anthropic pole veel ruumis.
Millal peaksite kasutama OpenAI otsuste API-t vastuste API asemel?
Kui vajate kiirelt sisestatavat jah-või-ei vastust – näiteks tingimuse tõesuse tõenäosust, valikut loendist või järjestatud tasemetel olevat skoori –, kasutage Decisions API-t. See töötab gpt-6-luna protokollil POST /v1/decisions kaudu, aktsepteerib teksti ja reasiseseid base64 pilte ning on umbes 10 korda kiirem kui Responses API. Hind on 0,10 dollarit miljoni sisendtokeni kohta, väljundtokeni eest tasu ei võeta. Abikõlblikele klientidele on olemas andmete säilitamise nulltasu ja HIPAA-teed; GA on oodata lähikuudel.
Mis teeb Google DeepMindi EmbeddingGemma 2 telefonides kasulikuks?
EmbeddingGemma 2 on 740 miljoni parameetriga Apache 2.0 mudel, mis kaardistab teksti, koodi, pildid, video ja heli ühte 768-mõõtmelisse ruumi. Saate laadida ainult teksti (270 MB), lisada pildi või heli või võtta kogu pinu. Matrjoška kärpimine võib vektoreid kahandada 128-mõõtmeliseks, mis vähendab kuni 6 korda salvestusruumi. Kvantiseeritud Pixel 11 Pro-l vajab ainult teksti kujutamine umbes 191 MB aktiivset muutmälu ja täielik multimodaalsus umbes 567 MB, 8K-tokeni kontekstiga.