Cerca

Grok 4.7 arriva lo stesso giorno su Cursor e Copilot, OpenAI svela oltre 100 problemi matematici risolti, Googlebook in preordine

ai-powered-markdown-translator

Articolo tradotto dal francese all’italiano con gpt-5.6-sol.

Vedi progetto su GitHub ↗

Lunedì 21 settembre, la giornata appartiene a xAI: Grok 4.7 viene rilasciato e arriva lo stesso giorno su Cursor e GitHub Copilot, senza alcun ritardo tra l’annuncio del modello e il suo arrivo negli strumenti. OpenAI sceglie lo stesso giorno per rivelare che un modello interno addestrato dal 28 agosto ha risolto oltre cento problemi matematici aperti e per istituire un gruppo consultivo di matematici dopo una dichiarazione firmata da 27 medaglie Fields. Google apre i preordini del Googlebook, ElevenLabs pone un agente di montaggio al centro del suo editor video e Hugging Face ripubblica la propria libreria di tokenizzazione, da 3 a 30 volte più veloce.


Grok 4.7 viene rilasciato da xAI e arriva lo stesso giorno su Cursor e GitHub Copilot

21 settembre — xAI pubblica Grok 4.7, il suo modello più capace per il codice e il lavoro intellettuale. Il modello di base è più grande di quello di Grok 4.6 e la sua fase di apprendimento per rinforzo (reinforcement learning) è stata prolungata su una combinazione di attività ponderata verso problemi che richiedono diverse ore. xAI si aspetta un modello che verifichi meglio il proprio lavoro e gestisca meglio i contesti lunghi.

I dati delineano un profilo contrastante, più che un dominio. Il prezzo, invece, non cambia: 2 dollari per milione di token in input e 6 in output, come Grok 4.6, vale a dire la metà del prezzo di input di GPT-5.6 Sol e un quinto di quello di Fable 5.1. È su questo rapporto qualità-prezzo che si concentra l’argomentazione.

Misura pubblicataGrok 4.7 (xHigh)Grok 4.6 (High)GPT-5.6 Sol (Max)Fable 5.1 (Max)
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
EEBench (ingegneria elettrica)64,0 %53,0 %39,4 %56,4 %
Prezzo in input (dollari / M di token)22410
Prezzo in output (dollari / M di token)662050

L’API espone grok-4.7 con 500 000 token di contesto e quattro livelli di impegno di ragionamento, da low a xhigh; il prezzo raddoppia oltre i 200 000 token di prompt. xAI mette inoltre in evidenza una serie completamente nuova di misure di protezione: primo posto nel benchmark di biosicurezza di LatchBio con il 62,4% e il 3,3% di prompt cyber rischiosi a duplice uso lasciati passare su HackerBench v0.3.

La distribuzione è immediata presso due integratori. Cursor offre il modello fin dal primo giorno, conseguenza dell’acquisizione di Anysphere da parte di SpaceX, conclusa il 14 agosto. Il modello resta di xAI: l’articolo pubblicato lo stesso giorno sul blog di Cursor consiste in una sola frase e rimanda all’annuncio completo su x.ai. È xAI a mettere in evidenza CursorBench 4.0, il banco di prova di Cursor per attività di lunga durata, nel quale Grok 4.7 ottiene il 46,3% a prezzo invariato. GitHub Copilot, dal canto suo, lo distribuisce su tutte le proprie piattaforme, da VS Code a Xcode, per i piani da Pro a Enterprise. La fatturazione merita attenzione: Grok 4.7 non rientra nel sistema dei moltiplicatori delle richieste e viene fatturato in base all’utilizzo, al prezzo pubblico del fornitore. Poiché un nuovo modello viene attivato per impostazione predefinita, tenere sotto controllo la spesa richiede un intervento nei criteri relativi ai modelli, non basta semplicemente non fare nulla.

🔗 Grok 4.7 — xAI 🔗 Grok 4.7 è ora disponibile in GitHub Copilot


OpenAI istituisce un gruppo consultivo di matematici e rivela di aver risolto oltre cento problemi aperti

21 settembre — OpenAI annuncia di collaborare con un gruppo consultivo indipendente composto da nove matematici, costituito autonomamente dai suoi membri e ospitato presso l’Institute for Advanced Study di Princeton. Il contesto pesa più dell’annuncio.

On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.

🇮🇹 Il 28 agosto abbiamo iniziato ad addestrare un nuovo modello interno. Oltre ad aver risolto il problema del millennio di Navier-Stokes, questo modello ha ormai risolto più di 100 problemi aperti da lungo tempo nella maggior parte degli ambiti della matematica. — OpenAI, Gruppo consultivo sulla matematica e l’intelligenza artificiale

Il modello non è stato reso noto pubblicamente e OpenAI scrive che il ritmo di questi progressi ha sorpreso i suoi stessi matematici. Questa accelerazione ha provocato una reazione diretta: l’11 settembre è stata pubblicata una dichiarazione intitolata «Un grave disallineamento dell’IA nella matematica», dotata di un DOI Zenodo e firmata da 27 medaglie Fields, tra cui Terence Tao, Peter Scholze e Cédric Villani. La loro tesi non è che i modelli commettano errori. Risolvere un grande problema ha sempre segnalato una nuova comprensione, successivamente elaborata dalla comunità fino a diventare insegnabile; i firmatari temono che una produzione in massa di enunciati veri o falsi distrugga questo terreno fertile anziché alimentarlo e che questi annunci affrettati non lascino il tempo per una redazione corretta.

Il meccanismo poggia saldamente sull’indipendenza: il gruppo può formulare pareri non richiesti, commentare pubblicamente l’impatto di OpenAI sulla matematica e modificare la propria composizione senza l’approvazione dell’azienda, e i suoi membri non sono retribuiti da quest’ultima. Resta la frase che OpenAI inserisce alla fine dello stesso paragrafo: il gruppo non fornirà consulenza all’azienda sul ritmo dei suoi progressi interni. L’ambito riguarda quindi la diffusione dei risultati, non la loro produzione: tutto tranne ciò che ha scatenato la protesta. Martin Hairer, invece, compare in entrambi gli elenchi, come firmatario della dichiarazione e membro del gruppo.

🔗 Un grave disallineamento dell’IA nella matematica


Googlebook, la gamma di computer portatili Google progettata attorno a Gemini

21 settembre — Google apre i preordini del Googlebook, che presenta come una categoria a sé stante: lo stack tecnologico Android, fondamenta desktop ereditate da ChromeOS, il tutto progettato attorno a Gemini. Cinque modelli vengono lanciati contemporaneamente, prodotti da Acer, ASUS, Dell, HP e Lenovo, a partire da 899 dollari. Le consegne iniziano il 4 ottobre negli Stati Uniti e il 5 ottobre in Canada, Regno Unito, Irlanda, Francia, Germania e Australia.

Caratteristica annunciataValore
Prezzo di partenza899 dollari
ProcessoriIntel Core Ultra Series 3 o Snapdragon X Elite
NPUpiù di 45 TOPS
Memoria RAM16 GB di base, fino a 32 GB
Autonomiafino a 14 h di video, 16 h di navigazione web
Supporto softwareaggiornamenti fino a 10 anni

Tre funzionalità Gemini sono specifiche del dispositivo. Magic Pointer, attivato scuotendo il cursore, porta Gemini sull’elemento visualizzato sullo schermo — per analizzare un’e-mail sospetta o combinare più immagini — e Google precisa che si attiva solo su richiesta e può essere disabilitato. Rambler trasforma una dettatura sconnessa in un testo strutturato con titoli ed elenchi di attività, anche quando si cambia lingua a metà frase. Create My Widget genera widget per il desktop a partire da una descrizione in linguaggio naturale.

Per gli sviluppatori, ogni dispositivo viene fornito con Antigravity, la piattaforma di agenti di sviluppo di Google, e con un ambiente Linux isolato dotato di un terminale completo: la documentazione menziona esplicitamente la possibilità di eseguirvi Claude Code o Antigravity CLI. Questo isolamento si basa su un hypervisor pKVM certificato Level 5, che Google presenta come una novità assoluta per la categoria, completato dalla radice di fiducia hardware Titan. La continuità con il telefono Android fa il resto: ripresa di un’attività iniziata sul dispositivo mobile e applicazioni mobili trasmesse in streaming in una finestra del desktop. Ogni Googlebook include 12 mesi di Google AI Pro con 5 TB di spazio di archiviazione, 3 mesi di YouTube Premium e Photoshop e un anno di GeForce NOW.

🔗 Preordini del Googlebook


ElevenLabs inserisce un agente di montaggio in Studio 4.0

21 settembre — ElevenLabs pubblica Studio 4.0 in ElevenCreative, l’aggiornamento del suo editor video. L’idea guida si riassume in una frase: tutto si svolge nello stesso posto. La generazione di video, immagini, voci, musica ed effetti sonori viene avviata direttamente dal progetto, tutti i modelli di ElevenCreative possono essere richiamati senza uscire dall’editor e il montaggio, la sottotitolazione e infine l’esportazione si susseguono nella stessa interfaccia. Una sequenza può essere rielaborata senza riavviare l’intera generazione e i sottotitoli possono essere manipolati come qualsiasi altra clip sulla timeline (timeline).

La novità più strutturale è Studio Agent, un co-montatore presente in ogni progetto.

Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.

🇮🇹 Studio Agent è il tuo co-montatore IA, integrato in ogni progetto. Descrivi la modifica che desideri e lui esegue il montaggio. Intervieni e realizza i tuoi tagli quando vuoi, quindi restituisci la timeline all’agente.@ElevenLabs su X

È questo passaggio avanti e indietro a distinguere lo strumento da una generazione opaca: il montatore riprende il controllo quando vuole, quindi restituisce la timeline. Quest’ultima è stata inoltre ricostruita per i progetti multiscena e multitraccia — campagne pubblicitarie, tutorial, serie di contenuti brevi — con zoom a livello di fotogramma, aggancio delle clip e spostamento di un gruppo di clip senza che il resto perda la sincronizzazione. I commenti del team vengono inseriti su una clip o su un asset specifico, invece di disperdersi in discussioni separate.

Da notare per il monitoraggio: al momento della scansione, l’annuncio esisteva soltanto su X, in un thread di sei messaggi. Il blog di ElevenLabs si fermava all’articolo del 10 settembre e il changelog della documentazione alla voce del 14.

🔗 Studio 4.0 in ElevenCreative


Hugging Face pubblica tokenizers v1, da 3 a 30 volte più veloce con identificatori identici

21 settembre — Hugging Face pubblica la release candidate di tokenizers v1, la libreria Rust che trasforma il testo in sequenze di numeri interi prima che un modello lo legga. La constatazione di partenza è semplice: la tokenizzazione non è mai stata il collo di bottiglia delle pipeline di machine learning, ma l’equilibrio cambia man mano che i modelli accelerano, e una GPU che aspetta il processore è una GPU inattiva.

MetricaValore misurato
Accelerazione della codifica rispetto alla v0.23, un solo threadda 3 a 30 volte
Macchina di misurazioneApple M4 Max
Estremi inferiore e superiore dell’intervallot5-base e gpt2
Scalabilità su otto worker76% rispetto a quella lineare
Identificatori dei token prodottiidentici alla v0.23
Installazione della release candidatecargo add tokenizers --pre

Il vincolo che il team si impone è più interessante dei miglioramenti stessi: v1 produce esattamente gli stessi identificatori di token della v0.23, l’API, il vocabolario e i ranghi di fusione (merge ranks) non cambiano e la libreria rimane generalista invece di specializzarsi nel BPE. L’aggiornamento non richiede quindi altro che cambiare la versione installata.

Sei modifiche costituiscono il fulcro del lavoro e la più insolita si chiama bitcannon. L’espressione regolare che suddivide il testo in pre-token è un parametro fisso, fornito insieme al tokenizer: non c’è alcun motivo di farla interpretare da un motore generico a ogni codifica. Hugging Face scrive quindi manualmente la funzione di suddivisione e la fa operare su flussi di bit in SIMD, elaborando 64 byte per operazione di registro. Il compromesso è dichiarato: soltanto i pattern riconosciuti (GPT-2, cl100k, o200k, Tekken, DeepSeek) ne beneficiano, mentre gli altri mantengono il percorso regex, il che spiega l’intervallo compreso tra 3 e 30. A ciò si aggiungono un ciclo di fusione senza allocazioni né diramazioni, una cache di parole locale al thread di esecuzione e il parallelismo nativo. I binding C e C++ per la sola inferenza, destinati a ExecuTorch e llama.cpp, sono annunciati prima della versione 1.0.0.

🔗 tokenizers v1: codifica, decodifica e scalabilità, misurate


Devin Cloud arriva nel terminale, con accesso SSH alla macchina dell’agente

21 settembre — Cognition porta Devin Cloud nel terminale: devin --cloud, oppure /cloud da una sessione in corso, crea, controlla e riprende una sessione cloud senza uscire dalla CLI. Il meccanismo si basa su un comando simmetrico: /handoff trasferisce l’attività in corso alla macchina virtuale di Devin — Mac, Linux o Windows — e, se eseguito dal cloud, compie il percorso inverso recuperando il branch della pull request. Le sessioni cloud sopravvivono al terminale che le ha avviate.

And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.

🇮🇹 E, per la prima volta, connettiti tramite SSH alla macchina virtuale dedicata di Devin, quindi riporta il lavoro sul tuo dispositivo con /handoff.@cognition su X

devin ssh apre un accesso completo all’ambiente che l’agente si è costruito: modificare il codice, avviare un server di sviluppo, inoltrare porte, trasferire file tramite scp. L’ambiente di esecuzione smette di essere una scatola nera. Le sessioni SWE-2 sono gratuite in Devin Cloud fino all’8 ottobre.

🔗 Devin Cloud nel tuo terminale


Qwen Code v0.24.3 strumenta la sua Web Shell e rende persistenti le sessioni tramite JDBC

21 settembre — Qwen Code passa alla v0.24.3 il giorno successivo alla v0.24.2: trentuno pull request, nessuna modifica incompatibile. La parte essenziale del lavoro visibile riguarda la Web Shell, i cui risultati di esecuzione non sono più testo grezzo, ma una struttura che separa il comando, il suo output, i dettagli dell’esecuzione e il tempo trascorso. Una scheda trajectory, disattivata per impostazione predefinita, mostra le durate per turno, il tempo fino al primo token, il numero di token e la durata di ciascuna chiamata agli strumenti.

La parte meno visibile è probabilmente quella più strutturale. Il runtime riceve una persistenza JDBC dei propri collegamenti e delle proprie sessioni, consentendo di condividere lo stato tra più processi broker e di mantenere la proprietà di una sessione dopo un riavvio. Gli strumenti del runtime vengono inoltre instradati tramite bwrap con una policy di workspace immutabile — il seguito diretto del sandbox introdotto il giorno precedente, la cui impostazione rimane non esposta. Lo stesso giorno, l’SDK TypeScript v0.1.14 integra questa CLI e Qwen Code Desktop v0.24.3 segue a ruota.

🔗 Note di rilascio di Qwen Code v0.24.3


Hugging Face pubblica relore, una memoria del repository per gli agenti di programmazione

21 settembre — Hugging Face pubblica relore con licenza Apache-2.0, uno strumento che fornisce a un agente di programmazione la memoria di un repository. Il punto di partenza è un incidente: sul ticket Transformers #48630, aperto l’8 settembre, erano già state proposte due correzioni quando l’agente di integrazione continua dell’azienda stava per scriverne una terza. Le informazioni erano interamente su GitHub, ma frammentate tra ticket, pull request e commenti invisibili dal ticket iniziale.

relore indicizza questa cronologia registrando chi ha detto cosa: una decisione di un maintainer non equivale all’ipotesi di un contributor e i contenuti generati automaticamente vengono esclusi per impostazione predefinita. Accanto all’indice viene mantenuto un clone di lavoro, servito dalla stessa API HTTP, e le richieste vengono elaborate localmente — soltanto l’ingestione contatta GitHub. Seguono i verbi: inflight elenca i thread che dichiarano di chiudere un ticket, search --trust authoritative ha fatto emergere la PR #39847 all’origine della regressione, why parte da una riga di codice per ritrovare i commenti di revisione che la circondano. Durante un test sul campo, l’agente ha riferito che defs gli forniva una panoramica migliore di un file rispetto alla sua lettura integrale, usando il 5% dei token.

🔗 relore, memoria del repository per gli agenti di programmazione


Perplexity sottopone Computer a post-training sugli errori degli utenti e aggiunge la generazione video

21 settembre — Perplexity Research descrive in dettaglio come l’azienda sottopone a post-training il modello alla base del suo agente Computer — GLM 5.2, come rivela incidentalmente l’articolo — a partire dalle sessioni reali dei suoi utenti. Gli ambienti sintetici producono attività controllate e facili da verificare; le sessioni reali forniscono due segnali che essi non producono: le correzioni apportate dall’utente e gli errori restituiti dagli strumenti. Le sessioni contenenti dati personali e quelle degli utenti che hanno rifiutato l’uso per l’addestramento vengono escluse prima di qualsiasi campionamento.

Ogni turno riceve quindi uno di tre trattamenti: imitazione tramite entropia incrociata per i turni senza errori delle sessioni riuscite, correzione tramite divergenza di Kullback-Leibler per i turni errati corredati da un indizio valido, oppure semplice mantenimento nel contesto. Lo stesso insieme di pesi svolge il ruolo di insegnante e allievo, ma soltanto l’insegnante vede l’indizio. Tre giudici automatici propongono i turni responsabili e almeno due devono convergere, perché l’ultimo turno prima del reclamo è la causa reale soltanto in circa la metà dei casi.

Tasso di errori degli strumentiValore misurato
Offline, GLM 5.2 originale2,79 %
Offline, solo campionamento con rifiuto1,35 %
Offline, con auto-distillazione0,87 %
Online, tra due checkpoint2,24 % poi 1,77 %, ossia il 21,2 % in meno in termini relativi

Gli autori indicano esplicitamente ciò che questi dati non dimostrano: i checkpoint confrontati offline non sono stati addestrati sugli stessi dati, i risultati per attività rimangono contrastanti e l’insoddisfazione degli utenti non cambia in modo significativo, 2,58 % contro 2,54 %, nei test A/B con circa centomila utenti per gruppo.

Lo stesso giorno, Computer acquisisce la generazione di video, affidata a due modelli di terze parti: MiniMax H3 e ByteDance Seedance 2.5. Che si tratti di un clip promozionale, di una dimostrazione di prodotto o di un contenuto visivo per i social, il video finale arriva nello stesso thread del testo e delle immagini prodotti per la medesima richiesta. Disponibile per gli abbonati Pro e Max, senza alcuna indicazione di accesso gratuito o disponibilità tramite API.

🔗 Imparare dagli errori del mondo reale 🔗 Perplexity Computer e i modelli video


Gemini Notebook estende Live Chat e Interactive Learning Overviews a tutti gli utenti previsti

21 settembre — Gemini Notebook ha raggiunto due traguardi di distribuzione nello stesso giorno. Live Chat raggiunge il 100% degli abbonati Ultra su dispositivi mobili: una conversazione vocale in tempo reale con un notebook, in circa 100 lingue, basata sui più recenti modelli audio di Google, con una guida passo dopo passo quasi completamente a mani libere. Poche ore dopo, le Interactive Learning Overviews escono dalla distribuzione progressiva e diventano accessibili a tutti gli utenti, senza requisiti di abbonamento; collocate sotto Reports, riuniscono i riepiloghi delle fonti e gli artefatti dello studio in un unico spazio interattivo.

Entrambe le funzionalità erano state presentate il 15 settembre, nell’annuncio dei nuovi strumenti di studio. I messaggi del 21 non aggiungono alcuna funzionalità: sanciscono una disponibilità effettiva, completa per la prima e aperta a tutti per la seconda.

🔗 Live Chat distribuita al 100% 🔗 Interactive Learning Overviews aperte a tutti


Google.org stanzia 4 milioni di dollari per la formazione degli insegnanti sull’IA

21 settembre — Google.org stanzia 4 milioni di dollari a favore di Digital Promise, annunciati a New York a margine dell’Assemblea generale delle Nazioni Unite. Il finanziamento estende la Google AI Educator Series, una formazione gratuita annunciata all’inizio dell’anno e destinata ai 6 milioni di insegnanti delle scuole primarie, secondarie e dell’istruzione superiore negli Stati Uniti. Progettata con ISTE secondo un approccio in cui gli insegnanti formano altri insegnanti, si concentra su competenze trasferibili da uno strumento all’altro anziché su un prodotto specifico e si svolge attraverso moduli autogestiti convalidati da badge digitali.

Digital Promise interviene su tre fronti: adattare la formazione alle agenzie educative statali e ai distretti scolastici, collaborare con le reti di community college per gli insegnanti del primo ciclo e condurre nell’arco di due anni uno studio su ciò che aiuta realmente i docenti dell’istruzione superiore, i cui risultati saranno pubblicati in una guida pubblica gratuita.

🔗 Google.org e Digital Promise


Runway estende i suoi Workflows al compositing, alla trasparenza e alle mappe di profondità

21 settembre — Runway amplia i suoi Workflows, le sequenze di operazioni che si possono comporre nella sua applicazione, con cinque componenti orientati alla post-produzione: Compositing, Alpha, HDR, Depth Map e RGB Depth. L’argomentazione dell’annuncio si riassume in una frase: costruire una parte più ampia della propria catena di produzione (pipeline) nello stesso luogo, senza passare a un altro strumento tra una fase e l’altra. Il compositing e la gestione del canale alpha mirano ad assemblare più livelli di immagine; le mappe di profondità, nelle loro due forme, fungono da segnale geometrico per controllare effetti che dipendono dalla distanza dalla fotocamera. L’annuncio è stato pubblicato su X con una dimostrazione di 31 secondi, senza un articolo corrispondente sulla pagina delle notizie di Runway al momento della scansione.

🔗 Workflows estesi in Runway


NVIDIA lancia DSX Ready, un programma di qualificazione per alimentare e raffreddare le fabbriche di IA

21 settembre — NVIDIA lancia DSX Ready, un programma che qualifica i prodotti dei partner rispetto ai requisiti della sua architettura di riferimento DSX per le fabbriche di IA. Il punto di partenza è molto concreto: l’alimentazione, il raffreddamento, l’acqua, il sito e la rete elettrica determinano oggi ciò che un costruttore può effettivamente implementare, e un’apparecchiatura non adeguata al resto del progetto non trasforma la capacità di calcolo in produzione utile.

Categoria qualificataPartner al lancioPercorso di qualificazione
Accumulo di energia mediante batterieHitachi Energy, LG Energy Solution, TeslaTest da parte del partner, revisione e approvazione NVIDIA
Unità di distribuzione del raffreddamentoLG Electronics, LiquidStack, VertivSuite di autoqualificazione

NVIDIA pone un limite esplicito al significato dell’etichetta: superare la qualificazione non sostituisce l’ingegneria a livello del sito e non implica alcuna garanzia sulla sua stabilità. Altre categorie, riguardanti l’infrastruttura e il software, dovrebbero aggiungersi progressivamente.

🔗 NVIDIA DSX Ready


NVIDIA affronta la sicurezza degli agenti come un problema ingegneristico, livello per livello

21 settembre — NVIDIA pubblica una presa di posizione sulla sicurezza dei sistemi agentici: è un problema ingegneristico e richiede quindi requisiti definiti, controlli applicabili, responsabili designati e prove dell’efficacia delle protezioni. Lo stack è suddiviso in tre livelli — i modelli forniscono le capacità, gli harness organizzano contesto, strumenti e flussi di lavoro, l’ambiente di esecuzione fornisce l’infrastruttura in cui si svolgono le azioni — ciascuno dotato dei propri controlli.

L’esempio scelto è eloquente: un agente aggiorna la scheda di un cliente, incontra istruzioni dannose in un documento allegato e tenta di esportare i dati verso una destinazione non autorizzata. NVIDIA si aspetta quindi una policy di rete che blocchi il trasferimento e log protetti che conservino la chiamata allo strumento tentata, la decisione di autorizzazione e il risultato. Il diritto di aggiornare una scheda non si estende al diritto di esportarla e un agente può richiedere un accesso senza mai poterselo concedere. Sul fronte degli strumenti, OpenShell applica le policy fuori dalla portata dell’agente; Cisco vi sovrappone DefenseClaw e JFrog verifica le skill a cui un agente accede.

Lo stesso giorno, un secondo articolo applica lo stesso ragionamento all’IA fisica e lo collega alla base Halos; è riportato nelle notizie brevi qui sotto, insieme alle sue due proiezioni di mercato.

🔗 Proteggere lo stack degli agenti


Earth-2 assimila le osservazioni locali per aggiornare le previsioni meteorologiche

21 settembre — NVIDIA pubblica un tutorial sugli strumenti di assimilazione dei dati tramite IA di Earth-2, destinati ai settori che dispongono già di proprie misurazioni: parchi eolici e solari, radar e sensori locali, osservazioni satellitari. La prima tecnica, SDA, si applica ai modelli di diffusione come CorrDiff e StormCast: a ogni fase di denoising confronta il risultato intermedio con le osservazioni e orienta la fase successiva, senza nuovo addestramento.

Tecnica misurataCopertura e risoluzioneMiglioramento riportato nell’esempio
CorrDiff-SDAEuropa, da 0,25 gradi a 2,2 kmRMSE del vento ridotto del 54 % nelle stazioni escluse
StormCast-SDAStati Uniti continentali, 3 km, inizializzato con HRRRRMSE del vento ridotto del 7,2 % su sei intervalli temporali
HealDAGlobale, griglia HEALPix a 1 gradoStato globale dell’atmosfera stimato in pochi secondi

L’interesse è innanzitutto operativo: le analisi numeriche richiedono un tempo di calcolo considerevole e vengono prodotte a orari fissi, mentre SDA integra continuamente le osservazioni e colma il divario con l’ora corrente. HealDA, da parte sua, tratta ciascun flusso come una nuvola di punti nello spazio e nel tempo, aggregata sulla griglia di destinazione e poi elaborata da una rete dorsale (backbone) di tipo vision transformer.

🔗 Assimilazione dei dati in Earth-2


Multiverse Computing pota i blocchi come un vetro di Ising e guadagna 23 punti su MMLU

21 settembre — Rimuovere interi blocchi di transformer è uno dei modi meno costosi per accelerare un grande modello linguistico e uno dei più brutali: il modello diventa letteralmente più corto, ma la rimozione dei blocchi sbagliati lo fa crollare. Multiverse Computing sostiene che la domanda sia posta male. I metodi esistenti valutano ciascun blocco isolatamente — magnitude, sensibilità, block influence — un approccio che gli autori definiscono di campo medio, mentre l’effetto della rimozione di un blocco dipende da quelli rimossi contemporaneamente.

La selezione diventa quindi un problema di ottimizzazione binaria vincolata, che viene proiettato su un vetro di Ising: un sistema di spin disordinato, con interazioni tra tutte le coppie e un numero fisso di spin orientati verso l’alto. Il vantaggio pratico si riassume in una frase: l’energia di questo sistema è un sostituto economico del punteggio che otterrà il modello potato, permettendo di classificare un grandissimo numero di configurazioni candidate senza valutarne alcuna sui benchmark. Con una compressione del 50% di Llama-3.3-70B-Instruct, gli autori dichiarano un guadagno di quasi 23 punti percentuali su MMLU rispetto al miglior metodo concorrente.

🔗 Potare gli LLM come un fisico


Notizie in breve

NVIDIA ha pubblicato sette articoli e messaggi il 21 settembre: tre sono trattati sopra, mentre gli altri quattro figurano qui, senza annunci tecnici.

  • NVIDIA invoca la sicurezza a ogni livello per l’IA fisica — articolo di posizione basato su due proiezioni di mercato: 49 milioni di veicoli autonomi di livello da 3 a 5 installati entro il 2035 secondo ABI Research e circa 60 milioni di robot industriali impiegati tra il 2026 e il 2035 secondo Omdia. Quattro requisiti di sicurezza sono collegati alla piattaforma NVIDIA Halos. 🔗 fonte
  • NVIDIA mette in evidenza la crescita dell’ecosistema IA egiziano — ricevimento al Grand Egyptian Museum con un discorso di apertura di Paolo Guglielmini, vicepresidente EMEA. L’introduzione segnala soprattutto che fabbriche di IA stanno entrando in funzione in Sudafrica, Marocco e Nigeria. 🔗 fonte
  • NVIDIA presenta cinque aziende che applicano l’IA alle energie a basse emissioni di carbonio — panoramica pubblicata per la New York Climate Week, dall’accelerazione della fusione al riutilizzo delle batterie riciclate dei veicoli elettrici. ThinkLabs AI vi costruisce gemelli digitali e agenti su CUDA per abbreviare i tempi di connessione alla rete. 🔗 fonte
  • NVIDIA annuncia i vincitori dei Golden Tickets per GTC Berlin — sei vincitori selezionati da una giuria per la conferenza dal 20 al 22 ottobre 2026. Nessun contenuto tecnico. 🔗 fonte
  • Qwen-Image-2.1 supportato fin dal primo giorno da vLLM, SGLang, ComfyUI e Hugging Face — SGLang-Diffusion esegue il modello su una singola RTX 4090 da 24 GB con offload sulla CPU, generando un’immagine 1024 × 1024 in 18,7 secondi e occupando 22,7 GiB. vLLM lo descrive come un transformer di diffusione da 7,1 miliardi di parametri associato a Qwen3-VL-8B. 🔗 fonte
  • OpenAI Academy aggiunge quattro percorsi formativi — Build with AI, Lead AI Adoption, AI for Educators e AI for College Students si aggiungono ad Apply AI at Work. Ogni corso termina con una valutazione che assegna un badge; il percorso per sviluppatori distingue l’utilizzo di Codex dalla creazione sull’API. 🔗 fonte
  • Runway organizza a San Francisco un hackathon dedicato alla sua API — una sola giornata, il 30 settembre al Masonic, in concomitanza con il Runway AI Summit, per creare un agente, un’applicazione o un flusso di lavoro creativo, senza presentazione né procedura di approvazione. 🔗 fonte
  • HeyGen mette in evidenza Code2Video, un benchmark creato con Google DeepMind e Kaggle — la misurazione riguarda una questione distinta dalla scrittura del codice: stabilire se quel codice produca un video che valga la pena guardare. Pubblicato come commento a un messaggio sullo stack video agentico basato sulla generazione di codice. 🔗 fonte
  • Suno mostra effetti sonori applicati mediante una semplice descrizione — dimostrazione di un minuto, da una saturazione calda a una resa più sperimentale. Nessun nome della funzionalità, nessun piano interessato e nessun articolo di blog associato: una presentazione del prodotto più che un lancio. 🔗 fonte
  • Dimostrazione dal vivo di Gemini per gli acquisti su Discord — sessione annunciata per martedì 22 settembre alle 11 PT sul server Discord ufficiale, dedicata alla preparazione di un acquisto, al confronto tra opzioni e alla ricerca a partire da una foto. Nessuna nuova funzionalità. 🔗 fonte
  • Together AI e Ollama annunciano una sessione sugli agenti di programmazione aperti — Parth Sareen di Ollama e Zain Hasan di Together AI condurranno una sessione sulla messa in produzione di agenti di programmazione basati su modelli aperti. Nel messaggio non sono indicati né la data né il luogo. 🔗 fonte
  • I pesi di due addestramenti abbandonati di Boris-2 diventano aperti — il primo si era fermato a una loss di 3,100 dopo 30 miliardi di token, a causa di un’incompatibilità tra i gradienti Muon e AdamW; il secondo è stato interrotto intorno ai 7 miliardi di token. Un resoconto del fallimento più istruttivo dei modelli stessi. 🔗 fonte
  • Un protocollo preregistrato contro il bias direzionale dei modelli giudici — l’ipotesi è che, sui testi narrativi, gli errori tendano verso la dichiarazione esplicita di un sentimento anziché la sua codifica implicita. Il protocollo viene pubblicato prima di qualsiasi raccolta dei dati, indicando il risultato che porterebbe ad abbandonare il costrutto e dichiarando un conflitto d’interessi dell’autore. 🔗 fonte
  • Una riproduzione di Jev con componenti aperti manca il risultato di 0,6 punti — un utente che dichiara di non saper programmare affida a Claude Code una giornata di esperimenti per ricostruire Jev su stack aperti funzionanti esclusivamente su CPU. Otto approcci falliti, che giudica più istruttivi di quello riuscito. 🔗 fonte
  • Jevini separa la progettazione e l’esecuzione della decisione — un grande modello di ragionamento progetta un grafo versionato di giudizi tipizzati, che un piccolo modello decisionale esegue per ogni nuova situazione. Contenuto promozionale dell’editore, da trattare come tale. 🔗 fonte
  • Cohere porta avanti la propria comunicazione di marca, senza annunci di prodotto — un messaggio del 20 settembre prosegue la campagna AI for Empowerment riformulando l’intento attribuito al cofondatore Aidan Gomez, mentre due contenuti visivi del 21 raccontano la partecipazione dell’azienda all’hackathon studentesco Hack The North, a Waterloo. Nessun modello, nessuna funzionalità e nessuna tariffa. 🔗 campagna · 🔗 hackathon

Cosa significa

Il giorno zero sta diventando la norma per la distribuzione. Grok 4.7 non aspetta: è disponibile in Cursor e GitHub Copilot il giorno stesso del suo annuncio, mentre Qwen-Image-2.1 è stato supportato fin dal lancio da vLLM, SGLang, ComfyUI e Hugging Face. Il tempo tra la pubblicazione di un modello e la sua disponibilità negli strumenti quotidiani, che prima si misurava in settimane, tende ormai a zero: nel caso di Cursor perché l’editore e il laboratorio appartengono allo stesso gruppo dal 14 agosto, altrove perché l’integrazione viene preparata prima dell’annuncio. La domanda interessante non è più quando arriverà un modello, ma quanto costerà una volta arrivato.

È proprio questo che cambia la modalità di fatturazione di Copilot. Grok 4.7 esce dal sistema dei moltiplicatori delle richieste per essere fatturato a consumo secondo la tariffa pubblica di xAI. Insieme all’attivazione automatica dei nuovi modelli, ciò sposta una decisione sui costi verso l’amministrazione della piattaforma: non fare nulla equivale ad aprire una voce di spesa indicizzata sul listino di un fornitore terzo. Per xAI, l’argomento è simmetrico: gli stessi 2 dollari in input di Grok 4.6, miglioramenti reali su Terminal-Bench, ma una posizione dietro Fable 5.1 nelle attività di programmazione lunghe. Ciò che viene venduto qui è un rapporto qualità-prezzo, non il primo posto.

Sul fronte degli agenti, tre annunci distanti raccontano la stessa svolta: l’ambiente di esecuzione smette di essere una scatola nera. devin ssh apre la macchina virtuale dell’agente a una sessione interattiva, relore offre all’agente la memoria delle decisioni passate di un repository anziché il solo stato attuale del codice, Perplexity sottopone il proprio modello a post-addestramento sui turni precisi in cui ha fallito con i suoi utenti e Qwen Code instrada i propri strumenti tramite bwrap. NVIDIA fornisce il quadro teorico di questo movimento affermando che la sicurezza di un agente si costruisce livello per livello, al di fuori della sua portata, con log che fungono da prova. L’agente ispezionabile e l’agente vincolato sono le due facce della stessa esigenza.

Rimane la questione che l’annuncio di OpenAI pone senza affrontarla. Un modello interno che risolve più di cento problemi aperti in meno di un mese ha prodotto una risposta istituzionale — un gruppo consultivo indipendente, non retribuito e libero di esprimere i propri pareri — il cui mandato esclude esplicitamente il ritmo dei progressi interni, vale a dire l’oggetto stesso della protesta dei 27 medagliati Fields. Il contrasto con il resto della giornata è istruttivo: mentre si discute il ritmo dei risultati spettacolari, una libreria di tokenizzazione ottiene un miglioramento da 3 a 30 volte garantendo identificatori identici, mentre un metodo di compressione prende spunto dai vetri di spin per guadagnare 23 punti MMLU con una compressione del 50%. Questo lavoro non fa notizia, ma è ciò che determinerà il costo dell’inferenza di domani.


Fonti