ai-powered-markdown-translatorArticolo tradotto dal francese all’italiano con gpt-5.6-sol.
Martedì 22 settembre, Anthropic e OpenAI lanciano ciascuna un modello di frontiera, a meno di due ore di distanza: Claude Opus 5.5, presentato come al livello di Fable 5.1 con un costo inferiore del 40% rispetto a Opus 5, poi GPT-6 Sol e GPT-6 Luna, i cui prezzi API si dimezzano rispetto alla tariffa promozionale di GPT-5.6. Entrambe le famiglie arrivano lo stesso giorno su GitHub Copilot, Devin e Perplexity, mentre Claude Code 2.1.280 passa i piani Pro e Team Standard da Sonnet a Opus. Codex CLI 0.156.0, limiti di utilizzo aumentati presso Anthropic e una serie di pubblicazioni di NVIDIA completano la giornata.
Anthropic lancia Claude Opus 5.5, primo modello della famiglia Claude 5.5
22 settembre — Anthropic lancia Claude Opus 5.5 (claude-opus-5-5), primo modello della sua nuova famiglia Claude 5.5; Sonnet 5.5 e Haiku 5.5 seguiranno «nelle prossime settimane». È disponibile da oggi sull’API Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud e Microsoft Foundry e diventa, in Claude Code, il modello predefinito dei piani a pagamento. Finestra di contesto di un milione di token, output massimo di 128.000 token, conoscenze affidabili fino a giugno 2026.
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
🇮🇹 Ecco Claude Opus 5.5, il primo modello della nostra nuova famiglia Claude 5.5. Svolge la maggior parte delle attività al livello di Claude Fable 5.1 e costa il 40% in meno da eseguire rispetto a Opus 5. — @claudeai su X
Secondo Anthropic, questo 40% viene misurato «con le impostazioni predefinite» su carichi di lavoro tipici e combina prezzi inferiori e meno token per attività. Le tariffe scendono del 20% (4 dollari per l’input e 20 per l’output per milione di token, contro 5 e 25 per Opus 5) e del 60% per le letture dalla cache (0,20 dollari). L’output viene generato oltre il 30% più velocemente e una modalità rapida (fast mode), in anteprima di ricerca, promette una velocità fino a 2,5 volte superiore per 8 e 40 dollari.
| Benchmark (dati Anthropic) | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 Main | 54,4 % | 50,3 % | 53,3 % |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1542 |
| OSWorld 2.0 | 81,8 % | 80,7 % | — |
| AutomationBench | 40,0 % | 31,4 % | 41,4 % |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 64,6 % |
Opus 5.5 passa in testa nel codice agentico, nel lavoro d’ufficio e nell’uso del computer, ma GPT-6 Astra rimane avanti su AutomationBench e Terminal-Bench-Science. Anthropic precisa che i suoi punteggi sono stati misurati con le protezioni di produzione attive, il che probabilmente li riduce, e ritiene che i margini dei benchmark siano diventati «una guida meno affidabile»: nell’uso concreto, il divario con Fable 5.1 sarebbe più ridotto di quanto indichino questi dati. È il primo Opus lanciato con protezioni della classe di Fable 5.1 per cybersicurezza, biologia e distillazione (la maggior parte delle attività cyber passa a Opus 4.8), e Anthropic riconosce che spesso sembra sospettare di essere sottoposto a valutazione.
Per gli sviluppatori, la migrazione richiede alcuni adeguamenti: la riflessione adattiva non può più essere disattivata, la scelta forzata dello strumento (da tool_choice a any o tool) restituisce un errore 400 e il livello di effort predefinito passa a medium (contro high su Opus 5). Il testo scritto tra due chiamate agli strumenti torna ora nei blocchi di riflessione, vuoti con la visualizzazione predefinita.
🔗 Presentazione di Claude Opus 5.5 · Novità di Opus 5.5 per l’API
Claude Code 2.1.280 installa Opus 5.5 e passa Pro e Team Standard a Opus
22 settembre — Claude Code 2.1.280 viene pubblicato alle 16:38 UTC, sette minuti dopo l’annuncio di Opus 5.5. Non è stata pubblicata alcuna versione 2.1.279: il CHANGELOG passa direttamente dalla 2.1.278 del 19 settembre a questa versione da 114 voci.
Il cambiamento più visibile riguarda il modello. Opus 5.5 diventa il modello Opus predefinito e i piani Pro e Team Standard passano per impostazione predefinita da Sonnet a Opus, come già avveniva per Max, Team Premium ed Enterprise. I livelli di effort salvati prima che /effort diventasse specifico per ciascun modello non si applicano più ai nuovi modelli come Opus 5.5, che si avviano con la propria impostazione predefinita; Opus 4.7, Opus 4.8 e Fable 5, invece, smettono di imporre il proprio effort iniziale al di sopra dell’impostazione scelta.
Sul fronte della sicurezza, una scrittura eseguita tramite un collegamento simbolico viene ora valutata in base alla sua destinazione effettiva: la richiesta di autorizzazione indica il punto in cui termina e acceptEdits, le regole di autorizzazione e la modalità automatica non approvano più una scrittura che termina al di fuori dell’albero. La modalità automatica non rifiuta più azioni in modo ciclico e senza pause quando un controllo di sicurezza non restituisce una risposta: i nuovi tentativi vengono progressivamente distanziati e il turno termina dopo dieci rifiuti consecutivi. I marketplace di plugin che imitano un nome riservato vengono rifiutati e la variabile CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH permette di modificare il limite di 2.048 caratteri delle descrizioni degli strumenti MCP.
Il resto riguarda la praticità d’uso: la pressione isolata del tasto y o n non conferma né chiude più una finestra di dialogo (al loro posto si usano Invio ed Esc), un doppio Ctrl+C in una finestra di dialogo non chiude più Claude Code, vengono corrette due interruzioni della cache dei prompt e l’estensione VS Code ottiene sei comandi digitati (/status, /sandbox, /chrome, /export, /skills, /plan).
| Categoria di voce del CHANGELOG | Numero di voci |
|---|---|
| Correzioni (Fixed) | 69 |
| Miglioramenti (Improved) | 21 |
| Aggiunte (Added) | 12 |
| Modifiche (Changed) | 10 |
| Ripristino e rimozione | 2 |
| Totale | 114 |
Due guide per lavorare con Opus 5.5
22 settembre — Anthropic pubblica anche due guide firmate da Addy Osmani. La prima, «Quanto costa un’attività su Opus 5.5» (What a task costs on Opus 5.5), ricorda che due modelli con lo stesso prezzo per token possono avere costi molto diversi per la stessa attività, perché ogni turno invia nuovamente l’intera conversazione. I suoi esempi, presentati come illustrazioni basate sulle tariffe pubbliche: 2,8 milioni di token di input costano 11,20 dollari senza cache e 1,62 dollari con il 90% letto dalla cache, mentre un token di output costa 100 volte una lettura dalla cache. Consiglia l’effort medium per l’uso quotidiano, high quando medium si blocca, poi Fable 5.1 se Opus 5.5 si scontra due volte con lo stesso problema, tenendo presente che cambiare effort o modello svuota la cache (che dura un’ora con un abbonamento e cinque minuti per impostazione predefinita con una chiave API). In un benchmark interno su 44 ticket di assistenza, il passaggio da Opus 4.8 a Opus 5.5 con effort basso ha ridotto il costo di circa il 18%, e /claude-api prompt-audit di un ulteriore 9%.
La seconda guida, su claude.dev, consiglia di definire cosa significhi «completato» e poi lasciare lavorare il modello, eliminando istruzioni come «rifletti attentamente», poiché il modello riflette sempre prima di rispondere. Spiega inoltre il passaggio a un modello precedente quando un messaggio viene segnalato dalle protezioni, un comportamento configurabile nelle applicazioni o in /config.
🔗 Quanto costa un’attività su Opus 5.5 · Come ottenere il massimo da Opus 5.5
OpenAI lancia GPT-6 Sol e GPT-6 Luna, il 50% più economici della tariffa promozionale di GPT-5.6
22 settembre — Meno di due ore dopo Anthropic, OpenAI amplia la famiglia GPT-6 con GPT-6 Sol e GPT-6 Luna, addestrati con metodi simili a GPT-6 Astra, che secondo l’azienda rimane il suo modello migliore. Sol è destinato al codice complesso e ai flussi agentici, Luna alle attività mirate ad alto volume; succedono a GPT-5.6 Sol e GPT-5.6 Luna.
We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
🇮🇹 Abbiamo inoltre reso più efficienti la memorizzazione nella cache e l’inferenza e trasferiamo direttamente a voi questi risparmi: prezzi API inferiori del 50% per Sol e Luna rispetto alla tariffa promozionale di GPT-5.6. — @OpenAI su X
| Tipo di tariffa (per milione di token) | GPT-6 Sol | GPT-6 Luna | Tariffa GPT-5.6 citata (Sol / Luna) |
|---|---|---|---|
| Input | 2 dollari | 0,10 dollari | 4 dollari / 0,20 dollari |
| Input nella cache | 0,20 dollari | 0,01 dollari | non specificato |
| Output | 10 dollari | 0,50 dollari | 20 dollari / 1,20 dollari |
Entrambi i modelli accettano 1.050.000 token di contesto e producono fino a 128.000 token; oltre 272.000 token di input, l’intera richiesta viene fatturata al doppio per l’input e a 1,5 volte il prezzo per l’output.
Nei benchmark di OpenAI, che confrontano Sol con i modelli Claude precedenti a Opus 5.5, Sol ottiene il 33,2% su AutomationBench con effort xhigh per 0,27 dollari per attività, superando Claude Opus 5 con effort max (26,9%, con un costo 11,1 volte superiore) e GPT-6 Astra con effort low (30,3%). Su DeepSWE v1.1 raggiunge il 68,8%, a 1,1 punti dal miglior punteggio di Claude Fable 5, con un costo per attività inferiore di circa l’80%; Luna vi ottiene il 66,6%. I punteggi dei concorrenti provengono da rapporti pubblici. Sul fronte dell’allineamento, il tasso di inganno misurato su attività di codice progettate per indurre alla disonestà scende all’1,3% per Sol, contro il 10,4% di GPT-5.6 Sol.
Entrambi i modelli arrivano in ChatGPT Work e Codex per gli abbonati Plus, Pro, Business, Enterprise ed Edu, con una distribuzione progressiva (attivazione da parte dell’amministratore in Enterprise); gli utenti Free e Go possono utilizzare Luna nell’applicazione desktop, mentre i modelli non sono ancora disponibili in Chat. Nell’API si chiamano gpt-6-sol e gpt-6-luna, tramite Responses e Chat Completions.
🔗 Presentazione di GPT-6 Sol e Luna
Una cache dei prompt riprogettata per GPT-6
22 settembre — Il post che accompagna il lancio, «Better prompt caching for GPT-6», descrive nel dettaglio il nuovo sistema di cache della famiglia: tassi di successo predefiniti più elevati, uno sconto fino al 90% sui token di input nella cache, applicato ai prefissi condivisi idonei riutilizzati entro 30 minuti, e scrittura nella cache fatturata a 1,25 volte la tariffa di input. Gli sviluppatori ottengono una dashboard Prompt Caching, punti di interruzione espliciti (explicit cache breakpoints) per stabilire i prefissi da riutilizzare, il preriscaldamento della cache (prewarming) all’avvio di un’applicazione e un configuration_update che modifica l’effort di ragionamento da una risposta all’altra senza invalidare la cache. GitHub, tramite il suo direttore di prodotto Mario Rodriguez, afferma di aver ridotto di oltre il 50% la quota di token dei prompt da elaborare nuovamente; Strawberry Browser annuncia una riduzione dei costi del 20%.
🔗 Una migliore cache dei prompt per GPT-6
Lo stesso giorno negli strumenti: GitHub Copilot, Devin, Perplexity, Cursor e v0
22 settembre — Opus 5.5 e i due nuovi GPT-6 non si sono fatti attendere: nel giro di poche ore, i principali strumenti di programmazione e ricerca li hanno aggiunti, spesso con misurazioni proprie.
GitHub Copilot apre l’accesso a Opus 5.5, GPT-6 Sol e GPT-6 Luna
GitHub aggiunge i tre modelli il giorno del loro lancio su dieci piattaforme: VS Code, Visual Studio, Copilot CLI, l’agente di programmazione, l’applicazione GitHub Copilot, github.com, GitHub Mobile, JetBrains, Xcode ed Eclipse. Tutti vengono fatturati in base all’utilizzo alla tariffa pubblica del fornitore, senza moltiplicatore per le richieste premium: gli abbonati annuali rimasti con la precedente fatturazione per richieste non li ricevono. Nessuno dei tre compare ancora nella selezione automatica (Auto).
| Modello in Copilot | Piani disponibili | Input e output per milione di token |
|---|---|---|
| Claude Opus 5.5 | Pro+, Max, Business, Enterprise (non Pro) | 4 e 20 dollari |
| GPT-6 Sol | Pro+, Max, Business, Enterprise | 2 e 10 dollari, poi 4 e 15 oltre 272.000 token |
| GPT-6 Luna | Pro, Pro+, Max, Business, Enterprise | 0,10 e 0,50 dollari, poi 0,20 e 0,75 oltre 272.000 token |
Luna è quindi l’unico modello GPT-6 accessibile con Copilot Pro, mentre Opus 5.5 non vi è disponibile. Secondo i primi test di GitHub, Opus 5.5 risolve le attività al livello di Claude Opus 5 con un numero nettamente inferiore di passaggi e token. GitHub segnala inoltre che Opus 5.5 applica una filigrana (watermark) ai propri output testuali, senza effetti, secondo GitHub, sul significato, sulla qualità, sulla leggibilità, sul numero di token o sul costo.
🔗 Claude Opus 5.5 in GitHub Copilot · GPT-6 Sol e GPT-6 Luna in GitHub Copilot
Devin classifica i nuovi arrivati su FrontierCode 1.1
Cognition rende disponibile Claude Opus 5.5 in Devin Desktop e Devin CLI il giorno della sua uscita e lo colloca al primo posto nel suo benchmark FrontierCode 1.1 nella variante Extended, con il 65,3%, davanti a Claude Fable 5 (64,9%) e GPT-6 Astra (64,5%), a meno di un decimo del costo per attività di Fable 5. Questo 65,3% non è confrontabile con il 54,4% pubblicato da Anthropic, misurato sulla variante Main. Quarantasette minuti dopo arrivano anche GPT-6 Sol e Luna: Sol eguaglia GPT-5.6 Sol (60,7% contro 60,6%) con un costo per attività inferiore del 61% e legge circa il 17% di contesto in meno; Luna (56,1%) scende sotto 0,10 dollari per attività, risultando secondo Cognition il modello più economico della classifica.
Il giorno prima, nel pomeriggio del 21 settembre (ora del Pacifico), Cognition aveva reso disponibile Grok 4.7 e lo aveva misurato al 59,4%, sotto Grok 4.6 (61,3%): solido nelle attività back-end difficili in Java, Go e Ruby, tende ad andare oltre l’ambito richiesto (over-scope), con diff più grandi di quanto richieda l’attività. Subito dopo, v0 ha reso disponibile Grok 4.7, con uno sconto del 40% fino al 27 settembre, senza specificare a cosa si applichi.
| Modello valutato | Punteggio FrontierCode 1.1 Extended |
|---|---|
| Claude Opus 5.5 | 65,3 % |
| Claude Fable 5 | 64,9 % |
| GPT-6 Astra | 64,5 % |
| Claude Fable 5.1 | 63,6 % |
| SWE-2 | 62,5 % |
| Grok 4.6 | 61,3 % |
| GPT-6 Sol | 60,7 % |
| GPT-5.6 Sol | 60,6 % |
| Grok 4.7 | 59,4 % |
| Gemini 3.7 Flash | 56,3 % |
| GPT-6 Luna | 56,1 % |
In grassetto, i modelli aggiunti a Devin il 21 e 22 settembre. Punteggi pubblicati da Cognition sulla variante Extended.
🔗 Opus 5.5 in Devin · GPT-6 Sol e Luna in Devin · Grok 4.7 in Devin · Grok 4.7 in v0
Perplexity: Opus 5.5 e GPT-6 Sol in Computer, quattro modelli nell’Agent API
Perplexity integra entrambi i nuovi modelli nel selettore dello sforzo introdotto il 17 settembre in Computer, il suo agente multi-step. Claude Opus 5.5 diventa il livello Standard: su WANDR, il benchmark interno di Perplexity per costi e prestazioni, ottiene 0,610 per 4,13 dollari per attività, leggermente sopra Claude Fable 5.1 con un costo per attività inferiore del 67,6%. GPT-6 Sol, disponibile anche nell’applicazione Perplexity, diventa l’opzione predefinita del livello Light. Nessuno dei due annunci specifica i piani interessati né i modelli sostituiti.
Per gli sviluppatori, una voce del changelog dell’API, datata soltanto settembre 2026, aggiunge all’Agent API openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 e xai/grok-4.7, senza indicarne il prezzo.
🔗 Opus 5.5 in Computer · GPT-6 Sol in Computer · Changelog dell’API Perplexity
Cursor e v0 rendono disponibile Opus 5.5
Cursor lo presenta come il nuovo miglior modello di CursorBench, con il 57,8% al massimo livello di sforzo (Max), a un costo per attività inferiore del 40% rispetto a Opus 5: sono i dati di Anthropic, con il livello di sforzo specificato. v0 lo rende disponibile senza dettagli sui prezzi.
🔗 Cursor su X · v0 su X
Anthropic aumenta i limiti su cinque ore e offre un ripristino fino al 22 ottobre
22 settembre — Con Opus 5.5, Anthropic aumenta i limiti calcolati su cinque ore dei piani Pro, Max, Team ed Enterprise basati sulle licenze (seat-based). L’account @ClaudeDevs quantifica l’aumento per Claude Code: +20% sui limiti delle sessioni di cinque ore a partire da oggi. Gli abbonati ricevono inoltre un ripristino del limite da tenere di riserva e attivare quando preferiscono: è disponibile in Impostazioni → Utilizzo (Settings → Usage) per Pro, Max e Team e può essere usato fino al 22 ottobre.
A ciò si aggiunge l’effetto del prezzo: in Claude Code, Opus 5.5 diventa il modello predefinito dei piani a pagamento e, essendo meno costoso di Opus 5, fa durare i limiti su cinque ore e settimanali «il 25% in più». La guida ai costi pubblicata lo stesso giorno precisa che la riduzione si riflette sui limiti, incluso il contesto in cache, ma che l’ulteriore riduzione del prezzo delle letture dalla cache riguarda soltanto l’API.
🔗 @ClaudeDevs su X · Ripristino e limiti
Codex CLI 0.156.0 attiva per impostazione predefinita la voce e i worktree
22 settembre — Pubblicata alle 19:51 UTC, Codex CLI 0.156.0 è la prima versione stabile dopo la 0.155.1 del 18 settembre; il suo changelog completo elenca 525 pull request dalla 0.155.0. Estende a tutti due funzionalità ancora sperimentali nella 0.155: le conversazioni vocali, con motori audio integrati per Linux e Windows, e i worktree, che il centro di comando degli agenti può aprire in sessioni filtrando le attività per stato.
| Novità della versione | Comando o impostazione | Precedente in Codex CLI |
|---|---|---|
| Conversazioni vocali predefinite | F8, /voice settings | /voice sperimentale (0.155.0, 17 settembre) |
| Worktree predefiniti | centro di comando degli agenti | sperimentali dalla 0.154.0 (9 settembre) |
| Interfaccia a schermo intero | /tui, al prossimo avvio | nessuno |
| Dashboard di analytics | /usage | analytics dell’applicazione desktop (18 settembre) |
| Server locale in background | /daemon, --no-daemon | nessuno |
L’interfaccia a schermo intero introduce la ricerca nella trascrizione, la selezione con il mouse e la copia con il tasto destro; arrivano sei temi integrati e le risposte mostrano direttamente i diagrammi Mermaid e le equazioni. La versione corregge inoltre diverse falle nell’isolamento della sandbox (traffico in entrata su Windows, socket Unix dell’app-server, fcntl modificabili su macOS). Le note di rilascio non menzionano GPT-6: Sol e Luna si selezionano con /model o --model.
Agenti di coding nel terminale: Vibe CLI, Qwen Code e Amp
Vibe CLI 2.25.6 e 2.25.7
22 settembre — Mistral pubblica Vibe CLI 2.25.7, con sei correzioni, il giorno dopo una 2.25.6 datata 21 settembre nel CHANGELOG ma mai pubblicata come release su GitHub, che contiene la maggior parte delle novità (1 aggiunta, 3 modifiche, 17 correzioni). Con l’opzione --experimental-harness, è possibile allegare immagini anche quando il modello attivo non è in grado di leggerle: un modello dotato di capacità visive dello stesso provider le descrive all’agente e la chiave vision_model di config.toml consente di specificarne uno diverso. Le schermate dell’interfaccia così descritte includono un contratto di layout (layout contract) affinché l’agente possa ricostruire la schermata.
Sul fronte della sicurezza, i comandi Git eseguiti senza approvazione vengono irrobustiti: i fetch protetti non ereditano più le sovrascritture dei percorsi dalla configurazione Git, un checkout non attendibile non può più scegliere il client SSH né gli hook e le opzioni rischiose o i reindirizzamenti della shell inseriti nei comandi di sola lettura richiedono un’approvazione. La 2.25.7 rende infine disponibile /teleport per le chiavi API Vibe e workspace, inclusi gli account gratuiti.
🔗 Vibe CLI v2.25.7 · CHANGELOG di Vibe CLI
Qwen Code v0.24.4
22 settembre — Un giorno dopo la v0.24.3, Qwen Code passa alla v0.24.4 con 13 funzionalità e 15 correzioni, senza modifiche incompatibili. Il server qwen serve ora apre workspace remoti tramite SSH senza installare un demone sulla macchina di destinazione, mentre la sandbox bubblewrap (bwrap), introdotta su Linux con la v0.24.0, viene applicata a livello dell’esecuzione di ogni strumento. Nel Web Shell, l’associazione tramite codice QR diventa disponibile per impostazione predefinita quando il server autenticato è in ascolto su un indirizzo diverso dal loopback (loopback), con inviti monouso che scadono dopo 60 secondi, e i diff delle modifiche vengono mostrati prima dell’approvazione. Sul fronte Java, le esecuzioni gestite degli strumenti vengono conservate nel database tramite JDBC. Una v0.24.5-preview.0 limitata a due correzioni è stata pubblicata lo stesso giorno.
I runner Amp creano worktree Git
22 settembre — Cinque giorni dopo aver consentito a un runner di servire più directory, Amp gli permette di creare worktree Git. Nel selettore, ogni repository servito propone l’opzione New Worktree: si preme Tab, si assegna un nome al branch e il thread si avvia in un nuovo checkout creato accanto al repository (~/code/amp produce ~/code/amp-fix-flaky-login-test), senza modificare il checkout principale. Un’azione dedicata archivia poi il thread ed elimina worktree e branch. I runner possono inoltre ricevere i segreti e le variabili d’ambiente (Secrets & Env Vars) configurati su ampcode.com: disattivata per impostazione predefinita, l’opzione si attiva con --amp-env e una variabile modificata viene applicata al thread successivo, senza riavvio né SSH.
Valutazioni di terze parti: OpenAI stabilisce le proprie regole, l’AISI britannico pubblica i risultati
22 settembre — Nello stesso giorno, due pubblicazioni riguardano la valutazione dei modelli da parte di organismi esterni ai laboratori.
OpenAI: quattro priorità e sette principi per i valutatori indipendenti
Firmato da Lama Ahmad, il post impegna OpenAI a fornire a valutatori indipendenti, privati o senza scopo di lucro, un accesso approfondito all’addestramento, alla valutazione e all’implementazione dei suoi modelli, affinché possano mettere in discussione le sue ipotesi, individuare rischi trascurati e giudicare autonomamente le sue protezioni. Queste valutazioni, distinte dal lavoro svolto con i governi, durerebbero da alcune settimane a diversi mesi, senza essere legate a un lancio.
| Ambito prioritario | Cosa viene esaminato |
|---|---|
| Dossier di sicurezza (safety cases) | L’argomentazione che dimostra che i rischi di un modello sono sotto controllo, dall’addestramento all’implementazione esterna |
| Protezioni critiche | Resistenza ai jailbreak, difese cyber, monitor del disallineamento, affidabilità del monitoraggio della chain of thought |
| Preparedness Framework | Test delle capacità (rischi chimici e biologici, cybersicurezza, auto-miglioramento dell’IA) e allineamento |
| Incidenti di disallineamento | Indagini indipendenti sugli incidenti critici, con l’incidente Hugging Face di luglio citato come esempio |
Il tutto è disciplinato da sette principi: ambito concordato e affermazioni registrate in anticipo, accesso proporzionato, metodo trasparente, competenza e indipendenza (conflitti d’interesse dichiarati), sicurezza e riservatezza, risultati utilizzabili con un periodo per le correzioni prima della pubblicazione e pubblicazione responsabile che regolamenti gli omissis. OpenAI afferma di essere in trattativa con diversi organismi, senza nominarne alcuno.
🔗 Priorità e principi per valutazioni efficaci di terze parti
Il UK AI Security Institute pubblica i propri risultati verificati con EvalEval
L’EvalEval Coalition annuncia sul blog di Hugging Face che il UK AI Security Institute (AISI), l’organismo pubblico britannico incaricato di studiare i rischi dell’IA avanzata, pubblica ora i propri risultati di valutazione nelle Evaluation Cards, la piattaforma aperta di EvalEval, insieme al contesto e alla configurazione, nel formato comune Every Eval Ever. La prima pubblicazione copre cinque benchmark (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro e Terminal-Bench 2.0) misurati su sei modelli, Claude Opus 4, 4.5 e 4.6, GPT-5, GPT-5.2 e GPT-5.4, oltre a due valutazioni cyber. La questione centrale è la riproducibilità: riferimenti verificati, pubblicati insieme alla loro configurazione, aiutano a comprendere perché due punteggi apparentemente confrontabili divergano.
🔗 Come UK AISI ed EvalEval rendono riproducibili i risultati dei benchmark
ChatGPT monitora il punteggio di credito Experian negli Stati Uniti
21 settembre — Annunciata dall’account @ChatGPT il 21 settembre, una nuova funzionalità consente di monitorare il proprio punteggio di credito in ChatGPT. Dall’area Finanze, gli abbonati Plus e Pro negli Stati Uniti collegano il proprio rapporto di credito Experian e il proprio punteggio VantageScore 3.0, ricevono spiegazioni personalizzate sui fattori che influenzano tale punteggio e vengono avvisati quando cambia. La funzionalità è disponibile sul web e nelle versioni più recenti delle applicazioni iOS e Android.
OpenAI cita casi d’uso concreti: valutare l’effetto del proprio credito su una richiesta di affitto, scegliere quale carta di credito rimborsare per prima, costruire la propria affidabilità creditizia nel tempo oppure vedere come credito e budget incidano sul leasing di un’auto o su un mutuo. La funzionalità completa gli strumenti per le finanze personali lanciati in anteprima a maggio per gli abbonati Pro statunitensi, con il collegamento bancario tramite Plaid.
Google: Colab entra nei piani Google AI, l’API Gemini limita Gemini 2.5
Colab entra nei piani Google AI
22 settembre — Gli abbonati Google AI ottengono vantaggi premium di Colab, tra cui l’accesso prioritario ad acceleratori più veloci e a macchine più potenti. Gli abbonati Ultra sbloccano inoltre l’esecuzione in background senza interruzioni e l’accesso alle GPU Premium, affinché un lungo addestramento possa completarsi senza mantenere aperta una scheda. Il post parla di un lancio «a partire da oggi», ma precisa che i vantaggi arriveranno nel corso delle prossime settimane nei Paesi in cui Colab è disponibile. Secondo le FAQ di Colab, le unità di calcolo di un piano Google AI e di un abbonamento Colab Pro o Pro+ vengono sommate allo stesso saldo; i piani Google One limitati allo spazio di archiviazione e le prove gratuite non ne beneficiano. Né il post né le FAQ quantificano le unità assegnate a ciascun piano.
🔗 Colab ora fa parte del tuo piano Google AI · FAQ di Colab
L’API Gemini limita l’accesso a Gemini 2.5
18 settembre — In una nota del 18 settembre, le note di rilascio dell’API Gemini limitano l’accesso ai modelli Gemini 2.5 agli utenti che li hanno utilizzati attivamente in passato, per garantire prestazioni affidabili e preservare la capacità. Questi modelli non sono deprecati e continueranno a essere disponibili fino a nuovo avviso: la pagina delle deprecazioni non mostra alcuna data di cessazione per gemini-2.5-pro, gemini-2.5-flash e gemini-2.5-flash-lite; soltanto gemini-2.5-flash-image verrà dismesso il 2 ottobre 2026. Per ogni nuovo progetto, Google indirizza verso Gemini 3.5 Flash-Lite o Gemini 3.8 Flash.
🔗 Note di rilascio dell’API Gemini · Pagina delle deprecazioni di Gemini
Hugging Face esegue i GGUF di llama.cpp in Transformers
22 settembre — Hugging Face consente ora di eseguire in modo efficiente in Transformers i file GGUF, il formato di quantizzazione di llama.cpp. Basta passare il file a from_pretrained (parametro gguf_file): i pesi restano compressi in memoria e i calcoli vengono eseguiti dai kernel Metal di ggml, distribuiti dall’Hub tramite la libreria kernels. Il comando transformers serve espone poi il modello dietro un’API compatibile con OpenAI.
L’ambito iniziale è ristretto: solo Mac Apple Silicon, architettura Qwen3.5 nelle versioni dense e MoE (oltre ai checkpoint Qwen3.8 compatibili), una conversazione alla volta e installazione dal branch main. Quattro kernel provengono da ggml, mentre un quinto, scritto da Hugging Face, gestisce l’instradamento degli esperti. Su un MacBook Pro M2 Max, Hugging Face giudica Transformers «vicino» a llama.cpp, con valori forniti solo in forma grafica e misurazioni non identiche (prefill incluso da una parte, solo decodifica dall’altra); il team continua a raccomandare llama.cpp per un’inferenza locale efficiente. L’interesse è altrove: manipolare un GGUF con i consueti strumenti PyTorch oppure partire da un GGUF dequantizzato per un fine-tuning.
| Variante GGUF (Qwen3.5-4B, Unsloth) | Dimensione del file | Compromesso indicato |
|---|---|---|
| BF16 | 8,42 GB | Riferimento non quantizzato |
| Q6_K | 3,53 GB | Maggiore precisione |
| Q5_K_M | 3,14 GB | Compromesso tra dimensioni e precisione |
| Q4_K_M | 2,74 GB | Punto di partenza consigliato per uso locale |
🔗 Transformers ora esegue le quantizzazioni di llama.cpp
Kimi: K3 su Amazon Bedrock e un’estensione del browser rinominata
Kimi K3 arriva su Amazon Bedrock
22 settembre — Moonshot AI annuncia l’arrivo di Kimi K3 su Amazon Bedrock; la scheda AWS data tuttavia questo lancio al 18 settembre. Il modello open-weight, pubblicato a fine luglio con un contesto di un milione di token, beneficia dei controlli di accesso, crittografia e audit di Bedrock. Viene servito tramite inferenza interregionale (cross-Region inference) statunitense e globale (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), mentre la sua cache esplicita parte da 1.024 token per punto di cache, per almeno 30 minuti. I livelli Priority (1,75 volte la tariffa) e Flex (0,5 volte) si applicano ai prezzi di base.
| Opzione di inferenza (livello Standard) | Input per milione di token | Output per milione di token | Lettura dalla cache |
|---|---|---|---|
| Inferenza globale | 3,00 dollari | 15,00 dollari | 0,30 dollari |
| Inferenza statunitense | 3,30 dollari | 16,50 dollari | 0,33 dollari |
🔗 Scheda di Kimi K3 su Amazon Bedrock · Kimi K3 su Bedrock, annuncio su X
Kimi WebBridge diventa Kimi Browser Extension
22 settembre — L’estensione del browser apparsa a giugno con Kimi Work cambia nome e acquisisce una barra laterale dalla quale è possibile dialogare con Kimi affinché navighi sui siti, compili moduli e porti a termine le attività. Le attività ripetitive vengono registrate una volta e salvate come skill, che Kimi riprende la volta successiva; l’estensione suddivide inoltre le pagine web in comandi. Un servizio locale controlla Chrome o Edge già aperto tramite Chrome DevTools Protocol e Moonshot afferma che le sessioni di accesso e il contenuto delle pagine non lasciano il dispositivo. Solo la barra laterale richiede un account Kimi.
🔗 Kimi Browser Extension · Kimi Browser Extension, annuncio su X
SpaceXAI: Grok Bot assorbe l’aumento dei ticket dell’assistenza
22 settembre — SpaceXAI pubblica un resoconto sulla propria assistenza clienti, ricostruita attorno a Grok Bot, il suo agente che opera negli strumenti dell’azienda. Da quando Cursor è entrata a far parte di SpaceXAI il 14 agosto, i due team di assistenza si sono fusi e coprono molti più prodotti. Secondo l’articolo, il volume dei ticket è aumentato del 175% senza alcuna assunzione, laddove sarebbe forse stato necessario assumere 200 persone; il periodo di misurazione non è specificato.
L’implementazione è stata progressiva: collegato a Plain per i ticket e a Linear per gli incidenti, Grok Bot è stato inizialmente limitato alle note interne, con ogni azione di scrittura convalidata da un essere umano, poi ha gestito i ticket semplici prima di rispondere direttamente ai clienti già alla fine del primo giorno. Oggi conduce un’indagine preliminare su ogni ticket in entrata, riproduce i problemi in video per il team di ingegneria e sintetizza ogni giorno più di 20.000 feedback sui prodotti.
| Indicatore pubblicato da SpaceXAI | Valore annunciato |
|---|---|
| Aumento dei ticket di assistenza | +175% |
| Assunzioni evitate (stima) | 200 |
| Costo per risoluzione degli strumenti classici | Da 1 a 4 dollari |
| Costo minimo per ticket con Grok Bot | Da 0,20 a 0,30 dollari |
| Rimborsi gestiti senza intervento umano | 99% |
🔗 Come SpaceXAI utilizza Grok Bot per ampliare l’assistenza clienti
Cognition: rotta verso l’America Latina e nuove note di versione di Devin
Cognition si espande in America Latina da San Paolo
22 settembre — In un articolo del suo team per l’America Latina, Cognition torna sull’annuncio fatto la settimana precedente al MASP, il museo d’arte di San Paolo: l’azienda si espande nella regione, con un team con sede a San Paolo e nuove assunzioni, in particolare di ingegneri dislocati presso i clienti (deployed engineers). Fa leva su clienti già acquisiti, tra cui Itaú, Nubank, Santander, Natura ed EBANX. Presso Itaú, secondo Cognition, oltre il 75% dei team tecnologici utilizza Devin, che ha documentato più di 300.000 repository e risolto automaticamente circa il 70% delle vulnerabilità; presso Nubank, la migrazione di un monolite di diversi milioni di righe sarebbe passata da diversi anni a poche settimane, con un costo oltre venti volte inferiore. Questi sono i risultati pubblicati da Cognition, senza fonti terze.
🔗 Costruire il futuro dell’ingegneria del software in America Latina
Le note di versione di Devin del 21 settembre
21 settembre — Pubblicate dopo la nostra edizione precedente, le note di versione di Devin introducono SWE-2, il modello di codice di Cognition uscito il 10 settembre, in anteprima di ricerca (research preview) nel selettore dell’agente: si scelgono SWE-2 e un livello di impegno (Medium, High o Max) all’avvio di una sessione o durante il suo svolgimento, e !swe2 fa lo stesso in Slack. I server MCP di Microsoft 365 (Mail e Contacts, Calendar, To Do, OneDrive e SharePoint, Teams, directory Entra ID) entrano nel marketplace MCP, in sola lettura per impostazione predefinita senza un ambito OAuth configurato. Devin Review si apre a Bitbucket Data Center, i plugin possono raggiungere 20 MiB e 2.500 file e la CLI autonoma npx devin-review viene ritirata: le copie già installate non funzionano più.
🔗 Note di versione di Devin del 21 settembre
Genspark porta il suo benchmark per le presentazioni nell’indice SII di Fireworks AI
22 settembre — Fireworks AI lancia lo Specialized Intelligence Index (SII), un indice di 20 benchmark del lavoro reale suddivisi in sette ambiti (sicurezza, diritto, finanza, assistenza clienti, software, salute, produttività) e realizzati da professionisti; Harvey, Doximity, Mercor, Sierra, Decagon e Genspark figurano tra le dodici aziende presenti. Unico benchmark della categoria produttività, il Genspark Slides Benchmark fa produrre presentazioni a undici modelli su 200 attività reali, nell’harness dell’agente Genspark Slides; le valutazioni provengono dal valutatore interno di Genspark. Per Gen-1 Slides, il suo modello proprietario, Genspark riprende l’argomento di un prezzo di input pari a circa un diciassettesimo di quello di Claude Opus 5.
| Modello valutato | Punteggio nell’indice SII | Punteggio nell’articolo di Genspark del 10 settembre | Costo per presentazione nell’indice |
|---|---|---|---|
| Claude Fable 5.1 | 83,6% | fuori tabella, vantaggio di 0,003 su Gen-1 Slides nel testo | non indicato |
| Gen-1 Slides | 82,2% | 0,821 | 0,44 dollari |
| Claude Opus 5 | 81,0% | 0,810 | 4,16 dollari |
| Claude Fable 5 | 79,9% | fuori tabella | non indicato |
| GPT-6 Astra | 78,0% | fuori tabella | non indicato |
| Kimi K3 | 72,6% | 0,723 | 2,00 dollari |
| GPT-5.6 Sol | 67,0% | 0,668 | 2,01 dollari |
| MiniMax M3 | 56,1% | 0,563 | 0,34 dollari |
🔗 Specialized Intelligence Index · Annuncio di Genspark
Runway lancia DIFFUSE, una piattaforma di recruiting per creativi formati sull’IA
22 settembre — Runway lancia DIFFUSE (diffuse.runway.com), una piattaforma aperta in cui marchi, agenzie e studi cercano, contattano e assumono talenti formati sugli strumenti di IA generativa (AI-native talent). Creativi, freelance, studi boutique o società di produzione vi creano un profilo e ospitano il proprio portfolio; non viene comunicata alcuna tariffa.
Runway si basa su un proprio studio di oltre 1.000 offerte di lavoro creative pubblicate da quasi 400 aziende: il 17% menziona competenze nell’IA o strumenti generativi e Runway sarebbe, secondo l’azienda, di gran lunga lo strumento video più richiesto. Runway riconosce che l’IA sta in parte trasformando le professioni creative, ma afferma che attorno a questi strumenti si sta formando una nuova forza lavoro creativa e che la relativa domanda sta accelerando.
🔗 Presentazione di DIFFUSE · Runway su X
NVIDIA per gli sviluppatori: Isaac ROS 5.0, DLSS 5 e RTX Mega Geometry 2.0
Isaac ROS 5.0 punta sugli agenti
22 settembre — Presentata alla conferenza ROSCon di Toronto, Isaac ROS 5.0, la raccolta gratuita e open source di pacchetti ROS accelerati tramite GPU di NVIDIA, supporta ROS Lyrical e Ubuntu 24.04 e copre l’intera gamma Jetson, da Jetson Orin Nano a Jetson Thor. La novità principale riguarda gli agenti: skill Isaac riutilizzabili per l’installazione e la manipolazione, documentazione leggibile dagli agenti, una skill che aiuta un agente a effettuare il fine-tuning del modello di visione stereo FoundationStereo per le proprie fotocamere e una skill autonoma di presa e posizionamento (pick and place). FoundationPose riceve una libreria di inferenza che monitora la posizione e l’orientamento degli oggetti fino a 5,5 volte più velocemente, senza che NVIDIA specifichi il riferimento di confronto.
DLSS 5 illustrato in dettaglio per gli studi, RTX Mega Geometry 2.0 disponibile
22 settembre — Già disponibile in NBA 2K27, DLSS 5 viene illustrato in dettaglio agli sviluppatori: il suo rendering neurale guidato dal 3D (3D-Guided Neural Rendering) si inserisce come fase finale della pipeline, parte dall’immagine renderizzata dal motore e si basa sul colore e sui vettori di movimento per aggiungere illuminazione e dettagli dei materiali, fotogramma per fotogramma, in modo deterministico, su una singola GeForce RTX serie 50 fino al 4K. Gli studi regolano l’intensità della struttura (Structure Intensity) e del tono (Tone Intensity) e dispongono di un mascheramento semantico basato sull’IA. Lo stesso articolo aggiunge ad ACE due modelli da 600 milioni di parametri, Nemotron Speech 3.5 Streaming (riconoscimento vocale) e Qwen3 TTS (sintesi vocale), pubblica RTX Kit 2026.3 e rende disponibile RTX Mega Geometry 2.0, con lo streaming di cluster a livello di dettaglio continuo per mesh molto dense.
🔗 Novità per gli sviluppatori di videogiochi
NVIDIA e l’inferenza: Dynamo-Triton multi-GPU e Confidential Computing su B200
Dynamo-Triton 26.07 serve un modello distribuito su otto GPU
21 settembre — NVIDIA mostra come servire un modello TensorRT distribuito su più GPU come un modello ordinario. L’inferenza multi-GPU di TensorRT (multi-device inference), pienamente supportata a partire da TensorRT 11.0, si basa su NCCL; Dynamo-Triton 26.07, il precedente Triton Inference Server, la abilita nel proprio backend TensorRT e l’applicazione chiama un solo endpoint gRPC. Nella generazione video di Cosmos 3 Nano (1280×720, 189 fotogrammi, 35 passaggi), la latenza end-to-end passa da 156,6 secondi su una GPU a 34,2 secondi su otto, ossia è 4,58 volte inferiore. NVIDIA precisa che il test non misura né il throughput con richieste simultanee né il costo per video.
| Configurazione testata | Numero di GPU | Latenza media end-to-end |
|---|---|---|
| GPU singola | 1 | 156,595 s |
| CP2 | 2 | 87,999 s |
| CP4 | 4 | 53,093 s |
| CP8 | 8 | 34,183 s |
🔗 Dynamo-Triton e TensorRT multi-GPU
L’inferenza riservata su B200 conserva oltre il 96% del throughput
22 settembre — NVIDIA misura il costo del proprio Confidential Computing su Blackwell, che esegue i carichi in macchine virtuali con memoria crittografata, GPU riservate e NVLink crittografato. Su un DGX B200 (otto GPU, piattaforma Intel TDX) che serve DeepSeek-R1 in NVFP4 con TensorRT LLM, 32.000 token in input e 1.000 in output, la modalità riservata conserva dal 96,1 al 98,2% del throughput e aumenta il tempo medio per token di output solo dall’1,2 al 4,3%, con un numero di richieste simultanee compreso tra 1 e 16. Sono stati necessari tre adattamenti del framework: memoria paginabile anziché pinned per alcuni trasferimenti, contatore interno della GPU per l’autotuner dei kernel e altri algoritmi di comunicazione a causa dell’assenza del multicast NVLink SHARP in questa modalità. Il carico è stato scelto per rendere visibile il sovraccosto; NVIDIA consiglia di confrontare le due modalità sul proprio carico.
🔗 Confidential Computing e TensorRT LLM
In breve
- Zed prepara Delta — Zed annuncia per questa settimana, anche se non sono ancora disponibili, colori per raggruppare i thread di Delta, il suo ambiente di programmazione multiplayer con agenti, e un indicatore che mostra la distanza dalla compattazione automatica del contesto. 🔗 fonte
- Replit e Handshake — Replit è partner fondatore dell’AI Skills Studio di Handshake: tre missioni gratuite da 45 minuti portano a un progetto visualizzato sul profilo Handshake; OpenAI (10 missioni), Google, Figma e Vercel figurano tra gli altri partner. 🔗 fonte
- oMLX entra in Hugging Face — Jun Kim, creatore di oMLX, progetto dell’ecosistema MLX di Apple, entra in Hugging Face; il progetto resta sotto licenza Apache 2.0, sempre sotto la sua direzione, diventa mantenuto e finanziato e punta innanzitutto ad accelerare la conversione dei modelli Transformers verso MLX. 🔗 fonte
- SnowLLM — Post della community: questo motore di inferenza sotto licenza Apache-2.0 (kernel distribuiti in formato binario), scritto per la GPU dei Ryzen AI Max, esegue il decoding fino a 2,3 volte più velocemente di llama.cpp (1,9 volte senza speculative decoding) e il prefill fino a 9,4 volte più velocemente, secondo i suoi autori. 🔗 fonte
- DecisionBench e Bosun v3.1 — Hanno Labs pubblica DecisionBench 1.0 (43 attività, 28 domini) e due modelli decisionali open-weight basati su Qwen3 (0,6 e 1,7 miliardi di parametri), che ottengono rispettivamente l’83,20% e l’87,29% sulla propria suite applicata; Jev li supera nella parte dedicata al ragionamento. 🔗 fonte
- Un Moshi da 600 milioni di parametri — Uno sviluppatore racconta il suo tentativo di creare un modello vocale full-duplex basato su Qwen3-0.6B-Base, addestrato con un costo compreso tra 2 e 15 dollari per prova su B200: il testo converge, ma la voce resta confusa, a causa di un blocco localizzato nei codebook acustici fini. Progetto in pausa, nessun peso pubblicato. 🔗 fonte
- Together AI e GLM-5.2 — In un caso di studio del 18 settembre, ripubblicato su X il 21, Together AI descrive una fintech che esegue i propri agenti di programmazione su GLM-5.2 con un contesto di 256K e 56 B200; un problema di accodamento da 1 a 3 minuti è stato risolto lo stesso giorno riconfigurando il routing. 🔗 fonte
- Gemini CLI — La nightly del 22 settembre, la prima con nuovo codice dal 19, corregge il crash
HttpsProxyAgent is not a constructorcon Vertex AI dietro un proxy ed emette l’aggiornamentotool_callprima della richiesta di autorizzazione in modalità ACP. 🔗 fonte - Google Flow — L’account ufficiale dichiara più di 25 milioni di utenti al mese e proroga per tutti i 50 crediti giornalieri aggiuntivi, un’offerta che a luglio era riservata agli abbonati Google AI fino al 31 agosto. 🔗 fonte
- Jigsaw e Sensemaking AI — L’incubatore di Google lancia il proprio Partner Program per distribuire in 30 città, Stati e Paesi la sua suite open source per la consultazione dei cittadini, basata su Gemini, con un fondo di Google.org, Bloomberg Philanthropies e Packard Foundation il cui importo non è stato reso noto. 🔗 fonte
- 100.000 borse di formazione — A margine dell’Assemblea generale delle Nazioni Unite, Google finanzia 100.000 borse per una formazione certificata sull’IA in più di 80 Paesi tramite l’AI Skills Coalition del programma AI for Good dell’UIT, distribuite dai governi locali e dalla rete Giga. 🔗 fonte
- Agenti che proteggono il codice di Google — In un post del 19 settembre, Google spiega di analizzare prima dell’invio ogni modifica al codice della propria infrastruttura con agenti basati sul suo harness open source Mantis, che bloccano centinaia di vulnerabilità al mese; l’agente di triage dichiara una precisione superiore al 92% in meno di un minuto. 🔗 fonte
- Copilot CLI 1.0.88 — Le impostazioni gestite dall’azienda si applicano ora alle sessioni
--acp,--ahp-hoste--server, fino ad allora prive di criteri MCP, autorizzazioni e plugin, mentre/forkfunziona durante un turno; la versione 1.0.87 del 21 settembre aveva aggiunto impostazioni gestite per il livello di routing Auto. 🔗 fonte - Pika e Seedance 2.5 — La modalità Draft di Seedance 2.5 arriva su Pika e nel Pika API Club: bozze di clip a partire da 10 centesimi al secondo, da finalizzare successivamente in alta qualità. 🔗 fonte
- Pika Swap Anything — Nuova applicazione Pika che sostituisce attori, costumi, scenografie o accessori di un video mantenendo il ritmo, i movimenti e la narrazione della ripresa originale, senza prezzi comunicati. 🔗 fonte
- Suno Studio — La workstation per la produzione musicale di Suno integra una suite di effetti audio, tra cui un compressore (soglia, ratio, attacco, rilascio, sidechain), incluso nell’abbonamento Premier. 🔗 fonte
- Sluicebox e Nemotron 3 Ultra — Caso di studio NVIDIA: passando a Nemotron 3 Ultra, questa startup che analizza le emissioni di carbonio delle catene di approvvigionamento riduce i costi di inferenza dal 51 all’80% e raggiunge l’87,7% nell’estrazione dei dati dei fornitori, contro l’84% del modello precedente. 🔗 fonte
- Topograph — Toolkit open source di NVIDIA che rileva la topologia di rete di un cluster di GPU e la pubblica per Kubernetes, Slurm e Slinky, così da collocare i workload distribuiti il più vicino possibile tra loro; legge le API di Crusoe, Google Cloud, Lambda, Nebius, Nscale e Oracle Cloud. 🔗 fonte
- Valutare un agente — In un post metodologico del 21 settembre, NVIDIA propone sei metriche, dalla chiamata dello strumento al completamento dell’attività, e cita Nemotron 3.5 Lightning con l’86% su PinchBench, il 30% più veloce di Qwen3.6 35B. 🔗 fonte
- Qwen-Image-2.1 su Intel — Annunciato da Intel il 21 settembre e rilanciato da Qwen il 22, il supporto fin dal primo giorno tramite OpenVINO è destinato alle GPU Arc Pro B70 e alle GPU integrate dei Core Ultra Series 3, con un notebook dedicato. 🔗 fonte
- Box e Grok 4.7 — Il 21 settembre, giorno del lancio di Grok 4.7, Box lo ha messo alla prova in un’anteprima di Box Agent su un sinistro da 2 milioni di dollari: sono stati individuati una fattura duplicata da 82.000 dollari e un accredito mancante da 64.000 dollari; non sono stati comunicati né la data di disponibilità né il prezzo. 🔗 fonte
- Un chirurgo e Codex — OpenAI Developers pubblica un video in cui Brian Pridgen, chirurgo della mano, mostra come costruisce i propri strumenti con Codex e passa in rassegna la letteratura scientifica su PubMed, senza dati quantitativi né uno studio scritto. 🔗 fonte
- ChatGPT in Word — Annunciato il 17 settembre: un unico componente aggiuntivo Microsoft consente di accedere a ChatGPT in Word, Excel e PowerPoint, in tutto il mondo e con tutti i piani, compreso Free, con limiti di utilizzo; Business ed Enterprise dispongono di un’anteprima gratuita di GPT-5.6 Sol in Word fino al 30 settembre. 🔗 fonte
- Alfabetizzazione sull’IA — Perplexity pubblica una guida che considera la valutazione delle risposte la competenza fondamentale, critica il «teatro della formazione» e cita Gallup: un’adozione dichiarata del 38%, ma un utilizzo quotidiano del 12% nel quarto trimestre del 2025. 🔗 fonte
Che cosa significa
Lo stesso giorno, Anthropic e OpenAI hanno sostenuto la medesima tesi: non un modello più potente a ogni costo, bensì prestazioni vicine alla fascia alta a un prezzo molto inferiore. Opus 5.5 viene presentato allo stesso livello di Fable 5.1 con un costo inferiore del 40% rispetto a Opus 5, mentre GPT-6 Sol riprende gran parte dei punti di forza di Astra a 2 e 10 dollari per milione di token. Entrambe le aziende ragionano ormai in termini di costo per attività anziché di prezzo per token e fanno della cache la vera leva: letture a 0,20 dollari presso Anthropic, sconto fino al 90% e punti di interruzione espliciti presso OpenAI.
L’integrazione, invece, si misura in ore. GitHub Copilot, Devin, Perplexity, Cursor e v0 hanno reso disponibili i nuovi modelli il giorno stesso, ciascuno con la propria metrica: FrontierCode 1.1 Extended presso Cognition, WANDR presso Perplexity, CursorBench presso Cursor. Questi dati non sono direttamente sovrapponibili (65,3% per Opus 5.5 nella variante Extended, 54,4% nella variante Main) e nessuna delle due aziende confronta ancora il proprio nuovo modello con quello dell’altra. Per uno sviluppatore, la scelta giusta si valuta sempre più all’interno del proprio strumento e sulle proprie attività, anziché nelle tabelle di lancio.
Anche i piani tariffari diventano un terreno di differenziazione. Anthropic aumenta i limiti su cinque ore, offre un ripristino e porta Pro e Team Standard su Opus in Claude Code; GitHub riserva Opus 5.5 ai piani superiori, ma rende disponibile GPT-6 Luna già da Copilot Pro; Google integra Colab nei propri piani Google AI, limitando al contempo Gemini 2.5 per preservarne la capacità. La distribuzione della potenza di calcolo tra i piani pesa ormai quanto il prezzo esposto.
Infine, sta cambiando anche il modo stesso di misurare. Anthropic riconosce che i margini nei benchmark sono meno indicativi rispetto al passato e che Opus 5.5 sembra spesso consapevole di essere sottoposto a valutazione; OpenAI stabilisce regole per aprire i propri modelli a valutatori indipendenti; l’AISI britannico rende i propri risultati riproducibili con EvalEval e NVIDIA propone di giudicare un agente in base all’attività completata anziché a ogni chiamata dello strumento. Verificare ciò che un modello fa realmente conta ormai quanto il suo punteggio.
Fonti
- Presentazione di Claude Opus 5.5 (Anthropic)
- @claudeai: lancio di Claude Opus 5.5
- Novità di Claude Opus 5.5 per l’API
- Claude Code v2.1.280
- Quanto costa un’attività su Opus 5.5
- Ottenere il massimo da Opus 5.5
- Presentazione di GPT-6 Sol e Luna (OpenAI)
- @OpenAI: lancio di GPT-6 Sol e Luna
- Migliore prompt caching per GPT-6
- Claude Opus 5.5 in GitHub Copilot
- GPT-6 Sol e GPT-6 Luna in GitHub Copilot
- Claude Opus 5.5 in Devin
- GPT-6 Sol e Luna in Devin
- Grok 4.7 in Devin
- @v0: Grok 4.7 in v0
- @perplexity_ai: Opus 5.5 in Computer
- @perplexity_ai: GPT-6 Sol in Computer
- Changelog dell’API Perplexity
- @cursor_ai: Opus 5.5 in Cursor
- @v0: Opus 5.5 in v0
- @ClaudeDevs: limiti di Claude Code
- @ClaudeDevs: ripristino dei limiti
- Codex CLI 0.156.0
- Vibe CLI v2.25.7
- CHANGELOG di Vibe CLI
- Qwen Code v0.24.4
- Un runner, molti worktree (Amp)
- Priorità e principi per valutazioni efficaci di terze parti (OpenAI)
- Come UK AISI ed EvalEval rendono riproducibili i risultati dei benchmark
- @ChatGPT: punteggio di credito Experian
- Colab ora fa parte del tuo piano Google AI
- FAQ di Colab
- Note di rilascio dell’API Gemini
- Pagina delle deprecazioni di Gemini
- Transformers ora esegue i quant di llama.cpp
- Scheda di Kimi K3 su Amazon Bedrock
- @Kimi_Moonshot: Kimi K3 su Bedrock
- Estensione browser Kimi
- @Kimi_Moonshot: estensione browser Kimi
- Come SpaceXAI usa Grok Bot per ampliare il supporto clienti
- Costruire il futuro dell’ingegneria del software in America Latina (Cognition)
- Note di rilascio di Devin del 21 settembre
- Indice dell’intelligenza specializzata (Fireworks AI)
- @genspark_ai: benchmark Genspark Slides nel SII
- Presentazione di DIFFUSE (Runway)
- @runwayml: lancio di DIFFUSE
- Isaac ROS 5.0 (NVIDIA)
- Novità per gli sviluppatori di videogiochi (NVIDIA)
- Dynamo-Triton e TensorRT multi-GPU (NVIDIA)
- Confidential computing e TensorRT LLM (NVIDIA)
- @zeddotdev: novità di Delta
- @Replit: AI Skills Studio di Handshake
- Jun Kim entra in Hugging Face (oMLX)
- SnowLLM
- DecisionBench e Bosun v3.1 (Hanno Labs)
- Riduzione dei modelli vocali full-duplex
- Caso di studio Together AI (Dedicated Model Inference)
- Gemini CLI v0.62.0-nightly.20260922
- @FlowbyGoogle: 25 milioni di utenti
- Sensemaking AI e Jigsaw Partner Program (Google)
- Investire nei talenti globali e nell’alfabetizzazione sull’IA (Google)
- Uso dell’agentic AI per proteggere il codice dell’infrastruttura (Google Cloud)
- Copilot CLI v1.0.88
- @pika_labs: modalità Draft di Seedance 2.5
- @pika_labs: Swap Anything
- Informazioni sulla compressione (Suno)
- Caso di studio Sluicebox (NVIDIA)
- Topograph (NVIDIA)
- Come valutare gli agenti IA (NVIDIA)
- Qwen-Image-2.1 su hardware Intel (OpenVINO)
- @Box: Grok 4.7 in Box Agent
- @OpenAIDevs: un chirurgo e Codex
- @ChatGPT: ChatGPT in Word
- Alfabetizzazione sull’IA (Perplexity)