Căutare

Claude Opus 5.5 apare la Anthropic, OpenAI lansează GPT-6 Sol și Luna, Claude Code trece Pro și Team Standard la Opus

ai-powered-markdown-translator

Articol tradus din franceză în română cu gpt-5.6-sol.

Vezi proiectul pe GitHub ↗

Marți, 22 septembrie, Anthropic și OpenAI lansează fiecare câte un model de frontieră, la mai puțin de două ore distanță: Claude Opus 5.5, prezentat ca fiind la nivelul Fable 5.1 la un cost cu 40 % mai mic decât Opus 5, apoi GPT-6 Sol și GPT-6 Luna, ale căror prețuri API scad la jumătate față de tariful promoțional al GPT-5.6. Ambele familii ajung în aceeași zi în GitHub Copilot, Devin și Perplexity, în timp ce Claude Code 2.1.280 trece abonamentele Pro și Team Standard de la Sonnet la Opus. Codex CLI 0.156.0, limite de utilizare majorate la Anthropic și o serie de publicații NVIDIA completează ziua.


Anthropic lansează Claude Opus 5.5, primul model din familia Claude 5.5

22 septembrie — Anthropic lansează Claude Opus 5.5 (claude-opus-5-5), primul model din noua sa familie Claude 5.5; Sonnet 5.5 și Haiku 5.5 vor urma „în următoarele săptămâni”. Este disponibil începând de astăzi în API-ul Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud și Microsoft Foundry și devine, în Claude Code, modelul implicit al abonamentelor cu plată. Fereastră de context de un milion de tokeni, ieșire maximă de 128.000 de tokeni, cunoștințe fiabile până în iunie 2026.

Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.

It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.

🇷🇴 Iată Claude Opus 5.5, primul model din noua noastră familie Claude 5.5. Lucrează la nivelul Claude Fable 5.1 pentru majoritatea sarcinilor și costă cu 40 % mai puțin să fie rulat decât Opus 5.@claudeai pe X

Potrivit Anthropic, acești 40 % sunt măsurați „cu setările implicite” pe sarcini tipice și combină prețuri mai mici cu mai puțini tokeni per sarcină. Tarifele scad cu 20 % (4 dolari pentru intrare și 20 pentru ieșire per milion de tokeni, față de 5 și 25 pentru Opus 5) și cu 60 % pentru citirile din cache (0,20 dolari). Ieșirea este generată cu peste 30 % mai rapid, iar un mod rapid (fast mode), aflat în previzualizare pentru cercetare, promite o viteză de până la 2,5 ori mai mare pentru 8 și 40 de dolari.

Benchmark (cifre Anthropic)Claude Opus 5.5Claude Fable 5.1GPT-6 Astra
Terminal-Bench 4.066,4 %55,8 %57,9 %
FrontierCode v1.1 Main54,4 %50,3 %53,3 %
GDPval-AA v2.1 (Elo)184617351542
OSWorld 2.081,8 %80,7 %
AutomationBench40,0 %31,4 %41,4 %
Terminal-Bench-Science 0.158,7 %52,6 %64,6 %

Opus 5.5 preia conducerea la programarea agentică, munca de birou și utilizarea computerului, dar GPT-6 Astra rămâne în față la AutomationBench și Terminal-Bench-Science. Anthropic precizează că scorurile sale au fost măsurate cu mecanismele de protecție din producție active, ceea ce probabil le reduce, și consideră că marjele din benchmark-uri au devenit „un reper mai puțin fiabil”: în utilizare, diferența față de Fable 5.1 ar fi mai mică decât sugerează aceste cifre. Este primul Opus lansat cu mecanisme de protecție din clasa Fable 5.1 pentru securitate cibernetică, biologie și distilare (majoritatea sarcinilor cyber sunt redirecționate către Opus 4.8), iar Anthropic recunoaște că acesta pare să suspecteze adesea că este evaluat.

Pentru dezvoltatori, migrarea necesită ajustări: raționamentul adaptiv nu mai poate fi dezactivat, alegerea forțată a instrumentului (tool_choice la any sau tool) returnează o eroare 400, iar efortul implicit devine medium (față de high pe Opus 5). Textul scris între două apeluri de instrumente apare acum în blocuri de raționament, goale în afișarea implicită.

🔗 Prezentarea Claude Opus 5.5 · Noutățile Opus 5.5 pentru API


Claude Code 2.1.280 instalează Opus 5.5 și trece Pro și Team Standard la Opus

22 septembrie — Claude Code 2.1.280 este publicată la 16:38 UTC, la șapte minute după anunțarea Opus 5.5. Nu a existat nicio versiune 2.1.279: CHANGELOG-ul trece direct de la 2.1.278 din 19 septembrie la această versiune cu 114 intrări.

Cea mai vizibilă schimbare privește modelul. Opus 5.5 devine modelul Opus implicit, iar abonamentele Pro și Team Standard trec implicit de la Sonnet la Opus, așa cum se întâmpla deja pentru Max, Team Premium și Enterprise. Nivelurile de efort salvate înainte ca /effort să devină specific fiecărui model nu se mai aplică modelelor noi precum Opus 5.5, care pornesc cu setarea lor implicită; Opus 4.7, Opus 4.8 și Fable 5, la rândul lor, nu mai impun efortul lor de pornire peste setarea aleasă.

În privința securității, o scriere care trece printr-o legătură simbolică este acum evaluată pe baza destinației sale reale: solicitarea de autorizare indică locul în care ajunge, iar acceptEdits, regulile de autorizare și modul automat nu mai aprobă o scriere care ajunge în afara arborelui de directoare. Modul automat nu mai refuză acțiuni în buclă, fără pauză, atunci când un control de securitate nu returnează niciun răspuns: noile încercări sunt distanțate, iar runda se oprește după zece refuzuri consecutive. Marketplace-urile de pluginuri care imită un nume rezervat sunt respinse, iar variabila CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH permite modificarea limitei de 2.048 de caractere pentru descrierile instrumentelor MCP.

Restul ține de confort: o apăsare izolată a tastei y sau n nu mai confirmă și nu mai închide un dialog (Enter și Escape le înlocuiesc), o apăsare dublă pe Ctrl+C într-un dialog nu mai închide Claude Code, două întreruperi ale cache-ului de prompturi sunt remediate, iar extensia VS Code primește șase comenzi tastate (/status, /sandbox, /chrome, /export, /skills, /plan).

Categoria intrării din CHANGELOGNumăr de intrări
Remedieri (Fixed)69
Îmbunătățiri (Improved)21
Adăugări (Added)12
Modificări (Changed)10
Revenire și eliminare2
Total114

🔗 Claude Code v2.1.280

Două ghiduri pentru lucrul cu Opus 5.5

22 septembrie — Anthropic publică și două ghiduri semnate de Addy Osmani. Primul, „Cât costă o sarcină pe Opus 5.5” (What a task costs on Opus 5.5), amintește că două modele cu același preț per token pot costa foarte diferit pentru aceeași sarcină, deoarece fiecare rundă retrimite întreaga conversație. Exemplele sale, prezentate ca ilustrații bazate pe tarifele publice: 2,8 milioane de tokeni de intrare costă 11,20 dolari fără cache și 1,62 dolari dacă 90 % sunt citiți din cache, iar un token de ieșire costă de 100 de ori mai mult decât o citire din cache. El recomandă efortul medium pentru utilizarea zilnică, high atunci când medium se blochează, apoi Fable 5.1 dacă Opus 5.5 eșuează de două ori la aceeași problemă, ținând cont că schimbarea efortului sau a modelului golește cache-ul (care rămâne activ o oră în cazul unui abonament și cinci minute în mod implicit cu o cheie API). Într-un benchmark intern cu 44 de tichete de asistență, trecerea de la Opus 4.8 la Opus 5.5 cu efort redus a micșorat costul cu aproximativ 18 %, iar /claude-api prompt-audit cu încă 9 %.

Al doilea ghid, publicat pe claude.dev, recomandă definirea a ceea ce înseamnă „finalizat” și apoi lăsarea modelului să lucreze, precum și eliminarea instrucțiunilor de tipul „gândește-te bine”, deoarece modelul raționează întotdeauna înainte de a răspunde. Acesta explică și trecerea la un model mai vechi atunci când un mesaj este semnalat de mecanismele de protecție, comportament configurabil în aplicații sau în /config.

🔗 Cât costă o sarcină pe Opus 5.5 · Cum să profiți la maximum de Opus 5.5


OpenAI lansează GPT-6 Sol și GPT-6 Luna, cu 50 % mai ieftine decât tariful promoțional al GPT-5.6

22 septembrie — La mai puțin de două ore după Anthropic, OpenAI extinde familia GPT-6 cu GPT-6 Sol și GPT-6 Luna, antrenate cu metode similare celor folosite pentru GPT-6 Astra, care rămâne, potrivit companiei, cel mai bun model al său. Sol vizează programarea complexă și fluxurile agentice, iar Luna sarcinile bine definite, cu volum mare; acestea succed GPT-5.6 Sol și GPT-5.6 Luna.

We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

🇷🇴 Am eficientizat, de asemenea, stocarea în cache și inferența și vă transferăm direct aceste economii: prețuri API cu 50 % mai mici pentru Sol și Luna față de tariful promoțional al GPT-5.6.@OpenAI pe X

Tip de tarif (per milion de tokeni)GPT-6 SolGPT-6 LunaTarif GPT-5.6 menționat (Sol / Luna)
Intrare2 dolari0,10 dolari4 dolari / 0,20 dolari
Intrare din cache0,20 dolari0,01 dolarinespecificat
Ieșire10 dolari0,50 dolari20 dolari / 1,20 dolari

Ambele modele acceptă un context de 1.050.000 de tokeni și produc până la 128.000 de tokeni; peste 272.000 de tokeni de intrare, întreaga solicitare este facturată de două ori mai scump la intrare și de 1,5 ori mai scump la ieșire.

În benchmark-urile OpenAI, care compară Sol cu modelele Claude anterioare Opus 5.5, Sol obține 33,2 % la AutomationBench cu efort xhigh pentru 0,27 dolari per sarcină, înaintea Claude Opus 5 cu efort max (26,9 %, la un cost de 11,1 ori mai mare) și GPT-6 Astra cu efort low (30,3 %). La DeepSWE v1.1, acesta atinge 68,8 %, la 1,1 puncte de cel mai bun scor al Claude Fable 5, pentru un cost per sarcină cu aproximativ 80 % mai mic; Luna obține acolo 66,6 %. Scorurile concurenților provin din rapoarte publice. În privința alinierii, rata de înșelare măsurată în sarcini de programare concepute pentru a încuraja lipsa de onestitate scade la 1,3 % pentru Sol, față de 10,4 % pentru GPT-5.6 Sol.

Ambele modele ajung în ChatGPT Work și Codex pentru abonații Plus, Pro, Business, Enterprise și Edu, cu o implementare progresivă (activare de către administrator în Enterprise); utilizatorii Free și Go pot folosi Luna în aplicația desktop, iar modelele nu sunt încă oferite în Chat. În API, acestea se numesc gpt-6-sol și gpt-6-luna, prin Responses și Chat Completions.

🔗 Prezentarea GPT-6 Sol și Luna

Un sistem de stocare în cache a prompturilor regândit pentru GPT-6

22 septembrie — Articolul care însoțește lansarea, „O stocare mai bună în cache a prompturilor pentru GPT-6” (Better prompt caching for GPT-6), detaliază noul sistem de cache al familiei: rate de succes mai mari în mod implicit, reducere de până la 90 % pentru tokenii de intrare din cache, acordată prefixelor comune eligibile reutilizate în decurs de 30 de minute, și scriere în cache facturată la de 1,25 ori tariful de intrare. Dezvoltatorii primesc un tablou de bord Prompt Caching, puncte de întrerupere explicite (explicit cache breakpoints) pentru stabilirea prefixelor care trebuie reutilizate, preîncălzirea cache-ului (prewarming) la pornirea unei aplicații și un configuration_update care modifică efortul de raționament de la un răspuns la altul fără a invalida cache-ul. GitHub, prin vocea directorului său de produs Mario Rodriguez, afirmă că a redus cu peste 50 % proporția tokenilor de prompt care trebuie reprocesați; Strawberry Browser anunță costuri cu 20 % mai mici.

🔗 O stocare mai bună în cache a prompturilor pentru GPT-6


În aceeași zi în instrumente: GitHub Copilot, Devin, Perplexity, Cursor și v0

22 septembrie — Opus 5.5 și cele două modele GPT-6 noi nu au așteptat: în câteva ore, principalele instrumente de programare și cercetare le-au adăugat, adesea împreună cu propriile măsurători.

GitHub Copilot oferă acces la Opus 5.5, GPT-6 Sol și GPT-6 Luna

GitHub adaugă cele trei modele în ziua lansării lor, pe zece platforme: VS Code, Visual Studio, Copilot CLI, agentul de programare, aplicația GitHub Copilot, github.com, GitHub Mobile, JetBrains, Xcode și Eclipse. Toate sunt facturate în funcție de utilizare la tariful public al furnizorului, fără multiplicator pentru solicitările premium: abonații anuali rămași la vechiul sistem de facturare per solicitare nu le primesc. Niciunul nu figurează încă în selecția automată (Auto).

Model în CopilotAbonamente disponibileIntrare și ieșire per milion de tokeni
Claude Opus 5.5Pro+, Max, Business, Enterprise (fără Pro)4 și 20 de dolari
GPT-6 SolPro+, Max, Business, Enterprise2 și 10 dolari, apoi 4 și 15 peste 272.000 de tokeni
GPT-6 LunaPro, Pro+, Max, Business, Enterprise0,10 și 0,50 dolari, apoi 0,20 și 0,75 peste 272.000 de tokeni

Luna este astfel singurul model GPT-6 accesibil în Copilot Pro, în timp ce Opus 5.5 nu este disponibil acolo. Potrivit primelor teste efectuate de GitHub, Opus 5.5 rezolvă sarcinile la nivelul Claude Opus 5, cu mult mai puțini pași și tokeni. GitHub semnalează, de asemenea, că Opus 5.5 aplică un filigran (watermark) ieșirilor sale text, fără efect, potrivit GitHub, asupra sensului, calității, lizibilității, numărului de tokeni sau costului.

🔗 Claude Opus 5.5 în GitHub Copilot · GPT-6 Sol și GPT-6 Luna în GitHub Copilot

Devin îi clasează pe noii veniți pe FrontierCode 1.1

Cognition face disponibil Claude Opus 5.5 în Devin Desktop și Devin CLI în ziua lansării și îl plasează pe primul loc în benchmarkul său FrontierCode 1.1, în varianta Extended, cu 65,3 %, înaintea Claude Fable 5 (64,9 %) și GPT-6 Astra (64,5 %), la mai puțin de o zecime din costul per sarcină al Fable 5. Acest rezultat de 65,3 % nu este comparabil cu cel de 54,4 % publicat de Anthropic, măsurat pe varianta Main. Patruzeci și șapte de minute mai târziu, sosesc la rândul lor GPT-6 Sol și Luna: Sol egalează GPT-5.6 Sol (60,7 % față de 60,6 %) cu un cost per sarcină cu 61 % mai mic și citește cu aproximativ 17 % mai puțin context; Luna (56,1 %) coboară sub 0,10 dolari per sarcină, fiind cel mai ieftin model din clasament potrivit Cognition.

Cu o zi înainte, în după-amiaza zilei de 21 septembrie (ora Pacificului), Cognition făcuse disponibil Grok 4.7 și îl măsurase la 59,4 %, sub Grok 4.6 (61,3 %): solid în sarcinile back-end dificile în Java, Go și Ruby, acesta are tendința de a depăși perimetrul (over-scope), cu diffs mai mari decât o cere sarcina. v0 a făcut disponibil Grok 4.7 imediat după aceea, cu o reducere de 40 % până pe 27 septembrie, fără să precizeze la ce se aplică.

Model evaluatScor FrontierCode 1.1 Extended
Claude Opus 5.565,3 %
Claude Fable 564,9 %
GPT-6 Astra64,5 %
Claude Fable 5.163,6 %
SWE-262,5 %
Grok 4.661,3 %
GPT-6 Sol60,7 %
GPT-5.6 Sol60,6 %
Grok 4.759,4 %
Gemini 3.7 Flash56,3 %
GPT-6 Luna56,1 %

Cu caractere aldine, modelele adăugate în Devin pe 21 și 22 septembrie. Scoruri publicate de Cognition pentru varianta Extended.

🔗 Opus 5.5 în Devin · GPT-6 Sol și Luna în Devin · Grok 4.7 în Devin · Grok 4.7 în v0

Perplexity: Opus 5.5 și GPT-6 Sol în Computer, patru modele în Agent API

Perplexity conectează cele două lansări la selectorul de efort introdus pe 17 septembrie în Computer, agentul său în mai mulți pași. Claude Opus 5.5 devine nivelul Standard: pe WANDR, benchmarkul intern al Perplexity pentru cost și performanță, obține 0,610 la 4,13 dolari per sarcină, ușor peste Claude Fable 5.1, cu un cost per sarcină mai mic cu 67,6 %. GPT-6 Sol, disponibil și în aplicația Perplexity, devine opțiunea implicită pentru nivelul Light. Niciunul dintre cele două mesaje nu precizează planurile vizate sau modelele înlocuite.

Pentru dezvoltatori, o intrare din changelogul API-ului, datată doar septembrie 2026, adaugă în Agent API openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 și xai/grok-4.7, fără tarife în această intrare.

🔗 Opus 5.5 în Computer · GPT-6 Sol în Computer · Changelogul API-ului Perplexity

Cursor și v0 fac disponibil Opus 5.5

Cursor îl prezintă drept noul cel mai bun model din CursorBench, cu 57,8 % la efort maxim (Max), pentru un cost per sarcină cu 40 % mai mic decât Opus 5: cifrele Anthropic, cu nivelul de efort precizat. v0 îl face disponibil fără detalii tarifare.

🔗 Cursor pe X · v0 pe X


Anthropic majorează limitele pe cinci ore și oferă o resetare până pe 22 octombrie

22 septembrie — Odată cu Opus 5.5, Anthropic majorează limitele calculate pe cinci ore pentru planurile Pro, Max, Team și Enterprise cu licențiere per utilizator (seat-based). Contul @ClaudeDevs cuantifică majorarea pentru Claude Code: +20 % la limitele sesiunilor de cinci ore începând de astăzi. Abonații primesc și o resetare a limitei pe care o pot păstra în rezervă și declanșa când doresc: aceasta este disponibilă în Setări → Utilizare (Settings → Usage) pentru Pro, Max și Team și trebuie folosită până pe 22 octombrie.

La aceasta se adaugă efectul prețului: în Claude Code, Opus 5.5 devine modelul implicit al planurilor cu plată și, fiind mai ieftin decât Opus 5, face ca limitele pe cinci ore și cele săptămânale să țină „cu 25 % mai mult”. Ghidul privind costurile publicat în aceeași zi precizează că reducerea este transferată asupra limitelor, inclusiv pentru contextul din cache, dar că reducerea suplimentară a prețului citirilor din cache privește doar API-ul.

🔗 @ClaudeDevs pe X · Resetarea și limitele


Codex CLI 0.156.0 activează implicit funcția vocală și worktrees

22 septembrie — Publicată la 19:51 UTC, Codex CLI 0.156.0 este prima versiune stabilă de la 0.155.1 din 18 septembrie; changelogul său complet enumeră 525 de pull requests de la versiunea 0.155.0. Aceasta generalizează două funcții încă experimentale în versiunea 0.155: conversațiile vocale, cu motoare audio integrate pentru Linux și Windows, și worktrees, pe care centrul de comandă al agenților le poate deschide în sesiuni, filtrând sarcinile după stare.

Noutatea versiuniiComandă sau setarePrecedent în Codex CLI
Conversații vocale impliciteF8, /voice settings/voice experimental (0.155.0, 17 septembrie)
Worktrees implicitecentrul de comandă al agențilorexperimentale de la 0.154.0 (9 septembrie)
Interfață pe ecran complet/tui, la următoarea lansareniciunul
Panou de bord pentru analytics/usageanalytics în aplicația desktop (18 septembrie)
Server local de fundal/daemon, --no-daemonniciunul

Interfața pe ecran complet aduce căutarea în transcriere, selectarea cu mouse-ul și copierea prin clic dreapta; sosesc șase teme integrate, iar răspunsurile afișează direct diagramele Mermaid și ecuațiile. Versiunea remediază și mai multe lacune în izolarea sandboxului (trafic de intrare în Windows, socketuri Unix ale app-server, fcntl modificabile în macOS). Notele versiunii nu menționează GPT-6: Sol și Luna pot fi selectate cu /model sau --model.

🔗 Codex CLI 0.156.0


Agenți de programare în terminal: Vibe CLI, Qwen Code și Amp

Vibe CLI 2.25.6 și 2.25.7

22 septembrie — Mistral publică Vibe CLI 2.25.7, cu șase remedieri, la o zi după versiunea 2.25.6 datată 21 septembrie în CHANGELOG, dar care nu a fost publicată niciodată ca release pe GitHub și care conține majoritatea noutăților (1 adăugare, 3 modificări, 17 remedieri). Cu opțiunea --experimental-harness, se pot atașa imagini chiar și atunci când modelul activ nu le poate citi: un model cu funcții de vision de la același furnizor le descrie pentru agent, iar cheia vision_model din config.toml permite impunerea altuia. Capturile de interfață descrise astfel includ un contract de dispunere (layout contract), pentru ca agentul să poată reconstrui ecranul.

În privința securității, comenzile Git executate fără aprobare sunt consolidate: fetchurile securizate nu mai moștenesc suprascrierile de căi din configurația Git, un checkout care nu este de încredere nu mai poate alege clientul SSH sau hookurile, iar opțiunile riscante ori redirecționările shell strecurate în comenzi doar pentru citire necesită aprobare. Versiunea 2.25.7 face în sfârșit /teleport disponibil pentru cheile API Vibe și workspace, inclusiv pentru conturile gratuite.

🔗 Vibe CLI v2.25.7 · CHANGELOGUL Vibe CLI

Qwen Code v0.24.4

22 septembrie — La o zi după v0.24.3, Qwen Code trece la v0.24.4, cu 13 funcționalități și 15 remedieri, fără modificări incompatibile. Serverul qwen serve deschide acum spații de lucru la distanță prin SSH fără a instala un daemon pe mașina țintă, iar sandboxul bubblewrap (bwrap), introdus pe Linux odată cu v0.24.0, se aplică la nivelul executării fiecărui instrument. În Web Shell, asocierea prin cod QR devine disponibilă implicit atunci când serverul autentificat ascultă pe o altă adresă decât loopback, cu invitații de unică folosință care expiră după 60 de secunde, iar diffurile editărilor sunt afișate înaintea aprobării. Pentru Java, execuțiile gestionate ale instrumentelor sunt păstrate în baza de date prin JDBC. O versiune v0.24.5-preview.0, limitată la două remedieri, a urmat în aceeași zi.

🔗 Qwen Code v0.24.4

Runnerele Amp creează worktrees Git

22 septembrie — La cinci zile după ce a permis unui runner să deservească mai multe directoare, Amp îl învață să creeze worktrees Git. În selector, fiecare depozit deservit oferă opțiunea New Worktree: se apasă Tab, se denumește ramura, iar firul începe într-un checkout nou creat lângă depozit (~/code/amp produce ~/code/amp-fix-flaky-login-test), fără a afecta checkoutul principal. O acțiune dedicată arhivează apoi firul și șterge worktree și ramura. Runnerele pot primi și secretele și variabilele de mediu (Secrets & Env Vars) configurate pe ampcode.com: dezactivată implicit, opțiunea se activează cu --amp-env, iar o variabilă modificată se aplică firului următor, fără repornire sau SSH.

🔗 Un runner, mai multe worktrees


Evaluări efectuate de terți: OpenAI își stabilește regulile, AISI din Regatul Unit își publică rezultatele

22 septembrie — În aceeași zi, două publicații abordează evaluarea modelelor de către organisme din afara laboratoarelor.

OpenAI: patru priorități și șapte principii pentru evaluatorii independenți

Semnat de Lama Ahmad, articolul angajează OpenAI să ofere evaluatorilor independenți, privați sau nonprofit, acces aprofundat la antrenarea, evaluarea și implementarea modelelor sale, pentru ca aceștia să îi poată contesta ipotezele, să identifice riscuri omise și să îi evalueze singuri măsurile de protecție. Aceste evaluări, distincte de activitatea desfășurată împreună cu guvernele, ar dura de la câteva săptămâni la mai multe luni, fără a fi legate de o lansare.

Domeniu prioritarCe este examinat
Dosare de siguranță (safety cases)Argumentația care arată că riscurile unui model sunt controlate, de la antrenare până la implementarea externă
Protecții criticeRezistența la jailbreaks, apărări cyber, monitoare de dezaliniere, fiabilitatea monitorizării lanțului de raționament
Preparedness FrameworkTeste de capabilități (riscuri chimice și biologice, securitate cibernetică, auto-îmbunătățirea AI) și aliniere
Incidente de dezaliniereInvestigații independente asupra incidentelor critice, incidentul Hugging Face din iulie fiind citat ca exemplu

Șapte principii încadrează întregul demers: perimetru convenit și afirmații înregistrate în prealabil, acces proporțional, metodă transparentă, expertiză și independență (conflicte de interese declarate), securitate și confidențialitate, constatări aplicabile cu un termen de remediere înainte de publicare și publicare responsabilă care reglementează cenzurarea informațiilor. OpenAI afirmă că discută cu mai multe organisme, fără să numească vreunul.

🔗 Priorități și principii pentru evaluări eficiente efectuate de terți

UK AI Security Institute își publică rezultatele verificate prin EvalEval

EvalEval Coalition anunță pe blogul Hugging Face că UK AI Security Institute (AISI), organismul public britanic însărcinat cu studierea riscurilor AI avansate, își publică de acum rezultatele evaluărilor în Evaluation Cards, platforma deschisă a EvalEval, împreună cu contextul și configurația lor, în formatul comun Every Eval Ever. Prima publicare acoperă cinci benchmarkuri (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro și Terminal-Bench 2.0) măsurate pe șase modele, Claude Opus 4, 4.5 și 4.6, GPT-5, GPT-5.2 și GPT-5.4, plus două evaluări cyber. Miza este reproductibilitatea: referințele verificate, publicate împreună cu configurația lor, ajută la înțelegerea motivului pentru care două scoruri aparent comparabile diferă.

🔗 Cum fac UK AISI și EvalEval rezultatele benchmarkurilor reproductibile


ChatGPT monitorizează scorul de credit Experian în Statele Unite

21 septembrie — Anunțată de contul @ChatGPT pe 21 septembrie, o funcție nouă permite monitorizarea scorului de credit în ChatGPT. Din spațiul Finanțe, abonații Plus și Pro din Statele Unite își conectează raportul de credit Experian și scorul VantageScore 3.0, primesc explicații personalizate despre factorii care influențează acest scor și sunt notificați când acesta se modifică. Funcția este disponibilă pe web și în cele mai recente versiuni ale aplicațiilor iOS și Android.

OpenAI menționează utilizări concrete: evaluarea efectului scorului de credit asupra unei cereri de închiriere, alegerea cardului de credit care trebuie rambursat cu prioritate, construirea istoricului de credit în timp sau înțelegerea modului în care creditul și bugetul influențează un leasing auto ori un credit ipotecar. Funcția completează instrumentele de finanțe personale lansate în preview în luna mai pentru abonații Pro din SUA, cu conectarea contului bancar prin Plaid.

🔗 Anunțul ChatGPT pe X


Google: Colab intră în planurile Google AI, API-ul Gemini restricționează Gemini 2.5

Colab se alătură planurilor Google AI

22 septembrie — Abonații Google AI primesc beneficii Colab premium, inclusiv acces prioritar la acceleratoare mai rapide și la mașini mai puternice. Abonații Ultra deblochează în plus execuția neîntreruptă în fundal și accesul la GPU Premium, astfel încât o sesiune lungă de antrenare să se încheie fără a păstra deschisă o filă. Articolul vorbește despre o lansare „începând de astăzi”, dar precizează că beneficiile vor sosi în următoarele săptămâni în țările în care Colab este disponibil. Potrivit întrebărilor frecvente Colab, unitățile de calcul ale unui plan Google AI și ale unui abonament Colab Pro sau Pro+ se adaugă la același sold; planurile Google One limitate la spațiu de stocare și perioadele de încercare gratuite nu beneficiază de acestea. Nici articolul, nici întrebările frecvente nu precizează numărul unităților alocate fiecărui plan.

🔗 Colab face acum parte din planul tău Google AI · Întrebări frecvente Colab

API-ul Gemini restricționează accesul la Gemini 2.5

18 septembrie — Într-o notă din 18 septembrie, notele versiunii API-ului Gemini limitează accesul la modelele Gemini 2.5 pentru utilizatorii care le-au folosit activ în trecut, pentru a garanta performanțe fiabile și a păstra capacitatea. Aceste modele nu sunt depreciate și continuă să fie disponibile până la noi instrucțiuni: pagina cu modelele depreciate nu afișează nicio dată de oprire pentru gemini-2.5-pro, gemini-2.5-flash și gemini-2.5-flash-lite, doar gemini-2.5-flash-image urmând să fie oprit pe 2 octombrie 2026. Pentru orice proiect nou, Google recomandă Gemini 3.5 Flash-Lite sau Gemini 3.8 Flash.

🔗 Notele versiunii API-ului Gemini · Pagina cu modelele Gemini depreciate


Hugging Face rulează fișierele GGUF ale llama.cpp în Transformers

22 septembrie — Hugging Face permite acum executarea eficientă în Transformers a fișierelor GGUF, formatul de cuantizare al llama.cpp. Este suficient ca fișierul să fie transmis către from_pretrained (parametrul gguf_file): ponderile rămân comprimate în memorie, iar calculele sunt efectuate de kernelurile Metal ale ggml, distribuite din Hub prin biblioteca kernels. Comanda transformers serve expune apoi modelul printr-un API compatibil cu OpenAI.

Domeniul inițial este restrâns: doar Mac cu Apple Silicon, arhitectura Qwen3.5 în versiunile dense și MoE (plus checkpointurile Qwen3.8 compatibile), o singură conversație simultan și instalare din ramura main. Patru kerneluri provin din ggml, iar un al cincilea, scris de Hugging Face, gestionează rutarea experților. Pe un MacBook Pro M2 Max, Hugging Face consideră că Transformers este „aproape” de llama.cpp, valorile fiind prezentate doar grafic, iar măsurătorile nefiind identice (prefill inclus într-un caz, doar decodare în celălalt); echipa recomandă în continuare llama.cpp pentru inferență locală eficientă. Interesul se află în altă parte: manipularea unui GGUF cu instrumentele PyTorch obișnuite sau folosirea unui GGUF decuantizat ca punct de pornire pentru fine-tuning.

Variantă GGUF (Qwen3.5-4B, Unsloth)Dimensiunea fișieruluiCompromisul indicat
BF168,42 GoReferință necuantizată
Q6_K3,53 GoPrecizie mai mare
Q5_K_M3,14 GoCompromis între dimensiune și precizie
Q4_K_M2,74 GoPunct de pornire recomandat pentru utilizare locală

🔗 Transformers rulează acum cuantizările llama.cpp


Kimi: K3 pe Amazon Bedrock și o extensie de browser redenumită

Kimi K3 ajunge pe Amazon Bedrock

22 septembrie — Moonshot AI anunță sosirea Kimi K3 pe Amazon Bedrock; pagina AWS datează însă această lansare pe 18 septembrie. Modelul cu ponderi deschise, publicat la sfârșitul lunii iulie cu un context de un milion de tokeni, beneficiază aici de controalele de acces, criptare și audit ale Bedrock. Este furnizat prin inferență interregională (cross-Region inference) americană și globală (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), iar memorarea sa explicită în cache începe de la 1 024 de tokeni pentru fiecare punct de cache, pentru cel puțin 30 de minute. Nivelurile Priority (de 1,75 ori tariful) și Flex (de 0,5 ori) se aplică prețurilor de bază.

Opțiune de inferență (nivel Standard)Intrare per milion de tokeniIeșire per milion de tokeniCitire din cache
Inferență globală3,00 dolari15,00 dolari0,30 dolari
Inferență americană3,30 dolari16,50 dolari0,33 dolari

🔗 Pagina Kimi K3 pe Amazon Bedrock · Kimi K3 pe Bedrock, anunț pe X

Kimi WebBridge devine Kimi Browser Extension

22 septembrie — Extensia de browser apărută în iunie odată cu Kimi Work își schimbă numele și primește o bară laterală din care utilizatorii discută cu Kimi pentru ca acesta să navigheze pe site-uri, să completeze formulare și să ducă sarcinile la bun sfârșit. Sarcinile repetitive sunt înregistrate o singură dată și salvate ca skill, pe care Kimi îl reutilizează data următoare; extensia transformă, de asemenea, paginile web în comenzi. Un serviciu local controlează instanța Chrome sau Edge deja deschisă prin Chrome DevTools Protocol, iar Moonshot afirmă că sesiunile de autentificare și conținutul paginilor nu părăsesc dispozitivul. Numai bara laterală necesită un cont Kimi.

🔗 Kimi Browser Extension · Kimi Browser Extension, anunț pe X


SpaceXAI: Grok Bot absoarbe creșterea numărului de tichete de asistență

22 septembrie — SpaceXAI publică o relatare despre experiența propriului serviciu de asistență pentru clienți, reconstruit în jurul Grok Bot, agentul său care lucrează în instrumentele companiei. De când Cursor s-a alăturat SpaceXAI pe 14 august, cele două echipe de asistență au fuzionat și acoperă mult mai multe produse. Potrivit articolului, volumul tichetelor a crescut cu 175 % fără nicio angajare, în condițiile în care ar fi putut fi necesară recrutarea a 200 de persoane; perioada de măsurare nu este precizată.

Implementarea a fost progresivă: conectat la Plain pentru tichete și la Linear pentru incidente, Grok Bot a fost inițial limitat la notele interne, fiecare acțiune de scriere fiind validată de un om, apoi a procesat tichetele simple înainte de a răspunde direct clienților încă de la sfârșitul primei zile. În prezent, efectuează o investigație preliminară pentru fiecare tichet primit, reproduce problemele în înregistrări video pentru echipa de inginerie și sintetizează zilnic peste 20 000 de feedbackuri despre produse.

Indicator publicat de SpaceXAIValoare anunțată
Creșterea numărului de tichete de asistență+175 %
Angajări evitate (estimare)200
Cost per rezolvare cu instrumentele clasice1–4 dolari
Cost per tichet cu Grok Bot, la nivelul minim0,20–0,30 dolari
Rambursări procesate fără intervenție umană99 %

🔗 Cum folosește SpaceXAI Grok Bot pentru a extinde asistența pentru clienți


Cognition: orientare spre America Latină și noi note de versiune pentru Devin

Cognition se extinde în America Latină din São Paulo

22 septembrie — Într-un articol al echipei sale din America Latină, Cognition revine asupra anunțului făcut în săptămâna precedentă la MASP, muzeul de artă din São Paulo: compania se extinde în regiune, cu o echipă stabilită în São Paulo și recrutări, în special de ingineri detașați la clienți (deployed engineers). Se bazează pe clienți deja existenți, printre care Itaú, Nubank, Santander, Natura și EBANX. La Itaú, potrivit Cognition, peste 75 % dintre echipele tehnologice folosesc Devin, care a documentat peste 300 000 de depozite și a remediat automat aproximativ 70 % dintre vulnerabilități; la Nubank, migrarea unui monolit cu mai multe milioane de linii ar fi fost redusă de la câțiva ani la câteva săptămâni, la un cost de peste douăzeci de ori mai mic. Aceste rezultate sunt cele publicate de Cognition, fără o sursă terță.

🔗 Construirea viitorului ingineriei software în America Latină

Notele de versiune Devin din 21 septembrie

21 septembrie — Publicate după ediția noastră precedentă, notele de versiune Devin introduc SWE-2, modelul de cod al Cognition lansat pe 10 septembrie, în versiune preliminară de cercetare (research preview) în selectorul de agenți: SWE-2 și un nivel de efort (Medium, High sau Max) pot fi alese la începutul unei sesiuni sau pe parcurs, iar !swe2 face același lucru în Slack. Serverele MCP Microsoft 365 (Mail și Contacts, Calendar, To Do, OneDrive și SharePoint, Teams, directorul Entra ID) intră în marketplace-ul MCP, implicit doar în citire dacă nu este configurat un domeniu OAuth. Devin Review devine disponibil pentru Bitbucket Data Center, pluginurile pot ajunge la 20 Mio și 2 500 de fișiere, iar CLI-ul autonom npx devin-review este retras: exemplarele deja instalate nu mai funcționează.

🔗 Notele de versiune Devin din 21 septembrie


Genspark își introduce benchmarkul pentru prezentări în indexul SII al Fireworks AI

22 septembrie — Fireworks AI lansează Specialized Intelligence Index (SII), un index cu 20 de benchmarkuri pentru activități profesionale reale, împărțite în șapte domenii (securitate, juridic, finanțe, asistență pentru clienți, software, sănătate, productivitate) și construite de practicieni; Harvey, Doximity, Mercor, Sierra, Decagon și Genspark se numără printre cele douăsprezece companii participante. Singurul benchmark din categoria productivitate, Genspark Slides Benchmark, pune unsprezece modele să creeze prezentări pentru 200 de sarcini reale, în cadrul agentului Genspark Slides; scorurile provin de la evaluatorul intern al Genspark. Pentru Gen-1 Slides, modelul său intern, Genspark reia argumentul unui preț de intrare de aproximativ șaptesprezece ori mai mic decât cel al Claude Opus 5.

Model evaluatScor în indexul SIIScor în articolul Genspark din 10 septembrieCost per prezentare în index
Claude Fable 5.183,6 %în afara tabelului, avans de 0,003 față de Gen-1 Slides în textneafișat
Gen-1 Slides82,2 %0,8210,44 dolari
Claude Opus 581,0 %0,8104,16 dolari
Claude Fable 579,9 %în afara tabeluluineafișat
GPT-6 Astra78,0 %în afara tabeluluineafișat
Kimi K372,6 %0,7232,00 dolari
GPT-5.6 Sol67,0 %0,6682,01 dolari
MiniMax M356,1 %0,5630,34 dolari

🔗 Specialized Intelligence Index · Anunțul Genspark


Runway lansează DIFFUSE, o platformă de recrutare pentru profesioniștii creativi instruiți în domeniul IA

22 septembrie — Runway lansează DIFFUSE (diffuse.runway.com), o platformă deschisă pe care mărcile, agențiile și studiourile caută, contactează și recrutează talente instruite în folosirea instrumentelor de IA generativă (AI-native talent). Profesioniștii creativi, independenții, studiourile boutique sau companiile de producție își creează aici un profil și își găzduiesc portofoliul; nu a fost comunicat niciun tarif.

Runway se bazează pe propriul studiu asupra a peste 1 000 de anunțuri de angajare în domenii creative, publicate de aproape 400 de companii: 17 % menționează competențe în IA sau instrumente generative, iar Runway ar fi, potrivit companiei, de departe cel mai solicitat instrument video. Runway recunoaște că IA transformă parțial profesiile creative, dar afirmă că în jurul acestor instrumente se formează o nouă forță de muncă creativă, iar cererea pentru aceasta se accelerează.

🔗 Prezentarea DIFFUSE · Runway pe X


NVIDIA pentru dezvoltatori: Isaac ROS 5.0, DLSS 5 și RTX Mega Geometry 2.0

Isaac ROS 5.0 mizează pe agenți

22 septembrie — Dezvăluită la conferința ROSCon din Toronto, Isaac ROS 5.0, colecția gratuită și open source de pachete ROS accelerate prin GPU de la NVIDIA, acceptă ROS Lyrical și Ubuntu 24.04 și acoperă întreaga gamă Jetson, de la Jetson Orin Nano până la Jetson Thor. Principala noutate vizează agenții: skilluri Isaac reutilizabile pentru instalare și manipulare, documentație care poate fi citită de agenți, un skill care ajută un agent să ajusteze modelul de vedere stereo FoundationStereo pentru propriile camere și un skill autonom de preluare și plasare (pick and place). FoundationPose primește o bibliotecă de inferență care urmărește poziția și orientarea obiectelor de până la 5,5 ori mai rapid, fără ca NVIDIA să precizeze referința de comparație.

🔗 Isaac ROS 5.0

DLSS 5 detaliat pentru studiouri, RTX Mega Geometry 2.0 disponibil

22 septembrie — Deja disponibil în NBA 2K27, DLSS 5 este prezentat în detaliu pentru dezvoltatori: randarea sa neuronală ghidată 3D (3D-Guided Neural Rendering) intervine în ultima etapă a pipeline-ului, pornește de la imaginea randată de motor și folosește culoarea și vectorii de mișcare pentru a adăuga iluminare și detalii ale materialelor, imagine cu imagine, în mod determinist, pe o singură placă GeForce RTX seria 50, până la 4K. Studiourile reglează intensitatea structurii (Structure Intensity) și intensitatea tonului (Tone Intensity) și dispun de mascare semantică prin IA. Același articol adaugă în ACE două modele cu 600 de milioane de parametri, Nemotron Speech 3.5 Streaming (recunoaștere vocală) și Qwen3 TTS (sinteză vocală), publică RTX Kit 2026.3 și face disponibil RTX Mega Geometry 2.0, cu streaming de clustere la nivel de detaliu continuu pentru mesh-uri foarte dense.

🔗 Noutăți pentru dezvoltatorii de jocuri


NVIDIA și inferența: Dynamo-Triton multi-GPU și calcul confidențial pe B200

Dynamo-Triton 26.07 deservește un model distribuit pe opt GPU-uri

21 septembrie — NVIDIA arată cum poate fi deservit un model TensorRT distribuit pe mai multe GPU-uri ca un model obișnuit. Inferența multi-GPU a TensorRT (multi-device inference), acceptată integral începând cu TensorRT 11.0, se bazează pe NCCL; Dynamo-Triton 26.07, fostul Triton Inference Server, o activează în backendul său TensorRT, iar aplicația apelează un singur endpoint gRPC. Pentru generarea video cu Cosmos 3 Nano (1280×720, 189 de imagini, 35 de pași), latența end-to-end scade de la 156,6 secunde pe un GPU la 34,2 secunde pe opt, adică este de 4,58 ori mai mică. NVIDIA precizează că testul nu măsoară nici debitul în condiții de cereri simultane, nici costul per videoclip.

Configurație testatăNumăr de GPU-uriLatență medie end-to-end
Mono-GPU1156,595 s
CP2287,999 s
CP4453,093 s
CP8834,183 s

🔗 Dynamo-Triton și TensorRT multi-GPU

Inferența confidențială pe B200 păstrează peste 96 % din debit

22 septembrie — NVIDIA măsoară costul funcției sale Confidential Computing pe Blackwell, care execută sarcinile în mașini virtuale cu memorie criptată, cu GPU-uri confidențiale și NVLink criptat. Pe un DGX B200 (opt GPU-uri, platformă Intel TDX) care deservește DeepSeek-R1 în NVFP4 cu TensorRT LLM, cu 32 000 de tokeni la intrare și 1 000 la ieșire, modul confidențial păstrează între 96,1 și 98,2 % din debit și mărește timpul mediu per token de ieșire cu numai 1,2–4,3 %, pentru 1 până la 16 cereri simultane. Au fost necesare trei adaptări ale frameworkului: memorie paginabilă în locul celei fixate pentru anumite transferuri, contorul intern al GPU-ului pentru autotunerul de kerneluri și alți algoritmi de comunicare din cauza absenței multicastului NVLink SHARP în acest mod. Sarcina a fost aleasă pentru a face vizibil costul suplimentar; NVIDIA recomandă compararea celor două moduri pe propria sarcină.

🔗 Calcul confidențial și TensorRT LLM


Pe scurt

  • Zed pregătește Delta — Zed anunță pentru această săptămână, fără ca acestea să fie încă disponibile, culori pentru gruparea firelor din Delta, mediul său de programare multiplayer cu agenți, și un indicator care arată distanța până la compactarea automată a contextului. 🔗 sursă
  • Replit și Handshake — Replit este partener fondator al AI Skills Studio de la Handshake: trei misiuni gratuite de 45 de minute duc la un proiect afișat pe profilul Handshake; OpenAI (10 misiuni), Google, Figma și Vercel se numără printre ceilalți parteneri. 🔗 sursă
  • oMLX se alătură Hugging Face — Jun Kim, creatorul oMLX, un proiect din ecosistemul MLX al Apple, se alătură Hugging Face; proiectul rămâne sub Apache 2.0, continuă să fie condus de el, devine întreținut și finanțat și urmărește, pentru început, o conversie mai rapidă a modelelor Transformers în MLX. 🔗 sursă
  • SnowLLM — Articol al comunității: acest motor de inferență sub Apache-2.0 (cu kerneluri distribuite în format binar), scris pentru GPU-ul Ryzen AI Max, decodează de până la 2,3 ori mai rapid decât llama.cpp (de 1,9 ori fără decodare speculativă) și efectuează prefill de până la 9,4 ori mai rapid, potrivit autorilor săi. 🔗 sursă
  • DecisionBench și Bosun v3.1 — Hanno Labs publică DecisionBench 1.0 (43 de sarcini, 28 de domenii) și două modele decizionale cu ponderi deschise bazate pe Qwen3 (0,6 și 1,7 miliarde de parametri), care obțin 83,20 % și 87,29 % pe propria suită aplicată; Jev le depășește pe pista de raționament. 🔗 sursă
  • Un Moshi cu 600 de milioane de parametri — Un dezvoltator își relatează încercarea de a crea un model vocal full-duplex bazat pe Qwen3-0.6B-Base, antrenat cu un cost de 2 până la 15 dolari per încercare pe B200: textul converge, dar vocea rămâne neclară, blocajul fiind localizat în codebookurile acustice fine. Proiectul este suspendat, fără ponderi publicate. 🔗 sursă
  • Together AI și GLM-5.2 — Într-un studiu de caz din 18 septembrie, republicat pe X pe 21, Together AI descrie o companie fintech care își deservește agenții de programare prin GLM-5.2, cu un context de 256K și 56 de B200; un incident cu o coadă de așteptare de 1 până la 3 minute a fost remediat în aceeași zi prin reconfigurarea rutării. 🔗 sursă
  • Gemini CLI — Versiunea nightly din 22 septembrie, prima cu cod nou de pe 19, remediază blocarea HttpsProxyAgent is not a constructor cu Vertex AI în spatele unui proxy și emite actualizarea tool_call înaintea solicitării permisiunii în modul ACP. 🔗 sursă
  • Google Flow — Contul oficial declară peste 25 de milioane de utilizatori pe lună și prelungește pentru toată lumea acordarea celor 50 de credite zilnice suplimentare, o ofertă rezervată în iulie abonaților Google AI până la 31 august. 🔗 sursă
  • Jigsaw și Sensemaking AI — Incubatorul Google își lansează Partner Program pentru a implementa în 30 de orașe, state și țări suita sa open source de consultare a cetățenilor, bazată pe Gemini, cu sprijinul unui fond Google.org, Bloomberg Philanthropies și Packard Foundation, a cărui valoare nu a fost publicată. 🔗 sursă
  • 100.000 de burse de formare — În marja Adunării Generale a Organizației Națiunilor Unite, Google finanțează 100.000 de burse pentru formare certificată în domeniul AI în peste 80 de țări, prin AI Skills Coalition din programul AI for Good al UIT, distribuite de guvernele locale și de rețeaua Giga. 🔗 sursă
  • Agenți care securizează codul Google — Într-un articol din 19 septembrie, Google explică faptul că analizează înainte de trimitere fiecare modificare a codului infrastructurii sale cu agenți construiți pe frameworkul său open source Mantis, care blochează sute de vulnerabilități pe lună; agentul de triaj declară o precizie de peste 92 % în mai puțin de un minut. 🔗 sursă
  • Copilot CLI 1.0.88 — Setările gestionate de companie se aplică acum sesiunilor --acp, --ahp-host și --server, care până acum nu aveau politici MCP, permisiuni sau pluginuri, iar /fork funcționează pe durata unei ture; versiunea 1.0.87 din 21 septembrie adăugase setări gestionate pentru nivelul de rutare Auto. 🔗 sursă
  • Pika și Seedance 2.5 — Modul Draft al Seedance 2.5 ajunge pe Pika și în Pika API Club: schițe de clipuri începând de la 10 cenți pe secundă, care pot fi apoi finalizate la calitate înaltă. 🔗 sursă
  • Pika Swap Anything — O nouă aplicație Pika care înlocuiește actorii, costumele, decorul sau accesoriile dintr-un videoclip, păstrând ritmul, mișcările și narațiunea filmării originale, fără un tarif anunțat. 🔗 sursă
  • Suno Studio — Stația de producție muzicală Suno integrează o suită de efecte audio, inclusiv un compresor (prag, raport, atac, eliberare, sidechain), inclusă în abonamentul Premier. 🔗 sursă
  • Sluicebox și Nemotron 3 Ultra — Studiu de caz NVIDIA: prin trecerea la Nemotron 3 Ultra, acest startup care analizează emisiile de carbon din lanțurile de aprovizionare își reduce costurile de inferență cu 51 până la 80 % și atinge 87,7 % la extragerea datelor furnizorilor, față de 84 % pentru modelul anterior. 🔗 sursă
  • Topograph — Set de instrumente open source de la NVIDIA care descoperă topologia rețelei unui cluster de GPU-uri și o publică pentru Kubernetes, Slurm și Slinky, pentru a plasa sarcinile distribuite cât mai aproape unele de altele; acesta citește API-urile Crusoe, Google Cloud, Lambda, Nebius, Nscale și Oracle Cloud. 🔗 sursă
  • Evaluarea unui agent — Într-un articol metodologic din 21 septembrie, NVIDIA propune șase metrici, de la apelarea instrumentului până la îndeplinirea sarcinii, și menționează Nemotron 3.5 Lightning cu 86 % pe PinchBench, cu 30 % mai rapid decât Qwen3.6 35B. 🔗 sursă
  • Qwen-Image-2.1 pe Intel — Anunțat de Intel pe 21 septembrie și preluat de Qwen pe 22, suportul din prima zi prin OpenVINO vizează GPU-urile Arc Pro B70 și GPU-urile integrate din Core Ultra Series 3, cu un notebook dedicat. 🔗 sursă
  • Box și Grok 4.7 — Pe 21 septembrie, în ziua lansării Grok 4.7, Box l-a testat într-o versiune preliminară a Box Agent, pe un dosar de daună de 2 milioane de dolari: au fost identificate o factură duplicată de 82.000 de dolari și o notă de credit lipsă de 64.000 de dolari; nu au fost anunțate nici data disponibilității, nici tariful. 🔗 sursă
  • Un chirurg și Codex — OpenAI Developers publică un videoclip în care Brian Pridgen, chirurg specializat în chirurgia mâinii, arată cum își construiește propriile instrumente cu Codex și analizează literatura științifică de pe PubMed, fără cifre sau studiu scris. 🔗 sursă
  • ChatGPT în Word — Anunțat pe 17 septembrie: un singur add-in Microsoft oferă acces la ChatGPT în Word, Excel și PowerPoint, în întreaga lume și pentru toate abonamentele, inclusiv Free, cu limite de utilizare; Business și Enterprise beneficiază de o versiune preliminară gratuită a GPT-5.6 Sol în Word până la 30 septembrie. 🔗 sursă
  • Alfabetizare în AI — Perplexity publică un ghid care consideră evaluarea răspunsurilor drept competența-cheie, critică „teatrul formării” și citează Gallup: o adopție declarată de 38 %, dar o utilizare zilnică de 12 % în al patrulea trimestru din 2025. 🔗 sursă

Ce înseamnă acest lucru

În aceeași zi, Anthropic și OpenAI au susținut același argument: nu un model mai puternic cu orice preț, ci un nivel apropiat de gama lor de vârf, la un cost mult mai mic. Opus 5.5 este prezentat ca fiind la nivelul Fable 5.1, cu 40 % mai ieftin decât Opus 5, iar GPT-6 Sol ca preluând o mare parte dintre punctele forte ale Astra, la 2 și 10 dolari per milion de tokenuri. Cei doi furnizori gândesc acum în termeni de cost per sarcină, nu de preț per token, și transformă cache-ul în adevărata pârghie: citiri la 0,20 dolari la Anthropic, reduceri de până la 90 % și puncte de întrerupere explicite la OpenAI.

Integrarea se măsoară, la rândul ei, în ore. GitHub Copilot, Devin, Perplexity, Cursor și v0 au oferit acces la noile modele chiar în ziua lansării, fiecare cu propria evaluare: FrontierCode 1.1 Extended la Cognition, WANDR la Perplexity, CursorBench la Cursor. Aceste cifre nu sunt direct comparabile (65,3 % pentru Opus 5.5 în varianta Extended, 54,4 % în varianta Main), iar niciunul dintre cei doi furnizori nu își compară încă noul model cu cel al celuilalt. Pentru un dezvoltator, alegerea potrivită se evaluează tot mai mult în propriul instrument și pe propriile sarcini, nu în tabelele de lansare.

Abonamentele devin, de asemenea, un teren de diferențiere. Anthropic își mărește limitele pentru intervale de cinci ore, oferă o resetare și trece Pro și Team Standard la Opus în Claude Code; GitHub rezervă Opus 5.5 planurilor superioare, dar oferă GPT-6 Luna începând cu Copilot Pro; Google integrează Colab în planurile sale Google AI, restricționând în același timp Gemini 2.5 pentru a-și conserva capacitatea. Distribuirea resurselor de calcul între planuri contează acum la fel de mult ca prețul afișat.

În cele din urmă, se schimbă chiar și modul de evaluare. Anthropic recunoaște că diferențele dintre benchmarkuri sunt mai puțin utile decât înainte și că Opus 5.5 pare adesea să știe că este evaluat; OpenAI stabilește reguli pentru a-și deschide modelele evaluării de către experți independenți; AISI din Regatul Unit își face rezultatele reproductibile cu EvalEval, iar NVIDIA propune ca un agent să fie evaluat după sarcina îndeplinită, nu după fiecare apel de instrument. Verificarea a ceea ce face efectiv un model contează acum la fel de mult ca scorul său.


Surse