Căutare

Demis Hassabis propune un Standards Body pentru modelele frontieră, NVIDIA revendică 25x performanță per watt, GPT-5.6 în disponibilitate generală pe Bedrock

Demis Hassabis propune un Standards Body pentru modelele frontieră, NVIDIA revendică 25x performanță per watt, GPT-5.6 în disponibilitate generală pe Bedrock

ai-powered-markdown-translator

Articol tradus din fr în ro cu gpt-5.4-mini.

Vezi proiectul pe GitHub ↗

Săptămâna aceasta este marcată de o luare de poziție a lui Demis Hassabis asupra guvernanței IA frontieră, de două publicații NVIDIA care cuantifică câștigurile de eficiență ale Blackwell și de o nouă metodă de cercetare condusă de agent, precum și de disponibilitatea generală a GPT-5.6 pe Amazon Bedrock. Restul actualităților acoperă un val de modele deschise (OCR, vision-language, cuantificare ternară), mai multe noutăți GitHub și Manus pe partea de instrumente și publicarea open source a benchmarkului WANDR de către Perplexity.


Demis Hassabis propune un cadru pentru IA frontieră și un Standards Body

14 iulie — Într-un articol lung publicat pe X, Demis Hassabis, cofondator și CEO al Google DeepMind, își exprimă poziția cu privire la traiectoria către inteligența artificială generală (AGI). El consideră că un sistem dotat cu toate capacitățile cognitive ale creierului uman este probabil la doar câțiva ani distanță și compară amploarea acestei rupturi cu descoperirea electricității sau a focului, cu un impact potențial de zece ori mai mare decât cel al revoluției industriale, la o viteză de zece ori mai mare.

Totuși, el avertizează: cursa comercială și geopolitică actuală este atât de intensă încât nu lasă timpul necesar pentru a înțelege bine riscurile (securitate cibernetică și, în cele din urmă, riscuri nucleare și biologice), nici pentru a menține controlul unor sisteme din ce în ce mai autonome și capabile să se autoîmbunătățească.

Propunerea sa centrală: un Standards Body dedicat evaluării modelelor frontieră, pe modelul unui parteneriat public-privat supravegheat de statul federal american — în stilul FINRA din finanțe — cu un consiliu care să includă experți tehnici independenți și reprezentanți ai open source. Finanțarea, predominant privată, ar urmări să atragă talente tehnice de prim rang și să finanțeze calculul necesar testelor la scară largă. Hassabis poziționează Statele Unite ca țara cel mai bine plasată pentru a iniția această demers, invitând totodată la o colaborare internațională pe temele de securitate.

If you stop to think about it, we’ve essentially found a way to make sand think. It’s miraculous. The magnitude of this technology’s impact will be unprecedented, perhaps 10x of the Industrial Revolution at 10x the speed.

🇷🇴 Dacă stăm să ne gândim, am găsit practic o modalitate de a face nisipul să gândească. Este miraculos. Amploarea impactului acestei tehnologii va fi fără precedent, poate de zece ori mai mare decât cea a revoluției industriale, la o viteză de zece ori mai mare.@demishassabis pe X

🔗 Articol complet pe X


NVIDIA — performanța per watt, metrică-cheie a eficienței infrastructurilor IA

14 iulie — NVIDIA apără performanța per watt ca metrică de referință pentru eficiența infrastructurilor IA: într-un context în care puterea electrică disponibilă este constrângerea cea mai dură, acest raport determină câți tokeni poate produce o fabrică de IA într-un buget fix de putere, deci veniturile și profitabilitatea sa.

Compania cuantifică câștigurile platformei sale Blackwell NVL72 față de generația Hopper:

Model evaluatCâștig de performanță per watt (Blackwell NVL72 vs Hopper)
DeepSeek V4 Propână la 25x
GLM 5.1până la 20x
Kimi K2.6 (sarcini agentice lungi)până la 10x

O parte din aceste câștiguri provine din trecerea de la un domeniu GPU de 8 unități (Hopper) la rack-uri integrate de 72 GPU, cu un NVLink Switch de generația a șasea care integrează calcul în rețea (tehnologia SHARP). Dincolo de hardware, optimizarea software continuă să producă câștiguri substanțiale: până la 5x performanță suplimentară pe DeepSeek V4 într-o singură lună, prin stiva TensorRT-LLM, Dynamo, SGLang și vLLM.

Pe partea de infrastructură electrică, tehnologia DSX MaxLPS ar permite rularea a până la 40 % mai multe GPU cu același buget de putere, datorită răcirii cu apă temperată și controlului dinamic al puterii — având în vedere că, în prezent, doar aproximativ 60 % din electricitatea extrasă din rețea se transformă efectiv în muncă IA utilă într-o fabrică. NVIDIA poziționează această abordare în perspectiva viitoarei sale platforme Vera Rubin și citează implementări în producție la Anthropic, OpenAI, CoreWeave, Perplexity și Fireworks AI.

🔗 Articol NVIDIA


NVIDIA — Nemotron Labs : cercetare RL autonomă condusă de competențe de agent

14 iulie — NVIDIA a prezentat „RL Autoresearch”, o demonstrație de cercetare în învățare prin întărire condusă de un agent, bazată pe NeMo RL, NeMo Gym și competențe reutilizabile. Principiul: îi oferi unui agent codeur un obiectiv și un buget de timp, apoi îl lași să construiască singur mediul de antrenament, să antreneze modelul și să-l evalueze, cercetătorul limitându-se să supravegheze orientarea generală a lucrărilor.

În exemplul prezentat, agentul trebuia să învețe un model de vision să numere stele colorate. Modelul Qwen3-VL-2B a trecut de la 25 % la 96,9 % precizie, iar agentul a propus singur experiența următoare de realizat, fără ca aceasta să-i fie dictată de cercetător.

Un al doilea exemplu, care ține de post-antrenare mai degrabă decât de cercetarea autonomă, ilustrează o utilizare similară: un model Cosmos 3 Nano, inițial incapabil să detecteze un semafor deși era vizibil în evaluare zero-shot, a fost post-antrenat prin LoRA pentru sarcina de validare WTS (scenarii de condus integrând vreme, trafic și semnalizare). Precizia trece de la 54,41 % la 87,14 % după LoRA, apoi la 93,35 % prin adăugarea NVIDIA TAO AutoML — totul în mai puțin de o zi.

We gave a coding agent a goal and a time budget: build a training environment and teach a vision model to count colored stars.

🇷🇴 Am oferit unui agent codeur un obiectiv și un buget de timp: să construiască un mediu de antrenament și să învețe un model de vision să numere stele colorate.@NVIDIAAI pe X

🔗 Anunț Nemotron Labs


Modele deschise & cercetare

Șapte publicații marchează această săptămână pe partea de modele deschise și cercetare, susținute în special de Hugging Face, Together AI și Sakana AI.

Model evaluatEditorParametriLicențăBenchmark-cheie
OvisOCR2Autor independent (HF)0,9 miliardeApache 2.096,58 pe OmniDocBench v1.6
MOSS-VL-RealtimeOpen_MOSS11 miliardeApache 2.0Context de 256 000 tokeni
Ternary Bonsai 27BPrismML~27,3 miliarde (ternar)Gratuit pe Together AI99,20 pe MATH-500

OvisOCR2 : recunoaștere de documente la 0,9 miliarde de parametri

OvisOCR2 revendică un scor de 96,58 pe OmniDocBench v1.6 și se prezintă ca primul model end-to-end care depășește sistemele în pipeline (OCR, detecția aspectului paginii și analiza tratate separat). Autorul propune o rețetă care folosește Hugging Face Jobs pentru a converti orice set de date în markdown prin OCR, fără GPU local. Limită de notat: acest scor și calificarea „primul model end-to-end” provin din tweetul de anunț, nefiind verificate pe o fișă completă de model.

🔗 Anunț OvisOCR2 pe X

MOSS-VL-Realtime : vision-language deschis pentru video în timp real

Echipa Open_MOSS publică un model vision-language de 11 miliarde de parametri conceput pentru analiza continuă a fluxurilor video, nu pentru imagini izolate: continuă să observe videoclipul în timp ce generează răspunsul, îl poate revizui dacă situația se schimbă pe ecran și alege să rămână tăcut în lipsa unor dovezi suficiente. Variantele Base, Instruct și Realtime sunt toate publicate sub Apache 2.0, cu suport day-0 din partea echipelor SGLang și LMSYS.

🔗 Anunț MOSS-VL-Realtime pe X

LeRobot v0.6.0 : suport nativ pentru profunzime

Biblioteca robotică open source Hugging Face adaugă suport nativ end-to-end pentru profunzime (depth): prin conectarea unei camere Intel RealSense și activarea use_depth: true, hărțile de profunzime sunt sincronizate automat cu fluxurile RGB, cuantificate în 12 biți și codificate fără pierderi în HEVC. Funcționalitatea acoperă SO-100/101, Koch, OpenArm, reBot și Unitree G1.

🔗 Anunț LeRobot v0.6.0 pe X

Sakana Marlin : un „Virtual CSO” pentru cercetare strategică

Sakana AI lansează un agent de cercetare autonom care realizează un raționament aprofundat timp de aproximativ 8 ore prin motorul AB-MCTS și un flux de tip AI Scientist, pentru a ajunge la opțiuni strategice structurate, mai degrabă decât la un rezumat. Livrabilele includ raport, anexe, referințe și diapozitive. Produsul este în beta, cu tarifare la utilizare (98 yeni per credit) sau o ofertă Enterprise la cerere.

Ternary Bonsai 27B : cuantificare ternară în format de telefon

PrismML publică o variantă de Qwen3.6 27B cuantificată în ternar (format g128, 1,71 bit per greutate, aproximativ de 9,4 ori mai compactă decât o bază FP16), păstrând, potrivit editorului, 95 % din calitatea în precizie deplină.

Benchmark evaluatScor
MATH-50099,20
AIME 202590,84
HumanEval+93,90
Medie (15 benchmarkuri thinking)80,49

Modelul suportă un context de 262 000 tokeni și o intrare vizuală, fiind oferit gratuit pe infrastructura serverless a Together AI.

🔗 Anunț Ternary Bonsai 27B pe X

Flash-BoN : best-of-N reinterpretat pentru difuzare

Sayak Paul (Hugging Face) arată că best-of-N reprezintă un reper mai solid decât se credea pentru scalare la momentul inferenței în difuzare, cu condiția să fie măsurat și timpul real de execuție, nu doar numărul de evaluări de funcție. Echipa introduce Flash-BoN, care privilegiază o explorare mai largă a eșantioanelor în locul validărilor intermediare repetate.

🔗 Anunț Flash-BoN pe X

Hugging Face deschide ZeroGPU tuturor utilizatorilor

Accesul la demo-urile ZeroGPU (GPU gratuit la cerere) este acum disponibil pentru toți utilizatorii Hugging Face, cu un agent skill care permite construirea unei demo direct dintr-un prompt în limbaj natural.


GitHub, Copilot & Manus

Code scanning afișează detectări de securitate prin IA pe pull request-uri

14 iulie — GitHub code scanning scoate acum la suprafață detectări de securitate asistate de IA direct pe pull request-uri, extinzând acoperirea la limbaje și framework-uri neacceptate de CodeQL. Funcționalitatea, în previzualizare publică, rămâne informativă: nu blochează merge-ul, necesită activarea default setup CodeQL, o licență Copilot și consumă credite IA doar atunci când apare o detecție.

🔗 Changelog GitHub

Dependabot introduce o perioadă de latență implicită

14 iulie — Dependabot așteaptă acum trei zile în mod implicit după publicarea unei versiuni noi înainte de a deschide un pull request de actualizare, pentru a limita expunerea la atacuri asupra lanțului de aprovizionare. Această întârziere este configurabilă prin opțiunea cooldown din .github/dependabot.yml; actualizările de securitate rămân imediate. Funcționalitatea va ajunge în GitHub Enterprise Server începând cu versiunea 3.23.

🔗 Changelog GitHub

/security-review în aplicația GitHub Copilot

14 iulie — Comanda /security-review este disponibilă în previzualizare publică în aplicația GitHub Copilot: ea analizează modificările de cod în curs și returnează rezultate clasificate după severitate și nivel de încredere, cu sugestii aplicabile direct fără a părăsi aplicația. Acoperă în special injecții, cross-site scripting și path traversal și este accesibilă planurilor Free, Pro, Business și Enterprise.

🔗 Changelog GitHub

Manus generează acum .pptx nativ

14 iulie — Manus genera anterior diapozitive și apoi le convertia în .pptx; acum produce direct fișierul PowerPoint nativ, cu grafice cu adevărat editabile (se redesenează când o valoare se schimbă) și posibilitatea de a activa sau nu etichetele, grila și legenda.

🔗 Anunț Manus

Manus lansează publicarea automată a site-urilor generate

13 iulie — Noua opțiune auto-publish implementează automat fiecare build reușit al unui site la adresa sa online, fiind dezactivată implicit. Combinată cu o coadă de schimbări, elimină ultimul pas manual dintre construire și punerea în producție.

🔗 Anunț Manus


Generare de imagini & video

Wan-Dancer-14B : generare video de dans open source

14 iulie — Alibaba pune open source Wan-Dancer-14B, un model care poate fi executat local, specializat în generarea de videoclipuri de dans ritmate, de lungă durată, vizând sincronizarea dintre mișcare și muzică pe secvențe prelungite, nu doar clipuri simple.

🔗 Anunț Alibaba Wan

HeyGen : marcare temporală cuvânt cu cuvânt pentru avataruri în timp real

14 iulie — HeyGen documentează un flux nepublic al API-ului său Avatar Realtime: un canal de marcare temporală cuvânt cu cuvânt ({mot, début, fin}) care permite sincronizarea precisă a gesturilor și a vorbirii. Confirmarea trimiterii unui text ajunge în aproximativ 70 ms, dar cuvântul are nevoie de mai multe secunde pentru a fi pronunțat efectiv, de unde necesitatea unei ancore recalculată de aproximativ patru ori pe secundă. Mecanismul a fost testat printr-o emisiune Twitch difuzată 24/24, cu 9 269 verdicte date în direct.

🔗 Articol HeyGen

HeyGen — Figma → HyperFrames, ziua 9/30

14 iulie — Competența /figma importă assets, tokenuri de brand, componente, cronologii de motion și storyboard-uri direct dintr-un fișier Figma. Pentru demonstrație, echipa a importat 27 de culori și stiluri numite și a reconstruit un storyboard de opt cadre ca un script de filmare interpretat în direct.

🔗 Depozit HyperFrames

NVIDIA — Nemotron : feedback cuantificat de la companii cliente

14 iulie — NVIDIA publică mai multe studii de caz cuantificate în jurul modelelor deschise Nemotron: H Company a depășit 76 % precizie pe OSWorld-Verified cu Holotron 3 Nano; Harvey a post-antrenat Nemotron 3 Ultra pentru un cost per execuție de cel puțin 10 ori mai mic decât alternativele închise; Arcee AI revendică un cost de aproximativ 20 de ori mai mic decât un model închis comparabil, plasându-se totodată pe locul al doilea pe PinchBench; Abridge și YTL AI Labs l-au personalizat, respectiv, pentru conversații clinice și limba malaeză.

🔗 Articol NVIDIA


Anthropic

Claude for Teachers : acces gratuit pentru profesorii K-12 din Statele Unite

14 iulie — Anthropic lansează acces gratuit la capabilitățile premium ale lui Claude pentru profesorii K-12 verificați din Statele Unite, cu o bibliotecă de competențe pedagogice și o conexiune la programe validate prin Learning Commons, aliniate la standardele celor 50 de state. Conversațiile nu sunt niciodată folosite la antrenarea modelelor, iar datele elevilor sunt acoperite de un acord de prelucrare conform cu legea FERPA.

🔗 Anunț Anthropic

Artifacts: partajare publică, editare multiplayer și creare prin Claude Tag

13 iulie — Artifacts câștigă partajare publică (oricine are linkul poate vizualiza), editare multiplayer simultană (planurile Team și Enterprise) și creare din Claude Tag în Slack la simpla solicitare într-un fir de discuție.

🔗 Anunț Anthropic


OpenAI

GPT-5.6 în disponibilitate generală pe Amazon Bedrock

13 iulie — Cele trei modele GPT-5.6 lansate pe 9 iulie — Sol (raționament flagship), Terra (intermediar) și Luna (inferență rapidă) — sunt acum în disponibilitate generală pe Amazon Bedrock, pe noul motor de inferență Bedrock conceput pentru performanță, securitate și scală. Acest lucru extinde punctele de acces la GPT-5.6 alături de ChatGPT, API-ul direct OpenAI și integrările terțe (Copilot, M365, Warp, Cursor, Devin).

🔗 Anunț AWS

Codex, agent recomandat implicit în JetBrains AI

14 iulie — JetBrains face din Codex agentul recomandat implicit în JetBrains AI (IntelliJ IDEA, PyCharm, WebStorm), o alegere neexclusivă — utilizatorul poate comuta oricând la un alt agent — reevaluată lunar pe măsură ce modelele evoluează.

🔗 Anunț JetBrains


Gemini

Gemini în Google Chrome lansat în Regatul Unit

14 iulie — Gemini devine accesibil din orice tab Chrome deschis în Regatul Unit, fără a schimba contextul: rezumă o pagină, compară conținut între taburi, răspunde la întrebări despre ceea ce este afișat pe ecran.

🔗 Anunț Google UK

Primul raport Gemini Asia de Sud-Est: adoptare record și Gemini Spark

14 iulie — Google publică primul său „Gemini Southeast Asia Report”: utilizatorii activi s-au mai mult decât dublat într-un an pe cele șase piețe principale (Indonezia, Malaezia, Filipine, Singapore, Thailanda, Vietnam), aproape 70% dintre interogări sunt trimise în limba locală, iar 5 miliarde de imagini au fost generate prin Nano Banana în ultimul an. Cu această ocazie, Google lansează Gemini Spark, un agent proactiv capabil să gestioneze sarcini Workspace, în limbile locale, pentru abonații Advanced din regiune.

🔗 Raport Google


Instrumente de dev & agenți

Devin Fusion: un agent preview care direcționează către Fable 5

13 iulie — Cognition lansează Devin Fusion, un agent în previzualizare disponibil în Devin Cloud, unde un model joacă rolul de manager delegând sarcini către un model mai economic, în loc să le execute pe toate cu un singur model premium. Potrivit echipei, Fable 5 se comportă ca un manager care deleagă prin redactarea unor specificații complete, în timp ce alte modele precum Opus 4.8 tind să microgestioneze și să își satureze contextul. Rezultatul: un cost per sarcină mai mic decât cel al Opus 4.8, în ciuda unui tarif unitar mai ridicat pentru Fable 5 — cu excepția depanării în serie, unde economiile rămân mai greu de obținut.

🔗 Anunț Cognition

Perplexity deschide open source benchmarkul său WANDR

14 iulie — Perplexity publică WANDR (Wide ANd Deep Research), un benchmark intern conceput pentru a evalua agenții de căutare pe sarcini ample și aprofundate: 500 de sarcini, 170 495 de înregistrări verificabile individual, pe trei niveluri de dificultate. Corectorul recuperează fiecare pagină citată pentru a verifica faptul că fiecare afirmație este susținută de dovada subiacentă. Pe șase sisteme de producție testate, rezultatele rămân modeste: 0,363 în F1 flexibil și doar 0,133 în F1 strict, pentru un cost per sarcină care variază de la 0,03 dolari la 324,83 dolari în funcție de setări.

🔗 Anunț Perplexity pe X · Benchmark GitHub


Pe scurt

  • Anthropic alocă 10 milioane de dolari canadieni pentru a finanța noi lucrări de cercetare în IA în Canada, în parteneriat cu instituții locale. 🔗 sursă
  • Cognition sărbătorește un an de la achiziția Windsurf: venit anualizat trecut de la 73 de milioane la peste 500 de milioane de dolari, peste 20 de milioane de linii de cod scrise, unificare sub marca Devin Desktop. 🔗 sursă
  • Amp (Sourcegraph) publică un tablou de bord public care arată în timp real utilizarea modurilor sale de agent, atât pentru toți utilizatorii, cât și pentru echipa internă. 🔗 sursă
  • Warp integrează Sentry prin MCP, pentru a lega analiza cauzei rădăcină (Seer) și crearea de pull request fără a părăsi terminalul. 🔗 sursă
  • Composio ajunge pe Warp, conectând agenții la peste 1 000 de aplicații (Gmail, Slack, Linear, Google Calendar). 🔗 sursă
  • Zach Lloyd (CEO al Warp) publică un eseu despre trecerea de la agenți interactivi la „cloud software factories” care automatizează întregul ciclu de viață software. 🔗 sursă
  • Hugging Face Jobs permite acum montarea unui dosar local direct într-un Job prin -v dossier:/chemin, fără pasul prealabil de încărcare către un depozit. 🔗 sursă
  • llama.cpp sărbătorește a 10 000-a publicație (release), fără detalii tehnice suplimentare. 🔗 sursă
  • LlamaCoder v4 (Together AI) generează aplicații complete într-un singur prompt, reconstruit în jurul GLM 5.2 cu un nou motor de randare WebAssembly, gratuit și open source. 🔗 sursă
  • NotebookLM recapitulează funcționalitățile sale recente (sincronizare automată cu Drive, fixarea notebook-urilor, reordonarea diapozitivelor, partajare mobilă) în așteptarea unui anunț viitor nedetaliat. 🔗 sursă
  • GitHub permite acum estimarea costului licenței Code Quality (committers activi, proiecție lunară) înainte de trecerea sa la 10 dolari per committer activ și pe lună, prevăzută pentru 20 iulie 2026. 🔗 sursă
  • NVIDIA lansează „AI Model Co-Design”, o nouă serie despre sinergia dintre dimensiunile modelelor și performanța GPU. 🔗 sursă
  • Kling AI dezvăluie trailerul pentru ODYSEEUS: The Fall, al doilea lungmetraj IA al studioului Fountain 0, regizat de Ash Koosha. 🔗 sursă
  • OpenAI publică un ghid Enterprise despre pilotarea investițiilor IA în era agentică, centrat pe măsurarea muncii utile per dolar cheltuit. 🔗 sursă
  • OpenAI detaliază modul în care echipele de vânzări folosesc ChatGPT Work pentru notițele de pipeline, pregătirile pentru întâlniri și diagnosticele tranzacțiilor blocate. 🔗 sursă
  • OpenAI detaliază modul în care echipele de data science folosesc ChatGPT Work pentru notițele de cauză rădăcină, rapoartele de impact și specificațiile tablourilor de bord. 🔗 sursă
  • Cohere este co-sponsor al hackathonului Hugging Face și recompensează două proiecte: Tiny Army (locul 2, pista Thousand-Token Wood) și Eyas, agent de supraveghere video (premiul pentru cel mai bun agent). 🔗 sursă

Ce înseamnă asta

Pe plan material, NVIDIA își structurează comunicarea în jurul unei singure idei: puterea electrică, nu siliciul, este acum constrângerea care determină rentabilitatea unei fabrici de IA. Câștigurile de performanță per watt ale Blackwell (până la 25x pe DeepSeek V4 Pro) și cazurile clienților Nemotron cuantificate în zeci de ori mai ieftin spun aceeași poveste: eficiența energetică și costul per token devin principalul argument de vânzare, mai mult decât puterea brută. Demonstrația RL Autoresearch merge în aceeași direcție, vizând automatizarea însăși a buclei cercetare-antrenare-evaluare, până acum în mare parte manuală.

Pe partea modelelor deschise, săptămâna ilustrează o diversificare rapidă a nișelor: recunoaștere de documente ultra-ușoară (OvisOCR2), înțelegere video continuă (MOSS-VL-Realtime), robotică cu profunzime nativă (LeRobot) și, mai ales, cuantificarea ternară a Bonsai 27B, care face să încapă o capacitate multimodală de clasa 27 de miliarde de parametri într-un volum de memorie demn de un telefon. Aceste publicații, susținute de Hugging Face, Together AI, Sakana AI și echipe independente, arată un ecosistem open source care continuă să urmărească îndeaproape capacitățile modelelor închise, reducând în același timp semnificativ costurile de inferență.

Pe terenul guvernanței, intervenția lui Demis Hassabis se desprinde de tonul obișnuit al anunțurilor de produs: ea afirmă explicit că actuala cursă comercială depășește înțelegerea colectivă a riscurilor și propune un mecanism concret — un Standards Body inspirat de FINRA — mai degrabă decât un simplu apel la prudență. Faptul că această propunere vine de la CEO-ul Google DeepMind, chiar în mijlocul unei săptămâni pline de lansări de produs, ilustrează tensiunea dintre ritmul comercial și anticiparea reglementară care traversează întregul sector.

În fine, instrumentele pentru dezvoltatori continuă să se reorganizeze în jurul delegării între modele, mai degrabă decât al cursei către un singur model mai puternic: Devin Fusion mizează pe un model manager care deleagă unui model executor mai ieftin, GitHub își extinde scanarea de securitate asistată de IA direct în pull requests, iar Perplexity își deschide benchmarkul WANDR pentru a obiectiva limitele reale ale agenților de căutare — o reamintire utilă că și cele mai bune sisteme actuale rămân departe de o fiabilitate completă în sarcini de verificare factuală la scară largă.


Surse