Szukaj

Grok 4.7 trafia tego samego dnia do Cursor i Copilot, OpenAI ujawnia ponad 100 rozwiązanych problemów matematycznych, Googlebook w przedsprzedaży

ai-powered-markdown-translator

Artykuł przetłumaczony z francuskiego na polski za pomocą gpt-5.6-sol.

Zobacz projekt na GitHubie ↗

Poniedziałek 21 września należy do xAI: Grok 4.7 debiutuje i jeszcze tego samego dnia trafia do Cursor oraz GitHub Copilot, bez opóźnienia między ogłoszeniem modelu a jego pojawieniem się w narzędziach. Tego samego dnia OpenAI ujawnia, że wewnętrzny model trenowany od 28 sierpnia rozwiązał ponad sto otwartych problemów matematycznych, oraz powołuje grupę doradczą matematyków po oświadczeniu podpisanym przez 27 laureatów Medalu Fieldsa. Google uruchamia przedsprzedaż Googlebooka, ElevenLabs umieszcza agenta montażowego w centrum swojego edytora wideo, a Hugging Face ponownie wydaje swoją bibliotekę do tokenizacji, od 3 do 30 razy szybszą.


Grok 4.7 debiutuje w xAI i tego samego dnia trafia do Cursor oraz GitHub Copilot

21 września — xAI udostępnia Grok 4.7, swój najbardziej zaawansowany model do kodowania i pracy z wiedzą. Model bazowy jest większy niż w Grok 4.6, a jego etap uczenia przez wzmacnianie (reinforcement learning) wydłużono, wykorzystując zestaw zadań z większą wagą problemów wymagających wielu godzin pracy. xAI oczekuje, że model będzie lepiej weryfikował własną pracę i skuteczniej radził sobie z długimi kontekstami.

Wyniki wskazują raczej na zróżnicowany profil niż dominację. Cena pozostaje natomiast bez zmian: 2 dolary za milion tokenów wejściowych i 6 za milion wyjściowych, tak jak w Grok 4.6, czyli połowa ceny wejściowej GPT-5.6 Sol i jedna piąta ceny Fable 5.1. Głównym argumentem jest właśnie ten stosunek ceny do wydajności.

Opublikowany pomiarGrok 4.7 (xHigh)Grok 4.6 (High)GPT-5.6 Sol (Max)Fable 5.1 (Max)
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
EEBench (elektrotechnika)64,0 %53,0 %39,4 %56,4 %
Cena wejścia (dolary / M tokenów)22410
Cena wyjścia (dolary / M tokenów)662050

API udostępnia grok-4.7 z kontekstem liczącym 500 000 tokenów i czterema poziomami intensywności rozumowania, od low do xhigh; cena podwaja się powyżej 200 000 tokenów promptu. xAI podkreśla również całkowicie nowy zestaw zabezpieczeń: pierwsze miejsce w benchmarku bezpieczeństwa biologicznego LatchBio z wynikiem 62,4% oraz zaledwie 3,3% ryzykownych promptów cybernetycznych podwójnego zastosowania przepuszczonych w HackerBench v0.3.

Wdrożenie u dwóch integratorów następuje natychmiast. Cursor udostępnia model już pierwszego dnia — to konsekwencja przejęcia Anysphere przez SpaceX, sfinalizowanego 14 sierpnia. Model nadal należy do xAI: wpis opublikowany tego samego dnia na blogu Cursor składa się z jednego zdania i odsyła do pełnego ogłoszenia na x.ai. To xAI eksponuje CursorBench 4.0, benchmark długotrwałych zadań opracowany przez Cursor, w którym Grok 4.7 osiąga 46,3% przy niezmienionej cenie. GitHub Copilot wdraża go natomiast we wszystkich swoich środowiskach, od VS Code po Xcode, w planach od Pro do Enterprise. Sposób rozliczania wymaga uwagi: Grok 4.7 nie podlega systemowi mnożników żądań i jest rozliczany według publicznej stawki dostawcy, na podstawie użycia. Ponieważ nowy model jest domyślnie aktywowany, kontrolowanie wydatków wymaga zmiany w zasadach dotyczących modeli, a nie jedynie braku działania.

🔗 Grok 4.7 — xAI 🔗 Grok 4.7 jest już dostępny w GitHub Copilot


OpenAI powołuje grupę doradczą matematyków i ujawnia rozwiązanie ponad stu otwartych problemów

21 września — OpenAI ogłasza współpracę z niezależną grupą doradczą złożoną z dziewięciu matematyków, utworzoną przez nich samych i działającą przy Institute for Advanced Study w Princeton. Kontekst ma większe znaczenie niż samo ogłoszenie.

On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.

🇵🇱 28 sierpnia rozpoczęliśmy trenowanie nowego modelu wewnętrznego. Oprócz rozwiązania milenijnego problemu Naviera–Stokesa model ten rozwiązał już ponad 100 od dawna otwartych problemów z większości dziedzin matematyki. — OpenAI, Grupa doradcza ds. matematyki i sztucznej inteligencji

Nazwa modelu nie została podana publicznie, a OpenAI pisze, że tempo tych postępów zaskoczyło nawet zatrudnionych przez firmę matematyków. To przyspieszenie wywołało zdecydowaną reakcję: 11 września opublikowano oświadczenie zatytułowane „A Severe Misalignment of AI in Mathematics”, opatrzone identyfikatorem DOI Zenodo i podpisane przez 27 laureatów Medalu Fieldsa, w tym Terence’a Tao, Petera Scholzego i Cédrica Villaniego. Nie twierdzą oni, że modele się mylą. Rozwiązanie ważnego problemu zawsze sygnalizowało nowe zrozumienie, które następnie społeczność rozwijała, aż stawało się możliwe do nauczania; sygnatariusze obawiają się, że masowe generowanie prawdziwych lub fałszywych twierdzeń zniszczy to podłoże, zamiast je wzbogacić, oraz że pochopne ogłoszenia nie pozostawią czasu na poprawne opracowanie wyników.

Konstrukcja grupy rzeczywiście opiera się na niezależności: może ona wydawać opinie bez uprzedniej prośby, publicznie komentować wpływ OpenAI na matematykę i zmieniać swój skład bez zgody firmy, a jej członkowie nie otrzymują od niej wynagrodzenia. Pozostaje jednak zdanie, które OpenAI umieszcza na końcu tego samego akapitu: grupa nie będzie doradzać firmie w sprawie tempa jej wewnętrznych postępów. Zakres jej działania obejmuje więc rozpowszechnianie wyników, a nie ich wytwarzanie — wszystko oprócz tego, co wywołało protest. Martin Hairer figuruje zaś na obu listach: jako sygnatariusz oświadczenia i członek grupy.

🔗 Poważne niedostosowanie AI w matematyce


Googlebook, linia laptopów Google zaprojektowana wokół Gemini

21 września — Google uruchamia przedsprzedaż Googlebooka, przedstawiając go jako odrębną kategorię: stos technologiczny Android, fundamenty systemu desktopowego odziedziczone po ChromeOS, a wszystko zaprojektowane wokół Gemini. Jednocześnie debiutuje pięć modeli produkowanych przez Acer, ASUS, Dell, HP i Lenovo, w cenach od 899 dolarów. Dostawy rozpoczną się 4 października w Stanach Zjednoczonych oraz 5 października w Kanadzie, Wielkiej Brytanii, Irlandii, Francji, Niemczech i Australii.

Zapowiedziana cechaWartość
Cena początkowa899 dolarów
ProcesoryIntel Core Ultra Series 3 lub Snapdragon X Elite
NPUponad 45 TOPS
Pamięć RAM16 GB w standardzie, maksymalnie 32 GB
Czas pracy na bateriido 14 h odtwarzania wideo, 16 h przeglądania internetu
Wsparcie oprogramowaniaaktualizacje przez maksymalnie 10 lat

Trzy funkcje Gemini są dostępne wyłącznie na tym urządzeniu. Magic Pointer, uruchamiany potrząśnięciem kursora, przenosi Gemini do elementu widocznego na ekranie — na przykład w celu przeanalizowania podejrzanej wiadomości e-mail lub połączenia kilku obrazów — a Google zaznacza, że funkcja aktywuje się tylko na żądanie i można ją wyłączyć. Rambler przekształca chaotyczne dyktowanie w uporządkowany tekst z nagłówkami i listami zadań, również wtedy, gdy użytkownik zmienia język w połowie zdania. Create My Widget generuje widżety pulpitu na podstawie opisu w języku naturalnym.

Dla deweloperów każde urządzenie jest dostarczane z Antigravity, platformą agentów programistycznych Google, oraz odizolowanym środowiskiem Linux z pełnym terminalem — dokumentacja wyraźnie wspomina o możliwości uruchamiania w nim Claude Code lub Antigravity CLI. Izolację zapewnia hypervisor pKVM z certyfikatem Level 5, przedstawiany przez Google jako pierwsze takie rozwiązanie w tej kategorii, uzupełniony sprzętowym źródłem zaufania Titan. Resztę zapewnia ciągłość pracy z telefonem Android: można wznowić zadanie rozpoczęte na urządzeniu mobilnym i wyświetlać aplikacje mobilne w oknie na pulpicie. Każdy Googlebook obejmuje 12 miesięcy Google AI Pro z 5 TB przestrzeni dyskowej, 3 miesiące YouTube Premium i Photoshop oraz rok GeForce NOW.

🔗 Przedsprzedaż Googlebooka


ElevenLabs dodaje agenta montażowego do Studio 4.0

21 września — ElevenLabs udostępnia Studio 4.0 w ElevenCreative, aktualizację swojego edytora wideo. Główna idea mieści się w jednym zdaniu: wszystko odbywa się w jednym miejscu. Generowanie wideo, obrazów, głosu, muzyki i efektów dźwiękowych uruchamia się bezpośrednio z projektu, wszystkie modele ElevenCreative można wywoływać bez opuszczania edytora, a montaż, dodawanie napisów i eksport następują kolejno w tym samym interfejsie. Ujęcie można przerobić bez ponownego uruchamiania całego procesu generowania, a napisami da się manipulować jak każdym innym klipem na osi czasu (timeline).

Najważniejszą zmianą strukturalną jest Studio Agent, współmontażysta obecny w każdym projekcie.

Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.

🇵🇱 Studio Agent to Twój współmontażysta AI, zintegrowany z każdym projektem. Opisz oczekiwaną zmianę, a wykona montaż. W dowolnym momencie możesz przejąć kontrolę i wykonać własne cięcia, a następnie ponownie przekazać oś czasu agentowi.@ElevenLabs na X

To właśnie ta dwukierunkowa współpraca odróżnia narzędzie od nieprzejrzystego procesu generowania: montażysta może przejąć kontrolę, kiedy zechce, a następnie ponownie przekazać oś czasu. Została ona zresztą przebudowana z myślą o projektach wieloscenowych i wielościeżkowych — kampaniach reklamowych, samouczkach czy seriach krótkich materiałów — oferując precyzyjne powiększenie do poziomu klatki, przyciąganie klipów oraz przesuwanie grupy klipów bez rozsynchronizowania reszty. Komentarze zespołu można przypinać do konkretnego klipu lub zasobu, zamiast rozpraszać je w oddzielnych wątkach.

Warto odnotować na potrzeby dalszego śledzenia: w chwili sprawdzania ogłoszenie istniało wyłącznie na X, w wątku składającym się z sześciu wiadomości. Ostatnim wpisem na blogu ElevenLabs pozostawał artykuł z 10 września, a ostatnią pozycją w dzienniku zmian dokumentacji — wpis z 14 września.

🔗 Studio 4.0 w ElevenCreative


Hugging Face publikuje tokenizers v1, od 3 do 30 razy szybsze przy identycznych identyfikatorach

21 września — Hugging Face publikuje wersję kandydującą tokenizers v1, biblioteki Rust przekształcającej tekst w ciągi liczb całkowitych, zanim odczyta go model. Punkt wyjścia jest prosty: tokenizacja nigdy nie była wąskim gardłem pipeline’ów uczenia maszynowego, ale równowaga przesuwa się wraz z przyspieszaniem modeli, a GPU czekający na procesor pozostaje bezczynny.

MetrykaZmierzona wartość
Przyspieszenie kodowania względem v0.23, jeden wątekod 3 do 30 razy
Urządzenie pomiaroweApple M4 Max
Dolna i górna granica zakresut5-base i gpt2
Skalowanie przy ośmiu workerach76% skalowania liniowego
Wygenerowane identyfikatory tokenówidentyczne jak w v0.23
Instalacja wersji kandydującejcargo add tokenizers --pre

Ograniczenie narzucone przez zespół jest ciekawsze od samych wzrostów wydajności: v1 generuje dokładnie te same identyfikatory tokenów co v0.23, API, słownik i rangi scalania (merge ranks) pozostają bez zmian, a biblioteka zachowuje uniwersalny charakter, zamiast specjalizować się w BPE. Aktualizacja nie wymaga więc niczego poza zmianą zainstalowanej wersji.

Za większość prac odpowiada sześć zmian, a najbardziej nietypowa nosi nazwę bitcannon. Wyrażenie regularne dzielące tekst na tokeny wstępne jest stałym parametrem dostarczanym z tokenizerem: nie ma powodu, by przy każdym kodowaniu interpretował je uniwersalny silnik. Hugging Face pisze więc funkcję dzielącą ręcznie i przetwarza strumienie bitów za pomocą SIMD, rozstrzygając 64 bajty podczas jednej operacji na rejestrze. Koszt jest świadomie zaakceptowany: korzystają z tego wyłącznie rozpoznawane wzorce (GPT-2, cl100k, o200k, Tekken, DeepSeek), natomiast pozostałe nadal korzystają ze ścieżki regex — stąd rozpiętość od 3 do 30 razy. Do tego dochodzą pętla scalania bez alokacji i rozgałęzień, lokalna dla wątku pamięć podręczna słów oraz natywna równoległość. Powiązania C i C++ przeznaczone wyłącznie do inferencji, kierowane do ExecuTorch i llama.cpp, zapowiedziano przed wydaniem 1.0.0.

🔗 tokenizers v1: zmierzone kodowanie, dekodowanie i skalowanie


Devin Cloud trafia do terminala, z dostępem SSH do maszyny agenta

21 września — Cognition udostępnia Devin Cloud w terminalu: devin --cloud lub /cloud z trwającej sesji tworzy, kontroluje i wznawia sesję w chmurze bez opuszczania CLI. Mechanizm opiera się na symetrycznym poleceniu: /handoff przenosi bieżące zadanie do maszyny wirtualnej Devin — Mac, Linux lub Windows — a uruchomione w chmurze wykonuje drogę powrotną, pobierając gałąź pull requestu. Sesje w chmurze działają nadal po zamknięciu terminala, z którego zostały uruchomione.

And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.

🇵🇱 I po raz pierwszy połącz się przez SSH z dedykowaną maszyną wirtualną Devin, a następnie przenieś pracę z powrotem na własne urządzenie za pomocą /handoff.@cognition na X

devin ssh zapewnia pełny dostęp do środowiska utworzonego przez agenta: można modyfikować kod, uruchamiać serwer deweloperski, przekierowywać porty i pobierać pliki za pomocą scp. Środowisko wykonawcze przestaje być czarną skrzynką. Sesje SWE-2 są bezpłatne w Devin Cloud do 8 października.

🔗 Devin Cloud w Twoim terminalu


Qwen Code v0.24.3 instrumentuje swój Web Shell i trwale zapisuje sesje w JDBC

21 września — Qwen Code przechodzi do wersji v0.24.3 dzień po v0.24.2: trzydzieści jeden pull requestów, żadnych zmian niekompatybilnych. Większość widocznych prac dotyczy Web Shell, którego wyniki wykonania nie są już surowym tekstem, lecz strukturą oddzielającą polecenie, jego dane wyjściowe, szczegóły wykonania i czas, który upłynął. Karta trajectory, domyślnie wyłączona, pokazuje czas trwania każdej tury, czas do pierwszego tokena, liczbę tokenów oraz czas trwania każdego wywołania narzędzia.

Najmniej widoczna część jest prawdopodobnie najbardziej fundamentalna. Runtime otrzymuje trwałe przechowywanie swoich powiązań i sesji w JDBC, co pozwala współdzielić stan między wieloma procesami broker i zachować własność sesji po ponownym uruchomieniu. Narzędzia runtime są ponadto kierowane przez bwrap z polityką niezmiennego workspace — to bezpośrednia kontynuacja sandboxa wprowadzonego poprzedniego dnia, którego ustawienie nadal nie jest dostępne. Tego samego dnia SDK TypeScript v0.1.14 zawiera tę CLI, a Qwen Code Desktop v0.24.3 podąża za nim.

🔗 Informacje o wydaniu Qwen Code v0.24.3


Hugging Face udostępnia relore, pamięć repozytorium dla agentów kodujących

21 września — Hugging Face publikuje relore na licencji Apache-2.0, narzędzie zapewniające agentowi kodującemu pamięć repozytorium. Punktem wyjścia był incydent: w zgłoszeniu Transformers #48630, otwartym 8 września, zaproponowano już dwie poprawki, gdy firmowy agent ciągłej integracji przystąpił do napisania trzeciej. Wszystkie informacje znajdowały się na GitHubie, ale były rozproszone między zgłoszeniami, pull requestami i komentarzami niewidocznymi z poziomu pierwotnego zgłoszenia.

relore indeksuje tę historię, zapisując, kto co powiedział: decyzja maintenera ma inną wagę niż hipoteza kontrybutora, a treści wygenerowane maszynowo są domyślnie pomijane. Klon roboczy jest utrzymywany obok indeksu i udostępniany przez to samo HTTP API, a zapytania są przetwarzane lokalnie — jedynie pobieranie danych kontaktuje się z GitHubem. Dalej pojawiają się czasowniki: inflight wyświetla wątki, które deklarują zamknięcie zgłoszenia, search --trust authoritative wskazało PR #39847 jako źródło regresji, a why wychodzi od wiersza kodu, aby odnaleźć otaczające go komentarze z przeglądu. Podczas testu w praktyce agent poinformował, że defs zapewnia mu lepszy ogólny obraz pliku niż przeczytanie go w całości, zużywając 5% tokenów.

🔗 relore, pamięć repozytorium dla agentów kodujących


Perplexity dotrenowuje Computer na błędach użytkowników i dodaje do niego wideo

21 września — Perplexity Research szczegółowo opisuje, jak firma dotrenowuje model obsługujący jej agenta Computer — jak przy okazji ujawnia artykuł, jest nim GLM 5.2 — na podstawie rzeczywistych sesji użytkowników. Środowiska syntetyczne generują kontrolowane i łatwe do zweryfikowania zadania; rzeczywiste sesje dostarczają dwóch sygnałów, których tamte nie wytwarzają: poprawek wprowadzanych przez użytkownika oraz błędów zwracanych przez narzędzia. Sesje zawierające dane osobowe oraz sesje użytkowników, którzy odmówili zgody na trenowanie, są wykluczane przed jakimkolwiek próbkowaniem.

Każda tura jest następnie poddawana jednemu z trzech procesów: imitacji za pomocą entropii krzyżowej w przypadku bezbłędnych tur z udanych sesji, korekcji za pomocą dywergencji Kullbacka-Leiblera w przypadku błędnych tur opatrzonych prawidłową wskazówką albo zwykłemu zachowaniu w kontekście. Ten sam zestaw wag pełni rolę nauczyciela i ucznia, lecz tylko nauczyciel widzi wskazówkę. Trzej automatyczni sędziowie wskazują tury odpowiedzialne za błąd i co najmniej dwóch z nich musi być zgodnych, ponieważ ostatnia tura przed skargą jest rzeczywistą przyczyną tylko w około połowie przypadków.

Wskaźnik błędów narzędziZmierzona wartość
Offline, oryginalny GLM 5.22,79%
Offline, samo próbkowanie z odrzucaniem1,35%
Offline, z samodestylacją0,87%
Online, między dwoma checkpointami2,24%, następnie 1,77%, czyli względnie o 21,2% mniej

Autorzy wyraźnie wskazują, czego te liczby nie dowodzą: porównywane offline checkpointy nie były trenowane na tych samych danych, wyniki według zadań pozostają niejednoznaczne, a niezadowolenie użytkowników nie zmienia się znacząco — 2,58% wobec 2,54% — w testach A/B obejmujących około stu tysięcy użytkowników w każdej grupie.

Tego samego dnia Computer zyskuje funkcję generowania wideo, powierzoną dwóm modelom zewnętrznym: MiniMax H3 i ByteDance Seedance 2.5. Klip kampanii, demonstracja produktu lub materiał do mediów społecznościowych — gotowe wideo pojawia się w tym samym wątku co tekst i obrazy utworzone na potrzeby tego samego żądania. Funkcja jest dostępna dla subskrybentów Pro i Max, bez wzmianki o bezpłatnym dostępie ani udostępnieniu przez API.

🔗 Uczenie się na błędach z rzeczywistego świata 🔗 Perplexity Computer i modele wideo


Gemini Notebook udostępnia Live Chat i Interactive Learning Overviews wszystkim docelowym użytkownikom

21 września — Gemini Notebook osiągnął tego samego dnia dwa etapy wdrożenia. Live Chat dociera do 100% subskrybentów Ultra na urządzeniach mobilnych: umożliwia rozmowę głosową w czasie rzeczywistym z notebookiem, w około 100 językach, opartą na najnowszych modelach audio Google, z niemal całkowicie bezdotykowymi instrukcjami krok po kroku. Kilka godzin później Interactive Learning Overviews wychodzą z fazy stopniowego wdrażania i stają się dostępne dla wszystkich użytkowników, bez wymogu subskrypcji; umieszczone w sekcji Reports, łączą podsumowania źródeł i artefakty studia w jednej interaktywnej przestrzeni.

Obie funkcje zaprezentowano 15 września w ogłoszeniu dotyczącym nowych narzędzi do nauki. Komunikaty z 21 września nie dodają żadnej funkcji: potwierdzają faktyczną dostępność — pełną w przypadku pierwszej i otwartą dla wszystkich w przypadku drugiej.

🔗 Live Chat wdrożony w 100% 🔗 Interactive Learning Overviews dostępne dla wszystkich


Google.org przeznacza 4 miliony dolarów na szkolenia nauczycieli z AI

21 września — Google.org przeznacza 4 miliony dolarów dla Digital Promise, co ogłoszono w Nowym Jorku przy okazji Zgromadzenia Ogólnego Organizacji Narodów Zjednoczonych. Finansowanie rozszerza Google AI Educator Series, bezpłatny program szkoleniowy ogłoszony wcześniej w tym roku i przeznaczony dla 6 milionów nauczycieli szkół podstawowych, średnich i wyższych w Stanach Zjednoczonych. Program, opracowany wspólnie z ISTE zgodnie z podejściem, w którym nauczyciele szkolą innych nauczycieli, koncentruje się na umiejętnościach możliwych do przenoszenia między narzędziami, a nie na konkretnym produkcie, i składa się z modułów realizowanych we własnym tempie, potwierdzanych cyfrowymi odznakami.

Digital Promise działa w trzech obszarach: dostosowuje szkolenia do stanowych agencji edukacyjnych i okręgów szkolnych, współpracuje z sieciami community colleges na rzecz nauczycieli pierwszego stopnia studiów oraz prowadzi dwuletnie badanie tego, co rzeczywiście pomaga nauczycielom akademickim, którego wyniki zostaną opublikowane w bezpłatnym publicznym przewodniku.

🔗 Google.org i Digital Promise


Runway rozszerza Workflows o compositing, przezroczystość i mapy głębi

21 września — Runway rozszerza swoje Workflows, czyli sekwencje operacji komponowane w aplikacji, o pięć elementów ukierunkowanych na postprodukcję: Compositing, Alpha, HDR, Depth Map i RGB Depth. Argument w ogłoszeniu mieści się w jednym zdaniu — można zbudować większą część swojego łańcucha produkcyjnego (pipeline) w jednym miejscu, bez przechodzenia do innego narzędzia między etapami. Compositing i obsługa kanału alpha służą do łączenia wielu warstw obrazu; mapy głębi, w obu postaciach, stanowią sygnał geometryczny sterujący efektami zależnymi od odległości od kamery. Ogłoszenie opublikowano na X wraz z 31-sekundową demonstracją, bez odpowiadającego mu wpisu na stronie aktualności Runway w chwili skanowania.

🔗 Rozszerzone Workflows w Runway


NVIDIA uruchamia DSX Ready, program kwalifikacji systemów zasilania i chłodzenia fabryk AI

21 września — NVIDIA uruchamia DSX Ready, program kwalifikujący produkty partnerów pod kątem wymagań jej architektury referencyjnej DSX dla fabryk AI. Punkt wyjścia jest bardzo praktyczny: zasilanie, chłodzenie, woda, lokalizacja i sieć elektroenergetyczna decydują dziś o tym, co konstruktor może rzeczywiście wdrożyć, a sprzęt niedopasowany do reszty projektu nie przekształca mocy obliczeniowej w użyteczną produkcję.

Kwalifikowana kategoriaPartnerzy w momencie uruchomieniaProces kwalifikacji
Magazynowanie energii w bateriachHitachi Energy, LG Energy Solution, TeslaTesty partnera, przegląd i zatwierdzenie przez NVIDIA
Jednostki dystrybucji chłodzeniaLG Electronics, LiquidStack, VertivZestaw testów do samodzielnej kwalifikacji

NVIDIA wyraźnie określa granice znaczenia tej etykiety: pomyślne przejście kwalifikacji nie zastępuje inżynierii na poziomie lokalizacji ani nie oznacza żadnej gwarancji jej stabilności. Z czasem mają zostać dodane kolejne kategorie obejmujące infrastrukturę i oprogramowanie.

🔗 NVIDIA DSX Ready


NVIDIA traktuje bezpieczeństwo agentów jak problem inżynieryjny, warstwa po warstwie

21 września — NVIDIA publikuje stanowisko w sprawie bezpieczeństwa systemów agentowych: jest to problem inżynieryjny, a więc wymaga zdefiniowanych wymagań, możliwych do zastosowania mechanizmów kontroli, wyznaczonych właścicieli oraz dowodów na skuteczność zabezpieczeń. Stos podzielono na trzy poziomy — modele zapewniają możliwości, frameworki organizują kontekst, narzędzia i przepływy pracy, a środowisko wykonawcze dostarcza infrastrukturę, w której odbywają się działania — z których każdy ma własne mechanizmy kontroli.

Wybrany przykład dobrze ilustruje problem: agent aktualizuje kartę klienta, napotyka złośliwe instrukcje w załączonym dokumencie i próbuje wyeksportować dane do nieautoryzowanego miejsca docelowego. NVIDIA oczekuje wówczas polityki sieciowej blokującej transfer oraz chronionych logów zachowujących próbę wywołania narzędzia, decyzję autoryzacyjną i wynik. Prawo do aktualizacji karty nie obejmuje prawa do jej eksportowania, a agent może poprosić o dostęp, ale nigdy nie może sam go sobie przyznać. Po stronie narzędzi OpenShell egzekwuje polityki poza zasięgiem agenta; Cisco dodaje ponad nim DefenseClaw, a JFrog weryfikuje skills, do których agent uzyskuje dostęp.

Tego samego dnia drugi wpis stosuje to samo rozumowanie do fizycznej AI i wiąże je z platformą Halos; znajduje się wśród krótkich wiadomości poniżej wraz z dwiema prognozami rynkowymi.

🔗 Zabezpieczanie stosu agentowego


Earth-2 asymiluje lokalne obserwacje, aby odświeżać prognozy pogody

21 września — NVIDIA publikuje samouczek dotyczący narzędzi Earth-2 do asymilacji danych przez AI, przeznaczonych dla sektorów, które dysponują już własnymi pomiarami: farm wiatrowych i słonecznych, lokalnych radarów i czujników oraz obserwacji satelitarnych. Pierwsza technika, SDA, ma zastosowanie do modeli dyfuzyjnych, takich jak CorrDiff i StormCast: na każdym etapie odszumiania porównuje pośredni wynik z obserwacjami i ukierunkowuje kolejny etap, bez ponownego trenowania.

Zmierzona technikaZasięg i rozdzielczośćZysk odnotowany w przykładzie
CorrDiff-SDAEuropa, od 0,25 stopnia do 2,2 kmSpadek RMSE wiatru o 54% na odłożonych stacjach
StormCast-SDAKontynentalne Stany Zjednoczone, 3 km, inicjalizacja HRRRSpadek RMSE wiatru o 7,2% w sześciu krokach czasowych
HealDAGlobalny, siatka HEALPix o rozdzielczości 1 stopniaGlobalny stan atmosfery oszacowany w kilka sekund

Korzyść jest przede wszystkim operacyjna: analizy numeryczne wymagają znacznej mocy obliczeniowej i są publikowane o stałych godzinach, podczas gdy SDA integruje obserwacje w sposób ciągły i wypełnia lukę do bieżącego czasu. HealDA z kolei traktuje każdy strumień jako chmurę punktów w przestrzeni i czasie, agregowaną na siatce docelowej, a następnie przekazywaną do sieci bazowej (backbone) typu vision transformer.

🔗 Asymilacja danych w Earth-2


Multiverse Computing przycina bloki niczym szkło Isinga i zyskuje 23 punkty w MMLU

21 września — Usuwanie całych bloków transformera jest jednym z najtańszych sposobów przyspieszenia dużego modelu językowego i jednym z najbardziej brutalnych: model dosłownie staje się krótszy, ale usunięcie niewłaściwych bloków powoduje jego załamanie. Multiverse Computing twierdzi, że pytanie zostało źle postawione. Istniejące metody oceniają każdy blok osobno — magnitude, sensitivity, block influence — co autorzy określają jako pole średnie, podczas gdy efekt usunięcia danego bloku zależy od tego, które inne bloki usuwa się jednocześnie.

Wybór staje się zatem problemem ograniczonej optymalizacji binarnej, który można odwzorować na szkło Isinga: układ nieuporządkowanych spinów, ze wzajemnymi oddziaływaniami wszystkich ze wszystkimi i stałą liczbą spinów skierowanych w górę. Praktyczną korzyść można ująć w jednym zdaniu: energia tego układu jest tanim substytutem wyniku, jaki uzyska przycięty model, co pozwala uszeregować bardzo dużą liczbę konfiguracji kandydujących bez oceniania żadnej z nich na benchmarkach. Przy kompresji Llama-3.3-70B-Instruct wynoszącej 50% autorzy deklarują zysk niemal 23 punktów procentowych w MMLU względem najlepszej konkurencyjnej metody.

🔗 Przycinanie LLM-ów niczym fizyk


Aktualności w skrócie

NVIDIA opublikowała 21 września siedem wpisów i wiadomości: trzy omówiono powyżej, a cztery pozostałe przedstawiono tutaj, bez ogłoszeń technicznych.

  • NVIDIA apeluje o bezpieczeństwo na każdej warstwie fizycznej AI — stanowisko oparte na dwóch prognozach rynkowych: według ABI Research do 2035 roku ma zostać wdrożonych 49 milionów autonomicznych pojazdów poziomów od 3 do 5, a według Omdia między 2026 a 2035 rokiem około 60 milionów robotów przemysłowych. Cztery powiązane z tym wymagania dotyczące bezpieczeństwa opierają się na platformie NVIDIA Halos. 🔗 źródło
  • NVIDIA podkreśla skalowanie egipskiego ekosystemu AI — przyjęcie w Grand Egyptian Museum z przemówieniem inauguracyjnym Paolo Guglielminiego, wiceprezesa na region EMEA. Wprowadzenie wskazuje przede wszystkim, że fabryki AI zaczynają działać w Republice Południowej Afryki, Maroku i Nigerii. 🔗 źródło
  • NVIDIA przedstawia pięć firm wykorzystujących AI w energetyce niskoemisyjnej — przegląd opublikowany z okazji New York Climate Week, obejmujący zagadnienia od przyspieszania prac nad syntezą jądrową po ponowne wykorzystywanie poddanych recyklingowi akumulatorów z pojazdów elektrycznych. ThinkLabs AI tworzy w tym celu cyfrowe bliźniaki i agentów na CUDA, aby skrócić czas przyłączania do sieci. 🔗 źródło
  • NVIDIA ogłasza zdobywców Golden Tickets na GTC Berlin — jury wyłoniło sześciu zwycięzców, którzy wezmą udział w konferencji odbywającej się od 20 do 22 października 2026 roku. Brak treści technicznych. 🔗 źródło
  • Qwen-Image-2.1 obsługiwany od pierwszego dnia przez vLLM, SGLang, ComfyUI i Hugging Face — SGLang-Diffusion uruchamia model na pojedynczej karcie RTX 4090 z 24 GB pamięci, korzystając z przenoszenia danych do procesora, a wygenerowanie obrazu o rozdzielczości 1024 na 1024 zajmuje 18,7 sekundy i wykorzystuje 22,7 GiB. vLLM opisuje go jako transformator dyfuzyjny z 7,1 miliarda parametrów, połączony z Qwen3-VL-8B. 🔗 źródło
  • OpenAI Academy dodaje cztery ścieżki szkoleniowe — Build with AI, Lead AI Adoption, AI for Educators i AI for College Students dołączają do Apply AI at Work. Każdy kurs kończy się oceną, za którą przyznawana jest odznaka; ścieżka dla deweloperów oddziela sterowanie Codexem od tworzenia rozwiązań z użyciem API. 🔗 źródło
  • Runway organizuje w San Francisco hackathon poświęcony swojemu API — jednodniowe wydarzenie odbędzie się 30 września w The Masonic, przy okazji Runway AI Summit, i będzie poświęcone tworzeniu agenta, aplikacji lub kreatywnego przepływu pracy, bez prezentacji ani procesu zatwierdzania. 🔗 źródło
  • HeyGen wyróżnia Code2Video, benchmark opracowany z Google DeepMind i Kaggle — pomiar dotyczy kwestii odrębnej od pisania kodu: tego, czy kod tworzy film, który warto obejrzeć. Informację opublikowano w komentarzu do wiadomości o stosie agentowym do obsługi wideo, opartym na generowaniu kodu. 🔗 źródło
  • Suno prezentuje efekty dźwiękowe stosowane za pomocą prostego opisu — minutowa demonstracja, od ciepłego przesterowania po bardziej eksperymentalne brzmienie. Nie podano nazwy funkcji ani objętego nią planu, nie opublikowano też powiązanego wpisu na blogu: to prezentacja produktu, a nie jego premiera. 🔗 źródło
  • Demonstracja Gemini na żywo dotycząca zakupów na Discordzie — sesję zapowiedziano na wtorek 22 września o godz. 11:00 czasu PT na oficjalnym serwerze Discord; będzie poświęcona przygotowaniu zakupu, porównywaniu opcji i wyszukiwaniu na podstawie zdjęcia. Brak nowych funkcji. 🔗 źródło
  • Together AI i Ollama zapowiadają sesję poświęconą otwartym agentom programistycznym — Parth Sareen ze strony Ollama i Zain Hasan ze strony Together AI poprowadzą sesję o wdrażaniu produkcyjnym agentów programistycznych opartych na modelach otwartych. W wiadomości nie podano ani daty, ani miejsca. 🔗 źródło
  • Udostępniono otwarte wagi dwóch porzuconych treningów Boris-2 — pierwszy zatrzymał się na wartości straty 3,100 po 30 miliardach tokenów z powodu niezgodności między gradientami Muon i AdamW; drugi przerwano przy około 7 miliardach tokenów. Opowieść o niepowodzeniu bardziej pouczająca niż same modele. 🔗 źródło
  • Wstępnie zarejestrowany protokół badający kierunkowe obciążenie modeli oceniających — hipoteza zakłada, że w przypadku tekstu narracyjnego błędy skłaniają się ku bezpośredniemu nazywaniu emocji zamiast ich pośredniego zakodowania. Protokół opublikowano przed zebraniem jakichkolwiek danych; określono w nim wynik, który doprowadziłby do wycofania konstruktu, a autor ujawnił konflikt interesów. 🔗 źródło
  • Reprodukcja Jev z użyciem otwartych komponentów przegrywa o 0,6 punktu — użytkownik, który twierdzi, że nie programuje, powierza Claude Code całodzienną serię eksperymentów mających odtworzyć Jev na otwartych stosach działających wyłącznie na procesorze. Osiem nieudanych podejść, które uważa za bardziej pouczające niż to zakończone sukcesem. 🔗 źródło
  • Jevini oddziela projektowanie decyzji od ich wykonywania — duży model rozumujący projektuje wersjonowany graf typowanych ocen, który mały model decyzyjny wykonuje dla każdej nowej sytuacji. Materiał promocyjny producenta, który należy tak właśnie traktować. 🔗 źródło
  • Cohere kontynuuje komunikację wizerunkową bez zapowiedzi produktu — wiadomość z 20 września rozwija kampanię AI for Empowerment, przeformułowując intencję przypisywaną współzałożycielowi Aidanowi Gomezowi, a dwie grafiki z 21 września opowiadają o drodze firmy na studencki hackathon Hack The North w Waterloo. Bez modelu, funkcji ani ceny. 🔗 kampania · 🔗 hackathon

Co to oznacza

Dostępność od dnia premiery staje się standardem dystrybucji. Grok 4.7 nie każe na siebie czekać: trafia do Cursor i GitHub Copilot w dniu ogłoszenia, a Qwen-Image-2.1 był obsługiwany przez vLLM, SGLang, ComfyUI i Hugging Face już w chwili premiery. Okres między publikacją modelu a jego dostępnością w narzędziach codziennego użytku, liczony wcześniej w tygodniach, zmierza do zera — w przypadku Cursor dlatego, że od 14 sierpnia producent i laboratorium należą do tej samej grupy, a w pozostałych przypadkach dlatego, że integrację przygotowuje się przed ogłoszeniem. Interesujące pytanie nie dotyczy już tego, kiedy model się pojawi, lecz ile będzie kosztował, gdy już trafi do użytkowników.

Właśnie to zmienia nowa pozycja na rachunku za Copilot. Grok 4.7 wychodzi w nim z systemu mnożników zapytań i jest rozliczany według publicznego cennika xAI, na podstawie użycia. W połączeniu z automatycznym włączaniem nowych modeli przenosi to decyzję o kosztach na poziom administracji platformą: brak działania oznacza otwarcie pozycji wydatków indeksowanej według cennika zewnętrznego dostawcy. Argument xAI jest symetryczny — te same 2 dolary za dane wejściowe co w przypadku Grok 4.6, rzeczywiste postępy w Terminal-Bench, ale miejsce za Fable 5.1 w długotrwałych zadaniach programistycznych: sprzedaje się tutaj stosunek ceny do wydajności, a nie pierwsze miejsce.

W obszarze agentów trzy odległe od siebie ogłoszenia opisują tę samą zmianę: środowisko wykonawcze przestaje być czarną skrzynką. devin ssh udostępnia maszynę wirtualną agenta w interaktywnej sesji, relore zapewnia agentowi pamięć wcześniejszych decyzji dotyczących repozytorium zamiast jedynie bieżącego stanu kodu, Perplexity prowadzi dodatkowy trening swojego modelu na konkretnych etapach, na których zawiódł on użytkowników, a Qwen Code kieruje swoje narzędzia przez bwrap. NVIDIA przedstawia teoretyczne ramy tego ruchu, przyjmując, że bezpieczeństwo agenta buduje się warstwa po warstwie, poza jego zasięgiem, za pomocą dzienników stanowiących dowód. Agent poddający się inspekcji i agent działający w ramach ograniczeń to dwie strony tej samej potrzeby.

Pozostaje pytanie, które ogłoszenie OpenAI stawia, ale którego nie podejmuje. Wewnętrzny model, który rozwiązał ponad sto otwartych problemów w mniej niż miesiąc, wywołał reakcję instytucjonalną — powołanie niezależnej, nieodpłatnej grupy doradczej, mającej swobodę wyrażania opinii — której mandat wyraźnie wyklucza tempo wewnętrznych postępów, czyli właśnie przedmiot protestu 27 medalistów Fieldsa. Kontrast z resztą dnia jest pouczający: podczas gdy trwa dyskusja o tempie osiągania spektakularnych wyników, biblioteka do tokenizacji przyspiesza od 3 do 30 razy, gwarantując identyczne identyfikatory, a metoda kompresji zapożycza rozwiązania ze szkieł spinowych, by zyskać 23 punkty MMLU przy kompresji wynoszącej 50%. Taka praca nie trafia na nagłówki, ale to ona decyduje o kosztach jutrzejszego wnioskowania.


Źródła