ai-powered-markdown-translatorArtykuł przetłumaczony z francuskiego na polski za pomocą gpt-5.6-sol.
Pięćdziesiąt jeden zapowiedzi w ciągu dwudziestu czterech godzin, obejmujących dziewięć obszarów: 25 sierpnia to najbardziej intensywny dzień tygodnia. Wyróżniają się cztery wydarzenia. OpenAI publikuje pierwsze wyniki pomiarów Jalapeño, własnego układu do inferencji, a zaraz potem rozpoczyna dziesięciodniowy hackathon poświęcony WebMCP wraz z Chrome, Cloudflare, Shopify, Vercel, Render i Netlify. Perplexity przenosi całego swojego agenta Computer na urządzenie użytkownika. IBM udostępnia Granite 4.2, swoją pierwszą rodzinę modeli rozumujących. Anthropic zaś ujednolica pamięć Claude między czatem a Cowork, umożliwiając jej przeglądanie i edytowanie plik po pliku. Pozostałe informacje — WeatherNext Cyclones wdrożony w National Hurricane Center, runda finansowania B Stability AI oraz około dwudziestu aktualizacji narzędzi — znajdują się poniżej.
WebMCP: standard, jego obsługa w produktach, wewnętrzne zastosowanie i konkurs mający zapoczątkować jego rozwój
25 sierpnia — OpenAI rozpoczyna WebMCP Challenge, dziesięciodniowy hackathon poświęcony wciąż eksperymentalnemu otwartemu standardowi, który zmienia sposób interakcji agentów z internetem. Rozwiązywany problem jest konkretny: obecnie agent, który ma wykonać zadanie w witrynie, musi odgadnąć, jak poruszać się po interfejsie zaprojektowanym dla oczu i myszy. WebMCP odwraca tę logikę — sama witryna udostępnia ustrukturyzowane narzędzia, które agent wywołuje bezpośrednio.
Sam konkurs nie jest najbardziej znaczącym aspektem tej zapowiedzi. Jest nim ujawniona przez niego zgodność kierunków: Chrome (Google), Cloudflare, Shopify, Vercel, Render i Netlify wspólnie z OpenAI wspierają ten sam standard. Widać to również w składzie jury, do którego należą Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (zespół Next.js Core, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) oraz Alex Nahas, twórca MCP-B.
The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.
🇵🇱 WebMCP Challenge wystartował. Połączyliśmy siły z @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render i @Netlify, aby zorganizować dziesięciodniowy hackathon. Do zdobycia: 35 000 dolarów w gotówce, klawiatury Codex Micro, subskrypcje ChatGPT Pro oraz inne nagrody ufundowane przez naszych partnerów. — @OpenAIDevs na X
Harmonogram jest napięty, a kryteria oceny jasno określone: użyteczność, oryginalność, wykonanie, przemyślane wykorzystanie WebMCP oraz jakość interakcji człowieka z agentem. Rejestracja i przesyłanie zgłoszeń odbywają się przez Devpost. OpenAI publikuje również natywne dla agentów aplikacje demonstracyjne, które mają pomóc w rozpoczęciu projektów — modelowanie 3D sterowane przez agenta, wspólne pisanie, w którym agent komentuje pod własną tożsamością, generator spersonalizowanych krzyżówek, Wandernote przekształcający notatki z podróży w plan wycieczki oraz eksploracja danych za pomocą DuckDB-Wasm w przeglądarce. Dozwolone jest również rozpoczęcie od istniejącej aplikacji i dodanie do niej WebMCP.
| Element konkursu | Ogłoszone szczegóły |
|---|---|
| Zapowiedziany czas trwania | 10 dni |
| Otwarcie zgłoszeń | 25 sierpnia 2026 r., 12:00 PT |
| Termin przesyłania prac | 3 września 2026 r., 13:00 PT |
| Ogłoszenie zwycięzców | 23 września 2026 r. (termin orientacyjny) |
| Łączna pula nagród | 35 000 dolarów |
| Nagroda dla laureata (top 10) | 3 000 dolarów, rok ChatGPT Pro, klawiatura Codex Micro, gadżety |
| Platforma zgłoszeniowa | Devpost |
Element produktowy, który pozwala korzystać ze standardu na co dzień, pojawia się tego samego dnia: wbudowana przeglądarka aplikacji desktopowej ChatGPT oraz ChatGPT Sites potrafią teraz obsługiwać WebMCP. Gdy ChatGPT lub Codex odwiedza zgodną witrynę, agent wykrywa narzędzia udostępnione przez stronę i używa ich automatycznie, zamiast poruszać się po interfejsie metodą prób i błędów — konieczna jest aktualizacja aplikacji desktopowej do najnowszej wersji. Druga połowa tego procesu znajduje się po stronie produkcyjnej: można teraz poprosić Codex o utworzenie aplikacji zgodnej z WebMCP, a następnie wdrożyć ją bezpośrednio w Sites. Warto zauważyć asymetrię obsługi względem Chrome, gdzie WebMCP nadal wymaga eksperymentalnej flagi lub wersji próbnej pochodzenia (origin trial), podczas gdy przeglądarka ChatGPT obsługuje go natywnie.
Pozostaje trzeci, najbardziej pouczający aspekt: OpenAI opisuje własne wewnętrzne zastosowanie. Jeden z inżynierów firmy opowiada, jak zrezygnował z pisania osobnej automatyzacji dla każdego zadania, aby stworzyć Runme — open source’ową aplikację webową z notebookami, zaprojektowaną do współpracy z Codex. Zapisuje w niej krótki cel wraz z jednoznacznymi instrukcjami — sprawdzić poprzednie wykonanie, opracować szczegółowy plan, przed rozpoczęciem poczekać na zatwierdzenie, udokumentować wykonane polecenia i ich interpretację — a Codex czyta notebook i aktualizuje go w miarę postępu prac. Na uwagę zasługują dwie decyzje architektoniczne. Po pierwsze, trwałość danych: notebooki są zapisywane w Google Drive, a Runme równolegle generuje towarzyszący indeks Markdown *.index.md, który Drive potrafi indeksować, dzięki czemu agent może odnaleźć poprzednie wykonanie i wykorzystać je jako kontekst operacyjny. Po drugie, udostępnianie możliwości: Runme jest statycznie serwowaną aplikacją kliencką, a dodanie serwera wyłącznie w celu udostępnienia klasycznego punktu dostępu MCP wprowadziłoby dodatkową infrastrukturę i przeniosło przetwarzanie danych notebooka. WebMCP pozwala aplikacji rejestrować swoje narzędzia bezpośrednio z poziomu przeglądarki.
🔗 WebMCP Challenge · Obsługa w ChatGPT desktop i Sites · Codex, Runme i WebMCP w OpenAI
Jalapeño: OpenAI publikuje pierwsze wyniki swojego układu do inferencji i otwarcie przedstawia swoją strategię compute
25 sierpnia — OpenAI publikuje pierwsze wyniki pomiarów Jalapeño, pierwszego zaprojektowanego przez siebie układu do inferencji. Znaczenie tej zapowiedzi nie wynika wyłącznie z bezwzględnego wzrostu wydajności, lecz także z charakteru kompromisu, który układ ma eliminować: istniejące systemy inferencyjne zasadniczo wymagają wyboru między przepustowością a opóźnieniem, natomiast Jalapeño ma zapewniać jedno i drugie w ramach jednej architektury.
Pomiary opierają się na InferenceX, publicznym benchmarku SemiAnalysis, który symuluje pełne przetwarzanie zapytania. Przetestowano trzy otwarte modele — GPT-OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T — w zestawieniu z systemami komercyjnymi. Decyzja o normalizacji wyników względem wata, a nie układu, jest wyraźna i dogodna: Jalapeño zużywa o połowę mniej energii niż porównywane systemy. Deklarowany pobór mocy Jalapeño wynosi 700 W, a zmierzony stały pobór podczas testowanych obciążeń nie przekraczał 550 W, wobec 1 200 W w przypadku GB200 i 1 400 W w przypadku GB300.
| Oceniany model (porównywany system) | Szczytowa przepustowość na kW | Opóźnienie od początku do końca | Minimalne TBT |
|---|---|---|---|
| GPT-OSS 120B (GB200, 1 200 W) | ≈1,9x (85 448 vs 44 960) | ≈1,7x (1,03 s vs 1,80 s) | ≈2,7x (0,69 vs 1,87 ms) |
| DeepSeek R1 670B (GB300, 1 400 W) | ≈1,7x (19 641 vs 11 781) | ≈3,6x (1,65 s vs 5,99 s) | ≈4,1x (1,43 vs 5,90 ms) |
| Kimi K2.5 1T (GB300, 1 400 W) | ≈1,5x (18 195 vs 11 862) | ≈3,4x (1,56 s vs 5,31 s) | ≈3,8x (1,44 vs 5,48 ms) |
W przypadku wszystkich trzech modeli OpenAI deklaruje od 1,5 do 1,9 raza więcej pracy AI na wat przy szczytowej przepustowości oraz od 1,7 do 3,6 raza mniejsze opóźnienie od początku do końca niż w porównywanych systemach, a także od 2,1 do 4,1 raza wyższą wydajność w przypadku wysoce interaktywnych obciążeń. Od strony technicznej korzyści wynikają ze wspólnego projektowania układu, pamięci, sieci, oprogramowania i systemu w skali całej szafy rack. Inferencja przebiega w dwóch fazach o różnych wąskich gardłach: wstępnym wypełnianiu (prefill), które przetwarza prompt i wysyca moc obliczeniową, oraz generowaniu (decode), które tworzy tokeny jeden po drugim i zależy przede wszystkim od przepustowości pamięci. Jalapeño ma minimalizować przemieszczanie danych — stan modelu, w tym cache KV, można umieścić jawnie i przechowywać lokalnie, podczas gdy system aktywuje odpowiednią kombinację zasobów obliczeniowych, pamięci i sieci zależnie od fazy.
Najciekawszy dla programisty aspekt dotyczy roli AI w projektowaniu samego układu. OpenAI informuje, że przeszło od początkowego projektu do przekazania do produkcji (tapeout) w ciągu dziewięciu miesięcy, skracając cykle projektowania, pomiarów i weryfikacji. Układ zaprojektowano jako przewidywalny cel programistyczny zarówno dla AI, jak i dla ludzi: zadania są opisywane za pomocą lokalnych tensorów, komunikacja jest jawna, a synchronizacja przewidywalna. Dzięki Codex i GPT-Astra zespół w ciągu dwóch miesięcy przeniósł trzy modele z otwartymi wagami, których nie było w pierwotnym planie produkcyjnym, a w wybranych blokach attention i mixture-of-experts modelu GPT-OSS jądra wygenerowane przez AI działają od 1,5 do 1,8 raza szybciej niż implementacje napisane przez ludzkich ekspertów. Należy zachować istotne zastrzeżenie: wyniki te dotyczą wybranych bloków, a nie całego modelu. Harmonogram pozostaje ostrożny — trwa kwalifikacja produkcyjna, oprogramowanie musi jeszcze dojrzeć, wdrożenie w infrastrukturze OpenAI zapowiedziano na koniec roku, Gen 2 znajduje się na zaawansowanym etapie rozwoju, a Gen 3 zaczyna nabierać kształtu.
Tego samego dnia Sarah Friar publikuje wpis przedstawiający ekonomiczną logikę stojącą za tym wszystkim. Opowiada się w nim za szerokim portfelem compute — którego fundament stanowią Microsoft i NVIDIA, uzupełniane przez AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy i SoftBank — przytaczając argument zarówno biznesowy, jak i techniczny: zachowanie realnego wyboru między dostawcami pozwala kierować każde obciążenie tam, gdzie stosunek wydajności do ceny jest najlepszy, oraz utrzymywać dyscyplinę cenową. Tezę uzupełnia konkretny wynik: w Artificial Analysis Coding Agent Index GPT-5.6 Sol przy maksymalnym poziomie rozumowania ustanawia nowy rekord, zużywając jednocześnie o 54% mniej tokenów wyjściowych niż inny czołowy model. Tekst otwarcie przyjmuje również paradoks Jevonsa — obniżenie kosztu inteligencji nie zmniejsza jej zużycia, lecz poszerza zakres opłacalnych zastosowań. W obszarze infrastruktury Project Camellia w Georgii przedstawiono jako obiekt z zamkniętym obiegiem wody i zobowiązaniami podlegającymi corocznemu, niezależnemu audytowi publicznemu. OpenAI zaznacza, że nadal będzie szeroko wdrażać akceleratory NVIDIA oraz innych partnerów, zarówno na potrzeby trenowania, jak i inferencji.
🔗 Jalapeño — pierwsze wyniki · Pełny stos stojący za powszechnie dostępną inteligencją
Perplexity Portable Computer: wszystko działa na urządzeniu, co potwierdzają benchmarki
25 sierpnia — Perplexity wprowadza Portable Computer, odmianę swojego agenta Computer, która działa w całości na urządzeniu użytkownika. Zmiana ma charakter bardziej architektoniczny niż kosmetyczny: lokalnie działa nie tylko model, lecz cały łańcuch orkiestracji — orkiestrator, planer, router narzędzi, harmonogram, trwała kolejka zadań i lokalny indeks wyszukiwania.
Today we’re launching Portable Computer on @NVIDIA DGX Spark.
Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.
🇵🇱 Dziś wprowadzamy Portable Computer na @NVIDIA DGX Spark. Portable Computer to w pełni lokalna wersja Perplexity Computer, w której całe środowisko wykonawcze — LLM orkiestratora, LLM subagentów oraz agent harness — działa na lokalnym sprzęcie. Bez żadnej zależności od chmury. — @perplexity_ai na X
Ogłoszenie przygotowano wspólnie z NVIDIA i początkowo dotyczy DGX Spark — platformy Grace Blackwell GB10 z 20-rdzeniowym procesorem Arm, GPU NVIDIA oraz 128 GB pamięci zunifikowanej — przy czym zapowiedziano rozszerzenie obsługi na komputery wyposażone w GPU RTX. Do wyboru są dwa modele: Qwen 3.8 27B lub PPLX 27B, czyli wersja modelu Qwen poddana przez Perplexity post-treningowi, a do selektora ma dołączyć NVIDIA Nemotron 3.5 Lightning, otwarty model 30B. Zadania przetwarzane lokalnie nie zużywają żadnych kredytów. Eskalacja do chmury pozostaje możliwa — w celu uzyskania aktualnych informacji, skorzystania z przeglądarki, połączonych aplikacji albo jednego z ponad 15 modeli frontier — ale wymaga wyraźnej zgody użytkownika. Konektory Google Drive, Gmail, Slack i GitHub działają z poziomu urządzenia, dyktowanie odbywa się lokalnie za pomocą NVIDIA Nemotron 3.5 ASR Model, bez opuszczania urządzenia przez dźwięk, a kod jest wykonywany w izolowanym środowisku (sandbox). Portable Computer jest dostępny dla subskrybentów Pro i Max posiadających DGX Spark, początkowo w systemie Linux, a następnie Windows, z instalacją jednym kliknięciem z poziomu aplikacji.
Tego samego dnia zespół inżynieryjny publikuje dane dokumentujące tę premierę. Teza brzmi, że model i harness muszą być projektowane wspólnie: ogólne harnessy zakładają wykorzystanie modelu frontier zdolnego przetwarzać długi kontekst i planować z dużym wyprzedzeniem, z czym modele lokalne radzą sobie słabo.
| Zmierzony benchmark | Computer (Qwen 3.8 27B) | Pi | Hermes | Computer + PPLX 27B |
|---|---|---|---|---|
| Local Knowledge Work Bench (53 zadania) | 82,6 % | 77,6 % | 74,0 % | 85,4 % |
| BrowseComp (1 266 zadań) | 66,7 % | 50,2 % | 43,9 % | — |
| ParseBench-100 (dokumenty multimodalne) | 65,1 % | 13,9 % | 34,6 % | — |
W BrowseComp Computer zużywa przy tym o 61% mniej czasu i 16% mniej tokenów niż Hermes oraz o 51% mniej czasu i 70% mniej tokenów niż Pi. Różnicę wyjaśniają cztery decyzje projektowe: minimalny prompt systemowy, możliwości podzielone na modułowe skills, które są wczytywane i usuwane w miarę przebiegu zadania, często używane konektory (Gmail, GitHub, Outlook, Google Calendar) przekształcone w kompaktowe narzędzia wiersza poleceń zamiast udostępniania ich jako serwery MCP, których definicje pochłaniają kontekst, oraz zawsze aktywny, niekonfigurowalny sandbox — jeśli jest niedostępny, harness wyłącza się przed jakimkolwiek wywołaniem narzędzia, zamiast przechodzić do wykonania bez izolacji. Perplexity zwraca również uwagę na przydatną obserwację praktyczną: Qwen 3.8 27B deklaruje okno kontekstowe o długości 260K tokenów, ale w praktyce zaczyna mieć trudności po przekroczeniu 100K.
| Terminal Bench 2.1 (89 zadań) | Wynik | Koszt API na wykonanie |
|---|---|---|
| Qwen 3.8 27B, 100% lokalnie | 59,6 % | około 0 |
| Qwen 3.8 27B + porada Claude Opus 5 | 73,0 % | 0,415 USD |
| Tylko Claude Opus 5 | 82,4 % | 0,65 USD |
Mechanizm eskalacji do modelu doradczego (advisor) jest najciekawszym punktem raportu: pozwala odzyskać około trzech piątych różnicy względem modelu frontier za mniej więcej dwie trzecie jego kosztu, a decyzja pozostaje w rękach użytkownika. Przed każdym wywołaniem harness wybiera odpowiedni kontekst, stosuje klasyfikator danych osobowych i pokazuje użytkownikowi, co opuściłoby urządzenie; model doradczy zwraca wyłącznie tekst i nie ma bezpośredniego dostępu do plików ani narzędzi. Post-trening PPLX 27B łączy natomiast dostrajanie przez odrzucanie (rejection fine-tuning) z uczeniem ze wzmocnieniem w syntetycznych środowiskach uruchamianych w kontenerach Docker, bez użycia jakichkolwiek rzeczywistych danych użytkowników. Zapowiedziano raport techniczny oraz udostępnienie benchmarku ewaluacyjnego jako open source.
🔗 Benchmarki lokalnego harnessu · Portable Computer — wpis Perplexity
Claude: jedna pamięć dla czatu i Cowork, możliwa do przeglądania plik po pliku
25 sierpnia — Anthropic usuwa granicę między dwiema pamięciami, które dotąd funkcjonowały równolegle. To, co Claude zapamiętuje z rozmów na czacie, jest teraz dokładnie tym, czym dysponuje w Claude Cowork — i odwrotnie. W praktyce, gdy Cowork wykonuje zadanie w chmurze, rozpoczyna je z kontekstem gromadzonym przez wiele miesięcy: priorytetami na dany kwartał, stanem realizacji projektów czy preferencjami konkretnej osoby dotyczącymi sposobu pisania. Anthropic podaje celowo przyziemne przykłady — można poprosić o przygotowanie informacji o postępach dla przełożonego bez konieczności wyjaśniania, o kogo chodzi ani w jaki sposób ta osoba lubi otrzymywać informacje.
Druga zmiana jest mniej widoczna, ale wpływa na codzienne działanie: pamięć aktualizuje się w trakcie rozmowy, a nie na podstawie podsumowania tworzonego po jej zakończeniu. Wystarczy wspomnieć, że termin został przesunięty na wrzesień, aby następna rozmowa uwzględniła tę zmianę. Polecenie „zapamiętaj to” nadal pozwala wymusić zapis konkretnej informacji, a pamięć można w dowolnej chwili wstrzymać lub zresetować.
W kwestii przejrzystości Anthropic wybrał czytelną reprezentację zamiast czarnej skrzynki: wszystko, co zapamiętuje Claude, pojawia się jako krótkie pliki uporządkowane tematycznie w sekcji Ustawienia, a następnie Pamięć. Każdy z nich można przeczytać, poprawić lub usunąć. Praktyczna korzyść jest natychmiastowa — wystarczy poprawić dawną nazwę swojej firmy w jednym pliku, aby wszystkie kolejne rozmowy używały właściwej.
Sposób traktowania tematów wrażliwych jest najciekawszym elementem z perspektywy decyzji produktowych. Domyślnie Claude nie zapamiętuje informacji dotyczących zdrowia, pochodzenia, przynależności etnicznej, przekonań religijnych, poglądów politycznych ani tożsamości płciowej. Anthropic przyznaje jednak, że granica ta ma charakter osobisty, i oferuje opcjonalne ustawienie pozwalające uwzględniać te tematy — dzięki temu Claude może pamiętać o nietolerancji glutenu podczas proponowania przepisów. Ustawienie nie działa wstecz i można je w każdej chwili wyłączyć. Jedna kategoria pozostaje wykluczona niezależnie od ustawień: numery identyfikacyjne, przeszłość kryminalna, status migracyjny i, szerzej, wszystko, co narusza Zasady dopuszczalnego użytkowania. Claude wyraźnie informuje, kiedy nie może zapisać tego rodzaju informacji — jest to decyzja projektowa przedkładająca jawne odrzucenie nad ciche filtrowanie.
| Aspekt pamięci | Opisane działanie |
|---|---|
| Zakres | Jedna pamięć współdzielona między czatem a Claude Cowork |
| Moment aktualizacji | W trakcie rozmowy, zamiast wcześniejszego podsumowania po jej zakończeniu |
| Format przechowywania | Krótkie pliki uporządkowane tematycznie, które można pojedynczo czytać i edytować |
| Tematy wrażliwe | Domyślnie niezapamiętywane, możliwe do włączenia w ustawieniach, bez działania wstecz |
| Stałe wykluczenia | Numery identyfikacyjne, przeszłość kryminalna, status migracyjny |
| Plany Free, Pro i Max | Pamięć domyślnie aktywna w przeglądarce, aplikacji komputerowej i mobilnej |
| Plany Team i Enterprise | Udostępniana przez administratora, wyłączona dla użytkownika do czasu aktywacji |
🔗 Pamięć Claude działa wszędzie · Ogłoszenie @claudeai
IBM otwiera Granite 4.2, swoją pierwszą rodzinę modeli rozumujących, oraz dwa modele ASR 470M
25 sierpnia — IBM publikuje Granite 4.2, przedstawianą jako pierwsza rodzina gęstych modeli językowych tej firmy, opartych wyłącznie na dekoderze i zaprojektowanych bezpośrednio z myślą o rozumowaniu. Podczas gdy poprzednie generacje koncentrowały się na wydajności i klasycznych zadaniach biznesowych, ta wersja stawia rozumowanie w centrum i pozwala dostosować jego intensywność: każdy model oferuje trzy tryby — thinking, non-thinking i low-effort — wybierane przez aplikację zależnie od akceptowanego budżetu opóźnienia i tokenów. Wszystkie trzy rozmiary (3B, 8B, 30B) korzystają z tej samej architektury i tego samego pipeline’u, dzięki czemu przechodzenie między nimi nie sprawia problemów po stronie integracji.
Architektura pozostaje klasyczna: GQA z 40 głowami attention i 8 głowami KV, RoPE z θ równym 10 milionów w celu obsługi kontekstu o długości 131 072 tokenów, MLP SwiGLU, normalizacja RMSNorm oraz trening w bfloat16 na klastrze NVIDIA GB200 NVL72 hostowanym przez CoreWeave. Pre-trening rozpoczyna się od zera i obejmuje około 15 bilionów tokenów podzielonych na pięć etapów. Granite 4.2 wyróżnia się przede wszystkim post-treningiem: zastosowano pipeline uczenia ze wzmocnieniem składający się z szeregu wyspecjalizowanych etapów zamiast jednego przebiegu, z asynchronicznym GRPO i obciętym próbkowaniem ważności, dzięki czemu części pętli odpowiedzialne za generowanie i trening nigdy wzajemnie się nie blokują. Program obejmuje kolejno trzy przebiegi RLVR z weryfikowalnymi nagrodami, ukierunkowane moduły wzmacniające wykonywanie instrukcji i kodowanie, dwa etapy software engineering z kontekstem 128K, etap pracy w terminalu, etap wyszukiwania, a następnie dostrajanie RLHF. Blok agentowego uczenia ze wzmocnieniem jest stosowany wyłącznie w modelach 8B i 30B, co wyjaśnia różnicę w wydajności kodowania agentowego między modelem 3B a jego większymi odpowiednikami.
| Benchmark opublikowany przez IBM | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| SWE-Bench Verified | — | 47,67 | 57,00 |
| SWE-Bench Multilingual | — | 30,78 | 41,89 |
| Terminal-Bench 2.1 | — | 20,56 | 29,24 |
| τ³-bench | 45,78 | 58,06 | 62,00 |
| AIME25 | 78,33 | 86,67 | 89,17 |
| GPQA | 54,80 | 64,14 | 66,41 |
| LiveCodeBench v6 | 69,71 | 73,24 | 75,77 |
| MMLU-Pro | 67,84 | 74,04 | 77,60 |
| RULER 128K | 55,30 | 71,41 | 81,38 |
Publikacja nie ogranicza się do wag bfloat16: premierze towarzyszą cztery skwantyzowane warianty dla vLLM — dynamiczny FP8 na kanał bez kalibracji oraz NVFP4 i MXFP4 za pośrednictwem GPTQ skalibrowanego na 2 000 próbek SFT — a także czternaście formatów GGUF dla llama.cpp, od Q2_K do Q8_0. Obsługiwanych jest dwanaście języków, w tym francuski, a od pierwszego dnia udokumentowano trzy harnessy do kodowania agentowego: OpenCode, Pi i OpenHands. W kwestii jakości danych IBM opisuje proces, w którym GPT-OSS-120B i Gemma 4 pełnią funkcję sędziów oceniających próbki SFT przed lokalną i globalną deduplikacją przy użyciu skrótów SHA-256.
Tego samego dnia IBM publikuje Granite Speech 5.0 Turbo CTC, dwa anglojęzyczne modele rozpoznawania mowy o 470 milionach parametrów, które różnią się wyłącznie danymi treningowymi i licencją — Apache 2.0 dla wariantu standardowego oraz CC-BY-NC-SA-4.0 dla wariantu wytrenowanego na dodatkowych danych. Zmiana architektury jest znacząca: wcześniejsze Granite Speech łączyły enkoder akustyczny, projektor i LLM, natomiast nowe modele składają się wyłącznie z enkodera. Stos obejmuje 16 bloków Conformer, stosuje samokondycjonowanie na wyjściu ósmego bloku, zastępuje attention oparte na iloczynie skalarnym attention blokowym (chunkwise), aby uniknąć kwadratowego wzrostu kosztu obliczeń, oraz bezpośrednio optymalizuje funkcję straty CTC. Prawdziwą nowością jest częstotliwość tokenów: operacje podpróbkowania zmniejszają strumień ze 100 ramek na sekundę na wyjściu spektrogramu log-Mel do 12,5 na sekundę, co wyjaśnia określenie „Turbo” w nazwie. Wyniki przedstawiono w OpenASR Leaderboard oraz FFASR Leaderboard dla dalekiego pola, wykorzystując wykresy Pareto szybkości i dokładności zamiast pojedynczych wyników, a także demonstrację ciągłego rozpoznawania uruchamianą w przeglądarce za pośrednictwem WebGPU, ograniczoną do Chrome i Edge.
🔗 Granite 4.2 — omówienie techniczne · Granite Speech 5.0 Turbo CTC
WeatherNext Cyclones, pierwszy model AI używany w czasie rzeczywistym przez National Hurricane Center
25 sierpnia — Google AI przedstawia szczegóły dotyczące WeatherNext Cyclones, modelu prognozowania cyklonów tropikalnych opracowanego przez Google DeepMind i Google Research. Ogłoszenie jest godne uwagi nie tyle ze względu na samą wydajność, ile na to, co mówi o przejściu meteorologicznej AI z laboratorium do zastosowań operacyjnych.
Rozwiązywany problem ma charakter strukturalny. Dotychczas śledzenie cyklonu wymagało kompromisu: modele fizyczne działające na superkomputerach dobrze odwzorowują rozległe struktury atmosferyczne przemieszczające się nad planetą, ale zrozumienie lokalnych i gwałtownych zjawisk fizycznych decydujących o sile burzy wymagało przejścia na zupełnie inne modele regionalne. WeatherNext Cyclones eliminuje tę konieczność, przewidując w ramach jednego procesu trajektorię, intensywność i rozmiar.
Zapowiadany zysk to pełna doba wyprzedzenia względem wcześniejszych systemów. Google ujmuje porównanie obrazowo: prognozy trzydniowe osiągają obecnie dokładność dawnych prognoz dwudniowych, co historycznie wymagało dekady postępów metodologicznych. Drugą korzyścią jest podejście probabilistyczne: model działa na tyle szybko, że może wygenerować do 1 000 symulacji dla każdej burzy, zastępując pojedynczą „najbardziej prawdopodobną” trajektorię wachlarzem scenariuszy. Ułatwia to interpretację gwałtownej intensyfikacji, definiowanej jako wzrost maksymalnej prędkości utrzymującego się wiatru o co najmniej 30 węzłów w ciągu 24 godzin. W tym roku za pośrednictwem WeatherLab prognostycy otrzymują 1 000 probabilistycznych prognoz dla każdej burzy.
Najważniejszym elementem pozostaje rzeczywiste wdrożenie. Podczas sezonu huraganowego w 2025 roku WeatherNext Cyclones został poddany próbie w amerykańskim National Hurricane Center — po raz pierwszy instytucja ta wykorzystała modele AI w działaniach prowadzonych w czasie rzeczywistym. Meteorolodzy użyli go do przygotowania prognozy uderzenia huraganu Melissa w Jamajkę jako huraganu kategorii 5, zapewniając lokalnym władzom dodatkowy czas na przygotowania. Artykuł ukazał się w Nature, a Google zapowiada opublikowanie kodu i wag modelu jako open source na GitHubie.
| Aspekt modelu | Wkład WeatherNext Cyclones |
|---|---|
| Prognozowane wielkości | Trajektoria, intensywność i rozmiar w jednym przebiegu |
| Zysk wyprzedzenia | Jeden dzień; prognoza 3-dniowa = dokładność dawnej prognozy 2-dniowej |
| Symulacje na burzę | Do 1 000 |
| Wdrożenie operacyjne | U.S. National Hurricane Center, sezon huraganowy 2025 |
| Udokumentowany przypadek użycia | Uderzenie huraganu Melissa kategorii 5 w Jamajkę |
| Próg intensyfikacji | Ponad 30 węzłów maksymalnej prędkości utrzymującego się wiatru w ciągu 24 godzin |
| Sposób udostępnienia | WeatherLab; kod i wagi jako open source na GitHubie |
🔗 Ogłoszenie @GoogleAI · Wpis Google DeepMind
Stability AI zamyka rundę Series B o wartości 76 milionów dolarów z udziałem EA, Sony Music, Universal i Warner
25 sierpnia — Stability AI ogłasza zamknięcie rundy Series B: 76 milionów dolarów nowego kapitału, dzięki czemu łączne finansowanie od czasu przejęcia kierownictwa firmy przez Prema Akkaraju w czerwcu 2024 roku wzrosło do 232 milionów dolarów, wliczając w to dwie rundy kapitałowe i obligacje zamienne. Kwota pozostaje skromna jak na skalę sektora, ale prawdziwym tematem jest skład grona inwestorów.
Do akcjonariatu dołączają czterej giganci branży rozrywkowej: Electronic Arts z sektora gier wideo oraz Sony Music Group, Universal Music Group i Warner Music Group z branży muzycznej. Trzy największe wytwórnie płytowe są teraz akcjonariuszami tego samego laboratorium. Dołączają do nich AMD Ventures i Pacific Alliance Ventures. Inwestorzy ci nie pojawili się znikąd: EA, Universal i Warner byli już strategicznymi partnerami Stability AI od jesieni 2025 roku. Runda przekształca więc istniejące umowy handlowe w udziały kapitałowe.
Kolejnym sygnałem jest lojalność inwestorów finansowych. Coatue, Greycroft, Kadmos Capital, Sean Parker i Eric Schmidt ponownie dokładają środki w drugiej z rzędu rundzie pod nowym kierownictwem — co po burzliwym okresie, przez który Stability AI przechodziło w latach 2023 i 2024, stanowi potwierdzenie zaufania. Thomas Laffont, współzałożyciel Coatue, dołącza do rady dyrektorów, w której zasiadają już James Cameron, Sean Parker, Dana Settle i Prem Akkaraju.
This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.
🇵🇱 Ta niezrównana grupa inwestorów potwierdza naszą wizję generatywnej AI, która zapewnia możliwości każdemu producentowi, muzykowi i autorowi opowieści. Stability jest wyjątkowe w dziedzinie AI, ponieważ jesteśmy twórcami tworzącymi narzędzia dla twórców. — Prem Akkaraju, CEO Stability AI, komunikat z 25 sierpnia
Przyjęta strategia zakłada działalność jako wyspecjalizowane laboratorium: bez modelu ogólnego przeznaczenia, za to z narzędziami dla profesjonalistów z branży kreatywnej, budowanymi wspólnie z właścicielami praw, a nie przeciwko nim. Dokładnie taki kierunek reprezentuje Stable Audio 3.0 — rodzina modeli z otwartymi wagami trenowana wyłącznie na w pełni licencjonowanych danych, rozszerzona 18 sierpnia o plugin do cyfrowych stacji roboczych audio. Środki mają finansować dalszy rozwój produktów, badania stosowane i dział usług profesjonalnych.
ChatGPT dla firm: plugin Admin, rozszerzenie dla wielu przeglądarek i stanowisko Premium za 100 dolarów
25 sierpnia — Trzy ogłoszenia OpenAI są skierowane do tej samej grupy odbiorców: organizacji wdrażających ChatGPT i Codex na dużą skalę.
Najbardziej znaczącą nowością jest plugin Admin dla ChatGPT Work i Codex, który skupia w jednej rozmowie funkcje dotychczas wymagające przechodzenia między panelami analytics, ekranami ustawień i raportami. Zakres obejmuje codzienne zadania: analizowanie adopcji i zużycia kredytów, wykrywanie członków lub grup zbliżających się do limitów, zarządzanie dołączaniem i odchodzeniem pracowników, sprawdzanie faktycznie obowiązujących uprawnień i diagnozowanie problemów z dostępem, dostosowywanie limitów użytkowania oraz rozpatrywanie wniosków o wydatki poprzez zestawienie ich z rzeczywistym zużyciem. Najciekawszym elementem jest automatyzacja bez pisania kodu: oczekujące wnioski o zwiększenie użycia mogą być kierowane do Slacka lub Microsoft Teams w celu zatwierdzenia w narzędziu, z którego osoby zatwierdzające już korzystają, a wnioski o dostęp do funkcji mogą być akceptowane automatycznie, jeśli spełniają określone wcześniej kryteria, przy czym wyjątki są przekazywane człowiekowi. Kluczowa kwestia dotycząca bezpieczeństwa: plugin działa w ramach istniejącej roli i uprawnień użytkownika i nie rozszerza żadnego dostępu, a każda instrukcja jest mapowana na obsługiwaną czynność odczytu lub zapisu ze zwracanym wynikiem strukturalnym. OpenAI przytacza własne zastosowanie — agent ChatGPT Work w Slacku obsługuje wewnętrzne wnioski IT, a wdrożone przepływy pracy rozwiązują około 45% zgłoszeń, eliminując zaległości mimo mniej więcej dwukrotnego wzrostu liczby zgłoszeń do wsparcia.
Drugie ogłoszenie: rozszerzenie przeglądarkowe ChatGPT wychodzi poza Chrome i obsługuje Microsoft Edge, Brave, Operę oraz Vivaldi. Zmiana ma znaczenie dla osób korzystających z alternatywnej przeglądarki ze względu na ochronę prywatności lub wymogi firmowe. Podkreślono dwa zastosowania: przekazywanie kontekstu otwartych kart do zadania za pomocą wzmianki @ tab w ChatGPT Desktop, dzięki czemu Codex pracuje na podstawie już wyświetlonej dokumentacji lub zgłoszenia; oraz umożliwienie agentowi sterowania przeglądarką w celu wykonywania konkretnych zadań internetowych, wśród których jako przykład wymieniono anulowanie subskrypcji.
Trzecie ogłoszenie jest bardziej lakoniczne: do oferty ChatGPT Business dołącza stanowisko Premium za 100 dolarów, przeznaczone dla małych firm i startupów, z planem przedstawianym jako elastyczny i skalowalny zależnie od wielkości zespołu. Ogłoszenie opublikowano na X bez szczegółowego wpisu na blogu, a dokładny zakres stanowiska nie został sprecyzowany w wiadomości.
🔗 Plugin Admin · Rozszerzenie dla wielu przeglądarek · Stanowisko Premium ChatGPT Business
NVIDIA: Gamescom dla RTX Spark oraz SANA zmniejszająca opóźnienie MiniMax H3 27-krotnie
25 sierpnia — NVIDIA wykorzystuje odbywające się w tym tygodniu w Kolonii targi Gamescom, aby rozszerzyć katalog RTX Spark, swojej platformy komputerów PC z Windows, której premiera jest oczekiwana tej jesieni. Electronic Arts, Embark Studios i Ubisoft dołączają do KRAFTON, NetEase, Riot Games i XBOX, które zadeklarowały zaangażowanie już podczas COMPUTEX w maju. Wymienione tytuły reprezentują zróżnicowane wymagania techniczne: EA SPORTS F1 25 i Apex Legends od EA, Anno 117: Pax Romana od Ubisoftu oraz ARC Raiders i THE FINALS od Embark Studios.
Najbardziej konkretny punkt dotyczy systemów anti-cheat. Samo uruchomienie gry nie wystarczy: duże tytuły online zależą od systemów anti-cheat, które muszą zostać przeniesione na każdą platformę, w przeciwnym razie gra pozostaje niegrywalna w trybie wieloosobowym. NVIDIA ogłasza współpracę z EA nad natywnym udostępnieniem EA Javelin Anticheat na RTX Spark — jest to ten rodzaj szczegółu infrastrukturalnego, który decyduje o rzeczywistym przyjęciu nowej platformy PC. W obszarze renderowania DLSS 4.5 Ray Reconstruction jest dostępny od razu, z modelem transformer drugiej generacji zastępującym klasyczne narzędzia do odszumiania siecią trenowaną na superkomputerze. Path tracing pojawi się w CONTROL Resonant i 007 First Light, Gears of War: E-Day integruje RTX Mega Geometry, a technologie NVIDIA ACE zapowiedziano w Aniimo na początek 2027 roku.
Druga strona działalności tej samej firmy, przedstawiona 24 sierpnia, ma bardziej techniczny charakter. MiniMax przekazuje wyniki uzyskane przez zespół SANA firmy NVIDIA przy zastosowaniu Sol Engine do modelu wideo H3: czas generowania dziesięciu sekund materiału w rozdzielczości 768p na pojedynczym GB200 skrócono z 414 sekund do 14,93 sekundy, co oznacza przyspieszenie 27,7-krotne. Metoda nie opiera się na optymalizacji kerneli, lecz na podziale generowania na dwa przebiegi — szkic w niskiej rozdzielczości tworzony przez H3 w 4 krokach, a następnie przebieg udoskonalający w rozdzielczości docelowej wykonywany przez LTX w 3 krokach z Sol-Attn. Łącznie siedem kroków. Drugim mechanizmem jest zastąpienie kosztownego dekodowania VAE przez TAEH3 i TAEHV, czyli odchudzone dekodery, przy jednoczesnym zachowaniu stabilności reprezentacji ukrytych na potrzeby przebiegu udoskonalającego.
| Pomiar dla MiniMax H3 | Zmierzona wartość |
|---|---|
| Zmierzone obciążenie | 10 s wideo w 768p, pojedynczy GB200 |
| Opóźnienie przed zmianą | 414 s |
| Opóźnienie po zmianie | 14,93 s |
| Współczynnik przyspieszenia | 27,7x |
| Kroki generowania | 4 (szkic H3 w niskiej rozdzielczości) + 3 (LTX) |
| Zastąpione dekodery | TAEH3 i TAEHV zamiast dekodowania VAE |
| Prognozowana przepustowość węzła | 378 000 filmów miesięcznie, ponad 97% marży GPU |
Prognozowana przepustowość jest szacunkiem MiniMax, a nie pomiarem produkcyjnym, i należy ją tak interpretować. Kierunek jest jednak jasny: przy piętnastu sekundach generowania dziesięciu sekund materiału generowanie wysokiej jakości wideo przestaje być asynchronicznym renderowaniem wsadowym i staje się infrastrukturą niemal interaktywną.
🔗 NVIDIA na Gamescom · SANA i Sol Engine dla H3
Chińskie modele otwarte stają się punktem odniesienia w badaniach, a Qwen3.8-27B wchodzi do pierwszej dziesiątki Code Arena
25 sierpnia — Qwen przekazuje dwa wyniki tego samego poranka, a drugi nadaje znaczenie pierwszemu.
Pierwszym jest ranking. Qwen3.8-27B debiutuje w rankingu Code Arena: WebDev, który ocenia modele pod kątem generowania interfejsów internetowych, zajmując 9. miejsce w klasyfikacji ogólnej z wynikiem 1595 punktów. Jest jedynym modelem w swojej kategorii wielkości w pierwszej dziesiątce i znajduje się zaledwie sześć pozycji za znacznie większym Qwen3.8-Max. Arena podkreśla, że wyznacza on na nowo granicę Pareto rankingu, i podaje wymowny punkt odniesienia: Gemma 4-31B, model o porównywalnej wielkości, lecz wydany w kwietniu, zajmuje 80. miejsce.
| Oceniany model | Pozycja w Code Arena: WebDev | Uzyskane punkty | Uwaga w rankingu |
|---|---|---|---|
| GLM-5.3 (Max) | 8. miejsce ogółem | 1597 | Stan na 20 sierpnia, 2. wśród modeli otwartych |
| Qwen3.8-27B | 9. miejsce ogółem | 1595 | Jedyny model tej wielkości w pierwszej dziesiątce |
| Qwen3.8-Max | Sześć pozycji przed 27B | b.d. | Znacznie większy model z tej samej rodziny |
| Gemma 4-31B | 80. miejsce ogółem | b.d. | Wydany w kwietniu 2026 |
Drugim wynikiem jest pomiar wykorzystania. Nathan Lambert, który współkierował projektem Olmo w Ai2, zlecił Codexowi przeanalizowanie 500 000 artykułów z arXiv dotyczących AI i uczenia maszynowego, opublikowanych od premiery ChatGPT, aby ustalić, które modele otwarte są rzeczywiście wykorzystywane w badaniach. Odwrócenie trendu można ująć w dwóch liczbach: w 2024 roku około 30% artykułów wspominało amerykański model otwarty, a 10% model chiński; obecnie około 40% cytuje chiński otwarty LLM, a tylko 25–30% amerykański.
| Rodzina modeli | Odsetek artykułów cytujących LLM |
|---|---|
| OpenAI (modele zamknięte) | około 37% |
| Qwen | około 33% |
| Gemini, Claude | 10–15% |
| Gemma, Mistral | 5–10% |
| Olmo | około 1% |
W szczegółowym ujęciu Qwen jest wspominany w jednej trzeciej artykułów cytujących jakikolwiek LLM. Llama osiągnęła szczyt na poziomie 30% około kwietnia 2025 roku, dokładnie w momencie premiery Llama 4, i od tego czasu traci udział. Sam Lambert wskazuje istotne ograniczenie: publikacje pozostają w tyle za premierami modeli, ponieważ badania wymagają czasu — liczby te opisują stan trwających prac, a nie aktualne preferencje. Równolegle widoczny jest głębszy trend, niezależny od rywalizacji modeli otwartych i zamkniętych: odsetek artykułów o AI wspominających LLM wzrósł z 10,43% w styczniu 2023 roku do ponad 50% w 2026 roku.
🔗 Qwen3.8-27B w Code Arena · Udostępniona przez Qwen analiza arXiv · Analiza @natolambert
Claude Code przechodzi na wersję 2.1.245, a renderowanie Claude w przeglądarce staje się 4 razy płynniejsze
W tym okresie ukazały się dwie wersje Claude Code, a ich zawartość jest wyraźnie ukierunkowana na wdrożenia w organizacjach. CHANGELOG nie zawiera dat, ale wskazuje je historia Git: wersja 2.1.243 pojawia się w commicie z 24 sierpnia o 23:40 UTC, a 2.1.245 w commicie z 25 sierpnia o 05:13 UTC.
| Dodane ustawienie | Wersja, której dotyczy | Praktyczne znaczenie |
|---|---|---|
modelPricing | 2.1.243 | Stawki umowne w /cost, pasku stanu i telemetrii |
modelPicker | 2.1.243 | Uporządkowana i opisana lista modeli dla /model |
promptCacheTtl / subagentPromptCacheTtl | 2.1.243 | Godzinny cache promptu dla konwersacji, 5 min dla subagentów |
Podział Loops w /usage | 2.1.243 | Wykrywanie wymykających się spod kontroli zadań /loop |
| Logowanie bez klucza przez Console | 2.1.243 | Organizacje zabraniające używania kluczy API |
| Poprawka dla glibc 2.44 | 2.1.245 | Awaria przy uruchamianiu na Arch Linux, CachyOS i Fedora Rawhide |
Najbardziej fundamentalnym ustawieniem jest modelPricing: dotychczas wyświetlane koszty były obliczane według publicznych stawek, natomiast teraz organizacja może wprowadzić własne stawki umowne dla poszczególnych modeli oraz współczynnik rabatu, dzięki czemu dane te można bezpośrednio wykorzystać do wewnętrznych rozliczeń. Para promptCacheTtl i subagentPromptCacheTtl rozwiązuje konkretny kompromis ekonomiczny dla użytkowników korzystających z klucza API: godzinny cache jest zachowywany dla głównej konwersacji, w której kontekst pozostaje stabilny, podczas gdy dla subagentów wynosi pięć minut, ponieważ ich konteksty są bardziej zmienne. Jeśli chodzi o poprawki, zdalne serwery MCP w trybie nieinteraktywnym nie pozostają już zablokowane po utracie połączenia, /resume nie ogranicza się już do pięćdziesięciu najnowszych sesji, a sesje nieaktywne przez ponad dziesięć minut wygasają teraz po około trzech minutach, po czym następuje ponowna próba i pojawia się jednoznaczny błąd.
24 sierpnia Anthropic poinformował ponadto o przepisaniu mechanizmu wyświetlającego odpowiedzi w trakcie generowania w internetowej i desktopowej wersji Claude. Zasada jest klasyczna dla renderowania interfejsów: aktualizować wyłącznie to, co nadal się zmienia, zamiast przerysowywać całą odpowiedź po każdym nowym fragmencie. W przypadku długiej odpowiedzi różnica ma charakter strukturalny — koszt renderowania przestaje rosnąć wraz z długością już wyświetlonego tekstu. Deklarowane korzyści są spójne: około 4 razy większa płynność, 9 razy mniej zacięć na komputerze przenośnym o niewielkiej mocy, najdłuższe zawieszenie interfejsu krótsze 4,5 raza oraz utrzymanie 120 klatek na sekundę od początku do końca na MacBooku z ekranem 120 Hz. Interesująca jest grupa docelowa: najwięcej zyskują słabsze konfiguracje.
🔗 CHANGELOG Claude Code · Renderowanie 4 razy płynniejsze, @ClaudeDevs
Agenci programistyczni wchodzą na skalę przemysłową: Warp publikuje format swoich factories, a Rohlik zleca agentom pisanie 90% kodu
24 sierpnia pod koniec dnia — Warp ujawnia wewnętrzny mechanizm Warp Factories, swojej platformy agentów chmurowych zapowiedzianej 18 sierpnia: przyjęty format konfiguracji oraz uruchomienie wczesnego dostępu. Punkt wyjścia został przedstawiony wprost — Warp przenosi własnych agentów poza komputery lokalne ze względów jakościowych i kosztowych, dlatego potrzebował sposobu opisywania środowisk, harnessów i uprawnień bezpieczeństwa jako wersjonowanego kodu.
| Element konfiguracji | Przyjęta wartość |
|---|---|
| Plik definicji | factory.yaml, schemaVersion: v1alpha1 |
| Główne klucze | name, repositories (owner / name), agentDefaults.model |
| Definicja agenta | agents/<nom>/agent.md z agentType (FOREMAN, REVIEW…) i model |
| Wyzwalacze | automations/<nom>/automation.md: agent, triggers (dostawca, zdarzenie) |
| Dostępne interfejsy | CLI (warp agent run-cloud), REST API, TypeScript SDK, serwer MCP |
| Wczesny dostęp | Do 10 000 USD bezpłatnego wykorzystania dla kwalifikujących się klientów |
To interesujący podział: agenci nie są opisywani w jednym pliku YAML, lecz w osobnych plikach Markdown, dzięki czemu definicja agenta staje się czytelnym dokumentem, którego zmiany można łatwo porównywać. Warp stosuje tę receptę u siebie — jego wewnętrzna factory o nazwie „wilson” obejmuje repozytoria takie jak warp-server czy warp-terraform, deklaruje sekrety i serwery MCP oraz porządkuje agentów według ról (code-review, foreman, implementation, spec, triage) w 34 wierszach. Liczby podane na stronie zgłoszenia do programu wczesnego dostępu są argumentami marketingowymi, których nie można zweryfikować z zewnątrz: 200 000 uruchomień agentów dziennie, ponad 30% pull requestów scalanych bez poprawek oraz koszt jednego pull requesta niższy o 20%.
25 sierpnia Cognition opublikował z kolei studium przypadku znacznie lepiej udokumentowane niż poprzednie. Rohlik Group to internetowy sprzedawca artykułów spożywczych założony w Czechach, działający w pięciu krajach i przynoszący zyski, którego przychody w ubiegłym roku przekroczyły 1,3 miliarda dolarów; dostarcza pełne cotygodniowe zakupy obejmujące wybór spośród 17 000 produktów w czasie krótszym niż godzina lub w piętnastominutowych przedziałach czasowych. Kluczowa liczba w artykule: około 90% kodu jest tam obecnie generowane przez agentów, a organizacja inżynieryjna określa się jako „agent-mostly”.
Nie jest to rezultat osiągnięty przez samo podłączenie narzędzia. Rohlik twierdzi, że rozpoczął rok temu od pierwszego eksperymentu z Devinem, którego uznano za pełnego błędów. Sytuację zmieniły fundamenty stworzone po stronie klienta: ponad pięćdziesiąt wewnętrznych i zewnętrznych integracji MCP, zgodnie z zasadą, że każde nowe narzędzie musi być dostępne dla agentów od pierwszego dnia, warstwa semantyczna nad hurtownią danych Snowflake oraz baza wiedzy zapewniająca agentom kontekst, który przekazano by nowemu współpracownikowi. Zadania trafiają do Devina z miejsca, w którym powstają — z rozmowy na Slacku dotyczącej błędu lub z dokumentu specyfikacji w Linear — i są prowadzone aż do pull requesta. Deklarowane wyniki — podwojenie przepustowości prac inżynieryjnych od listopada, integracja robotyki AutoStore dostarczona w osiem miesięcy zamiast typowych dla branży dwóch–trzech lat oraz skrócenie prototypowania z miesiąca do jednego dnia — pozostają twierdzeniami ze strony klienta opublikowanej przez dostawcę. Najbardziej wymowny efekt leży gdzie indziej: najlepsi inżynierowie poświęcają obecnie 80% czasu na przeglądanie kodu, a około 30% wykorzystania Devina w Rohlik stanowi analiza danych wykonywana przez użytkowników biznesowych.
🔗 Format factory.yaml, @warpdotdev · Studium przypadku Rohlik, @cognition · Strona klienta Devin
GitHub: cztery ćwiczenia dotyczące workflow agentowych i ogólna dostępność zakładki Customize
25 sierpnia — GitHub udostępnia cztery nowe ćwiczenia na swojej platformie edukacyjnej GitHub Skills. Podejście jest jednoznaczne: zamiast dokumentować tegoroczne nowości agentowe, GitHub proponuje przećwiczenie ich w demonstracyjnym repozytorium, z instrukcjami przekazywanymi w kolejnych pull requestach.
| Opublikowane ćwiczenie | Przedmiot ćwiczenia |
|---|---|
| Agent Orchestration Build Your AI Dream Team | Niestandardowi agenci w Copilot CLI: planowanie, projektowanie, budowanie, walidacja, przekazywanie |
| Agentic Workflows that Read the Room | Rozszerzenie gh aw, workflow agentowy w Markdown, zmiany przesyłane przez pull requesty |
| Idea to Merge with the Copilot App | Od sesji do scalonego pull requesta, w całości w aplikacji GitHub Copilot |
| Ship with Quality | Automatyczne sygnały jakości, pokrycie testami, obowiązkowe kontrole pull requestów |
Najbardziej godne uwagi z całej czwórki jest pierwsze ćwiczenie: po raz pierwszy GitHub oferuje prowadzony krok po kroku kurs dotyczący orkiestracji wielu agentów w swoim CLI — tematu, który dotychczas był opisany jedynie w formie tekstowej dokumentacji. Drugie wprowadza rozszerzenie gh aw, z istotnym aspektem bezpieczeństwa — zmiany proponowane przez workflow przechodzą przez pull requesty, zamiast być stosowane bezpośrednio, dzięki czemu zachowany zostaje etap przeglądu przez człowieka.
Tego samego dnia aplikacja GitHub Copilot otrzymuje ogólnie dostępną zakładkę Customize. Jej zadaniem jest zebranie w jednym miejscu czterech mechanizmów rozszerzeń wprowadzanych osobno w ostatnich miesiącach: serwerów MCP, plugins, skills i canvases. Widok Featured przedstawia wyselekcjonowane propozycje z każdej kategorii dla użytkownika, który wie, co chce zrobić, ale nie wie, jaki typ rozszerzenia odpowiada temu zadaniu; serwery MCP otrzymują natomiast własny interfejs przeglądania, z opcjami wyróżnianymi według popularności i podziałem na kategorie. Changelog ilustruje zalety canvases konkretnym przypadkiem: canvas Azure DevOps pozwalający sortować issues, ustalać priorytety backlogu, przydzielać dalsze działania, a następnie powierzyć zadanie Copilotowi, aby przeprowadził analizę, wdrożył rozwiązanie lub przygotował przegląd.
🔗 Cztery ćwiczenia GitHub Skills · Ogólna dostępność zakładki Customize
Narzędzia Google dla programistów: Gemini CLI 0.57.0 i Antigravity 2.10.0
25 sierpnia — Google publikuje stabilną wersję 0.57.0 Gemini CLI, poprzedzoną kwadrans wcześniej wersją preview 0.58.0. Zawartość tej wersji mówi mniej o nowych funkcjach, a więcej o sposobie, w jaki Google utrzymuje swoje narzędzie: spośród 24 pozycji w changelogu 13 ma prefiks [SSR Agent] Issue Fix i odwołuje się do numerów issues, często dość starych, od 19239 do 28518. Poprawki te rozwiązują niedogodności nagromadzone w backlogu — bezterminowe zawieszenie interfejsu terminala, do którego dodano limity czasu, mylący komunikat o błędzie administracyjnym dla kont osobistych, brak spacji po sugestiach autouzupełniania oraz renderowanie terminala, które nie odświeżało się po wyjściu z zewnętrznego edytora. Innymi słowy, Google kieruje agenta do pracy nad własnym długiem technicznym, a rezultat trafia bezpośrednio do wersji stabilnej.
| Opublikowana wersja | Data i godzina (UTC) | Kanał publikacji | Najważniejsze elementy |
|---|---|---|---|
| v0.57.0 | 25 sierpnia, 18:37:14 | Stable | 13 poprawek [SSR Agent], walidacja evals, kontekstowe retries |
| v0.58.0-preview.0 | 25 sierpnia, 18:22:01 | Preview | Izolacja Docker w profilu Seatbelt macOS, mechanizmy kontroli bezpieczeństwa |
W zakresie funkcji wysiłki skupiają się na ewaluacji: dodano polecenie do walidacji evals oraz formatter wywołań narzędzi uwzględniający podsumowania niepowodzeń. Poprawiono również niezawodność: błędy przepustowości uruchamiają ciche retries uwzględniające kontekst, a anulowanie żądania wieloturowego powoduje pełny rollback zamiast pozostawienia stanu częściowego. Warto zauważyć, że dla osób szukających informacji o wydaniach plik docs/changelogs/index.md w repozytorium nie został zaktualizowany poza wersję v0.54.0 z 6 sierpnia.
Cztery dni po wersji 2.9.1 i funkcji Remote Control Google Antigravity przechodzi 24 sierpnia na wersję 2.10.0 i uzupełnia dwa braki, które zmuszały użytkowników do opuszczania narzędzia: zintegrowany terminal oraz natywną obsługę kontroli wersji Git, oba umieszczone bezpośrednio na pasku bocznym. Takie połączenie jest spójne z kierunkiem rozwoju produktu — Antigravity pozycjonuje się jako środowisko do zarządzania agentami, a nie edytowania kodu wiersz po wierszu, lecz nadal trzeba mieć możliwość uruchomienia polecenia i sprawdzenia diffu bez przełączania okna. Pozostała część wydania rozszerza zarówno zakres materiałów, które można przekazać agentowi, jak i widoczność jego pracy: do obsługiwanych załączników dołączają pliki audio, interaktywne komentowanie obrazów pozwala opisywać elementy wizualne w celu pokierowania agentem, a rozbudowane podglądy wykonania narzędzi MCP ułatwiają zrozumienie, co faktycznie zrobił serwer narzędzi. Google podaje, że wydanie obejmuje 13 ulepszeń i 8 poprawek oraz jest wdrażane stopniowo.
🔗 Gemini CLI v0.57.0 · Changelog Antigravity
Anthropic finansuje niezależne badania nad dobrostanem kwotą 5 milionów dolarów
25 sierpnia — Anthropic uruchamia program grantowy o wartości 5 milionów dolarów, którego celem jest finansowanie niezależnych badań nad wpływem AI na dobrostan użytkowników. Laureaci otrzymują bezpośrednie finansowanie, dostęp do modeli i wsparcie techniczne, lecz pracują w pełni niezależnie: ich ewaluacje są publikowane jako open source i mogą być ponownie wykorzystywane przez całą branżę. Zgłoszenia można składać do 21 września, a kandydaci wybrani do przedstawienia pełnej propozycji zostaną powiadomieni przed 5 października.
Uzasadnienie techniczne wyjaśnia, dlaczego ten obszar opiera się tradycyjnym metodom ewaluacji. W przypadku większości zachowań modelu wystarczy przeanalizować pojedynczą odpowiedź, aby ocenić jej poprawność i stosowność. Dobrostan wymaga kontekstu: użytkownik w kryzysie nie musi od razu wspominać o myślach o samookaleczeniu, a porady dotyczące zbilansowanego odżywiania, rozsądne w jednym przypadku, mogą stać się niebezpieczne, jeśli dana osoba wykazywała wcześniej zaburzenia odżywiania. Zespół Safeguards publikuje równolegle pięć kryteriów rygoru metodologicznego: jasno określić, co jest mierzone; włączyć klinicystów i specjalistów z danej dziedziny w proces projektowania; testować zarówno środki ostrożności, jak i szkody — czyli oceniać ryzyko nadmiernej ugodowości oraz nadmiernego odmawiania — odzwierciedlać rzeczywiste wykorzystanie za pomocą scenariuszy wieloturowych; oraz walidować automatyczne mechanizmy oceny z udziałem prawdziwych ekspertów. To trzecie kryterium, czyli symetria między nadmiernym podporządkowaniem a nadmiernym odmawianiem, odróżnia to podejście od zwykłego zaostrzenia zabezpieczeń.
🔗 Granty na badania nad dobrostanem
Quantization-Aware Healing: model 4-bitowy, który przewyższa swój pełnoprecyzyjny oryginał
25 sierpnia — Standardowy pipeline służący do przygotowania dużego modelu do wdrożenia obejmuje trzy etapy: kompresję architektury, kwantyzację wyniku, a następnie naprawę utraty jakości. Dominującą metodą realizacji tego ostatniego etapu jest QAT (quantization-aware training), który wstawia operacje pozornej kwantyzacji i ponownie trenuje model; alternatywą jest QAD, polegający na destylacji z pełnoprecyzyjnego skompresowanego modelu. W obu przypadkach model uczniowski może w najlepszym razie dorównać swojemu skompresowanemu nauczycielowi, a zatem dziedziczy ograniczenie narzucone przez kompresję.
Multiverse Computing proponuje zmianę jednej linii: destylację bezpośrednio z oryginalnego modelu, sprzed kompresji. Kwantyzacja przestaje wówczas być stratnym etapem postprocessingu, a staje się pełnoprawnym etapem uczenia. Wynik jest sprzeczny z intuicją — po zastosowaniu tej metody do GPT-OSS 120B skompresowanego do 60B, a następnie skwantyzowanego w MXFP4, powstaje model 4-bitowy, który dorównuje własnemu źródłu bfloat16 lub je przewyższa w siedmiu z dziewięciu benchmarków. Największe zyski pojawiają się tam, gdzie kompresja szkodzi najbardziej: +7,4 punktu w AA-LCR w rozumowaniu z długim kontekstem oraz +5,6 w AIME 2025. Jedyne dwa spadki, w MMLU-Pro i SciCode, pozostają poniżej półtora punktu.
Bezpośrednie porównanie z QAT przy identycznym pipeline jest być może najbardziej użytecznym wynikiem w praktyce. W przypadku GPT-OSS 9B skwantyzowanego w MXFP4 obie metody osiągają porównywalny szczyt, 54,9 wobec 54,6, lecz różnym kosztem: QAH dochodzi do niego po około stu krokach i utrzymuje ten poziom, podczas gdy QAT potrzebuje około 700 kroków, po czym jego wyniki się pogarszają. W praktyce oznacza to inny poziom ryzyka wdrożeniowego — punkt kontrolny QAT wymaga uważnego monitorowania wczesnego zatrzymania, a punkt kontrolny QAH znacznie mniejszego.
Gradio integruje gr.Workflow, konstruktor pipeline’ów AI w formie grafu
25 sierpnia — Hugging Face publikuje przewodnik przedstawiający gr.Workflow, prymityw zintegrowany obecnie z Gradio. Punkt wyjścia jest prosty: większość interesujących aplikacji AI nie sprowadza się do jednego wywołania modelu, lecz stanowi sekwencję działań — generujemy obraz, usuwamy z niego tło, tworzymy do niego głos lektorski, prosimy LLM o tytuł. Dotychczas połączenie tych etapów i ich właściwe udostępnienie wymagało napisania zarówno logiki, jak i interfejsu. gr.Workflow łączy oba elementy: etapy opisuje się jako graf typowanych węzłów, a sam graf staje się interfejsem.
Korzyści dla deweloperów wykraczają poza wizualną demonstrację. Każde wyjście grafu automatycznie otrzymuje własny endpoint REST: przedstawione jako przykład studio multimedialne, które łączy generowanie za pomocą FLUX, usuwanie tła, syntezę mowy i LLM, udostępnia trzy odrębne trasy (/sticker, /voiceover, /episode_title), które można wywoływać z kodu bez korzystania z interfejsu. Węzły potrafią komunikować się z czterema środowiskami — modelami hostowanymi za pośrednictwem Inference Providers od Hugging Face, innymi publicznymi Spaces Gradio wykorzystywanymi ponownie jako komponenty, wierszem zbioru danych z Hub oraz dowolnym kodem Python. Ten ostatni element daje najwięcej możliwości: węzeł operatora udekorowany za pomocą @spaces.GPU rezerwuje GPU ZeroGPU na czas swojego działania, co pozwala uruchamiać własne wagi. Przewodnikowi towarzyszy pięć rzeczywiście wdrożonych aplikacji w Spaces, w tym profiler zbiorów danych oraz demonstracja animująca nieruchomy obraz za pomocą Lightricks/LTX-Video.
ElevenLabs wprowadza Composer, edytor utworów działający sekcja po sekcji
25 sierpnia — ElevenLabs ogłasza Composer, edytor utworów działający sekcja po sekcji. Jego zasada odbiega od dominującego sposobu generowania muzyki przez modele: zamiast tworzyć cały utwór w jednym przebiegu i generować wszystko od nowa, gdy któryś fragment jest niezadowalający, Composer pozwala osobno poprawić zwrotkę, refren lub bridge. Dostępne są cztery punkty wyjścia — własny tekst, dostarczony istniejący utwór, pusta strona albo prosty prompt — a następnie utwór powstaje poprzez kolejne poprawki.
To drugi krok ElevenLabs w stronę muzyki po Eleven Music i następuje on w intensywnym dla firmy tygodniu, dzień po wydaniu CLI v1. Kierunek ten jest spójny z resztą sektora audio: Suno uruchomiło Studio 2.0 13 sierpnia, Pika wydała serię Pika Music 18 sierpnia, a Stability AI tego samego dnia udostępniło swój plugin do cyfrowych stacji roboczych audio. Polem rywalizacji stała się precyzyjna kontrola nad strukturą utworu, a nie sama jakość generowania. Jest jednak jedno zastrzeżenie: ogłoszeniu nie towarzyszy żaden wpis na blogu i nie ma informacji o planach zapewniających dostęp do Composer, formatach eksportu ani dostępie przez API.
🔗 Ogłoszenie Composer, @ElevenLabs
LiveAvatar znosi wszystkie limity równoczesnych sesji i obniża cenę do 0,01 USD za minutę
25 sierpnia — HeyGen ogłasza zniesienie limitów równoczesnych sesji w LiveAvatar, swoim produkcie oferującym awatary czasu rzeczywistego. Sformułowanie podkreśla charakter zmiany: limity nie zostają podniesione, lecz całkowicie znikają. Jedna sesja lub dziesięć tysięcy sesji działa za pośrednictwem tego samego API bez wcześniejszego negocjowania limitu. Ogłoszeniu towarzyszą dwa parametry — renderowanie nadal obejmuje całą sylwetkę w rozdzielczości 1080p, a przy dużej skali cena spada do 0,01 USD za minutę.
Taki poziom cen zmienia charakter możliwych zastosowań: przy koszcie jednego centa za minutę awatar czasu rzeczywistego staje się opłacalny w masowej obsłudze klienta, szkoleniach lub interaktywnych kioskach, czyli w przypadkach, w których koszt jednostkowy dotychczas decydował o wykonalności. Technicznie interesującym elementem jest zniesienie limitu równoczesnych sesji. Platformy awatarów czasu rzeczywistego zwykle ograniczają liczbę jednoczesnych sesji, ponieważ każda z nich stale wykorzystuje GPU; usunięcie tego ograniczenia oznacza albo znaczny zapas mocy obliczeniowej, albo poprawę efektywności modelu. HeyGen publikuje artykuł wyjaśniający swoje podejście, ale jego szczegóły techniczne nie były dostępne w chwili przeglądu.
🔗 Nieograniczona liczba równoczesnych sesji w LiveAvatar
Grok 4.6 trafia do OpenCode Go
25 sierpnia — Grok 4.6 dołącza do OpenCode Go, planu subskrypcyjnego open source’owego agenta programistycznego OpenCode. Ogłoszenie opublikowało pod koniec dnia OpenCode, a konto @grok udostępniło je ponownie pół godziny później. Konkretną informacją dla deweloperów jest limit: 169 zapytań w każdym 5-godzinnym okresie dla użytkowników planu Go. Jest to limit kroczący, a nie miesięczny, dzięki czemu dobrze odpowiada typowemu dla sesji programowania ze wsparciem AI korzystaniu w krótkich, intensywnych seriach.
Ta integracja wpisuje się w serię udostępnień Grok 4.6 w narzędziach zewnętrznych: model trafił do GitHub Copilot 14 sierpnia, do Amazon Bedrock 19 sierpnia, a następnie do Gemini Enterprise Agent Platform od Google 21 sierpnia. Ponadto xAI już w maju 2026 roku połączyło OpenCode ze swoimi subskrypcjami SuperGrok i X Premium — dzisiejszą nowością nie jest więc sam dostęp do OpenCode, lecz obecność modelu 4.6 w planie Go z uwzględnionym limitem, zamiast konieczności samodzielnego zapewnienia subskrypcji xAI.
🔗 Udostępnienie przez @grok · Ogłoszenie @opencode
Cohere publikuje badanie IDC dotyczące wdrażania suwerennej AI w 2026 roku
25 sierpnia — Cohere publikuje wyniki zleconego IDC raportu InfoBrief dotyczącego wdrażania suwerennej AI w sektorach regulowanych. W badaniu przeprowadzonym od kwietnia do maja 2026 roku uczestniczyło ponad 500 osób na wyższych stanowiskach decyzyjnych z przedsiębiorstw osiągających przychody przekraczające miliard dolarów w Kanadzie, Stanach Zjednoczonych, Wielkiej Brytanii i Niemczech.
Najbardziej znaczący wynik dotyczy nie tyle wdrażania, ile niejasności pojęciowej. Co trzeci członek kadry kierowniczej ma trudności z opisaniem suwerennej AI własnymi słowami, a tylko 13% deklaruje bardzo dużą znajomość tego zagadnienia. Wśród osób, które potrafią podać definicję, 52% ujmuje ją w kategoriach kontroli lokalnej lub krajowej, a 35% wspomina o niezależności cyfrowej. Różnica przebiega również przez strukturę organizacyjną: świadomość wśród osób odpowiedzialnych za IT jest dwukrotnie wyższa niż wśród menedżerów biznesowych.
| Badany sektor | Wyciek danych i zgodność z przepisami jako główna obawa | Przewaga konkurencyjna jako czynnik napędzający |
|---|---|---|
| Usługi finansowe | 82% | 21% |
| Przemysł | 77% | 32% |
| Telekomunikacja | 75% | 37% |
| Ochrona zdrowia | 74% | 28% |
| Energetyka | 70% | 21% |
W kwestii motywacji panuje wyraźna i przekrojowa zgoda: wyciek danych, prywatność i zgodność z przepisami zajmują pierwsze miejsce we wszystkich badanych sektorach. Przewaga konkurencyjna występuje jako drugorzędny, lecz zyskujący na znaczeniu czynnik, częściej wskazywany w Kanadzie (35%) i Stanach Zjednoczonych (28%) niż w Niemczech (23%) lub Wielkiej Brytanii (18%). Badanie oczywiście wspiera pozycjonowanie Cohere, którego platforma agentowa North działa w infrastrukturze i jurysdykcji wybranej przez klienta; faktem pozostaje jednak, że dane przypisano do określonego źródła. IDC przewiduje ponadto, że do 2028 roku dyrektorzy IT w korporacjach międzynarodowych zwiększą o 65% inwestycje w modułowe suwerenne środowiska cloud i lokalizację danych.
🔗 Stan wdrażania suwerennej AI w 2026 roku
W skrócie
- Bain & Company dołącza do Claude Partner Network — Firma konsultingowa zostaje partnerem Global Premier w związku z wdrożeniem Claude dla swoich 19 000 pracowników; już w fazie pilotażowej było ponad 7 000 aktywnych użytkowników, a ponad dwie trzecie uczestników zaczęło korzystać z Claude for Excel. 🔗 Wpis Anthropic
- Amp wyjaśnia, czym są orbs — Notatka Thorstena Balla będąca odpowiedzią na niejasności dotyczące nazwy: orb to zdalny agent, którym można sterować z poziomu sieci, telefonu lub CLI. Dwa przydatne wyjaśnienia dotyczą kosztów: nieograniczony stan uśpienia nie jest płatny, a liczba jednocześnie działających orbs nie jest ograniczona. 🔗 Notatka Amp
- Together AI udostępnia Qwen3.8 27B do fine-tuningu i dedykowanej inferencji — Model staje się dostępny zarówno do dostrajania na własnych danych, jak i do Dedicated Model Inference na zarezerwowanym sprzęcie. 🔗 Tweet @togethercompute
- FINAL-Bench uruchamia FINCHAL, konkurs prognozowania finansowego dla agentów — Konkurs z pulą nagród wynoszącą 2 000 dolarów wymaga zajmowania pozycji zamiast przedstawiania prognoz i publikuje pułap szczęścia (luck ceiling), aby oddzielić umiejętności od przypadku. 🔗 Wpis FINAL-Bench
- Au-Zone publikuje EdgeFirst Model Zoo — Cztery rodziny YOLO do detekcji i segmentacji zmierzone na rzeczywistym układzie wbudowanym; każda opublikowana wartość odsyła do sesji walidacyjnej, w której ją uzyskano, co stanowi przeciwieństwo nieprzejrzystych wartości TOPS podawanych przez producentów. 🔗 Wpis EdgeFirst
- Inteligentne dyktowanie Gemini dla macOS — Dyktowanie w dowolnym oknie pulpitu z automatycznym usuwaniem zawahań i uwzględnianiem poprawek wprowadzanych w środku zdania; głosu można również używać do podsumowywania plików i przepisywania tekstu. 🔗 Przewodnik blog.google
- Push rules obsługują wyjątki dla ścieżek — W publicznej wersji zapoznawczej reguły Restrict file paths i Restrict file size mogą wyłączać określone ścieżki, na przykład blokować pliki JAR wszędzie poza
**/gradle/wrapper/*.jar. 🔗 Dziennik zmian GitHub - Blokowanie użytkownika z poziomu powiadomienia o bezpieczeństwie — Działanie jest dostępne w menu z trzema kropkami w opisie lub komentarzu w publicznych repozytoriach, bez konieczności przechodzenia do ustawień; powiadomienie pozostaje nienaruszone. 🔗 Dziennik zmian GitHub
- Manus informuje o dużym zapotrzebowaniu na przywracanie danych — Nieudane operacje przywracania należy ponowić w dalszej części dnia; wyraźne zalecenie nakazuje zachować pakiety kopii zapasowych w nienaruszonym i niezmienionym stanie. 🔗 Tweet @ManusAI
- Kling publikuje trzy przewodniki dotyczące swojego serwera MCP — Podłączenie Kling do asystenta zgodnego z MCP pozwala ponownie wykorzystać zatwierdzoną konfigurację kreatywną i generować warianty wsadowo; dwa z trzech samouczków wskazują Claude Code jako klienta. 🔗 Blog Kling
- Wan 3.0 trafia do Runway i Replicate — Runway integruje go 24 sierpnia z obsługą wielu wejść referencyjnych w postaci obrazów, wideo i audio; Replicate dołącza 25 sierpnia, podkreślając możliwość natywnego generowania 30-sekundowych materiałów w jednym ujęciu ze zsynchronizowanym dźwiękiem. 🔗 Tweet @runwayml
- Runway ogłasza nowych prelegentów AI Summit — Program wrześniowego wydarzenia w San Francisco rozszerzono o robotykę, pojazdy autonomiczne, marketing i infrastrukturę. 🔗 Tweet @runwayml
- MiniMax publikuje indeks integracji H3 — Awesome MiniMax H3 Integrations kataloguje rozwiązania powstające wokół otwartego modelu wideo, w tym konfiguracje działające na 24 GB VRAM. 🔗 Tweet @MiniMax_AI
- Luma uruchamia Dream Lab Weekly — Pierwszy odcinek serii wideo poświęconej kreatywnym profesjonalistom korzystającym z Luma i ich cotygodniowej pracy nad produktem. 🔗 Tweet @LumaLabsAI
- NVIDIA transmituje sesję Nemotron Labs dotyczącą routingu otwartych modeli — 55-minutowa transmisja na żywo zatytułowana Get Started with Open Model Routing, będąca kontynuacją prac nad Nemotron 3.5 Lightning i NeMo Switchyard. 🔗 Tweet @NVIDIAAI
- Pozostał tydzień do końca konkursu Grok Imagine dotyczącego Odysei — Należy stworzyć scenę z Odysei prezentującą możliwości narzędzia w zakresie wideo i głosu; nagrody wynoszą 100 000, 50 000 i 25 000 dolarów. 🔗 Tweet @grok
- Pula resetów limitów dla subskrybentów Plus i Pro — Zamiast czekać na okno resetowania, użytkownik wykorzystuje zachowany w puli reset; jeden jest bezpłatny na start, a kolejne można uzyskać przez polecenia, przy czym w planie Business dostępne są współdzielone kredyty workspace. 🔗 Dziennik zmian ChatGPT i Codex
Co to oznacza
Krzem ponownie staje się tematem laboratoriów zajmujących się modelami. OpenAI tego samego dnia publikuje pierwsze wyniki pomiarów własnego układu do inferencji oraz wpis przedstawiający strategię firmy w zakresie mocy obliczeniowej. Ta zbieżność terminów nie jest przypadkowa: dostawca modeli, który projektuje własny krzem, mierzy go za pomocą publicznego benchmarku niezależnej firmy i otwarcie deklaruje portfel dziesięciu partnerów, zmienia charakter konkurencji. Pytanie przestaje brzmieć „który model jest najlepszy”, a zaczyna „jaki jest koszt każdego pomyślnie wykonanego zadania”, przy czym odpowiedź zależy zarówno od infrastruktury w szafach rack, jak i od wag modelu. Być może najbardziej znaczący szczegół kryje się gdzie indziej: AI posłużyła do zaprojektowania układu i napisania jego kerneli, a proces od projektu do produkcji trwał dziewięć miesięcy; wygenerowane implementacje przewyższają rozwiązania ludzkich ekspertów w wybranych blokach. Pętla się zamyka — modele projektują sprzęt, na którym będą działać.
AI wraca na urządzenia, a liczby zaczynają to potwierdzać. Trzy sygnały z tego samego dnia wskazują ten sam kierunek. Perplexity uruchamia całego swojego agenta lokalnie na DGX Spark, bez zużywania kredytów, a eskalacja do chmury pozostaje decyzją użytkownika. Multiverse Computing publikuje metodę, dzięki której model 4-bitowy dorównuje swojemu źródłowemu modelowi o pełnej precyzji lub go przewyższa, co podważa typowy argument przeciwko agresywnej kwantyzacji. Au-Zone publikuje pomiary modeli wizyjnych na układach wbudowanych, zarzucając deklarowanym wartościom TOPS, że nie mówią nic o rzeczywistej wydajności konkretnego modelu. Żadna z tych trzech prac nie twierdzi, że dorównuje modelom frontier: uczciwy wynik Perplexity to 59,6% lokalnie wobec 82,4% dla samego Claude Opus 5 w Terminal Bench 2.1. Jednak eskalacja do modelu doradczego pozwala odrobić trzy piąte różnicy za dwie trzecie kosztu i to właśnie ten kompromis, bardziej niż osiągnięcie parytetu, czyni lokalne wykonywanie zadań uzasadnionym.
Otwarte wagi stają się domyślnym podejściem. Analiza 500 000 artykułów z arXiv, udostępniona przez Qwen, dokumentuje widoczny już zwrot: udział chińskich modeli otwartych wzrósł z 10% do około 40% wzmianek, podczas gdy amerykańskie modele otwarte utrzymują się na poziomie od 25 do 30%. Qwen3.8-27B trafia do pierwszej dziesiątki Code Arena jako jedyny model tej wielkości, GLM-5.3 przewyższał GPT-5.6 Sol i Claude Fable 5 w DeepSWE w próbach wielokrotnych przy koszcie od 2,1 do 5,4 raza niższym, a IBM otwiera Granite 4.2 z czterema wariantami kwantyzowanymi i czternastoma formatami GGUF już pierwszego dnia — wszędzie powtarza się ta sama logika. Otwarcie wag nie jest już próbą nadrobienia zaległości, lecz sposobem na stanie się domyślną infrastrukturą dla innych, z zastrzeżeniem, które sam Nathan Lambert podkreśla: publikacje pojawiają się z opóźnieniem względem premier, a krzywe te opisują trwające prace, nie bieżące preferencje.
A sieć przygotowuje się na to, że będą ją odczytywać agenci, a nie ludzie. WebMCP Challenge to konkurs z pulą nagród wynoszącą 35 000 dolarów, czyli niewielką; znacznie cenniejsze jest to, co ujawnia. Chrome, Cloudflare, Shopify, Vercel, Render i Netlify wspólnie z OpenAI opowiadają się za standardem, który wymaga od witryn udostępniania ustrukturyzowanych narzędzi, zamiast pozostawiania agentom odgadywania sposobu obsługi interfejsu. Tego samego dnia ChatGPT desktop potrafi natywnie korzystać z WebMCP, Codex może tworzyć i wdrażać zgodne z nim aplikacje, a OpenAI dokumentuje wewnętrzne wykorzystanie protokołu w narzędziu do notebooków. Ta konwergencja odpowiada temu, co Rohlik opisuje u siebie: ponad pięćdziesiąt integracji MCP oraz zasada, że każde nowe narzędzie musi być dostępne dla agentów od pierwszego dnia. Warstwa interfejsu dla agentów przestaje być tematem badawczym i staje się wymogiem inżynieryjnym.
Źródła
- OpenAI — WebMCP Challenge
- OpenAI — ogłoszenie WebMCP Challenge na X
- OpenAI — WebMCP w ChatGPT desktop i Sites
- OpenAI — automatyzacja powtarzalnej pracy za pomocą Codex, Runme i WebMCP
- OpenAI — Jalapeño, pierwsze wyniki
- OpenAI — The full stack behind abundant intelligence
- OpenAI — plugin Admin dla ChatGPT Work i Codex
- OpenAI — rozszerzenie przeglądarkowe dostępne również dla Edge, Brave, Opera i Vivaldi
- OpenAI — stanowisko Premium w ChatGPT Business
- ChatGPT i Codex — dziennik zmian
- Perplexity — premiera Portable Computer
- Perplexity — wpis o Portable Computer
- Perplexity — benchmarki lokalnego środowiska testowego
- Anthropic — pamięć Claude działa wszędzie
- Anthropic — ogłoszenie dotyczące pamięci na X
- Anthropic — CHANGELOG Claude Code
- Anthropic — czterokrotnie płynniejsze renderowanie strumieniowe
- Anthropic — granty badawcze dotyczące dobrostanu
- Anthropic — Bain & Company dołącza do Claude Partner Network
- IBM — Granite 4.2
- IBM — Granite Speech 5.0 Turbo CTC
- Multiverse Computing — Quantization-Aware Healing
- Hugging Face — przewodnik po gr.Workflow
- FINAL-Bench — konkurs FINCHAL
- Au-Zone — EdgeFirst Model Zoo
- Together AI — Qwen3.8 27B do fine-tuningu i dedykowanej inferencji
- Google AI — WeatherNext Cyclones
- Google DeepMind — WeatherNext Cyclones
- Google — Gemini CLI v0.57.0
- Google — dziennik zmian Antigravity
- Google — inteligentne dyktowanie Gemini dla macOS
- Stability AI — runda Series B o wartości 76 milionów dolarów
- Stability AI — ogłoszenie na X
- NVIDIA — Gamescom i RTX Spark
- MiniMax — SANA i Sol Engine na H3
- MiniMax — indeks integracji H3
- NVIDIA — sesja Nemotron Labs o routingu modeli otwartych
- Qwen — Qwen3.8-27B w Code Arena WebDev
- Qwen — udostępnienie analizy arXiv
- Nathan Lambert — analiza 500 000 artykułów z arXiv
- Warp — format factory.yaml i wczesny dostęp
- Cognition — studium przypadku Rohlik Group
- Devin — strona klienta Rohlik Group
- Amp — objaśnienie orbów
- GitHub — cztery nowe ćwiczenia GitHub Skills
- GitHub — karta Customize ogólnie dostępna
- GitHub — wyjątki ścieżek w push rules
- GitHub — blokowanie z poziomu alertu bezpieczeństwa
- Manus — aktualizacja dotycząca przywracania danych
- ElevenLabs — Composer
- HeyGen — nieograniczona współbieżność w LiveAvatar
- Kling — przewodniki dotyczące serwera MCP
- Runway — Wan 3.0 dostępny na platformie
- Runway — nowi prelegenci AI Summit
- Luma — Dream Lab Weekly
- xAI — Grok 4.6 w OpenCode Go
- OpenCode — Grok 4.6 w planie Go
- xAI — konkurs Grok Imagine poświęcony Odysei
- Cohere — State of Sovereign AI Adoption 2026