Szukaj

Claude Opus 5.5 debiutuje w Anthropic, OpenAI wprowadza GPT-6 Sol i Luna, a Claude Code przełącza plany Pro i Team Standard na Opus

ai-powered-markdown-translator

Artykuł przetłumaczony z fr na pl za pomocą gpt-5.6-sol.

Zobacz projekt na GitHubie ↗

We wtorek 22 września Anthropic i OpenAI wprowadzają, w odstępie niespełna dwóch godzin, po jednym modelu frontier: Claude Opus 5.5, przedstawiany jako dorównujący Fable 5.1 przy kosztach niższych o 40% niż w przypadku Opus 5, oraz GPT-6 Sol i GPT-6 Luna, których ceny API spadają o połowę względem promocyjnej stawki GPT-5.6. Obie rodziny trafiają tego samego dnia do GitHub Copilot, Devin i Perplexity, podczas gdy Claude Code 2.1.280 przełącza plany Pro i Team Standard z Sonnet na Opus. Dzień uzupełniają Codex CLI 0.156.0, podwyższone limity użycia w Anthropic oraz seria publikacji NVIDIA.


Anthropic wprowadza Claude Opus 5.5, pierwszy model z rodziny Claude 5.5

22 września — Anthropic wprowadza Claude Opus 5.5 (claude-opus-5-5), pierwszy model ze swojej nowej rodziny Claude 5.5; Sonnet 5.5 i Haiku 5.5 pojawią się „w najbliższych tygodniach”. Od dziś jest dostępny przez Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud i Microsoft Foundry, a w Claude Code staje się domyślnym modelem płatnych planów. Okno kontekstowe obejmuje milion tokenów, maksymalna długość odpowiedzi wynosi 128 000 tokenów, a wiarygodna wiedza sięga czerwca 2026 roku.

Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.

It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.

🇵🇱 Oto Claude Opus 5.5, pierwszy model z naszej nowej rodziny Claude 5.5. W większości zadań działa na poziomie Claude Fable 5.1, a jego uruchamianie kosztuje o 40% mniej niż Opus 5.@claudeai na X

Według Anthropic te 40% zmierzono „przy ustawieniach domyślnych” dla typowych obciążeń, a wynik łączy niższe ceny z mniejszą liczbą tokenów potrzebnych do wykonania zadania. Stawki spadają o 20% (4 dolary za wejście i 20 dolarów za wyjście na milion tokenów, wobec 5 i 25 dolarów w przypadku Opus 5) oraz o 60% za odczyty z cache (0,20 dolara). Odpowiedzi są generowane o ponad 30% szybciej, a tryb szybki (fast mode), dostępny w wersji research preview, obiecuje nawet 2,5-krotnie większą szybkość za 8 i 40 dolarów.

Benchmark (dane Anthropic)Claude Opus 5.5Claude Fable 5.1GPT-6 Astra
Terminal-Bench 4.066,4 %55,8 %57,9 %
FrontierCode v1.1 Main54,4 %50,3 %53,3 %
GDPval-AA v2.1 (Elo)184617351542
OSWorld 2.081,8 %80,7 %
AutomationBench40,0 %31,4 %41,4 %
Terminal-Bench-Science 0.158,7 %52,6 %64,6 %

Opus 5.5 wysuwa się na prowadzenie w kodowaniu agentowym, pracy biurowej i obsłudze komputera, ale GPT-6 Astra pozostaje lepszy w AutomationBench i Terminal-Bench-Science. Anthropic zaznacza, że wyniki zmierzono z aktywnymi produkcyjnymi zabezpieczeniami, co prawdopodobnie je obniża, i ocenia, że różnice w benchmarkach stały się „mniej wiarygodną wskazówką”: w praktyce przewaga nad Fable 5.1 ma być mniejsza, niż sugerują te liczby. To pierwszy Opus wydany z zabezpieczeniami klasy Fable 5.1 w obszarach cyberbezpieczeństwa, biologii i destylacji (większość zadań cybernetycznych jest przełączana na Opus 4.8), a Anthropic przyznaje, że model często zdaje się podejrzewać, iż jest oceniany.

Dla deweloperów migracja wymaga korekt: adaptacyjnego rozumowania nie można już wyłączyć, wymuszony wybór narzędzia (tool_choice na any lub tool) zwraca błąd 400, a domyślny poziom wysiłku zmienia się na medium (wobec high w Opus 5). Tekst generowany między dwoma wywołaniami narzędzi trafia teraz do bloków rozumowania, które przy domyślnym sposobie wyświetlania są puste.

🔗 Przedstawiamy Claude Opus 5.5 · Nowości w Opus 5.5 dla API


Claude Code 2.1.280 wprowadza Opus 5.5 i przełącza plany Pro oraz Team Standard na Opus

22 września — Claude Code 2.1.280 zostaje wydany o 16:38 UTC, siedem minut po ogłoszeniu Opus 5.5. Wersja 2.1.279 nigdy się nie pojawiła: CHANGELOG przechodzi bezpośrednio z wersji 2.1.278 z 19 września do tej wersji, zawierającej 114 wpisów.

Najbardziej widoczna zmiana dotyczy modelu. Opus 5.5 staje się domyślnym modelem Opus, a plany Pro i Team Standard domyślnie przechodzą z Sonnet na Opus, podobnie jak wcześniej Max, Team Premium i Enterprise. Poziomy wysiłku zapisane, zanim /effort stał się ustawieniem właściwym dla każdego modelu, nie mają już zastosowania do nowych modeli takich jak Opus 5.5, które uruchamiają się ze swoim domyślnym ustawieniem; Opus 4.7, Opus 4.8 i Fable 5 przestają natomiast narzucać początkowy poziom wysiłku wyższy od wybranego ustawienia.

W kwestii bezpieczeństwa zapis wykonywany przez link symboliczny jest teraz oceniany na podstawie jego rzeczywistego celu: prośba o autoryzację wskazuje miejsce docelowe, a acceptEdits, reguły autoryzacji i tryb automatyczny nie zatwierdzają już zapisu prowadzącego poza drzewo katalogów. Tryb automatyczny nie odrzuca już działań w pętli bez przerwy, gdy kontrola bezpieczeństwa nie zwraca odpowiedzi: kolejne próby są podejmowane w coraz większych odstępach, a tura kończy się po dziesięciu kolejnych odmowach. Marketplace’y pluginów podszywające się pod zastrzeżoną nazwę są odrzucane, a zmienna CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH pozwala zmienić limit 2048 znaków dla opisów narzędzi MCP.

Pozostałe zmiany dotyczą wygody: pojedyncze naciśnięcie y lub n nie zatwierdza już ani nie zamyka okna dialogowego (służą do tego Enter i Escape), dwukrotne Ctrl+C w oknie dialogowym nie zamyka już Claude Code, naprawiono dwa przypadki unieważniania cache promptów, a rozszerzenie VS Code zyskuje sześć typowanych poleceń (/status, /sandbox, /chrome, /export, /skills, /plan).

Kategoria wpisu w CHANGELOGLiczba wpisów
Poprawki (Fixed)69
Ulepszenia (Improved)21
Dodatki (Added)12
Zmiany (Changed)10
Wycofanie zmian i usunięcie2
Łącznie114

🔗 Claude Code v2.1.280

Dwa przewodniki po pracy z Opus 5.5

22 września — Anthropic publikuje również dwa przewodniki autorstwa Addy’ego Osmaniego. Pierwszy, „Ile kosztuje zadanie w Opus 5.5” (What a task costs on Opus 5.5), przypomina, że dwa modele o tej samej cenie za token mogą mieć bardzo różne koszty wykonania tego samego zadania, ponieważ każda tura ponownie przesyła całą rozmowę. Podaje następujące przykłady, przedstawione jako ilustracje oparte na publicznych stawkach: 2,8 miliona tokenów wejściowych kosztuje 11,20 dolara bez cache i 1,62 dolara, gdy 90% jest odczytywane z cache, a jeden token wyjściowy kosztuje tyle co 100 odczytów z cache. Do codziennego użytku zaleca wysiłek medium, high, gdy medium utknie, a następnie Fable 5.1, jeśli Opus 5.5 dwukrotnie nie poradzi sobie z tym samym problemem, przy czym zmiana wysiłku lub modelu opróżnia cache (który w ramach subskrypcji działa przez godzinę, a przy użyciu klucza API domyślnie przez pięć minut). W wewnętrznym benchmarku obejmującym 44 zgłoszenia pomocy technicznej przejście z Opus 4.8 na Opus 5.5 przy niskim wysiłku zmniejszyło koszt o około 18%, a /claude-api prompt-audit o kolejne 9%.

Drugi przewodnik, opublikowany na claude.dev, zaleca najpierw określić, co oznacza „ukończone”, a następnie pozwolić modelowi działać, oraz usunąć instrukcje w rodzaju „dobrze się zastanów”, ponieważ model zawsze rozumuje przed udzieleniem odpowiedzi. Wyjaśnia również przełączanie na starszy model, gdy wiadomość zostanie oznaczona przez zabezpieczenia — zachowanie to można skonfigurować w aplikacjach lub w /config.

🔗 Ile kosztuje zadanie w Opus 5.5 · Jak najlepiej wykorzystać Opus 5.5


OpenAI wprowadza GPT-6 Sol i GPT-6 Luna, o 50% tańsze od promocyjnej stawki GPT-5.6

22 września — Niespełna dwie godziny po Anthropic OpenAI rozszerza rodzinę GPT-6 o GPT-6 Sol i GPT-6 Luna, wytrenowane metodami podobnymi do GPT-6 Astra, który według firmy pozostaje jej najlepszym modelem. Sol jest przeznaczony do złożonego kodowania i agentowych przepływów pracy, a Luna do ukierunkowanych zadań wykonywanych na dużą skalę; zastępują one GPT-5.6 Sol i GPT-5.6 Luna.

We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

🇵🇱 Zwiększyliśmy również efektywność buforowania i inferencji, a uzyskane oszczędności przekazujemy bezpośrednio wam: ceny API dla Sol i Luna są o 50% niższe niż promocyjne stawki GPT-5.6.@OpenAI na X

Rodzaj stawki (za milion tokenów)GPT-6 SolGPT-6 LunaPodana stawka GPT-5.6 (Sol / Luna)
Wejście2 dolary0,10 dolara4 dolary / 0,20 dolara
Wejście z cache0,20 dolara0,01 dolaranie podano
Wyjście10 dolarów0,50 dolara20 dolarów / 1,20 dolara

Oba modele obsługują kontekst obejmujący 1 050 000 tokenów i generują do 128 000 tokenów; powyżej 272 000 tokenów wejściowych cała prośba jest rozliczana dwukrotnie drożej za wejście i 1,5 raza drożej za wyjście.

W benchmarkach OpenAI, porównujących Sol z modelami Claude sprzed Opus 5.5, Sol osiąga 33,2% w AutomationBench przy wysiłku xhigh i koszcie 0,27 dolara za zadanie, wyprzedzając Claude Opus 5 przy wysiłku max (26,9%, przy koszcie 11,1 raza wyższym) oraz GPT-6 Astra przy wysiłku low (30,3%). W DeepSWE v1.1 osiąga 68,8%, o 1,1 punktu mniej od najlepszego wyniku Claude Fable 5, przy koszcie zadania niższym o około 80%; Luna uzyskuje tam 66,6%. Wyniki konkurentów pochodzą z publicznych raportów. W obszarze alignment odsetek oszustw zmierzony w zadaniach programistycznych zaprojektowanych tak, by skłaniać do nieuczciwości, spada do 1,3% w przypadku Sol, wobec 10,4% dla GPT-5.6 Sol.

Oba modele trafiają do ChatGPT Work i Codex dla subskrybentów Plus, Pro, Business, Enterprise i Edu w ramach stopniowego wdrożenia (w Enterprise wymagana jest aktywacja przez administratora); użytkownicy Free i Go mogą korzystać z Luna w aplikacji desktopowej, a modele nie są jeszcze dostępne w Chat. W API noszą nazwy gpt-6-sol i gpt-6-luna i są dostępne przez Responses oraz Chat Completions.

🔗 Przedstawiamy GPT-6 Sol i Luna

Przeprojektowane buforowanie promptów dla GPT-6

22 września — Towarzyszący premierze wpis „Lepsze buforowanie promptów dla GPT-6” (Better prompt caching for GPT-6) opisuje nowy system cache tej rodziny: domyślnie wyższy odsetek trafień, rabat sięgający 90% na tokeny wejściowe pobierane z cache, przyznawany kwalifikującym się współdzielonym prefiksom ponownie użytym w ciągu 30 minut, oraz zapis do cache rozliczany według stawki 1,25 raza wyższej od ceny wejścia. Deweloperzy otrzymują dashboard Prompt Caching, jawne punkty przerwania (explicit cache breakpoints) pozwalające ustalić prefiksy do ponownego użycia, wstępne rozgrzewanie cache (prewarming) przy uruchamianiu aplikacji oraz configuration_update, który zmienia poziom wysiłku związanego z rozumowaniem między kolejnymi odpowiedziami bez unieważniania cache. Mario Rodriguez, dyrektor produktu GitHub, informuje, że firma zmniejszyła o ponad 50% udział tokenów promptu wymagających ponownego przetworzenia; Strawberry Browser zapowiada obniżenie kosztów o 20%.

🔗 Lepsze buforowanie promptów dla GPT-6


Tego samego dnia w narzędziach: GitHub Copilot, Devin, Perplexity, Cursor i v0

22 września — Opus 5.5 i dwa nowe modele GPT-6 nie musiały długo czekać: w ciągu kilku godzin najważniejsze narzędzia do programowania i wyszukiwania dodały ich obsługę, często wraz z własnymi pomiarami.

GitHub Copilot udostępnia Opus 5.5, GPT-6 Sol i GPT-6 Luna

GitHub dodaje wszystkie trzy modele w dniu ich premiery na dziesięciu platformach: VS Code, Visual Studio, Copilot CLI, agencie programistycznym, aplikacji GitHub Copilot, github.com, GitHub Mobile, JetBrains, Xcode i Eclipse. Wszystkie są rozliczane według zużycia, zgodnie z publiczną stawką dostawcy i bez mnożnika żądań premium; nie otrzymują ich użytkownicy rocznych subskrypcji, którzy pozostali przy dawnym rozliczaniu według liczby żądań. Żaden z nich nie jest jeszcze dostępny w automatycznym wyborze (Auto).

Model w CopilotDostępne planyWejście i wyjście za milion tokenów
Claude Opus 5.5Pro+, Max, Business, Enterprise (bez Pro)4 i 20 dolarów
GPT-6 SolPro+, Max, Business, Enterprise2 i 10 dolarów, następnie 4 i 15 powyżej 272 000 tokenów
GPT-6 LunaPro, Pro+, Max, Business, Enterprise0,10 i 0,50 dolara, następnie 0,20 i 0,75 powyżej 272 000 tokenów

Luna jest więc jedynym modelem GPT-6 dostępnym w Copilot Pro, podczas gdy Opus 5.5 nie jest w nim udostępniony. Według pierwszych testów GitHub Opus 5.5 rozwiązuje zadania na poziomie Claude Opus 5, wykonując przy tym wyraźnie mniej kroków i zużywając mniej tokenów. GitHub informuje również, że Opus 5.5 umieszcza znak wodny (watermark) w swoich odpowiedziach tekstowych, co według GitHub nie wpływa na znaczenie, jakość, czytelność, liczbę tokenów ani koszt.

🔗 Claude Opus 5.5 w GitHub Copilot · GPT-6 Sol i GPT-6 Luna w GitHub Copilot

Devin klasyfikuje nowych graczy na FrontierCode 1.1

Cognition udostępnia Claude Opus 5.5 w Devin Desktop i Devin CLI w dniu jego premiery i umieszcza go na pierwszym miejscu swojego benchmarku FrontierCode 1.1 w wariancie Extended, z wynikiem 65,3%, przed Claude Fable 5 (64,9%) i GPT-6 Astra (64,5%), przy koszcie zadania wynoszącym mniej niż jedną dziesiątą kosztu Fable 5. Tego wyniku 65,3% nie można porównywać z wynikiem 54,4% opublikowanym przez Anthropic, zmierzonym w wariancie Main. Czterdzieści siedem minut później pojawiają się również GPT-6 Sol i Luna: Sol dorównuje GPT-5.6 Sol (60,7% wobec 60,6%) przy koszcie zadania niższym o 61% i wykorzystaniu około 17% mniej kontekstu; Luna (56,1%) schodzi poniżej 0,10 dolara za zadanie, będąc według Cognition najtańszym modelem w rankingu.

Dzień wcześniej, 21 września po południu (czasu pacyficznego), Cognition udostępniło Grok 4.7 i zmierzyło jego wynik na 59,4%, poniżej Grok 4.6 (61,3%): solidny w trudnych zadaniach back-endowych w językach Java, Go i Ruby, ma tendencję do wychodzenia poza zakres zadania (over-scope), generując większe diffy, niż wymaga tego zadanie. Niedługo potem v0 udostępniło Grok 4.7 z rabatem 40% do 27 września, nie precyzując, czego on dotyczy.

Oceniany modelWynik FrontierCode 1.1 Extended
Claude Opus 5.565,3%
Claude Fable 564,9%
GPT-6 Astra64,5%
Claude Fable 5.163,6%
SWE-262,5%
Grok 4.661,3%
GPT-6 Sol60,7%
GPT-5.6 Sol60,6%
Grok 4.759,4%
Gemini 3.7 Flash56,3%
GPT-6 Luna56,1%

Pogrubiono modele dodane do Devin 21 i 22 września. Wyniki opublikowane przez Cognition dla wariantu Extended.

🔗 Opus 5.5 w Devin · GPT-6 Sol i Luna w Devin · Grok 4.7 w Devin · Grok 4.7 w v0

Perplexity: Opus 5.5 i GPT-6 Sol w Computer, cztery modele w Agent API

Perplexity łączy obie premiery z suwakiem wysiłku wprowadzonym 17 września w Computer, swoim wieloetapowym agencie. Claude Opus 5.5 staje się poziomem Standard: w WANDR, wewnętrznym benchmarku kosztów i wydajności Perplexity, uzyskuje wynik 0,610 przy koszcie 4,13 dolara za zadanie, nieznacznie przewyższając Claude Fable 5.1 przy koszcie zadania niższym o 67,6%. GPT-6 Sol, dostępny również w aplikacji Perplexity, staje się domyślną opcją poziomu Light. W obu komunikatach nie sprecyzowano ani objętych planów, ani zastąpionych modeli.

Po stronie deweloperów wpis w changelogu API, datowany jedynie na wrzesień 2026 roku, dodaje do Agent API openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 i xai/grok-4.7, nie podając w nim cen.

🔗 Opus 5.5 w Computer · GPT-6 Sol w Computer · Changelog API Perplexity

Cursor i v0 udostępniają Opus 5.5

Cursor przedstawia go jako nowy najlepszy model w CursorBench, z wynikiem 57,8% przy maksymalnym wysiłku (Max) i kosztem zadania niższym o 40% od Opus 5: są to dane Anthropic, z określonym poziomem wysiłku. v0 udostępnia go bez szczegółów dotyczących cen.

🔗 Cursor na X · v0 na X


Anthropic zwiększa limity pięciogodzinne i oferuje reset do 22 października

22 września — Wraz z Opus 5.5 Anthropic zwiększa limity obliczane w pięciogodzinnych oknach dla planów Pro, Max, Team i Enterprise rozliczanych według liczby stanowisk (seat-based). Konto @ClaudeDevs określa skalę podwyżki dla Claude Code: od dziś limity pięciogodzinnych sesji rosną o 20%. Abonenci otrzymują również jeden reset limitu, który mogą zachować w rezerwie i uruchomić w wybranym momencie: jest dostępny w Ustawienia → Użycie (Settings → Usage) dla planów Pro, Max i Team i można go wykorzystać do 22 października.

Dochodzi do tego wpływ ceny: w Claude Code Opus 5.5 staje się domyślnym modelem w płatnych planach, a ponieważ jest tańszy niż Opus 5, pozwala wykorzystać limity pięciogodzinne i tygodniowe „o 25% efektywniej”. Opublikowany tego samego dnia przewodnik po kosztach precyzuje, że obniżka przekłada się na limity, w tym na kontekst w cache, ale dodatkowa obniżka ceny odczytów z cache dotyczy wyłącznie API.

🔗 @ClaudeDevs na X · Reset i limity


Codex CLI 0.156.0 domyślnie włącza obsługę głosu i worktrees

22 września — Wydany o 19:51 UTC Codex CLI 0.156.0 jest pierwszą stabilną wersją od 0.155.1 z 18 września; jego pełny changelog obejmuje 525 pull requests od wersji 0.155.0. Wprowadza do powszechnego użytku dwie funkcje, które w wersji 0.155 wciąż były eksperymentalne: rozmowy głosowe, z wbudowanymi silnikami audio dla systemów Linux i Windows, oraz worktrees, które centrum dowodzenia agentami potrafi otwierać jako sesje, filtrując zadania według statusu.

Nowość w wersjiPolecenie lub ustawieniePoprzedni stan w Codex CLI
Domyślne rozmowy głosoweF8, /voice settingseksperymentalne /voice (0.155.0, 17 września)
Domyślne worktreescentrum dowodzenia agentamieksperymentalne od wersji 0.154.0 (9 września)
Interfejs pełnoekranowy/tui, przy następnym uruchomieniubrak
Panel analytics/usageanalytics aplikacji desktopowej (18 września)
Lokalny serwer działający w tle/daemon, --no-daemonbrak

Interfejs pełnoekranowy wprowadza wyszukiwanie w transkrypcji, zaznaczanie myszą i kopiowanie prawym przyciskiem myszy; pojawia się też sześć wbudowanych motywów, a odpowiedzi bezpośrednio wyświetlają diagramy Mermaid i równania. Wersja usuwa również kilka luk w izolacji sandboxa (ruch przychodzący w systemie Windows, gniazda Unix app-servera, modyfikowalne fcntl w systemie macOS). Informacje o wydaniu nie wspominają o GPT-6: Sol i Luna wybiera się za pomocą /model lub --model.

🔗 Codex CLI 0.156.0


Agenci programistyczni w terminalu: Vibe CLI, Qwen Code i Amp

Vibe CLI 2.25.6 i 2.25.7

22 września — Mistral publikuje Vibe CLI 2.25.7 z sześcioma poprawkami, dzień po wersji 2.25.6 datowanej w CHANGELOGU na 21 września, lecz nigdy nieopublikowanej jako wydanie na GitHubie, która zawiera większość nowości (1 dodatek, 3 zmiany, 17 poprawek). Przy użyciu opcji --experimental-harness można załączać obrazy nawet wtedy, gdy aktywny model nie potrafi ich odczytać: model obsługujący obraz od tego samego dostawcy opisuje je agentowi, a klucz vision_model w config.toml pozwala narzucić inny model. Tak opisane zrzuty interfejsu zawierają kontrakt układu (layout contract), aby agent mógł odtworzyć ekran.

W zakresie bezpieczeństwa zaostrzono reguły dotyczące poleceń Git uruchamianych bez zatwierdzenia: bezpieczne operacje fetch nie dziedziczą już nadpisań ścieżek z konfiguracji Git, niezaufany checkout nie może już wybierać klienta SSH ani hooks, a ryzykowne opcje lub przekierowania shell przemycone do poleceń tylko do odczytu wymagają zatwierdzenia. Wersja 2.25.7 udostępnia wreszcie /teleport dla kluczy API Vibe i workspace, w tym dla bezpłatnych kont.

🔗 Vibe CLI v2.25.7 · CHANGELOG Vibe CLI

Qwen Code v0.24.4

22 września — Dzień po wersji v0.24.3 Qwen Code przechodzi do v0.24.4 z 13 funkcjami i 15 poprawkami, bez zmian niekompatybilnych wstecz. Serwer qwen serve otwiera teraz zdalne przestrzenie robocze przez SSH bez instalowania demona na maszynie docelowej, a sandbox bubblewrap (bwrap), wprowadzony w systemie Linux wraz z wersją v0.24.0, działa na poziomie wykonania każdego narzędzia. W Web Shell parowanie za pomocą kodu QR staje się domyślnie dostępne, gdy uwierzytelniony serwer nasłuchuje poza interfejsem loopback, z jednorazowymi zaproszeniami wygasającymi po 60 sekundach, a diffy edycji są wyświetlane przed zatwierdzeniem. W przypadku języka Java zarządzane wykonania narzędzi są przechowywane w bazie danych przez JDBC. Tego samego dnia pojawiła się również wersja v0.24.5-preview.0 ograniczona do dwóch poprawek.

🔗 Qwen Code v0.24.4

Runnery Amp tworzą Git worktrees

22 września — Pięć dni po umożliwieniu jednemu runnerowi obsługi wielu katalogów Amp uczy go tworzenia Git worktrees. W selektorze każde obsługiwane repozytorium oferuje opcję New Worktree: użytkownik naciska Tab, nadaje nazwę gałęzi, a wątek rozpoczyna się w nowym checkout utworzonym obok repozytorium (~/code/amp daje ~/code/amp-fix-flaky-login-test), bez ingerowania w główny checkout. Osobna akcja następnie archiwizuje wątek i usuwa worktree oraz gałąź. Runnery mogą również otrzymywać sekrety i zmienne środowiskowe (Secrets & Env Vars) skonfigurowane na ampcode.com: opcja ta jest domyślnie wyłączona, włącza się ją za pomocą --amp-env, a zmodyfikowana zmienna obowiązuje w następnym wątku, bez ponownego uruchamiania ani SSH.

🔗 Jeden runner, wiele worktrees


Oceny zewnętrzne: OpenAI ustala zasady, brytyjski AISI publikuje wyniki

22 września — Tego samego dnia ukazują się dwie publikacje dotyczące oceny modeli przez organizacje spoza laboratoriów.

OpenAI: cztery priorytety i siedem zasad dla niezależnych ewaluatorów

Podpisany przez Lamę Ahmad wpis zobowiązuje OpenAI do zapewnienia niezależnym ewaluatorom z sektora prywatnego lub organizacji non-profit pogłębionego dostępu do trenowania, oceny i wdrażania modeli, aby mogli kwestionować przyjęte założenia, wykrywać przeoczone zagrożenia i samodzielnie oceniać zabezpieczenia. Oceny te, odrębne od prac prowadzonych z rządami, trwałyby od kilku tygodni do kilku miesięcy i nie byłyby powiązane z premierą.

Obszar priorytetowyCo jest badane
Uzasadnienia bezpieczeństwa (safety cases)Argumentacja wykazująca, że ryzyka związane z modelem są kontrolowane, od trenowania po wdrożenie zewnętrzne
Krytyczne zabezpieczeniaOdporność na jailbreaki, zabezpieczenia cyber, monitory niedopasowania, niezawodność nadzoru nad łańcuchem rozumowania
Preparedness FrameworkTesty zdolności (ryzyko chemiczne i biologiczne, cyberbezpieczeństwo, samodoskonalenie AI) oraz dopasowanie
Incydenty niedopasowaniaNiezależne dochodzenia dotyczące krytycznych incydentów, z lipcowym incydentem Hugging Face przytoczonym jako przykład

Całość wyznacza siedem zasad: uzgodniony zakres i wcześniejsze zarejestrowanie twierdzeń, proporcjonalny dostęp, przejrzysta metoda, wiedza ekspercka i niezależność (z ujawnieniem konfliktów interesów), bezpieczeństwo i poufność, praktyczne ustalenia z czasem na wprowadzenie poprawek przed publikacją oraz odpowiedzialna publikacja określająca zasady redagowania poufnych treści. OpenAI twierdzi, że prowadzi rozmowy z kilkoma organizacjami, nie wymieniając żadnej z nich.

🔗 Priorytety i zasady skutecznych ocen zewnętrznych

UK AI Security Institute publikuje zweryfikowane wyniki za pośrednictwem EvalEval

EvalEval Coalition ogłasza na blogu Hugging Face, że UK AI Security Institute (AISI), brytyjska instytucja publiczna zajmująca się badaniem zagrożeń związanych z zaawansowaną AI, publikuje teraz wyniki swoich ocen w Evaluation Cards, otwartej platformie EvalEval, wraz z ich kontekstem i konfiguracją, we wspólnym formacie Every Eval Ever. Pierwsza publikacja obejmuje pięć benchmarków (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro i Terminal-Bench 2.0) zmierzonych na sześciu modelach: Claude Opus 4, 4.5 i 4.6 oraz GPT-5, GPT-5.2 i GPT-5.4, a także dwie oceny cyberbezpieczeństwa. Stawką jest odtwarzalność: zweryfikowane punkty odniesienia opublikowane wraz z konfiguracją pomagają zrozumieć, dlaczego dwa pozornie porównywalne wyniki się różnią.

🔗 Jak UK AISI i EvalEval zapewniają odtwarzalność wyników benchmarków


ChatGPT umożliwia śledzenie wyniku kredytowego Experian w Stanach Zjednoczonych

21 września — Nowa funkcja, ogłoszona przez konto @ChatGPT 21 września, umożliwia śledzenie swojego wyniku kredytowego w ChatGPT. W sekcji Finanse abonenci planów Plus i Pro w Stanach Zjednoczonych mogą połączyć swój raport kredytowy Experian oraz wynik VantageScore 3.0, otrzymywać spersonalizowane wyjaśnienia czynników wpływających na ten wynik i powiadomienia o jego zmianach. Funkcja jest dostępna w przeglądarce oraz w najnowszych wersjach aplikacji na iOS i Android.

OpenAI podaje konkretne zastosowania: ocena wpływu historii kredytowej na wniosek o wynajem, wybór karty kredytowej do spłacenia w pierwszej kolejności, budowanie historii kredytowej z czasem lub sprawdzanie, jak zdolność kredytowa i budżet wpływają na leasing samochodu albo kredyt hipoteczny. Funkcja uzupełnia narzędzia finansów osobistych udostępnione w maju w wersji preview amerykańskim abonentom planu Pro, wraz z połączeniem konta bankowego przez Plaid.

🔗 Ogłoszenie ChatGPT na X


Google: Colab trafia do planów Google AI, API Gemini ogranicza Gemini 2.5

Colab dołącza do planów Google AI

22 września — Abonenci Google AI otrzymują korzyści premium w Colab, w tym priorytetowy dostęp do szybszych akceleratorów i wydajniejszych maszyn. Abonenci planu Ultra zyskują dodatkowo nieprzerwane wykonywanie w tle i dostęp do GPU Premium, dzięki czemu długotrwały trening może dobiec końca bez konieczności pozostawiania otwartej karty. Wpis mówi o uruchomieniu „od dziś”, ale precyzuje, że korzyści będą wprowadzane w ciągu najbliższych tygodni w krajach, w których dostępny jest Colab. Według FAQ Colab jednostki obliczeniowe z planu Google AI oraz subskrypcji Colab Pro lub Pro+ sumują się na tym samym saldzie; plany Google One ograniczone do przestrzeni dyskowej i bezpłatne okresy próbne nie zapewniają tych korzyści. Ani wpis, ani FAQ nie podają liczby jednostek przydzielanych w ramach poszczególnych planów.

🔗 Colab jest teraz częścią Twojego planu Google AI · FAQ Colab

API Gemini ogranicza dostęp do Gemini 2.5

18 września — W notatce z 18 września informacje o wydaniu API Gemini ograniczają dostęp do modeli Gemini 2.5 do użytkowników, którzy aktywnie korzystali z nich w przeszłości, aby zagwarantować niezawodne działanie i zachować dostępne zasoby. Modele te nie zostały wycofane i będą nadal obsługiwane do odwołania: strona wycofywania nie podaje żadnej daty zakończenia obsługi dla gemini-2.5-pro, gemini-2.5-flash i gemini-2.5-flash-lite; jedynie gemini-2.5-flash-image przestanie działać 2 października 2026 roku. W przypadku każdego nowego projektu Google zaleca Gemini 3.5 Flash-Lite lub Gemini 3.8 Flash.

🔗 Informacje o wydaniu API Gemini · Strona wycofywania modeli Gemini


Hugging Face uruchamia pliki GGUF z llama.cpp w Transformers

22 września — Hugging Face umożliwia teraz wydajne uruchamianie w Transformers plików GGUF, formatu kwantyzacji llama.cpp. Wystarczy przekazać plik do from_pretrained (parametr gguf_file): wagi pozostają skompresowane w pamięci, a obliczenia przechodzą przez kernele Metal z ggml, dystrybuowane z Hubu przez bibliotekę kernels. Polecenie transformers serve udostępnia następnie model za pośrednictwem API zgodnego z OpenAI.

Początkowy zakres jest wąski: wyłącznie komputery Mac z Apple Silicon, architektura Qwen3.5 w wersjach dense i MoE (oraz zgodne checkpointy Qwen3.8), jedna rozmowa naraz i instalacja z gałęzi main. Cztery kernele pochodzą z ggml, a piąty, napisany przez Hugging Face, obsługuje routing ekspertów. Na MacBooku Pro M2 Max Hugging Face ocenia wydajność Transformers jako „zbliżoną” do llama.cpp, przy czym wartości podano tylko na wykresie, a pomiary nie są identyczne (po jednej stronie uwzględniono prefill, po drugiej tylko dekodowanie); zespół nadal zaleca llama.cpp do wydajnej lokalnej inferencji. Korzyść leży gdzie indziej: można pracować z plikiem GGUF za pomocą zwykłych narzędzi PyTorch albo wykorzystać zdekwantyzowany GGUF jako punkt wyjścia do fine-tuningu.

Wariant GGUF (Qwen3.5-4B, Unsloth)Rozmiar plikuWskazany kompromis
BF168,42 GBNieskwantyzowany punkt odniesienia
Q6_K3,53 GBWiększa precyzja
Q5_K_M3,14 GBKompromis między rozmiarem a precyzją
Q4_K_M2,74 GBZalecany punkt wyjścia do pracy lokalnej

🔗 Transformers uruchamia teraz kwantyzowane modele llama.cpp


Kimi: K3 w Amazon Bedrock i rozszerzenie przeglądarki pod nową nazwą

Kimi K3 trafia do Amazon Bedrock

22 września — Moonshot AI ogłasza udostępnienie Kimi K3 w Amazon Bedrock, choć karta AWS datuje tę premierę na 18 września. Model z otwartymi wagami, opublikowany pod koniec lipca z kontekstem miliona tokenów, korzysta tam z mechanizmów kontroli dostępu, szyfrowania i audytu Bedrock. Jest obsługiwany za pomocą amerykańskiej i globalnej inferencji międzyregionalnej (cross-Region inference) (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), a jego jawne buforowanie zaczyna się od 1024 tokenów na punkt pamięci podręcznej i trwa co najmniej 30 minut. Poziomy Priority (1,75-krotność ceny) i Flex (0,5-krotność) stosuje się do cen bazowych.

Opcja inferencji (poziom Standard)Dane wejściowe za milion tokenówDane wyjściowe za milion tokenówOdczyt z pamięci podręcznej
Inferencja globalna3,00 dolary15,00 dolarów0,30 dolara
Inferencja amerykańska3,30 dolara16,50 dolara0,33 dolara

🔗 Karta Kimi K3 w Amazon Bedrock · Kimi K3 w Bedrock, ogłoszenie na X

Kimi WebBridge zmienia nazwę na Kimi Browser Extension

22 września — Rozszerzenie przeglądarki, które pojawiło się w czerwcu wraz z Kimi Work, zmienia nazwę i zyskuje panel boczny, z którego można rozmawiać z Kimi, aby poruszał się po stronach, wypełniał formularze i realizował zadania do końca. Powtarzalne zadania konfiguruje się raz i zapisuje jako skill, z którego Kimi korzysta następnym razem; rozszerzenie dzieli również strony internetowe na polecenia. Lokalna usługa steruje już otwartą przeglądarką Chrome lub Edge za pośrednictwem Chrome DevTools Protocol, a Moonshot twierdzi, że sesje logowania i zawartość stron nie opuszczają urządzenia. Jedynie panel boczny wymaga konta Kimi.

🔗 Kimi Browser Extension · Kimi Browser Extension, ogłoszenie na X


SpaceXAI: Grok Bot przejmuje wzrost liczby zgłoszeń do działu wsparcia

22 września — SpaceXAI publikuje opis doświadczeń z własnym działem obsługi klienta, przebudowanym wokół Grok Bot, agenta działającego w narzędziach firmy. Odkąd Cursor dołączył do SpaceXAI 14 sierpnia, oba zespoły wsparcia zostały połączone i obsługują znacznie więcej produktów. Według wpisu liczba zgłoszeń wzrosła o 175% bez zatrudnienia choćby jednej osoby, podczas gdy być może trzeba byłoby przyjąć 200 pracowników; nie podano okresu pomiarowego.

Wdrożenie przebiegało stopniowo: Grok Bot, połączony z Plain do obsługi zgłoszeń i z Linear do obsługi incydentów, początkowo ograniczał się do wewnętrznych notatek, a każdą operację zapisu zatwierdzał człowiek. Następnie obsługiwał proste zgłoszenia, by już pod koniec pierwszego dnia odpowiadać klientom bezpośrednio. Obecnie prowadzi wstępne dochodzenie w sprawie każdego przychodzącego zgłoszenia, odtwarza problemy na nagraniach wideo dla zespołu inżynieryjnego i codziennie syntetyzuje ponad 20 000 opinii o produktach.

Wskaźnik opublikowany przez SpaceXAIPodana wartość
Wzrost liczby zgłoszeń do wsparcia+175%
Uniknięte zatrudnienia (szacunek)200
Koszt rozwiązania w klasycznych narzędziachod 1 do 4 dolarów
Najniższy koszt zgłoszenia z Grok Botod 0,20 do 0,30 dolara
Zwroty środków obsłużone bez udziału człowieka99%

🔗 Jak SpaceXAI wykorzystuje Grok Bot do skalowania obsługi klienta


Cognition: kurs na Amerykę Łacińską i nowe informacje o wydaniach Devin

Cognition rozwija działalność w Ameryce Łacińskiej z São Paulo

22 września — We wpisie swojego zespołu ds. Ameryki Łacińskiej Cognition wraca do ogłoszenia z poprzedniego tygodnia, dokonanego w MASP, Muzeum Sztuki w São Paulo: firma rozwija działalność w regionie, tworząc zespół z siedzibą w São Paulo i prowadząc rekrutację, między innymi inżynierów wdrażanych u klientów (deployed engineers). Opiera się na obecnych już klientach, wśród których są Itaú, Nubank, Santander, Natura i EBANX. Według Cognition w Itaú ponad 75% zespołów technologicznych korzysta z Devin, który udokumentował ponad 300 000 repozytoriów i automatycznie usunął około 70% podatności; w Nubank migracja monolitu liczącego kilka milionów linii miała skrócić się z kilku lat do kilku tygodni, przy koszcie ponad dwudziestokrotnie niższym. Są to wyniki opublikowane przez Cognition, bez niezależnego źródła.

🔗 Budowanie przyszłości inżynierii oprogramowania w Ameryce Łacińskiej

Informacje o wydaniu Devin z 21 września

21 września — Opublikowane po naszym poprzednim wydaniu informacje o wydaniu Devin wprowadzają SWE-2, model programistyczny Cognition wydany 10 września, jako wersję badawczą (research preview) w selektorze agentów: SWE-2 oraz poziom wysiłku (Medium, High lub Max) można wybrać na początku sesji lub w jej trakcie, a !swe2 umożliwia to samo w Slacku. Serwery MCP Microsoft 365 (Mail i Contacts, Calendar, To Do, OneDrive i SharePoint, Teams oraz katalog Entra ID) trafiają na marketplace MCP, domyślnie w trybie tylko do odczytu, jeśli nie skonfigurowano zakresu OAuth. Devin Review zostaje udostępniony dla Bitbucket Data Center, pluginy mogą mieć do 20 MiB i 2500 plików, a samodzielne CLI npx devin-review zostaje wycofane: już zainstalowane kopie przestają działać.

🔗 Informacje o wydaniu Devin z 21 września


Genspark wprowadza swój benchmark prezentacji do indeksu SII Fireworks AI

22 września — Fireworks AI uruchamia Specialized Intelligence Index (SII), indeks 20 benchmarków rzeczywistej pracy podzielonych na siedem dziedzin (bezpieczeństwo, prawo, finanse, obsługa klienta, oprogramowanie, zdrowie i produktywność) i opracowanych przez praktyków; Harvey, Doximity, Mercor, Sierra, Decagon i Genspark należą do dwunastu uczestniczących firm. Genspark Slides Benchmark, jedyny benchmark w kategorii produktywności, zleca jedenastu modelom tworzenie prezentacji na podstawie 200 rzeczywistych zadań w środowisku agenta Genspark Slides; oceny pochodzą z wewnętrznego ewaluatora Genspark. W odniesieniu do Gen-1 Slides, własnego modelu firmy, Genspark powtarza argument, że cena danych wejściowych wynosi około jednej siedemnastej ceny Claude Opus 5.

Oceniany modelWynik w indeksie SIIWynik we wpisie Genspark z 10 wrześniaKoszt prezentacji w indeksie
Claude Fable 5.183,6%poza tabelą, przewaga nad Gen-1 Slides o 0,003 w tekścienie podano
Gen-1 Slides82,2%0,8210,44 dolara
Claude Opus 581,0%0,8104,16 dolara
Claude Fable 579,9%poza tabeląnie podano
GPT-6 Astra78,0%poza tabeląnie podano
Kimi K372,6%0,7232,00 dolary
GPT-5.6 Sol67,0%0,6682,01 dolara
MiniMax M356,1%0,5630,34 dolara

🔗 Specialized Intelligence Index · Ogłoszenie Genspark


Runway uruchamia DIFFUSE, platformę rekrutacyjną dla twórców wyszkolonych w zakresie AI

22 września — Runway uruchamia DIFFUSE (diffuse.runway.com), otwartą platformę, na której marki, agencje i studia wyszukują, kontaktują się i zatrudniają osoby wyszkolone w obsłudze narzędzi generatywnej AI (AI-native talent). Twórcy, freelancerzy, butikowe studia i firmy produkcyjne mogą tworzyć tam profile i udostępniać portfolio; nie podano żadnych cen.

Runway opiera się na własnym badaniu ponad 1000 ofert pracy kreatywnej opublikowanych przez blisko 400 firm: 17% z nich wspomina o umiejętnościach związanych z AI lub narzędziach generatywnych, a według firmy Runway jest w nich zdecydowanie najbardziej poszukiwanym narzędziem wideo. Runway przyznaje, że AI częściowo wypiera zawody kreatywne, ale twierdzi, że wokół tych narzędzi powstaje nowa kreatywna siła robocza, na którą popyt rośnie.

🔗 Przedstawiamy DIFFUSE · Runway na X


NVIDIA dla programistów: Isaac ROS 5.0, DLSS 5 i RTX Mega Geometry 2.0

Isaac ROS 5.0 stawia na agentów

22 września — Isaac ROS 5.0, zaprezentowana na konferencji ROSCon w Toronto bezpłatna i open source’owa kolekcja akcelerowanych przez GPU pakietów ROS firmy NVIDIA, obsługuje ROS Lyrical i Ubuntu 24.04 oraz całą gamę Jetson, od Jetson Orin Nano po Jetson Thor. Główna nowość jest skierowana do agentów: wielokrotnego użytku skille Isaac do instalacji i obsługi, dokumentacja czytelna dla agentów, skill pomagający agentowi dostroić model widzenia stereoskopowego FoundationStereo do własnych kamer oraz autonomiczny skill chwytania i odkładania (pick and place). FoundationPose otrzymuje bibliotekę inferencyjną, która śledzi położenie i orientację obiektów nawet 5,5 raza szybciej, przy czym NVIDIA nie podaje punktu odniesienia.

🔗 Isaac ROS 5.0

DLSS 5 szczegółowo omówiony dla studiów, RTX Mega Geometry 2.0 już dostępne

22 września — DLSS 5, dostępny już w NBA 2K27, został szczegółowo opisany z myślą o programistach: jego renderowanie neuronowe sterowane danymi 3D (3D-Guided Neural Rendering) jest włączane na ostatnim etapie pipeline’u, zaczyna od obrazu wyrenderowanego przez silnik i wykorzystuje informacje o kolorze oraz wektory ruchu, aby deterministycznie, klatka po klatce, dodawać oświetlenie i szczegóły materiałów na jednej karcie GeForce RTX serii 50 w rozdzielczości do 4K. Studia mogą regulować intensywność struktury (Structure Intensity) i tonu (Tone Intensity) oraz korzystać z semantycznego maskowania przez AI. Ten sam wpis dodaje do ACE dwa modele mające po 600 milionów parametrów, Nemotron Speech 3.5 Streaming (rozpoznawanie mowy) i Qwen3 TTS (synteza mowy), publikuje RTX Kit 2026.3 i udostępnia RTX Mega Geometry 2.0 ze strumieniowaniem klastrów o ciągłym poziomie szczegółowości dla bardzo gęstych siatek.

🔗 Nowości dla twórców gier


NVIDIA i inferencja: wieloprocesorowy Dynamo-Triton oraz Confidential Computing na B200

Dynamo-Triton 26.07 obsługuje model rozłożony na osiem GPU

21 września — NVIDIA pokazuje, jak obsługiwać model TensorRT rozłożony na wiele GPU tak jak zwykły model. Wieloprocesorowa inferencja TensorRT (multi-device inference), w pełni obsługiwana od TensorRT 11.0, wykorzystuje NCCL; Dynamo-Triton 26.07, dawniej Triton Inference Server, aktywuje ją w swoim backendzie TensorRT, a aplikacja wywołuje tylko jeden endpoint gRPC. W przypadku generowania wideo za pomocą Cosmos 3 Nano (1280×720, 189 klatek, 35 kroków) opóźnienie end-to-end spada ze 156,6 sekundy na jednym GPU do 34,2 sekundy na ośmiu, czyli jest 4,58 raza mniejsze. NVIDIA zaznacza, że test nie mierzy ani przepustowości przy jednoczesnych żądaniach, ani kosztu jednego filmu.

Testowana konfiguracjaLiczba GPUŚrednie opóźnienie end-to-end
Pojedynczy GPU1156,595 s
CP2287,999 s
CP4453,093 s
CP8834,183 s

🔗 Dynamo-Triton i wieloprocesorowy TensorRT

Poufna inferencja na B200 zachowuje ponad 96% przepustowości

22 września — NVIDIA mierzy narzut swojego rozwiązania Confidential Computing na platformie Blackwell, które uruchamia obciążenia w maszynach wirtualnych z szyfrowaną pamięcią, poufnymi GPU i szyfrowanym NVLink. Na DGX B200 (osiem GPU, platforma Intel TDX), obsługującym DeepSeek-R1 w NVFP4 za pomocą TensorRT LLM, przy 32 000 tokenów wejściowych i 1000 wyjściowych tryb poufny zachowuje od 96,1 do 98,2% przepustowości i wydłuża średni czas przypadający na token wyjściowy tylko o 1,2–4,3%, przy od 1 do 16 jednoczesnych żądań. Konieczne były trzy modyfikacje frameworka: pamięć stronicowalna zamiast przypiętej dla niektórych transferów, wewnętrzny licznik GPU dla autotunera kerneli oraz inne algorytmy komunikacji ze względu na brak multicastu NVLink SHARP w tym trybie. Obciążenie dobrano tak, aby uwidocznić narzut; NVIDIA zaleca porównanie obu trybów na własnym obciążeniu.

🔗 Confidential Computing i TensorRT LLM


W skrócie

  • Zed przygotowuje Deltę — Zed zapowiada na ten tydzień, choć funkcje nie są jeszcze dostępne, kolory do grupowania wątków Delty — wieloosobowego środowiska programistycznego z agentami — oraz wskaźnik pokazujący, ile pozostało do automatycznej kompakcji kontekstu. 🔗 źródło
  • Replit i Handshake — Replit jest partnerem założycielskim AI Skills Studio firmy Handshake: trzy bezpłatne, 45-minutowe zadania prowadzą do projektu wyświetlanego w profilu Handshake; wśród pozostałych partnerów są OpenAI (10 zadań), Google, Figma i Vercel. 🔗 źródło
  • oMLX dołącza do Hugging Face — Jun Kim, twórca oMLX, projektu z ekosystemu MLX firmy Apple, dołącza do Hugging Face; projekt pozostaje na licencji Apache 2.0 i nadal jest przez niego kierowany, zyskuje stałe utrzymanie oraz finansowanie, a jego pierwszym celem jest szybsze przenoszenie modeli Transformers do MLX. 🔗 źródło
  • SnowLLM — Wpis społecznościowy: ten silnik inferencyjny na licencji Apache-2.0 (jądra dostarczane binarnie), napisany dla GPU w Ryzen AI Max, według autorów dekoduje do 2,3 raza szybciej niż llama.cpp (1,9 raza bez dekodowania spekulatywnego), a wypełnianie wstępne wykonuje do 9,4 raza szybciej. 🔗 źródło
  • DecisionBench i Bosun v3.1 — Hanno Labs publikuje DecisionBench 1.0 (43 zadania, 28 dziedzin) oraz dwa modele decyzyjne z otwartymi wagami oparte na Qwen3 (0,6 i 1,7 miliarda parametrów), osiągające 83,20% i 87,29% w autorskim zestawie testów praktycznych; Jev wyprzedza je w kategorii rozumowania. 🔗 źródło
  • Moshi z 600 milionami parametrów — Deweloper opisuje próbę stworzenia pełnodupleksowego modelu głosowego opartego na Qwen3-0.6B-Base, trenowanego na B200 za 2–15 dolarów na próbę: tekst osiąga zbieżność, lecz głos pozostaje zniekształcony, a problem zlokalizowano w szczegółowych codebookach akustycznych. Projekt został wstrzymany, nie opublikowano żadnych wag. 🔗 źródło
  • Together AI i GLM-5.2 — W studium przypadku z 18 września, ponownie opublikowanym na X 21 września, Together AI opisuje firmę fintech, która obsługuje swoje agenty programistyczne za pomocą GLM-5.2 z kontekstem 256K na 56 układach B200; incydent powodujący oczekiwanie w kolejce od 1 do 3 minut usunięto tego samego dnia przez rekonfigurację routingu. 🔗 źródło
  • Gemini CLI — Wersja nightly z 22 września, pierwsza zawierająca nowy kod od 19 września, naprawia awarię HttpsProxyAgent is not a constructor występującą z Vertex AI za proxy i wysyła aktualizację tool_call przed żądaniem uprawnienia w trybie ACP. 🔗 źródło
  • Google Flow — Oficjalne konto informuje o ponad 25 milionach użytkowników miesięcznie i przedłuża dla wszystkich ofertę dodatkowych 50 kredytów dziennie, która w lipcu była dostępna dla subskrybentów Google AI do 31 sierpnia. 🔗 źródło
  • Jigsaw i Sensemaking AI — Inkubator Google uruchamia Partner Program, aby wdrożyć swój oparty na Gemini pakiet open source do konsultacji obywatelskich w 30 miastach, stanach i państwach, wraz z funduszem od Google.org, Bloomberg Philanthropies i Packard Foundation, którego wartości nie ujawniono. 🔗 źródło
  • 100 000 stypendiów szkoleniowych — Przy okazji Zgromadzenia Ogólnego ONZ Google finansuje 100 000 stypendiów na certyfikowane szkolenia z AI w ponad 80 krajach za pośrednictwem AI Skills Coalition działającej w ramach programu AI for Good ITU; stypendia będą rozdzielane przez lokalne rządy i sieć Giga. 🔗 źródło
  • Agenci zabezpieczający kod Google — We wpisie z 19 września Google wyjaśnia, że przed przesłaniem każdej zmiany w kodzie swojej infrastruktury analizuje ją za pomocą agentów zbudowanych na otwartym środowisku Mantis, które blokują setki luk miesięcznie; agent klasyfikujący ma osiągać ponad 92% precyzji w czasie krótszym niż minuta. 🔗 źródło
  • Copilot CLI 1.0.88 — Ustawienia zarządzane przez przedsiębiorstwo mają teraz zastosowanie do sesji --acp, --ahp-host i --server, które wcześniej nie podlegały zasadom MCP, uprawnieniom ani pluginom, a /fork działa w trakcie jednej tury; wersja 1.0.87 z 21 września dodała ustawienia zarządzane dla poziomu routingu Auto. 🔗 źródło
  • Pika i Seedance 2.5 — Tryb Draft modelu Seedance 2.5 trafia do Pika i Pika API Club: szkice klipów od 10 centów za sekundę, które można następnie sfinalizować w wysokiej jakości. 🔗 źródło
  • Pika Swap Anything — Nowa aplikacja Pika zastępuje aktorów, kostiumy, scenografię lub rekwizyty w filmie, zachowując rytm, ruchy i narrację oryginalnego ujęcia; ceny nie podano. 🔗 źródło
  • Suno Studio — Stacja produkcji muzycznej Suno otrzymuje pakiet efektów dźwiękowych, w tym kompresor (próg, ratio, attack, release, sidechain), dostępny w ramach subskrypcji Premier. 🔗 źródło
  • Sluicebox i Nemotron 3 Ultra — Studium przypadku NVIDIA: po przejściu na Nemotron 3 Ultra ten startup analizujący ślad węglowy łańcuchów dostaw obniżył koszty inferencji o 51–80% i osiągnął 87,7% skuteczności ekstrakcji danych dostawców wobec 84% w przypadku poprzedniego modelu. 🔗 źródło
  • Topograph — Zestaw narzędzi open source firmy NVIDIA, który wykrywa topologię sieciową klastra GPU i udostępnia ją systemom Kubernetes, Slurm i Slinky, aby rozmieszczać rozproszone obciążenia możliwie blisko siebie; odczytuje API usług Crusoe, Google Cloud, Lambda, Nebius, Nscale i Oracle Cloud. 🔗 źródło
  • Ocena agenta — We wpisie metodologicznym z 21 września NVIDIA proponuje sześć metryk, od wywołania narzędzia po wykonanie zadania, i wskazuje, że Nemotron 3.5 Lightning osiąga 86% w PinchBench, działając o 30% szybciej niż Qwen3.6 35B. 🔗 źródło
  • Qwen-Image-2.1 na Intel — Ogłoszone przez Intel 21 września i udostępnione dalej przez Qwen 22 września wsparcie od pierwszego dnia za pośrednictwem OpenVINO jest przeznaczone dla GPU Arc Pro B70 oraz zintegrowanych GPU w Core Ultra Series 3; udostępniono także specjalny notebook. 🔗 źródło
  • Box i Grok 4.7 — 21 września, w dniu premiery Grok 4.7, Box przetestował go we wczesnej wersji Box Agent na przykładzie szkody o wartości 2 milionów dolarów: wykryto podwójną fakturę na 82 000 dolarów oraz brakującą notę uznaniową na 64 000 dolarów; nie podano ani daty dostępności, ani ceny. 🔗 źródło
  • Chirurg i Codex — OpenAI Developers publikuje film, w którym Brian Pridgen, chirurg ręki, pokazuje, jak tworzy własne narzędzia za pomocą Codex i przegląda literaturę naukową w PubMed; nie przedstawiono danych liczbowych ani pisemnego opracowania. 🔗 źródło
  • ChatGPT w Wordzie — Ogłoszono 17 września: jeden dodatek Microsoft zapewnia dostęp do ChatGPT w Wordzie, Excelu i PowerPoincie na całym świecie i we wszystkich planach, w tym Free, z limitami użytkowania; użytkownicy Business i Enterprise otrzymują bezpłatny dostęp do wersji zapoznawczej GPT-5.6 Sol w Wordzie do 30 września. 🔗 źródło
  • Kompetencje w zakresie AI — Perplexity publikuje przewodnik, który uznaje ocenianie odpowiedzi za kluczową umiejętność, krytykuje „teatr szkoleniowy” i przytacza dane Gallupa: deklarowana adopcja wyniosła 38%, lecz codzienne użycie w czwartym kwartale 2025 roku zaledwie 12%. 🔗 źródło

Co to oznacza

Tego samego dnia Anthropic i OpenAI broniły tego samego argumentu: nie chodzi o potężniejszy model za wszelką cenę, lecz o poziom zbliżony do ich najwyższej klasy za znacznie mniej. Opus 5.5 przedstawiono jako dorównujący Fable 5.1 przy cenie o 40% niższej niż Opus 5, a GPT-6 Sol jako oferujący znaczną część mocnych stron Astry za 2 i 10 dolarów za milion tokenów. Obie firmy myślą teraz w kategoriach kosztu zadania, a nie ceny tokena, i uznają cache za prawdziwą dźwignię: odczyty po 0,20 dolara w Anthropic oraz zniżka do 90% i jawne punkty przerwania w OpenAI.

Integrację mierzy się natomiast w godzinach. GitHub Copilot, Devin, Perplexity, Cursor i v0 udostępniły nowe modele jeszcze tego samego dnia, każde z własnym miernikiem: FrontierCode 1.1 Extended w Cognition, WANDR w Perplexity i CursorBench w Cursor. Wyniki te nie są bezpośrednio porównywalne (65,3% dla Opus 5.5 w wariancie Extended i 54,4% w wariancie Main), a żaden z dwóch producentów nie porównuje jeszcze swojego nowego modelu z modelem konkurenta. Deweloper powinien coraz częściej oceniać właściwy wybór we własnym narzędziu i na własnych zadaniach, a nie na podstawie tabel prezentowanych podczas premiery.

Plany subskrypcyjne również stają się polem rywalizacji. Anthropic zwiększa limity w pięciogodzinnych okresach, oferuje ich reset i przełącza plany Pro oraz Team Standard na Opus w Claude Code; GitHub rezerwuje Opus 5.5 dla wyższych planów, ale udostępnia GPT-6 Luna już od Copilot Pro; Google włącza Colab do planów Google AI, jednocześnie ograniczając Gemini 2.5, aby zachować dostępną moc obliczeniową. Podział zasobów obliczeniowych między plany ma dziś równie duże znaczenie jak wyświetlana cena.

Wreszcie zmienia się sam sposób pomiaru. Anthropic przyznaje, że różnice w benchmarkach są mniej miarodajne niż wcześniej i że Opus 5.5 często zdaje się wiedzieć, iż jest oceniany; OpenAI określa zasady udostępniania swoich modeli niezależnym ewaluatorom; brytyjski AISI zapewnia powtarzalność wyników za pomocą EvalEval, a NVIDIA proponuje oceniać agenta na podstawie wykonanego zadania, nie każdego wywołania narzędzia. Sprawdzenie, co model rzeczywiście robi, ma dziś równie duże znaczenie jak jego wynik.


Źródła