Szukaj

Claude Code czyta AGENTS.md, nadchodzi Qwen3.8-Omni-Flash, Codex testuje rozmowy głosowe

ai-powered-markdown-translator

Artykuł przetłumaczony z fr na pl za pomocą gpt-5.6-sol.

Zobacz projekt na GitHubie ↗

W ten piątek narzędzia agentowe zbliżają się do wspólnych formatów: Claude Code odczytuje teraz AGENTS.md, gdy projekt nie ma CLAUDE.md, Antigravity wstrzykuje katalog podagentów do promptu systemowego swoich agentów Markdown, Codex szczegółowo przedstawia zużycie zasobów przez poszczególne podagenty, a MiniMax udostępnia kod swojego agenta terminalowego. Resztę dnia wypełniają premiery dwóch modeli — Qwen3.8-Omni-Flash i Grok Voice Transcribe 2.0 — oraz nietypowe partnerstwo: Anthropic umieszcza ewaluatorów Accenture wewnątrz własnej firmy.


Claude Code czyta AGENTS.md, izoluje podagentów i usuwa TaskOutput

18 września — W ciągu dwudziestu godzin ukazały się trzy wersje Claude Code: 2.1.275 17 września o 22:33 UTC, 2.1.276 18 września o 02:12 UTC i 2.1.277 18 września o 18:06 UTC.

Najbardziej znacząca zmiana mieści się w jednym wierszu informacji o wersji 2.1.277. W projekcie pozbawionym CLAUDE.md Claude Code odczytuje AGENTS.md, plik instrukcji, który stał się wspólną konwencją dla kilku dostępnych na rynku agentów programistycznych. Ustawienie można zmienić w /config, w sekcji „Instrukcje projektu”. Funkcja nie jest jeszcze dostępna w Bedrock, Vertex ani Foundry.

Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)

🇵🇱 Dodano obsługę AGENTS.md: w projekcie bez CLAUDE.md Claude Code odczytuje zamiast niego AGENTS.md; ustawienie można zmienić w sekcji „Instrukcje projektu” w /config (funkcja nie jest jeszcze dostępna w Bedrock, Vertex ani Foundry). — CHANGELOG Claude Code, anthropics/claude-code

Dwie inne zmiany w tej samej wersji dotyczą bezpieczeństwa kontekstu. Wyniki podagentów trafiają do agenta głównego pod nagłówkiem oznaczającym je jako takie, aby tekst zwrócony przez podagenta nie mógł zostać uznany za instrukcję sesji; z promptów usuwane są też niewidoczne znaki formatujące Unicode, a oczyszczona wersja jest wyświetlana przed wysłaniem. Wersja 2.1.277 usuwa również przestarzałe narzędzie TaskOutput: Claude odczytuje teraz plik wyjściowy zadania działającego w tle za pomocą Read.

Wersja 2.1.275 dodaje klawisz natychmiastowego wysyłania (ctrl+enter), który przerywa bieżącą turę i jednocześnie wysyła wszystkie wiadomości z kolejki, a także synchronizację z terminalem skills i plugins aktywowanych na koncie claude.ai. W zakresie łańcucha dostaw plugins pochodzące z npm są pobierane przez npm pack --ignore-scripts z weryfikacją integralności, co uniemożliwia uruchamianie skryptów instalacyjnych pakietu. Wersja 2.1.276, opublikowana niespełna cztery godziny później, naprawia tylko regresję z tej wersji: błąd 400 powodujący niepowodzenie wszystkich żądań przesyłanych przez proxy.

Numer wersjiPublikacja (UTC)Najważniejsza zawartość
2.1.27517.09 o 22:33Natychmiastowe wysyłanie, synchronizacja skills z claude.ai, npm --ignore-scripts
2.1.27618.09 o 02:12Pojedyncza poprawka: błąd 400 za proxy
2.1.27718.09 o 18:06Obsługa AGENTS.md, izolacja podagentów, usunięcie TaskOutput

🔗 Informacje o wersji 2.1.277


Qwen3.8-Omni-Flash, pierwszy agentowy model omni-modalny Qwen

18 września — Qwen publikuje Qwen3.8-Omni-Flash, przedstawiany jako pierwszy model omni-modalny firmy zaprojektowany wokół możliwości agentowych. Zapowiadana zmiana nie dotyczy już rozumienia treści multimodalnych, lecz ich wykorzystania: zrozumienia treści, zaplanowania zadania, wykonania go za pomocą narzędzi i dostarczenia rezultatu. Model przyjmuje tekst, obrazy, dźwięk i wideo w oknie kontekstowym liczącym milion tokenów.

Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!

🇵🇱 Oto Qwen3.8-Omni-Flash, pierwszy model omni-modalny Qwen zbudowany wokół możliwości agentowych.@Alibaba_Qwen na X

W 29 ewaluacjach wybranych przez Qwen średni wynik wzrasta o ponad 25% względem Qwen3.5-Omni-Plus, przy czym największe postępy dotyczą agentów audio-wideo. Największa zmiana nastąpiła w rozpoznawaniu wielu mówców.

Wybrana ewaluacjaQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71,034,558,9
UniClawBench69,667,169,0
AgenticVBench36,814,545,0
OmniVideoBench63,453,865,2
StreamingBench80,857,179,9
AliMeeting DER / cpWER (mniej znaczy lepiej)3,4 / 17,288,1 / 89,672,6 / 53,1

Najbardziej oryginalnym elementem jest percepcja agentowa zastosowana do długich materiałów wideo. Zamiast przetwarzać nagranie od początku do końca, model wychodzi od zadanego pytania, sam decyduje, co obejrzeć i czego posłuchać, oraz lokalizuje informacje w kolejnych przejściach od ogółu do szczegółu. W OmniVideoBench tryb ten zwiększa dokładność z 63,4 do 67,8, jednocześnie zmniejszając zużycie ze 145 736 do 79 117 tokenów na żądanie, czyli o około 45,7% — jest to wartość podana wprost w oficjalnym wpisie.

W ślad za tym idą ceny: zgodnie z metodologią Qwen cena za godzinę wejściowego dźwięku spada o ponad 98% względem Qwen3.5-Omni-Plus. Jednocześnie udostępniono dwa komponenty: Qwen-MM-Plugins, zgodny z harnessami Codex, Claude Code, Qwen Code i Gemini CLI, oraz Qwen-Live Harness do interakcji w czasie rzeczywistym. Wariant Realtime jest przeznaczony do ciągłej interakcji o niskim opóźnieniu, z pierwszym tokenem po 591–981 milisekundach.

🔗 Wpis Qwen o Qwen3.8-Omni-Flash


Codex CLI 0.155.0 eksperymentalnie wprowadza rozmowy głosowe

17 września — OpenAI publikuje Codex CLI 0.155.0, pierwszą stabilną wersję od wydania 0.154.0 z 10 września, instalowaną przez npm install -g @openai/codex@0.155.0. To brakująca pozycja w changelogu agenta głosowego zapowiedzianego dzień wcześniej na X: funkcja nosi nazwę /voice, oferuje transkrypcję na żywo i sterowanie mikrofonem oraz pozostaje eksperymentalna — jest dostępna tylko w obsługiwanych kompilacjach (supported builds) i trzeba ją aktywować przez /experimental.

Pozostała część wydania jest mniej efektowna, ale bardziej bezpośrednio użyteczna. Interfejs terminalowy otrzymuje podsumowania rozumowania na żywo w wierszu stanu oraz znacznik czasu zakończenia po każdej pomyślnie ukończonej turze. Widok agentów pozwala ukrywać, archiwizować i usuwać zadania, pokazuje szczegóły własności worktrees i prosi o potwierdzenie przed usunięciem czystych, zarządzanych worktrees. Na zgodnych komputerach Mac żądania MCP z lokalnych sesji TUI można zatwierdzać za pomocą Touch ID. Amazon Bedrock może pobierać dane uwierzytelniające AWS ze skonfigurowanych poleceń, z obsługą pamięci podręcznej, odświeżania po wygaśnięciu i ponawiania po nieudanym uwierzytelnieniu.

Kilka poprawek dotyczy bezpieczeństwa: zablokowano ucieczki procesów Windows z ograniczonych sandboxów WSL, wzmocniono pośredniczone snapshoty powłoki przed ujawnieniem danych uwierzytelniających, a zmiana konta unieważnia sesje zdalnego sterowania, zapisany w pamięci podręcznej stan WebSocket oraz katalogi modeli należące do poprzedniej tożsamości.

Nowość w wersjiSzczegóły
/voiceTranskrypcja na żywo i sterowanie mikrofonem, eksperymentalnie przez /experimental
Interfejs terminalowyPodsumowania rozumowania w wierszu stanu, znacznik czasu zakończenia tury
Widok agentówUkrywanie, archiwizowanie i usuwanie zadań, własność worktrees
Touch IDZatwierdzanie żądań MCP w sesji lokalnej na zgodnych komputerach Mac
Amazon BedrockDane uwierzytelniające AWS pobierane poleceniem, z cache i odświeżaniem

🔗 Informacje o wersji Codex CLI 0.155.0

Codex szczegółowo przedstawia zużycie według zadania, podagenta i rozmowy

18 września — OpenAI Developers zapowiada szczegółowe śledzenie zużycia w Codex: narzędzie pokazuje, w jaki sposób zadania, podagenty i poszczególne rozmowy składają się na całkowite użycie. Informacje znajdują się w aplikacji desktopowej, w Ustawieniach, a następnie w sekcji Użycie i rozliczenia dla kont osobistych i Business lub w sekcji Użycie dla kwalifikujących się kont Enterprise; aby z nich korzystać, trzeba mieć aktualną wersję. Zapowiedzi nie towarzyszy żaden wpis na blogu ani pozycja w changelogu.

Najważniejsza jest szczegółowość. Do tej pory wyczerpany limit nie wskazywał źródła zużycia; rozbicie według podagentów pozwala ustalić, która delegacja jest kosztowna, i ją przepisać. To księgowy odpowiednik upowszechnienia podagentów w harnessach programistycznych.

🔗 Zapowiedź OpenAI Developers na X


Grok Voice Transcribe 2.0, rozpoznawanie mowy SpaceXAI w niezmienionej cenie

18 września — SpaceXAI zapowiada Grok Voice Transcribe 2.0, swój nowy model rozpoznawania mowy (speech-to-text), opisywany jako dwukrotnie dokładniejszy od wersji 1.0 przy tej samej cenie. Model opiera się na fundamencie audio, który już zasila Grok Voice, przetwarzający według firmy dziesiątki tysięcy połączeń z obsługą klienta dziennie i transkrybujący miliony godzin narracji wideo.

Główny argument dotyczy rzeczywistych nagrań, a nie dźwięku laboratoryjnego: niestabilnych linii telefonicznych, nakładających się głosów, lokalnych akcentów oraz numerów telefonów i adresów e-mail dyktowanych na głos. SpaceXAI deklaruje pierwsze miejsce pod względem dokładności wśród 32 modeli strumieniowych w publicznym rankingu Artificial Analysis i opiera się na czterech wewnętrznych zbiorach pochodzących z ruchu produkcyjnego — telefonii 8 kHz, rozmowach z Grok, dyktowanych identyfikatorach oraz krótkich poleceniach głosowych w 19 językach.

Największa poprawa dotyczy wielojęzyczności. W zbiorze krótkich zdań, które dostarczają najmniej kontekstu do rozpoznania języka, współczynnik błędów słów spada z 20,6% do 6,8%. Model automatycznie wykrywa język i śledzi jego zmiany w trakcie nagrania w jednym przebiegu.

Zmierzona metrykaDeklarowana wartość
Deklarowana dokładność względem Transcribe 1.0dwukrotnie wyższa
Ranking Artificial Analysis (tryb strumieniowy)1. miejsce wśród 32 modeli
Współczynnik błędów dla krótkich zdań (1.0 → 2.0)20,6% → 6,8%
Cena przetwarzania wsadowego0,10 dolara za godzinę dźwięku
Cena przetwarzania strumieniowego0,20 dolara za godzinę dźwięku
Kanały transkrybowane niezależniedo 8
Terminy branżowe na żądaniedo 100

Model obsługuje przetwarzanie wsadowe i strumieniowe, znaczniki czasu na poziomie słów z wynikiem ufności, rozdzielanie mówców (diarization) bez dodatkowych opłat oraz wykrywanie końca tury wypowiedzi. Istniejące integracje API otrzymują większą dokładność bez zmiany kodu. Grok Voice Transcribe 2.0 wkrótce stanie się domyślnym modelem API, a wersja 1.0 zostanie uznana za przestarzałą w nadchodzących tygodniach: aby przy niej pozostać, trzeba będzie przypiąć grok-voice-transcribe-1.0.

🔗 Zapowiedź Grok Voice Transcribe 2.0


Anthropic umieszcza ewaluatorów Accenture wewnątrz firmy

18 września — Anthropic ogłasza partnerstwo z Accenture dotyczące niezależnej ewaluacji modeli frontier, przedstawiane jako ważny krok w realizacji zobowiązania dyrektora generalnego do przyjmowania zintegrowanych ewaluatorów (embedded). Prace poprowadzi Faculty, spółka zależna Accenture specjalizująca się w AI, i obejmą ewaluację oraz red-teaming modeli, ewaluacje alignmentu i testowanie guardrails.

Różnica względem ewaluatorów zewnętrznych jest wyraźna: zintegrowany ewaluator pracuje wewnątrz firmy AI i ma dostęp porównywalny z dostępem pracownika. Może obserwować modele podczas trenowania, śledzić decyzje dotyczące ich budowy i wdrażania, rozmawiać bezpośrednio z pracownikami, sprawdzać przestrzeganie zobowiązań w zakresie bezpieczeństwa, zgłaszać incydenty i publikować lepiej udokumentowany opis korzyści oraz zagrożeń. Anthropic podkreśla, że rozwiązanie to nie zmniejsza odpowiedzialności firmy, lecz ułatwia jej weryfikację.

Zapowiedź jest wyjątkowo szczera w kwestii tego, czego jeszcze nie ma. Nie istnieją żadne standardy dotyczące informacji, do których zintegrowany ewaluator powinien mieć dostęp, sposobu publikowania ustaleń ani systemu finansowania niezależnej ewaluacji. Anthropic uważa, że docelowo finansowanie powinno pochodzić ze wspólnych lub publicznych funduszy; ponieważ taki mechanizm obecnie nie istnieje, firma bezpośrednio finansuje pracę Accenture — co stanowi najbardziej widoczne ograniczenie tego rozwiązania.

Element partnerstwaDeklarowana wartość
Podmiot realizującyFaculty, spółka AI należąca do Accenture
InwestycjaCo najmniej 1 miliard dolarów na stronę w ciągu pięciu lat
ZakresEwaluacja, red-teaming, alignment, guardrails
Poziom dostępuPorównywalny z dostępem pracownika
FinansowanieBezpośrednio przez Anthropic z braku wspólnych funduszy
WyłącznośćBrak po obu stronach

Anthropic informuje ponadto, że prowadzi rozmowy z METR i innymi ewaluatorami non-profit w sprawie eksperymentowania z elementami zintegrowanej ewaluacji w ramach ich własnego finansowania, oraz zapowiada kolejnych partnerów w nadchodzących tygodniach.

🔗 Zapowiedź Anthropic dotycząca zintegrowanej ewaluacji


Antigravity: trzy wersje w dwa dni poświęcone niestandardowym agentom

Google opublikował kolejno dwie wersje swojego CLI i jedną wersję aplikacji Antigravity. Wszystkie trzy podejmują ten sam temat z trzech perspektyw: co wie niestandardowy agent, czego może odmówić i jak długo może działać bez nadzoru. Stanowią kontynuację intensywnej serii rozpoczętej 11 września, której wersje od 1.2.1 do 1.2.4 nie zostały tutaj uwzględnione.

CLI 1.2.6 udostępnia Remote Control powiązany z sesją i znosi limit pięciu minut

18 września — Osiem dni po wersji 1.2.0, która przekształciła CLI w trwałą usługę systemową, Google obiera przeciwny kierunek, wprowadzając drugą, znacznie lżejszą formę Remote Control: połączenie ograniczone do sesji (session-scoped), otwierane za pomocą flagi --remote-control podczas uruchamiania lub polecenia /remote-control w trakcie działania. Wpisanie /remote-control off lub zamknięcie sesji usuwa tunel i urządzenie z listy. Podczas gdy wersja 1.2.0 stawiała na demona działającego po zakończeniu sesji, 1.2.6 zmierza w przeciwnym kierunku.

Druga zmiana dotyczy trybu bez interfejsu (headless): domyślny limit czasu wykonań -p / --prompt zostaje wydłużony z pięciu minut do nieograniczonego czasu, chyba że jawnie podano --print-timeout. Trzecia porządkuje raportowanie błędów — w przypadku awarii agenta lub API CLI zapisuje na standardowym wyjściu błędów wiersz JSON AGY_ERROR: {...} zawierający kanoniczny status, kod HTTP lub gRPC, informację o możliwości ponowienia oraz identyfikator błędu, a kod wyjścia zmienia się z 1 na 3. Skrypt orkiestrujący może więc odróżnić tymczasową awarię sieci od trwałego błędu bez analizowania swobodnego tekstu.

CLI 1.2.5 wreszcie udostępnia agentom Markdown katalog ich podagentów

17 września — Dotychczas niestandardowy agent zdefiniowany w Markdown mógł zadeklarować invoke_subagent w swoich narzędziach, ale nie wiedział, jakie podagenty istnieją: miał narzędzie, lecz nie katalog. CLI dodaje teraz automatycznie do jego promptu systemowego katalog dostępnych podagentów oraz instrukcję ich użycia, dzięki czemu delegowanie faktycznie działa.

Terminologia changelogu wymaga zastrzeżenia: jest to dodanie kontekstu przez sam produkt, a nie luka bezpieczeństwa ani poprawka. Drugie usprawnienie zachowuje jawną nazwę zadania wysłanego do pracy w tle, która wcześniej ginęła między powiadomieniami a listami zadań. Pięć poprawek obejmuje usuwanie unieważnionych identyfikatorów, kody wyjścia przerwanych poleceń oraz ramki rozumowania, które pozostawały zawieszone.

Antigravity 2.15.0 pozwala niestandardowym agentom wyłączać domyślne prompty i narzędzia

18 września — Trzy dni po wersji 2.14.0 aplikacja publikuje 7 usprawnień i 16 poprawek. Główna zmiana daje niestandardowym agentom kontrolę nad ich własnym kontekstem: mogą wyłączać domyślne sekcje promptu i domyślne narzędzia, a następnie ponownie wprowadzać tylko te, których potrzebują. W przypadku wyspecjalizowanego agenta odpowiednio ogranicza to narzucony prompt systemowy.

Pozostałe zmiany dotyczą nawigacji i trwałości ustawień: Page Up, Page Down, Home i End przewijają rozmowę, Escape przenosi fokus poza pole wprowadzania, a wybrany niestandardowy agent jest zapamiętywany po ponownym wczytaniu. Dwie poprawki dotyczą integralności danych — zapisane ustawienia i lista projektów mogły zostać nadpisane, gdy aplikacji nie udało się odczytać pliku stanu, a ustawienia uprawnień gromadziły duplikaty, przez które rosły pliki rozmów.

🔗 Changelog Antigravity


GitHub Copilot: canvas Sentry, sześć wycofanych modeli i metryki według personalizacji

Trzy wpisy w changelogu opublikowane w ciągu dwóch dni pokazują tę samą troskę: mierzyć, jak zespoły rzeczywiście korzystają z Copilot, i usuwać to, czego już nie używają.

Podsumowanie z 14 września wyodrębnia dwa nowe elementy

18 września — GitHub publikuje cotygodniowe podsumowanie Copilot za tydzień rozpoczynający się 14 września. Większość zestawienia powtarza wpisy opublikowane już wcześniej w changelogu; tylko dwa elementy nie zostały nigdy ogłoszone oddzielnie. Pierwszym jest canvas Sentry w aplikacji Copilot, który łączy raport o awarii produkcyjnej z poprawką bez opuszczania aplikacji: wyświetla błędy, ślady stosu (stack traces) i kontekst, a następnie umożliwia zbadanie przyczyny, zweryfikowanie poprawki i przygotowanie pull request. Jest to pierwsza integracja narzędzia do monitorowania błędów w canvases, po Jira na początku września.

Drugim jest fala agentów w VS Code 1.138. Okno Agents może uruchomić agenta w lokalnym Dev Container, z narzędziami i zależnościami projektu — funkcja jest wdrażana stopniowo i wymaga Docker. Nieaktywne sesje mogą być automatycznie oznaczane jako zakończone po scaleniu wszystkich ich pull requests, z opcjonalnym usunięciem po okresie karencji; funkcja jest dostępna w wersji zapoznawczej i wymaga jawnego włączenia. Ponadto pull request można utworzyć bezpośrednio z sesji Agent Host.

🔗 Cotygodniowe podsumowanie Copilot

Sześć modeli znika ze wszystkich interfejsów Copilot 19 października

18 września — GitHub zapowiada wycofanie sześciu modeli ze wszystkich interfejsów Copilot — Copilot Chat, edycji inline, trybów ask i agent oraz uzupełniania kodu — 19 października 2026 roku. Jest to druga fala wycofań zapowiedziana we wrześniu.

Wycofywany modelData wycofaniaSugerowana alternatywa
Gemini 3.7 Flash19/10/2026Gemini 3.8 Flash
GPT-5.519/10/2026GPT-5.6 Sol
GPT-5.419/10/2026GPT-5.6 Sol
GPT-5.4 mini19/10/2026GPT-5.6 Luna
GPT-5 mini19/10/2026GPT-5.6 Luna
Grok 4.519/10/2026Grok 4.6

Przy domyślnym włączaniu modeli alternatywy są automatycznie aktywowane dla klientów Copilot Enterprise i Business, chyba że administrator wyłączył globalne ustawienie domyślne lub jawnie zablokował dany model; w takim przypadku dostęp można ponownie otworzyć za pomocą zasad modeli w ustawieniach. Wycofanie modeli nie wymaga żadnych działań.

🔗 Ogłoszenie o wycofaniu modeli Copilot

API metryk zlicza skills, agentów, serwery MCP i plugins CLI

17 września — API metryk użycia Copilot obejmuje teraz pięć kategorii agentowych personalizacji CLI: skills, niestandardowych agentów, serwery MCP, slash commands i plugins. Tabele totals_by_skill, totals_by_custom_agent, totals_by_mcp, totals_by_slash_cmd i totals_by_plugin przedstawiają pięć najaktywniejszych elementów wraz z ich interaction_count, natomiast pola distinct_*_use_count zliczają różnorodność elementów używanych poza tą pierwszą piątką.

Dwa niuanse zapobiegają błędnym interpretacjom. W przypadku serwerów MCP licznik zwiększa się tylko wtedy, gdy CLI próbuje nawiązać lub ponownie nawiązać połączenie — niezależnie od powodzenia — a nie przy każdym wywołaniu narzędzia w ramach już ustanowionego połączenia. Metryki plugins zliczają wyłącznie wywołania skills powiązanych z plugin: stanowią podzbiór łącznej liczby skills i nie należy ich do niej dodawać. Ze względów prywatności wyświetlane są tylko nazwy dostarczone przez GitHub, natomiast nazwy zdefiniowane przez klientów są grupowane pod other.

🔗 Agentowe personalizacje CLI w API metryk


Agenci kodujący w terminalu: MiniMax otwiera własnego, Mistral stabilizuje swój harness

Dwa ogłoszenia od dwóch niepowiązanych podmiotów, tego samego dnia i na tym samym rynku: agent kodujący działający w terminalu staje się powszechny, a obszarem różnicowania stają się licencja i stabilność harnessu.

MiniMax publikuje kod MiniMax Code CLI na licencji MIT

18 września — MiniMax udostępnia kod źródłowy swojego terminalowego agenta kodującego w wersji 0.4.12. Narzędzie instaluje się pod nazwą mcode i oferuje trzy punkty wejścia: interaktywny interfejs terminalowy, tryb bez interfejsu (mcode exec) przeznaczony do skryptów shell, ciągłej integracji i ewaluacji oraz tryb ACP dla edytorów zgodnych z Agent Client Protocol. Odczytuje pliki projektu, analizuje różnice, wykonuje polecenia shell i testy, działając w ramach systemu uprawnień i sandbox.

Wybór modelu pozostaje otwarty: z jednej strony konto MiniMax i jego Token Plan, z drugiej dostawca zewnętrzny, o ile udostępnia format API zgodny z OpenAI lub Anthropic. Do tego dochodzą zintegrowane wyszukiwanie, narzędzia multimodalne, protokół MCP, podagenci i system plugins. Własny kod projektu jest domyślnie publikowany na licencji MIT. Repozytorium obejmuje TUI, CLI bez interfejsu oraz tryb ACP, ale nie aplikację desktopową, choć zawiera jej system śledzenia błędów; propozycje zmian w kodzie są obecnie przyjmowane wyłącznie od współpracowników repozytorium.

🔗 Ogłoszenie MiniMax na X

Unified Harness w Vibe CLI traci status eksperymentalny

18 września — Mistral publikuje Vibe CLI 2.25.5, sześć dni po wersji 2.25.4. Kluczowa zmiana mieści się w jednym wierszu informacji o wydaniu: Unified Harness nie jest już oznaczony jako „experimental”, a udokumentowaną drogą powrotu do starego harnessu Python jest teraz --legacy-harness. Po serii wydań naprawczych skupionych na bezpieczeństwie zatwierdzania poleceń shell nowy harness staje się oficjalnym rozwiązaniem domyślnym — istotna jest ta informacja, a nie numer wersji.

Zmianie towarzyszy nadrabianie braków funkcjonalnych: Unified Harness wprowadza teraz bieżącą gałąź Git, stan repozytorium i ostatnie commity do instrukcji systemowych, hooks wreszcie wykonują się wewnątrz podagentów, zamiast być po cichu ignorowane, a dostawcy skonfigurowani bez zmiennej środowiskowej z kluczem API — serwery lokalne lub samodzielnie hostowane — znów działają. Zaostrzanie uprawnień trwa nadal: zatwierdzenia poleceń shell nie rozszerzają się już na inny program lub środowisko, wywołania narzędzi MCP respektują teraz system uprawnień, zamiast go omijać, a smart approve przestaje obchodzić reguły użytkownika.

🔗 Informacje o wydaniu Vibe CLI 2.25.5


Plugins ChatGPT obsługują jednocześnie wiele kont

18 września — Obsługa wielu kont trafia do większości plugins ChatGPT. Można teraz połączyć konto osobiste, konto służbowe i konta pobocznych projektów, a następnie przywoływać kontekst z każdego z nich w tej samej rozmowie. Konta łączy się z poziomu katalogu plugins pod adresem chatgpt.com/plugins.

Ogłoszenie na koncie OpenAI Developers powtarza wiadomość Maxa Stoibera opublikowaną godzinę wcześniej. Deweloperzy plugins nie muszą nic robić: funkcja włącza się automatycznie, bez żadnych zmian. Osoby, które chcą pójść o krok dalej, mogą dodać narzędzie profile do swojego serwera MCP, aby ChatGPT potrafił oznaczać połączone konta — jest to jedyne konkretne działanie, jakiego się od nich oczekuje. Ogłoszeniu opublikowanemu o 18:10 czasu paryskiego nie towarzyszy żaden wpis na blogu ani w changelogu.

Docelowy przypadek użycia to deweloper rozdzielający swoje tożsamości według pracodawcy lub projektu, który dotychczas musiał zmieniać połączenie, aby przełączać kontekst.

🔗 Ogłoszenie obsługi wielu kont na X

🔗 Oryginalna wiadomość Maxa Stoibera


Genspark dodaje cotygodniową pulę kredytów do planów Plus i Pro

18 września — Genspark zmienia korzyści w ramach subskrypcji Plus i Pro, dodając do nich cotygodniową pulę kredytów bez zmiany cen planów. Pula jest przyznawana co tydzień niezależnie od już wykupionego planu i pokrywa użycie w trybie Standard we wszystkich agentach i narzędziach platformy: Super Agent, AI Chat, AI Image, AI Slides, AI Sheets, AI Docs oraz Deep Research.

Druga wiadomość w tym samym wątku szczegółowo opisuje działanie w przypadku AI Chat i AI Image. Obecni subskrybenci otrzymują tę pulę oprócz środków, którymi już dysponują, a do 31 grudnia 2026 roku wszystkie modele AI Chat i AI Image można wykorzystywać bez zużywania kredytów, w tym flagowe modele takie jak Opus; osoby, które wykupią subskrypcję od 18 września, otrzymują bezpłatny dostęp do podstawowych modeli (core models) AI Chat i AI Image. Genspark zaznacza, że zmiany te nie dotyczą planów Team ani Enterprise, i odsyła do swojego centrum pomocy po szczegółowe warunki.

🔗 Ogłoszenie Genspark na X


Google Research: rezultaty AlphaGenome Atlas i samoweryfikujące się symulacje

Dwie publikacje badawcze tego samego dnia łączy wspólny element: w obu przypadkach pokazano nie sam model, lecz to, co uzyskały z niego podmioty trzecie, albo to, co w jego zastępstwie sprawdza pętla walidacyjna.

AlphaGenome Atlas przedstawia pierwsze wyniki swoich partnerów

17 września — Dziewięć dni po publikacji AlphaGenome Atlas, mapy przewidującej skutki 9 miliardów możliwych substytucji w ludzkim DNA, Google DeepMind przypina wątek opisujący szczegółowo trzy współprace.

Partner naukowyZgłoszony wynik
Stowers InstituteZmapowano ponad 2 500 motywów regulatorowych
University of Exeter / UK BiobankPrzeanalizowano ponad 54 000 uczestników, wykryto o ponad 22% więcej rzadkich sygnałów genetycznych
Broad InstituteZidentyfikowano krytyczną mutację genu DNM1, a następnie potwierdzono ją i zweryfikowano laboratoryjnie

Motywy regulatorowe to sekwencje DNA, które działają jak przełączniki i potencjometry aktywności genów. Badanie przeprowadzone w Exeter wykryło również nowe warianty wpływające na stężenie PLA2G7, białka związanego ze zdrowiem metabolicznym. Przypadek Broad Institute jest najbardziej konkretny z całej trójki: wobec ogromnej listy możliwych mutacji w niewyjaśnionych chorobach rzadkich Atlas pomaga wskazać właściwą, którą następnie potwierdzają badania laboratoryjne. Całość przedstawiono jednak wyłącznie w wątku na X, bez szczegółowego wpisu ani powiązanej publikacji.

🔗 Wątek AlphaGenome Atlas na X

Wygenerowane symulacje edukacyjne, następnie przetestowane przez agenta w Chrome

17 września — Gal Elidan i Yael Haramaty publikują eksperyment wykorzystujący interfejs generatywny (generative UI) do tworzenia symulacji edukacyjnych. Inicjatywa pozostaje po stronie nauczyciela: proponuje on temat, Google generuje zestaw edytowalnych celów nauczania, które wymagają jego zatwierdzenia i służą jako podstawa do generowania. Każdy materiał interaktywny jest podzielony na poziomy o rosnącym stopniu trudności, z zestawem narzędzi, stopniowanymi wskazówkami i szczegółowymi rozwiązaniami.

Najciekawszym elementem jest pętla samokorekty. Generowanie jest kontrolowane według kryteriów pedagogicznych, mechanicznych i prezentacyjnych, a niektóre oceny mają charakter agentowy: test rozwiązywalności otwiera instancję Chrome i obsługuje symulację tak, jak robiłby to użytkownik, próbując również działań kontradyktoryjnych, takich jak przesuwanie suwaków do skrajnych wartości. Pętla powtarza się, aż wszystkie kryteria zostaną spełnione, kosztem dłuższego czasu generowania. Google publikuje ponad 30 interaktywnych materiałów STEM w języku angielskim; kolekcja 40 materiałów została oceniona przez brytyjskich nauczycieli, a badanie przeprowadzone wśród 12 amerykańskich nauczycieli przyniosło średnią ocenę 8 na 10.

🔗 Wpis Google Research o interaktywnych materiałach edukacyjnych


Claude przyspiesza ponad 30 modeli biologicznych i finansuje konkurs projektowania białek

17 września — Anthropic publikuje wpis opisujący, jak Claude zoptymalizował inferencję ponad 30 modeli open source używanych przez biologów — do przewidywania struktur, projektowania białek oraz tworzenia modeli językowych białek i genomiki — w niecałe cztery tygodnie, osiągając średnio około czterokrotne przyspieszenie. Cały kod został opublikowany jako open source.

Techniczny rdzeń prac dotyczy uwagi trójkątnej i mnożenia trójkątnego, których złożoność czasowa i pamięciowa jest sześcienna. Claude stworzył FlashPairformer, zestaw kerneli, który przewyższa standard branżowy od 2,7 do 2,9 raza w przypadku mechanizmu uwagi. Tryb niskiego zużycia pamięci nazwany „Big” pozwala precyzyjnie przewidywać fałdowanie układów liczących ponad 10 000 tokenów na pojedynczym węźle GPU, podczas gdy rybosom 40S przewidziany przez AlphaFold3 liczył 7 663 tokeny. Równie ważna jest metodologia: prace nadzorowało dwóch członków personelu technicznego bez wcześniejszego doświadczenia w optymalizacji inferencji.

Anthropic wraz z Adaptyv Bio współfinansuje również konkurs projektowania białek obejmujący pięć trudnych problemów, z ponad 5 000 projektów społeczności zweryfikowanych eksperymentalnie, nagrodami do 1 miliona dolarów w kredytach Claude oraz zasobami obliczeniowymi o wartości 250 000 dolarów zapewnionymi przez Modal.

🔗 Wpis badawczy Anthropic


Otwarte modele i laboratoria: Muse trafia na Maca, Sakana ujawnia swój zespół badań pionierskich

Meta wprowadza swojego agenta Muse na macOS

18 września — Meta udostępnia Muse na Macu, co ogłoszono w nocy z 17 na 18 września. Konto @AIatMeta przekazuje publikację opisującą osobistego agenta zdolnego do bezpośredniego działania na komputerze użytkownika, za każdym razem za jego wyraźną zgodą. Wymieniono trzy zastosowania: porządkowanie folderu pobranych plików, odnajdywanie zagubionego pliku oraz podsumowywanie wiadomości i notatek.

Ogłoszenie stanowi rozszerzenie premiery Muse z 8 września, agenta opartego na Muse Spark 1.3, dotychczas dostępnego na iOS, Androidzie, w internecie i WhatsApp. Wejście na Maca oznacza kolejny etap rozwoju tego rodzaju produktu: agent nie działa już we własnym środowisku izolowanym, lecz na osobistych plikach użytkownika. Meta nie podaje ceny, krajów dostępności ani wymagań systemowych, a udostępnieniu nie towarzyszy żaden dokument dotyczący bezpieczeństwa na Macu — blog ai.meta.com nie opublikował niczego od 27 lipca.

🔗 Ogłoszenie Meta na X

Sakana AI ujawnia Frontier Intelligence Group i swoje stanowisko wobec obecnego paradygmatu

18 września — Sakana AI ogłasza istnienie Frontier Intelligence Group (FIG), wewnętrznego zespołu rozwijanego od początków firmy. Punktem wyjścia jest pytanie zadane przez Lliona Jonesa, dyrektora technicznego Sakana AI i jednego z twórców Transformera: czy skalowanie architektury Transformer za pomocą coraz większej ilości danych i mocy obliczeniowej wystarczy, aby osiągnąć AGI? Odpowiedź laboratorium brzmi: nie.

To właśnie tutaj znajduje się najważniejsza informacja, bardziej niż w towarzyszącym jej katalogu prac. Wpis wymienia problemy, których obecny paradygmat nie rozwiązał — modele z przekonaniem generujące fałszywe informacje, zawodzące w obliczu naprawdę nowych sytuacji i zużywające dużo energii — oraz przeciwstawia im inteligencję biologiczną, która uczy się w sposób ciągły i generalizuje na podstawie znacznie mniejszej ilości danych. Grupa przyjmuje pięć zasad, w tym swobodę ponoszenia porażek bez presji na wyniki benchmarków. Wśród zaprezentowanych prac znajdują się rzadkie Transformery opracowane wraz z NVIDIA, które wychodzą od zmierzonej obserwacji — ponad 95% neuronów warstwy feed-forward pozostaje nieaktywnych podczas przetwarzania słowa — i doprowadziły do powstania formatu danych o nazwie TwELL, przyjętego na ICML 2026.

🔗 Wpis Sakana AI o Frontier Intelligence Group


Generowanie wideo: Runway ujednolica kredyty, Pika wydaje swoją pierwszą aplikację

Runway umożliwia wymienne korzystanie z kredytów w aplikacji webowej i Runway Dev

18 września — Runway znosi podział między swoimi dwoma produktami: zakupione kredyty można teraz wykorzystywać zarówno w aplikacji webowej, jak i w Runway Dev, ofercie przeznaczonej dla deweloperów. Dotychczas oba środowiska korzystały z oddzielnych pul, osobnych umów i nie miały jednego miejsca do śledzenia zużycia w różnych projektach.

Zmianie towarzyszą cztery elementy: jedna pula kupowana centralnie na jednej fakturze, płynne przejście między budowaniem przepływu pracy w aplikacji webowej a udostępnianiem go przez API, rozszerzone wsparcie dla Runway Dev z dostępem do Applied AI Architects oraz przeprojektowany widok analityczny przestrzeni roboczej, który pozwala administratorom przenosić kredyty między przestrzeniami webowymi i Dev. Dwie oferty handlowe obowiązują do 31 grudnia 2026 roku: 10% dodatkowych kredytów przy podpisaniu umowy dla nowych firm, co według przelicznika podanego przez Runway odpowiada co najmniej 130 minutom wideo lub 12 000 obrazów, a dla obecnych klientów — 5 000 kredytów oraz jeden dzień pracy Applied AI Architect w zamian za polecenie firmie osoby odpowiedzialnej za aplikacje AI.

🔗 Wpis Runway o ujednoliconych cenach

Pika uruchamia Product Ad, przekształcając zdjęcie produktu w reklamę wideo

18 września — Dzień po zaprezentowaniu swojej nowej platformy kreatywnej Pika udostępnia jej pierwszą aplikację: Product Ad. Aplikacja przyjmuje jedno lub kilka zdjęć produktu, łączy je z pisemnym briefem i tworzy na tej podstawie wideo przedstawiane jako gotowe do wprowadzenia na rynek.

Parametr generowaniaOferowana wartość
Dostępne długości6 s, 15 s, 30 s, 60 s, 2 min
Format wyjściowy16:9
Oczekiwane danezdjęcia produktu i pisemny brief
Dostępwymagane utworzenie konta

Pika publikuje ogłoszenie, przywołując własną wiadomość z poprzedniego dnia dotyczącą przebudowy platformy, co umieszcza Product Ad w serii oczekiwanych aplikacji, a nie przedstawia go jako odrębną funkcję. Nie wskazano żadnego modelu ani nie podano ceny.

🔗 Ogłoszenie Pika na X


NVIDIA publikuje AIPerf, następcę GenAI-Perf do pomiaru inferencji na dużą skalę

18 września — NVIDIA prezentuje AIPerf, swoje narzędzie do pomiaru wydajności inferencji generatywnej, określane jako następca GenAI-Perf i napisane od podstaw. Punkt wyjścia jest znajomy: po wdrożeniu modelu pytanie „czy działa szybko?” często rozstrzyga się za pomocą poleceń curl lub improwizowanego generatora obciążenia, które dostarczają niewiarygodnych wyników.

Przełom ma charakter architektoniczny. Podczas gdy większość narzędzi działa w pojedynczym procesie i przy rosnącej współbieżności napotyka globalną blokadę interpretera Python, AIPerf rozdziela pracę: procesy robocze generują obciążenie, oddzielne usługi przetwarzają wyniki, a całość jest koordynowana przez ZMQ. Cel jest jasno określony — klient pomiarowy nigdy nie może sam stać się wąskim gardłem.

Raportowany wskaźnikCo mierzy
Time to First TokenCzas od wysłania żądania do otrzymania pierwszego tokenu
Inter-Token LatencyOpóźnienie między kolejnymi tokenami podczas generowania
Opóźnienie żądaniaŁączny czas uzyskania pełnej odpowiedzi
Przepustowość tokenów wyjściaTokeny generowane na sekundę we wszystkich żądaniach
Raportowane percentylep25, p50, p75, p90, p95, p99
Typy punktów końcowychponad 15

Narzędzie potrafi również odtwarzać ślady rzeczywistego ruchu w formatach Mooncake, Baseten i WEKA. Artykuł podkreśla przede wszystkim użyteczność rozkładów: serwer, którego średni czas do pierwszego tokenu wygląda prawidłowo, ale którego p99 gwałtownie rośnie, pozostaje niezauważony w danych zagregowanych i zawodzi w środowisku produkcyjnym.

🔗 Wpis NVIDIA o AIPerf


Mistral zaprzecza twierdzeniom o nieautoryzowanym dostępie do swoich systemów

18 września — Mistral publikuje o 05:48 UTC krótki komunikat na swoim koncie X w odpowiedzi na twierdzenie o nieautoryzowanym dostępie do jego systemów. Firma informuje, że przeprowadziła szczegółowe dochodzenie, nie znalazła żadnych dowodów potwierdzających to twierdzenie i potwierdza, że jej systemy nie zostały naruszone.

We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.

🇵🇱 Wiemy o zarzucie dotyczącym nieautoryzowanego dostępu do naszych systemów. Po przeprowadzeniu szczegółowego dochodzenia nie znaleźliśmy żadnych dowodów potwierdzających ten zarzut i możemy potwierdzić, że nasze systemy nie zostały naruszone.@MistralAI na X

Wiadomość nie wskazuje autora tego twierdzenia, nie określa jego daty ani charakteru i nie podaje żadnych szczegółów dotyczących zakresu dochodzenia. Przedstawiono tutaj stanowisko Mistral i wyłącznie ono: nie udało się dotrzeć do pierwotnego zarzutu. Komunikat jest najczęściej wyświetlaną wiadomością tego konta w omawianym okresie, a na stronie firmy nie znaleziono żadnej dodatkowej publikacji.


Krótkie wiadomości

  • Balyasny Asset Management opowiada, jak wyznacza ramy korzystania z Claude Fable 5 — firma, która zarządza około 38 miliardami dolarów, skraca wstępną analizę arbitrażu fuzji z trzech–pięciu dni do mniej niż jednego dnia dzięki agentowi działającemu przez około 30 minut i weryfikacji przez człowieka. 🔗 źródło
  • Codex CLI 0.155.1 ponownie domyślnie wyłącza podsumowania rozumowania — jedyna poprawka wydana dzień po wersji 0.155.0: ich automatyczne włączanie powodowało odrzucanie żądań przez dostawców, którzy ich nie obsługują. 🔗 źródło
  • Gemini CLI wznawia serię wydań nightly po dniu przerwy — cztery zmiany 18 września, w tym zachowywanie refresh tokena OAuth podczas odnowienia oraz idempotentne usuwanie danych uwierzytelniających; kanały stable i preview pozostają bez zmian. 🔗 źródło
  • Kimi Code 2.0.1 przyspiesza uruchamianie i wznawianie sesji — wydanie poprawek 32 godziny po wersji 2.0.0: kompaktowanie indeksu sesji, szybsze wznawianie długich historii, możliwość odczytu klucza API z nazwanej zmiennej środowiskowej oraz ograniczona liczba obserwatorów plików. 🔗 źródło
  • Qwen Code trafia do wersji preview v0.24.1 z przeglądarkowym SDK Playwright — nie jest to wersja stable; wprowadza zintegrowane sterowanie przeglądarką z mostem natywnej komunikacji Chrome oraz uruchamianie podagentów w kontenerach. 🔗 źródło
  • Zed publikuje wersję stable 1.20.2 zawierającą tylko dwie poprawki — błędy płatności u zewnętrznych dostawców modeli nie wyświetlają już zaproszenia do przejścia na Zed Pro zamiast pierwotnego komunikatu, a dwa rozszerzenia snippets dla tego samego języka nie wyłączają się już wzajemnie. 🔗 źródło
  • Replit twierdzi, że Free Mode jest „30 razy” hojniejszy, nie publikując punktu odniesienia — jedynie tweet, bez linku ani changelogu, który nie precyzuje, z czym porównywany jest ten współczynnik: należy traktować to jako deklarację Replit, a nie pomiar. 🔗 źródło
  • Panel wpływu Copilot rozbija zaangażowanie według funkcji — siedem obszarów w okresie 28 dni, z rozróżnieniem między aktywnym a pasywnym code review oraz populacją fazy adopcji obliczaną teraz w oknie kroczącym. 🔗 źródło
  • GitHub planuje transmisję na żywo wprowadzającą do SDK Copilot w sześciu językach — sesje, narzędzia, serwery MCP i zdarzenia strumieniowe, z osobnymi sesjami poświęconymi .NET i Java, bez wymagań wstępnych. 🔗 źródło
  • Runway Ruby zachowuje kanał alfa podczas konwersji do HDR — konwersja materiału do HDR zachowuje nienaruszoną przezroczystość w jednym kroku; nie podano ceny ani wymaganego poziomu subskrypcji. 🔗 źródło
  • MiniMax dołącza do Singtel AI Pass w ramach singapurskiego programu SkillsFuture — MiniMax H3, MiniMax Agent i MiniMax Audio wchodzą do oferty skierowanej do uprawnionych uczestników ponad 200 kursów AI wspieranych przez SWDA; nie podano kwoty ani harmonogramu. 🔗 źródło
  • VC-Attention przyspiesza mechanizm attention w MiniMax-H3 bez ponownego trenowania — MiniMax informuje o pracach Nunchux AI nad mechanizmem attention o niskiej precyzji, który można zastosować do istniejącego modelu; Nunchux AI deklaruje przyspieszenie 1,6x na B200 i 1,5x na B300 względem FlashAttention-4. 🔗 źródło
  • Wan3.0 zajmuje drugie miejsce w kategorii wideo w OpenArt Arena — Alibaba podkreśla 30-sekundowe ujęcia, natywny dźwięk i obsługę dowolnych materiałów referencyjnych; jest to pozycja w zewnętrznym rankingu, bez nowości produktowych. 🔗 źródło
  • Synthesia otwiera swoją amerykańską siedzibę w Nowym Jorku — wiadomość korporacyjna bez informacji o produkcie, zatrudnieniu ani harmonogramie inwestycji, dwa dni po ogólnym udostępnieniu Interactive Avatar API. 🔗 źródło
  • Grok Imagine przedstawia koszt pilota wyprodukowanego w całości przy użyciu AI — studio PJaccetturo informuje o dziewięciu dniach pracy, 3627 wygenerowanych obrazach i 3043 wygenerowanych filmach oraz koszcie generowania wynoszącym 2677 dolarów w przypadku odcinka pilotażowego konkursu Odyseja. 🔗 źródło
  • BananaMind 2 Pro zbliża się do SmolLM2, wykorzystując dwadzieścia razy mniej tokenów — model ze 139 milionami parametrów, wytrenowany na 100 miliardach tokenów i karcie RTX 5070 Ti, osiąga 42,78% w HellaSwag wobec 43,22 dla SmolLM2-135M, wytrenowanego na 2 bilionach tokenów. 🔗 źródło
  • Optimum-Intel v2.2.0 i OpenVINO GenAI 2026.4.0 rozszerzają eksport na sprzęt Intel — Hugging Face i Intel publikują wspólne wydania obejmujące procesory, karty graficzne i NPU Intel, a Mistral 3 można teraz eksportować. 🔗 źródło
  • AmberTrace Labs mierzy wierność rozumowania Olmo 3 podczas RL z weryfikowalną nagrodą — w testach diagnostycznych wyłączonych z treningu wierność rośnie z 0,238 do 0,262: jest to pozytywna zmiana, a nie pogorszenie; opublikowano również checkpointy. 🔗 źródło
  • Together AI deklaruje najkrótszy czas do pierwszego tokena w DeepSeek V4.1 Flash — firma powtarza pomiar strony trzeciej dotyczący rozgrzanych żądań, nie publikując ani metody, ani wartości: jest to deklaracja, a nie weryfikowalny wynik. 🔗 źródło
  • Google Flow wspiera dwoje twórców podczas Nowojorskiego Tygodnia Mody — niestandardowe narzędzia zaprojektowane z Jane Wade i Sergio Hudsonem; prezentacja zastosowania, bez nowego modelu ani wdrożonej funkcji. 🔗 źródło
  • Google AI Educator Series umożliwia uzyskanie punktów akademickich — kursy szkoleniowe pozwalają teraz uzyskać punkty akademickie lub punkty w ramach kształcenia ustawicznego. 🔗 źródło

Co to oznacza

Ten dzień pokazuje przede wszystkim jedno: agenci do kodowania przestają być zamkniętymi produktami i zaczynają współdzielić formaty. Claude Code odczytuje AGENTS.md, gdy projekt nie ma CLAUDE.md — oznacza to, że Anthropic akceptuje plik instrukcji zdefiniowany gdzie indziej, aby to samo repozytorium mogło obsługiwać wiele narzędzi. Tego samego dnia Antigravity umieszcza w systemowym prompcie swoich agentów Markdown katalog dostępnych podagentów, Vibe CLI wreszcie uruchamia hooki wewnątrz podagentów, Codex rozbija rachunek według podagentów, a Qwen Code umieszcza swoich w kontenerach. Delegowanie zadań między agentami było obietnicą konfiguracyjną; staje się mechanizmem, który trzeba dokumentować, izolować i rozliczać. Claude Code doprowadza zresztą logikę nieufności do końca, oznaczając wyniki podagentów specjalnym nagłówkiem, aby przekazany wyżej tekst nie mógł podszyć się pod instrukcję.

Rynek agentów terminalowych szybko staje się czymś powszednim. MiniMax publikuje własnego na licencji MIT, z TUI, trybem bez interfejsu, ACP i swobodnym wyborem modelu; Mistral usuwa etykietę „eksperymentalny” ze swojego Unified Harness i opisuje --legacy-harness jako wyjście awaryjne; Kimi Code wydaje poprawkę wydajności 32 godziny po swojej wersji głównej. Gdy czterech dostawców oferuje ten sam produkt z takimi samymi punktami wejścia, zróżnicowanie przenosi się gdzie indziej: zależy od licencji, stabilności harnessu i modelu uprawnień — i właśnie tych obszarów dotyczą dzisiejsze zmiany zarówno w Mistral, jak i Anthropic.

W przypadku modeli obserwujemy przejście od opisowego do agentowego wykorzystania audio i wideo. Qwen3.8-Omni-Flash nie próbuje już opisywać filmu, lecz znaleźć w nim odpowiedź: wychodząc od pytania, zyskuje 4,4 punktu w OmniVideoBench, zużywając jednocześnie o 45,7% mniej tokenów — wydajność i oszczędność zmierzają w tym samym kierunku, co zdarza się rzadko. Z kolei Grok Voice Transcribe 2.0 nie stawia na demonstrację laboratoryjną, ale na rzeczywisty ruch: współczynnik błędów dla krótkich zdań spada z 20,6% do 6,8%, a cena pozostaje bez zmian. Oba ogłoszenia prowadzą do tego samego wniosku: wartość nie wynika już z obsługiwanej modalności, lecz z tego, co model postanawia przetworzyć.

Pozostaje pytanie, co laboratoria zgadzają się poddać weryfikacji. Anthropic płaci Accenture za umieszczenie ewaluatorów wewnątrz własnej firmy i zapewnienie im dostępu pracowniczego — a w tym samym ogłoszeniu przyznaje, że nie istnieje żadna norma określająca, do czego taki ewaluator powinien mieć dostęp, jak publikować jego ustalenia ani kto powinien go finansować. Jest to w równym stopniu przyznanie się do problemu, co środek zaradczy. Najmocniejsze dowody tego dnia to natomiast te, które strona trzecia może odtworzyć: wyniki Exeter i Stowers Institute dotyczące AlphaGenome Atlas, opublikowany jako open source kod optymalizacji biomolekularnej oraz checkpointy AmberTrace Labs. Odwrotne przypadki są równie widoczne: Replit podaje współczynnik 30 bez punktu odniesienia, Together AI powtarza ranking bez metodologii, a Mistral zaprzecza zarzutowi, którego nikt nie mógł przeczytać. W tym krajobrazie AIPerf pojawia się w idealnym momencie — jako narzędzie pomiarowe, które zaczyna od przyznania, że problemem często jest sam mierzący.


Źródła