Sök

Jalapeño levererar sina första uppmätta resultat, WebMCP Challenge samlar sex plattformar, Perplexity kör sin agent lokalt

ai-powered-markdown-translator

Artikel översatt från franska till svenska med gpt-5.6-sol.

Visa projekt på GitHub ↗

Femtioett tillkännagivanden på tjugofyra timmar, fördelade över nio områden: 25 augusti är veckans mest intensiva dag. Fyra utvecklingar sticker ut. OpenAI publicerar de första uppmätta resultaten för Jalapeño, företagets egenutvecklade inferenschip, och lanserar direkt därefter ett tio dagar långt hackathon kring WebMCP tillsammans med Chrome, Cloudflare, Shopify, Vercel, Render och Netlify. Perplexity flyttar hela sin Computer-agent till användarens dator. IBM öppnar Granite 4.2, företagets första familj av resonemangsmodeller. Och Anthropic förenar Claudes minne mellan chatten och Cowork och gör det läsbart och redigerbart fil för fil. Resten — WeatherNext Cyclones tas i bruk hos National Hurricane Center, Stability AI:s serie B, ett tjugotal verktygsuppdateringar — följer nedan.


WebMCP: en standard, dess produktstöd, dess interna användning och en tävling för att få igång den

25 augusti — OpenAI lanserar WebMCP Challenge, ett tio dagar långt hackathon kring en ännu experimentell öppen standard som förändrar hur agenter interagerar med webben. Problemet som ska lösas är konkret: i dag måste en agent som ska utföra en uppgift på en webbplats gissa hur den ska navigera i ett gränssnitt utformat för ögon och mus. WebMCP vänder på logiken: webbplatsen exponerar själv strukturerade verktyg som agenten anropar direkt.

Tävlingen är inte det mest anmärkningsvärda med tillkännagivandet. Det är samsynen som den blottlägger: Chrome (Google), Cloudflare, Shopify, Vercel, Render och Netlify samarbetar alla med OpenAI kring samma standard. Juryn återspeglar detta, med Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (Next.js Core-teamet, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) och Alex Nahas, skaparen av MCP-B.

The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.

🇸🇪 WebMCP Challenge har startat. Vi har gått samman med @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render och @Netlify för ett tio dagar långt hackathon. I potten finns 35 000 dollar i prispengar, Codex Micro-enheter, ChatGPT Pro-abonnemang och andra priser från våra partner.@OpenAIDevs på X

Tidsplanen är snäv och bedömningskriterierna är tydliga: nytta, originalitet, genomförande, genomtänkt användning av WebMCP och kvaliteten på upplevelsen mellan människa och agent. Registreringar och bidrag hanteras via Devpost. OpenAI publicerar även agentanpassade demoapplikationer för att få igång projekten — agentstyrd 3D-modellering, kollaborativt skrivande där agenten kommenterar under sin egen identitet, en generator för personligt anpassade korsord, Wandernote för att omvandla reseanteckningar till en resplan samt datautforskning via DuckDB-Wasm i webbläsaren. Det är tillåtet att utgå från en befintlig applikation och lägga till WebMCP.

TävlingsmomentTillkännagivna detaljer
Tillkännagiven längd10 dagar
Bidragen öppnar25 augusti 2026, kl. 12 PT
Sista inlämningsdag3 september 2026, kl. 13 PT
Vinnarna tillkännages23 september 2026 (preliminärt datum)
Total prissumma35 000 dollar
Pris per vinnare (topp 10)3 000 dollar, ett år med ChatGPT Pro, ett Codex Micro-tangentbord, profilprodukter
InlämningsplattformDevpost

Produktkomponenten som gör standarden användbar i vardagen kommer samma dag: den inbyggda webbläsaren i ChatGPT:s datorapplikation och ChatGPT Sites kan nu använda WebMCP. När ChatGPT eller Codex besöker en kompatibel webbplats upptäcker agenten de verktyg som sidan exponerar och använder dem automatiskt i stället för att famla sig fram i gränssnittet — en uppdatering till den senaste versionen av datorapplikationen krävs. Den andra halvan av kedjan finns på produktionssidan: det blir möjligt att be Codex skapa en WebMCP-kompatibel applikation och sedan distribuera den direkt på Sites. Värt att notera är den asymmetriska supporten jämfört med Chrome, där WebMCP fortfarande ligger bakom en experimentell flagga eller en ursprungstestperiod (origin trial), medan ChatGPT:s webbläsare har inbyggt stöd.

Sedan återstår den tredje och mest lärorika delen: OpenAI dokumenterar sin egen interna användning. En ingenjör på företaget berättar hur han slutade skriva en automatisering per uppgift för att i stället bygga Runme, en open source-webbapplikation med notebooks som utformats för samarbete med Codex. Där skriver han ett kort mål med uttryckliga instruktioner — granska en tidigare körning, utarbeta en detaljerad plan, invänta godkännande före start samt dokumentera körda kommandon och tolkningen av dem — och Codex läser och uppdaterar sedan notebooken under arbetets gång. Två arkitekturval förtjänar uppmärksamhet. Först persistensen: notebooks sparas i Google Drive, och parallellt genererar Runme ett kompletterande Markdown-index *.index.md som Drive kan indexera, vilket gör det möjligt för en agent att hitta en tidigare körning som operativ kontext. Därefter exponeringen av funktioner: Runme är en statiskt levererad klientapplikation, och att lägga till en server enbart för att exponera en klassisk MCP-åtkomstpunkt skulle ha introducerat infrastruktur och flyttat behandlingen av notebookens data. Med WebMCP kan applikationen registrera sina verktyg direkt från webbläsaren.

🔗 WebMCP Challenge · Stöd i ChatGPT för datorer och Sites · Codex, Runme och WebMCP hos OpenAI


Jalapeño: OpenAI publicerar de första resultaten för sitt inferenschip och står för sin compute-strategi

25 augusti — OpenAI publicerar de första uppmätta resultaten för Jalapeño, det första inferenschip som företaget har konstruerat självt. Tillkännagivandets betydelse ligger inte enbart i de rena prestandavinsterna, utan i den kompromiss som företaget hävdar sig kunna undanröja: befintliga inferenssystem måste i allmänhet väga genomströmning mot latens, medan Jalapeño gör anspråk på båda i en och samma arkitektur.

Mätningarna bygger på InferenceX, ett offentligt benchmark från SemiAnalysis som simulerar den fullständiga behandlingen av en förfrågan. Tre öppna modeller testades — GPT-OSS 120B, DeepSeek R1 670B och Kimi K2.5 1T — mot kommersiella system. Valet att normalisera per watt i stället för per chip är uttryckligt och praktiskt: Jalapeño förbrukar hälften så mycket som de system det jämförs med. Jalapeño anges till 700 W, och den uppmätta kontinuerliga förbrukningen låg på 550 W eller mindre för de testade belastningarna, jämfört med 1 200 W för GB200 och 1 400 W för GB300.

Utvärderad modell (jämförelsesystem)Maximal genomströmning per kWÄnde-till-ände-latensLägsta TBT
GPT-OSS 120B (GB200, 1 200 W)≈1,9x (85 448 vs 44 960)≈1,7x (1,03 s vs 1,80 s)≈2,7x (0,69 vs 1,87 ms)
DeepSeek R1 670B (GB300, 1 400 W)≈1,7x (19 641 vs 11 781)≈3,6x (1,65 s vs 5,99 s)≈4,1x (1,43 vs 5,90 ms)
Kimi K2.5 1T (GB300, 1 400 W)≈1,5x (18 195 vs 11 862)≈3,4x (1,56 s vs 5,31 s)≈3,8x (1,44 vs 5,48 ms)

För samtliga tre modeller uppger OpenAI 1,5 till 1,9 gånger mer AI-arbete per watt vid maximal genomströmning och 1,7 till 3,6 gånger lägre ände-till-ände-latens än jämförelsesystemen, samt upp till 2,1 till 4,1 gånger högre prestanda vid mycket interaktiva belastningar. Tekniskt kommer vinsterna från gemensam konstruktion av chip, minne, nätverk, programvara och system på racknivå. Inferens genomgår två faser med olika flaskhalsar: förifyllning (prefill), som bearbetar prompten och maximerar beräkningsbelastningen, och generering (decode), som producerar tokens ett i taget och främst är beroende av minnets bandbredd. Jalapeño försöker minimera dataförflyttningar genom att modellens tillstånd — inklusive KV-cache — uttryckligen kan placeras och hållas lokalt medan systemet aktiverar rätt kombination av beräkning, minne och nätverk beroende på fas.

Den mest intressanta delen för en utvecklare gäller AI:ns roll i konstruktionen av själva chippet. OpenAI uppger att företaget gick från den första konstruktionen till tillverkningsstart (tapeout) på nio månader genom att förkorta cyklerna för konstruktion, mätning och verifiering. Chippet utformades som ett förutsägbart programmeringsmål för såväl AI som människor: arbete beskrivs via lokala tensorer, kommunikationen är explicit och synkroniseringen förutsägbar. Med Codex och GPT-Astra portade teamet på två månader tre modeller med öppna vikter som inte ingick i den ursprungliga produktionsplanen, och för utvalda attention- och mixture-of-experts-block från GPT-OSS körs de AI-genererade kärnorna 1,5 till 1,8 gånger snabbare än implementationer skrivna av mänskliga experter. Nyansen är viktig att behålla: siffrorna avser utvalda block, inte hela modellen. Tidsplanen är fortsatt försiktig — produktionskvalificering pågår, programvaran behöver mogna, driftsättning i OpenAI:s infrastruktur aviseras till årets slut, Gen 2 är långt framskriden i utvecklingen och Gen 3 börjar ta form.

Samma dag publicerar Sarah Friar inlägget som förklarar den ekonomiska logiken bakom allt detta. Där framhåller hon en bred compute-portfölj — med Microsoft och NVIDIA som grund, kompletterade av AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy och SoftBank — med ett argument som är lika kommersiellt som tekniskt: att bibehålla ett trovärdigt val mellan leverantörer gör det möjligt att styra varje arbetsbelastning till bästa förhållande mellan prestanda och pris samt upprätthålla prisdisciplin. Ett konkret tal följer med resonemanget: i Artificial Analysis Coding Agent Index når GPT-5.6 Sol med maximal resonemangsnivå ett nytt rekord samtidigt som modellen förbrukar 54 % färre utgående tokens än en annan ledande modell. Texten bejakar slutligen Jevons paradox — att göra intelligens billigare minskar inte förbrukningen, utan utvidgar området för lönsamma användningsfall. På infrastruktursidan presenteras Project Camellia i Georgia med ett slutet vattensystem och åtaganden som omfattas av en årlig oberoende offentlig revision. OpenAI klargör att företaget även fortsättningsvis kommer att driftsätta acceleratorer från NVIDIA och sina andra partner i stor skala, både för träning och inferens.

🔗 Jalapeño — de första resultaten · Hela teknikstacken bakom rikligt tillgänglig intelligens


Perplexity Portable Computer: allt körs på maskinen, med benchmarkresultat som stöd

25 augusti — Perplexity lanserar Portable Computer, en variant av dess Computer-agent som körs helt på användarens maskin. Förändringen är mer arkitektonisk än kosmetisk: det är inte bara modellen som körs lokalt, utan hela orkestreringskedjan — orkestrerare, planerare, verktygsrouter, schemaläggare, beständig uppgiftskö och lokalt sökindex.

Today we’re launching Portable Computer on @NVIDIA DGX Spark.

Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.

🇸🇪 I dag lanserar vi Portable Computer på @NVIDIA DGX Spark. Portable Computer är en helt lokal version av Perplexity Computer, där hela exekveringsmiljön — orkestrerarens LLM, underagenternas LLM och agentens harness — körs på din lokala maskinvara. Inga beroenden av molnet.@perplexity_ai på X

Tillkännagivandet görs tillsammans med NVIDIA och riktar sig inledningsvis till DGX Spark — en plattform med Grace Blackwell GB10, Arm-processor med 20 kärnor, NVIDIA-GPU och 128 GB enhetligt minne — med en planerad utökning till datorer utrustade med RTX-GPU:er. Två modeller erbjuds att välja mellan, Qwen 3.8 27B eller PPLX 27B, Perplexitys eftertränade version av Qwen-modellen, och NVIDIA Nemotron 3.5 Lightning, en öppen 30B-modell, ska läggas till i modellväljaren. Arbete som behandlas lokalt förbrukar inga krediter. Eskalering till molnet är fortfarande möjlig — för aktuell information, webbläsare, anslutna appar eller någon av de drygt 15 frontier-modellerna — men kräver uttryckligt godkännande från användaren. Anslutningarna till Google Drive, Gmail, Slack och GitHub fungerar från enheten, diktering körs lokalt via NVIDIA Nemotron 3.5 ASR Model utan att ljudet lämnar maskinen och kod körs i en isolerad sandlåda (sandbox). Portable Computer är förbehållet Pro- och Max-prenumeranter med en DGX Spark, först på Linux och senare på Windows, med installation med ett klick från appen.

Samma dag publicerar utvecklingsteamet siffrorna som dokumenterar lanseringen. Tesens utgångspunkt är att modellen och dess harness måste utformas tillsammans: generiska harness förutsätter en frontier-modell som kan hantera långa kontexter och planera över en lång tidshorisont, något lokala modeller har svårt att klara.

Uppmätt benchmarkComputer (Qwen 3.8 27B)PiHermesComputer + PPLX 27B
Local Knowledge Work Bench (53 uppgifter)82,6 %77,6 %74,0 %85,4 %
BrowseComp (1 266 uppgifter)66,7 %50,2 %43,9 %
ParseBench-100 (multimodala dokument)65,1 %13,9 %34,6 %

På BrowseComp använder Computer dessutom 61 % mindre tid och 16 % färre tokens än Hermes samt 51 % mindre tid och 70 % färre tokens än Pi. Fyra designval förklarar skillnaden: en minimal systemprompt, funktioner som modulariserats i skills och läses in och ur under körningens gång, ofta använda anslutningar (Gmail, GitHub, Outlook, Google Calendar) som omvandlats till kompakta kommandoradsverktyg i stället för att exponeras som MCP-servrar vars definitioner slukar kontext, samt en sandlåda som alltid är aktiv och inte kan konfigureras — om den inte är tillgänglig inaktiveras harness innan något verktygsanrop görs, i stället för att växla till oisolerad körning. Perplexity noterar även en användbar praktisk observation: Qwen 3.8 27B uppger ett kontextfönster på 260K tokens, men börjar enligt empiriska resultat få problem över 100K.

Terminal Bench 2.1 (89 uppgifter)PoängAPI-kostnad per körning
Qwen 3.8 27B, 100 % lokalt59,6 %cirka 0
Qwen 3.8 27B + rådgivning från Claude Opus 573,0 %0,415 USD
Enbart Claude Opus 582,4 %0,65 USD

Mekanismen för eskalering till en rådgivande modell (advisor) är rapportens mest intressanta punkt: den återhämtar ungefär tre femtedelar av gapet till frontier till omkring två tredjedelar av kostnaden, medan beslutet fortfarande ligger i användarens händer. Före varje anrop väljer harness relevant kontext, tillämpar en klassificerare för personuppgifter och visar användaren vad som skulle lämna enheten; den rådgivande modellen returnerar endast text och har ingen direkt åtkomst till filer eller verktyg. Efterträningen av PPLX 27B kombinerar slutligen finjustering genom avvisning (rejection fine-tuning) och därefter förstärkningsinlärning i syntetiska miljöer som körs i Docker-containrar, helt utan verkliga användardata. En teknisk rapport och publicering av utvärderingsbenchmarken som open source har utlovats.

🔗 Benchmarkresultat för det lokala harness-systemet · Portable Computer — Perplexitys blogginlägg


Claude: ett gemensamt minne för chatten och Cowork, läsbart fil för fil

25 augusti — Anthropic tar bort gränsen mellan två minnen som hittills har existerat parallellt. Det Claude minns från dina konversationer i chatten är nu exakt det som är tillgängligt i Claude Cowork, och det omvända gäller också. När Cowork utför en uppgift i molnet startar det i praktiken med den kontext som samlats under flera månader: kvartalets prioriteringar, projektens framsteg och en samtalspartners skrivpreferenser. Anthropic ger avsiktligt vardagliga exempel — som att be om en lägesrapport till sin chef utan att behöva ange vem det är eller hur personen föredrar att få informationen presenterad.

Den andra förändringen är mer diskret men påverkar det dagliga beteendet: minnet uppdateras under konversationens gång i stället för genom en sammanfattning som skapas i efterhand. Det räcker att nämna att en tidsfrist har flyttats till september för att nästa konversation ska ta hänsyn till det. Formuleringen ”kom ihåg detta” kan fortfarande användas för att uttryckligen spara en viss uppgift, och minnet kan när som helst pausas eller återställas.

När det gäller transparens har Anthropic valt en läsbar representation i stället för en svart låda: allt Claude minns visas som korta filer, sorterade efter ämne, under Inställningar och sedan Minne. Varje fil kan läsas, korrigeras eller tas bort. Den praktiska nyttan är omedelbar — det räcker att korrigera företagets gamla namn i en enda fil för att alla efterföljande konversationer ska använda det rätta namnet.

Hanteringen av känsliga ämnen är den mest intressanta punkten ur produktvalssynpunkt. Som standard minns Claude inte sådant som rör hälsa, ursprung, etnicitet, religiös tro, politiska åsikter eller könsidentitet. Anthropic medger dock att gränsdragningen är personlig och erbjuder en valfri inställning för att inkludera dessa ämnen — vilket exempelvis gör att Claude kan komma ihåg en glutenintolerans när recept föreslås. Inställningen gäller inte retroaktivt och kan när som helst stängas av. En kategori förblir undantagen oavsett inställning: identifikationsnummer, belastningsregister, migrationsstatus och mer allmänt allt som strider mot policyn för acceptabel användning. Claude anger uttryckligen när information av den här typen inte kan sparas, ett designval som prioriterar ett synligt avslag framför tyst filtrering.

MinnesaspektBeskrivet beteende
OmfattningEtt gemensamt minne som delas mellan chatten och Claude Cowork
Tidpunkt för uppdateringUnder konversationen, jämfört med tidigare då en sammanfattning gjordes efteråt
LagringsformatKorta filer sorterade efter ämne, som kan läsas och ändras en i taget
Känsliga ämnenSparas inte som standard, kan aktiveras via en inställning, utan retroaktiv verkan
Permanenta undantagIdentifikationsnummer, belastningsregister, migrationsstatus
Free-, Pro- och Max-abonnemangMinnet är aktiverat som standard på webben, datorer och mobila enheter
Team- och Enterprise-abonnemangÖppnas av administratören och är inaktiverat för varje användare tills det aktiveras

🔗 Claudes minne fungerar överallt · Tillkännagivande från @claudeai


IBM öppnar Granite 4.2, sin första familj för resonemang, samt två ASR-modeller på 470M

25 augusti — IBM lanserar Granite 4.2, som presenteras som företagets första familj av täta språkmodeller med enbart decoder som uttryckligen utformats för resonemang. Medan tidigare generationer inriktades på effektivitet och traditionella företagsuppgifter sätter den här versionen resonemanget i centrum och gör det justerbart: varje modell erbjuder tre lägen — thinking, non-thinking och low-effort — som appen väljer utifrån den budget för latens och tokens som den är beredd att betala. De tre storlekarna (3B, 8B, 30B) delar samma arkitektur och pipeline, vilket gör det smidigt att byta mellan dem ur integrationssynpunkt.

Arkitekturen förblir klassisk: GQA-attention med 40 huvuden för 8 KV-huvuden, RoPE med ett θ på 10 miljoner för att hantera en kontext på 131 072 tokens, SwiGLU-MLP, RMSNorm-normalisering och träning i bfloat16 på ett NVIDIA GB200 NVL72-kluster hos CoreWeave. Förträningen börjar från noll med omkring 15 000 miljarder tokens fördelade på fem faser. Det som verkligen särskiljer Granite 4.2 är efterträningen: en förstärkningspipeline med en kedja av specialiserade steg i stället för en enda körning, med asynkron GRPO och trunkerad importance sampling, vilket gör att loopens genererings- och träningshalvor aldrig blockerar varandra. Läroplanen omfattar tre RLVR-körningar med verifierbara belöningar, riktade förstärkare för instruktionsföljning och kod, två steg för software engineering med 128K-kontext, ett terminalsteg, ett söksteg och därefter RLHF-anpassning. Blocket för agentbaserad förstärkning tillämpas endast på modellerna 8B och 30B, vilket förklarar skillnaden i agentbaserad kodningsprestanda mellan 3B och dess större syskon.

Benchmark publicerat av IBM3B Dense8B Dense30B Dense
SWE-Bench Verified47,6757,00
SWE-Bench Multilingual30,7841,89
Terminal-Bench 2.120,5629,24
τ³-bench45,7858,0662,00
AIME2578,3386,6789,17
GPQA54,8064,1466,41
LiveCodeBench v669,7173,2475,77
MMLU-Pro67,8474,0477,60
RULER 128K55,3071,4181,38

Lanseringen begränsas inte till vikter i bfloat16: fyra kvantiserade varianter följer med för vLLM — dynamisk FP8 per kanal utan kalibrering samt NVFP4 och MXFP4 via GPTQ kalibrerat på 2 000 SFT-exempel — liksom fjorton GGUF-format för llama.cpp, från Q2_K till Q8_0. Tolv språk stöds, däribland franska, och tre harness för agentbaserad kodning dokumenteras redan från första dagen: OpenCode, Pi och OpenHands. När det gäller datakvalitet beskriver IBM en kedja där GPT-OSS-120B och Gemma 4 används som domare för att betygsätta SFT-exemplen, före lokal och global deduplicering med SHA-256-hashning.

Samma dag lanserar IBM Granite Speech 5.0 Turbo CTC, två modeller för engelsk taligenkänning med 470 miljoner parametrar som endast skiljer sig åt genom sina träningsdata och licenser — Apache 2.0 för standardvarianten och CC-BY-NC-SA-4.0 för varianten som tränats på ytterligare data. Arkitekturförändringen är betydande: tidigare Granite Speech-modeller kombinerade en akustisk encoder, en projektor och en LLM, medan dessa enbart består av en encoder. Stacken består av 16 Conformer-block, tillämpar självkonditionering efter det åttonde blocket, ersätter skalärproduktattention med blockvis attention (chunkwise) för att undvika kvadratisk skalning och optimerar CTC-förlusten direkt. Den verkliga nyheten är tokenfrekvensen: genom nedsampling minskas flödet från 100 bildrutor per sekund efter log-Mel-spektrogrammet till 12,5 per sekund, vilket förklarar namnets ”Turbo”. Resultaten redovisas på OpenASR Leaderboard och FFASR Leaderboard för fjärrfält, med Pareto-diagram för hastighet och precision i stället för enskilda poäng, samt en demonstration av kontinuerlig taligenkänning som körs i webbläsaren via WebGPU och är begränsad till Chrome och Edge.

🔗 Granite 4.2 — teknisk genomgång · Granite Speech 5.0 Turbo CTC


WeatherNext Cyclones, den första AI-modellen som används i realtid av National Hurricane Center

25 augusti — Google AI beskriver WeatherNext Cyclones, en modell för prognoser av tropiska cykloner från Google DeepMind och Google Research. Tillkännagivandet är anmärkningsvärt mindre för den rena prestandan än för vad det säger om väder-AI:s övergång från laboratoriet till operativ drift.

Problemet som angrips är strukturellt. Hittills har övervakning av en cyklon krävt en avvägning: de fysikaliska modeller som körs på superdatorer fångar väl de stora atmosfäriska strukturer som sveper över planeten, men för att förstå den lokala och intensiva fysik som avgör en storms styrka har man behövt växla till helt andra regionala modeller. WeatherNext Cyclones eliminerar detta fram och tillbaka genom att förutsäga bana, intensitet och storlek i ett enda steg.

Den uppgivna vinsten är en hel dags extra framförhållning jämfört med tidigare system. Google uttrycker jämförelsen tydligt: tredygnsprognoser uppnår nu samma precision som de tidigare tvådygnsprognoserna, ett framsteg som historiskt har krävt ett årtionde av metodologiska förbättringar. Det andra bidraget är probabilistiskt: modellen är tillräckligt snabb för att producera upp till 1 000 simuleringar per storm, vilket ersätter den enda ”mest sannolika” banan med ett spektrum av scenarier. Det gör snabb intensifiering lättare att tolka, definierad som en ökning av de maximala ihållande vindarna med minst 30 knop på 24 timmar. I år tillhandahålls 1 000 probabilistiska prognoser per storm till prognosmakarna via WeatherLab.

Det mest betydelsefulla är fortfarande den faktiska driftsättningen. Under orkansäsongen 2025 testades WeatherNext Cyclones inom USA:s National Hurricane Center — första gången som institutionen använder AI-modeller i realtidsverksamhet. Meteorologerna använde modellen för att ta fram prognosen för orkanen Melissas landfall som kategori 5 på Jamaica, vilket gav de lokala myndigheterna extra tid för förberedelser. En artikel har publicerats i Nature, och Google meddelar att koden och modellvikterna ska publiceras som open source på GitHub.

Aspekt av modellenBidrag från WeatherNext Cyclones
Förutsagda storheterBana, intensitet och storlek i ett enda steg
Vinst i framförhållningEn dag; 3-dygnsprognos = precisionen hos den tidigare 2-dygnsprognosen
Simuleringar per stormUpp till 1 000
Operativ driftsättningU.S. National Hurricane Center, orkansäsongen 2025
Dokumenterat användningsfallOrkanen Melissas landfall som kategori 5 på Jamaica
IntensifieringströskelMer än 30 knops ökning av maximala ihållande vindar på 24 timmar
TillgängliggörandeWeatherLab; kod och vikter som open source på GitHub

🔗 Tillkännagivande från @GoogleAI · Inlägg från Google DeepMind


Stability AI slutför en Serie B-runda på 76 miljoner dollar med EA, Sony Music, Universal och Warner

25 augusti — Stability AI tillkännager att Serie B-rundan har slutförts: 76 miljoner dollar i nytt kapital, vilket innebär att den totala finansieringen uppgår till 232 miljoner sedan Prem Akkaraju tog över ledningen för företaget i juni 2024, inklusive två aktierundor och konvertibla obligationer. Beloppet är fortfarande blygsamt sett till sektorns storlek, men investerargruppens sammansättning är den verkliga nyheten.

Fyra tungviktare inom underhållning går in som delägare: Electronic Arts inom datorspel samt Sony Music Group, Universal Music Group och Warner Music Group inom musik. De tre stora skivbolagen är nu aktieägare i samma laboratorium. Därtill kommer AMD Ventures och Pacific Alliance Ventures. Dessa investerare kommer inte från ingenstans: EA, Universal och Warner var redan strategiska partner till Stability AI sedan hösten 2025. Rundans effekt är alltså att befintliga kommersiella avtal omvandlas till ägarandelar.

En annan signal är de finansiella investerarnas lojalitet. Coatue, Greycroft, Kadmos Capital, Sean Parker och Eric Schmidt investerar på nytt för andra rundan i följd under den nya ledningen — vilket efter den turbulenta period som Stability AI genomgick 2023 och 2024 får ses som ett styrkebesked. Thomas Laffont, medgrundare av Coatue, ansluter till styrelsen där James Cameron, Sean Parker, Dana Settle och Prem Akkaraju redan sitter.

This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.

🇸🇪 Denna investerargrupp utan motstycke bekräftar vår vision om generativ AI som ger varje producent, musiker och berättare verktyg och möjligheter. Stability är unikt inom AI eftersom vi är kreatörer som bygger verktyg för kreatörer. — Prem Akkaraju, CEO för Stability AI, pressmeddelande den 25 augusti

Den uttalade strategin är att vara ett nischlaboratorium: ingen generell modell, utan verktyg för kreativa yrkesutövare, byggda tillsammans med rättighetsinnehavarna snarare än mot dem. Det är exakt inriktningen för Stable Audio 3.0, en familj av modeller med öppna vikter som tränats på helt licensierade data och som den 18 augusti utökades med ett plugin för digitala ljudarbetsstationer. Pengarna ska finansiera den fortsatta produktutvecklingen, tillämpad forskning och enheten för professionella tjänster.

🔗 Tillkännagivande från @StabilityAI


ChatGPT för företag: Admin-plugin, tillägg för flera webbläsare och Premium-plats för 100 dollar

25 augusti — Tre tillkännagivanden från OpenAI riktar sig till samma målgrupp: organisationer som driftsätter ChatGPT och Codex i stor skala.

Det mest omfattande är Admin-pluginet för ChatGPT Work och Codex, som i en enda konversation samlar sådant som tidigare krävde navigering mellan analytics-paneler, inställningssidor och rapporter. Omfattningen täcker de dagliga uppgifterna: förstå användningen och kreditförbrukningen, identifiera medlemmar eller grupper som närmar sig sina gränser, hantera nyanställningar och avgångar, granska faktiska behörigheter och diagnostisera åtkomstproblem, justera användningsgränser och bedöma utgiftsförfrågningar mot den faktiska förbrukningen. Den mest intressanta delen är automatisering utan att skriva kod: väntande förfrågningar om användning kan dirigeras till Slack eller Microsoft Teams för godkännande i det verktyg som beslutsfattarna redan använder, och förfrågningar om åtkomst till en funktion kan beviljas automatiskt när de uppfyller fördefinierade kriterier, medan undantagen skickas vidare till en människa. En grundläggande säkerhetsaspekt är att pluginet verkar inom användarens befintliga roll och behörigheter och inte utökar någon åtkomst; varje instruktion mappas till en stödd läs- eller skrivåtgärd med ett strukturerat resultat. OpenAI hänvisar till sin egen användning — en ChatGPT Work-agent i Slack hanterar interna IT-förfrågningar, och de driftsatta arbetsflödena löser omkring 45 % av ärendevolymen, vilket har eliminerat kön trots att supportvolymen ungefär har fördubblats.

Det andra tillkännagivandet är att ChatGPT:s webbläsartillägg lämnar Chrome-miljön och får stöd för Microsoft Edge, Brave, Opera och Vivaldi. Förändringen är viktig för dem som arbetar i en alternativ webbläsare av integritetsskäl eller på grund av företagskrav. Två användningsområden lyfts fram: att föra in kontext från öppna flikar i en uppgift genom omnämnandet @ tab i ChatGPT Desktop, så att Codex arbetar utifrån dokumentationen eller ärendet som redan visas; och att låta agenten styra webbläsaren för att utföra konkreta webbuppgifter, där uppsägning av abonnemang är ett av exemplen.

Det tredje tillkännagivandet är mer kortfattat: en Premium-plats för 100 dollar läggs till i ChatGPT Business-erbjudandet och riktar sig till småföretag och startups, med en plan som beskrivs som flexibel och skalbar efter teamets storlek. Tillkännagivandet gjordes på X utan något detaljerat blogginlägg, och den exakta omfattningen av platsen anges inte i meddelandet.

🔗 Admin-plugin · Tillägg för flera webbläsare · Premium-plats för ChatGPT Business


NVIDIA: Gamescom för RTX Spark och SANA som minskar latensen för MiniMax H3 med en faktor 27

25 augusti — NVIDIA utnyttjar Gamescom, som hålls denna vecka i Köln, för att utöka katalogen för RTX Spark, företagets Windows PC-plattform som väntas i höst. Electronic Arts, Embark Studios och Ubisoft ansluter till KRAFTON, NetEase, Riot Games och XBOX, som hade förbundit sig redan under COMPUTEX i maj. De namngivna titlarna omfattar varierande tekniska krav: EA SPORTS F1 25 och Apex Legends från EA, Anno 117: Pax Romana från Ubisoft samt ARC Raiders och THE FINALS från Embark Studios.

Den mest konkreta punkten gäller anti-cheat. Det räcker inte att få ett spel att köra: stora onlinetitlar är beroende av anti-cheat-system som måste porteras till varje plattform, annars förblir spelet ospelbart i multiplayer. NVIDIA meddelar att företaget arbetar med EA för att ge RTX Spark inbyggt stöd för EA Javelin Anticheat — den typ av infrastrukturdetalj som avgör om en ny PC-plattform faktiskt får genomslag. På renderingssidan är DLSS 4.5 Ray Reconstruction tillgängligt omedelbart, med en andra generationens transformer-modell som ersätter traditionella brusreducerare med ett nätverk tränat på en superdator. Path tracing kommer till CONTROL Resonant och 007 First Light, Gears of War: E-Day integrerar RTX Mega Geometry och NVIDIA ACE-tekniker tillkännages för Aniimo i början av 2027.

Den andra sidan av samma aktör, den 24 augusti, är mer teknisk. MiniMax återger resultaten som NVIDIA:s SANA-team har uppnått med Sol Engine tillämpad på videomodellen H3: tio sekunders video i 768p som genereras på en enda GB200 går från 414 sekunder till 14,93 sekunder, en acceleration med en faktor 27,7. Metoden bygger inte på kärnoptimering utan på att dela upp genereringen i två pass — ett lågupplöst utkast som H3 producerar i 4 steg, följt av ett förfiningspass i målupplösningen som utförs av LTX i 3 steg med Sol-Attn. Totalt sju steg. Den andra hävstången är att de kostsamma VAE-avkodningarna ersätts av TAEH3 och TAEHV, lättare avkodare, samtidigt som latenterna hålls stabila inför förfiningspasset.

Mätning för MiniMax H3Uppmätt värde
Uppmätt arbetslast10 s video i 768p, en enda GB200
Latens före414 s
Latens efter14,93 s
Accelerationsfaktor27,7x
Genereringssteg4 (lågupplöst H3-utkast) + 3 (LTX)
Ersatta avkodareTAEH3 och TAEHV i stället för VAE-avkodningar
Beräknad kapacitet per nod378 000 videor per månad, mer än 97 % GPU-marginal

Den beräknade kapaciteten är en uppskattning från MiniMax, inte en produktionsmätning, och bör läsas som sådan. Men riktningen är tydlig: med femton sekunder för tio sekunders video lämnar högkvalitativ videogenerering asynkron batchrendering och närmar sig en interaktiv infrastruktur.

🔗 NVIDIA på Gamescom · SANA och Sol Engine på H3


Kinesiska öppna modeller blir riktmärket inom forskning och Qwen3.8-27B tar sig in bland de 10 bästa i Code Arena

25 augusti — Qwen förmedlar två resultat samma morgon, och det andra förklarar innebörden av det första.

Det första är en rankning. Qwen3.8-27B tar plats i rankningen Code Arena: WebDev, som utvärderar modeller för generering av webbgränssnitt, på 9:e plats totalt med 1595 poäng. Det är den enda modellen i sin storleksklass bland de 10 bästa och ligger bara sex placeringar efter den betydligt större Qwen3.8-Max. Arena framhåller att modellen flyttar rankningens Pareto-front och ger en talande jämförelsepunkt: Gemma 4-31B, som är ungefär lika stor men släpptes i april, ligger på 80:e plats.

Utvärderad modellPlacering i Code Arena: WebDevErhållna poängKommentar i rankningen
GLM-5.3 (Max)8:a totalt1597Notering från 20 augusti, 2:a bland öppna modeller
Qwen3.8-27B9:a totalt1595Enda modellen i sin storleksklass bland de 10 bästa
Qwen3.8-MaxSex placeringar före 27Bej angivetBetydligt större modell i samma familj
Gemma 4-31B80:e totaltej angivetSläppt i april 2026

Det andra resultatet är ett mått på användning. Nathan Lambert, som var med och ledde Olmo-projektet på Ai2, lät Codex analysera 500 000 arXiv-artiklar om AI och machine learning som publicerats sedan lanseringen av ChatGPT, för att identifiera vilka öppna modeller som faktiskt används i forskningen. Omsvängningen kan sammanfattas i två siffror: 2024 nämnde omkring 30 % av artiklarna en amerikansk öppen modell, jämfört med 10 % som nämnde en kinesisk modell; i dag hänvisar omkring 40 % till en kinesisk öppen LLM och endast 25 till 30 % till en amerikansk.

ModellfamiljAndel artiklar som hänvisar till en LLM
OpenAI (slutna modeller)omkring 37 %
Qwenomkring 33 %
Gemini, Claude10 till 15 %
Gemma, Mistral5 till 10 %
Olmoomkring 1 %

Mer specifikt nämns Qwen i en tredjedel av alla artiklar som hänvisar till någon LLM. Llama nådde sin topp omkring april 2025 med 30 %, samtidigt som Llama 4 lanserades, och har minskat sedan dess. Lambert pekar själv på en viktig begränsning: publikationer släpar efter modellsläpp eftersom forskning tar tid — dessa siffror beskriver läget för pågående arbeten snarare än aktuella preferenser. Parallellt syns en underliggande trend som är skild från motsättningen mellan öppet och slutet: andelen AI-artiklar som nämner en LLM har stigit från 10,43 % i januari 2023 till mer än 50 % år 2026.

🔗 Qwen3.8-27B i Code Arena · Qwens återgivning av arXiv-analysen · Analys av @natolambert


Claude Code uppdateras till 2.1.245, och renderingen av Claude på webben blir 4 gånger smidigare

Två versioner av Claude Code släpptes under perioden, och innehållet är tydligt inriktat på driftsättningar i organisationer. CHANGELOG saknar datum, men Git-historiken placerar dem i tiden: 2.1.243 förekommer i commiten den 24 augusti kl. 23.40 UTC och 2.1.245 i commiten den 25 augusti kl. 05.13 UTC.

Tillagd inställningBerörd versionPraktisk nytta
modelPricing2.1.243Avtalspriser i /cost, statusfältet och telemetrin
modelPicker2.1.243Ordnad och etiketterad lista över modeller för /model
promptCacheTtl / subagentPromptCacheTtl2.1.243Promptcache i en timme för konversationen, 5 min för subagents
Uppdelning av Loops i /usage2.1.243Upptäcka /loop-uppgifter som spårar ur
Nyckelfri anslutning via Console2.1.243Organisationer som förbjuder API-nycklar
Korrigering för glibc 2.442.1.245Krasch vid start på Arch Linux, CachyOS och Fedora Rawhide

Den mest genomgripande inställningen är modelPricing: hittills har de visade kostnaderna beräknats utifrån offentliga priser, men nu kan en organisation lägga in sina avtalspriser per modell och sin rabattfaktor, vilket gör siffrorna direkt användbara för intern vidarefakturering. Kombinationen promptCacheTtl och subagentPromptCacheTtl hanterar en konkret ekonomisk avvägning för användare med API-nyckel: en cache på en timme behålls för huvudkonversationen, där kontexten förblir stabil, medan subagents ligger kvar på fem minuter eftersom deras kontexter är mer flyktiga. Bland korrigeringarna märks att fjärranslutna MCP-servrar i icke-interaktivt läge inte längre förblir blockerade efter ett avbrott, att /resume inte längre begränsas till de femtio senaste sessionerna och att sessioner som varit tysta i mer än tio minuter nu löper ut efter cirka tre minuter före ett nytt försök och ett tydligt felmeddelande.

Den 24 augusti meddelar Anthropic dessutom att företaget har skrivit om motorn som visar svar medan de genereras i Claude för webben och datorn. Principen är klassisk inom gränssnittsrendering: endast det som fortfarande förändras uppdateras, i stället för att hela svaret ritas om vid varje nytt fragment. För ett långt svar är skillnaden strukturell – renderingskostnaden slutar öka med längden på texten som redan visas. De angivna förbättringarna är konsekventa: cirka 4 gånger smidigare rendering, 9 gånger färre låsningar på en resurssvag bärbar dator, en värsta gränssnittsfrysning som är 4,5 gånger kortare samt stabila 120 bilder per sekund från början till slut på en MacBook med 120 Hz. Den intressanta detaljen är målgruppen: det är de enklare konfigurationerna som vinner mest.

🔗 CHANGELOG för Claude Code · 4 gånger smidigare rendering, @ClaudeDevs


Kodagenter industrialiseras: Warp publicerar formatet för sina factories, Rohlik låter agenter skriva 90 % av koden

24 augusti sent på dagen – Warp visar den interna mekaniken bakom Warp Factories, företagets plattform för cloud agents som tillkännagavs den 18 augusti: det valda konfigurationsformatet och öppnandet av early access. Utgångspunkten är uttalad – Warp flyttar sina egna agenter från lokala datorer av kvalitets- och kostnadsskäl och behövde beskriva miljöer, harnesses och säkerhetsbehörigheter som versionshanterad kod.

KonfigurationselementValt värde
Definitionsfilfactory.yaml, schemaVersion: v1alpha1
Huvudnycklarname, repositories (owner / name), agentDefaults.model
Definition av en agentagents/<nom>/agent.md med agentType (FOREMAN, REVIEW…) och model
Triggersautomations/<nom>/automation.md: agent, triggers (leverantör, händelse)
Tillgängliga gränssnittCLI (warp agent run-cloud), REST API, TypeScript SDK, MCP-server
Early accessUpp till 10 000 USD i kostnadsfri användning för kvalificerade kunder

Uppdelningen är intressant: agenterna beskrivs inte i en enda YAML-fil utan i separata Markdown-filer, så definitionen av en agent blir ett läsbart dokument vars skillnader enkelt kan jämföras. Warp tillämpar receptet på sig självt – företagets interna factory, kallad ”wilson”, omfattar repositories som warp-server och warp-terraform, deklarerar sina secrets och MCP-servrar samt organiserar sina agenter efter roll (code-review, foreman, implementation, spec, triage) på 34 rader. Siffrorna på sidan för åtkomstansökan är kommersiella påståenden som inte kan verifieras externt: 200 000 agentkörningar per dag, mer än 30 % av alla pull requests mergade utan ändringar och 20 % lägre kostnad per pull request.

Den 25 augusti publicerar Cognition i sin tur en fallstudie som är betydligt bättre dokumenterad än den föregående. Rohlik Group är en nätbaserad livsmedelsdistributör med ursprung i Tjeckien, verksam i fem länder och lönsam, med en omsättning på över 1,3 miljarder dollar förra året. Företaget levererar en veckohandling med 17 000 produkter på mindre än en timme eller inom tidsfönster på femton minuter. Siffran som präglar artikeln är att omkring 90 % av koden där numera genereras av agenter och att teknikorganisationen beskriver sig som ”agent-mostly”.

Detta är inte ett resultat som uppnåtts genom att bara ansluta ett verktyg. Rohlik uppger att arbetet började för ett år sedan, med en första erfarenhet av Devin som bedömdes vara buggig. Det som förändrade spelplanen var grunden som kunden lade: fler än femtio interna och externa MCP-integrationer, med principen att varje nytt verktyg ska vara tillgängligt för agenterna från första dagen, ett semantiskt lager ovanpå Snowflake-datalagret samt en kunskapsbas som ger agenterna den kontext man skulle förmedla till en ny kollega. Arbetet kommer till Devin från den plats där det uppstår, från en Slack-konversation om en bugg eller ett specifikationsdokument i Linear och vidare hela vägen till en pull request. De angivna resultaten – fördubblad utvecklingstakt sedan november, en integration av AutoStore-robotik levererad på åtta månader där branschen vanligtvis behöver två till tre år och prototypframtagning som minskat från en månad till en dag – är fortfarande uppgifter från en kundsida publicerad av leverantören. Den mest talande effekten finns på annat håll: de bästa utvecklarna ägnar nu 80 % av sin tid åt kodgranskning, och omkring 30 % av användningen av Devin hos Rohlik består av dataanalys utförd av verksamhetsanvändare.

🔗 Formatet factory.yaml, @warpdotdev · Fallstudie om Rohlik, @cognition · Kundsida för Devin


GitHub: fyra övningar om agentiska workflows och fliken Customize blir allmänt tillgänglig

25 augusti – GitHub publicerar fyra nya övningar på sin utbildningsplattform GitHub Skills. Inriktningen är tydlig: i stället för att dokumentera årets agentiska nyheter låter GitHub användarna öva på dem i ett demo-repository, med instruktioner som levereras stegvis via pull requests.

Publicerad övningÖvningens syfte
Agent Orchestration Build Your AI Dream TeamAnpassade agenter i Copilot CLI: planera, utforma, bygga, validera, överlämna
Agentic Workflows that Read the RoomTillägget gh aw, agentiskt workflow i Markdown, ändringar inskickade via pull requests
Idea to Merge with the Copilot AppFrån en session till en mergad pull request, helt i GitHub Copilot-appen
Ship with QualityAutomatiserade kvalitetssignaler, testtäckning, obligatoriska kontroller av pull requests

Den första är den mest anmärkningsvärda av de fyra: det är första gången GitHub erbjuder en guidad kurs om orkestrering av flera agenter i sin CLI, ett ämne som hittills endast dokumenterats i löptext. Den andra introducerar tillägget gh aw, med en viktig säkerhetsaspekt – ändringarna som föreslås av workflowet går via pull requests i stället för att tillämpas direkt, vilket bevarar en mänsklig granskningspunkt.

Samma dag blir fliken Customize i GitHub Copilot-appen allmänt tillgänglig. Dess funktion är att samla de fyra utökningsmekanismer som introducerats separat under de senaste månaderna på en enda yta: MCP-servrar, plugins, skills och canvases. Vyn Featured visar ett redaktionellt urval från varje kategori för användare som vet vad de vill göra men inte vilken typ av utökning som passar, och MCP-servrarna får en egen navigering med alternativ som lyfts fram efter popularitet och möjlighet att utforska per kategori. Changeloggen illustrerar nyttan med canvases genom ett konkret fall: en Azure DevOps-canvas för att sortera issues, prioritera en backlog, tilldela uppföljningar och sedan överlåta en uppgift till Copilot så att den kan undersöka, implementera eller förbereda granskningen.

🔗 Fyra GitHub Skills-övningar · Fliken Customize blir allmänt tillgänglig


Googles verktyg för utvecklare: Gemini CLI 0.57.0 och Antigravity 2.10.0

25 augusti – Google publicerar den stabila versionen 0.57.0 av Gemini CLI, efter previewversionen 0.58.0 som släpptes en kvart tidigare. Innehållet i den här versionen säger mindre om nya funktioner än om hur Google underhåller sitt verktyg: av de 24 posterna i changeloggen har 13 prefixet [SSR Agent] Issue Fix och hänvisar till ofta gamla issue-nummer, från 19239 till 28518. Dessa korrigeringar hanterar irritationsmoment som samlats i backloggen – en terminal som låser sig på obestämd tid och därför får timeouts, ett missvisande administrativt felmeddelande för personliga konton, ett saknat mellanslag efter förslag från autocompletion samt terminalrendering som inte uppdaterades efter att en extern editor stängts. Med andra ord låter Google en agent arbeta med verktygets egen tekniska skuld, och resultatet hamnar direkt i den stabila versionen.

Publicerad versionDatum och tid (UTC)PubliceringskanalViktiga punkter
v0.57.025 augusti, 18:37:14Stabil13 [SSR Agent]-korrigeringar, validering av evals, kontextuella retries
v0.58.0-preview.025 augusti, 18:22:01PreviewDocker-isolering i Seatbelt-profilen för macOS, säkerhetskontroller

På funktionssidan ligger fokus på utvärdering, med ett kommando för validering av evals och en formatterare för verktygsanrop som inkluderar sammanfattningar av misslyckanden. Tillförlitligheten förbättras också: kapacitetsfel utlöser tysta retries som tar hänsyn till kontexten, och om en multi-turn-förfrågan avbryts görs en fullständig rollback i stället för att ett partiellt tillstånd lämnas kvar. För den som letar efter versionsanteckningarna är det värt att notera att repositoryfilen docs/changelogs/index.md inte har uppdaterats efter v0.54.0 från den 6 augusti.

Fyra dagar efter 2.9.1 och dess Remote Control uppdateras Google Antigravity till 2.10.0 den 24 augusti och fyller två luckor som tidigare tvingade användaren att lämna verktyget: en integrerad terminal och inbyggd Git-versionshantering, båda direkt i sidofältet. Samlingen ligger i linje med produktens utveckling – Antigravity positioneras som en miljö där man styr agenter i stället för att redigera kod rad för rad, men då måste det också gå att köra ett kommando och inspektera en diff utan att byta fönster. Resten av versionen utökar både vad som kan skickas till en agent och vad användaren kan se av dess arbete: ljudfiler läggs till bland accepterade bilagor, interaktiva kommentarer på bilder gör det möjligt att annotera en bild för att vägleda agenten och förbättrade förhandsvisningar av MCP-verktygens körningar gör det tydligt vad en verktygsserver faktiskt har gjort. Google anger att versionen innehåller 13 förbättringar och 8 korrigeringar och att den lanseras gradvis.

🔗 Gemini CLI v0.57.0 · Changelog för Antigravity


Anthropic finansierar oberoende utvärderingar av välbefinnande med 5 miljoner dollar

25 augusti – Anthropic öppnar ett stipendieprogram på 5 miljoner dollar för att finansiera oberoende forskning om hur AI påverkar användarnas välbefinnande. Mottagarna får direkt finansiering, tillgång till modeller och teknisk support men arbetar helt oberoende: deras utvärderingar publiceras som open source och kan återanvändas av hela branschen. Ansökningar tas emot till och med den 21 september, och de kandidater som väljs ut för att lämna in ett fullständigt förslag meddelas senast den 5 oktober.

Den tekniska motiveringen förklarar varför området är svårt att hantera med vanliga utvärderingsmetoder. För de flesta modellbeteenden räcker det att granska ett enskilt svar för att bedöma om det är korrekt och lämpligt. Välbefinnande kräver kontext: en användare i kris nämner inte nödvändigtvis självskadetankar direkt, och råd om en balanserad kost som är rimliga i ett fall kan bli potentiellt farliga om personen har uppvisat en historik av ätstörningar. Safeguards-teamet publicerar samtidigt fem kriterier för stringens: ange tydligt vad som mäts, involvera kliniker och ämnesspecialister i utformningen, testa både försiktighetsåtgärder och skador – det vill säga utvärdera risken för såväl överdriven följsamhet som överdrivna avslag –, återspegla verklig användning genom multi-turn-scenarier och validera automatiska bedömare mot verkliga experter. Det tredje kriteriet, symmetrin mellan överdriven följsamhet och överdrivna avslag, är det som skiljer denna metod från en enkel skärpning av skyddsräckena.

🔗 Forskningsstipendier om välbefinnande


Quantization-Aware Healing: en 4-bitarsmodell som överträffar sitt original med full precision

25 augusti — Standardprocessen för att göra en stor modell redo för driftsättning består av tre steg: komprimera arkitekturen, kvantisera resultatet och sedan reparera kvalitetsförlusten. Den dominerande metoden för det sista steget är QAT (quantization-aware training), som infogar operationer för simulerad kvantisering och tränar om modellen; ett alternativ, QAD, destillerar från den komprimerade modellen med full precision. I båda fallen kan eleven som bäst komma ikapp sin komprimerade lärare och ärver därför det tak som komprimeringen sätter.

Multiverse Computing föreslår en ändring på en enda rad: destillera direkt från originalmodellen, alltså modellen före komprimeringen. Kvantiseringen upphör då att vara en efterbehandling med kvalitetsförlust och blir i stället ett fullvärdigt inlärningssteg. Resultatet är kontraintuitivt — när metoden tillämpas på GPT-OSS 120B, som komprimerats till 60B och därefter kvantiserats i MXFP4, ger den en 4-bitarsmodell som matchar eller överträffar sin egen bfloat16-källa i sju av nio benchmarks. De största förbättringarna syns där komprimeringen gör mest skada: +7,4 poäng på AA-LCR för resonemang med lång kontext och +5,6 på AIME 2025. De enda två försämringarna, på MMLU-Pro och SciCode, är mindre än en och en halv poäng.

Den direkta jämförelsen med QAT i en identisk pipeline är kanske det mest praktiskt användbara resultatet. På GPT-OSS 9B kvantiserad i MXFP4 når de båda metoderna jämförbara toppresultat, 54,9 mot 54,6, men inte till samma kostnad: QAH når dit på omkring hundra steg och håller sig kvar, medan QAT behöver cirka 700 steg för att nå dit och sedan försämras. Den konkreta följden är en annan driftsättningsrisk — en QAT-checkpoint kräver noggrann övervakning av tidigt stopp, medan en QAH-checkpoint kräver betydligt mindre.

🔗 Quantization-Aware Healing


Gradio integrerar gr.Workflow, en grafbaserad byggare för AI-pipelines

25 augusti — Hugging Face publicerar en guide som presenterar gr.Workflow, en primitiv som nu är integrerad i Gradio. Utgångspunkten är enkel: de flesta intressanta AI-applikationer består inte av ett enda modellanrop utan av en kedja — man genererar en bild, tar bort dess bakgrund, skapar en berättarröst och ber en LLM om en titel. Hittills har det krävts att både logiken och gränssnittet skrivs för att koppla ihop kedjan och presentera den på ett snyggt sätt. gr.Workflow förenar de två: stegen beskrivs som en graf med typade noder, och grafen blir själv gränssnittet.

För utvecklare sträcker sig nyttan längre än den visuella demonstrationen. Varje utdata från grafen får automatiskt en egen REST-endpoint: mediestudion i exemplet, som kombinerar FLUX-generering, bakgrundsborttagning, talsyntes och en LLM, exponerar tre separata routes (/sticker, /voiceover, /episode_title) som kan anropas från kod utan att gå via gränssnittet. Noderna kan kommunicera med fyra världar — modeller som körs via Hugging Faces Inference Providers, andra offentliga Gradio Spaces som återanvänds som byggstenar, en rad ur ett dataset på Hub och godtycklig Python. Den sista punkten öppnar flest möjligheter: en operatornod dekorerad med @spaces.GPU reserverar en ZeroGPU-GPU medan den körs, vilket gör det möjligt att köra egna vikter. Guiden åtföljs av fem applikationer som faktiskt har driftsatts i Spaces, däribland en datasetprofilerare och en demonstration som animerar en stillbild med Lightricks/LTX-Video.

🔗 Guide till gr.Workflow


ElevenLabs lanserar Composer, en låtredigerare för en sektion i taget

25 augusti — ElevenLabs presenterar Composer, en låtredigerare som arbetar med en sektion i taget. Principen bryter med det dominerande genereringssättet för musikmodeller: i stället för att skapa en hel låt i ett enda svep och göra om allt när ett avsnitt inte fungerar, låter Composer användaren bearbeta en vers, refräng eller brygga separat. Fyra utgångspunkter erbjuds — dina egna sångtexter, ett befintligt spår som du tillhandahåller, ett tomt blad eller en enkel prompt — varefter låten byggs upp genom successiva justeringar.

Det är ElevenLabs andra satsning på musik efter Eleven Music, och den kommer under en händelserik vecka för företaget, då CLI v1 släpptes dagen innan. Positioneringen ligger i linje med resten av ljudsektorn: Suno lanserade Studio 2.0 den 13 augusti, Pika släppte sitt Pika Music-sortiment den 18 augusti och Stability AI levererade samma dag sitt plugin för digitala ljudarbetsstationer. Detaljerad kontroll över låtens struktur, snarare än enbart genereringens kvalitet, har blivit det nya konkurrensområdet. Det finns dock en reservation: lanseringen åtföljs inte av något blogginlägg, och det finns ingen information om vilka abonnemang som ger tillgång till Composer, vilka exportformat som stöds eller om API-åtkomst finns.

🔗 Composer-presentationen, @ElevenLabs


LiveAvatar tar bort alla samtidighetsgränser och sänker priset till 0,01 USD per minut

25 augusti — HeyGen meddelar att samtidighetsgränserna för LiveAvatar, företagets produkt för avatarer i realtid, tas bort. Formuleringen betonar förändringens karaktär: gränserna höjs inte, de försvinner. En session eller tiotusen körs via samma API utan föregående förhandling om kvoter. Två parametrar följer med beskedet — renderingen förblir i helkroppsformat och 1080p, och priset sjunker till så lite som 0,01 USD per minut vid storskalig användning.

Den prisnivån förändrar vilka användningsområden som är tänkbara: för en cent per minut blir en realtidsavatar genomförbar för storskalig kundsupport, utbildning eller interaktiva kiosker, där kostnaden per enhet hittills har avgjort om lösningen varit möjlig. Att samtidighetsgränsen tas bort är den tekniskt intressanta punkten. Plattformar för realtidsavatarer begränsar vanligtvis antalet samtidiga sessioner eftersom varje session kontinuerligt använder GPU-resurser; att häva detta tak förutsätter antingen en betydande kapacitetsmarginal eller effektiviseringar i modellen. HeyGen publicerar en artikel som förklarar företagets tillvägagångssätt, men de tekniska detaljerna var inte tillgängliga vid genomgången.

🔗 Obegränsad samtidighet för LiveAvatar


Grok 4.6 kommer till OpenCode Go

25 augusti — Grok 4.6 ansluter sig till OpenCode Go, abonnemanget för open source-kodagenten OpenCode. Beskedet kom från OpenCode sent på dagen och vidarebefordrades av kontot @grok en halvtimme senare. Den konkreta punkten för utvecklare är kvoten: 169 förfrågningar per femtimmarsperiod för användare med Go-abonnemanget. Det är ett rullande tak, inte en månatlig räknare, vilket passar den intensiva periodvisa användning som är typisk för assisterade kodningssessioner.

Integrationen ingår i en rad öppningar av Grok 4.6 mot verktyg från tredje part: modellen kom till GitHub Copilot den 14 augusti, till Amazon Bedrock den 19 augusti och därefter till Googles Gemini Enterprise Agent Platform den 21 augusti. xAI hade dessutom redan anslutit OpenCode till sina abonnemang SuperGrok och X Premium i maj 2026 — dagens nyhet är alltså inte tillgången till OpenCode i sig, utan att modellen 4.6 ingår i Go-abonnemanget med en inkluderad kvot i stället för att användaren själv måste tillhandahålla ett xAI-abonnemang.

🔗 Inlägg från @grok · Tillkännagivande från @opencode


Cohere publicerar en IDC-studie om införandet av suverän AI 2026

25 augusti — Cohere publicerar resultaten från en InfoBrief som beställts av IDC om införandet av suverän AI inom reglerade sektorer. Studien omfattade fler än 500 högre beslutsfattare från företag med en omsättning på över en miljard dollar i Kanada, USA, Storbritannien och Tyskland mellan april och maj 2026.

Det mest anmärkningsvärda resultatet handlar mindre om införandet än om den begreppsmässiga förvirringen. Var tredje chef har svårt att beskriva suverän AI med egna ord, och endast 13 % uppger att de har mycket hög kännedom om ämnet. Bland dem som kan ge en definition beskriver 52 % begreppet i termer av lokal eller nationell kontroll och 35 % nämner digitalt oberoende. Skillnaden går också genom organisationen: IT-chefer uppvisar dubbelt så hög kännedom som verksamhetschefer.

Undersökt sektorDataläckor och regelefterlevnad som främsta farhågaKonkurrensfördel som drivkraft
Finansiella tjänster82 %21 %
Industri77 %32 %
Telekommunikation75 %37 %
Hälso- och sjukvård74 %28 %
Energi70 %21 %

När det gäller drivkrafterna är samsynen tydlig och sektorsövergripande: dataläckor, integritet och regelefterlevnad ligger högst i samtliga undersökta sektorer. Konkurrensfördelar framstår som en sekundär men växande drivkraft och framhävs mer i Kanada (35 %) och USA (28 %) än i Tyskland (23 %) eller Storbritannien (18 %). Studien stöder förstås Coheres positionering, eftersom företagets agentplattform North körs i den infrastruktur och jurisdiktion som kunden väljer; siffrorna kan trots detta hänföras till en namngiven källa. IDC förutspår dessutom att multinationella företags CIO:er fram till 2028 kommer att öka sina investeringar i modulära suveräna cloud-miljöer och datalokalisering med 65 %.

🔗 State of Sovereign AI Adoption 2026


Kortfattat

  • Bain & Company ansluter sig till Claude Partner Network — Konsultföretaget blir Global Premier-partner i samband med en utrullning av Claude till dess 19 000 anställda; över 7 000 aktiva användare redan under pilotfasen, och mer än två tredjedelar av deltagarna började använda Claude for Excel. 🔗 Anthropics blogginlägg
  • Amp förklarar vad orbs är — En kommentar av Thorsten Ball som svar på förvirringen kring namnet: en orb är en fjärragent som kan styras från webben, telefonen eller CLI. Två användbara förtydliganden om kostnaden: obegränsad vilotid debiteras inte och antalet samtidiga orbs är inte begränsat. 🔗 Kommentar från Amp
  • Together AI öppnar Qwen3.8 27B för fine-tuning och dedikerad inferens — Modellen blir tillgänglig både för finjustering med egna data och för Dedicated Model Inference på reserverad hårdvara. 🔗 Inlägg från @togethercompute
  • FINAL-Bench öppnar FINCHAL, en tävling i finansiella prognoser för agenter — Tävlingen har 2 000 dollar i prispott, efterfrågar positioner snarare än prognoser och publicerar ett slumpmässighetstak (luck ceiling) för att skilja skicklighet från tur. 🔗 FINAL-Bench-blogginlägg
  • Au-Zone publicerar EdgeFirst Model Zoo — Fyra YOLO-familjer för detektering och segmentering, uppmätta på verkligt inbyggt kisel, där varje publicerad siffra länkar till valideringssessionen som producerade den, i kontrast till den bristande insynen i tillverkarnas uppgivna TOPS. 🔗 EdgeFirst-blogginlägg
  • Geminis smarta diktering för macOS — Diktera i vilket skrivbordsfönster som helst, med automatisk borttagning av tvekljud och hänsyn till korrigeringar mitt i en mening; rösten kan också användas för att sammanfatta filer och skriva om text. 🔗 Guide på blog.google
  • Push rules tillåter sökvägsundantag — I offentlig förhandsversion kan reglerna Restrict file paths och Restrict file size undanta specifika sökvägar, exempelvis blockera JAR-filer överallt utom i **/gradle/wrapper/*.jar. 🔗 GitHub Changelog
  • Blockera en användare från en säkerhetsavisering — Åtgärden finns i menyn med tre punkter i beskrivningen eller en kommentar i offentliga repositories, utan att användaren behöver gå via inställningarna; aviseringen förblir oförändrad. 🔗 GitHub Changelog
  • Manus rapporterar hög efterfrågan på dataåterställning — Återställningar som inte slutförs måste startas om senare under dagen; den uttryckliga instruktionen är att bevara säkerhetskopieringspaketen intakta och oförändrade. 🔗 Inlägg från @ManusAI
  • Kling publicerar tre guider om sin MCP-server — Anslut Kling till en MCP-kompatibel assistent för att återanvända en validerad kreativ konfiguration och skapa varianter i batch; två av de tre guiderna nämner Claude Code som klient. 🔗 Klings blogg
  • Wan 3.0 kommer till Runway och Replicate — Runway integrerar modellen den 24 augusti med flera referensindata i form av bild, video och ljud; Replicate följer efter den 25:e och framhäver 30 sekunders nativ generering i en enda tagning med synkroniserat ljud. 🔗 Inlägg från @runwayml
  • Runway presenterar nya talare till sitt AI Summit — Programmet utökas med robotik, självkörande fordon, marknadsföring och infrastruktur inför evenemanget i San Francisco i september. 🔗 Inlägg från @runwayml
  • MiniMax publicerar ett index över H3-integrationer — Awesome MiniMax H3 Integrations sammanställer det som byggs kring den öppna videomodellen, inklusive konfigurationer som körs med 24 GB VRAM. 🔗 Inlägg från @MiniMax_AI
  • Luma lanserar Dream Lab Weekly — Det första avsnittet i en videoserie om Lumas kreativa yrkesanvändare och deras veckovisa arbete med produkten. 🔗 Inlägg från @LumaLabsAI
  • NVIDIA sänder en Nemotron Labs-session om routing för öppna modeller — En 55 minuter lång direktsändning med titeln Get Started with Open Model Routing, som bygger vidare på arbetet med Nemotron 3.5 Lightning och NeMo Switchyard. 🔗 Inlägg från @NVIDIAAI
  • En vecka återstår av Grok Imagine-tävlingen om Odysséen — Uppgiften är att skapa en scen ur Odysséen som visar verktygets video- och röstfunktioner; prissummorna är 100 000, 50 000 och 25 000 dollar. 🔗 Inlägg från @grok
  • Bank med gränsåterställningar för Plus- och Pro-prenumeranter — I stället för att vänta på återställningsfönstret använder användaren en sparad återställning; en kostnadsfri vid lanseringen och fler genom värvningar, med delade workspace-krediter för Business. 🔗 Ändringslogg för ChatGPT och Codex

Vad det innebär

Kisel blir återigen ett ämne för modellaboratorierna. OpenAI publicerar samma dag de första uppmätta siffrorna för sitt eget inferenschip och inlägget som redogör för företagets compute-strategi. Det är ingen tillfällighet i kalendern: när en modellleverantör utformar sitt eget kisel, mäter det med ett offentligt benchmark från tredje part och öppet står för en portfölj med tio partner förändras konkurrensens natur. Frågan slutar vara ”vilken modell är bäst” och blir i stället ”till vilken kostnad per framgångsrikt genomförd uppgift”, och svaret avgörs lika mycket i racket som i vikterna. Den mest betydelsefulla detaljen finns kanske någon annanstans: AI användes för att utforma chipet och skriva dess kärnor, med tillverkningsstart inom nio månader och genererade implementationer som överträffar mänskliga experters på de utvalda blocken. Cirkeln sluts — modellerna utformar hårdvaran som ska köra dem.

AI flyttar tillbaka till enheten, och siffrorna börjar följa efter. Tre signaler samma dag pekar i samma riktning. Perplexity kör hela sin agent lokalt på en DGX Spark, utan att förbruka krediter, med en eskalering till molnet som fortfarande är användarens beslut. Multiverse Computing publicerar en metod där en 4-bitarsmodell matchar eller överträffar sin källa med full precision, vilket undanröjer det vanliga argumentet mot aggressiv kvantisering. Au-Zone publicerar mätningar av vision per inbyggt kisel och kritiserar de angivna TOPS-siffrorna för att inte säga något om vad en viss modell faktiskt kommer att åstadkomma. Inget av dessa tre arbeten påstår sig nå upp till frontier-nivån: Perplexitys uppriktiga siffra är 59,6 % lokalt jämfört med 82,4 % för enbart Claude Opus 5 på Terminal Bench 2.1. Men eskaleringen till en rådgivande modell återvinner tre femtedelar av gapet till två tredjedelar av kostnaden, och det är denna avvägning, snarare än paritet, som gör lokal körning försvarbar.

Öppna vikter etablerar sig som referensposition. Analysen av 500 000 arXiv-artiklar som Qwen har förmedlat dokumenterar en redan märkbar omsvängning: kinesiska öppna modeller har gått från 10 % till omkring 40 % av omnämnandena, medan amerikanska öppna modeller stagnerar mellan 25 och 30 %. Qwen3.8-27B tar sig in bland de tio främsta i Code Arena som den enda modellen i sin storleksklass, GLM-5.3 överträffade GPT-5.6 Sol och Claude Fable 5 på DeepSWE i försök med flera körningar till en 2,1 till 5,4 gånger lägre kostnad, och IBM öppnar Granite 4.2 med fyra kvantiserade varianter och fjorton GGUF-format redan första dagen — samma logik upprepas. Att öppna vikterna är inte längre ett sätt att komma ikapp, utan ett sätt att bli andras standardinfrastruktur, med den nyansering som Nathan Lambert själv gör: publikationerna släpar efter lanseringarna, och dessa kurvor beskriver pågående arbeten snarare än aktuella preferenser.

Och webben förbereder sig på att läsas av agenter snarare än av ögon. WebMCP Challenge är en tävling med 35 000 dollar i prispengar, vilket är lite; det den avslöjar är mer värt. Chrome, Cloudflare, Shopify, Vercel, Render och Netlify ställer sig tillsammans med OpenAI bakom en standard som kräver att webbplatser exponerar strukturerade verktyg i stället för att låta agenter gissa sig till ett gränssnitt. Samma dag kan ChatGPT desktop använda WebMCP direkt, Codex kan skapa och driftsätta en kompatibel applikation och OpenAI dokumenterar sin interna användning av protokollet i ett notebook-verktyg. Denna konvergens ligger i linje med det Rohlik beskriver från sitt håll, med fler än femtio MCP-integrationer och principen att varje nytt verktyg ska vara tillgängligt för agenter redan från första dagen. Gränssnittslagret för agenter upphör att vara ett forskningsämne och blir ett tekniskt krav.


Källor