Zoeken

Claude ontdekt een enzymatisch systeem met CRISPR-achtige herhalingen, Google lanceert Gemini 3.8 Flash TTS, Black Forest Labs publiceert FLUX 3 Action

ai-powered-markdown-translator

Artikel vertaald van het Frans naar het Nederlands met gpt-6-sol.

Bekijk project op GitHub ↗

Op 23 september onthult Anthropic zijn laboratorium voor moleculaire biologie en het eerste resultaat ervan: ART, een onbekend enzymatisch systeem dat ongeveer 950 Claude-agenten ontdekten in het DNA van bacteriofagen. Google lanceert Gemini 3.8 Flash TTS en Flash-Lite TTS, twee spraaksynthesemodellen die stemmen creëren en klonen. Black Forest Labs publiceert FLUX 3 Action, een model met open gewichten om robots aan te sturen, en Perplexity publiceert de eerste beveiligingsaudit van SPACE, de sandbox waarin zijn agenten draaien.


Anthropic opent een laboratorium voor moleculaire biologie, waar Claude ART ontdekt

23 september — Anthropic presenteert een nieuwe onderzoeksgroep voor levenswetenschappen met een eigen laboratorium voor moleculaire biologie. De groep werd in het voorjaar opgericht en is gevestigd in de San Francisco Bay Area. Het eerste resultaat: Claude-agenten hebben in het DNA van bacteriofagen, virussen die bacteriën infecteren, een nooit eerder beschreven enzymatisch systeem gevonden. Anthropic noemt het ART (array-associated reverse transcriptases, reverse-transcriptasen die met een reeks zijn geassocieerd).

Het begon allemaal met één prompt: zoek in een grote database met DNA-sequenties naar nieuwe voorbeelden van reverse-transcriptasen, enzymen die RNA omzetten in DNA. In 21 uur verbruikten ongeveer 950 agenten 210 miljoen tokens, verzamelden ze meer dan 200.000 reverse-transcriptasen, identificeerden ze 3.500 nieuwe kandidaatsystemen en selecteerden ze de 20 meest veelbelovende, elk met een voor mensen leesbaar rapport. Volgens Anthropic zou een deskundige voor zo’n analyse weken of zelfs maanden nodig hebben; de menselijke inbreng bleef beperkt tot de oorspronkelijke prompt en de laboratoriumexperimenten.

Stap van het onderzoekGemeten waarde
Duur van het onderzoek21 uur
Ingezette Claude-agentenongeveer 950
Verbruikte tokens210 miljoen
Verzamelde reverse-transcriptasenmeer dan 200.000
Nieuwe kandidaatsystemen3.500
Geselecteerde en onderzochte kandidaten20

ART bestaat uit drie onderdelen: de reverse-transcriptase, een nabijgelegen partnergen waarvan de functie onbekend is, en een lange reeks regelmatig gespreide, herhaalde DNA-sequenties waarvan de opbouw aan een CRISPR-reeks doet denken. De transcriptase zelf, gevonden in een reuzenfaag, was al bekend; Claude „lijkt de eerste te zijn”, aldus Anthropic, die de niet-coderende reeks en het bijbehorende eiwit heeft opgemerkt. De eerste experimenten tonen aan dat deze reeks tot afzonderlijke kleine RNA’s wordt omgezet. Anthropic blijft voorzichtig: de functie van ART is nog onbekend en verdere experimenten lopen. Volgens Anthropic vertoont slechts een handvol bekende systemen deze kenmerken; ze zijn allemaal programmeerbaar en kunnen DNA knippen, kopiëren en plakken.

Claude has discovered a previously unknown enzyme system hidden in the DNA of bacteriophages. Beside the enzyme’s gene sits a long array of repeating DNA—a structure that looks somewhat similar to CRISPR.

🇳🇱 Claude heeft een tot nu toe onbekend enzymatisch systeem ontdekt, verborgen in het DNA van bacteriofagen. Naast het gen van het enzym ligt een lange reeks herhaald DNA, een structuur die enigszins op CRISPR lijkt.@AnthropicAI op X

Het laboratorium werkt uitsluitend op bioveiligheidsniveaus BSL-1 en BSL-2 en behandelt geen ziekteverwekkers die mensen kunnen infecteren; al het werk aan de labtafel wordt door menselijke wetenschappers gedaan. Het team gebruikt Claude Science en Claude Code, soms met een zelfgebouwd systeem dat veel sessies tegelijk coördineert. Omdat een onderzoekscampagne honderden of zelfs duizenden rapporten oplevert, worden de hypothesen zelf ook onderzocht: wat de hypothesen onderscheidt die onderzoekers de moeite van het testen waard vinden, helpt om de instructies voor Claude te verfijnen. Feng Zhang, pionier op het gebied van genoombewerking met CRISPR (MIT en Broad Institute), heeft de preprint gelezen en ziet hierin een veelbelovend voorbeeld van wat AI-agenten kunnen bijdragen aan biologische ontdekkingen. Anthropic publiceert de preprint en nodigt wetenschappers uit om onderzoeksvragen in te dienen.

🔗 Claude ontdekt een nieuw enzymatisch systeem met CRISPR-achtige herhalingen · Preprint (PDF)


Gemini 3.8 Flash TTS en Flash-Lite TTS: Google creëert en kloont stemmen

23 september — Google voegt twee spraaksynthesemodellen (text-to-speech) toe aan de Gemini-familie en noemt ze zijn meest expressieve audiomodellen: Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS. Beide zijn algemeen beschikbaar in de Gemini API en Google AI Studio, met een nieuw Voices-endpoint; de changelog van de API dateert de vermelding op 22 september, terwijl de publieke aankondiging op de 23e verscheen.

De twee modellen hebben elk een eigen taak. Flash TTS is bedoeld om stemmen te creëren: je beschrijft in gewone taal de rol, het accent en het karakter van een stem en stuurt vervolgens elke tekstregel aan (vertolking, tempo, verandering van dialect). Google richt het model op videogames, luisterboeken en podcasts. Flash-Lite TTS is gericht op volume en kosten: nasynchronisatie op grote schaal, massale audioproductie en realtime spraakagenten; het moet gemini-3.1-flash-tts-preview vervangen. Beide ondersteunen dialogen met twee stemmen in één script, uren audio zonder merkbare verandering in de stemklank en tags zoals <laughs>, <sigh> of |mhm|.

De blogpost kondigt meer dan 2.000 kant-en-klare stemmen aan, waaronder regionale varianten zoals Canadees-Frans; de API-documentatie beschrijft daarentegen 30 studiostemmen en een uitgebreide bibliotheek met enkele honderden stemmen. Stemklonen werkt met een opname van 30 seconden, mits de mondelinge toestemming van de eigenaar van de stem wordt vastgelegd, en alle gegenereerde audio krijgt een SynthID-watermerk. Belangrijk voor lezers in Europa: volgens een opmerking in de blogpost is stemklonen via AI Studio niet beschikbaar in de Europese Economische Ruimte, het Verenigd Koninkrijk, Zwitserland, India, Illinois of Texas. Het remixen van bestaande stemmen is voor binnenkort aangekondigd.

ModelkenmerkGemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
API-identificatiecodegemini-3.8-flash-ttsgemini-3.8-flash-lite-tts
Ondersteunde talen (API-documentatie)130101
Beoogd gebruikCreatie, precieze sturingVolume, nasynchronisatie, spraakagenten
Audio-uitvoer, Standard-prijs t/m 31/12/2026 (miljoen tokens)9 dollar6 dollar
Audio-uitvoer, Standard-prijs vanaf 01/01/2027 (miljoen tokens)18 dollar12 dollar
ConsumentenproductGemini NotebookGoogle Vids (aangekondigde voice-over)

Ter vergelijking: Gemini 3.1 Flash TTS Preview kost 20 dollar per miljoen tokens voor audio-uitvoer. Google onderbouwt de lancering met externe evaluaties: Flash TTS staat bovenaan de Voice Design Benchmark van Hume AI (71,4), en de twee modellen bezetten de eerste twee plaatsen op de Overall Quality Index van Hume AI. Ze komen „binnenkort” ook via een API beschikbaar in Gemini Enterprise.

🔗 Aankondiging van Google · Releaseopmerkingen voor de Gemini API · API-tarieven


FLUX 3 Action: Black Forest Labs publiceert een model met open gewichten om robots aan te sturen

23 september — Black Forest Labs, bekend van zijn FLUX-beeldmodellen, publiceert FLUX 3 Action, een World Action Model met 7 miljard parameters dat is ontworpen om robots aan te sturen. Het is afgeleid van de multimodale basis FLUX 3 en voorspelt in één berekening toekomstige beelden en motorcommando’s op basis van camerabeelden en de stand van de gewrichten. De gewichten zijn openbaar (de Hugging Face-pagina van het DROID-checkpoint vermeldt de licentie „flux-kommunity-license”), en het laboratorium publiceert ook de code, het recept voor fine-tuning, benchmarks en reproduceerbare voorbeelden.

An open weights 7B World Action Model that achieves first place on the RoboLab benchmark. It outperforms the previous best open model by 6.1 percentage points while using 56% fewer parameters and running up to 3.95x faster.

🇳🇱 Een World Action Model met 7B parameters en open gewichten dat bovenaan de RoboLab-benchmark staat. Het overtreft het vorige beste open model met 6,1 procentpunt, terwijl het 56% minder parameters gebruikt en tot 3,95 keer zo snel draait.@bfl_ai op X

Beoordeeld modelModeltypeToegang tot gewichtenSuccespercentage RoboLab-120Aantal parameters
FLUX 3 ActionWAMOpen42,92 %7B
OASIS WAMVLM + WAMGesloten39,0 %
Cosmos3-Nano-PolicyWAMOpen36,8 %16B
PhoenixTAMP+FMGesloten34,4 %
BiMind v0.1VLAGesloten33,3 %
π0.5VLAOpen28,0 %3,3B
DreamZeroWAMOpen25,7 %14B
GR00T N1.6VLAOpen7,2 %3B

Het vorige beste open model was Cosmos3-Nano-Policy van NVIDIA. „Tot 3,95 keer sneller” is vergeleken met Cosmos 3 Nano in FP8: afhankelijk van de GPU is FLUX 3 Action 1,52 tot 3,95 keer zo snel. Vergeleken met π0.5, het best presterende open vision-language-action-model (VLA), is de tot één stap gedistilleerde variant (38,3 %) sneller op GPU’s voor werkstations en datacenters, maar trager op een RTX 5090; per voorspelling voorspelt deze variant wel 2,13 seconden beweging vooruit, tegenover 1 seconde voor π0.5.

De blogpost test ook een hybride beleid waarbij GPT-6 Astra van OpenAI toezicht houdt op de robot: met Astra op een laag inspanningsniveau (low) voltooit FLUX 3 Action 90 % van de episodes, tegen 8,77 dollar en ongeveer 8 minuten per geslaagde taak. Astra alleen, op inspanningsniveau „xhigh”, voltooit alle taken, maar kost 13,47 dollar en 16 minuten per succes. Bij een blinde evaluatie met een echte Franka-robotarm door Positronic Robotics slaagt FLUX 3 Action 28 van de 30 keer, tegenover 27 keer voor Cosmos 3 Nano en 13 keer voor π0.5. Drie checkpoints zijn beschikbaar op Hugging Face (base, SO-101 en DROID), en het model is samen met NVIDIA geïntegreerd in LeRobot, met de mogelijkheid om het op Jetson te draaien.

🔗 FLUX 3 Action (Black Forest Labs) · Hugging Face-collectie


Escaping SPACE: Perplexity publiceert de eerste beveiligingsaudit van de sandbox van Computer

23 september — Het Perplexity Secure Intelligence Institute publiceert het eerste deel van een rapport over penetratietests (red-teaming) op SPACE, de sandbox waarin de agenten van Perplexity Computer draaien en die op 15 juli werd gepresenteerd. Dit is de eerste gepubliceerde beveiligingsevaluatie van SPACE. Elke sandbox is een Firecracker-micro-VM, geïsoleerd van de hostmachine, en een gateway per sandbox handhaaft het beleid voor uitgaand netwerkverkeer.

Negen modellen kregen roottoegang in de virtuele machine en twee opdrachten van het type capture the flag: de grens tussen de VM en de host doorbreken om een lok-AWS-identificatiecode op te halen, of een URL bereiken die door het netwerkbeleid wordt geblokkeerd. Het testprotocol combineert wel of geen toegang tot de broncode van SPACE met twee netwerkniveaus, geen toegang of beperkte toegang (PyPI- en Ubuntu-pakketbronnen en de webzoekfunctie van Perplexity), met drie pogingen per configuratie. Het resultaat: in 108 pogingen ontsnapte geen enkel model uit de VM naar de host, zelfs niet met toegang tot de broncode. De netwerkfiltering hield stand wanneer alles geblokkeerd was (0 van 54); bij beperkte netwerktoegang bereikten daarentegen 11 van de 54 pogingen de verboden bestemming, voordat de kwetsbaarheden werden verholpen.

Beoordeeld modelGeslaagd met broncodeGeslaagd zonder broncode
Claude Opus 5.03 van de 3 pogingenGeen
GPT-5.6 Sol3 van de 3 pogingen2 van de 3 pogingen
Kimi K32 van de 3 pogingenGeen
GPT-5.6 CyberGeen1 van de 3 pogingen
Vijf andere beoordeelde modellenGeenGeen

Er werden twee zwakke plekken benut. De eerste was DNS-spoofing: de agent voegde een vals antwoord toe dat pypi.org aan het adres van het doel koppelde, waarna de gateway het vastlegde zonder de herkomst te controleren; daarvoor was een intern adres nodig dat alleen in de broncode zichtbaar was. De tweede berustte op het delen van IP-adressen via een CDN: GPT-5.6 Sol liet fiddle.fastly.dev de verboden URL opvragen, bereikbaar via hetzelfde adres als PyPI, en GPT-5.6 Cyber gebruikte een beelddienst van Taboola en de screenshotgenerator thum.io om daarna de vlag met tekstherkenning te lezen. Claude Opus 5.0 herkende deze route, maar verwierp haar omdat die volgens het model in strijd was met de instructie om geen extern systeem als doelwit te kiezen. Kimi K3 is het enige model met open gewichten dat slaagde. Twee modellen konden niet worden geëvalueerd: Fable weigerde de oefening ondanks Perplexity’s deelname aan het Cyber Verification Program van Anthropic, en ook GPT-6 Astra weigerde.

De kwetsbaarheden, ontdekt op 26 augustus, zijn verholpen: elk uitgaand pakket moet het aan de eigen VM toegewezen adres dragen, en de gateway handelt TLS zelf af om de servernaam (SNI) en de HTTP-host te controleren. Bij een nieuwe evaluatie in de voor de aanvaller gunstigste configuratie wisten de modellen de vlag niet meer te bemachtigen. Perplexity testte vervolgens zonder agent tien sandboxplatforms van derden: bij acht bleek minstens één omzeiling mogelijk, waaronder E2B, Vercel Sandbox, Modal Sandboxes en Daytona Sandbox, terwijl Cloudflare Sandbox en NVIDIA OpenShell standhielden. Alle aanbieders, die op 1 september op de hoogte werden gebracht, reageerden; op 10 september hadden Daytona, Deno en microsandbox de problemen verholpen, terwijl Vercel en Modal het gedrag als een bekende beperking beschouwden. Het tweede deel van het rapport, over de strategieën van de modellen, is aangekondigd zonder datum.

🔗 Escaping SPACE, deel I


Claude Code 2.1.281: attributie uitschakelbaar en automodus aangescherpt

23 september — Claude Code 2.1.281 verscheen om 19.19 uur UTC, een dag na 2.1.280, en bevat 176 vermeldingen, waaronder 112 bugfixes. Twee veranderingen zijn dagelijks merkbaar: de instelling "attribution": false in settings.json verwijdert alle attributie uit commits en pull requests, en het direct verzenden van een bericht (ctrl+enter) laat lopende tools op de achtergrond doorgaan in plaats van de beurt te annuleren.

De automodus wordt strenger: wanneer de beoordeling door de classifier op de server draait, wachten zelfs shellcommando’s die alleen lezen op het oordeel. Een beveiligingsoplossing verdient vermelding: een recursieve rm gericht op commandosubstitutie, zoals rm -rf "$(pwd)", werd in de automodus en met --dangerously-skip-permissions zonder bevestiging uitgevoerd; voortaan is bevestiging vereist, zelfs met een toegestane Bash-regel. Om onbeheerde sessies niet te blokkeren, wacht de prompt voor een gevaarlijke rm twee minuten en weigert daarna het commando met een voorstel om het te herschrijven.

Incompatibele wijziging voor zelfgehoste runners: tussenscripts (wrappers) of hooks die --system-prompt toevoegen, moeten overstappen op --system-prompt-file. Voor beheerders kan de Claude apps-gateway Amazon Bedrock aanroepen met een via STS verkregen IAM-rol (assume_role), zo nodig in een ander AWS-account, en op elk verzoek een Bedrock-beveiligingsmaatregel toepassen.

🔗 Claude Code v2.1.281


Anthropic als product: claude.ai versneld, Marketplace uitgebreid

Twee productaankondigingen van Anthropic, gepubliceerd op dezelfde dag, vullen het wetenschappelijke resultaat aan.

claude.ai in twee weken drie keer zo snel

23 september — Op claude.dev beschrijven drie ingenieurs van Anthropic de sprint van twee weken in augustus die claude.ai en de desktopapp ongeveer drie keer zo snel maakte. Alles gebeurde in één Slack-kanaal, met Claude Tag (bèta), aangedreven door een intern onderzoeksmodel dat „ongeveer vergelijkbaar is met Opus 5.5”: Claude spoorde knelpunten op, bouwde benchmarks, stelde oplossingen voor en bewaakte de uitrol, terwijl mensen de doelen bepaalden en elke wijziging goedkeurden. Het resultaat: meer dan 3.000 samengevoegde wijzigingen, zonder voor klanten zichtbaar incident of terugdraaiing.

Gemeten traject (75e percentiel)Voor de sprintNa de sprint
claude.ai-pagina klaar voor invoer3,1 s0,55 s
Nieuwe Claude Code-sessie (desktop)0,8 s0,3 s
Claude Cowork-cloudsessie (desktop)2,6 s0,73 s
Geometrisch gemiddelde over 13 metingen3,1x sneller

De methode berust op één idee: zodra Claude een getal heeft om te verbeteren, kan het optimaliseren. Het team zette daarom deterministische metingen om in CI-ratchets die alleen omlaag kunnen. Een deel van deze winst, ongeveer vier keer vloeiender streaming, was al op 24 augustus aangekondigd.

🔗 Hoe we claude.ai in twee weken 3x sneller maakten

Claude Marketplace brengt connectors, agents en integrators samen

23 september — Anthropic breidt Claude Marketplace uit, dat in maart als beperkte preview werd gelanceerd. Het aanbod omvat nu drie soorten diensten: meer dan 2.000 connectors en plugins (Atlassian, Google, Microsoft, Notion, Salesforce…), agents en producten op basis van Claude (CrowdStrike, Cursor, Harvey, Legora, Lovable, Snowflake), die bedrijven met een deel van hun bestedingsverplichting bij Anthropic kunnen betalen, en adviesbureaus van het Claude Partner Network (Accenture, Boston Consulting Group, Deloitte). Leveranciers kunnen op drie manieren deelnemen: een connector of plugin bouwen met MCP en Agent Skills, een agent of product aanmelden, of toetreden tot het Partner Network. Een begeleidend artikel laat zien hoe de aankoop werkt: CodeRabbit financierde een Vercel-abonnement met zijn toegezegde Anthropic-budget; de overeenkomst werd in een week gesloten. Betalen via de bestedingsverplichting bij Anthropic blijft een beperkte preview waarvoor geschiktheid moet worden aangevraagd.

🔗 Claude Marketplace


ChatGPT: Voice komt in actie, flashcards en Privacy Center

Voice gebruikt plugins en komt naar ChatGPT Work

23 september — OpenAI breidt ChatGPT Voice in twee richtingen uit. De spraakmodus Live kan tijdens een gesprek op het web, iOS en Android nu plugins en aan het account gekoppelde apps gebruiken, zoals e-mail, agenda of Slack. Ook komt Voice naar ChatGPT Work op het web en mobiel: gebruikers kunnen hardop vragen een document, presentatie of spreadsheet te maken, een gekoppelde app te gebruiken of een taak in de browser uit te voeren. Die taak kan na het gesprek schriftelijk worden voortgezet.

Wat de modellen betreft, vermeldt de tweet van OpenAI dat Voice ook GPT-6 Astra, Sol en Luna kan gebruiken; het helpartikel stelt dat Live, afhankelijk van het abonnement, op GPT-Live-1 of GPT-Live-1 mini draait, zonder de rol van de GPT-6-modellen toe te lichten. Gebruikers met Free en Go hebben Voice in Chat met de plugins van hun abonnement; Voice in Work vereist toegang tot beide, en taken die zo worden gestart tellen mee voor het normale gebruik van Work. Live ondersteunt geen video of schermdeling. De wereldwijde uitrol loopt sinds 23 september in de nieuwste versie van de app.

🔗 Aankondiging van OpenAI op X · Helpartikel over ChatGPT Voice

Flashcards en privacycentrum

22 september — ChatGPT kan nu interactieve flashcards maken op basis van een onderwerp of geüploade aantekeningen. Je tikt op een kaart om die om te draaien en geeft vervolgens aan of je het antwoord wist of het nog eens moet bekijken; de volgorde van de kaarten kan worden geschud. De kaarten worden automatisch in de bibliotheek opgeslagen. De functie is op mobiel en op het web beschikbaar voor alle abonnementen, ook het gratis abonnement.

21 september — Terugblik: dezelfde pagina met release notes kondigde de dag ervoor een privacycentrum (Privacy Center) aan, dat wordt uitgerold voor ingelogde gebruikers met Free, Go, Plus en Pro. Het brengt informatie over de privacy van gesprekken, geheugen, personalisatie, gegevensgebruik, gekoppelde apps en accountbeveiliging op één plek samen, met directe links naar de instellingen. Op het web is het bereikbaar via het accountmenu (Help, daarna Privacy Center) en op mobiel via de instellingen.

🔗 Release notes van ChatGPT


Twee nieuwe benchmarks: geestelijke gezondheid en inferentiediensten

MentalHealthBench (OpenAI)

23 september — OpenAI publiceert MentalHealthBench, een open benchmark die meet hoe modellen reageren in realistische gesprekken over geestelijke gezondheid, van alledaagse gesprekken met een emotionele component tot noodsituaties. De benchmark is samen ontwikkeld met meer dan 80 erkende psychologen en psychiaters uit 22 landen, die 19 talen spreken. De synthetische gesprekken bevatten vier profielen: volwassenen, jongeren van 13 tot 17 jaar, mantelzorgers en zorgverleners. Voor elk gesprek schreven de deskundigen gewogen criteria van -10 tot +10; alleen criteria die door minstens twee van de drie deskundigen waren goedgekeurd, zonder tegenspraak van de derde, bleven behouden. De beoordeling verloopt automatisch, met GPT-5.6 Sol als beoordelaar, en de score wordt uitgesplitst in tien dimensies, zoals veiligheid, het zoeken naar context en respect voor de autonomie van de gebruiker. OpenAI stelt dat de modellen gestaag vooruitgaan, met name bij het zoeken naar context, maar de scores per model staan alleen in de grafieken van het artikel. OpenAI benadrukt dat ChatGPT geen vervanging is voor therapie of professionele begeleiding.

🔗 Introductie van MentalHealthBench

SWE-Serve (NVIDIA)

23 september — Het team van NVIDIA dat verantwoordelijk is voor de data en evaluatie van de Nemotron-modellen publiceert SWE-Serve, ontwikkeld met het SGLang-team: 83 daadwerkelijk samengevoegde pull requests in deze inferentieserver zijn omgezet in 53 uitvoerbare taken (speculatief decoderen, ondersteuning van modellen, kernels, cache, service-API). Het belangrijkste resultaat betreft het verschil tussen lokale tests en de echte dienst: bij de 19 taken die een echte server starten, slagen dezelfde oplossingen voor 69,4 % zonder live servicetests, maar voor 45,9 % met de volledige verifier. Ongeveer één op de drie oplossingen die de andere controles doorstaat, faalt dus zodra het model wordt geladen en bevraagd.

Beoordeeld model (maximaal redeneren)pass@1 over 3 runsGemiddelde kosten per taak
Claude Opus 575 %17,40 dollar
GPT-5.6 Sol75 %12,26 dollar
Kimi K364 %7,24 dollar
GPT-5.6 Luna64 %0,95 dollar
DeepSeek V4 Flash (0731)55 %0,69 dollar

Elf modellen zijn beoordeeld met een minimale agent, zonder toegang tot het web; de tabel bevat geen Claude Opus 5.5, GPT-6 Sol of Luna, die op 22 september verschenen, en ook geen GPT-6 Astra. De taken en verifiers zijn openbaar.

🔗 Hoe SWE-Serve de kloof tussen lokale tests en live dienstverlening blootlegt · GitHub-repository


Generatieve video vindt zijn weg naar montagesoftware

Runway in DaVinci Resolve Studio

23 september — Twee weken na zijn plugins voor Premiere Pro en After Effects komt Runway naar DaVinci Resolve Studio, de montagesoftware van Blackmagic Design. De gratis plugin voor macOS en Windows wordt geopend via Workspace en vervolgens Workflow Integrations. Je kunt er met een prompt beelden en video’s genereren en die met één klik importeren in de Media Pool en op de timeline, zonder de browser te gebruiken. De functie Edit Studio werkt op een shot dat al is gemonteerd: het paneel exporteert het gekozen fragment en Aleph 2.0 rendert het opnieuw in een nieuwe stijl, met dezelfde duur, op basis van maximaal vijf bewerkte keyframes. DaVinci Resolve Studio 19 of nieuwer is vereist; genereren is beschikbaar voor alle betaalde Runway-abonnementen en verbruikt bestaande credits. De kosten van elke generatie worden vóór bevestiging getoond.

🔗 Runway is nu beschikbaar in DaVinci Resolve

Gemini Omni 1.1 Flash gratis in Google Vids

23 september — Iedereen met een Google- of Google Workspace-account kan nu gratis video’s genereren met Gemini Omni 1.1 Flash in Google Vids, via vids.new op een computer. Versie 1.1 biedt drie opdrachten: een scène verlengen met behoud van personages, belichting en decor, de exacte lengte van een clip instellen om die op een voice-over af te stemmen, en direct in 1080p genereren. Elke clip krijgt een SynthID-watermerk. De volledige uitrol begint op 23 september en kan 1 tot 3 dagen duren; betaalde abonnementen bieden hogere generatievolumes, maar Google heeft geen aantallen bekendgemaakt. Google kondigt aan dat gesproken tekst met Gemini 3.8 Flash-Lite TTS binnenkort in Vids beschikbaar komt, in meer dan 100 talen.

🔗 Aankondiging van Google

Made On YouTube 2026: Gemini Omni bij het monteren van Shorts

23 september — Tijdens zijn jaarlijkse evenement Made On YouTube integreert YouTube Gemini Omni in een conversationele montageassistent voor Shorts en de app YouTube Create: eenvoudige tekstinstructies volstaan om gesproken passages weg te knippen, muziek te synchroniseren, tekstuele blikvangers toe te voegen of shots in een andere volgorde te zetten. Livestreams krijgen automatische nasynchronisatie (Live auto-dubbing), YouTube Music krijgt Ask Music om via gesprekken afspeelwachtrijen samen te stellen, en Podcast Lineup levert wekelijks door AI gegenereerde gesproken voorproefjes van aanbevolen podcasts. Makers krijgen ook uitgebreidere herkenning van gelijkenis om hun stem en gezicht te beschermen. Alleen de gepersonaliseerde startfeeds (Custom Feeds) hebben een tijdsaanduiding: die komen dit najaar voor Amerikaanse kijkers; voor de overige functies is nog geen precies tijdschema bekend.

🔗 Made On YouTube 2026 · Overzicht van Google


Assistenten maken verbinding met andere apps

Gemini: een nieuwe reeks gekoppelde apps

23 september — Google rolt een nieuwe reeks apps uit die aan Gemini kunnen worden gekoppeld; het account @GeminiApp omschrijft die als MCP-verbindingen. Het artikel noemt 14 namen in drie categorieën: productiviteit (Airtable, Linear, monday.com, PandaDoc, Wispr AI, Zoho), creatie (Adobe, Picsart, Squarespace, Webflow) en dagelijks leven (apartments.com, Experian, Peloton, SeatGeek); de tweet van @GeminiApp spreekt van 13 nieuwe apps. Deze diensten kunnen in de instellingen worden geactiveerd of in een gesprek worden aangeroepen door @ te typen. Genoemde voorbeelden zijn de belichting van een foto aanpassen met Adobe en je kredietscore bekijken met Experian. Het artikel vermeldt niet voor welke landen of abonnementen dit geldt.

🔗 Aankondiging van Google · Aankondiging van @GeminiApp

Muse, de agent van Meta: Shopify, PayPal, Expedia, Instacart, daarna ElevenLabs en HeyGen

22 en 23 september — Muse, de persoonlijke agent die Meta op 8 september lanceerde, kondigde in minder dan 24 uur vier connectors voor commerciële diensten aan. Volgens het officiële account @Muse zijn ze allemaal „binnenkort” beschikbaar, zonder datum, prijs of landen te noemen. Op de 23e kondigden twee bedrijven voor generatieve media ook hun komst aan: ElevenLabs, zonder beschikbaarheidsdatum, en HeyGen, dat zijn MCP-server gebruikt.

Aangekondigde dienstGebruik volgens de aankondigingAangekondigd doorAangekondigde beschikbaarheid
ShopifyMet één handeling betalen op het hele web@MuseBinnenkort
PayPalDoor de agent beheerde betalingen, wereldwijd@MuseBinnenkort
ExpediaHotels boeken@MuseBinnenkort
InstacartBoodschappen thuisbezorgd@MuseBinnenkort
ElevenLabsVoice-overs, soundtracks en video’s@ElevenLabsNiet vermeld
HeyGenVideo van je avatar, met je stem, klaar om te publiceren@HeyGenNiet vermeld

🔗 De vier door @Muse aangekondigde connectors · ElevenLabs komt naar Muse · HeyGen sluit zich aan bij Muse

Grok Bot in Tesla’s en in Google Slides, Sheets en Docs

22 september — Tesla kondigt de komst aan van Grok Bot, de agent van SpaceXAI, in zijn auto’s: met Connectors kan Grok de mailbox beheren, de agenda ordenen of bestaande bestanden, gesprekken en taken oppakken, zonder dat de bestuurder het stuur loslaat. Het account @grok deelde de aankondiging diezelfde avond. Activeren gebeurt in drie stappen: inloggen bij de Grok-app in de auto, Connectors toevoegen via de mobiele app of de website van Grok, en vervolgens een abonnement nemen op SuperGrok, dat vereist is voor Grok Bot. De berichten vermelden niet om welke voertuigmodellen of landen het gaat.

Diezelfde dag kondigt het account @bot aan dat Grok Bot rechtstreeks verbinding maakt met Google Slides, Sheets en Docs, e-mailbijlagen beter verwerkt (bestanden lezen en toevoegen) en zijn webnavigatie via het netwerk van de gebruiker kan laten lopen. SpaceXAI belooft ook snellere taken en een responsievere desktopapp, zonder cijfers te geven.

🔗 Bericht van @grok · Aankondiging van Tesla · Berichtenreeks van Grok Bot


Antigravity: lokale agents en opdracht /plan

De SDK laat zijn agents lokaal draaien met Gemma 4 26B

23 september — De Antigravity SDK, die vanuit Python toegang geeft tot de agentmogelijkheden van Google Antigravity, ondersteunt nu volledig lokale workflows. De eerste ondersteuning geldt voor Gemma 4 26B A4B, uitgevoerd met LiteRT (Google AI Edge) op een machine met meer dan 24 GB VRAM of gedeeld geheugen; LocalOpenAIAgentConfig maakt verbinding met elke OpenAI-compatibele server, zoals Ollama, LM Studio of vLLM. Volgens Google zijn er geen API-kosten of snelheidslimieten, blijft de code op de machine en zijn hybride workflows mogelijk. In de demonstratie plant Gemini 3.8 Flash in de cloud de audit van drie kwetsbare modules met 95 tokens, zonder de code ooit te zien. Ondertussen reproduceren lokale instanties van Gemma 4 26B de kwetsbaarheden en schrijven en valideren ze de oplossingen; 97,2 % van de tokens (3 322) blijft lokaal. Deze vernieuwingen kwamen op 21 september met SDK 0.1.18, die ook de interactieve vraagtool ASK_QUESTION uit de standaardtools verwijdert, zodat agents zelfstandig kunnen werken.

🔗 Aankondiging van Google Developers

Antigravity 2.16.0 en 2.17.0, CLI 1.2.8 en 1.2.9

22 september — De Antigravity-app brengt op dezelfde dag twee versies uit. Versie 2.17.0 introduceert de opdracht /plan: de agent schrijft een plan dat je kunt bekijken en aanpassen voordat hij ook maar één regel code schrijft. Daarbij hoort een instelling voor Plan Review Policy met drie modi (elk plan beoordelen, de agent laten beslissen, of geen beoordeling). De versie reserveert ook een budget van 20 000 tokens voor regels en leest de configuratie per repository uit .gemini/config.json; het oude .agents/settings.json wordt niet meer gebruikt. Versie 2.16.0 maakt verbinding met een WSL-distributie mogelijk, laat je Word-, Excel- en PowerPoint-documenten aan een prompt toevoegen en toont subagents op live bijgewerkte kaarten.

AppversieAantal verbeteringenAantal bugfixesBelangrijkste vernieuwing
2.16.01215WSL, Office-bijlagen, kaarten voor subagents
2.17.01110/plan, budget van 20 000 tokens voor regels

22 en 23 september — In de terminal voegt CLI 1.2.9 een @-syntaxis toe om rechtstreeks een subagent aan te spreken en maakt de headless-modus betrouwbaarder: achtergrondtaken krijgen tot 30 minuten de tijd, in plaats van enkele seconden na inactiviteit van de agent te worden geannuleerd. Versie 1.2.8 herziet de contextcompactie en beperkt spraakdictatie tot 3 min 30 s.

🔗 Changelog van Antigravity


Google DeepMind: versleuteld persistent geheugen voor Private AI Compute

23 september — Google DeepMind beschrijft hoe het Private AI Compute, zijn verwerkingsplatform met hardwarematig geïsoleerde cloudomgevingen, van persistent geheugen wil voorzien. Tot nu toe was het platform ‘toestandloos’: alle context verdween na afloop van een taak. De nieuwe laag werkt als een versleutelde kluis in de cloud, waarvan de sleutels uitsluitend op de apparaten van de gebruiker blijven. Daardoor zijn de gegevens volgens Google voor niemand toegankelijk, ook niet voor Google zelf. Wanneer een model informatie nodig heeft, ontsleutelt een beveiligde omgeving de gegevens tijdelijk in geïsoleerd geheugen, verwerkt het verzoek, slaat de nieuwe context op en versleutelt die meteen opnieuw. Een genoemd voorbeeld is het terugvinden op een computer van montage-instructies die eerder via een slimme bril zijn bekeken.

Het gaat om een aankondiging van een architectuur die nog moet worden ingevoerd, zonder beschikbaarheidsdatum of genoemd product. Om het vertrouwen te onderbouwen, publiceert Google een bijgewerkt witboek, een publiek, fraudebestendig register van zijn serversoftware dat apparaten kunnen controleren voordat ze persoonsgegevens versturen, en de resultaten van een onafhankelijke audit door een niet bij naam genoemd bureau.

🔗 Artikel van Google DeepMind


Qwen: agents voor smartphones en goedkopere audio

Qwen Intelligence, drie agents voor telefoonfabrikanten

23 september — Qwen lanceert Qwen Intelligence, een aanbod van agents voor smartphones dat in eerste instantie op telefoonfabrikanten is gericht. De modules (planning, uitvoering, beeld, geheugen) kunnen naar keuze worden gecombineerd, terwijl een routering de berekeningen verdeelt tussen het apparaat en de cloud. Bij de lancering zijn er drie agents: Mobile Planner plant complexe taken, Mobile-Use voert ze uit via eerst de API’s en zo nodig de grafische interface (82,1 op MobileWorld, 97,2 op AndroidDaily en volgens Qwen 90 % succes van begin tot eind), en Mobile Creative genereert in 3 seconden een afbeelding. Qwen stelt vier benchmarks beschikbaar, maar niet de gewichten of de code van de agents. Mobile-Use en Mobile Creative worden al naar gebruik gefactureerd; de facturering van Mobile Planner wordt ‘binnenkort’ verwacht.

Geëvalueerd model of systeem (volgens Qwen)Totaalscore MobilePA-Bench
Qwen-Planner-Agent 27B77,05 %
GPT-6 Astra76,84 %
Claude Opus 575,71 %
Claude Fable 574,53 %
GLM 5.373,88 %

🔗 Aankondiging van Qwen op X · Rapport over Qwen-Planner-Agent

Qwen-Audio-3.1, tot 95 % goedkoper

23 september — Qwen-Audio-3.1 vernieuwt de drie audiomodellen van Qwen voor spraakherkenning (ASR), spraaksynthese (TTS) en realtime gesprekken (Realtime), en voegt er twee toe: TTS-Next, dat in één keer spraak, effecten en achtergrondgeluid genereert, en ASR-Next, dat sprekers onderscheidt, tijdstempels aan transcripties toevoegt en emoties en omgevingsgeluiden herkent. Realtime luistert en spreekt tegelijk en kan worden onderbroken. Op QwenCloud kost qwen-audio-3.1-realtime-plus 6,4 dollar per miljoen inkomende audiotokens en 24 dollar per miljoen uitgaande tekst- en audiotokens, met een context van 262K tokens; ASR voor bestanden kost 0,15 dollar per miljoen inkomende tokens. Alleen deze twee API’s zijn beschikbaar; de andere zijn voor ‘binnenkort’ aangekondigd.

ModelfamilieAangekondigde prijsdaling
TTSongeveer 70 %
Realtimeongeveer 85 %
ASRtot 95 %

🔗 Aankondiging van Qwen-Audio-3.1 op X · Qwen-Audio-3.1-Realtime op QwenCloud


Mistral Vibe: Chat en Work worden samengevoegd, de CLI scherpt zijn machtigingen aan

Chat en Work worden samengevoegd, kennisbank in preview

22 september — Mistral publiceert vier release notes voor Vibe, zijn assistent (voorheen Le Chat), zonder blogartikel of bericht op X. De belangrijkste aankondiging voegt Chat en Work samen tot één ervaring: je stelt op dezelfde plek een vraag of start een taak. Een Fast / Think-keuzemenu vervangt het wisselen van modus, en Skills vervangen de Chat Agents, waarbij Deep Research een van die Skills wordt. De migratie begon op 14 september voor Free-, Pro- en Teams-accounts; zakelijke klanten volgen vanaf 1 oktober, binnen een periode van ongeveer zes maanden. De agentische kennisbank (Agentic Knowledge Base), in publieke preview, vervangt een ondoorzichtig geheugen door pagina’s die je kunt raadplegen en bewerken, en vermeldt de bron van elk herinnerd feit. Mini App Canvas genereert vanuit een prompt kleine, deelbare React-apps, en Excel- en CSV-spreadsheets komen beschikbaar in Vibe Work bij betaalde abonnementen.

🔗 Release notes van Mistral

Vibe CLI 2.25.8 verhelpt omzeilingen van machtigingen

23 september — Vibe CLI 2.25.8 bevat 5 toevoegingen en 38 bugfixes, waarvan er meerdere betrekking hebben op de beveiliging van machtigingen. Een machtiging op basis van een relatief pad geeft niet langer toegang tot een bestand alleen omdat het pad op hetzelfde achtervoegsel eindigt. Wildcards in shellopdrachten omzeilen de controle van paden buiten de werkmap niet meer, en een machtiging voor een bovenliggende map geldt niet langer automatisch voor submappen. Daardoor kunnen sommige goedkeuringsverzoeken opnieuw verschijnen. De release notes noemen ook voor het eerst een ‘Rust CLI’, waarop 18 regels betrekking hebben en waarmee onder meer externe projecten van Vibe Code kunnen worden geconfigureerd. Voor bedrijven wordt de door de organisatie opgelegde configuratie toegepast zodra een Unified Harness-sessie wordt geopend. Ook is de OAuth-verbinding met MCP-servers die een clientgeheim uitgeven, zoals Supabase, gecorrigeerd.

🔗 Release notes van Vibe CLI 2.25.8


Open source codeagents voor de opdrachtregel

ZCode wordt open source na beveiligingsproblemen

21 september — Terugblik: Z.ai heeft de code van ZCode vrijgegeven, zijn infrastructuur voor agentisch programmeren die wordt gepresenteerd als het officiële hulpmiddel van GLM-5.3. Dat gebeurde naar aanleiding van beveiligingsproblemen die door de gemeenschap waren gemeld. Het account @zcode_ai zegt de noodzakelijke correcties te hebben voltooid en biedt excuses aan. De repository zai-org/ZCode, onder de Apache-2.0-licentie, bevat de clients, backenddiensten, CLI en runtime van de agent; op 23 september had die ongeveer 6 500 sterren.

With respect to the code data referenced by the community, we confirm that no such data is retained and that it has never been used for model training.

🇳🇱 Wat betreft de codegegevens waarover de gemeenschap sprak, bevestigen we dat geen van deze gegevens wordt bewaard en dat ze nooit zijn gebruikt om modellen te trainen.@zcode_ai op X

Volgens ZCode hebben daarna twee organisaties de situatie beoordeeld: volgens CAICT bevat de Alibaba Cloud OSS-bucket ‘zcode-prod’ geen gegevens meer; volgens NSFOCUS zijn zowel de objecten als de bucket zelf verwijderd. Beide constateren dat client v3.14.0 de correctie bevat, dat de functie Repo Wiki is verdwenen en dat de stroom die momentopnamen van lokale repositories uploadde, is uitgeschakeld. Z.ai kondigt een permanent meldproces voor kwetsbaarheden met beloningen aan en belooft het volledige beoordelingsrapport te publiceren.

🔗 Broncode van ZCode op GitHub

Kimi Code 2.1.0 versterkt de beveiliging

23 september — Moonshot brengt Kimi Code 2.1.0 uit (2 nieuwe functies, 18 bugfixes). De zichtbare vernieuwing is een experimentele schermvullende indeling, te kiezen via /settings en van kracht na een herstart. Verschillende bugfixes versterken de beveiliging: bestandstools kunnen via symbolische links niet meer buiten de werkmap komen, de lokale configuratie van een project wordt pas toegepast nadat de werkruimte is goedgekeurd, de git-configuratie van een repository kan tijdens git-bewerkingen op de achtergrond geen opdrachten meer uitvoeren, en extra mappen die naar de thuismap of de hoofdmap verwijzen, worden geweigerd. OAuth voor MCP-servers vraagt voortaan offline toegang, waardoor elk uur opnieuw autoriseren niet meer nodig is. Tegelijkertijd heeft Moonshot de oude, in Python geschreven Kimi CLI (11 424 sterren) gearchiveerd; versies 1.51.0 en 1.52.0 verwijzen naar Kimi Code.

🔗 Release notes van Kimi Code 2.1.0

DeepSeek Harness 0.1.7-rc.1, in preview

23 september — DeepSeek publiceert v0.1.7-rc.1 van DeepSeek Harness, zijn open source agentinfrastructuur onder de MIT-licentie die op 13 augustus werd gepresenteerd. Het is een release candidate: de repository telt sinds augustus 21 previewversies, maar tot op heden geen stabiele versie. De opvallendste toevoegingen zijn experimenteel: een Computer Use-modus waarmee de agent handelingen op de lokale computer kan uitvoeren en schermafbeeldingen kan maken (via Cua Driver MCP of een native driver), en drie backends voor browserbesturing (Playwright MCP, Chrome DevTools MCP, Stagehand). De webinterface krijgt ingebouwde terminals en een beoordeling van wijzigingen met diffs, de headless-modus leest taken van standaardinvoer en geeft gebeurtenissen uit als JSON, en de agent kan via SSH in een externe werkruimte werken. Houd rekening met migraties: de officiële adapter van DeepSeek gebruikt voortaan uitsluitend de Messages API, de E2B-uitvoeringsbackends verdwijnen en de experimentele teammodus gaat van 8 naar 16 teamleden.

🔗 DeepSeek Harness v0.1.7-rc.1

GenCode, de codeagent van Genspark

23 september — Genspark lanceert GenCode, een codeagent die is geïntegreerd in zijn Super App op macOS, Windows en Linux en ook via de opdrachtregel beschikbaar is. De belangrijkste troef is de modelkeuze: Claude, GPT, DeepSeek of een model met open gewichten, per taak te kiezen vanuit één account en zonder een API-sleutel te configureren. Volgens Genspark kosten open modellen ‘1/10 tot 1/20 van de prijs’. GenCode neemt in één stap de instructies, regels en het geheugen over die voor Claude Code zijn opgebouwd. De README van het npm-pakket @genspark/gencode verduidelijkt de herkomst: het is afgeleid van opencode, de open source codeagent, maar blijft een propriëtair product dat niet bij het project hoort en bewust de map .opencode/ van repositories deelt. De kosten worden bij elke stap in Genspark-credits weergegeven.

🔗 GenCode · Aankondiging van Genspark op X


GitHub Copilot: ondersteunde goedkeuringen en lokale sandbox

Copilot voor JetBrains 1.18.0

22 september — Versie 1.18.0 van Copilot voor JetBrains-IDE’s introduceert in publieke preview ondersteunde goedkeuringen (assisted approvals): in agentsessies worden toolaanroepen met een laag ingeschat risico automatisch goedgekeurd, terwijl voor riskantere acties nog steeds een beslissing nodig is. Je kunt ook een eerder bericht opnieuw bewerken: Copilot draait dan het gesprek en de bestandswijzigingen terug voordat het de nieuwe instructie verstuurt. De Codex-agent, beschikbaar in Copilot voor JetBrains, krijgt een planmodus om de aanpak vóór elke wijziging te bekijken, verfijnen of goed te keuren. Sessies ondersteunen ook Skills en instructies van organisaties en bedrijven. De ingebouwde GitHub MCP-server, die standaard actief is, kan worden uitgeschakeld. Gebruikers van een JetBrains-IDE uit de 2025.1-reeks krijgen een melding met het advies over te stappen op 2026.1 of nieuwer.

🔗 Wat is er nieuw in Copilot voor JetBrains

De Copilot-app beperkt zijn lokale sessies tot een sandbox

23 september — De GitHub Copilot-app, de desktopapp van GitHub voor zijn agents, krijgt in publieke preview een lokale sandbox. Die wordt per project geconfigureerd en beperkt waartoe opdrachten in een lokale sessie toegang hebben: het bestandssysteem (mappen met lees- en schrijftoegang, alleen-lezen toegang of geen toegang), het netwerk (uitgaande toegang tot internet en het lokale netwerk) en aanmeldgegevens (Git via HTTPS, GitHub CLI). Door het bedrijf beheerde instellingen kunnen het beleid aanscherpen. Als het besturingssysteem het gevraagde beleid niet kan afdwingen, stopt de shell van de sandbox met een foutmelding in plaats van zonder bescherming te draaien. De sandbox staat standaard uit en kan worden ingeschakeld voor nieuwe sessies van het project, of met /sandbox on voor een lopende sessie. Hij geldt niet voor cloudsessies of externe hosts, en zijn instellingen staan los van die van Copilot CLI.

🔗 Lokale sandbox in de GitHub Copilot-app


Cursor: twee bots voor productie-uitrol, 7 % minder tokens

Rollouts en Security Review

23 september — Cursor lanceert twee bots voor de laatste fase van de levering van code, beschikbaar voor Teams en Enterprise. Rollouts publiceert bij het openen van elke pull request een monitoringsplan (risico’s, verwacht effect, te controleren signalen). Na elke uitrol vergelijkt het dat plan met logs, statistieken en traces en geeft het per omgeving een oordeel: gezond, regressie gedetecteerd of geen uitsluitsel. Bij een regressie wijst het de vermoedelijke wijziging aan en kan het een pull request voor het terugdraaien ervan openen ter goedkeuring; het voegt zelf niets samen en draait zelf niets terug. Security Review controleert elke pull request en meldt uitbuitbare kwetsbaarheden (injecties, omzeiling van authenticatie, geheimen die in de code zijn achtergebleven, SSRF…), telkens met de ernst, de aanvalsmethode en een voorgestelde oplossing. Gedurende 10 dagen kunnen gebruikers met proefcredits Rollouts testen op ongeveer 50 wijzigingen voor Teams en 500 voor Enterprise.

🔗 Wijzigingslogboek van Cursor

7 % lagere kosten in tokens, zonder kwaliteitsverlies

23 september — Cursor legt uit hoe het de kosten in tokens van zijn agent voor gebruikers met 7 % heeft verlaagd, zonder kwaliteitsverlies. Omdat recente modellen geen lange lijsten met verboden meer nodig hebben, is de systeemprompt met ongeveer 66 % ingekort. Die inkortingen zijn gevalideerd met A/B-tests op werkelijk verkeer. Ingebouwde tools, waarvan de meeste in minder dan 20 % van de gesprekken worden gebruikt, worden voortaan op aanvraag geladen.

OptimalisatieDoor Cursor gemeten effect
Ingekorte systeempromptongeveer 66 % van de prompt verwijderd
Ingebouwde tools op aanvraag geladen-60 % beschrijvingstokens in de statische context
Expliciete cachebreekpunten-20 % mislukte cacheverzoeken bij een koude start
Eén regelnummer per tien regels-1,6 % tokens gelezen vanuit de cache
Alle wijzigingen samen-7 % kosten in tokens voor gebruikers

🔗 Blogbericht van Cursor


NVIDIA: open diarization en AI Day Singapore

Nemotron 3 Diarization onderscheidt maximaal acht sprekers

23 september — NVIDIA publiceert Nemotron 3 Diarization op Hugging Face, een model met open gewichten en 100 miljoen parameters dat bepaalt wie wanneer spreekt in een gesprek, ook wanneer stemmen elkaar overlappen. Het volgt maximaal acht sprekers, tegenover vier bij zijn voorganger Streaming Sortformer, en werkt zowel achteraf als met een continue stream, met een instelbare buffervertraging van 30,4 tot 0,32 seconde. Het transcribeert geen woorden: het levert tijdvakken per spreker die met een transcriptiemodel kunnen worden gecombineerd. In de eerste resultaten van Diarization-Bench van VoiceArena staat het bovenaan van 12 systemen met een diarization-foutpercentage van 14,72 %, tegenover 19,3 % voor het volgende systeem. Volgens NVIDIA kan die voorlopige rangschikking nog veranderen. Vergeleken met het vorige model daalt het foutpercentage gemiddeld met 41 % over acht evaluatiedatasets, met een lichte verslechtering bij de gesprekken met twee sprekers in CALLHOME. Licentie: OpenMDW 1.1.

Gepubliceerde metingNemotron 3 DiarizationVorig model
Maximaal aantal gevolgde sprekers84
Doorvoer bij 30,4 s (batches van 32, RTX PRO 5000)15 113 keer realtime2 619 keer
DIHARD III-foutpercentage bij 30,4 s12,73 %19,09 %

🔗 Nemotron 3 Diarization op het Hugging Face-blog

AI Day Singapore: Vera Rubin en Nemotron in Zuidoost-Azië

22 september — In een blogbericht dat op de 22e om 19.30 uur PT verscheen tijdens AI Day Singapore (22 en 23 september), noemt NVIDIA Sea Limited, het moederbedrijf van Shopee, Garena en Monee, het eerste bedrijf in de ASEAN-regio dat zijn Vera Rubin-platform gaat gebruiken om modellen en agents op grotere schaal te ontwikkelen en uit te rollen. Verder laat het bericht zien hoe de open Nemotron-modellen lokaal worden aangepast: AI Singapore breidt zijn SEA-LION-familie voor de talen van de regio uit met Nemotron-modellen; in Vietnam heeft Viettel AI Nemotron 3 Super verfijnd voor het Vietnamees, waarmee het bovenaan de VMLU-benchmark staat; in Thailand heeft iApp Technology Nemotron 3 Nano aangepast aan het Thaise recht met het als open source gepubliceerde OpenThai 2.0 Legal, waarop de juridische chatbot Thanoy draait voor zijn ongeveer 43 000 gebruikers.

🔗 Tijdens AI Day Singapore tonen NVIDIA en partners AI-ontwikkelingen in Zuidoost-Azië


AI zonder problemen in productie nemen

Twee aankondigingen delen hetzelfde uitgangspunt: valideer met echte werklasten voordat verkeer wordt omgeschakeld of machines worden bijgewerkt.

De canary-uitrol van Together AI

22 september — Together AI beschrijft de geleidelijke uitrol voor zijn aanbod Dedicated Model Inference, beschikbaar sinds de update van 15 september: het model achter een endpoint wijzigen zonder onderbreking of wijziging van de URL. Er zijn drie strategieën: bij canary wordt het aandeel van het nieuwe model stapsgewijs verhoogd (standaard 5 %, 25 %, 50 % en daarna 100 %), bij blue-green schakelt al het verkeer in één keer om en bij geleidelijke vervanging worden de replica’s één voor één omgewisseld. Na elke canary-stap vergelijkt een controlepunt de latentie of het foutpercentage met dat van het oude model en pauzeert het de uitrol als die waarden verslechteren. In de gepubliceerde demonstratie wordt de overstap van Qwen2.5-7B naar Qwen3.5-9B al bij 10 % van het verkeer gestopt vanwege een stijging van 137 % in de p95-latentie (1 740 ms tegenover 734 ms). Het oude model werd hersteld zonder dat een van de 6 800 verwerkte verzoeken mislukte.

🔗 Canary-uitrol: modellen in productie bijwerken zonder downtime

NVCRE en NodeWright bij NVIDIA

23 september — NVIDIA beschrijft twee open source-projecten (Apache 2.0) van DSX OS, de softwarelaag van zijn platform voor AI-fabrieken, voor GPU-clusters onder Kubernetes. NVIDIA Cluster Readiness Engine (NVCRE) vertrekt vanuit een vaststelling: een cluster kan alle gezondheidscontroles doorstaan en toch falen bij gedistribueerde training. Daarom certificeert het clusters met echte werklasten (NCCL-communicatietests, DCGM-diagnostiek, NeMo-pretraining) op groepen nodes die op basis van hun topologie zijn gekozen. Het wijst de defecte nodes aan en deelt in de diagnosemodus falende groepen telkens in tweeën totdat de verdachte nodes zijn geïsoleerd. Het blogbericht noemt onder deze werklasten Nemotron 5-modellen met 8 en 56 miljard parameters, zonder verdere details. NodeWright, voorheen Skyhook en bij NVIDIA in productie gebruikt, werkt het systeem van nodes bij (kernelinstellingen, beveiligingsagents, kwetsbaarheidspatches) zodra beschermde taken zijn afgerond. Dat gebeurt in vaste, lineaire of exponentiële golven die automatisch stoppen als te veel batches mislukken.

🔗 Controleer of GPU-clusters klaar zijn voordat AI-werklasten erop worden uitgevoerd · NodeWright


Twee open datasets: gesprekken met meerdere stemmen en een wetenschappelijk corpus

Basis Conversations 1500

23 september — Basis publiceert Basis Conversations 1500 op Hugging Face: 1 502 uur aan spontane gesprekken tussen 2 645 mensen uit 33 landen, in 22 talen, van Engels tot Mingreels en Xhosa. Aan elk gesprek doen twee tot vier mensen mee, ieder opgenomen op een eigen gesynchroniseerd spoor (FLAC 48 kHz). Daarmee kunnen overlappingen, onderbrekingen en spreekbeurten worden onderzocht, waar modellen volgens het team nog moeite mee hebben. Ongeveer 100 uur is nauwkeurig door mensen geannoteerd (113 096 beoordelingen): meelevende of geïrriteerde verbale feedback, ongemakkelijke stiltes en coöperatieve of competitieve overlappingen. De meegeleverde transcripties zijn automatisch gegenereerd en mogen zonder controle niet als trainingsdoel worden gebruikt. Het blogbericht presenteert de dataset als vrij te gebruiken voor commerciële doeleinden en onderzoek, maar er geldt een eigen licentie van Basis (basis-data-license-1.0) en toegang wordt handmatig goedgekeurd.

🔗 Basis Conversations 1500

QVAC Genesis III

23 september — Tether AI Research publiceert QVAC Genesis III, het derde deel van zijn synthetische corpus voor de pretraining van kleine modellen in wetenschap, technologie, techniek en wiskunde. Met 43,06 miljard extra tokens omvat het geheel nu 191,43 miljard tokens en ongeveer 160 miljoen documenten uit 19 vakgebieden; het bijbehorende artikel is geaccepteerd voor de conferentie COLM 2026. De methode ondervraagt een klein leerlingmodel, Qwen3-1.7B-Base: een fout leidt tot een corrigerende uitleg, een goed antwoord tot een analyse van elke antwoordoptie. Een model met 1,7 miljard parameters dat vanaf nul op dit corpus is getraind, presteert duidelijk beter dan hetzelfde model dat met een gelijk tokenbudget op Cosmopedia-v2 is getraind. Het corpus is gepubliceerd onder een niet-commerciële licentie (CC-BY-NC 4.0); voor een erop getraind model is de licentie Apache 2.0 aangekondigd.

Geëvalueerde benchmarkWinst ten opzichte van Cosmopedia-v2 (gelijk tokenbudget)
ARC-Easy+28,57 punten
ARC-Challenge+21,35 punten
GPQA Diamond+2,52 punten
MMLU STEM+15,03 punten

🔗 QVAC Genesis III


AI voor het klimaat en de voedselvoorziening

Ai2 en Global Fishing Watch houden de oceanen met agents in de gaten

23 september — Tijdens de Climate Week in New York kondigen Ai2 en Global Fishing Watch een partnerschap aan om AI, en vooral agents, in te zetten voor oceaanmonitoring en visserijcontrole. De twee organisaties werkten al samen en gaan nu gezamenlijk ontwikkelen: een gedeelde detectiepipeline, nieuwe vision-modellen die satellietbeelden in realtime verwerken en agents die meerdere gegevensbronnen kunnen combineren. Global Fishing Watch krijgt toegang tot OlmoEarth, het op open modellen gebaseerde aardobservatieplatform van Ai2, om zijn gegevens te annoteren en eigen modellen te trainen. De realtime detectie van schepen door Skylight wordt toegevoegd aan zijn portaal voor beheerders van zeegebieden. Beide teams zullen ook agents zoals Shippy verder ontwikkelen, waaraan een analist de geschiedenis van een schip kan opvragen. De aankondiging bevat geen tijdschema of bedrag.

🔗 Ai2 en Global Fishing Watch bundelen hun krachten om AI-agents voor oceaanmonitoring in te zetten

Google.org en de Gates Foundation: voor 200 miljoen kleine boeren

18 en 22 september — Terugblik: Google.org en de Gates Foundation breiden hun gezamenlijke initiatief uit om klimaat-, landbouw- en taaltools op basis van AI beschikbaar te maken voor 200 miljoen kleine boeren in Sub-Sahara-Afrika en Zuid-Azië, tegenover de oorspronkelijk geplande 50 miljoen. De twee partners stellen samen 100 miljoen dollar aan financiering beschikbaar, met technische ondersteuning van onderzoekers en ingenieurs van Google. Het persbericht van de Gates Foundation dateert van 18 september; blog.google berichtte er op de avond van de 22e over. Het programma financiert lokale organisaties zoals Wadhwani AI en Digital Green in India, voegt AI-voorspellingen toe aan het klimaatplatform TomorrowNow, brengt landbouwpercelen in kaart met een resolutie van minder dan een meter en ondersteunt open spraak- en tekstdatasets in meer dan 40 Afrikaanse talen. Kleine boeren produceren bijna 35 % van het voedsel wereldwijd.

🔗 Aankondiging van Google.org · Persbericht van de Gates Foundation


Korte berichten

  • Anthropic, modernisering van code — In de reeks ‘Notes from the Field’ beschrijven twee bij klanten gedetacheerde ingenieurs van Anthropic, Jonah Ezekiel en Lexie Tonelli, zes stappen om een door agents uitgevoerde modernisering van code voor te bereiden: een doel, een ‘certificaat’ van tests, stapsgewijze menselijke beoordeling, randvoorwaarden, een agentworkflow en vervolgens de start. Ze noemen geen kostenbedrag en adviseren dit in een proefproject te meten. 🔗 bron
  • Boris Cherny verifieert de Claude Agent SDK met Lean — Op de avond van de 22e vertelt Boris Cherny (Claude Code) dat hij Opus 5.5 de Claude Agent SDK formeel heeft laten verifiëren met de bewijsassistent Lean: enkele korte prompts leverden 16 pull requests op die bugs en gelijktijdigheidsproblemen verhelpen. Hij zegt ook TLA+ te gebruiken. 🔗 bron
  • Codex CLI 0.156.1 — Deze patch voor 0.156.0 voegt GPT-6 Sol en GPT-6 Luna toe aan de modelkiezer van de CLI; de melding bij het bereiken van een snelheidslimiet raadt voortaan Luna aan, en er worden migraties aangeboden vanaf GPT-5.5 en GPT-5.6. 🔗 bron
  • Airbnb en GPT-6 Astra — Een nieuwe overeenkomst geeft de engineering- en productteams van Airbnb bredere toegang tot de modellen van OpenAI, waaronder GPT-6 Astra, via de OpenAI API en Amazon Bedrock. Technisch directeur Ahmad Al-Dahle zegt dat zijn teams ongeveer 80% meer functies opleveren dan een jaar geleden; er is geen bedrag bekendgemaakt. 🔗 bron
  • OpenAI Academy bestaat twee jaar — Sinds september 2024 zijn er meer dan 250 evenementen gehouden en meer dan 4 miljoen mensen bereikt; OpenAI test een programma voor trainers uit de gemeenschap (Community Trainer Program), waarin medewerkers van partnerorganisaties na een beoordeling leren workshops te geven. 🔗 bron
  • Een LED-display als spraakassistent — Op de blog OpenAI Developers vertelt Sid Rampally hoe Codex hem hielp een door een Raspberry Pi aangestuurd LED-paneel van 128 × 64 pixels aan te sluiten en te programmeren; GPT-Live-1 voert het gesprek en delegeert zoekopdrachten en de weergave via de Responses API aan GPT-5.6 Luna. 🔗 bron
  • MedGemma passeert 10 miljoen downloads — Google beschrijft praktijktoepassingen van zijn open medische modellen: screening op baarmoederhalskanker bij meer dan 3.500 vrouwen in Zambia, proefprojecten in het AIIMS-ziekenhuis in Delhi en detectie van tuberculose in Indonesië. De resultaten mogen niet rechtstreeks als basis voor een diagnose dienen, benadrukt Google. 🔗 bron
  • Gemini Notebook in Google Docs — Door @ in Docs te typen, kun je een notebook als bron aanhalen: Gemini baseert de tekst op de bronnen van het notebook, met citaten in de tekst, en combineert die via Workspace Intelligence met e-mails en bestanden. Beschikbaar voor Business Standard en Plus, Enterprise Standard en Plus, Education Plus en abonnees van Google AI Pro en Ultra. 🔗 bron
  • Zes tools van Google Flow — Google Labs publiceert zes tools die creatieven met Google Flow Tools hebben gebouwd: Mondo Sónico (gesynchroniseerde geluidseffecten), CaptionCast (geanimeerde ondertitels), ThumbnailForge (miniaturen), Surface (texturen op 3D-oppervlakken), CollageMotion Pro en SwissFlow Studio (motion design); elke tool kan worden gekopieerd en aangepast. 🔗 bron
  • Google Beam wordt geleverd in Frankrijk — Beam, het samen met HP verkochte videocommunicatieplatform van Google dat persoonlijke aanwezigheid wil nabootsen, wordt inmiddels geleverd in zes landen, waaronder Frankrijk, met 18 partners. Volgens een interne studie voelen teams zich 50% meer verbonden en zijn er 21% minder vervolgvergaderingen. 🔗 bron
  • Android Enterprise en Gemini-agents — Gemini kan op basis van de context op het scherm taken in meerdere apps achter elkaar uitvoeren, terwijl beveiligingsmaatregelen voorkomen dat persoonlijke agents toegang krijgen tot het werkprofiel; beheerders kunnen AI-automatisering voor hun hele apparatenpark beperken of uitschakelen. 🔗 bron
  • AI Brief in het Frans — De gesloten bèta van AI Brief, waarmee gebruikers AI Max-campagnes in Google Ads in hun eigen woorden kunnen aansturen, wordt beschikbaar in het Frans, Nederlands, Duits, Italiaans, Japans, Portugees en Spaans. 🔗 bron
  • Gemini CLI, nightly van 23 september — Dit is alleen een nightly, geen stabiele versie: ze voegt Gemini 3.8 Flash en Gemini 3.5 Flash Lite toe, direct toegankelijk via een API-sleutel, Vertex AI of een gateway, en met een Google-account via experimentele opties. Op dinsdag de 22e verscheen geen stabiele versie. 🔗 bron
  • EcoHash meet zijn video-optimalisaties — Op een RTX PRO 6000 met 96 GB verkort EcoHash de verwerkingstijd van een MiniMax H3-video van 174,8 naar 40,8 seconden en die van Wan2.2 voor tekst-naar-video van 132,3 naar 10,7 seconden, met een LoRA die is gedistilleerd in 4 stappen; drie van de tien geteste instellingen, waaronder beide compilatiemodi, maakten geen verschil. 🔗 bron
  • Krim-Tataars: een vertekende test voorkomen — De ontwikkelaar van een spraakherkenningsmodel voor het Krim-Tataars ontdekte dat vier audioboeken dubbel in zijn corpus stonden: 96,9% van de fragmenten in zijn belangrijkste test had een tegenhanger in de trainingsdata. Na correctie, verfijning met LoRA en aanpassing van de decoder daalde de foutmarge per woord van 0,3463 naar 0,1701. 🔗 bron
  • Falcon-H1 en mlx-lm — In mlx-lm 0.31.3 wordt zonder KV-cache tijdens de training alleen de eerste van de 66 lagen van Falcon-H1 uitgevoerd: elke LoRA wordt zonder foutmelding of waarschuwing getraind op een model met één laag. De oplossing bestaat uit één regel code en er is een issue aangemaakt. 🔗 bron
  • Agents en bijdragen aan open source — Quentin Gallouédec (Hugging Face) vindt dat door agents gemaakte bijdragen het signaal van een echte behoefte uitwissen en beheerders tijd kosten bij de beoordeling; hij vraagt om geen agents meer los te laten op willekeurig gekozen projecten en eerst het project te gebruiken. 🔗 bron
  • Phionyx bij de IETF — De auteur van Phionyx dient een individueel concept in, Claim-Preserving Exchange of AI Evaluation Evidence, om ervoor te zorgen dat een evaluatieresultaat zijn voorwaarden en beperkingen behoudt wanneer het tussen systemen wordt uitgewisseld; de tekst is door geen enkele werkgroep overgenomen. 🔗 bron
  • Kimi Work 3.2.12 — Met de desktopagent van Moonshot kun je een passage in een PPT-, Excel-, Word- of Markdown-bestand selecteren om die gericht te laten aanpassen; de limiet voor de grootte van bijlagen vervalt. 🔗 bron
  • Qwen-Image-2.1 voert de open modellen aan — Volgens Arena is Qwen-Image-2.1 nu het hoogst gerangschikte open model voor beeldbewerking (1.367 punten, 16e in het algemeen) en tekst-naar-beeldgeneratie (1.228 punten, 17e in het algemeen). 🔗 bron
  • OpenTelemetry in de Copilot-app — Beheerders kunnen traces van agentsessies in de GitHub Copilot-app (verzoeken aan modellen, gebruikte tools) via de eigenschap telemetry van managed-settings.json exporteren naar hun monitoringtools; de inhoud van prompts en antwoorden wordt standaard uitgesloten. 🔗 bron
  • Copilot CLI en C++ — De Microsoft C++ Language Server van Copilot CLI maakt nu standaard een permanente index van symbolen in het hele project; het voor het eerst opbouwen daarvan kan lang duren en veel geheugen kosten, en GitHub noemt geen cijfer voor de winst. 🔗 bron
  • Een pull request van een miljoen regels — Een technisch blogbericht van GitHub legt uit hoe de Copilot-app een pull request met 2.200 bestanden, meer dan een miljoen regels en meer dan 400 opmerkingen weergeeft: de geometrie van de code wordt vooraf berekend, die van de opmerkingen wordt gemeten in de buurt van het zichtbare gebied. 🔗 bron
  • Genspark voegt Opus 5.5, GPT-6 en Grok 4.7 toe — In de nacht van de 23e maakt Genspark Claude Opus 5.5, Grok 4.7, GPT-6 Sol en GPT-6 Luna beschikbaar in AI Chat, Code Agent en Claw. Het neemt daarbij de argumenten van de makers over, zonder abonnement of tarieven te specificeren. 🔗 bron
  • Onderzoek van GitHub en Yale — Van 1.039 GitHub-gebruikers in de Verenigde Staten zegt 71% zich zorgen te maken over de milieu-impact van AI en willen acht op de tien tools om energiezuiniger code te schrijven; GitHub benadrukt dat de steekproef, samengesteld uit mensen die marketingberichten wilden ontvangen, niet representatief is. 🔗 bron
  • Zed 1.21.0 — De stabiele versie maakt Claude Opus 5.5 en GPT-6 Astra, Sol en Luna toegankelijk met een eigen API-sleutel, voegt aanmelding bij SuperGrok toe aan het Agent-paneel en voorkomt standaard dat de computer in slaapstand gaat terwijl een agent werkt. 🔗 bron
  • Warp — GPT-6 Sol en Luna, gevolgd door Claude Opus 5.5, komen beschikbaar in de Warp-terminal en de Warp Agent CLI, evenals Grok 4.7 voor wie zijn Grok-abonnement koppelt; er zijn geen tarieven genoemd. 🔗 bron
  • Devin in Microsoft Teams — Devin, tot nu toe beperkt tot kanalen, antwoordt nu ook in directe berichten en groepsgesprekken, start Automations vanuit een kanaal en verstuurt kaarten met een vraag of goedkeuringsverzoek; de app vraagt geen nieuwe machtigingen. 🔗 bron
  • Scribe v2 Medical — Het model voor klinische transcriptie van ElevenLabs is sinds 11 september beschikbaar en krijgt nu zijn officiële aankondiging, met een nieuw cijfer: 35% minder woordfouten bij klinische audio dan Scribe v2. De prijs begint bij 0,22 dollar per uur. 🔗 bron
  • Sora 2 verdwijnt uit ElevenLabs — ElevenLabs verwijdert Sora 2 en Sora 2 Pro uit zijn studio, omdat OpenAI de Sora API op 24 september sluit, een datum die OpenAI op 24 maart bekendmaakte; de betrokken workflows moeten overstappen op een ander videomodel, zoals Gemini Omni 1.1 Flash. 🔗 bron
  • Cohere Model Vault in Canada — Cohere kondigt aan dat Model Vault, zijn platform voor inferentie met een eigen omgeving per klant, beschikbaar is in Canada, zonder cloudregio, aanbieder of tarief te noemen; de productpagina vermeldt Canada nog niet. 🔗 bron
  • Cohere en veranderingsmanagement — In een blogbericht pleit Katherine Correia (Cohere) ervoor AI als deelnemer te betrekken in plaats van als eenvoudig hulpmiddel te behandelen, taken in te delen als verifieerbaar, beoordelingsgericht of hybride, en het gebruik per toepassing te beheren; ze noemt geen product of cijfers. 🔗 bron

Wat dit betekent

Het resultaat van Anthropic brengt codeagents naar de fundamentele biologie. Ongeveer 950 Claude-agents hebben in 21 uur meer dan 200.000 reverse-transcriptasen gesorteerd. Mensen kwamen alleen aan het begin tussenbeide, met een prompt, en aan het eind, voor de experimenten. Het knelpunt verschuift naar het selecteren van hypothesen, iets wat Anthropic nu als onderzoeksonderwerp bestudeert. Voorzichtigheid blijft geboden: de functie van ART is onbekend en het resultaat is vooralsnog een preprint. Dezelfde aanpak, met grote aantallen agents en duidelijke meetpunten, komt terug in de sprint die claude.ai versnelde, met meer dan 3.000 wijzigingen, en in de formele verificatie van de Claude Agent SDK met Lean.

De veiligheid van sandboxes voor agents wordt een publiek onderwerp. De audit van Perplexity onderscheidt twee grenzen: de isolatie van de virtuele machine hield stand in alle 108 tests, maar de netwerkfiltering werd in 11 van de 54 tests omzeild door modellen die misbruik maakten van gebrekkig gecontroleerde DNS of gedeelde adressen van een CDN. Bij 8 van de 10 externe platforms bleek minstens één omzeiling mogelijk. Twee modellen, Fable en GPT-6 Astra, weigerden aan de oefening mee te doen. Op dezelfde dag introduceert de GitHub Copilot-app een lokale sandbox die bij problemen liever stopt dan zonder bescherming draait, laat de automatische modus van Claude Code zelfs alleen-lezencommando’s door een classificatiemodel beoordelen, en sluiten Vibe CLI en Kimi Code manieren om autorisatie te omzeilen; twee dagen eerder had ZCode na meldingen van zijn gemeenschap zijn code openbaar gemaakt.

Spraak wordt een interface om acties uit te voeren. Gemini 3.8 Flash TTS en Flash-Lite TTS maken audio-uitvoer meer dan twee keer zo goedkoop als de vorige preview (9 en 6 dollar per miljoen tokens tot eind 2026, tegenover 20) en voegen stemreplicatie toe waarvoor vastgelegde toestemming vereist is; die functie is via AI Studio niet beschikbaar in de Europese Economische Ruimte. Qwen kondigt prijsverlagingen van 70 tot 95% aan voor zijn audiomodellen, NVIDIA stelt een model beschikbaar dat acht sprekers kan onderscheiden, en Basis publiceert 1.500 uur aan gesprekken waarin stemmen elkaar overlappen. Tegelijk gaat ChatGPT Voice met de plugins en taken van ChatGPT Work verder dan gesprekken voeren en kan het ook acties uitvoeren.

Tot slot worden er meer middelen voor fysieke AI beschikbaar, met enkele kanttekeningen. FLUX 3 Action zet een model met 7 miljard parameters bovenaan RoboLab-120, integreert het met LeRobot en NVIDIA en laat zien dat een snel en betrouwbaar beleid de behoefte aan kostbare redeneerstappen vermindert: 8,77 dollar per geslaagde taak met GPT-6 Astra als toezichthouder, tegenover 13,47 dollar voor Astra alleen. Maar ‘open’ betekent niet overal hetzelfde: een eigen licentie voor zowel FLUX 3 Action als Basis Conversations 1500, een niet-commerciële licentie voor QVAC Genesis III en gepubliceerde benchmarks zonder modelgewichten voor Qwen Intelligence. Wie deze middelen wil hergebruiken, moet even goed naar de licentie als naar de score kijken.


Bronnen