Rechercher

Claude Code lit AGENTS.md, Qwen3.8-Omni-Flash arrive, Codex teste les conversations vocales

Ce vendredi, les outils d’agents convergent vers des formats partagés : Claude Code lit désormais AGENTS.md quand un projet n’a pas de CLAUDE.md, Antigravity injecte le catalogue des sous-agents dans le prompt système de ses agents Markdown, Codex détaille sa consommation par sous-agent et MiniMax ouvre le code de son agent de terminal. Le reste de la journée tient en deux sorties de modèles — Qwen3.8-Omni-Flash et Grok Voice Transcribe 2.0 — et en un partenariat inhabituel : Anthropic installe des évaluateurs d’Accenture à l’intérieur de sa propre entreprise.


Claude Code lit AGENTS.md, isole les sous-agents et retire TaskOutput

18 septembre — Trois versions de Claude Code se sont succédé en vingt heures : la 2.1.275 le 17 septembre à 22 h 33 UTC, la 2.1.276 le 18 à 02 h 12 UTC, la 2.1.277 le 18 à 18 h 06 UTC.

La nouveauté la plus structurante tient en une ligne de la 2.1.277. Dans un projet dépourvu de CLAUDE.md, Claude Code lit AGENTS.md, le fichier d’instructions devenu convention partagée par plusieurs agents de code du marché. Le choix se règle dans /config, sous « Project instructions ». La fonction n’est pas encore disponible sur Bedrock, Vertex ni Foundry.

Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)

🇫🇷 Ajout de la prise en charge d’AGENTS.md : dans un projet sans CLAUDE.md, Claude Code lit AGENTS.md à la place ; le réglage se change sous « Project instructions » dans /config (pas encore sur Bedrock, Vertex ou Foundry). — CHANGELOG Claude Code, anthropics/claude-code

Deux autres changements de la même version touchent la sécurité du contexte. Les résultats de sous-agents remontent à l’agent principal sous un en-tête qui les marque comme tels, afin qu’un texte renvoyé par un sous-agent ne puisse pas passer pour une instruction de la session ; et les caractères Unicode invisibles de formatage sont retirés des prompts, la version nettoyée étant affichée avant envoi. La 2.1.277 supprime aussi l’outil déprécié TaskOutput : Claude lit désormais le fichier de sortie d’une tâche de fond avec Read.

La 2.1.275 ajoute une touche d’envoi immédiat (ctrl+enter) qui interrompt le tour en cours et expédie d’un coup tous les messages en file, et la synchronisation vers le terminal des skills et plugins activés sur le compte claude.ai. Côté chaîne d’approvisionnement, les plugins d’origine npm sont récupérés par npm pack --ignore-scripts avec vérification d’intégrité, ce qui empêche les scripts d’installation d’un paquet de s’exécuter. La 2.1.276, publiée moins de quatre heures plus tard, ne répare qu’une régression de cette version : une erreur 400 qui faisait échouer toutes les requêtes derrière un proxy.

Numéro de versionPublication (UTC)Contenu marquant
2.1.27517/09 à 22 h 33Envoi immédiat, synchronisation des skills claude.ai, npm --ignore-scripts
2.1.27618/09 à 02 h 12Correctif unique : erreur 400 derrière un proxy
2.1.27718/09 à 18 h 06Prise en charge d’AGENTS.md, isolation des sous-agents, retrait de TaskOutput

🔗 Notes de version 2.1.277


Qwen3.8-Omni-Flash, le premier modèle omni-modal agentique de Qwen

18 septembre — Qwen publie Qwen3.8-Omni-Flash, présenté comme son premier modèle omni-modal conçu autour des capacités agentiques. Le déplacement annoncé n’est plus la compréhension de contenus multimodaux mais leur exploitation : comprendre le contenu, planifier la tâche, l’exécuter avec des outils, livrer le résultat. Le modèle accepte texte, image, audio et vidéo dans une fenêtre de contexte d’un million de tokens.

Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!

🇫🇷 Voici Qwen3.8-Omni-Flash, le premier modèle omni-modal de Qwen construit autour des capacités agentiques.@Alibaba_Qwen sur X

Sur les 29 évaluations retenues par Qwen, le score moyen progresse de plus de 25 % face à Qwen3.5-Omni-Plus, les gains se concentrant sur les agents audio-vidéo. La reconnaissance multi-locuteurs est le poste qui bouge le plus.

Évaluation retenueQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71,034,558,9
UniClawBench69,667,169,0
AgenticVBench36,814,545,0
OmniVideoBench63,453,865,2
StreamingBench80,857,179,9
AliMeeting DER / cpWER (plus bas est meilleur)3,4 / 17,288,1 / 89,672,6 / 53,1

Le point le plus original est la perception agentique appliquée aux vidéos longues. Plutôt que de traiter un enregistrement du début à la fin, le modèle part de la question posée, décide de lui-même quoi regarder et écouter, et localise l’information par passes successives du grossier au fin. Sur OmniVideoBench, ce mode fait passer la précision de 63,4 à 67,8 tout en ramenant la consommation de 145 736 à 79 117 tokens par requête, soit environ 45,7 % de moins — chiffre que le billet officiel énonce lui-même.

Le volet tarifaire suit : selon la méthodologie de Qwen, le prix par heure d’entrée audio baisse de plus de 98 % par rapport à Qwen3.5-Omni-Plus. Deux briques sont ouvertes dans la foulée, Qwen-MM-Plugins, compatible avec les harnais Codex, Claude Code, Qwen Code et Gemini CLI, et Qwen-Live Harness pour l’interaction temps réel. Une variante Realtime est dédiée à l’interaction continue à faible latence, avec un premier token entre 591 et 981 millisecondes.

🔗 Billet Qwen sur Qwen3.8-Omni-Flash


Codex CLI 0.155.0 fait entrer les conversations vocales en expérimental

17 septembre — OpenAI publie Codex CLI 0.155.0, première version stable depuis la 0.154.0 du 10 septembre, installable par npm install -g @openai/codex@0.155.0. C’est l’entrée de changelog qui manquait à l’agent vocal annoncé la veille sur X : la fonctionnalité porte le nom /voice, propose la transcription en direct et les contrôles du microphone, et reste expérimentale — disponible seulement sur les compilations prises en charge (supported builds), et à activer par /experimental.

Le reste de la version est plus discret mais plus immédiatement utile. L’interface en terminal gagne des résumés de raisonnement en direct dans la ligne de statut ainsi qu’un horodatage de fin après chaque tour réussi. L’aperçu des agents permet de masquer, archiver et supprimer des tâches, avec les détails de propriété des worktrees et une confirmation avant suppression des worktrees gérés propres. Sur les Mac compatibles, les requêtes MCP des sessions TUI locales peuvent être validées par Touch ID. Amazon Bedrock peut obtenir ses identifiants AWS depuis des commandes configurées, avec mise en cache, rafraîchissement à l’expiration et reprise après échec d’authentification.

Plusieurs correctifs relèvent de la sécurité : les échappements de processus Windows depuis les bacs à sable WSL restreints sont bloqués, les instantanés de shell intermédiés sont durcis contre l’exposition d’identifiants, et un changement de compte invalide les sessions de contrôle à distance, l’état WebSocket en cache et les catalogues de modèles appartenant à l’identité précédente.

Nouveauté de la versionDétail
/voiceTranscription en direct et contrôles du micro, expérimental via /experimental
Interface en terminalRésumés de raisonnement dans la ligne de statut, horodatage de fin de tour
Aperçu des agentsMasquage, archivage, suppression de tâches, propriété des worktrees
Touch IDValidation des requêtes MCP en session locale, sur Mac compatibles
Amazon BedrockIdentifiants AWS obtenus par commande, avec cache et rafraîchissement

🔗 Notes de version Codex CLI 0.155.0

Codex détaille sa consommation par tâche, sous-agent et conversation

18 septembre — OpenAI Developers annonce un suivi détaillé de la consommation dans Codex : l’outil montre comment les tâches, les sous-agents et les conversations individuelles contribuent à l’usage total. L’information se trouve dans l’application pour ordinateur, sous Réglages puis Usage & billing pour les comptes personnels et Business, ou sous Usage pour les comptes Enterprise éligibles ; il faut être à jour pour en disposer. Aucun billet de blog ni entrée de changelog n’accompagne l’annonce.

La granularité est le vrai sujet. Jusqu’ici, un quota épuisé ne disait pas d’où venait la dépense ; une ventilation par sous-agent permet de savoir quelle délégation coûte, et de la réécrire. C’est le pendant comptable de la généralisation des sous-agents dans les harnais de code.

🔗 Annonce OpenAI Developers sur X


Grok Voice Transcribe 2.0, la reconnaissance vocale de SpaceXAI à tarif inchangé

18 septembre — SpaceXAI annonce Grok Voice Transcribe 2.0, son nouveau modèle de reconnaissance vocale (speech-to-text), décrit comme deux fois plus précis que la version 1.0 à tarif identique. Le modèle repose sur le socle audio qui alimente déjà Grok Voice, lequel traite selon l’entreprise des dizaines de milliers d’appels de support client par jour et transcrit des millions d’heures de narration vidéo.

L’argument central porte sur l’audio réel plutôt que sur l’audio de laboratoire : lignes téléphoniques instables, voix concurrentes, accents locaux, numéros de téléphone et adresses e-mail dictés à voix haute. SpaceXAI revendique la première place en précision parmi 32 modèles en flux continu sur le classement public Artificial Analysis, et s’appuie sur quatre jeux internes tirés du trafic de production — téléphonie 8 kHz, conversations avec Grok, identifiants dictés, commandes vocales courtes en 19 langues.

Le gain le plus net concerne le multilingue. Sur le jeu de phrases courtes, celles qui offrent le moins de contexte pour identifier la langue, le taux d’erreur par mot passe de 20,6 % à 6,8 %. Le modèle détecte la langue automatiquement et suit les changements en cours d’enregistrement en une seule passe.

Métrique mesuréeValeur annoncée
Précision revendiquée face à Transcribe 1.0deux fois supérieure
Classement Artificial Analysis (flux continu)1er sur 32 modèles
Taux d’erreur sur phrases courtes (1.0 → 2.0)20,6 % → 6,8 %
Tarif par lot0,10 dollar par heure d’audio
Tarif en flux continu0,20 dollar par heure d’audio
Canaux transcrits indépendammentjusqu’à 8
Termes métier par requêtejusqu’à 100

Le modèle gère le traitement par lots et le flux continu, les horodatages au mot avec score de confiance, la séparation des locuteurs (diarization) sans surcoût et la détection de fin de tour de parole. Les intégrations existantes de l’API reçoivent le gain de précision sans changement de code. Grok Voice Transcribe 2.0 deviendra prochainement le modèle par défaut de l’API et la 1.0 sera dépréciée dans les semaines à venir : il faudra épingler grok-voice-transcribe-1.0 pour rester dessus.

🔗 Annonce Grok Voice Transcribe 2.0


Anthropic installe des évaluateurs d’Accenture à l’intérieur de l’entreprise

18 septembre — Anthropic annonce un partenariat avec Accenture portant sur l’évaluation indépendante des modèles de frontière, présenté comme une étape importante vers l’engagement pris par son directeur général d’accueillir des évaluateurs intégrés (embedded). Le travail sera mené par Faculty, la filiale spécialisée en IA d’Accenture, et couvrira l’évaluation et le red-teaming des modèles, les évaluations d’alignement et les tests des garde-fous.

La distinction avec les évaluateurs externes est explicite : un évaluateur intégré travaille à l’intérieur de l’entreprise d’IA avec un accès comparable à celui d’un salarié. Il peut observer les modèles pendant leur entraînement, suivre les décisions qui gouvernent leur construction et leur déploiement, parler directement aux employés, vérifier que les engagements de sécurité sont tenus, signaler des incidents et publier une description mieux informée des bénéfices et des risques. Anthropic précise que le dispositif ne réduit pas sa responsabilité mais la rend plus vérifiable.

L’annonce est inhabituellement franche sur ce qui n’existe pas. Il n’y a aucune norme sur les informations auxquelles un évaluateur intégré devrait avoir accès, ni sur la façon dont il devrait publier ses constats, ni de système établi pour financer l’évaluation indépendante. Anthropic estime qu’à terme ce financement devrait venir de fonds mutualisés ou publics ; faute d’un tel mécanisme aujourd’hui, elle finance directement le travail d’Accenture — ce qui constitue la limite la plus visible du montage.

Élément du partenariatValeur annoncée
Entité opératriceFaculty, filiale IA d’Accenture
InvestissementAu moins 1 milliard de dollars par partie, sur cinq ans
Périmètre couvertÉvaluation, red-teaming, alignement, garde-fous
Niveau d’accèsComparable à celui d’un employé
FinancementDirect par Anthropic, faute de fonds mutualisés
ExclusivitéAucune, des deux côtés

Anthropic indique par ailleurs discuter avec METR et d’autres évaluateurs à but non lucratif pour expérimenter des éléments d’évaluation intégrée sur leurs propres financements, et annonce d’autres partenaires dans les semaines à venir.

🔗 Annonce Anthropic sur l’évaluation intégrée


Antigravity : trois versions en deux jours autour des agents personnalisés

Google a publié coup sur coup deux versions de sa CLI et une version de l’application Antigravity. Les trois traitent le même sujet sous trois angles : ce qu’un agent personnalisé sait, ce qu’il peut refuser, et jusqu’où il peut tourner sans surveillance. Elles prolongent une série dense entamée le 11 septembre, dont les versions 1.2.1 à 1.2.4 ne sont pas reprises ici.

La CLI 1.2.6 ouvre un Remote Control lié à la session et lève le plafond de cinq minutes

18 septembre — Huit jours après la 1.2.0, qui faisait de la CLI un service système persistant, Google prend le contre-pied avec une seconde forme de Remote Control, beaucoup plus légère : une connexion à portée de session (session-scoped), ouverte par le drapeau --remote-control au démarrage ou par la commande /remote-control en cours de route. Taper /remote-control off ou fermer la session démonte le tunnel et retire l’appareil de la liste. Là où 1.2.0 visait un démon qui survit à la session, 1.2.6 vise l’inverse.

Le deuxième changement concerne le mode sans interface (headless) : le délai d’expiration par défaut des exécutions -p / --prompt passe de cinq minutes à illimité, sauf --print-timeout explicite. Le troisième structure le signalement d’erreurs — sur échec d’agent ou d’API, la CLI écrit sur la sortie d’erreur une ligne JSON AGY_ERROR: {...} contenant le statut canonique, le code HTTP ou gRPC, le caractère retentable et un identifiant d’erreur, avec un code de sortie qui passe de 1 à 3. Un script d’orchestration peut donc distinguer une panne réseau temporaire d’une erreur définitive sans analyser du texte libre.

La CLI 1.2.5 donne enfin aux agents Markdown l’annuaire de leurs sous-agents

17 septembre — Jusqu’ici, un agent personnalisé défini en Markdown pouvait déclarer invoke_subagent dans ses outils sans jamais savoir quels sous-agents existaient : il possédait l’outil mais pas l’annuaire. La CLI ajoute désormais automatiquement dans son prompt système le catalogue des sous-agents disponibles et leur mode d’emploi, ce qui rend la délégation effective.

Le vocabulaire du changelog mérite une précaution : il s’agit d’un ajout de contexte par le produit lui-même, pas d’une faille de sécurité ni d’un correctif. La seconde amélioration préserve le nom explicite d’une tâche envoyée en arrière-plan, qui se perdait entre les notifications et les listes de tâches. Les cinq correctifs traitent la purge des identifiants invalidés, les codes de sortie des commandes interrompues et des cadres de réflexion qui restaient figés.

Antigravity 2.15.0 laisse les agents personnalisés couper les prompts et outils par défaut

18 septembre — Trois jours après la 2.14.0, l’application publie 7 améliorations et 16 correctifs. Le changement principal donne aux agents personnalisés la main sur leur propre contexte : ils peuvent désactiver les sections de prompt par défaut et les outils par défaut, puis ne réintroduire que ceux dont ils ont besoin. Pour un agent spécialisé, cela réduit d’autant le prompt système imposé.

Le reste porte sur la navigation et la persistance : Page Up, Page Down, Home et End font défiler une conversation, Échap sort de la zone de saisie, et l’agent personnalisé sélectionné est mémorisé après un rechargement. Deux correctifs touchent l’intégrité des données — les réglages enregistrés et la liste de projets pouvaient être écrasés quand l’application échouait à lire son fichier d’état, et les réglages de permissions accumulaient des doublons qui faisaient gonfler les fichiers de conversation.

🔗 Changelog Antigravity


GitHub Copilot : un canvas Sentry, six modèles retirés, et des métriques par personnalisation

Trois entrées de changelog en deux jours dessinent la même préoccupation : mesurer ce que les équipes font réellement de Copilot, et nettoyer ce qu’elles n’utilisent plus.

Le récapitulatif du 14 septembre isole deux briques neuves

18 septembre — GitHub publie son récapitulatif hebdomadaire Copilot pour la semaine du 14 septembre. La majeure partie du sommaire reprend des entrées déjà parues au fil du changelog ; deux éléments seulement n’avaient jamais été annoncés séparément. Le premier est le canvas Sentry dans l’application Copilot, qui relie un rapport de plantage de production à un correctif sans quitter l’application : il affiche les erreurs, les traces de pile (stack traces) et le contexte, puis permet d’enquêter sur la cause, de valider une correction et de préparer une pull request. C’est la première intégration d’un outil de supervision d’erreurs dans les canvases, après Jira début septembre.

Le second est la vague agents de VS Code 1.138. La fenêtre Agents peut exécuter un agent dans un Dev Container local, avec les outils et dépendances du projet — déploiement progressif, Docker requis. Les sessions inactives peuvent être marquées automatiquement comme terminées une fois toutes leurs pull requests fusionnées, avec suppression optionnelle après un délai de grâce, en préversion et à activer explicitement. Enfin, une pull request peut être créée directement depuis une session Agent Host.

🔗 Récapitulatif hebdomadaire Copilot

Six modèles quittent toutes les surfaces Copilot le 19 octobre

18 septembre — GitHub annonce le retrait de six modèles de l’ensemble des surfaces Copilot — Copilot Chat, éditions en ligne, modes ask et agent, complétions de code — le 19 octobre 2026. C’est la deuxième vague de dépréciation annoncée en septembre.

Modèle retiréDate de retraitAlternative suggérée
Gemini 3.7 Flash19/10/2026Gemini 3.8 Flash
GPT-5.519/10/2026GPT-5.6 Sol
GPT-5.419/10/2026GPT-5.6 Sol
GPT-5.4 mini19/10/2026GPT-5.6 Luna
GPT-5 mini19/10/2026GPT-5.6 Luna
Grok 4.519/10/2026Grok 4.6

Sous l’activation par défaut des modèles, les alternatives sont automatiquement activées pour les clients Copilot Enterprise et Business, sauf si un administrateur a désactivé la valeur par défaut globale ou explicitement bloqué le modèle concerné ; dans ce cas, l’accès se rouvre par les politiques de modèle dans les réglages. Aucune action n’est requise pour retirer les modèles.

🔗 Annonce de dépréciation des modèles Copilot

L’API de métriques compte les skills, agents, serveurs MCP et plugins du CLI

17 septembre — L’API de métriques d’utilisation de Copilot couvre désormais cinq familles de personnalisations agentiques du CLI : skills, agents personnalisés, serveurs MCP, slash commands et plugins. Les tableaux totals_by_skill, totals_by_custom_agent, totals_by_mcp, totals_by_slash_cmd et totals_by_plugin listent les cinq éléments les plus actifs avec leur interaction_count, tandis que les champs distinct_*_use_count comptent la variété d’éléments employés au-delà de ce top cinq.

Deux subtilités évitent des contresens. Pour les serveurs MCP, le compteur n’augmente que lorsque le CLI tente de se connecter ou de se reconnecter — succès comme échec —, pas à chaque appel d’outil sur une connexion établie. Les métriques de plugins ne comptent que les invocations de skills liées à un plugin : elles forment un sous-ensemble des totaux de skills et ne doivent pas s’y additionner. Par confidentialité, seuls les noms fournis par GitHub sont affichés, les noms définis par les clients étant regroupés sous other.

🔗 Personnalisations agentiques du CLI dans l’API de métriques


Les agents de code en terminal : MiniMax ouvre le sien, Mistral stabilise son harnais

Deux annonces venues de deux acteurs sans rapport, le même jour, sur le même marché : l’agent de codage qui vit dans un terminal se banalise, et la différenciation se déplace vers la licence et la stabilité du harnais.

MiniMax publie le code de MiniMax Code CLI sous licence MIT

18 septembre — MiniMax ouvre le code source de son agent de codage en terminal en version 0.4.12. L’outil s’installe sous le nom mcode et propose trois points d’entrée : une interface terminal interactive, un mode sans interface (mcode exec) destiné aux scripts shell, à l’intégration continue et aux évaluations, et un mode ACP pour les éditeurs compatibles avec l’Agent Client Protocol. Il lit les fichiers d’un projet, inspecte les différences, exécute des commandes shell et des tests, sous un régime de permissions et de bac à sable.

Le choix du modèle reste ouvert : compte MiniMax et son Token Plan d’un côté, fournisseur tiers de l’autre dès lors qu’il expose un format d’API compatible OpenAI ou Anthropic. S’y ajoutent une recherche intégrée, des outils multimodaux, le protocole MCP, des sous-agents et un système de greffons. Le code de première main est publié par défaut sous licence MIT. Le dépôt couvre la TUI, la CLI sans interface et le mode ACP, mais pas l’application de bureau, dont il héberge néanmoins le suivi des anomalies ; les propositions de code ne sont pour l’instant acceptées que des collaborateurs du dépôt.

🔗 Annonce MiniMax sur X

Le Unified Harness de Vibe CLI quitte le statut expérimental

18 septembre — Mistral publie Vibe CLI 2.25.5, six jours après la 2.25.4. Le changement structurant tient en une ligne des notes de version : le Unified Harness n’est plus étiqueté « experimental », et c’est désormais --legacy-harness qui sert d’échappatoire documentée vers l’ancien harnais Python. Après une série de versions correctives centrées sur la sécurité des approbations shell, le nouveau harnais devient le défaut assumé — c’est l’information, pas le numéro de version.

Le basculement s’accompagne d’un rattrapage de parité : le Unified Harness injecte maintenant la branche Git courante, l’état du dépôt et les commits récents dans les instructions système, les hooks s’exécutent enfin à l’intérieur des sous-agents au lieu d’être silencieusement ignorés, et les fournisseurs configurés sans variable d’environnement de clé d’API — serveurs locaux ou auto-hébergés — fonctionnent à nouveau. Le durcissement des permissions se poursuit : les approbations shell ne s’élargissent plus à un autre programme ou environnement, les appels d’outils MCP respectent désormais le système de permissions au lieu de passer outre, et le smart approve cesse de court-circuiter les règles de l’utilisateur.

🔗 Notes de version Vibe CLI 2.25.5


Les plugins ChatGPT acceptent plusieurs comptes à la fois

18 septembre — La prise en charge de plusieurs comptes arrive sur la plupart des plugins ChatGPT. Il devient possible de relier son compte personnel, son compte professionnel et ceux de ses projets annexes, puis de faire venir le contexte de chacun dans une même conversation. Les comptes se connectent depuis le répertoire de plugins, sur chatgpt.com/plugins.

L’annonce du compte OpenAI Developers reprend un message de Max Stoiber publié une heure plus tôt. Côté développeurs de plugins, rien n’est à faire : la fonctionnalité s’active automatiquement, sans modification. Ceux qui veulent aller plus loin peuvent ajouter un outil profile à leur serveur MCP, pour que ChatGPT sache étiqueter les comptes connectés — c’est la seule action concrète attendue d’eux. Aucun billet de blog ni entrée de changelog n’accompagne l’annonce, publiée à 18 h 10 heure de Paris.

Le cas d’usage visé est celui d’un développeur qui cloisonne ses identités par employeur ou par projet et devait jusqu’ici changer de connexion pour changer de contexte.

🔗 Annonce des comptes multiples sur X

🔗 Le message d’origine de Max Stoiber


Genspark ajoute un solde de crédits hebdomadaire aux forfaits Plus et Pro

18 septembre — Genspark modifie les avantages de ses abonnements Plus et Pro en y ajoutant un solde de crédits hebdomadaire, sans changer le prix des forfaits. Ce solde arrive chaque semaine en plus du forfait déjà souscrit et couvre l’usage en mode Standard sur l’ensemble des agents et outils de la plateforme : Super Agent, AI Chat, AI Image, AI Slides, AI Sheets, AI Docs et Deep Research.

Un second message du même fil détaille le fonctionnement pour AI Chat et AI Image. Pour les abonnés existants, le solde s’ajoute à ce dont ils disposent déjà et, jusqu’au 31 décembre 2026, tous les modèles d’AI Chat et d’AI Image sont utilisables sans coût en crédits, y compris les modèles phares comme Opus ; pour les personnes qui souscrivent à partir du 18 septembre, les modèles de base (core models) d’AI Chat et d’AI Image sont gratuits. Genspark précise que ces changements ne s’appliquent ni aux forfaits Team ni aux forfaits Enterprise, et renvoie son centre d’aide pour le détail des conditions.

🔗 Annonce Genspark sur X


Google Research : ce qu’AlphaGenome Atlas a produit, et des simulations qui se testent elles-mêmes

Deux publications de recherche le même jour, avec un point commun : dans les deux cas, ce qui est montré n’est pas le modèle mais ce que des tiers en ont tiré, ou ce que la boucle de validation vérifie à sa place.

AlphaGenome Atlas livre les premiers résultats de ses partenaires

17 septembre — Neuf jours après la publication d’AlphaGenome Atlas, la carte prédictive des 9 milliards de substitutions possibles de l’ADN humain, Google DeepMind épingle un fil détaillant trois collaborations.

Partenaire scientifiqueRésultat rapporté
Stowers InstitutePlus de 2 500 motifs régulateurs cartographiés
Université d’Exeter / UK BiobankPlus de 54 000 participants analysés, plus de 22 % de détection en plus des signaux génétiques rares
Broad InstituteMutation critique du gène DNM1 identifiée, puis confirmée et validée en laboratoire

Les motifs régulateurs sont les séquences d’ADN qui agissent comme des interrupteurs et des potentiomètres sur l’activité des gènes. Le travail mené à Exeter a aussi identifié de nouveaux variants influençant l’abondance de PLA2G7, une protéine liée à la santé métabolique. Le cas du Broad Institute est le plus concret des trois : face à une liste immense de mutations possibles dans des maladies rares inexpliquées, Atlas sert à désigner la bonne, que la paillasse confirme ensuite. L’ensemble tient toutefois dans un fil sur X, sans billet détaillé ni publication associée.

🔗 Fil AlphaGenome Atlas sur X

Des simulations pédagogiques générées, puis testées par un agent dans Chrome

17 septembre — Gal Elidan et Yael Haramaty publient une expérimentation qui applique l’interface générative (generative UI) à la création de simulations pédagogiques. L’enseignant reste à l’initiative : il propose le sujet, Google génère un jeu d’objectifs d’apprentissage modifiables et soumis à son approbation, qui servent de base à la génération. Chaque interactif est découpé en niveaux de difficulté croissante, avec boîte à outils, indices progressifs et solutions détaillées.

L’élément le plus intéressant est la boucle d’auto-correction. La génération est contrôlée par des critères de pédagogie, de mécanique et de présentation, et certaines évaluations sont agentiques : le test de solvabilité ouvre une instance de Chrome et manipule la simulation comme le ferait un utilisateur, en tentant aussi des actions adverses comme pousser les curseurs à leurs valeurs extrêmes. La boucle se répète jusqu’à ce que tous les critères soient remplis, au prix d’un temps de génération plus long. Google publie plus de 30 interactifs STEM en anglais ; une collection de 40 a été évaluée par des enseignants britanniques, et une étude auprès de 12 enseignants américains donne une note moyenne de 8 sur 10.

🔗 Billet Google Research sur les interactifs pédagogiques


Claude accélère plus de 30 modèles de biologie et finance une compétition de protéines

17 septembre — Anthropic publie un billet décrivant comment Claude a optimisé l’inférence de plus de 30 modèles open source utilisés par les biologistes — prédiction de structure, design de protéines, modèles de langage protéique et génomique — en un peu moins de quatre semaines, avec un gain d’environ 4x en moyenne. Tout le code est publié en open source.

Le cœur technique porte sur l’attention triangulaire et la multiplication triangulaire, cubiques en temps comme en mémoire. Claude a produit FlashPairformer, un jeu de kernels qui dépasse le standard du domaine de 2,7 à 2,9x sur l’attention. Un mode basse mémoire baptisé « Big » permet de replier avec précision des systèmes de plus de 10 000 tokens sur un seul nœud GPU, là où le ribosome 40S prédit par AlphaFold3 comptait 7 663 tokens. Le point de méthode compte autant : le travail a été supervisé par deux membres du personnel technique sans expérience préalable en optimisation d’inférence.

Anthropic co-sponsorise enfin avec Adaptyv Bio une compétition de design de protéines sur cinq problèmes difficiles, avec plus de 5 000 designs communautaires validés expérimentalement, jusqu’à 1 million de dollars en crédits Claude et 250 000 dollars de calcul apportés par Modal.

🔗 Billet de recherche Anthropic


Modèles ouverts et labos : Muse arrive sur Mac, Sakana révèle son groupe de frontière

Meta porte son agent Muse sur macOS

18 septembre — Meta déploie Muse sur Mac, annoncé dans la nuit du 17 au 18 septembre. Le compte @AIatMeta relaie une publication décrivant un agent personnel capable d’agir directement sur l’ordinateur de l’utilisateur, avec sa permission explicite à chaque fois. Trois usages sont cités : ranger le dossier de téléchargements, retrouver un fichier perdu, résumer messages et notes.

L’annonce prolonge le lancement de Muse du 8 septembre, agent propulsé par Muse Spark 1.3 et jusqu’ici disponible sur iOS, Android, le web et WhatsApp. Le passage au Mac fait franchir une étape à ce type de produit : l’agent ne travaille plus dans son propre bac à sable mais sur les fichiers personnels de l’utilisateur. Meta ne communique ni tarif, ni pays de disponibilité, ni configuration requise, et aucun document de sécurité spécifique au Mac n’accompagne la mise à disposition — le blog ai.meta.com n’a rien publié depuis le 27 juillet.

🔗 Annonce Meta sur X

Sakana AI révèle le Frontier Intelligence Group et sa position sur le paradigme

18 septembre — Sakana AI annonce l’existence du Frontier Intelligence Group (FIG), collectif interne qui grandissait depuis les débuts de l’entreprise. Le point de départ est une question posée par Llion Jones, directeur technique de Sakana AI et l’un des inventeurs du Transformer : faire grossir l’architecture Transformer avec toujours plus de données et de calcul suffit-il pour aller jusqu’à l’AGI ? La réponse du laboratoire est non.

C’est là que se trouve l’information, plus que dans le catalogue de travaux qui l’accompagne. Le billet liste les défauts que le paradigme actuel n’a pas résolus — des modèles qui produisent avec assurance des informations fausses, s’effondrent face à des situations réellement nouvelles et consomment beaucoup d’énergie — et leur oppose l’intelligence biologique, qui apprend en continu et généralise à partir de bien moins de données. Le groupe se donne cinq principes, dont la liberté d’échouer sans pression sur les scores de benchmarks. Parmi les travaux présentés, les Transformer creux menés avec NVIDIA partent d’un constat mesuré — plus de 95 % des neurones d’une couche feed-forward restent silencieux lors du traitement d’un mot — et ont produit un format de données baptisé TwELL, accepté à ICML 2026.

🔗 Billet Sakana AI sur le Frontier Intelligence Group


Vidéo générative : Runway décloisonne ses crédits, Pika sort sa première application

Runway rend ses crédits fongibles entre l’application web et Runway Dev

18 septembre — Runway fait tomber la cloison entre ses deux produits : les crédits achetés deviennent utilisables indifféremment dans l’application web et dans Runway Dev, l’offre destinée aux développeurs. Jusqu’ici, les deux univers vivaient sur des réserves séparées, des contrats distincts, et sans endroit unique pour suivre la consommation d’un projet à l’autre.

Quatre points accompagnent le changement : une réserve unique achetée centralement sur une seule facture, un chemin continu entre la construction d’un enchaînement dans l’application web et son exposition en API, un support renforcé pour Runway Dev avec accès à des Applied AI Architects, et une vue d’analyse d’espace de travail refondue qui permet aux administrateurs de transférer les crédits entre les espaces web et Dev. Deux offres commerciales sont valables jusqu’au 31 décembre 2026 : 10 % de crédits supplémentaires à la signature pour les nouvelles entreprises, soit au minimum 130 minutes de vidéo ou 12 000 images selon la conversion annoncée par Runway, et, pour les clients existants, 5 000 crédits plus une journée d’Applied AI Architect en contrepartie d’un parrainage auprès du responsable produit des applications IA.

🔗 Billet Runway sur la tarification unifiée

Pika lance Product Ad, de la photo de produit à la publicité vidéo

18 septembre — Au lendemain du dévoilement de sa nouvelle plateforme créative, Pika en livre la première application : Product Ad. L’application prend une ou plusieurs images de produit, les combine avec un brief écrit, et en tire une vidéo présentée comme prête pour le marché.

Paramètre de générationValeur proposée
Durées disponibles6 s, 15 s, 30 s, 60 s, 2 min
Format de sortie16:9
Entrée attendueimages du produit et brief écrit
Accèscréation de compte requise

Pika publie l’annonce en citant son propre message de la veille sur la refonte de la plateforme, ce qui inscrit Product Ad dans une série d’applications attendues plutôt que comme une fonctionnalité isolée. Aucun modèle n’est nommé et aucun tarif n’est communiqué.

🔗 Annonce Pika sur X


NVIDIA publie AIPerf, successeur de GenAI-Perf pour mesurer l’inférence à grande échelle

18 septembre — NVIDIA présente AIPerf, son outil de mesure de performance pour l’inférence générative, désigné comme le successeur de GenAI-Perf et réécrit depuis zéro. Le constat de départ est familier : une fois un modèle déployé, la question « est-ce que c’est rapide ? » se règle souvent avec des commandes curl ou un générateur de charge improvisé, qui produisent des chiffres auxquels on ne peut pas se fier.

La rupture est architecturale. Là où la plupart des outils tournent dans un seul processus et se heurtent au verrou global de l’interpréteur Python dès que la concurrence monte, AIPerf répartit le travail : des processus de travail génèrent la charge, des services distincts traitent les résultats, l’ensemble se coordonnant par ZMQ. L’objectif est explicite — que le client de mesure ne devienne jamais lui-même le goulot d’étranglement.

Indicateur rapportéCe qu’il mesure
Time to First TokenDélai entre l’envoi de la requête et le premier token
Inter-Token LatencyDélai entre deux tokens successifs pendant la génération
Latence de requêteTemps de bout en bout de la réponse complète
Débit de tokens en sortieTokens produits par seconde sur toutes les requêtes
Centiles rapportésp25, p50, p75, p90, p95, p99
Types de points de terminaisonplus de 15

L’outil sait aussi rejouer des traces de trafic réel, aux formats Mooncake, Baseten et WEKA. L’article insiste surtout sur l’utilité des distributions : un serveur dont le temps moyen jusqu’au premier token paraît sain mais dont le p99 s’envole passe inaperçu en agrégat et échoue en production.

🔗 Billet NVIDIA sur AIPerf


Mistral dément une revendication d’accès non autorisé à ses systèmes

18 septembre — Mistral publie à 05 h 48 UTC un communiqué bref sur son compte X, en réponse à une revendication d’accès non autorisé à ses systèmes. L’entreprise indique avoir mené une enquête approfondie, n’avoir trouvé aucun élément étayant cette revendication, et confirme que ses systèmes n’ont pas été compromis.

We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.

🇫🇷 Nous avons connaissance d’une allégation faisant état d’un accès non autorisé à nos systèmes. À l’issue d’une enquête approfondie, nous n’avons trouvé aucun élément étayant cette allégation et pouvons confirmer que nos systèmes n’ont pas été compromis.@MistralAI sur X

Le message ne nomme pas l’auteur de la revendication, ne précise ni sa date ni sa nature, et ne donne aucun détail sur le périmètre de l’enquête. C’est la position de Mistral, et elle seule, qui est rapportée ici : l’allégation d’origine n’a pas pu être consultée. Le communiqué est le message le plus vu du compte sur la période, et aucune publication complémentaire n’a été trouvée sur le site de l’entreprise.


Brèves

  • Balyasny Asset Management raconte comment il encadre Claude Fable 5 — la société, qui gère environ 38 milliards de dollars, ramène l’analyse initiale d’un arbitrage de fusions de trois à cinq jours à moins d’une journée, avec un agent qui tourne environ 30 minutes et une revue humaine. 🔗 source
  • Codex CLI 0.155.1 redésactive les résumés de raisonnement par défaut — correctif unique le lendemain de la 0.155.0 : les activer d’office faisait rejeter les requêtes par les fournisseurs qui ne les prennent pas en charge. 🔗 source
  • Gemini CLI reprend sa série nightly après une journée blanche — quatre changements le 18 septembre, dont la rétention du refresh token OAuth lors d’un renouvellement et une suppression d’identifiants devenue idempotente ; les canaux stable et preview restent inchangés. 🔗 source
  • Kimi Code 2.0.1 accélère le démarrage et la reprise de session — version de correctifs 32 heures après la 2.0.0 : compactage de l’index de session, reprise plus rapide sur les longs historiques, clé d’API lisible depuis une variable d’environnement nommée et observateurs de fichiers bornés. 🔗 source
  • Qwen Code passe en préversion v0.24.1 avec un SDK navigateur Playwright — ce n’est pas une version stable ; elle introduit un pilotage de navigateur intégré avec relais de messagerie native Chrome, et l’exécution des sous-agents en conteneur. 🔗 source
  • Zed publie la version stable 1.20.2, deux correctifs seulement — les erreurs de paiement des fournisseurs de modèles tiers n’affichent plus une invitation à passer à Zed Pro à la place du message d’origine, et deux extensions de snippets pour le même langage ne s’annulent plus. 🔗 source
  • Replit affirme un Free Mode « 30 fois plus » généreux, sans référence publiée — un tweet seul, sans lien ni changelog, qui ne précise pas à quoi ce facteur se compare : à prendre comme une affirmation de Replit, pas comme une mesure. 🔗 source
  • Le tableau de bord d’impact Copilot ventile l’engagement par fonctionnalité — sept surfaces sur 28 jours, avec distinction entre revue de code active et passive, et une population de phase d’adoption désormais calculée en fenêtre glissante. 🔗 source
  • GitHub programme un direct d’initiation au SDK Copilot, en six langues — sessions, outils, serveurs MCP et évènements en flux, avec des sessions dédiées à .NET et Java, sans prérequis. 🔗 source
  • Runway Ruby préserve le canal alpha lors de la conversion en HDR — la conversion d’un rush vers le HDR garde la transparence intacte, en une seule étape ; ni tarif ni palier d’abonnement précisés. 🔗 source
  • MiniMax rejoint le Singtel AI Pass pour le programme singapourien SkillsFuture — MiniMax H3, MiniMax Agent et MiniMax Audio entrent dans l’offre, qui s’adresse aux apprenants éligibles sur plus de 200 cours d’IA soutenus par la SWDA ; aucun montant ni calendrier. 🔗 source
  • VC-Attention accélère l’attention de MiniMax-H3 sans réentraînement — MiniMax relaie les travaux de Nunchux AI sur une attention en basse précision applicable au modèle existant ; Nunchux AI annonce 1,6x sur B200 et 1,5x sur B300 face à FlashAttention-4. 🔗 source
  • Wan3.0 se classe deuxième en catégorie vidéo de l’OpenArt Arena — Alibaba met en avant les plans de 30 secondes, l’audio natif et la prise en charge de toute référence ; positionnement dans un classement tiers, sans nouveauté produit. 🔗 source
  • Synthesia ouvre son siège américain à New York — nouvelle d’entreprise sans produit, effectif ni calendrier d’investissement, deux jours après la disponibilité générale de son Interactive Avatar API. 🔗 source
  • Grok Imagine détaille le coût d’un pilote produit intégralement en IA — le studio de PJaccetturo annonce neuf jours de travail, 3 627 images et 3 043 vidéos générées pour 2 677 dollars de générations sur son épisode pilote du concours Odyssée. 🔗 source
  • BananaMind 2 Pro approche SmolLM2 avec vingt fois moins de tokens — un modèle de 139 millions de paramètres entraîné sur 100 milliards de tokens et une RTX 5070 Ti atteint 42,78 % sur HellaSwag contre 43,22 pour SmolLM2-135M, entraîné sur 2 000 milliards de tokens. 🔗 source
  • Optimum-Intel v2.2.0 et OpenVINO GenAI 2026.4.0 élargissent l’export vers le matériel Intel — Hugging Face et Intel publient des versions conjointes couvrant processeurs, cartes graphiques et NPU Intel, avec Mistral 3 désormais exportable. 🔗 source
  • AmberTrace Labs mesure la fidélité du raisonnement d’Olmo 3 sous RL à récompense vérifiable — sur les sondes tenues à l’écart de l’entraînement, la fidélité passe de 0,238 à 0,262 : une dérive positive et non une érosion, avec checkpoints publiés. 🔗 source
  • Together AI revendique le meilleur temps au premier token sur DeepSeek V4.1 Flash — l’entreprise relaie la mesure d’un tiers pour les requêtes préchauffées, sans publier ni méthode ni valeur : une revendication, pas un résultat vérifiable. 🔗 source
  • Google Flow accompagne deux créateurs à la Fashion Week de New York — des outils sur mesure conçus avec Jane Wade et Sergio Hudson ; vitrine d’usage, sans nouveau modèle ni fonctionnalité déployée. 🔗 source
  • La Google AI Educator Series ouvre droit à des crédits universitaires — les cours de la formation donnent désormais droit à des crédits universitaires ou de formation continue. 🔗 source

Ce que ça signifie

La journée dit surtout une chose : les agents de code cessent d’être des produits fermés et commencent à partager leurs formats. Claude Code lit AGENTS.md quand un projet n’a pas de CLAUDE.md — c’est-à-dire qu’Anthropic accepte un fichier d’instructions défini ailleurs, pour que le même dépôt serve plusieurs outils. Le même jour, Antigravity injecte dans le prompt système de ses agents Markdown le catalogue des sous-agents disponibles, Vibe CLI fait enfin s’exécuter les hooks à l’intérieur des sous-agents, Codex ventile sa facture par sous-agent, et Qwen Code met les siens en conteneur. La délégation entre agents était une promesse de configuration ; elle devient une mécanique qu’il faut documenter, isoler et facturer. Claude Code va d’ailleurs jusqu’au bout de la logique de méfiance en marquant les résultats de sous-agents d’un en-tête dédié, pour qu’un texte remonté ne puisse pas se faire passer pour une instruction.

Le marché des agents de terminal, lui, se banalise à vue d’œil. MiniMax publie le sien sous licence MIT avec TUI, mode sans interface, ACP et choix libre du modèle ; Mistral retire l’étiquette « expérimental » de son Unified Harness et documente --legacy-harness comme porte de sortie ; Kimi Code sort un correctif de performance 32 heures après sa version majeure. Quand quatre éditeurs proposent le même objet avec les mêmes points d’entrée, la différenciation se déplace : elle tient à la licence, à la stabilité du harnais et au régime de permissions — et c’est précisément là que portent les changements du jour, chez Mistral comme chez Anthropic.

Sur les modèles, le mouvement est celui de l’audio-vidéo qui devient agentique plutôt que descriptif. Qwen3.8-Omni-Flash ne cherche plus à décrire une vidéo mais à y trouver une réponse : en partant de la question, il gagne 4,4 points sur OmniVideoBench tout en consommant 45,7 % de tokens en moins — la performance et l’économie vont dans le même sens, ce qui est rare. En face, Grok Voice Transcribe 2.0 ne joue pas la démonstration de laboratoire mais le trafic réel, avec un taux d’erreur sur phrases courtes qui passe de 20,6 % à 6,8 % et un tarif inchangé. Les deux annonces convergent : la valeur ne vient plus de la modalité prise en charge, elle vient de ce que le modèle décide de traiter.

Reste la question de ce que les laboratoires acceptent de faire vérifier. Anthropic paie Accenture pour installer des évaluateurs à l’intérieur de sa propre entreprise, avec un accès d’employé — et reconnaît dans la même annonce qu’aucune norme n’existe sur ce à quoi un tel évaluateur devrait accéder, ni sur la façon de publier ses constats, ni sur qui devrait le financer. C’est un aveu autant qu’un dispositif. À côté, les preuves les plus solides du jour sont celles qu’un tiers peut refaire : les résultats d’Exeter et du Stowers Institute sur AlphaGenome Atlas, le code d’optimisation biomoléculaire publié en open source, les checkpoints d’AmberTrace Labs. Et l’inverse se voit tout aussi bien : Replit avance un facteur 30 sans référence, Together AI relaie un classement sans méthode, Mistral dément une allégation que personne n’a pu lire. AIPerf, dans ce paysage, tombe à point — un outil de mesure qui commence par admettre que le mesureur est souvent le problème.


Sources