Lundi 21 septembre, la journée appartient à xAI : Grok 4.7 sort et se retrouve le jour même dans Cursor et dans GitHub Copilot, sans délai entre l’annonce du modèle et son arrivée dans les outils. OpenAI choisit le même jour pour révéler qu’un modèle interne entraîné depuis le 28 août a résolu plus de cent problèmes ouverts de mathématiques, et pour installer un groupe consultatif de mathématiciens après une déclaration signée par 27 médaillés Fields. Google ouvre les précommandes du Googlebook, ElevenLabs place un agent de montage au cœur de son éditeur vidéo, et Hugging Face republie sa bibliothèque de tokenisation de 3 à 30 fois plus rapide.
Grok 4.7 sort chez xAI et arrive le jour même dans Cursor et GitHub Copilot
21 septembre — xAI publie Grok 4.7, son modèle le plus capable pour le code et le travail de connaissance. Le modèle de base est plus grand que celui de Grok 4.6 et sa phase d’apprentissage par renforcement (reinforcement learning) a été allongée sur un mélange de tâches pondéré vers des problèmes de plusieurs heures. xAI en attend un modèle qui vérifie mieux son propre travail et tient mieux les contextes longs.
Les chiffres dessinent un profil contrasté plutôt qu’une domination. Le tarif, lui, ne bouge pas : 2 dollars par million de tokens en entrée et 6 en sortie, comme Grok 4.6, soit la moitié du prix d’entrée de GPT-5.6 Sol et un cinquième de celui de Fable 5.1. C’est sur ce rapport prix-performance que porte l’argument.
| Mesure publiée | Grok 4.7 (xHigh) | Grok 4.6 (High) | GPT-5.6 Sol (Max) | Fable 5.1 (Max) |
|---|---|---|---|---|
| CursorBench 4.0 | 46,3 % | 40,4 % | 41,7 % | 51,8 % |
| Terminal-Bench 4.0 | 38,0 % | 20,3 % | 37,3 % | 57,9 % |
| EEBench (ingénierie électrique) | 64,0 % | 53,0 % | 39,4 % | 56,4 % |
| Prix en entrée (dollars / M tokens) | 2 | 2 | 4 | 10 |
| Prix en sortie (dollars / M tokens) | 6 | 6 | 20 | 50 |
L’API expose grok-4.7 avec 500 000 tokens de contexte et quatre niveaux d’effort de raisonnement, de low à xhigh ; le tarif double au-delà de 200 000 tokens de prompt. xAI met aussi en avant une pile de garde-fous entièrement nouvelle : première place du benchmark de biosécurité de LatchBio à 62,4 %, et 3,3 % de prompts cyber à double usage risqués laissés passer sur HackerBench v0.3.
Le déploiement est immédiat chez deux intégrateurs. Cursor sert le modèle dès le premier jour — conséquence du rachat d’Anysphere par SpaceX, clos le 14 août. Le modèle reste celui de xAI : le billet publié le même jour sur le blog de Cursor tient en une phrase et renvoie à l’annonce complète sur x.ai. C’est xAI qui met en avant CursorBench 4.0, le banc d’essai de tâches longues de Cursor, où Grok 4.7 obtient 46,3 % à tarif inchangé. GitHub Copilot le déploie de son côté sur toutes ses surfaces, de VS Code à Xcode, pour les formules Pro à Enterprise. La facturation y mérite attention : Grok 4.7 échappe au système de multiplicateurs de requêtes et se facture au tarif public du fournisseur, à l’usage. Comme un nouveau modèle est activé par défaut, maîtriser la dépense demande une action dans la politique de modèles, pas seulement de ne rien faire.
🔗 Grok 4.7 — xAI 🔗 Grok 4.7 is now available in GitHub Copilot
OpenAI installe un groupe consultatif de mathématiciens et révèle plus de cent problèmes ouverts résolus
21 septembre — OpenAI annonce travailler avec un groupe consultatif indépendant de neuf mathématiciens, constitué par eux-mêmes et hébergé à l’Institute for Advanced Study de Princeton. Le contexte pèse plus lourd que l’annonce.
On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.
🇫🇷 Le 28 août, nous avons commencé à entraîner un nouveau modèle interne. Outre la résolution du problème du millénaire Navier-Stokes, ce modèle a désormais résolu plus de 100 problèmes ouverts de longue date dans la plupart des domaines des mathématiques. — OpenAI, Advisory Group on Mathematics and Artificial Intelligence
Le modèle n’est pas nommé publiquement, et OpenAI écrit que le rythme de ces progrès a surpris ses propres mathématiciens. Cette accélération a provoqué une réaction frontale : le 11 septembre, une déclaration intitulée « A Severe Misalignment of AI in Mathematics » était publiée avec un DOI Zenodo et la signature de 27 médaillés Fields, dont Terence Tao, Peter Scholze et Cédric Villani. Leur argument n’est pas que les modèles se trompent. Résoudre un grand problème a toujours signalé une compréhension nouvelle, ensuite travaillée par la communauté jusqu’à devenir enseignable ; les signataires redoutent qu’une production en masse d’énoncés vrais ou faux ne détruise ce terreau au lieu de le nourrir, et que ces annonces précipitées ne laissent pas le temps d’une rédaction correcte.
Le dispositif tient bien sur l’indépendance : le groupe peut émettre des avis non sollicités, commenter publiquement l’impact d’OpenAI sur les mathématiques et modifier sa composition sans validation de l’entreprise, et ses membres ne sont pas rémunérés par elle. Reste la phrase qu’OpenAI place en fin du même paragraphe : le groupe ne conseillera pas l’entreprise sur le rythme de ses progrès internes. Le périmètre couvre donc la diffusion des résultats, pas leur production — tout sauf ce qui a déclenché la protestation. Martin Hairer, lui, figure sur les deux listes, signataire de la déclaration et membre du groupe.
🔗 A Severe Misalignment of AI in Mathematics
Googlebook, la gamme d’ordinateurs portables Google conçue autour de Gemini
21 septembre — Google ouvre les précommandes du Googlebook, qu’il présente comme une catégorie à part entière : la pile technologique Android, des fondations desktop héritées de ChromeOS, le tout pensé autour de Gemini. Cinq modèles sortent simultanément, fabriqués par Acer, ASUS, Dell, HP et Lenovo, à partir de 899 dollars. Les livraisons commencent le 4 octobre aux États-Unis, le 5 octobre au Canada, au Royaume-Uni, en Irlande, en France, en Allemagne et en Australie.
| Caractéristique annoncée | Valeur |
|---|---|
| Prix de départ | 899 dollars |
| Processeurs | Intel Core Ultra Series 3 ou Snapdragon X Elite |
| NPU | plus de 45 TOPS |
| Mémoire vive | 16 Go de base, jusqu’à 32 Go |
| Autonomie | jusqu’à 14 h en vidéo, 16 h en navigation web |
| Suivi logiciel | mises à jour jusqu’à 10 ans |
Trois fonctions Gemini sont propres à la machine. Magic Pointer, déclenché en secouant le curseur, amène Gemini sur l’élément affiché à l’écran — analyser un courriel suspect, combiner plusieurs images — et Google précise qu’il ne s’active que sur demande et peut être désactivé. Rambler transforme une dictée décousue en texte structuré avec titres et listes de tâches, y compris quand on change de langue en cours de phrase. Create My Widget génère des widgets de bureau depuis une description en langage naturel.
Pour les développeurs, chaque machine est livrée avec Antigravity, la plateforme d’agents de développement de Google, et avec un environnement Linux isolé doté d’un terminal complet — la documentation cite explicitement la possibilité d’y faire tourner Claude Code ou Antigravity CLI. Cet isolement repose sur un hyperviseur pKVM certifié Level 5, que Google présente comme une première dans la catégorie, complété par la racine de confiance matérielle Titan. La continuité avec le téléphone Android fait le reste : reprise d’une tâche commencée sur mobile, applications mobiles diffusées dans une fenêtre du bureau. Chaque Googlebook inclut 12 mois de Google AI Pro avec 5 To de stockage, 3 mois de YouTube Premium et de Photoshop, et un an de GeForce NOW.
ElevenLabs met un agent de montage dans Studio 4.0
21 septembre — ElevenLabs publie Studio 4.0 dans ElevenCreative, la mise à jour de son éditeur vidéo. L’idée directrice tient en une phrase : tout se fait au même endroit. La génération de vidéo, d’image, de voix, de musique et d’effets sonores se déclenche depuis le projet lui-même, tous les modèles d’ElevenCreative sont appelables sans quitter l’éditeur, et le montage, le sous-titrage puis l’export s’enchaînent dans la même interface. Un plan se retravaille sans relancer la génération complète, et les sous-titres se manipulent comme n’importe quel clip sur le banc de montage (timeline).
La nouveauté la plus structurante est Studio Agent, un co-monteur présent dans chaque projet.
Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.
🇫🇷 Studio Agent est votre co-monteur IA, intégré à chaque projet. Décrivez le changement que vous voulez et il réalise le montage. Intervenez et faites vos coupes quand vous le souhaitez, puis rendez le banc de montage à l’agent. — @ElevenLabs sur X
C’est cet aller-retour qui distingue l’outil d’une génération opaque : le monteur reprend la main quand il le veut, puis rend le banc de montage. Celui-ci a d’ailleurs été reconstruit pour les projets multi-scènes et multi-pistes — campagne publicitaire, tutoriel, série de formats courts — avec zoom à l’image, aimantation des clips et déplacement d’un groupe de clips sans que le reste se désynchronise. Les commentaires d’équipe se posent sur un clip ou un asset précis au lieu de se disperser dans des fils séparés.
À noter pour le suivi : au moment du scan, l’annonce n’existait que sur X, en un fil de six messages. Le blog d’ElevenLabs s’arrêtait au billet du 10 septembre et le changelog de la documentation à l’entrée du 14.
🔗 Studio 4.0 dans ElevenCreative
Hugging Face publie tokenizers v1, de 3 à 30 fois plus rapide à identifiants identiques
21 septembre — Hugging Face publie la version candidate de tokenizers v1, la bibliothèque Rust qui transforme le texte en suites d’entiers avant qu’un modèle ne le lise. Le constat de départ est simple : la tokenisation n’a jamais été le goulot d’étranglement des chaînes d’apprentissage automatique, mais l’équilibre se déplace à mesure que les modèles accélèrent, et un GPU qui attend son processeur est un GPU inactif.
| Métrique | Valeur mesurée |
|---|---|
| Accélération de l’encodage face à v0.23, un seul fil | 3 à 30 fois |
| Machine de mesure | Apple M4 Max |
| Bas et haut de fourchette | t5-base et gpt2 |
| Montée en charge sur huit workers | 76 % du linéaire |
| Identifiants de tokens produits | identiques à v0.23 |
| Installation de la version candidate | cargo add tokenizers --pre |
La contrainte que s’impose l’équipe est plus intéressante que les gains eux-mêmes : v1 produit exactement les mêmes identifiants de tokens que v0.23, l’API, le vocabulaire et les rangs de fusion (merge ranks) ne bougent pas, et la bibliothèque reste généraliste au lieu de se spécialiser sur le BPE. La mise à jour ne demande donc rien d’autre que de changer la version installée.
Six changements portent l’essentiel du travail, et le plus inhabituel s’appelle bitcannon. L’expression régulière qui découpe le texte en pré-tokens est un paramètre fixe, livré avec le tokenizer : aucune raison de la faire interpréter par un moteur générique à chaque encodage. Hugging Face écrit donc la fonction de découpage à la main et la fait travailler sur des flux de bits en SIMD, 64 octets décidés par opération de registre. La contrepartie est assumée : seuls les motifs reconnus (GPT-2, cl100k, o200k, Tekken, DeepSeek) en profitent, les autres conservent le chemin regex — ce qui explique l’écart entre 3 et 30. S’y ajoutent une boucle de fusion sans allocation ni branchement, un cache de mots local au fil d’exécution et un parallélisme natif. Les liaisons C et C++ d’inférence seule, destinées à ExecuTorch et llama.cpp, sont annoncées avant la 1.0.0.
🔗 tokenizers v1: encode, decode and scaling, measured
Devin Cloud arrive dans le terminal, avec un accès SSH à la machine de l’agent
21 septembre — Cognition ouvre Devin Cloud au terminal : devin --cloud, ou /cloud depuis une session en cours, crée, pilote et reprend une session cloud sans quitter le CLI. Le mécanisme repose sur une commande symétrique : /handoff transfère la tâche en cours à la machine virtuelle de Devin — Mac, Linux ou Windows — et, exécutée depuis le cloud, fait le chemin inverse en récupérant la branche de la pull request. Les sessions cloud survivent au terminal qui les a lancées.
And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.
🇫🇷 Et, pour la première fois, connectez-vous en SSH à la machine virtuelle dédiée de Devin, puis rapatriez le travail sur votre propre appareil avec /handoff. — @cognition sur X
devin ssh ouvre un accès complet à l’environnement que l’agent s’est construit : modifier le code, lancer un serveur de développement, rediriger des ports, rapatrier des fichiers par scp. L’environnement d’exécution cesse d’être une boîte noire. Les sessions SWE-2 sont gratuites dans Devin Cloud jusqu’au 8 octobre.
🔗 Devin Cloud in your terminal
Qwen Code v0.24.3 instrumente son Web Shell et persiste ses sessions en JDBC
21 septembre — Qwen Code passe en v0.24.3 le lendemain de la v0.24.2 : trente et une pull requests, aucun changement incompatible. L’essentiel du travail visible porte sur le Web Shell, dont les résultats d’exécution ne sont plus du texte brut mais une structure séparant la commande, sa sortie, les détails d’exécution et le temps écoulé. Un onglet trajectory, désactivé par défaut, expose les durées par tour, le temps jusqu’au premier token, le nombre de tokens et la durée de chaque appel d’outil.
La partie la moins visible est probablement la plus structurante. Le runtime reçoit une persistance JDBC de ses liaisons et de ses sessions, ce qui permet de partager l’état entre plusieurs processus broker et de conserver la propriété d’une session après un redémarrage. Les outils du runtime sont par ailleurs routés via bwrap avec une politique de workspace immuable — la suite directe du bac à sable posé la veille, dont le réglage reste non exposé. Le même jour, le SDK TypeScript v0.1.14 embarque cette CLI et Qwen Code Desktop v0.24.3 suit.
🔗 Notes de version Qwen Code v0.24.3
Hugging Face ouvre relore, une mémoire de dépôt pour les agents de code
21 septembre — Hugging Face publie relore sous licence Apache-2.0, un outil qui donne à un agent de code la mémoire d’un dépôt. Le point de départ est un incident : sur le ticket Transformers #48630, ouvert le 8 septembre, deux correctifs avaient déjà été proposés quand l’agent d’intégration continue de l’entreprise s’est apprêté à en écrire un troisième. L’information était entièrement sur GitHub, mais éclatée entre tickets, pull requests et commentaires invisibles depuis le ticket de départ.
relore indexe cet historique en enregistrant qui a dit quoi : une décision de mainteneur ne vaut pas une hypothèse de contributeur, et le contenu généré par machine est écarté par défaut. Un clone de travail est maintenu à côté de l’index, servi par la même API HTTP, et les requêtes sont traitées localement — seule l’ingestion contacte GitHub. Les verbes suivent : inflight liste les fils qui prétendent clore un ticket, search --trust authoritative a fait remonter la PR #39847 à l’origine de la régression, why part d’une ligne de code pour retrouver les commentaires de revue qui l’entourent. Lors d’un test terrain, l’agent a rapporté que defs lui donnait une meilleure vue d’ensemble d’un fichier que sa lecture intégrale, pour 5 % des tokens.
🔗 relore, repository memory for coding agents
Perplexity post-entraîne Computer sur les erreurs de ses utilisateurs et lui ajoute la vidéo
21 septembre — Perplexity Research détaille comment l’entreprise post-entraîne le modèle qui sert son agent Computer — GLM 5.2, l’article le révèle au passage — à partir des sessions réelles de ses utilisateurs. Les environnements synthétiques produisent des tâches contrôlées et faciles à vérifier ; les sessions réelles livrent deux signaux qu’ils ne produisent pas, les corrections apportées par l’utilisateur et les erreurs renvoyées par les outils. Les sessions contenant des données personnelles et celles des utilisateurs ayant refusé l’entraînement sont écartées avant tout échantillonnage.
Chaque tour reçoit ensuite l’un de trois traitements : imitation par entropie croisée pour les tours sans erreur des sessions réussies, correction par divergence de Kullback-Leibler pour les tours fautifs munis d’un indice valide, ou simple maintien en contexte. Un même jeu de poids joue l’enseignant et l’élève, mais seul l’enseignant voit l’indice. Trois juges automatiques proposent les tours responsables et au moins deux doivent converger, car le dernier tour avant la plainte n’est la cause réelle que dans la moitié des cas environ.
| Taux d’erreurs d’outils | Valeur mesurée |
|---|---|
| Hors ligne, GLM 5.2 d’origine | 2,79 % |
| Hors ligne, échantillonnage avec rejet seul | 1,35 % |
| Hors ligne, avec auto-distillation | 0,87 % |
| En ligne, entre deux checkpoints | 2,24 % puis 1,77 %, soit 21,2 % de moins en relatif |
Les auteurs sont explicites sur ce que ces chiffres ne démontrent pas : les checkpoints comparés hors ligne n’ont pas été entraînés sur les mêmes données, les résultats par tâche restent mitigés, et l’insatisfaction des utilisateurs ne bouge pas significativement, 2,58 % contre 2,54 %, sur des tests A/B d’environ cent mille utilisateurs par bras.
Le même jour, Computer gagne la génération de vidéos, confiée à deux modèles tiers : MiniMax H3 et ByteDance Seedance 2.5. Clip de campagne, démonstration de produit ou visuel social, la vidéo finie arrive dans le même fil que le texte et les images produits pour la même demande. Disponible pour les abonnés Pro et Max, sans mention d’accès gratuit ni d’exposition par l’API.
🔗 Learning from Real-World Experience 🔗 Perplexity Computer et les modèles vidéo
Gemini Notebook généralise Live Chat et les Interactive Learning Overviews
21 septembre — Gemini Notebook a franchi deux paliers de déploiement le même jour. Live Chat atteint 100 % des abonnés Ultra sur mobile : conversation vocale en temps réel avec un notebook, dans environ 100 langues, appuyée sur les derniers modèles audio de Google, avec un guidage pas à pas presque entièrement mains libres. Quelques heures plus tard, les Interactive Learning Overviews sortent de leur déploiement progressif pour devenir accessibles à tous les utilisateurs, sans condition d’abonnement ; placées sous Reports, elles réunissent les résumés de sources et les artefacts du studio dans un même espace interactif.
Les deux fonctions avaient été présentées le 15 septembre, dans l’annonce des nouveaux outils d’étude. Les messages du 21 n’ajoutent aucune fonctionnalité : ils actent une disponibilité réelle, complète pour la première, ouverte à tous pour la seconde.
🔗 Live Chat déployé à 100 % 🔗 Interactive Learning Overviews ouvertes à tous
Google.org engage 4 millions de dollars pour la formation des enseignants à l’IA
21 septembre — Google.org engage 4 millions de dollars auprès de Digital Promise, annoncés à New York en marge de l’Assemblée générale des Nations unies. Le financement prolonge la Google AI Educator Series, une formation gratuite annoncée plus tôt dans l’année et destinée aux 6 millions d’enseignants du primaire, du secondaire et du supérieur aux États-Unis. Conçue avec ISTE selon une approche d’enseignants formant d’autres enseignants, elle porte sur des compétences transférables d’un outil à l’autre plutôt que sur un produit particulier, et se suit en modules à rythme libre validés par des badges numériques.
Digital Promise intervient sur trois volets : adapter la formation aux agences éducatives d’État et aux districts scolaires, s’associer aux réseaux de community colleges pour les enseignants du premier cycle, et mener sur deux ans une étude sur ce qui aide réellement les enseignants du supérieur, dont les résultats seront publiés dans un guide public gratuit.
🔗 Google.org et Digital Promise
Runway étend ses Workflows au compositing, à la transparence et aux cartes de profondeur
21 septembre — Runway élargit ses Workflows, les enchaînements d’opérations que l’on compose dans son application, avec cinq briques orientées post-production : Compositing, Alpha, HDR, Depth Map et RGB Depth. L’argument tient en une ligne dans l’annonce — construire une plus grande partie de sa chaîne de production (pipeline) au même endroit, sans sortir vers un autre outil entre deux étapes. Le compositing et la gestion du canal alpha visent l’assemblage de plusieurs couches d’image ; les cartes de profondeur, sous leurs deux formes, servent de signal géométrique pour piloter des effets qui dépendent de la distance à la caméra. L’annonce a été faite sur X avec une démonstration de 31 secondes, sans billet correspondant sur la page d’actualités de Runway au moment du scan.
🔗 Workflows étendus dans Runway
NVIDIA ouvre DSX Ready, un programme de qualification pour alimenter et refroidir les usines IA
21 septembre — NVIDIA ouvre DSX Ready, un programme qui qualifie les produits partenaires au regard des exigences de son architecture de référence DSX pour usines IA. Le constat de départ est terre à terre : l’alimentation, le refroidissement, l’eau, le site et le réseau électrique décident aujourd’hui de ce qu’un constructeur peut réellement déployer, et un équipement mal accordé au reste de la conception ne transforme pas la capacité de calcul en production utile.
| Catégorie qualifiée | Partenaires au lancement | Parcours de qualification |
|---|---|---|
| Stockage d’énergie par batteries | Hitachi Energy, LG Energy Solution, Tesla | Tests par le partenaire, revue et approbation NVIDIA |
| Unités de distribution de refroidissement | LG Electronics, LiquidStack, Vertiv | Suite d’auto-qualification |
NVIDIA pose une limite explicite à ce que signifie le label : réussir la qualification ne remplace pas l’ingénierie au niveau du site et n’implique aucune garantie de stabilité de celui-ci. D’autres catégories, touchant l’infrastructure et le logiciel, doivent s’ajouter progressivement.
NVIDIA traite la sécurité des agents comme un problème d’ingénierie, couche par couche
21 septembre — NVIDIA publie une prise de position sur la sécurité des systèmes agentiques : c’est un problème d’ingénierie, donc des exigences définies, des contrôles applicables, des propriétaires nommés et des preuves que les protections tiennent. La pile est décomposée en trois niveaux — les modèles apportent les capacités, les harnais organisent contexte, outils et flux de travail, l’environnement d’exécution fournit l’infrastructure où les actions se déroulent — chacun portant ses propres contrôles.
L’exemple retenu est parlant : un agent met à jour une fiche client, rencontre des instructions malveillantes dans un document joint et tente d’exporter les données vers une destination non autorisée. NVIDIA attend alors une politique réseau qui bloque le transfert et des journaux protégés qui conservent l’appel d’outil tenté, la décision d’autorisation et le résultat. Le droit de mettre à jour une fiche ne s’étend pas au droit de l’exporter, et un agent peut demander un accès sans jamais pouvoir se l’accorder. Côté outillage, OpenShell applique les politiques hors de portée de l’agent ; Cisco pose DefenseClaw par-dessus et JFrog vérifie les skills auxquelles un agent accède.
Le même jour, un second billet applique le même raisonnement à l’IA physique et le rattache au socle Halos ; il figure en brèves ci-dessous, avec ses deux projections de marché.
Earth-2 assimile les observations locales pour rafraîchir les prévisions météo
21 septembre — NVIDIA publie un tutoriel sur les outils d’assimilation de données par IA d’Earth-2, destinés aux secteurs qui disposent déjà de leurs propres mesures : parcs éoliens et solaires, radars et capteurs locaux, observations satellitaires. La première technique, SDA, s’applique aux modèles de diffusion comme CorrDiff et StormCast : à chaque étape de débruitage, elle compare le résultat intermédiaire aux observations et oriente l’étape suivante, sans réentraînement.
| Technique mesurée | Portée et résolution | Gain rapporté dans l’exemple |
|---|---|---|
| CorrDiff-SDA | Europe, de 0,25 degré vers 2,2 km | RMSE du vent en baisse de 54 % aux stations écartées |
| StormCast-SDA | États-Unis continentaux, 3 km, initialisé HRRR | RMSE du vent en baisse de 7,2 % sur six pas de temps |
| HealDA | Globale, grille HEALPix à 1 degré | État global de l’atmosphère estimé en quelques secondes |
L’intérêt est d’abord opérationnel : les analyses numériques demandent un temps de calcul substantiel et sortent à horaires fixes, alors que SDA intègre des observations en continu et comble l’écart avec l’heure courante. HealDA, de son côté, traite chaque flux comme un nuage de points en espace et en temps, agrégé sur la grille cible puis passé dans un réseau dorsal (backbone) de type vision transformer.
🔗 Assimilation de données dans Earth-2
Multiverse Computing élague les blocs comme un verre d’Ising et gagne 23 points de MMLU
21 septembre — Supprimer des blocs entiers de transformeur est l’un des moyens les moins coûteux d’accélérer un grand modèle de langage, et l’un des plus brutaux : le modèle devient littéralement plus court, mais retirer les mauvais blocs le fait s’effondrer. Multiverse Computing soutient que la question est mal posée. Les méthodes existantes notent chaque bloc isolément — magnitude, sensibilité, block influence — ce que les auteurs qualifient de champ moyen, alors que l’effet du retrait d’un bloc dépend de ceux que l’on retire en même temps.
La sélection devient donc un problème d’optimisation binaire sous contrainte, qui se projette sur un verre d’Ising : un système de spins désordonné, à interactions toutes à toutes, avec un nombre fixe de spins orientés vers le haut. L’intérêt pratique tient en une phrase : l’énergie de ce système est un substitut peu coûteux du score qu’obtiendra le modèle élagué, ce qui permet de classer un très grand nombre de configurations candidates sans en évaluer aucune sur des benchmarks. À 50 % de compression de Llama-3.3-70B-Instruct, les auteurs revendiquent près de 23 points de pourcentage gagnés sur MMLU face à la meilleure méthode concurrente.
🔗 Pruning LLMs like a physicist
Brèves
NVIDIA a publié sept billets et messages le 21 septembre : trois sont traités plus haut, les quatre autres figurent ici, sans annonce technique.
- NVIDIA appelle à une sécurité à chaque couche pour l’IA physique — billet de position appuyé sur deux projections de marché, 49 millions de véhicules autonomes de niveau 3 à 5 installés d’ici 2035 selon ABI Research et environ 60 millions de robots industriels déployés entre 2026 et 2035 selon Omdia. Quatre exigences de sécurité y sont rattachées au socle NVIDIA Halos. 🔗 source
- NVIDIA met en avant le passage à l’échelle de l’écosystème IA égyptien — réception au Grand Egyptian Museum avec une allocution d’ouverture de Paolo Guglielmini, vice-président EMEA. Le chapô signale surtout que des usines IA entrent en service en Afrique du Sud, au Maroc et au Nigeria. 🔗 source
- NVIDIA recense cinq entreprises qui appliquent l’IA aux énergies bas carbone — panorama publié pour la New York Climate Week, de l’accélération de la fusion au réemploi de batteries de véhicules électriques recyclées. ThinkLabs AI y construit jumeaux numériques et agents sur CUDA pour raccourcir les délais de raccordement au réseau. 🔗 source
- NVIDIA annonce les gagnants des Golden Tickets pour GTC Berlin — six gagnants désignés par un jury pour la conférence des 20 au 22 octobre 2026. Aucun contenu technique. 🔗 source
- Qwen-Image-2.1 servi dès le premier jour par vLLM, SGLang, ComfyUI et Hugging Face — SGLang-Diffusion fait tourner le modèle sur une seule RTX 4090 de 24 Go avec déport vers le processeur, pour une génération 1024 par 1024 en 18,7 secondes et 22,7 Gio occupés. vLLM le décrit comme un transformeur de diffusion de 7,1 milliards de paramètres associé à Qwen3-VL-8B. 🔗 source
- OpenAI Academy ajoute quatre parcours de formation — Build with AI, Lead AI Adoption, AI for Educators et AI for College Students rejoignent Apply AI at Work. Chaque cours se termine par une évaluation qui donne un badge ; le parcours développeurs sépare le pilotage de Codex et la construction sur l’API. 🔗 source
- Runway organise un hackathon à San Francisco autour de son API — journée unique le 30 septembre au Masonic, en marge du Runway AI Summit, pour construire un agent, une application ou un flux de travail créatif, sans dossier de présentation ni circuit de validation. 🔗 source
- HeyGen met en avant Code2Video, un benchmark construit avec Google DeepMind et Kaggle — la mesure porte sur une question distincte de l’écriture du code : savoir si ce code produit une vidéo qui mérite d’être regardée. Publié en commentaire d’un message sur la pile vidéo agentique fondée sur la génération de code. 🔗 source
- Suno montre des effets sonores appliqués par simple description — démonstration d’une minute, d’une saturation chaude à un rendu plus expérimental. Ni nom de fonctionnalité, ni forfait concerné, ni billet de blog associé : une mise en avant produit plutôt qu’un lancement. 🔗 source
- Démonstration en direct de Gemini pour les achats sur Discord — session annoncée pour le mardi 22 septembre à 11 h PT sur le serveur Discord officiel, consacrée à la préparation d’un achat, à la comparaison d’options et à la recherche à partir d’une photo. Aucune fonctionnalité nouvelle. 🔗 source
- Together AI et Ollama annoncent une session sur les agents de code ouverts — Parth Sareen côté Ollama et Zain Hasan côté Together AI animeront une session sur la mise en production des agents de code fondés sur des modèles ouverts. Ni date ni lieu dans le message. 🔗 source
- Deux entraînements abandonnés de Boris-2 passent en poids ouverts — le premier plafonnait à 3,100 de perte à 30 milliards de tokens, à cause d’une incompatibilité entre gradients Muon et AdamW ; le second a été arrêté vers 7 milliards de tokens. Un récit d’échec plus instructif que les modèles. 🔗 source
- Un protocole pré-enregistré contre le biais directionnel des modèles juges — l’hypothèse est que, sur du texte narratif, les erreurs penchent vers la déclaration d’un sentiment plutôt que son encodage. Le protocole est publié avant toute collecte, avec le résultat qui ferait retirer le construit et un conflit d’intérêts déclaré par l’auteur. 🔗 source
- Une reproduction de Jev en briques ouvertes échoue de 0,6 point — un utilisateur qui déclare ne pas programmer confie une journée d’expériences à Claude Code pour reconstruire Jev sur des piles ouvertes fonctionnant uniquement sur processeur. Huit approches ratées, qu’il juge plus instructives que celle qui a fonctionné. 🔗 source
- Jevini sépare la conception et l’exécution de la décision — un grand modèle de raisonnement conçoit un graphe versionné de jugements typés, qu’un petit modèle de décision exécute sur chaque situation nouvelle. Contenu promotionnel d’éditeur, à traiter comme tel. 🔗 source
- Cohere tient sa communication de marque, sans annonce produit — un message du 20 septembre prolonge la campagne AI for Empowerment en reformulant l’intention prêtée au cofondateur Aidan Gomez, et deux visuels du 21 racontent le passage de l’entreprise au hackathon étudiant Hack The North, à Waterloo. Ni modèle, ni fonctionnalité, ni tarif. 🔗 campagne · 🔗 hackathon
Ce que ça signifie
Le jour zéro devient la norme de distribution. Grok 4.7 n’attend pas : il est dans Cursor et dans GitHub Copilot le jour de son annonce, et Qwen-Image-2.1 a été servi dès sa sortie par vLLM, SGLang, ComfyUI et Hugging Face. Le délai entre une publication de modèle et sa disponibilité dans les outils du quotidien, qui se comptait en semaines, tend vers zéro — chez Cursor parce que l’éditeur et le laboratoire appartiennent désormais au même groupe depuis le 14 août, ailleurs parce que l’intégration se prépare avant l’annonce. La question intéressante n’est plus de savoir quand un modèle arrivera, mais ce qu’il coûtera une fois arrivé.
C’est justement ce que change la ligne de facturation de Copilot. Grok 4.7 y sort du système de multiplicateurs de requêtes pour être facturé au tarif public de xAI, à l’usage. Combiné à l’activation automatique des nouveaux modèles, cela déplace une décision de coût vers l’administration de la plateforme : ne rien faire revient à ouvrir un poste de dépense indexé sur la grille d’un fournisseur tiers. Côté xAI, l’argument est symétrique — mêmes 2 dollars en entrée que Grok 4.6, gains réels sur Terminal-Bench, mais une place derrière Fable 5.1 sur les tâches de code longues : ce qui se vend ici, c’est un rapport prix-performance, pas une première place.
Sur les agents, trois annonces éloignées racontent la même bascule : l’environnement d’exécution cesse d’être une boîte noire. devin ssh ouvre la machine virtuelle de l’agent à une session interactive, relore donne à l’agent la mémoire des décisions passées d’un dépôt plutôt que le seul état présent du code, Perplexity post-entraîne son modèle sur les tours précis où il a échoué chez ses utilisateurs, et Qwen Code route ses outils via bwrap. NVIDIA fournit le cadre théorique de ce mouvement en posant que la sécurité d’un agent se joue couche par couche, hors de sa portée, avec des journaux qui font preuve. L’agent inspectable et l’agent contraint sont les deux faces du même besoin.
Reste la question que l’annonce d’OpenAI pose sans la traiter. Un modèle interne qui résout plus de cent problèmes ouverts en moins d’un mois a produit une réponse institutionnelle — un groupe consultatif indépendant, non rémunéré, libre de ses avis — dont le mandat exclut explicitement le rythme des progrès internes, c’est-à-dire l’objet même de la protestation des 27 médaillés Fields. Le contraste avec le reste de la journée est instructif : pendant que se discute la cadence des résultats spectaculaires, une bibliothèque de tokenisation gagne un facteur 3 à 30 en garantissant des identifiants identiques, et une méthode de compression emprunte aux verres de spins pour gagner 23 points de MMLU à 50 % de compression. Ce travail-là ne fait pas de titre, mais c’est lui qui décide de ce que coûtera l’inférence de demain.
Sources
- Grok 4.7 — xAI
- @SpaceXAI sur X, annonce de Grok 4.7
- Grok 4.7 is now available in GitHub Copilot
- Advisory Group on Mathematics and Artificial Intelligence
- A Severe Misalignment of AI in Mathematics
- Précommandes du Googlebook
- ElevenLabs sur X, Studio 4.0
- ElevenLabs sur X, Studio Agent
- tokenizers v1: encode, decode and scaling, measured
- Devin Cloud in your terminal
- Cognition sur X, devin ssh
- Notes de version Qwen Code v0.24.3
- relore, repository memory for coding agents
- Learning from Real-World Experience
- Perplexity sur X, modèles vidéo dans Computer
- Gemini Notebook sur X, Live Chat
- Gemini Notebook sur X, Interactive Learning Overviews
- Google.org et Digital Promise
- Runway sur X, Workflows étendus
- NVIDIA DSX Ready
- Securing the agent stack
- NVIDIA, sécurité de l’IA physique et socle Halos
- Assimilation de données dans Earth-2
- Pruning LLMs like a physicist
- NVIDIA, écosystème IA égyptien
- NVIDIA, cinq entreprises et les énergies bas carbone
- NVIDIA AI sur X, Golden Tickets GTC Berlin
- Alibaba Qwen sur X, prise en charge de Qwen-Image-2.1
- Expanding OpenAI Academy with new learning paths
- Runway sur X, hackathon API
- HeyGen sur X, benchmark Code2Video
- Suno sur X, effets sonores décrits en langage naturel
- Gemini App sur X, démonstration achats
- Together AI sur X, session avec Ollama
- Boris-2-0907 and Boris-2-0917
- Summarization Bias: A Pre-Registered Test for a Directional Failure in LLM Judges
- I benchmarked Jev against open CPU-only stacks
- Decision Circuit Engineering
- Cohere sur X, campagne AI for Empowerment
- Cohere sur X, Hack The North