Buscar

Grok 4.7 llega el mismo día a Cursor y Copilot, OpenAI revela más de 100 problemas matemáticos resueltos, Googlebook en preventa

ai-powered-markdown-translator

Artículo traducido del francés al español con gpt-5.6-sol.

Ver proyecto en GitHub ↗

El lunes 21 de septiembre, la jornada pertenece a xAI: Grok 4.7 sale y llega ese mismo día a Cursor y GitHub Copilot, sin demora entre el anuncio del modelo y su incorporación a las herramientas. OpenAI elige el mismo día para revelar que un modelo interno entrenado desde el 28 de agosto ha resuelto más de cien problemas matemáticos abiertos y para crear un grupo consultivo de matemáticos tras una declaración firmada por 27 medallistas Fields. Google abre las preventas del Googlebook, ElevenLabs sitúa un agente de edición en el centro de su editor de vídeo y Hugging Face vuelve a publicar su biblioteca de tokenización, entre 3 y 30 veces más rápida.


Grok 4.7 sale en xAI y llega el mismo día a Cursor y GitHub Copilot

21 de septiembre — xAI publica Grok 4.7, su modelo más capaz para código y trabajo de conocimiento. El modelo base es más grande que el de Grok 4.6 y su fase de aprendizaje por refuerzo (reinforcement learning) se ha prolongado con una combinación de tareas orientada hacia problemas de varias horas. xAI espera que el resultado sea un modelo que compruebe mejor su propio trabajo y gestione mejor los contextos largos.

Las cifras dibujan un perfil dispar más que una dominación. El precio, por su parte, no cambia: 2 dólares por millón de tokens de entrada y 6 de salida, como Grok 4.6, es decir, la mitad del precio de entrada de GPT-5.6 Sol y una quinta parte del de Fable 5.1. El argumento se centra en esta relación calidad-precio.

Medida publicadaGrok 4.7 (xHigh)Grok 4.6 (High)GPT-5.6 Sol (Max)Fable 5.1 (Max)
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
EEBench (ingeniería eléctrica)64,0 %53,0 %39,4 %56,4 %
Precio de entrada (dólares/M tokens)22410
Precio de salida (dólares/M tokens)662050

La API ofrece grok-4.7 con 500 000 tokens de contexto y cuatro niveles de esfuerzo de razonamiento, de low a xhigh; el precio se duplica por encima de 200 000 tokens de prompt. xAI también destaca un conjunto de medidas de protección completamente nuevo: primer puesto en el benchmark de bioseguridad de LatchBio con un 62,4 % y un 3,3 % de prompts cibernéticos arriesgados de doble uso admitidos en HackerBench v0.3.

El despliegue es inmediato en dos integradores. Cursor ofrece el modelo desde el primer día, como consecuencia de la adquisición de Anysphere por SpaceX, cerrada el 14 de agosto. El modelo sigue siendo de xAI: la entrada publicada ese mismo día en el blog de Cursor consta de una sola frase y remite al anuncio completo en x.ai. Es xAI quien destaca CursorBench 4.0, el banco de pruebas de tareas largas de Cursor, donde Grok 4.7 obtiene un 46,3 % sin cambios de precio. GitHub Copilot, por su parte, lo despliega en todas sus plataformas, desde VS Code hasta Xcode, para los planes Pro a Enterprise. Su facturación merece atención: Grok 4.7 queda fuera del sistema de multiplicadores de solicitudes y se factura según la tarifa pública del proveedor, en función del uso. Como los nuevos modelos se activan de forma predeterminada, controlar el gasto exige intervenir en la política de modelos, no basta con no hacer nada.

🔗 Grok 4.7 — xAI 🔗 Grok 4.7 ya está disponible en GitHub Copilot


OpenAI crea un grupo consultivo de matemáticos y revela más de cien problemas abiertos resueltos

21 de septiembre — OpenAI anuncia que trabaja con un grupo consultivo independiente de nueve matemáticos, constituido por ellos mismos y alojado en el Institute for Advanced Study de Princeton. El contexto pesa más que el anuncio.

On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.

🇪🇸 El 28 de agosto comenzamos a entrenar un nuevo modelo interno. Además de resolver el problema del milenio de Navier-Stokes, este modelo ya ha resuelto más de 100 problemas abiertos desde hace mucho tiempo en la mayoría de los campos de las matemáticas. — OpenAI, Grupo consultivo sobre Matemáticas e Inteligencia Artificial

El modelo no tiene un nombre público y OpenAI escribe que el ritmo de estos avances sorprendió a sus propios matemáticos. Esta aceleración provocó una reacción frontal: el 11 de septiembre se publicó una declaración titulada «A Severe Misalignment of AI in Mathematics», con un DOI de Zenodo y la firma de 27 medallistas Fields, entre ellos Terence Tao, Peter Scholze y Cédric Villani. Su argumento no es que los modelos se equivoquen. Resolver un gran problema siempre ha señalado una nueva comprensión, posteriormente desarrollada por la comunidad hasta poder enseñarse; los firmantes temen que la producción en masa de enunciados verdaderos o falsos destruya ese terreno fértil en lugar de nutrirlo y que estos anuncios precipitados no dejen tiempo para una redacción adecuada.

El mecanismo se sustenta firmemente en la independencia: el grupo puede emitir opiniones no solicitadas, comentar públicamente el impacto de OpenAI en las matemáticas y modificar su composición sin la aprobación de la empresa, y esta no remunera a sus miembros. Queda la frase que OpenAI sitúa al final del mismo párrafo: el grupo no asesorará a la empresa sobre el ritmo de sus avances internos. Por tanto, el ámbito abarca la difusión de los resultados, no su producción: todo salvo aquello que desencadenó la protesta. Martin Hairer, por su parte, aparece en ambas listas, como firmante de la declaración y miembro del grupo.

🔗 Una grave desalineación de la IA en las matemáticas


Googlebook, la gama de ordenadores portátiles de Google diseñada en torno a Gemini

21 de septiembre — Google abre las preventas del Googlebook, que presenta como una categoría propia: la pila tecnológica de Android, fundamentos de escritorio heredados de ChromeOS y todo ello diseñado en torno a Gemini. Se lanzan simultáneamente cinco modelos, fabricados por Acer, ASUS, Dell, HP y Lenovo, desde 899 dólares. Las entregas comienzan el 4 de octubre en Estados Unidos y el 5 de octubre en Canadá, Reino Unido, Irlanda, Francia, Alemania y Australia.

Característica anunciadaValor
Precio inicial899 dólares
ProcesadoresIntel Core Ultra Series 3 o Snapdragon X Elite
NPUmás de 45 TOPS
Memoria RAM16 GB de base, hasta 32 GB
Autonomíahasta 14 h de vídeo, 16 h de navegación web
Soporte de softwareactualizaciones durante un máximo de 10 años

Tres funciones de Gemini son exclusivas del equipo. Magic Pointer, que se activa al agitar el cursor, lleva Gemini al elemento mostrado en pantalla —para analizar un correo electrónico sospechoso o combinar varias imágenes— y Google precisa que solo se activa cuando se solicita y que puede deshabilitarse. Rambler transforma un dictado inconexo en texto estructurado con títulos y listas de tareas, incluso cuando se cambia de idioma a mitad de una frase. Create My Widget genera widgets de escritorio a partir de una descripción en lenguaje natural.

Para los desarrolladores, cada equipo incluye Antigravity, la plataforma de agentes de desarrollo de Google, y un entorno Linux aislado con un terminal completo; la documentación menciona explícitamente la posibilidad de ejecutar en él Claude Code o Antigravity CLI. Este aislamiento se basa en un hipervisor pKVM con certificación Level 5, que Google presenta como una primicia en la categoría, complementado por la raíz de confianza de hardware Titan. La continuidad con el teléfono Android hace el resto: reanudación de una tarea iniciada en el móvil y aplicaciones móviles transmitidas en una ventana del escritorio. Cada Googlebook incluye 12 meses de Google AI Pro con 5 TB de almacenamiento, 3 meses de YouTube Premium y Photoshop, y un año de GeForce NOW.

🔗 Preventas del Googlebook


ElevenLabs incorpora un agente de edición a Studio 4.0

21 de septiembre — ElevenLabs publica Studio 4.0 en ElevenCreative, la actualización de su editor de vídeo. La idea central se resume en una frase: todo se hace en el mismo lugar. La generación de vídeo, imagen, voz, música y efectos de sonido se inicia desde el propio proyecto, todos los modelos de ElevenCreative pueden utilizarse sin salir del editor y la edición, la creación de subtítulos y la exportación se suceden en la misma interfaz. Un plano puede retocarse sin reiniciar la generación completa y los subtítulos se manipulan como cualquier otro clip en la línea de tiempo (timeline).

La novedad más estructural es Studio Agent, un coeditor presente en cada proyecto.

Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.

🇪🇸 Studio Agent es tu coeditor de IA, integrado en cada proyecto. Describe el cambio que deseas y él realiza la edición. Intervén y haz tus cortes cuando quieras, y después devuelve la línea de tiempo al agente.@ElevenLabs en X

Es este intercambio el que diferencia la herramienta de una generación opaca: el editor retoma el control cuando quiere y después devuelve la línea de tiempo. Esta, además, se ha reconstruido para proyectos con múltiples escenas y pistas —campañas publicitarias, tutoriales, series de formatos cortos—, con zoom preciso hasta cada fotograma, ajuste magnético de los clips y desplazamiento de un grupo de clips sin desincronizar el resto. Los comentarios del equipo se asocian a un clip o asset concreto en lugar de dispersarse en hilos separados.

Un dato para el seguimiento: en el momento del análisis, el anuncio solo existía en X, en un hilo de seis mensajes. El blog de ElevenLabs terminaba en la entrada del 10 de septiembre y el changelog de la documentación, en la del día 14.

🔗 Studio 4.0 en ElevenCreative


Hugging Face publica tokenizers v1, entre 3 y 30 veces más rápido con identificadores idénticos

21 de septiembre — Hugging Face publica la versión candidata de tokenizers v1, la biblioteca de Rust que transforma el texto en secuencias de enteros antes de que un modelo lo lea. El punto de partida es sencillo: la tokenización nunca ha sido el cuello de botella de los procesos de machine learning, pero el equilibrio cambia a medida que los modelos se aceleran, y una GPU que espera a su procesador es una GPU inactiva.

MétricaValor medido
Aceleración de la codificación frente a v0.23, un hiloDe 3 a 30 veces
Equipo de mediciónApple M4 Max
Extremos inferior y superior del intervalot5-base y gpt2
Escalado con ocho workers76 % del lineal
Identificadores de tokens generadosidénticos a v0.23
Instalación de la versión candidatacargo add tokenizers --pre

La restricción que se impone el equipo es más interesante que las propias mejoras: v1 genera exactamente los mismos identificadores de tokens que v0.23, la API, el vocabulario y los rangos de fusión (merge ranks) no cambian, y la biblioteca sigue siendo generalista en lugar de especializarse en BPE. Por tanto, la actualización no requiere nada más que cambiar la versión instalada.

Seis cambios concentran la mayor parte del trabajo, y el más inusual se llama bitcannon. La expresión regular que divide el texto en pre-tokens es un parámetro fijo, suministrado con el tokenizer: no hay razón para que un motor genérico tenga que interpretarla en cada codificación. Por ello, Hugging Face escribe manualmente la función de segmentación y hace que trabaje con flujos de bits mediante SIMD, procesando 64 bytes por operación de registro. La contrapartida se asume: solo se benefician de ello los patrones reconocidos (GPT-2, cl100k, o200k, Tekken, DeepSeek); los demás conservan la ruta regex, lo que explica la diferencia entre 3 y 30. A esto se suman un bucle de fusión sin asignaciones ni bifurcaciones, una caché de palabras local para cada hilo de ejecución y paralelismo nativo. Las bindings C y C++ destinadas únicamente a inferencia, para ExecuTorch y llama.cpp, se anuncian para antes de la versión 1.0.0.

🔗 tokenizers v1: codificación, decodificación y escalado, medidos


Devin Cloud llega al terminal, con acceso SSH al equipo del agente

21 de septiembre — Cognition lleva Devin Cloud al terminal: devin --cloud, o /cloud desde una sesión en curso, crea, controla y reanuda una sesión cloud sin salir de la CLI. El mecanismo se basa en un comando simétrico: /handoff transfiere la tarea en curso a la máquina virtual de Devin —Mac, Linux o Windows— y, cuando se ejecuta desde el cloud, realiza el trayecto inverso recuperando la rama de la pull request. Las sesiones cloud sobreviven al terminal que las inició.

And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.

🇪🇸 Y, por primera vez, conéctate por SSH a la máquina virtual dedicada de Devin y después devuelve el trabajo a tu propio dispositivo con /handoff.@cognition en X

devin ssh abre un acceso completo al entorno que el agente ha construido: modificar el código, iniciar un servidor de desarrollo, redirigir puertos y transferir archivos mediante scp. El entorno de ejecución deja de ser una caja negra. Las sesiones SWE-2 son gratuitas en Devin Cloud hasta el 8 de octubre.

🔗 Devin Cloud en tu terminal


Qwen Code v0.24.3 instrumenta su Web Shell y conserva sus sesiones mediante JDBC

21 de septiembre — Qwen Code pasa a la versión v0.24.3 al día siguiente de la v0.24.2: treinta y una pull requests y ningún cambio incompatible. La mayor parte del trabajo visible se centra en el Web Shell, cuyos resultados de ejecución ya no son texto sin formato, sino una estructura que separa el comando, su salida, los detalles de ejecución y el tiempo transcurrido. Una pestaña trajectory, desactivada de forma predeterminada, muestra la duración de cada turno, el tiempo hasta el primer token, el número de tokens y la duración de cada llamada a herramientas.

La parte menos visible es probablemente la más estructural. El runtime incorpora persistencia JDBC para sus enlaces y sesiones, lo que permite compartir el estado entre varios procesos broker y conservar la propiedad de una sesión tras un reinicio. Además, las herramientas del runtime se enrutan mediante bwrap con una política de workspace inmutable, continuación directa del sandbox incorporado el día anterior, cuya configuración sigue sin estar expuesta. Ese mismo día, el SDK de TypeScript v0.1.14 incluye esta CLI y Qwen Code Desktop v0.24.3 le sigue.

🔗 Notas de la versión Qwen Code v0.24.3


Hugging Face publica relore, una memoria de repositorio para los agentes de código

21 de septiembre — Hugging Face publica relore bajo licencia Apache-2.0, una herramienta que proporciona a un agente de código la memoria de un repositorio. El punto de partida es un incidente: en el ticket Transformers #48630, abierto el 8 de septiembre, ya se habían propuesto dos correcciones cuando el agente de integración continua de la empresa se disponía a escribir una tercera. La información estaba íntegramente en GitHub, pero dispersa entre tickets, pull requests y comentarios invisibles desde el ticket inicial.

relore indexa este historial registrando quién dijo qué: una decisión de un mantenedor no tiene el mismo valor que la hipótesis de un colaborador, y el contenido generado por máquinas se excluye de forma predeterminada. Se mantiene un clon de trabajo junto al índice, servido por la misma API HTTP, y las consultas se procesan localmente; solo la ingesta contacta con GitHub. A continuación vienen los comandos: inflight enumera los hilos que afirman cerrar un ticket, search --trust authoritative sacó a la luz la PR #39847 que originó la regresión, y why parte de una línea de código para recuperar los comentarios de revisión que la rodean. Durante una prueba en condiciones reales, el agente señaló que defs le ofrecía una mejor visión general de un archivo que leerlo íntegramente, utilizando el 5 % de los tokens.

🔗 relore, memoria de repositorio para agentes de código


Perplexity posentrena Computer con los errores de sus usuarios y le añade vídeo

21 de septiembre — Perplexity Research detalla cómo la empresa posentrena el modelo que utiliza su agente Computer —GLM 5.2, según revela de paso el artículo— a partir de las sesiones reales de sus usuarios. Los entornos sintéticos producen tareas controladas y fáciles de verificar; las sesiones reales proporcionan dos señales que aquellos no generan: las correcciones realizadas por el usuario y los errores devueltos por las herramientas. Las sesiones que contienen datos personales y las de los usuarios que rechazaron el entrenamiento se excluyen antes de cualquier muestreo.

Después, cada turno recibe uno de tres tratamientos: imitación mediante entropía cruzada para los turnos sin errores de las sesiones satisfactorias, corrección mediante divergencia de Kullback-Leibler para los turnos erróneos que cuentan con una pista válida, o la simple conservación en el contexto. Un mismo conjunto de pesos actúa como profesor y alumno, pero solo el profesor ve la pista. Tres jueces automáticos proponen los turnos responsables y al menos dos deben coincidir, porque el último turno anterior a la queja solo es la causa real en aproximadamente la mitad de los casos.

Tasa de errores de herramientasValor medido
Sin conexión, GLM 5.2 original2,79 %
Sin conexión, solo muestreo con rechazo1,35 %
Sin conexión, con autodestilación0,87 %
En línea, entre dos checkpoints2,24 % y después 1,77 %, es decir, un 21,2 % menos en términos relativos

Los autores explican con claridad lo que estas cifras no demuestran: los checkpoints comparados sin conexión no se entrenaron con los mismos datos, los resultados por tarea siguen siendo dispares y la insatisfacción de los usuarios no cambia de forma significativa, un 2,58 % frente a un 2,54 %, en pruebas A/B con aproximadamente cien mil usuarios por grupo.

Ese mismo día, Computer incorpora la generación de vídeos, encomendada a dos modelos de terceros: MiniMax H3 y ByteDance Seedance 2.5. Ya sea un clip de campaña, una demostración de producto o una pieza visual para redes sociales, el vídeo terminado aparece en el mismo hilo que el texto y las imágenes producidos para la misma solicitud. Está disponible para los suscriptores Pro y Max, sin mención de acceso gratuito ni de disponibilidad mediante la API.

🔗 Aprender de los errores del mundo real 🔗 Perplexity Computer y los modelos de vídeo


Gemini Notebook amplía Live Chat y las Interactive Learning Overviews a todos sus destinatarios

21 de septiembre — Gemini Notebook alcanzó dos hitos de despliegue el mismo día. Live Chat llega al 100 % de los suscriptores Ultra en dispositivos móviles: una conversación de voz en tiempo real con un notebook, en aproximadamente 100 idiomas, basada en los modelos de audio más recientes de Google y con una guía paso a paso que permite usarla casi por completo sin las manos. Unas horas más tarde, las Interactive Learning Overviews concluyen su despliegue gradual y pasan a estar disponibles para todos los usuarios, sin necesidad de suscripción; ubicadas en Reports, reúnen los resúmenes de las fuentes y los artefactos del estudio en un mismo espacio interactivo.

Ambas funciones se habían presentado el 15 de septiembre, en el anuncio de las nuevas herramientas de estudio. Los mensajes del día 21 no añaden ninguna funcionalidad: confirman una disponibilidad real, completa para la primera y abierta a todo el mundo para la segunda.

🔗 Live Chat desplegado al 100 % 🔗 Interactive Learning Overviews disponibles para todos


Google.org destina 4 millones de dólares a la formación de docentes en IA

21 de septiembre — Google.org destina 4 millones de dólares a Digital Promise, anunciados en Nueva York con motivo de la Asamblea General de las Naciones Unidas. La financiación amplía la Google AI Educator Series, una formación gratuita anunciada a principios de año y dirigida a los 6 millones de docentes de educación primaria, secundaria y superior de Estados Unidos. Diseñada junto con ISTE mediante un enfoque en el que docentes forman a otros docentes, se centra en competencias transferibles de una herramienta a otra, en lugar de en un producto concreto, y se realiza mediante módulos al propio ritmo validados con insignias digitales.

Digital Promise interviene en tres ámbitos: adaptar la formación a las agencias educativas estatales y a los distritos escolares, colaborar con redes de community colleges para los docentes de grado y realizar durante dos años un estudio sobre lo que ayuda realmente al profesorado de educación superior, cuyos resultados se publicarán en una guía pública gratuita.

🔗 Google.org y Digital Promise


Runway amplía sus Workflows al compositing, la transparencia y los mapas de profundidad

21 de septiembre — Runway amplía sus Workflows, las secuencias de operaciones que se componen en su aplicación, con cinco componentes orientados a la posproducción: Compositing, Alpha, HDR, Depth Map y RGB Depth. El argumento del anuncio se resume en una frase: crear una parte mayor de la cadena de producción (pipeline) en un mismo lugar, sin tener que recurrir a otra herramienta entre dos etapas. El compositing y la gestión del canal alpha están destinados a ensamblar varias capas de imagen; los mapas de profundidad, en sus dos modalidades, sirven como señal geométrica para controlar efectos que dependen de la distancia a la cámara. El anuncio se hizo en X con una demostración de 31 segundos, sin que hubiera una publicación correspondiente en la página de noticias de Runway en el momento del análisis.

🔗 Workflows ampliados en Runway


NVIDIA presenta DSX Ready, un programa de cualificación para alimentar y refrigerar las fábricas de IA

21 de septiembre — NVIDIA presenta DSX Ready, un programa que cualifica los productos de sus socios según los requisitos de su arquitectura de referencia DSX para fábricas de IA. La observación inicial es muy práctica: el suministro eléctrico, la refrigeración, el agua, el emplazamiento y la red eléctrica determinan hoy lo que un constructor puede desplegar realmente, y un equipo mal adaptado al resto del diseño no transforma la capacidad de computación en una producción útil.

Categoría cualificadaSocios en el lanzamientoProceso de cualificación
Almacenamiento de energía en bateríasHitachi Energy, LG Energy Solution, TeslaPruebas por parte del socio, revisión y aprobación de NVIDIA
Unidades de distribución de refrigeraciónLG Electronics, LiquidStack, VertivConjunto de pruebas de autocualificación

NVIDIA establece un límite explícito sobre el significado de la etiqueta: superar la cualificación no sustituye la ingeniería a nivel del emplazamiento ni implica garantía alguna sobre su estabilidad. Está previsto añadir progresivamente otras categorías relacionadas con la infraestructura y el software.

🔗 NVIDIA DSX Ready


NVIDIA aborda la seguridad de los agentes como un problema de ingeniería, capa por capa

21 de septiembre — NVIDIA publica una postura sobre la seguridad de los sistemas agénticos: es un problema de ingeniería, por lo que requiere requisitos definidos, controles aplicables, responsables designados y pruebas de que las protecciones funcionan. La pila se divide en tres niveles: los modelos aportan las capacidades, los arneses organizan el contexto, las herramientas y los flujos de trabajo, y el entorno de ejecución proporciona la infraestructura donde tienen lugar las acciones; cada uno cuenta con sus propios controles.

El ejemplo elegido es revelador: un agente actualiza la ficha de un cliente, encuentra instrucciones maliciosas en un documento adjunto e intenta exportar los datos a un destino no autorizado. NVIDIA espera entonces una política de red que bloquee la transferencia y registros protegidos que conserven la llamada a la herramienta que se intentó realizar, la decisión de autorización y el resultado. El derecho a actualizar una ficha no se extiende al derecho a exportarla, y un agente puede solicitar acceso sin poder concedérselo nunca a sí mismo. En cuanto a las herramientas, OpenShell aplica las políticas fuera del alcance del agente; Cisco añade DefenseClaw por encima y JFrog verifica las skills a las que accede un agente.

Ese mismo día, una segunda publicación aplica el mismo razonamiento a la IA física y lo vincula con la base Halos; aparece en las noticias breves de más abajo, junto con sus dos proyecciones de mercado.

🔗 Proteger la pila de agentes


Earth-2 asimila las observaciones locales para actualizar las previsiones meteorológicas

21 de septiembre — NVIDIA publica un tutorial sobre las herramientas de asimilación de datos mediante IA de Earth-2, destinadas a los sectores que ya disponen de sus propias mediciones: parques eólicos y solares, radares y sensores locales, y observaciones por satélite. La primera técnica, SDA, se aplica a modelos de difusión como CorrDiff y StormCast: en cada etapa de eliminación de ruido, compara el resultado intermedio con las observaciones y orienta la etapa siguiente, sin necesidad de reentrenamiento.

Técnica medidaAlcance y resoluciónMejora indicada en el ejemplo
CorrDiff-SDAEuropa, de 0,25 grados a 2,2 kmReducción del 54 % del RMSE del viento en estaciones excluidas
StormCast-SDAEstados Unidos continentales, 3 km, inicializado con HRRRReducción del 7,2 % del RMSE del viento en seis pasos temporales
HealDAGlobal, cuadrícula HEALPix de 1 gradoEstado global de la atmósfera estimado en pocos segundos

El interés es ante todo operativo: los análisis numéricos requieren un tiempo de computación considerable y se publican en horarios fijos, mientras que SDA integra observaciones de forma continua y cubre la diferencia con la hora actual. HealDA, por su parte, trata cada flujo como una nube de puntos en el espacio y el tiempo, agregada en la cuadrícula de destino y procesada después por una red troncal (backbone) de tipo vision transformer.

🔗 Asimilación de datos en Earth-2


Multiverse Computing poda los bloques como un vidrio de Ising y gana 23 puntos en MMLU

21 de septiembre — Eliminar bloques completos de transformer es una de las formas menos costosas de acelerar un gran modelo de lenguaje y una de las más drásticas: el modelo se vuelve literalmente más corto, pero eliminar los bloques equivocados hace que se desplome. Multiverse Computing sostiene que la pregunta está mal planteada. Los métodos existentes puntúan cada bloque de forma aislada —magnitud, sensibilidad, block influence—, lo que los autores califican de campo medio, aunque el efecto de eliminar un bloque depende de los que se eliminan al mismo tiempo.

Por tanto, la selección se convierte en un problema de optimización binaria con restricciones que se proyecta sobre un vidrio de Ising: un sistema de espines desordenado, con interacciones de todos con todos y un número fijo de espines orientados hacia arriba. El interés práctico se resume en una frase: la energía de este sistema es un sustituto de bajo coste de la puntuación que obtendrá el modelo podado, lo que permite clasificar un número muy elevado de configuraciones candidatas sin evaluar ninguna de ellas en benchmarks. Con una compresión del 50 % de Llama-3.3-70B-Instruct, los autores afirman obtener casi 23 puntos porcentuales más en MMLU que el mejor método competidor.

🔗 Podar LLMs como un físico


Breves

NVIDIA publicó siete artículos y mensajes el 21 de septiembre: tres se abordan más arriba y los otros cuatro figuran aquí, sin ningún anuncio técnico.

  • NVIDIA pide seguridad en cada capa para la IA física — artículo de posicionamiento respaldado por dos proyecciones de mercado: 49 millones de vehículos autónomos de nivel 3 a 5 instalados de aquí a 2035, según ABI Research, y alrededor de 60 millones de robots industriales desplegados entre 2026 y 2035, según Omdia. Cuatro requisitos de seguridad se vinculan a la base NVIDIA Halos. 🔗 fuente
  • NVIDIA destaca la expansión del ecosistema egipcio de IA — recepción en el Grand Egyptian Museum con un discurso de apertura de Paolo Guglielmini, vicepresidente para EMEA. La entradilla señala principalmente que se están poniendo en marcha fábricas de IA en Sudáfrica, Marruecos y Nigeria. 🔗 fuente
  • NVIDIA enumera cinco empresas que aplican la IA a las energías bajas en carbono — panorama publicado con motivo de la New York Climate Week, desde la aceleración de la fusión hasta la reutilización de baterías recicladas de vehículos eléctricos. ThinkLabs AI desarrolla allí gemelos digitales y agentes sobre CUDA para reducir los plazos de conexión a la red. 🔗 fuente
  • NVIDIA anuncia a los ganadores de los Golden Tickets para GTC Berlin — seis ganadores seleccionados por un jurado para la conferencia del 20 al 22 de octubre de 2026. Ningún contenido técnico. 🔗 fuente
  • Qwen-Image-2.1 disponible desde el primer día mediante vLLM, SGLang, ComfyUI y Hugging Face — SGLang-Diffusion ejecuta el modelo en una sola RTX 4090 de 24 GB con descarga al procesador, para generar una imagen de 1024 por 1024 en 18,7 segundos y con 22,7 GiB ocupados. vLLM lo describe como un transformer de difusión de 7,1 mil millones de parámetros asociado a Qwen3-VL-8B. 🔗 fuente
  • OpenAI Academy añade cuatro itinerarios formativos — Build with AI, Lead AI Adoption, AI for Educators y AI for College Students se suman a Apply AI at Work. Cada curso termina con una evaluación que otorga una insignia; el itinerario para desarrolladores separa el manejo de Codex del desarrollo sobre la API. 🔗 fuente
  • Runway organiza en San Francisco un hackathon en torno a su API — jornada única el 30 de septiembre en el Masonic, paralela al Runway AI Summit, para crear un agente, una aplicación o un flujo de trabajo creativo, sin presentación de diapositivas ni circuito de validación. 🔗 fuente
  • HeyGen destaca Code2Video, un benchmark creado con Google DeepMind y Kaggle — la medición aborda una cuestión distinta de la escritura del código: determinar si ese código produce un vídeo que merezca la pena ver. Publicado como comentario a un mensaje sobre la pila de vídeo agéntica basada en la generación de código. 🔗 fuente
  • Suno muestra efectos sonoros aplicados mediante una simple descripción — demostración de un minuto, desde una saturación cálida hasta un resultado más experimental. No se indica el nombre de la funcionalidad, el plan correspondiente ni un artículo de blog asociado: se trata más de una presentación del producto que de un lanzamiento. 🔗 fuente
  • Demostración en directo de Gemini para compras en Discord — sesión anunciada para el martes 22 de septiembre a las 11:00 PT en el servidor oficial de Discord, dedicada a preparar una compra, comparar opciones y buscar a partir de una foto. Ninguna funcionalidad nueva. 🔗 fuente
  • Together AI y Ollama anuncian una sesión sobre agentes de código abiertos — Parth Sareen por parte de Ollama y Zain Hasan por parte de Together AI dirigirán una sesión sobre la puesta en producción de agentes de código basados en modelos abiertos. El mensaje no indica ni fecha ni lugar. 🔗 fuente
  • Se publican con pesos abiertos dos entrenamientos abandonados de Boris-2 — el primero se estancó en una pérdida de 3,100 tras 30 mil millones de tokens, debido a una incompatibilidad entre los gradientes Muon y AdamW; el segundo se detuvo en torno a los 7 mil millones de tokens. Un relato de fracaso más instructivo que los modelos. 🔗 fuente
  • Un protocolo prerregistrado contra el sesgo direccional de los modelos jueces — la hipótesis es que, en textos narrativos, los errores se inclinan hacia la declaración de un sentimiento en lugar de su codificación. El protocolo se publica antes de cualquier recopilación de datos, junto con el resultado que llevaría a retirar el constructo y un conflicto de intereses declarado por el autor. 🔗 fuente
  • Una reproducción de Jev con componentes abiertos queda 0,6 puntos por debajo — un usuario que afirma no saber programar encarga a Claude Code una jornada de experimentos para reconstruir Jev sobre pilas abiertas que funcionan únicamente con procesador. Ocho enfoques fallidos, que considera más instructivos que el que funcionó. 🔗 fuente
  • Jevini separa el diseño y la ejecución de la decisión — un gran modelo de razonamiento diseña un grafo versionado de juicios tipados, que un pequeño modelo de decisión ejecuta en cada situación nueva. Contenido promocional del proveedor, que debe tratarse como tal. 🔗 fuente
  • Cohere mantiene su comunicación de marca, sin anuncios de producto — un mensaje del 20 de septiembre prolonga la campaña AI for Empowerment reformulando la intención atribuida al cofundador Aidan Gomez, y dos contenidos visuales del día 21 narran la participación de la empresa en el hackathon estudiantil Hack The North, en Waterloo. Ni modelo, ni funcionalidad, ni precio. 🔗 campaña · 🔗 hackathon

Qué significa esto

El día cero se está convirtiendo en la norma de distribución. Grok 4.7 no espera: está disponible en Cursor y GitHub Copilot el día de su anuncio, y Qwen-Image-2.1 estuvo disponible desde su lanzamiento mediante vLLM, SGLang, ComfyUI y Hugging Face. El plazo entre la publicación de un modelo y su disponibilidad en las herramientas cotidianas, que antes se contaba en semanas, tiende a cero: en Cursor, porque el proveedor y el laboratorio pertenecen al mismo grupo desde el 14 de agosto; en otros lugares, porque la integración se prepara antes del anuncio. La pregunta interesante ya no es cuándo llegará un modelo, sino cuánto costará una vez que llegue.

Eso es precisamente lo que cambia la modalidad de facturación de Copilot. Grok 4.7 abandona allí el sistema de multiplicadores de solicitudes para facturarse según la tarifa pública de xAI, en función del uso. Combinado con la activación automática de nuevos modelos, esto traslada una decisión de costes a la administración de la plataforma: no hacer nada equivale a abrir una partida de gasto indexada a la tarifa de un proveedor externo. Por parte de xAI, el argumento es simétrico: los mismos 2 dólares de entrada que Grok 4.6, mejoras reales en Terminal-Bench, pero un puesto por detrás de Fable 5.1 en tareas de código prolongadas. Lo que se vende aquí es una relación precio-rendimiento, no un primer puesto.

En cuanto a los agentes, tres anuncios distantes describen el mismo cambio: el entorno de ejecución deja de ser una caja negra. devin ssh abre la máquina virtual del agente a una sesión interactiva, relore proporciona al agente la memoria de las decisiones pasadas de un repositorio en lugar de limitarse al estado actual del código, Perplexity realiza el postentrenamiento de su modelo en los turnos concretos en los que falló con sus usuarios, y Qwen Code enruta sus herramientas mediante bwrap. NVIDIA aporta el marco teórico de este movimiento al plantear que la seguridad de un agente se determina capa por capa, fuera de su alcance, con registros que sirven como prueba. El agente inspeccionable y el agente restringido son las dos caras de una misma necesidad.

Queda la cuestión que plantea el anuncio de OpenAI sin abordarla. Un modelo interno que resuelve más de cien problemas abiertos en menos de un mes ha dado lugar a una respuesta institucional —un grupo consultivo independiente, no remunerado y libre en sus opiniones— cuyo mandato excluye explícitamente el ritmo de los avances internos, es decir, el propio objeto de la protesta de los 27 medallistas Fields. El contraste con el resto de la jornada resulta instructivo: mientras se debate el ritmo de los resultados espectaculares, una biblioteca de tokenización multiplica su rendimiento por entre 3 y 30 garantizando identificadores idénticos, y un método de compresión toma ideas de los vidrios de espín para ganar 23 puntos en MMLU con una compresión del 50 %. Ese trabajo no ocupa titulares, pero es el que determina cuánto costará la inferencia del mañana.


Fuentes