ai-powered-markdown-translatorArtículo traducido del fr al es con gpt-5.6-sol.
Cincuenta y un anuncios en veinticuatro horas, distribuidos entre nueve ámbitos: la jornada del 25 de agosto es la más intensa de la semana. Destacan cuatro movimientos. OpenAI publica los primeros resultados medidos de Jalapeño, su chip de inferencia propio, e inmediatamente después lanza un hackathon de diez días en torno a WebMCP con Chrome, Cloudflare, Shopify, Vercel, Render y Netlify. Perplexity traslada la totalidad de su agente Computer a la máquina del usuario. IBM abre Granite 4.2, su primera familia de modelos de razonamiento. Y Anthropic unifica la memoria de Claude entre el chat y Cowork, haciéndola legible y modificable archivo por archivo. El resto —WeatherNext Cyclones en servicio en el National Hurricane Center, la Serie B de Stability AI, una veintena de actualizaciones de herramientas— aparece a continuación.
WebMCP: un estándar, su compatibilidad en productos, su uso interno y un concurso para impulsarlo
25 de agosto — OpenAI lanza el WebMCP Challenge, un hackathon de diez días dedicado a un estándar abierto aún experimental que cambia la forma en que los agentes interactúan con la web. El problema que aborda es concreto: hoy en día, un agente que debe realizar una tarea en un sitio tiene que adivinar cómo navegar por una interfaz diseñada para ojos y un ratón. WebMCP invierte la lógica: el propio sitio expone herramientas estructuradas que el agente invoca directamente.
El concurso no es el aspecto más destacable del anuncio. Lo es el alineamiento que revela: Chrome (Google), Cloudflare, Shopify, Vercel, Render y Netlify colaboran con OpenAI en torno al mismo estándar. El jurado da muestra de ello, con Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (equipo Next.js Core, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) y Alex Nahas, creador de MCP-B.
The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.
🇪🇸 El WebMCP Challenge ya está en marcha. Nos hemos asociado con @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render y @Netlify para celebrar un hackathon de diez días. En juego: 35 000 dólares en premios en efectivo, Codex Micro, suscripciones a ChatGPT Pro y otros premios ofrecidos por nuestros socios. — @OpenAIDevs en X
El calendario es ajustado y los criterios de evaluación son explícitos: utilidad, originalidad, ejecución, uso meditado de WebMCP y calidad de la experiencia humano-agente. Las inscripciones y entregas se realizan a través de Devpost. OpenAI también publica aplicaciones de demostración nativas para agentes con el fin de impulsar los proyectos: modelado 3D controlado por el agente, escritura colaborativa en la que el agente comenta con su propia identidad, generador de crucigramas personalizados, Wandernote para transformar notas de viaje en un itinerario y exploración de datos mediante DuckDB-Wasm en el navegador. Se permite partir de una aplicación existente y añadirle WebMCP.
| Elemento del concurso | Detalle anunciado |
|---|---|
| Duración anunciada | 10 días |
| Apertura de las entregas | 25 de agosto de 2026, 12 h PT |
| Fecha límite de entrega | 3 de septiembre de 2026, 13 h PT |
| Anuncio de los ganadores | 23 de septiembre de 2026 (fecha orientativa) |
| Dotación total | 35 000 dólares |
| Premio por ganador (top 10) | 3 000 dólares, un año de ChatGPT Pro, un teclado Codex Micro, artículos promocionales |
| Plataforma de entrega | Devpost |
El componente de producto que permite utilizar el estándar a diario llega el mismo día: el navegador integrado en la aplicación de escritorio ChatGPT y ChatGPT Sites ya puede utilizar WebMCP. Cuando ChatGPT o Codex visita un sitio compatible, el agente detecta las herramientas expuestas por la página y las utiliza automáticamente en lugar de avanzar a tientas por la interfaz; es necesario actualizar la aplicación de escritorio a la versión más reciente. La otra mitad del circuito está en el lado de producción: ahora es posible pedir a Codex que cree una aplicación compatible con WebMCP y que después la despliegue directamente en Sites. Cabe señalar la asimetría de la compatibilidad con Chrome, donde WebMCP permanece detrás de una bandera experimental o una prueba de origen (origin trial), mientras que el navegador de ChatGPT lo gestiona de forma nativa.
Queda el tercer aspecto, el más instructivo: OpenAI documenta su propio uso interno. Un ingeniero de la empresa cuenta cómo dejó de escribir una automatización para cada tarea para construir Runme, una aplicación web de notebooks open source concebida para colaborar con Codex. En ella escribe un objetivo breve con instrucciones explícitas —consultar una ejecución anterior, redactar un plan detallado, esperar la validación antes de empezar, documentar los comandos ejecutados y su interpretación— y Codex lee y actualiza el notebook a medida que avanza el trabajo. Dos decisiones de arquitectura merecen atención. En primer lugar, la persistencia: los notebooks se guardan en Google Drive y Runme genera en paralelo un índice Markdown complementario *.index.md que Drive puede indexar, lo que permite a un agente recuperar una ejecución anterior como contexto operativo. En segundo lugar, la exposición de las capacidades: Runme es una aplicación cliente servida de forma estática, y añadir un servidor únicamente para exponer un punto de acceso MCP clásico habría introducido infraestructura y desplazado el procesamiento de los datos del notebook. WebMCP permite que la aplicación registre sus herramientas directamente desde el navegador.
🔗 WebMCP Challenge · Compatibilidad en ChatGPT para escritorio y Sites · Codex, Runme y WebMCP en OpenAI
Jalapeño: OpenAI publica las primeras cifras de su chip de inferencia y reivindica su estrategia de compute
25 de agosto — OpenAI publica los primeros resultados medidos de Jalapeño, el primer chip de inferencia que ha diseñado internamente. El interés del anuncio no reside únicamente en las mejoras brutas, sino en la naturaleza del compromiso que afirma resolver: los sistemas de inferencia existentes suelen tener que elegir entre rendimiento y latencia, mientras que Jalapeño reivindica ambos en una única arquitectura.
Las mediciones se basan en InferenceX, un benchmark público de SemiAnalysis que simula el procesamiento completo de una solicitud. Se probaron tres modelos abiertos —GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T— frente a sistemas comerciales. La decisión de normalizar por vatio en lugar de por chip es explícita y conveniente: Jalapeño consume la mitad que los sistemas con los que se compara. Jalapeño presenta una potencia anunciada de 700 W, y el consumo sostenido medido se mantuvo en 550 W o menos durante las cargas probadas, frente a los 1 200 W del GB200 y los 1 400 W del GB300.
| Modelo evaluado (sistema comparado) | Rendimiento máximo por kW | Latencia de extremo a extremo | TBT mínimo |
|---|---|---|---|
| GPT-OSS 120B (GB200, 1 200 W) | ≈1,9x (85 448 vs 44 960) | ≈1,7x (1,03 s vs 1,80 s) | ≈2,7x (0,69 vs 1,87 ms) |
| DeepSeek R1 670B (GB300, 1 400 W) | ≈1,7x (19 641 vs 11 781) | ≈3,6x (1,65 s vs 5,99 s) | ≈4,1x (1,43 vs 5,90 ms) |
| Kimi K2.5 1T (GB300, 1 400 W) | ≈1,5x (18 195 vs 11 862) | ≈3,4x (1,56 s vs 5,31 s) | ≈3,8x (1,44 vs 5,48 ms) |
En el conjunto de los tres modelos, OpenAI anuncia entre 1,5 y 1,9 veces más trabajo de IA por vatio con el rendimiento máximo y entre 1,7 y 3,6 veces menos latencia de extremo a extremo que los sistemas de comparación, así como un rendimiento hasta 2,1 a 4,1 veces mayor en cargas altamente interactivas. Técnicamente, las mejoras proceden de un codiseño del chip, la memoria, la red, el software y el sistema a escala de rack. La inferencia atraviesa dos fases con cuellos de botella distintos: el prellenado (prefill), que procesa el prompt y satura la capacidad de cálculo, y la generación (decode), que produce los tokens uno por uno y depende principalmente del ancho de banda de la memoria. Jalapeño busca minimizar los movimientos de datos: el estado del modelo —incluida la caché KV— puede ubicarse explícitamente y mantenerse en local mientras el sistema activa la combinación adecuada de cálculo, memoria y red según la fase.
El aspecto más interesante para un desarrollador se refiere al papel de la IA en el diseño del propio chip. OpenAI señala que pasó del diseño inicial a la fabricación (tapeout) en nueve meses, acortando los ciclos de diseño, medición y verificación. El chip fue concebido como un objetivo de programación predecible tanto para la IA como para los humanos: trabajo descrito mediante tensores locales, comunicación explícita y sincronización predecible. Con Codex y GPT-Astra, el equipo portó en dos meses tres modelos de pesos abiertos que no figuraban en el plan de producción inicial y, en bloques seleccionados de atención y mixture-of-experts de GPT-OSS, los kernels generados por IA funcionan entre 1,5 y 1,8 veces más rápido que las implementaciones escritas por expertos humanos. Conviene conservar el matiz: estas cifras corresponden a los bloques seleccionados, no al modelo completo. El calendario sigue siendo prudente: la cualificación para producción está en curso, el software debe madurar, el despliegue en la infraestructura de OpenAI está anunciado para finales de año, Gen 2 se encuentra en una fase avanzada de desarrollo y Gen 3 empieza a tomar forma.
Ese mismo día, Sarah Friar publica la entrada que explica la lógica económica detrás de todo ello. En ella reivindica una amplia cartera de compute —con Microsoft y NVIDIA como base, complementados por AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy y SoftBank— con un argumento tanto comercial como técnico: preservar una capacidad real de elección entre proveedores permite dirigir cada carga de trabajo hacia la mejor relación rendimiento-precio y mantener la disciplina de precios. Una cifra concreta acompaña el argumento: en el Artificial Analysis Coding Agent Index, GPT-5.6 Sol con razonamiento máximo alcanza un nuevo récord mientras consume un 54 % menos de tokens de salida que otro modelo líder. Por último, el texto asume la paradoja de Jevons: abaratar la inteligencia no reduce su consumo, sino que amplía el abanico de usos rentables. En cuanto a la infraestructura, Project Camellia en Georgia se presenta con un circuito cerrado de agua y compromisos sometidos a una auditoría pública independiente anual. OpenAI precisa que seguirá desplegando ampliamente los aceleradores de NVIDIA y de sus demás socios, tanto para el entrenamiento como para la inferencia.
🔗 Jalapeño — primeros resultados · La pila completa detrás de una inteligencia abundante
Perplexity Portable Computer: todo se ejecuta en la máquina, con benchmarks que lo respaldan
25 de agosto — Perplexity lanza Portable Computer, una versión de su agente Computer que se ejecuta íntegramente en la máquina del usuario. El cambio es más arquitectónico que cosmético: no es solo el modelo lo que funciona localmente, sino toda la cadena de orquestación —orquestador, planificador, router de herramientas, programador, cola de tareas persistente e índice de búsqueda local—.
Today we’re launching Portable Computer on @NVIDIA DGX Spark.
Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.
🇪🇸 Hoy lanzamos Portable Computer en el @NVIDIA DGX Spark. Portable Computer es una versión completamente local de Perplexity Computer, en la que todo el entorno de ejecución —el LLM orquestador, el LLM de los subagentes y el arnés del agente— funciona en su hardware local. Sin ninguna dependencia de la nube. — @perplexity_ai en X
El anuncio se realiza conjuntamente con NVIDIA y se dirige inicialmente al DGX Spark —plataforma Grace Blackwell GB10, CPU Arm de 20 núcleos, GPU NVIDIA y 128 GB de memoria unificada—, con una ampliación anunciada a los PC equipados con GPU RTX. Se ofrecen dos modelos a elegir, Qwen 3.8 27B o PPLX 27B, la versión del modelo Qwen posentrenada por Perplexity, y NVIDIA Nemotron 3.5 Lightning, un modelo abierto de 30B, se incorporará al selector. El trabajo procesado localmente no consume ningún crédito. La escalada a la nube sigue siendo posible —información actualizada, navegador, aplicaciones conectadas o cualquiera de los más de 15 modelos frontier—, pero requiere la autorización explícita del usuario. Los conectores de Google Drive, Gmail, Slack y GitHub funcionan desde el dispositivo, el dictado se ejecuta localmente mediante NVIDIA Nemotron 3.5 ASR Model sin que el audio salga de la máquina y el código se ejecuta en un entorno aislado (sandbox). Portable Computer está reservado para los suscriptores Pro y Max que dispongan de un DGX Spark, primero en Linux y después en Windows, con instalación en un clic desde la aplicación.
Ese mismo día, el equipo de ingeniería publica las cifras que documentan este lanzamiento. La tesis es que el modelo y el arnés (harness) deben diseñarse conjuntamente: los arneses genéricos presuponen un modelo frontier capaz de asimilar contextos largos y planificar a largo plazo, algo que los modelos locales gestionan mal.
| Benchmark medido | Computer (Qwen 3.8 27B) | Pi | Hermes | Computer + PPLX 27B |
|---|---|---|---|---|
| Local Knowledge Work Bench (53 tareas) | 82,6 % | 77,6 % | 74,0 % | 85,4 % |
| BrowseComp (1 266 tareas) | 66,7 % | 50,2 % | 43,9 % | — |
| ParseBench-100 (documentos multimodales) | 65,1 % | 13,9 % | 34,6 % | — |
En BrowseComp, Computer consume además un 61 % menos de tiempo y un 16 % menos de tokens que Hermes, y un 51 % menos de tiempo y un 70 % menos de tokens que Pi. Cuatro decisiones de diseño explican la diferencia: un prompt de sistema mínimo, capacidades modularizadas en skills que se cargan y descargan a lo largo de la trayectoria, conectores muy utilizados (Gmail, GitHub, Outlook, Google Calendar) convertidos en herramientas compactas de línea de comandos en vez de exponerse como servidores MCP cuyas definiciones devoran el contexto, y un entorno aislado siempre activo y no configurable; si no está disponible, el arnés se desactiva antes de cualquier llamada a una herramienta en vez de pasar a una ejecución no aislada. Perplexity también señala una observación práctica útil: Qwen 3.8 27B anuncia una ventana de 260K tokens, pero empíricamente comienza a tener dificultades por encima de 100K.
| Terminal Bench 2.1 (89 tareas) | Puntuación | Coste de API por ejecución |
|---|---|---|
| Qwen 3.8 27B, 100 % local | 59,6 % | aproximadamente 0 |
| Qwen 3.8 27B + asesoría Claude Opus 5 | 73,0 % | 0,415 USD |
| Solo Claude Opus 5 | 82,4 % | 0,65 USD |
El mecanismo de escalada a un modelo asesor (advisor) es el punto más interesante del informe: recupera aproximadamente tres quintas partes de la diferencia respecto al frontier por alrededor de dos tercios de su coste, y la decisión permanece en manos del usuario. Antes de cada llamada, el arnés selecciona el contexto pertinente, aplica un clasificador de datos personales y muestra al usuario qué información saldría del dispositivo; el modelo asesor solo devuelve texto y no tiene acceso directo a los archivos ni a las herramientas. Por último, el posentrenamiento de PPLX 27B combina un ajuste por rechazo (rejection fine-tuning) seguido de aprendizaje por refuerzo en entornos sintéticos ejecutados en contenedores Docker, sin ningún dato real de usuarios. Se anuncian un informe técnico y la publicación como open source del benchmark de evaluación.
🔗 Benchmarks del arnés local · Portable Computer — artículo de Perplexity
Claude: una única memoria entre el chat y Cowork, legible archivo por archivo
25 de agosto — Anthropic elimina la frontera entre dos memorias que hasta ahora coexistían. Lo que Claude recuerda de sus conversaciones en el chat es ahora exactamente lo mismo de lo que dispone en Claude Cowork, y también a la inversa. En la práctica, cuando Cowork ejecuta una tarea en la nube, comienza con el contexto acumulado durante meses: las prioridades del trimestre, el estado de avance de los proyectos y las preferencias de redacción de un interlocutor. Anthropic ofrece ejemplos deliberadamente cotidianos, como pedir una actualización para su responsable sin tener que especificar de quién se trata ni cómo prefiere recibir la información.
El segundo cambio es más discreto, pero modifica el comportamiento diario: la memoria se actualiza a medida que avanza la conversación, en lugar de hacerlo mediante un resumen generado posteriormente. Mencionar que un plazo se aplaza hasta septiembre basta para que la siguiente conversación lo tenga en cuenta. La fórmula «recuerda esto» sigue disponible para forzar el almacenamiento de un elemento concreto, y la memoria puede pausarse o restablecerse en cualquier momento.
En cuanto a la transparencia, Anthropic ha elegido una representación legible en lugar de una caja negra: todo lo que Claude recuerda aparece en forma de archivos cortos, clasificados por tema, en Ajustes y después Memoria. Cada uno puede leerse, corregirse o eliminarse. La utilidad práctica es inmediata: basta con corregir el antiguo nombre de su empresa en un solo archivo para que todas las conversaciones posteriores utilicen el correcto.
El tratamiento de los temas sensibles es el punto más interesante desde la perspectiva de las decisiones de producto. De forma predeterminada, Claude no memoriza información relacionada con la salud, el origen, la etnia, las creencias religiosas, las opiniones políticas o la identidad de género. Sin embargo, Anthropic reconoce que el límite es personal y ofrece un ajuste opcional para incluir estos temas, lo que permite que Claude recuerde una intolerancia al gluten cuando proponga recetas. Este ajuste no es retroactivo y puede desactivarse en cualquier momento. Una categoría permanece excluida independientemente del ajuste: números de identificación, antecedentes judiciales, situación migratoria y, en términos más generales, todo aquello que contravenga la Política de uso aceptable. Claude indica explícitamente cuándo no puede guardar información de este tipo, una decisión de diseño que prioriza el rechazo visible frente al filtrado silencioso.
| Aspecto de la memoria | Comportamiento descrito |
|---|---|
| Alcance | Memoria única compartida entre el chat y Claude Cowork |
| Momento de la actualización | Durante la conversación, frente al resumen posterior que se utilizaba antes |
| Formato de almacenamiento | Archivos cortos clasificados por tema, legibles y modificables individualmente |
| Temas sensibles | No se memorizan por defecto; pueden activarse mediante un ajuste, sin retroactividad |
| Exclusiones permanentes | Números de identificación, antecedentes judiciales y situación migratoria |
| Planes Free, Pro y Max | Memoria activa por defecto en la web, el escritorio y el móvil |
| Planes Team y Enterprise | Habilitada por el administrador y desactivada por usuario hasta su activación |
🔗 La memoria de Claude funciona en todas partes · Anuncio de @claudeai
IBM publica Granite 4.2, su primera familia de razonamiento, y dos modelos ASR de 470M
25 de agosto — IBM publica Granite 4.2, presentada como su primera familia de modelos de lenguaje densos, solo decodificador, diseñados explícitamente para el razonamiento. Mientras que las generaciones anteriores buscaban la eficiencia y las tareas empresariales clásicas, esta versión sitúa el razonamiento en el centro y permite modularlo: cada modelo ofrece tres modos —thinking, non-thinking y low-effort— que la aplicación elige según el presupuesto de latencia y tokens que esté dispuesta a asumir. Los tres tamaños (3B, 8B y 30B) comparten la misma arquitectura y el mismo pipeline, lo que facilita la integración al pasar de uno a otro.
La arquitectura sigue siendo clásica: atención GQA con 40 cabezas para 8 cabezas KV, RoPE con un θ de 10 millones para admitir los 131 072 tokens de contexto, MLP SwiGLU, normalización RMSNorm y entrenamiento en bfloat16 sobre un clúster NVIDIA GB200 NVL72 alojado por CoreWeave. El preentrenamiento parte de cero con unos 15 billones de tokens distribuidos en cinco fases. Lo que realmente distingue a Granite 4.2 es el posentrenamiento: un pipeline de refuerzo compuesto por una cadena de etapas especializadas, en lugar de una única pasada, mediante GRPO asíncrono con muestreo de importancia truncado, de modo que las mitades de generación y entrenamiento del bucle nunca se bloquean mutuamente. El programa encadena tres pasadas de RLVR con recompensas verificables, amplificadores centrados en el seguimiento de instrucciones y el código, dos etapas de software engineering con contexto de 128K, una etapa de terminal, una etapa de búsqueda y, finalmente, la alineación RLHF. El bloque de refuerzo agéntico solo se aplica a los modelos 8B y 30B, lo que explica la diferencia de rendimiento en programación agéntica entre el 3B y sus hermanos mayores.
| Benchmark publicado por IBM | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| SWE-Bench Verified | — | 47,67 | 57,00 |
| SWE-Bench Multilingual | — | 30,78 | 41,89 |
| Terminal-Bench 2.1 | — | 20,56 | 29,24 |
| τ³-bench | 45,78 | 58,06 | 62,00 |
| AIME25 | 78,33 | 86,67 | 89,17 |
| GPQA | 54,80 | 64,14 | 66,41 |
| LiveCodeBench v6 | 69,71 | 73,24 | 75,77 |
| MMLU-Pro | 67,84 | 74,04 | 77,60 |
| RULER 128K | 55,30 | 71,41 | 81,38 |
La publicación no se limita a los pesos bfloat16: el lanzamiento incluye cuatro variantes cuantizadas para vLLM —FP8 dinámico por canal sin calibración, NVFP4 y MXFP4 mediante GPTQ calibrado con 2 000 muestras SFT—, así como catorce formatos GGUF para llama.cpp, desde Q2_K hasta Q8_0. Se admiten doce idiomas, entre ellos el francés, y desde el primer día se documentan tres arneses de programación agéntica: OpenCode, Pi y OpenHands. En cuanto a la calidad de los datos, IBM detalla una cadena en la que GPT-OSS-120B y Gemma 4 actúan como jueces para puntuar las muestras SFT, antes de una deduplicación local y global mediante hash SHA-256.
Ese mismo día, IBM publica Granite Speech 5.0 Turbo CTC, dos modelos de reconocimiento de voz en inglés con 470 millones de parámetros que solo se diferencian por sus datos de entrenamiento y su licencia —Apache 2.0 para la variante estándar y CC-BY-NC-SA-4.0 para la variante entrenada con datos adicionales—. El cambio de arquitectura es notable: los Granite Speech anteriores combinaban un codificador acústico, un proyector y un LLM; estos modelos son solo codificador. La pila combina 16 bloques Conformer, aplica autoacondicionamiento a la salida del octavo bloque, sustituye la atención de producto escalar por atención por bloques (chunkwise) para evitar el escalado cuadrático y optimiza directamente la pérdida CTC. La verdadera novedad es la tasa de tokens: las operaciones de submuestreo reducen el flujo de 100 tramas por segundo a la salida del espectrograma log-Mel a 12,5 por segundo, lo que explica el «Turbo» del nombre. Los resultados se presentan en el OpenASR Leaderboard y el FFASR Leaderboard para campo lejano, con gráficos de Pareto de velocidad y precisión en lugar de puntuaciones aisladas, y una demostración de reconocimiento continuo ejecutada en el navegador mediante WebGPU, limitada a Chrome y Edge.
🔗 Granite 4.2 — recorrido técnico · Granite Speech 5.0 Turbo CTC
WeatherNext Cyclones, primer modelo de IA utilizado en tiempo real por el National Hurricane Center
25 de agosto — Google AI presenta en detalle WeatherNext Cyclones, un modelo de predicción de ciclones tropicales desarrollado por Google DeepMind y Google Research. El anuncio destaca menos por el rendimiento bruto que por lo que revela sobre el paso de la IA meteorológica del laboratorio a las operaciones reales.
El problema abordado es estructural. Hasta ahora, seguir un ciclón exigía una disyuntiva: los modelos físicos ejecutados en supercomputadoras capturan bien las grandes estructuras atmosféricas que recorren el planeta, pero comprender la física local e intensa que determina la fuerza de una tormenta obligaba a cambiar a modelos regionales completamente distintos. WeatherNext Cyclones elimina este ir y venir al predecir de una sola vez la trayectoria, la intensidad y el tamaño.
La mejora anunciada supone un día completo adicional de antelación respecto a los sistemas anteriores. Google formula la comparación de manera ilustrativa: las previsiones a tres días alcanzan ahora la precisión de las antiguas previsiones a dos días, un avance que históricamente requería una década de progresos metodológicos. La segunda contribución es probabilística: el modelo es lo bastante rápido como para producir hasta 1.000 simulaciones por tormenta, sustituyendo la trayectoria única «más probable» por un abanico de escenarios. Esto permite interpretar mejor la intensificación rápida, definida como un aumento de los vientos máximos sostenidos de al menos 30 nudos en 24 horas. Este año se proporcionan a los meteorólogos 1.000 predicciones probabilísticas por tormenta mediante WeatherLab.
El aspecto más significativo sigue siendo su despliegue real. Durante la temporada de huracanes de 2025, WeatherNext Cyclones se puso a prueba en el National Hurricane Center estadounidense: la primera vez que esta institución utiliza modelos de IA en operaciones en tiempo real. Los meteorólogos lo utilizaron para elaborar la previsión del impacto en tierra del huracán Melissa, de categoría 5, en Jamaica, dando a las autoridades locales tiempo adicional para prepararse. Se ha publicado un artículo en Nature y Google anuncia que publicará el código y los pesos del modelo como open source en GitHub.
| Aspecto del modelo | Aportación de WeatherNext Cyclones |
|---|---|
| Magnitudes predichas | Trayectoria, intensidad y tamaño en una sola pasada |
| Mejora en la antelación | Un día; previsión a 3 días = precisión de la antigua a 2 días |
| Simulaciones por tormenta | Hasta 1.000 |
| Despliegue operativo | U.S. National Hurricane Center, temporada de huracanes de 2025 |
| Caso de uso documentado | Impacto en tierra del huracán Melissa, de categoría 5, en Jamaica |
| Umbral de intensificación | Más de 30 nudos de vientos máximos sostenidos en 24 horas |
| Modalidades de disponibilidad | WeatherLab; código y pesos como open source en GitHub |
🔗 Anuncio de @GoogleAI · Publicación de Google DeepMind
Stability AI cierra una Serie B de 76 millones de dólares con EA, Sony Music, Universal y Warner
25 de agosto — Stability AI anuncia el cierre de su Serie B: 76 millones de dólares de capital nuevo, que elevan la financiación total a 232 millones desde que Prem Akkaraju tomó las riendas de la empresa en junio de 2024, incluidas dos rondas de capital y obligaciones convertibles. El importe sigue siendo modesto a escala del sector, pero la composición de la ronda es el verdadero tema de interés.
Cuatro pesos pesados del entretenimiento entran en el capital: Electronic Arts en videojuegos y Sony Music Group, Universal Music Group y Warner Music Group en música. Las tres grandes discográficas son ahora accionistas del mismo laboratorio. A ellas se suman AMD Ventures y Pacific Alliance Ventures. Estos inversores no aparecen de la nada: EA, Universal y Warner ya eran socios estratégicos de Stability AI desde el otoño de 2025. La ronda transforma así acuerdos comerciales existentes en participaciones de capital.
La otra señal reside en la fidelidad de los inversores financieros. Coatue, Greycroft, Kadmos Capital, Sean Parker y Eric Schmidt vuelven a aportar fondos por segunda ronda consecutiva bajo la nueva dirección, lo que, tras el turbulento periodo que atravesó Stability AI en 2023 y 2024, supone una confirmación. Thomas Laffont, cofundador de Coatue, se incorpora al consejo de administración, en el que ya participan James Cameron, Sean Parker, Dana Settle y Prem Akkaraju.
This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.
🇪🇸 Este grupo de inversores sin parangón confirma nuestra visión: una IA generativa que proporciona herramientas a cada productor, músico y narrador. Stability es única en el ámbito de la IA porque somos creativos que fabricamos herramientas para creativos. — Prem Akkaraju, CEO de Stability AI, comunicado del 25 de agosto
La estrategia declarada es la de un laboratorio de nicho: no un modelo generalista, sino herramientas para los profesionales de la creación, desarrolladas con los titulares de derechos en vez de contra ellos. Es exactamente el enfoque de Stable Audio 3.0, una familia de modelos de pesos abiertos entrenada con datos íntegramente licenciados, ampliada el 18 de agosto con un plugin para estaciones de trabajo de audio. El dinero debe financiar la evolución de los productos, la investigación aplicada y el área de servicios profesionales.
ChatGPT para empresas: plugin Admin, extensión para varios navegadores y puesto Premium de 100 dólares
25 de agosto — Tres anuncios de OpenAI convergen en el mismo público: las organizaciones que despliegan ChatGPT y Codex a escala.
El más sustancial es el plugin Admin para ChatGPT Work y Codex, que reúne en una conversación lo que hasta ahora obligaba a navegar entre paneles de analytics, pantallas de configuración e informes. Su alcance abarca las tareas cotidianas: comprender la adopción y el consumo de créditos, detectar a los miembros o grupos próximos a sus límites, gestionar altas y bajas, examinar los permisos efectivos y diagnosticar problemas de acceso, ajustar los límites de uso y resolver las solicitudes de gasto comparándolas con el consumo real. La parte más interesante es la automatización sin escribir código: las solicitudes de uso pendientes pueden dirigirse a Slack o Microsoft Teams para su aprobación en la herramienta que ya utilizan los responsables, y las solicitudes de acceso a una funcionalidad pueden concederse automáticamente cuando cumplen criterios predefinidos, mientras que las excepciones se remiten a una persona. Un aspecto fundamental en materia de seguridad: el plugin opera dentro del rol y de los permisos existentes del usuario y no amplía ningún acceso; cada instrucción se asigna a una acción de lectura o escritura compatible con un resultado estructurado. OpenAI menciona su propio uso: un agente de ChatGPT Work en Slack procesa las solicitudes internas de TI, y los flujos de trabajo desplegados resuelven aproximadamente el 45 % del volumen de tickets, eliminando el backlog pese a que el volumen de soporte prácticamente se había duplicado.
El segundo anuncio es que la extensión de navegador de ChatGPT sale del ámbito de Chrome y pasa a ser compatible con Microsoft Edge, Brave, Opera y Vivaldi. El cambio es importante para quienes trabajan en un navegador alternativo por motivos de privacidad o por restricciones empresariales. Se destacan dos usos: incorporar el contexto de las pestañas abiertas a una tarea mediante la mención @ tab en ChatGPT Desktop, de modo que Codex trabaje a partir de la documentación o del ticket ya mostrados; y permitir que el agente controle el navegador para ejecutar tareas web concretas, con la cancelación de suscripciones entre los ejemplos proporcionados.
El tercer anuncio, más escueto: un puesto Premium de 100 dólares se incorpora a la oferta ChatGPT Business, orientado a pequeñas empresas y startups con un plan presentado como flexible y escalable según el tamaño del equipo. El anuncio se hizo en X sin una publicación detallada en el blog, y el mensaje no precisa la composición exacta del puesto.
🔗 Plugin Admin · Extensión para varios navegadores · Puesto Premium de ChatGPT Business
NVIDIA: Gamescom para RTX Spark y SANA reduce 27 veces la latencia de MiniMax H3
25 de agosto — NVIDIA aprovecha la Gamescom, que se celebra esta semana en Colonia, para ampliar el catálogo de RTX Spark, su plataforma para PC con Windows prevista para este otoño. Electronic Arts, Embark Studios y Ubisoft se suman a KRAFTON, NetEase, Riot Games y XBOX, que ya se habían comprometido durante COMPUTEX en mayo. Los títulos mencionados abarcan requisitos técnicos variados: EA SPORTS F1 25 y Apex Legends por parte de EA, Anno 117: Pax Romana de Ubisoft, y ARC Raiders y THE FINALS de Embark Studios.
El aspecto más concreto se refiere al sistema antitrampas. Ejecutar un juego no basta: los grandes títulos en línea dependen de sistemas antitrampas que deben adaptarse a cada plataforma, pues de lo contrario el juego no puede utilizarse en modo multijugador. NVIDIA anuncia que trabaja con EA para llevar EA Javelin Anticheat de forma nativa a RTX Spark, el tipo de detalle de infraestructura que determina la adopción real de una nueva plataforma para PC. En cuanto al renderizado, DLSS 4.5 Ray Reconstruction está disponible de inmediato, con un modelo transformer de segunda generación que sustituye los reductores de ruido clásicos por una red entrenada en una supercomputadora. El path tracing llega a CONTROL Resonant y 007 First Light, Gears of War: E-Day integra RTX Mega Geometry y se anuncia la llegada de las tecnologías NVIDIA ACE a Aniimo a principios de 2027.
La otra faceta de la misma empresa, el 24 de agosto, es más técnica. MiniMax difunde los resultados obtenidos por el equipo SANA de NVIDIA con Sol Engine aplicado a su modelo de vídeo H3: diez segundos de vídeo en 768p generados en un único GB200 pasan de 414 segundos a 14,93 segundos, lo que supone una aceleración de 27,7 veces. El método no se basa en optimizar kernels, sino en dividir la generación en dos pasadas: un borrador de baja resolución producido por H3 en 4 pasos y después una pasada de refinamiento a la resolución objetivo realizada por LTX en 3 pasos con Sol-Attn. Siete pasos en total. Como segunda medida, las costosas decodificaciones VAE se sustituyen por TAEH3 y TAEHV, decodificadores ligeros, manteniendo al mismo tiempo estables los latentes para la pasada de refinamiento.
| Medición en MiniMax H3 | Valor medido |
|---|---|
| Carga medida | 10 s de vídeo en 768p, un único GB200 |
| Latencia anterior | 414 s |
| Latencia posterior | 14,93 s |
| Factor de aceleración | 27,7x |
| Pasos de generación | 4 (borrador H3 de baja resolución) + 3 (LTX) |
| Decodificadores sustituidos | TAEH3 y TAEHV en sustitución de las decodificaciones VAE |
| Rendimiento estimado por nodo | 378.000 vídeos al mes, más de un 97 % de margen de GPU |
El rendimiento proyectado es una estimación de MiniMax, no una medición en producción, y merece interpretarse como tal. Pero la dirección está clara: con quince segundos para generar diez segundos de vídeo, la generación de vídeo de alta fidelidad abandona el renderizado por lotes asíncrono para acercarse a una infraestructura casi interactiva.
🔗 NVIDIA en la Gamescom · SANA y Sol Engine en H3
Los modelos abiertos chinos se convierten en la referencia de la investigación y Qwen3.8-27B entra en el top 10 de Code Arena
25 de agosto — Qwen difunde dos resultados la misma mañana, y el segundo da sentido al primero.
El primero es una clasificación. Qwen3.8-27B entra en la clasificación Code Arena: WebDev, que evalúa los modelos en la generación de interfaces web, en el 9.º puesto general con 1595 puntos. Es el único modelo de su categoría de tamaño en el top 10 y se encuentra solo seis puestos por detrás de Qwen3.8-Max, mucho más grande. Arena destaca que redefine la frontera de Pareto de la clasificación y proporciona una referencia ilustrativa: Gemma 4-31B, de tamaño comparable pero publicado en abril, ocupa el 80.º puesto.
| Modelo evaluado | Posición en Code Arena: WebDev | Puntos obtenidos | Observación de la clasificación |
|---|---|---|---|
| GLM-5.3 (Max) | 8.º en la clasificación general | 1597 | Registro del 20 de agosto, 2.º entre los modelos abiertos |
| Qwen3.8-27B | 9.º en la clasificación general | 1595 | Único modelo de su tamaño en el top 10 |
| Qwen3.8-Max | Seis puestos por delante del 27B | n.d. | Modelo mucho más grande de la misma familia |
| Gemma 4-31B | 80.º en la clasificación general | n.d. | Publicado en abril de 2026 |
El segundo resultado es una medición de uso. Nathan Lambert, que codirigió el proyecto Olmo en Ai2, encargó a Codex el análisis de 500.000 artículos de arXiv sobre IA y aprendizaje automático publicados desde el lanzamiento de ChatGPT, con el fin de identificar los modelos abiertos utilizados realmente en la investigación. El vuelco se resume en dos cifras: en 2024, aproximadamente el 30 % de los artículos mencionaba un modelo abierto estadounidense, frente al 10 % que mencionaba uno chino; hoy, cerca del 40 % cita un LLM abierto chino y solo entre el 25 y el 30 % uno estadounidense.
| Familia de modelos | Porcentaje de artículos que citan un LLM |
|---|---|
| OpenAI (modelos cerrados) | aproximadamente 37 % |
| Qwen | aproximadamente 33 % |
| Gemini, Claude | entre 10 y 15 % |
| Gemma, Mistral | entre 5 y 10 % |
| Olmo | aproximadamente 1 % |
En detalle, Qwen se menciona en un tercio de los artículos que citan algún LLM. Llama alcanzó su máximo hacia abril de 2025, con un 30 %, justo cuando se lanzó Llama 4, y desde entonces está retrocediendo. El propio Lambert señala una limitación importante: las publicaciones van por detrás de los lanzamientos de modelos porque la investigación requiere tiempo; estas cifras describen el estado de los trabajos en curso más que las preferencias del momento. En paralelo puede observarse una tendencia de fondo distinta de la pugna entre modelos abiertos y cerrados: la proporción de artículos de IA que mencionan un LLM pasó del 10,43 % en enero de 2023 a más del 50 % en 2026.
🔗 Qwen3.8-27B en Code Arena · Difusión por Qwen del análisis de arXiv · Análisis de @natolambert
Claude Code pasa a la versión 2.1.245, y la renderización de Claude en la web se vuelve 4 veces más fluida
Se publicaron dos versiones de Claude Code durante este periodo, y su contenido está claramente orientado a los despliegues en organizaciones. El CHANGELOG no incluye fechas, pero el historial de Git permite situarlas: la 2.1.243 aparece en el commit del 24 de agosto a las 23:40 UTC y la 2.1.245, en el del 25 de agosto a las 05:13 UTC.
| Configuración añadida | Versión afectada | Utilidad práctica |
|---|---|---|
modelPricing | 2.1.243 | Tarifas contractuales en /cost, la barra de estado y la telemetría |
modelPicker | 2.1.243 | Lista de modelos ordenada y etiquetada para /model |
promptCacheTtl / subagentPromptCacheTtl | 2.1.243 | Caché de prompt de una hora para la conversación, 5 min para los subagentes |
Desglose Loops en /usage | 2.1.243 | Detectar las tareas /loop que se desvían |
| Inicio de sesión sin clave mediante Console | 2.1.243 | Organizaciones que prohíben las claves de API |
| Corrección para glibc 2.44 | 2.1.245 | Fallo al iniciar en Arch Linux, CachyOS y Fedora Rawhide |
La configuración más estructural es modelPricing: hasta ahora, los costes mostrados se calculaban según la tarifa pública; una organización puede ahora introducir sus tarifas contractuales por modelo y su coeficiente de descuento, lo que permite utilizar las cifras directamente para la facturación interna. La combinación de promptCacheTtl y subagentPromptCacheTtl aborda un compromiso económico concreto para quienes utilizan una clave de API: mantener una caché de una hora en la conversación principal, donde el contexto permanece estable, y dejar la de los subagentes en cinco minutos, ya que sus contextos son más volátiles. En cuanto a las correcciones, los servidores MCP remotos en modo no interactivo ya no se quedan bloqueados después de una desconexión, /resume ya no se limita a las cincuenta sesiones más recientes y las sesiones sin actividad durante más de diez minutos ahora expiran al cabo de unos tres minutos antes de volver a intentarlo y mostrar un error explícito.
El 24 de agosto, Anthropic anunció además que había reescrito el motor que muestra las respuestas mientras se generan en Claude para la web y escritorio. El principio es habitual en la renderización de interfaces: modificar únicamente lo que todavía está cambiando, en vez de volver a dibujar toda la respuesta con cada nuevo fragmento. En una respuesta larga, la diferencia es estructural: el coste de renderización deja de crecer con la longitud del texto ya mostrado. Las mejoras anunciadas son coherentes: aproximadamente 4 veces más fluidez, 9 veces menos bloqueos en un portátil poco potente, una congelación máxima de la interfaz 4,5 veces más breve y 120 imágenes por segundo sostenidas de principio a fin en un MacBook de 120 Hz. El detalle interesante es el público beneficiado: las configuraciones modestas son las que más ganan.
🔗 CHANGELOG de Claude Code · Renderización 4 veces más fluida, @ClaudeDevs
Los agentes de código se industrializan: Warp publica el formato de sus factories y Rohlik hace que agentes escriban el 90 % de su código
24 de agosto, al final del día — Warp muestra el funcionamiento interno de Warp Factories, su plataforma de agentes en la nube anunciada el 18 de agosto: el formato de configuración elegido y la apertura de un acceso anticipado. El punto de partida se reconoce abiertamente: Warp está trasladando sus propios agentes fuera de las máquinas locales por motivos de calidad y coste, y necesitaba describir los entornos, harnesses y permisos de seguridad como código versionado.
| Elemento de configuración | Valor elegido |
|---|---|
| Archivo de definición | factory.yaml, schemaVersion: v1alpha1 |
| Claves principales | name, repositories (owner / name), agentDefaults.model |
| Definición de un agente | agents/<nom>/agent.md con agentType (FOREMAN, REVIEW…) y model |
| Desencadenadores | automations/<nom>/automation.md: agent, triggers (proveedor, evento) |
| Interfaces disponibles | CLI (warp agent run-cloud), API REST, SDK TypeScript, servidor MCP |
| Acceso anticipado | Hasta 10 000 USD de uso gratuito para clientes que cumplan los requisitos |
La separación es interesante: los agentes no se describen en un único YAML, sino en archivos Markdown específicos, de modo que la definición de un agente se convierte en un documento legible y comparable mediante diff. Warp aplica la fórmula a sí misma: su factory interna, denominada «wilson», abarca repositorios como warp-server o warp-terraform, declara sus secretos y sus servidores MCP y organiza sus agentes por función (code-review, foreman, implementation, spec, triage) en 34 líneas. Las cifras presentadas en la página de solicitud de acceso son argumentos comerciales que no pueden verificarse desde el exterior: 200 000 ejecuciones de agentes al día, más del 30 % de las pull requests fusionadas sin modificaciones y un 20 % menos de coste por pull request.
El 25 de agosto, Cognition publicó por su parte un estudio de caso mucho más documentado que el anterior. Rohlik Group es un distribuidor de alimentación en línea nacido en la República Checa, presente en cinco países, rentable y con más de 1 300 millones de dólares de facturación el año pasado; entrega una compra semanal completa de 17 000 productos en menos de una hora o en franjas de quince minutos. La cifra que vertebra el artículo: actualmente, alrededor del 90 % del código se genera mediante agentes, y la organización de ingeniería se describe como «agent-mostly».
No es un resultado obtenido simplemente conectando una herramienta. Rohlik afirma que comenzó hace un año, con una primera experiencia con Devin que consideró plagada de errores. Lo que cambió la situación fueron los cimientos establecidos por el cliente: más de cincuenta integraciones MCP internas y externas, con el principio de que toda herramienta nueva debe ser accesible para los agentes desde el primer día; una capa semántica sobre el almacén de datos Snowflake; y una base de conocimientos que proporciona a los agentes el contexto que se transmitiría a un compañero nuevo. El trabajo llega a Devin desde el lugar donde surge, ya sea una conversación de Slack sobre un error o un documento de especificaciones de Linear, y continúa hasta la pull request. Los resultados declarados —un rendimiento de ingeniería duplicado desde noviembre, una integración de la robótica AutoStore entregada en ocho meses cuando el sector tarda entre dos y tres años y un prototipado reducido de un mes a un día— siguen siendo los de una página de cliente publicada por el proveedor. El efecto más revelador está en otra parte: los mejores ingenieros dedican ahora el 80 % de su tiempo a revisar código, y aproximadamente el 30 % del uso de Devin en Rohlik corresponde al análisis de datos por parte de usuarios empresariales.
🔗 Formato factory.yaml, @warpdotdev · Estudio de caso de Rohlik, @cognition · Página de cliente de Devin
GitHub: cuatro ejercicios sobre workflows agénticos y la pestaña Customize en disponibilidad general
25 de agosto — GitHub publicó cuatro ejercicios nuevos en su plataforma de aprendizaje GitHub Skills. El enfoque es explícito: en vez de documentar las novedades agénticas del año, GitHub propone ponerlas en práctica en un repositorio de demostración, con instrucciones proporcionadas a través de pull requests.
| Ejercicio publicado | Objetivo del ejercicio |
|---|---|
| Agent Orchestration Build Your AI Dream Team | Agentes personalizados en Copilot CLI: planificar, diseñar, construir, validar y transferir |
| Agentic Workflows that Read the Room | Extensión gh aw, workflow agéntico en Markdown, cambios enviados mediante pull requests |
| Idea to Merge with the Copilot App | De una sesión a una pull request fusionada, íntegramente en la app GitHub Copilot |
| Ship with Quality | Señales de calidad automatizadas, cobertura de pruebas y verificaciones obligatorias en las pull requests |
El más destacable de los cuatro es el primero: es la primera vez que GitHub ofrece un recorrido guiado sobre la orquestación multiagente en su CLI, un tema que hasta ahora solo se había documentado en prosa. El segundo presenta la extensión gh aw, con un aspecto importante para la seguridad: las modificaciones propuestas por el workflow pasan por pull requests en lugar de aplicarse directamente, lo que conserva un punto de revisión humana.
Ese mismo día, la app GitHub Copilot incorporó una pestaña Customize en disponibilidad general. Su función es reunir en una única superficie los cuatro mecanismos de extensión introducidos por separado durante los últimos meses: servidores MCP, plugins, skills y canvases. Una vista Featured presenta una selección editorial de cada categoría para el usuario que sabe qué quiere hacer, pero no qué tipo de extensión responde a su necesidad; los servidores MCP, por su parte, disponen de una navegación propia con opciones destacadas según su popularidad y un recorrido por categorías. El changelog ilustra la utilidad de los canvases con un caso concreto: un canvas de Azure DevOps para clasificar las issues, priorizar un backlog, asignar los seguimientos y después encomendar una tarea a Copilot para que investigue, implemente o prepare la revisión.
🔗 Cuatro ejercicios de GitHub Skills · Pestaña Customize en disponibilidad general
Las herramientas de Google para desarrolladores: Gemini CLI 0.57.0 y Antigravity 2.10.0
25 de agosto — Google publicó la versión estable 0.57.0 de Gemini CLI, precedida quince minutos antes por la preview 0.58.0. El contenido de esta versión dice menos sobre nuevas funcionalidades que sobre la forma en que Google mantiene su herramienta: de las 24 entradas del changelog, 13 llevan el prefijo [SSR Agent] Issue Fix y remiten a números de issues, a menudo antiguas, de la 19239 a la 28518. Estas correcciones abordan problemas acumulados en el backlog: un bloqueo indefinido de la interfaz de terminal al que se añaden tiempos de espera, un mensaje de error administrativo engañoso para las cuentas personales, la ausencia de un espacio tras las sugerencias de autocompletado y la renderización del terminal que no se actualizaba al salir de un editor externo. En otras palabras, Google está poniendo un agente a trabajar sobre su propia deuda técnica y el resultado llega directamente a la versión estable.
| Versión publicada | Fecha y hora (UTC) | Canal de publicación | Aspectos destacados |
|---|---|---|---|
| v0.57.0 | 25 de agosto, 18:37:14 | Stable | 13 correcciones [SSR Agent], validación de evals, retries contextuales |
| v0.58.0-preview.0 | 25 de agosto, 18:22:01 | Preview | Aislamiento Docker en el perfil Seatbelt de macOS, verificadores de seguridad |
En cuanto a las funcionalidades, el esfuerzo se centra en la evaluación, con un comando para validar evals y un formateador de llamadas a herramientas que incorpora resúmenes de errores. La fiabilidad también mejora: los errores de capacidad activan retries silenciosos que tienen en cuenta el contexto, y la cancelación de una solicitud multivuelta provoca un rollback completo en lugar de dejar un estado parcial. Para quienes busquen las notas de versión, cabe señalar que el archivo docs/changelogs/index.md del repositorio no se ha actualizado más allá de la v0.54.0 del 6 de agosto.
Cuatro días después de la 2.9.1 y su Remote Control, Google Antigravity pasa a la versión 2.10.0 el 24 de agosto y cubre dos carencias que obligaban a salir de la herramienta: un terminal integrado y un control de versiones Git nativo, ambos alojados directamente en la barra lateral. La agrupación es coherente con la trayectoria del producto: Antigravity se posiciona como un entorno donde se dirigen agentes en vez de editar código línea por línea, pero aun así es necesario poder ejecutar un comando e inspeccionar un diff sin cambiar de ventana. El resto de la versión amplía tanto lo que se puede enviar a un agente como lo que se ve de su trabajo: los archivos de audio se incorporan a los adjuntos admitidos, los comentarios interactivos sobre imágenes permiten anotar un elemento visual para orientar al agente y las vistas previas enriquecidas de la ejecución de herramientas MCP permiten entender qué ha hecho realmente un servidor de herramientas. Google cifra la versión en 13 mejoras y 8 correcciones, con un despliegue progresivo.
🔗 Gemini CLI v0.57.0 · Changelog de Antigravity
Anthropic financia con 5 millones de dólares evaluaciones independientes sobre el bienestar
25 de agosto — Anthropic abrió un programa de subvenciones de 5 millones de dólares destinado a financiar investigaciones independientes sobre el efecto de la IA en el bienestar de sus usuarios. Los beneficiarios reciben financiación directa, acceso a los modelos y asistencia técnica, pero trabajan con total independencia: sus evaluaciones se publican como open source y pueden ser reutilizadas por todo el sector. Las candidaturas están abiertas hasta el 21 de septiembre, y los candidatos seleccionados para presentar una propuesta completa recibirán una notificación antes del 5 de octubre.
La argumentación técnica explica por qué este ámbito se resiste a los métodos habituales de evaluación. Para la mayoría de los comportamientos de un modelo, basta con examinar una respuesta aislada para determinar si es correcta y apropiada. El bienestar exige contexto: un usuario en apuros no menciona necesariamente pensamientos autolesivos desde el principio, y unos consejos sobre alimentación equilibrada que son razonables en un caso pueden resultar potencialmente peligrosos si la persona ha mostrado antecedentes de trastornos alimentarios. El equipo Safeguards publica en paralelo cinco criterios de rigor: indicar claramente qué se mide; involucrar en el diseño a profesionales clínicos y especialistas del ámbito; probar tanto las precauciones como los perjuicios —es decir, evaluar tanto el riesgo de complacencia excesiva como el de rechazo excesivo—; reflejar el uso real mediante escenarios multivuelta; y validar los evaluadores automáticos con verdaderos expertos. Este tercer criterio, la simetría entre el exceso de conformidad y el exceso de rechazo, es lo que distingue este enfoque de un simple endurecimiento de las salvaguardas.
🔗 Subvenciones de investigación sobre el bienestar
Quantization-Aware Healing: un modelo de 4 bits que supera a su original de precisión completa
25 de agosto — El pipeline estándar para hacer desplegable un gran modelo encadena tres etapas: comprimir la arquitectura, cuantificar el resultado y, a continuación, reparar la pérdida de calidad. La receta dominante para esta última etapa es el QAT (quantization-aware training), que inserta operaciones de cuantificación simulada y vuelve a entrenar; una alternativa, el QAD, destila a partir del modelo comprimido de precisión completa. En ambos casos, el alumno, en el mejor de los casos, solo puede alcanzar a su profesor comprimido y, por tanto, hereda el límite impuesto por la compresión.
Multiverse Computing propone un cambio de una sola línea: destilar directamente desde el modelo original, el anterior a la compresión. La cuantificación deja entonces de ser un posprocesamiento con pérdidas para convertirse en una etapa de aprendizaje por derecho propio. El resultado es contraintuitivo: aplicada a GPT-OSS 120B comprimido a 60B y después cuantificado en MXFP4, la técnica produce un modelo de 4 bits que iguala o supera a su propia fuente bfloat16 en siete de nueve benchmarks, con las mejoras más marcadas allí donde la compresión causa más daño: +7,4 puntos en AA-LCR para razonamiento de contexto largo y +5,6 en AIME 2025. Los dos únicos retrocesos, en MMLU-Pro y SciCode, se mantienen por debajo de un punto y medio.
La comparación directa con el QAT usando un pipeline idéntico quizá sea el resultado más útil en la práctica. En GPT-OSS 9B cuantificado en MXFP4, ambos métodos alcanzan un pico comparable, 54,9 frente a 54,6, pero no al mismo precio: QAH llega en alrededor de un centenar de pasos y se mantiene, mientras que QAT tarda unos 700 pasos en conseguirlo y después se degrada. La consecuencia concreta es un riesgo de despliegue diferente: un punto de control de QAT exige una supervisión atenta de la parada anticipada; uno de QAH, mucho menos.
Gradio integra gr.Workflow, un constructor de pipelines de IA mediante grafos
25 de agosto — Hugging Face publica una guía que presenta gr.Workflow, una primitiva ahora integrada en Gradio. El punto de partida es sencillo: la mayoría de las aplicaciones de IA interesantes no consisten en una llamada a un modelo, sino en una secuencia: se genera una imagen, se elimina su fondo, se crea una voz en off y se pide un título a un LLM. Hasta ahora, conectar esta secuencia y exponerla correctamente requería escribir tanto la lógica como la interfaz. gr.Workflow fusiona ambas: se describen las etapas como un grafo de nodos tipados y el propio grafo se convierte en la interfaz.
El interés para los desarrolladores va más allá de la demostración visual. Cada salida del grafo obtiene automáticamente su propio endpoint REST: el estudio multimedia del ejemplo, que encadena una generación FLUX, una eliminación de fondo, una síntesis de voz y un LLM, expone tres rutas distintas (/sticker, /voiceover, /episode_title) que pueden invocarse desde código sin pasar por la interfaz. Los nodos pueden comunicarse con cuatro mundos: los modelos alojados mediante los Inference Providers de Hugging Face, otros Spaces públicos de Gradio reutilizados como componentes, una fila de un conjunto de datos del Hub y Python arbitrario. Este último punto es el que abre más posibilidades: un nodo operador decorado con @spaces.GPU reserva una GPU ZeroGPU mientras dura su ejecución, lo que permite ejecutar sus propios pesos. La guía incluye cinco aplicaciones realmente desplegadas en Spaces, entre ellas un perfilador de conjuntos de datos y una demostración que anima una imagen fija con Lightricks/LTX-Video.
ElevenLabs lanza Composer, un editor de canciones sección por sección
25 de agosto — ElevenLabs anuncia Composer, un editor de canciones que trabaja sección por sección. El principio rompe con el modo de generación dominante de los modelos musicales: en lugar de producir una canción completa de una sola vez y reiniciar todo cuando un pasaje no resulta satisfactorio, Composer permite retocar de forma aislada una estrofa, un estribillo o un puente. Se ofrecen cuatro puntos de partida: tus propias letras, una pista existente que aportes, una página en blanco o un simple prompt; la canción se construye después mediante retoques sucesivos.
Es el segundo movimiento de ElevenLabs hacia la música después de Eleven Music, y llega durante una semana ajetreada para la empresa, ya que el CLI v1 se publicó el día anterior. El posicionamiento es coherente con el resto del sector del audio: Suno lanzó Studio 2.0 el 13 de agosto, Pika presentó su gama Pika Music el 18 de agosto y Stability AI lanzó su plugin para estaciones de trabajo de audio ese mismo día. El control preciso sobre la estructura de la canción, más que la calidad bruta de la generación, se ha convertido en el terreno de competición. Sin embargo, hay una salvedad: ningún artículo de blog acompaña al anuncio y no hay información disponible sobre los planes que dan acceso a Composer, los formatos de exportación ni el acceso mediante API.
🔗 Anuncio de Composer, @ElevenLabs
LiveAvatar elimina todos los límites de concurrencia y baja a 0,01 USD por minuto
25 de agosto — HeyGen anuncia la eliminación de los límites de concurrencia en LiveAvatar, su producto de avatares en tiempo real. La formulación subraya la naturaleza del cambio: los límites no aumentan, sino que desaparecen. Una sesión o diez mil funcionan en la misma API, sin negociar previamente una cuota. Dos parámetros acompañan al anuncio: el renderizado sigue siendo de cuerpo entero a 1080p y el precio baja hasta 0,01 USD por minuto a escala.
Este nivel de precios cambia la naturaleza de los usos posibles: a un centavo por minuto, un avatar en tiempo real se vuelve viable para la atención al cliente a gran escala, la formación o los quioscos interactivos, casos en los que hasta ahora el coste unitario determinaba la viabilidad. La eliminación del límite de concurrencia es el aspecto técnicamente interesante. Las plataformas de avatares en tiempo real suelen limitar el número de sesiones simultáneas porque cada una ocupa una GPU de forma continua; eliminar este límite supone disponer de un margen de capacidad considerable o haber mejorado la eficiencia del modelo. HeyGen publica un artículo en el que explica su enfoque, cuyos detalles técnicos no estaban disponibles en el momento del rastreo.
🔗 Concurrencia ilimitada en LiveAvatar
Grok 4.6 llega a OpenCode Go
25 de agosto — Grok 4.6 se incorpora a OpenCode Go, el plan de suscripción del agente de código open source OpenCode. El anuncio llegó de OpenCode al final del día y la cuenta @grok lo compartió media hora más tarde. El dato concreto para los desarrolladores es la cuota: 169 solicitudes por cada periodo de 5 horas para los usuarios del plan Go. Es un límite móvil, no un recuento mensual, lo que se adapta al uso por ráfagas típico de las sesiones de programación asistida.
Esta integración forma parte de una serie de aperturas de Grok 4.6 hacia herramientas de terceros: el modelo llegó a GitHub Copilot el 14 de agosto, a Amazon Bedrock el 19 y después a la Gemini Enterprise Agent Platform de Google el 21 de agosto. Además, xAI ya había conectado OpenCode con sus suscripciones SuperGrok y X Premium en mayo de 2026; por tanto, la novedad del día no es el acceso a OpenCode en sí, sino la presencia del modelo 4.6 en el plan Go, con una cuota incluida en lugar de tener que aportar una suscripción a xAI.
🔗 Publicación de @grok · Anuncio de @opencode
Cohere publica un estudio de IDC sobre la adopción de la IA soberana en 2026
25 de agosto — Cohere publica los resultados de un InfoBrief encargado a IDC sobre la adopción de la IA soberana en sectores regulados. El estudio encuestó a más de 500 altos responsables de empresas con una facturación superior a mil millones de dólares en Canadá, Estados Unidos, Reino Unido y Alemania, entre abril y mayo de 2026.
El resultado más notable se refiere menos a la adopción que a la confusión conceptual. Uno de cada tres directivos tiene dificultades para describir la IA soberana con sus propias palabras y solo el 13 % declara tener un conocimiento muy amplio del tema. Entre quienes logran definirla, el 52 % lo hace en términos de control local o nacional y el 35 % menciona la independencia digital. La brecha también atraviesa el organigrama: los responsables de IT muestran un nivel de conocimiento dos veces mayor que los responsables de negocio.
| Sector encuestado | Fuga de datos y cumplimiento como principal preocupación | Ventaja competitiva como motor |
|---|---|---|
| Servicios financieros | 82 % | 21 % |
| Industria | 77 % | 32 % |
| Telecomunicaciones | 75 % | 37 % |
| Salud | 74 % | 28 % |
| Energía | 70 % | 21 % |
En cuanto a las motivaciones, el consenso es claro y transversal: la fuga de datos, la privacidad y el cumplimiento ocupan el primer lugar en todos los sectores encuestados. La ventaja competitiva aparece como un motor secundario, pero en crecimiento, y se destaca más en Canadá (35 %) y Estados Unidos (28 %) que en Alemania (23 %) o Reino Unido (18 %). Evidentemente, el estudio favorece el posicionamiento de Cohere, cuya plataforma agéntica North se ejecuta en la infraestructura y la jurisdicción elegidas por el cliente; aun así, las cifras se atribuyen a una fuente identificada. IDC prevé además que, para 2028, los CIO de las multinacionales aumentarán un 65 % sus inversiones en entornos de cloud soberano modulares y en la localización de datos.
🔗 Estado de la adopción de la IA soberana en 2026
Breves
- Bain & Company se incorpora a Claude Partner Network — La consultora se convierte en socio Global Premier, respaldado por un despliegue de Claude entre sus 19 000 empleados; hubo más de 7 000 usuarios activos desde la fase piloto y más de dos tercios de los participantes adoptaron Claude for Excel. 🔗 Artículo de Anthropic
- Amp explica qué son los orbs — Nota de Thorsten Ball en respuesta a la confusión sobre el nombre: un orb es un agente remoto que puede controlarse desde la web, el teléfono o la CLI. Dos precisiones útiles sobre el coste: el reposo ilimitado no se factura y el número de orbs simultáneos no está limitado. 🔗 Nota de Amp
- Together AI abre Qwen3.8 27B al fine-tuning y a la inferencia dedicada — El modelo pasa a estar disponible tanto para el ajuste con datos propios como para Dedicated Model Inference en hardware reservado. 🔗 Publicación de @togethercompute
- FINAL-Bench abre FINCHAL, un concurso de previsión financiera para agentes — Dotado con 2 000 dólares, pide posiciones en lugar de predicciones y publica un límite de azar (luck ceiling) para separar la habilidad de la suerte. 🔗 Artículo de FINAL-Bench
- Au-Zone publica EdgeFirst Model Zoo — Cuatro familias YOLO de detección y segmentación medidas en silicio embebido real, con cada cifra publicada enlazada a la sesión de validación que la produjo, frente a la opacidad de los TOPS anunciados por los fabricantes. 🔗 Artículo de EdgeFirst
- El dictado inteligente de Gemini para macOS — Permite dictar en cualquier ventana del escritorio, con eliminación automática de las vacilaciones y consideración de las correcciones a mitad de frase; la voz también sirve para resumir archivos y reescribir texto. 🔗 Guía de blog.google
- Las push rules admiten excepciones de ruta — En versión preliminar pública, las reglas Restrict file paths y Restrict file size pueden eximir rutas específicas; por ejemplo, bloquear los JAR en todas partes salvo en
**/gradle/wrapper/*.jar. 🔗 Registro de cambios de GitHub - Bloqueo de un usuario desde un aviso de seguridad — La acción se realiza desde el menú de tres puntos de la descripción o de un comentario, en repositorios públicos, sin volver a pasar por la configuración; el aviso permanece intacto. 🔗 Registro de cambios de GitHub
- Manus informa de una fuerte demanda en la restauración de datos — Las restauraciones que no se completen deberán volver a iniciarse más tarde ese mismo día; se indica expresamente que los paquetes de copia de seguridad deben conservarse intactos y sin cambios. 🔗 Publicación de @ManusAI
- Kling publica tres guías sobre su servidor MCP — Conectar Kling a un asistente compatible con MCP para reutilizar una configuración creativa validada y generar variantes por lotes; dos de los tres tutoriales mencionan Claude Code como cliente. 🔗 Blog de Kling
- Wan 3.0 llega a Runway y Replicate — Runway lo integra el 24 de agosto con múltiples entradas de referencia de imagen, vídeo y audio; Replicate le sigue el día 25, destacando los 30 segundos nativos en una sola toma con audio sincronizado. 🔗 Publicación de @runwayml
- Runway anuncia nuevos ponentes para su AI Summit — Programa ampliado a la robótica, los vehículos autónomos, el marketing y la infraestructura para el evento de septiembre en San Francisco. 🔗 Publicación de @runwayml
- MiniMax publica un índice de las integraciones de H3 — Awesome MiniMax H3 Integrations recopila lo que se está construyendo en torno al modelo de vídeo abierto, incluidas configuraciones que funcionan con 24 GB de VRAM. 🔗 Publicación de @MiniMax_AI
- Luma lanza Dream Lab Weekly — Primer episodio de una serie de vídeos dedicada a los profesionales creativos de Luma y a su trabajo semanal en el producto. 🔗 Publicación de @LumaLabsAI
- NVIDIA emite una sesión de Nemotron Labs sobre el enrutamiento de modelos abiertos — Emisión en directo de 55 minutos titulada Get Started with Open Model Routing, continuación del trabajo sobre Nemotron 3.5 Lightning y NeMo Switchyard. 🔗 Publicación de @NVIDIAAI
- Queda una semana para el concurso Grok Imagine sobre la Odisea — Hay que componer una escena extraída de la Odisea que destaque las capacidades de vídeo y voz de la herramienta; premios de 100 000, 50 000 y 25 000 dólares. 🔗 Publicación de @grok
- Banco de restablecimientos de límites para los suscriptores Plus y Pro — En lugar de esperar a la ventana de restablecimiento, el usuario consume un restablecimiento guardado en reserva; uno gratuito en el lanzamiento y otros mediante referidos, con créditos de workspace compartidos para Business. 🔗 Registro de cambios de ChatGPT y Codex
Qué significa
El silicio vuelve a ser un tema de laboratorio de modelos. OpenAI publica el mismo día las primeras cifras medidas de su propio chip de inferencia y la entrada que expone su estrategia de compute. No es una coincidencia de calendario: un proveedor de modelos que diseña su silicio, lo mide con un benchmark público de terceros y asume públicamente una cartera de diez socios cambia la naturaleza de la competencia. La pregunta deja de ser «qué modelo es el mejor» para convertirse en «a qué coste por tarea completada con éxito», y la respuesta se juega tanto en el rack como en los pesos. Quizá el detalle más significativo esté en otra parte: la IA se utilizó para diseñar el chip y escribir sus kernels, con un paso a fabricación en nueve meses e implementaciones generadas que superan a las de expertos humanos en los bloques seleccionados. El círculo se cierra: los modelos diseñan el hardware que los hará funcionar.
La IA vuelve a bajar al dispositivo, y las cifras empiezan a acompañarla. Tres señales del mismo día apuntan en la misma dirección. Perplexity ejecuta la totalidad de su agente localmente en un DGX Spark, sin consumir créditos, con un escalado al cloud que sigue siendo una decisión del usuario. Multiverse Computing publica un método con el que un modelo de 4 bits iguala o supera a su fuente en precisión completa, lo que elimina el argumento habitual contra la cuantificación agresiva. Au-Zone publica mediciones de visión por silicio integrado y reprocha que los TOPS anunciados no digan nada sobre lo que realmente hará un modelo determinado. Ninguno de estos tres trabajos pretende igualar el frontier: la cifra honesta de Perplexity es del 59,6 % en local frente al 82,4 % de Claude Opus 5 por sí solo en Terminal Bench 2.1. Pero el escalado hacia un modelo asesor recupera tres quintas partes de la diferencia por dos tercios del coste, y es esta compensación, más que la paridad, la que hace defendible la ejecución local.
La apertura de los pesos se consolida como posición de referencia. El análisis de 500 000 artículos de arXiv difundido por Qwen documenta un vuelco que ya era perceptible: los modelos abiertos chinos han pasado del 10 % a alrededor del 40 % de las menciones, mientras que los modelos abiertos estadounidenses se estancan entre el 25 y el 30 %. Qwen3.8-27B entra en el top 10 de Code Arena siendo el único de su tamaño; GLM-5.3 superaba a GPT-5.6 Sol y Claude Fable 5 en DeepSWE en pruebas múltiples con un coste entre 2,1 y 5,4 veces inferior; IBM abre Granite 4.2 con cuatro variantes cuantificadas y catorce formatos GGUF desde el primer día: se repite la misma lógica. Abrir los pesos ya no es un gesto para ponerse al día, sino una forma de convertirse en la infraestructura predeterminada de los demás, con el matiz que plantea el propio Nathan Lambert: las publicaciones van por detrás de los lanzamientos y estas curvas describen los trabajos en curso, no las preferencias del momento.
Y la web se prepara para ser leída por agentes en lugar de por ojos. El WebMCP Challenge es un concurso dotado con 35 000 dólares, lo cual es poco; lo que revela vale más. Chrome, Cloudflare, Shopify, Vercel, Render y Netlify se alinean con OpenAI en torno a un estándar que pide a los sitios exponer herramientas estructuradas, en lugar de dejar que los agentes deduzcan una interfaz. Ese mismo día, ChatGPT desktop ya puede consumir WebMCP de forma nativa, Codex puede producir y desplegar una aplicación compatible y OpenAI documenta su uso interno del protocolo en una herramienta de notebooks. Esta convergencia coincide con lo que Rohlik describe por su parte, con más de cincuenta integraciones MCP y el principio de que toda herramienta nueva debe ser accesible para los agentes desde el primer día. La capa de interfaz para agentes deja de ser un tema de investigación para convertirse en un requisito de ingeniería.
Fuentes
- OpenAI — WebMCP Challenge
- OpenAI — anuncio del WebMCP Challenge en X
- OpenAI — WebMCP en ChatGPT desktop y Sites
- OpenAI — automatizar el trabajo repetitivo con Codex, Runme y WebMCP
- OpenAI — Jalapeño, primeros resultados
- OpenAI — La pila completa detrás de una inteligencia abundante
- OpenAI — plugin Admin para ChatGPT Work y Codex
- OpenAI — extensión del navegador ampliada a Edge, Brave, Opera y Vivaldi
- OpenAI — puesto Premium de ChatGPT Business
- ChatGPT y Codex — registro de cambios
- Perplexity — lanzamiento de Portable Computer
- Perplexity — entrada sobre Portable Computer
- Perplexity — benchmarks del arnés local
- Anthropic — la memoria de Claude funciona en todas partes
- Anthropic — anuncio sobre la memoria en X
- Anthropic — registro de cambios de Claude Code
- Anthropic — renderizado en streaming cuatro veces más fluido
- Anthropic — becas de investigación sobre el bienestar
- Anthropic — Bain & Company se une a Claude Partner Network
- IBM — Granite 4.2
- IBM — Granite Speech 5.0 Turbo CTC
- Multiverse Computing — Quantization-Aware Healing
- Hugging Face — guía de gr.Workflow
- FINAL-Bench — concurso FINCHAL
- Au-Zone — EdgeFirst Model Zoo
- Together AI — Qwen3.8 27B para fine-tuning e inferencia dedicada
- Google AI — WeatherNext Cyclones
- Google DeepMind — WeatherNext Cyclones
- Google — Gemini CLI v0.57.0
- Google — registro de cambios de Antigravity
- Google — dictado inteligente de Gemini para macOS
- Stability AI — Serie B de 76 millones de dólares
- Stability AI — anuncio en X
- NVIDIA — Gamescom y RTX Spark
- MiniMax — SANA y Sol Engine en H3
- MiniMax — índice de integraciones de H3
- NVIDIA — sesión de Nemotron Labs sobre el enrutamiento de modelos abiertos
- Qwen — Qwen3.8-27B en Code Arena WebDev
- Qwen — difusión del análisis de arXiv
- Nathan Lambert — análisis exhaustivo de 500 000 artículos de arXiv
- Warp — formato factory.yaml y acceso anticipado
- Cognition — estudio de caso de Rohlik Group
- Devin — página de cliente de Rohlik Group
- Amp — explicación de los orbs
- GitHub — cuatro nuevos ejercicios de GitHub Skills
- GitHub — pestaña Customize disponible de forma general
- GitHub — excepciones de ruta en las push rules
- GitHub — bloqueo desde un aviso de seguridad
- Manus — actualización sobre la restauración de datos
- ElevenLabs — Composer
- HeyGen — concurrencia ilimitada en LiveAvatar
- Kling — guías sobre el servidor MCP
- Runway — Wan 3.0 disponible en la plataforma
- Runway — nuevos ponentes del AI Summit
- Luma — Dream Lab Weekly
- xAI — Grok 4.6 en OpenCode Go
- OpenCode — Grok 4.6 en el plan Go
- xAI — concurso Grok Imagine sobre la Odisea
- Cohere — Estado de la adopción de la IA soberana en 2026