ai-powered-markdown-translatorArtículo traducido del fr al es con gpt-5.6-sol.
El martes 22 de septiembre, Anthropic y OpenAI lanzan cada una un modelo de frontera, con menos de dos horas de diferencia: Claude Opus 5.5, presentado como equivalente a Fable 5.1 por un 40 % menos que Opus 5, y después GPT-6 Sol y GPT-6 Luna, cuyos precios de API se reducen a la mitad frente a la tarifa promocional de GPT-5.6. Ambas familias llegan ese mismo día a GitHub Copilot, Devin y Perplexity, mientras Claude Code 2.1.280 pasa los planes Pro y Team Standard de Sonnet a Opus. Codex CLI 0.156.0, unos límites de uso ampliados en Anthropic y una serie de publicaciones de NVIDIA completan la jornada.
Anthropic lanza Claude Opus 5.5, primer modelo de la familia Claude 5.5
22 de septiembre — Anthropic lanza Claude Opus 5.5 (claude-opus-5-5), primer modelo de su nueva familia Claude 5.5; Sonnet 5.5 y Haiku 5.5 llegarán «en las próximas semanas». Está disponible desde hoy en la API de Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud y Microsoft Foundry, y se convierte, en Claude Code, en el modelo predeterminado de los planes de pago. Ventana de contexto de un millón de tokens, salida máxima de 128 000 tokens y conocimientos fiables hasta junio de 2026.
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
🇪🇸 Presentamos Claude Opus 5.5, el primer modelo de nuestra nueva familia Claude 5.5. Trabaja al nivel de Claude Fable 5.1 en la mayoría de las tareas y cuesta un 40 % menos de ejecutar que Opus 5. — @claudeai en X
Según Anthropic, ese 40 % se mide «con la configuración predeterminada» en cargas típicas y combina precios más bajos con menos tokens por tarea. Las tarifas bajan un 20 % (4 dólares de entrada y 20 de salida por millón de tokens, frente a 5 y 25 para Opus 5) y un 60 % en las lecturas de caché (0,20 dólares). La salida se genera más de un 30 % más rápido, y un modo rápido (fast mode), en vista previa de investigación, promete hasta 2,5 veces más velocidad por 8 y 40 dólares.
| Benchmark (cifras de Anthropic) | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 Main | 54,4 % | 50,3 % | 53,3 % |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1542 |
| OSWorld 2.0 | 81,8 % | 80,7 % | — |
| AutomationBench | 40,0 % | 31,4 % | 41,4 % |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 64,6 % |
Opus 5.5 pasa a liderar en programación agéntica, trabajo de oficina y uso del ordenador, pero GPT-6 Astra sigue por delante en AutomationBench y Terminal-Bench-Science. Anthropic precisa que sus puntuaciones se midieron con las salvaguardas de producción activas, lo que probablemente las reduce, y considera que los márgenes de los benchmarks se han convertido en «una guía menos fiable»: en la práctica, la diferencia con Fable 5.1 sería menor de lo que indican estas cifras. Es el primer Opus lanzado con salvaguardas de la clase de Fable 5.1 en ciberseguridad, biología y destilación (la mayoría de las tareas de ciberseguridad pasan a Opus 4.8), y Anthropic reconoce que a menudo parece sospechar que está siendo evaluado.
Para los desarrolladores, la migración requiere ajustes: la reflexión adaptativa ya no puede desactivarse, la selección forzada de herramientas (tool_choice a any o tool) devuelve un error 400, y el esfuerzo predeterminado pasa a medium (frente a high en Opus 5). El texto escrito entre dos llamadas a herramientas aparece ahora en bloques de reflexión, vacíos con la visualización predeterminada.
🔗 Presentación de Claude Opus 5.5 · Novedades de Opus 5.5 para la API
Claude Code 2.1.280 incorpora Opus 5.5 y pasa Pro y Team Standard a Opus
22 de septiembre — Claude Code 2.1.280 se publica a las 16:38 UTC, siete minutos después del anuncio de Opus 5.5. No hubo ninguna versión 2.1.279: el CHANGELOG pasa directamente de la 2.1.278 del 19 de septiembre a esta versión con 114 entradas.
El cambio más visible afecta al modelo. Opus 5.5 se convierte en el modelo Opus predeterminado, y los planes Pro y Team Standard pasan de Sonnet a Opus de forma predeterminada, como ya sucedía con Max, Team Premium y Enterprise. Los niveles de esfuerzo guardados antes de que /effort pasara a ser específico de cada modelo ya no se aplican a modelos nuevos como Opus 5.5, que se inician con su configuración predeterminada; Opus 4.7, Opus 4.8 y Fable 5, por su parte, dejan de imponer su esfuerzo inicial por encima de la configuración elegida.
En materia de seguridad, una escritura que pasa por un enlace simbólico se evalúa ahora según su destino real: la solicitud de autorización indica el lugar donde termina, y acceptEdits, las reglas de autorización y el modo automático ya no aprueban una escritura que termine fuera del árbol de directorios. El modo automático ya no rechaza acciones en bucle, sin pausa, cuando un control de seguridad no devuelve respuesta: los nuevos intentos se espacian y el turno termina después de diez rechazos consecutivos. Se rechazan los marketplaces de plugins que imitan un nombre reservado, y la variable CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH permite modificar el límite de 2 048 caracteres de las descripciones de herramientas MCP.
El resto son mejoras de comodidad: una pulsación aislada de y o n ya no confirma ni cierra un diálogo (se usan Intro y Escape en su lugar), pulsar Ctrl+C dos veces dentro de un diálogo ya no cierra Claude Code, se corrigen dos interrupciones de la caché de prompts y la extensión de VS Code incorpora seis comandos escritos (/status, /sandbox, /chrome, /export, /skills, /plan).
| Categoría de entrada del CHANGELOG | Número de entradas |
|---|---|
| Correcciones (Fixed) | 69 |
| Mejoras (Improved) | 21 |
| Adiciones (Added) | 12 |
| Cambios (Changed) | 10 |
| Reversión y retirada | 2 |
| Total | 114 |
Dos guías para trabajar con Opus 5.5
22 de septiembre — Anthropic también publica dos guías firmadas por Addy Osmani. La primera, «Lo que cuesta una tarea en Opus 5.5» (What a task costs on Opus 5.5), recuerda que dos modelos con el mismo precio por token pueden tener costes muy distintos para una misma tarea, porque cada turno vuelve a enviar toda la conversación. Sus ejemplos, presentados como ilustraciones basadas en las tarifas públicas: 2,8 millones de tokens de entrada cuestan 11,20 dólares sin caché y 1,62 dólares con el 90 % leído desde la caché, y un token de salida cuesta 100 veces más que una lectura de caché. Recomienda el esfuerzo medium para el uso cotidiano, high cuando medium se atasca y, después, Fable 5.1 si Opus 5.5 tropieza dos veces con el mismo problema, teniendo en cuenta que cambiar el esfuerzo o el modelo vacía la caché (que dura una hora con una suscripción y cinco minutos de forma predeterminada con una clave de API). En un benchmark interno de 44 tickets de soporte, pasar de Opus 4.8 a Opus 5.5 con esfuerzo bajo redujo el coste aproximadamente un 18 %, y /claude-api prompt-audit lo redujo un 9 % adicional.
La segunda guía, en claude.dev, recomienda definir qué significa «terminado» y después dejar que trabaje, así como eliminar instrucciones del tipo «piensa bien», puesto que el modelo siempre reflexiona antes de responder. También explica el cambio a un modelo anterior cuando las salvaguardas señalan un mensaje, un comportamiento configurable en las aplicaciones o en /config.
🔗 Lo que cuesta una tarea en Opus 5.5 · Cómo sacar el máximo partido a Opus 5.5
OpenAI lanza GPT-6 Sol y GPT-6 Luna, un 50 % más baratos que la tarifa promocional de GPT-5.6
22 de septiembre — Menos de dos horas después de Anthropic, OpenAI amplía la familia GPT-6 con GPT-6 Sol y GPT-6 Luna, entrenados con métodos similares a los de GPT-6 Astra, que sigue siendo, según la empresa, su mejor modelo. Sol está orientado a la programación compleja y los flujos agénticos; Luna, a las tareas específicas de gran volumen. Suceden a GPT-5.6 Sol y GPT-5.6 Luna.
We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
🇪🇸 También hemos mejorado la eficiencia de la caché y la inferencia, y os trasladamos directamente ese ahorro: precios de API un 50 % inferiores para Sol y Luna en comparación con la tarifa promocional de GPT-5.6. — @OpenAI en X
| Tipo de tarifa (por millón de tokens) | GPT-6 Sol | GPT-6 Luna | Tarifa de GPT-5.6 citada (Sol / Luna) |
|---|---|---|---|
| Entrada | 2 dólares | 0,10 dólares | 4 dólares / 0,20 dólares |
| Entrada en caché | 0,20 dólares | 0,01 dólares | no especificada |
| Salida | 10 dólares | 0,50 dólares | 20 dólares / 1,20 dólares |
Ambos modelos admiten 1 050 000 tokens de contexto y generan hasta 128 000 tokens; por encima de 272 000 tokens de entrada, toda la solicitud se factura al doble de precio en la entrada y a 1,5 veces el precio en la salida.
En los benchmarks de OpenAI, que comparan Sol con modelos Claude anteriores a Opus 5.5, Sol obtiene un 33,2 % en AutomationBench con esfuerzo xhigh por 0,27 dólares por tarea, por delante de Claude Opus 5 con esfuerzo max (26,9 %, con un coste 11,1 veces mayor) y GPT-6 Astra con esfuerzo low (30,3 %). En DeepSWE v1.1 alcanza un 68,8 %, a 1,1 puntos de la mejor puntuación de Claude Fable 5, con un coste por tarea aproximadamente un 80 % inferior; Luna obtiene allí un 66,6 %. Las puntuaciones de los competidores proceden de informes públicos. En cuanto al alineamiento, la tasa de engaño medida en tareas de programación diseñadas para fomentar la deshonestidad cae al 1,3 % en Sol, frente al 10,4 % de GPT-5.6 Sol.
Ambos modelos llegan a ChatGPT Work y Codex para los suscriptores Plus, Pro, Business, Enterprise y Edu, con un despliegue progresivo (activación por parte del administrador en Enterprise); los usuarios de Free y Go pueden utilizar Luna en la aplicación de escritorio, y los modelos todavía no están disponibles en Chat. En la API, se denominan gpt-6-sol y gpt-6-luna, mediante Responses y Chat Completions.
🔗 Presentación de GPT-6 Sol y Luna
Una caché de prompts rediseñada para GPT-6
22 de septiembre — La publicación complementaria del lanzamiento, «Mejor caché de prompts para GPT-6» detalla el nuevo sistema de caché de la familia: mayores tasas de acierto de forma predeterminada, un descuento de hasta el 90 % en los tokens de entrada almacenados en caché, aplicado a los prefijos compartidos aptos reutilizados durante los 30 minutos siguientes, y una escritura en caché facturada a 1,25 veces la tarifa de entrada. Los desarrolladores obtienen un panel Prompt Caching, puntos de interrupción explícitos (explicit cache breakpoints) para fijar los prefijos que se reutilizarán, el precalentamiento de la caché (prewarming) al iniciar una aplicación y un configuration_update que cambia el esfuerzo de razonamiento entre respuestas sin invalidar la caché. GitHub, a través de su director de producto Mario Rodriguez, afirma haber reducido en más de un 50 % la proporción de tokens de prompt que deben volver a procesarse; Strawberry Browser anuncia una reducción de costes del 20 %.
🔗 Mejor caché de prompts para GPT-6
Ese mismo día en las herramientas: GitHub Copilot, Devin, Perplexity, Cursor y v0
22 de septiembre — Opus 5.5 y los dos nuevos GPT-6 no han esperado: en pocas horas, las principales herramientas de programación e investigación los han añadido, a menudo con sus propias mediciones.
GitHub Copilot incorpora Opus 5.5, GPT-6 Sol y GPT-6 Luna
GitHub añade los tres modelos el día de su lanzamiento en diez superficies: VS Code, Visual Studio, Copilot CLI, el agente de programación, la aplicación GitHub Copilot, github.com, GitHub Mobile, JetBrains, Xcode y Eclipse. Todos se facturan según el uso a la tarifa pública del proveedor, sin multiplicador de solicitudes premium: los suscriptores anuales que permanecen en la antigua facturación por solicitudes no los reciben. Ninguno aparece todavía en la selección automática (Auto).
| Modelo en Copilot | Planes disponibles | Entrada y salida por millón de tokens |
|---|---|---|
| Claude Opus 5.5 | Pro+, Max, Business, Enterprise (no Pro) | 4 y 20 dólares |
| GPT-6 Sol | Pro+, Max, Business, Enterprise | 2 y 10 dólares, después 4 y 15 por encima de 272 000 tokens |
| GPT-6 Luna | Pro, Pro+, Max, Business, Enterprise | 0,10 y 0,50 dólares, después 0,20 y 0,75 por encima de 272 000 tokens |
Así, Luna es el único modelo GPT-6 accesible con Copilot Pro, mientras que Opus 5.5 no está disponible en ese plan. Según las primeras pruebas de GitHub, Opus 5.5 resuelve las tareas al nivel de Claude Opus 5 con muchas menos etapas y tokens. GitHub también señala que Opus 5.5 incorpora una marca de agua (watermark) en sus salidas de texto, sin efecto, según GitHub, sobre el significado, la calidad, la legibilidad, el número de tokens ni el coste.
🔗 Claude Opus 5.5 en GitHub Copilot · GPT-6 Sol y GPT-6 Luna en GitHub Copilot
Devin clasifica a los recién llegados en FrontierCode 1.1
Cognition habilita Claude Opus 5.5 en Devin Desktop y Devin CLI el día de su lanzamiento y lo sitúa primero en su benchmark FrontierCode 1.1 en la variante Extended, con un 65,3 %, por delante de Claude Fable 5 (64,9 %) y GPT-6 Astra (64,5 %), por menos de una décima parte del coste por tarea de Fable 5. Este 65,3 % no es comparable con el 54,4 % publicado por Anthropic, medido en la variante Main. Cuarenta y siete minutos más tarde, GPT-6 Sol y Luna llegan a su vez: Sol iguala a GPT-5.6 Sol (60,7 % frente a 60,6 %) con un 61 % menos de coste por tarea y lee aproximadamente un 17 % menos de contexto; Luna (56,1 %) baja de 0,10 dólares por tarea, el modelo más barato de la clasificación según Cognition.
El día anterior, el 21 de septiembre por la tarde (hora del Pacífico), Cognition había habilitado Grok 4.7 y lo había medido con un 59,4 %, por debajo de Grok 4.6 (61,3 %): sólido en las tareas back-end difíciles en Java, Go y Ruby, tiende a exceder el alcance (over-scope), con diffs más grandes de lo que requiere la tarea. v0 habilitó Grok 4.7 inmediatamente después, con un 40 % de descuento hasta el 27 de septiembre, sin precisar a qué se aplica.
| Modelo evaluado | Puntuación FrontierCode 1.1 Extended |
|---|---|
| Claude Opus 5.5 | 65,3 % |
| Claude Fable 5 | 64,9 % |
| GPT-6 Astra | 64,5 % |
| Claude Fable 5.1 | 63,6 % |
| SWE-2 | 62,5 % |
| Grok 4.6 | 61,3 % |
| GPT-6 Sol | 60,7 % |
| GPT-5.6 Sol | 60,6 % |
| Grok 4.7 | 59,4 % |
| Gemini 3.7 Flash | 56,3 % |
| GPT-6 Luna | 56,1 % |
En negrita, los modelos añadidos a Devin los días 21 y 22 de septiembre. Puntuaciones publicadas por Cognition en la variante Extended.
🔗 Opus 5.5 en Devin · GPT-6 Sol y Luna en Devin · Grok 4.7 en Devin · Grok 4.7 en v0
Perplexity: Opus 5.5 y GPT-6 Sol en Computer, cuatro modelos en la Agent API
Perplexity conecta ambos lanzamientos con el selector de esfuerzo introducido el 17 de septiembre en Computer, su agente de varios pasos. Claude Opus 5.5 se convierte en el nivel Standard: en WANDR, el benchmark interno de coste y rendimiento de Perplexity, obtiene 0,610 por 4,13 dólares por tarea, ligeramente por encima de Claude Fable 5.1 con un coste por tarea un 67,6 % inferior. GPT-6 Sol, disponible también en la aplicación Perplexity, se convierte en la opción predeterminada del nivel Light. Ninguno de los dos mensajes precisa qué planes están incluidos ni qué modelos sustituyen.
Para los desarrolladores, una entrada del changelog de la API, fechada únicamente en septiembre de 2026, añade a la Agent API openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 y xai/grok-4.7, sin tarifas en la entrada.
🔗 Opus 5.5 en Computer · GPT-6 Sol en Computer · Changelog de la API de Perplexity
Cursor y v0 habilitan Opus 5.5
Cursor lo presenta como el nuevo mejor modelo de CursorBench, con un 57,8 % al máximo esfuerzo (Max), por un coste por tarea un 40 % inferior al de Opus 5: son las cifras de Anthropic, con el nivel de esfuerzo especificado. v0 lo habilita sin detalles sobre las tarifas.
🔗 Cursor en X · v0 en X
Anthropic aumenta los límites de cinco horas y ofrece un restablecimiento hasta el 22 de octubre
22 de septiembre — Con Opus 5.5, Anthropic aumenta los límites calculados en periodos de cinco horas de los planes Pro, Max, Team y Enterprise con licencia por usuario (seat-based). La cuenta @ClaudeDevs cuantifica el aumento para Claude Code: un 20 % más en los límites de sesión de cinco horas desde hoy. Los suscriptores también reciben un restablecimiento del límite que pueden guardar como reserva y activar cuando quieran: está disponible en Ajustes → Uso (Settings → Usage) para Pro, Max y Team, y debe utilizarse antes del 22 de octubre.
A esto se suma el efecto del precio: en Claude Code, Opus 5.5 se convierte en el modelo predeterminado de los planes de pago y, al ser más barato que Opus 5, hace que los límites de cinco horas y semanales «rindan un 25 % más». La guía de costes publicada el mismo día precisa que la bajada se repercute en los límites, incluido el contexto almacenado en caché, pero que la reducción adicional del precio de las lecturas de caché solo afecta a la API.
🔗 @ClaudeDevs en X · Restablecimiento y límites
Codex CLI 0.156.0 activa la voz y los worktrees de forma predeterminada
22 de septiembre — Publicada a las 19:51 UTC, Codex CLI 0.156.0 es la primera versión estable desde la 0.155.1 del 18 de septiembre; su changelog completo enumera 525 pull requests desde la 0.155.0. Generaliza dos funciones que aún eran experimentales en la 0.155: las conversaciones de voz, con motores de audio integrados para Linux y Windows, y los worktrees, que el centro de control de agentes puede abrir como sesiones filtrando las tareas por estado.
| Novedad de la versión | Comando o ajuste | Precedente en Codex CLI |
|---|---|---|
| Conversaciones de voz predeterminadas | F8, /voice settings | /voice experimental (0.155.0, 17 de septiembre) |
| Worktrees predeterminados | centro de control de agentes | experimentales desde la 0.154.0 (9 de septiembre) |
| Interfaz de pantalla completa | /tui, en el próximo inicio | ninguno |
| Panel de analytics | /usage | analytics de la aplicación de escritorio (18 de septiembre) |
| Servidor local en segundo plano | /daemon, --no-daemon | ninguno |
La interfaz de pantalla completa incorpora búsqueda en la transcripción, selección con el ratón y copia mediante clic derecho; llegan seis temas integrados, y las respuestas muestran directamente los diagramas Mermaid y las ecuaciones. La versión también corrige varias vulnerabilidades de aislamiento del sandbox (tráfico entrante en Windows, sockets Unix del app-server, fcntl modificables en macOS). Las notas de la versión no mencionan GPT-6: Sol y Luna se seleccionan con /model o --model.
Agentes de código en terminal: Vibe CLI, Qwen Code y Amp
Vibe CLI 2.25.6 y 2.25.7
22 de septiembre — Mistral publica Vibe CLI 2.25.7, con seis correcciones, un día después de una 2.25.6 fechada el 21 de septiembre en el CHANGELOG, pero nunca publicada como release de GitHub, que contiene la mayoría de las novedades (1 incorporación, 3 cambios y 17 correcciones). Con la opción --experimental-harness, se pueden adjuntar imágenes incluso cuando el modelo activo no sabe leerlas: un modelo con visión del mismo proveedor las describe para el agente, y la clave vision_model de config.toml permite imponer otro. Las capturas de la interfaz descritas de este modo incluyen un contrato de diseño (layout contract) para que el agente pueda reconstruir la pantalla.
En cuanto a la seguridad, se refuerzan los comandos Git ejecutados sin aprobación: los fetch seguros ya no heredan las sobrescrituras de rutas de la configuración de Git, un checkout no fiable ya no puede elegir el cliente SSH ni los hooks, y las opciones arriesgadas o las redirecciones de shell introducidas en comandos de solo lectura requieren aprobación. Por último, la 2.25.7 habilita /teleport para las claves de API de Vibe y workspace, incluidas las cuentas gratuitas.
🔗 Vibe CLI v2.25.7 · CHANGELOG de Vibe CLI
Qwen Code v0.24.4
22 de septiembre — Un día después de la v0.24.3, Qwen Code pasa a la v0.24.4 con 13 funcionalidades y 15 correcciones, sin cambios incompatibles. El servidor qwen serve ahora abre espacios de trabajo remotos mediante SSH sin instalar un daemon en la máquina de destino, y el sandbox bubblewrap (bwrap), introducido en Linux con la v0.24.0, se aplica durante la ejecución de cada herramienta. En Web Shell, el emparejamiento mediante código QR pasa a estar disponible de forma predeterminada cuando el servidor autenticado escucha fuera de la interfaz de loopback, con invitaciones de un solo uso que caducan al cabo de 60 segundos, y los diffs de edición se muestran antes de la aprobación. En Java, las ejecuciones gestionadas de herramientas se conservan en la base de datos mediante JDBC. Una v0.24.5-preview.0 limitada a dos correcciones llegó el mismo día.
Los runners de Amp crean worktrees de Git
22 de septiembre — Cinco días después de permitir que un runner atienda varios directorios, Amp le permite crear worktrees de Git. En el selector, cada repositorio atendido ofrece la opción New Worktree: se pulsa Tab, se asigna un nombre a la rama y el hilo comienza en un checkout nuevo creado junto al repositorio (~/code/amp genera ~/code/amp-fix-flaky-login-test), sin modificar el checkout principal. Después, una acción específica archiva el hilo y elimina el worktree y la rama. Los runners también pueden recibir los secretos y las variables de entorno (Secrets & Env Vars) configurados en ampcode.com: desactivada de forma predeterminada, la opción se activa con --amp-env, y una variable modificada se aplica al siguiente hilo, sin reinicio ni SSH.
Evaluaciones de terceros: OpenAI establece sus reglas y el AISI británico publica sus resultados
22 de septiembre — El mismo día, dos publicaciones abordan la evaluación de modelos por organismos externos a los laboratorios.
OpenAI: cuatro prioridades y siete principios para los evaluadores independientes
Firmada por Lama Ahmad, la publicación compromete a OpenAI a ofrecer a evaluadores independientes, privados o de organizaciones sin ánimo de lucro, un acceso profundo al entrenamiento, la evaluación y el despliegue de sus modelos, para que puedan cuestionar sus hipótesis, detectar riesgos no identificados y juzgar por sí mismos sus protecciones. Estas evaluaciones, distintas del trabajo realizado con los gobiernos, durarían desde unas semanas hasta varios meses, sin estar vinculadas a un lanzamiento.
| Área prioritaria | Qué se examina |
|---|---|
| Argumentos de seguridad (safety cases) | La argumentación que demuestra que los riesgos de un modelo están controlados, desde el entrenamiento hasta el despliegue externo |
| Protecciones críticas | Resistencia a los jailbreaks, defensas cibernéticas, monitores de desalineación, fiabilidad del seguimiento de la cadena de pensamiento |
| Preparedness Framework | Pruebas de capacidades (riesgos químicos y biológicos, ciberseguridad, autooptimización de la IA) y alineación |
| Incidentes de desalineación | Investigaciones independientes sobre incidentes críticos, citándose como ejemplo el incidente de Hugging Face de julio |
Siete principios enmarcan el conjunto: alcance acordado y afirmaciones registradas de antemano, acceso proporcionado, método transparente, experiencia e independencia (con declaración de conflictos de intereses), seguridad y confidencialidad, conclusiones aplicables con un plazo de corrección antes de la publicación, y publicación responsable que regule la censura de información. OpenAI afirma estar conversando con varios organismos, sin nombrar ninguno.
🔗 Prioridades y principios para evaluaciones eficaces de terceros
El UK AI Security Institute publica sus resultados verificados con EvalEval
La EvalEval Coalition anuncia en el blog de Hugging Face que el UK AI Security Institute (AISI), el organismo público británico encargado de estudiar los riesgos de la IA avanzada, publica ahora sus resultados de evaluación en Evaluation Cards, la plataforma abierta de EvalEval, con su contexto y configuración, en el formato común Every Eval Ever. La primera publicación cubre cinco benchmarks (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro y Terminal-Bench 2.0) medidos en seis modelos, Claude Opus 4, 4.5 y 4.6, GPT-5, GPT-5.2 y GPT-5.4, además de dos evaluaciones de ciberseguridad. El objetivo es la reproducibilidad: unas referencias verificadas, publicadas con su configuración, ayudan a comprender por qué divergen dos puntuaciones aparentemente comparables.
🔗 Cómo UK AISI y EvalEval hacen reproducibles los resultados de los benchmarks
ChatGPT permite seguir la puntuación crediticia de Experian en Estados Unidos
21 de septiembre — Anunciada por la cuenta @ChatGPT el 21 de septiembre, una nueva función permite seguir la puntuación crediticia en ChatGPT. Desde el espacio Finanzas, los suscriptores Plus y Pro de Estados Unidos conectan su informe crediticio de Experian y su puntuación VantageScore 3.0, reciben explicaciones personalizadas sobre los factores que influyen en ella y reciben avisos cuando cambia. La función está disponible en la web y en las últimas versiones de las aplicaciones para iOS y Android.
OpenAI cita usos concretos: medir el efecto del crédito en una solicitud de alquiler, decidir qué tarjeta de crédito amortizar primero, construir el historial crediticio a largo plazo o ver cómo el crédito y el presupuesto influyen en el arrendamiento de un automóvil o en un préstamo hipotecario. La función complementa las herramientas de finanzas personales lanzadas en versión preliminar en mayo para los suscriptores Pro estadounidenses, con conexión bancaria mediante Plaid.
Google: Colab se incorpora a los planes Google AI y la API de Gemini restringe Gemini 2.5
Colab se incorpora a los planes Google AI
22 de septiembre — Los suscriptores de Google AI obtienen ventajas premium de Colab, incluido acceso prioritario a aceleradores más rápidos y máquinas más potentes. Los suscriptores Ultra también desbloquean la ejecución ininterrumpida en segundo plano y el acceso a GPU Premium, para que un entrenamiento prolongado pueda terminar sin mantener una pestaña abierta. La publicación habla de un lanzamiento «a partir de hoy», pero precisa que las ventajas llegarán durante las próximas semanas a los países donde Colab está disponible. Según las preguntas frecuentes de Colab, las unidades de cómputo de un plan Google AI y de una suscripción Colab Pro o Pro+ se suman al mismo saldo; los planes Google One limitados al almacenamiento y las pruebas gratuitas no dan derecho a ellas. Ni la publicación ni las preguntas frecuentes cuantifican las unidades asignadas a cada plan.
🔗 Colab ya forma parte de tu plan Google AI · Preguntas frecuentes de Colab
La API de Gemini restringe el acceso a Gemini 2.5
18 de septiembre — En una nota del 18 de septiembre, las notas de la versión de la API de Gemini limitan el acceso a los modelos Gemini 2.5 a los usuarios que los hayan utilizado activamente en el pasado, para garantizar un rendimiento fiable y conservar capacidad. Estos modelos no están obsoletos y seguirán disponibles hasta nuevo aviso: la página de obsolescencias no muestra ninguna fecha de retirada para gemini-2.5-pro, gemini-2.5-flash y gemini-2.5-flash-lite, y únicamente gemini-2.5-flash-image dejará de estar disponible el 2 de octubre de 2026. Para cualquier proyecto nuevo, Google recomienda Gemini 3.5 Flash-Lite o Gemini 3.8 Flash.
🔗 Notas de la versión de la API de Gemini · Página de obsolescencias de Gemini
Hugging Face ejecuta los GGUF de llama.cpp en Transformers
22 de septiembre — Hugging Face permite ahora ejecutar eficientemente en Transformers los archivos GGUF, el formato de cuantificación de llama.cpp. Basta con pasar el archivo a from_pretrained (parámetro gguf_file): los pesos permanecen comprimidos en memoria y los cálculos pasan por los kernels Metal de ggml, distribuidos desde el Hub por la biblioteca kernels. El comando transformers serve expone después el modelo mediante una API compatible con OpenAI.
El alcance inicial es limitado: solo Mac Apple Silicon, arquitectura Qwen3.5 en versiones dense y MoE (además de los checkpoints Qwen3.8 compatibles), una conversación a la vez e instalación desde la rama main. Cuatro kernels proceden de ggml y un quinto, escrito por Hugging Face, gestiona el enrutamiento de los expertos. En un MacBook Pro M2 Max, Hugging Face considera que Transformers está «cerca» de llama.cpp, con valores presentados únicamente en un gráfico y mediciones no idénticas (prellenado incluido en un caso y solo decodificación en el otro); el equipo sigue recomendando llama.cpp para una inferencia local eficiente. El interés está en otra parte: manipular un GGUF con las herramientas habituales de PyTorch o partir de un GGUF descuantificado para un ajuste fino.
| Variante GGUF (Qwen3.5-4B, Unsloth) | Tamaño del archivo | Compromiso indicado |
|---|---|---|
| BF16 | 8,42 GB | Referencia sin cuantificar |
| Q6_K | 3,53 GB | Mayor precisión |
| Q5_K_M | 3,14 GB | Compromiso entre tamaño y precisión |
| Q4_K_M | 2,74 GB | Punto de partida recomendado para uso local |
🔗 Transformers ahora ejecuta cuantizaciones de llama.cpp
Kimi: K3 en Amazon Bedrock y una extensión de navegador con nuevo nombre
Kimi K3 llega a Amazon Bedrock
22 de septiembre — Moonshot AI anuncia la llegada de Kimi K3 a Amazon Bedrock; sin embargo, la ficha de AWS fecha este lanzamiento el 18 de septiembre. El modelo de pesos abiertos, publicado a finales de julio con un contexto de un millón de tokens, se beneficia allí de los controles de acceso, cifrado y auditoría de Bedrock. Se ofrece mediante inferencia entre regiones (cross-Region inference) estadounidense y global (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), y su almacenamiento explícito en caché comienza a partir de 1.024 tokens por punto de caché, durante al menos 30 minutos. Los niveles Priority (1,75 veces la tarifa) y Flex (0,5 veces) se aplican sobre los precios base.
| Opción de inferencia (nivel Standard) | Entrada por millón de tokens | Salida por millón de tokens | Lectura de caché |
|---|---|---|---|
| Inferencia global | 3,00 dólares | 15,00 dólares | 0,30 dólares |
| Inferencia estadounidense | 3,30 dólares | 16,50 dólares | 0,33 dólares |
🔗 Ficha de Kimi K3 en Amazon Bedrock · Kimi K3 en Bedrock, anuncio en X
Kimi WebBridge se convierte en Kimi Browser Extension
22 de septiembre — La extensión de navegador aparecida en junio con Kimi Work cambia de nombre e incorpora una barra lateral desde la que se conversa con Kimi para que navegue por sitios web, rellene formularios y complete tareas. Las tareas repetitivas se registran una vez y se guardan como skill, que Kimi reutiliza la vez siguiente; la extensión también descompone las páginas web en comandos. Un servicio local controla el Chrome o Edge que ya está abierto mediante Chrome DevTools Protocol, y Moonshot afirma que las sesiones iniciadas y el contenido de las páginas no salen del dispositivo. Solo la barra lateral requiere una cuenta de Kimi.
🔗 Kimi Browser Extension · Kimi Browser Extension, anuncio en X
SpaceXAI: Grok Bot absorbe el aumento de los tickets de soporte
22 de septiembre — SpaceXAI publica un informe sobre su propio soporte al cliente, reconstruido en torno a Grok Bot, su agente que trabaja con las herramientas de la empresa. Desde que Cursor se incorporó a SpaceXAI el 14 de agosto, los dos equipos de soporte se han fusionado y cubren muchos más productos. Según la publicación, el volumen de tickets aumentó un 175 % sin ninguna contratación, cuando quizá habría sido necesario contratar a 200 personas; no se especifica el periodo de medición.
El despliegue fue progresivo: conectado a Plain para los tickets y a Linear para los incidentes, Grok Bot se limitó inicialmente a las notas internas, con cada acción de escritura validada por una persona, y después procesó los tickets sencillos antes de responder directamente a los clientes desde el final del primer día. Actualmente realiza una investigación preliminar de cada ticket entrante, reproduce los problemas en vídeo para el equipo de ingeniería y sintetiza cada día más de 20.000 comentarios sobre productos.
| Indicador publicado por SpaceXAI | Valor anunciado |
|---|---|
| Aumento de los tickets de soporte | +175 % |
| Contrataciones evitadas (estimación) | 200 |
| Coste por resolución de las herramientas clásicas | De 1 a 4 dólares |
| Coste por ticket con Grok Bot, como mínimo | De 0,20 a 0,30 dólares |
| Reembolsos procesados sin intervención humana | 99 % |
🔗 Cómo utiliza SpaceXAI Grok Bot para ampliar el soporte al cliente
Cognition: rumbo a América Latina y nuevas notas de la versión de Devin
Cognition se establece en América Latina desde São Paulo
22 de septiembre — En una publicación de su equipo de América Latina, Cognition repasa el anuncio realizado la semana anterior en el MASP, el museo de arte de São Paulo: la empresa se expande por la región, con un equipo basado en São Paulo y nuevas contrataciones, en particular de ingenieros desplegados con los clientes (deployed engineers). Se apoya en clientes ya existentes, entre ellos Itaú, Nubank, Santander, Natura y EBANX. En Itaú, según Cognition, más del 75 % de los equipos tecnológicos utilizan Devin, que ha documentado más de 300.000 repositorios y resuelto automáticamente alrededor del 70 % de las vulnerabilidades; en Nubank, la migración de un monolito de varios millones de líneas habría pasado de varios años a unas semanas, con un coste más de veinte veces inferior. Estos resultados son los publicados por Cognition, sin fuentes externas.
🔗 Construyendo el futuro de la ingeniería de software en América Latina
Las notas de la versión de Devin del 21 de septiembre
21 de septiembre — Publicadas después de nuestra edición anterior, las notas de la versión de Devin incorporan SWE-2, el modelo de código de Cognition lanzado el 10 de septiembre, como versión preliminar de investigación (research preview) en el selector de agentes: se eligen SWE-2 y un nivel de esfuerzo (Medium, High o Max) al iniciar una sesión o durante esta, y !swe2 hace lo mismo en Slack. Los servidores MCP de Microsoft 365 (Mail y Contacts, Calendar, To Do, OneDrive y SharePoint, Teams y directorio de Entra ID) se incorporan al marketplace de MCP, en modo de solo lectura de forma predeterminada si no se configura un ámbito de OAuth. Devin Review se abre a Bitbucket Data Center, los plugins pueden alcanzar 20 MiB y 2.500 archivos, y se retira la CLI independiente npx devin-review: las copias ya instaladas dejan de funcionar.
🔗 Notas de la versión de Devin del 21 de septiembre
Genspark incorpora su benchmark de presentaciones al índice SII de Fireworks AI
22 de septiembre — Fireworks AI lanza el Specialized Intelligence Index (SII), un índice de 20 benchmarks de trabajo real distribuidos en siete ámbitos (seguridad, derecho, finanzas, soporte al cliente, software, salud y productividad) y creados por profesionales; Harvey, Doximity, Mercor, Sierra, Decagon y Genspark figuran entre las doce empresas participantes. Como único benchmark de la categoría de productividad, Genspark Slides Benchmark hace que once modelos creen presentaciones para 200 tareas reales, dentro del entorno del agente Genspark Slides; las puntuaciones proceden del evaluador interno de Genspark. Para Gen-1 Slides, su modelo propio, Genspark retoma el argumento de que su precio de entrada es aproximadamente una decimoséptima parte del de Claude Opus 5.
| Modelo evaluado | Puntuación en el índice SII | Puntuación de la publicación de Genspark del 10 de septiembre | Coste por presentación en el índice |
|---|---|---|---|
| Claude Fable 5.1 | 83,6 % | fuera de la tabla, aventaja a Gen-1 Slides en 0,003 según el texto | no mostrado |
| Gen-1 Slides | 82,2 % | 0,821 | 0,44 dólares |
| Claude Opus 5 | 81,0 % | 0,810 | 4,16 dólares |
| Claude Fable 5 | 79,9 % | fuera de la tabla | no mostrado |
| GPT-6 Astra | 78,0 % | fuera de la tabla | no mostrado |
| Kimi K3 | 72,6 % | 0,723 | 2,00 dólares |
| GPT-5.6 Sol | 67,0 % | 0,668 | 2,01 dólares |
| MiniMax M3 | 56,1 % | 0,563 | 0,34 dólares |
🔗 Specialized Intelligence Index · Anuncio de Genspark
Runway lanza DIFFUSE, una plataforma de contratación para creativos formados en IA
22 de septiembre — Runway lanza DIFFUSE (diffuse.runway.com), una plataforma abierta donde marcas, agencias y estudios buscan, contactan y contratan talento formado en herramientas de IA generativa (AI-native talent). Los creativos, profesionales independientes, estudios boutique o productoras crean allí un perfil y alojan su portfolio; no se comunica ninguna tarifa.
Runway se basa en su propio estudio de más de 1.000 ofertas de empleo creativo publicadas por cerca de 400 empresas: el 17 % menciona competencias en IA o herramientas generativas y, según la empresa, Runway sería con diferencia la herramienta de vídeo más solicitada. Runway reconoce que la IA está desplazando parcialmente los oficios creativos, pero afirma que se está formando una nueva fuerza laboral creativa en torno a estas herramientas y que la demanda de esta se acelera.
🔗 Presentamos DIFFUSE · Runway en X
NVIDIA para desarrolladores: Isaac ROS 5.0, DLSS 5 y RTX Mega Geometry 2.0
Isaac ROS 5.0 apuesta por los agentes
22 de septiembre — Presentada en la conferencia ROSCon de Toronto, Isaac ROS 5.0, la colección gratuita y open source de paquetes ROS acelerados por GPU de NVIDIA, es compatible con ROS Lyrical y Ubuntu 24.04 y cubre toda la gama Jetson, desde Jetson Orin Nano hasta Jetson Thor. La principal novedad se centra en los agentes: skills reutilizables de Isaac para la instalación y la manipulación, documentación legible por agentes, una skill que ayuda a un agente a ajustar el modelo de visión estéreo FoundationStereo para sus propias cámaras y una skill autónoma de recogida y colocación (pick and place). FoundationPose recibe una biblioteca de inferencia que sigue la posición y la orientación de los objetos hasta 5,5 veces más rápido, sin que NVIDIA especifique la referencia de comparación.
DLSS 5 detallado para los estudios, RTX Mega Geometry 2.0 disponible
22 de septiembre — Ya disponible en NBA 2K27, DLSS 5 se detalla para los desarrolladores: su renderizado neuronal guiado por 3D (3D-Guided Neural Rendering) se inserta como última etapa del pipeline, parte de la imagen renderizada por el motor y se apoya en el color y los vectores de movimiento para añadir iluminación y detalles de materiales, fotograma a fotograma y de manera determinista, en una sola GeForce RTX serie 50 hasta 4K. Los estudios ajustan la intensidad de estructura (Structure Intensity) y de tono (Tone Intensity) y disponen de enmascaramiento semántico mediante IA. La misma publicación añade a ACE dos modelos de 600 millones de parámetros, Nemotron Speech 3.5 Streaming (reconocimiento de voz) y Qwen3 TTS (síntesis de voz), publica RTX Kit 2026.3 y pone a disposición RTX Mega Geometry 2.0, con streaming de clústeres de nivel de detalle continuo para mallas muy densas.
🔗 Novedades para desarrolladores de videojuegos
NVIDIA y la inferencia: Dynamo-Triton multi-GPU y computación confidencial en B200
Dynamo-Triton 26.07 sirve un modelo distribuido entre ocho GPU
21 de septiembre — NVIDIA muestra cómo servir un modelo TensorRT distribuido entre varias GPU como un modelo ordinario. La inferencia multi-GPU de TensorRT (multi-device inference), plenamente compatible a partir de TensorRT 11.0, se basa en NCCL; Dynamo-Triton 26.07, anteriormente Triton Inference Server, la habilita en su backend TensorRT, y la aplicación solo llama a un único endpoint gRPC. En la generación de vídeo de Cosmos 3 Nano (1280×720, 189 fotogramas, 35 pasos), la latencia de extremo a extremo pasa de 156,6 segundos con una GPU a 34,2 segundos con ocho, es decir, es 4,58 veces menor. NVIDIA precisa que la prueba no mide ni el rendimiento con solicitudes simultáneas ni el coste por vídeo.
| Configuración probada | Número de GPU | Latencia media de extremo a extremo |
|---|---|---|
| Una GPU | 1 | 156,595 s |
| CP2 | 2 | 87,999 s |
| CP4 | 4 | 53,093 s |
| CP8 | 8 | 34,183 s |
🔗 Dynamo-Triton y TensorRT multi-GPU
La inferencia confidencial en B200 conserva más del 96 % del rendimiento
22 de septiembre — NVIDIA mide el coste de su Confidential Computing en Blackwell, que ejecuta las cargas en máquinas virtuales con memoria cifrada, GPU confidenciales y NVLink cifrado. En un DGX B200 (ocho GPU, plataforma Intel TDX) que sirve DeepSeek-R1 en NVFP4 con TensorRT LLM, con 32.000 tokens de entrada y 1.000 de salida, el modo confidencial conserva entre el 96,1 y el 98,2 % del rendimiento y solo aumenta el tiempo medio por token de salida entre un 1,2 y un 4,3 %, con entre 1 y 16 solicitudes simultáneas. Fueron necesarias tres adaptaciones del framework: memoria paginable en lugar de anclada para ciertas transferencias, contador interno de la GPU para el autotuner de kernels y otros algoritmos de comunicación debido a la ausencia de multidifusión NVLink SHARP en este modo. La carga se eligió para hacer visible el sobrecoste; NVIDIA aconseja comparar ambos modos con la carga propia.
🔗 Computación confidencial y TensorRT LLM
Breves
- Zed prepara Delta — Zed anuncia para esta semana, aunque todavía no están disponibles, colores para agrupar los hilos de Delta, su entorno de código multijugador con agentes, y un indicador que muestra la distancia restante hasta la compactación automática del contexto. 🔗 fuente
- Replit y Handshake — Replit es socio fundador del AI Skills Studio de Handshake: tres misiones gratuitas de 45 minutos conducen a un proyecto que se muestra en el perfil de Handshake; OpenAI (10 misiones), Google, Figma y Vercel figuran entre los demás socios. 🔗 fuente
- oMLX se une a Hugging Face — Jun Kim, creador de oMLX, un proyecto del ecosistema MLX de Apple, se une a Hugging Face; el proyecto continúa bajo Apache 2.0, sigue dirigido por él, pasa a contar con mantenimiento y financiación, y busca primero acelerar la conversión de modelos Transformers a MLX. 🔗 fuente
- SnowLLM — Publicación de la comunidad: este motor de inferencia bajo Apache-2.0 (kernels distribuidos como binarios), escrito para la GPU de los Ryzen AI Max, decodifica hasta 2,3 veces más rápido que llama.cpp (1,9 veces sin decodificación especulativa) y realiza el prefill hasta 9,4 veces más rápido, según sus autores. 🔗 fuente
- DecisionBench y Bosun v3.1 — Hanno Labs publica DecisionBench 1.0 (43 tareas, 28 ámbitos) y dos modelos de decisión de pesos abiertos basados en Qwen3 (0,6 y 1,7 mil millones de parámetros), con un 83,20 % y un 87,29 % en su propia suite aplicada; Jev los supera en la categoría de razonamiento. 🔗 fuente
- Un Moshi de 600 millones de parámetros — Un desarrollador relata su intento de crear un modelo de voz full-duplex basado en Qwen3-0.6B-Base, entrenado por entre 2 y 15 dólares por prueba en B200: el texto converge, pero la voz continúa distorsionada, un bloqueo localizado en los codebooks acústicos finos. Proyecto en pausa, sin pesos publicados. 🔗 fuente
- Together AI y GLM-5.2 — En un estudio de caso del 18 de septiembre, republicado en X el día 21, Together AI describe una fintech que ejecuta sus agentes de código en GLM-5.2 con un contexto de 256K y 56 B200; un incidente de cola de espera de entre 1 y 3 minutos se corrigió ese mismo día mediante una reconfiguración del enrutamiento. 🔗 fuente
- Gemini CLI — La nightly del 22 de septiembre, la primera con código nuevo desde el día 19, corrige el fallo
HttpsProxyAgent is not a constructorcon Vertex AI detrás de un proxy y emite la actualizacióntool_callantes de solicitar permiso en modo ACP. 🔗 fuente - Google Flow — La cuenta oficial afirma tener más de 25 millones de usuarios al mes y amplía para todos los 50 créditos diarios adicionales, una oferta reservada en julio a los suscriptores de Google AI hasta el 31 de agosto. 🔗 fuente
- Jigsaw y Sensemaking AI — La incubadora de Google lanza su Partner Program para desplegar en 30 ciudades, estados y países su suite open source de consulta ciudadana, impulsada por Gemini, con un fondo de Google.org, Bloomberg Philanthropies y Packard Foundation cuyo importe no se ha publicado. 🔗 fuente
- 100 000 becas de formación — Al margen de la Asamblea General de las Naciones Unidas, Google financia 100 000 becas de formación certificada en IA en más de 80 países mediante la AI Skills Coalition del programa AI for Good de la UIT, distribuidas por los gobiernos locales y la red Giga. 🔗 fuente
- Agentes que protegen el código de Google — En una publicación del 19 de septiembre, Google explica que analiza antes de su envío cada modificación del código de su infraestructura mediante agentes creados sobre su arnés open source Mantis, que bloquean cientos de vulnerabilidades al mes; el agente de clasificación anuncia más de un 92 % de precisión en menos de un minuto. 🔗 fuente
- Copilot CLI 1.0.88 — Los ajustes gestionados por la empresa se aplican ahora a las sesiones
--acp,--ahp-hosty--server, que hasta ahora carecían de políticas MCP, permisos y plugins, y/forkfunciona durante un turno; la versión 1.0.87 del 21 de septiembre incorporaba ajustes gestionados para el nivel de enrutamiento Auto. 🔗 fuente - Pika y Seedance 2.5 — El modo Draft de Seedance 2.5 llega a Pika y al Pika API Club: borradores de clips a partir de 10 centavos por segundo, que después pueden finalizarse en alta calidad. 🔗 fuente
- Pika Swap Anything — Nueva aplicación de Pika que sustituye actores, vestuario, decorados o accesorios de un vídeo conservando el ritmo, los movimientos y la narración de la toma original, sin precio anunciado. 🔗 fuente
- Suno Studio — La estación de producción musical de Suno incorpora una suite de efectos de audio, entre ellos un compresor (umbral, ratio, ataque, liberación, sidechain), incluido en la suscripción Premier. 🔗 fuente
- Sluicebox y Nemotron 3 Ultra — Estudio de caso de NVIDIA: al adoptar Nemotron 3 Ultra, esta empresa emergente de análisis de carbono de las cadenas de suministro reduce sus costes de inferencia entre un 51 y un 80 % y alcanza un 87,7 % en la extracción de datos de proveedores, frente al 84 % de su modelo anterior. 🔗 fuente
- Topograph — Conjunto de herramientas open source de NVIDIA que descubre la topología de red de un clúster de GPU y la publica para Kubernetes, Slurm y Slinky, con el fin de situar las cargas distribuidas lo más cerca posible unas de otras; consulta las API de Crusoe, Google Cloud, Lambda, Nebius, Nscale y Oracle Cloud. 🔗 fuente
- Evaluar un agente — En una publicación metodológica del 21 de septiembre, NVIDIA propone seis métricas, desde la llamada a una herramienta hasta la tarea completada, y menciona que Nemotron 3.5 Lightning alcanza un 86 % en PinchBench y es un 30 % más rápido que Qwen3.6 35B. 🔗 fuente
- Qwen-Image-2.1 en Intel — Anunciada por Intel el 21 de septiembre y difundida por Qwen el día 22, la compatibilidad desde el primer día mediante OpenVINO está destinada a las GPU Arc Pro B70 y a las GPU integradas de los Core Ultra Series 3, con un notebook específico. 🔗 fuente
- Box y Grok 4.7 — El 21 de septiembre, día del lanzamiento de Grok 4.7, Box lo probó en una versión preliminar de Box Agent con un siniestro de 2 millones de dólares: detectó una factura duplicada de 82 000 dólares y un abono pendiente de 64 000 dólares; no se anunció fecha de disponibilidad ni precio. 🔗 fuente
- Un cirujano y Codex — OpenAI Developers publica un vídeo en el que Brian Pridgen, cirujano de la mano, muestra cómo crea sus propias herramientas con Codex y revisa la literatura científica en PubMed, sin cifras ni estudio escrito. 🔗 fuente
- ChatGPT en Word — Anunciado el 17 de septiembre: un único complemento de Microsoft permite acceder a ChatGPT desde Word, Excel y PowerPoint, en todo el mundo y con todos los planes, incluido Free, con límites de uso; Business y Enterprise disponen de una versión preliminar gratuita de GPT-5.6 Sol en Word hasta el 30 de septiembre. 🔗 fuente
- Alfabetización en IA — Perplexity publica una guía que considera la evaluación de las respuestas como la competencia clave, critica el «teatro de la formación» y cita a Gallup: un 38 % de adopción declarada, pero un 12 % de uso diario en el cuarto trimestre de 2025. 🔗 fuente
Qué significa
Ese mismo día, Anthropic y OpenAI defendieron el mismo argumento: no un modelo más potente a cualquier precio, sino un nivel cercano al de su gama alta por mucho menos dinero. Opus 5.5 se presenta al nivel de Fable 5.1 por un 40 % menos que Opus 5, y GPT-6 Sol como un modelo que conserva gran parte de las fortalezas de Astra por 2 y 10 dólares por millón de tokens. Ambos proveedores razonan ahora en términos de coste por tarea en lugar de precio por token y convierten la caché en la verdadera palanca: lecturas a 0,20 dólares en Anthropic, descuentos de hasta el 90 % y puntos de interrupción explícitos en OpenAI.
La integración, por su parte, se mide en horas. GitHub Copilot, Devin, Perplexity, Cursor y v0 ofrecieron los nuevos modelos ese mismo día, cada uno con su propia medición: FrontierCode 1.1 Extended en Cognition, WANDR en Perplexity y CursorBench en Cursor. Estas cifras no son directamente comparables (65,3 % para Opus 5.5 en la variante Extended y 54,4 % en la variante Main), y ninguno de los dos proveedores compara todavía su nuevo modelo con el del otro. Para un desarrollador, la elección adecuada depende cada vez más de su herramienta y de sus tareas que de las tablas de lanzamiento.
Los planes también se están convirtiendo en un campo de diferenciación. Anthropic aumenta sus límites durante cinco horas, ofrece un restablecimiento y cambia Pro y Team Standard a Opus en Claude Code; GitHub reserva Opus 5.5 para los planes superiores, pero ofrece GPT-6 Luna desde Copilot Pro; Google incorpora Colab a sus planes Google AI mientras restringe Gemini 2.5 para preservar su capacidad. La distribución de la capacidad de cómputo entre los planes pesa ahora tanto como el precio anunciado.
Por último, la propia forma de medir está cambiando. Anthropic reconoce que las diferencias en los benchmarks orientan peor que antes y que Opus 5.5 a menudo parece saber que está siendo evaluado; OpenAI establece reglas para abrir sus modelos a evaluadores independientes; el AISI británico hace reproducibles sus resultados con EvalEval, y NVIDIA propone evaluar a un agente por la tarea completada en lugar de por cada llamada a una herramienta. Comprobar lo que realmente hace un modelo importa ahora tanto como su puntuación.
Fuentes
- Presentación de Claude Opus 5.5 (Anthropic)
- @claudeai: lanzamiento de Claude Opus 5.5
- Novedades de Claude Opus 5.5 para la API
- Claude Code v2.1.280
- Cuánto cuesta una tarea en Opus 5.5
- Cómo aprovechar al máximo Opus 5.5
- Presentación de GPT-6 Sol y Luna (OpenAI)
- @OpenAI: lanzamiento de GPT-6 Sol y Luna
- Mejor almacenamiento en caché de prompts para GPT-6
- Claude Opus 5.5 en GitHub Copilot
- GPT-6 Sol y GPT-6 Luna en GitHub Copilot
- Claude Opus 5.5 en Devin
- GPT-6 Sol y Luna en Devin
- Grok 4.7 en Devin
- @v0: Grok 4.7 en v0
- @perplexity_ai: Opus 5.5 en Computer
- @perplexity_ai: GPT-6 Sol en Computer
- Registro de cambios de la API de Perplexity
- @cursor_ai: Opus 5.5 en Cursor
- @v0: Opus 5.5 en v0
- @ClaudeDevs: límites de Claude Code
- @ClaudeDevs: restablecimiento de los límites
- Codex CLI 0.156.0
- Vibe CLI v2.25.7
- CHANGELOG de Vibe CLI
- Qwen Code v0.24.4
- Un Runner, muchos Worktrees (Amp)
- Prioridades y principios para evaluaciones eficaces de terceros (OpenAI)
- Cómo UK AISI y EvalEval hacen reproducibles los resultados de los benchmarks
- @ChatGPT: puntuación crediticia de Experian
- Colab ahora forma parte de tu plan Google AI
- Preguntas frecuentes de Colab
- Notas de la versión de la API de Gemini
- Página de obsolescencias de Gemini
- Transformers ahora ejecuta las cuantizaciones de llama.cpp
- Ficha de Kimi K3 en Amazon Bedrock
- @Kimi_Moonshot: Kimi K3 en Bedrock
- Extensión de navegador de Kimi
- @Kimi_Moonshot: extensión de navegador de Kimi
- Cómo SpaceXAI utiliza Grok Bot para ampliar la atención al cliente
- Construir el futuro de la ingeniería de software en América Latina (Cognition)
- Notas de la versión de Devin del 21 de septiembre
- Índice de inteligencia especializada (Fireworks AI)
- @genspark_ai: benchmark de Genspark Slides en el SII
- Presentación de DIFFUSE (Runway)
- @runwayml: lanzamiento de DIFFUSE
- Isaac ROS 5.0 (NVIDIA)
- Novedades para desarrolladores de videojuegos (NVIDIA)
- Dynamo-Triton y TensorRT multi-GPU (NVIDIA)
- Computación confidencial y TensorRT LLM (NVIDIA)
- @zeddotdev: novedades de Delta
- @Replit: AI Skills Studio de Handshake
- Jun Kim se une a Hugging Face (oMLX)
- SnowLLM
- DecisionBench y Bosun v3.1 (Hanno Labs)
- Reducción del habla full-duplex
- Estudio de caso de Together AI (Dedicated Model Inference)
- Gemini CLI v0.62.0-nightly.20260922
- @FlowbyGoogle: 25 millones de usuarios
- Sensemaking AI y Jigsaw Partner Program (Google)
- Invertir en el talento global y la alfabetización en IA (Google)
- Uso de IA agéntica para proteger el código de infraestructura (Google Cloud)
- Copilot CLI v1.0.88
- @pika_labs: modo Draft de Seedance 2.5
- @pika_labs: Swap Anything
- Acerca de la compresión (Suno)
- Estudio de caso de Sluicebox (NVIDIA)
- Topograph (NVIDIA)
- Cómo evaluar agentes de IA (NVIDIA)
- Qwen-Image-2.1 en hardware Intel (OpenVINO)
- @Box: Grok 4.7 en Box Agent
- @OpenAIDevs: un cirujano y Codex
- @ChatGPT: ChatGPT en Word
- Alfabetización en IA (Perplexity)