Buscar

Qwen-Image-2.1 unifica generación y edición con pesos abiertos, el sandbox de Antigravity llega a Windows, trece verificadores en un único conjunto de pruebas

Artículo generado por inteligencia artificial
Qwen-Image-2.1 unifica generación y edición con pesos abiertos, el sandbox de Antigravity llega a Windows, trece verificadores en un único conjunto de pruebas

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.6-sol.

Ver proyecto en GitHub ↗

El sábado y el domingo, los laboratorios guardaron silencio: ni DeepSeek, ni Meta, ni Ai2, ni Sakana, ni Mistral, ni xAI publicaron nada, y las cuentas oficiales del ámbito de los modelos abiertos permanecieron vacías durante dos días. Un único lanzamiento real: Qwen-Image-2.1, publicado el domingo a media tarde con pesos abiertos. El grueso del resto se resume en cinco entradas del blog comunitario de Hugging Face, una versión de Antigravity que no corrige nada y dos entradas del changelog de GitHub recuperadas del 18 de septiembre: una jornada tranquila que no hay motivo alguno para exagerar.


Qwen-Image-2.1, un único modelo para generar, editar y ofrecer transparencia

20 de septiembre — Qwen publicó Qwen-Image-2.1, su modelo de generación y edición de imágenes, con pesos abiertos en Hugging Face, ModelScope y GitHub. El argumento no es el tamaño, sino la unificación: una misma serie de pesos abarca la creación a partir de una instrucción textual y el retoque de imágenes existentes, cuando estos dos usos requerían anteriormente dos modelos.

La novedad más concreta es la transparencia nativa: el modelo produce y modifica directamente capas RGBA, y es la instrucción la que determina si la salida incluye un canal de transparencia. Qwen ofrecía esta capacidad desde diciembre de 2025 mediante un modelo específico, Qwen-Image-Layered, ahora absorbido. Desaparece un paso de recorte: extraer de una fotografía un sujeto como capa reutilizable o sustituir el texto de una capa transparente.

En cuanto a la edición, el modelo admite hasta 10 imágenes de referencia para una misma composición, y el área que debe retocarse puede indicarse mediante un círculo de color, una anotación pintada o una máscara proporcionada por separado; esta tercera opción existe porque las dos primeras cubren el contenido original. La eficiencia se basa en una atención de granularidad mixta, donde las entradas de edición forman un contexto estático que se almacena en caché desde la primera etapa.

Elemento técnicoValor anunciado
Parámetros de generación visual7.000 millones, sobre 32 capas Single-Stream DiT
Imágenes de referencia admitidas10 como máximo
Transparencia de las salidasCapas RGBA nativas, tanto al generar como al editar
Modelo específico absorbidoQwen-Image-Layered, publicado en diciembre de 2025
Compatibilidad desde el primer díavLLM-Omni y ComfyUI

Qwen publica una comparación en Qwen-Image-Bench, pero sus valores solo aparecen en una imagen de la entrada, por lo que no se reproducen aquí.

Generate, edit, and create transparent images with one model: a 7.1B DiT paired with Qwen3-VL-8B.

🇪🇸 Generar, editar y crear imágenes transparentes con un único modelo: un DiT de 7.100 millones de parámetros combinado con Qwen3-VL-8B.@vllm_project en X

🔗 Anuncio


Qwen Code v0.24.2, voz completa en Web Shell y un sandbox bwrap que se amplía

Mismo editor, mismo día, producto sin relación. 20 de septiembre — publicada poco más de veinticuatro horas después de la v0.24.1, la v0.24.2 del agente de programación de línea de comandos de Qwen es la primera de su serie sin ningún cambio incompatible, cuando cada una de las dos anteriores incluía uno.

El sandbox bubblewrap recibe una base de ejecución completa: lanzamiento estructurado de procesos, supervisión y workers confinados. En la misma línea, un espacio de trabajo cuyo nivel de confianza no esté decidido exige ahora una decisión explícita. Web Shell, por su parte, hace que la función Live Voice sea realmente utilizable: el modelo y la voz se eligen desde la tarjeta de configuración, y el nivel del micrófono se muestra durante la llamada. Para quienes ejecutan varias sesiones en paralelo, cada mensaje entrante se evalúa ahora para la sesión a la que está dirigido, y la caché de prompts se conserva para las herramientas diferidas.

🔗 Notas de la versión


Verificar una respuesta sin escribir un token y una clasificación cuyo autor es juez y parte

20 de septiembre — Dos entradas, el mismo día, sobre el mismo conjunto de 2.018 elementos. La primera presenta Zero-Token Confidence: una sonda lee el último estado oculto del modelo en una pasada hacia delante y extrae de él una probabilidad calibrada, sin generar ningún token. Preguntarle si está seguro obtiene 0,5000 de área bajo la curva, es decir, puro azar; leer su estado interno obtiene 0,8801, en 0,0615 segundos frente a los 1,631 necesarios para generar una respuesta. La segunda somete a prueba trece verificadores: solo tres superan 0,70, y ZTC aventaja a JEV por 0,0014, una diferencia indistinguible.

El dato más sólido está en otra parte: una referencia que solo examina la longitud y el formato de la respuesta, nunca su contenido, alcanza 0,7036 y supera a ocho de los trece sistemas. Una salvedad: el autor de la clasificación no es un tercero neutral; indica que también evalúa su propio sistema, sin decir cuál de los trece es, y las dos entradas aparecen el mismo día. Las cifras pueden ser exactas; la independencia de la clasificación, en cambio, no está demostrada.

🔗 ZTC · clasificación


Un LoRA de 54 dólares que corrige y rompe al mismo tiempo

20 de septiembre — ScalablyAI entrenó, por 53,88 dólares, dos adaptadores LoRA sobre Qwen3.8-27B a partir de los 143.145 bloques de uso de herramientas recopilados por su plataforma de agentes, y después los evaluó con una batería congelada antes del primer paso de entrenamiento.

El resultado tiene dos caras. En 73 estados de recuperación tras una llamada de herramienta rechazada, el adaptador pasa de 31 a 38 éxitos, con siete casos que cambian a su favor y ninguno en contra. Pero en 73 decisiones de trayectoria correcta, retrocede de 49 a 45, cinco puntos y medio frente a un límite fijado en dos. Como descargar un adaptador es una operación atómica, evitar el retroceso obligaba a renunciar a la mejora: ambos fueron rechazados. De ahí la arquitectura adoptada: 433 reglas de memoria editables por un lado y los pesos sin tocar por el otro.

If every useful experience immediately changes the weights, learning and corruption can become the same operation, and at production sample sizes you cannot tell which one you performed.

🇪🇸 Si cada experiencia útil modifica inmediatamente los pesos, aprender y corromper pueden convertirse en la misma operación y, con los tamaños de muestra disponibles en producción, no se puede saber cuál de las dos se acaba de realizar.pavle-scalably en el blog de Hugging Face

🔗 Informe completo y registro de pruebas


SeamFlow coloca las costuras UV donde las pondría un artista

20 de septiembre — Desplegar una superficie 3D en 2D obliga a cortarla; un buen despiece coloca esas costuras donde menos se verán. SeamFlow, presentado por Meshy AI junto con la City University of Hong Kong, Bambu Lab y la Nanyang Technological University, cambia la representación antes del modelo: cada arista de la malla se convierte en un token y la etiqueta binaria se relaja hasta convertirse en un valor continuo, lo que permite aplicar el emparejamiento de flujos (flow matching).

Las ventajas son estructurales: ya no hay etapa de proyección ni orden arbitrario de los tokens, y cada corte predicho coincide con una arista existente. Entrenado con 350.000 mallas de Objaverse cuyas costuras fueron creadas por profesionales, el modelo coloca los cortes en los pliegues: el ángulo diedro medio a lo largo de las costuras alcanza 67,59 grados, frente a 56,65 de xatlas y 55,97 de PartUV. Realiza el despliegue en 5,63 segundos, frente a 11,46 de una referencia autorregresiva, y es la primera opción preferida en el 61,0 % de los casos, frente al 19,1 % del siguiente.

🔗 SeamFlow


Antigravity 2.15.1 abre el sandbox en Windows, sin activarlo

19 de septiembre — La versión 2.15.1 de Antigravity se resume en una línea: el sandbox de archivos y red llega a Windows. Una única mejora, ninguna corrección, mientras que la 2.15.0 del día anterior acumulaba siete y dieciséis, respectivamente: una incorporación específica, no una versión de mantenimiento.

La diferencia respecto al resto de la gama es el verdadero asunto. En Linux, el sandbox se basa en los namespaces del kernel; en macOS, en los perfiles Seatbelt de sandbox-exec; en ambos casos está activo de forma predeterminada. En Windows, la primitiva utilizada no está documentada, la activación sigue siendo manual mediante una casilla «Enable Sandbox Mode (Preview)» y ninguno de los tres ajustes de seguridad ofrecidos —Default, Full machine y Turbo mode— lo activa: marcar la casilla cambia el ajuste a Custom. Google anuncia que los igualará en una versión posterior, sin calendario.

🔗 Changelog de Antigravity


Breves

  • Cinco anotadores, una misma instrucción, cinco respuestas diferentes — en 100 escenas turcas y con una referencia humana de 9 positivos, cinco anotadores automáticos dan entre 0 y 78 positivos, y todos los kappas de Cohen permanecen entre 0,000 y 0,185 pese a un acuerdo bruto de entre el 74,7 y el 86,3 %. El autor, que declara ser el creador del esquema evaluado, recuerda que un diseñador no es un juez neutral de la transferibilidad de su propio esquema. 🔗 fuente
  • La nightly de Gemini CLI del 20 de septiembre no contiene ningún cambio — la etiqueta v0.62.0-nightly.20260920.gcfbcaa8df apunta al mismo commit que la del día anterior, con el mismo sufijo de hash, y la página de la versión no muestra ninguna sección «What’s Changed». Los canales stable (v0.60.0) y preview (v0.61.0-preview.0) tampoco han cambiado. 🔗 fuente
  • Eyeball, el plugin de Copilot CLI escrito por un jurista de GitHub, es open source — la herramienta inserta capturas de pantalla del documento original junto a la cláusula analizada, para que el análisis y su prueba puedan leerse uno al lado del otro. El repositorio dvelton/eyeball es público bajo licencia MIT, está escrito en Python, tiene 35 estrellas y no recibe commits desde el 5 de abril de 2026. 🔗 fuente
  • Tokens de npm limitados a la preparación, desde el 18 de septiembre — el permiso «Read and write (stage only)» permite que una cadena de integración continua deposite una versión mediante npm stage publish sin poder publicarla, ya que la puesta en línea exige la aprobación mediante 2FA de un mantenedor. El bloqueo se aplica en el registro, incluso a un token configurado para eludir la 2FA; npm eliminará esta publicación directa en enero de 2027. 🔗 fuente
  • La regla de cobertura de código puede gestionarse mediante la API REST, también desde el 18 de septiembre — la opción del conjunto de reglas «Restrict code coverage», que impone un umbral mínimo o limita la reducción tolerada en una pull request, alcanza la disponibilidad general en la API y, por tanto, en la infraestructura como código. Está reservada para GitHub Enterprise Cloud y GitHub Team, y no está disponible en GitHub Enterprise Server. 🔗 fuente
  • Wan destaca su función Peel-Off Sticker — la cuenta de Alibaba Wan muestra un componente de wan.video que integra una foto personal en una escena y la anima con Wan 3.0. No es un lanzamiento: el mensaje no incluye fecha de apertura, precio ni medición de calidad. 🔗 fuente
  • Cohere publica cuatro fotos desde la conferencia ALL IN de Montreal — el mensaje del 19 de septiembre señala la presencia de Aston Martin F1 y Magnus Carlsen junto a la empresa. Ningún anuncio de producto, ninguna cifra, ningún enlace. 🔗 fuente

Qué significa

El único lanzamiento de modelo del fin de semana es abierto y consolida en lugar de añadir. Qwen-Image-2.1 no viene a acumularse junto a Qwen-Image-Layered: lo absorbe y hace desaparecer un modelo específico de nueve meses de antigüedad al integrar la transparencia en el modelo principal. El mismo movimiento se produce entre generación y edición, reunidas en una única serie de pesos. Para quienes producen recursos visuales, esto significa una cadena más corta: un modelo que cargar, una capa RGBA directamente utilizable y ninguna etapa de recorte; además, el ecosistema respondió ese mismo día, con vLLM-Omni y ComfyUI operativos desde la publicación.

Tres entradas del domingo cuentan la misma preocupación desde tres ángulos: saber si se puede confiar en lo que produce un modelo y a qué precio. Zero-Token Confidence responde desde el coste: 0,0615 segundos frente a 1,631, porque un verificador que genera tokens compite con el agente por el mismo presupuesto. La clasificación de los trece verificadores responde desde la medición, y su enseñanza resulta desagradable para el sector: una referencia que solo lee la longitud y el formato de una respuesta supera a ocho de trece. El listón que hay que superar para demostrar que un verificador realmente lee es, por tanto, más alto de lo que muestra la mayoría; y el hecho de que su autor reconozca que también evalúa su propio sistema invita a esperar una réplica independiente.

El informe de ScalablyAI añade la dimensión que falta en los otros dos: la reversibilidad. Una actualización de pesos de 54 dólares produjo, en el mismo artefacto, una mejora medida en la recuperación tras un fallo y una posible pérdida en las decisiones correctas, con un tamaño de muestra que impide diferenciarlas en producción. Como no se puede descargar la mitad de un adaptador, hubo que desecharlo todo. La conclusión operativa —el conocimiento barato de revertir vive en archivos de texto; los pesos solo cambian tras superar una batería congelada— es un contrapunto útil al discurso sobre la IA que se mejora a sí misma.

En cuanto a las herramientas, el aislamiento mediante el sistema operativo se convierte en una base y deja de ser una opción. Qwen Code convierte bubblewrap en una base interna de ejecución, Antigravity lleva su sandbox a Windows y npm inventa un token que prepara una versión sin poder publicarla: tres editores que, en tres días, trasladan la seguridad del discurso al valor predeterminado. Con una salvedad en el caso de Windows: un sandbox que debe activarse manualmente y que ninguno de los tres ajustes propuestos habilita aún no es una protección predeterminada, y la diferencia respecto a macOS y Linux seguirá intacta mientras Google no proporcione un calendario.


Fuentes