Pesquisar

Grok 4.7 chega no mesmo dia ao Cursor e ao Copilot, OpenAI revela mais de 100 problemas de matemática resolvidos, Googlebook em pré-venda

ai-powered-markdown-translator

Artigo traduzido do francês para o português com o gpt-5.6-sol.

Ver projeto no GitHub ↗

Na segunda-feira, 21 de setembro, o dia pertence à xAI: o Grok 4.7 é lançado e chega no próprio dia ao Cursor e ao GitHub Copilot, sem demora entre o anúncio do modelo e a sua chegada às ferramentas. A OpenAI escolhe o mesmo dia para revelar que um modelo interno, treinado desde 28 de agosto, resolveu mais de cem problemas de matemática em aberto e para criar um grupo consultivo de matemáticos após uma declaração assinada por 27 medalhistas Fields. A Google abre as pré-vendas do Googlebook, a ElevenLabs coloca um agente de edição no centro do seu editor de vídeo e a Hugging Face relança a sua biblioteca de tokenização, de 3 a 30 vezes mais rápida.


Grok 4.7 é lançado pela xAI e chega no mesmo dia ao Cursor e ao GitHub Copilot

21 de setembro — A xAI lança o Grok 4.7, o seu modelo mais capaz para código e trabalho do conhecimento. O modelo de base é maior do que o do Grok 4.6 e a sua fase de aprendizagem por reforço (reinforcement learning) foi prolongada com uma combinação de tarefas ponderada para problemas de várias horas. A xAI espera assim obter um modelo que verifique melhor o próprio trabalho e lide melhor com contextos longos.

Os números traçam um perfil contrastante, em vez de um domínio absoluto. Já o preço não muda: 2 dólares por milhão de tokens de entrada e 6 de saída, tal como o Grok 4.6, ou seja, metade do preço de entrada do GPT-5.6 Sol e um quinto do Fable 5.1. É nesta relação preço-desempenho que se centra o argumento.

Métrica publicadaGrok 4.7 (xHigh)Grok 4.6 (High)GPT-5.6 Sol (Max)Fable 5.1 (Max)
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
EEBench (engenharia eletrotécnica)64,0 %53,0 %39,4 %56,4 %
Preço de entrada (dólares/M tokens)22410
Preço de saída (dólares/M tokens)662050

A API disponibiliza grok-4.7 com 500 000 tokens de contexto e quatro níveis de esforço de raciocínio, de low a xhigh; o preço duplica acima de 200 000 tokens de prompt. A xAI destaca também um conjunto de salvaguardas totalmente novo: primeiro lugar no benchmark de biossegurança da LatchBio, com 62,4%, e 3,3% de prompts cibernéticos de dupla utilização e de risco que passaram no HackerBench v0.3.

A implementação é imediata em dois integradores. O Cursor disponibiliza o modelo desde o primeiro dia — consequência da aquisição da Anysphere pela SpaceX, concluída em 14 de agosto. O modelo continua a ser da xAI: a publicação divulgada no mesmo dia no blogue do Cursor resume-se a uma frase e remete para o anúncio completo em x.ai. É a xAI que destaca o CursorBench 4.0, o banco de testes de tarefas longas do Cursor, no qual o Grok 4.7 obtém 46,3% sem alteração de preço. Por sua vez, o GitHub Copilot implementa-o em todas as suas plataformas, do VS Code ao Xcode, nos planos Pro a Enterprise. A faturação merece aqui atenção: o Grok 4.7 não está sujeito ao sistema de multiplicadores de pedidos e é faturado à utilização, segundo o preço público do fornecedor. Como um novo modelo é ativado por predefinição, controlar a despesa exige uma ação na política de modelos, e não apenas não fazer nada.

🔗 Grok 4.7 — xAI 🔗 O Grok 4.7 já está disponível no GitHub Copilot


OpenAI cria um grupo consultivo de matemáticos e revela mais de cem problemas em aberto resolvidos

21 de setembro — A OpenAI anuncia que está a trabalhar com um grupo consultivo independente de nove matemáticos, constituído pelos próprios e sediado no Institute for Advanced Study de Princeton. O contexto tem mais peso do que o anúncio.

On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.

🇵🇹 Em 28 de agosto, começámos a treinar um novo modelo interno. Além de resolver o problema do milénio de Navier-Stokes, este modelo já resolveu mais de 100 problemas em aberto de longa data na maioria das áreas da matemática. — OpenAI, Grupo Consultivo sobre Matemática e Inteligência Artificial

O modelo não foi identificado publicamente, e a OpenAI escreve que o ritmo destes progressos surpreendeu os seus próprios matemáticos. Esta aceleração provocou uma reação direta: em 11 de setembro, foi publicada uma declaração intitulada «A Severe Misalignment of AI in Mathematics», com um DOI do Zenodo e a assinatura de 27 medalhistas Fields, entre os quais Terence Tao, Peter Scholze e Cédric Villani. O argumento não é que os modelos estejam errados. Resolver um grande problema sempre foi sinal de uma nova compreensão, posteriormente desenvolvida pela comunidade até poder ser ensinada; os signatários receiam que uma produção em massa de enunciados verdadeiros ou falsos destrua esse terreno fértil em vez de o alimentar e que estes anúncios precipitados não deixem tempo para uma redação adequada.

O mecanismo assenta efetivamente na independência: o grupo pode emitir pareceres não solicitados, comentar publicamente o impacto da OpenAI na matemática e alterar a sua composição sem a aprovação da empresa, e os seus membros não são remunerados por ela. Resta a frase que a OpenAI coloca no fim do mesmo parágrafo: o grupo não aconselhará a empresa sobre o ritmo dos seus progressos internos. O âmbito abrange, portanto, a divulgação dos resultados, não a sua produção — tudo menos aquilo que desencadeou o protesto. Martin Hairer, por sua vez, figura nas duas listas, como signatário da declaração e membro do grupo.

🔗 Um grave desalinhamento da IA na matemática


Googlebook, a gama de computadores portáteis da Google concebida em torno do Gemini

21 de setembro — A Google abre as pré-vendas do Googlebook, que apresenta como uma categoria própria: a pilha tecnológica Android, bases para desktop herdadas do ChromeOS, tudo concebido em torno do Gemini. São lançados simultaneamente cinco modelos, fabricados pela Acer, ASUS, Dell, HP e Lenovo, a partir de 899 dólares. As entregas começam em 4 de outubro nos Estados Unidos e em 5 de outubro no Canadá, Reino Unido, Irlanda, França, Alemanha e Austrália.

Característica anunciadaValor
Preço inicial899 dólares
ProcessadoresIntel Core Ultra Series 3 ou Snapdragon X Elite
NPUmais de 45 TOPS
Memória RAM16 GB de base, até 32 GB
Autonomiaaté 14 h de vídeo, 16 h de navegação na Web
Suporte de softwareatualizações durante até 10 anos

Três funcionalidades do Gemini são exclusivas da máquina. O Magic Pointer, acionado ao agitar o cursor, leva o Gemini até ao elemento apresentado no ecrã — para analisar uma mensagem de correio eletrónico suspeita ou combinar várias imagens — e a Google esclarece que só é ativado mediante pedido e pode ser desativado. O Rambler transforma um ditado desarticulado em texto estruturado, com títulos e listas de tarefas, inclusive quando se muda de idioma a meio de uma frase. O Create My Widget gera widgets para o ambiente de trabalho a partir de uma descrição em linguagem natural.

Para os programadores, cada máquina é fornecida com o Antigravity, a plataforma de agentes de desenvolvimento da Google, e com um ambiente Linux isolado equipado com um terminal completo — a documentação menciona explicitamente a possibilidade de executar nele o Claude Code ou o Antigravity CLI. Este isolamento baseia-se num hipervisor pKVM com certificação Level 5, que a Google apresenta como uma estreia na categoria, complementado pela raiz de confiança de hardware Titan. A continuidade com o telemóvel Android faz o resto: é possível retomar uma tarefa iniciada no dispositivo móvel e transmitir aplicações móveis numa janela do ambiente de trabalho. Cada Googlebook inclui 12 meses de Google AI Pro com 5 TB de armazenamento, 3 meses de YouTube Premium e de Photoshop e um ano de GeForce NOW.

🔗 Pré-vendas do Googlebook


ElevenLabs coloca um agente de edição no Studio 4.0

21 de setembro — A ElevenLabs lança o Studio 4.0 no ElevenCreative, a atualização do seu editor de vídeo. A ideia central resume-se numa frase: tudo é feito no mesmo local. A geração de vídeo, imagem, voz, música e efeitos sonoros é iniciada a partir do próprio projeto, todos os modelos do ElevenCreative podem ser utilizados sem sair do editor, e a edição, a legendagem e depois a exportação sucedem-se na mesma interface. Uma cena pode ser reformulada sem reiniciar toda a geração, e as legendas podem ser manipuladas como qualquer outro clipe na linha temporal (timeline).

A novidade mais estruturante é o Studio Agent, um coeditor presente em cada projeto.

Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.

🇵🇹 O Studio Agent é o seu coeditor de IA, integrado em cada projeto. Descreva a alteração que pretende e ele realiza a edição. Intervenha e faça os seus cortes quando quiser e, depois, devolva a linha temporal ao agente.@ElevenLabs no X

É esta alternância que distingue a ferramenta de uma geração opaca: o editor retoma o controlo quando quiser e depois devolve a linha temporal. Esta foi, aliás, reconstruída para projetos com várias cenas e várias faixas — campanhas publicitárias, tutoriais ou séries de formatos curtos —, com zoom ao nível do fotograma, encaixe de clipes e deslocação de um grupo de clipes sem dessincronizar o restante conteúdo. Os comentários da equipa são colocados num clipe ou asset específico, em vez de ficarem dispersos por conversas separadas.

Uma nota para acompanhamento: no momento da verificação, o anúncio só existia no X, numa thread de seis mensagens. O blogue da ElevenLabs terminava na publicação de 10 de setembro e o changelog da documentação, na entrada do dia 14.

🔗 Studio 4.0 no ElevenCreative


Hugging Face lança tokenizers v1, de 3 a 30 vezes mais rápido com identificadores idênticos

21 de setembro — A Hugging Face lança a versão candidata do tokenizers v1, a biblioteca Rust que transforma texto em sequências de números inteiros antes de um modelo o ler. A constatação inicial é simples: a tokenização nunca foi o estrangulamento dos pipelines de aprendizagem automática, mas o equilíbrio está a mudar à medida que os modelos aceleram, e uma GPU que aguarda pelo processador é uma GPU inativa.

MétricaValor medido
Aceleração da codificação face à v0.23, uma só thread3 a 30 vezes
Máquina de mediçãoApple M4 Max
Limites inferior e superior do intervalot5-base e gpt2
Escalabilidade com oito workers76% do linear
Identificadores de tokens produzidosidênticos aos da v0.23
Instalação da versão candidatacargo add tokenizers --pre

A restrição que a equipa impôs a si própria é mais interessante do que os próprios ganhos: a v1 produz exatamente os mesmos identificadores de tokens que a v0.23, a API, o vocabulário e as posições de fusão (merge ranks) não mudam, e a biblioteca continua a ser generalista, em vez de se especializar em BPE. Portanto, a atualização não exige nada além de mudar a versão instalada.

Seis alterações concentram a maior parte do trabalho, e a mais invulgar chama-se bitcannon. A expressão regular que divide o texto em pré-tokens é um parâmetro fixo, fornecido com o tokenizer: não há razão para a fazer interpretar por um motor genérico em cada codificação. Por isso, a Hugging Face escreve manualmente a função de segmentação e fá-la trabalhar sobre fluxos de bits em SIMD, decidindo 64 bytes por operação de registo. A contrapartida é assumida: apenas os padrões reconhecidos (GPT-2, cl100k, o200k, Tekken, DeepSeek) tiram partido disso; os restantes mantêm o percurso regex — o que explica a diferença entre 3 e 30. A isto juntam-se um ciclo de fusão sem alocação nem ramificações, uma cache de palavras local à thread de execução e paralelismo nativo. As ligações C e C++ apenas para inferência, destinadas ao ExecuTorch e ao llama.cpp, estão anunciadas para antes da versão 1.0.0.

🔗 tokenizers v1: codificação, descodificação e escalabilidade, medidas


Devin Cloud chega ao terminal, com acesso SSH à máquina do agente

21 de setembro — A Cognition leva o Devin Cloud ao terminal: devin --cloud, ou /cloud a partir de uma sessão em curso, cria, controla e retoma uma sessão na cloud sem sair do CLI. O mecanismo assenta num comando simétrico: /handoff transfere a tarefa em curso para a máquina virtual do Devin — Mac, Linux ou Windows — e, quando executado a partir da cloud, faz o percurso inverso, recuperando a branch da pull request. As sessões na cloud sobrevivem ao terminal que as iniciou.

And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.

🇵🇹 E, pela primeira vez, ligue-se por SSH à máquina virtual dedicada do Devin e, depois, transfira o trabalho de volta para o seu próprio dispositivo com /handoff.@cognition no X

devin ssh abre acesso completo ao ambiente que o agente criou: modificar o código, iniciar um servidor de desenvolvimento, redirecionar portas e transferir ficheiros por scp. O ambiente de execução deixa de ser uma caixa negra. As sessões SWE-2 são gratuitas no Devin Cloud até 8 de outubro.

🔗 Devin Cloud no seu terminal


Qwen Code v0.24.3 instrumenta seu Web Shell e persiste suas sessões em JDBC

21 de setembro — O Qwen Code passa para a v0.24.3 no dia seguinte à v0.24.2: trinta e um pull requests, nenhuma alteração incompatível. A maior parte do trabalho visível concentra-se no Web Shell, cujos resultados de execução deixam de ser texto simples e passam a ser uma estrutura que separa o comando, sua saída, os detalhes da execução e o tempo decorrido. Uma aba trajectory, desativada por padrão, apresenta as durações por turno, o tempo até o primeiro token, o número de tokens e a duração de cada chamada de ferramenta.

A parte menos visível é provavelmente a mais estruturante. O runtime recebe persistência JDBC de suas conexões e sessões, permitindo compartilhar o estado entre vários processos broker e conservar a propriedade de uma sessão após uma reinicialização. Além disso, as ferramentas do runtime são roteadas via bwrap com uma política de workspace imutável — a continuação direta do sandbox implementado no dia anterior, cuja configuração continua não exposta. No mesmo dia, o SDK TypeScript v0.1.14 incorpora essa CLI, seguido pelo Qwen Code Desktop v0.24.3.

🔗 Notas de versão do Qwen Code v0.24.3


Hugging Face lança o relore, uma memória de repositório para agentes de código

21 de setembro — A Hugging Face publica o relore sob a licença Apache-2.0, uma ferramenta que fornece a um agente de código a memória de um repositório. O ponto de partida é um incidente: no ticket Transformers #48630, aberto em 8 de setembro, duas correções já haviam sido propostas quando o agente de integração contínua da empresa se preparava para escrever uma terceira. A informação estava inteiramente no GitHub, mas dispersa entre tickets, pull requests e comentários invisíveis a partir do ticket inicial.

O relore indexa esse histórico registrando quem disse o quê: uma decisão de mantenedor não tem o mesmo peso que uma hipótese de colaborador, e o conteúdo gerado por máquina é descartado por padrão. Um clone de trabalho é mantido ao lado do índice, servido pela mesma API HTTP, e as consultas são processadas localmente — apenas a ingestão entra em contato com o GitHub. Seguem-se os comandos: inflight lista as threads que alegam encerrar um ticket, search --trust authoritative revelou a PR #39847 que deu origem à regressão, e why parte de uma linha de código para encontrar os comentários de revisão relacionados a ela. Durante um teste em condições reais, o agente informou que defs lhe proporcionava uma visão geral melhor de um arquivo do que sua leitura integral, usando 5% dos tokens.

🔗 relore, memória de repositório para agentes de código


Perplexity pós-treina o Computer com os erros de seus usuários e adiciona vídeo

21 de setembro — A Perplexity Research detalha como a empresa pós-treina o modelo usado por seu agente Computer — GLM 5.2, revela o artigo de passagem — a partir das sessões reais de seus usuários. Os ambientes sintéticos produzem tarefas controladas e fáceis de verificar; as sessões reais fornecem dois sinais que eles não produzem: as correções feitas pelo usuário e os erros retornados pelas ferramentas. As sessões que contêm dados pessoais e as dos usuários que recusaram o treinamento são excluídas antes de qualquer amostragem.

Cada turno recebe então um de três tratamentos: imitação por entropia cruzada para os turnos sem erro das sessões bem-sucedidas, correção por divergência de Kullback-Leibler para os turnos com falha acompanhados de uma indicação válida, ou simples manutenção no contexto. O mesmo conjunto de pesos atua como professor e aluno, mas apenas o professor vê a indicação. Três avaliadores automáticos propõem os turnos responsáveis, e pelo menos dois precisam convergir, pois o último turno antes da reclamação é a causa real em apenas cerca de metade dos casos.

Taxa de erros de ferramentasValor medido
Offline, GLM 5.2 original2,79%
Offline, apenas amostragem com rejeição1,35%
Offline, com autodestilação0,87%
Online, entre dois checkpoints2,24% e depois 1,77%, ou seja, 21,2% menos em termos relativos

Os autores são explícitos quanto ao que esses números não demonstram: os checkpoints comparados offline não foram treinados com os mesmos dados, os resultados por tarefa continuam heterogêneos e a insatisfação dos usuários não apresenta mudança significativa, 2,58% contra 2,54%, em testes A/B com cerca de cem mil usuários por grupo.

No mesmo dia, o Computer ganha geração de vídeos, confiada a dois modelos de terceiros: MiniMax H3 e ByteDance Seedance 2.5. Seja um clipe de campanha, uma demonstração de produto ou um visual para redes sociais, o vídeo finalizado chega à mesma thread que o texto e as imagens produzidos para a mesma solicitação. Disponível para assinantes Pro e Max, sem menção a acesso gratuito nem a disponibilização pela API.

🔗 Aprendendo com erros do mundo real 🔗 Perplexity Computer e os modelos de vídeo


Gemini Notebook amplia o Live Chat e os Interactive Learning Overviews para todos

21 de setembro — O Gemini Notebook alcançou duas etapas de implantação no mesmo dia. O Live Chat chega a 100% dos assinantes Ultra em dispositivos móveis: conversa por voz em tempo real com um notebook, em cerca de 100 idiomas, apoiada pelos modelos de áudio mais recentes do Google, com orientação passo a passo quase inteiramente sem o uso das mãos. Algumas horas depois, os Interactive Learning Overviews deixam sua implantação gradual e tornam-se acessíveis a todos os usuários, sem exigência de assinatura; situados em Reports, eles reúnem os resumos de fontes e os artefatos do studio em um mesmo espaço interativo.

As duas funcionalidades haviam sido apresentadas em 15 de setembro, no anúncio das novas ferramentas de estudo. As mensagens do dia 21 não acrescentam nenhuma funcionalidade: elas confirmam uma disponibilidade efetiva, completa para a primeira e aberta a todos para a segunda.

🔗 Live Chat implantado para 100% 🔗 Interactive Learning Overviews abertos a todos


Google.org destina 4 milhões de dólares à formação de professores em IA

21 de setembro — O Google.org destina 4 milhões de dólares à Digital Promise, anunciados em Nova York à margem da Assembleia Geral das Nações Unidas. O financiamento amplia a Google AI Educator Series, uma formação gratuita anunciada no início do ano e destinada aos 6 milhões de professores do ensino fundamental, médio e superior dos Estados Unidos. Desenvolvida com a ISTE segundo uma abordagem de professores formando outros professores, ela se concentra em competências transferíveis de uma ferramenta para outra, em vez de um produto específico, e é realizada em módulos de ritmo livre validados por badges digitais.

A Digital Promise atua em três frentes: adaptar a formação às agências estaduais de educação e aos distritos escolares, estabelecer parcerias com redes de community colleges para professores dos primeiros anos do ensino superior e conduzir, ao longo de dois anos, um estudo sobre o que realmente ajuda os professores do ensino superior, cujos resultados serão publicados em um guia público gratuito.

🔗 Google.org e Digital Promise


Runway amplia seus Workflows para compositing, transparência e mapas de profundidade

21 de setembro — A Runway amplia seus Workflows, os encadeamentos de operações montados em seu aplicativo, com cinco componentes voltados à pós-produção: Compositing, Alpha, HDR, Depth Map e RGB Depth. O argumento do anúncio cabe em uma linha — construir uma parte maior de sua cadeia de produção (pipeline) no mesmo lugar, sem precisar recorrer a outra ferramenta entre duas etapas. O compositing e o gerenciamento do canal alpha destinam-se à combinação de várias camadas de imagem; os mapas de profundidade, em suas duas formas, servem como sinal geométrico para controlar efeitos que dependem da distância até a câmera. O anúncio foi feito no X com uma demonstração de 31 segundos, sem uma publicação correspondente na página de notícias da Runway no momento da verificação.

🔗 Workflows ampliados na Runway


NVIDIA lança o DSX Ready, um programa de qualificação para alimentar e resfriar fábricas de IA

21 de setembro — A NVIDIA lança o DSX Ready, um programa que qualifica produtos de parceiros segundo os requisitos de sua arquitetura de referência DSX para fábricas de IA. A constatação inicial é bastante concreta: a alimentação elétrica, o resfriamento, a água, o local e a rede elétrica determinam hoje o que um construtor pode realmente implantar, e um equipamento mal integrado ao restante do projeto não transforma capacidade computacional em produção útil.

Categoria qualificadaParceiros no lançamentoProcesso de qualificação
Armazenamento de energia em bateriasHitachi Energy, LG Energy Solution, TeslaTestes pelo parceiro, revisão e aprovação pela NVIDIA
Unidades de distribuição de resfriamentoLG Electronics, LiquidStack, VertivConjunto de testes de autoqualificação

A NVIDIA estabelece um limite explícito para o significado do selo: obter a qualificação não substitui a engenharia no nível do local nem implica qualquer garantia de estabilidade dele. Outras categorias, relacionadas à infraestrutura e ao software, devem ser adicionadas gradualmente.

🔗 NVIDIA DSX Ready


NVIDIA trata a segurança dos agentes como um problema de engenharia, camada por camada

21 de setembro — A NVIDIA publica um posicionamento sobre a segurança dos sistemas agênticos: trata-se de um problema de engenharia, portanto exige requisitos definidos, controles aplicáveis, responsáveis designados e provas de que as proteções funcionam. A stack é dividida em três níveis — os modelos fornecem as capacidades, os harnesses organizam contexto, ferramentas e fluxos de trabalho, e o ambiente de execução fornece a infraestrutura na qual as ações ocorrem —, cada um com seus próprios controles.

O exemplo escolhido é revelador: um agente atualiza uma ficha de cliente, encontra instruções maliciosas em um documento anexado e tenta exportar os dados para um destino não autorizado. A NVIDIA espera então uma política de rede que bloqueie a transferência e logs protegidos que conservem a chamada de ferramenta tentada, a decisão de autorização e o resultado. O direito de atualizar uma ficha não se estende ao direito de exportá-la, e um agente pode solicitar acesso sem jamais poder concedê-lo a si mesmo. No lado das ferramentas, o OpenShell aplica as políticas fora do alcance do agente; a Cisco adiciona o DefenseClaw por cima, e a JFrog verifica as skills às quais um agente tem acesso.

No mesmo dia, uma segunda publicação aplica o mesmo raciocínio à IA física e o relaciona à base Halos; ela aparece nas notas breves abaixo, com suas duas projeções de mercado.

🔗 Protegendo a stack de agentes


Earth-2 assimila observações locais para atualizar as previsões meteorológicas

21 de setembro — A NVIDIA publica um tutorial sobre as ferramentas de assimilação de dados por IA do Earth-2, destinadas aos setores que já dispõem de suas próprias medições: parques eólicos e solares, radares e sensores locais, observações por satélite. A primeira técnica, SDA, aplica-se a modelos de difusão como CorrDiff e StormCast: em cada etapa de remoção de ruído, ela compara o resultado intermediário às observações e orienta a etapa seguinte, sem novo treinamento.

Técnica medidaAbrangência e resoluçãoGanho relatado no exemplo
CorrDiff-SDAEuropa, de 0,25 grau para 2,2 kmRMSE do vento reduzido em 54% nas estações excluídas
StormCast-SDAEstados Unidos continentais, 3 km, iniciado com HRRRRMSE do vento reduzido em 7,2% ao longo de seis intervalos de tempo
HealDAGlobal, grade HEALPix de 1 grauEstado global da atmosfera estimado em poucos segundos

O interesse é, antes de tudo, operacional: as análises numéricas exigem um tempo de computação considerável e são divulgadas em horários fixos, enquanto a SDA integra observações continuamente e preenche a lacuna até o horário atual. O HealDA, por sua vez, trata cada fluxo como uma nuvem de pontos no espaço e no tempo, agregada na grade-alvo e depois processada por uma rede dorsal (backbone) do tipo vision transformer.

🔗 Assimilação de dados no Earth-2


Multiverse Computing poda os blocos como um vidro de Ising e ganha 23 pontos no MMLU

21 de setembro — Remover blocos inteiros de transformer é uma das maneiras menos dispendiosas de acelerar um grande modelo de linguagem, e uma das mais brutais: o modelo torna-se literalmente mais curto, mas a remoção dos blocos errados faz com que ele entre em colapso. A Multiverse Computing sustenta que a questão está mal formulada. Os métodos existentes avaliam cada bloco isoladamente — magnitude, sensibilidade, block influence —, abordagem que os autores qualificam como campo médio, embora o efeito da remoção de um bloco dependa daqueles removidos ao mesmo tempo.

A seleção torna-se, portanto, um problema de otimização binária com restrições, projetado sobre um vidro de Ising: um sistema de spins desordenado, com interações entre todos os pares e um número fixo de spins orientados para cima. O interesse prático resume-se em uma frase: a energia desse sistema é um substituto de baixo custo para a pontuação que o modelo podado obterá, o que permite classificar um número muito grande de configurações candidatas sem avaliar nenhuma delas em benchmarks. Com 50% de compressão do Llama-3.3-70B-Instruct, os autores afirmam obter um ganho de quase 23 pontos percentuais no MMLU em relação ao melhor método concorrente.

🔗 Podando LLMs como um físico


Notícias breves

A NVIDIA publicou sete artigos e mensagens a 21 de setembro: três são tratados acima, os outros quatro encontram-se aqui, sem anúncios técnicos.

  • A NVIDIA apela à segurança em todas as camadas para a IA física — artigo de posição sustentado por duas projeções de mercado: 49 milhões de veículos autónomos de nível 3 a 5 instalados até 2035, segundo a ABI Research, e cerca de 60 milhões de robôs industriais implementados entre 2026 e 2035, segundo a Omdia. Quatro requisitos de segurança são associados à plataforma NVIDIA Halos. 🔗 fonte
  • A NVIDIA destaca a expansão do ecossistema de IA egípcio — receção no Grand Egyptian Museum com um discurso de abertura de Paolo Guglielmini, vice-presidente para a EMEA. O destaque assinala sobretudo que fábricas de IA estão a entrar em funcionamento na África do Sul, em Marrocos e na Nigéria. 🔗 fonte
  • A NVIDIA enumera cinco empresas que aplicam IA às energias de baixo carbono — panorama publicado para a New York Climate Week, desde a aceleração da fusão até à reutilização de baterias recicladas de veículos elétricos. A ThinkLabs AI desenvolve gémeos digitais e agentes em CUDA para reduzir os prazos de ligação à rede. 🔗 fonte
  • A NVIDIA anuncia os vencedores dos Golden Tickets para a GTC Berlin — seis vencedores selecionados por um júri para a conferência de 20 a 22 de outubro de 2026. Sem conteúdo técnico. 🔗 fonte
  • Qwen-Image-2.1 disponibilizado desde o primeiro dia por vLLM, SGLang, ComfyUI e Hugging Face — o SGLang-Diffusion executa o modelo numa única RTX 4090 de 24 GB, com descarregamento para o processador, para gerar uma imagem de 1024 por 1024 em 18,7 segundos e com 22,7 GiB ocupados. O vLLM descreve-o como um transformer de difusão com 7,1 mil milhões de parâmetros associado ao Qwen3-VL-8B. 🔗 fonte
  • A OpenAI Academy acrescenta quatro percursos de formação — Build with AI, Lead AI Adoption, AI for Educators e AI for College Students juntam-se ao Apply AI at Work. Cada curso termina com uma avaliação que atribui um distintivo; o percurso para programadores separa a utilização do Codex do desenvolvimento sobre a API. 🔗 fonte
  • A Runway organiza um hackathon em São Francisco em torno da sua API — evento de um único dia, a 30 de setembro, no Masonic, à margem do Runway AI Summit, para criar um agente, uma aplicação ou um fluxo de trabalho criativo, sem apresentação de candidatura nem circuito de aprovação. 🔗 fonte
  • A HeyGen destaca o Code2Video, um benchmark desenvolvido com a Google DeepMind e a Kaggle — a avaliação centra-se numa questão distinta da escrita do código: saber se esse código produz um vídeo que vale a pena ver. Publicado como comentário a uma mensagem sobre a stack de vídeo agêntico baseada na geração de código. 🔗 fonte
  • A Suno mostra efeitos sonoros aplicados através de uma simples descrição — demonstração de um minuto, desde uma saturação quente até um resultado mais experimental. Sem nome de funcionalidade, plano abrangido ou artigo de blogue associado: mais uma apresentação do produto do que um lançamento. 🔗 fonte
  • Demonstração em direto do Gemini para compras no Discord — sessão anunciada para terça-feira, 22 de setembro, às 11h PT, no servidor oficial do Discord, dedicada à preparação de uma compra, à comparação de opções e à pesquisa a partir de uma fotografia. Nenhuma funcionalidade nova. 🔗 fonte
  • A Together AI e a Ollama anunciam uma sessão sobre agentes de código aberto — Parth Sareen, da Ollama, e Zain Hasan, da Together AI, conduzirão uma sessão sobre a colocação em produção de agentes de código baseados em modelos abertos. Sem data nem local na mensagem. 🔗 fonte
  • Os pesos de dois treinos abandonados do Boris-2 são disponibilizados abertamente — o primeiro estagnou numa perda de 3,100 após 30 mil milhões de tokens, devido a uma incompatibilidade entre os gradientes Muon e AdamW; o segundo foi interrompido por volta dos 7 mil milhões de tokens. Um relato de fracasso mais instrutivo do que os próprios modelos. 🔗 fonte
  • Um protocolo pré-registado contra o viés direcional dos modelos avaliadores — a hipótese é que, em textos narrativos, os erros tendem a declarar um sentimento em vez de o codificar. O protocolo é publicado antes de qualquer recolha, incluindo o resultado que levaria ao abandono do construto e um conflito de interesses declarado pelo autor. 🔗 fonte
  • Uma reprodução do Jev com componentes abertos fica aquém por 0,6 pontos — um utilizador que afirma não saber programar entrega um dia de experiências ao Claude Code para reconstruir o Jev com stacks abertas executadas exclusivamente no processador. Oito abordagens falhadas, que considera mais instrutivas do que aquela que funcionou. 🔗 fonte
  • O Jevini separa a conceção da execução da decisão — um grande modelo de raciocínio concebe um grafo versionado de avaliações tipadas, que um pequeno modelo de decisão executa em cada nova situação. Conteúdo promocional do fornecedor, que deve ser tratado como tal. 🔗 fonte
  • A Cohere mantém a sua comunicação de marca, sem anúncios de produto — uma mensagem de 20 de setembro prolonga a campanha AI for Empowerment, reformulando a intenção atribuída ao cofundador Aidan Gomez, e dois conteúdos visuais do dia 21 contam a passagem da empresa pelo hackathon estudantil Hack The North, em Waterloo. Sem modelo, funcionalidade ou preço. 🔗 campanha · 🔗 hackathon

O que isto significa

O dia zero está a tornar-se a norma de distribuição. O Grok 4.7 não espera: está no Cursor e no GitHub Copilot no dia do seu anúncio, e o Qwen-Image-2.1 foi disponibilizado, logo no lançamento, pelo vLLM, SGLang, ComfyUI e Hugging Face. O intervalo entre a publicação de um modelo e a sua disponibilidade nas ferramentas do quotidiano, que antes se media em semanas, tende para zero — no Cursor, porque o fornecedor e o laboratório pertencem agora ao mesmo grupo desde 14 de agosto; nos restantes casos, porque a integração é preparada antes do anúncio. A questão interessante já não é quando chegará um modelo, mas quanto custará depois de chegar.

É precisamente isso que a modalidade de faturação do Copilot altera. Nela, o Grok 4.7 sai do sistema de multiplicadores de pedidos para ser faturado conforme a utilização, ao preço público da xAI. Combinado com a ativação automática de novos modelos, isto transfere uma decisão de custos para a administração da plataforma: não fazer nada equivale a abrir uma rubrica de despesa indexada à tabela de preços de um fornecedor externo. Do lado da xAI, o argumento é simétrico — os mesmos 2 dólares de entrada do Grok 4.6, ganhos reais no Terminal-Bench, mas uma posição atrás do Fable 5.1 em tarefas de código prolongadas: o que aqui se vende é uma relação entre preço e desempenho, não o primeiro lugar.

Quanto aos agentes, três anúncios distintos contam a história da mesma mudança: o ambiente de execução deixa de ser uma caixa negra. devin ssh abre a máquina virtual do agente a uma sessão interativa, o relore fornece ao agente a memória das decisões anteriores de um repositório, em vez de apenas o estado atual do código, a Perplexity aplica pós-treino ao seu modelo nas interações específicas em que falhou perante os utilizadores, e o Qwen Code encaminha as suas ferramentas através do bwrap. A NVIDIA fornece o enquadramento teórico deste movimento ao defender que a segurança de um agente se constrói camada a camada, fora do seu alcance, com registos que servem de prova. O agente inspecionável e o agente limitado são as duas faces da mesma necessidade.

Resta a questão que o anúncio da OpenAI coloca sem a abordar. Um modelo interno que resolve mais de cem problemas em aberto em menos de um mês produziu uma resposta institucional — um grupo consultivo independente, não remunerado e livre nas suas opiniões — cujo mandato exclui explicitamente o ritmo dos progressos internos, isto é, o próprio objeto do protesto dos 27 medalhados Fields. O contraste com o resto do dia é revelador: enquanto se discute o ritmo dos resultados espetaculares, uma biblioteca de tokenização obtém um ganho de 3 a 30 vezes garantindo identificadores idênticos, e um método de compressão inspira-se nos vidros de spin para ganhar 23 pontos no MMLU com 50% de compressão. Esse trabalho não dá manchetes, mas é ele que determina quanto custará a inferência de amanhã.


Fontes