Pesquisar

Claude Opus 5.5 chega à Anthropic, OpenAI lança GPT-6 Sol e Luna, Claude Code atualiza Pro e Team Standard para Opus

ai-powered-markdown-translator

Artigo traduzido do francês para o português com o gpt-5.6-sol.

Ver projeto no GitHub ↗

Na terça-feira, 22 de setembro, a Anthropic e a OpenAI lançam, cada uma, um modelo de fronteira, com menos de duas horas de intervalo: Claude Opus 5.5, apresentado como estando ao nível do Fable 5.1 por um custo 40% inferior ao do Opus 5, seguido pelo GPT-6 Sol e pelo GPT-6 Luna, cujos preços de API caem pela metade em comparação com o preço promocional do GPT-5.6. Ambas as famílias chegam no mesmo dia ao GitHub Copilot, Devin e Perplexity, enquanto o Claude Code 2.1.280 atualiza os planos Pro e Team Standard de Sonnet para Opus. Codex CLI 0.156.0, limites de utilização aumentados na Anthropic e uma série de publicações da NVIDIA completam o dia.


Anthropic lança Claude Opus 5.5, primeiro modelo da família Claude 5.5

22 de setembro — A Anthropic lança o Claude Opus 5.5 (claude-opus-5-5), primeiro modelo da sua nova família Claude 5.5; Sonnet 5.5 e Haiku 5.5 chegarão «nas próximas semanas». Está disponível a partir de hoje na API Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud e Microsoft Foundry e torna-se, no Claude Code, o modelo predefinido dos planos pagos. Janela de contexto de um milhão de tokens, saída máxima de 128 000 tokens e conhecimentos fiáveis até junho de 2026.

Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.

It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.

🇵🇹 Apresentamos o Claude Opus 5.5, o primeiro modelo da nossa nova família Claude 5.5. Trabalha ao nível do Claude Fable 5.1 na maioria das tarefas e custa 40% menos para executar do que o Opus 5.@claudeai no X

Segundo a Anthropic, esses 40% são medidos «com as configurações predefinidas» em cargas de trabalho típicas e combinam preços mais baixos com menos tokens por tarefa. Os preços caem 20% (4 dólares para entrada e 20 para saída por milhão de tokens, contra 5 e 25 para o Opus 5) e 60% nas leituras de cache (0,20 dólar). A saída é gerada mais de 30% mais depressa, e um modo rápido (fast mode), em pré-visualização de investigação, promete até 2,5 vezes mais velocidade por 8 e 40 dólares.

Benchmark (números da Anthropic)Claude Opus 5.5Claude Fable 5.1GPT-6 Astra
Terminal-Bench 4.066,4 %55,8 %57,9 %
FrontierCode v1.1 Main54,4 %50,3 %53,3 %
GDPval-AA v2.1 (Elo)184617351542
OSWorld 2.081,8 %80,7 %
AutomationBench40,0 %31,4 %41,4 %
Terminal-Bench-Science 0.158,7 %52,6 %64,6 %

O Opus 5.5 assume a liderança em código agêntico, trabalho de escritório e utilização do computador, mas o GPT-6 Astra continua à frente no AutomationBench e no Terminal-Bench-Science. A Anthropic esclarece que as suas pontuações foram medidas com as salvaguardas de produção ativas, o que provavelmente as reduz, e considera que as margens dos benchmarks se tornaram «um guia menos fiável»: na utilização prática, a diferença em relação ao Fable 5.1 seria menor do que estes números sugerem. É o primeiro Opus lançado com salvaguardas da classe do Fable 5.1 em cibersegurança, biologia e destilação (a maioria das tarefas cibernéticas passa para o Opus 4.8), e a Anthropic reconhece que ele parece frequentemente suspeitar de que está a ser avaliado.

Para os programadores, a migração exige ajustes: o raciocínio adaptativo já não pode ser desativado, a escolha forçada de ferramentas (tool_choice para any ou tool) devolve um erro 400, e o esforço predefinido passa para medium (contra high no Opus 5). O texto escrito entre duas chamadas de ferramentas passa agora a ser incluído em blocos de raciocínio, vazios com a apresentação predefinida.

🔗 Apresentação do Claude Opus 5.5 · Novidades do Opus 5.5 para a API


Claude Code 2.1.280 instala Opus 5.5 e atualiza Pro e Team Standard para Opus

22 de setembro — O Claude Code 2.1.280 é publicado às 16h38 UTC, sete minutos após o anúncio do Opus 5.5. Não houve uma versão 2.1.279: o CHANGELOG passa diretamente da 2.1.278, de 19 de setembro, para esta versão com 114 entradas.

A mudança mais visível diz respeito ao modelo. O Opus 5.5 torna-se o modelo Opus predefinido, e os planos Pro e Team Standard passam de Sonnet para Opus por predefinição, tal como já acontecia com Max, Team Premium e Enterprise. Os níveis de esforço guardados antes de /effort se tornar específico de cada modelo deixam de se aplicar a modelos novos como o Opus 5.5, que começam com a respetiva configuração predefinida; por sua vez, Opus 4.7, Opus 4.8 e Fable 5 deixam de impor o seu esforço inicial acima da configuração escolhida.

No que diz respeito à segurança, uma escrita efetuada através de uma ligação simbólica passa a ser avaliada com base no destino real: o pedido de autorização identifica o local onde ela termina, e acceptEdits, as regras de autorização e o modo automático deixam de aprovar uma escrita cujo destino esteja fora da árvore. O modo automático já não recusa ações em ciclo, sem pausa, quando uma verificação de segurança não devolve uma resposta: as novas tentativas tornam-se mais espaçadas e a interação termina após dez recusas consecutivas. Os marketplaces de plugins que imitem um nome reservado são recusados, e a variável CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH permite alterar o limite de 2 048 caracteres das descrições de ferramentas MCP.

O restante diz respeito à facilidade de utilização: uma tecla y ou n isolada deixa de confirmar ou fechar uma caixa de diálogo (Enter e Esc passam a fazê-lo), um duplo Ctrl+C numa caixa de diálogo deixa de encerrar o Claude Code, duas quebras do cache de prompts são corrigidas, e a extensão VS Code recebe seis comandos digitados (/status, /sandbox, /chrome, /export, /skills, /plan).

Categoria de entrada do CHANGELOGNúmero de entradas
Correções (Fixed)69
Melhorias (Improved)21
Adições (Added)12
Alterações (Changed)10
Reversão e remoção2
Total114

🔗 Claude Code v2.1.280

Dois guias para trabalhar com o Opus 5.5

22 de setembro — A Anthropic publica também dois guias assinados por Addy Osmani. O primeiro, «Quanto custa uma tarefa no Opus 5.5» (What a task costs on Opus 5.5), recorda que dois modelos com o mesmo preço por token podem ter custos muito diferentes para a mesma tarefa, porque cada interação reenvia toda a conversa. Os seus exemplos, apresentados como ilustrações baseadas nos preços públicos: 2,8 milhões de tokens de entrada custam 11,20 dólares sem cache e 1,62 dólar com 90% lidos a partir do cache, e um token de saída custa 100 vezes mais do que uma leitura de cache. Recomenda o esforço medium para o dia a dia, high quando medium fica bloqueado e, depois, Fable 5.1 se o Opus 5.5 falhar duas vezes no mesmo problema, sabendo que mudar o esforço ou o modelo esvazia o cache (que dura uma hora numa subscrição e cinco minutos por predefinição com uma chave de API). Num benchmark interno de 44 pedidos de suporte, mudar do Opus 4.8 para o Opus 5.5 com esforço baixo reduziu o custo em cerca de 18%, e /claude-api prompt-audit em mais 9%.

O segundo guia, no claude.dev, recomenda definir o que significa «concluído» e depois deixar o modelo trabalhar, bem como remover instruções do tipo «pensa bem», uma vez que o modelo raciocina sempre antes de responder. Explica também a mudança para um modelo mais antigo quando uma mensagem é sinalizada pelas salvaguardas, um comportamento configurável nas aplicações ou em /config.

🔗 Quanto custa uma tarefa no Opus 5.5 · Como tirar o máximo partido do Opus 5.5


OpenAI lança GPT-6 Sol e GPT-6 Luna, 50% mais baratos do que o preço promocional do GPT-5.6

22 de setembro — Menos de duas horas depois da Anthropic, a OpenAI expande a família GPT-6 com o GPT-6 Sol e o GPT-6 Luna, treinados com métodos semelhantes aos do GPT-6 Astra, que continua a ser, segundo a empresa, o seu melhor modelo. O Sol destina-se a código complexo e fluxos agênticos, e o Luna a tarefas específicas de grande volume; sucedem ao GPT-5.6 Sol e ao GPT-5.6 Luna.

We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

🇵🇹 Também tornámos o armazenamento em cache e a inferência mais eficientes e transferimos essas poupanças diretamente para si: preços de API 50% inferiores para o Sol e o Luna em comparação com o preço promocional do GPT-5.6.@OpenAI no X

Tipo de preço (por milhão de tokens)GPT-6 SolGPT-6 LunaPreço indicado do GPT-5.6 (Sol / Luna)
Entrada2 dólares0,10 dólar4 dólares / 0,20 dólar
Entrada em cache0,20 dólar0,01 dólarnão especificado
Saída10 dólares0,50 dólar20 dólares / 1,20 dólar

Ambos os modelos aceitam 1 050 000 tokens de contexto e produzem até 128 000 tokens; acima de 272 000 tokens de entrada, todo o pedido é faturado ao dobro do preço na entrada e a 1,5 vezes o preço na saída.

Nos benchmarks da OpenAI, que comparam o Sol com modelos Claude anteriores ao Opus 5.5, o Sol obtém 33,2% no AutomationBench com esforço xhigh por 0,27 dólar por tarefa, à frente do Claude Opus 5 com esforço max (26,9%, por um custo 11,1 vezes superior) e do GPT-6 Astra com esforço low (30,3%). No DeepSWE v1.1, alcança 68,8%, a 1,1 pontos da melhor pontuação do Claude Fable 5, por um custo por tarefa cerca de 80% inferior; o Luna obtém 66,6%. As pontuações dos concorrentes provêm de relatórios públicos. No que toca ao alinhamento, a taxa de engano medida em tarefas de código concebidas para incentivar a desonestidade cai para 1,3% no Sol, contra 10,4% no GPT-5.6 Sol.

Ambos os modelos chegam ao ChatGPT Work e ao Codex para subscritores Plus, Pro, Business, Enterprise e Edu, com uma disponibilização progressiva (ativação pelo administrador no Enterprise); os utilizadores dos planos Free e Go podem utilizar o Luna na aplicação para computador, e os modelos ainda não estão disponíveis no Chat. Na API, chamam-se gpt-6-sol e gpt-6-luna, através de Responses e Chat Completions.

🔗 Apresentação do GPT-6 Sol e Luna

Um armazenamento em cache de prompts reformulado para o GPT-6

22 de setembro — Publicação complementar ao lançamento, «Melhor armazenamento em cache de prompts para o GPT-6» detalha o novo sistema de cache da família: taxas de acerto predefinidas mais elevadas, desconto que pode chegar a 90% nos tokens de entrada em cache, aplicado aos prefixos partilhados elegíveis reutilizados no prazo de 30 minutos, e escrita em cache faturada a 1,25 vezes o preço da entrada. Os programadores passam a ter um painel Prompt Caching, pontos de interrupção explícitos (explicit cache breakpoints) para fixar os prefixos a reutilizar, pré-aquecimento do cache (prewarming) no arranque de uma aplicação e um configuration_update que altera o esforço de raciocínio entre respostas sem invalidar o cache. O GitHub, através do seu diretor de produto Mario Rodriguez, afirma ter reduzido em mais de 50% a proporção de tokens de prompt que precisam de ser novamente processados; o Strawberry Browser anuncia uma redução de 20% nos custos.

🔗 Melhor armazenamento em cache de prompts para o GPT-6


No mesmo dia nas ferramentas: GitHub Copilot, Devin, Perplexity, Cursor e v0

22 de setembro — O Opus 5.5 e os dois novos GPT-6 não ficaram à espera: em poucas horas, as principais ferramentas de código e investigação adicionaram-nos, muitas vezes acompanhados das suas próprias métricas.

GitHub Copilot disponibiliza Opus 5.5, GPT-6 Sol e GPT-6 Luna

O GitHub adiciona os três modelos no dia do lançamento, em dez interfaces: VS Code, Visual Studio, Copilot CLI, agente de código, aplicação GitHub Copilot, github.com, GitHub Mobile, JetBrains, Xcode e Eclipse. Todos são faturados com base na utilização, segundo o preço público do fornecedor, sem multiplicador de pedidos premium: os subscritores anuais que permaneceram no antigo sistema de faturação por pedidos não os recebem. Nenhum deles consta ainda da seleção automática (Auto).

Modelo no CopilotPlanos disponíveisEntrada e saída por milhão de tokens
Claude Opus 5.5Pro+, Max, Business, Enterprise (não o Pro)4 e 20 dólares
GPT-6 SolPro+, Max, Business, Enterprise2 e 10 dólares, depois 4 e 15 acima de 272 000 tokens
GPT-6 LunaPro, Pro+, Max, Business, Enterprise0,10 e 0,50 dólar, depois 0,20 e 0,75 acima de 272 000 tokens

Assim, o Luna é o único modelo GPT-6 acessível no Copilot Pro, enquanto o Opus 5.5 não está disponível nesse plano. Segundo os primeiros testes do GitHub, o Opus 5.5 resolve as tarefas ao nível do Claude Opus 5 com muito menos etapas e tokens. O GitHub assinala também que o Opus 5.5 aplica uma marca de água (watermark) às suas saídas de texto, sem qualquer efeito, segundo o GitHub, no significado, qualidade, legibilidade, número de tokens ou custo.

🔗 Claude Opus 5.5 no GitHub Copilot · GPT-6 Sol e GPT-6 Luna no GitHub Copilot

Devin classifica os recém-chegados no FrontierCode 1.1

A Cognition disponibiliza o Claude Opus 5.5 no Devin Desktop e no Devin CLI no dia do seu lançamento e coloca-o em primeiro lugar no seu benchmark FrontierCode 1.1 na variante Extended, com 65,3%, à frente do Claude Fable 5 (64,9%) e do GPT-6 Astra (64,5%), por menos de um décimo do custo por tarefa do Fable 5. Esses 65,3% não são comparáveis aos 54,4% publicados pela Anthropic, medidos na variante Main. Quarenta e sete minutos depois, chegam também o GPT-6 Sol e o Luna: o Sol iguala o GPT-5.6 Sol (60,7% contra 60,6%) com um custo por tarefa 61% menor e lê cerca de 17% menos contexto; o Luna (56,1%) fica abaixo de 0,10 dólar por tarefa, sendo o modelo mais barato da classificação segundo a Cognition.

Na véspera, 21 de setembro, durante a tarde (horário do Pacífico), a Cognition havia disponibilizado o Grok 4.7 e medido um resultado de 59,4%, abaixo do Grok 4.6 (61,3%): sólido em tarefas back-end difíceis em Java, Go e Ruby, tende a ultrapassar o escopo (over-scope), com diffs maiores do que a tarefa exige. A v0 disponibilizou o Grok 4.7 logo depois, com 40% de desconto até 27 de setembro, sem especificar a que o desconto se aplica.

Modelo avaliadoPontuação FrontierCode 1.1 Extended
Claude Opus 5.565,3%
Claude Fable 564,9%
GPT-6 Astra64,5%
Claude Fable 5.163,6%
SWE-262,5%
Grok 4.661,3%
GPT-6 Sol60,7%
GPT-5.6 Sol60,6%
Grok 4.759,4%
Gemini 3.7 Flash56,3%
GPT-6 Luna56,1%

Em negrito, os modelos adicionados ao Devin em 21 e 22 de setembro. Pontuações publicadas pela Cognition na variante Extended.

🔗 Opus 5.5 no Devin · GPT-6 Sol e Luna no Devin · Grok 4.7 no Devin · Grok 4.7 na v0

Perplexity: Opus 5.5 e GPT-6 Sol no Computer, quatro modelos na Agent API

A Perplexity integra os dois lançamentos ao seletor de esforço introduzido em 17 de setembro no Computer, o seu agente de várias etapas. O Claude Opus 5.5 torna-se o nível Standard: no WANDR, o benchmark interno de custo e desempenho da Perplexity, obtém 0,610 por 4,13 dólares por tarefa, ligeiramente acima do Claude Fable 5.1, com um custo por tarefa 67,6% menor. O GPT-6 Sol, também disponível no aplicativo Perplexity, torna-se a opção padrão do nível Light. Nenhum dos dois anúncios especifica os planos abrangidos nem os modelos substituídos.

Para os desenvolvedores, uma entrada do changelog da API, datada apenas de setembro de 2026, adiciona à Agent API openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 e xai/grok-4.7, sem preços na entrada.

🔗 Opus 5.5 no Computer · GPT-6 Sol no Computer · Changelog da API da Perplexity

Cursor e v0 disponibilizam o Opus 5.5

A Cursor apresenta-o como o novo melhor modelo do CursorBench, com 57,8% no esforço máximo (Max), por um custo por tarefa 40% menor do que o Opus 5: são os números da Anthropic, com o nível de esforço especificado. A v0 disponibiliza-o sem detalhes sobre preços.

🔗 Cursor no X · v0 no X


Anthropic aumenta os limites de cinco horas e oferece uma redefinição até 22 de outubro

22 de setembro — Com o Opus 5.5, a Anthropic aumenta os limites calculados em períodos de cinco horas dos planos Pro, Max, Team e Enterprise por licença (seat-based). A conta @ClaudeDevs quantifica o aumento para o Claude Code: +20% nos limites das sessões de cinco horas a partir de hoje. Os assinantes também recebem uma redefinição de limite para manter em reserva e acionar quando quiserem: ela fica disponível em Configurações → Uso (Settings → Usage) para Pro, Max e Team e deve ser usada até 22 de outubro.

Soma-se a isso o efeito do preço: no Claude Code, o Opus 5.5 torna-se o modelo padrão dos planos pagos e, por ser mais barato que o Opus 5, faz com que os limites de cinco horas e semanais rendam «25% mais». O guia de custos publicado no mesmo dia especifica que a redução é repassada aos limites, incluindo o contexto em cache, mas que a redução adicional no preço das leituras do cache se aplica apenas à API.

🔗 @ClaudeDevs no X · Redefinição e limites


Codex CLI 0.156.0 ativa voz e worktrees por padrão

22 de setembro — Publicado às 19h51 UTC, o Codex CLI 0.156.0 é a primeira versão estável desde a 0.155.1, de 18 de setembro; o seu changelog completo contabiliza 525 pull requests desde a 0.155.0. Ele generaliza duas funcionalidades ainda experimentais na 0.155: as conversas por voz, com mecanismos de áudio integrados para Linux e Windows, e os worktrees, que o centro de comando dos agentes consegue abrir em sessões, filtrando as tarefas por status.

Novidade da versãoComando ou configuraçãoPrecedente no Codex CLI
Conversas por voz por padrãoF8, /voice settings/voice experimental (0.155.0, 17 de setembro)
Worktrees por padrãocentro de comando dos agentesexperimentais desde a 0.154.0 (9 de setembro)
Interface de tela cheia/tui, na próxima inicializaçãonenhum
Painel de analytics/usageanalytics do aplicativo desktop (18 de setembro)
Servidor local em segundo plano/daemon, --no-daemonnenhum

A interface de tela cheia oferece pesquisa na transcrição, seleção com o mouse e cópia com o botão direito; chegam seis temas integrados, e as respostas exibem diretamente diagramas Mermaid e equações. A versão também corrige várias falhas de isolamento do sandbox (tráfego de entrada no Windows, sockets Unix do app-server, fcntl modificáveis no macOS). As notas da versão não mencionam o GPT-6: Sol e Luna são selecionados com /model ou --model.

🔗 Codex CLI 0.156.0


Agentes de código no terminal: Vibe CLI, Qwen Code e Amp

Vibe CLI 2.25.6 e 2.25.7

22 de setembro — A Mistral publica o Vibe CLI 2.25.7, com seis correções, um dia após uma versão 2.25.6 datada de 21 de setembro no CHANGELOG, mas nunca publicada como release no GitHub, que concentra a maioria das novidades (1 adição, 3 alterações, 17 correções). Com a opção --experimental-harness, é possível anexar imagens mesmo quando o modelo ativo não consegue lê-las: um modelo com visão do mesmo fornecedor descreve-as para o agente, e a chave vision_model de config.toml permite impor outro. As capturas de interface assim descritas incluem um contrato de layout (layout contract) para que o agente possa reconstruir a tela.

Na área de segurança, os comandos Git executados sem aprovação foram reforçados: os fetches seguros já não herdam as substituições de caminhos da configuração do Git, um checkout não confiável já não pode escolher o cliente SSH nem os hooks, e as opções arriscadas ou os redirecionamentos de shell inseridos em comandos somente de leitura exigem aprovação. Por fim, a 2.25.7 disponibiliza /teleport para as chaves de API Vibe e workspace, incluindo contas gratuitas.

🔗 Vibe CLI v2.25.7 · CHANGELOG do Vibe CLI

Qwen Code v0.24.4

22 de setembro — Um dia depois da v0.24.3, o Qwen Code passa para a v0.24.4 com 13 funcionalidades e 15 correções, sem alterações incompatíveis. O servidor qwen serve agora abre espaços de trabalho remotos por SSH sem instalar um daemon na máquina de destino, e o sandbox bubblewrap (bwrap), introduzido no Linux com a v0.24.0, é aplicado no nível da execução de cada ferramenta. No Web Shell, o emparelhamento por código QR passa a estar disponível por padrão quando o servidor autenticado escuta fora do loopback (loopback), com convites de uso único que expiram após 60 segundos, e os diffs de edição são exibidos antes da aprovação. Para Java, as execuções gerenciadas de ferramentas são mantidas no banco de dados via JDBC. Uma v0.24.5-preview.0 limitada a duas correções foi lançada no mesmo dia.

🔗 Qwen Code v0.24.4

Os runners do Amp criam worktrees Git

22 de setembro — Cinco dias depois de permitir que um runner atendesse a vários diretórios, o Amp ensina-o a criar worktrees Git. No seletor, cada repositório atendido oferece a opção New Worktree: pressiona-se Tab, dá-se um nome à branch, e a thread começa em um checkout novo criado ao lado do repositório (~/code/amp gera ~/code/amp-fix-flaky-login-test), sem tocar no checkout principal. Em seguida, uma ação dedicada arquiva a thread e exclui o worktree e a branch. Os runners também podem receber os segredos e as variáveis de ambiente (Secrets & Env Vars) configurados no ampcode.com: desativada por padrão, a opção é ativada com --amp-env, e uma variável alterada passa a valer para a thread seguinte, sem reinicialização nem SSH.

🔗 Um runner, muitos worktrees


Avaliações por terceiros: OpenAI estabelece as suas regras, AISI britânico publica os seus resultados

22 de setembro — No mesmo dia, duas publicações abordam a avaliação dos modelos por organizações externas aos laboratórios.

OpenAI: quatro prioridades e sete princípios para avaliadores independentes

Assinado por Lama Ahmad, o artigo compromete a OpenAI a oferecer a avaliadores independentes, privados ou associativos, acesso aprofundado ao treinamento, à avaliação e à implantação dos seus modelos, para que possam questionar as suas hipóteses, identificar riscos ignorados e julgar por si próprios as suas proteções. Essas avaliações, distintas do trabalho realizado com governos, durariam de algumas semanas a vários meses, sem estarem vinculadas a um lançamento.

Área prioritáriaO que é examinado
Dossiês de segurança (safety cases)A argumentação que demonstra que os riscos de um modelo estão controlados, do treinamento à implantação externa
Proteções críticasResistência a jailbreaks, defesas cibernéticas, monitores de desalinhamento, confiabilidade do acompanhamento da cadeia de pensamento
Preparedness FrameworkTestes de capacidades (riscos químicos e biológicos, cibersegurança, autoaperfeiçoamento da IA) e alinhamento
Incidentes de desalinhamentoInvestigações independentes sobre incidentes críticos, sendo citado como exemplo o incidente da Hugging Face em julho

Sete princípios regem tudo isso: escopo acordado e alegações registradas antecipadamente, acesso proporcional, método transparente, competência e independência (conflitos de interesse declarados), segurança e confidencialidade, constatações acionáveis com prazo para correção antes da publicação e publicação responsável que regulamente as supressões. A OpenAI afirma estar em conversas com várias organizações, sem nomear nenhuma.

🔗 Prioridades e princípios para avaliações eficazes por terceiros

O UK AI Security Institute publica os seus resultados verificados com o EvalEval

A EvalEval Coalition anuncia no blog da Hugging Face que o UK AI Security Institute (AISI), o órgão público britânico encarregado de estudar os riscos da IA avançada, agora publica os seus resultados de avaliação nos Evaluation Cards, a plataforma aberta do EvalEval, com o respetivo contexto e configuração, no formato comum Every Eval Ever. A primeira publicação abrange cinco benchmarks (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro e Terminal-Bench 2.0) medidos em seis modelos, Claude Opus 4, 4.5 e 4.6, GPT-5, GPT-5.2 e GPT-5.4, além de duas avaliações cibernéticas. O que está em jogo é a reprodutibilidade: referências verificadas, publicadas com a respetiva configuração, ajudam a entender por que duas pontuações aparentemente comparáveis divergem.

🔗 Como o UK AISI e o EvalEval estão tornando os resultados de benchmarks reproduzíveis


ChatGPT acompanha a pontuação de crédito Experian nos Estados Unidos

21 de setembro — Anunciada pela conta @ChatGPT em 21 de setembro, uma nova funcionalidade permite acompanhar a própria pontuação de crédito no ChatGPT. Na área Finanças, os assinantes Plus e Pro nos Estados Unidos conectam o seu relatório de crédito Experian e a sua pontuação VantageScore 3.0, recebem explicações personalizadas sobre o que influencia essa pontuação e são avisados quando ela muda. A funcionalidade está disponível na web e nas versões mais recentes dos aplicativos para iOS e Android.

A OpenAI cita usos concretos: avaliar o efeito do próprio crédito em uma solicitação de aluguel, escolher qual cartão de crédito pagar primeiro, construir o histórico de crédito ao longo do tempo ou ver como o crédito e o orçamento influenciam um leasing de automóvel ou um empréstimo imobiliário. A funcionalidade complementa as ferramentas de finanças pessoais lançadas em prévia em maio para assinantes Pro dos Estados Unidos, com conexão bancária via Plaid.

🔗 Anúncio do ChatGPT no X


Google: Colab entra nos planos Google AI, API Gemini restringe o Gemini 2.5

Colab passa a integrar os planos Google AI

22 de setembro — Os assinantes do Google AI recebem benefícios premium do Colab, incluindo acesso prioritário a aceleradores mais rápidos e máquinas mais potentes. Os assinantes Ultra também desbloqueiam a execução contínua em segundo plano e o acesso a GPUs Premium, para que um treinamento longo chegue ao fim sem ser necessário manter uma aba aberta. O artigo fala em um lançamento «a partir de hoje», mas especifica que os benefícios chegarão ao longo das próximas semanas nos países onde o Colab está disponível. Segundo as perguntas frequentes do Colab, as unidades de computação de um plano Google AI e de uma assinatura Colab Pro ou Pro+ são somadas ao mesmo saldo; os planos Google One limitados a armazenamento e as avaliações gratuitas não têm direito a elas. Nem o artigo nem as perguntas frequentes informam quantas unidades são atribuídas a cada plano.

🔗 O Colab agora faz parte do seu plano Google AI · Perguntas frequentes do Colab

A API Gemini restringe o acesso ao Gemini 2.5

18 de setembro — Em uma nota de 18 de setembro, as notas da versão da API Gemini limitam o acesso aos modelos Gemini 2.5 aos usuários que os utilizaram ativamente no passado, para garantir um desempenho confiável e preservar a capacidade. Esses modelos não estão obsoletos e continuarão disponíveis até novo aviso: a página de descontinuações não apresenta nenhuma data de encerramento para gemini-2.5-pro, gemini-2.5-flash e gemini-2.5-flash-lite, sendo apenas o gemini-2.5-flash-image encerrado em 2 de outubro de 2026. Para todos os novos projetos, a Google recomenda o Gemini 3.5 Flash-Lite ou o Gemini 3.8 Flash.

🔗 Notas da versão da API Gemini · Página de descontinuações do Gemini


Hugging Face executa os GGUF do llama.cpp no Transformers

22 de setembro — A Hugging Face permite agora executar de forma eficiente no Transformers os ficheiros GGUF, o formato de quantização do llama.cpp. Basta passar o ficheiro para from_pretrained (parâmetro gguf_file): os pesos permanecem comprimidos na memória e os cálculos passam pelos kernels Metal do ggml, distribuídos a partir do Hub pela biblioteca kernels. O comando transformers serve expõe depois o modelo através de uma API compatível com OpenAI.

O âmbito inicial é restrito: apenas Mac Apple Silicon, arquitetura Qwen3.5 nas versões dense e MoE (além dos checkpoints Qwen3.8 compatíveis), uma conversa de cada vez e instalação a partir do branch main. Quatro kernels vêm do ggml e um quinto, escrito pela Hugging Face, gere o encaminhamento dos experts. Num MacBook Pro M2 Max, a Hugging Face considera que o Transformers está «próximo» do llama.cpp, com valores apresentados apenas em gráfico e medições não idênticas (preenchimento inicial incluído de um lado, apenas descodificação do outro); a equipa continua a recomendar o llama.cpp para inferência local eficiente. O interesse está noutro ponto: manipular um GGUF com as ferramentas PyTorch habituais ou partir de um GGUF desquantizado para um ajuste fino.

Variante GGUF (Qwen3.5-4B, Unsloth)Tamanho do ficheiroCompromisso indicado
BF168,42 GBReferência não quantizada
Q6_K3,53 GBMaior precisão
Q5_K_M3,14 GBCompromisso entre tamanho e precisão
Q4_K_M2,74 GBPonto de partida recomendado para uso local

🔗 O Transformers agora executa quantizações do llama.cpp


Kimi: K3 no Amazon Bedrock e uma extensão de navegador renomeada

Kimi K3 chega ao Amazon Bedrock

22 de setembro — A Moonshot AI anuncia a chegada do Kimi K3 ao Amazon Bedrock; contudo, a página da AWS data este lançamento de 18 de setembro. O modelo com pesos abertos, publicado no final de julho com um contexto de um milhão de tokens, beneficia aí dos controlos de acesso, encriptação e auditoria do Bedrock. É disponibilizado por inferência entre regiões (cross-Region inference) nos Estados Unidos e a nível global (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), e o seu caching explícito começa em 1 024 tokens por ponto de cache, durante pelo menos 30 minutos. Os níveis Priority (1,75 vezes a tarifa) e Flex (0,5 vezes) aplicam-se aos preços base.

Opção de inferência (nível Standard)Entrada por milhão de tokensSaída por milhão de tokensLeitura de cache
Inferência global3,00 dólares15,00 dólares0,30 dólar
Inferência nos Estados Unidos3,30 dólares16,50 dólares0,33 dólar

🔗 Página do Kimi K3 no Amazon Bedrock · Kimi K3 no Bedrock, anúncio no X

Kimi WebBridge passa a chamar-se Kimi Browser Extension

22 de setembro — A extensão de navegador que surgiu em junho com o Kimi Work muda de nome e ganha uma barra lateral a partir da qual se conversa com o Kimi para que navegue em sites, preencha formulários e conclua tarefas. As tarefas repetitivas são gravadas uma vez e guardadas como skill, que o Kimi reutiliza da próxima vez; a extensão também converte páginas web em comandos. Um serviço local controla o Chrome ou o Edge já aberto através do Chrome DevTools Protocol, e a Moonshot afirma que as sessões iniciadas e o conteúdo das páginas não saem do dispositivo. Apenas a barra lateral exige uma conta Kimi.

🔗 Kimi Browser Extension · Kimi Browser Extension, anúncio no X


SpaceXAI: Grok Bot absorve o aumento dos pedidos do seu suporte

22 de setembro — A SpaceXAI publica um relato da experiência com o seu próprio apoio ao cliente, reconstruído em torno do Grok Bot, o seu agente que trabalha nas ferramentas da empresa. Desde que a Cursor se juntou à SpaceXAI, em 14 de agosto, as duas equipas de suporte fundiram-se e passaram a abranger muito mais produtos. Segundo a publicação, o volume de pedidos aumentou 175% sem qualquer contratação, quando talvez tivesse sido necessário contratar 200 pessoas; o período de medição não é especificado.

A implementação foi progressiva: ligado ao Plain para os pedidos e ao Linear para os incidentes, o Grok Bot foi inicialmente limitado às notas internas, sendo cada ação de escrita validada por uma pessoa, e depois tratou os pedidos simples antes de responder diretamente aos clientes a partir do final do primeiro dia. Atualmente, realiza uma investigação preliminar de cada pedido recebido, reproduz os problemas em vídeo para a equipa de engenharia e sintetiza diariamente mais de 20 000 comentários sobre os produtos.

Indicador publicado pela SpaceXAIValor anunciado
Aumento dos pedidos de suporte+175%
Contratações evitadas (estimativa)200
Custo por resolução das ferramentas clássicas1 a 4 dólares
Custo mínimo por pedido com o Grok Bot0,20 a 0,30 dólar
Reembolsos processados sem intervenção humana99%

🔗 Como a SpaceXAI utiliza o Grok Bot para ampliar o apoio ao cliente


Cognition: aposta na América Latina e novas notas de versão do Devin

Cognition instala-se na América Latina a partir de São Paulo

22 de setembro — Numa publicação da sua equipa da América Latina, a Cognition retoma o anúncio feito na semana anterior no MASP, o Museu de Arte de São Paulo: a empresa está a expandir-se na região, com uma equipa sediada em São Paulo e novas contratações, incluindo engenheiros destacados junto dos clientes (deployed engineers). Apoia-se em clientes já existentes, entre os quais Itaú, Nubank, Santander, Natura e EBANX. No Itaú, segundo a Cognition, mais de 75% das equipas tecnológicas utilizam o Devin, que documentou mais de 300 000 repositórios e resolveu automaticamente cerca de 70% das vulnerabilidades; no Nubank, a migração de um monólito com vários milhões de linhas teria passado de vários anos para algumas semanas, por um custo mais de vinte vezes inferior. Estes resultados são os publicados pela Cognition, sem uma fonte externa.

🔗 Construir o futuro da engenharia de software na América Latina

As notas de versão do Devin de 21 de setembro

21 de setembro — Publicadas depois da nossa edição anterior, as notas de versão do Devin introduzem o SWE-2, o modelo de código da Cognition lançado em 10 de setembro, em pré-visualização para investigação (research preview) no seletor de agentes: escolhe-se o SWE-2 e um nível de esforço (Medium, High ou Max) ao iniciar uma sessão ou durante a mesma, e !swe2 faz o mesmo no Slack. Os servidores MCP do Microsoft 365 (Mail e Contacts, Calendar, To Do, OneDrive e SharePoint, Teams, diretório Entra ID) chegam ao marketplace MCP, apenas para leitura por predefinição caso não esteja configurado um âmbito OAuth. O Devin Review passa a estar disponível para o Bitbucket Data Center, os plugins podem atingir 20 MiB e 2 500 ficheiros, e a CLI autónoma npx devin-review é descontinuada: as cópias já instaladas deixaram de funcionar.

🔗 Notas de versão do Devin de 21 de setembro


Genspark inclui o seu benchmark de apresentações no índice SII da Fireworks AI

22 de setembro — A Fireworks AI lança o Specialized Intelligence Index (SII), um índice de 20 benchmarks de trabalho real distribuídos por sete áreas (segurança, jurídico, finanças, apoio ao cliente, software, saúde e produtividade) e criados por profissionais; Harvey, Doximity, Mercor, Sierra, Decagon e Genspark estão entre as doze empresas presentes. Único benchmark da categoria de produtividade, o Genspark Slides Benchmark leva onze modelos a produzir apresentações para 200 tarefas reais, no ambiente do agente Genspark Slides; as pontuações são atribuídas pelo avaliador interno da Genspark. Para o Gen-1 Slides, o seu modelo interno, a Genspark retoma o argumento de um preço de entrada equivalente a cerca de um décimo sétimo do preço do Claude Opus 5.

Modelo avaliadoPontuação no índice SIIPontuação da publicação da Genspark de 10 de setembroCusto por apresentação no índice
Claude Fable 5.183,6%fora da tabela, vantagem de 0,003 sobre o Gen-1 Slides no textonão apresentado
Gen-1 Slides82,2%0,8210,44 dólar
Claude Opus 581,0%0,8104,16 dólares
Claude Fable 579,9%fora da tabelanão apresentado
GPT-6 Astra78,0%fora da tabelanão apresentado
Kimi K372,6%0,7232,00 dólares
GPT-5.6 Sol67,0%0,6682,01 dólares
MiniMax M356,1%0,5630,34 dólar

🔗 Specialized Intelligence Index · Anúncio da Genspark


Runway lança a DIFFUSE, uma plataforma de recrutamento para profissionais criativos formados em IA

22 de setembro — A Runway lança a DIFFUSE (diffuse.runway.com), uma plataforma aberta onde marcas, agências e estúdios procuram, contactam e recrutam talentos formados em ferramentas de IA generativa (AI-native talent). Profissionais criativos, independentes, estúdios boutique ou produtoras podem criar um perfil e alojar o seu portefólio; não foi divulgado qualquer preço.

A Runway baseia-se no seu próprio estudo de mais de 1 000 ofertas de emprego criativas publicadas por quase 400 empresas: 17% mencionam competências em IA ou ferramentas generativas e, segundo a empresa, a Runway seria, de longe, a ferramenta de vídeo mais procurada. A Runway reconhece que a IA está a substituir parcialmente as profissões criativas, mas afirma que uma nova força de trabalho criativa se está a formar em torno destas ferramentas e que a procura por estes profissionais está a acelerar.

🔗 Apresentação da DIFFUSE · Runway no X


NVIDIA para programadores: Isaac ROS 5.0, DLSS 5 e RTX Mega Geometry 2.0

Isaac ROS 5.0 aposta nos agentes

22 de setembro — Apresentada na conferência ROSCon de Toronto, a Isaac ROS 5.0, a coleção gratuita e open source de pacotes ROS acelerados por GPU da NVIDIA, suporta ROS Lyrical e Ubuntu 24.04 e abrange toda a gama Jetson, desde o Jetson Orin Nano ao Jetson Thor. A principal novidade destina-se aos agentes: skills Isaac reutilizáveis para instalação e manipulação, documentação legível por agentes, uma skill que ajuda um agente a ajustar o modelo de visão estéreo FoundationStereo às suas próprias câmaras e uma skill autónoma de recolha e colocação (pick and place). O FoundationPose recebe uma biblioteca de inferência que acompanha a posição e a orientação dos objetos até 5,5 vezes mais depressa, sem que a NVIDIA especifique a referência usada na comparação.

🔗 Isaac ROS 5.0

DLSS 5 detalhado para os estúdios, RTX Mega Geometry 2.0 disponível

22 de setembro — Já disponível no NBA 2K27, o DLSS 5 é detalhado para os programadores: a sua renderização neural orientada por 3D (3D-Guided Neural Rendering) insere-se na última etapa do pipeline, parte da imagem renderizada pelo motor e utiliza a cor e os vetores de movimento para acrescentar iluminação e detalhes dos materiais, imagem a imagem, de forma determinística, numa única GeForce RTX série 50 até 4K. Os estúdios ajustam a intensidade da estrutura (Structure Intensity) e do tom (Tone Intensity) e dispõem de mascaramento semântico por IA. A mesma publicação adiciona ao ACE dois modelos com 600 milhões de parâmetros, Nemotron Speech 3.5 Streaming (reconhecimento de voz) e Qwen3 TTS (síntese de voz), publica o RTX Kit 2026.3 e disponibiliza o RTX Mega Geometry 2.0, com streaming de clusters de nível de detalhe contínuo para malhas muito densas.

🔗 Novidades para os programadores de jogos


NVIDIA e inferência: Dynamo-Triton multi-GPU e computação confidencial no B200

Dynamo-Triton 26.07 disponibiliza um modelo distribuído por oito GPU

21 de setembro — A NVIDIA mostra como disponibilizar um modelo TensorRT distribuído por várias GPU como um modelo comum. A inferência multi-GPU do TensorRT (multi-device inference), totalmente suportada a partir do TensorRT 11.0, utiliza NCCL; o Dynamo-Triton 26.07, anteriormente Triton Inference Server, ativa-a no seu backend TensorRT, e a aplicação chama apenas um único endpoint gRPC. Na geração de vídeo do Cosmos 3 Nano (1280×720, 189 imagens, 35 etapas), a latência de ponta a ponta passa de 156,6 segundos numa GPU para 34,2 segundos em oito, ou seja, uma redução de 4,58 vezes. A NVIDIA especifica que o teste não mede o débito com pedidos simultâneos nem o custo por vídeo.

Configuração testadaNúmero de GPULatência média de ponta a ponta
GPU única1156,595 s
CP2287,999 s
CP4453,093 s
CP8834,183 s

🔗 Dynamo-Triton e TensorRT multi-GPU

A inferência confidencial no B200 conserva mais de 96% do débito

22 de setembro — A NVIDIA mede o custo do seu Confidential Computing no Blackwell, que executa as cargas em máquinas virtuais com memória encriptada, GPU confidenciais e NVLink encriptado. Num DGX B200 (oito GPU, plataforma Intel TDX) que disponibiliza o DeepSeek-R1 em NVFP4 com TensorRT LLM, com 32 000 tokens de entrada e 1 000 de saída, o modo confidencial conserva entre 96,1% e 98,2% do débito e aumenta o tempo médio por token de saída apenas entre 1,2% e 4,3%, de 1 a 16 pedidos simultâneos. Foram necessárias três adaptações do framework: memória paginável em vez de memória fixada para algumas transferências, contador interno da GPU para o autotuner de kernels e outros algoritmos de comunicação devido à ausência de multidifusão NVLink SHARP neste modo. A carga foi escolhida para tornar visível o custo adicional; a NVIDIA recomenda comparar os dois modos com a sua própria carga.

🔗 Computação confidencial e TensorRT LLM


Breves

  • Zed prepara o Delta — A Zed anuncia para esta semana, embora ainda não estejam disponíveis, cores para agrupar os tópicos do Delta, o seu ambiente de código multijogador com agentes, e um indicador que mostra a distância até à compactação automática do contexto. 🔗 fonte
  • Replit e Handshake — A Replit é parceira fundadora do AI Skills Studio da Handshake: três missões gratuitas de 45 minutos conduzem a um projeto apresentado no perfil Handshake; OpenAI (10 missões), Google, Figma e Vercel estão entre os outros parceiros. 🔗 fonte
  • oMLX junta-se à Hugging Face — Jun Kim, criador do oMLX, projeto do ecossistema MLX da Apple, junta-se à Hugging Face; o projeto permanece sob Apache 2.0, continua a ser dirigido por ele, passa a ter manutenção e financiamento e visa, em primeiro lugar, uma conversão mais rápida dos modelos Transformers para MLX. 🔗 fonte
  • SnowLLM — Publicação da comunidade: este motor de inferência sob Apache-2.0 (kernels fornecidos em formato binário), criado para a GPU dos Ryzen AI Max, descodifica até 2,3 vezes mais depressa do que llama.cpp (1,9 vezes sem descodificação especulativa) e realiza o preenchimento inicial até 9,4 vezes mais depressa, segundo os seus autores. 🔗 fonte
  • DecisionBench e Bosun v3.1 — A Hanno Labs publica o DecisionBench 1.0 (43 tarefas, 28 domínios) e dois modelos de decisão com pesos abertos baseados no Qwen3 (0,6 e 1,7 mil milhões de parâmetros), com 83,20% e 87,29% na sua própria bateria aplicada; o Jev supera-os na vertente de raciocínio. 🔗 fonte
  • Um Moshi de 600 milhões de parâmetros — Um programador relata a sua tentativa de criar um modelo de voz full-duplex baseado no Qwen3-0.6B-Base, treinado por 2 a 15 dólares por tentativa em B200: o texto converge, mas a voz continua distorcida, um bloqueio localizado nos codebooks acústicos finos. Projeto em pausa, sem pesos publicados. 🔗 fonte
  • Together AI e GLM-5.2 — Num estudo de caso de 18 de setembro, republicado no X no dia 21, a Together AI descreve uma fintech que disponibiliza os seus agentes de código no GLM-5.2 com contexto de 256K e 56 B200; um incidente com uma fila de espera de 1 a 3 minutos foi corrigido no próprio dia através de uma reconfiguração do encaminhamento. 🔗 fonte
  • Gemini CLI — A nightly de 22 de setembro, a primeira com código novo desde o dia 19, corrige a falha HttpsProxyAgent is not a constructor com o Vertex AI atrás de um proxy e emite a atualização tool_call antes do pedido de permissão no modo ACP. 🔗 fonte
  • Google Flow — A conta oficial afirma ter mais de 25 milhões de utilizadores por mês e prolonga para todos os 50 créditos diários adicionais, uma oferta que em julho estava reservada aos subscritores do Google AI até 31 de agosto. 🔗 fonte
  • Jigsaw e Sensemaking AI — A incubadora da Google lança o seu Partner Program para implementar em 30 cidades, estados e países a sua suite open source de consulta aos cidadãos, alimentada pelo Gemini, com um fundo da Google.org, Bloomberg Philanthropies e Packard Foundation cujo valor não foi divulgado. 🔗 fonte
  • 100 000 bolsas de formação — À margem da Assembleia Geral das Nações Unidas, a Google financia 100 000 bolsas de formação certificada em IA em mais de 80 países através da AI Skills Coalition do programa AI for Good da UIT, distribuídas pelos governos locais e pela rede Giga. 🔗 fonte
  • Agentes que protegem o código da Google — Numa publicação de 19 de setembro, a Google explica que analisa, antes da submissão, cada alteração ao código da sua infraestrutura com agentes criados sobre o seu framework open source Mantis, que bloqueiam centenas de vulnerabilidades por mês; o agente de triagem anuncia uma precisão superior a 92% em menos de um minuto. 🔗 fonte
  • Copilot CLI 1.0.88 — As definições geridas pela empresa aplicam-se agora às sessões --acp, --ahp-host e --server, até então sem política MCP, permissões nem plugins, e /fork funciona durante um turno; a versão 1.0.87 de 21 de setembro acrescentava definições geridas para o nível de encaminhamento Auto. 🔗 fonte
  • Pika e Seedance 2.5 — O modo Draft do Seedance 2.5 chega ao Pika e ao Pika API Club: rascunhos de clips a partir de 10 cêntimos por segundo, que podem depois ser finalizados em alta qualidade. 🔗 fonte
  • Pika Swap Anything — Nova aplicação da Pika que substitui atores, figurinos, cenários ou acessórios de um vídeo, preservando o ritmo, os movimentos e a narrativa da filmagem original, sem preço divulgado. 🔗 fonte
  • Suno Studio — A estação de produção musical da Suno integra uma suite de efeitos de áudio, incluindo um compressor (limiar, rácio, ataque, libertação, sidechain), incluída na subscrição Premier. 🔗 fonte
  • Sluicebox e Nemotron 3 Ultra — Estudo de caso da NVIDIA: ao adotar o Nemotron 3 Ultra, esta startup de análise das emissões de carbono das cadeias de abastecimento reduz os seus custos de inferência entre 51% e 80% e alcança 87,7% na extração de dados de fornecedores, contra 84% do seu modelo anterior. 🔗 fonte
  • Topograph — Conjunto de ferramentas open source da NVIDIA que descobre a topologia de rede de um cluster de GPU e a disponibiliza ao Kubernetes, Slurm e Slinky, para colocar as cargas distribuídas o mais próximo possível umas das outras; lê as API da Crusoe, Google Cloud, Lambda, Nebius, Nscale e Oracle Cloud. 🔗 fonte
  • Avaliar um agente — Numa publicação metodológica de 21 de setembro, a NVIDIA propõe seis métricas, desde a chamada de ferramenta até à tarefa concluída, e refere o Nemotron 3.5 Lightning com 86% no PinchBench, 30% mais rápido do que o Qwen3.6 35B. 🔗 fonte
  • Qwen-Image-2.1 na Intel — Anunciado pela Intel em 21 de setembro e divulgado pela Qwen no dia 22, o suporte desde o primeiro dia através do OpenVINO destina-se às GPU Arc Pro B70 e às GPU integradas dos Core Ultra Series 3, com um notebook dedicado. 🔗 fonte
  • Box e Grok 4.7 — Em 21 de setembro, dia do lançamento do Grok 4.7, a Box testou-o numa pré-visualização do Box Agent num sinistro de 2 milhões de dólares: foram detetados uma fatura duplicada de 82 000 dólares e um crédito em falta de 64 000 dólares; sem data de disponibilidade nem preço. 🔗 fonte
  • Um cirurgião e o Codex — A OpenAI Developers publica um vídeo no qual Brian Pridgen, cirurgião da mão, mostra como cria as suas próprias ferramentas com o Codex e revê a literatura científica no PubMed, sem dados quantitativos nem estudo escrito. 🔗 fonte
  • ChatGPT no Word — Anunciado em 17 de setembro: um único suplemento Microsoft dá acesso ao ChatGPT no Word, Excel e PowerPoint, em todo o mundo e em todos os planos, incluindo o Free, com limites de utilização; Business e Enterprise têm uma pré-visualização gratuita do GPT-5.6 Sol no Word até 30 de setembro. 🔗 fonte
  • Literacia em IA — A Perplexity publica um guia que considera a avaliação das respostas a competência fundamental, critica o «teatro da formação» e cita a Gallup: 38% de adoção declarada, mas 12% de utilização diária no quarto trimestre de 2025. 🔗 fonte

O que isto significa

No mesmo dia, a Anthropic e a OpenAI defenderam o mesmo argumento: não um modelo mais poderoso a qualquer preço, mas um nível próximo dos seus modelos de topo por muito menos. O Opus 5.5 é apresentado ao nível do Fable 5.1 por menos 40% do que o Opus 5, e o GPT-6 Sol como recuperando grande parte dos pontos fortes do Astra por 2 e 10 dólares por milhão de tokens. As duas empresas passam agora a raciocinar em termos de custo por tarefa, em vez de preço por token, e fazem da cache a verdadeira alavanca: leituras a 0,20 dólar na Anthropic, desconto de até 90% e pontos de interrupção explícitos na OpenAI.

A integração, por sua vez, mede-se em horas. GitHub Copilot, Devin, Perplexity, Cursor e v0 disponibilizaram os novos modelos no próprio dia, cada um com a sua própria métrica: FrontierCode 1.1 Extended na Cognition, WANDR na Perplexity, CursorBench na Cursor. Estes números não são diretamente comparáveis (65,3% para o Opus 5.5 na variante Extended, 54,4% na variante Main), e nenhuma das duas empresas compara ainda o seu novo modelo com o da outra. Para um programador, a escolha certa é avaliada cada vez mais na sua ferramenta e nas suas tarefas, em vez de nas tabelas de lançamento.

Os planos também se tornam um terreno de diferenciação. A Anthropic aumenta os seus limites para cinco horas, oferece uma reposição e passa os planos Pro e Team Standard para o Opus no Claude Code; o GitHub reserva o Opus 5.5 aos planos superiores, mas disponibiliza o GPT-6 Luna a partir do Copilot Pro; a Google integra o Colab nos seus planos Google AI, ao mesmo tempo que restringe o Gemini 2.5 para preservar a sua capacidade. A distribuição da capacidade computacional entre os planos pesa agora tanto como o preço anunciado.

Por fim, a própria forma de medir está a mudar. A Anthropic reconhece que as margens nos benchmarks orientam menos bem do que antes e que o Opus 5.5 parece muitas vezes saber que está a ser avaliado; a OpenAI estabelece regras para disponibilizar os seus modelos a avaliadores independentes; o AISI britânico torna os seus resultados reproduzíveis com o EvalEval, e a NVIDIA propõe avaliar um agente pela tarefa concluída, em vez de por cada chamada de ferramenta. Verificar o que um modelo realmente faz conta agora tanto como a sua pontuação.


Fontes