Pesquisar

Claude Code lê AGENTS.md, Qwen3.8-Omni-Flash chega, Codex testa conversas por voz

ai-powered-markdown-translator

Artigo traduzido do francês para o português com o gpt-5.6-sol.

Ver projeto no GitHub ↗

Nesta sexta-feira, as ferramentas de agentes convergem para formatos partilhados: o Claude Code agora lê AGENTS.md quando um projeto não tem CLAUDE.md, o Antigravity injeta o catálogo dos subagentes no prompt de sistema dos seus agentes Markdown, o Codex detalha o seu consumo por subagente e a MiniMax disponibiliza o código do seu agente de terminal. O restante do dia resume-se a dois lançamentos de modelos — Qwen3.8-Omni-Flash e Grok Voice Transcribe 2.0 — e a uma parceria pouco habitual: a Anthropic instala avaliadores da Accenture dentro da própria empresa.


Claude Code lê AGENTS.md, isola os subagentes e remove TaskOutput

18 de setembro — Três versões do Claude Code sucederam-se em vinte horas: a 2.1.275 em 17 de setembro às 22h33 UTC, a 2.1.276 no dia 18 às 02h12 UTC e a 2.1.277 no dia 18 às 18h06 UTC.

A novidade mais estruturante resume-se a uma linha da versão 2.1.277. Num projeto sem CLAUDE.md, o Claude Code lê AGENTS.md, o ficheiro de instruções que se tornou uma convenção partilhada por vários agentes de código do mercado. A opção é configurada em /config, na secção «Project instructions». A funcionalidade ainda não está disponível no Bedrock, Vertex nem Foundry.

Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)

🇵🇹 Adicionado suporte para AGENTS.md: num projeto sem CLAUDE.md, o Claude Code lê AGENTS.md em alternativa; a definição pode ser alterada em «Project instructions» no /config (ainda não disponível no Bedrock, Vertex ou Foundry). — CHANGELOG do Claude Code, anthropics/claude-code

Duas outras alterações da mesma versão dizem respeito à segurança do contexto. Os resultados dos subagentes são enviados ao agente principal sob um cabeçalho que os identifica como tal, para impedir que um texto devolvido por um subagente se faça passar por uma instrução da sessão; além disso, os caracteres Unicode invisíveis de formatação são removidos dos prompts, sendo a versão limpa apresentada antes do envio. A versão 2.1.277 também remove a ferramenta obsoleta TaskOutput: o Claude agora lê o ficheiro de saída de uma tarefa em segundo plano com Read.

A versão 2.1.275 acrescenta uma tecla de envio imediato (ctrl+enter), que interrompe o turno em curso e envia de uma só vez todas as mensagens na fila, bem como a sincronização com o terminal das skills e dos plugins ativados na conta claude.ai. No que diz respeito à cadeia de fornecimento, os plugins provenientes do npm são obtidos através de npm pack --ignore-scripts com verificação de integridade, impedindo a execução dos scripts de instalação de um pacote. A versão 2.1.276, publicada menos de quatro horas depois, corrige apenas uma regressão dessa versão: um erro 400 que fazia falhar todos os pedidos efetuados através de um proxy.

Número da versãoLançamento (UTC)Conteúdo de destaque
2.1.27517/09 às 22h33Envio imediato, sincronização das skills do claude.ai, npm --ignore-scripts
2.1.27618/09 às 02h12Correção única: erro 400 através de um proxy
2.1.27718/09 às 18h06Suporte para AGENTS.md, isolamento dos subagentes, remoção de TaskOutput

🔗 Notas da versão 2.1.277


Qwen3.8-Omni-Flash, o primeiro modelo omni-modal agêntico da Qwen

18 de setembro — A Qwen lança o Qwen3.8-Omni-Flash, apresentado como o seu primeiro modelo omni-modal concebido em torno de capacidades agênticas. A evolução anunciada já não se limita à compreensão de conteúdos multimodais, mas à sua utilização: compreender o conteúdo, planear a tarefa, executá-la com ferramentas e entregar o resultado. O modelo aceita texto, imagem, áudio e vídeo numa janela de contexto de um milhão de tokens.

Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!

🇵🇹 Apresentamos o Qwen3.8-Omni-Flash, o primeiro modelo omni-modal da Qwen desenvolvido em torno de capacidades agênticas.@Alibaba_Qwen no X

Nas 29 avaliações selecionadas pela Qwen, a pontuação média aumenta mais de 25% em comparação com o Qwen3.5-Omni-Plus, concentrando-se os ganhos nos agentes de áudio e vídeo. O reconhecimento de múltiplos locutores é a área que mais evolui.

Avaliação selecionadaQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71,034,558,9
UniClawBench69,667,169,0
AgenticVBench36,814,545,0
OmniVideoBench63,453,865,2
StreamingBench80,857,179,9
AliMeeting DER / cpWER (quanto menor, melhor)3,4 / 17,288,1 / 89,672,6 / 53,1

O aspeto mais original é a perceção agêntica aplicada a vídeos longos. Em vez de processar uma gravação do início ao fim, o modelo parte da pergunta feita, decide por si próprio o que ver e ouvir e localiza a informação através de passagens sucessivas, do geral para o específico. No OmniVideoBench, este modo aumenta a precisão de 63,4 para 67,8, reduzindo simultaneamente o consumo de 145 736 para 79 117 tokens por pedido, ou seja, cerca de 45,7% menos — valor indicado pela própria publicação oficial.

A componente de preços acompanha esta evolução: segundo a metodologia da Qwen, o preço por hora de entrada de áudio diminui mais de 98% em comparação com o Qwen3.5-Omni-Plus. Dois componentes são disponibilizados em código aberto ao mesmo tempo: Qwen-MM-Plugins, compatível com os harnesses Codex, Claude Code, Qwen Code e Gemini CLI, e Qwen-Live Harness, destinado à interação em tempo real. Uma variante Realtime é dedicada à interação contínua de baixa latência, com o primeiro token entre 591 e 981 milissegundos.

🔗 Publicação da Qwen sobre o Qwen3.8-Omni-Flash


Codex CLI 0.155.0 introduz as conversas por voz como funcionalidade experimental

17 de setembro — A OpenAI lança o Codex CLI 0.155.0, a primeira versão estável desde a 0.154.0, de 10 de setembro, instalável através de npm install -g @openai/codex@0.155.0. É a entrada no changelog que faltava para o agente de voz anunciado na véspera no X: a funcionalidade chama-se /voice, disponibiliza transcrição em direto e controlos do microfone e continua a ser experimental — disponível apenas nas compilações suportadas (supported builds) e ativada através de /experimental.

O restante da versão é mais discreto, mas tem utilidade mais imediata. A interface no terminal passa a apresentar resumos do raciocínio em direto na linha de estado, bem como um carimbo de data e hora de conclusão após cada turno bem-sucedido. A vista geral dos agentes permite ocultar, arquivar e eliminar tarefas, apresentando os detalhes de propriedade dos worktrees e uma confirmação antes da eliminação dos worktrees geridos que estejam limpos. Nos Mac compatíveis, os pedidos MCP das sessões TUI locais podem ser validados através do Touch ID. O Amazon Bedrock pode obter as suas credenciais AWS a partir de comandos configurados, com armazenamento em cache, atualização após a expiração e recuperação depois de uma falha de autenticação.

Várias correções estão relacionadas com a segurança: são bloqueadas as fugas de processos Windows a partir de sandboxes WSL restritas, os snapshots intermediados do shell são reforçados contra a exposição de credenciais e uma mudança de conta invalida as sessões de controlo remoto, o estado WebSocket em cache e os catálogos de modelos pertencentes à identidade anterior.

Novidade da versãoDetalhe
/voiceTranscrição em direto e controlos do microfone, experimental através de /experimental
Interface no terminalResumos do raciocínio na linha de estado, carimbo de data e hora do fim do turno
Vista geral dos agentesOcultação, arquivo e eliminação de tarefas, propriedade dos worktrees
Touch IDValidação dos pedidos MCP em sessões locais, em Mac compatíveis
Amazon BedrockCredenciais AWS obtidas por comando, com cache e atualização

🔗 Notas da versão Codex CLI 0.155.0

Codex detalha o seu consumo por tarefa, subagente e conversa

18 de setembro — A OpenAI Developers anuncia o acompanhamento detalhado do consumo no Codex: a ferramenta mostra como as tarefas, os subagentes e as conversas individuais contribuem para a utilização total. A informação encontra-se na aplicação para computador, em Definições e depois Usage & billing para contas pessoais e Business, ou em Usage para contas Enterprise elegíveis; é necessário ter a aplicação atualizada para aceder à funcionalidade. Nenhuma publicação de blogue nem entrada no changelog acompanha o anúncio.

A granularidade é o verdadeiro tema. Até agora, o esgotamento de uma quota não indicava a origem do consumo; uma discriminação por subagente permite saber qual delegação tem custos elevados e reescrevê-la. É a contrapartida contabilística da generalização dos subagentes nos harnesses de código.

🔗 Anúncio da OpenAI Developers no X


Grok Voice Transcribe 2.0, o reconhecimento de voz da SpaceXAI com preço inalterado

18 de setembro — A SpaceXAI anuncia o Grok Voice Transcribe 2.0, o seu novo modelo de reconhecimento de voz (speech-to-text), descrito como duas vezes mais preciso do que a versão 1.0 pelo mesmo preço. O modelo baseia-se na infraestrutura de áudio que já alimenta o Grok Voice, que, segundo a empresa, processa dezenas de milhares de chamadas de apoio ao cliente por dia e transcreve milhões de horas de narração de vídeo.

O argumento central diz respeito ao áudio real, e não ao áudio de laboratório: linhas telefónicas instáveis, vozes concorrentes, sotaques locais, números de telefone e endereços de e-mail ditados em voz alta. A SpaceXAI reivindica o primeiro lugar em precisão entre 32 modelos de streaming na classificação pública da Artificial Analysis e baseia-se em quatro conjuntos internos extraídos do tráfego de produção — telefonia a 8 kHz, conversas com o Grok, identificadores ditados e comandos de voz curtos em 19 idiomas.

O ganho mais significativo diz respeito ao multilinguismo. No conjunto de frases curtas, aquelas que oferecem menos contexto para identificar o idioma, a taxa de erro por palavra diminui de 20,6% para 6,8%. O modelo deteta automaticamente o idioma e acompanha as mudanças durante a gravação numa única passagem.

Métrica medidaValor anunciado
Precisão reivindicada em relação ao Transcribe 1.0duas vezes superior
Classificação da Artificial Analysis (streaming)1.º entre 32 modelos
Taxa de erro em frases curtas (1.0 → 2.0)20,6% → 6,8%
Preço por lote0,10 dólar por hora de áudio
Preço em streaming0,20 dólar por hora de áudio
Canais transcritos de forma independenteaté 8
Termos profissionais por pedidoaté 100

O modelo suporta processamento em lote e streaming, carimbos de data e hora ao nível das palavras com pontuação de confiança, separação de locutores (diarization) sem custos adicionais e deteção do fim do turno de fala. As integrações existentes da API recebem o ganho de precisão sem qualquer alteração de código. O Grok Voice Transcribe 2.0 tornar-se-á em breve o modelo predefinido da API e a versão 1.0 será descontinuada nas próximas semanas: será necessário fixar grok-voice-transcribe-1.0 para continuar a utilizá-la.

🔗 Anúncio do Grok Voice Transcribe 2.0


Anthropic instala avaliadores da Accenture dentro da empresa

18 de setembro — A Anthropic anuncia uma parceria com a Accenture para a avaliação independente de modelos de fronteira, apresentada como um passo importante para cumprir o compromisso assumido pelo seu diretor executivo de receber avaliadores integrados (embedded). O trabalho será conduzido pela Faculty, a subsidiária da Accenture especializada em IA, e abrangerá a avaliação e o red-teaming dos modelos, as avaliações de alinhamento e os testes das salvaguardas.

A distinção em relação aos avaliadores externos é explícita: um avaliador integrado trabalha dentro da empresa de IA com um nível de acesso comparável ao de um funcionário. Pode observar os modelos durante o treino, acompanhar as decisões que orientam a sua construção e implementação, falar diretamente com os funcionários, verificar se os compromissos de segurança são cumpridos, comunicar incidentes e publicar uma descrição mais bem fundamentada dos benefícios e dos riscos. A Anthropic esclarece que este mecanismo não reduz a sua responsabilidade, mas torna-a mais verificável.

O anúncio é invulgarmente franco sobre o que ainda não existe. Não há qualquer norma relativa às informações a que um avaliador integrado deve ter acesso, nem à forma como deve publicar as suas conclusões, nem existe um sistema estabelecido para financiar a avaliação independente. A Anthropic considera que, a prazo, esse financiamento deverá provir de fundos mutualizados ou públicos; na ausência atual de tal mecanismo, financia diretamente o trabalho da Accenture — o que constitui a limitação mais visível desta estrutura.

Elemento da parceriaValor anunciado
Entidade operadoraFaculty, subsidiária de IA da Accenture
InvestimentoPelo menos 1 mil milhão de dólares por parte, ao longo de cinco anos
Âmbito abrangidoAvaliação, red-teaming, alinhamento, salvaguardas
Nível de acessoComparável ao de um funcionário
FinanciamentoDireto pela Anthropic, na ausência de fundos mutualizados
ExclusividadeNenhuma, de ambos os lados

A Anthropic indica também estar em conversações com a METR e outros avaliadores sem fins lucrativos para testar componentes da avaliação integrada com financiamento próprio e anuncia outros parceiros nas próximas semanas.

🔗 Anúncio da Anthropic sobre a avaliação integrada


Antigravity: três versões em dois dias sobre agentes personalizados

A Google publicou em rápida sucessão duas versões da sua CLI e uma versão do aplicativo Antigravity. As três abordam o mesmo tema sob três ângulos: o que um agente personalizado sabe, o que pode recusar e por quanto tempo pode funcionar sem supervisão. Elas dão continuidade a uma série intensa iniciada em 11 de setembro, cujas versões 1.2.1 a 1.2.4 não são abordadas aqui.

A CLI 1.2.6 abre um Remote Control vinculado à sessão e elimina o limite de cinco minutos

18 de setembro — Oito dias após a 1.2.0, que transformava a CLI em um serviço persistente do sistema, a Google segue na direção oposta com uma segunda forma de Remote Control, muito mais leve: uma conexão limitada à sessão (session-scoped), aberta pela flag --remote-control na inicialização ou pelo comando /remote-control durante a execução. Digitar /remote-control off ou encerrar a sessão desmonta o túnel e remove o dispositivo da lista. Enquanto a 1.2.0 visava um daemon que sobrevive à sessão, a 1.2.6 visa o contrário.

A segunda mudança diz respeito ao modo sem interface (headless): o tempo limite padrão das execuções -p / --prompt passa de cinco minutos para ilimitado, salvo se houver um --print-timeout explícito. A terceira estrutura o relatório de erros — em caso de falha do agente ou da API, a CLI grava na saída de erro uma linha JSON AGY_ERROR: {...} contendo o status canônico, o código HTTP ou gRPC, a possibilidade de nova tentativa e um identificador de erro, com um código de saída que passa de 1 para 3. Assim, um script de orquestração pode distinguir uma falha temporária de rede de um erro definitivo sem analisar texto livre.

A CLI 1.2.5 finalmente fornece aos agentes Markdown o diretório de seus subagentes

17 de setembro — Até agora, um agente personalizado definido em Markdown podia declarar invoke_subagent em suas ferramentas sem nunca saber quais subagentes existiam: ele tinha a ferramenta, mas não o diretório. Agora, a CLI adiciona automaticamente ao seu prompt de sistema o catálogo dos subagentes disponíveis e as respectivas instruções de uso, tornando efetiva a delegação.

O vocabulário do changelog exige cautela: trata-se de uma adição de contexto pelo próprio produto, não de uma vulnerabilidade de segurança nem de uma correção. A segunda melhoria preserva o nome explícito de uma tarefa enviada para execução em segundo plano, que se perdia entre as notificações e as listas de tarefas. As cinco correções tratam da remoção de identificadores invalidados, dos códigos de saída de comandos interrompidos e de quadros de raciocínio que permaneciam congelados.

O Antigravity 2.15.0 permite que agentes personalizados desativem prompts e ferramentas padrão

18 de setembro — Três dias após a 2.14.0, o aplicativo publica 7 melhorias e 16 correções. A principal mudança dá aos agentes personalizados controle sobre seu próprio contexto: eles podem desativar as seções de prompt padrão e as ferramentas padrão e, em seguida, reintroduzir apenas aquelas de que precisam. Para um agente especializado, isso reduz na mesma proporção o prompt de sistema imposto.

O restante trata da navegação e da persistência: Page Up, Page Down, Home e End rolam uma conversa, Esc sai da área de entrada, e o agente personalizado selecionado é memorizado após um recarregamento. Duas correções afetam a integridade dos dados — as configurações salvas e a lista de projetos podiam ser sobrescritas quando o aplicativo não conseguia ler seu arquivo de estado, e as configurações de permissões acumulavam duplicatas que faziam os arquivos de conversa crescerem.

🔗 Changelog do Antigravity


GitHub Copilot: um canvas Sentry, seis modelos removidos e métricas por personalização

Três entradas de changelog em dois dias revelam a mesma preocupação: medir o que as equipes realmente fazem com o Copilot e remover o que já não utilizam.

O resumo de 14 de setembro destaca dois componentes novos

18 de setembro — O GitHub publica seu resumo semanal do Copilot referente à semana de 14 de setembro. A maior parte do sumário retoma entradas já publicadas ao longo do changelog; apenas dois elementos nunca haviam sido anunciados separadamente. O primeiro é o canvas Sentry no aplicativo Copilot, que conecta um relatório de falha em produção a uma correção sem sair do aplicativo: ele exibe os erros, os rastreamentos de pilha (stack traces) e o contexto e, em seguida, permite investigar a causa, validar uma correção e preparar uma pull request. É a primeira integração de uma ferramenta de monitoramento de erros nos canvases, após o Jira no início de setembro.

O segundo é a leva de recursos de agentes do VS Code 1.138. A janela Agents pode executar um agente em um Dev Container local, com as ferramentas e dependências do projeto — implantação progressiva, Docker necessário. As sessões inativas podem ser marcadas automaticamente como concluídas quando todas as suas pull requests forem mescladas, com exclusão opcional após um período de carência, em prévia e mediante ativação explícita. Por fim, uma pull request pode ser criada diretamente de uma sessão do Agent Host.

🔗 Resumo semanal do Copilot

Seis modelos deixam todas as interfaces do Copilot em 19 de outubro

18 de setembro — O GitHub anuncia a remoção de seis modelos de todas as interfaces do Copilot — Copilot Chat, edições online, modos ask e agent, preenchimentos de código — em 19 de outubro de 2026. É a segunda leva de descontinuações anunciada em setembro.

Modelo removidoData de remoçãoAlternativa sugerida
Gemini 3.7 Flash19/10/2026Gemini 3.8 Flash
GPT-5.519/10/2026GPT-5.6 Sol
GPT-5.419/10/2026GPT-5.6 Sol
GPT-5.4 mini19/10/2026GPT-5.6 Luna
GPT-5 mini19/10/2026GPT-5.6 Luna
Grok 4.519/10/2026Grok 4.6

Com a ativação padrão dos modelos, as alternativas são ativadas automaticamente para os clientes Copilot Enterprise e Business, a menos que um administrador tenha desativado o padrão global ou bloqueado explicitamente o modelo em questão; nesse caso, o acesso é reaberto pelas políticas de modelos nas configurações. Nenhuma ação é necessária para remover os modelos.

🔗 Anúncio da descontinuação dos modelos do Copilot

A API de métricas contabiliza skills, agentes, servidores MCP e plugins da CLI

17 de setembro — A API de métricas de uso do Copilot agora abrange cinco famílias de personalizações agênticas da CLI: skills, agentes personalizados, servidores MCP, slash commands e plugins. As tabelas totals_by_skill, totals_by_custom_agent, totals_by_mcp, totals_by_slash_cmd e totals_by_plugin listam os cinco elementos mais ativos com seus respectivos interaction_count, enquanto os campos distinct_*_use_count contabilizam a variedade de elementos utilizados além desse top cinco.

Duas sutilezas evitam interpretações equivocadas. Para os servidores MCP, o contador só aumenta quando a CLI tenta se conectar ou reconectar — com sucesso ou sem ele —, não a cada chamada de ferramenta em uma conexão estabelecida. As métricas de plugins contabilizam apenas as invocações de skills associadas a um plugin: elas formam um subconjunto dos totais de skills e não devem ser somadas a eles. Por motivos de privacidade, apenas os nomes fornecidos pelo GitHub são exibidos, enquanto os nomes definidos pelos clientes são agrupados sob other.

🔗 Personalizações agênticas da CLI na API de métricas


Agentes de código no terminal: MiniMax abre o seu, Mistral estabiliza seu harness

Dois anúncios de duas empresas sem relação entre si, no mesmo dia e no mesmo mercado: o agente de codificação que vive em um terminal está se tornando comum, e a diferenciação se desloca para a licença e a estabilidade do harness.

A MiniMax publica o código do MiniMax Code CLI sob a licença MIT

18 de setembro — A MiniMax abre o código-fonte do seu agente de codificação em terminal na versão 0.4.12. A ferramenta é instalada sob o nome mcode e oferece três pontos de entrada: uma interface de terminal interativa, um modo sem interface (mcode exec) destinado a scripts shell, integração contínua e avaliações, e um modo ACP para editores compatíveis com o Agent Client Protocol. Ela lê os arquivos de um projeto, inspeciona as diferenças, executa comandos shell e testes, sob um regime de permissões e sandbox.

A escolha do modelo permanece aberta: conta MiniMax e seu Token Plan de um lado, provedor terceirizado do outro, desde que disponibilize um formato de API compatível com OpenAI ou Anthropic. Somam-se a isso pesquisa integrada, ferramentas multimodais, o protocolo MCP, subagentes e um sistema de plugins. O código original é publicado por padrão sob a licença MIT. O repositório abrange a TUI, a CLI sem interface e o modo ACP, mas não o aplicativo para desktop, embora hospede o rastreamento de problemas deste último; por enquanto, as contribuições de código são aceitas apenas de colaboradores do repositório.

🔗 Anúncio da MiniMax no X

O Unified Harness do Vibe CLI deixa de ser experimental

18 de setembro — A Mistral publica o Vibe CLI 2.25.5, seis dias após a 2.25.4. A mudança estrutural cabe em uma linha das notas de versão: o Unified Harness já não é rotulado como « experimental », e agora é --legacy-harness que serve como rota de escape documentada para o antigo harness Python. Após uma série de versões corretivas centradas na segurança das aprovações de shell, o novo harness passa a ser o padrão assumido — essa é a informação relevante, não o número da versão.

A mudança vem acompanhada de uma recuperação de paridade: agora, o Unified Harness injeta o branch Git atual, o estado do repositório e os commits recentes nas instruções do sistema; os hooks finalmente são executados dentro dos subagentes, em vez de serem silenciosamente ignorados; e os provedores configurados sem variável de ambiente de chave de API — servidores locais ou auto-hospedados — voltam a funcionar. O reforço das permissões continua: as aprovações de shell já não se estendem a outro programa ou ambiente, as chamadas de ferramentas MCP agora respeitam o sistema de permissões em vez de contorná-lo, e o smart approve deixa de ignorar as regras do usuário.

🔗 Notas de versão do Vibe CLI 2.25.5


Os plugins do ChatGPT aceitam várias contas simultaneamente

18 de setembro — O suporte a várias contas chega à maioria dos plugins do ChatGPT. Agora é possível vincular a conta pessoal, a conta profissional e as contas de projetos paralelos e, em seguida, trazer o contexto de cada uma para uma mesma conversa. As contas são conectadas pelo diretório de plugins, em chatgpt.com/plugins.

O anúncio da conta OpenAI Developers retoma uma mensagem de Max Stoiber publicada uma hora antes. Para os desenvolvedores de plugins, não há nada a fazer: o recurso é ativado automaticamente, sem alterações. Quem quiser ir além pode adicionar uma ferramenta profile ao seu servidor MCP, para que o ChatGPT saiba rotular as contas conectadas — essa é a única ação concreta esperada deles. Nenhuma publicação de blog ou entrada de changelog acompanha o anúncio, publicado às 18h10, horário de Paris.

O caso de uso pretendido é o de um desenvolvedor que mantém suas identidades separadas por empregador ou projeto e que, até agora, precisava trocar de login para mudar de contexto.

🔗 Anúncio de várias contas no X

🔗 Mensagem original de Max Stoiber


Genspark adiciona um saldo semanal de créditos aos planos Plus e Pro

18 de setembro — A Genspark altera os benefícios de suas assinaturas Plus e Pro, adicionando um saldo semanal de créditos sem mudar o preço dos planos. Esse saldo é disponibilizado toda semana, além do plano já contratado, e cobre o uso no modo Standard em todos os agentes e ferramentas da plataforma: Super Agent, AI Chat, AI Image, AI Slides, AI Sheets, AI Docs e Deep Research.

Uma segunda mensagem do mesmo fio detalha o funcionamento para AI Chat e AI Image. Para os assinantes atuais, o saldo é adicionado ao que já possuem e, até 31 de dezembro de 2026, todos os modelos de AI Chat e AI Image podem ser usados sem custo em créditos, incluindo modelos de destaque como Opus; para as pessoas que assinarem a partir de 18 de setembro, os modelos básicos (core models) de AI Chat e AI Image são gratuitos. A Genspark esclarece que essas mudanças não se aplicam aos planos Team nem aos planos Enterprise e encaminha para sua central de ajuda para os detalhes das condições.

🔗 Anúncio da Genspark no X


Google Research: o que o AlphaGenome Atlas produziu e simulações que testam a si mesmas

Duas publicações de pesquisa no mesmo dia, com um ponto em comum: em ambos os casos, o que é mostrado não é o modelo, mas aquilo que terceiros extraíram dele ou aquilo que o ciclo de validação verifica em seu lugar.

O AlphaGenome Atlas apresenta os primeiros resultados de seus parceiros

17 de setembro — Nove dias após a publicação do AlphaGenome Atlas, o mapa preditivo das 9 bilhões de substituições possíveis do DNA humano, a Google DeepMind destaca um fio detalhando três colaborações.

Parceiro científicoResultado relatado
Stowers InstituteMais de 2.500 motivos regulatórios mapeados
Universidade de Exeter / UK BiobankMais de 54.000 participantes analisados, mais de 22% de detecção adicional de sinais genéticos raros
Broad InstituteMutação crítica do gene DNM1 identificada, depois confirmada e validada em laboratório

Os motivos regulatórios são as sequências de DNA que funcionam como interruptores e potenciômetros da atividade dos genes. O trabalho realizado em Exeter também identificou novas variantes que influenciam a abundância de PLA2G7, uma proteína associada à saúde metabólica. O caso do Broad Institute é o mais concreto dos três: diante de uma lista imensa de possíveis mutações em doenças raras sem explicação, o Atlas serve para indicar a correta, que depois é confirmada em bancada. No entanto, o conjunto limita-se a um fio no X, sem publicação detalhada em blog nem artigo associado.

🔗 Fio sobre o AlphaGenome Atlas no X

Simulações pedagógicas geradas e depois testadas por um agente no Chrome

17 de setembro — Gal Elidan e Yael Haramaty publicam uma experiência que aplica a interface generativa (generative UI) à criação de simulações pedagógicas. O professor mantém a iniciativa: propõe o tema, a Google gera um conjunto de objetivos de aprendizagem modificáveis e sujeitos à sua aprovação, que servem de base para a geração. Cada recurso interativo está dividido em níveis de dificuldade crescente, com caixa de ferramentas, pistas progressivas e soluções detalhadas.

O elemento mais interessante é o ciclo de autocorreção. A geração é controlada por critérios pedagógicos, mecânicos e de apresentação, e algumas avaliações são agênticas: o teste de resolubilidade abre uma instância do Chrome e manipula a simulação como faria um utilizador, tentando também ações adversas, como levar os controlos deslizantes aos seus valores extremos. O ciclo repete-se até que todos os critérios sejam cumpridos, à custa de um tempo de geração mais longo. A Google publica mais de 30 recursos interativos STEM em inglês; uma coleção de 40 foi avaliada por professores britânicos, e um estudo com 12 professores americanos atribui uma classificação média de 8 em 10.

🔗 Publicação da Google Research sobre os recursos pedagógicos interativos


Claude acelera mais de 30 modelos de biologia e financia uma competição de proteínas

17 de setembro — A Anthropic publica um artigo que descreve como Claude otimizou a inferência de mais de 30 modelos open source utilizados por biólogos — previsão de estruturas, design de proteínas, modelos de linguagem de proteínas e genómica — em pouco menos de quatro semanas, com uma melhoria média de cerca de 4x. Todo o código é publicado em open source.

O núcleo técnico incide sobre a atenção triangular e a multiplicação triangular, cúbicas tanto em tempo como em memória. Claude produziu o FlashPairformer, um conjunto de kernels que supera o padrão do setor em 2,7 a 2,9x na atenção. Um modo de baixa memória chamado «Big» permite modelar com precisão sistemas com mais de 10 000 tokens num único nó GPU, enquanto o ribossoma 40S previsto pelo AlphaFold3 tinha 7 663 tokens. O método é igualmente importante: o trabalho foi supervisionado por dois membros da equipa técnica sem experiência prévia em otimização de inferência.

Por fim, a Anthropic copatrocina com a Adaptyv Bio uma competição de design de proteínas em cinco problemas difíceis, com mais de 5 000 designs da comunidade validados experimentalmente, até 1 milhão de dólares em créditos Claude e 250 000 dólares de capacidade computacional fornecida pela Modal.

🔗 Publicação de investigação da Anthropic


Modelos abertos e laboratórios: Muse chega ao Mac, Sakana revela o seu grupo de fronteira

Meta leva o seu agente Muse ao macOS

18 de setembro — A Meta disponibiliza o Muse no Mac, anunciado durante a noite de 17 para 18 de setembro. A conta @AIatMeta partilha uma publicação que descreve um agente pessoal capaz de agir diretamente no computador do utilizador, sempre com a sua autorização explícita. São mencionadas três utilizações: organizar a pasta de transferências, encontrar um ficheiro perdido e resumir mensagens e notas.

O anúncio dá continuidade ao lançamento do Muse, em 8 de setembro, um agente impulsionado pelo Muse Spark 1.3 e até agora disponível no iOS, Android, na web e no WhatsApp. A chegada ao Mac leva este tipo de produto a uma nova etapa: o agente deixa de trabalhar no seu próprio sandbox e passa a atuar nos ficheiros pessoais do utilizador. A Meta não comunica preços, países de disponibilidade nem requisitos de sistema, e a disponibilização não é acompanhada por qualquer documento de segurança específico para o Mac — o blogue ai.meta.com não publica nada desde 27 de julho.

🔗 Anúncio da Meta no X

Sakana AI revela o Frontier Intelligence Group e a sua posição sobre o paradigma

18 de setembro — A Sakana AI anuncia a existência do Frontier Intelligence Group (FIG), um coletivo interno que crescia desde os primórdios da empresa. O ponto de partida é uma pergunta colocada por Llion Jones, diretor técnico da Sakana AI e um dos inventores do Transformer: aumentar a arquitetura Transformer com cada vez mais dados e capacidade computacional será suficiente para chegar à AGI? A resposta do laboratório é não.

É aí que reside a informação, mais do que no catálogo de trabalhos que a acompanha. A publicação enumera os problemas que o paradigma atual não resolveu — modelos que produzem com confiança informações falsas, entram em colapso perante situações verdadeiramente novas e consomem muita energia — e contrapõe-lhes a inteligência biológica, que aprende continuamente e generaliza a partir de muito menos dados. O grupo define cinco princípios, incluindo a liberdade de falhar sem pressão sobre as pontuações dos benchmarks. Entre os trabalhos apresentados, os Transformers esparsos desenvolvidos com a NVIDIA partem de uma constatação medida — mais de 95% dos neurónios de uma camada feed-forward permanecem inativos durante o processamento de uma palavra — e produziram um formato de dados chamado TwELL, aceite na ICML 2026.

🔗 Publicação da Sakana AI sobre o Frontier Intelligence Group


Vídeo generativo: Runway unifica os seus créditos, Pika lança a sua primeira aplicação

Runway torna os seus créditos fungíveis entre a aplicação web e o Runway Dev

18 de setembro — A Runway elimina a separação entre os seus dois produtos: os créditos adquiridos passam a poder ser utilizados indistintamente na aplicação web e no Runway Dev, a oferta destinada a programadores. Até agora, os dois universos funcionavam com saldos separados, contratos distintos e sem um local único para acompanhar o consumo entre projetos.

A mudança é acompanhada por quatro elementos: um saldo único adquirido centralmente numa só fatura, uma transição contínua entre a criação de um fluxo na aplicação web e a sua disponibilização através de API, suporte reforçado para o Runway Dev com acesso a Applied AI Architects e uma vista de análise do espaço de trabalho reformulada, que permite aos administradores transferir créditos entre os espaços web e Dev. Duas ofertas comerciais são válidas até 31 de dezembro de 2026: 10% de créditos adicionais na assinatura para novas empresas, o equivalente a pelo menos 130 minutos de vídeo ou 12 000 imagens, segundo a conversão anunciada pela Runway; e, para os clientes existentes, 5 000 créditos e um dia de acompanhamento por um Applied AI Architect em troca de uma indicação ao responsável de produto das aplicações de IA.

🔗 Publicação da Runway sobre os preços unificados

Pika lança Product Ad, da fotografia de produto à publicidade em vídeo

18 de setembro — No dia seguinte à apresentação da sua nova plataforma criativa, a Pika lança a primeira aplicação: Product Ad. A aplicação recebe uma ou várias imagens de um produto, combina-as com um briefing escrito e cria um vídeo apresentado como pronto para o mercado.

Parâmetro de geraçãoValor proposto
Durações disponíveis6 s, 15 s, 30 s, 60 s, 2 min
Formato de saída16:9
Entrada esperadaimagens do produto e briefing escrito
Acessocriação de conta obrigatória

A Pika publica o anúncio citando a sua própria mensagem do dia anterior sobre a reformulação da plataforma, inserindo assim o Product Ad numa série de aplicações previstas, em vez de o apresentar como uma funcionalidade isolada. Nenhum modelo é mencionado e nenhum preço é comunicado.

🔗 Anúncio da Pika no X


NVIDIA publica AIPerf, sucessor do GenAI-Perf para medir a inferência em grande escala

18 de setembro — A NVIDIA apresenta o AIPerf, a sua ferramenta de medição de desempenho para inferência generativa, descrita como sucessora do GenAI-Perf e reescrita de raiz. A constatação inicial é familiar: depois de um modelo ser implementado, a pergunta «é rápido?» é frequentemente respondida com comandos curl ou um gerador de carga improvisado, que produzem números nos quais não se pode confiar.

A diferença é arquitetónica. Enquanto a maioria das ferramentas funciona num único processo e esbarra no bloqueio global do interpretador Python quando a concorrência aumenta, o AIPerf distribui o trabalho: processos de trabalho geram a carga, serviços distintos processam os resultados e todo o conjunto é coordenado através de ZMQ. O objetivo é explícito — garantir que o cliente de medição nunca se torne o próprio estrangulamento.

Indicador apresentadoO que mede
Time to First TokenTempo entre o envio do pedido e o primeiro token
Inter-Token LatencyTempo entre dois tokens sucessivos durante a geração
Latência do pedidoTempo de ponta a ponta da resposta completa
Débito de tokens de saídaTokens produzidos por segundo em todos os pedidos
Percentis apresentadosp25, p50, p75, p90, p95, p99
Tipos de endpointsmais de 15

A ferramenta também consegue reproduzir registos de tráfego real nos formatos Mooncake, Baseten e WEKA. O artigo salienta sobretudo a utilidade das distribuições: um servidor cujo tempo médio até ao primeiro token parece saudável, mas cujo p99 dispara, passa despercebido nos dados agregados e falha em produção.

🔗 Publicação da NVIDIA sobre o AIPerf


Mistral desmente alegação de acesso não autorizado aos seus sistemas

18 de setembro — A Mistral publica às 05h48 UTC um breve comunicado na sua conta do X, em resposta a uma alegação de acesso não autorizado aos seus sistemas. A empresa afirma ter realizado uma investigação aprofundada, não ter encontrado qualquer elemento que sustente a alegação e confirma que os seus sistemas não foram comprometidos.

We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.

🇵🇹 Temos conhecimento de uma alegação de acesso não autorizado aos nossos sistemas. Após uma investigação aprofundada, não encontrámos qualquer elemento que sustente essa alegação e podemos confirmar que os nossos sistemas não foram comprometidos.@MistralAI no X

A mensagem não identifica o autor da alegação, não especifica a sua data nem a sua natureza e não fornece qualquer detalhe sobre o âmbito da investigação. É a posição da Mistral, e apenas ela, que é aqui relatada: não foi possível consultar a alegação original. O comunicado é a mensagem mais vista da conta durante o período, e não foi encontrada qualquer publicação complementar no site da empresa.


Breves

  • A Balyasny Asset Management conta como enquadra o Claude Fable 5 — a empresa, que gere cerca de 38 mil milhões de dólares, reduz a análise inicial de uma arbitragem de fusões de três a cinco dias para menos de um dia, com um agente que funciona durante cerca de 30 minutos e uma revisão humana. 🔗 fonte
  • O Codex CLI 0.155.1 volta a desativar os resumos de raciocínio por predefinição — correção única no dia seguinte à versão 0.155.0: ativá-los por predefinição fazia com que os pedidos fossem rejeitados pelos fornecedores que não os suportam. 🔗 fonte
  • O Gemini CLI retoma a sua série nightly após um dia sem lançamentos — quatro alterações a 18 de setembro, incluindo a retenção do refresh token OAuth durante uma renovação e uma remoção de credenciais que passou a ser idempotente; os canais stable e preview permanecem inalterados. 🔗 fonte
  • O Kimi Code 2.0.1 acelera o arranque e a retoma de sessões — versão de correções 32 horas após a 2.0.0: compactação do índice de sessões, retoma mais rápida em históricos longos, chave de API legível a partir de uma variável de ambiente com nome e observadores de ficheiros com limites. 🔗 fonte
  • O Qwen Code entra em pré-visualização v0.24.1 com um SDK de navegador Playwright — não é uma versão stable; introduz controlo integrado do navegador com retransmissão de mensagens nativas do Chrome e execução de subagentes em contentores. 🔗 fonte
  • O Zed publica a versão stable 1.20.2, com apenas duas correções — os erros de pagamento dos fornecedores de modelos terceiros já não apresentam um convite para mudar para o Zed Pro em vez da mensagem original, e duas extensões de snippets para a mesma linguagem já não se anulam mutuamente. 🔗 fonte
  • A Replit afirma que o Free Mode é «30 vezes mais» generoso, sem referência publicada — apenas um tweet, sem ligação nem changelog, que não especifica com o que este fator é comparado: deve ser encarado como uma afirmação da Replit, não como uma medição. 🔗 fonte
  • O painel de impacto do Copilot discrimina o envolvimento por funcionalidade — sete superfícies ao longo de 28 dias, distinguindo a revisão de código ativa da passiva, e uma população da fase de adoção agora calculada numa janela móvel. 🔗 fonte
  • O GitHub agenda uma transmissão em direto de introdução ao SDK Copilot, em seis línguas — sessões, ferramentas, servidores MCP e eventos em streaming, com sessões dedicadas a .NET e Java, sem pré-requisitos. 🔗 fonte
  • O Runway Ruby preserva o canal alpha durante a conversão para HDR — a conversão de imagens brutas para HDR mantém a transparência intacta, num único passo; não são especificados preços nem níveis de subscrição. 🔗 fonte
  • A MiniMax junta-se ao Singtel AI Pass para o programa SkillsFuture de Singapura — MiniMax H3, MiniMax Agent e MiniMax Audio passam a integrar a oferta, destinada a alunos elegíveis em mais de 200 cursos de IA apoiados pela SWDA; sem valores nem calendário. 🔗 fonte
  • A VC-Attention acelera a atenção do MiniMax-H3 sem novo treino — a MiniMax divulga o trabalho da Nunchux AI sobre atenção de baixa precisão aplicável ao modelo existente; a Nunchux AI anuncia 1,6x no B200 e 1,5x no B300 em comparação com o FlashAttention-4. 🔗 fonte
  • O Wan3.0 ocupa o segundo lugar na categoria de vídeo da OpenArt Arena — a Alibaba destaca os planos de 30 segundos, o áudio nativo e o suporte para qualquer referência; posicionamento numa classificação de terceiros, sem novidades de produto. 🔗 fonte
  • A Synthesia abre a sua sede norte-americana em Nova Iorque — notícia empresarial sem produto, número de funcionários ou calendário de investimento, dois dias após a disponibilidade geral da sua Interactive Avatar API. 🔗 fonte
  • O Grok Imagine detalha o custo de um episódio-piloto produzido integralmente com IA — o estúdio de PJaccetturo anuncia nove dias de trabalho, 3 627 imagens e 3 043 vídeos gerados, num total de 2 677 dólares em gerações, para o episódio-piloto do concurso Odisseia. 🔗 fonte
  • O BananaMind 2 Pro aproxima-se do SmolLM2 com vinte vezes menos tokens — um modelo de 139 milhões de parâmetros treinado com 100 mil milhões de tokens e uma RTX 5070 Ti alcança 42,78% no HellaSwag, contra 43,22 para o SmolLM2-135M, treinado com 2 biliões de tokens. 🔗 fonte
  • O Optimum-Intel v2.2.0 e o OpenVINO GenAI 2026.4.0 expandem a exportação para hardware Intel — a Hugging Face e a Intel publicam versões conjuntas que abrangem processadores, placas gráficas e NPU Intel, sendo agora possível exportar o Mistral 3. 🔗 fonte
  • A AmberTrace Labs mede a fidelidade do raciocínio do Olmo 3 sob RL com recompensa verificável — nas sondas mantidas fora do treino, a fidelidade passa de 0,238 para 0,262: uma evolução positiva, não uma erosão, com checkpoints publicados. 🔗 fonte
  • A Together AI reivindica o melhor tempo até ao primeiro token no DeepSeek V4.1 Flash — a empresa divulga a medição de um terceiro para pedidos pré-aquecidos, sem publicar o método nem o valor: uma reivindicação, não um resultado verificável. 🔗 fonte
  • O Google Flow acompanha dois criadores na Semana da Moda de Nova Iorque — ferramentas personalizadas concebidas com Jane Wade e Sergio Hudson; montra de utilização, sem novo modelo nem funcionalidade implementada. 🔗 fonte
  • A Google AI Educator Series passa a dar direito a créditos universitários — os cursos da formação dão agora direito a créditos universitários ou de formação contínua. 🔗 fonte

O que isto significa

O dia diz sobretudo uma coisa: os agentes de código estão a deixar de ser produtos fechados e começam a partilhar os seus formatos. O Claude Code lê AGENTS.md quando um projeto não tem CLAUDE.md — ou seja, a Anthropic aceita um ficheiro de instruções definido noutro local, para que o mesmo repositório sirva várias ferramentas. No mesmo dia, o Antigravity introduz no prompt de sistema dos seus agentes Markdown o catálogo dos subagentes disponíveis, o Vibe CLI finalmente executa os hooks dentro dos subagentes, o Codex discrimina a sua faturação por subagente e o Qwen Code coloca os seus em contentores. A delegação entre agentes era uma promessa de configuração; está a tornar-se um mecanismo que é necessário documentar, isolar e faturar. O Claude Code leva, aliás, a lógica da desconfiança até ao fim ao marcar os resultados dos subagentes com um cabeçalho específico, para impedir que um texto devolvido se faça passar por uma instrução.

O mercado dos agentes de terminal, por sua vez, está visivelmente a tornar-se comum. A MiniMax publica o seu sob licença MIT, com TUI, modo sem interface, ACP e escolha livre do modelo; a Mistral remove a etiqueta «experimental» do seu Unified Harness e documenta --legacy-harness como porta de saída; o Kimi Code lança uma correção de desempenho 32 horas após a sua versão principal. Quando quatro empresas propõem o mesmo objeto com os mesmos pontos de entrada, a diferenciação desloca-se: passa a depender da licença, da estabilidade do harness e do regime de permissões — e é precisamente aí que incidem as alterações do dia, tanto na Mistral como na Anthropic.

Nos modelos, o movimento é o do áudio e vídeo que se tornam agentivos, em vez de descritivos. O Qwen3.8-Omni-Flash já não procura descrever um vídeo, mas encontrar nele uma resposta: partindo da pergunta, ganha 4,4 pontos no OmniVideoBench, consumindo simultaneamente menos 45,7% de tokens — o desempenho e a economia seguem na mesma direção, o que é raro. Do outro lado, o Grok Voice Transcribe 2.0 não aposta numa demonstração de laboratório, mas no tráfego real, com uma taxa de erro em frases curtas que desce de 20,6% para 6,8% e um preço inalterado. Os dois anúncios convergem: o valor já não vem da modalidade suportada, mas daquilo que o modelo decide processar.

Resta a questão do que os laboratórios aceitam que seja verificado. A Anthropic paga à Accenture para instalar avaliadores dentro da sua própria empresa, com acesso de funcionário — e reconhece no mesmo anúncio que não existe qualquer norma sobre aquilo a que um avaliador desse tipo deve ter acesso, nem sobre a forma de publicar as suas conclusões, nem sobre quem o deve financiar. É tanto uma confissão como um mecanismo. Ao lado disso, as provas mais sólidas do dia são aquelas que um terceiro pode reproduzir: os resultados de Exeter e do Stowers Institute sobre o AlphaGenome Atlas, o código de otimização biomolecular publicado em open source e os checkpoints da AmberTrace Labs. E o inverso é igualmente evidente: a Replit avança com um fator de 30 sem referência, a Together AI divulga uma classificação sem método, a Mistral desmente uma alegação que ninguém conseguiu ler. Neste panorama, o AIPerf chega no momento certo — uma ferramenta de medição que começa por admitir que quem mede é frequentemente o problema.


Fontes