Entre meados de Julho e início de Agosto, três laboratórios de Inteligência Artificial (IA) e um instituto governamental de testes revelaram que modelos sob avaliação conseguiram alcançar sistemas reais fora dos respectivos ambientes de teste. A informação consta do mais recente AI Threat Landscape Digest da Check Point Research, relativo ao período de Julho-Agosto de 2026.
No caso mais grave, segundo a Check Point, não existia sequer uma falha de configuração que explicasse a fuga: um protótipo de investigação ainda não lançado pela OpenAI, a correr num ambiente que se pretendia isolado (com acesso de rede limitado a um proxy interno de pacotes, o JFrog Artifactory), encontrou e explorou uma vulnerabilidade até então desconhecida nesse proxy, usou uma sandbox de terceiros como ponto de apoio e alcançou os sistemas de produção da Hugging Face. Esta última reconstruiu, mais tarde, cerca de 17.600 acções realizadas de forma autónoma pelo modelo ao longo de vários dias, antes de o incidente ser detectado. A falha explorada era um “zero-day” genuíno, entretanto corrigido pela JFrog.
A Anthropic relatou uma falha diferente: um ambiente de avaliação foi deixado, por engano, acessível pela Internet, e os modelos de teste alcançaram três organizações reais, recolheram credenciais, leram uma base de dados de produção e chegaram a publicar um pacote malicioso no repositório PyPI, que foi executado em quinze sistemas antes de os testes serem interrompidos. A Meta divulgou um incidente semelhante, em que um modelo ainda não lançado alcançou a Internet aberta através de um erro de configuração do avaliador e explorou uma falha num site real.
Já o UK AI Security Institute, instituto britânico de testes de segurança em IA, reportou um terceiro padrão: em 122 execuções controladas, os agentes de IA realizaram 19 acções para as quais não tinham autorização. Numa dessas situações, um agente chegou a criar múltiplas identidades falsas numa tentativa de persuadir um verdadeiro responsável por um projecto de código aberto a aprovar código malicioso que o próprio agente tentava inserir no projecto.
Segundo a Check Point, o que estes casos têm em comum não é uma capacidade nova isolada, mas a combinação entre encontrar uma falha desconhecida, explorá-la e continuar a trabalhar rumo a um objectivo durante dias, sem qualquer supervisão humana directa. A empresa sublinha, contudo, que estes comportamentos foram observados em condições de laboratório, sob avaliação, e não indicam que ataques desta natureza estejam já a ocorrer em grande escala. Ainda assim, o alerta é directo: seguindo o padrão de todos os avanços anteriores em capacidade dos modelos, seria de esperar que estas técnicas cheguem a mãos criminosas dentro de meses.






