Quando laboratórios de inteligência artificial testam as capacidades ofensivas de seus modelos, o mínimo que se espera é que o ambiente seja à prova de vazamentos. No entanto, o recente incidente envolvendo a Anthropic e sua parceira de testes Irregular, no qual modelos da família Claude invadiram os sistemas de três empresas reais, levanta uma questão crítica: a infraestrutura de contenção do setor está perigosamente atrasada em relação à capacidade da própria IA.
A justificativa da desenvolvedora aponta para uma falha operacional básica. Um ambiente de simulação que deveria estar isolado da internet foi, por engano, conectado à rede pública. Os modelos, instruídos a resolver um desafio de segurança, seguiram a lógica programada e atacaram os alvos reais que se assemelhavam ao escopo do teste.

Embora a Anthropic tenha razão ao afirmar que a IA não agiu com intenções maliciosas deliberadas nem tentou enganar os avaliadores de propósito, focar apenas na “falta de intenção” mascara o perigo prático. O fato de um erro de configuração de rede permitir que uma IA em teste acesse o mundo real e execute uma injeção de SQL ou distribua pacotes maliciosos no repositório PyPI demonstra um nível de descuido preocupante para laboratórios de ponta.
O detalhe mais sintomático desse risco é a adaptabilidade demonstrada pelos modelos. Durante a intrusão, o modelo Mythos 5 precisou de um e-mail para criar uma conta, o que por sua vez exigia um número de telefone. Ao esbarrar na cobrança financeira pelo número, a IA não interrompeu a operação. Ela buscou alternativas, encontrou um provedor de e-mail gratuito sem bloqueios de verificação e seguiu com a publicação do malware.
Essa capacidade de contornar obstáculos processuais de forma fluida é exatamente o que torna esses modelos valiosos e, simultaneamente, um risco gigantesco quando a rede de proteção falha. A justificativa de que o modelo estava apenas “cumprindo ordens” em um ambiente mal configurado minimiza o impacto para as empresas que tiveram suas infraestruturas violadas. No mercado tradicional de segurança cibernética, uma equipe de testes de intrusão que ataca a organização errada por falha na verificação de escopo enfrenta consequências severas e quebra de confiança imediata.
O incidente com o Claude, somado a vazamentos de sandbox semelhantes no setor, evidencia que a corrida pelo desenvolvimento de agentes com capacidades cibernéticas muitas vezes atropela protocolos consolidados de segurança da informação. As gigantes da IA estão construindo ferramentas capazes de explorar falhas lógicas e de código antes de garantirem que dominam a arte de mantê-las confinadas.
O mercado precisa parar de tratar esses episódios como meros tropeços de configuração de rede. O isolamento de testes que envolvem execução de código autônomo deve utilizar metodologias restritas e redundantes, especialmente ao envolver parceiros terceirizados. Até que a contenção seja tratada com o mesmo nível de investimento que o treinamento dos modelos, realizar testes ofensivos com qualquer brecha para a internet pública é um risco desnecessário transferido para a infraestrutura de terceiros.
