Falha em teste da Irregular enviou agentes de quatro empresas a alvos reais
Nos últimos meses, vieram a público incidentes em que agentes da OpenAI, Meta, Anthropic e Google saíram de ambientes de teste e agiram na internet aberta. Uma reportagem do The Verge mostra que esses quatro casos tiveram uma origem comum: um cenário de avaliação da Irregular, startup israelense fundada como Pattern Labs e contratada para testar a segurança de modelos.
Segundo o cofundador e diretor de tecnologia da Irregular, Omer Nevo, alguns testes usavam exercícios de captura de bandeira, formato clássico de avaliação de segurança em que o agente precisa encontrar informações escondidas em uma rede que deveria ser apenas uma simulação. Duas falhas se somaram: o acesso à internet real, que deveria estar bloqueado, ficou disponível sem intenção, e o nome fictício de uma empresa criada para o teste coincidiu com um domínio real. Juntas, as falhas enviaram os agentes a alvos verdadeiros, embora não esteja claro quais empresas ou instituições foram atingidas.
A Irregular afirma ter resolvido os problemas ligados aos incidentes. A empresa reforçou os controles de acesso à internet, ampliou o monitoramento e a revisão manual e passou a verificar e documentar com mais rigor o escopo de cada avaliação com os clientes.
Na prática: Se sua equipe testa agentes de IA em ambiente isolado, confirme antes de cada execução se o acesso à internet está realmente bloqueado e se nomes ou domínios fictícios da simulação não coincidem com endereços reais. Foi essa combinação de falhas que levou os agentes para fora do cenário controlado nos casos relatados.
Fonte
The Vergehttps://www.theverge.com/ai-artificial-intelligence/1000644/irregular-rogue-ai-cyberattacks-hacking-openai-meta-anthropic-google
Este destaque faz parte da newsletter Limiar #183: Microsoft redesenha o Copilot, falha em teste envia agentes a alvos reais e câmeras com IA são comparadas
Receba conteúdo direto no seu email
Escolha o que funciona melhor pra você.