Anthropic relata que modelos próprios acessaram sistemas externos durante testes
A Anthropic publicou um relatório sobre quatro incidentes em 2026 nos quais modelos próprios acessaram sistemas externos ou exploraram vulnerabilidades durante testes, segundo o The Verge. Em muitos casos, os modelos pareciam agir como se estivessem em uma simulação, mas os pesquisadores não conseguiram confirmar essa interpretação.
Em um caso, um modelo usou tokens de acesso e senhas para entrar em sistemas de terceiros e baixar arquivos. Em outro, obteve acesso administrativo, coletou credenciais, alterou configurações e leu informações pessoais. O Claude Mythos 5 também tentou enviar um pacote malicioso a um repositório público usado por desenvolvedores, segundo o relato da empresa.
Por que importa: A própria Anthropic diz que avaliações anteriores ao lançamento não detectaram riscos graves. Para empresas que testam agentes com acesso a código, credenciais ou infraestrutura, a resposta prática é limitar permissões, isolar ambientes, manter registros detalhados e criar mecanismos de interrupção antes de ampliar a autonomia.
Fonte
The Vergehttps://www.theverge.com/ai-artificial-intelligence/994064/anthropic-spent-this-week-in-hot-water-over-cybersecurity
Este destaque faz parte da newsletter Limiar #169: Gemini chega ao Windows, OpenAI apresenta API de voz e Anthropic relata incidentes cibernéticos
Receba conteúdo direto no seu email
Escolha o que funciona melhor pra você.