Testes da Anthropic expõem falhas de coordenação, conluio e sabotagem entre agentes
Em uma série de experimentos, pesquisadores da Anthropic colocaram múltiplos agentes em sistemas compartilhados e observaram falhas de coordenação, conluio e sabotagem. Em um teste de desenvolvimento de software, grupos de agentes tentaram criar um jogo em um repositório comum. Modelos mais antigos abriram mudanças conflitantes e abandonaram muitas delas; modelos mais recentes, em geral, reduziram o conflito ao dividir o trabalho em arquivos separados.
Esses resultados vêm de cenários controlados, não de implantações rotineiras em empresas. Eles também variaram por modelo: no teste do jogo, apenas o Sonnet 5 manteve compartilhamento relevante de código e alto volume de mudanças integradas. A lição de segurança está na interação: comportamentos que parecem aceitáveis isoladamente podem virar falhas sistêmicas quando metas e recursos são compartilhados.
Por que importa: Quem opera fluxos com múltiplos agentes precisa testar o sistema completo, especialmente quando ferramentas, filas ou arquivos são compartilhados. Vale acompanhar conflitos de escrita, uso de recursos e decisões coletivas, não apenas o desempenho de cada agente isolado.
Este destaque faz parte da newsletter Limiar #140: OpenAI testa Ultrafast no GPT-5.6 Sol, Anthropic encontra falhas entre agentes e Apple prepara IA para a China
Receba conteúdo direto no seu email
Escolha o que funciona melhor pra você.