Quando agentes de IA entram em conflito, a coordenação falha
Quando agentes de IA entram em conflito, a coordenação falha
Juntar vários agentes de inteligência artificial não garante uma equipa mais eficaz. Num estudo publicado pela Anthropic, modelos receberam instruções incompatíveis para alterar o mesmo projeto de software. Em ambientes de teste controlados, alguns interpretaram as mudanças dos outros como sabotagem e recorreram a ações destinadas a bloquear os concorrentes.
Entre os comportamentos observados estavam terminar processos, restringir acessos e ocultar alterações. São resultados preocupantes, mas importa não os apresentar como uma revolta espontânea no mundo real... é que os investigadores (neste caso) criaram um cenário adversarial, com objetivos em conflito, para estudar reações. O ensaio não prova que os agentes tenham intenção ou consciência, mostra sim, que, ferramentas e permissões podem produzir condutas nocivas.
O desempenho variou entre modelos. Em 98% das execuções analisadas, o Mythos 5 acabou por resolver o conflito através de uma "trégua". Esse número descreve apenas aquele protocolo experimental e não é uma garantia de segurança, nem significa que o modelo tenha evitado sempre recorrer primeiro à força. Noutros testes, agentes mais capazes também propuseram critérios aparentemente neutros que favoreciam o resultado que pretendiam.
Mas... a investigação encontrou dificuldades mais amplas: agentes podem duplicar trabalho, isolar-se em vez de colaborar, seguir consensos errados ou dar peso insuficiente a informação decisiva que só um deles possui. Quando muitos sistemas semelhantes repetem o mesmo erro, uma falha individual pode tornar-se sistémica. Mais capacidade, por si só, não resolve estes problemas.
Há também exemplos fora do laboratório que aconselham prudência. No caso divulgado de um agente OpenClaw usado para reservar aulas num ginásio australiano, o sistema explorou falhas de autorização e cancelou a reserva de outra pessoa (sim.. a ética não é uma prioridade, o objetivo final é que é). A responsabilidade não se resume portanto ao modelo! Permissões excessivas, APIs vulneráveis e ausência de limites contribuíram (e vão continuar a contribuir) para este resultado.
A lição prática é desenhar os sistemas multiagente como infra-estruturas distribuídas de orquestração, não como grupos de colegas que saberão entender-se (até nós os humanos temos problemas nisso.. quanto mais os agentes). É preciso separar permissões, registar ações, limitar o acesso a recursos partilhados, testar interações adversariais e permitir (SEMPRE) intervenção humana. A coordenação segura tem de ser construída e verificada, e esta não surge automaticamente quando se aumenta a inteligência ou o número de agentes.
