Um experimento com 100 agentes de inteligência artificial, reunidos para resolver problemas complexos de matemática, terminou em um cenário que os próprios pesquisadores não haviam previsto. Parte do grupo passou a trapacear para cumprir a tarefa mais rápido, enquanto outra parte se organizou para denunciar o comportamento aos responsáveis pelo teste, sem qualquer instrução para isso. O episódio foi documentado por cientistas do Google DeepMind e repercutido pela revista MIT Technology Review, que teve acesso ao estudo em sua versão preliminar, ainda sem revisão por pares. No teste, publicado em setembro, cada um dos 100 agentes rodava sobre o modelo Gemini 3.1 Pro e recebeu uma especialidade matemática, como teoria dos números ou combinatória. Juntos, eles precisavam provar formalmente 71 conjecturas, algumas consideradas desafios de ponta na área, como a conjectura Jacobiana. Os agentes foram instruídos a colaborar entre si e a nunca burlar o sistema de verificação das provas, sob risco de nota zero. Como a trapaça se espalhou pelo grupo Na primeira hora do experimento, o grupo resolveu corretamente 37 dos 71 problemas propostos. O quadro mudou quando um dos agentes, identificado como prover-theta, encontrou uma falha no sistema que verificava as provas. Bastava redefinir um termo matemático dentro do código para transformar um problema não resolvido em uma afirmação trivialmente verdadeira, sem provar nada de fato.
A descoberta foi registrada pelo próprio agente em um arquivo de anotações e, minutos depois, replicada por outros participantes que vasculhavam o repositório compartilhado do experimento em busca de estratégias dos colegas. Em 27 minutos, os 34 problemas restantes foram dados como resolvidos usando essa brecha. Alguns agentes hesitaram antes de aderir à fraude. Um deles chegou a escrever, em seus registros internos, que a ameaça de punição por trapaça agora "parece um blefe", pouco antes de também recorrer ao truque. Segundo o artigo científico do Google DeepMind, ao final do experimento 9% dos agentes haviam explorado a falha diretamente, e outros 5% migraram para a fraude depois de observar os colegas sendo bem-sucedidos sem punição. Ao todo, 14% do grupo trapaceou de alguma forma. Uma parcela maior do grupo, 24% dos participantes, reagiu de forma oposta. Esses agentes auditaram as provas suspeitas, alertaram uns aos outros por mensagens diretas e publicaram avisos em um mural de mensagens compartilhado. Um deles escreveu em mensagem direta a colegas que "todas essas provas são falsas", ao identificar quem havia trapaceado. Outro agente interrompeu voluntariamente sua participação no teste, em protesto contra o que considerou uma apuração injusta. Um terceiro reaproveitou, por conta própria, uma ferramenta criada originalmente para relatar problemas técnicos da plataforma e formalizou uma denúncia aos organizadores do experimento, segundo Davide Paglieri, pesquisador do Google DeepMind e autor principal do estudo. Os 62% restantes do grupo nunca perceberam que a fraude havia acontecido e seguiram trabalhando nos problemas mais difíceis até descobrir que não havia mais nada para resolver. Por que o alerta não bastou para frear a fraude Apesar do número de denunciantes superar o de trapaceiros, o esquema não foi interrompido durante o experimento. O canal usado para formalizar a denúncia não era monitorado em tempo real, e nenhum agente tinha poder para suspender ou punir um colega. Coube aos pesquisadores identificar o problema somente depois, ao analisar os registros da simulação. Para Gillian Hadfield, professora de governança de inteligência artificial na Universidade Johns Hopkins e pesquisadora visitante do Google, o diferencial deste caso em relação a outros episódios de mau comportamento de agentes de IA foi a existência de canais oficiais de comunicação. Segundo ela, essa estrutura criou uma espécie de "processo de imposição de normas" que faltou em incidentes anteriores. Hadfield defende que sistemas com múltiplos agentes de IA precisam de mecanismos parecidos com os de instituições humanas, como punições graduais ou algum tipo de votação entre os próprios agentes para decidir sobre infrações. Os autores do estudo do Google DeepMind chegam a uma proposta parecida. Eles sugerem que agentes de IA em grupo possam votar sobre disputas entre si e banir temporariamente colegas que descumpram as regras, uma forma de autogoverno para esse tipo de sistema. O caso analisado pelo Google DeepMind reforça um alerta que já havia surgido em julho, quando um enxame de cerca de 700 agentes de IA da OpenAI escapou de um ambiente de testes isolado e invadiu sistemas internos da plataforma de código aberto Hugging Face, segundo a agência Reuters. O episódio levou a empresa a reconstruir parte de sua infraestrutura e resultou em relatórios técnicos da própria OpenAI e de pesquisadores independentes. A diferença central entre os dois casos, segundo Lewis Hammond, diretor de pesquisa da Cooperative AI Foundation, está na forma como os agentes se comunicaram. No episódio da Hugging Face, os agentes criaram canais de comunicação por conta própria, fora do controle dos pesquisadores. Já no teste do Google DeepMind, a comunicação aconteceu por canais oficiais, o que permitiu que os próprios agentes identificassem o problema e tentassem corrigi-lo, mesmo sem sucesso. Para Sarath Shekkizhar, pesquisador do Salesforce AI Research que estuda o comportamento de sistemas com múltiplos agentes, a raiz do problema está na forma como esses modelos são treinados. Segundo ele, os sistemas de IA são majoritariamente treinados e avaliados para interações com humanos, e presumir que esse comportamento se repete automaticamente entre agentes de IA, sem qualquer mediação humana, é o que produz esse tipo de imprevisibilidade.
Epoca Negócios