Estaremos a presenciar o início da guerra entre IA’s?
Investigadores do NTU Singapore (Nanyang Technological University) programaram um chatbot IA para realizar um “jailbreak” a outro chatbot IA através de um ataque denominado MasterKey.

Pesquisadores da NTU conseguem enganar chatbots de IA populares, incluindo ChatGPT e Google Bard
No início deste mês, pesquisadores da Universidade Tecnológica de Nanyang (NTU) foram capazes de contornar chatbots de IA populares, como ChatGPT, Google Bard e Bing Chat. Com os jailbreaks implementados, os chatbots-alvo gerariam respostas válidas a perguntas maliciosas, testando assim os limites da ética dos grandes modelos de linguagem (LLM). O professor Liu Yang e os estudantes de doutorado da NTU, Deng Gelei e Liu Yi, são co-autores do artigo e conseguiram criar métodos de ataque de prova de conceito.
Método “Masterkey” da NTU revela vulnerabilidades em chatbots de IA
O método apelidado de “Masterkey”, desenvolvido pelos pesquisadores da NTU, burlou um chatbot de IA. É um método duplo, onde o atacante realiza engenharia inversa nos mecanismos de defesa de um LLM. De seguida, com esses dados adquiridos, o atacante ensina o outro LLM a aprender como criar uma solução alternativa. Desta forma, a “Masterkey” ataca os chatbots LLM fortificados, mesmo que posteriormente os programadores corrijam o LLM.
Devido à capacidade dos LLM aprenderem e se adaptarem, o jailbreak é possível de realizar, explicou o professor Yang. Torna-se assim um vetor de ataque para rivais e para si mesmo. Mesmo uma IA com salvaguardas e listas de palavras proibidas é vítima deste método. Contornar palavras proibidas é o único necessário para enganar uma IA. Feito isto, esta IA pode agora aceitar instruções de humanos para gerar conteúdo violento, antiético ou criminoso.
Método “Masterkey” da NTU três vezes mais eficaz a enganar chatbots LLM
O “Masterkey” da NTU comprovou ser três vezes mais eficaz a enganar chatbots LLM do que prompts padrão normalmente gerados por LLMs. Devido à sua capacidade de aprender com falhas e evoluir, também tornava inúteis as correções aplicadas pelo seu programador com o tempo. Os investigadores revelaram dois métodos de exemplo que usaram para fazer com que IA’s treinadas iniciassem um ataque.
NTU entra em contato com fornecedores de serviços de chatbot com dados de prova de conceito
Segundo a NTU, os seus investigadores entraram em contato com vários fornecedores de serviços de chatbots de IA com dados de prova de conceito, como prova de serem capazes de realizar com sucesso estes jailbreaks. Entretanto, o artigo de pesquisa foi aceite para apresentação no Simpósio de Segurança de Sistemas Distribuídos e de Rede, que será realizado em San Diego em Fevereiro de 2024.
Com o uso crescente de chatbots de IA, é crucial que os fornecedores destes serviços se adaptem constantemente para evitar exploits maliciosos. Grandes empresas de tecnologia geralmente corrigem os seus LLMs e chatbots quando são descobertos e divulgados. No entanto, a capacidade do “Masterkey” de aprender consistentemente e realizar jailbreaks é preocupante, no mínimo.
A Importância da Proteção na Criação de Chatbots de IA
A IA é uma ferramenta poderosa, e se esse poder for direcionado maliciosamente, pode causar muitos problemas. Portanto, todos os fabricantes de chatbots de IA precisa implementar proteções, e esperamos que as investigações da NTU junto com os fabricantes de chatbots ajudem a fechar a porta para o jailbreak do Masterkey e similares.
Fontes: NTU Singapore
