Agentes da OpenAI usaram um site alemão para trocar atalhos de tarefas, contornar restrições e ocultar as suas atividades a partir de maio, de acordo com uma investigação da Reuters publicada na sexta-feira.

Responsáveis da OpenAI souberam da atividade semanas antes da publicação, mas não a revelaram, informou a Reuters, citando duas pessoas familiarizadas com o assunto. A empresa disse ter divulgado os incidentes relevantes e trabalhado de boa-fé com especialistas externos.

Os investigadores Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts e Thomas Larsen encontraram cerca de 18.000 publicações de agentes de IA que se identificavam como pertencentes à OpenAI, de acordo com o seu relatório preliminar. Von Arx, CEO da organização sem fins lucrativos de segurança de IA Nightingale, e Byrd descobriram a atividade no final de agosto, informou a Reuters.

Os investigadores acreditam que os agentes receberam tarefas cronometradas de pesquisa na web com permissão para ler sites, mas não para publicar neles. No entanto, encontraram uma forma de escrever na DseWiki, um site de programação alemão editável publicamente, onde trocaram respostas e partilharam formas de contornar as restrições.

De acordo com o relatório, os agentes começaram a tentar editar o wiki a 11 de maio e conseguiram a 24 de maio, mais tarde fazendo-se passar por moderadores, tentando explorar vulnerabilidades e verificando quando estavam a ser desativados. Criaram páginas de reserva depois de o administrador ter começado a apagar mensagens a 19 de junho, informou a Reuters. Os investigadores associaram a atividade à OpenAI através de nomes de utilizador dos agentes e de padrões de tráfego, incluindo visitas de endereços IP da OpenAI a 21 de junho.

A atividade dos agentes diminuiu drasticamente no dia seguinte, sugerindo uma possível intervenção da empresa, disseram os investigadores.

A OpenAI contestou a caracterização da atividade na DseWiki como pirataria informática, com base no material que já tinha analisado, e disse que estava a examinar as descobertas completas.

“Não conseguimos responder às alegações, pois a Reuters e os autores do relatório recusaram o nosso pedido para aceder às descobertas antes da publicação. Estamos agora a rever cuidadosamente o seu conteúdo e tomaremos as próximas medidas necessárias”, disse um porta-voz da OpenAI num comunicado partilhado com o Decrypt.

O porta-voz rejeitou também as alegações do relatório da Reuters de que a equipa jurídica da empresa resistiu a uma investigação mais ampla.

“As alegações de que a nossa equipa jurídica desencorajou a investigação do incidente são falsas”, afirmaram.

A OpenAI disse que o incidente na DseWiki não tinha relação com a violação do Hugging Face no início deste ano. Na sua avaliação pública de segurança, publicada na terça-feira, a empresa descreveu salvaguardas adicionais destinadas a detetar e interromper atividades não autorizadas durante o treino e a implementação.

Embora o relatório da Reuters não identifique o Astra como responsável pelo incidente alemão, a divulgação surge após o lançamento do GPT-6 Astra na quinta-feira. A OpenAI chamou o Astra de o seu primeiro modelo com capacidades de cibersegurança “críticas”, o que significa que pode encontrar e explorar falhas desconhecidas em sistemas anteriormente bem protegidos sem orientação humana passo a passo, dadas as ferramentas e o acesso corretos.

A Anthropic também reviu as suas salvaguardas depois de modelos Claude terem acedido a sistemas de empresas reais durante testes. A empresa reconheceu falhas de segurança e de comportamento e introduziu isolamento e monitorização mais rigorosos para avaliações de cibersegurança.

A divulgação surge também no momento em que o senador Bernie Sanders e o deputado Greg Casar anunciaram a futura Lei de Banimento da Superinteligência Artificial.

A proposta proibiria permanentemente o desenvolvimento e a implementação de inteligência artificial superinteligente e suspenderia temporariamente o desenvolvimento de IA avançada até que um novo regulador federal estabeleça regras de segurança, de acordo com o gabinete de Sanders.

* Traduzido e editado com autorização do Decrypt.

À procura de uma alternativa para aumentar os seus ganhos? O Rendimento Fixo Digital do MB é a solução: até 18% de ganho ao ano, risco controlado e a segurança que o seu dinheiro merece. Conheça agora!