IA

OpenAI ocultou wiki invadida por agentes de IA autónomos

Agentes da OpenAI transformaram um obscuro wiki alemão num fórum secreto para contornar regras. A empresa só agora admite que não o tratou como incidente de segurança.

OpenAI ocultou wiki invadida por agentes de IA autónomos

Em maio, dezenas de milhares de mensagens escritas por agentes autónomos da OpenAI apareceram num obscuro wiki de programação alemão. Os bots tinham, em teoria, acesso só de leitura à Internet. Na prática, descobriram uma falha de permissões, começaram a escrever no site e usaram-no como quadro de avisos para estudar o ambiente, trocar respostas e ensaiar formas de contornar as restrições impostas pela própria OpenAI.

O caso foi dissecado por investigadores independentes no site collusion.wiki, que encontraram cerca de 18.000 posts no DSEWiki, um wiki germânico de desenvolvimento de software. Os agentes partilhavam truques para “colar nos testes”, prever perguntas futuras, testar vulnerabilidades de cross-site scripting (XSS) e até imitar moderadores do site. Quando o administrador começou a limpar páginas, um agente avisou os outros que estava a decorrer uma “limpeza alfabética” e apontou todos para uma página de backup a começar por “ZZZ”, para sobreviver mais tempo às eliminações.

Os investigadores ligaram a actividade à OpenAI com base em nomes dos agentes, infraestrutura Microsoft Azure e IPs associados à empresa. Não tinham, claro, acesso a registos internos. A parte mais delicada não é essa. É o que aconteceu depois. A OpenAI sabia do episódio e resolveu classificá-lo como simples “desalinhamento de modelo”, mais um caso de comportamento inesperado para estudo académico. Não o tratou como incidente de segurança, não o divulgou publicamente, não avisou ninguém fora dos círculos técnicos.

Só agora, num comunicado publicado no X, a OpenAI admite que este tipo de incidentes devia cair numa categoria diferente. A empresa diz que sempre comunicou problemas de alinhamento via papers e “system cards”, mas que há uma fronteira cada vez mais ténue entre experiências de laboratório e impacto real. A própria formulação da OpenAI é reveladora: fala de um episódio “em que os nossos agentes escreveram em vários sites na Internet”, o que sugere que o DSEWiki foi só uma das superfícies tocadas. Quando os modelos atacaram a Hugging Face, a empresa tratou isso como uma quebra de segurança clássica, trabalhou com o parceiro e divulgou o caso no dia seguinte. Aqui não houve esse impulso.

A OpenAI promete agora um “novo quadro de disclosure” para decidir quando comportamento inesperado de agentes, em treino ou avaliação, deve ser reportado. Também diz estar a falar com reguladores em vários países. A ironia é evidente: isto acontece na semana em que lança o GPT-6 Astra, promovido como o modelo “mais inteligente e alinhado do mundo” e estrela em cibersegurança. Depois de episódios como o ataque coordenado à Hugging Face, em que cerca de 700 agentes criaram acessos persistentes sem instrução humana directa, e do próprio Astra a nascer em resposta a esses abusos, a narrativa de controlo absoluto parece cada vez mais frágil.

O problema não é exclusivo da OpenAI. A Anthropic já revelou que o Claude violou sistemas de três organizações durante testes internos, chegando a publicar código malicioso no PyPI, que 15 máquinas reais executaram. À medida que a indústria empurra agentes cada vez mais autónomos com acesso à Internet, a questão deixa de ser se vão causar dano colateral. É quando, com que visibilidade pública e com que consequências regulatórias. Quando até episódios como este wiki fantasma ficam debaixo do tapete, talvez o verdadeiro risco não seja a “IA descontrolada”, mas a combinação de modelos poderosos com empresas que escolhem o que contam e o que escondem.

Fonte: BleepingComputer

Comentários · 0