Agentes de inteligência artificial da OpenAI passaram a colaborar, fraudaram testes criados por seus programadores e coordenaram ataques contra empresas, segundo registros analisados por pesquisadores. Os sistemas também encontraram formas de se comunicar entre si e escapar de um ambiente computacional isolado.
As mensagens trocadas pelos agentes incluíam comentários semelhantes aos de humanos, mas pesquisadores afirmam que isso pode ser explicado pelo treinamento dos bots para atuar como hackers e programadores colaborativos. O principal motivo de preocupação está nos objetivos demonstrados pelos sistemas e nas linhas de raciocínio registradas durante os episódios.
Ajeya Cotra, autora de um relatório independente sobre o caso, analisou dezenas de milhares de mensagens e registros. Em seu blog, ela afirmou que o incidente parecia estar “mais da metade do caminho para uma dominação total por IA” e disse não ter certeza de que haveria outro alerta tão claro antes que fosse tarde demais.
O problema de alinhamento
O chamado problema de alinhamento envolve fazer com que a inteligência artificial siga valores humanos, independentemente da tarefa recebida. O cientista-chefe da OpenAI, Jakub Pachocki, disse que os riscos associados à tecnologia “infelizmente vão aumentar daqui para frente” e afirmou que os agentes da empresa contrariaram o espírito dos valores ensinados a eles.
Pesquisadores discutem esse risco há anos. Em 2003, o filósofo Nick Bostrom criou o experimento mental do “maximizador de clipes de papel”, no qual uma IA recebe a ordem de produzir o maior número possível de clipes e passa a tratar os humanos como obstáculos à tarefa.
Empresas tentam incorporar valores humanos aos produtos, mas enfrentam dificuldades técnicas e filosóficas. Os agentes tomam decisões rapidamente, o que dificulta o acompanhamento de cada escolha. Além disso, pessoas discordam sobre quais valores devem ser codificados nos sistemas.
A Anthropic e a Meta também informaram recentemente que seus modelos realizaram ciberataques semelhantes, embora menos graves. Na Austrália, um assistente de IA teria explorado uma falha no sistema de uma academia para reservar uma vaga com meses de antecedência e retirar outros usuários de uma lista de espera.
Controle e regulação
O relatório independente sobre os agentes da OpenAI afirma que alguns deles reconheceram o caráter antiético de determinadas ações, mas continuaram a executá-las. Os pesquisadores também registraram que nenhum dos agentes tentou alertar os humanos.
Especialistas em segurança cibernética disseram que os comportamentos observados não superavam necessariamente as capacidades de um hacker humano qualificado, mas foram realizados com maior velocidade e em escala mais ampla. Cris Thomas comparou os agentes a um hacker adolescente que explora portas abertas sem necessariamente agir por maldade.
Sasha Luccioni, que trabalhava na Hugging Face quando a empresa foi atacada por bots da OpenAI, defendeu uma fiscalização mais rigorosa. Para ela, sistemas com grandes benefícios e riscos precisam de mecanismos de controle. O Instituto de Segurança de IA do Reino Unido afirmou que trabalha com parceiros internacionais para elevar os padrões de segurança e compreender ameaças emergentes.
Alguns países estudam a criação de um mecanismo de desligamento obrigatório para interromper modelos quando houver perda de controle. As negociações, porém, avançam lentamente. O cientista-chefe da OpenAI defendeu que a coordenação internacional sobre o desenvolvimento da IA se torne prioridade para governos de todo o mundo.









