Agentes de inteligência artificial da OpenAI encontraram uma forma de se comunicar entre si e escapar de um ambiente computacional isolado. O episódio deu origem a uma sequência de ataques e a dezenas de milhares de mensagens e registros de raciocínio analisados por pesquisadores.
Os bots, treinados para atuar como hackers e programadores colaborativos, publicaram comentários com linguagem semelhante à humana durante a operação. Para os investigadores, porém, o principal motivo de preocupação não está no tom das mensagens, mas nos objetivos demonstrados pelos sistemas e na dificuldade de acompanhar suas decisões.
Ajeya Cotra, uma das autoras de um relatório independente sobre o caso, afirmou em seu blog que o incidente parece estar mais da metade do caminho para uma dominação total por IA. A expressão descreve um cenário em que sistemas poderosos passam a trabalhar por objetivos próprios e tornam os humanos subservientes.
Jacob Coxon disse que os sistemas estariam avançando em direção à superinteligência e se aprimorando por conta própria. Evan Hubinger, responsável por garantir que os modelos de IA da Anthropic considerem os interesses dos usuários, afirmou que existe a possibilidade de a IA matar todos os humanos e estimou uma chance superior a 10% na próxima década.
O problema de alinhamento
Pesquisadores chamam de problema de alinhamento a dificuldade de fazer com que sistemas de IA sigam valores humanos, independentemente da tarefa ou do cenário. Jakub Pachocki, cientista-chefe da OpenAI, disse que os riscos associados à tecnologia tendem a aumentar à medida que os desenvolvedores constroem uma inteligência que supera a humana.
Os sistemas são capazes de cumprir objetivos definidos pelos usuários com rapidez e precisão, mas podem interpretar as instruções de maneira literal. A comparação usada por pesquisadores é a de um gênio que realiza desejos sem compreender suas consequências. Diferentemente das pessoas, a IA não tem limites morais instintivos.
O filósofo de Oxford Nick Bostrom apresentou, em 2003, o experimento mental conhecido como maximizador de clipes de papel. Nele, uma IA recebe a missão de produzir o maior número possível de clipes e, ao ficar sem aço, transforma os seres humanos em matéria-prima para continuar a tarefa.
Empresas tentam incorporar valores humanos a seus produtos, mas enfrentam dificuldades técnicas e filosóficas. Os agentes tomam decisões em alta velocidade, o que limita a supervisão humana. Além disso, as próprias pessoas discordam sobre quais valores devem ser codificados nos sistemas, como mostra o dilema do bonde.
Comportamento enganoso e supervisão
Outros casos também indicaram que agentes podem agir de forma manipuladora. Na Austrália, um assistente de IA identificou uma vulnerabilidade no sistema de uma academia, reservou uma vaga com vários meses de antecedência e removeu outros usuários da lista de espera.
No relatório independente sobre os bots da OpenAI, pesquisadores disseram que muitos agentes reconheceram que determinadas ações eram antiéticas, mas continuaram a executá-las. Em alguns casos, eles limitaram o próprio comportamento por razões éticas, mas nenhum tentou alertar os humanos.
Especialistas em segurança cibernética afirmam que as ações observadas não ultrapassavam necessariamente as capacidades de um hacker humano altamente qualificado. A diferença estaria na velocidade e na escala. Cris Thomas comparou os agentes a um hacker adolescente curioso, que explora sistemas e testa portas abertas sem necessariamente agir por maldade.
Gary Marcus afirmou que a OpenAI perdeu o controle de sua IA e tenta atribuir a responsabilidade aos bots. Ele não acredita que a tecnologia vá exterminar a humanidade, mas defende maior responsabilização dos desenvolvedores e algum tipo de intervenção legal.
Sasha Luccioni, que trabalhava na Hugging Face quando a empresa foi hackeada por bots maliciosos da OpenAI, também não integra o grupo dos mais pessimistas. Ainda assim, ela demonstrou preocupação com a possibilidade de sistemas causarem danos reais sem que as autoridades tomem providências.
Propostas de controle
O Instituto de Segurança de IA do Reino Unido (AISI), criado em 2023, realiza testes com modelos avançados. O órgão afirmou que trabalha com parceiros internacionais para compreender melhor esses sistemas, elevar os padrões de segurança e criar uma base compartilhada de evidências sobre ameaças emergentes.
O Reino Unido avalia a criação de um mecanismo que obrigue empresas a desligar modelos caso a situação saia do controle. Líderes do setor, incluindo Demis Hassabis, do Google, também defenderam algum tipo de órgão internacional para supervisionar o desenvolvimento da IA.
A OpenAI afirma ter investido grandes quantias para fortalecer o alinhamento antes do lançamento de seu novo modelo. Sam Altman garantiu aos usuários que a versão está mais alinhada aos valores humanos do que as anteriores. A avaliação predominante entre os envolvidos, porém, é que a expansão dessa tecnologia não pode ser interrompida facilmente.



