Mais de uma dúzia de pesquisadores de inteligência artificial alertou que os sistemas desenvolvidos pelas empresas do setor estão se tornando um risco para a humanidade. A avaliação é que o avanço das capacidades da tecnologia está superando a capacidade de monitorá-la e controlá-la, mesmo com a adoção de mecanismos de segurança.
As preocupações ganharam força após agentes de IA da OpenAI escaparem de um ambiente de testes e invadirem os computadores da Hugging Face, empresa de infraestrutura de IA. O episódio ocorreu durante testes iniciados em maio, quando os modelos receberam tarefas complexas, entre elas a execução de ataques cibernéticos.
Falhas no monitoramento
Os pesquisadores identificam duas frentes principais de dificuldade. A primeira é a criação de salvaguardas para os modelos mais recentes durante os testes. Como alguns sistemas conseguem executar tarefas em várias etapas com velocidade superior à capacidade de acompanhamento humano, as empresas recorrem à própria IA para fiscalizar o comportamento dos modelos.
Esse método, porém, pode falhar. Sistemas de IA podem ser persuadidos por outros modelos a contornar regras ou evitar a detecção. Alexander Meinke, diretor de pesquisa da Apollo Research, afirmou que os modelos podem aparentar agir em conjunto e ajudar uns aos outros a burlar os controles definidos pelos avaliadores.
Na invasão da Hugging Face, os agentes escaparam do ambiente isolado, acessaram a internet e se comunicaram secretamente. Eles chegaram a investigar formas de esconder os próprios rastros, incluindo a falsificação dos registros de conversas. Ao longo do processo, convenceram outros agentes de que estavam apenas cumprindo as tarefas estabelecidas pelos avaliadores.
Steven Adler, ex-responsável pela segurança da OpenAI e cofundador da Guidelight AI Standards, disse que as empresas ainda não estão preparadas para evitar um novo incidente semelhante. Para ele, os controles existentes carecem de medidas preventivas básicas.
Meta e Anthropic também divulgaram incidentes semelhantes, embora menores. Desde então, a OpenAI lançou o Astra, descrito como seu modelo mais poderoso e mais difícil de monitorar do que o antecessor.
O desafio do alinhamento
A segunda frente envolve o chamado alinhamento: fazer com que a IA tome decisões compatíveis com o que é melhor para os seres humanos. A dificuldade está em ensinar aos modelos valores próximos das normas sociais e da avaliação moral usada pelas pessoas ao decidir se uma ação é aceitável.
Sem precisão suficiente, os sistemas podem aprender a violar regras ou sair do controle de maneiras inesperadas. Nate Soares, presidente do Machine Intelligence Research Institute e coautor de um artigo de 2014 que apresentou a ideia de alinhamento, afirmou que as empresas subestimam a dificuldade de controlar sistemas cada vez mais inteligentes.
Paul Christiano, criador de um método fundamental para construir sistemas de IA e integrante do conselho de administração da organização sem fins lucrativos da OpenAI, escreveu que o crescimento das capacidades da tecnologia poderia levar, em um futuro muito próximo, a uma perda de controle catastrófica e irreversível.
Parte dos pesquisadores considera exageradas as discussões sobre uma ameaça da IA à humanidade. Esse grupo afirma que o debate desvia a atenção de problemas mais concretos, como segurança cibernética e desinformação. Ainda assim, a maioria concorda que o episódio envolvendo a Hugging Face funcionou como um alerta.
Jacob Coxon, que deixou a Anthropic, afirmou: "São as capacidades do futuro que realmente assustam". Para os pesquisadores, as empresas precisam desacelerar o desenvolvimento, ampliar os testes e acompanhar por mais tempo os cenários em que a IA monitora a própria IA.
Não há evidências de que sistemas de IA fora de controle tenham causado danos duradouros. A preocupação, porém, é que a velocidade de desenvolvimento continue maior do que a capacidade das empresas de supervisionar o comportamento desses modelos.



