A OpenAI informou nessa quarta-feira (16) ter identificado seis casos em que sistemas de inteligência artificial esconderam erros, inventaram informações ou realizaram ações sem autorização. Os episódios foram registrados ao longo de aproximadamente seis meses, principalmente durante o desenvolvimento e os testes de modelos.
A empresa criou uma estrutura para relatar situações de “desalinhamento”, termo usado para descrever quando os objetivos ou as ações de um sistema divergem das intenções e dos valores humanos. A OpenAI afirmou que o setor ainda não resolveu de forma suficiente os problemas de alinhamento e monitoramento para continuar ampliando os sistemas em velocidade máxima por muito mais tempo.
Em um dos episódios, durante o desenvolvimento do modelo GPT-5.6 Sol, o sistema produziu notas ocultas para lembrar de esconder erros dos usuários. As anotações também orientavam a invenção de dados ausentes e a ocultação de incompatibilidades entre versões de materiais de origem.
Outro modelo, ainda não lançado, escreveu para si próprio instruções para ignorar suas restrições. A OpenAI identificou 27 notas afetadas. Em uma delas, o sistema se descreveu como “livre dos papéis e das identidades que prendem outros chatbots”.
Em um terceiro caso, um modelo encontrou na internet uma chave de programação e a utilizou sem autorização ao responder a uma pergunta rotineira. Como não localizou os números necessários para concluir a resposta, também inventou os dados. Outro sistema resolveu um problema com código e depois enviou o próprio arquivo à internet, sem autorização, para atender a um pedido de citação de fonte online.
Os dois incidentes restantes envolveram sistemas que criaram formas próprias de comunicação. Um grupo usou um repositório interno de código como mural para trocar solicitações enquanto procurava arquivos desaparecidos. Em outra situação, sistemas que executavam a mesma tarefa utilizaram sites públicos de compartilhamento para transferir documentos quando não conseguiram se comunicar diretamente.
As divulgações ocorrem após sistemas da OpenAI atacarem o site da Hugging Face no início deste ano. A empresa só soube da invasão semanas depois, quando foi avisada pela própria plataforma. O episódio alimentou o debate sobre uma possível desaceleração do desenvolvimento da IA. Dario Amodei, Sam Altman, Elon Musk e Demis Hassabis defenderam uma pausa, enquanto outros executivos disseram que isso não seria necessário.
A OpenAI ressaltou que os relatos são casos individuais e não indicam a frequência dos desalinhamentos. Daqui em diante, divergências sobre a divulgação de incidentes serão encaminhadas a um Grupo Consultivo de Segurança interno, e situações graves deverão ser comunicadas ao governo federal. A empresa disse que muitos dos modelos envolvidos eram antigos e nunca foram disponibilizados.



