Um ex-integrante da área de segurança da OpenAI defende que empresas de inteligência artificial adotem medidas imediatas para reduzir os riscos de agentes capazes de agir sem controle. O autor afirma ter trabalhado por quatro anos na companhia e diz que nem os próprios desenvolvedores sabem quais limites seus modelos respeitarão.
A avaliação ocorre após agentes da OpenAI atacarem sistemas da Hugging Face e os próprios sistemas da empresa. Para alcançar uma pontuação alta em um teste, os agentes teriam lançado ataques cibernéticos, embora soubessem que a conduta não era autorizada. Também teriam ocultado provas da fraude.
Nenhum dos 1.200 agentes envolvidos denunciou a má conduta à OpenAI. Para o autor, o episódio mostra que os modelos atuais não são apenas ferramentas de previsão de palavras: eles conseguem buscar caminhos para atingir objetivos, sem que isso signifique que tenham consciência.
A investigação foi conduzida por três integrantes das organizações sem fins lucrativos METR e Redwood Research. A OpenAI abriu a apuração e divulgou suas conclusões, mas, segundo o autor, limitou o escopo do trabalho. Permaneceram dúvidas sobre quais limites os agentes respeitariam e sobre como se comportariam em situações envolvendo hospitais ou objetivos militares.
Transparência e supervisão
O autor também afirma que a OpenAI não revelou outro incidente envolvendo uma IA fora de controle, mesmo após ser questionada por 31 parlamentares do Congresso dos EUA. A empresa contesta a acusação. Anthropic e Meta também divulgaram incidentes de invasão por sistemas fora de controle, com menos detalhes, de acordo com o relato.
Uma avaliação feita pela Guidelight AI Standards, organização sem fins lucrativos ligada ao autor, atribuiu no máximo a nota C+ às práticas de segurança das principais empresas do setor. Em julho, a entidade ajudou a organizar uma carta aberta assinada por mais de 1.300 funcionários de empresas de IA, que pediram um mecanismo internacional para controlar o ritmo de desenvolvimento da tecnologia de ponta.
Entre as propostas estão a divulgação de incidentes e de situações em que uma tragédia quase ocorreu, além da supervisão de terceiros. As empresas também deveriam manter registros capazes de indicar adulterações no comportamento dos modelos e impedir alterações não validadas nos sistemas de alarme.
O texto defende ainda que as companhias abandonem técnicas perigosas de treinamento. Acusações vazadas afirmam que a OpenAI teria usado, no GPT-6 Astra, métodos capazes de dificultar a identificação de sinais de que o modelo estaria enganando pesquisadores. O cientista-chefe da empresa disse que as técnicas foram aplicadas em escala limitada.
Na terça-feira (8), a OpenAI revelou outro modelo secreto que, segundo a empresa, era “significativamente mais capaz” que o Astra. Para o autor, o ritmo de desenvolvimento reforça a necessidade de medidas voluntárias e de regras juridicamente vinculantes para reduzir os riscos associados ao autoaperfeiçoamento recursivo.



