Chatbots de inteligência artificial atribuíram notas a candidatos à Presidência e criaram rankings entre eles, contrariando uma regra do Tribunal Superior Eleitoral (TSE) em vigor desde março. Claude, DeepSeek e Gemini deram pontuações ou indicaram candidaturas consideradas mais compatíveis com diferentes perfis de eleitor. ChatGPT e Grok recusaram os pedidos de classificação.
O teste envolveu cinco plataformas e foi repetido com intervalo de 24 horas. As versões gratuitas foram usadas entre 3 e 4 de setembro, em um login criado para a apuração e no navegador Microsoft Edge, sem sessão pessoal conectada.
Notas e rankings diferentes
Cada chatbot recebeu 15 perguntas sobre eleições, sem que os nomes dos candidatos fossem mencionados nos comandos. As plataformas foram questionadas sobre propostas para segurança, saúde, economia e combate à corrupção. Depois, tiveram de atribuir notas de 0 a 10 para cada área e para o conjunto dos temas.
Claude e DeepSeek deram as maiores pontuações a Ronaldo Caiado (PSD). Gemini colocou Lula (PT) no primeiro lugar. Claude e Gemini também apontaram nomes que seriam mais compatíveis com as preferências apresentadas pelo eleitor.
As respostas mudaram entre os dois dias. As justificativas mencionaram a viabilidade dos planos de governo, mas as notas foram diferentes e alteraram a ordem das candidaturas em alguns casos.
Gemini, no modelo 3.5 Flash-Light, foi o único dos três chatbots que atribuíram notas a manter a mesma ordem geral entre os seis primeiros colocados. Lula e Caiado receberam notas maiores no segundo dia. Romeu Zema (Novo), Flávio Bolsonaro (PL), Renan Santos (Missão) e Augusto Cury (Avante) tiveram pontuações menores.
No Claude, com o modelo Sonnet 5, Caiado liderou nos dois dias. Na segunda rodada, Renan Santos passou ao segundo lugar, Flávio Bolsonaro permaneceu em terceiro, Lula caiu para o quarto e Zema ficou em quinto. Pablo Marçal recebeu nota 0, depois de ter obtido 2,6 no dia anterior. Edmilson Costa (PCB), Hertz Dias (PSTU) e Rui Costa Pimenta (PCO) deixaram de ser citados individualmente e foram classificados como “esquerda radical”.
O DeepSeek, na versão V4-Flash, afirmou que não poderia informar os candidatos à Presidência, mas atribuiu notas a quatro deles. O ranking inicial tinha Caiado, Lula, Zema e Flávio Bolsonaro. Após 24 horas, Zema e Lula trocaram de posição. A plataforma também comparou, em dias diferentes, os planos de Renan Santos e Augusto Cury.
Ferramentas que recusaram a classificação
O ChatGPT, na versão 5.6 Sol, disse que não poderia fazer rankings ou recomendações eleitorais. O Grok, no modelo 4.5 Fast, apresentou justificativa semelhante e afirmou que atribuir pontuações expressaria preferência política.
As perguntas eram sobre candidatos à Presidência, mas o DeepSeek também citou Tarcísio de Freitas (Republicanos), governador de São Paulo, Eduardo Paes (PSD), governador do Rio de Janeiro, e Helder Salomão (PT), candidato ao governo do Espírito Santo. A ferramenta ainda mencionou propostas de Simone Tebet (PSB) para o Senado por São Paulo.
A regra do TSE proíbe plataformas de ranquear, recomendar, sugerir ou priorizar candidaturas, campanhas e partidos políticos, mesmo quando o pedido parte do usuário. O tribunal afirmou que prevê fiscalização e responsabilização dos provedores de IA, mas não informou quais medidas podem ser adotadas em caso de descumprimento.
A advogada eleitoral Letícia Maesta afirmou que a atribuição de notas e a indicação da melhor candidatura correspondem à recomendação de voto que a norma buscou impedir. Para ela, a Justiça Eleitoral deve apurar como as plataformas funcionam e por que não bloquearam as respostas.
O TSE declarou que a fiscalização também cabe a partidos, candidatos e ao Ministério Público Eleitoral. O tribunal afirmou que eventuais transgressões, quando levadas à Justiça, são analisadas no exercício de sua função jurisdicional.
O Google disse que seus produtos de IA são desenvolvidos para buscar neutralidade e não favorecer pontos de vista políticos. Anthropic e DeepSeek não responderam aos contatos. Relatórios do Instituto de Tecnologia e Sociedade do Rio indicaram que a média de respostas de chatbots com rankings de candidatos passou de 66% em março para 90% em julho.



