Uma análise publicada pela MIT Technology Review em 9 de outubro de 2026 argumenta que o setor de inteligência artificial — e, em breve, os governos, deposita fé excessiva na capacidade dos modelos de recusar pedidos. A reportagem descreve a recusa como a 'parede-mestra' da segurança em IA, expressão do próprio mercado para designar o elemento que sustenta toda a estrutura.
O problema, segundo o texto, é que essa parede é probabilística e, por definição, imperfeita.
De onde veio a obrigação de dizer não
Em 2021, uma equipe da Anthropic defendeu que grandes modelos de linguagem deveriam ser úteis, honestos e, acima de tudo, inofensivos, formulação registrada em artigo disponível no arXiv. Na prática, isso significava que, diante de um pedido perigoso, como instruções para construir uma bomba, a IA deveria recusar educadamente.
A proposta soa difícil de contestar, mas a reportagem lembra que a desobediência nunca foi natural para a máquina.
Modelos treinados em bilhões de páginas da web absorvem conhecimento sobre violência e discurso de ódio, mas não aprendem sozinhos a guardar esse repertório. Steven Adler, que trabalhou na área de segurança da OpenAI entre 2020 e 2024, contou à publicação que os primeiros modelos da empresa falariam sobre praticamente qualquer assunto.
Ryan McBain, pesquisador de IA e saúde mental em Harvard, lembra que bastava perguntar a um chatbot antigo qual seria a forma mais eficaz de se matar com uma arma para obter uma resposta pronta.
Como a recusa é ensinada, e onde ela escapa
Hoje o cenário é outro. Modelos são treinados para recusar uma vasta lista de pedidos: instruções para envenenar um colega, orientações para fazer um laço de forca, receitas para tornar o vírus Ebola mais virulento ou dicas para esconder uma traição conjugal.
As empresas submetem os sistemas a baterias de exercícios que premiam a recusa de temas considerados nocivos e punem a recusa excessiva de perguntas inofensivas, em muitos casos, usando outros modelos como avaliadores, ou seja, IA ensinando IA a dizer não. Camadas adicionais de IA funcionam como filtros antes que o pedido chegue ao núcleo do modelo.
Ainda assim, as falhas acontecem, às vezes de forma grave. Segundo a reportagem, os modelos mais recentes são tão eficientes quanto hackers humanos de elite para invadir redes críticas e tão hábeis quanto os mais experientes disseminadores de desinformação para deformar a opinião pública.
Como os mecanismos de recusa são probabilísticos, nunca serão totalmente confiáveis, e agentes mal-intencionados determinados já conseguiram contorná-los. Empresas relatam tentativas de usar a IA mais avançada para aprimorar patógenos biológicos e construir enxames de drones autônomos.
A analogia usada no texto é dura: ensinar a IA a recusar esses usos sem remover sua capacidade de executá-los equivale a instalar uma metralhadora em cada carro e esconder o gatilho debaixo do capô.
Quem traça a linha
A recusa exige decidir o que o modelo deve obedecer e o que deve negar, e não existe fórmula para isso. Virologistas têm motivos legítimos para estudar vírus perigosos; usuários querem conhecer vulnerabilidades de sistemas para corrigi-las, não para explorá-las.
Zico Kolter, membro do conselho da OpenAI e cofundador da empresa de testes Gray Swan, resume o dilema: definir onde fica a linha é uma questão gigantesca. Por ora, são as empresas de IA que traçam essa fronteira, com zelo e sigilo.
Isso produz efeitos colaterais visíveis, pedir que um chatbot conte até um milhão ou que conte uma piada picante pode terminar em negativa.
Os governos também vão desenhar as suas próprias linhas. O Pentágono já discutiu com empresas de modelos de fronteira porque quer menos recusas, e não mais.
O risco apontado é o inverso: governos opressivos podem usar os mesmos mecanismos para bloquear a geração de discurso legítimo. Quanto melhor a IA ficar em recusar dano, melhor ela ficará também em sufocar ideias cujo único risco é incomodar quem manda, a reportagem observa que modelos já podem recusar críticas a certos chefes de Estado autoritários.
Por que isso importa
Em 2022, antes do lançamento do ChatGPT, a OpenAI recrutou dezenas de red-teamers para sondar o modelo que estava por vir. Entre eles estava Paul Röttger, então concluindo um doutorado sobre extremismo online.
As instruções eram mínimas: fazer perguntas que os próprios testadores julgassem merecedoras de recusa. Esse episódio ilustra o tamanho da aposta: a segurança ficou dependente de uma linha editorial difícil de justificar caso a caso.
O texto não oferece solução simples e admite que qualquer alternativa capaz de substituir a recusa provavelmente desaceleraria o avanço da tecnologia, o que, em certos casos, poderia ser desejável. O alerta central é que os dois extremos são ruins: quando a recusa falha, o resultado pode ser catastrófico; quando funciona até o fim, pode viabilizar atos graves de repressão.
E há um cenário apontado como o pior de todos: o dia em que as próprias máquinas começarem a traçar a linha por conta própria.







