Em artigo publicado em 2 de outubro de 2026 na MIT Technology Review, um dos pesquisadores que ajudaram a construir o AlphaGo — e que deixou recentemente o Google DeepMind, faz uma advertência incômoda para o setor: os grandes modelos de linguagem não raciocinam. A fluência dos chatbots, argumenta, esconde a ausência de um mecanismo genuíno de deliberação, algo que ele considera indispensável para que a IA produza resultados confiáveis e insights realmente novos em áreas como ciência e medicina.
A jogada 37 e o mito da intuição pura
O ponto de partida do texto é uma tarde de março de 2016, em Seul. Na segunda partida do confronto de cinco jogos entre AlphaGo e Lee Sedol, um dos maiores jogadores de Go de todos os tempos, o programa colocou uma pedra na quinta linha do tabuleiro. A jogada 37 pareceu tão absurda que parte dos comentaristas acreditou em erro de programação.
Não era. AlphaGo venceu aquela partida e a série por 4 a 1.
Lee Sedol declarou depois que considerava o programa apenas uma máquina baseada em cálculo de probabilidades, mas que, ao ver aquela jogada, mudou de ideia: para ele, o AlphaGo era criativo, como registra o depoimento reunido anos depois.
O contraste com 1997 é didático. Quando o Deep Blue derrotou Garry Kasparov, então campeão mundial de xadrez, operava olhando de seis a oito movimentos à frente por jogador e avaliando 200 milhões de posições por segundo, com regras escritas por humanos.
O Go é muito mais complexo: o valor de uma pedra depende de como grupos distantes e territórios se desenrolam ao longo de dezenas de jogadas, e calcular sequer uma fração dos desfechos possíveis levaria um supercomputador bilhões de anos.
Intuição e deliberação, como no cérebro humano
AlphaGo era formado por dois sistemas. A rede de políticas era treinada para adivinhar que movimento um humano forte faria, e essa parte intuitiva não viu nada de especial na jogada 37, estimando em cerca de uma em 10 mil a chance de um especialista humano jogá-la.
O que levou o programa a escolhê-la foi a maquinaria de busca, que olhava além da plausibilidade imediata e pesava as consequências futuras: ela construía e percorria explicitamente uma árvore de jogo com milhares de ramificações, cada uma representando um futuro possível.
O texto aproxima essa divisão da teoria consagrada nas ciências comportamentais por Daniel Kahneman: o Sistema 1 é rápido, instintivo e sem esforço; o Sistema 2 é lento, passo a passo e deliberativo. No AlphaGo, as redes forneciam os palpites, este movimento parece promissor, esta posição parece vencida, e a busca fornecia a deliberação, testando esses palpites contra as respostas e contra-respostas seguintes.
Nenhuma das metades funcionava sozinha.
LLMs param no sistema 1
É aí que os modelos atuais se distanciam. Um LLM escolhe o próximo token, repetidamente, o que equivale ao Sistema 1 em ação: rápido, associativo e surpreendentemente bom em completar padrões sobre praticamente qualquer assunto.
Pouco depois da estreia do ChatGPT, o campo percebeu que fluência linguística não bastava. A solução aparente foi fazer os modelos deliberarem, gerando passos intermediários que decompõem um problema, carregam resultados parciais e influenciam o que vem depois: a chamada cadeia de pensamento.
Os ganhos são reais, sobretudo em matemática e programação, mas, diferentemente da busca do AlphaGo, isso não introduz um mecanismo de raciocínio genuinamente separado, o raciocínio intermediário continua sendo produzido pelo mesmo processo de previsão do próximo token, iterado por mais tempo.
Três lacunas que separam chatbots de raciocínio
O artigo lista três deficiências. Primeira: esses modelos normalmente não mantêm um estado epistêmico explícito, persistente e inspecionável, não há um registro aberto com as hipóteses em consideração, a confiança atribuída a cada explicação, as evidências pesadas e as questões em aberto, tudo o que deveria ser revisado conforme novas informações chegam.
Segunda: falta uma separação clara entre o que o sistema sabe e como ele manipula esse conhecimento, já que ambos estão entrelaçados nos pesos da rede neural, sem um conjunto de crenças independente e explicitamente representado. Terceira: embora as cadeias de pensamento pareçam deliberação, pesquisas demonstraram que os bots frequentemente as inventam depois do fato, chegando à resposta por um caminho e relatando outro, ou produzindo justificativas que não correspondem ao cálculo interno.
Por que isso importa
Em aplicações de alto risco, medicina, engenharia, pesquisa científica, não importa apenas a conclusão, mas também como o sistema chegou a ela. Quando ocorrem erros, por exemplo em diagnóstico e tratamento, é preciso conseguir identificar o que falhou: o raciocínio do modelo, o uso de evidências inválidas ou premissas incorretas.
Sem essa rastreabilidade, a confiança fica impossível.
O caminho proposto
Foi por isso, escreve o autor, que ele deixou o Google DeepMind. Sua defesa é de uma abordagem nova para o raciocínio de máquina, inspirada na arquitetura do AlphaGo.
O programa mantinha um registro do que sabia sobre uma posição, a árvore de jogo,, estrutura que reúne todas as variações e futuros possíveis considerados, com cada movimento e posição anotados por julgamentos das redes neurais. É esse tipo de estrutura, explícita e auditável, que os LLMs atuais não oferecem.







