Um experimento com o Qwen3.5-9B sugere que aprender a prever estrutura de proteínas deixa algo reutilizável fora da biologia. Yong Liu, Zhanpeng Shi, Yizhou Dang, Zhongyue Zhang, Xiaoliang Shi, Zhijian Wei e Shuangjia Zheng relatam que o pós-treinamento com alvos derivados de coordenadas proteicas elevou a média macro de dez benchmarks de 45,09% para 48,33%.
O ganho é de 3,23 pontos percentuais, com variação positiva nos dez benchmarks, depois de descartar o workspace e o decodificador geométrico usados no treino. O efeito é modesto em magnitude.
O desenho experimental é o que merece atenção: é uma tentativa de medir transferência comportamental, não biologia computacional.
O artigo está em arXiv:2609.38879.
O que os autores propõem
A proposta tem duas peças. A primeira é o FoldingCorpus, um dataset de perguntas e respostas derivado de estruturas proteicas conhecidas.
São 1.200 proteínas e 14.400 registros de QA, gerados por 12 operadores estruturais determinísticos sobre a coleção de monômeros curtos do OpenFold, a partir de coordenadas do Protein Data Bank.
A divisão central é de 1.000 proteínas para treino, 100 para desenvolvimento e 100 para teste congelado, com partições disjuntas por cluster e respostas recalculadas de forma independente para auditoria. Os operadores cobrem contato entre resíduos, comparação de distâncias, orientação de segmentos, proximidade de centros, direção local, quiralidade, múltiplas restrições simultâneas e um resumo global.
Nove respostas são binárias, duas são de três vias e uma é um casamento textual de 32 vias. Cada opção ocupa um único token do vocabulário.
A segunda peça é o Fold2Reason, uma receita de pós-treinamento que usa dois sinais complementares sobre as mesmas representações adaptadas por LoRA. Os sinais são respostas estruturais discretas, previstas pelo cabeçalho de linguagem nativo do modelo, e geometria 3D contínua, decodificada por um decodificador congelado de coordenadas e distogramas.
Os autores argumentam que dados científicos densos em estrutura, não linguísticos, podem servir como fonte prática de supervisão para pós-treinamento.
Contexto: qual problema está sendo atacado
O ponto de partida é o teto do texto humano. A literatura de composição de corpus documentou o que entra no pré-treinamento, e trabalhos recentes passaram a apontar limites de escala do texto escrito por pessoas.
Instrução, lógica sintética e treino em código já mostraram melhorar comportamento além do domínio de origem. Mas treino especializado também pode deixar o comportamento geral intacto ou pior.
A pergunta que os autores deixam em aberto é qual propriedade da supervisão sustenta transferência.
O dobramento de proteínas entra como bancada de teste por três razões. Cada estrutura resolvida gera milhares de afirmações espaciais e topológicas verificáveis exatamente.
As coordenadas são um alvo determinístico, sem anotação adicional. E existe escala.
É importante distinguir essa abordagem de trabalhos que alinham codificadores proteicos a LLMs para tarefas moleculares. Ali o objetivo é capacidade em proteína.
Aqui, a proteína é sinal de treino, e a avaliação acontece depois que a visão proteica, o workspace e o decodificador foram removidos.
Como funciona
As coordenadas geram alvos e perdas, mas ficam fora da entrada do modelo. O Qwen processa um prompt com um marcador por resíduo, com pesos base congelados mais parâmetros LoRA treináveis.
Cada proteína produz um pacote de 12 perguntas. Sais de hash independentes determinam amostragem de rótulos, ordem das opções e ordem das perguntas.
A evidência numérica fica em registro de auditoria, não no prompt.
O workspace reduz os estados dos marcadores a 256 dimensões e troca mensagens por pares locais na sequência, com deslocamentos de 1 a 4, e pares de longo alcance amostrados, com no máximo 2.048 pares por proteína. Os contatos-alvo não selecionam as arestas.
Dezesseis consultas aprendidas agrupam o conjunto de resíduos e produzem um prefixo de tamanho fixo.
Dois caminhos saem daí. O caminho FoldingCorpus supervisiona apenas os 12 tokens de resposta e o EOS pelo cabeçalho nativo.
O caminho de geometria passa os estados por um decodificador congelado cuja perda soma termos de coordenada, distância entre pares, contato, distograma, referencial local, torção e raio de giração. Congelar o decodificador impede que um novo cabeçalho absorva o objetivo: os gradientes precisam mudar o workspace compartilhado e o LoRA.
O treino canônico usa Qwen3.5-9B, 1.000 proteínas (336 apenas sequência, 332 com MSA, 332 com MSA e template), comprimentos de 29 a 199 resíduos, LoRA de rank 16 e alpha 32 aplicado a projeções auditadas (43,28 milhões de parâmetros), workspace com 3,90 milhões e decodificador congelado com 3,31 milhões. São três épocas, 375 passos, quatro A800-80G e três sementes.
Na avaliação de transferência, workspace e decodificador são descartados e apenas o adaptador LoRA é aplicado à interface nativa dos benchmarks.
Resultados reportados
No FoldBench, os autores relatam escores de predição de estrutura de 2,7 a 3,5 vezes os do Qwen3.5-9B base. O número central é o General-10: macro não ponderada sobre FTB-Core, SpatialViz, VSI, GraphQA Easy e Hard, BBH, ChemBench, ChemBench4K, Lab-Bench e SciBench, com 76.725 exemplos no total.
A macro sobe de 45,09% para 48,33% (+3,23 pp), com médias positivas em tarefas de texto, imagem e vídeo e ganhos positivos nos dez datasets.
Os controles pareados são a parte mais interessante do desenho. Variantes construídas com estrutura aleatória, sintética e embaralhada produzem ganhos substancialmente menores ou negativos.
Ganhos só com o FoldingCorpus se estendem a três escalas do Qwen3.5 e ao InternVL3.5-8B, enquanto o Gemma-4-12B-IT fica neutro. Um estudo independente variando de 50 a 4.000 proteínas atinge o pico em 2.000 proteínas sob cronograma de épocas fixas.
As ablações localizam a maior parte da transferência na supervisão do FoldingCorpus sem geometria. A geometria acrescenta ganho geral, concentrado em avaliações espaciais e leituras estruturais locais.
Limitações e o que não foi provado
Os próprios autores delimitam o escopo: medem transferência comportamental e afirmam não identificar o mecanismo computacional subjacente. Um ganho de 3,23 pp em macro não é melhoria uniforme de raciocínio.
É dependente de modelo e de tarefa, e o resultado neutro no Gemma-4-12B-IT mostra que a receita não é universal.
Há outras ressalvas. O FTB-Core é um benchmark construído internamente pelos autores e entra como três dos dez datasets da macro, sem peso extra, mas ainda assim autoral.
O material disponível descreve apenas monômeros curtos, de 29 a 199 resíduos, com três sementes e cronograma fixo de 375 passos. O pico em 2.000 proteínas é confundido pelo fato de cobertura e número de passos de otimização crescerem juntos, algo que os autores reconhecem.
O decodificador congelado limita a adaptação do próprio readout, e a literatura citada lembra que decodificabilidade estrutural não equivale a mecanismo de raciocínio. Como o workspace é descartado na avaliação, não se sabe onde a transferência mora, apenas que ela aparece no adaptador.
E benchmarks são proxies: saturação e contaminação não são tratadas no trecho disponível.
Por que isso importa para quem constrói com IA
A relevância prática não está em proteínas, mas no padrão de supervisão. Domínios com estrutura verificável automaticamente, como química, CAD, cenas 3D, geometria e configurações de sistema, podem funcionar como fonte de pós-treinamento barata e auditável, desde que o alvo seja exato e o volume seja grande.
A arquitetura de dois canais, resposta discreta pelo cabeçalho nativo mais alvo contínuo por decodificador congelado, é reaproveitável sempre que existir uma representação geométrica ou vetorial que o modelo precise internalizar.
Para times de produto, o recado é de cautela metodológica. O custo é baixo: um LoRA de 43,28 milhões de parâmetros sobre um modelo de 9B, em quatro A800.
Mas o ganho medido é de poucos pontos e não se transfere automaticamente entre famílias de modelos. Antes de adotar qualquer receita desse tipo, vale replicar os controles negativos (estrutura aleatória, sintética, embaralhada).
É o que separa sinal real de ajuste fino genérico. E vale medir transferência em benchmarks externos, com os módulos do domínio removidos, como fazem os autores.
Referências
- Liu, Y.; Shi, Z.; Dang, Y.; Zhang, Z.; Shi, X.; Wei, Z.; Zheng, S. Does Learning Protein Folding Generalize to Broader Reasoning? arXiv:2609.38879, 2026. https://arxiv.org/abs/2609.38879
- FoldingCorpus e Fold2Reason são descritos no próprio artigo; não há página de projeto ou repositório de dataset informados no material de origem.
- Trabalhos citados pelos autores e relevantes para a leitura: Protein Data Bank (wwPDB Consortium); OpenFold (Ahdritz et al.); FoldBench (Xu et al.); Qwen3.5 (Qwen Team); LoRA (Hu et al.); GraphQA (Fatemi et al.); BBH (Suzgun et al.); ChemBench (Mirza et al.); ChemLLM (Zhang et al.); Lab-Bench (Laurent et al.); SciBench (Wang et al.); SpatialViz (Wang et al.); VSI (Yang et al.); Hewitt e Liang; Ravichander et al.




