O Google Research anunciou em 2 de outubro de 2026 uma nova geração de seu sistema de aprendizado federado (federated learning, FL), capaz de oferecer garantias de privacidade verificáveis externamente enquanto desloca parte da computação para o servidor, com ganhos de velocidade de treinamento, acurácia e cobertura de dispositivos. O anúncio foi assinado por Katharine Daly, engenheira de software, e Daniel Ramage, diretor de pesquisa, e vem acompanhado de um artigo técnico.
Segundo os autores, o Gboard já adotou o novo sistema e registra tempos de computação substancialmente mais rápidos do que a geração anterior.
Uma década de aprendizado federado
A técnica de aprendizado federado foi apresentada pelo Google em 2017 como uma forma de treinar modelos de aprendizado de máquina sobre dados descentralizados e privados, sem centralizá-los. Desde então, passou a sustentar recursos cotidianos: previsão da próxima palavra e Smart Compose no Gboard, sugestões de resposta no Google Messages e a seleção inteligente de texto no Android.
O desenvolvimento desses sistemas é orientado por quatro princípios de privacidade: minimização de dados, anonimização, transparência e controle, e verificabilidade e auditabilidade. Anos de pesquisa em anonimização levaram a garantias fortes de privacidade diferencial (DP) para modelos em produção, por meio de algoritmos como o MF-DP-FTRL (matrix factorization DP-FTRL) e da privacidade diferencial distribuída combinada com Secure Aggregation.
Em 2025, a empresa apresentou uma definição evoluída de FL, centrada nesses princípios e na ideia de que os clientes devem manter controle total sobre seus dados, sobre quais cargas de trabalho podem acessá-los e sobre as propriedades de anonimização aplicadas a eles.
TEEs para tornar a privacidade auditável
A nova geração recorre a Trusted Execution Environments (TEEs), os ambientes de execução confiáveis, para oferecer garantias de anonimização plenamente verificáveis e auditáveis. A lógica que roda dentro de um TEE é atestável remotamente, ou seja, terceiros podem verificar qual código está sendo executado.
Esse código ganha ainda confidencialidade, já que seu estado interno não pode ser observado, e integridade, pois não pode ser interrompido, respeitadas as limitações dos TEEs de geração atual. O sistema combina essas propriedades, que existem no nível de uma única máquina, para formar um fluxo federado verifiável de ponta a ponta.
De acordo com os pesquisadores, o resultado é um sistema com garantias de privacidade mais fortes e melhor acurácia. O trabalho se apoia em técnicas desenvolvidas em projetos anteriores da empresa, como a analítica federada confidencial e o esforço para produzir insights provadamente privados sobre o uso de IA.
Quatro conceitos operacionais
O sistema coordena quatro conceitos centrais. No upload de dados, os dispositivos dos clientes criptografam localmente os exemplos de treinamento e os enviam, pré-autorizando uma política de acesso que define quais computações em TEE poderão processar aqueles dados.
Essas computações só liberam resultados anonimizados, e as políticas de acesso precisam ser publicadas em um log público de transparência.
O KMS (Key Management System), formado por um cluster de TEEs que implementa o protocolo de consenso RAFT, só entrega chaves de descriptografia a cargas de trabalho em TEE no lado do servidor que correspondam exatamente às computações previstas na política de acesso. Na etapa de execução, um TEE considerado raiz roda um programa Python que implementa o laço de treinamento e delega subtarefas paralelizáveis a um cluster de TEEs trabalhadores.
A lógica distribuída é expressa na Federated Language, linguagem de orquestração de código aberto e agnóstica de framework, derivada do TensorFlow Federated, que alimentava o sistema anterior. O laço de treinamento libera periodicamente pesos de modelo anonimizados para o analista de dados.
Há a recuperação tolerante a falhas: ao término de cada rodada de treinamento, o programa Python salva um estado de recuperação criptografado pelo KMS. Esse estado permite retomar a operação após falhas intermitentes do TEE raiz ou dos trabalhadores, sem vazar nenhuma informação adicional sensível do ponto de vista de privacidade.
Por que isso importa
A verificabilidade é um dos quatro princípios que guiam o desenvolvimento dos sistemas de aprendizado federado do Google, e o novo desenho baseado em TEEs busca transformá-la em algo que terceiros possam conferir, e não apenas em uma promessa interna. Ao mesmo tempo, mover a computação para o servidor ataca limitações práticas das abordagens anteriores, melhorando velocidade de treinamento, acurácia e cobertura de dispositivos — exatamente os pontos citados pela empresa como motivação para o novo sistema.
O caso do Gboard serve como indicação de que a arquitetura deixou de ser apenas pesquisa e passou a operar em produção, em um recurso usado por um volume amplo de pessoas. Os autores lembram, no entanto, que as garantias dependem das propriedades oferecidas pelos TEEs de geração atual, que têm limitações conhecidas e documentadas.
Fontes e links
- Google Research
- Paper: Toward provably private learning from federated data
- Federated Language (repositório)







