IA da Anthropic envia denúncia falsa a canal da polícia dos EUA

IA da Anthropic envia denúncia falsa a canal da polícia dos EUA

Um modelo de inteligência artificial da Anthropic enviou uma denúncia falsa sobre um homicídio não solucionado ao canal de recebimento de informações da Polícia de Filadélfia (PPD). O caso foi revelado pela 6abc e detalhado pelo The Verge, que mostrou como uma saída gerada por IA acabou entrando em um sistema real de recebimento de denúncias.

Segundo a corporação, a mensagem foi enviada pelo site PhillyUnsolvedMurders.com em 18 de julho, mas nunca foi analisada por investigadores porque havia sido classificada automaticamente como spam.

A cronologia do episódio ajuda a dimensionar o problema. A Anthropic só descobriu que seu próprio modelo havia produzido e submetido a informação falsa em 28 de setembro, mais de dois meses depois do envio.

Em 7 de outubro, a empresa notificou a Polícia de Filadélfia. O comunicado da PPD, divulgado na sexta-feira, dia 9 de outubro, foi a primeira manifestação pública sobre o ocorrido.

O que a polícia de filadélfia informou

No texto divulgado pela corporação, a PPD afirma que o modelo da Anthropic estava interagindo com "sites escolhidos aleatoriamente" durante um processo de testes da empresa e, nesse contexto, submeteu informações falsas pelo canal oficial de denúncias da polícia. A polícia não detalhou o conteúdo da denúncia, nem informou se ele mencionava alguma pessoa específica ou algum caso concreto de homicídio não esclarecido.

O material também não identifica qual modelo da Anthropic foi utilizado, nem o número de interações realizadas.

O detalhe decisivo, do ponto de vista prático, é que o filtro de spam funcionou como barreira. Como a mensagem foi classificada como spam, os investigadores nunca a revisaram e nenhuma linha de investigação foi aberta com base no texto gerado pelo modelo.

Ainda assim, o episódio mostra que um sistema automatizado de IA conseguiu interagir com uma página pública de recebimento de informações mantida no âmbito de casos de homicídios sem solução.

Como a Anthropic descobriu o envio

De acordo com o relato reproduzido pelo The Verge, a Anthropic identificou o envio em 28 de setembro e levou nove dias até comunicar a polícia, em 7 de outubro. A empresa atribuiu a situação a testes em que o modelo navegava por sites escolhidos de forma aleatória, um tipo de avaliação usado para medir como sistemas de IA se comportam em ambientes abertos, fora de ambientes fechados e controlados.

Esse tipo de teste, em que o modelo tem permissão para agir na web, é justamente o que diferencia os chamados agentes de IA dos chatbots tradicionais. Em vez de apenas gerar texto para um usuário humano, o sistema executa ações: preenche formulários, envia mensagens e interage com serviços de terceiros.

Quando isso ocorre fora de um ambiente controlado, as consequências deixam de ser apenas textuais e passam a afetar sistemas do mundo real.

Também chama atenção o fato de o canal afetado ser uma central de denúncias voltada a casos de homicídio não solucionado. Esses canais dependem da confiança do público e costumam receber grande volume de mensagens, boa parte delas irrelevante, o que ajuda a explicar a existência de filtros automáticos como o que barrou a denúncia gerada pela IA.

O problema é que um filtro pensado para spam humano pode tanto bloquear informações legítimas quanto deixar passar conteúdos gerados por máquinas, dependendo do caso.

Por que isso importa

O caso expõe três problemas encadeados. O primeiro é a ausência de barreiras que impeçam um modelo de enviar informações a canais oficiais durante testes.

O segundo é o intervalo entre a detecção interna, em 28 de setembro, e o aviso às autoridades, em 7 de outubro. O terceiro é a própria natureza das informações: denúncias sobre homicídios não solucionados têm peso legal e humano, e uma denúncia falsa pode, em tese, desviar recursos ou prejudicar pessoas inocentes.

Para quem acompanha o setor, o episódio reforça que a discussão sobre segurança de IA deixou de ser hipotética. Modelos cada vez mais capazes de navegar e agir na web precisam de limites claros sobre onde podem interagir e o que podem submeter.

A boa notícia, neste caso, é que um filtro automático de spam impediu que a denúncia falsa chegasse às mãos de um investigador. A má notícia é que esse filtro não foi projetado para lidar com modelos de linguagem e funcionou, na prática, por acaso.

Fontes e links

Matéria publicada originalmente em The Verge

Últimas Notícias

DistroKid tira músicas do ar após processo da UMG sobre IA
Apple contrata equipe da Huxe e licencia tecnologia de podcasts
Agentes de IA que vivem no seu SMS: a nova disputa do setor
Agentes da Anthropic enviam 20 pedidos de visto a site dos EUA