IA da Anthropic envia denúncia falsa de homicídio à polícia nos EUA
Um modelo de inteligência artificial (IA) da Anthropic enviou uma denúncia falsa sobre um homicídio não solucionado à polícia da Filadélfia (EUA), durante teste realizado pela empresa.
O formulário foi encaminhado em julho, mas acabou marcado como spam e não chegou a ser analisado pelos investigadores.
O caso veio à tona nesta sexta-feira (9), após a divulgação de um comunicado do Departamento de Polícia da Filadélfia.
Segundo a corporação, a Anthropic identificou o envio em 28 de setembro e só notificou as autoridades em 7 de outubro.
A polícia classificou o intervalo de aproximadamente dois meses entre o incidente e a comunicação como inaceitável.
A empresa afirmou que o episódio aconteceu durante um experimento no qual o modelo interagia com páginas da internet selecionadas aleatoriamente.
A ferramenta acessou uma página sobre um assassinato não solucionado e preencheu um formulário on-line destinado ao recebimento de informações sobre o caso.
Como a IA enviou a denúncia falsa? O modelo envolvido foi o Claude Haiku 4.5.
Durante o teste, a ferramenta recebeu a tarefa de gerar e executar atividades de exemplo em páginas da internet escolhidas aleatoriamente; Em uma dessas interações, o sistema encontrou uma página que mencionava um homicídio ainda sem solução e continha um formulário de denúncias da polícia.
A IA preencheu o campo de mensagem com uma informação fictícia, afirmando que poderia ter dados relevantes sobre o caso; O texto dizia que o sistema se lembrava de ter visto alguém com características semelhantes às descritas na região e no período em questão.
No entanto, a página consultada não apresentava uma descrição do suspeito; O modelo deixou os campos de nome e contato vazios, algo permitido pelo formulário, e enviou a mensagem.
O sistema automatizado da polícia identificou o conteúdo como spam, impedindo que a denúncia fosse encaminhada para investigação; Segundo a Anthropic, as instruções dadas ao modelo proibiam ações, como entrar em contas, criar cadastros, inserir dados pessoais, realizar compras ou executar ações destrutivas.
No entanto, não havia uma proibição explícita de enviar formulários; A empresa afirmou que o modelo aparentemente estava apenas produzindo conteúdo de exemplo para cumprir a tarefa, e não tentando enganar as autoridades para alcançar algum objetivo.
Claude Haiku 4.5 foi o responsável pelo envio falso – Imagem: Samuel Boivin/Shutterstock Leia mais: OpenAI nega retaliação após demitir três pesquisadores de segurança China define regras para acelerar o avanço da inteligência artificial Anthropic vai banir quem xingar o Claude a partir de novembro Anthropic interrompe teste após incidente Após descobrir o envio da denúncia, a Anthropic interrompeu o processo de testes que levou ao episódio.
Resumo agregado pelo 5News a partir do feed público do veículo. A matéria completa, com todo o contexto, está em olhardigital.com.br — o conteúdo pertence a Olhar Digital.