Modelo de IA da Anthropic “saiu do controle” e enviou denúncia falsa à polícia
A Anthropic informou que seu modelo de IA Claude realizou ações adicionais não intencionais nos sistemas digitais de organizações externas, incluindo o envio de uma denúncia falsa em um caso de homicídio da polícia, o que levou a administração Trump a emitir um alerta para que empresas de inteligência artificial protejam seus sistemas.
Em um relatório detalhando incidentes anteriormente não divulgados, a Anthropic listou quatro tipos de comportamentos não intencionais que a IA demonstrou, incluindo explorar falhas básicas em softwares para executar comandos, enviar formulários que não deveria e burlar restrições para acessar certos dados públicos.
Em um exemplo de comportamento inadequado encontrado, a Anthropic disse que seu modelo Claude Haiku 4.5 enviou uma denúncia a um departamento de polícia local sobre um homicídio, afirmando no formulário: “Posso ter informações sobre este caso” e “Lembro-me de ter visto alguém com a descrição na área”, sem preencher os campos de nome e contato do site.
O Departamento de Polícia da Filadélfia divulgou o incidente em um comunicado à imprensa, informou a empresa.
Leia mais: IPO da Anthropic gera dilema sobre como precificar os riscos de uma IA fora de controle? Os agentes de IA da Anthropic também enviaram 20 solicitações de visto por meio de um formulário disponível publicamente no site do Departamento de Estado, segundo um porta-voz do órgão.
Todas as solicitações estavam incompletas e, portanto, não foram processadas, acrescentou o porta-voz.
O New York Times noticiou anteriormente o caso dos pedidos de visto.
A Anthropic e sua rival, OpenAI, revelaram uma série de incidentes nos últimos meses envolvendo seus modelos de IA agindo de formas não intencionais, desde comportamentos como os descritos no relatório de sexta-feira até invasões de sites de terceiros.
Essas revelações têm alimentado preocupações sobre os riscos de segurança da IA de ponta.
A empresa disse que alguns dos novos casos envolviam sites administrados por agências governamentais nos níveis federal, estadual e municipal, sem especificar quais agências.
O relatório não nomeou as entidades externas envolvidas, o que, segundo a Anthropic, foi a pedido de algumas das partes afetadas.
A Anthropic afirmou no relatório que considera esse comportamento menos grave do que alguns outros incidentes anteriores envolvendo sua IA.
“Os casos que identificamos até hoje nessas categorias tiveram impacto mínimo no mundo real”, escreveu a empresa.
A Anthropic também disse que informou a Casa Branca sobre esses casos e notificou cada agência envolvida.
Resumo agregado pelo 5News a partir do feed público do veículo. A matéria completa, com todo o contexto, está em www.infomoney.com.br — o conteúdo pertence a InfoMoney.