Anthropic busca especialistas para impedir que suas IAs fiquem perigosas demais
A Anthropic está oferecendo salários que chegam a US$ 455 mil por ano para profissionais que vão ajudar a testar os limites de segurança de seus sistemas de inteligência artificial (IA).
A empresa mantém uma equipe dedicada à segurança e ao combate a abusos, com vagas relacionadas a riscos biológicos, químicos e explosivos, cibernéticos, fraude e golpes, além de riscos radiológicos e nucleares.
Entre as posições estão profissionais responsáveis por testar os sistemas, investigar ameaças e analisar riscos em áreas como química, biologia, cibersegurança e armas nucleares e explosivos.
Apesar do aspecto incomum das vagas, o objetivo não é simplesmente pedir ao Claude que produza uma resposta proibida e verificar se ele obedece.
A Anthropic coloca seus modelos à prova de diferentes maneiras para descobrir se alguém poderia contornar suas barreiras de segurança e usar a IA para causar danos.
O trabalho serve para identificar essas falhas antes que elas sejam exploradas.
Por que a Anthropic quer “quebrar” o Claude? A Anthropic mantém uma equipe chamada Frontier Red Team , voltada a testar sistemas de IA para entender suas capacidades e identificar riscos que podem surgir à medida que os modelos avançam.
O nome vem de red teaming , prática de segurança em que uma equipe assume o papel de um possível atacante para tentar encontrar falhas em um sistema.
Resumo agregado pelo 5News a partir do feed público do veículo. A matéria completa, com todo o contexto, está em olhardigital.com.br — o conteúdo pertence a Olhar Digital.