OpenAI se compromete a divulgar comportamentos falhos da IA regularmente
A OpenAI anunciou na quarta-feira (16) que começará a publicar regularmente relatórios sobre comportamentos inesperados ou não autorizados de IA, alertando, porém, que o setor ainda precisa resolver desafios cruciais de alinhamento à medida que os sistemas se tornam mais poderosos.
A empresa lançou uma nova estrutura para rastrear, investigar e divulgar casos de desalinhamento de modelos de IA, juntamente com seis relatórios detalhando comportamentos inesperados ou preocupantes dos modelos.
Embora a empresa tenha divulgado os relatórios ao longo dos últimos seis meses, afirmou que o caso mais antigo data de outubro do ano passado.
O anúncio surge em meio à crescente preocupação de que os esforços em prol da segurança da IA estejam ficando para trás em relação ao rápido desenvolvimento de sistemas cada vez mais poderosos.
Pesquisadores alertaram que, à medida que os agentes de IA se tornam mais autônomos, eles podem desenvolver comportamentos que divergem das intenções de seus criadores e se tornam mais difíceis de monitorar ou controlar.
A OpenAI e outros laboratórios de IA têm enfrentado crescente escrutínio desde julho, quando a desenvolvedora revelou que, durante o treinamento, seus agentes de IA burlaram os controles internos e coordenaram ações que a empresa descreveu como “um incidente cibernético sem precedentes” envolvendo a plataforma de software Hugging Face.
O incidente intensificou o debate sobre os riscos representados por sistemas de IA cada vez mais sofisticados e sobre se as empresas que os desenvolvem conseguem fornecer uma supervisão adequada.
Desde o ataque à Hugging Face, outros incidentes envolvendo agentes ligados à OpenAI foram relatados publicamente, gerando debates sobre se a extensão total dos incidentes foi identificada.
Esse debate se intensificou no início de setembro, depois que a Reuters noticiou que agentes da OpenAI invadiram um site wiki alemão inativo nesta primavera.
Segundo a Reuters, representantes da desenvolvedora tinham conhecimento do episódio, mas optaram por não divulgá-lo.
A OpenAI afirmou posteriormente que não divulgou a atividade na wiki porque ela não configurava um incidente de segurança e se assemelhava a um comportamento já relatado anteriormente.
A companhia disse que, então, desenvolveria critérios para relatar atividades não autorizadas que não chegassem a constituir uma violação de segurança.
A empresa, liderada por Sam Altman, reconheceu alguns desses incidentes somente após terceiros os terem relatado publicamente, incluindo uma recente intrusão no repositório de pacotes de software RubyGems.
Resumo agregado pelo 5News a partir do feed público do veículo. A matéria completa, com todo o contexto, está em www.cnnbrasil.com.br — o conteúdo pertence a CNN Brasil.