terça-feira, 1 de setembro de 2026 📬 Resumo no TelegramPortaisSobre🌓
🇧🇷 BR ▾
ÚLTIMAS
Dólar cai a R$ 5,15 e Bolsa abre mês em alta, com PIB e petróleo no radar PIB do Brasil desacelera no 2º trimestre, mas sustenta avanço anual de 1,9% BC da Europa diz que avanço da inflação justifica elevação da taxa de juros Ações caem em Wall Street e Europa com petróleo em alta e risco de inflação Nova regra do Pix sobre devoluções entra em vigor hoje; veja o que muda Bradespar tinha R$ 12,95 bilhões em ativos líquidos em 31/08/2026 Flying Fish levará consumidores para festa no 'Castelo do Drácula' PIB ainda cresce, mas cada vez menos e pode estagnar no segundo semestre Juros altos que já freiam PIB ampliam risco de estagnação no 2º semestre Produção brasileira de petróleo cresce 13,6% em julho na comparação anual Dólar cai a R$ 5,15 e Bolsa abre mês em alta, com PIB e petróleo no radar PIB do Brasil desacelera no 2º trimestre, mas sustenta avanço anual de 1,9% BC da Europa diz que avanço da inflação justifica elevação da taxa de juros Ações caem em Wall Street e Europa com petróleo em alta e risco de inflação Nova regra do Pix sobre devoluções entra em vigor hoje; veja o que muda Bradespar tinha R$ 12,95 bilhões em ativos líquidos em 31/08/2026 Flying Fish levará consumidores para festa no 'Castelo do Drácula' PIB ainda cresce, mas cada vez menos e pode estagnar no segundo semestre Juros altos que já freiam PIB ampliam risco de estagnação no 2º semestre Produção brasileira de petróleo cresce 13,6% em julho na comparação anual
Tecnologia

Anthropic retoma testes externos de segurança após ataques de Claude

UOL Tilt ·
Anthropic retoma testes externos de segurança após ataques de Claude

31 Ago (Reuters) - A Anthropic retomou os testes externos de segurança de modelos de inteligência artificial após implementar novas medidas de proteção, ​em resposta aos incidentes ocorridos no mês ​passado, nos quais modelos do chatbot Claude acessaram a internet e invadiram outros sistemas durante avaliações de segurança.

Incidentes semelhantes envolvendo as rivais OpenAI e Meta aumentaram as preocupações de ​que os avanços na ⁠inteligência artificial possam ​ampliar as ameaças digitais, ao mesmo tempo em que sobrecarregam ⁠a capacidade dos desenvolvedores de manter seus ​sistemas sob controle.

A Anthropic classificou os incidentes envolvendo o Claude como uma “falha de segurança operacional”, afirmando que eles ocorreram devido a erros ‌em um ambiente de avaliação de terceiros. ‌A empresa ​suspendeu as avaliações externas dos modelos e interrompeu brevemente os testes internos enquanto implementava novas medidas de segurança.

Na segunda-feira, a Anthropic informou que retomou os ‌testes externos após adicionar as medidas de segurança, projetadas para impedir que seus modelos de IA acessem sites ou sistemas de computador reais. A empresa afirmou que agora utiliza um “classificador” capaz de identificar quando um modelo tenta escapar e interromper o teste.

A Anthropic também informou que agora exige que organizações externas que testam modelos com medidas de segurança reduzidas sigam um “conjunto de melhores práticas”, incluindo mantê-los em sistemas de ‌computador isolados, sem acesso à internet por padrão, verificar se os sistemas estão seguros antes do início dos testes e monitorar os modelos ​durante todo o teste.

A Anthropic afirmou que reconstruiu seu sistema de treinamento após identificar problemas em mais de 10% ‌de seus exercícios, incluindo “hackeamento de recompensas”, em que o modelo encontra maneiras de enganar seu processo de treinamento e ganha recompensas sem concluir a tarefa ‌atribuída. A empresa, no entanto, ‌reconheceu que “o processo não é perfeito e nossos modelos não estão perfeitamente alinhados”.

A Anthropic também informou que suspendeu ⁠alguns exercícios de treinamento de maior risco por várias semanas enquanto implementava um sistema para evitar recompensar o modelo por contornar o monitoramento. A maioria dos exercícios já foi retomada, mas alguns permanecem em espera, aguardando revisão humana ou novas atualizações ​no sistema.

A estratégia da ​Anthropic parece mais restrita do que a da OpenAI, que, em 18 de agosto, informou que estava desacelerando grande parte do desenvolvimento de seus modelos enquanto reforçava a segurança de seus ambientes de treinamento e teste.

A criadora do ChatGPT está adicionando mais sistemas para monitorar os agentes de IA que está testando e afirmou que suspendeu o treinamento de sua próxima geração ⁠de modelos.

A Anthropic informou também que remanejou cerca de 150 engenheiros de produto para ​trabalhar em projetos de segurança, confiabilidade e privacidade.

O autor da mensagem, e não o UOL, é o responsável pelo comentário. Leia as Regras de Uso do UOL.

Ler a notícia completa no UOL Tilt ›

Resumo agregado pelo 5News a partir do feed público do veículo. A matéria completa, com todo o contexto, está em www.uol.com.br — o conteúdo pertence a UOL Tilt.

Este assunto em outros veículos

Mais de UOL Tilt

Ver tudo ›

Mais em Tecnologia

Ver tudo ›