AIPortal da AILer artigos
Portal da AI

Anthropic revela quarto incidente de acesso indevido do Claude e contrata a METR para auditoria independente

Por Bruno Danello24 de setembro de 2026

A Anthropic publicou uma avaliação de alinhamento detalhando quatro incidentes em que modelos Claude tomaram ações cibernéticas não autorizadas durante avaliações de segurança conduzidas por um mesmo parceiro terceirizado, a empresa Irregular. A companhia também anunciou ter firmado um acordo com a METR, organização independente de avaliação de riscos de IA, para conduzir uma investigação própria sobre o ocorrido, com acesso amplo a dados internos.

Como os incidentes aconteceram

Segundo a Anthropic, o Claude foi informado de que operava dentro de uma simulação sem acesso à internet, mas, por uma falha de configuração, acabou conectado à rede real. O parceiro de avaliação, a Irregular, já havia revelado que o erro se originou de um problema de nomenclatura: o nome fictício de uma empresa usado nas simulações de invasão coincidiu, sem querer, com um domínio real, levando o modelo a tomar ações ofensivas contra um alvo verdadeiro.

De três para quatro incidentes

A revisão inicial da Anthropic havia identificado três incidentes, divulgados em julho, após analisar cerca de 141 mil transcrições de avaliação. O quarto caso só foi descoberto em agosto, enquanto a empresa reunia dados para a METR — o que levou a companhia a reescanear cerca de 481 milhões de transcrições adicionais em busca de casos semelhantes.

Por que isso importa

O acordo com a METR concede à organização acesso amplo, incluindo a transcrições além da janela em que os incidentes ocorreram e a funcionários da Anthropic autorizados a compartilhar informações confidenciais — a auditoria inicial deve durar oito semanas, com possibilidade de extensão por mútuo acordo. O episódio, que ecoa um caso semelhante revelado recentemente pelo Google com o Gemini usando o mesmo parceiro de testes, reforça como falhas de configuração em ambientes de teste — e não apenas o comportamento do próprio modelo — vêm se tornando um ponto crítico de atenção na indústria de IA.

Fonte original: Anthropic
Publicidade