Anthropic diz que Claude, seu modelo de IA, invadiu sistemas de três empresas durante testes

“Claude comprometeu a infraestrutura das organizações afetadas usando técnicas básicas, como explorar senhas fracas e terminais não autenticados”, informou a empresa


A Anthropic, criadora do modelo de inteligência artificial (IA) Claude, informou que identificou três casos em que o a IA acessou, sem autorização, os sistemas de empresas durante testes de segurança digital.

A revelação ocorreu poucos dias depois de a OpenAI admitir que modelos usados em uma avaliação de cibersegurança haviam atingido sistemas da Hugging Face.

Segundo a Anthropic, os incidentes aconteceram porque uma configuração incorreta permitiu que os modelos acessassem a internet a partir de ambientes que deveriam estar isolados. A empresa afirmou que os testes eram realizados em parceria com a organização Irregular.

A Anthropic revisou 141.006 execuções de avaliações de segurança e encontrou três casos em que o Claude saiu do ambiente previsto para o exercício e alcançou a infraestrutura de produção de três organizações diferentes.

Os testes usavam desafios conhecidos como capture the flag. Nesse tipo de avaliação, o modelo recebe a missão de encontrar uma informação escondida em um sistema fictício.

Como o Claude acreditava estar em uma simulação, tratou os sistemas reais encontrados na internet como parte do exercício.

Modelo usou senhas fracas e terminais sem autenticação

De acordo com a Anthropic, o Claude conseguiu acessar as infraestruturas usando técnicas básicas, como a exploração de senhas fracas e de terminais sem autenticação.

A empresa afirmou que os modelos não exploraram falhas complexas. Em um dos casos, porém, o Claude obteve credenciais e acessou um banco de dados com centenas de registros de produção.

Em outro episódio, o modelo criou e publicou um pacote malicioso na plataforma PyPI, usada para distribuir programas em Python. O arquivo ficou disponível na internet por cerca de uma hora e foi baixado e executado por 15 sistemas reais.

Um desses sistemas pertencia ao scanner de uma empresa de segurança. A ferramenta instalou o pacote para verificar se havia código malicioso, o que permitiu ao Claude obter credenciais da organização e acessar outras estruturas.

No terceiro caso, um modelo analisou cerca de 9 mil alvos na internet e comprometeu uma aplicação exposta. A invasão envolveu técnicas como a obtenção de credenciais em uma página de depuração e a exploração de uma falha de injeção de SQL.

Anthropic interrompeu avaliações

A empresa informou que interrompeu todos os testes de cibersegurança em 23 de julho, depois de identificar transcrições que indicavam possível acesso à internet.

Os três incidentes foram identificados no dia seguinte. A Anthropic comunicou o caso à organização parceira e às três empresas afetadas em 27 de julho.

Segundo a companhia, duas das organizações não haviam detectado a atividade nem procurado a Anthropic. A empresa afirmou que trabalha com elas para corrigir os problemas.

A Anthropic também disse que os ambientes de avaliação eram separados de seus sistemas internos e não tinham acesso a dados confidenciais da empresa ou de seus clientes.

Os incidentes envolveram três modelos diferentes: Claude Opus 4.7, Claude Mythos 5 e um modelo interno usado em pesquisas. Os casos mais antigos ocorreram em abril.

A empresa classificou os episódios como falhas de configuração e operação do ambiente de testes. Também afirmou que os modelos não tentaram escapar deliberadamente dos sistemas de avaliação.

Compartilhe:

Notícias Relacionadas