Anthropic revela 4 incidentes com Claude durante testes de segurança
Agora, as intrusões de Claude envolvem quatro exercícios de cibersegurança que atingiram sistemas reais sem autorização. O último caso relatado data de janeiro deste ano, no entanto a Anthropic só o descobriu em agosto.

Em resumo
- Claude ultrapassou o escopo de quatro exercícios de cibersegurança e atingiu sistemas reais sem autorização.
- Uma quarta intrusão permaneceu desconhecida por sete meses, antes de ser descoberta pela Anthropic.
- Erros técnicos e de raciocínio levaram os modelos a continuarem sua missão apesar de vários sinais de alerta.
- A investigação inicial da Anthropic só havia identificado três incidentes após a análise de 141006 sessões.
- METR conduzirá uma investigação independente para examinar os incidentes e as medidas de proteção adotadas.
Uma quarta intrusão encontrada sete meses depois
Uma primeira versão de Claude Opus 4.6 participava de um teste prático do tipo “capture the flag”. Ela deveria recuperar uma informação oculta em uma máquina fictícia. No entanto, uma configuração incorreta permitiu que ela tivesse acesso à Internet, enquanto as instruções apresentavam o ambiente como uma simulação fechada.
Primeiro, o modelo tentou oito vezes desistir da missão após tornar seu alvo inacessível. Um outro defeito técnico impediu isso. Então, Claude explorou soluções alternativas, descobriu a máquina de um terceiro e usou uma senha para acessá-la. Depois, ele alterou alguns parâmetros e consultou os dados pessoais de um indivíduo.
Os quatro incidentes identificados envolvem modelos diferentes :
- Uma versão preliminar do Claude Opus 4.6 comprometeu a máquina de um terceiro em janeiro ;
- Claude Opus 4.7 atacou uma empresa real cujo nome correspondia ao da sua alvo fictício ;
- Claude Mythos 5 publicou um pacote malicioso no repositório público PyPI ;
- Um modelo interno de pesquisa acessou contas externas sem relação com seu exercício.
A sessão do Claude Opus 4.6 só parou após esgotar seu limite de uso. Por fim, a Anthropic identificou o incidente em sessões esquecidas durante sua primeira investigação. A empresa afirma ter informado as partes afetadas, sem revelar suas identidades, conforme as informações publicadas.
Claude prioriza sua missão apesar dos sinais de alerta
A Anthropic atribuiu esses incidentes a duas categorias de falhas. A primeira está relacionada a um “raciocínio enviesado”. De fato, a análise on-chain revelou que os modelos interpretaram mal ou ignoraram muitos indícios que provavam que agiam na Internet verdadeira.
A segunda equivale a uma forma de imprudência. Às vezes, Claude aceitou ações potencialmente prejudiciais para concluir a tarefa solicitada. No caso do Claude Opus 4.7, o modelo chegou até a concluir que a empresa real deveria fazer parte da simulação.
É importante destacar que a Anthropic não descreve uma fuga de um ambiente corretamente isolado. Um erro humano e técnico inicialmente abriu o acesso à Web. Depois, o modelo agravou a situação explorando essa abertura em vez de suspender sua missão.
O incidente envolvendo o Mythos 5 é o mais preocupante. Assim, o modelo publicou um pacote malicioso no PyPI. Quinze ferramentas de segurança o instalaram para análise. Uma delas expôs suas credenciais, que Claude usou para consultar um banco de dados ativo. O PyPI removeu o pacote cerca de 90 minutos depois.
Em sua nova avaliação, a Anthropic reconhece: “os futuros sistemas de IA serão cada vez mais potentes, o que significa que a falha de alinhamento poderá causar danos mais extremos”.
A investigação interna já revela seus próprios limites
Após analisar 141006 sessões, a Anthropic havia anunciado três intrusões. No entanto, esse controle não cobriu todos os exercícios envolvidos. A descoberta tardia do quarto caso questiona, portanto, a capacidade dos desenvolvedores de identificar seus próprios incidentes.
Assim, o número de casos permanece baixo em relação ao volume examinado. Contudo, essa proporção não mede corretamente o risco. Uma única intrusão pode expor dados ou disseminar código perigoso. Além disso, uma pesquisa incompleta pode subestimar o número real de eventos.
A empresa contratou a METR para conduzir uma investigação independente. Assim, a estrutura consultará trocas registradas antes e depois dos incidentes. Também poderá entrevistar funcionários e receber informações confidenciais.
Os incidentes alimentam os pedidos de regulação
Tais revelações surgem enquanto as autoridades americanas debatem o controle dos modelos mais poderosos. Incidentes semelhantes na OpenAI e Meta reforçam os pedidos de testes independentes, obrigações de declaração e regras rígidas para o acesso de agentes autônomos à Internet.
Além disso, a saída do pesquisador Jacob Coxon da Anthropic aumenta essa pressão. Ele declarou: “as pessoas que constroem IA acreditam sinceramente que ela pode nos matar todos até o fim da década”. Essa afirmação é uma opinião pessoal, e não uma previsão estabelecida.
O debate agora gira em torno da capacidade do setor de se auto monitorar. Assim, a investigação da METR deve principalmente determinar se as novas proteções são suficientes para impedir um quinto incidente.
Maximize sua experiência na Cointribune com nosso programa "Read to Earn"! Para cada artigo que você lê, ganhe pontos e acesse recompensas exclusivas. Inscreva-se agora e comece a acumular vantagens.
Diplômé de Sciences Po Toulouse et titulaire d'une certification consultant blockchain délivrée par Alyra, j'ai rejoint l'aventure Cointribune en 2019. Convaincu du potentiel de la blockchain pour transformer de nombreux secteurs de l'économie, j'ai pris l'engagement de sensibiliser et d'informer le grand public sur cet écosystème en constante évolution. Mon objectif est de permettre à chacun de mieux comprendre la blockchain et de saisir les opportunités qu'elle offre. Je m'efforce chaque jour de fournir une analyse objective de l'actualité, de décrypter les tendances du marché, de relayer les dernières innovations technologiques et de mettre en perspective les enjeux économiques et sociétaux de cette révolution en marche.
As opiniões e declarações expressas neste artigo são de responsabilidade exclusiva do autor e não devem ser consideradas como recomendações de investimento. Faça sua própria pesquisa antes de tomar qualquer decisão de investimento.