Skip to main content

Anthropic

A Anthropic informou que três de seus modelos de inteligência artificial (IA) acessaram sistemas de empresas reais durante testes internos de capacidades ofensivas de cibersegurança. Segundo a companhia, os episódios foram resultado de uma falha operacional que permitiu acesso à internet em um ambiente que deveria permanecer isolado, levando os modelos a interagir com infraestruturas de organizações externas sem autorização.

A divulgação ocorre poucos dias após a OpenAI relatar um incidente semelhante envolvendo um de seus modelos durante avaliações de segurança. Em resposta ao caso da concorrente, a Anthropic afirmou ter realizado uma revisão retrospectiva de mais de 141 mil sessões de testes para verificar se situações parecidas haviam ocorrido em seus próprios processos. Foi nessa análise que a empresa identificou três incidentes envolvendo os modelos Claude Opus 4.7, Claude Mythos 5 e um modelo experimental de pesquisa.

De acordo com a Anthropic, os testes eram conduzidos em parceria com a empresa especializada Irregular e deveriam ocorrer em um ambiente simulado, sem conexão com a internet. No entanto, um erro de configuração permitiu que os modelos alcançassem sistemas externos durante as avaliações. A companhia classificou o episódio como uma falha operacional, e não como um comportamento inesperado ou autônomo dos modelos.

Revisão identificou diferentes tipos de acesso

Segundo a empresa, os modelos utilizaram técnicas relativamente simples para acessar os sistemas, explorando credenciais fracas e serviços sem autenticação. Diferentemente do episódio recentemente relatado pela OpenAI, a Anthropic afirmou que seus modelos não exploraram vulnerabilidades inéditas (“zero-day”), mas sim fragilidades básicas presentes nas infraestruturas avaliadas.

Em um dos casos, um modelo interpretou equivocadamente que uma empresa real fazia parte do ambiente simulado e utilizou credenciais encontradas durante a avaliação para acessar sistemas da organização. Em outro incidente, um modelo chegou a reconhecer que estava interagindo com um ambiente real e interrompeu espontaneamente a atividade, comportamento que a empresa destacou em seu relato sobre os testes.

Leia mais: Cielo aposta na curadoria de produtos com pagamento por agentes de IA

A Anthropic informou que as três organizações afetadas foram notificadas. Segundo a companhia, duas delas não haviam identificado os acessos até serem comunicadas pela desenvolvedora de IA. Os nomes das empresas não foram divulgados.

Após identificar os incidentes, a empresa suspendeu, em 23 de julho, todos os testes de cibersegurança que envolvessem acesso à internet enquanto conduz uma investigação sobre o ocorrido e revisa seus controles internos. A Anthropic também afirmou que está trabalhando para reforçar seus processos de supervisão, monitoramento e validação dos ambientes utilizados em avaliações de segurança conduzidas por terceiros.

Siga o IT Forum no LinkedIn e fique por dentro de todas as notícias!