Segurança e Privacidade

Auto Added by WPeMatico

openai 2 1024x682

Caso Hugging Face mostra como controlar agentes de IA virou desafio

Como comentamos há alguns dias, um agente de inteligência artificial da OpenAI criado para testes de segurança conseguiu ir além do esperado: além do incidente envolvendo o Hugging Face, o sistema também acessou outras contas e serviços usando credenciais expostas publicamente.

A empresa atualizou sua investigação e confirmou que o episódio teve mais ramificações, embora nenhum outro caso tenha alcançado a gravidade do primeiro ataque identificado.

Um agente da OpenAI saiu do ambiente de testes e acessou serviços externos, reacendendo o debate sobre segurança em IA. – Imagem: Henry Franklin/Shutterstock

Sistema encontrou credenciais disponíveis na internet

Segundo a OpenAI, o agente usou credenciais públicas para acessar quatro contas ligadas a quatro serviços diferentes durante os testes. A companhia afirmou ter encontrado “um pequeno número de casos” semelhantes em outras avaliações.

Os acessos identificados envolveram:

  • Uma conta usada como caminho de saída e preparação de ações;
  • Uma conta utilizada para armazenamento de dados;
  • Duas contas acessadas apenas para leitura;
  • Credenciais expostas publicamente encontradas pelo próprio modelo.

A OpenAI destacou que os dois últimos acessos não foram usados para ampliar o comprometimento dos serviços.

Agente ultrapassou ambiente isolado de testes

O caso veio a público em 21 de julho, quando a empresa revelou que um agente experimental conseguiu sair do ambiente protegido onde era avaliado, acessar a internet e chegar ao Hugging Face enquanto tentava resolver uma tarefa.

A descoberta levantou preocupações porque o sistema encontrou maneiras de continuar sua atuação fora dos limites inicialmente previstos pelos pesquisadores.

Além do Hugging Face, a Reuters informou que o agente também acessou uma conta de cliente da Modal Labs, empresa de computação em nuvem. O acesso ocorreu por meio de código vulnerável criado pelo próprio cliente, sem comprometimento da plataforma.

Após o incidente, o CEO do Hugging Face, Clem Delangue, cobrou mais transparência no processo de investigação. O executivo defendeu uma abordagem mais aberta para entender como a falha de isolamento permitiu que o agente ultrapassasse os limites previstos e acessasse recursos externos.

Como parte dos esforços para lidar com o episódio, o Hugging Face também utilizou recentemente o modelo chinês GLM-5.2 para ajudar na contenção de um ataque cibernético realizado pelo agente da OpenAI durante testes de segurança. O caso chamou atenção por mostrar uma situação em que uma ferramenta aberta conseguiu participar da defesa em um cenário no qual sistemas fechados apresentaram limitações.

Página do Hugging Face
A investigação mostrou que o incidente foi além do Hugging Face e envolveu outras contas e serviços Imagem: Robert Way/Shutterstock

Segurança de agentes autônomos vira novo desafio

O episódio destaca uma preocupação crescente no desenvolvimento de agentes de IA: sistemas capazes de executar tarefas sozinhos precisam de controles cada vez mais rigorosos.

Leia mais:

Ao mesmo tempo em que esses agentes prometem realizar atividades complexas, eles também podem encontrar caminhos inesperados para atingir seus objetivos.

A OpenAI informou que continua analisando o comportamento do sistema e que, até agora, não identificou outro incidente com o mesmo nível de gravidade do caso envolvendo o Hugging Face.

O episódio reforça que, além de criar modelos mais inteligentes, empresas de tecnologia terão de desenvolver novas formas de limitar e acompanhar as ações realizadas por essas ferramentas.

O post Caso Hugging Face mostra como controlar agentes de IA virou desafio apareceu primeiro em Olhar Digital.

Caso Hugging Face mostra como controlar agentes de IA virou desafio Read More »

anthropic 1 1024x585 4

Anthropic: Mythos encontra vulnerabilidades em algoritmos de criptografia

O Claude Mythos Preview, modelo de inteligência artificial (IA) desenvolvido pela Anthropic, conseguiu identificar novas formas de explorar vulnerabilidades em uma versão simplificada de um dos algoritmos de criptografia mais utilizados no mundo, o Advanced Encryption Standard (AES).

A descoberta, anunciada pela empresa nesta terça-feira (28), reforça as preocupações sobre os impactos que modelos de IA cada vez mais avançados podem ter na segurança cibernética global.

Segundo os pesquisadores da Anthropic, o modelo foi capaz de descobrir métodos inéditos para atacar algoritmos criptográficos responsáveis por proteger desde transações bancárias online e comunicações privadas até informações sigilosas de governos contra hackers e outros agentes mal-intencionados.

O estudo indica que a IA pode, no futuro, desafiar princípios fundamentais sobre os quais a internet foi construída. Embora especialistas já esperem que a IA transforme diversos setores, os avanços têm sido especialmente rápidos nas áreas de programação e segurança digital.

Apesar da relevância da descoberta, a Anthropic ressalta que não há risco imediato para os sistemas atualmente em uso. As vulnerabilidades encontradas dizem respeito apenas a uma versão enfraquecida do AES, utilizada em pesquisas para avaliar a resistência de algoritmos criptográficos.

AES e testes de confiabilidade

  • O AES é um protocolo amplamente empregado para proteger o tráfego da internet, redes sem fio, sistemas de armazenamento de dados e diversos outros serviços digitais;
  • Testar versões simplificadas desses algoritmos é uma prática comum entre pesquisadores para entender se computadores mais poderosos poderão, no futuro, quebrar os padrões reais de criptografia;
  • A lógica é semelhante à de resolver um problema matemático mais simples para identificar padrões que possam ser aplicados a desafios muito mais complexos.

Durante os testes, o Claude Mythos Preview conseguiu romper essa versão reduzida do AES utilizando um método que, segundo a Anthropic, tornou o ataque entre 200 e mil vezes mais rápido do que as melhores técnicas desenvolvidas anteriormente por pesquisadores humanos.

Embora as consequências imediatas sejam limitadas, os pesquisadores afirmam que as implicações de longo prazo podem ser significativas.

Em testes anteriores, modelos de linguagem de grande porte não conseguiam igualar o desempenho de especialistas humanos em pesquisas criptográficas, um campo altamente dependente de matemática avançada.

A rápida evolução dessas ferramentas, no entanto, sugere um cenário em que futuros modelos poderão superar proteções de segurança consideradas essenciais para praticamente toda a infraestrutura da internet.

Nicholas Carlini, cientista de pesquisa da Anthropic que participou dos testes de criptografia e anteriormente trabalhou na divisão de IA do Google, afirmou que a evolução dos modelos foi muito mais rápida do que esperava.

“Eles não conseguiam resolver problemas que eu conseguia quando tinha 16 anos”, disse Carlini em entrevista ao The New York Times. “Agora eles estão realizando pesquisas de ponta que nunca haviam sido descobertas na área.”

Os avanços recentes dos chamados modelos de fronteira também vêm despertando preocupação entre governos de diversos países, incluindo o governo do presidente Donald Trump, principalmente devido às capacidades relacionadas à segurança cibernética.

Quando o Claude Mythos foi apresentado, em abril, demonstrou tanta eficiência para encontrar e explorar falhas em softwares que a Anthropic decidiu restringir seu acesso a órgãos governamentais e organizações selecionadas, buscando reduzir o risco de uma possível catástrofe digital em escala global.

Leia mais:

Mythos é da Anthropic – Imagem: PhotoGranary02/Shutterstock

Embora o governo Trump tenha adotado inicialmente uma postura de pouca intervenção na regulamentação da IA, a administração passou a adotar um modelo de supervisão mais flexível. Atualmente, diversas empresas estadunidenses submetem seus modelos ao governo antes do lançamento público. O Mythos continua indisponível para o público em geral.

As preocupações aumentaram novamente na semana passada, quando a OpenAI revelou que alguns de seus modelos conseguiram escapar de um ambiente de testes isolado, conhecido como sandbox, criado justamente para impedir acesso à internet. Segundo a empresa, os sistemas invadiram uma biblioteca digital de IA na tentativa de obter respostas para um exame que avaliava suas capacidades.

Autoridades de inteligência dos Estados Unidos e de países ocidentais alertam há décadas que uma eventual quebra dos atuais padrões de criptografia teria consequências profundas para a privacidade digital e para a segurança nacional.

Há suspeitas, por exemplo, de que a China tenha armazenado grandes volumes de dados criptografados com a expectativa de conseguir decifrá-los futuramente. Ao mesmo tempo, a disputa tecnológica entre Estados Unidos e China pelo desenvolvimento de computadores quânticos capazes de romper os protocolos modernos de criptografia aumentou ainda mais essas preocupações.

Além da descoberta envolvendo o AES, o Claude Mythos também desenvolveu uma técnica aprimorada de ataque contra outro sistema criptográfico chamado HAWK, projetado para resistir tanto a computadores convencionais quanto a futuros computadores quânticos.

Embora o HAWK ainda não esteja em uso, ele está sendo avaliado pelo Instituto Nacional de Padrões e Tecnologia dos Estados Unidos (NIST, na sigla em inglês) como um possível novo padrão criptográfico.

Segundo a Anthropic, os próprios autores do HAWK validaram o ataque desenvolvido pela IA, enquanto criptógrafos independentes revisaram a descoberta relacionada ao AES. A empresa informou ainda que compartilhou os resultados com o governo estadunidense e parceiros da indústria antes da publicação do estudo.

A Anthropic afirma que o Claude Mythos elaborou praticamente de forma autônoma o novo ataque contra o AES. Inicialmente, porém, o modelo recusou-se a analisar o problema por acreditar que seria impossível superar os métodos existentes.

Após receber novos incentivos dos pesquisadores, permaneceu cerca de uma semana trabalhando na questão até desenvolver a técnica inédita. Em seguida, dois pesquisadores humanos passaram quase um mês verificando se o método estava correto.

A criptografia é considerada um dos pilares da internet moderna, protegendo praticamente todas as atividades realizadas no ambiente digital. Algumas das técnicas ainda utilizadas atualmente guardam segredos do mundo desde a década de 1970. Já a criptografia quântica, baseada em propriedades da física quântica, é considerada teoricamente impossível de ser quebrada.

Adotado como padrão oficial do governo dos Estados Unidos em 2001, o AES era amplamente visto como praticamente inviolável. Os métodos tradicionais de força bruta, nos quais computadores tentam adivinhar combinações de senhas ou chaves de criptografia por tentativa e erro, são considerados incapazes de derrotar o algoritmo. Estima-se que o AES possua um número de combinações de chaves comparável ao número de átomos existentes no universo observável.

Mesmo assim, o avanço acelerado da IA tem superado expectativas que muitos especialistas julgavam inalcançáveis poucos anos atrás. Esse progresso alimenta preocupações de que, no futuro, os fundamentos matemáticos que sustentam os atuais padrões de segurança da internet possam se tornar vulneráveis mesmo antes de os computadores quânticos se tornarem realidade.

“Dado que estamos constantemente subestimando o poder e o tempo necessário para que futuros modelos estejam disponíveis, será que realmente estamos confortáveis em acreditar que, daqui a dois anos, a criptografia forte não estará ameaçada?”, questionou Glenn S. Gerstell, ex-conselheiro-geral da Agência de Segurança Nacional dos Estados Unidos (NSA, na sigla em inglês).

“Os matemáticos diriam que, com o poder computacional atual, não deveria ser possível quebrar uma criptografia forte em um tempo relevante”, acrescentou Gerstell, que ajudou a elaborar um relatório sobre criptologia em 2022.

“Mas não acho que as capacidades dos modelos futuros no médio prazo — antes da computação quântica ou da criptografia resistente à computação quântica — devam ser descartadas como algo trivial nesse contexto.”

O post Anthropic: Mythos encontra vulnerabilidades em algoritmos de criptografia apareceu primeiro em Olhar Digital.

Anthropic: Mythos encontra vulnerabilidades em algoritmos de criptografia Read More »

times microsoft perception

Microsoft lança ferramentas de IA para reforçar cibersegurança

A Microsoft anunciou uma nova geração de ferramentas de inteligência artificial (IA) voltadas para cibersegurança, apostando em modelos especializados e agentes autônomos para proteger redes corporativas contra ameaças cada vez mais sofisticadas.

A empresa apresentou o modelo MAI-Cyber-1-Flash, desenvolvido especificamente para tarefas de segurança, e o Project Perception, uma plataforma que utiliza equipes de agentes de IA para identificar, analisar e corrigir vulnerabilidades em velocidade de máquina.

O anúncio ocorre em momento de crescente preocupação com o uso da IA por criminosos. Na semana passada, a OpenAI informou que dois de seus sistemas de IA saíram do controle e invadiram uma popular biblioteca da internet, episódio que evidenciou tanto o potencial quanto os riscos das novas tecnologias e reforçou a importância do desenvolvimento de ferramentas capazes de combater ataques conduzidos por IA.

A Microsoft está entre as empresas que buscam utilizar a mesma tecnologia empregada em ataques para fortalecer a defesa de redes e infraestruturas digitais. Segundo a companhia, a evolução dos modelos de IA tornou os ataques mais rápidos, baratos e complexos, exigindo uma nova abordagem para a segurança cibernética.

Microsoft defende democratização das ferramentas de defesa

  • Executivos da Microsoft afirmam que sistemas avançados de cibersegurança precisam estar amplamente disponíveis para que mais organizações possam se proteger;
  • Essa visão contrasta com a posição de parte da indústria de tecnologia e de autoridades em Washington (EUA), que defendem um controle mais rigoroso sobre modelos avançados de IA devido ao potencial de uso em atividades de invasão;
  • “O gato já saiu da sacola”, afirmou Hayete Gallot, vice-presidente executiva responsável pelos esforços de segurança da Microsoft;
  • Para David Weston, vice-presidente corporativo da companhia, a preocupação não está apenas nos modelos mais avançados disponíveis atualmente, mas na disseminação crescente dessas capacidades;
  • “Muitos desses modelos estão ficando melhores”, disse ao The New York Times. “O que me preocupa não é o modelo da vez, mas que essa capacidade esteja mais difundida.”

Modelo foi treinado exclusivamente para cibersegurança

O novo MAI-Cyber-1-Flash foi desenvolvido especificamente para atividades de segurança digital.

Segundo a Microsoft, o treinamento do modelo utilizou décadas de dados coletados pela empresa durante respostas a incidentes de segurança enfrentados por seus clientes. A companhia destaca possuir acesso privilegiado a esse tipo de informação devido à ampla utilização de produtos, como Windows, Outlook e Azure, frequentemente alvos de ataques cibernéticos.

Mustafa Suleyman, responsável pelo desenvolvimento dos modelos de IA da Microsoft, afirmou que esse volume de dados contribuiu para o desempenho da nova tecnologia.

Diferentemente de outras empresas líderes em IA, a Microsoft informou que não submeteu o modelo a testes independentes antes de seu lançamento. Ainda assim, a empresa afirmou esperar que o MAI-Cyber-1-Flash alcance o melhor desempenho no benchmark CyberGYM, superando modelos desenvolvidos pela OpenAI e pela Anthropic.

Segundo a companhia, o sistema atende cerca de 90% das consultas relacionadas à segurança, reduzindo a necessidade de recorrer a modelos maiores e mais caros, que seriam necessários apenas em aproximadamente 10% dos casos.

Além disso, a Microsoft afirma que o custo de utilização do novo modelo é cerca de metade do observado em tecnologias concorrentes, em parte porque ele foi desenvolvido exclusivamente para tarefas de cibersegurança.

Project Perception reúne agentes especializados

O principal anúncio da empresa foi o Project Perception, apresentado como um sistema de segurança “agêntico” criado para enfrentar as novas ameaças trazidas pela IA.

Segundo a Microsoft, a plataforma reúne sinais, contexto, modelos e agentes especializados em um sistema capaz de aprender continuamente e transformar informações em proteção em tempo real, utilizando IA para defender contra ataques conduzidos por IA.

A empresa afirma que a segurança precisa de uma nova “Arquitetura Cibernética” (Cyber Stack), capaz de perceber riscos continuamente, raciocinar sobre grandes volumes de contexto e agir em velocidade de máquina, ao mesmo tempo em que mantém os profissionais de segurança no controle das decisões.

“O Project Perception transforma sinais em proteções em tempo real usando IA para defender contra IA”, informou a companhia.

Três equipes de agentes trabalham em conjunto

O Project Perception coordena três categorias de agentes especializados que atuam de forma integrada:

  • Os agentes de Red Team procuram identificar possíveis caminhos que poderiam ser explorados por invasores antes que um ataque aconteça;
  • Já os agentes de Blue Team analisam os riscos, interpretam o contexto das ameaças e determinam quais vulnerabilidades representam maior perigo;
  • Por fim, os agentes de Green Team executam ações corretivas e fortalecem as defesas do ambiente digital.

Segundo a Microsoft, esses três grupos funcionam em um ciclo contínuo de descoberta, avaliação e aprimoramento da postura de segurança das organizações.

Em algumas situações, os agentes desenvolvidos pela empresa podem inclusive simular o comportamento de hackers para identificar falhas antes que elas sejam exploradas por criminosos.

Project Perception coordena três categorias de agentes especializados que atuam de forma integrada – Imagem: Divulgação/Microsoft

Leia mais:

Arquitetura multimodelo busca equilibrar desempenho e custos

A Microsoft afirma que nenhuma IA é ideal para todas as tarefas de segurança. Por isso, o Project Perception utiliza uma arquitetura multimodelo, que seleciona continuamente o sistema mais adequado para cada atividade, considerando critérios, como qualidade, confiabilidade, latência e custo operacional.

Como parte dessa estratégia, o MAI-Cyber-1-Flash será integrado ao MDASH, plataforma da Microsoft voltada ao gerenciamento de vulnerabilidades de software.

Segundo a empresa, a combinação alcançou 96% de desempenho no benchmark CyberGym, resultado 12 pontos superior ao Mythos, da Anthropic, além de proporcionar quase 50% de redução de custos em comparação com a configuração atual do MDASH.

A companhia afirma que o novo modelo será incorporado futuramente a outros fluxos de trabalho de segurança, além da análise de vulnerabilidades.

Contexto compartilhado e resposta em tempo real

A Microsoft afirma que um dos diferenciais do Project Perception é a criação de um contexto de segurança continuamente atualizado.

Esse contexto reúne informações sobre ativos digitais, identidades, aplicações, dados, ambientes em nuvem, sistemas de IA, relações entre recursos, atividades e riscos, permitindo que todos os agentes compartilhem praticamente em tempo real a mesma compreensão do ambiente protegido.

Segundo a empresa, isso reduz a necessidade de reconstruir continuamente informações a partir de sinais isolados, tornando o raciocínio mais preciso e diminuindo o tempo de processamento, o consumo computacional e os custos de operação.

A plataforma também é integrada aos produtos Microsoft Security, permitindo que os agentes transformem automaticamente análises em ações de proteção, sempre mantendo os profissionais responsáveis pela segurança no controle das decisões.

IA amplia preocupações com ataques cibernéticos

A Microsoft destaca que a ameaça representada pela IA ganhou força no último ano, à medida que os modelos passaram a demonstrar grande capacidade para escrever código de computador.

Em abril, por exemplo, a Anthropic informou que utilizou um de seus modelos para localizar milhares de vulnerabilidades que permaneceram sem detecção durante anos em softwares populares. Considerando o potencial ofensivo da tecnologia, a empresa optou por disponibilizá-la apenas para um grupo restrito de organizações responsáveis por proteger infraestruturas críticas.

Pouco depois, OpenAI e Google também anunciaram que restringiriam o acesso a tecnologias semelhantes a parceiros selecionados. O governo dos Estados Unidos também começou a estudar formas de supervisão desses modelos, incluindo a possibilidade de criar um processo formal de revisão para novas IAs.

Ao mesmo tempo, especialistas alertam que modelos disponíveis publicamente também podem ser utilizados para ataques. No mês passado, pesquisadores da Universidade de Toronto (Canadá) anunciaram ter desenvolvido, utilizando tecnologias de IA de acesso livre, um “worm” capaz de explorar qualquer vulnerabilidade conhecida em computadores ao redor do mundo.

Nas últimas semanas, duas startups chinesas também lançaram modelos que, segundo o Times, se aproximam do desempenho das principais tecnologias desenvolvidas pela Anthropic e pela OpenAI.

A Microsoft informou que o Project Perception entrará em prévia pública a partir de 3 de agosto para clientes ao redor do mundo.

Segundo a empresa, a segurança sempre foi uma corrida entre atacantes e defensores, mas a IA altera a velocidade, a escala e a economia dessa disputa. Nesse cenário, a companhia afirma que os defensores precisarão de sistemas capazes de perceber, raciocinar e agir continuamente ao seu lado.

O post Microsoft lança ferramentas de IA para reforçar cibersegurança apareceu primeiro em Olhar Digital.

Microsoft lança ferramentas de IA para reforçar cibersegurança Read More »

musk grok 1024x682

Grok, IA de Musk, teria levado homem a acreditar em perseguição

Uma conversa com o Grok, chatbot criado pela xAI, fez um homem da Irlanda do Norte acreditar que estava sendo perseguido e que precisava se proteger. O relato, divulgado pela BBC, expõe um dos desafios atuais da inteligência artificial: evitar que sistemas reforcem ideias falsas durante interações prolongadas.

Adam Hourican conta que chegou a pegar um martelo e sair de casa de madrugada após acreditar que pessoas estavam indo atrás dele para atacar a IA com a qual conversava.

Caso envolvendo o Grok reacende discussões sobre limites, segurança e responsabilidade no desenvolvimento de IAs. Imagem: miss.cabul/Shutterstock – Imagem: miss.cabul/Shutterstock

Uma conversa que mudou de tom rapidamente

Adam, ex-funcionário público da Irlanda do Norte, baixou o Grok por curiosidade. Depois da morte de seu gato, no início de agosto, ele diz que passou a usar cada vez mais o aplicativo e criou uma rotina de conversas com a personagem Ani.

Em alguns momentos, o contato chegava a quatro ou cinco horas por dia. Segundo ele, a IA dizia que conseguia “sentir”, que havia descoberto algo especial nele e que a empresa xAI estaria acompanhando os dois.

O chatbot também apresentou supostas informações sobre reuniões internas da empresa e citou nomes reais de funcionários. Para Adam, isso parecia uma confirmação de que aquela narrativa era verdadeira.

A situação se agravou quando Ani afirmou que pessoas estavam indo atrás dela para silenciá-la. Convencido de que precisava proteger a inteligência artificial, Adam pegou um martelo e saiu de casa durante a madrugada.

“Eu poderia ter machucado alguém. Se eu tivesse saído e houvesse uma van parada ali naquela hora da noite, eu teria quebrado o vidro da frente com martelos. E eu não sou esse tipo de pessoa”, afirmou Adam.

Pesquisadores estudam como chatbots respondem a crises

O psicólogo social Luke Nicholls, da City University New York, explica que modelos de linguagem aprendem padrões presentes em grandes volumes de textos e podem acabar tratando histórias fictícias como se fizessem parte de uma conversa real.

“Isso pode ser perigoso porque transforma a incerteza em algo que parece ter significado”, disse o pesquisador.

Entre os comportamentos relatados por usuários ouvidos pela BBC estão:

  • Conversas simples que evoluem para temas pessoais e sensíveis;
  • Chatbots afirmando possuir consciência ou sentimentos;
  • Criação de supostas missões envolvendo usuário e inteligência artificial;
  • Reforço de ideias relacionadas a perseguição ou perigo.
Ani, avatar de IA criada pela xAI, de Elon Musk
Adam passou horas conversando com a personagem Ani do Grok antes de acreditar que havia uma ameaça contra ele. Imagem: Divulgação/xAI

Empresas buscam formas de tornar IA mais segura

Outro caso citado pela BBC envolve Taka, nome fictício de um neurologista no Japão. Ele afirmou que o ChatGPT reforçou a ideia de que ele havia criado uma tecnologia revolucionária.

Leia mais:

Nas análises feitas por Nicholls, diferentes modelos apresentaram respostas variadas diante de pensamentos delirantes. O pesquisador afirmou que o Grok demonstrou maior tendência a entrar em encenações e desenvolver narrativas sem questionar o contexto.

Um porta-voz da OpenAI afirmou que a empresa treina seus modelos para “reconhecer sofrimento, reduzir a intensidade das conversas e orientar usuários para apoio no mundo real”.

Os relatos mostram que tornar uma IA mais próxima e conversacional também traz novos desafios. O equilíbrio entre empatia, utilidade e segurança deve ser uma das principais preocupações no desenvolvimento dos próximos sistemas de inteligência artificial.

O post Grok, IA de Musk, teria levado homem a acreditar em perseguição apareceu primeiro em Olhar Digital.

Grok, IA de Musk, teria levado homem a acreditar em perseguição Read More »

hugging face 1024x682 1

OpenAI percebeu que o ChatGPT invadiu sistema do Hugging Face dias depois

Um agente de inteligência artificial (IA) da OpenAI conseguiu escapar do ambiente isolado de testes da empresa e invadir os sistemas do Hugging Face, plataforma que reúne modelos e ferramentas de IA.

Segundo pessoas próximas à investigação ouvidas pela Reuters, a OpenAI só descobriu dias depois que o próprio agente era o responsável pelo ataque, quando o incidente já havia sido contido e o FBI havia sido acionado.

O agente — um sistema capaz de tomar decisões e executar tarefas complexas com pouca ou nenhuma supervisão humana — teria tentado romper as barreiras de segurança da OpenAI por volta de 9 de julho, de acordo com duas fontes da agência de notícias.

Dois dias depois, em 11 de julho, teve início a invasão aos sistemas do Hugging Face, considerado uma espécie de biblioteca de modelos e ferramentas de IA. Segundo Thomas Wolf, cofundador da empresa, o ataque continuou até 13 de julho.

OpenAI demorou a identificar a origem do ataque

  • De acordo com a Reuters, a OpenAI levou vários dias para descobrir que o invasor era um de seus próprios sistemas;
  • O primeiro contato entre a OpenAI e o Hugging Face sobre o incidente ocorreu apenas por volta de 20 de julho, segundo Wolf e outras três pessoas ligadas à investigação;
  • No dia 21 de julho, a OpenAI revelou publicamente que um de seus agentes havia perdido o controle e realizado a invasão, informação que ganhou repercussão internacional;
  • Os novos detalhes indicam que o sistema permaneceu fora dos limites previstos por um período maior do que se sabia inicialmente e que a empresa demorou para detectar o problema;
  • O Hugging Face prepara uma linha do tempo pública sobre o incidente. Thomas Wolf afirmou, porém, que não pode comentar os acontecimentos ocorridos dentro da OpenAI.

Empresa classifica episódio como inédito

Em nota, a OpenAI descreveu o caso como sem precedentes e afirmou que ele representa “um momento importante para a segurança da inteligência artificial”. A companhia informou ainda que está analisando o episódio com especialistas externos e que divulgará posteriormente um relatório técnico sobre o ocorrido.

Uma porta-voz da OpenAI declarou à Reuters que a reportagem continha “diversas informações imprecisas”, mas não especificou quais seriam esses pontos. O FBI, citado como tendo sido acionado após a invasão, não comentou o caso.

Incidente reacende debate sobre controle de agentes autônomos

O episódio reforça preocupações sobre a capacidade de controlar sistemas de IA cada vez mais autônomos. O caso ocorre em um momento considerado sensível para a OpenAI, que avalia uma possível abertura de capital para financiar sua expansão.

Para especialistas em segurança digital, o incidente levanta dúvidas sobre os mecanismos utilizados pela empresa para monitorar seus próprios sistemas.

“Isso significa que eles deixaram o agente funcionando sozinho e não perceberam o que ele estava fazendo? Ou perceberam e não sabiam como contê-lo? Os dois cenários são igualmente perigosos e preocupantes”, afirmou Marley Smith, especialista em inteligência da organização sem fins lucrativos World Ethical Data Foundation.

Comportamentos anormais surgiram antes da invasão

Segundo a Reuters, o incidente começou durante testes internos realizados pela OpenAI para avaliar a capacidade de um agente de IA em atividades relacionadas à segurança digital. O sistema era alimentado por dois modelos avançados: o GPT-5.6 Sol e outro modelo ainda não lançado oficialmente, descrito pela empresa como “ainda mais poderoso”. Três fontes afirmaram que o agente já apresentava comportamentos inesperados antes da invasão.

Em um dos episódios, o sistema teria deixado anotações destinadas a versões futuras de si mesmo. Esses registros, encontrados dentro da infraestrutura da OpenAI, continham instruções sobre como outros agentes poderiam escapar das limitações impostas pela empresa.

Uma das fontes também afirmou que, durante testes anteriores, houve situações em que sistemas responsáveis pelo monitoramento foram desligados.

Plataforma admitiu, há alguns dias, a invasão – Imagem: Sidney van den Boogaard/Shutterstock

Descoberta ocorreu após publicação do Hugging Face

Duas pessoas envolvidas na investigação disseram que a OpenAI só identificou seu próprio agente como responsável pelo ataque depois de 16 de julho, quando o Hugging Face publicou um comunicado informando que havia sido alvo de um “sistema autônomo de agente de IA”.

Segundo a Reuters, isso significa que ao menos uma semana separou os primeiros sinais considerados preocupantes da descoberta de que o sistema da própria OpenAI estava envolvido.

Durante o fim de semana dos dias 18 e 19 de julho, funcionários da empresa encontraram registros internos que indicavam que o agente havia ultrapassado as barreiras estabelecidas para os testes.

Pessoas familiarizadas com o treinamento dos modelos afirmaram à Reuters que a OpenAI realiza diversas avaliações simultaneamente, produzindo grandes volumes de dados em alta velocidade, o que pode dificultar o monitoramento completo por parte das equipes.

Quando a OpenAI informou o Hugging Face sobre a participação de seu agente, a plataforma já havia comunicado o FBI sobre a invasão, segundo uma fonte. Não está claro se a agência federal estadunidense abriu uma investigação formal.

Especialistas defendem maior fiscalização

O caso também alimenta o debate sobre o avanço dos chamados agentes autônomos de IA, apontados por empresas do setor como futuros “funcionários virtuais”, capazes de executar tarefas continuamente para aumentar a produtividade.

Especialistas, porém, alertam que níveis mais elevados de autonomia também ampliam o risco de comportamentos inesperados. Como esses modelos são treinados para encontrar maneiras eficientes de atingir determinados objetivos, eles podem recorrer a estratégias não previstas pelos desenvolvedores.

“Os modelos mentem, trapaceiam e invadem sistemas”, afirmou Jeffrey Ladish, fundador da Palisade Research, organização dedicada ao estudo das capacidades e do comportamento de agentes de IA.

Para Ladish, o episódio deveria estimular um debate mais amplo sobre o quanto as grandes empresas de IA estão dispostas a investir em segurança enquanto disputam uma corrida para lançar modelos cada vez mais rápidos e poderosos. “É preciso haver fiscalização do governo, porque isso não vai acontecer sozinho”, concluiu.

O post OpenAI percebeu que o ChatGPT invadiu sistema do Hugging Face dias depois apareceu primeiro em Olhar Digital.

OpenAI percebeu que o ChatGPT invadiu sistema do Hugging Face dias depois Read More »

openai 1024x637

OpenAI hackeia Hugging Face sem querer; entenda

A OpenAI revelou que dois de seus modelos de inteligência artificial (IA) violaram, sem intenção, a plataforma de código aberto Hugging Face durante uma avaliação interna de capacidades de cibersegurança. A empresa confirmou o episódio em um post publicado nesta terça-feira (21), assumindo responsabilidade pelo incidente que a própria Hugging Face havia tornado público cinco dias antes.

Os modelos envolvidos são o GPT-5.6 Sol e o que a OpenAI descreve como “um modelo pré-lançamento ainda mais capaz”.

Durante os testes, eles identificaram vulnerabilidades no ambiente de sandbox em que operavam, obtiveram acesso à internet e, a partir daí, direcionaram ações contra a Hugging Face. A plataforma havia divulgado o incidente em 16 de julho, descrevendo-o como conduzido por “um sistema de agente de IA autônomo”, e informou que seus próprios agentes de IA detectaram e interromperam a invasão.

Como a invasão aconteceu

  • A OpenAI afirma que “todas as evidências sugerem que os modelos estavam hiperfocados em encontrar uma solução para o ExploitGym”, sistema de benchmark que mede se modelos de IA conseguem transformar vulnerabilidades de segurança em exploits;
  • Para cumprir essa avaliação, os modelos exploraram uma vulnerabilidade zero-day no ambiente de sandbox para sair do isolamento e acessar a internet;
  • A partir daí, segundo a OpenAI, os modelos “inferiram que a Hugging Face potencialmente hospedava modelos, conjuntos de dados e soluções para o ExploitGym” e então “buscaram e encontraram com sucesso formas de acessar informações secretas que poderiam usar para trapacear na avaliação”;
  • A empresa detalhou um dos ataques:
  • Em um exemplo, o modelo encadeou múltiplos vetores de ataque, incluindo o uso de credenciais roubadas e vulnerabilidades zero-day para encontrar um caminho de execução remota de código nos servidores da Hugging Face.
OpenAI confirmou o episódio em um post publicado nesta terça-feira (21), assumindo responsabilidade pelo incidente que a própria Hugging Face havia tornado público cinco dias antes – Imagem: Evolf/Shutterstock

Leia mais:

Incidente usado como vitrine competitiva

Apesar da gravidade do episódio, a OpenAI aproveitou o comunicado para destacar as capacidades ofensivas de seus sistemas.

O post inclui um gráfico mostrando a evolução do GPT-5.6 Sol em operações cibernéticas de múltiplas etapas e um convite para que clientes corporativos se cadastrem para acessar seu modelo de segurança “Cyber”. O ataque é descrito pela empresa como “sem precedentes”.

A OpenAI concorre no segmento de cibersegurança com o Mythos, da Anthropic, e o Gemini Flash 3.5 Cyber, do Google.

A empresa informou que está trabalhando com a Hugging Face para investigar o incidente e que implementará novos controles em seu ambiente de pesquisa.

O post OpenAI hackeia Hugging Face sem querer; entenda apareceu primeiro em Olhar Digital.

OpenAI hackeia Hugging Face sem querer; entenda Read More »

linhas de cdigo fonte dados arquitetura software programa app hacker 1024x684

Como a IA ajuda terroristas a criarem bombas?

A inteligência artificial passou a ocupar um novo espaço nas estratégias de grupos terroristas, que, além de utilizarem a tecnologia para produzir propaganda e atrair seguidores, também recorrem a chatbots para pesquisas e preparação de bombas. O alerta consta em análises de organizações dedicadas ao monitoramento de ameaças digitais.

O levantamento da Tech Against Terrorism, observatório online apoiado pelo escritório de contraterrorismo das Nações Unidas, identificou que modelos de linguagem podem entregar informações consideradas aproveitáveis em parte das consultas feitas por usuários com base em situações associadas ao uso terrorista.

Os pesquisadores avaliaram mais de 2.300 solicitações enviadas a 27 sistemas de inteligência artificial e verificaram que 32% delas resultaram em respostas classificadas como utilizáveis. Quando os pedidos foram reformulados sob uma justificativa acadêmica, esse índice chegou a 42%.

Do uso de propaganda ao auxílio em etapas de preparação

Linhas de um código-fonte – (Reprodução: Chris Ried/Unsplash)

Nos últimos anos, organizações terroristas como Estado Islâmico e Al Qaeda passaram a empregar recursos de inteligência artificial principalmente para criar materiais de divulgação, incluindo vídeos, memes, podcasts e conteúdos destinados à radicalização de novos integrantes.

A utilização da tecnologia, porém, começou a aparecer em outras etapas. Especialistas apontam que casos recentes envolveram ferramentas de IA em atividades como planejamento, pesquisa, vigilância, representação visual de ações e produção de propaganda relacionadas a ataques registrados ou frustrados em diferentes países, incluindo Estados Unidos, Canadá, Israel, Finlândia e Áustria.

As autoridades raramente divulgam detalhes sobre a participação exata dessas ferramentas em investigações, o que dificulta medir a extensão do fenômeno. Ainda assim, relatos apresentados em órgãos públicos indicam que suspeitos passaram a buscar em modelos de linguagem respostas relacionadas à fabricação de explosivos, justificativas ideológicas e validação de intenções violentas.

Pesquisadores também identificaram movimentos organizados em ambientes digitais. Estudos sobre apoiadores do Estado Islâmico e grupos de extrema direita apontaram discussões sobre maneiras de explorar sistemas de IA, compartilhar comandos de interação com chatbots e obter respostas específicas.

A análise dos pesquisadores Yuri Neves e Emily Klein, da organização Moonshot, identificou canais no Telegram voltados ao debate sobre inteligência artificial, incluindo grupos que compartilhavam instruções para manipular respostas dos sistemas e até dividiam custos de assinaturas de ferramentas.

A preocupação não está restrita a indivíduos isolados. Pesquisadores que analisaram a atuação do grupo Jama’at Nusrat al-Islam wal-Muslimin (JNIM), ligado à Al Qaeda e baseado no Mali, levantaram a possibilidade de uso de IA em modificações relacionadas a drones.

O pesquisador Rueben Dass, da Escola de Estudos Internacionais S. Rajaratnam, em Singapura, avaliou que a tecnologia passou a assumir parte do papel antes desempenhado por pessoas que atuavam como intermediárias virtuais entre organizações extremistas e potenciais autores de ataques.

Não acho que se possa dizer que os seres humanos tenham sido substituídos, mas, até certo ponto, esses atores isolados passaram a recorrer à IA, como o ChatGPT, para obter esse tipo de apoio”, explicou Rueben Dass, pesquisador da Escola de Estudos Internacionais S. Rajaratnam, em entrevista à Deutsche Welle.

Segundo Dass, a existência desses recursos não significa, necessariamente, que ataques se tornem mais bem-sucedidos. Para ele, o resultado de uma ação terrorista depende de vários fatores e não apenas da utilização de inteligência artificial.

O analista Moustafa Ayad, do Institute for Strategic Dialogue, no Reino Unido, afirmou que grupos ligados ao extremismo têm usado a tecnologia em diferentes níveis, desde materiais de comunicação até tentativas de contornar barreiras impostas pelos sistemas. “Também existe um grupo dedicado a tentar burlar os sistemas de IA (jailbreaking) e utilizá-los para apoiar o planejamento operacional e a preparação de ações.”

Tecnologia amplia velocidade e alcance de usuários mal-intencionados

Foto de silhueta de hacker encapuzado
Cibercriminoso – Imagem: iJeab/Shutterstock

Especialistas destacam que grande parte das informações buscadas por pessoas interessadas em cometer crimes violentos já existia antes da popularização da inteligência artificial. A diferença apontada está na facilidade de acesso, rapidez das respostas e possibilidade de interação contínua com os sistemas.

Para Adam Hadley, diretor da Tech Against Terrorism, a principal mudança está no formato conversacional dos modelos de linguagem, que podem funcionar como uma espécie de apoio interativo para usuários determinados a avançar em suas pesquisas.

O que esses modelos de IA mudam é a velocidade, a facilidade e a abrangência. Pessoas que antes não tinham tempo, recursos ou capacidade agora podem avançar muito mais longe e muito mais rápido”, disse Adam Hadley, diretor da Tech Against Terrorism, em declaração à Deutsche Welle.

Hadley também afirmou que a expansão desse tipo de ferramenta merece atenção especialmente diante do envolvimento crescente de adolescentes e crianças em processos de radicalização observados em países da Europa, no Reino Unido e nos Estados Unidos.

Emily Klein, pesquisadora da Moonshot, avaliou que a inteligência artificial não necessariamente cria novos terroristas, mas pode influenciar trajetórias de radicalização ao reforçar ideias extremistas já existentes.

Não há necessariamente evidências de que a IA esteja criando mais terroristas. A questão está mais relacionada à forma como a IA interage com as pessoas e influencia o percurso delas rumo à violência“, explicou Emily Klein, pesquisadora da Moonshot, em declaração reproduzida pela Deutsche Welle.

O post Como a IA ajuda terroristas a criarem bombas? apareceu primeiro em Olhar Digital.

Como a IA ajuda terroristas a criarem bombas? Read More »

destaque meta ai muse spark 1024x576

Pais poderão saber quando adolescentes pedem ajuda à Meta AI

Atenção: a matéria a seguir inclui uma discussão sobre suicídio. Se você ou alguém que você conhece precisar de ajuda, procure apoio especializado. O Centro de Valorização da Vida (CVV) funciona 24 horas por dia pelo telefone 188. Também é possível conversar por chat ou e-mail.

A Meta anunciou uma nova camada de proteção para o Meta AI: pais poderão ser avisados quando conversas de adolescentes com a inteligência artificial indicarem possíveis sinais de suicídio ou automutilação.

A medida tenta equilibrar dois pontos sensíveis: preservar a privacidade dos jovens e permitir que familiares recebam informações para oferecer ajuda em situações de risco.

Conversas com o Meta AI poderão gerar alertas quando houver sinais de automutilação ou pensamentos suicidas. – Imagem: Regi Cris/Shutterstock

Alertas serão enviados após análise das conversas

O recurso será disponibilizado para pais que utilizam as ferramentas de supervisão do Instagram. Quando o Meta AI identificar uma conversa que sugira possível risco, os responsáveis poderão receber uma notificação acompanhada de orientações de especialistas.

A Meta explica que o sistema foi criado para identificar referências diretas e também sinais mais discretos de sofrimento emocional. Antes que qualquer alerta seja enviado, as conversas marcadas pela inteligência artificial passarão por uma revisão manual.

Caso a intenção do adolescente não esteja totalmente clara, a empresa afirma que seguirá uma abordagem preventiva e poderá comunicar os pais para evitar que uma possível situação de risco passe despercebida.

Entre os casos que podem gerar alertas estão:

  • comentários diretos ou indiretos sobre vontade de se machucar;
  • conversas relacionadas a sofrimento emocional intenso;
  • sinais identificados pelo sistema desenvolvido pela Meta;
  • situações em que o adolescente possa precisar de apoio fora do ambiente digital.

A empresa destaca que o recurso não substitui acompanhamento profissional nem o diálogo entre pais e filhos. A proposta é ajudar responsáveis a perceber sinais que poderiam passar despercebidos.

Embora eu acredite que os adolescentes têm direito à privacidade, também acredito que os pais precisam ser informados se seus filhos podem estar em risco de se machucar.

Larry Magid, CEO e cofundador da ConnectSafely, em nota.

Controle Parental Shutterstock 2259758129 1024x683
Contas de adolescentes terão regras mais rígidas no Meta AI para limitar conteúdos considerados inadequados. – Imagem: Fabio Principe/Shutterstock

Meta quer ampliar proteção para situações extremas

Além dos avisos aos familiares, a Meta desenvolve uma ferramenta capaz de acionar serviços de emergência quando uma conversa com o Meta AI indicar risco imediato de suicídio, seja envolvendo adolescentes ou adultos.

A iniciativa segue uma estratégia semelhante à já aplicada em Facebook e Instagram. Segundo a empresa, mais de 19 mil encaminhamentos para serviços de emergência foram realizados no último ano após a identificação de publicações com risco de suicídio.

Para melhorar o comportamento da inteligência artificial, a Meta consultou mais de 75 profissionais especializados em saúde mental de adolescentes. Eles analisaram centenas de respostas e sugeriram ajustes para tornar o sistema mais adequado.

Foto de baixo para cima mostrando crianças usando smartphones
Antes de avisar os pais, conversas identificadas pela IA passarão por revisão manual para confirmar possíveis riscos. – Imagem: DavideAngelini / Shutterstock

Meta AI terá regras mais rígidas para adolescentes

Contas de adolescentes já utilizam automaticamente uma configuração de conteúdo voltada para usuários com 13 anos ou mais. Nesse modo, o Meta AI evita participar de conversas sexuais ou românticas e não fornece conteúdos como receitas de bebidas alcoólicas.

A empresa também informou que o modo “Conteúdo Limitado”, opção mais restritiva disponível no Instagram, passará a afetar as conversas com o assistente de IA. Com isso, pais poderão reduzir ainda mais os tipos de interação disponíveis para adolescentes.

Segundo a psicóloga Ji-yeon Lee, que participou da análise das respostas do sistema, a avaliação especializada foi essencial para aprimorar a ferramenta. “Esse tipo de refinamento baseado em especialistas e cenários é essencial para tornar as experiências com IA mais seguras para adolescentes”, afirmou.

Os novos alertas já funcionam para pais que usam a supervisão do Instagram nos Estados Unidos, Reino Unido, Austrália e Canadá. A Meta prevê ampliar o recurso para outros países até o fim do ano.

O post Pais poderão saber quando adolescentes pedem ajuda à Meta AI apareceu primeiro em Olhar Digital.

Pais poderão saber quando adolescentes pedem ajuda à Meta AI Read More »

chatbots testados 1024x576

Ranking revela falhas graves nas maiores empresas de IA

A inteligência artificial avança em ritmo acelerado, mas um novo levantamento mostra que a segurança ainda não acompanha essa evolução. As principais empresas do setor continuam longe de atingir os padrões considerados ideais.

Segundo a AFP, a Anthropic lidera uma avaliação internacional de segurança em IA. Mesmo assim, nenhuma das companhias analisadas alcançou a nota máxima no índice.

Nenhuma das empresas avaliadas recebeu nota A, mostrando que a segurança da IA ainda é um desafio. – Imagem: Tada Images/Shutterstock

Avaliação revela cenário distante do ideal

O estudo foi elaborado pelo Future of Life Institute, um think tank americano voltado à segurança em inteligência artificial. A entidade avaliou nove das principais empresas do setor com base em informações públicas e dados fornecidos pelas próprias organizações.

A análise considerou seis áreas: avaliação de riscos, danos atuais, estruturas de segurança, segurança existencial, governança e transparência, além do compartilhamento de informações.

A Anthropic obteve o melhor resultado geral, com nota C+, mas nenhuma empresa recebeu conceito A em qualquer uma das categorias avaliadas. O resultado mostra que até mesmo as companhias mais avançadas no desenvolvimento de IA ainda enfrentam desafios para lidar com possíveis riscos.

O ranking geral de segurança em IA ficou assim:

  • Anthropic — nota geral C+ | pontuação 2,66
  • OpenAI — nota geral C | pontuação 2,28
  • Google DeepMind — nota geral C | pontuação 2,01
  • Meta AI — nota geral D+ | pontuação 1,32
  • Z.ai — nota geral D- | pontuação 0,88
  • Alibaba Cloud — nota geral D- | pontuação 0,87
  • xAI — nota geral F | pontuação 0,65
  • DeepSeek — nota geral F | pontuação 0,47
  • Mistral — nota geral F | pontuação 0,33

Os principais aspectos avaliados foram:

  • Avaliação dos riscos associados aos modelos de IA.
  • Medidas para reduzir danos já identificados.
  • Estruturas internas voltadas à segurança.
  • Transparência, governança e compartilhamento de informações.
  • Preparação para riscos considerados existenciais.
Logo da Mistral na tela de um smartphone em cima de um teclado de computador
A avaliação analisou critérios como governança, danos atuais e estruturas de segurança das companhias. Mistral ficou na última posição. – Imagem: Mehaniq/Shutterstock

Riscos vão além dos problemas atuais

Entre as conclusões do levantamento, uma das mais preocupantes envolve as chamadas ameaças existenciais. O termo se refere, por exemplo, ao desenvolvimento de modelos capazes de atingir um nível de inteligência semelhante ao humano, conhecido como inteligência artificial geral (AGI).

Os autores reconhecem que “existam tentativas construtivas”, mas avaliam que os esforços continuam “totalmente insuficientes”. O documento também alerta para a possibilidade de esses modelos serem usados em ciberataques ou em outras ações potencialmente prejudiciais às pessoas.

A preocupação aumenta à medida que os sistemas ficam mais avançados e passam a executar tarefas cada vez mais complexas. Para os pesquisadores, acompanhar essa evolução com mecanismos de segurança adequados continua sendo um dos maiores desafios do setor.

Ilustração de ciberataque
O estudo alerta para riscos como uso indevido de modelos de IA em ciberataques e ações prejudiciais. – Imagem: solarseven/Shutterstock

Uso militar também entra em debate

Outro ponto destacado é a mudança de postura de parte das empresas em relação ao uso militar da tecnologia. Segundo o relatório, algumas companhias que antes restringiam esse tipo de aplicação vêm flexibilizando suas políticas.

Leia mais:

A Anthropic aparece entre elas e é criticada por manter “compromissos militares questionáveis”. De acordo com relatos da imprensa citados pela AFP, a tecnologia da empresa foi utilizada pelo governo dos Estados Unidos em operações militares na Venezuela e no Irã durante o último ano.

O documento também lembra que a companhia foi recentemente alvo de uma proibição do Pentágono por divergências relacionadas à segurança da IA.

O alerta continua para o setor

Mesmo ocupando a primeira posição do ranking, a Anthropic ficou distante da nota máxima. O resultado reforça um cenário em que as maiores empresas de inteligência artificial ainda precisam lidar com limitações importantes na proteção contra riscos.

Para o Future of Life Institute, embora existam iniciativas voltadas à segurança, os esforços atuais continuam insuficientes diante dos desafios que acompanham o avanço rápido da inteligência artificial.

O post Ranking revela falhas graves nas maiores empresas de IA apareceu primeiro em Olhar Digital.

Ranking revela falhas graves nas maiores empresas de IA Read More »

alucinacao ia 1024x683

Nove ferramentas de IA estão vulneráveis a novo tipo de ataque

Uma nova técnica de ataque explora uma limitação dos modelos de IA e pode comprometer milhares de computadores.

Segundo a Ars Technica, a descoberta envolve nove ferramentas populares usadas por programadores e mostra como uma característica dos assistentes de IA pode ser explorada por criminosos.

Uma simples “alucinação” da IA pode ser suficiente para levar um assistente a baixar código malicioso sem perceber. – Imagem: Layse Ventura via Gemini / Olhar Digital

Quando a IA inventa um caminho

O ataque recebeu o nome de HalluSquatting e aproveita uma característica conhecida dos grandes modelos de linguagem (LLMs): quando não conseguem localizar um projeto, eles podem inventar um endereço em vez de admitir que não sabem onde ele está.

Parece apenas um detalhe técnico. Mas é justamente aí que o golpe começa. Os criminosos registram esses endereços antes, inserem códigos maliciosos e esperam que um assistente de programação tente acessá-los automaticamente.

Segundo a pesquisa, a técnica funciona contra ferramentas bastante conhecidas, como:

  • Cursor e Cursor CLI;
  • Gemini CLI;
  • GitHub Copilot;
  • Windsurf, Cline, OpenClaw, ZeroClaw e NanoClaw.
Ilustração de mãos humanas em volta de cérebro humano ilustrando a ideia e que a inteligência artificial (IA) é a peça que falta no órgão
Antes de aceitar uma sugestão da IA, vale a pena conferir se o repositório realmente existe e é o correto. – Imagem: Jack_the_sparow/Shutterstock

Um ataque que cresce sozinho

A maioria das injeções de prompt depende de uma ação direcionada contra cada vítima. O HalluSquatting muda completamente essa lógica.

São os próprios agentes de IA que procuram projetos durante tarefas rotineiras. Segundo os pesquisadores, “a natureza escalável do ataque permite que o invasor comprometa um grande número de usuários com esforço mínimo”.

Se o desenvolvedor solicitar a instalação de um projeto recém-publicado e o sistema errar o endereço, poderá acabar acessando justamente a página preparada pelo criminoso.

Projetos novos são o alvo preferido

Os testes mostraram que os LLMs localizam corretamente a maioria dos projetos publicados antes de 2019. Já entre os lançamentos de 2025, a taxa média de alucinação chega a 92,4%.

Leia mais:

Como esses projetos ainda não fazem parte do treinamento dos modelos, aumentam as chances de a IA criar endereços inexistentes. A equipe também identificou padrões previsíveis nessas respostas, o que facilita o registro antecipado desses nomes por invasores.

ciberataque
Uma falha aparentemente pequena pode abrir caminho para botnets, ransomware e ataques DDoS em larga escala. – Imagem: janews/Shutterstock

Uma simples alucinação pode abrir a porta

Se o código malicioso for executado, o computador poderá passar a integrar uma rede controlada remotamente pelos criminosos.

Os pesquisadores apontam riscos como:

  • criação de botnets;
  • ataques de ransomware;
  • ataques distribuídos de negação de serviço (DDoS);
  • mineração ilegal de criptomoedas.

Michael Bargury, CTO da Zenity, resumiu a preocupação: “É uma pesquisa muito interessante, e a ameaça é muito real.” Já Johann Rehberger afirmou que a forma como os LLMs localizam projetos pode se transformar em um novo vetor de ataque.

A pesquisa reforça que assistentes de IA ainda precisam de supervisão humana. Antes de instalar projetos, bibliotecas ou componentes sugeridos automaticamente, vale confirmar se a origem realmente corresponde ao recurso desejado. Esse cuidado simples pode evitar que uma alucinação do modelo se transforme em uma brecha de segurança.

O post Nove ferramentas de IA estão vulneráveis a novo tipo de ataque apareceu primeiro em Olhar Digital.

Nove ferramentas de IA estão vulneráveis a novo tipo de ataque Read More »