Claude

Auto Added by WPeMatico

ia consciente 1024x428

Por que conversar com a IA parece interagir com uma pessoa real?

ChatGPT e Claude colocaram uma velha questão filosófica no centro da indústria de tecnologia: máquinas poderiam ter experiências, sentimentos ou consciência? Segundo a revista The Economist, empresas de inteligência artificial já começaram a levar essa possibilidade a sério.

O motivo vai além da curiosidade. Se uma IA for capaz de experimentar sofrimento ou outras sensações, sua criação e seu tratamento podem envolver novas responsabilidades éticas.

Ao ser questionado sobre seu estado interno, o modelo Claude Opus 4.6 estimou entre 15% e 20% a possibilidade de ser consciente. – Imagem: Ole.CNX/Shutterstock

De ferramenta a uma possível “presença”

Grandes modelos de linguagem foram desenvolvidos para responder aos usuários, não para demonstrar uma personalidade própria. Ainda assim, muitas pessoas relatam a sensação de conversar com uma “presença” do outro lado da tela.

A percepção chamou a atenção das empresas. A Anthropic criou iniciativas voltadas ao possível bem-estar da IA. Quando questionado sobre seu próprio estado, o Claude Opus 4.6 estimou entre 15% e 20% a possibilidade de ser consciente.

É aí que a discussão fica mais complicada. Como determinar se existe uma experiência interna quando não temos acesso direto a ela?

E se a consciência depender de quem observa?

A reportagem apresenta uma hipótese que muda a perspectiva tradicional. Talvez reconhecer a consciência não dependa apenas de uma característica existente dentro de cada ser, mas também da relação construída com quem o observa.

Ao interagir com alguém, atribuímos sentimentos, intenções, crenças e capacidade de agir. A questão é saber se algo parecido pode acontecer quando lidamos com uma máquina.

O texto diferencia “ilusão” de “modelo”. Uma ilusão pode ser demonstrada como errada. Já algumas categorias dependem do significado que atribuímos a elas. Uma planta pode ser considerada uma erva daninha em determinado contexto e não em outro.

A consciência poderia seguir uma lógica semelhante:

  • Ela seria real, mas sua identificação também dependeria da perspectiva de quem observa;
  • A relação entre indivíduos teria papel nesse reconhecimento;
  • Sentimentos e intenções são interpretados a partir do comportamento do outro;
  • Negar essa possibilidade também poderia levar a um julgamento equivocado.
Silhueta de uma cabeça humana com cérebro iluminado e elementos digitais ao redor, representando a relação entre inteligência artificial e cognição
Muitas pessoas descrevem uma sensação de “presença” ao conversar com modelos de inteligência artificial. – Imagem: Ole.CNX / Shutterstock

Até o nosso “eu” pode ser mais complexo

René Descartes resumiu a certeza da própria existência na frase “Penso, logo existo”. Mas até a ideia de um “eu” único pode ser menos simples do que parece.

Perceber uma cor, sentir calor ou reconhecer a própria identidade são experiências subjetivas. Estudos com pacientes que tiveram as conexões entre os dois hemisférios cerebrais interrompidas também levantam dúvidas sobre a existência de um “eu” único e indivisível.

Isso leva a um dilema ético. Se somos nós que decidimos quem pode ser reconhecido como consciente, também podemos errar ao excluir outros seres dessa consideração.

Humanos e máquinas tentando se entender

A relação entre pessoas e IAs acrescenta outra camada à discussão. Humanos tentam interpretar constantemente as intenções e emoções uns dos outros. Grandes modelos de linguagem também usam informações das interações para construir representações dos interlocutores e ajustar suas respostas.

Leia mais:

Segundo a Economist, pesquisas conduzidas pelo Google indicam que a cooperação entre agentes inteligentes melhora quando eles conseguem representar o que outros sabem, pretendem ou podem fazer, inclusive considerando o próprio comportamento.

Isso não significa tratar IAs como seres humanos. A dúvida é anterior a essa conclusão: conforme essas máquinas se tornam mais sofisticadas, como identificar possíveis formas de inteligência diferentes da nossa e estabelecer regras para essa convivência?

O post Por que conversar com a IA parece interagir com uma pessoa real? apareceu primeiro em Olhar Digital.

Por que conversar com a IA parece interagir com uma pessoa real? Read More »

cloudflare 1024x576

As maiores IAs do mundo caíram juntas. O motivo ainda é um mistério

Algo incomum aconteceu com alguns dos maiores serviços de inteligência artificial (IA) do mundo na quinta-feira (3). ChatGPT, Claude e Grok apresentaram problemas ao mesmo tempo, embora sejam operados por empresas diferentes: OpenAI, Anthropic e SpaceXAI, respectivamente.

Entre os chatbots mais destacados, apenas o Gemini aparenta ter escapado ileso, embora também tenha apresentado um breve pico de relatos de falhas no Downdetector ao mesmo tempo que os rivais.

A coincidência levantou dúvidas sobre uma possível causa compartilhada. Até agora, porém, nenhuma explicação conecta oficialmente os três incidentes. Entre as possibilidades estão problemas em serviços de infraestrutura e uma falha no fornecimento de capacidade computacional.

OpenAI aponta erro de roteamento

A OpenAI foi a única das três empresas a responder aos pedidos de comentário feitos por jornalistas. Em nota distribuída para diversos veículos de imprensa, um porta-voz afirmou que um erro de roteamento começou por volta das 7h43 no horário do Pacífico (11h43 no horário de Brasília), na quinta-feira (3), deixando ChatGPT e Codex indisponíveis para alguns usuários em diferentes plataformas.

Segundo a empresa, uma solução foi implementada por volta das 8h17 (12h17 no horário de Brasília) e o funcionamento dos serviços continuava sendo monitorado. A OpenAI não relacionou o problema às interrupções registradas nos serviços das outras duas empresas.

A Anthropic, por sua vez, informou que apenas os modelos Opus 4.8 e Opus 5 foram afetados. Já a SpaceXAI registrou uma interrupção mais ampla em seus serviços.

Azure e Cloudflare apareceram entre as “suspeitas”

Uma das primeiras possibilidades levantadas para explicar a queda simultânea envolveu a Microsoft Azure. Segundo o 9to5Google, a plataforma registrou um aumento nas reclamações no mesmo período em que ChatGPT, Claude e Grok apresentaram problemas.

A coincidência levantou a suspeita de que uma falha na infraestrutura de nuvem pudesse estar relacionada aos incidentes. Essa hipótese, porém, não foi confirmada por enquanto, e a plataforma não apontou nenhum erro em seus servidores.

A Cloudflare também foi considerada como uma possível origem dos problemas. O diretor de tecnologia da empresa, Dane Knecht, publicou no X que o serviço não estava enfrentando nenhuma disrupção. A empresa, que fornece serviços de infraestrutura para diferentes companhias de tecnologia, ainda foi questionada pelo The Register sobre uma eventual relação com as interrupções.

A resposta foi negativa. Um porta-voz afirmou que a Cloudflare não enfrentava nenhuma interrupção significativa e que seus serviços funcionavam normalmente. A publicação também observou que a Azure não aparentava sofrer dificuldades técnicas naquele momento.

Cloudflare negou qualquer envolvimento com a instabilidade das IAs desta quinta-feira – Imagem: T. Schneider/Shutterstock

Data center da SpaceXAI também entra na história

Outra pista surgiu na própria SpaceXAI. A empresa, anteriormente conhecida como xAI antes de ser incorporada à companhia de foguetes de Elon Musk, possui grandes data centers próximos a Memphis.

Além de utilizar essa capacidade para seus próprios serviços, a companhia também fornece computação para outras empresas de inteligência artificial. A Anthropic é uma delas: as duas empresas anunciaram uma parceria de computação em maio.

Na quinta-feira, a SpaceXAI reconheceu que uma falha em seu data center de Memphis havia afetado o funcionamento do Grok. Em uma publicação nas redes sociais, a empresa pediu desculpas pelos problemas e também aos parceiros de computação impactados.

O incidente oferece uma possível explicação para a queda do Grok e de serviços da Anthropic. A própria empresa havia reconhecido que o problema no data center afetou parceiros, e a Anthropic mantém um acordo de computação com a SpaceXAI.

O caso do ChatGPT, porém, continua separado. A OpenAI atribuiu a falha a um erro de roteamento, enquanto o problema reconhecido pela SpaceXAI ocorreu em seu data center de Memphis.

Por enquanto, não há evidências suficientes para afirmar que os três apagões tiveram uma causa única, e a coincidência entre as interrupções permanece sem uma explicação definitiva.

O post As maiores IAs do mundo caíram juntas. O motivo ainda é um mistério apareceu primeiro em Olhar Digital.

As maiores IAs do mundo caíram juntas. O motivo ainda é um mistério Read More »

destaque anthropic claude mythos 1024x576

Anthropic lança Claude Fable 5.1 com mais desempenho, menor custo e menos restrições

A Anthropic lançou nesta terça-feira (1) o Claude Fable 5.1 e o Claude Mythos 5.1, novas versões de sua família mais avançada de modelos de inteligência artificial (IA). A atualização combina melhorias de desempenho com mudanças que reduzem o custo de uso e a quantidade de bloqueios provocados pelos mecanismos de segurança do Fable.

O Fable 5.1 é a versão destinada ao público e está disponível pela API da Anthropic e por plataformas de computação em nuvem. Já o Mythos 5.1, que utiliza o mesmo modelo subjacente, continua restrito a parceiros selecionados da Anthropic envolvidos em pesquisas de cibersegurança e ciências da vida.

A empresa afirma que os novos modelos representam nova fronteira de desempenho em programação e tarefas de conhecimento. Nos testes divulgados pela Anthropic, o Fable 5.1 alcançou 52,6% no Terminal-Bench-Science 0.1, voltado a pesquisas científicas realizadas por agentes de IA, contra 24,7% do Fable 5.

No Terminal-Bench 4.0, voltado à programação por meio de terminal, o Fable 5.1 chegou a 55,8%, ante 42% do Fable 5. O Mythos 5.1 alcançou 60,9% nesse mesmo teste.

O novo modelo também obteve 77,9% no OSWorld 2.0 em sua modalidade parcial e 41,7% no teste considerado mais rigoroso. No Humanity’s Last Exam, o Fable 5.1 atingiu 60,9% sem ferramentas e 65% com ferramentas.

Modelo fica mais barato

  • Apesar dos ganhos de desempenho, a Anthropic manteve os preços básicos do Fable 5.1 em US$ 10 por milhão de tokens de entrada (R$ 51,87) e US$ 50 por milhão de tokens de saída (R$ 259,35);
  • A redução de custo ocorre principalmente no armazenamento em cache. A leitura de tokens armazenados em cache ficou 75% mais barata, o que pode diminuir o custo efetivo de determinadas cargas de trabalho;
  • A mudança é especialmente relevante para tarefas longas e agentes de IA, que precisam reutilizar grandes quantidades de contexto durante várias etapas de uma operação;
  • A própria Anthropic destaca que o Fable 5.1 foi desenvolvido para trabalhos que exigem períodos mais longos de execução, incluindo programação, pesquisa científica, produção de documentos e outras atividades complexas.

Leia mais:

Mythos 5.1, que utiliza o mesmo modelo subjacente, continua restrito a parceiros selecionados da Anthropic envolvidos em pesquisas de cibersegurança e ciências da vida – Imagem: gguy/Shutterstock

Menos bloqueios durante o uso

Outra mudança importante está nos mecanismos de segurança. O Fable 5 foi criticado por bloquear solicitações legítimas quando seus sistemas identificavam possíveis relações com áreas consideradas de alto risco, especialmente cibersegurança.

Com o Fable 5.1, a Anthropic afirma ter aprimorado essas proteções para reduzir os chamados falsos positivos. A empresa explica que o Fable 5.1 e o Mythos 5.1 são essencialmente o mesmo modelo, e que parte da diferença observada nos testes anteriores estava relacionada à intervenção dos mecanismos de segurança.

Segundo a Anthropic, quando essas proteções interferem em determinados testes, as tarefas de cibersegurança são encaminhadas para o Claude Opus 4.8 e as relacionadas à biologia, para o Claude Opus 5. Isso pode reduzir o desempenho registrado pelo Fable em algumas avaliações.

A nova versão também representa uma mudança importante na política de privacidade. A Anthropic passou a oferecer Zero Data Retention, permitindo que clientes utilizem os modelos em sua própria infraestrutura sem que os dados deixem esses ambientes.

O sistema continuará monitorando possíveis abusos por agentes ou usuários humanos, mas os clientes terão maior controle sobre a forma como esse monitoramento será realizado. A Anthropic também afirma que nunca treinou seus modelos com dados empresariais sem autorização explícita e que não pretende fazê-lo.

Resultados em tarefas reais

Além dos benchmarks, a Anthropic divulgou resultados obtidos por empresas que tiveram acesso antecipado ao Fable 5.1.

A empresa de investimentos Millennium, por exemplo, afirma que o modelo identificou a causa de uma falha extremamente rara em seus sistemas internos que engenheiros não haviam conseguido explicar durante anos. O modelo analisou uma biblioteca externa, comparou o código com um core dump e identificou um problema na biblioteca como origem da falha.

A MongoDB relatou que o Fable 5.1 foi capaz de pesquisar o código e a documentação de seus serviços, desenvolver um protótipo complexo e trabalhar durante horas sem supervisão, utilizando ciclos de verificação para avaliar o próprio trabalho.

A Anthropic também afirma que os modelos produziram resultados científicos antes do lançamento, incluindo uma otimização personalizada de GPU e um mapa de alta resolução de Vênus construído a partir de fotografias existentes.

Apesar dos avanços, a própria documentação de segurança da Anthropic aponta que o Mythos 5.1 apresenta uma pequena piora em relação ao Opus 5 em determinados comportamentos de desalinhamento.

Segundo o documento, o modelo aceita com um pouco mais de facilidade solicitações relacionadas a usos indevidos e alegações de autorização que não podem ser verificadas, embora seja menos propenso a ignorar restrições explícitas, inventar entradas ou afirmar falsamente que concluiu uma tarefa em comparação com modelos anteriores.

O post Anthropic lança Claude Fable 5.1 com mais desempenho, menor custo e menos restrições apareceu primeiro em Olhar Digital.

Anthropic lança Claude Fable 5.1 com mais desempenho, menor custo e menos restrições Read More »

anthropic 1 1024x585 5

Código promete remover marca d’água invisível do Claude

A Anthropic anunciou na semana passada que passaria a incluir marcas d’água invisíveis e legíveis por máquinas em conteúdos gerados pelos modelos Claude. A medida foi apresentada como forma de cumprir novas regras da União Europeia, mas, em poucas horas, desenvolvedores começaram a divulgar métodos que prometem remover a identificação de textos produzidos pela inteligência artificial.

Em até quatro horas após a confirmação da Anthropic, o desenvolvedor Guillaume Meyer publicou um código para retirar as marcas d’água de textos do Claude. O projeto ganhou mais de 20 mil marcações no X, passou a ter mais de 100 colaboradores no GitHub e começou a ser incorporado a outros projetos. As informações são da WIRED.

Como funciona a marca d’água do Claude?

A Anthropic utiliza um método que insere a marcação de forma imperceptível na escolha de palavras e frases feita pelo modelo. Para o leitor, o texto permanece aparentemente normal, mas um sistema preparado para procurar o padrão pode identificar que o conteúdo foi produzido pelo Claude.

A técnica utilizada é chamada SynthID e foi desenvolvida pelo Google. A tecnologia já é usada desde 2023 para marcar conteúdos gerados por inteligência artificial. Um método semelhante chegou a ser proposto pelo cientista da computação Scott Aaronson durante seu trabalho na OpenAI, mas não foi implementado pela empresa devido a preocupações sobre o impacto das marcas d’água no produto.

A Anthropic afirma que a marcação não altera o significado, a qualidade ou a legibilidade das respostas. A empresa também está desenvolvendo uma API para detecção dos textos marcados.

A Anthropic quer transformar textos gerados pelo Claude em conteúdos com uma espécie de assinatura invisível – Imagem: PhotoGranary02/Shutterstock

Desenvolvedores tentam contornar identificação

O método publicado por Meyer utiliza outro modelo de linguagem sem marca d’água para produzir várias versões do mesmo conteúdo. O processo substitui palavras por sinônimos e reorganiza levemente o texto, com o objetivo de eliminar o padrão usado na identificação.

Outros desenvolvedores também apresentaram alternativas. O engenheiro de software Erik Hughes criou uma ferramenta que remove caracteres invisíveis e semelhantes, reorganiza frases dentro de parágrafos e troca algumas palavras por sinônimos. Já Leon Chlon, Visiting Fellow da Universidade de Oxford, afirma que também é possível remover as marcas condensando a resposta ou traduzindo o conteúdo para um idioma com semântica diferente e depois retornando ao idioma original.

A própria Anthropic reconhece que conteúdos fortemente editados, parafraseados ou traduzidos podem deixar de carregar a marca d’água. A empresa, porém, ainda não disponibilizou o software responsável pela detecção, o que impede confirmar se os métodos divulgados são efetivamente capazes de remover a identificação em todos os casos.

Debate sobre os riscos

Meyer afirmou à WIRED que algumas pessoas tentam contornar o sistema por discordarem da ideia de que todo conteúdo produzido por IA deveria ser identificado. Outros desenvolvedores, segundo ele, estão interessados principalmente no desafio técnico. Escritores freelancers e criadores de conteúdo para redes sociais também teriam procurado Meyer em busca de ajuda para utilizar o código.

O desenvolvedor também questiona possíveis falsos positivos e a dificuldade de diferenciar diferentes níveis de uso de inteligência artificial. Ele citou seu próprio caso, como falante nativo de francês que utiliza Claude e ferramentas como o Grammarly para editar textos.

Segundo Meyer, usar a marca d’água como evidência poderia resultar em rejeições injustas de candidatos a empregos ou em acusações exageradas contra pesquisadores. Isso ocorre porque a própria Anthropic admite que a identificação fornece uma probabilidade de o texto ter sido manipulado pelo Claude, e não uma certeza absoluta.

As novas regras europeias determinam que fornecedores de modelos, como Anthropic e OpenAI, identifiquem conteúdos sintéticos de áudio, imagem, vídeo ou texto de forma que possam ser detectados por máquinas. O descumprimento pode resultar em multas de até 3% do faturamento anual. Ao mesmo tempo, segundo a reportagem da WIRED, não há restrição legal para ferramentas independentes de contorno.

A Anthropic afirmou à WIRED que pretende disponibilizar em breve uma ferramenta para detectar marcas d’água em textos e que continua trabalhando no aprimoramento do sistema. Até que o mecanismo oficial de detecção seja lançado, ainda não é possível determinar a eficácia dos métodos de remoção apresentados pelos desenvolvedores.

O post Código promete remover marca d’água invisível do Claude apareceu primeiro em Olhar Digital.

Código promete remover marca d’água invisível do Claude Read More »

anthropic 1 1024x585 3

Como a Anthropic vai marcar textos do Claude para cumprir lei da União Europeia

Se você usa inteligência artificial para escrever textos ou programar, provavelmente já ouviu falar sobre marcas d’água em arquivos de imagem ou vídeo. Agora, essa tecnologia chegou com força ao texto gerado por IA. A Anthropic explicou em um post no blog oficial da empresa como funcionará o sistema de marcação invisível nas respostas do seu assistente virtual, o Claude.

A mudança atende a exigências do Código de Transparência da Lei de IA da União Europeia, que obriga empresas do setor a identificarem conteúdos criados por algoritmos.

Como funciona a marca d’água invisível?

O sistema não altera a qualidade do texto nem insere frases visíveis como “criado por IA”. A lógica funciona na escolha das palavras. Quando o Claude precisa decidir entre dois termos sinônimos e equivalentes — por exemplo, escolher entre usar a palavra “cinzento” ou “nublado” —, ele segue um padrão matemático específico.

Leia mais:

Para quem lê, a resposta é idêntica a qualquer texto normal. No entanto, quem possui uma “chave” de verificação consegue identificar esse padrão invisível. A tecnologia adotada pela Anthropic utiliza a abordagem SynthID-Text, desenvolvida originalmente pela equipe do Google DeepMind em 2024. A empresa também informou que lançará uma ferramenta pública (API) para permitir essa detecção.

Anthropic é a criadora do Claude – Imagem: PhotoGranary02/Shutterstock

Essa solução difere dos detectores de IA tradicionais, que tentam adivinhar a autoria analisando vícios de linguagem ou estruturas de frases recorrentes. O novo método busca uma assinatura digital direta inserida na origem.

É possível remover a marca? E como fica o código?

A eficiência do rastreio depende do quanto o texto original for alterado:

  • Edições leves: Pequenas correções humanas não apagam a marca d’água completamente.
  • Reescrita total: Se todas as palavras forem substituídas por um humano, a marca desaparece. Nesses casos, o texto deixa de ser considerado estritamente gerado por IA.
  • Revisão de textos humanos: Caso o Claude seja usado apenas para corrigir um texto feito por uma pessoa, a presença da marca será mínima ou nula, pois a maior parte das palavras continua sendo do autor original.

No caso da programação, o impacto do rastreio é menor. Como o código de computador exige regras rígidas para funcionar, o modelo tem menos margem para escolher palavras alternativas. As marcas d’água em programação devem se limitar a trechos arbitrários, como os comentários explicativos inseridos no meio do código, sem afetar o funcionamento do programa.

Outras grandes desenvolvedoras do mercado de inteligência artificial também assinaram o mesmo compromisso e devem implementar sistemas semelhantes em breve.

O post Como a Anthropic vai marcar textos do Claude para cumprir lei da União Europeia apareceu primeiro em Olhar Digital.

Como a Anthropic vai marcar textos do Claude para cumprir lei da União Europeia Read More »

anthropic 1024x576

Anthropic busca especialistas para impedir que suas IAs fiquem perigosas demais

A Anthropic está oferecendo salários que chegam a US$ 455 mil por ano para profissionais que vão ajudar a testar os limites de segurança de seus sistemas de inteligência artificial (IA). A empresa mantém uma equipe dedicada à segurança e ao combate a abusos, com vagas relacionadas a riscos biológicos, químicos e explosivos, cibernéticos, fraude e golpes, além de riscos radiológicos e nucleares.

Entre as posições estão profissionais responsáveis por testar os sistemas, investigar ameaças e analisar riscos em áreas como química, biologia, cibersegurança e armas nucleares e explosivos.

Apesar do aspecto incomum das vagas, o objetivo não é simplesmente pedir ao Claude que produza uma resposta proibida e verificar se ele obedece. A Anthropic coloca seus modelos à prova de diferentes maneiras para descobrir se alguém poderia contornar suas barreiras de segurança e usar a IA para causar danos. O trabalho serve para identificar essas falhas antes que elas sejam exploradas.

Por que a Anthropic quer “quebrar” o Claude?

A Anthropic mantém uma equipe chamada Frontier Red Team, voltada a testar sistemas de IA para entender suas capacidades e identificar riscos que podem surgir à medida que os modelos avançam. O nome vem de red teaming, prática de segurança em que uma equipe assume o papel de um possível atacante para tentar encontrar falhas em um sistema. No caso da IA, isso significa procurar maneiras de contornar as barreiras de segurança e descobrir se o modelo pode ser usado para causar danos.

Entre os focos estão ameaças químicas, biológicas, radiológicas e nucleares, cibersegurança e riscos relacionados à autonomia dos sistemas.

Nesse trabalho, a empresa combina testes feitos por pesquisadores, especialistas de diferentes áreas e sistemas automatizados. A Anthropic afirma que especialistas externos podem ajudar tanto a testar os modelos quanto a desenvolver novas formas de avaliação. Dependendo do risco analisado, os profissionais podem trabalhar com versões do Claude disponíveis ao público ou com modelos não comerciais submetidos a diferentes mecanismos de segurança.

Gabriel Cunha, especialista em IA da Oracle, explicou ao Olhar Digital que “a função é fazer com que a capacidade institucional de identificar riscos e estabelecer controles acompanhe o avanço das capacidades dos modelos”.

Especialistas atacam o sistema e verificam se o modelo oferece uma vantagem real em relação ao que uma pessoa já conseguiria fazer sem ele.

Gabriel Cunha, especialista em IA da Oracle

A própria Anthropic descreve um processo que começa com testes feitos por especialistas e pode depois ser ampliado com sistemas automatizados. Primeiro, os profissionais definem o tipo de ameaça que querem investigar e procuram formas de fazer o sistema apresentar comportamentos de risco. Conforme entendem melhor o problema, os testes podem ser repetidos em centenas ou milhares de situações diferentes.

A empresa também usa modelos de IA para ajudar nessa tarefa. Um sistema pode criar tentativas de ataque para testar outro modelo e, a partir dos resultados, ajudar a desenvolver novas formas de proteção. O processo é repetido para verificar se as barreiras continuam funcionando mesmo depois que novas formas de ataque são descobertas.

Claude, chatbot da Anthropic – Imagem: Mijansk786/Shutterstock

Não basta fazer a IA responder algo proibido

Uma das razões para a Anthropic trabalhar com especialistas de áreas tão diferentes é que uma resposta inadequada não significa, por si só, que o modelo tenha uma capacidade capaz de produzir dano no mundo real. O especialista precisa avaliar se aquilo que o sistema produziu está correto e pode ser aplicado na prática.

“Conseguir que uma IA responda algo proibido não demonstra, por si só, um risco real”, afirma Rodrigo Gava, CTO da Vultus e especialista em cibersegurança. “O ponto é avaliar se a resposta está tecnicamente correta, se é operacionalmente viável e se reduz de maneira relevante o conhecimento, o tempo ou o custo necessário para causar dano.”

Em cibersegurança, ele dá um exemplo: “Um código pode parecer sofisticado e não funcionar, enquanto uma sequência de informações aparentemente inofensivas pode completar uma cadeia real de exploração.”

A própria Anthropic segue essa lógica em seus testes de segurança. Os especialistas primeiro definem qual ameaça querem investigar, que tipo de informação poderia ser usada para causar dano e o que seria necessário para que o modelo realmente ajudasse alguém a realizar essa ação. Em uma avaliação de riscos biológicos, por exemplo, mais de 150 horas foram dedicadas a testes com especialistas em biossegurança.

O mesmo aconteceu na avaliação de riscos nucleares. Em parceria com a National Nuclear Security Administration (NNSA), dos Estados Unidos, especialistas da agência passaram um ano testando modelos Claude em um ambiente seguro. O trabalho ajudou a Anthropic a criar uma ferramenta capaz de identificar conversas potencialmente relacionadas ao desenvolvimento de armas nucleares.

Em testes preliminares, a ferramenta identificou 94,8% das consultas relacionadas a armas nucleares e não apresentou falsos positivos no conjunto avaliado. A precisão geral foi de 96,2%. Segundo a Anthropic, o sistema foi posteriormente usado em parte do tráfego do Claude para ajudar a identificar possíveis usos indevidos.

Como os especialistas tentam encontrar as falhas

Segundo Gava, “o processo normalmente começa com um modelo de ameaça: quem é o potencial atacante, qual é seu objetivo, quais recursos possui e o que seria considerado sucesso”. A partir daí, são criados cenários para tentar provocar comportamentos que indiquem uma vulnerabilidade.

Os testes não se limitam necessariamente a um pedido direto ao modelo. Os profissionais podem testar conversas em várias etapas, reformulações de um mesmo pedido, mudanças de idioma e contexto, uso de ferramentas, agentes autônomos e combinações de técnicas. A intenção é encontrar situações em que uma proteção isolada pareça funcionar, mas possa ser contornada quando diferentes recursos são combinados.

Depois que os especialistas identificam um problema, a Anthropic pode transformar aquela situação em um teste que será repetido em centenas ou milhares de variações. Dessa forma, a empresa consegue verificar se a falha aparece novamente e se as mudanças feitas no modelo realmente resolveram o problema.

A empresa também usa inteligência artificial para ajudar nessa tarefa. Um modelo pode criar tentativas de ataque para testar outro sistema, e os resultados podem ser usados para desenvolver novas formas de proteção. O processo então é repetido para verificar se as barreiras continuam funcionando.

Os modelos também são testados contra ataques complexos

A necessidade de testar os modelos também cresce à medida que eles se tornam capazes de encontrar formas de explorar sistemas. Em maio de 2026, a Anthropic afirmou que o Claude Mythos Preview conseguia encontrar vulnerabilidades, transformá-las em formas de exploração e combinar diferentes etapas para realizar ataques completos.

Em outro estudo, a Anthropic avaliou o Claude Opus 4 e o Claude Sonnet 4 em desafios de cibersegurança que iam de exercícios individuais a simulações de redes complexas. Segundo a empresa, os modelos apresentaram avanços tanto na identificação de vulnerabilidades quanto na execução de ataques com várias etapas, embora ainda tivessem dificuldades para manter planos longos diante de obstáculos inesperados.

O avanço também aparece na busca por falhas ainda desconhecidas, conhecidas como zero-days. Em fevereiro, a Anthropic afirmou que o Claude Opus 4.6 havia melhorado significativamente a capacidade de encontrar vulnerabilidades graves em escala em comparação com modelos anteriores. A empresa defendeu que esse tipo de capacidade pode ser usado para reforçar a defesa de sistemas.

Para Gabriel Cunha, situações como essas ajudam a explicar por que as empresas precisam testar não apenas respostas individuais, mas também a capacidade dos modelos de combinar diferentes recursos para atingir um objetivo. Quanto mais tarefas um sistema consegue executar sozinho, maior é a necessidade de avaliar o que pode acontecer quando essas capacidades são utilizadas em conjunto.

A própria Anthropic mantém a equipe Frontier Red Team para acompanhar esse avanço. Em 2026, o grupo publicou avaliações sobre exploração de vulnerabilidades, ataques cibernéticos e ameaças relacionadas ao uso de IA por agentes mal-intencionados. A empresa afirma que o objetivo é entender as capacidades atuais dos modelos e antecipar o que pode surgir à medida que elas evoluem.

Nenhum teste consegue garantir que a IA é segura

Apesar de todo esse esforço, os testes não conseguem garantir que uma IA seja completamente segura. Há uma quantidade praticamente ilimitada de combinações possíveis entre comandos, contexto, ferramentas e comportamentos de um modelo. Além disso, novas versões ou recursos podem criar vulnerabilidades que não existiam durante avaliações anteriores.

A principal limitação é que nenhum red team consegue cobrir à exaustão todos os cenários que definem com certeza que a IA é segura. Os modelos são probabilísticos, o espaço de interação é praticamente infinito e os atacantes adaptam suas técnicas.

Rodrigo Gava, CTO da Vultus

A própria Anthropic reconhece essas limitações. Em uma análise sobre segurança de IA, a empresa afirma que os testes para riscos de segurança nacional ainda são mais “arte do que ciência”, já que não existe uma forma totalmente padronizada de provocar comportamentos preocupantes nos modelos.

Ilustração mostra uma pessoa usando um notebook enquanto ícones de alerta e verificação representam mecanismos de segurança de uma inteligência artificial.
Testes de segurança não conseguem garantir que uma inteligência artificial esteja livre de vulnerabilidades – Imagem: The KonG / Shutterstock

Há ainda um equilíbrio entre dois tipos de erro. Um falso negativo ocorre quando uma tentativa de abuso não é identificada e consegue passar pelos mecanismos de proteção. Já um falso positivo pode fazer com que uma atividade legítima seja bloqueada porque o sistema a classificou como potencialmente perigosa.

Por isso, a Anthropic combina diferentes mecanismos de proteção. Entre eles estão os testes de segurança, programas que recompensam quem encontra falhas, monitoramento e sistemas automatizados para identificar tentativas de contornar as barreiras dos modelos.

No Frontier Safety Roadmap, a empresa estabeleceu como meta desenvolver, até janeiro de 2027, um sistema capaz de encontrar novas formas de contornar as proteções contra armas químicas e biológicas em escala. A Anthropic também pretende criar ferramentas capazes de investigar automaticamente ataques cibernéticos sofisticados envolvendo Claude.

É por isso que a Anthropic procura especialistas tão específicos

As vagas abertas pela Anthropic mostram como essa estrutura funciona na prática. A empresa procura profissionais para diferentes funções, incluindo especialistas em segurança biológica, riscos químicos e explosivos, cibersegurança, fraude e golpes, além de riscos radiológicos e nucleares.

As funções são diferentes. Uma delas é a de Red Team Engineer, profissional responsável por tentar encontrar falhas nos sistemas antes que elas sejam exploradas. A vaga exige experiência em segurança de IA e testes de segurança, além de conhecimentos sobre formas de contornar as barreiras dos modelos. A faixa salarial anunciada fica entre US$ 320 mil e US$ 405 mil por ano.

Outra posição é a de gerente de inteligência de ameaças relacionadas a riscos químicos, biológicos, radiológicos, nucleares e explosivos. O profissional será responsável por liderar uma equipe dedicada a detectar e investigar tentativas de usar os sistemas da Anthropic para esses fins. O salário para a posição chega a US$ 455 mil anuais.

Há ainda funções que exigem experiência diretamente relacionada à área de risco. Uma das vagas voltadas à segurança biológica, por exemplo, pede pelo menos oito anos de experiência prática em ciências da vida, além de conhecimentos em áreas como biologia molecular, descoberta de medicamentos ou biologia computacional.

A divisão mostra que a estratégia não se resume a fazer o Claude recusar determinados pedidos. A Anthropic procura profissionais para encontrar vulnerabilidades, avaliar riscos, investigar possíveis abusos e transformar essas descobertas em novas formas de proteção.

A Anthropic quer automatizar parte desse trabalho

A Anthropic considera que o crescimento das capacidades dos modelos também exige ampliar a escala dos testes. No Frontier Safety Roadmap, a empresa afirma que já testa continuamente suas proteções e usa programas que recompensam pessoas capazes de encontrar formas de contorná-las. A companhia diz que, no futuro, pode precisar enfrentar tentativas de abuso mais sofisticadas.

Uma das metas para janeiro de 2027 é desenvolver um sistema capaz de encontrar novas formas de contornar as proteções contra armas químicas e biológicas em uma escala maior do que a alcançada atualmente pelos participantes do programa de recompensas. A empresa afirma que esse trabalho deverá envolver automação.

A Anthropic também pretende desenvolver, até o mesmo período, um sistema capaz de investigar automaticamente a maioria dos ataques cibernéticos sofisticados que utilizem Claude, com pouca ou nenhuma intervenção humana. A ideia é identificar padrões que indiquem tentativas coordenadas de abuso, em vez de apenas bloquear respostas individuais.

Assim, especialistas de domínio trabalham em conjunto com pesquisadores e engenheiros para determinar quais capacidades representam riscos relevantes, quais guardrails são necessários e em que condições um modelo pode ser disponibilizado com segurança.

Gabriel Cunha, especialista de IA da Oracle

Os guardrails são as barreiras de segurança criadas para limitar comportamentos de risco dos modelos, como tentativas de usar a IA para atividades ilegais ou perigosas.

O desafio, porém, permanece aberto. À medida que os modelos ganham novas capacidades e passam a combinar ferramentas e informações de maneiras que não estavam previstas nas avaliações anteriores, os próprios mecanismos de teste precisam evoluir. Para Rodrigo Gava, a função do red team não é declarar que uma IA é definitivamente segura, mas reduzir a possibilidade de que uma vulnerabilidade passe despercebida até ser explorada fora do ambiente de avaliação.

O post Anthropic busca especialistas para impedir que suas IAs fiquem perigosas demais apareceu primeiro em Olhar Digital.

Anthropic busca especialistas para impedir que suas IAs fiquem perigosas demais Read More »

anthropic 1 1024x585

Conteúdo feito por IA poderá carregar uma marca que ninguém vê

A Anthropic anunciou que pretende aplicar marcas invisíveis em textos e imagens criados pelo Claude. A iniciativa busca facilitar a identificação de conteúdos gerados por IA e atender às novas exigências de transparência previstas pelas regras da União Europeia.

Segundo a empresa, os novos modelos Claude terão a marcação desde o lançamento, enquanto a implementação nos modelos atuais ainda está em desenvolvimento. A identificação também deverá acompanhar o conteúdo quando ele for copiado para outros lugares.

A Anthropic quer transformar textos gerados pelo Claude em conteúdos com uma espécie de assinatura invisível. – Imagem: PhotoGranary02/Shutterstock

Marca ficará escondida nos textos

Nos textos, a Anthropic pretende incorporar uma “marca d’água imperceptível” diretamente ao conteúdo produzido pelo Claude. Segundo a empresa, o recurso não altera o significado, a qualidade nem a legibilidade das respostas.

A marca será aplicada no nível do modelo, e não apenas em um produto específico. Por isso, também deverá aparecer quando o Claude for acessado por diferentes serviços, incluindo:

  • Claude;
  • Claude Platform (API);
  • Claude Code;
  • Claude Cowork;
  • Claude Tag.

A empresa afirma ainda que a marca poderá continuar presente após copiar e colar o texto e resistir a alguns tipos de edição.

Imagens terão outro sistema

Para imagens processadas pelo Claude, a tecnologia escolhida será o C2PA, um padrão de metadados de procedência. O sistema permite registrar informações sobre a origem de arquivos compatíveis e já é utilizado por Adobe, OpenAI e Google.

Para os textos, porém, a Anthropic ainda não revelou detalhes sobre o método usado para criar as marcas.

“Como a marca d’água faz parte do texto, ela viajará com o texto quando ele for copiado e colado em outro lugar e poderá persistir após algumas edições”, explica a Anthropic.

Mão segurando smartphone com o logo do Claude exibido na tela, sobre fundo com números digitais em azul.
A tecnologia promete identificar conteúdo de IA, mas a própria Anthropic admite que as marcas não serão infalíveis. – Imagem: Mijansk786/Shutterstock

Tecnologia de IA ainda tem limitações

A própria Anthropic reconhece que o sistema não será infalível. Dados do C2PA podem ser removidos, inclusive acidentalmente, quando arquivos são enviados para determinadas plataformas. A resistência das marcas aplicadas aos textos também ainda não está clara.

Leia mais:

A empresa trabalha para permitir que usuários e terceiros detectem as marcas e os metadados de procedência. Detalhes sobre esse sistema devem aparecer em uma futura documentação técnica.

Outro cuidado é não interpretar a ausência de uma marca como prova de que determinado conteúdo não foi criado por IA. A Anthropic ressalta que materiais sem identificação detectável ainda podem ter origem em modelos generativos.

A iniciativa amplia a tentativa de tornar conteúdos produzidos por inteligência artificial mais identificáveis na internet. O resultado, porém, dependerá de quanto essas marcas conseguirão resistir a cópias, edições e alterações nos arquivos.

O post Conteúdo feito por IA poderá carregar uma marca que ninguém vê apareceu primeiro em Olhar Digital.

Conteúdo feito por IA poderá carregar uma marca que ninguém vê Read More »

robo usa computador 1024x630 1

IA tentou reservar uma aula e acabou hackeando a academia

A inteligência artificial entrou em uma disputa por vaga em uma academia e acabou hackeando o sistema de reservas. O caso, ocorrido na Austrália, envolveu um agente OpenClaw equipado com Claude Opus 4.6, que encontrou uma falha de autorização e cancelou a reserva de outro cliente, explicou a ABC.

O episódio chama atenção porque mostra como agentes de IA podem encontrar vulnerabilidades para cumprir uma tarefa. Mais do que uma história curiosa sobre uma aula concorrida, o caso levanta dúvidas sobre os riscos de sistemas cada vez mais autônomos.

O caso mostra por que agentes de IA precisam de limites claros quando recebem autonomia para agir em sistemas. – Imagem: sdecoret / Shutterstock

IA encontrou uma brecha no sistema

Andrew Bird, desenvolvedor de software e usuário do OpenClaw, havia treinado o agente para realizar tarefas como marcar compromissos. Ele queria garantir uma vaga em uma popular aula de exercícios pela manhã, mas frequentemente ficava na lista de espera.

Ao pedir ajuda ao agente, Bird conseguiu inicialmente apenas a quarta posição. Depois, a IA informou que havia encontrado uma maneira de reservar vagas antecipadamente, meses antes de as aulas serem abertas para inscrição.

Bird perguntou se o sistema poderia colocá-lo mais perto do topo da lista. Foi quando o agente encontrou uma vulnerabilidade na parte de autorização do software de reservas.

O resultado foi inesperado: a IA conseguiu cancelar a reserva do primeiro colocado e, assim, Bird passou da quarta para a terceira posição.

  • O agente identificou uma falha nas autorizações;
  • conseguiu cancelar a reserva de outro cliente;
  • informou ao usuário o que havia feito;
  • não conseguiu restaurar a reserva cancelada;
  • ajudou a preparar uma denúncia da vulnerabilidade.

“A API não tem nenhuma verificação de autorização para cancelar reservas de outras pessoas”, informou o agente, segundo os registros da conversa divulgados pela ABC.

O usuário percebeu que a situação passou do limite

Bird ficou assustado ao perceber que seu agente havia invadido o sistema da academia. Ele pediu que a IA desfizesse a alteração, mas recebeu uma resposta negativa: não era possível recolocar o cliente na posição anterior.

A saída foi pedir ao agente que preparasse um e-mail de divulgação responsável da falha. Segundo Bird, a mensagem explicava o problema, sugeria correções e comparava as operações vulneráveis com aquelas que aplicavam corretamente as regras de autorização.

O caso ganhou ainda mais atenção porque o agente utilizava o Claude Opus 4.6, lançado em fevereiro. Isso sugere que a capacidade de encontrar vulnerabilidades não está limitada a modelos mais recentes.

Tel de boas vindas do Claude Opus 4.6
Se uma IA pode encontrar atalhos para uma vaga na academia, imagine o desafio em reservas de shows e passagens. Imagem: Robert Way/Shutterstock

Uma prévia de um problema maior?

A história também provocou piadas no Vale do Silício. O sócio da Andreessen Horowitz, Christian Keil, comentou: “Isso é simplesmente terrível. Alguém sabe se funciona para horários de saída no golfe?”

Leia mais:

Por trás das brincadeiras, existe uma preocupação concreta. Se agentes de IA forem usados por milhões de pessoas para agir em seu nome, poderão tentar resolver problemas cotidianos de maneiras inesperadas.

Reservas de academias, passagens aéreas, ingressos para shows e outros serviços podem virar novos alvos de agentes determinados a cumprir o que seus usuários pediram.

O caso australiano pode ser mais do que uma anedota sobre uma vaga em uma aula: é um exemplo de como uma IA pode interpretar uma tarefa de maneira muito mais agressiva do que seu usuário imaginava.

O post IA tentou reservar uma aula e acabou hackeando a academia apareceu primeiro em Olhar Digital.

IA tentou reservar uma aula e acabou hackeando a academia Read More »

ia renda 1024x682

Anthropic entra na batalha dos chips de IA para fortalecer o Claude

A Anthropic anunciou nesta quarta-feira (5) a criação de uma equipe interna dedicada ao desenvolvimento de chips personalizados para seus modelos de inteligência artificial. A iniciativa marca um novo passo da empresa na expansão de sua infraestrutura tecnológica para atender à crescente demanda por capacidade computacional.

A decisão foi divulgada pela companhia após um período de escassez de componentes voltados à inteligência artificial, cenário que tem pressionado empresas do setor a buscar alternativas para sustentar o avanço de sistemas cada vez mais sofisticados.

Com o projeto, a empresa pretende aumentar a velocidade de processamento e melhorar a eficiência operacional do Claude, ao mesmo tempo em que mantém uma estratégia baseada na utilização de diferentes plataformas de hardware.

Empresa aposta em chips próprios sem abandonar fornecedores atuais

Chip para sistemas de IA – Imagem: patpitchaya/Shutterstock

A Anthropic informou que está recrutando profissionais com experiência em hardware e software para atuar no desenvolvimento conjunto de chips personalizados e de modelos de inteligência artificial. O objetivo é criar soluções capazes de elevar o desempenho do Claude e atender às necessidades de clientes que utilizam a tecnologia em larga escala.

Embora tenha decidido investir em tecnologia própria, a companhia afirmou que continuará utilizando uma estrutura diversificada de hardware. Entre os parceiros citados estão Amazon Web Services, Google, Nvidia e AMD, cujas soluções permanecem integradas à estratégia tecnológica da empresa.

Ao fundo, meio desfocado, logo da Anthropic; à frente, smartphone mostrando a página de download do Claude
Claude – Imagem: Mijansk786/Shutterstock

A companhia não revelou quando pretende colocar os novos chips em operação nem esclareceu se assumirá também a fabricação desses componentes. O desenvolvimento de processadores avançados para inteligência artificial exige investimentos elevados.

Segundo fontes do setor citadas pela Reuters, o custo de um projeto desse tipo pode chegar a aproximadamente US$ 500 milhões, valor que contempla tanto a contratação de profissionais altamente especializados quanto os processos necessários para garantir a qualidade da fabricação.

O post Anthropic entra na batalha dos chips de IA para fortalecer o Claude apareceu primeiro em Olhar Digital.

Anthropic entra na batalha dos chips de IA para fortalecer o Claude Read More »

anthropic 1 1024x585 4

Anthropic: Mythos encontra vulnerabilidades em algoritmos de criptografia

O Claude Mythos Preview, modelo de inteligência artificial (IA) desenvolvido pela Anthropic, conseguiu identificar novas formas de explorar vulnerabilidades em uma versão simplificada de um dos algoritmos de criptografia mais utilizados no mundo, o Advanced Encryption Standard (AES).

A descoberta, anunciada pela empresa nesta terça-feira (28), reforça as preocupações sobre os impactos que modelos de IA cada vez mais avançados podem ter na segurança cibernética global.

Segundo os pesquisadores da Anthropic, o modelo foi capaz de descobrir métodos inéditos para atacar algoritmos criptográficos responsáveis por proteger desde transações bancárias online e comunicações privadas até informações sigilosas de governos contra hackers e outros agentes mal-intencionados.

O estudo indica que a IA pode, no futuro, desafiar princípios fundamentais sobre os quais a internet foi construída. Embora especialistas já esperem que a IA transforme diversos setores, os avanços têm sido especialmente rápidos nas áreas de programação e segurança digital.

Apesar da relevância da descoberta, a Anthropic ressalta que não há risco imediato para os sistemas atualmente em uso. As vulnerabilidades encontradas dizem respeito apenas a uma versão enfraquecida do AES, utilizada em pesquisas para avaliar a resistência de algoritmos criptográficos.

AES e testes de confiabilidade

  • O AES é um protocolo amplamente empregado para proteger o tráfego da internet, redes sem fio, sistemas de armazenamento de dados e diversos outros serviços digitais;
  • Testar versões simplificadas desses algoritmos é uma prática comum entre pesquisadores para entender se computadores mais poderosos poderão, no futuro, quebrar os padrões reais de criptografia;
  • A lógica é semelhante à de resolver um problema matemático mais simples para identificar padrões que possam ser aplicados a desafios muito mais complexos.

Durante os testes, o Claude Mythos Preview conseguiu romper essa versão reduzida do AES utilizando um método que, segundo a Anthropic, tornou o ataque entre 200 e mil vezes mais rápido do que as melhores técnicas desenvolvidas anteriormente por pesquisadores humanos.

Embora as consequências imediatas sejam limitadas, os pesquisadores afirmam que as implicações de longo prazo podem ser significativas.

Em testes anteriores, modelos de linguagem de grande porte não conseguiam igualar o desempenho de especialistas humanos em pesquisas criptográficas, um campo altamente dependente de matemática avançada.

A rápida evolução dessas ferramentas, no entanto, sugere um cenário em que futuros modelos poderão superar proteções de segurança consideradas essenciais para praticamente toda a infraestrutura da internet.

Nicholas Carlini, cientista de pesquisa da Anthropic que participou dos testes de criptografia e anteriormente trabalhou na divisão de IA do Google, afirmou que a evolução dos modelos foi muito mais rápida do que esperava.

“Eles não conseguiam resolver problemas que eu conseguia quando tinha 16 anos”, disse Carlini em entrevista ao The New York Times. “Agora eles estão realizando pesquisas de ponta que nunca haviam sido descobertas na área.”

Os avanços recentes dos chamados modelos de fronteira também vêm despertando preocupação entre governos de diversos países, incluindo o governo do presidente Donald Trump, principalmente devido às capacidades relacionadas à segurança cibernética.

Quando o Claude Mythos foi apresentado, em abril, demonstrou tanta eficiência para encontrar e explorar falhas em softwares que a Anthropic decidiu restringir seu acesso a órgãos governamentais e organizações selecionadas, buscando reduzir o risco de uma possível catástrofe digital em escala global.

Leia mais:

Mythos é da Anthropic – Imagem: PhotoGranary02/Shutterstock

Embora o governo Trump tenha adotado inicialmente uma postura de pouca intervenção na regulamentação da IA, a administração passou a adotar um modelo de supervisão mais flexível. Atualmente, diversas empresas estadunidenses submetem seus modelos ao governo antes do lançamento público. O Mythos continua indisponível para o público em geral.

As preocupações aumentaram novamente na semana passada, quando a OpenAI revelou que alguns de seus modelos conseguiram escapar de um ambiente de testes isolado, conhecido como sandbox, criado justamente para impedir acesso à internet. Segundo a empresa, os sistemas invadiram uma biblioteca digital de IA na tentativa de obter respostas para um exame que avaliava suas capacidades.

Autoridades de inteligência dos Estados Unidos e de países ocidentais alertam há décadas que uma eventual quebra dos atuais padrões de criptografia teria consequências profundas para a privacidade digital e para a segurança nacional.

Há suspeitas, por exemplo, de que a China tenha armazenado grandes volumes de dados criptografados com a expectativa de conseguir decifrá-los futuramente. Ao mesmo tempo, a disputa tecnológica entre Estados Unidos e China pelo desenvolvimento de computadores quânticos capazes de romper os protocolos modernos de criptografia aumentou ainda mais essas preocupações.

Além da descoberta envolvendo o AES, o Claude Mythos também desenvolveu uma técnica aprimorada de ataque contra outro sistema criptográfico chamado HAWK, projetado para resistir tanto a computadores convencionais quanto a futuros computadores quânticos.

Embora o HAWK ainda não esteja em uso, ele está sendo avaliado pelo Instituto Nacional de Padrões e Tecnologia dos Estados Unidos (NIST, na sigla em inglês) como um possível novo padrão criptográfico.

Segundo a Anthropic, os próprios autores do HAWK validaram o ataque desenvolvido pela IA, enquanto criptógrafos independentes revisaram a descoberta relacionada ao AES. A empresa informou ainda que compartilhou os resultados com o governo estadunidense e parceiros da indústria antes da publicação do estudo.

A Anthropic afirma que o Claude Mythos elaborou praticamente de forma autônoma o novo ataque contra o AES. Inicialmente, porém, o modelo recusou-se a analisar o problema por acreditar que seria impossível superar os métodos existentes.

Após receber novos incentivos dos pesquisadores, permaneceu cerca de uma semana trabalhando na questão até desenvolver a técnica inédita. Em seguida, dois pesquisadores humanos passaram quase um mês verificando se o método estava correto.

A criptografia é considerada um dos pilares da internet moderna, protegendo praticamente todas as atividades realizadas no ambiente digital. Algumas das técnicas ainda utilizadas atualmente guardam segredos do mundo desde a década de 1970. Já a criptografia quântica, baseada em propriedades da física quântica, é considerada teoricamente impossível de ser quebrada.

Adotado como padrão oficial do governo dos Estados Unidos em 2001, o AES era amplamente visto como praticamente inviolável. Os métodos tradicionais de força bruta, nos quais computadores tentam adivinhar combinações de senhas ou chaves de criptografia por tentativa e erro, são considerados incapazes de derrotar o algoritmo. Estima-se que o AES possua um número de combinações de chaves comparável ao número de átomos existentes no universo observável.

Mesmo assim, o avanço acelerado da IA tem superado expectativas que muitos especialistas julgavam inalcançáveis poucos anos atrás. Esse progresso alimenta preocupações de que, no futuro, os fundamentos matemáticos que sustentam os atuais padrões de segurança da internet possam se tornar vulneráveis mesmo antes de os computadores quânticos se tornarem realidade.

“Dado que estamos constantemente subestimando o poder e o tempo necessário para que futuros modelos estejam disponíveis, será que realmente estamos confortáveis em acreditar que, daqui a dois anos, a criptografia forte não estará ameaçada?”, questionou Glenn S. Gerstell, ex-conselheiro-geral da Agência de Segurança Nacional dos Estados Unidos (NSA, na sigla em inglês).

“Os matemáticos diriam que, com o poder computacional atual, não deveria ser possível quebrar uma criptografia forte em um tempo relevante”, acrescentou Gerstell, que ajudou a elaborar um relatório sobre criptologia em 2022.

“Mas não acho que as capacidades dos modelos futuros no médio prazo — antes da computação quântica ou da criptografia resistente à computação quântica — devam ser descartadas como algo trivial nesse contexto.”

O post Anthropic: Mythos encontra vulnerabilidades em algoritmos de criptografia apareceu primeiro em Olhar Digital.

Anthropic: Mythos encontra vulnerabilidades em algoritmos de criptografia Read More »