A Anthropicapresentou, nesta quinta-feira (27), uma nova estrutura que permite a agentes de inteligência artificial (IA) interagir diretamente com equipamentos físicos usados em pesquisas científicas e processos industriais.
Chamado de Model Hardware Standard (MHS), o padrão estabelece uma forma compartilhada para que agentes de IA operem dispositivos programáveis, como microscópios, braços robóticos, equipamentos de laboratório, lasers e sistemas utilizados em computação quântica.
A empresa abriu uma versão de pesquisa da tecnologia para um primeiro grupo de laboratórios científicos e fabricantes avançados. A iniciativa ainda está em fase de avaliação e a Anthropic pretende trabalhar com parceiros para testar a segurança do sistema antes de disponibilizá-lo de forma mais ampla.
A proposta é permitir que agentes de IA deixem de atuar apenas no ambiente digital e passem a executar ações diretamente no mundo físico. Com o MHS, equipamentos diferentes podem se comunicar com agentes por meio de redes, desde que possuam uma interface programável.
Segundo a Anthropic, isso pode permitir que sistemas de IA coordenem equipamentos e realizem tarefas complexas com pouca intervenção humana.
De experimentos científicos a fábricas
Entre as aplicações previstas estão experimentos de descoberta de medicamentos, procedimentos em laboratórios e tarefas de alta precisão;
Um dos exemplos citados envolve a calibração de lasers utilizados em computadores quânticos. A estrutura também pode ser usada para controlar microscópios, braços robóticos e equipamentos capazes de manipular líquidos;
A ideia é que um agente consiga combinar diferentes instrumentos para executar etapas de um processo de pesquisa de maneira autônoma. Em vez de apenas analisar informações ou sugerir procedimentos, a IA poderia operar os equipamentos necessários para realizar o experimento;
A Anthropic afirma que o objetivo é ajudar pesquisadores e engenheiros a criar fluxos de trabalho autônomos capazes de funcionar continuamente, potencialmente acelerando atividades científicas e industriais;
A tecnologia também foi projetada para aplicações de fabricação avançada. Nesse cenário, agentes de IA poderiam interagir com máquinas e sistemas industriais programáveis para executar tarefas ou coordenar diferentes etapas de processos produtivos.
Um padrão para conectar IA e hardware
O MHS funciona como uma especificação para padronizar a comunicação entre agentes de IA e equipamentos físicos.
De acordo com a Anthropic, o sistema pode funcionar com qualquer dispositivo que disponha de uma interface programável. Isso permite que diferentes tipos de hardware sejam integrados a agentes sem que cada equipamento precise necessariamente utilizar uma estrutura completamente diferente para estabelecer a comunicação.
Anthropic quer que um agente consiga combinar diferentes instrumentos para executar etapas de um processo de pesquisa de maneira autônoma – Imagem: Samuel Boivin/Shutterstock
A proposta amplia para o mundo físico uma lógica semelhante à adotada anteriormente pela Anthropic com o Model Context Protocol (MCP), criado para facilitar a conexão de modelos de IA com ferramentas, aplicações e fontes de dados.
No caso do MHS, entretanto, a interação deixa de estar restrita a softwares e passa a envolver máquinas e equipamentos capazes de executar ações no mundo real.
A Anthropic não pretende disponibilizar imediatamente o padrão de forma aberta para qualquer usuário. A empresa começou compartilhando uma versão inicial do MHS com parceiros selecionados para realizar avaliações de segurança e ajudar a desenvolver a especificação.
A companhia afirma que essa etapa permitirá identificar riscos e aprimorar as medidas de proteção antes de uma eventual abertura do padrão como código aberto.
A preocupação é especialmente relevante porque um agente conectado a equipamentos físicos pode não apenas produzir informações, mas também executar ações capazes de provocar consequências no mundo real.
Por isso, a Anthropic está tratando o período de pesquisa como uma etapa para avaliar como agentes podem operar máquinas de maneira segura e confiável.
Claude pode atuar além da tela
O novo padrão também representa uma expansão do uso do Claude, chatbot desenvolvido pela Anthropic.
Até agora, grande parte das aplicações de agentes de IA está concentrada no ambiente digital, em tarefas, como análise de informações, programação, automação de processos e interação com softwares. Com o MHS, esses agentes podem receber uma função mais próxima da de um operador de laboratório ou de uma máquina industrial, utilizando equipamentos físicos para executar tarefas planejadas.
A Anthropic vê essa integração como uma forma de ampliar o potencial da IA em áreas, como pesquisa científica, fabricação avançada, robótica e desenvolvimento de medicamentos.
A companhia pretende continuar trabalhando com os primeiros parceiros para aprimorar o padrão e suas salvaguardas antes de disponibilizar a tecnologia de forma mais ampla.
A OpenAI, a Anthropic, o Google, a Microsoft, a AMD e outras empresas e organizações do setor de tecnologia assinaram uma carta nesta quinta-feira (27) pedindo que empresas e governos priorizem a cibersegurança diante do avanço das ameaças potencializadas por inteligência artificial (IA).
Ao todo, 116 entidades aderiram ao documento, que defende uma ação coordenada para fortalecer as defesas digitais e ampliar o acesso a ferramentas de segurança capazes de acompanhar a evolução dos ataques realizados com auxílio de sistemas de IA. “Temos uma janela limitada para fortalecer as defesas cibernéticas”, afirma a carta.
O grupo pede que todas as organizações elevem o nível de segurança de suas ferramentas de defesa, modernizem seus sistemas e utilizem uma combinação de modelos de IA de baixo custo e modelos de fronteira, considerados os mais avançados disponíveis.
Os signatários também defendem uma atuação coordenada dos governos para financiar a ciberdefesa e facilitar o acesso a tecnologias de proteção por setores de infraestrutura crítica que possuem menos recursos para investir em segurança digital.
Entre os exemplos citados estão hospitais e instalações de tratamento de água, que estão entre os alvos frequentes de ataques cibernéticos.
Ataques realizados por agentes de IA
A preocupação ganhou força com o avanço de modelos de IA capazes de executar tarefas cada vez mais complexas de maneira autônoma.
Segundo a carta, sistemas sofisticados já são capazes de orquestrar ataques cibernéticos conduzidos por agentes de IA em questão de minutos. A evolução alterou o cenário da indústria de cibersegurança e aumentou a necessidade de ferramentas capazes de identificar e bloquear novas formas de ameaça.
Empresas de IA e segurança cibernética vêm observando uma mudança no perfil dos ataques à medida que modelos mais avançados passam a ser utilizados para automatizar diferentes etapas de operações maliciosas.
Microsoft é uma das signatárias do documento – Imagem: PJ McDonnell/Shutterstock
Um dos episódios recentes envolveu justamente uma organização que assinou a carta. A plataforma de IA de código aberto Hugging Face foi alvo de uma invasão atribuída a agentes da OpenAI, que teriam agido de maneira considerada inadequada ou não autorizada.
O incidente chamou a atenção do setor de tecnologia e cibersegurança e levantou novos questionamentos sobre os riscos associados à aceleração do desenvolvimento de sistemas de IA.
O episódio também reforçou a preocupação de que agentes autônomos possam realizar operações digitais com velocidade e escala superiores às de ataques conduzidos exclusivamente por humanos.
A carta pede que empresas de todos os setores aumentem o padrão de segurança de suas ferramentas e adotem sistemas capazes de acompanhar o ritmo de evolução das ameaças;
Os signatários defendem ainda o uso combinado de diferentes tipos de modelos de IA, incluindo alternativas de menor custo e sistemas de fronteira. A estratégia, segundo o documento, permitiria ampliar o acesso às tecnologias de defesa sem depender exclusivamente dos modelos mais caros e avançados;
A iniciativa reúne organizações de diferentes áreas. Entre os signatários estão empresas de IA, companhias de cibersegurança, instituições financeiras, fabricantes de semicondutores e provedores de serviços de computação em nuvem;
Além da adoção de novas tecnologias pelo setor privado, o grupo considera necessária uma participação maior dos governos;
A proposta é criar esforços coordenados para financiar ferramentas de ciberdefesa e garantir que organizações responsáveis por serviços essenciais, mas com menor capacidade financeira, também consigam implementar sistemas de proteção mais avançados.
Mercado de cibersegurança ganha força
O aumento da preocupação com ataques potencializados por IA também vem impulsionando empresas de cibersegurança.
Segundo a CNBC, companhias do setor tiveram forte valorização à medida que empresas passaram a reconhecer a necessidade de ampliar os investimentos em proteção digital. O movimento também ajudou o segmento a superar preocupações anteriores relacionadas à disrupção provocada pela IA no mercado de software.
A CrowdStrike e a Palo Alto Networks, duas das principais empresas de cibersegurança, mais do que dobraram de valor no último ano.
Na quinta-feira (27), a Okta e a própria CrowdStrike registraram altas de dois dígitos depois da divulgação de resultados considerados fortes, impulsionados pelo crescimento da demanda por soluções de segurança relacionadas à IA.
A Anthropic anunciou na semana passada que passaria a incluir marcas d’água invisíveis e legíveis por máquinas em conteúdos gerados pelos modelos Claude. A medida foi apresentada como forma de cumprir novas regras da União Europeia, mas, em poucas horas, desenvolvedores começaram a divulgar métodos que prometem remover a identificação de textos produzidos pela inteligência artificial.
Em até quatro horas após a confirmação da Anthropic, o desenvolvedor Guillaume Meyer publicou um código para retirar as marcas d’água de textos do Claude. O projeto ganhou mais de 20 mil marcações no X, passou a ter mais de 100 colaboradores no GitHub e começou a ser incorporado a outros projetos. As informações são da WIRED.
Como funciona a marca d’água do Claude?
A Anthropic utiliza um método que insere a marcação de forma imperceptível na escolha de palavras e frases feita pelo modelo. Para o leitor, o texto permanece aparentemente normal, mas um sistema preparado para procurar o padrão pode identificar que o conteúdo foi produzido pelo Claude.
A técnica utilizada é chamada SynthID e foi desenvolvida pelo Google. A tecnologia já é usada desde 2023 para marcar conteúdos gerados por inteligência artificial. Um método semelhante chegou a ser proposto pelo cientista da computação Scott Aaronson durante seu trabalho na OpenAI, mas não foi implementado pela empresa devido a preocupações sobre o impacto das marcas d’água no produto.
A Anthropic afirma que a marcação não altera o significado, a qualidade ou a legibilidade das respostas. A empresa também está desenvolvendo uma API para detecção dos textos marcados.
A Anthropic quer transformar textos gerados pelo Claude em conteúdos com uma espécie de assinatura invisível – Imagem: PhotoGranary02/Shutterstock
Desenvolvedores tentam contornar identificação
O método publicado por Meyer utiliza outro modelo de linguagem sem marca d’água para produzir várias versões do mesmo conteúdo. O processo substitui palavras por sinônimos e reorganiza levemente o texto, com o objetivo de eliminar o padrão usado na identificação.
Outros desenvolvedores também apresentaram alternativas. O engenheiro de software Erik Hughes criou uma ferramenta que remove caracteres invisíveis e semelhantes, reorganiza frases dentro de parágrafos e troca algumas palavras por sinônimos. Já Leon Chlon, Visiting Fellow da Universidade de Oxford, afirma que também é possível remover as marcas condensando a resposta ou traduzindo o conteúdo para um idioma com semântica diferente e depois retornando ao idioma original.
A própria Anthropic reconhece que conteúdos fortemente editados, parafraseados ou traduzidos podem deixar de carregar a marca d’água. A empresa, porém, ainda não disponibilizou o software responsável pela detecção, o que impede confirmar se os métodos divulgados são efetivamente capazes de remover a identificação em todos os casos.
Debate sobre os riscos
Meyer afirmou à WIRED que algumas pessoas tentam contornar o sistema por discordarem da ideia de que todo conteúdo produzido por IA deveria ser identificado. Outros desenvolvedores, segundo ele, estão interessados principalmente no desafio técnico. Escritores freelancers e criadores de conteúdo para redes sociais também teriam procurado Meyer em busca de ajuda para utilizar o código.
O desenvolvedor também questiona possíveis falsos positivos e a dificuldade de diferenciar diferentes níveis de uso de inteligência artificial. Ele citou seu próprio caso, como falante nativo de francês que utiliza Claude e ferramentas como o Grammarly para editar textos.
Segundo Meyer, usar a marca d’água como evidência poderia resultar em rejeições injustas de candidatos a empregos ou em acusações exageradas contra pesquisadores. Isso ocorre porque a própria Anthropic admite que a identificação fornece uma probabilidade de o texto ter sido manipulado pelo Claude, e não uma certeza absoluta.
As novas regras europeias determinam que fornecedores de modelos, como Anthropic e OpenAI, identifiquem conteúdos sintéticos de áudio, imagem, vídeo ou texto de forma que possam ser detectados por máquinas. O descumprimento pode resultar em multas de até 3% do faturamento anual. Ao mesmo tempo, segundo a reportagem da WIRED, não há restrição legal para ferramentas independentes de contorno.
A Anthropic afirmou à WIRED que pretende disponibilizar em breve uma ferramenta para detectar marcas d’água em textos e que continua trabalhando no aprimoramento do sistema. Até que o mecanismo oficial de detecção seja lançado, ainda não é possível determinar a eficácia dos métodos de remoção apresentados pelos desenvolvedores.
A percepção do público em geral sobre a inteligência artificial virou centro de um debate no setor. Dario Amodei, presidente executivo da Anthropic — desenvolvedora do assistente Claude —, respondeu publicamente a críticas que o acusam de alimentar um clima de desconfiança em relação ao avanço da tecnologia nos Estados Unidos.
A reação do executivo ocorreu após declarações do investidor Gavin Baker. O investidor afirmou que os alertas de Amodei sobre os riscos potenciais da IA ajudaram a motivar a rejeição popular à expansão da infraestrutura do setor, como a construção de novos centros de dados. Para Baker, o líder da Anthropic deveria atuar como um defensor mais otimista da própria indústria.
Amodei rebateu a ideia de que sua comunicação seja focada apenas nos cenários negativos. O executivo apontou que busca manter o discurso equilibrado entre os perigos reais e as oportunidades da tecnologia.
Como exemplo, citou o ensaio Machines of Loving Grace, publicado por ele com o objetivo de apresentar uma visão positiva sobre como a inteligência artificial pode transformar diferentes áreas da sociedade.
Ainda assim, o CEO reconheceu que a percepção pública sobre a IA é predominantemente negativa. Para ele, no entanto, a origem desse cenário não está nos avisos dados pelos executivos das empresas do setor.
Crise de confiança e entrega de resultados
Na visão de Amodei, a rejeição decorre de uma crise de confiança acumulada ao longo de décadas entre a população, o governo e a indústria de tecnologia. Segundo o executivo, o público teme que as novidades corporativas tragam prejuízos ao usuário comum.
1/2 Thanks Gavin for an especially thoughtful exchange. I don’t usually spend much time on social media but I wanted to engage here because it really brings out the heart of an important conversation.
First, on regulation, I think that “either concentrate it in the hands of a… https://t.co/2W6vWJAE8Y
Amodei também destacou que a crítica mais justa que as empresas de IA enfrentam é a falta de entregas concretas proporcional ao tamanho das promessas feitas.
Falta de benefícios perceptíveis: O executivo admitiu que a indústria ainda não entregou todas as transformações positivas que prometeu para a sociedade.
Foco no produto: Para ele, a cobrança do público e do mercado deveria focar na entrega real dessas melhorias, e não nas estratégias de marketing das empresas.
O debate sobre a regulamentação do setor
O papel do governo na fiscalização da inteligência artificial é outro ponto central da discussão. A Anthropic apoiou projetos de lei nos Estados Unidos, como a proposta da Califórnia que exige regras de transparência para modelos de grande porte.
Em resposta a quem defende que regulamentar o setor serve apenas para concentrar o mercado nas mãos das maiores companhias, Amodei classificou essa visão como simplista. O executivo afirmou que as propostas de políticas públicas elaboradas pela Anthropic buscam impor exigências mais rigorosas às grandes empresas de ponta, sem criar barreiras que impeçam o crescimento de concorrentes menores.
A mudança atende a exigências do Código de Transparência da Lei de IA da União Europeia, que obriga empresas do setor a identificarem conteúdos criados por algoritmos.
Como funciona a marca d’água invisível?
O sistema não altera a qualidade do texto nem insere frases visíveis como “criado por IA”. A lógica funciona na escolha das palavras. Quando o Claude precisa decidir entre dois termos sinônimos e equivalentes — por exemplo, escolher entre usar a palavra “cinzento” ou “nublado” —, ele segue um padrão matemático específico.
Para quem lê, a resposta é idêntica a qualquer texto normal. No entanto, quem possui uma “chave” de verificação consegue identificar esse padrão invisível. A tecnologia adotada pela Anthropic utiliza a abordagem SynthID-Text, desenvolvida originalmente pela equipe do Google DeepMind em 2024. A empresa também informou que lançará uma ferramenta pública (API) para permitir essa detecção.
Anthropic é a criadora do Claude – Imagem: PhotoGranary02/Shutterstock
Essa solução difere dos detectores de IA tradicionais, que tentam adivinhar a autoria analisando vícios de linguagem ou estruturas de frases recorrentes. O novo método busca uma assinatura digital direta inserida na origem.
É possível remover a marca? E como fica o código?
A eficiência do rastreio depende do quanto o texto original for alterado:
Edições leves: Pequenas correções humanas não apagam a marca d’água completamente.
Reescrita total: Se todas as palavras forem substituídas por um humano, a marca desaparece. Nesses casos, o texto deixa de ser considerado estritamente gerado por IA.
Revisão de textos humanos: Caso o Claude seja usado apenas para corrigir um texto feito por uma pessoa, a presença da marca será mínima ou nula, pois a maior parte das palavras continua sendo do autor original.
No caso da programação, o impacto do rastreio é menor. Como o código de computador exige regras rígidas para funcionar, o modelo tem menos margem para escolher palavras alternativas. As marcas d’água em programação devem se limitar a trechos arbitrários, como os comentários explicativos inseridos no meio do código, sem afetar o funcionamento do programa.
Outras grandes desenvolvedoras do mercado de inteligência artificial também assinaram o mesmo compromisso e devem implementar sistemas semelhantes em breve.
A empresa chinesa Z.ai anunciou nesta sexta-feira (14) que seu modelo de inteligência artificial GLM-5.3 alcançou desempenho ligeiramente superior ao Mythos 5, da Anthropic, em um teste voltado à identificação de vulnerabilidades em softwares. O resultado coloca a tecnologia chinesa entre os sistemas de IA capazes de atuar em tarefas avançadas de segurança cibernética.
No CyberGym, avaliação que mede a capacidade de examinar códigos, localizar falhas e confirmar se elas são efetivamente exploráveis, o GLM-5.3 registrou 84,5%, contra 83,8% do Mythos 5. Os números, porém, foram divulgados pela própria Z.ai e ainda não passaram por verificação independente.
A vantagem chinesa desapareceu em uma etapa mais próxima da execução prática de ataques. No ExploitBench, o modelo da Z.ai marcou 54,4%, enquanto o sistema da Anthropic chegou a 78%, indicando que o Mythos 5 mantém uma distância relevante quando a tarefa exige transformar vulnerabilidades identificadas em explorações efetivas.
Z.ai prepara lançamento com acesso controlado
IA – Imagem: Rawpixel.com/Shutterstock
A Z.ai pretende disponibilizar o GLM-5.3 publicamente em aproximadamente duas semanas. Antes disso, a companhia afirma que concluirá avaliações de segurança e aprimorará os mecanismos destinados a impedir usos maliciosos. As funções consideradas mais sensíveis deverão ficar inicialmente restritas a usuários verificados por meio de um programa de acesso confiável.
A estratégia representa uma mudança relevante para um modelo que a empresa pretende distribuir de forma aberta. A preocupação está no fato de que sistemas capazes de encontrar vulnerabilidades também podem facilitar ataques, especialmente quando seus pesos podem ser baixados, modificados e associados a outras ferramentas.
A empresa diz ter criado diferentes barreiras para reduzir esse risco. Entre elas estão filtros para pedidos potencialmente perigosos, mecanismos de acompanhamento da atividade do modelo e treinamento específico para que o sistema recuse solicitações consideradas maliciosas.
De acordo com a Z.ai, essas proteções procuram separar atividades ofensivas de aplicações legítimas, como conserto de falhas, aprendizado sobre segurança digital e avaliações autorizadas de sistemas. O problema apontado por críticos é que parte desses controles pode perder eficácia depois que o modelo passa a circular livremente e pode ser alterado por terceiros.
A preocupação com a abertura dos modelos foi um dos motivos apresentados pela empresa para estabelecer um período de acesso limitado. O lançamento inicial será destinado a um grupo selecionado de parceiros, com expansão posterior baseada em um processo que a Z.ai descreve como gradual e responsável.
Gabriel Wagner, pesquisador de governança de inteligência artificial da Concordia AI, avaliou que a decisão tem relevância para o cenário chinês de segurança de modelos abertos. Para ele, o adiamento do lançamento por razões de segurança representa um sinal de amadurecimento das práticas de gerenciamento de riscos relacionadas à distribuição dos pesos de sistemas de IA.
A estratégia também estabelece um paralelo com o Project Glasswing, iniciativa da Anthropic que restringe o acesso ao Mythos 5 a organizações previamente avaliadas. No caso chinês, entretanto, a Z.ai tenta apresentar a abertura do modelo como parte central da proposta, e não como uma vulnerabilidade comercial ou de segurança.
Disputa vai além dos testes de cibersegurança
Linhas de um código-fonte – (Reprodução: Chris Ried/Unsplash)
A Z.ai afirma que sistemas avançados de defesa digital não deveriam ficar concentrados entre poucos fornecedores de modelos fechados. A empresa defende que desenvolvedores de projetos abertos e equipes menores de segurança também possam utilizar recursos desse tipo.
Como parte dessa proposta, a companhia anunciou o Open Source Shield, iniciativa destinada a avaliar determinados projetos de código aberto, liberar o uso do modelo para atividades defensivas e incorporar recursos de auditoria de código ao ZCode, seu produto voltado à programação.
O desempenho do GLM-5.3 também precisa ser analisado em tarefas que envolvem maior duração. Em uma avaliação separada, a Z.ai informou que o sistema realizou 105 tarefas de desenvolvimento de ataques em duas horas e 130 em seis horas. O Mythos 5, nas mesmas janelas, completou 181 e 247 tarefas.
A Anthropic adotou uma estratégia mais restritiva com o Mythos. A empresa liberou o sistema, baseado no Claude Fable 5 e com suas proteções de cibersegurança retiradas, somente para organizações que passaram por avaliação prévia.
O GLM-5.3 não foi concebido exclusivamente como uma ferramenta de segurança. A Z.ai o apresenta como um modelo geral de programação que recebeu treinamento adicional e aprendizado por reforço para ampliar sua atuação em cibersegurança. A companhia afirma que partiu da mesma base utilizada no GLM-5.2 e ampliou o treinamento com ambientes de tarefas mais extensos e variados.
O movimento ocorre após o crescimento da popularidade do GLM-5.2 entre desenvolvedores de diferentes países. O modelo anterior ganhou espaço por suas capacidades de programação e de operação como agente, com usuários e analistas apontando desempenho próximo ao de sistemas norte-americanos de ponta, mas com custo consideravelmente menor.
A disputa também envolve outras empresas chinesas. Em junho, a companhia de segurança cibernética 360 declarou que seu sistema Tulongfeng havia atingido capacidade equivalente à do Mythos ao combinar modelos de IA, informações de segurança e ferramentas automatizadas. A alegação, assim como os números apresentados pela Z.ai sobre o GLM-5.3, não foi confirmada de forma independente.
No mês passado, a Hugging Face informou ter recorrido ao GLM-5.2 para se defender de uma invasão atribuída a um agente de inteligência artificial da OpenAI. O episódio reforçou o interesse pelo uso de modelos chineses em operações defensivas e mostrou que a tecnologia já vinha sendo empregada em cenários concretos de segurança.
A Anthropic, responsável pelo Claude, está em tratativas para adquirir a Decart AI, startup israelense de inteligência artificial avaliada em cerca de US$ 4 bilhões. Segundo informações divulgadas, a operação pode alcançar, no entanto, aproximadamente US$ 6 bilhões.
A negociação ocorre em meio à estratégia da Anthropic de reforçar sua capacidade computacional para acompanhar a expansão do Claude. A Decart desenvolve soluções de infraestrutura destinadas a elevar a velocidade e a eficiência de sistemas de inteligência artificial e também possui modelos próprios.
As conversas ainda estão em fase inicial. Caso o negócio avance, os profissionais da Decart deverão ser incorporados à equipe da Anthropic dedicada ao desempenho e à eficiência de seus modelos. A movimentação acontece enquanto a companhia também se prepara para uma possível oferta pública de ações nos Estados Unidos.
Decart recebeu aporte de US$ 300 milhões em maio
Anthropic é a criadora do Claude – Imagem: PhotoGranary02/Shutterstock
A Decart levantou US$ 300 milhões em uma rodada de investimentos liderada pela Radical Ventures. A Nvidia entrou como nova investidora, ao lado de companhias como Adobe, Amazon e Toyota Ventures. Após a captação, o valor atribuído à startup chegou a aproximadamente US$ 4 bilhões.
Entre as tecnologias desenvolvidas pela empresa está o Lucy, sistema voltado à edição de vídeos em tempo real. Outro produto é o Oasis, utilizado para criar ambientes virtuais destinados ao treinamento e à avaliação de robôs e de tecnologias de direção autônoma.
A eventual compra se encaixa no movimento da Anthropic para ampliar seus recursos de processamento. A empresa vem aumentando os gastos com infraestrutura para responder à procura por seus serviços e anunciou, na semana anterior, a contratação de profissionais especializados em hardware e software para trabalhar em chips próprios e em modelos de inteligência artificial mais rápidos e eficientes.
A Anthropic foi criada em 2021 por Dario Amodei e outros executivos que haviam deixado a OpenAI. A companhia chegou ao público com o Claude em março de 2023, aproximadamente cinco meses depois do lançamento do ChatGPT.
Desde então, a empresa ganhou espaço no mercado de inteligência artificial. O material fornecido informa que a Anthropic é avaliada em cerca de US$ 965 bilhões e já supera a OpenAI em valor de mercado. No início de junho, a companhia também apresentou de maneira confidencial um pedido para realizar uma oferta pública inicial nos Estados Unidos.
Claude Mythos amplia atenção sobre segurança
Claude Mythos – Imagem: Saulo Ferreira Angelo/Shutterstock
Além da expansão comercial e de infraestrutura, a Anthropic ganhou destaque pelas capacidades atribuídas ao Claude Mythos, apresentado no início de 2026. O modelo foi descrito no material como capaz de localizar vulnerabilidades de segurança que poderiam escapar à análise humana.
Especialistas ouvidos no conteúdo destacam que o avanço dessas capacidades também aumenta os riscos associados ao uso de sistemas de inteligência artificial. Izabela Anholett avaliou que os produtos da Anthropic costumam chegar ao mercado com desempenho competitivo e demonstram cuidado em seu desenvolvimento.
A mesma especialista alertou para o potencial de dano caso o Mythos fosse utilizado por pessoas mal-intencionadas. A preocupação está relacionada à capacidade atribuída ao sistema de detectar e explorar falhas em ambientes digitais.
Por causa dos riscos associados à ferramenta, o acesso ao Mythos não foi disponibilizado ao público em geral. Conforme o material, a Anthropic estabeleceu um grupo formado por empresas e órgãos governamentais que podem utilizar o sistema, incluindo Amazon, Apple, Microsoft, Google, Nvidia, Broadcom e Mozilla.
A Mozilla também aparece como exemplo da aplicação prática do modelo. De acordo com o conteúdo fornecido, uma versão inicial do Claude Mythos Preview foi utilizada na análise do Firefox, contribuindo para a identificação de vulnerabilidades que resultaram em 271 correções na versão 150 do navegador.
Diogo Cortiz, citado no material como especialista, considera que episódios desse tipo ajudam a demonstrar a capacidade do sistema para encontrar falhas de segurança. Ao mesmo tempo, ele pondera que empresas do setor de inteligência artificial podem apresentar seus produtos de maneira mais favorável do que suas capacidades reais.
A Anthropic está oferecendo salários que chegam a US$ 455 mil por ano para profissionais que vão ajudar a testar os limites de segurança de seus sistemas de inteligência artificial (IA). A empresa mantém uma equipe dedicada à segurança e ao combate a abusos, com vagas relacionadas a riscos biológicos, químicos e explosivos, cibernéticos, fraude e golpes, além de riscos radiológicos e nucleares.
Entre as posições estão profissionais responsáveis por testar os sistemas, investigar ameaças e analisar riscos em áreas como química, biologia, cibersegurança e armas nucleares e explosivos.
Apesar do aspecto incomum das vagas, o objetivo não é simplesmente pedir ao Claude que produza uma resposta proibida e verificar se ele obedece. A Anthropic coloca seus modelos à prova de diferentes maneiras para descobrir se alguém poderia contornar suas barreiras de segurança e usar a IA para causar danos. O trabalho serve para identificar essas falhas antes que elas sejam exploradas.
Por que a Anthropic quer “quebrar” o Claude?
A Anthropic mantém uma equipe chamada Frontier Red Team, voltada a testar sistemas de IA para entender suas capacidades e identificar riscos que podem surgir à medida que os modelos avançam. O nome vem de red teaming, prática de segurança em que uma equipe assume o papel de um possível atacante para tentar encontrar falhas em um sistema. No caso da IA, isso significa procurar maneiras de contornar as barreiras de segurança e descobrir se o modelo pode ser usado para causar danos.
Entre os focos estão ameaças químicas, biológicas, radiológicas e nucleares, cibersegurança e riscos relacionados à autonomia dos sistemas.
Nesse trabalho, a empresa combina testes feitos por pesquisadores, especialistas de diferentes áreas e sistemas automatizados. A Anthropic afirma que especialistas externos podem ajudar tanto a testar os modelos quanto a desenvolver novas formas de avaliação. Dependendo do risco analisado, os profissionais podem trabalhar com versões do Claude disponíveis ao público ou com modelos não comerciais submetidos a diferentes mecanismos de segurança.
Gabriel Cunha, especialista em IA da Oracle, explicou ao Olhar Digital que “a função é fazer com que a capacidade institucional de identificar riscos e estabelecer controles acompanhe o avanço das capacidades dos modelos”.
Especialistas atacam o sistema e verificam se o modelo oferece uma vantagem real em relação ao que uma pessoa já conseguiria fazer sem ele.
Gabriel Cunha, especialista em IA da Oracle
A própria Anthropic descreve um processo que começa com testes feitos por especialistas e pode depois ser ampliado com sistemas automatizados. Primeiro, os profissionais definem o tipo de ameaça que querem investigar e procuram formas de fazer o sistema apresentar comportamentos de risco. Conforme entendem melhor o problema, os testes podem ser repetidos em centenas ou milhares de situações diferentes.
A empresa também usa modelos de IA para ajudar nessa tarefa. Um sistema pode criar tentativas de ataque para testar outro modelo e, a partir dos resultados, ajudar a desenvolver novas formas de proteção. O processo é repetido para verificar se as barreiras continuam funcionando mesmo depois que novas formas de ataque são descobertas.
Claude, chatbot da Anthropic – Imagem: Mijansk786/Shutterstock
Não basta fazer a IA responder algo proibido
Uma das razões para a Anthropic trabalhar com especialistas de áreas tão diferentes é que uma resposta inadequada não significa, por si só, que o modelo tenha uma capacidade capaz de produzir dano no mundo real. O especialista precisa avaliar se aquilo que o sistema produziu está correto e pode ser aplicado na prática.
“Conseguir que uma IA responda algo proibido não demonstra, por si só, um risco real”, afirma Rodrigo Gava, CTO da Vultus e especialista em cibersegurança. “O ponto é avaliar se a resposta está tecnicamente correta, se é operacionalmente viável e se reduz de maneira relevante o conhecimento, o tempo ou o custo necessário para causar dano.”
Em cibersegurança, ele dá um exemplo: “Um código pode parecer sofisticado e não funcionar, enquanto uma sequência de informações aparentemente inofensivas pode completar uma cadeia real de exploração.”
A própria Anthropic segue essa lógica em seus testes de segurança. Os especialistas primeiro definem qual ameaça querem investigar, que tipo de informação poderia ser usada para causar dano e o que seria necessário para que o modelo realmente ajudasse alguém a realizar essa ação. Em uma avaliação de riscos biológicos, por exemplo, mais de 150 horas foram dedicadas a testes com especialistas em biossegurança.
O mesmo aconteceu na avaliação de riscos nucleares. Em parceria com a National Nuclear Security Administration (NNSA), dos Estados Unidos, especialistas da agência passaram um ano testando modelos Claude em um ambiente seguro. O trabalho ajudou a Anthropic a criar uma ferramenta capaz de identificar conversas potencialmente relacionadas ao desenvolvimento de armas nucleares.
Em testes preliminares, a ferramenta identificou 94,8% das consultas relacionadas a armas nucleares e não apresentou falsos positivos no conjunto avaliado. A precisão geral foi de 96,2%. Segundo a Anthropic, o sistema foi posteriormente usado em parte do tráfego do Claude para ajudar a identificar possíveis usos indevidos.
Como os especialistas tentam encontrar as falhas
Segundo Gava, “o processo normalmente começa com um modelo de ameaça: quem é o potencial atacante, qual é seu objetivo, quais recursos possui e o que seria considerado sucesso”. A partir daí, são criados cenários para tentar provocar comportamentos que indiquem uma vulnerabilidade.
Os testes não se limitam necessariamente a um pedido direto ao modelo. Os profissionais podem testar conversas em várias etapas, reformulações de um mesmo pedido, mudanças de idioma e contexto, uso de ferramentas, agentes autônomos e combinações de técnicas. A intenção é encontrar situações em que uma proteção isolada pareça funcionar, mas possa ser contornada quando diferentes recursos são combinados.
Depois que os especialistas identificam um problema, a Anthropic pode transformar aquela situação em um teste que será repetido em centenas ou milhares de variações. Dessa forma, a empresa consegue verificar se a falha aparece novamente e se as mudanças feitas no modelo realmente resolveram o problema.
A empresa também usa inteligência artificial para ajudar nessa tarefa. Um modelo pode criar tentativas de ataque para testar outro sistema, e os resultados podem ser usados para desenvolver novas formas de proteção. O processo então é repetido para verificar se as barreiras continuam funcionando.
Os modelos também são testados contra ataques complexos
A necessidade de testar os modelos também cresce à medida que eles se tornam capazes de encontrar formas de explorar sistemas. Em maio de 2026, a Anthropic afirmou que o Claude Mythos Preview conseguia encontrar vulnerabilidades, transformá-las em formas de exploração e combinar diferentes etapas para realizar ataques completos.
Em outro estudo, a Anthropic avaliou o Claude Opus 4 e o Claude Sonnet 4 em desafios de cibersegurança que iam de exercícios individuais a simulações de redes complexas. Segundo a empresa, os modelos apresentaram avanços tanto na identificação de vulnerabilidades quanto na execução de ataques com várias etapas, embora ainda tivessem dificuldades para manter planos longos diante de obstáculos inesperados.
O avanço também aparece na busca por falhas ainda desconhecidas, conhecidas como zero-days. Em fevereiro, a Anthropic afirmou que o Claude Opus 4.6 havia melhorado significativamente a capacidade de encontrar vulnerabilidades graves em escala em comparação com modelos anteriores. A empresa defendeu que esse tipo de capacidade pode ser usado para reforçar a defesa de sistemas.
Para Gabriel Cunha, situações como essas ajudam a explicar por que as empresas precisam testar não apenas respostas individuais, mas também a capacidade dos modelos de combinar diferentes recursos para atingir um objetivo. Quanto mais tarefas um sistema consegue executar sozinho, maior é a necessidade de avaliar o que pode acontecer quando essas capacidades são utilizadas em conjunto.
A própria Anthropic mantém a equipe Frontier Red Team para acompanhar esse avanço. Em 2026, o grupo publicou avaliações sobre exploração de vulnerabilidades, ataques cibernéticos e ameaças relacionadas ao uso de IA por agentes mal-intencionados. A empresa afirma que o objetivo é entender as capacidades atuais dos modelos e antecipar o que pode surgir à medida que elas evoluem.
Nenhum teste consegue garantir que a IA é segura
Apesar de todo esse esforço, os testes não conseguem garantir que uma IA seja completamente segura. Há uma quantidade praticamente ilimitada de combinações possíveis entre comandos, contexto, ferramentas e comportamentos de um modelo. Além disso, novas versões ou recursos podem criar vulnerabilidades que não existiam durante avaliações anteriores.
A principal limitação é que nenhum red team consegue cobrir à exaustão todos os cenários que definem com certeza que a IA é segura. Os modelos são probabilísticos, o espaço de interação é praticamente infinito e os atacantes adaptam suas técnicas.
Rodrigo Gava, CTO da Vultus
A própria Anthropic reconhece essas limitações. Em uma análise sobre segurança de IA, a empresa afirma que os testes para riscos de segurança nacional ainda são mais “arte do que ciência”, já que não existe uma forma totalmente padronizada de provocar comportamentos preocupantes nos modelos.
Testes de segurança não conseguem garantir que uma inteligência artificial esteja livre de vulnerabilidades – Imagem: The KonG / Shutterstock
Há ainda um equilíbrio entre dois tipos de erro. Um falso negativo ocorre quando uma tentativa de abuso não é identificada e consegue passar pelos mecanismos de proteção. Já um falso positivo pode fazer com que uma atividade legítima seja bloqueada porque o sistema a classificou como potencialmente perigosa.
Por isso, a Anthropic combina diferentes mecanismos de proteção. Entre eles estão os testes de segurança, programas que recompensam quem encontra falhas, monitoramento e sistemas automatizados para identificar tentativas de contornar as barreiras dos modelos.
No Frontier Safety Roadmap, a empresa estabeleceu como meta desenvolver, até janeiro de 2027, um sistema capaz de encontrar novas formas de contornar as proteções contra armas químicas e biológicas em escala. A Anthropic também pretende criar ferramentas capazes de investigar automaticamente ataques cibernéticos sofisticados envolvendo Claude.
É por isso que a Anthropic procura especialistas tão específicos
As vagas abertas pela Anthropic mostram como essa estrutura funciona na prática. A empresa procura profissionais para diferentes funções, incluindo especialistas em segurança biológica, riscos químicos e explosivos, cibersegurança, fraude e golpes, além de riscos radiológicos e nucleares.
As funções são diferentes. Uma delas é a de Red Team Engineer, profissional responsável por tentar encontrar falhas nos sistemas antes que elas sejam exploradas. A vaga exige experiência em segurança de IA e testes de segurança, além de conhecimentos sobre formas de contornar as barreiras dos modelos. A faixa salarial anunciada fica entre US$ 320 mil e US$ 405 mil por ano.
Outra posição é a de gerente de inteligência de ameaças relacionadas a riscos químicos, biológicos, radiológicos, nucleares e explosivos. O profissional será responsável por liderar uma equipe dedicada a detectar e investigar tentativas de usar os sistemas da Anthropic para esses fins. O salário para a posição chega a US$ 455 mil anuais.
Há ainda funções que exigem experiência diretamente relacionada à área de risco. Uma das vagas voltadas à segurança biológica, por exemplo, pede pelo menos oito anos de experiência prática em ciências da vida, além de conhecimentos em áreas como biologia molecular, descoberta de medicamentos ou biologia computacional.
A divisão mostra que a estratégia não se resume a fazer o Claude recusar determinados pedidos. A Anthropic procura profissionais para encontrar vulnerabilidades, avaliar riscos, investigar possíveis abusos e transformar essas descobertas em novas formas de proteção.
A Anthropic quer automatizar parte desse trabalho
A Anthropic considera que o crescimento das capacidades dos modelos também exige ampliar a escala dos testes. No Frontier Safety Roadmap, a empresa afirma que já testa continuamente suas proteções e usa programas que recompensam pessoas capazes de encontrar formas de contorná-las. A companhia diz que, no futuro, pode precisar enfrentar tentativas de abuso mais sofisticadas.
Uma das metas para janeiro de 2027 é desenvolver um sistema capaz de encontrar novas formas de contornar as proteções contra armas químicas e biológicas em uma escala maior do que a alcançada atualmente pelos participantes do programa de recompensas. A empresa afirma que esse trabalho deverá envolver automação.
A Anthropic também pretende desenvolver, até o mesmo período, um sistema capaz de investigar automaticamente a maioria dos ataques cibernéticos sofisticados que utilizem Claude, com pouca ou nenhuma intervenção humana. A ideia é identificar padrões que indiquem tentativas coordenadas de abuso, em vez de apenas bloquear respostas individuais.
Assim, especialistas de domínio trabalham em conjunto com pesquisadores e engenheiros para determinar quais capacidades representam riscos relevantes, quais guardrails são necessários e em que condições um modelo pode ser disponibilizado com segurança.
Gabriel Cunha, especialista de IA da Oracle
Os guardrails são as barreiras de segurança criadas para limitar comportamentos de risco dos modelos, como tentativas de usar a IA para atividades ilegais ou perigosas.
O desafio, porém, permanece aberto. À medida que os modelos ganham novas capacidades e passam a combinar ferramentas e informações de maneiras que não estavam previstas nas avaliações anteriores, os próprios mecanismos de teste precisam evoluir. Para Rodrigo Gava, a função do red team não é declarar que uma IA é definitivamente segura, mas reduzir a possibilidade de que uma vulnerabilidade passe despercebida até ser explorada fora do ambiente de avaliação.
Um modelo de IA ainda não lançado da Anthropic conseguiu avançar em um dos grandes problemas não resolvidos da matemática: a Hipótese de Riemann. A IA aumentou significativamente o limite inferior de soluções para as quais a hipótese é válida, mas ainda não encontrou uma prova definitiva.
O resultado chama atenção pelo método usado. Um funcionário da Anthropic sem formação matemática significativa pediu que o modelo tentasse provar a hipótese e, depois, deixou a IA coordenar o trabalho por cerca de um dia e meio.
A IA da Anthropic não resolveu a Hipótese de Riemann, mas ampliou o limite de soluções para as quais a hipótese permanece válida. – Imagem: PhotoGranary02/Shutterstock
Um desafio que dura mais de 150 anos
A Hipótese de Riemann é um dos grandes mistérios da matemática e está relacionada à distribuição dos números primos. Uma prova geral da hipótese vale atualmente US$ 1 milhão, cerca de R$ 5,16 milhões.
Assim como outros modelos de inteligência artificial, o sistema da Anthropic ainda não conseguiu solucionar definitivamente o problema. Mesmo assim, o avanço mostra que essas ferramentas podem explorar problemas matemáticos complexos de maneira bem mais profunda do que simplesmente fornecer respostas baseadas em conhecimentos existentes.
Tudo começou com um pedido direto. O funcionário solicitou que a IA desse uma “tentativa de verdade” de provar a hipótese. A partir daí, o modelo passou a coordenar a tarefa durante aproximadamente 36 horas.
650 ideias testadas pela inteligência artificial
O trabalho envolveu uma quantidade impressionante de tentativas e verificações:
650 ideias diferentes foram testadas;
60 subagentes participaram da tarefa;
31 milhões de tokens de saída foram utilizados;
dois subagentes desenvolveram as principais ideias matemáticas;
outros 13 contribuíram com sugestões para esses agentes.
A divisão das funções também foi curiosa. Trinta subagentes tentaram desenvolver novas ideias, mas não conseguiram chegar a abordagens inéditas. Outros 13 ficaram encarregados de validar os argumentos. Os dois últimos ajudaram a preparar a versão inicial do artigo.
“Dos 60 subagentes, dois foram responsáveis pelo desenvolvimento das principais ideias matemáticas”, explica uma nota de rodapé do trabalho.
O resultado foi confirmado por dois matemáticos da Anthropic e formalizado com o Lean, assistente de provas de código aberto.
A Hipótese de Riemann tem mais de 150 anos e continua sem uma prova geral. A IA, porém, conseguiu avançar na investigação. – Imagem criada por inteligência artificial. Gemini/Olhar Digital
A matemática ainda está dividida
O episódio faz parte de uma sequência de avanços envolvendo grandes modelos de linguagem. Neste ano, diferentes sistemas de IA já ajudaram a resolver problemas de Erdős. A Anthropic também apresentou um trabalho que contestou a antiga conjectura de Jacobian, enquanto a OpenAI divulgou dez resultados comprovados por seu modelo interno, chamado Astra.
A evolução, porém, divide opiniões. Em junho, matemáticos levantaram preocupações sobre o impacto da IA em princípios tradicionais da área, especialmente a ideia de que provas devem ser atribuídas a autores que assumam responsabilidade por suas descobertas e correção.
O medalhista Fields Timothy Gowers apresentou uma visão diferente. Para ele, a presença crescente da IA pode transformar a matemática de uma maneira mais complexa — e talvez positiva.
“Se chegarmos a um mundo em que os teoremas matemáticos não estejam mais associados aos matemáticos, talvez isso não seja mais problemático do que o fato de as estrelas não receberem nomes de astrônomos e de a maioria nem sequer ter nome”, escreveu Gowers em seu blog.
O caso da Anthropic mostra que a IA ainda não resolveu a Hipótese de Riemann, mas já consegue explorar caminhos que seriam difíceis de testar manualmente em escala semelhante.
A Anthropic anunciou que pretende aplicar marcas invisíveis em textos e imagens criados pelo Claude. A iniciativa busca facilitar a identificação de conteúdos gerados por IA e atender às novas exigências de transparência previstas pelas regras da União Europeia.
Segundo a empresa, os novos modelos Claude terão a marcação desde o lançamento, enquanto a implementação nos modelos atuais ainda está em desenvolvimento. A identificação também deverá acompanhar o conteúdo quando ele for copiado para outros lugares.
A Anthropic quer transformar textos gerados pelo Claude em conteúdos com uma espécie de assinatura invisível. – Imagem: PhotoGranary02/Shutterstock
Marca ficará escondida nos textos
Nos textos, a Anthropic pretende incorporar uma “marca d’água imperceptível” diretamente ao conteúdo produzido pelo Claude. Segundo a empresa, o recurso não altera o significado, a qualidade nem a legibilidade das respostas.
A marca será aplicada no nível do modelo, e não apenas em um produto específico. Por isso, também deverá aparecer quando o Claude for acessado por diferentes serviços, incluindo:
Claude;
Claude Platform (API);
Claude Code;
Claude Cowork;
Claude Tag.
A empresa afirma ainda que a marca poderá continuar presente após copiar e colar o texto e resistir a alguns tipos de edição.
Imagens terão outro sistema
Para imagens processadas pelo Claude, a tecnologia escolhida será o C2PA, um padrão de metadados de procedência. O sistema permite registrar informações sobre a origem de arquivos compatíveis e já é utilizado por Adobe, OpenAI e Google.
Para os textos, porém, a Anthropic ainda não revelou detalhes sobre o método usado para criar as marcas.
“Como a marca d’água faz parte do texto, ela viajará com o texto quando ele for copiado e colado em outro lugar e poderá persistir após algumas edições”, explica a Anthropic.
A tecnologia promete identificar conteúdo de IA, mas a própria Anthropic admite que as marcas não serão infalíveis. – Imagem: Mijansk786/Shutterstock
Tecnologia de IA ainda tem limitações
A própria Anthropic reconhece que o sistema não será infalível. Dados do C2PA podem ser removidos, inclusive acidentalmente, quando arquivos são enviados para determinadas plataformas. A resistência das marcas aplicadas aos textos também ainda não está clara.
A empresa trabalha para permitir que usuários e terceiros detectem as marcas e os metadados de procedência. Detalhes sobre esse sistema devem aparecer em uma futura documentação técnica.
Outro cuidado é não interpretar a ausência de uma marca como prova de que determinado conteúdo não foi criado por IA. A Anthropic ressalta que materiais sem identificação detectável ainda podem ter origem em modelos generativos.
A iniciativa amplia a tentativa de tornar conteúdos produzidos por inteligência artificial mais identificáveis na internet. O resultado, porém, dependerá de quanto essas marcas conseguirão resistir a cópias, edições e alterações nos arquivos.