O dilema do Claude 4.5: Nova IA empata com os melhores programadores e torna testes inúteis
Publicado em 22 de janeiro de 2026 às 20:01
2 min de leituraO Anthropic Claude está criando um curioso dilema para recrutadores de tecnologia. Desde 2024, a equipe de otimização de desempenho da Anthropic vem utilizando testes técnicos para avaliar candidatos a emprego, mas agora enfrenta um problema peculiar: suas próprias criações de IA estão tornando esses testes obsoletos ao superarem candidatos humanos.
De acordo com Tristan Hume, líder da equipe, cada nova versão do assistente de IA da empresa tem forçado uma completa reformulação dos testes aplicados. A situação chegou a um ponto crítico quando, sob as mesmas condições e limites de tempo, o Claude Opus 4 conseguiu desempenho superior ao da maioria dos candidatos humanos avaliados.
Mesmo esse cenário ainda permitia identificar os candidatos excepcionais, até que o Claude Opus 4.5 elevou o nível novamente, igualando-se até mesmo aos melhores talentos humanos que participaram do processo seletivo. Essa evolução criou um verdadeiro paradoxo para a equipe de recrutamento.
Representação visual da inteligência artificial Anthropic Claude com conexões neurais em destaque. "Sob as restrições do teste para fazer em casa, não tínhamos mais como distinguir entre a produção dos nossos melhores candidatos e a do nosso modelo mais capaz", explicou Hume em publicação no blog oficial da empresa.
A ironia não passa despercebida: os mesmos laboratórios de IA que desenvolvem ferramentas cada vez mais sofisticadas agora precisam lidar com o potencial uso delas para trapacear em seus próprios processos seletivos. Sem supervisão presencial, tornou-se praticamente impossível garantir que candidatos não estejam utilizando assistentes de IA para resolver os desafios propostos.
O problema da trapaça com IA já causa estragos em escolas e universidades ao redor do mundo, como reportado pelo Wall Street Journal. No entanto, a Anthropic encontra-se em posição única para enfrentar esse desafio, justamente por conhecer profundamente as capacidades e limitações de seus modelos.
A solução encontrada por Hume foi desenvolver um novo teste menos focado em otimização de hardware e mais em aspectos para os quais as IAs atuais ainda não foram adequadamente treinadas, tornando-o suficientemente inovador para confundir até mesmo assistentes avançados como o próprio Claude.
Como parte da publicação, a Anthropic compartilhou o teste original e lançou um desafio aos leitores: "Se você conseguir superar o Opus 4.5, adoraríamos ouvir de você" – uma estratégia que funciona simultaneamente como recrutamento e benchmark para avaliar as limitações de seus modelos mais recentes.
Você também pode gostar dos artigos abaixo:
Anthropic fecha acordo bilionário com Google Cloud e terá acesso a 1 milhão de chips de IA
Anthropic cria agentes de IA que auditam outras IAs; entenda
Fonte: Hardware.com.br
Leia também
- Claude Guillemot, cofundador da Ubisoft, morre em acidente de avião na França

O cofundador da Ubisoft, Claude Guillemot, de 69 anos, morreu em um acidente com uma aeronave de pequeno porte, o bimotor Cessna 421 no oeste da França. Segundo a Reuters, o acidente ocorreu na noite de ontem, 19, em um campo próximo ao Aeroporto de La Baule, na costa atlântica francesa.
💬 0 - Anker Soundcore P30i com 43% OFF: Fone com ANC inteligente, bateria de 45h e 4 opções de cores

Se você está procurando um fone de ouvido bluetooth que una tecnologia, conforto e um preço acessível, o Anker Soundcore P30i merece sua atenção – especialmente agora, com 43% de desconto. E o melhor: você pode escolher entre quatro cores diferentes para combinar com seu estilo.
💬 0 - A Fighter’s Nova: Mindara é um novo RPG com visuais inspirados em mangás e combate de jogos de luta
BadRez Games anunciou A Fighter’s Nova: Mindara, um RPG inspirado na cultura japonesa que combina uma narrativa rica com a intensidade de um jogo de luta autêntico. O jogo será lançado para PC via Steam, além de uma campanha de financiamento no Kickstarter que será lançada em breve.
💬 0