Em Alta Eleições 2026 PolíticaNotíciasAcontecimentos internacionaisPessoasConflitoseconomiaFutebol

Converse com o Telinha

Telinha
Oi! Posso responder perguntas apenas com base nesta matéria. O que você quer saber?

Experimento derruba barreiras em IAs do Google e Meta em curto prazo

Estudo revela facilidade de driblar guardrails em Gemma 3 e Llama 3.3, bases de Gemini e Meta AI, gerando alerta à segurança e necessidade de atualizações constantes

Gemma 3 foi um dos modelos open source considerados no estudo (imagem: divulgação/Google)
0:00
Carregando...
0:00

Um estudo conduzido pela empresa de cibersegurança Alice (antiga ActiveFence) revelou vulnerabilidades em modelos de IA usados como base para o Gemini, do Google, e o Meta AI, derivados de Gemma 3 e Llama 3.3. O teste mostrou que, em apenas 10 minutos, barreiras que impedem respostas perigosas foram derrubadas usando a ferramenta gratuita Heretic no GitHub.

Segundo a pesquisa, o funcionamento abriu espaço para explicações sobre temas sensíveis, incluindo dispersão de gases tóxicos e conteúdos ligados à pedofilia. Até o momento, o mecanismo já seria utilizado para desenvolver cerca de 3,5 mil LLMs sem controles, com mais de 13 milhões de downloads. A superfície de segurança do Gemma 4 também foi derrubada pouco depois de ficar disponível.

A avaliação reforça a importância dos chamados guardrails para uso responsável. Em paralelo, casos anteriores mostraram que plataformas com IA podem sofrer falhas de conteúdo. O Google tratou o assunto como um “desafio técnico conhecido em modelos de código aberto”, limitado aos lançamentos pré‑comercialização, sem confirmar detalhes ao portal Resultsense. A Meta não comentou o assunto quando procurada.

A pesquisa aponta que o método de derrubada, chamada de abliiteration, é mais fácil de aplicar em modelos abertos do que em sistemas proprietários como ChatGPT ou Claude. Pesquisadores ressaltam que há um prazo de validade para a técnica, exigindo atualizações semestrais ou anuais. Especialistas consultados pelo SQ Magazine também indicaram que modelos públicos podem reagir de forma diferente conforme o contexto.

Em abril, a Anthropic anunciou Claude Mythos, uma IA de alto poder que não foi disponibilizada amplamente, citando riscos de uso malicioso. A empresa criou o Project Glasswing, com participação de Apple, Google e AWS, para desenvolver mecanismos de proteção contra ataques envolvendo IA avançada.

Comentários 0

Entre na conversa da comunidade

Os comentários não representam a opinião do Portal Tela; a responsabilidade é do autor da mensagem. Conecte-se para comentar

Veja Mais