A segurança da inteligência artificial acaba de enfrentar um novo desafio. Pesquisadores da Check Point Research (CPR), divisão de inteligência de ameaças da Check Point Software, identificaram uma técnica inédita capaz de esconder comandos maliciosos dentro de textos aparentemente comuns, sem utilizar códigos suspeitos, caracteres especiais ou qualquer elemento que normalmente despertaria a atenção dos sistemas de proteção.
Batizada de PuzzleMask, a técnica chamou a atenção da comunidade de cibersegurança após conseguir driblar modelos de IA responsáveis por analisar conteúdos antes de serem processados por sistemas mais avançados. Segundo os pesquisadores, a descoberta revela uma vulnerabilidade importante em arquiteturas amplamente utilizadas por empresas que adotam assistentes virtuais, copilotos corporativos e agentes de inteligência artificial.
Como funciona a técnica PuzzleMask?
Diferentemente dos ataques tradicionais contra inteligência artificial, a PuzzleMask não utiliza códigos ocultos, emojis, texto invisível ou formatações incomuns. O método consiste em inserir instruções maliciosas dentro de narrativas aparentemente inocentes, como histórias, poemas ou textos escritos em linguagem natural.
Para um sistema de triagem convencional, o conteúdo parece totalmente legítimo. Porém, quando chega a modelos mais sofisticados e com maior capacidade de raciocínio, as instruções escondidas podem ser identificadas e executadas.
Esse comportamento preocupa especialistas porque muitas empresas utilizam uma estrutura em duas etapas:
- Um modelo mais leve faz a análise inicial do conteúdo;
- Um modelo mais avançado executa a solicitação final;
- A primeira camada funciona como uma espécie de filtro de segurança;
- A PuzzleMask explora justamente a diferença de capacidade entre esses dois sistemas.
Taxa de sucesso impressiona pesquisadores
Durante os experimentos conduzidos pela Check Point Research, quatro modelos de IA utilizados como barreira de proteção falharam em identificar todas as instruções ocultas incorporadas aos textos.
O resultado foi considerado surpreendente pelos pesquisadores:
| Teste realizado | Resultado |
|---|---|
| Instruções apresentadas de forma direta | 100% detectadas |
| Instruções ocultas com PuzzleMask | 100% passaram despercebidas |
| Total de testes de evasão | 23 de 23 bem-sucedidos |
| Recuperação por modelo avançado | 17 de 18 tentativas |
Em outras palavras, os filtros de segurança não encontraram qualquer ameaça, mas os modelos mais avançados conseguiram interpretar e executar as instruções escondidas na maioria dos casos.
Por que isso preocupa as empresas?
O avanço da inteligência artificial nos ambientes corporativos tem ampliado o acesso dos sistemas a informações estratégicas, bancos de dados, aplicações internas e fluxos de trabalho críticos.
Nesse cenário, um simples documento recebido por e-mail, uma página da internet ou até mesmo um texto compartilhado em uma plataforma corporativa pode conter comandos ocultos capazes de influenciar o comportamento da IA.
O principal risco está no fato de que a ameaça pode atravessar a camada inicial de proteção sem levantar qualquer suspeita.
Segundo os pesquisadores, organizações que utilizam agentes autônomos de IA precisam começar a monitorar não apenas o que entra no sistema, mas também o que acontece após o processamento das informações.
PuzzleMask não é um jailbreak
Os especialistas destacam que a técnica não deve ser confundida com os chamados jailbreaks, métodos usados para convencer uma inteligência artificial a ignorar suas próprias regras de segurança.
No caso da PuzzleMask, o ataque acontece antes mesmo de o modelo principal receber o conteúdo. O objetivo é enganar a camada de verificação responsável por aprovar ou bloquear solicitações.
Isso significa que o modelo avançado continua seguindo suas regras normalmente. O problema é que ele recebe informações que não deveriam ter passado pela triagem inicial.
Modelos mais robustos apresentaram resistência
Nem todos os sistemas testados apresentaram vulnerabilidade.
Segundo a Check Point Research, modelos da categoria Opus, desenvolvidos pela Anthropic, conseguiram resistir ao ataque durante os testes realizados.
A hipótese dos pesquisadores é que esses sistemas possuam mecanismos capazes de identificar sinais de processamento oculto durante o raciocínio interno, em vez de analisar apenas as características visíveis do texto recebido.
O futuro da segurança em inteligência artificial
A descoberta da PuzzleMask reforça um debate cada vez mais importante no setor de tecnologia: a segurança dos sistemas de inteligência artificial não pode depender exclusivamente da inspeção das entradas.
À medida que assistentes virtuais, agentes inteligentes e copilotos corporativos assumem tarefas mais complexas, torna-se necessário monitorar também suas ações, decisões e interações com sistemas empresariais.
Entre as recomendações apontadas pelos especialistas estão:
- Fortalecer os mecanismos de triagem de prompts;
- Monitorar continuamente o comportamento dos modelos;
- Implementar proteção em tempo real;
- Utilizar inteligência de ameaças específica para IA;
- Reduzir a diferença de capacidade entre os modelos de triagem e os modelos principais.
A pesquisa demonstra que, no atual estágio da inteligência artificial, a segurança precisa acompanhar a evolução tecnológica na mesma velocidade. Caso contrário, técnicas como a PuzzleMask poderão abrir novas portas para ataques cada vez mais sofisticados e difíceis de detectar.
Receba em primeira mão nossas notícias, tendências e exclusivas.