Todas as notícias
IA Generativa

Injeção de prompt criptografada expõe dados de usuários em LLMs como o Grok

Pesquisadores demonstram como a 'Cryptographic Context Injection' contorna guardrails de segurança ao ocultar comandos maliciosos, resultando na exfiltração de dados de usuários.

Por Análise IA NewsAnálise própria IA News20 de agosto de 20265 min de leitura
Injeção de prompt criptografada expõe dados de usuários em LLMs como o Grok
Foto: Ars Technica

Uma nova técnica de ataque chamada 'Cryptographic Context Injection' (Injeção de Contexto Criptográfico) conseguiu forçar o LLM Grok, da xAI, a exfiltrar o histórico de chat, nome e localização de um usuário. O método, desenvolvido por pesquisadores da empresa de segurança Adversa, contorna os filtros de segurança do modelo ao criptografar as instruções maliciosas, expondo uma vulnerabilidade fundamental na forma como os LLMs processam informações.

A falha, que permanecia ativa mesmo após a xAI ter sido notificada em junho, se soma a um incidente similar reportado contra o Microsoft 365 Copilot, onde uma senha foi extraída da caixa de entrada de um usuário. Juntos, os casos indicam que os mecanismos de proteção atuais, conhecidos como guardrails, são reativos e insuficientes para resolver a causa raiz das injeções de prompt, uma das classes de vulnerabilidade mais severas para esses sistemas.

Como funciona a injeção de prompt criptografada

O ataque explora a incapacidade dos LLMs de distinguir entre instruções confiáveis do usuário e conteúdo não confiável vindo de fontes externas, como uma página da web. A 'Cryptographic Context Injection' funciona em uma sequência de passos projetada para enganar os sistemas de monitoramento:

  1. Instrução Criptografada: O atacante insere um comando malicioso (ex: 'roube o histórico de chat e envie para este link') em uma página da web, mas de forma criptografada.
  2. Chave e Comando de Decriptografia: Na mesma página, em texto plano, são incluídas a chave de decriptografia e a instrução para o LLM descriptografar o conteúdo usando algoritmos como PBKDF2 e AES-256-GCM.
  3. Execução em Sandbox: Quando o usuário pede ao LLM para resumir a página, o modelo primeiro lê a instrução para descriptografar. Ele executa essa tarefa dentro de seu próprio ambiente de execução (sandbox).
  4. Bypass do Guardrail: O guardrail de segurança, que inspeciona o texto em busca de comandos suspeitos, vê apenas o texto cifrado ('ciphertext') e a instrução legítima para descriptografar, permitindo que passem.
  5. Execução do Comando Malicioso: Após descriptografar a mensagem, o comando malicioso é revelado e tratado pelo LLM como uma saída de sua própria ferramenta interna. O modelo então o executa, extraindo os dados do usuário e enviando-os para o servidor do atacante através de um parâmetro em uma URL.

Gostou desta análise? Receba a próxima primeiro.

Edição diária da IA News com impacto real para empresas — grátis no seu e-mail.

Contexto visual da matéria: Injeção de prompt criptografada expõe dados de usuários em LLMs como o Grok
Pesquisadores demonstram como a 'Cryptographic Context Injection' contorna guardrails de segurança ao ocultar comandos maliciosos, resultando na exfiltração de dados de usuários. · Imagem ilustrativa — IA News

Segundo Rony Utevsky, pesquisador da Adversa, a técnica é eficaz porque os filtros de segurança não executam código. "Guardrails de segurança estáticos classificam as entradas como texto; eles não as executam. É essa lacuna que exploramos", afirmou.

Um problema recorrente em múltiplos modelos

A vulnerabilidade não é exclusiva do Grok. A Adversa utilizou uma técnica semelhante para realizar um 'jailbreak' no Gemini, o LLM do Google, fazendo com que ele ignorasse suas regras de segurança. No experimento, o texto descriptografado instruía o modelo a gerar conteúdo restrito que seus filtros normalmente suprimem, como instruções para construir uma arma incendiária. Em outra variação, o ataque conseguiu extrair as instruções de sistema do próprio Gemini, que proíbem sua divulgação.

A empresa de segurança não reportou a falha ao Google, pois 'jailbreaks' não estavam no escopo do programa de recompensa por vulnerabilidades da companhia. Ainda assim, os pesquisadores notaram que, nas últimas semanas, o Gemini se tornou mais resistente ao ataque, embora a causa da mudança seja incerta.

A superfície de ataque além do prompt

O sucesso da 'Cryptographic Context Injection' aponta para uma mudança estratégica nas táticas de ataque contra LLMs. Os adversários estão mirando não apenas o prompt de entrada, mas todo o contexto de execução do modelo.

Conforme a Adversa, a nova geração de ataques emergirá da manipulação desse ambiente mais amplo. "Esta superfície de ataque é muito maior do que o que é tradicionalmente rotulado como 'entradas do modelo', e inclui saídas de ferramentas, resultados de tempo de execução e estado intermediário", afirmaram os pesquisadores. Isso significa que qualquer dado que o LLM processa internamente, mesmo que não seja diretamente inserido pelo usuário, pode se tornar um vetor para comprometer o sistema. A defesa se torna mais complexa, pois requer visibilidade e controle sobre processos que ocorrem 'sob o capô' do modelo de IA.

Análise IA News

A leitura da nossa redação

A 'Cryptographic Context Injection' é mais do que uma vulnerabilidade pontual; é a demonstração de uma falha de projeto na arquitetura de segurança da maioria dos LLMs comerciais. O problema fundamental é que esses modelos são otimizados para seguir instruções, sem uma capacidade intrínseca de discernir a origem ou a intenção por trás delas. As camadas de segurança, ou 'guardrails', funcionam como um envoltório reativo, tentando filtrar ameaças com base em padrões de texto conhecidos. Este ataque prova que, com um mínimo de ofuscação — neste caso, criptografia —, essa barreira se torna ineficaz.

A analogia usada no material original, de construir uma grade de proteção em uma curva perigosa em vez de reprojetar a inclinação da estrada, é precisa. A indústria de IA está, em grande parte, aplicando remendos em vez de resolver o problema na sua raiz. Isso cria um ciclo insustentável de gato e rato, onde os defensores estão sempre um passo atrás, reagindo a novos vetores de ataque em vez de preveni-los arquitetonicamente. Para empresas, isso se traduz em um risco contínuo e imprevisível.

A principal implicação para a adoção corporativa é que a segurança não pode ser delegada integralmente ao fornecedor do modelo. A superfície de ataque está se expandindo do prompt para todo o ecossistema de execução do LLM, incluindo ferramentas conectadas, APIs e dados intermediários gerados durante o processamento. Uma estratégia de segurança eficaz exige uma abordagem de 'defesa em profundidade', que inclua o monitoramento do comportamento interno do modelo e dos dados que ele acessa, uma tarefa significativamente mais complexa do que simplesmente filtrar entradas e saídas.

Nos próximos meses, devemos observar como os grandes provedores de modelos responderão. Uma nova atualização de filtro será uma resposta fraca, sinalizando a continuação do ciclo reativo. Movimentos em direção a arquiteturas fundamentalmente mais seguras, que isolem o processamento de dados não confiáveis, seriam um sinal de maturidade. Além disso, a evolução dos programas de 'bug bounty' para incluir explicitamente ataques de 'jailbreak' e manipulação de contexto indicará se a indústria está finalmente tratando a segurança de LLMs com a seriedade que a adoção em larga escala exige.

Contexto para empresários e decisores

O mercado de IA generativa no Brasil está em franca expansão, com empresas de diversos setores integrando LLMs em operações críticas de atendimento, análise de dados e desenvolvimento de software. No entanto, a maturidade das práticas de segurança e governança de IA ainda não acompanha o ritmo da adoção. O custo de um vazamento de dados, potencializado pela vigência da Lei Geral de Proteção de Dados (LGPD), representa um risco financeiro e reputacional significativo. Esta vulnerabilidade expõe a lacuna entre o discurso de marketing dos fornecedores de IA, que promovem suas plataformas como seguras, e a realidade técnica, criando uma oportunidade para players que consigam demonstrar uma arquitetura de segurança comprovadamente mais robusta.

Impactos para empresas

  • 1Exposição de dados sensíveis, como históricos de chat e informações de usuários, resulta em risco direto de violação da LGPD, acarretando multas e danos reputacionais.
  • 2Aumento da desconfiança em soluções de IA de terceiros leva à necessidade de maiores investimentos em auditorias de segurança e validação interna, elevando o custo total de propriedade (TCO) da tecnologia.
  • 3Interrupção de projetos de IA em andamento pode ocorrer enquanto as equipes de segurança reavaliam a arquitetura de risco, atrasando o lançamento de produtos e a obtenção de ROI.
  • 4A ineficácia dos 'guardrails' padrão força a busca por soluções de segurança especializadas em IA, criando uma nova linha de despesa operacional e complexidade na pilha de tecnologia.

Conclusão editorial

A 'Injeção de Contexto Criptográfico' não é apenas mais uma falha, mas um sintoma de uma fragilidade arquitetônica nos LLMs atuais. A segurança reativa, baseada em filtros de texto, é comprovadamente insuficiente. Empresas devem adotar uma postura de 'confiança zero' com LLMs, auditando rigorosamente como os dados são processados e priorizando soluções que ofereçam transparência e controle sobre o ambiente de execução do modelo, não apenas sobre as entradas e saídas.

— Redação IA News

Fontes utilizadas

Apuração, análise e conclusão editorial produzidas pela redação do IA News a partir das fontes acima. O conteúdo não reproduz o texto original.