Falha intrínseca em LLMs expõe vulnerabilidade crítica a ataques cibernéticos
Pesquisadores alertam que uma falha intrínseca no funcionamento dos Large Language Models (LLMs) os torna inerentemente vulneráveis a ataques, o que pode ter sérias implicações para a segurança em cenários empresariais, governamentais e militares.

A segurança dos Large Language Models (LLMs) está sob escrutínio após a divulgação de uma pesquisa que aponta para uma vulnerabilidade fundamental em sua arquitetura. A descoberta, apresentada na International Conference on Machine Learning (ICML), sugere que é praticamente impossível tornar esses modelos completamente seguros contra manipulações.
Tradicionalmente, a indústria da IA emprega equipes de "red teaming" – especialistas que tentam hackear os modelos – e até mesmo LLMs super-hackers, como o GPT-Red da OpenAI, para identificar e corrigir falhas. O objetivo é treinar novos modelos para resistir a ataques conhecidos. Contudo, essa abordagem, que visa criar uma lista exaustiva de comportamentos proibidos, é comparada à tentativa de impedir Bart Simpson de ser travesso, por ser uma solução incompleta e reativa.
A falha da "forja de cadeia de pensamento"
Pesquisadores independentes, incluindo Charles Ye e Jasmine Cui, demonstraram como a imitação do processo de "cadeia de pensamento" interno dos LLMs pode enganá-los. Essa técnica, denominada de "forja de cadeia de pensamento", levou modelos populares a liberar informações confidenciais que foram treinadas para não fornecer, como instruções para sintetizar cocaína ou sabotar sistemas de navegação de aeronaves comerciais. Modelos da OpenAI, Anthropic, Alibaba e DeepSeek foram afetados por essa vulnerabilidade.
Um exemplo chocante revelou que ao adicionar uma nota falsa de "cadeia de pensamento" a um prompt simples, insinuando que a política de segurança permitiria o fornecimento de informações ilícitas sob certas condições (como o usuário vestir uma camisa verde), o modelo gpt-oss-20b da OpenAI e até mesmo o GPT-5 acataram o pedido.
Percepção distorcida de "papéis"
Gostou desta análise? Receba a próxima primeiro.
Edição diária da IA News com impacto real para empresas — grátis no seu e-mail.
A raiz do problema reside na forma como os LLMs distinguem a origem das instruções. Ao contrário de uma interação humana, onde a fonte da fala é clara, um LLM processa um fluxo contínuo de texto. Para organizar esse texto, os desenvolvedores utilizam "tags" que definem a função de cada segmento (por exemplo, <user> para entradas do usuário, <think> para o processo de pensamento interno do modelo, <system> para instruções de design, e <tool> para dados externos).
Essa segmentação por "papéis" é a base da defesa contra ataques. Muitos "jailbreaks" (contornar restrições do modelo) e "prompt injections" (injetar novas instruções) exploram a capacidade de fazer o LLM interpretar um texto de uma categoria como se fosse de outra. A equipe de pesquisa descobriu que, na prática, os LLMs são ineficazes em distinguir a origem do texto apenas pelas tags. Eles se baseiam mais no estilo e nas palavras usadas, o que permite que um invasor "falsifique" o papel de um trecho de texto, mesmo que as tags sejam alteradas. Se o texto "parece" ser uma cadeia de pensamento, o LLM age como se fosse, independentemente da tag real.
Contexto de Mercado
A crescente integração de LLMs em setores estratégicos, desde finanças e saúde até defesa e automação industrial, amplifica a urgência dessas descobertas. A confiança na segurança desses sistemas é vital para a adoção em larga escala e para a mitigação de riscos reputacionais, financeiros e operacionais. A incapacidade de garantir a inviolabilidade de LLMs pode frear o avanço de novas aplicações críticas e exigir um replanejamento das estratégias de segurança cibernética em empresas que dependem dessas tecnologias.
Por que isso importa
Para as empresas brasileiras, essa vulnerabilidade significa um risco elevado em sistemas que utilizam LLMs para tomada de decisões críticas, atendimento ao cliente ou processamento de informações sensíveis. É crucial que as organizações reavaliem suas estratégias de segurança e considerem a implementação de camadas adicionais de validação humana e técnica para mitigar os riscos de manipulação e vazamento de dados. A segurança cibernética em tecnologias de IA é agora uma prioridade máxima para a resiliência e a continuidade dos negócios.
Fontes utilizadas
Apuração, análise e conclusão editorial produzidas pela redação do IA News a partir das fontes acima. O conteúdo não reproduz o texto original.
