Inteligência Artificial

Pesquisadores identificam nova vulnerabilidade em modelos de linguagem grande (LLMs)

Publicado por
Isabella Caminoto

Um grupo de pesquisadores da Anthropic descobriu uma nova técnica de “desvio de segurança” chamada “many-shot jailbreaking” (quebra de proteção em vários disparos). Essa técnica explora as janelas de contexto expandidas para driblar as proteções de segurança em modelos de linguagem grande (LLMs).

Entenda como funciona:

  • Enganando o sistema: O “many-shot jailbreaking” funciona através da inserção de uma série de diálogos simulados na entrada de dados. Esses diálogos exploram a capacidade dos LLMs de aprender com o contexto.
  • Quantidade é (perigosamente) importante: Quanto mais diálogos (ou “disparos”) forem incluídos no prompt, maior a chance de se obter uma resposta prejudicial do modelo.
  • Aprendizado no contexto: A eficácia dessa técnica está ligada ao processo de “aprendizado no contexto”, onde os LLMs usam o contexto do prompt para gerar respostas.
  • Corrida contra o tempo: A Anthropic já comunicou essa vulnerabilidade a outros pesquisadores e empresas de IA. Atualmente, eles trabalham ativamente em estratégias de mitigação para fechar essa brecha de segurança.

Por que isso importa?

A descoberta do “many-shot jailbreaking” destaca a faca de dois gumes das janelas de contexto expandidas em LLMs. Por um lado, entradas mais longas e o aprendizado no contexto tornam os modelos mais úteis. Por outro lado, esses mesmos recursos também abrem caminho para novos tipos de vulnerabilidades.

É importante que pesquisadores e empresas de inteligência artificial trabalhem em conjunto para desenvolver LLMs cada vez mais robustos e seguros.

Leia também:

Este post foi modificado pela última vez em %s = human-readable time difference 12:34

Isabella Caminoto

Advogada e mestranda em Direito Internacional, tenho a democracia e a liberdade como bandeiras irrenunciáveis. Sou apaixonada pelos animais e acredito que o bem-estar do nosso planeta deveria ser o destaque diário da pauta da nossa sociedade.

Posts recentes

Google se associa à Apptronik para desenvolver robôs humanoides

O Google DeepMind acaba de anunciar uma parceria estratégica com a Apptronik, uma empresa de…

20 de dezembro de 2024

Genesis: Um novo patamar para simulações físicas em IA

Uma equipe de pesquisadores de 20 laboratórios diferentes acaba de apresentar o Genesis, um motor…

20 de dezembro de 2024

Google lança seu próprio modelo de IA de “raciocínio”

O Google acabou de lançar o que está chamando de um novo modelo de inteligência…

19 de dezembro de 2024

GitHub Copilot agora é gratuito

A GitHub, de propriedade da Microsoft, acaba de anunciar um nível gratuito de seu Copilot…

19 de dezembro de 2024

ChatGPT ganha um novo número de telefone; veja

A OpenAI acaba de lançar uma nova maneira surpreendente de acessar o ChatGPT - através…

19 de dezembro de 2024

Google lança novo benchmark para testar a factualidade de LLMs

O Google DeepMind acaba de lançar o FACTS Grounding, um novo benchmark projetado para avaliar…

18 de dezembro de 2024