Inteligência Artificial

Pesquisadores identificam nova vulnerabilidade em modelos de linguagem grande (LLMs)

Publicado por
Isabella Caminoto

Um grupo de pesquisadores da Anthropic descobriu uma nova técnica de “desvio de segurança” chamada “many-shot jailbreaking” (quebra de proteção em vários disparos). Essa técnica explora as janelas de contexto expandidas para driblar as proteções de segurança em modelos de linguagem grande (LLMs).

Entenda como funciona:

  • Enganando o sistema: O “many-shot jailbreaking” funciona através da inserção de uma série de diálogos simulados na entrada de dados. Esses diálogos exploram a capacidade dos LLMs de aprender com o contexto.
  • Quantidade é (perigosamente) importante: Quanto mais diálogos (ou “disparos”) forem incluídos no prompt, maior a chance de se obter uma resposta prejudicial do modelo.
  • Aprendizado no contexto: A eficácia dessa técnica está ligada ao processo de “aprendizado no contexto”, onde os LLMs usam o contexto do prompt para gerar respostas.
  • Corrida contra o tempo: A Anthropic já comunicou essa vulnerabilidade a outros pesquisadores e empresas de IA. Atualmente, eles trabalham ativamente em estratégias de mitigação para fechar essa brecha de segurança.

Por que isso importa?

A descoberta do “many-shot jailbreaking” destaca a faca de dois gumes das janelas de contexto expandidas em LLMs. Por um lado, entradas mais longas e o aprendizado no contexto tornam os modelos mais úteis. Por outro lado, esses mesmos recursos também abrem caminho para novos tipos de vulnerabilidades.

É importante que pesquisadores e empresas de inteligência artificial trabalhem em conjunto para desenvolver LLMs cada vez mais robustos e seguros.

Leia também:

Este post foi modificado pela última vez em 3 de abril de 2024 12:34

Isabella Caminoto

Advogada e mestranda em Direito Internacional, tenho a democracia e a liberdade como bandeiras irrenunciáveis. Sou apaixonada pelos animais e acredito que o bem-estar do nosso planeta deveria ser o destaque diário da pauta da nossa sociedade.

Posts recentes

TikTok aposta em IA generativa para impulsionar seu negócio de anúncios

O TikTok é a mais recente empresa de tecnologia a incorporar IA generativa em seu…

23 de maio de 2024

Consultor envolvido em robocall deepfake de Biden é indiciado por esquema na primária democrata

Steve Kramer, um consultor político que admitiu à NBC News ter utilizado a voz deepfake…

23 de maio de 2024

Crise entre Scarlett Johansson e a OpenAI reforça temor de Hollywood sobre a IA

A aparente homenagem da OpenAI ao filme "Her", usando uma voz similar a de Scarlett…

23 de maio de 2024

Startup de neurociência planeja sistema de transplante de cabeça com IA

A BrainBridge, startup de neurociência, acaba de apresentar um novo conceito para um sistema robótico…

23 de maio de 2024

Meta cria Conselho para assessorar desenvolvimento de IA

Mark Zuckerberg, CEO da Meta Platforms Inc., anunciou a criação de um novo conselho consultivo…

23 de maio de 2024

Humane busca por comprador após lançamento do AI Pin

A Humane está supostamente explorando uma venda potencial da empresa, poucas semanas após o lançamento…

23 de maio de 2024