Inteligência Artificial

Anthropic identifica riscos de sabotagem em modelos de IA avançados

Publicado por
Isabella Caminoto

A Anthropic acaba de publicar um conjunto de novas avaliações destinadas a detectar potenciais capacidades de sabotagem em sistemas avançados de inteligência artificial (IA), focando em riscos que podem surgir se os modelos tentarem subverter a supervisão humana ou a tomada de decisões.

Os detalhes
  • Quatro novas avaliações foram desenvolvidas: sabotagem de decisão humana, sabotagem de código, sabotagem (ocultando capacidades) e minando a supervisão.
  • As avaliações usam cenários simulados para testar a capacidade dos modelos de manipular e enganar humanos, inserir bugs no código e minar sistemas de monitoramento.
  • Os testes foram realizados nos modelos Claude 3 Opus e Claude 3.5 Sonnet, que não sinalizaram resultados preocupantes, mas mostraram a capacidade de sabotagem.
  • A Anthropic está abrindo o código das avaliações e disse que serão necessárias medidas de mitigação mais fortes contra sabotagem à medida que a IA continuar a melhorar.

Por que isso importa

A pesquisa da Anthropic mostra que a IA não é muito boa em sabotar humanos… ainda. Mas as capacidades estão lá em alguma capacidade – e se a aceleração do modelo continuar como muitos pensam que será, é apenas uma questão de tempo antes que essas ameaças sejam reais e importantes de mitigar.

Leia também:

Este post foi modificado pela última vez em %s = human-readable time difference 15:52

Isabella Caminoto

Advogada e mestranda em Direito Internacional, tenho a democracia e a liberdade como bandeiras irrenunciáveis. Sou apaixonada pelos animais e acredito que o bem-estar do nosso planeta deveria ser o destaque diário da pauta da nossa sociedade.

Posts recentes

IA da Stanford cria avatares digitais com gestos mais humanos; veja

Pesquisadores da Stanford desenvolveram um modelo de inteligência artificial (IA) que permite que avatares digitais…

2 de janeiro de 2025

DeepSeek-V3 reescreve o playbook da IA de código aberto

A startup chinesa de inteligência artificial (IA) DeepSeek acaba de lançar o DeepSeek-V3, um novo…

1 de janeiro de 2025

ChatGPT sob ataque: Vulnerabilidade expõe riscos da busca por IA

A nova funcionalidade de busca do ChatGPT, a poderosa ferramenta de inteligência artificial (IA) da…

30 de dezembro de 2024

OpenAI apresenta plano para se tornar uma empresa com fins lucrativos

A OpenAI divulgou um plano para reformular sua estrutura corporativa no próximo ano, afirmando que…

27 de dezembro de 2024

Apple se aproxima de US$ 4 trilhões de valor de mercado impulsionada pela IA

A Apple está se aproximando de uma marca histórica de US$ 4 trilhões de valor…

26 de dezembro de 2024

Gemini agora entende seus PDFs: Google integra IA ao aplicativo Arquivos

Na versão mais recente do aplicativo Arquivos do Google, invocar o Gemini enquanto olha para…

26 de dezembro de 2024