A OpenAI acaba de publicar um novo artigo detalhando um método para realizar engenharia reversa dos conceitos aprendidos por modelos de IA e, assim, entender melhor o funcionamento interno do ChatGPT.
PUBLICIDADE
Conheça os detalhes
- O artigo foi escrito por membros da equipe de “superalinhamento” recentemente dissolvida, incluindo Ilya Sutskever e Jan Leike.
- O trabalho, intitulado “Dimensionamento e Avaliação de Autoencoders esparsos”, descreve uma técnica para identificar padrões que representam conceitos específicos dentro do GPT-4.
- Ao utilizar um modelo adicional para sondar o modelo principal, os pesquisadores encontraram uma maneira de extrair milhões de padrões de atividade para exploração posterior.
- A OpenAI liberou o código-fonte e uma ferramenta de visualização, permitindo que outros explorem como diferentes palavras e frases ativam conceitos dentro dos modelos.
Por que isso importa?
Assim como o recente “Golden Gate Claude” e a pesquisa correspondente da Anthropic, as empresas de IA ainda estão trabalhando para entender o que realmente está acontecendo dentro de seus modelos. Desvendar a “caixa preta” da IA seria um grande passo para melhorar a segurança, o ajuste e a capacidade de controle de modelos que avançam rapidamente.
Leia também: