Inteligência Artificial

MLE-bench: Novo benchmark de agente de IA da OpenAI

Publicado por
Isabella Caminoto

A OpenAI acaba de introduzir o MLE-bench, um novo benchmark projetado para avaliar o desempenho de agentes de inteligência artificial (IA) em tarefas de engenharia de machine learning no mundo real, utilizando competições do Kaggle.

Os detalhes
  • O MLE-bench consiste em 75 competições do Kaggle selecionadas, abrangendo uma variedade de tarefas de ML, como treinamento de modelos, preparação de dados e experimentação.
  • As competições do Kaggle são desafios online em que cientistas de dados competem para resolver problemas complexos usando machine learning, buscando prêmios e reconhecimento.
  • Nas pesquisas, os modelos de IA geralmente tiveram sucesso ao aplicar técnicas padrão, mas enfrentaram dificuldades em tarefas que exigiam adaptabilidade ou resolução criativa de problemas.
  • A configuração de melhor desempenho, o modelo o1-preview da OpenAI com a estrutura AIDE, conquistou pelo menos uma medalha de bronze em 16,9% das competições.
Por que isso importa

Os agentes de IA estão ganhando força — e novos benchmarks são necessários para avaliar suas capacidades que superam as medidas de teste anteriores. Com os comentários da OpenAI, uma onda de startups impulsionando capacidades de agentes, e a criação de novos benchmarks, a revolução dos agentes de IA parece prestes a explodir.

Leia também:

Este post foi modificado pela última vez em 11 de outubro de 2024 14:36

Isabella Caminoto

Advogada e mestranda em Direito Internacional, tenho a democracia e a liberdade como bandeiras irrenunciáveis. Sou apaixonada pelos animais e acredito que o bem-estar do nosso planeta deveria ser o destaque diário da pauta da nossa sociedade.

Posts recentes

Movimento pró-Musk promete transformar o debate sobre IA nos EUA; entenda

Esforços para influenciar as políticas do presidente eleito Donald Trump por meio de Elon Musk…

11 de novembro de 2024

Além da escala: A busca por uma IA mais inteligente e humana

Empresas de inteligência artificial (IA) como a OpenAI estão buscando superar atrasos inesperados e desafios…

11 de novembro de 2024

Inteligência Artificial do MIT treina cães-robôs em mundos virtuais

Pesquisadores do MIT divulgaram um sistema de inteligência artificial (IA) chamado LucidSim que treina robôs…

11 de novembro de 2024

Sam Altman prevê AGI em 2025; veja

Sam Altman, CEO da OpenAI, acabou de prever que a inteligência artificial geral (AGI) será…

11 de novembro de 2024

Beatles de volta ao Grammy com música restaurada pela IA

Os Beatles foram indicados a dois Grammys - quase 50 anos após a banda se…

10 de novembro de 2024

ByteDance revoluciona a animação com IA: X-Portrait 2 transforma fotos em vídeos realistas

A ByteDance acaba de revelar o X-Portrait 2, um sistema de inteligência artificial (IA) que…

8 de novembro de 2024