Alibaba lança novos modelos de IA que podem entender imagens

A Alibaba, uma das maiores empresas de tecnologia da China, anunciou recentemente o lançamento de dois novos modelos de IA que podem entender imagens.

Publicado por

Uesley Durães

30 de agosto de 2023 12:21

Os modelos, chamados Qwen-VL e Qwen-VL-Chat, são modelos de linguagem de visão, o que significa que são capazes de entender imagens e gerar texto. Qwen-VL-Chat é o modelo mais avançado dos dois e é capaz de realizar tarefas complexas, como fornecer instruções, resolver equações e gerar narrativas.

Exemplo de como o modelo pode ser usado (reprodução)

“Os dois modelos podem compreender a entrada de imagens e textos em inglês e chinês. Eles podem realizar tarefas visuais, como responder perguntas abertas com base em várias imagens e gerar legendas de imagens. O Qwen-VL-Chat pode realizar tarefas mais sofisticadas, como fazer cálculos matemáticos e criar uma história baseada em múltiplas imagens”, narra o comunicado de lançamento da Alibaba.

De acordo com a Alibaba, Qwen-VL-Chat pode ser usado para:

Ajudar pessoas com deficiência visual a navegar pelo mundo
Traduzir idiomas
Criar conteúdo de marketing personalizado
Automatizar tarefas de atendimento ao cliente

O lançamento desses novos modelos é um sinal da crescente importância da IA na China. O governo chinês tem feito da IA uma prioridade e está investindo pesadamente em pesquisa e desenvolvimento. A Alibaba está tentando acompanhar o ritmo de empresas do eixo EUA-Europa.

Veja também:

Meta elimina milhares de contas de propaganda chinesa

Meta, a empresa matriz do Facebook, anunciou nesta terça-feira (29) que eliminou milhares de contas da rede social que fariam parte de uma operação de propaganda chinesa on-line.

Alemanha vai aumentar investimento para pesquisas em IA

A Alemanha anunciou na quarta-feira (23) um plano para dobrar o financiamento público para pesquisas em inteligência artificial (IA) para quase um bilhão de euros nos próximos dois anos.

Este post foi modificado pela última vez em %s = human-readable time difference 12:37

Uesley Durães