Pesquisadores de inteligência artificial (IA) desenvolveram um novo Modelo de Linguagem de Escuta Enquanto Fala (LSLM) capaz de ouvir e falar simultaneamente, avançando nas conversas baseadas em voz em tempo real e interativas.
O novo modelo, chamado LSLM, permite modelagem full-duplex em modelos de linguagem e fala interativos. O LSLM utiliza um decodificador baseado em tokens apenas para geração de fala e um codificador de aprendizado autosupervisionado em streaming para entrada de áudio em tempo real.
O sistema pode detectar troca de turnos em tempo real e responder a interrupções, uma característica fundamental de uma conversa natural. O modelo demonstrou robustez ao ruído e sensibilidade a instruções diversas em experimentos.
Enquanto o recente modo de voz avançado Her-like da OpenAI para o ChatGPT nos aproxima de conversas de IA realistas, o LSLM avança ainda mais, permitindo que a IA processe a fala de entrada enquanto fala. Isso pode revolucionar as interações humano-IA, tornando as conversas com máquinas verdadeiramente naturais e responsivas.
Leia também:
Este post foi modificado pela última vez em 7 de agosto de 2024 11:45
A startup de inteligência artificial (IA) Runway fez um nome para si mesma construindo modelos…
Golpistas estão usando a inteligência artificial (IA) para transformar seus vídeos de redes sociais em…
A 1X desenvolveu seu ‘World Model’, um simulador virtual alimentado por inteligência artificial (IA) para…
A Snap acaba de apresentar seus Spectacles de quinta geração, óculos AR autônomos alimentados pelo…
Um em cada cinco médicos de família (GPs) no Reino Unido está usando ferramentas de…
O governo Biden anunciou na quarta-feira (18) que realizará uma Cúpula Global de Segurança sobre…