La inteligencia artificial sigue explorando nuevos caminos. Ahora se atreve a inventar el audio.
Muy pronto la creación de efectos de sonido para vídeos, películas, etc., se puede realizar de forma sencilla e inmediata. Al menos eso es lo que promete. Generación de audioa inteligencia artificial que convertir texto a sonido.
Hace unos meses nos quedamos boquiabiertos con DALL-E, un inteligencia artificial de Google que convierte cualquier texto en una imagen. Tecnología que podemos probar nosotros mismos con este tutorial de Difusión Estable.
Hace unas semanas, Meta presentó Make-a-video, una IA para convertir texto a video. El propio Google contraatacó con Image Video, otra IA que también obtiene vídeos a partir de una frase.
Y ahora nos encontramos Generación de audioa AI que convertir texto a sonido. No es el primero, ya que hay otros como DiffSound y Ground Truth, pero por los ejemplos sí que parece ser el más avanzado.
AudioGen, convertidor de texto a audio basado en IA
Generación de audio Es una inteligencia artificial que utiliza un modelo generativo autorregresivo por generar un sonido a partir de una frase de texto. Ha sido creado por un grupo de investigadores de la Universidad Hebrea de Jerusalén, encabezados por Felix Kreuk.
La dificultad de este proyecto está en obtener audio utilizable para entrenar la IA. En la mayoría de los archivos de audio hay muchos tipos de sonidos mezclados: desde varias personas hablando hasta sonidos de fondo o limitaciones de grabación como el ruido. Pero para aprender una IA necesita diferenciar sonidos purospara luego poder manejarlos y manipularlos a voluntad.
Este equipo de investigadores usó 10 conjuntos de datos que contiene diferentes tipos de anotaciones de audio y texto.
Para acelerar la inferencia, utilizaron modelos de flujo múltiple, que permite el uso de secuencias más cortas manteniendo una tasa de bits y una calidad de percepción similares. Puedes ver el resultado en el archivo de vídeo de este tuit:
¡Presentamos “AudioGen: Generación de audio guiada textualmente”! AudioGen es un transformador autorregresivo LM que sintetiza audio general condicionado a texto (Text-to-Audio). 📖 Papel: https://t.co/XKctRaShN1🎵 Muestras: https://t.co/e7vWmOUfva💻 Código y modelos: ¡pronto! (1/n) pic.twitter.com/UiJaA627bv
— Félix Kreuk (@FelixKreuk) 30 de septiembre de 2022
Como vemos, se introducen frases como “silbar con el sonido de un viento fuerte”, “habla un hombre mientras un pájaro canta y un perro ladra”, o “las sirenas de la policía pasan”, y la IA reproduce exactamente esos sonidos.
Es fácil ver las implicaciones que este tipo de IA tendrá para los creadores de videos, cine o series de televisión. En el futuro, ya no será necesario grabar estos sonidos específicos, ni descargarlos o comprarlos de una base de datos de audio.
Generación de audiola inteligencia artificial que convertir texto en sonidos Todavía está en desarrollo, por lo que sus creadores aún no ofrecen el código o el software para probarlo nosotros mismos. Pero puedes ver cómo funciona con los muchos ejemplos que se recopilan en su sitio web.