Audio y música
Suno abre a todos la beta de Speech, que genera la voz y la música en una sola pista
Suno abrió el 1 de octubre la beta de Speech a toda su comunidad, después de un mes de pruebas con un grupo pequeño de usuarios. Sirve para crear audio hablado con música original de fondo: se escribe una idea, un poema o un texto propio y se describe la voz y el estilo musical que se quiere. Va integrado dentro de Suno, sin herramienta aparte. La compañía lo presenta como el primer modelo de audio que genera voz y música juntas en una sola pista, afirmación que es suya.
Preview o betaEn preview o betaSin confirmar si afecta al plan gratuito
Qué significa para ti
Lo interesante es que marcan ellos mismos el terreno: dicen que beta significa beta de verdad, que de vez en cuando los acentos británicos se van a Australia y vuelven, y que las pausas dramáticas pueden salir muy dramáticas. Lo plantean como una extensión de lo que la gente ya hace ahí —canciones de cumpleaños, bodas, chistes internos— y cuentan que en sus propias pruebas acabaron haciendo meditaciones, poemas, charlas de ánimo y cuentos para dormir. De precios y de qué entra en el plan gratuito, el anuncio no dice nada.
Fuentes
Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.
Seguir leyendo
- Audio y música
Hugging Face abre una clasificación de voz sintética medida con métricas objetivas, no con votos
Hugging Face publicó el 30 de septiembre el Open TTS Leaderboard, una clasificación de modelos de voz sintética centrada en el código abierto y en varios idiomas. Cuenta que en su Hub hay ya más de 8.000 modelos de este tipo y sostiene que la evaluación no ha seguido ese ritmo: sigue fragmentada y sin estandarizar. En vez de recoger votos mide con métricas objetivas: inteligibilidad por tasa de error transcribiendo con Qwen3 ASR, velocidad en una GPU H200 y parecido de voz entre el audio generado y el de referencia.
LanzamientoDisponible
- Audio y música
Google lanza Gemini 3.8 Live, dos modelos de voz que cambian de idioma a mitad de conversación
Google DeepMind presentó el 15 de septiembre Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de audio pensados para agentes de voz. El primero está orientado a escala y coste, con diálogo fluido y anclaje visual; el segundo, a tareas complejas con razonamiento de varios pasos. Detectan y cambian entre 97 idiomas en mitad de la conversación y ejecutan herramientas y llamadas a la API en segundo plano mientras siguen hablando. Ambos empezaron a desplegarse ese mismo día.
LanzamientoAcceso limitado
- Audio y música
ElevenLabs y Universal Music Group firman un acuerdo de licencias y desarrollo de producto
ElevenLabs y Universal Music Group anunciaron el 10 de septiembre un acuerdo plurianual de licencias y colaboración estratégica. Las dos compañías desarrollarán productos de audio con IA para artistas y compositores, y ElevenLabs lanzará una plataforma musical para fans basada en música licenciada. Esa plataforma, todavía en desarrollo, permitirá crear remezclas, mashups, nuevas interpretaciones de temas y experiencias vocales personalizadas. Según ElevenLabs, es su primer acuerdo con una gran discográfica.
AnuncioAnunciado