Audio y música
Hugging Face abre una clasificación de voz sintética medida con métricas objetivas, no con votos
Hugging Face publicó el 30 de septiembre el Open TTS Leaderboard, una clasificación de modelos de voz sintética centrada en el código abierto y en varios idiomas. Cuenta que en su Hub hay ya más de 8.000 modelos de este tipo y sostiene que la evaluación no ha seguido ese ritmo: sigue fragmentada y sin estandarizar. En vez de recoger votos mide con métricas objetivas: inteligibilidad por tasa de error transcribiendo con Qwen3 ASR, velocidad en una GPU H200 y parecido de voz entre el audio generado y el de referencia.
LanzamientoDisponibleSin confirmar si afecta al plan gratuito
Qué significa para ti
El argumento de fondo es de representación: sostienen que las arenas de votos no pueden seguir el ritmo de los lanzamientos, y ahí los modelos abiertos salen poco: a 30 de septiembre sólo 16 de los 92 modelos de Artificial Analysis tienen pesos abiertos. Con métricas objetivas, dicen, evaluar un modelo baja de un par de semanas a un par de horas. El límite lo ponen ellos: esto no sustituye la clasificación por preferencia humana, porque ninguna de esas métricas mide la naturalidad, la expresividad ni lo que prefiere quien escucha. Para eso hay una pestaña donde escuchar los audios.
Fuentes
Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.
Seguir leyendo
- Audio y música
Google lanza Gemini 3.8 Live, dos modelos de voz que cambian de idioma a mitad de conversación
Google DeepMind presentó el 15 de septiembre Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de audio pensados para agentes de voz. El primero está orientado a escala y coste, con diálogo fluido y anclaje visual; el segundo, a tareas complejas con razonamiento de varios pasos. Detectan y cambian entre 97 idiomas en mitad de la conversación y ejecutan herramientas y llamadas a la API en segundo plano mientras siguen hablando. Ambos empezaron a desplegarse ese mismo día.
LanzamientoAcceso limitado
- Audio y música
ElevenLabs y Universal Music Group firman un acuerdo de licencias y desarrollo de producto
ElevenLabs y Universal Music Group anunciaron el 10 de septiembre un acuerdo plurianual de licencias y colaboración estratégica. Las dos compañías desarrollarán productos de audio con IA para artistas y compositores, y ElevenLabs lanzará una plataforma musical para fans basada en música licenciada. Esa plataforma, todavía en desarrollo, permitirá crear remezclas, mashups, nuevas interpretaciones de temas y experiencias vocales personalizadas. Según ElevenLabs, es su primer acuerdo con una gran discográfica.
AnuncioAnunciado
- Audio y músicaAfecta al plan gratuito
Suno lanza v6: el modelo principal queda para Pro y Premier, y v6-mini está disponible para todos
Suno presentó el 9 de septiembre v6, una nueva generación de modelos musicales desarrollada con socios de la industria como Warner Music Group, BMG y Believe. Llega en tres modelos: v6, el principal, y v6-wild, pensado para resultados menos previsibles, son para suscriptores Pro y Premier; v6-mini, más rápido y eficiente, está disponible para todos. Suno retirará sus modelos anteriores a medida que despliegue v6.
LanzamientoDisponible