Modelos multimodales
Google añade avatares en tiempo real a Gemini 3.8 Live, por ahora sólo dentro de Gemini Enterprise
Google DeepMind presentó el 24 de septiembre Gemini 3.8 Live con Live Avatar, que añade presencia visual casi en tiempo real a sus modelos de diálogo en directo. La función combina generación de vídeo casi en tiempo real con voz, de forma que el sistema escucha, ve y habla a la vez, y llega apoyada en el lanzamiento de Gemini 3.8 Live de la semana anterior. Desde ese mismo día está disponible en Gemini Enterprise, y los desarrolladores pueden generar un avatar a partir de una imagen de referencia conservando el parecido o la identidad de marca.
LanzamientoDisponibilidad limitadaSin confirmar si afecta al plan gratuito
Qué significa para ti
El alcance es lo que conviene mirar: está en Gemini Enterprise y crear avatares propios sólo se abre por lista de permitidos, así que no es algo que el público pueda probar hoy. Google afirma haberlo construido con salvaguardas para respetar la identidad y sostiene que todo lo que generan sus productos lleva la marca de agua SynthID. Llega un día después de que Meta presentara sus propios avatares en tiempo real para Muse: dos de los mayores laboratorios han elegido la misma semana para ponerle cara a la voz.
Fuentes
Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.
Seguir leyendo
- Modelos multimodales
DeepSeek lanza V4.1-Flash y redirige a él las peticiones de V4-Pro desde el 14 de septiembre
DeepSeek presentó el 10 de septiembre V4.1-Flash, el modelo más pequeño de su nueva familia de arquitectura, con comprensión visual nativa. Es un modelo de mezcla de expertos de 552.000 millones de parámetros que activa 8.000 millones para procesar la entrada y 16.000 millones para generar la salida. Está disponible en la API de DeepSeek y sustituye a V4-Flash y V4-Flash-Vision-Exp, que quedan retirados. Según la compañía, pruebas de varias partes lo sitúan por delante de V4-Pro en rendimiento, coste y velocidad.
LanzamientoDisponible
- Modelos multimodales
Google lanza la aplicación de Gemini para Windows, que se abre con Alt + Espacio
Google lanzó el 10 de septiembre la aplicación de Gemini para Windows, disponible desde ese día en todo el mundo para Windows 10 y 11 y descargable en gemini.google/desktop. El atajo Alt + Espacio abre el asistente encima de la aplicación en la que se esté trabajando. Desde ella se puede pedir a Gemini el resumen de un proyecto con información de Gmail y Google Drive o generar imágenes con Nano Banana.
LanzamientoDisponible
- Modelos multimodales
Mistral presenta Robostral Navigate, su primer modelo de navegación para robots
Mistral presentó el 8 de julio de 2026 Robostral Navigate, un modelo de 8.000 millones de parámetros que permite a un robot desplazarse de forma autónoma por oficinas, edificios y exteriores con una sola cámara RGB, sin LiDAR ni sensores de profundidad. Según Mistral, se entrenó por completo en simulación y funciona en robots con ruedas, con patas y voladores.
AnuncioDisponibilidad sin confirmar