Modelos multimodales
Gemini Live estrena Guided Vision, que describe el entorno por voz, y llega a Android 9 o posterior
Google lanzó el 1 de octubre Guided Vision en Gemini Live para los dispositivos Android compatibles: al compartir la cámara, Gemini describe el entorno por voz y, si el encuadre no le sirve, pide girar despacio a la derecha, inclinar hacia abajo o echarse atrás. Está dirigido a personas ciegas o con baja visión y se construyó junto a esa comunidad: para entrenarlo se asociaron con Aira, con decenas de miles de horas de interpretación visual, y más de 1.000 miembros de su red de probadores ayudaron a afinar el modelo.
LanzamientoDisponibleSin confirmar si afecta al plan gratuito
Qué significa para ti
La salvedad la pone Google y conviene leerla entera: es una utilidad de asistencia que puede equivocarse, no es un dispositivo médico, ni una ayuda a la movilidad, ni un sustituto del bastón blanco, y no está pensada para navegar, guiar un desplazamiento seguro ni detectar obstáculos. Funciona en Android 9 o posterior, en las regiones e idiomas donde ya funciona Gemini Live, y se abre desde los ajustes del perfil, con un atajo de accesibilidad o desde el menú de TalkBack con tres dedos. Admite varios idiomas, afinados con comunidades de India, Brasil, Singapur, Indonesia y Japón.
Fuentes
Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.
Seguir leyendo
- Modelos multimodales
Google añade avatares en tiempo real a Gemini 3.8 Live, por ahora sólo dentro de Gemini Enterprise
Google DeepMind presentó el 24 de septiembre Gemini 3.8 Live con Live Avatar, que añade presencia visual casi en tiempo real a sus modelos de diálogo en directo. La función combina generación de vídeo casi en tiempo real con voz, de forma que el sistema escucha, ve y habla a la vez, y llega apoyada en el lanzamiento de Gemini 3.8 Live de la semana anterior. Desde ese mismo día está disponible en Gemini Enterprise, y los desarrolladores pueden generar un avatar a partir de una imagen de referencia conservando el parecido o la identidad de marca.
LanzamientoAcceso limitado
- Modelos multimodales
DeepSeek lanza V4.1-Flash y redirige a él las peticiones de V4-Pro desde el 14 de septiembre
DeepSeek presentó el 10 de septiembre V4.1-Flash, el modelo más pequeño de su nueva familia de arquitectura, con comprensión visual nativa. Es un modelo de mezcla de expertos de 552.000 millones de parámetros que activa 8.000 millones para procesar la entrada y 16.000 millones para generar la salida. Está disponible en la API de DeepSeek y sustituye a V4-Flash y V4-Flash-Vision-Exp, que quedan retirados. Según la compañía, pruebas de varias partes lo sitúan por delante de V4-Pro en rendimiento, coste y velocidad.
LanzamientoDisponible
- Modelos multimodales
Google lanza la aplicación de Gemini para Windows, que se abre con Alt + Espacio
Google lanzó el 10 de septiembre la aplicación de Gemini para Windows, disponible desde ese día en todo el mundo para Windows 10 y 11 y descargable en gemini.google/desktop. El atajo Alt + Espacio abre el asistente encima de la aplicación en la que se esté trabajando. Desde ella se puede pedir a Gemini el resumen de un proyecto con información de Gmail y Google Drive o generar imágenes con Nano Banana.
LanzamientoDisponible