Modelos multimodales

Gemini Live estrena Guided Vision, que describe el entorno por voz, y llega a Android 9 o posterior

Google lanzó el 1 de octubre Guided Vision en Gemini Live para los dispositivos Android compatibles: al compartir la cámara, Gemini describe el entorno por voz y, si el encuadre no le sirve, pide girar despacio a la derecha, inclinar hacia abajo o echarse atrás. Está dirigido a personas ciegas o con baja visión y se construyó junto a esa comunidad: para entrenarlo se asociaron con Aira, con decenas de miles de horas de interpretación visual, y más de 1.000 miembros de su red de probadores ayudaron a afinar el modelo.

LanzamientoDisponibleSin confirmar si afecta al plan gratuito

Qué significa para ti

La salvedad la pone Google y conviene leerla entera: es una utilidad de asistencia que puede equivocarse, no es un dispositivo médico, ni una ayuda a la movilidad, ni un sustituto del bastón blanco, y no está pensada para navegar, guiar un desplazamiento seguro ni detectar obstáculos. Funciona en Android 9 o posterior, en las regiones e idiomas donde ya funciona Gemini Live, y se abre desde los ajustes del perfil, con un atajo de accesibilidad o desde el menú de TalkBack con tres dedos. Admite varios idiomas, afinados con comunidades de India, Brasil, Singapur, Indonesia y Japón.

Fuentes

Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.

Seguir leyendo

  • Modelos multimodales

    Google añade avatares en tiempo real a Gemini 3.8 Live, por ahora sólo dentro de Gemini Enterprise

    Google DeepMind presentó el 24 de septiembre Gemini 3.8 Live con Live Avatar, que añade presencia visual casi en tiempo real a sus modelos de diálogo en directo. La función combina generación de vídeo casi en tiempo real con voz, de forma que el sistema escucha, ve y habla a la vez, y llega apoyada en el lanzamiento de Gemini 3.8 Live de la semana anterior. Desde ese mismo día está disponible en Gemini Enterprise, y los desarrolladores pueden generar un avatar a partir de una imagen de referencia conservando el parecido o la identidad de marca.

    LanzamientoAcceso limitado

  • Modelos multimodales

    DeepSeek lanza V4.1-Flash y redirige a él las peticiones de V4-Pro desde el 14 de septiembre

    DeepSeek presentó el 10 de septiembre V4.1-Flash, el modelo más pequeño de su nueva familia de arquitectura, con comprensión visual nativa. Es un modelo de mezcla de expertos de 552.000 millones de parámetros que activa 8.000 millones para procesar la entrada y 16.000 millones para generar la salida. Está disponible en la API de DeepSeek y sustituye a V4-Flash y V4-Flash-Vision-Exp, que quedan retirados. Según la compañía, pruebas de varias partes lo sitúan por delante de V4-Pro en rendimiento, coste y velocidad.

    LanzamientoDisponible

    Herramientas:DeepSeek V4 Flash, DeepSeek V4 Pro

  • Modelos multimodales

    Google lanza la aplicación de Gemini para Windows, que se abre con Alt + Espacio

    Google lanzó el 10 de septiembre la aplicación de Gemini para Windows, disponible desde ese día en todo el mundo para Windows 10 y 11 y descargable en gemini.google/desktop. El atajo Alt + Espacio abre el asistente encima de la aplicación en la que se esté trabajando. Desde ella se puede pedir a Gemini el resumen de un proyecto con información de Gmail y Google Drive o generar imágenes con Nano Banana.

    LanzamientoDisponible

    Herramientas:Google Gemini