Google DeepMind lanza Gemini Omni: generación de vídeo multimodal con IA
IA

Google DeepMind lanza Gemini Omni: generación de vídeo multimodal con IA

En resumen

Google DeepMind presenta Gemini Omni, un nuevo modelo de IA capaz de crear y editar vídeos de alta calidad a partir de cualquier combinación de entradas como imágenes, audio, texto y vídeo. El primer modelo de la familia, Gemini Omni Flash, ya está disponible para suscriptores de Google AI Plus, Pro y Ultra, así como para usuarios de YouTube Shorts y YouTube Create App. Esta tecnología representa un salto significativo en la creación de contenido generativo, con implicaciones directas para agencias de marketing y responsables de comunicación digital.

Puntos clave

  • Gemini Omni Flash es el primer modelo de la familia Omni y permite crear vídeos de alta calidad combinando como entradas imágenes, audio, vídeo y texto, todo ello respaldado por el conocimiento enciclopédico de Gemini sobre el mundo real.
  • El modelo permite editar vídeos mediante lenguaje natural en múltiples turnos de conversación, manteniendo la coherencia visual entre planos: los personajes permanecen consistentes, la física de la escena se respeta y el contexto acumulado se preserva a lo largo de toda la sesión de edición.
  • Omni incorpora una comprensión mejorada de la física intuitiva, incluyendo gravedad, energía cinética y dinámica de fluidos, lo que permite generar escenas con mayor realismo sin necesidad de ajustes técnicos manuales.
  • La función Avatars permite a los usuarios crear un doble digital de sí mismos para generar vídeos que reproduzcan su imagen y voz, y todos los vídeos generados con Omni incluyen la marca de agua digital imperceptible SynthID para garantizar la trazabilidad del contenido.
  • Gemini Omni Flash está disponible desde hoy para suscriptores de planes Google AI Plus, Pro y Ultra a través de la app Gemini y Google Flow, y se despliega también de forma gratuita en YouTube Shorts y YouTube Create App a partir de esta semana.
  • En las próximas semanas, el modelo estará accesible para desarrolladores y clientes empresariales a través de APIs, lo que abre la puerta a integraciones en flujos de producción de contenido profesional y herramientas de marketing digital.

Análisis

Gemini Omni representa la culminación de la apuesta de Google DeepMind por la multimodalidad nativa. Desde sus orígenes, Gemini fue diseñado para razonar sobre múltiples tipos de datos a la vez, y Omni extiende esta capacidad al ámbito de la generación creativa. Lo que distingue a este modelo de otras soluciones de vídeo generativo es su capacidad para combinar referencias heterogéneas (una imagen de personaje, un fragmento de vídeo con movimiento de referencia y una pista de audio) y producir un resultado cohesionado, sin que el usuario tenga que gestionar manualmente la consistencia entre capas.

La edición conversacional en múltiples turnos es una de las innovaciones más relevantes para los equipos de producción de contenido. Hasta ahora, la edición de vídeo mediante IA generativa exigía regenerar el clip completo ante cada modificación, perdiendo el contexto visual acumulado. Con Omni, cada instrucción se apoya en la anterior, lo que significa que un responsable de marketing puede iterar sobre un vídeo de forma progresiva, como si estuviera dando indicaciones a un editor humano, sin perder la coherencia de la escena original.

La integración directa con YouTube Shorts y YouTube Create App tiene consecuencias inmediatas para las estrategias de contenido en redes sociales. YouTube Shorts es uno de los formatos de mayor crecimiento en consumo de vídeo corto y está directamente indexado por Google Search. La capacidad de generar vídeos cortos de alta calidad a partir de prompts textuales o referencias visuales reduce significativamente la barrera de entrada para marcas que quieran mantener una presencia activa en este formato, con el consiguiente impacto en visibilidad orgánica.

El sistema de transparencia y trazabilidad implementado por Google merece atención especial. La marca de agua SynthID, invisible para el ojo humano pero verificable a través de la app Gemini, Chrome y Google Search, anticipa un ecosistema donde la procedencia del contenido generado por IA será verificable de forma sistemática. Esto tiene implicaciones para el SEO y la confianza editorial, ya que los motores de búsqueda y las plataformas podrán identificar y categorizar el contenido generado artificialmente con mayor precisión.

La hoja de ruta anunciada, que contempla soporte futuro para generación de imágenes y audio como outputs adicionales, indica que Omni está diseñado para convertirse en una plataforma creativa unificada. Para las agencias de marketing, esto significa que la gestión de activos digitales (vídeo, imagen, audio) podría converger en un único entorno de generación, simplificando los flujos de trabajo de producción de campañas multimedia y reduciendo la dependencia de múltiples herramientas especializadas.

Qué hacer

  • Integrar Gemini Omni Flash en los flujos de producción de contenido para YouTube Shorts desde el primer momento, aprovechando su disponibilidad gratuita en esta plataforma para generar vídeos cortos de alta calidad sin coste adicional y evaluar su impacto en el alcance orgánico de los canales de marca.
  • Desarrollar una biblioteca de referencias visuales y de audio (imágenes de personajes, guías de estilo visual, muestras de audio de marca) que puedan utilizarse como entradas en Gemini Omni, de modo que la producción de nuevos contenidos mantenga coherencia con la identidad visual corporativa ya establecida.
  • Establecer protocolos internos de revisión de contenidos generados con IA que contemplen la verificación de la marca de agua SynthID, tanto para cumplir con las políticas de transparencia de Google como para anticipar posibles requisitos regulatorios sobre identificación de contenido generado artificialmente.
  • Explorar los casos de uso de edición conversacional en múltiples turnos para agilizar ciclos de aprobación de creatividades de vídeo, permitiendo que los equipos iteren directamente sobre un clip base mediante instrucciones en lenguaje natural en lugar de encargar nuevas versiones al equipo de producción.
  • Preparar a los equipos de contenido para acceder a la API de Gemini Omni Flash en cuanto esté disponible para desarrolladores, identificando con antelación los casos de uso prioritarios (personalización de vídeos a escala, generación de variantes para tests A/B, creación de contenido localizado) que podrían integrarse en las plataformas de gestión de campañas existentes.
  • Monitorizar la evolución de las políticas de Google Search respecto al contenido de vídeo generado con IA, dado que la integración de la verificación SynthID en Google Search sugiere que el motor de búsqueda desarrollará criterios específicos de calidad y autenticidad para este tipo de contenido, lo que afectará directamente al posicionamiento de los vídeos de marca.
Impacto

La irrupción de Gemini Omni en el ecosistema de YouTube Shorts introduce un nuevo vector de creación de contenido visual optimizado para plataformas de alto tráfico, lo que puede modificar las estrategias de visibilidad orgánica y la forma en que las marcas producen vídeos para posicionarse en búsquedas y feeds algorítmicos. Las marcas que adopten esta tecnología podrán generar contenido visual a escala, con mayor coherencia narrativa y menor coste de producción, lo que impactará directamente en su capacidad de presencia digital.

Fuente oficial
No te pierdas ninguna novedad

Novedades de producto, actualizaciones de algoritmos y buenas prácticas, directamente en tu correo.

Volver al seguimiento

Mantente un paso por delante de los algoritmos

Pulsar sigue tus posiciones en Google, tu visibilidad en las IA y tus redes sociales en un único dashboard. 14 días de prueba, sin tarjeta bancaria.

Empezar una prueba gratuita