Gemini Omni y el fin de las fronteras entre texto, voz, imagen y video
Durante años llamamos «multimodal» a sistemas que aceptaban una foto además de texto. La nueva generación busca algo más profundo: comprender, crear y editar distintos medios dentro de una misma conversación.
Google presentó Gemini Omni en I/O 2026 como un modelo capaz de partir de entradas diversas, con especial atención al video y la edición conversacional. La tendencia importa porque reduce la distancia entre una intención y una pieza terminada. Una empresa puede mostrar un producto, explicar con voz qué desea cambiar y obtener variaciones sin traducir cada decisión a una herramienta diferente.
La interfaz se vuelve conversación
Eso no elimina el oficio. Lo desplaza. La habilidad valiosa será describir criterios, reconocer una mala composición, cuidar derechos y mantener consistencia. Crear más rápido amplifica tanto el buen gusto como la confusión.
Conviene guardar el material original, documentar qué fue generado y revisar nombres, datos, manos, reflejos y continuidad. Cuanto más natural parezca el resultado, más deliberada debe ser la verificación.
Fuente para ampliar: Colección oficial de Google I/O 2026.