Google, Gémeaux Omni 1.1 Flash En publiant le modèle, la production vidéo avec intelligence artificielle est réalisée avec extension de scène, contrôle de la première et de la dernière image. Mise à l'échelle 4K options ajoutées. Le modèle restitue la scène en utilisant les 10 dernières secondes de la vidéo actuelle comme contexte. Jusqu'à 40 secondes au total par étapes de 10 secondes peut soutenir. De plus, il devient possible de produire des brouillons plus rapides avec une résolution de 360p. Google rend le modèle disponible via l'API Gemini, Google AI Studio, l'application Gemini et Google Flow.
Avec Gemini Omni 1.1 Flash, Google étend les outils vidéo de la précédente version préliminaire de Gemini Omni Flash. Alors que le modèle précédent se concentrait sur la production vidéo à grande vitesse et les fonctionnalités de montage vidéo en langage naturel, la nouvelle version directement extension vidéo apporte du soutien. Lors de l'extension d'un clip, le modèle examine les 10 dernières secondes de la vidéo originale et tente de préserver l'image, le mouvement, les personnages et le son dans la section suivante. Cependant, le système peut apporter des modifications aux dernières images de la vidéo d'entrée pour rendre la transition transparente. Chaque extension ajoute 10 secondes à la vidéo et la durée totale peut atteindre 40 secondes.
Le nouveau modèle est créé dans une seule sortie vidéo 3 à 10 secondes Il offre une option de durée entre et peut regarder des vidéos par seconde. 24 carrés Il se prépare à toute vitesse. Gemini Omni 1.1 Flash accepte le texte, les images et la vidéo côté entrée, tout en produisant de la vidéo côté sortie. La durée de la vidéo source téléchargée pour édition ou extension peut atteindre un maximum de 10 secondes, mais des règles différentes s'appliquent lors de l'extension répétée des vidéos précédemment produites par le modèle. De plus, l'étirement vidéo ajoute uniquement de nouvelles séquences à la fin du clip, et non au début ou au milieu de la vidéo existante.
Contrôle de la première et de la dernière image Il permet de définir deux images comme points de départ et d'arrivée d'une prise de vue. Gemini Omni 1.1 Flash produit une vidéo entre ces images, conservant le mouvement de la caméra et la transition entre deux images désignées. Ainsi, deux images distinctes peuvent être utilisées pour les tours de caméra, les zooms ou les vidéos dont le début et la fin sont connectés. Il est également possible d'ajouter des images et des vidéos comme références. Selon le document du développeur de Google, le système accepte un maximum de trois vidéos de référence, et chacune de ces vidéos jusqu'à 3 secondes Cela peut s’étendre.
Gemini Omni 1.1 accélère la production vidéo Flash
Google élimine également le besoin de préparer chaque tentative en haute résolution lors de la production de vidéos. Gemini Omni 1.1 Flash avec l'option standard 720p Brouillon de vidéo en résolution 360p peut créer. Selon l'entreprise, le mode 360p fournit des résultats jusqu'à 60 % plus rapides que la production standard 720p et réduit les coûts d'un tiers. Cela vous permet d'essayer différentes scènes et compositions en basse résolution, puis de déplacer la version préférée en haute résolution. L'application mobile Google Flow utilise également cette option pour préparer des brouillons vidéo rapides sur le téléphone.
Options de résolution 360p, 720p, 1080p et 4K Le système crée une vidéo 720p par défaut. De plus, Google applique la conversion ascendante dans les options 1080p et 4K au lieu de produire directement à cette résolution. Par conséquent, après des essais en basse résolution, il est possible de déplacer la vidéo sélectionnée vers une résolution plus élevée. Du côté de Google Flow, la société positionne des options d'exportation 1080p et 4K pour les processus d'édition de contenu numérique haute résolution, de médias sociaux et de diffusion. La documentation de l'API Gemini définit également clairement la sortie 1080p et 4K comme une vidéo « mise à l'échelle ».
Gemini Omni 1.1 Flash peut traiter du texte, des images et des vidéos ensemble pendant la production vidéo et suit les commandes d'édition via le langage naturel. Ainsi, il est possible de décrire uniquement la partie qui doit être modifiée dans la vidéo créée et de demander que les autres éléments soient conservés. Le modèle combine également les connaissances en physique avec les connaissances des Gémeaux en matière d'histoire, de science et de contexte culturel. Google crée également une piste audio adaptée à la vidéo sur demande, mais la version actuelle de l'API ne prend pas en charge le chargement de fichiers audio comme référence. Ce que le spectateur ne peut pas voir dans toutes les vidéos Gemini Omni produites Filigrane numérique SynthID est également inclus.
Google pour les développeurs Gémeaux Omni 1.1 Flash modèle gemini-omni-1.1-flash Il le propose en version stable avec son code. Le modèle peut être utilisé dans Google AI Studio via l'API Gemini, et les développeurs d'entreprise peuvent accéder au modèle via la plateforme Gemini Enterprise Agent. De plus, les abonnés Google AI Plus, Pro et Ultra peuvent utiliser les fonctionnalités Flash de Gemini Omni 1.1 dans le monde entier au sein de Google Flow. La fonctionnalité d'extension de scène est également disponible pour les utilisateurs de l'application Gemini disposant des mêmes abonnements. Ainsi, Google étend la distribution Gemini Omni, lancée en mai avec l'application Gemini, Flow et YouTube Shorts, aux outils de développement.
Gemini Omni Flash a été introduit pour la première fois lors de Google I/O en mai 2026, et la société a annoncé le modèle comme un modèle de média génératif capable de traiter ensemble du texte, des images, de l'audio et de la vidéo. Google plus tard le 30 juin gemini-omni-flash-preview a rendu son modèle disponible pour un aperçu public via l'API Gemini. Cette version créait des vidéos de 3 à 10 secondes à une résolution de 720p et permettait aux utilisateurs de modifier les vidéos avec des commandes vocales. entreprise maintenant Gémeaux Omni 1.1 Flash a terminé ce processus de prévisualisation et a rendu le modèle disponible pour un usage général.
Selon les notes de version de l'API Gemini de Google, elle est obsolète gemini-omni-flash-preview point final Le 30 septembre 2026 atteindra la fin de sa durée de vie utile. Par conséquent, les développeurs utilisant le modèle préliminaire en question gemini-omni-1.1-flash Il faut mettre à niveau vers la version. Avec la transition, le nouveau modèle ajoute l'étirement vidéo, la création vidéo entre la première et la dernière image et le contrôle de la résolution côté API. Google fournit également des références vidéo et des exemples d'étirement de scène et d'augmentation de la résolution dans sa documentation pour les développeurs et ses guides d'invite.