Google a mis à jour son modèle de production d'images et d'édition de chat avec Nano Banana 2.1. Le modèle, qui est la suite de Nano Banana 2, se concentre sur la cohérence des personnages, la conformité des commandes et la création de texte dans l'image. Le document développeur de la société, mis à jour le 6 octobre, répertorie la nouvelle version avec le code gemini-nano-banana-2.1.
Le modèle prend en charge l'utilisation de jusqu'à 14 images de référence dans une seule production. Par ailleurs, Google explique la capacité à conserver l'apparence de quatre caractères et les propriétés de dix objets. Ce support donne plus de conseils aux développeurs qui souhaitent utiliser le même personnage dans différentes scènes ; Cela ne garantit pas une correspondance parfaite pour chaque résultat.
Du côté de la sortie visuelle, il existe des options de résolution 1K, 2K et 4K ; l'option par défaut reste 1K. De plus, le modèle vise à réduire l’apparence des pièces répétitives dans des proportions larges et panoramiques. Google indique spécifiquement la correction des ratios 1:4, 4:1, 1:8 et 8:1 dans les sorties 2K et 4K.
Nano Banana 2.1 améliore également la génération de texte et la mise en page infographique dans les images. D’un autre côté, le fait que le modèle crée un meilleur texte n’indique pas à lui seul que le texte préparé est correct sur le plan informationnel. L'utilisateur continue de vérifier davantage l'adéquation des numéros, des étiquettes et des descriptions de l'image à la source.
Nano Banana 2.1 étend les options de production et d'édition
Les développeurs peuvent définir le niveau de réflexion avec des options minimales, moyennes ou élevées. Google utilise le support par défaut. De plus, la production supportée par la recherche web et visuelle permet au modèle de bénéficier d'informations externes et du contexte visuel ; Cette fonction ne crée pas la même capacité que la recherche de fichiers standard.
La fiche modèle de Google complète le cadre technique et les informations d'évaluation de la version. Le document du développeur répertorie les entrées de texte, d'image, de vidéo et de PDF, ainsi que la sortie d'image et de texte. Cependant, la production audio, l'API en direct, l'exécution de code et les appels de fonctions ne font pas partie des fonctionnalités prises en charge.
La limite d'entrée est annoncée à 131 072 et la limite de sortie est de 32 768 jetons. Ces chiffres représentent le contexte et les limites de réponse du modèle ; Il ne montre pas directement le nombre d’images pouvant être produites dans les mêmes nombres. De plus, la prise en charge de l'API Batch offre une option aux développeurs qui souhaitent exécuter des tâches par lots avec un flux de traitement distinct.
Google positionne le modèle comme une continuation de l'approche Flash en matière de vitesse et de rentabilité. Cependant, étant donné que le coût d'utilisation dépend du résultat sélectionné et du prix de l'API, il n'y a pas de frais fixes uniques. La nouvelle version propose une mise à jour technique répondant spécifiquement à la nécessité de travailler avec des références et de maintenir l'intégrité visuelle au cours de plusieurs cycles d'édition.