Blog

Le nouveau modèle de génération d’images de Midjourney prêt à rivaliser avec GPT-4 d’OpenAI

Le nouveau modèle de génération d'images de Midjourney prêt à rivaliser avec GPT-4 d'OpenAI
Ecrit par Mathieu

MidJourney : Une Évolution Nécessaire dans un Marché Concurrentiel

Contexte et Défis

Bien que MidJourney ait été l’un des modèles de génération d’images les plus prometteurs à l’aube de l’intelligence artificielle, il semble désormais être dépassé par des outils plus accessibles, simples d’utilisation et gratuits tels que Gemini, ChatGPT, et Bing.

Le dernier modèle d’OpenAI, GPT-4o, ajoute encore à ses difficultés en offrant une génération d’images d’une précision impressionnante, capable de recréer des photos réalistes et de produire un texte impeccable.

Face à ces défis, et peut-être pour reprendre le devant de la scène face à la vague d’art inspiré de Studio Ghibli inondant internet, MidJourney déploie un modèle actualisé avec divers améliorations.

Nouveau Modèle V7 : Améliorations et Fonctionnalités

Le PDG David Holz a annoncé les détails du nouveau modèle V7 sur le serveur Discord officiel de MidJourney ainsi que dans un article de blog.

Selon ses propos, le nouveau modèle est “plus intelligent avec les textes d’invite” et génère des images d’une qualité “visiblement supérieure” avec de “magnifiques textures“.

Holz souligne que le modèle est capable de créer des images en un clin d’œil, jusqu’à 10 fois plus rapidement que le modèle précédent, car il est conçu pour le brainstorming et les itérations fréquentes.

Il est possible de passer en mode conversationnel (uniquement sur le web) afin de recréer une partie de l’image sans avoir à réécrire complètement l’invite ou à utiliser le mode d’édition.

Les images générées sont de qualité moindre et coûtent la moitié du prix des images classiques.

Une des fonctionnalités les plus excitantes pour notre nouveau modèle V7 est ce que nous appelons le “Draft Mode”. Le mode brouillon coûte deux fois moins cher et est 10 fois plus rapide ; il pourrait être la meilleure façon de développer des idées jamais vue. Essayez-le avec la voix, pensez à haute voix et laissez nos idées couler comme des rêves liquides.

Le mode conversationnel est remplacé par un mode vocal lorsque vous utilisez l’application Discord sur votre ordinateur ou mobile. Holz explique que cela vous permet de “penser à voix haute et de laisser les images s’écouler sous vous comme des rêves liquides”. Cette fonctionnalité fait également partie du mode brouillon nouvellement introduit.

Modes Relax et Turbo

En outre, MidJourney V7 peut fonctionner en modes Relax et Turbo pour des images à haute résolution (par rapport au mode brouillon), et l’utilisation de ce dernier coûtera le double de crédits en contrepartie d’une production de l’image plus rapide.

Limitations et Perspectives

Actuellement, le nouveau modèle V7 manque de certaines fonctions, et les flux de travail reviennent par défaut au modèle V6.1 précédent pour les tâches nécessitant un upscaling, de l’inpainting, et du retexturage.

Enfin, le modèle permet aussi la personnalisation avec la possibilité d’enregistrer des préférences sur les types d’images souhaités et de laisser le modèle produire des résultats en conséquence.

Cela nécessite un paramétrage de cinq minutes, passant par une série de 200 images que vous pouvez sélectionner pour ajuster vos préférences.

Actuellement, MidJourney réalise un test alpha communautaire pour le modèle, et promet des fonctionnalités supplémentaires dans les 60 prochains jours. Vous pouvez l’essayer en tapant /settings dans la boîte de chat sur Discord ou la plateforme web, envoyez le message, et changez le modèle par défaut pour le V7 à partir des paramètres qui apparaissent.

A propos de l'auteur.

Mathieu

Laisser un commentaire.