Blog

ChatGPT décrypte les photos avec une expertise surpassant celle d’un critique d’art et d’un enquêteur réunis

ChatGPT décrypte les photos avec une expertise surpassant celle d'un critique d'art et d'un enquêteur réunis
Ecrit par Mathieu

Les capacités de génération d’images de ChatGPT redéfinissent notre compréhension

Les récentes avancées dans la génération d’images par ChatGPT bouleversent notre compréhension précédente des médias générés par IA.

Le modèle GPT-4o récemment annoncé se distingue par sa capacité remarquable à interpréter et recréer des images avec une précision impressionnante, souvent avec des effets viraux comme ceux inspirés par Studio Ghibli.

Il maîtrise même le texte dans les images créées par IA, un défi que l’IA n’avait pas encore relevé auparavant. Désormais, deux nouveaux modèles ont été lancés, capables de disséquer des images pour en extraire des indices qui pourraient échapper à l’œil humain.

Présentation des modèles o3 et o4-mini d’OpenAI

OpenAI a dévoilé deux nouveaux modèles plus tôt cette semaine, augmentant ainsi les capacités de réflexion de ChatGPT. Le nouveau modèle o3, présenté comme « le modèle de raisonnement le plus puissant » par OpenAI, améliore les compétences existantes en matière d’interprétation et de perception, s’améliorant en programmation, mathématiques, sciences, et perception visuelle.

Parallèlement, le o4-mini est un modèle plus petit et plus rapide dédié à un « raisonnement efficace en termes de coûts » dans les mêmes domaines. Ce lancement fait suite à celui des modèles de classe GPT-4.1, apportant un traitement plus rapide et un contexte plus profond.

ChatGPT pense désormais “avec des images”

Grâce à ces améliorations en matière de raisonnement, ces modèles peuvent désormais intégrer des images dans leur processus de réflexion, ce qui les rend capables de « penser avec des images », comme le proclame OpenAI. Cette nouveauté permet aux modèles de dépasser l’analyse basique des images.

Les modèles o3 et o4-mini peuvent désormais examiner les images de manière plus approfondie et même les manipuler, via des actions telles que recadrer, zoomer, retourner, ou enrichir les détails pour tirer tout indice visuel susceptible d’améliorer les solutions proposées par ChatGPT.

Introducing OpenAI o3 and o4-mini—our smartest and most capable models to date.

OpenAI affirme que ces modèles combinent le raisonnement visuel et textuel, pouvant être intégrés à d’autres fonctionnalités de ChatGPT, comme la recherche web, l’analyse de données, et la génération de code, et doivent servir de fondation pour des agents d’IA avancés dotés d’analyses multimodales.

Application pratique et accès limité

Parmi les applications pratiques, il est désormais possible d’inclure des images variées, qu’il s’agisse de diagrammes ou de notes manuscrites, pour offrir à ChatGPT une compréhension approfondie sans avoir besoin de texte descriptif.

Cela rapproche OpenAI du système Gemini de Google, qui possède une capacité impressionnante à interpréter le monde réel à travers la vidéo en direct.

Malgré ces affirmations ambitieuses, OpenAI limite l’accès aux seuls membres payants, probablement pour éviter de « faire fondre » ses GPU en raison de la forte demande de calcul pour ces nouvelles fonctionnalités de raisonnement.

Actuellement, les modèles o3, o4-mini, et o4-mini-high ne sont disponibles que pour les membres ChatGPT Plus, Pro et Team, tandis que les utilisateurs des offres Enterprise et Education y auront accès dans une semaine.

Pour leur part, les utilisateurs gratuits auront un accès limité à o4-mini en sélectionnant le bouton « Think » dans la barre de saisie.

A propos de l'auteur.

Mathieu

Laisser un commentaire.