Aller au contenu principal
Intelligence artificielle

ChatGPT vs Gemini : lequel comprend le mieux les images ?

Par Abdellah BALRHOUAT7 min de lecture
ChatGPT vs Gemini comparés sur la reconnaissance et l’analyse d’images
Comparatif ChatGPT et Google Gemini pour comprendre des photos

Gemini s’est montré plus régulier que ChatGPT lors d’un comparatif publié par CNET portant sur la compréhension d’images. Soumis aux mêmes photographies et aux mêmes questions, l’assistant de Google a notamment mieux reconnu une écriture manuscrite difficile à lire et une référence au film Hocus Pocus, tandis que ChatGPT s’est distingué sur l’analyse d’une plante.

Le résultat est intéressant, car les assistants IA ne servent plus uniquement à rédiger des textes ou à répondre à des questions. Ils peuvent désormais examiner des photos, lire des documents, identifier des objets et, selon le produit utilisé, analyser ce que montre la caméra d’un smartphone.

Mais il faut immédiatement apporter une nuance : le test de CNET repose sur seulement quatre situations et n’a rien d’un benchmark scientifique. Il donne une photographie utile de l’expérience utilisateur, pas une preuve définitive qu’un modèle « voit » systématiquement mieux que l’autre.

À retenir:

  • CNET a comparé ChatGPT et Gemini avec les mêmes photos et les mêmes questions.
  • Gemini s’est montré plus convaincant sur l’écriture manuscrite et l’identification d’une référence cinématographique.
  • ChatGPT a fourni une réponse particulièrement utile lors du diagnostic visuel d’une plante.
  • L’exercice sur une position d’échecs n’a pas permis de dégager un résultat suffisamment fiable.
  • Le comparatif porte sur des photos fixes et ne mesure pas toutes les fonctions visuelles disponibles aujourd’hui dans ChatGPT et Gemini Live.

Quatre images pour tester la compréhension visuelle

Pour limiter les différences de méthode, le journaliste de CNET a utilisé des photos fixes plutôt que de la vidéo en direct. La même image et une consigne identique étaient envoyées successivement à ChatGPT et Gemini.

Cette méthodologie simple a un avantage : elle permet de comparer plus directement les réponses.

Le premier exercice concernait des notes manuscrites volontairement difficiles à déchiffrer. Gemini est parvenu à les retranscrire de manière beaucoup plus convaincante et à reconnaître leur origine littéraire, liée à The Hound of the Baskervilles d’Arthur Conan Doyle.

ChatGPT, dans ce cas précis, a eu nettement plus de difficultés à reconstruire correctement le texte.

Ce type de tâche est particulièrement exigeant. Une IA multimodale ne doit pas seulement détecter des lettres : elle doit distinguer des formes irrégulières, reconstruire les mots grâce au contexte puis comprendre leur signification.

Gemini a donc marqué un point important sur un usage concret : transformer rapidement une photo de notes difficiles à lire en information exploitable.

Gemini reconnaît mieux une référence visuelle à Hocus Pocus

Un autre exercice reposait sur trois œuvres artisanales représentant les sourires des sœurs Sanderson du film Hocus Pocus.

ChatGPT a correctement décrit ce qu’il voyait, notamment plusieurs peintures de forme géométrique, mais n’a pas identifié leur référence cinématographique.

Gemini a reconnu Hocus Pocus et relié les différentes œuvres aux personnages concernés.

La distinction est intéressante.

Décrire une image et identifier ce qu’elle représente réellement sont deux problèmes différents. Une IA peut parfaitement reconnaître des formes, des couleurs ou des visages sans réussir à relier ces éléments à une œuvre culturelle précise.

Dans cet exercice, Gemini a mieux effectué cette deuxième étape : passer de la perception visuelle au contexte.

Cela correspond à l’objectif affiché par Google avec Gemini Live, qui permet de partager la caméra d’un smartphone avec l’assistant et de lui poser des questions sur ce qui apparaît devant l’utilisateur. Google a encore développé ces fonctions en 2026 avec des outils de guidage visuel capables d’aider l’utilisateur à cadrer ou localiser certains objets.

ChatGPT plus convaincant lorsqu’il faut expliquer un problème

Gemini n’a toutefois pas dominé tous les exercices.

Lorsqu’une photo montrant une dionée attrape-mouche en mauvais état a été soumise aux deux assistants, les réponses obtenues étaient globalement utiles des deux côtés.

ChatGPT s’est montré particulièrement détaillé dans son diagnostic et dans les recommandations proposées.

Cet exemple rappelle qu’une bonne analyse visuelle ne consiste pas uniquement à reconnaître correctement un objet.

Dans de nombreuses situations quotidiennes, identifier « une plante » ne suffit pas. L’assistant doit comprendre son état apparent, envisager plusieurs causes possibles et expliquer quelles vérifications effectuer.

C’est justement l’un des intérêts majeurs de la multimodalité : combiner reconnaissance visuelle et raisonnement conversationnel.

OpenAI indique officiellement que ChatGPT peut analyser des images ajoutées à une conversation, notamment pour identifier des objets ou comprendre des documents. Son mode vocal Advanced peut également utiliser la vidéo et le partage d’écran sur les appareils compatibles, tandis que le nouveau mode ChatGPT Live accepte actuellement les images mais pas encore la vidéo en direct.

Le test sur les échecs montre les limites de ce type de comparatif

Le quatrième exercice concernait une position sur un échiquier.

Les deux assistants ont tenté d’analyser la situation, mais déterminer objectivement quelle réponse était correcte s’est révélé plus difficile. Faute de validation suffisamment solide par un spécialiste des échecs, CNET a choisi de ne pas utiliser ce test pour départager définitivement les deux services.

Cette décision est importante.

Les modèles multimodaux peuvent produire des explications très convaincantes même lorsqu’une partie de leur interprétation visuelle est incorrecte. Sur un échiquier, une seule pièce mal identifiée ou placée sur la mauvaise case suffit à rendre toute l’analyse stratégique erronée.

Même principe pour un schéma électronique, un document médical ou une photographie technique : une réponse détaillée ne signifie pas automatiquement que l’observation initiale était exacte.

Google et OpenAI recommandent d’ailleurs de vérifier les informations importantes générées par leurs assistants.

Gemini gagne ce petit test, pas forcément la bataille de la vision IA

CNET privilégie finalement Gemini en raison de sa plus grande régularité, particulièrement dans les exercices consacrés au manuscrit et à Hocus Pocus.

Cette conclusion doit cependant rester limitée au protocole utilisé.

Quatre photographies ne constituent pas un benchmark suffisamment large pour mesurer toutes les dimensions de la vision artificielle : lecture de petits caractères, compréhension de graphiques, analyse de documents, localisation spatiale, suivi vidéo, comptage d’objets, reconnaissance d’interfaces ou raisonnement à partir de plusieurs images.

Les produits évoluent également très rapidement.

Google permet aujourd’hui de partager directement sa caméra et son écran avec Gemini Live. L’entreprise a également introduit des fonctions de guidage visuel capables de mettre en évidence certains éléments à l’écran et développe ses modèles Gemini Live autour d’interactions combinant voix et compréhension visuelle.

OpenAI suit une architecture légèrement différente. Son nouveau ChatGPT Live, basé sur GPT-Live-1 pour les utilisateurs payants et GPT-Live-1 mini pour l’offre gratuite, peut combiner voix, texte et images. La vidéo et le partage d’écran restent pour l’instant proposés via l’ancien mode Advanced sur les appareils et comptes compatibles.

Le test CNET est donc surtout révélateur d’une tendance plus large : la qualité d’un assistant IA ne se mesure plus uniquement à ce qu’il sait écrire, mais aussi à sa capacité à comprendre ce que l’utilisateur lui montre.

Pour les utilisateurs, le meilleur choix dépendra ainsi moins d’un classement universel que du type de tâche : lecture de documents, identification d’objets, assistance en temps réel ou analyse détaillée d’une photographie.

Vous pouvez retrouver d’autres comparatifs et analyses consacrés à ChatGPT, Gemini et aux nouveaux modèles d’intelligence artificielle sur TechExplorateur.

FAQ:

Gemini reconnaît-il mieux les images que ChatGPT ?

Dans le petit comparatif réalisé par CNET, Gemini s’est montré plus régulier, notamment pour lire une écriture manuscrite et identifier une référence à Hocus Pocus. Ce résultat ne constitue toutefois pas un benchmark général.

ChatGPT peut-il analyser une photo ?

Oui. OpenAI permet d’ajouter des images à ChatGPT afin de poser des questions sur leur contenu, identifier des objets ou analyser certains documents.

Gemini Live peut-il utiliser la caméra du téléphone ?

Oui. Gemini Live permet de partager la caméra ou l’écran d’un appareil compatible afin de discuter avec l’assistant de ce que l’utilisateur est en train de regarder.

Sources officielles et fiables:

Partager cet article

Abdellah BALRHOUAT

Abdellah BALRHOUAT

Journaliste spécialisé en high-tech, matériel informatique, jeux vidéo et intelligence artificielle, Abdellah BALRHOUAT suit l’industrie technologique depuis plus de dix ans. Fondateur et directeur de la publication de Tech Explorateur, il teste personnellement le matériel sur le banc d’essai de la rédaction et vérifie chaque information auprès des sources primaires avant publication. Sa ligne de conduite : une information tech claire, fiable et vraiment utile aux lecteurs francophones.

Tous les articles de cet auteur

Laisser un commentaire

Your email address will not be published. Required fields are marked *

En commentant, vous acceptez notre charte des commentaires .