23 avril 2013 | Québec
Apprendre aux systèmes informatiques à exploiter l’information visuelle
Une photographie est immédiatement compréhensible pour une personne. Nous pouvons reconnaître des objets, distinguer des formes ou remarquer certains détails presque instantanément. Pour un système informatique, une image est d’abord constituée de données numériques qu’il faut analyser afin d’en extraire de l’information utile.
C’est le rôle de la vision par ordinateur, ou computer vision. Ce domaine de l’intelligence artificielle regroupe différentes méthodes permettant aux systèmes informatiques d’analyser des images et d’en reconnaître certaines caractéristiques.
Dans le programme de Spécialiste en intelligence artificielle – LEA.E3 du Collège CDI, la vision par ordinateur est notamment abordée dans les apprentissages avancés liés à l’intelligence artificielle et à l’apprentissage profond.
Comment un ordinateur voit-il une image?
Une image numérique est composée de pixels. Chacun d’eux contient des valeurs représentant notamment la luminosité ou les couleurs.
Pour une personne, l’ensemble forme immédiatement une scène, un visage ou un objet. Pour un ordinateur, il s’agit plutôt d’un ensemble de valeurs numériques organisées selon une structure donnée.
La première difficulté consiste donc à passer de ces données brutes à des caractéristiques permettant au système de distinguer et d’interpréter certains éléments présents dans l’image.
Cette transformation explique pourquoi l’analyse d’images peut nécessiter des méthodes d’apprentissage automatique capables d’exploiter une quantité considérable de données.
👉 Découvrez également : Réseaux neuronaux : comment fonctionnent-ils en intelligence artificielle?
Reconnaître une image ou localiser un objet?
Plusieurs tâches distinctes se cachent derrière l’expression « analyser une image ».
La classification d’images consiste, par exemple, à attribuer une catégorie à une image. Un modèle pourrait devoir déterminer laquelle de plusieurs catégories correspond le mieux au contenu présenté.
La détection d’objets ajoute une dimension supplémentaire : il faut non seulement reconnaître certains éléments, mais également déterminer leur position dans l’image.
La vision par ordinateur peut donc servir à répondre à des questions très différentes selon l’application : qu’est-ce qui apparaît sur cette image? Où se trouve cet élément? Quelles parties de l’image lui correspondent?
Comment un modèle apprend-il à reconnaître des images?
Dans un problème de classification supervisée, un modèle peut être entraîné à partir d’un ensemble d’images associées à des informations connues.
En examinant de nombreux exemples, il ajuste progressivement ses paramètres afin d’apprendre certaines caractéristiques qui l’aideront ensuite à traiter de nouvelles images.
Comme pour les autres applications d’apprentissage automatique, il faut toutefois distinguer les données utilisées pour entraîner le modèle de celles qui serviront à évaluer sa capacité à traiter des données qu’il n’a jamais vues.
👉 Découvrez également : Apprentissage supervisé et non supervisé : quelle différence?
Pourquoi utilise-t-on des réseaux neuronaux convolutifs?
Les réseaux de neurones convolutifs, ou CNN, sont particulièrement associés au traitement des images.
Plutôt que de traiter une image comme une simple succession de valeurs indépendantes, ces réseaux peuvent exploiter sa structure spatiale. Au fil des différentes couches, ils peuvent apprendre à détecter des caractéristiques de plus en plus complexes.
Certaines couches peuvent ainsi réagir à des éléments relativement simples, tandis que les suivantes combinent progressivement cette information afin d’apprendre à construire des représentations plus élaborées.
Les réseaux de neurones convolutifs font partie des architectures abordées dans le cours d’apprentissage profond du programme de Spécialiste en intelligence artificielle – LEA.E3.
Qu’est-ce que la segmentation d’une image?
Certaines applications nécessitent une analyse plus précise que la simple détection d’un objet.
La segmentation vise à déterminer quelles parties d’une image correspondent à des éléments donnés. Plutôt que d’indiquer uniquement qu’un objet est présent ou de tracer une zone approximative autour de celui-ci, le système cherche à identifier plus précisément les pixels qui lui appartiennent.
Cette distinction montre à quel point les problèmes de vision par ordinateur peuvent varier en complexité. Reconnaître globalement le contenu d’une photographie et analyser précisément ses différentes composantes ne requièrent pas nécessairement les mêmes méthodes.
Pourquoi faut-il beaucoup travailler sur les données?
La performance d’un modèle dépend fortement des données utilisées pour son entraînement.
Si certaines situations sont absentes ou très peu représentées, le modèle peut rencontrer davantage de difficultés lorsqu’il les rencontre ultérieurement. Les différences d’éclairage, d’orientation, de cadrage ou de qualité d’image peuvent également compliquer l’analyse.
Il faut donc préparer les données, en vérifier la qualité et évaluer si elles reflètent suffisamment le problème que l’on souhaite résoudre.
Cette étape s’inscrit dans un principe qui se retrouve dans plusieurs domaines de l’intelligence artificielle : la sophistication d’un algorithme ne compense pas automatiquement des données inadéquates.
👉 Découvrez également : Statistiques et intelligence artificielle : pourquoi vont-elles de pair?
Où la vision par ordinateur peut-elle être utilisée?
La capacité à analyser automatiquement des images peut s'avérer utile dans de nombreux contextes.
Selon les applications, la vision par ordinateur peut notamment intervenir dans l’analyse d’images, la reconnaissance d’éléments visuels, l’automatisation de certaines inspections ou l’exploitation de grandes quantités de contenu visuel.
Les problèmes rencontrés varient toutefois considérablement d’un projet à l’autre. Le choix des données, des méthodes et des critères d’évaluation doit donc être adapté à l’objectif recherché.
Vision par ordinateur et apprentissage profond : quel est le lien?
La vision par ordinateur existait avant le développement actuel de l’apprentissage profond. Toutefois, les réseaux neuronaux profonds ont permis de développer de nouvelles façons d’apprendre directement certaines caractéristiques à partir de grandes quantités d’images.
C’est pourquoi la vision par ordinateur est aujourd’hui étroitement associée à plusieurs architectures d’apprentissage profond.
Dans le programme de Spécialiste en intelligence artificielle – LEA.E3, ces apprentissages s’inscrivent dans une progression qui comprend également les statistiques, Python, les bases de données, l’analyse prédictive et l’apprentissage automatique.
La vision par ordinateur constitue ainsi une application concrète de plusieurs notions étudiées précédemment dans la formation.
Foire aux questions
1. Qu’est-ce que la vision par ordinateur?
La vision par ordinateur est un domaine qui regroupe des méthodes permettant aux systèmes informatiques d’analyser des images et d’en extraire des informations. Elle peut notamment intervenir dans des tâches de classification, de détection ou de segmentation d’images.
2. Quelle est la différence entre la classification et la détection d’objets?
La classification vise généralement à déterminer ce qu’une image représente ou à laquelle catégorie elle appartient. La détection d’objets vise également à localiser certains éléments présents dans l’image.
3. Pourquoi utilise-t-on des réseaux neuronaux pour analyser des images?
Certaines architectures de réseaux de neurones, notamment les réseaux de neurones convolutifs, peuvent apprendre progressivement des caractéristiques présentes dans les images. Elles permettent ainsi de développer des modèles adaptés à diverses tâches de vision par ordinateur.
Pour aller plus loin
👉 Intelligence artificielle : comprendre le domaine et ses perspectives
👉 Traitement du langage naturel : comment l’IA analyse-t-elle le texte?
👉 Python en intelligence artificielle : pourquoi ce langage est-il si utilisé?
👉 En savoir plus sur le programme de Spécialiste en intelligence artificielle – LEA.E3 du Collège CDI