img

Apprentissage supervisé et non supervisé : quelle différence?

22 avril 2013 | Québec

Deux grandes façons d’apprendre à partir des données

Lorsqu’un modèle d’apprentissage automatique analyse des données, la manière dont elles sont présentées et utilisées peut varier considérablement. Dans certains cas, les données contiennent déjà la réponse que le modèle doit apprendre à reconnaître. Dans d’autres cas, le modèle doit plutôt rechercher des structures ou des regroupements sans disposer au départ d’une réponse attendue.

 

Cette distinction permet de distinguer deux grandes approches de l’apprentissage automatique : l’apprentissage supervisé et l’apprentissage non supervisé.

 

Dans le programme de Spécialiste en intelligence artificielle – LEA.E3 du Collège CDI, ces méthodes sont notamment abordées dans le cours consacré à l’apprentissage automatique.

Qu’est-ce que l’apprentissage supervisé?

Dans l’apprentissage supervisé, le modèle apprend à partir de données dont le résultat attendu est déjà connu.

 

Imaginons un ensemble de courriels déjà identifiés comme indésirables ou légitimes. Ces exemples peuvent servir à entraîner un modèle pour reconnaître les caractéristiques propres à chacune des deux catégories. Une fois entraîné, celui-ci peut tenter de classer de nouveaux courriels qu’il n’a jamais rencontrés.

 

Le principe est donc celui d’un apprentissage à partir d’exemples accompagnés d’une réponse connue.

 

Cette approche peut être utilisée pour résoudre différents types de problèmes, notamment la classification et la régression.

 

👉 Découvrez également : Analyse prédictive et analyse prescriptive : quelle différence?

Classification et régression : deux problèmes différents

La classification consiste à attribuer une observation à une catégorie. Un modèle pourrait, par exemple, déterminer à quelle catégorie appartient une donnée en fonction des caractéristiques qu’il a appris à reconnaître.

 

La régression vise plutôt à estimer une valeur numérique. Elle pourrait notamment être utilisée lorsqu’on souhaite prévoir une quantité ou une valeur à partir de plusieurs variables.

 

Dans les deux cas, le modèle dispose d’exemples dont la réponse est connue au cours de l’apprentissage. Il tente ensuite d’apprendre les relations entre les caractéristiques des données et le résultat attendu.

 

Le programme de Spécialiste en intelligence artificielle – LEA.E3 aborde différents algorithmes et méthodes d’apprentissage supervisé dans le cadre du cours d’apprentissage automatique.

Comment vérifie-t-on si le modèle a réellement appris?

Un modèle peut obtenir d’excellents résultats avec les données qu’il a déjà vues, sans pour autant être efficace sur de nouvelles données.

 

Il faut donc évaluer sa capacité à généraliser, c’est-à-dire à appliquer ce qu’il a appris à des observations différentes de celles utilisées lors de son entraînement.

 

Cette logique explique notamment l’utilisation de données distinctes pour l’entraînement et l’évaluation des modèles. Elle permet de vérifier si le modèle a véritablement appris des relations utiles plutôt que de simplement s’adapter aux exemples qui lui ont été fournis.

 

👉 Découvrez également : Statistiques et intelligence artificielle : pourquoi vont-elles de pair?

Qu’est-ce que l’apprentissage non supervisé?

Dans l’apprentissage non supervisé, les données ne sont pas accompagnées d’une réponse que le modèle doit apprendre à reproduire.

 

L’objectif consiste plutôt à explorer les données afin d’y découvrir des structures, des similitudes ou des particularités.

 

Supposons qu’une organisation dispose d’un vaste ensemble de données relatives à sa clientèle sans avoir préalablement défini de catégories. Une méthode non supervisée pourrait aider à repérer des groupes présentant des caractéristiques communes.

 

Le modèle ne cherche donc pas à retrouver une réponse déjà connue. Il tente plutôt de mettre en évidence une organisation présente dans les données.

Qu’est-ce que le regroupement des données?

Le regroupement, souvent appelé clustering, constitue une application importante de l’apprentissage non supervisé.

 

L’objectif est de réunir des observations présentant des similitudes. Selon les données étudiées, cette approche peut permettre de découvrir des groupes qui n’avaient pas nécessairement été identifiés auparavant.

 

Il faut ensuite interpréter ces regroupements afin de comprendre ce qu’ils représentent et de déterminer s’ils apportent une information pertinente.

 

Cette étape rappelle une réalité importante de l’intelligence artificielle : un algorithme peut mettre en évidence une structure dans les données sans, à lui seul, en expliquer la signification dans le contexte étudié.

Supervisé ou non supervisé : comment choisir?

Le choix dépend principalement du problème à résoudre et des données disponibles.

 

Si les données contiennent des résultats connus et que l’objectif est d’apprendre à prédire ces résultats pour de nouvelles observations, une approche supervisée peut être appropriée.

 

Si l’objectif est plutôt d’explorer un ensemble de données afin d’y rechercher des regroupements ou certaines structures sans disposer de catégories préétablies, une approche non supervisée peut être envisagée.

 

Il n’existe donc pas de méthode universellement supérieure à l’autre. La question à résoudre détermine l’approche à privilégier.

 

👉 Découvrez également : Apprentissage automatique et apprentissage profond en intelligence artificielle

Pourquoi la préparation des données reste-t-elle importante?

Quelle que soit la méthode utilisée, la qualité des données demeure déterminante.

 

Valeurs manquantes, variables mal choisies, données incohérentes ou informations peu représentatives peuvent influencer les résultats obtenus. Il faut donc examiner et préparer les données avant de les utiliser pour entraîner ou explorer un modèle.

 

Le programme de Spécialiste en intelligence artificielle – LEA.E3 permet justement d’aborder le travail avec les données sous plusieurs angles, notamment les bases de données, les statistiques, R, Python, l’analyse prédictive et l’apprentissage automatique.

 

L’apprentissage automatique s’inscrit ainsi dans un processus plus vaste qui commence bien avant le choix d’un algorithme.

Comprendre les méthodes derrière l’apprentissage automatique

Les expressions « apprentissage supervisé » et « apprentissage non supervisé » peuvent sembler abstraites, mais la distinction repose finalement sur une question assez simple : le modèle connaît-il ou non les réponses qu’il doit apprendre à retrouver?

 

Comprendre cette différence permet ensuite de mieux saisir pourquoi certains algorithmes sont adaptés à la prédiction ou à la classification alors que d’autres servent davantage à explorer les données et à y découvrir des structures.

 

Dans le programme de Spécialiste en intelligence artificielle – LEA.E3, ces notions font partie des apprentissages qui permettent aux étudiants de comprendre et d’utiliser différentes méthodes d’apprentissage automatique.

Foire aux questions

1. Quelle est la principale différence entre l’apprentissage supervisé et l’apprentissage non supervisé?
En apprentissage supervisé, le modèle apprend à partir d’exemples dont le résultat attendu est connu. En apprentissage non supervisé, il explore des données sans réponse prédéterminée afin d’y rechercher notamment des structures ou des regroupements.


2. À quoi sert l’apprentissage supervisé?
L’apprentissage supervisé peut notamment servir à résoudre des problèmes de classification ou de régression. Le modèle apprend les relations présentes dans des exemples connus afin de tenter de produire un résultat à partir de nouvelles données.


3. À quoi sert l’apprentissage non supervisé?
L’apprentissage non supervisé peut servir à explorer des données lorsqu’aucune réponse n’a été définie à l’avance. Il peut notamment permettre de rechercher des groupes d’observations présentant des similitudes et de découvrir des structures qui méritent d’être davantage analysées.

Pour aller plus loin

👉 Intelligence artificielle : comprendre le domaine et ses perspectives

 

👉 Python en intelligence artificielle : pourquoi ce langage est-il si utilisé?

 

👉 R en science des données : à quoi sert-il en intelligence artificielle?

 

👉 En savoir plus sur le programme de Spécialiste en intelligence artificielle – LEA.E3 du Collège CDI

Souhaitez-vous obtenir plus d'information ou vous inscrire?

Cliquez sur le bouton ci-dessous et un conseiller communiquera avec vous dès que possible.