Distinction entre apprentissage supervisé et non supervisé

Objective

After completing this lesson, you will be able to faire la distinction entre les approches d'apprentissage supervisé et non supervisé

Principales différences entre l’apprentissage supervisé et non supervisé

L'apprentissage supervisé utilise des jeux de données d'entraînement étiquetés, tandis que l'apprentissage non supervisé n'a pas de variable cible. Les algorithmes d'apprentissage non supervisé tentent d'apprendre la structure intrinsèque des données sans supervision ou instruction humaine. Dans le cadre d'un apprentissage non supervisé, des données d'entrée non étiquetées sont fournies à l'algorithme pour rechercher des modèles dans le jeu de données.

L'apprentissage supervisé et non supervisé sont les principales approches de l'apprentissage automatique. L'apprentissage automatique supervisé est approprié pour les tâches de classification et de régression, telles que les prévisions météorologiques, la prévision des cours des actions, la détection de la fraude, la prévision de l'attrition des clients, entre autres. L'apprentissage non supervisé, quant à lui, s'appuie sur des données sans supervision humaine et est fréquemment utilisé pour l'analyse exploratoire des données et les activités de regroupement, telles que la détection des anomalies et la visualisation du Big Data.

La modélisation d'apprentissage supervisée se concentre sur l'apprentissage des relations entre les éléments de données d'entrée et de sortie. Par exemple, la classification tente de prédire les valeurs catégoriques de la variable cible compte tenu des données d'entrée, tandis que la régression tente de comprendre la relation entre la ou les variables indépendantes et la variable dépendante.

En revanche, pour l'apprentissage non supervisé, il n'y a pas d'étiquettes mais uniquement des attributs de données, c'est-à-dire des caractéristiques, décrivant ces groupes de blocs. L'apprentissage non supervisé prend en charge la découverte de modèles dans les jeux de données. Par exemple, des activités telles que le regroupement fractionnent les données en collections d'entités similaires.

En résumé, les principales différences entre l'apprentissage supervisé et non supervisé résident dans la manière dont les modèles sont entraînés et le type de jeux de données d'entraînement alimentés par les algorithmes.

d'application

Ensembles de données de formation supervisée

Les algorithmes d'apprentissage supervisé sont entraînés sur un jeu de données étiqueté, c'est-à-dire que le jeu de données a une 'Variable cible'.

Dans un jeu de données étiqueté, chaque instance du jeu de données est accompagnée d'une étiquette ou d'une « variable cible » qui indique la bonne sortie. Cette étiquette est utilisée par les algorithmes d'apprentissage supervisé pour apprendre une fonction qui mappe les entrées aux sorties souhaitées.

Les algorithmes d'apprentissage supervisé sont entraînés sur un jeu de données, où les fonctionnalités d'entrée et les sorties correctes (étiquettes) sont fournies. Le modèle apprend à prédire la sortie des données d'entrée. Les algorithmes d'apprentissage non supervisé, quant à eux, fonctionnent avec des données non étiquetées et tentent d'identifier des modèles ou des regroupements inhérents sans connaissance préalable des résultats. La durée et la complexité du processus d'entraînement pour les deux types d'apprentissage peuvent varier en fonction de facteurs tels que la taille du jeu de données, les ressources informatiques disponibles, entre autres.

Le jeu de données du logement californien, disponible sur le portail californien des données ouvertes, (https://data.ca.gov/dataset) est utilisé comme référence dans les paragraphes ci-dessous.

Le tableau ci-dessous illustre l'exemple de jeu de données d'entrée pour une tâche d'apprentissage supervisée, qui vise à entraîner un modèle pour prédire la 'valeur de maison médiane' pour les districts californiens. En d'autres termes, la "variable cible" est la "valeur interne médiane".

Les colonnes sont également appelées "Fonctionnalités". Ces fonctionnalités sont des attributs de données qui peuvent aider à prédire la "variable cible". Intuitivement, 'Âge médian de la maison', 'Nombre moyen de pièces par ménage' et 'Nombre moyen de chambres par ménage' sont des caractéristiques d'une maison qui influencent sa valeur. Enfin, "Fonctionnalités" et "Étiquettes" sont les données d'entrée pour l'entraînement du modèle supervisé.

Image montrant un ensemble de données étiqueté pour une tâche d'apprentissage supervisé, y compris diverses fonctionnalités telles que 'Population', 'Revenu médian', 'Âge médian du logement' et 'Chambres totales', dans le but d'entraîner un modèle à prédire la 'Valeur médiane de la maison' pour les districts en Californie.

d'application

Ce jeu de données a été dérivé du recensement américain de 1990, et chaque rangée représente un groupe de blocs de recensement. Un groupe de blocs est la plus petite unité géographique pour laquelle le bureau de recensement américain publie des échantillons de données (un groupe de blocs a généralement une population de 600 à 3 000 personnes).

Tableau illustrant l'exemple de 'Variable cible' de l'ensemble de données sur les logements en Californie

Par exemple, les valeurs "4.526" et "3.585" sont des étiquettes pour la "variable cible" continue, ce qui signifie que la variable peut prendre n'importe quelle valeur comprise entre sa valeur minimale et sa valeur maximale.

Chaque ligne est une observation ou un exemple à partir duquel le modèle apprendra.

d'application

Approche d'apprentissage supervisée - Prévision de modèle

Une fois l'entraînement du modèle terminé, de nouvelles données d'entrée peuvent être fournies au modèle.

Dans ce scénario, un groupe de blocs est utilisé comme entrée.

Rappelons qu'un groupe de blocs est la plus petite unité géographique pour laquelle le bureau de recensement américain publie des échantillons de données (un groupe de blocs a généralement une population de 600 à 3 000 personnes).

Les caractéristiques sont données comme entrées dans la table, et le modèle fournit une prédiction : la 'Valeur maison médiane'.

L'image représente un diagramme dans lequel les caractéristiques (telles que 'Population', 'Revenu médian', 'Âge médian du logement' et 'Nombre total de chambres') sont fournies comme entrées dans un modèle, qui calcule comme résultat final, la 'Valeur médiane de la maison'.
d'application
Ensembles de données d’entraînement non supervisés

Pour l'apprentissage non supervisé, le jeu de données n'a pas d'étiquettes, mais a des attributs de données, c'est-à-dire des "Fonctionnalités", décrivant ces groupes de blocs. L'apprentissage non supervisé prend en charge la découverte de modèles dans les jeux de données. Par exemple, des activités telles que le regroupement fractionnent les données en collections d'entités similaires.

L'apprentissage non supervisé peut être appliqué pour identifier les différentes variétés des marchés du logement.

Le tableau ci-dessous montre un bloc de recensement et il est utilisé par un algorithme de clustering pour générer des regroupements de régions en fonction de la similarité des groupes de blocs de recensement. Par exemple, une catégorie peut être un marché du logement avec un « revenu médian » élevé et un nombre moyen de chambres d'au moins 5.

Ensemble de données sur le logement en Californie - Bloc de recensement

Revenu médianÂge médian de la maisonNombre moyen de chambresNombre moyen de chambresPopulationNombre moyen de membres du ménageLatitudeLongitudeValeur médiane de la maison
15.00132.08.8450411.0351241318.02.72314037.44-122.225.00001
15.00143.05.6875000.75000058.03.62500037.46-121.875.00001
15.00152.07.9944751.027624483.02.66850837.79-122.445.00001
15.00117.08.5203761.0219441011.03.16927932.99-117.235.00001
15.00127.07.6519230.9807691351.02.59807734.10-118.405.00001
Ensembles de données d'entraînement non supervisés

Il est important de noter que ces catégories émergent par le biais du processus d'apprentissage non supervisé, plutôt que d'être prédéterminées. Les informations obtenues grâce à la mise en cluster des résultats peuvent être précieuses pour les acheteurs de maisons et les investisseurs immobiliers.

d'application

Approche d'apprentissage non supervisée - Prédiction de modèle

Une fois l'entraînement du modèle terminé, il peut être utilisé pour effectuer des prévisions. Ainsi, à l'aide du modèle entraîné, vous pouvez prévoir la meilleure adaptation pour le groupe de blocs d'entrée donné comme illustré ci-dessous.

Prévision de la région de logement sur la base du modèle construit.
d'application

Approche d’apprentissage non supervisée

L'apprentissage non supervisé, d'autre part, peut toujours être utilisé pour découvrir des modèles dans des ensembles de données non étiquetés. L'étiquetage des données peut être une tâche fastidieuse, ce qui n'est pas toujours possible. En outre, il se peut même que vous ne connaissiez pas les catégories ou groupes pertinents dans lesquels les ensembles de données peuvent être fractionnés.

Par exemple, la découverte de grappes significatives de régions de logement en Californie peut aider les acheteurs de logements et les investisseurs immobiliers à mieux comprendre le marché immobilier californien.

En identifiant ces modèles, l'apprentissage non supervisé fournit des informations précieuses qui autrement seraient difficiles à obtenir.

Icône représentant les jeux de données lorsqu'ils ne sont pas étiquetés. Icône représentant les jeux de données lorsqu'ils sont étiquetés.