Ce sujet traite de trois méthodes d'apprentissage automatique clés pour SAP HANA : régression, classification et analyse de séries chronologiques.
Ces méthodes peuvent être utilisées dans différents scénarios, tels que :
- Régression : efficace pour prévoir les prix des voitures en fonction des caractéristiques des modèles et des tendances du marché.
- Classification : utile pour prévoir les comportements des clients, notamment l'attrition, la détection des fraudes et les modèles d'achat.
- Analyse des séries chronologiques : idéale pour prévoir les ventes futures, la demande, les coûts et d'autres métriques basées sur des données historiques.
d'application
Régression linéaire : prix de la maison en fonction de la surface habitable de la maison (taille)La régression linéaire est l'une des techniques statistiques les plus connues. Il est essentiel de le comprendre pour apprécier le développement de différents modèles de régression linéaire, tels que les "modèles linéaires généralisés".
La régression linéaire permet de découvrir des relations linéaires, c'est-à-dire des relations linéaires, entre les variables numériques d'entrée et de sortie, ce qui en fait une technique populaire pour la modélisation prédictive et statistique.
Dans la figure représentée, la variable "x" représente l'ensemble des valeurs des zones de vie des maisons, tandis que la variable "y" représente les prix des maisons.
Les valeurs continues de la variable 'y' sont prédites par 'h' : la fonction qui mappe les valeurs de 'x' à 'y'.
Pour plus de simplicité, la figure n'illustre qu'un seul attribut de données des maisons, qui est la surface habitable. Dans ce cas, la variable de prédicteur "x" est continue.

d'application
À l'instar de la figure précédente, le graphique suivant montre la variable d'entrée (espaces de vie des maisons) sur l'axe x et la variable de sortie (prix des maisons) sur l'axe des ordonnées.

L'objectif est de construire un modèle qui prend la surface habitable d'une maison comme entrée et prédit le prix de la maison. Les points de données du tracé représentent les observations du jeu de données. En adaptant une ligne à ces points de données, le modèle est créé. L'équation de cette ligne est Y = m x + c, où 'm' est la pente de la ligne et 'c' est l'interception y, c'est-à-dire le point où la ligne traverse l'axe y.
d'application
Régression - Mesure des performances du modèle : erreur quadratique moyenne (EQM) ou perte L2
Ensuite, il est essentiel d'évaluer la manière dont le modèle s'adapte à l'ensemble de données, qui est déterminé par le concept de perte. La perte mesure la différence entre la valeur prédite et la valeur réelle (vérité fondamentale).
L'erreur quadratique moyenne (EQM) ou perte L2 est une fonction de perte qui calcule la moyenne des différences quadratiques entre les prédictions données par 'd'' et les valeurs d'échantillon réelles données par 'yi'.

EQM = erreur quadratique moyenne
N = Nombre de points de données
yi = Valeurs observées
: valeurs prédites
« »
qu'est-ce que la classification ?
La classification est une technique fondamentale d'apprentissage automatique visant à organiser les données d'entrée en classes distinctes. Par exemple, la figure ci-dessous illustre la manière dont un modèle de classification détermine si un message entrant appartient à la catégorie SPAM ou Boîte de réception (non SPAM).

Au cours du processus de classification, le modèle subit un entraînement à l'aide de la fonction 'Entraîner sous-ensemble', suivi d'une évaluation à l'aide de la fonction 'Sous-ensemble de test'.
Une distinction notable entre les tâches de classification et de régression réside dans leurs variables de sortie. Bien que la classification traite des variables cible discrètes, les tâches de régression impliquent des variables de sortie continues, comme introduit dans les sections précédentes.
d'application
Analyse des séries chronologiques
Les données de séries chronologiques sont des données collectées sur un sujet à différents moments. Par exemple, les exportations d'un pays par année, les ventes d'une entreprise donnée sur une période donnée ou la pression artérielle d'une personne prise toutes les minutes. Toute donnée capturée en continu à différents intervalles de temps est un type de données de série chronologique.
Par exemple, la figure ci-dessous illustre les températures moyennes annuelles du Royaume-Uni, mesurées en degrés Celsius, qui remontent de 1800 à ces dernières années. Les données proviennent du met ou du centre météorologique had-uk gridded dataset. Le met office sert de service national de météo et de climat au Royaume-Uni.

En vous référant au blog de l'équipe d'information du Met office (https://blog.metoffice.gov.uk/2023/07/14/how-have-daily-temperatures-shifted-in-the-uks-changing-climate/), vous pouvez découvrir que, en utilisant des périodes de moyenne météorologique de 30 ans, révèle une augmentation de près de 1 degré Celsius de la température moyenne annuelle moyenne pour le Royaume-Uni au cours de la dernière période (1991-2020) par rapport à la période précédente (1961-1990). Ces données de séries chronologiques historiques révèlent une tendance au réchauffement à long terme.
d'application
Vue d'ensemble des algorithmes dans SAP HANA
SAP HANA a implémenté une grande variété d'algorithmes dans les catégories de classification, de régression et d'analyse de séries chronologiques, et bien plus encore.
Les algorithmes typiques pour la classification sont : Analyse de l'arbre de décision (CART, C4.5, CHAID), Régression logistique, Machine à vecteurs de support, K-Nearest Voisin, Bayes naïf, Matrice de confusion, AUC, Régression logistique multi-classes en ligne, et bien d'autres.
Alors que pour la régression, les algorithmes typiques sont : Régression linéaire multiple et Régression linéaire en ligne, entre autres.
Les algorithmes d'analyse de série temporelle les plus populaires sont le lissage exponentiel (automatique), le lissage exponentiel unifié, la régression linéaire (tendance amortie, ajustement des mers), la prévision hiérarchique et bien plus encore.
Pour en savoir plus, voir La carte d'informations de l'apprentissage automatique | SAP Help Portal
