Vue d'ensemble des modèles de classification

Objective

After completing this lesson, you will be able to comprendre les principes, les méthodologies et les types de classification.

Compréhension de la classification dans SAP HANA

La classification est une technique fondamentale dans l'apprentissage automatique utilisée pour catégoriser les points de données en étiquettes prédéfinies en fonction de leurs fonctionnalités. Il joue un rôle crucial dans diverses applications du monde réel, comme prédire si un employé va démissionner ou rester dans une entreprise, identifier les transactions frauduleuses ou classer les e-mails comme spam ou non. Les principes fondamentaux de la classification impliquent un apprentissage supervisé, où les modèles sont entraînés à l'aide de données étiquetées pour reconnaître des modèles et faire des prévisions sur de nouvelles données invisibles.

Il existe différentes approches de classification, chacune utilisant des méthodologies distinctes. Certains des algorithmes les plus couramment utilisés incluent les arbres de décision, le gradient boosting et les réseaux neuronaux, chacun adapté à différents types de données et aux défis de classification. La classification elle-même peut être catégorisée en trois types principaux. La classification binaire consiste à distinguer deux résultats possibles, tels que « oui » ou « non » et « spam » ou « pas de spam ». La classification multi-classes étend cela en catégorisant les données en plusieurs groupes distincts, comme la classification de différentes catégories de produits. Pendant ce temps, la classification multi-étiquettes permet à un seul point de données d'appartenir à plusieurs catégories, telles que l'identification d'un document avec plusieurs rubriques pertinentes.

Dans SAP HANA Framework, les modèles de classification exploitent les puissantes fonctionnalités d'apprentissage automatique et d'analyse prédictive de SAP HANA Cloud. Cela inclut des algorithmes avancés tels que l'arbre HGBT (Hybrid Gradient Boosting Tree), qui est optimisé pour gérer efficacement les tâches de classification à grande échelle. SAP HANA s'intègre en toute transparence à différents modèles de données, ce qui permet aux utilisateurs d'entraîner et d'évaluer des modèles de classification dans son environnement. Cette intégration garantit une transition en douceur des données brutes vers des informations exploitables sans avoir besoin d'outils de traitement externes.

Le workflow de classification dans SAP HANA suit un processus d'apprentissage automatique structuré, en commençant par la préparation des données, où les données brutes sont nettoyées, transformées et structurées à des fins d'analyse. Lorsque les données sont préparées, l'étape suivante est l'entraînement du modèle, où les algorithmes de classification apprennent des modèles à partir de jeux de données étiquetés. Après l'entraînement, le modèle est évalué à l'aide de métriques de performance telles que la précision, la précision, le rappel et le score F1 pour garantir sa fiabilité dans la réalisation des prévisions. Enfin, une fois validé, le modèle est déployé et intégré aux applications de gestion, où il peut automatiser la prise de décision et améliorer l'efficacité opérationnelle. Grâce aux fonctions intégrées de SAP HANA, les workflows de classification sont rationalisés, ce qui permet aux entreprises d'intégrer facilement l'analyse prédictive à leurs opérations.