Formation Big Data Analytics avec Python modélisation et représentation des données -

Le Big Data Analytics suppose la maîtrise de techniques fondamentales de traitement des données : méthodes statistiques, classifications, régressions, ACP… Ce stage pratique vous montrera, sur des données concrètes, comment utiliser ces techniques pour construire puis évaluer des modèles à l’aide du langage Python.

Description

Objectifs pédagogiques

À l’issue de la formation, le participant sera en mesure de :

Comprendre le principe de la modélisation statistique
Choisir entre la régression et la classification en fonction du type de données
Évaluer les performances prédictives d’un algorithme
Créer des sélections et des classements dans de grands volumes de données pour dégager des tendances

Travaux pratiques

Développement/réalisation d’analyses sur le logiciel Python, avec les modules pandas, NumPy, SciPy, MatPlotLib, seaborn, scikit-learn et statsmodels.

PROGRAMME DE FORMATION

Introduction à la modélisation

Introduction au langage Python.
Introduction au logiciel Jupiter Notebook.
Les étapes de construction d’un modèle.
Les algorithmes supervisés et non supervisés.
Le choix entre la régression et la classification.

Travaux pratiques
Installation de Python 3, d’Anaconda et de Jupiter Notebook.

Procédures d’évaluation de modèles

Les techniques de ré-échantillonnage en jeu d’apprentissage, de validation et de test.
Test de représentativité des données d’apprentissage.
Mesures de performance des modèles prédictifs.
Matrice de confusion, de coût et la courbe ROC et AUC.

Travaux pratiques
Mise en place d’échantillonnage de jeux de donnes. Effectuer des tests d’évaluations sur plusieurs modèles fournis.

Les algorithmes supervisés

Le principe de régression linéaire univariée.
La régression multivariée.
La régression polynomiale.
La régression régularisée.
Le Naive Bayes.
La régression logistique.

Travaux pratiques
Mise en œuvre des régressions et des classifications sur plusieurs types de données.

Les algorithmes non supervisés

Le clustering hiérarchique.
Le clustering non hiérarchique.
Les approches mixtes.

Travaux pratiques
Traitements de clustering non supervisés sur plusieurs jeux de données.

Analyse en composantes

Analyse en composantes principales.
Analyse factorielle des correspondances.
Analyse des correspondances multiples.
Analyse factorielle pour données mixtes.
Classification hiérarchique sur composantes principales.

Travaux pratiques
Mise en œuvre de la diminution du nombre des variables et identification des facteurs sous-jacents des dimensions associées à une variabilité importante.

Analyse de données textuelles

Collecte et prétraitement des données textuelles.
Extraction d’entités primaires, d’entités nommées et résolution référentielle.
Étiquetage grammatical, analyse syntaxique, analyse sémantique.
Lemmatisation.
Représentation vectorielle des textes.
Pondération TF-IDF.
Word2Vec.

Travaux pratiques
Explorer le contenu d’une base de textes en utilisant l’analyse sémantique latente.

<< retour à la liste

Cookie	Durée	Description
cookielawinfo-checbox-analytics	11 months	This cookie is set by GDPR Cookie Consent plugin. The cookie is used to store the user consent for the cookies in the category "Analytics".
cookielawinfo-checbox-functional	11 months	The cookie is set by GDPR cookie consent to record the user consent for the cookies in the category "Functional".
cookielawinfo-checbox-others	11 months	This cookie is set by GDPR Cookie Consent plugin. The cookie is used to store the user consent for the cookies in the category "Other.
cookielawinfo-checkbox-necessary	11 months	This cookie is set by GDPR Cookie Consent plugin. The cookies is used to store the user consent for the cookies in the category "Necessary".
cookielawinfo-checkbox-performance	11 months	This cookie is set by GDPR Cookie Consent plugin. The cookie is used to store the user consent for the cookies in the category "Performance".
viewed_cookie_policy	11 months	The cookie is set by the GDPR Cookie Consent plugin and is used to store whether or not user has consented to the use of cookies. It does not store any personal data.

Description

Objectifs pédagogiques

Travaux pratiques

Introduction à la modélisation

Procédures d’évaluation de modèles

Les algorithmes supervisés

Les algorithmes non supervisés

Analyse en composantes

Analyse de données textuelles

Ces formations peuvent vous intéresser:

Formation Chatbot, créer et déployer un agent conversationnel en JavaScript

Formation Big Data Analytics avec R modélisation et représentation des données

Formation Machine learning, méthodes et solutions