Manipuler, analyser et visualiser des données avec les modules Python de Data Science

Cette certification vous permet d’attester vos compétences en manipulation, analyse et visualisation des données avec les modules Python de Data Science : NumPy, Pandas, Matplotlib, Seaborn et Plotly.

Programme

Cette formation vous conduit de la mise en place d’un environnement Python jusqu’à la restitution visuelle de vos analyses. Vous importez, nettoyez et préparez des jeux de données, vous les structurez et les transformez, vous calculez et interprétez des indicateurs, puis vous construisez des visualisations statiques, statistiques et interactives, accessibles et lisibles.

Elle prépare à la certification RS6763, enregistrée le 01/10/2024 auprès d’API SOCIETY.

Points forts de la formation

Cours individuels ou en mini groupe limité à 10 personnes, pour plus d’interactivité.

Préparation d’une certification officielle enregistrée au Répertoire spécifique.

Formation 100 % synchrone, en présentiel ou en classe virtuelle selon la session sélectionnée sur Mon Compte Formation.

Objectifs

Installer et configurer un environnement Python dédié à la Data Science, en utilisant notamment Jupyter Notebook, un IDE adapté et Git pour le versioning et le travail collaboratif.

Importer, nettoyer et préparer des jeux de données avec Pandas et NumPy, en traitant les valeurs manquantes, en modifiant les types de données et en appliquant des filtres, masques, expressions régulières et rééchantillonnages.

Manipuler et structurer des données tabulaires avec NumPy et Pandas, à partir des objets ndarray, Series et DataFrame, en utilisant l’indexation, le tri, la transposition, les pivots, les MultiIndex ainsi que les opérations de fusion et d’empilement.

Calculer, analyser et interpréter des données avec NumPy et Pandas, en mobilisant les fonctions statistiques, les opérations vectorisées, le broadcasting, les agrégations, les fonctions universelles et les fonctions personnalisées.

Évaluer la pertinence des bibliothèques et méthodes utilisées, notamment NumPy, Pandas, Matplotlib, Seaborn et Plotly, au regard d’un besoin d’analyse ou de traitement de données spécifique.

Créer des visualisations statiques, statistiques et interactives avec Matplotlib, Seaborn et Plotly, en choisissant le type de graphique adapté et en appliquant les recommandations d’accessibilité, de lisibilité et de restitution des résultats.

Public

Professionnels de la donnée, statisticiens, actuaires, data analysts et data scientists, ainsi que scientifiques voulant attester leurs compétences en manipulation, analyse et visualisation des données avec les modules Python de Data Science.

Prérequis

Connaître les fondamentaux de la programmation en langage Python.

En cas de séance en distanciel, il faut également savoir utiliser une plateforme collaborative en ligne de visioconférence.

Évaluation

Organisées par l’organisme certificateur, les épreuves de la certification sont composées d’un questionnaire théorique évaluant les connaissances sur les modules Python de Data Science, et d’exercices pratiques évaluant les compétences de programmation du candidat.

À l’aide du logiciel API Cert permettant des captations audio et vidéo durant les épreuves, cette certification est passable à distance et en asynchronie. Le jury est composé d’un surveillant qui garantit l’identité du candidat et l’absence de fraude grâce aux captations, d’un professionnel de la Data Science avec Python certifié qui corrige les exercices sans accéder aux captations afin de préserver l’anonymat des candidats et l’équité de la correction, et d’un président qui attribue ou non la certification selon les comptes rendus du surveillant et du correcteur.

Le passage de l’évaluation certificative est obligatoire pour tout candidat mobilisant ses droits CPF. En cas d’absence ou de refus de présentation à l’évaluation, cette situation est tracée dans le dossier du bénéficiaire et peut avoir une incidence sur la validation de la certification, selon les règles applicables de Mon Compte Formation et du certificateur.

Dispositif de suivi et d’évaluation des résultats : feuilles d’émargement, autoévaluation de niveau en début et en fin de formation, exercices d’entraînement tout au long de la formation, contrôle permanent des acquis par le formateur, questionnaire de satisfaction à chaud et à froid, réussite à l’évaluation finale prévue par le certificateur.

Qualité et indicateurs de résultats : taux de présence contre taux d’abandon, taux de satisfaction à chaud et à froid, taux de réussite à l’évaluation finale et taux de certification.

Indicateurs

Modalités pédagogiques

En présentiel :

  • Accueil des participants dans une salle dédiée à la formation.
  • Documents supports de formation projetés.
  • Études de cas concrets.
  • Quiz et activités collectives en salle.
  • Mise à disposition en ligne de documents supports à la suite de la formation.

En distanciel :

  • Classes virtuelles via l’interface Digiforma.
  • Support de formation partagé.
  • Activités d’entraînement en synchrone.
  • Un support technique est mis en place pour les séances en distanciel.

Moyens pédagogiques et techniques

La formation est animée par un formateur expert en programmation Python, algorithmique, automatisation, traitement de données et développement d’applications professionnelles.

Moyens d’encadrement

Équipe pédagogique

Notre équipe pédagogique maîtrise l’ensemble des sujets proposés à la formation. Nous construisons nos programmes en identifiant les besoins en compétences des futurs apprenants et en collaboration avec nos experts métiers. Axio Academy Impulseo repose sur une approche personnalisée pour chaque parcours professionnel, et accompagne le candidat dans la compréhension des attendus de certification et dans l’organisation du passage de l’évaluation, selon les modalités prévues par le certificateur et précisées sur la fiche EDOF.

Accessibilité et délais d’accès

Pour les personnes en situation de handicap, nous étudions les actions que nous pouvons mettre en place pour favoriser leur apprentissage à travers un questionnaire avant formation. Nous nous appuyons également sur un réseau de partenaires locaux.

Pour tout besoin lié à la pédagogie, notre référent est Patrick, gestion@axio-academy.com, également référent handicap. Pour tout besoin d’ordre administratif, notre référente est Emilie, gestion@axio-academy.com.

Délai d’accès : 3 semaines, 11 jours ouvrés en financement CPF. Processus : recueil de besoin, validation des prérequis par entretien et diagnostic initiaux, devis et convention, convocation.

Contenu de la formation

1. Mettre en place son environnement Python pour la Data Science

  • Installer Python et comprendre la gestion de ses différentes versions.
  • Créer et administrer un environnement virtuel dédié à un projet Data Science.
  • Installer et mettre à jour les principales bibliothèques scientifiques : NumPy, Pandas, Matplotlib, Seaborn et Plotly.
  • Prendre en main un environnement de développement scientifique tel que Jupyter Notebook ou un IDE Python.
  • Utiliser des outils collaboratifs pour partager et versionner les travaux, notamment les notebooks et Git.
  • Rechercher de nouvelles bibliothèques Python et évaluer leur pertinence au regard d’un besoin professionnel.
  • Exercice d’application : créer un environnement Python opérationnel, installer NumPy, Pandas, Matplotlib, Seaborn et Plotly, ouvrir un notebook sous Jupyter Notebook et sélectionner une bibliothèque complémentaire en justifiant son intérêt.

2. Importer, nettoyer et préparer les données avec Pandas et NumPy

  • Importer différents formats de données avec Pandas : CSV, Excel, JSON.
  • Explorer la structure d’un jeu de données à l’aide des objets DataFrame et Series.
  • Identifier les types de variables et repérer les valeurs manquantes.
  • Nettoyer les données avec Pandas : suppression, remplacement ou traitement des valeurs manquantes.
  • Modifier les types de données lorsque leur format n’est pas adapté.
  • Concevoir des masques avec NumPy et Pandas afin d’extraire certaines observations.
  • Filtrer les données à partir de conditions logiques, y compris selon des plages temporelles.
  • Utiliser les expressions rationnelles pour rechercher et extraire des données correspondant à un motif.
  • Modifier la fréquence d’échantillonnage des données avec les fonctionnalités de Pandas.
  • Exercice d’application : charger dans Pandas un fichier comportant des données incomplètes, identifier et traiter les valeurs manquantes, construire des masques, réaliser plusieurs filtres et préparer un DataFrame exploitable pour l’analyse.

3. Structurer et transformer des données avec NumPy et Pandas

  • Manipuler les tableaux multidimensionnels ndarray avec NumPy.
  • Comprendre et gérer les principaux types de données.
  • Créer et manipuler des Series et DataFrame avec Pandas.
  • Utiliser l’indexation implicite par position et l’indexation explicite par clé alphanumérique ou temporelle.
  • Trier les données selon leurs index ou leurs valeurs, et les transposer.
  • Construire des tableaux croisés et effectuer des opérations de pivot avec Pandas.
  • Créer et exploiter des MultiIndex.
  • Regrouper plusieurs sources grâce aux opérations concat, merge et join de Pandas.
  • Exercice d’application : à partir de plusieurs DataFrame, modifier les types de données, créer des index, trier et transposer les tableaux, puis fusionner plusieurs jeux de données à l’aide de concat, merge ou join.

4. Calculer, analyser et interpréter des données avec NumPy et Pandas

  • Utiliser les opérations vectorisées de NumPy et Pandas pour optimiser les traitements.
  • Appliquer des fonctions et méthodes sur les lignes et colonnes d’un DataFrame.
  • Mobiliser les fonctions universelles NumPy.
  • Calculer des statistiques descriptives : moyenne, médiane, minimum, maximum, centiles et écart-type.
  • Créer de nouvelles variables à partir de colonnes existantes.
  • Regrouper et agréger les données avec la fonction groupby de Pandas.
  • Calculer des moyennes glissantes avec les fonctions rolling de Pandas.
  • Utiliser les règles de broadcasting NumPy pour effectuer des opérations sur des tableaux.
  • Appliquer des fonctions personnalisées et des fonctions anonymes lambda aux données.
  • Interpréter les résultats obtenus au regard d’un besoin métier.
  • Exercice d’application : analyser un jeu de données, créer de nouvelles colonnes, réaliser des agrégations avec groupby, calculer des statistiques et des moyennes glissantes, puis mobiliser le broadcasting pour optimiser certains calculs.

5. Visualiser et communiquer les données avec Matplotlib, Seaborn et Plotly

  • Identifier les spécificités des bibliothèques Matplotlib, Seaborn et Plotly, et choisir la plus adaptée au besoin.
  • Créer des graphiques en deux dimensions avec Matplotlib.
  • Générer différents types de représentations : histogrammes, diagrammes en colonnes, diagrammes circulaires, boîtes à moustaches et cartes thermiques.
  • Générer directement des graphiques à partir de DataFrame Pandas.
  • Utiliser Seaborn pour produire des visualisations statistiques.
  • Créer des visualisations interactives avec Plotly.
  • Concevoir des graphiques comportant plusieurs tracés afin de comparer plusieurs séries ou identifier des corrélations.
  • Personnaliser titres, axes, étiquettes et légendes.
  • Améliorer l’accessibilité des graphiques : contraste, taille et lisibilité des textes, épaisseur des lignes et bordures, légendes explicites.
  • Exercice d’application : à partir d’un même jeu de données, créer plusieurs représentations avec Matplotlib, Seaborn et Plotly, comparer les résultats, retenir la visualisation la plus pertinente puis l’adapter afin de respecter les recommandations d’accessibilité.
Durée

28 heures réparties sur 4 jours.

Formation 100 % synchrone, en présentiel ou en classe virtuelle selon la session sélectionnée sur Mon Compte Formation.

Suivi de la formation

Personnes en situation de handicap

Par défaut les formations en nos locaux sont non éligibles aux personnes en situation de handicap, néanmoins engagement à rechercher autant que possible les aménagements raisonnables.

Les financements

CPF

Décidez de votre formation en toute indépendance avec un reste à charge symbolique et avec notre accompagnement dans les formalités.

RÉSEAU POUR L’EMPLOI

En recherche d’un emploi, obtenez une nouvelle qualification via une formation financée par un des acteurs du réseau pour l’emploi (France Travail …).

TRANSITION PRO’

Salarié, absentez vous de votre travail tout en étant rémunéré pour suivre une formation certifiante dans le but de changer de métier.

ENTREPRISE
ET PRESCRIPTEURS

Sollicitez votre entreprise ou votre opérateur de Transition Professionnelle pour financer votre période de reconversion.

Formation Python Data Science

Manipulez, analysez et visualisez vos données avec NumPy, Pandas, Matplotlib, Seaborn et Plotly. Formation certifiante RS6763, en collectif ou en individuel, à distance ou en présentiel.

Lieu

Présentiel & distanciel

Prix

1 649 € T.T.C

Durée

28h

Formation Python Data Science

Manipulez, analysez et visualisez vos données avec NumPy, Pandas, Matplotlib, Seaborn et Plotly. Formation certifiante RS6763, en collectif ou en individuel, à distance ou en présentiel.

Lieu

Présentiel & distanciel

Prix

2 579 € T.T.C

Durée

28h

Nos formations populaires

Devenir gestionnaire de paie 

Le gestionnaire de paie, en fonction des informations sociales de l’entreprise et du personnel, assure mensuellement la production du bulletin de paie et la gestion des données sociales, conformément à la réglementation en vigueur.
5 à 12 mois
Bac ou équivalent
Période entreprise minimale : 210h
Eligible CPF

Devenir formateur professionnel d’adultes

Le formateur professionnel d’adultes accompagne les apprenants dans l’acquisition de savoirs, il identifie les compétences requises avant de rédiger la progression pédagogique, il anime les formations.
7 à 12 mois
Bac ou équivalent
Période entreprise minimale : 315h
Eligible CPF

Devenir responsable petite et moyenne structure

Dirige et gère une entreprise, un établissement, une association, de moins de 50 salariés, dans ses dimensions stratégique, humaine, commerciale, productive, financière, administrative et sociétale. 
7 à 12 mois
Bac ou équivalent
Période entreprise minimale : 210h
Eligible CPF

Des questions ?

Nous vous proposons de trouver les réponses à quelques interrogations courantes, n’hésitez pas à nous contacter via la fiche contact pour tout autre question.

Cette formation est-elle finançable avec mon CPF ?

Oui, cette formation est éligible au CPF. Vous mobilisez vos droits sur moncompteformation.gouv.fr pour financer tout ou partie du montant. Le CPF finance jusqu’à 1 500 €, et une participation forfaitaire de 100 € reste à votre charge. Nous calculons votre reste à charge exact et nous montons votre dossier avec vous, gratuitement. D’autres financements sont possibles : OPCO, France Travail, fonds propres.
Il faut connaître les fondamentaux de la programmation en langage Python. La formation ne revient pas sur la syntaxe de base : elle porte sur les bibliothèques de Data Science, NumPy, Pandas, Matplotlib, Seaborn et Plotly. En cas de séance à distance, il faut également savoir utiliser une plateforme de visioconférence. La session collective est à 1 649 € T.T.C, à partir de deux participants, en visioconférence ou en présentiel. La session individuelle est à 2 579 € T.T.C.
La formation prépare à la certification « Manipuler, analyser et visualiser des données grâce aux modules Python de Data Science », enregistrée sous le code RS6763 le 01/10/2024 auprès d’API SOCIETY. Les épreuves comportent un questionnaire théorique et des exercices pratiques de programmation. Elles se passent à distance et en asynchronie, avec captation audio et vidéo par le logiciel API Cert. Le jury réunit un surveillant, un correcteur professionnel de la Data Science et un président.