Virtualisation, Cloud, Devops

Formation Traitement de Données Serverless avec Google Cloud Dataflow

Maîtrisez le traitement de données massives en continu ou par lots. Concevez des pipelines robustes et évolutifs. Optimisez vos applications pour l'analyse Big Data. Idéal pour les architectes et développeurs Cloud. Transformez vos données efficacement et sans gérer l'infrastructure. Formation pratique et orientée projet.

Formation certifianteCertifié Qualiopi
Disponible en
Durée
21 h · 3 j
Rythme
Sessions de 7 h
Niveau
Tout niveau
Lieu
Vos locaux ou nos centres
Délai d'accès
11 jours ouvrés

Tarif intra-entreprise

Sur devis

Groupe jusqu'à 10 personnes · programme adaptable

Demander un devisÊtre rappelé par un conseiller

Réponse sous 24 h ouvrées · sans engagement

Financement

OPCOPlan de développement des compétencesFNE / FAFSimuler mon financement

Objectifs de la formation

Concevoir des pipelines de données Serverless pour traiter des données massives
Optimiser les performances et les coûts de Dataflow
Intégrer des services Big Data Google Cloud pour une analyse efficace
Déployer et opérer avancé des pipelines Dataflow

Programme détaillé

12 modules · 21 heures
01

Introduction au Serverless et aux Datapipelines Google Cloud

  • —Comprendre le paradigme Serverless et ses avantages
  • —Panorama des services Google Cloud pour le traitement de données
  • —Introduction à Apache Beam et Dataflow comme service managé
  • —Cas d'usage typiques des pipelines de données (streaming, batch)
02

Fondamentaux d'Apache Beam et du SDK Python

  • —Architecture d'Apache Beam : PCollection, PTransform, Pipeline
  • —Installation et configuration du SDK Apache Beam Python
  • —Écrire un pipeline simple : chargement, transformation, écriture
  • —Exécution de pipelines en mode local et sur un Runner
03

Dataflow Basic : Exécution et Monitoring des Jobs

  • —Déploiement d'un job Dataflow depuis gcloud et la console
  • —Surveillance en temps réel des jobs Dataflow (graphiques, logs)
  • —Comprendre les métriques clés de performance et d'erreurs
  • —Gestion et dépannage des jobs Dataflow en production
04

Traitement de Données Batch avec Dataflow

  • —Conception de pipelines pour le traitement de données massives par lot
  • —Stratégies de parallélisation et d'optimisation pour le batch
  • —Utilisation des transformations de regroupement (GroupByKey, Combine)
  • —Exemples de cas d'usage : ETL, analyse historique, migration de données
05

Traitement de Données en Streaming avec Dataflow

  • —Principes du traitement de données en temps réel et des fenêtres
  • —Types de fenêtres (Fixed, Sliding, Session) et Watermarks
  • —Gestion des événements en retard (late data) avec Dataflow
  • —Exemples de cas d'usage : analyse clickstream, IoT, détection d'anomalies
06

Connecteurs d'Entrée-Sortie (I/O) majeurs

  • —Lecture et écriture depuis Google Cloud Storage (GCS)
  • —Intégration avec BigQuery pour la lecture et l'écriture de tables
  • —Connexion à Pub/Sub pour les sources et sinks de streaming
  • —Exploration des autres connecteurs populaires (Spanner, Bigtable)
07

Transformations Avancées et Fonctions personnalisées

  • —Application de fonctions utilisateur définies (DoFn, Map)
  • —Transformations composites et réutilisables
  • —Jointures de PCollections et agrégations complexes
  • —Implémentation de logging et métriques personnalisées
08

Optimisation des Performances et Coûts Dataflow

  • —Tuning des Workers Dataflow (CPU, mémoire, disque)
  • —Stratégies d'autoscaling et de chargement équilibré
  • —Optimisation des transformations pour réduire la latence et les coûts
  • —Utilisation du profilage et des diagnostics Dataflow
09

Modèle de Données et Schémas

  • —Gestion des schémas de données : Avro, Parquet, JSON
  • —Validation et évolution des schémas dans les pipelines
  • —Structuration des PCollections pour l'efficacité
  • —Bonnes pratiques de sérialisation et désérialisation des données
10

Sécurité et Permissions Dataflow sur Google Cloud

  • —Gestion des accès avec IAM pour les jobs Dataflow
  • —Sécurisation des données en transit et au repos
  • —Intégration Dataflow avec VPC Service Controls
  • —Journalisation d'audit et conformité
11

Tests, Déploiement et Intégration Continue (CI/CD)

  • —Écriture de tests unitaires et d'intégration pour les pipelines Beam
  • —Stratégies de déploiement des jobs Dataflow (templates, CLI)
  • —Automatisation des déploiements avec Cloud Build et CI/CD
  • —Gestion des versions et des dépendances des pipelines
12

Dataflow Flex Templates et Cas d'Usage Avancés

  • —Création et utilisation de Flex Templates pour la réutilisabilité
  • —Cas d'usage des User Defined Functions (UDF) et Side Inputs
  • —Dataflow Prime et les innovations récentes de Dataflow
  • —Comparaison avec d'autres services de Big Data Google Cloud
Le conseil de l'expert

Un des objectifs pédagogiques clés de cette formation est de concevoir des pipelines de données Serverless pour traiter des données massives. Cet aspect est essentiel dans un environnement où les volumes de données augmentent de façon exponentielle. Les participants apprendront à utiliser Google Cloud Dataflow pour construire des solutions flexibles et scalables, ce qui leur permettra de répondre efficacement aux besoins de leur entreprise dans le traitement des données. Un défi commun rencontré par les apprenants dans ce domaine est la compréhension des concepts fondamentaux d’Apache Beam et de son SDK Python. Beaucoup d’entre eux peinent à intégrer ces notions dans des projets concrets, ce qui peut entraîner des erreurs dans la conception et l’optimisation de leurs pipelines. Cette formation vise à surmonter ces obstacles en offrant une approche pratique et immersive qui facilite l'assimilation des concepts clés. Ce qui distingue cette formation des autres approches est son accent sur l'intégration des services Big Data de Google Cloud pour une analyse efficace. Contrairement à d'autres formations plus théoriques, nous mettons l'accent sur l'application pratique des compétences dans des scénarios réels. Les participants bénéficieront d'exercices concrets et de retours d'expérience qui les prépareront à relever des défis réels dans leur quotidien professionnel. Pour tirer le maximum de cette formation, il est conseillé aux participants d’arriver avec des cas d'utilisation ou des problématiques spécifiques qu'ils rencontrent dans leur travail. Cela leur permettra d'appliquer directement les connaissances acquises à des situations concrètes, maximisant ainsi la pertinence de leur apprentissage. Soyez proactif et engagez-vous pleinement dans les échanges et exercices ; cela enrichira votre expérience et celle de vos pairs.

Pourquoi choisir cette formation en virtualisation, cloud, devops

🎯

Pipelines de données Serverless

Apprenez à concevoir des pipelines de données Serverless, optimisant ainsi la scalabilité et la gestion des ressources pour des traitements de données massives.

⚙️

Optimisation des coûts

Maîtrisez les techniques d'optimisation des performances et des coûts de Dataflow, garantissant une efficacité maximale lors de l'utilisation des services Google Cloud.

📊

Intégration Big Data

Découvrez comment intégrer les services Big Data de Google Cloud pour réaliser des analyses efficaces et pertinentes sur vos données.

🚀

Déploiement avancé

Acquérez des compétences avancées pour déployer et opérer des pipelines Dataflow, vous permettant de gérer des flux de données complexes avec aisance.

🔧

Fondamentaux d'Apache Beam

Explorez les fondamentaux d'Apache Beam et du SDK Python, vous offrant une base solide pour le développement de solutions de traitement de données.

🔗

Connecteurs I/O puissants

Apprenez à utiliser les connecteurs d'entrée-sortie majeurs pour interagir efficacement avec diverses sources et cibles de données dans vos projets.

Compétences acquises

Conception de pipelines de données Serverless

Concevoir, développer et déployer des pipelines de traitement de données batch et streaming évolutifs et tolérants aux pannes en utilisant Apache Beam et Google Cloud Dataflow.

Optimisation des performances et des coûts Dataflow

Analyser, diagnostiquer et optimiser les performances des jobs Dataflow pour réduire la latence, améliorer le débit et minimiser les coûts opérationnels sur Google Cloud.

Intégration de services Big Data Google Cloud

Interconnecter efficacement Dataflow avec d'autres services majeurs de Google Cloud tels que Pub/Sub, BigQuery et Cloud Storage pour des architectures de données complètes.

Déploiement et Opérations avancées Dataflow

Mettre en œuvre des pratiques CI/CD pour les pipelines Dataflow, gérer la sécurité et les permissions, et dépanner les jobs en production pour assurer la robustesse des applications.

Public, prérequis et modalités

Public visé

Architectes Cloud Développeurs Cloud Ingénieurs Data Experts Big Data

Prérequis

Aucun prérequis spécifique, bien que des connaissances de base en développement et en architecture Cloud soient préférables.

Moyens pédagogiques

Salle équipée, supports remis en PDF, cas réels rejoués en atelier, 8 participants maximum.

Suivi & évaluation

Évaluation continue à travers des exercices et des projets Examens théoriques et pratiques Retour d'expérience et feedbacks des participants

Accessibilité

Notre organisme de formation s'engage à accueillir et accompagner les personnes en situation de handicap. Notre référente handicap, Mme Lorène Travaux est disponible pour étudier avec vous les adaptations pédagogiques, techniques ou logistiques nécessaires avant toute inscription.

Financer cette formation

Plusieurs dispositifs permettent de prendre en charge tout ou partie du coût. Nos conseillers identifient avec vous la solution la plus adaptée à votre situation.

OPCO

Formations financées via votre opérateur de compétences

Les OPCO peuvent prendre en charge tout ou partie des frais de formation de vos salariés, dans le cadre du plan de développement des compétences ou de l'alternance.

En savoir plus

FAF

Aide à la formation pour les indépendants

Les Fonds d'Assurance Formation financent les formations des indépendants, auto-entrepreneurs, professions libérales et chefs d'entreprise (FAFCEA, AGEFICE, FIFPL…).

En savoir plus

France Travail

Des aides pour les demandeurs d'emploi

France Travail peut financer votre formation via l'AIF (Aide Individuelle à la Formation) ou des achats directs. Parlez-en à votre conseiller pour vérifier votre éligibilité.

En savoir plus

Employeur

Votre entreprise peut financer votre formation

Dans le cadre du plan de développement des compétences, l'employeur prend en charge le coût pédagogique et maintient la rémunération pendant la formation.

En savoir plus

FNE-Formation

Un soutien pour les entreprises en transformation

Le FNE-Formation accompagne les entreprises en mutation économique ou en transition écologique et numérique, avec une prise en charge pouvant aller jusqu'à 100 %.

En savoir plus

Besoin d'aide pour choisir votre dispositif ?

Nos conseillers analysent votre situation et vous orientent vers la solution la plus avantageuse.

Être conseillé gratuitement

Ils ont suivi cette formation

« Il a conçu un pipeline de données qui optimise le traitement des données massives en utilisant Dataflow. »

Participant à cette formation · avis recueilli en fin de session

« Elle a réussi à surveiller en temps réel les jobs Dataflow, détectant rapidement les anomalies. »

Participant à cette formation · avis recueilli en fin de session

Questions fréquentes

1. Connaissances de base de Python. 2. Familiarité avec les concepts du Cloud Computing (idéalement Google Cloud). 3. Compréhension des principes fondamentaux du traitement de données (batch, streaming).

Demandez un devis pour la formation Traitement de Données Serverless avec Google Cloud Dataflow

Programme adaptable à votre contexte. Réponse sous 24 h ouvrées, sans engagement.

Demander un devisCertifié Qualiopi · Financement OPCO / FAF

Formations similaires

Autres formations de la même catégorie qui pourraient vous intéresser.

Certification Usages Informatique et Numérique

14 h

Voir la formation

Maîtriser l'Analyse Forensic Cyber : Enquêtes Numériques Avancées

21 h

Voir la formation

Apprenez les fondamentaux des bases de données relationnelles

21 h

Voir la formation