Concept

Apache Spark

Séances de cours associées (32)

Techniques avancées d'optimisation des sparks : gestion du Big Data

Discute des techniques avancées d'optimisation Spark pour gérer efficacement les Big Data, en se concentrant sur la parallélisation, les opérations de mélange et la gestion de la mémoire.

Modèles d'exécution pour l'informatique distribuée - 2e génération

Explore la 2ème génération de modèles d'exécution pour l'informatique distribuée, en mettant l'accent sur les ensembles de données distribués Spark et Résilient (RDD).

Spark Streaming : tolérance aux pannes et DStreams

Explore la tolérance aux pannes et DStreams dans Spark Streaming pour une analyse en temps réel des données volumineuses.

Évoluer vers des données massives: Fondements de l'étincelle

Couvre les fondamentaux de l'échelle vers des données massives à l'aide de Spark, en mettant l'accent sur les DDR, les transformations, les actions, l'architecture Spark, et la boîte à outils d'apprentissage automatique de Spark.

Introduction à l'architecture Spark Runtime

Couvre l'architecture d'exécution Spark, y compris les RDD, les transformations, les actions et la mise en cache pour l'optimisation des performances.

Défis Big Data : Computing distribué avec Spark

Explore les défis du Big Data, l'informatique distribuée avec Spark, les RDD, la configuration matérielle requise, MapReduce, les transformations et Spark DataFrames.

Couche de stockage Spark

Explore l'écosystème Spark, les ensembles de données distribués résilients et l'abstraction de la couche de stockage dans Spark.

Traitement des flux et tolérance aux défauts

Explore le traitement de flux, la tolérance aux défauts, DStreams, et les opérations de fenêtre coulissante dans l'analyse de big data.

Défis du Big Data : l'expansion vers des données massives

Explore les défis de la manipulation massive des données à l'ère du big data, en discutant de solutions comme MapReduce et Spark.

Introduction au traitement du flux de données

Couvre les bases du traitement des flux de données, y compris des outils comme Apache Storm et Kafka, des concepts clés tels que le temps d'événement et les opérations de fenêtre, et les défis du traitement des flux.

Optimisation avancée de l'étincelle

Déplacez-vous dans les techniques avancées d'optimisation Spark, en mettant l'accent sur la partition des données, les opérations de shuffle et la gestion de la mémoire.

Traitement du flux de données : Apache Kafka et Spark

Couvre le traitement de flux de données avec Apache Kafka et Spark, y compris le temps d'événement vs le temps de traitement, les opérations de traitement de flux, et les jointures de flux.

Optimisations et partitionnement avancés des sparks

Plongez dans les optimisations avancées Spark, le partitionnement, le biais de données, la persistance, MLlib et les meilleures pratiques.

Introduction générale aux données massives

Couvre les outils de science des données, Hadoop, Spark, les écosystèmes des lacs de données, le théorème CAP, le traitement par lots vs. flux, HDFS, Hive, Parquet, ORC, et l'architecture MapReduce.

Introduction au traitement du flux de données

Introduit le traitement de flux de données, couvrant le traitement par lots vs le traitement de flux, des informations en temps réel, des applications, des défis et des outils comme Apache Kafka et Spark Streaming.

Introduction au traitement des flux de données: concepts et applications

Couvre les principes du traitement des flux de données et de ses applications dans l'analyse de données en temps réel.

Scaling up : Spark et Big Data

Explore les défis du traitement des données volumineuses et présente Spark en tant que solution.

Traitement des flux de données : gestion et défis

Explore la gestion des flux de données, les applications en temps réel, les défis de l'analyse et les stratégies efficaces de gestion des flux.

Concepts avancés de traitement du flux de données

Explore les concepts avancés de traitement de flux de données, y compris Kafka, Spark stream, jointures et modèles de planification d'itinéraire.

Introduction au traitement des flux de données: concepts et applications

Couvre les concepts de traitement de flux de données, en se concentrant sur l'intégration Apache Kafka et Spark Streaming, la gestion du temps des événements et les directives de mise en œuvre du projet.