Get in Touch

Course Outline

Introduction:

  • Apache Spark within the Hadoop Ecosystem
  • Brief overview of Python and Scala

Core Concepts (Theory):

  • System Architecture
  • RDD (Resilient Distributed Datasets)
  • Transformations vs. Actions
  • Stages, Tasks, and Dependencies

Practical Application in Databricks (Hands-on Workshop):

  • Practical exercises using the RDD API
  • Core action and transformation functions
  • Working with PairRDDs
  • Join operations
  • Caching strategies
  • Practical exercises using the DataFrame API
  • SparkSQL integration
  • DataFrame operations: select, filter, group, sort
  • UDF (User Defined Functions)
  • Exploring the DataSet API
  • Spark Streaming

Cloud Deployment with AWS (Hands-on Workshop):

  • Fundamentals of AWS Glue
  • Comparing AWS EMR and AWS Glue
  • Implementing example jobs in both environments
  • Evaluating advantages and limitations

Additional Topics:

  • Introduction to Apache Airflow orchestration

Requirements

Programming experience (Python or Scala preferred)

Foundational SQL knowledge

 21 Hours

Number of participants


Price per participant

Testimonials (3)

Upcoming Courses

Related Categories