Entrar em Contato

Programa do Curso

Introdução:

  • Apache Spark no ecossistema Hadoop
  • Visão geral básica de Python e Scala

Fundamentos (teoria):

  • Arquitetura
  • RDD (Resilient Distributed Datasets)
  • Transformações e Ações
  • Stage, Task e Dependências

Entendimento dos fundamentos usando o ambiente Databricks (workshop prático):

  • Exercícios utilizando a API RDD
  • Funções básicas de ações e transformações
  • PairRDD
  • Join
  • Estratégias de cache
  • Exercícios utilizando a API DataFrame
  • SparkSQL
  • DataFrame: select, filter, group, sort
  • UDF (Função Definida pelo Usuário)
  • Visão geral da API DataSet
  • Streaming

Entendimento do deploy usando o ambiente AWS (workshop prático):

  • Fundamentos do AWS Glue
  • Diferenças entre AWS EMR e AWS Glue
  • Exemplos de jobs em ambos os ambientes
  • Compreensão das vantagens e desvantagens

Conteúdo adicional:

  • Introdução à orquestração com Apache Airflow

Requisitos

Habilidades de programação (preferencialmente em Python e Scala)

Conhecimentos básicos de SQL

 21 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (3)

Próximas Formações Provisórias

Categorias Relacionadas