Entrar em Contato

Programa do Curso

Introdução

Compreendendo o Big Data

Noções gerais sobre Spark

Noções gerais sobre Python

Noções gerais sobre PySpark

  • Distribuição de dados por meio do framework Resilient Distributed Datasets (RDD)
  • Distribuição de processamento utilizando operadores da API do Spark

Configuração do Python com o Spark

Configuração do PySpark

Uso de instâncias EC2 da Amazon Web Services (AWS) para Spark

Configuração do Databricks

Configuração do cluster AWS EMR

Aprendizado dos fundamentos da programação em Python

  • Iniciando com Python
  • Utilizando o Jupyter Notebook
  • Variáveis e tipos de dados simples
  • Trabalhando com listas
  • Uso de estruturas condicionais (if)
  • Solicitação e uso de entradas do usuário
  • Trabalhando com loops while
  • Criando funções
  • Trabalhando com classes
  • Manipulação de arquivos e tratamento de exceções
  • Trabalhando com projetos, dados e APIs

Aprendizado dos fundamentos do Spark DataFrame

  • Iniciando com Spark DataFrames
  • Implementação de operações básicas no Spark
  • Uso de agrupamento (groupby) e operações agregadas
  • Manipulação de carimbos de data/hora (timestamps) e datas

Exercício prático de projeto com Spark DataFrame

Compreensão do aprendizado de máquina com a biblioteca MLlib

Trabalhando com MLlib, Spark e Python para aprendizado de máquina

Compreendendo regressões

  • Aprendizado da teoria da regressão linear
  • Implementação de código para avaliação de regressão
  • Exercício prático de regressão linear com exemplo
  • Aprendizado da teoria da regressão logística
  • Implementação de código de regressão logística
  • Exercício prático de regressão logística com exemplo

Compreendendo Random Forests (Florestas Aleatórias) e Decision Trees (Árvores de Decisão)

  • Aprendizado da teoria dos métodos baseados em árvores
  • Implementação de códigos para Árvores de Decisão e Random Forests
  • Exercício prático de classificação com Random Forest

Trabalhando com agrupamento K-means

  • Compreendendo a teoria do agrupamento K-means
  • Implementação de código para agrupamento K-means
  • Exercício prático de clustering com exemplo

Sistemas de recomendação

Implementação de processamento de linguagem natural (NLP)

  • Compreensão do Processamento de Linguagem Natural (NLP)
  • Noções gerais sobre ferramentas de NLP
  • Exercício prático de NLP com exemplo

Processamento de fluxo de dados (streaming) com Spark em Python

  • Noções gerais sobre streaming com Spark
  • Exercício prático de streaming com Spark

Agradecimentos e encerramento

Requisitos

  • Habilidades gerais de programação

Público-alvo

  • Desenvolvedores
  • Profissionais de TI
  • Cientistas de Dados
 21 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (6)

Próximas Formações Provisórias

Categorias Relacionadas