Curso de Streaming de Dados e Processamento de Dados em Tempo Real
Visão Geral do Curso
Este curso oferece uma introdução prática e estruturada à construção de sistemas de streaming de dados em tempo real. Ele aborda conceitos fundamentais, padrões de arquitetura e ferramentas da indústria utilizadas para processar dados contínuos em larga escala. Os participantes aprenderão a projetar, implementar e otimizar pipelines de streaming usando frameworks modernos. O curso evolui de ideias básicas até aplicações práticas, permitindo que os alunos construam com confiança soluções prontas para produção em tempo real.
Formato do Treinamento
• Sessões conduzidas por instrutor com explicações guiadas
• Explicações de conceitos com exemplos do mundo real
• Demonstrações práticas e exercícios de codificação
• Laboratórios progressivos alinhados aos tópicos diários
• Discussões interativas e sessão de perguntas e respostas
Objetivos do Curso
• Compreender os conceitos de streaming de dados em tempo real e a arquitetura dos sistemas
• Diferenciar entre modelos de processamento de dados em lote e streaming
• Projetar pipelines de streaming escaláveis e tolerantes a falhas
• Trabalhar com ferramentas e frameworks de streaming distribuído
• Aplicar processamento baseado em tempo de evento, janelas temporais (windowing) e operações com estado
Construir e otimizar soluções de dados em tempo real para casos de uso empresariais
Programa do Curso
Conteúdo Programático - Dia 1
• Introdução aos conceitos de streaming de dados
• Fundamentos do processamento em lote versus em tempo real
• Noções básicas de arquitetura orientada a eventos
• Casos de uso comuns na indústria
• Visão geral do ecossistema de streaming
Dia 2
• Padrões de design de arquitetura de streaming
• Fundamentos dos sistemas de mensagens distribuídas
• Produtores e consumidores
• Tópicos, partições e fluxo de dados
• Estratégias de ingestão de dados
Dia 3
• Conceitos e frameworks de processamento de streams
• Tempo de evento versus tempo de processamento
• Técnicas de janelas temporais e seus casos de uso
• Processamento de streaming com estado (stateful)
• Noções básicas de tolerância a falhas e checkpointing
Dia 4
• Transformação de dados em pipelines de streaming
• ETL e ELT em sistemas em tempo real
• Gestão e evolução de esquemas (schema)
• Joins de streams e enriquecimento de dados
• Introdução aos serviços de streaming baseados em nuvem
Dia 5
• Monitoramento e observabilidade em sistemas de streaming
• Noções básicas de segurança e controle de acesso
• Tuning de desempenho e otimização
• Revisão do design de pipeline ponta a ponta
• Casos de uso reais, como detecção de fraudes e processamento de IoT
Os cursos de treinamento abertos exigem mais de 5 participantes.
Curso de Streaming de Dados e Processamento de Dados em Tempo Real - Reserva
Curso de Streaming de Dados e Processamento de Dados em Tempo Real - Consulta
Streaming de Dados e Processamento de Dados em Tempo Real - SOLICITAÇÃO DE CONSULTORIA
Testemunhos de Clientes (2)
Uma jornada pelo mundo do Spark: um curso muito intenso. DSL, Spark SQL, particionamento vs. bucketização para mim.
Georgiana Elisabeta
Curso - Apache Spark Fundamentals
Máquina Traduzida
Exercícios práticos. A turma deveria ter durado 5 dias, mas os 3 dias ajudaram a esclarecer muitas das minhas dúvidas sobre o trabalho com NiFi.
James - BHG Financial
Curso - Apache NiFi for Administrators
Máquina Traduzida
Próximas Formações Provisórias
Cursos Relacionados
Apache Iceberg Avançado
21 HorasEste treinamento ao vivo com instrutor em Brasil (online ou presencial) destina-se a profissionais de dados de nível avançado que desejam otimizar fluxos de trabalho de processamento de dados, garantir a integridade dos dados e implementar soluções robustas de lakehouse capazes de lidar com as complexidades das aplicações modernas de big data.
Ao final deste treinamento, os participantes serão capazes de:
- Obter uma compreensão aprofundada da arquitetura do Iceberg, incluindo gerenciamento de metadados e layout dos arquivos.
- Configurar o Iceberg para desempenho ótimo em vários ambientes e integrá-lo com múltiplos motores de processamento de dados.
- Gerenciar tabelas Iceberg em larga escala, realizar alterações complexas de esquema e lidar com a evolução das partições.
- Dominar técnicas para otimizar o desempenho das consultas e a eficiência da varredura de dados em grandes conjuntos de dados.
- Implementar mecanismos para garantir a consistência dos dados, gerenciar garantias transacionais e lidar com falhas em ambientes distribuídos.
Fundamentos do Apache Iceberg
14 HorasEste treinamento ao vivo com instrutor em Brasil (online ou presencial) é voltado para profissionais de dados iniciantes que desejam adquirir os conhecimentos e as habilidades necessários para utilizar efetivamente o Apache Iceberg no gerenciamento de conjuntos de dados em grande escala, garantir a integridade dos dados e otimizar os fluxos de processamento.
Ao final deste treinamento, os participantes serão capazes de:
- Obter uma compreensão profunda da arquitetura, recursos e benefícios do Apache Iceberg.
- Aprender sobre formatos de tabela, particionamento, evolução de esquemas e recursos de viagem no tempo.
- Instalar e configurar o Apache Iceberg em diferentes ambientes.
- Criar, gerenciar e manipular tabelas Iceberg.
- Compreender o processo de migração de dados de outros formatos de tabela para o Iceberg.
Análise de Big Data com Google Colab e Apache Spark
14 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é direcionado a cientistas de dados e engenheiros de nível intermediário que desejam utilizar o Google Colab e o Apache Spark para processamento e análise de big data.
Ao final deste treinamento, os participantes serão capazes de:
- Configurar um ambiente de big data usando o Google Colab e o Spark.
- Processar e analisar grandes conjuntos de dados de forma eficiente com o Apache Spark.
- Visualizar big data em um ambiente colaborativo.
- Integrar o Apache Spark a ferramentas baseadas em nuvem.
Inteligência de Negócios Big Data para Agências do Governo
35 HorasOs avanços tecnológicos e o aumento exponencial na quantidade de informações estão transformando a forma como os negócios são conduzidos em muitos setores, incluindo o governo. A geração de dados governamentais e as taxas de arquivamento digital estão aumentando devido ao rápido crescimento de dispositivos móveis e aplicativos, sensores e dispositivos inteligentes, soluções de computação em nuvem e portais voltados aos cidadãos. À medida que as informações digitais se expandem e se tornam mais complexas, o gerenciamento, o processamento, o armazenamento, a segurança e a disposição dos dados também se tornam mais desafiadores. Novas ferramentas de captura, busca, descoberta e análise estão ajudando as organizações a obter insights valiosos a partir de seus dados não estruturados. O mercado governamental está em um ponto de inflexão, percebendo que a informação é um ativo estratégico, e que o governo precisa proteger, aproveitar e analisar informações tanto estruturadas quanto não estruturadas para atender melhor às necessidades da missão e aos requisitos operacionais. À medida que os líderes governamentais se esforçam para evoluir suas organizações baseadas em dados para cumprir com sucesso sua missão, estão estabelecendo as bases para correlacionar dependências entre eventos, pessoas, processos e informações.
Soluções governamentais de alto valor serão criadas a partir de uma combinação das tecnologias mais disruptivas:
- Dispositivos móveis e aplicativos
- Serviços em nuvem
- Tecnologias de negócios sociais e redes sociais
- Big Data e análise de dados
O Big Data é uma das soluções inteligentes para o setor e permite que o governo tome decisões melhores ao agir com base nos padrões revelados pela análise de grandes volumes de dados — relacionados ou não, estruturados ou não estruturados.
No entanto, realizar essas conquistas exige muito mais do que simplesmente acumular enormes quantidades de dados. "Dar sentido a esses volumes de Big Data requer ferramentas e tecnologias de ponta capazes de analisar e extrair conhecimento útil de fluxos vastos e diversos de informações", escreveram Tom Kalil e Fen Zhao do Escritório de Ciência e Política Tecnológica da Casa Branca (OSTP) em um artigo no Blog da OSTP.
A Casa Branca deu um passo rumo a ajudar as agências a encontrar essas tecnologias quando estabeleceu a Iniciativa Nacional de Pesquisa e Desenvolvimento de Big Data em 2012. A iniciativa incluiu mais de US$ 200 milhões para aproveitar ao máximo a explosão do Big Data e das ferramentas necessárias para analisá-lo.
Os desafios que o Big Data apresenta são tão assustadores quanto sua promessa é encorajadora. Armazenar dados de forma eficiente é um desses desafios. Como sempre, os orçamentos são apertados, portanto, as agências devem minimizar o custo por megabyte do armazenamento e manter os dados facilmente acessíveis para que os usuários possam obtê-los quando quiserem e da forma como precisam. Fazer backup de quantidades massivas de dados intensifica ainda mais esse desafio.
Analisar os dados de maneira eficaz é outro grande desafio. Muitas agências utilizam ferramentas comerciais que permitem filtrar as montanhas de dados, identificando tendências que podem ajudá-las a operar com mais eficiência. (Um recente estudo da MeriTalk revelou que executivos de TI do governo federal acreditam que o Big Data pode ajudar as agências a economizar mais de US$ 500 bilhões, ao mesmo tempo em que cumprem seus objetivos de missão).
Ferramentas de Big Data desenvolvidas sob medida também estão permitindo que as agências atendam à necessidade de analisar seus dados. Por exemplo, o Grupo de Análise Computacional de Dados do Laboratório Nacional Oak Ridge disponibilizou seu sistema de análise de dados Piranha para outras agências. O sistema ajudou pesquisadores médicos a encontrar uma conexão que pode alertar os médicos sobre aneurismas da aorta antes que eles ocorram. Ele também é usado para tarefas mais rotineiras, como filtrar currículos para conectar candidatos ao emprego com os gestores de contratação.
Uma Introdução Prática à Análise de Dados e Big Data - 3 Dias
21 HorasAos participantes que concluírem este treinamento ao vivo e ministrado por instrutor em Brasil serão adquiridos uma compreensão prática e do mundo real sobre o Big Data, suas tecnologias relacionadas, metodologias e ferramentas.
Os participantes terão a oportunidade de colocar esse conhecimento em prática por meio de exercícios práticos. A interação em grupo e o feedback do instrutor são componentes importantes da aula.
O curso começa com uma introdução aos conceitos fundamentais do Big Data, depois avança para as linguagens de programação e metodologias usadas para realizar a Análise de Dados. Por fim, discutimos as ferramentas e a infraestrutura que permitem o armazenamento de Big Data, o Processamento Distribuído e a Escalabilidade.
Big Data e Análise Avançada
42 HorasBig Data e Análise Avançada é a aplicação de técnicas e ferramentas sofisticadas para analisar grandes volumes de dados complexos, obtendo insights acionáveis e apoiando decisões estratégicas.
Este treinamento ao vivo, ministrado por instrutor (online ou presencial), destina-se a profissionais de dados de nível avançado que desejam aproveitar métodos analíticos de última geração e tecnologias de big data para análise preditiva, prescritiva e em tempo real.
Ao final deste treinamento, os participantes serão capazes de:
- Projetar e implementar pipelines de processamento de dados em larga escala para dados estruturados e não estruturados.
- Aplicar técnicas avançadas de aprendizado de máquina e aprendizado profundo a conjuntos massivos de dados.
- Aproveitar frameworks de computação distribuída para análises em tempo real e streaming de dados.
- Integrar a análise de big data nos sistemas de inteligência de negócios e tomada de decisão.
Formato do Curso
- Palestras interativas e discussões.
- Muitos exercícios e práticas.
- Implementação prática em um ambiente de laboratório ao vivo.
Opções de Personalização do Curso
- Para solicitar um treinamento personalizado para este curso, entre em contato conosco para combinar os detalhes.
Apache NiFi para Administradores
21 HorasO Apache NiFi é uma plataforma de integração de dados e processamento de eventos de código aberto, baseada em fluxos. Ele permite o roteamento automatizado de dados em tempo real, transformação e mediação entre sistemas distintos, com interface web (UI) e controle granular.
Este treinamento ao vivo, ministrado por instrutor (presencial ou remoto), destina-se a administradores e engenheiros de nível intermediário que desejam implantar, gerenciar, proteger e otimizar fluxos de dados do NiFi em ambientes de produção.
Ao final deste treinamento, os participantes serão capazes de:
- Instalar, configurar e manter clusters do Apache NiFi.
- Projetar e gerenciar fluxos de dados provenientes de diversas fontes e destinos.
- Implementar lógica de automação de fluxos, roteamento e transformação.
- Otimizar o desempenho, monitorar operações e solucionar problemas.
Formato do Curso
- Palestra interativa com discussões sobre arquiteturas de casos reais.
- Laboratórios práticos: construção, implantação e gerenciamento de fluxos.
- Exercícios baseados em cenários em ambiente de laboratório ao vivo.
Opções de Personalização do Curso
- Para solicitar um treinamento personalizado para este curso, entre em contato conosco para organizar.
PySpark e Aprendizado de Máquina
21 HorasEsta formação oferece uma introdução prática à construção de fluxos de trabalho escalonáveis de processamento de dados e aprendizado de máquina utilizando PySpark. Os participantes aprenderão como o Apache Spark opera dentro dos modernos ecossistemas de Big Data e como processar grandes conjuntos de dados de maneira eficiente, aplicando os princípios da computação distribuída.
Fundamentos do Apache Spark
21 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é voltado para engenheiros que desejam configurar e implantar o sistema Apache Spark para processar grandes volumes de dados.
Ao final deste treinamento, os participantes serão capazes de:
- Instalar e configurar o Apache Spark.
- Processar rapidamente e analisar grandes conjuntos de dados.
- Compreender as diferenças entre o Apache Spark e o Hadoop MapReduce, e saber quando usar cada um.
- Integrar o Apache Spark com outras ferramentas de aprendizado de máquina.
Administração do Apache Spark
35 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é voltado para administradores de sistemas de nível iniciante a intermediário que desejam implantar, manter e otimizar clusters Spark.
Ao final deste treinamento, os participantes serão capazes de:
- Instalar e configurar o Apache Spark em vários ambientes.
- Gerenciar recursos do cluster e monitorar aplicativos Spark.
- Otimizar o desempenho dos clusters Spark.
- Implementar medidas de segurança e garantir alta disponibilidade.
- Depurar e resolver problemas comuns do Spark.
Apache Spark na Nuvem
21 HorasA curva de aprendizado do Apache Spark começa lenta, exigindo muito esforço para obter os primeiros resultados. Este curso tem como objetivo superar essa fase inicial difícil. Após concluir este curso, os participantes compreenderão o básico do Apache Spark, saberão diferenciar claramente RDD de DataFrame, aprenderão as APIs em Python e Scala, entenderão executores e tarefas, etc. Além disso, seguindo as melhores práticas, este curso dá ênfase à implantação em nuvem, Databricks e AWS. Os alunos também compreenderão as diferenças entre AWS EMR e AWS Glue, um dos serviços Spark mais recentes da AWS.
PÚBLICO-ALVO:
Engenheiro de Dados, DevOps, Cientista de Dados
Python e Spark para Big Data (PySpark)
21 HorasNeste treinamento presencial e guiado por instrutor em Brasil, os participantes aprenderão a utilizar Python e Spark em conjunto para analisar grandes volumes de dados, enquanto realizam exercícios práticos.
Ao final deste treinamento, os participantes serão capazes de:
- Apprender como usar o Spark com o Python para analisar Big Data.
- Trabalhar em exercícios que simulam casos reais.
- Utilizar diversas ferramentas e técnicas para análise de big data por meio do PySpark.
Python, Spark e Hadoop para Big Data
21 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é direcionado a desenvolvedores que desejam utilizar e integrar Spark, Hadoop e Python para processar, analisar e transformar conjuntos de dados grandes e complexos.
Ao final deste treinamento, os participantes serão capazes de:
- Configurar o ambiente necessário para começar a processar big data com Spark, Hadoop e Python.
- Compreender as funcionalidades, componentes principais e arquitetura do Spark e do Hadoop.
- Aprender como integrar Spark, Hadoop e Python para o processamento de big data.
- Explorar as ferramentas do ecossistema do Spark (Spark MLlib, Spark Streaming, Kafka, Sqoop, Kafka e Flume).
- Construir sistemas de recomendação por filtragem colaborativa semelhantes aos da Netflix, YouTube, Amazon, Spotify e Google.
- Utilizar o Apache Mahout para escalonar algoritmos de aprendizado de máquina.
Stratio: Módulos Rocket e Intelligence com PySpark
14 HorasA Stratio é uma plataforma centrada em dados que integra big data, inteligência artificial (IA) e governança em uma única solução. Seus módulos Rocket e Intelligence permitem exploração rápida de dados, transformação e análises avançadas em ambientes corporativos.
Esta formação presencial (online ou ao vivo) é direcionada a profissionais de dados de nível intermediário que desejam usar os módulos Rocket e Intelligence da Stratio de forma eficaz com PySpark, com foco em estruturas de repetição, funções definidas pelo usuário (UDFs) e lógica de dados avançada.
Ao final desta formação, os participantes serão capazes de:
- Navegar e trabalhar na plataforma Stratio utilizando os módulos Rocket e Intelligence.
- Aplicar o PySpark no contexto de ingestão, transformação e análise de dados.
- Usar laços de repetição e lógica condicional para controlar fluxos de trabalho e tarefas de engenharia de recursos (feature engineering).
- Criar e gerenciar funções definidas pelo usuário (UDFs) para operações reutilizáveis em PySpark.
Formato do Curso
- Palestra interativa e discussão.
- Diversos exercícios e práticas.
- Implementação prática em ambiente de laboratório ao vivo (live-lab).
Opções de Personalização do Curso
- Para solicitar uma formação personalizada para este curso, entre em contato conosco para organizarmos os detalhes.