Entrar em Contato

Programa do Curso

Cada sessão dura 2 horas

Dia 1: Sessão 1: Visão Geral de Negócios sobre Por Que Inteligência de Negócios em Big Data no Governo

  • Estudos de caso do NIH, DoE
  • Taxa de adaptação do Big Data nas agências governamentais e como estão alinhando suas operações futuras à análise preditiva de Big Data
  • Áreas de aplicação de larga escala em DoD, NSA, IRS, USDA etc.
  • Interface do Big Data com dados legados
  • Compreensão básica das tecnologias habilitadoras na análise preditiva
  • Integração de dados e visualização em dashboards
  • Gestão de fraudes
  • Geração de regras de negócios/detecção de fraudes
  • Detecção de ameaças e perfilamento
  • Análise de custo-benefício para a implementação de Big Data

Dia 1: Sessão 2: Introdução ao Big Data-1

  • Principais características do Big Data: volume, variedade, velocidade e veracidade. Arquitetura MPP para volume.
  • Armazéns de dados – esquema estático, conjunto de dados que evolui lentamente
  • Bancos de dados MPP como Greenplum, Exadata, Teradata, Netezza, Vertica etc.
  • Soluções baseadas em Hadoop – sem condições sobre a estrutura do conjunto de dados.
  • Padrão típico : HDFS, MapReduce (crunch), recuperação do HDFS
  • Processamento em lote (Batch) – adequado para análise/não interativo
  • Volume : dados de streaming CEP
  • Escolhas típicas – produtos CEP (e.g. Infostreams, Apama, MarkLogic etc)
  • Menos pronto para produção – Storm/S4
  • Bancos de dados NoSQL – (colunar e chave-valor): Mais adequados como complemento analítico ao armazém de dados/banco de dados

Dia 1 : Sessão 3 : Introdução ao Big Data-2

Soluções NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierárquico) - GT.m, Cache
  • KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Banco de Objetos - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variedades de Dados: Introdução à questão da Limpeza de Dados em Big Data

  • RDBMS – estrutura/esquema estático, não promove um ambiente ágil e exploratório.
  • NoSQL – semi estruturado, estrutura suficiente para armazenar dados sem um esquema exato antes do armazenamento
  • Problemas de limpeza de dados

Dia 1 : Sessão 4 : Introdução ao Big Data-3 : Hadoop

  • Quando selecionar Hadoop?
  • ESTRUTURADO - Armazéns de dados/bancos de dados empresariais podem armazenar dados massivos (a um custo) mas impõem estrutura (não bom para exploração ativa)
  • Dados SEMI ESTRUTURADOS – difícil de lidar com soluções tradicionais (DW/DB)
  • Armazenar dados em warehouse = grande esforço e estático mesmo após a implementação
  • Para variedade e volume de dados, processado em hardware de commodity – HADOOP
  • Hardware de commodity necessário para criar um Cluster Hadoop

Introdução ao Map Reduce /HDFS

  • MapReduce – distribuição de computação sobre múltiplos servidores
  • HDFS – torna os dados disponíveis localmente para o processo de computação (com redundância)
  • Dados – podem ser não estruturados/sem esquema (ao contrário de RDBMS)
  • Responsabilidade do desenvolvedor de dar sentido aos dados
  • Programação MapReduce = trabalhar com Java (prós/contras), carregando manualmente dados para o HDFS

Dia 2: Sessão 1: Ecossistema de Big Data - Construindo ETL de Big Data: universo de Ferramentas de Big Data - qual usar e quando?

  • Hadoop vs. Outras soluções NoSQL
  • Para acesso interativo e aleatório a dados
  • Hbase (banco de dados orientado a colunas) sobre o Hadoop
  • Acesso aleatório a dados, mas com restrições impostas (máx 1 PB)
  • Não bom para análise ad-hoc, bom para logging, contagem, séries temporais
  • Sqoop - Importação de bancos de dados para Hive ou HDFS (acesso JDBC/ODBC)
  • Flume – Dados de streaming (e.g. dados de log) para HDFS

Dia 2: Sessão 2: Sistema de Gerenciamento de Big Data

  • Movimento de partes, início/falha de nós de computação :ZooKeeper - Para serviços de configuração/coordenação/nomeação
  • Pipeline/workflow complexo: Oozie – gerenciar workflow, dependências, corrente de tarefas
  • Implantação, configuração, gerenciamento de cluster, atualização etc (admin de sistemas) :Ambari
  • Na Nuvem : Whirr

Dia 2: Sessão 3: Análise Preditiva em Inteligência de Negócios -1: Técnicas Fundamentais e BI baseado em Machine learning :

  • Introdução ao Machine learning
  • Técnicas de aprendizado de classificação
  • Predição Bayesiana-preparação do arquivo de treinamento
  • Support Vector Machine
  • KNN p-Tree Algebra & mineração vertical
  • Rede Neural
  • Problema de variáveis grandes em Big Data -Random forest (RF)
  • Problema de Automação em Big Data – Ensemble de modelos múltiplos RF
  • Automação através do Soft10-M
  • Ferramenta de análise textual-Treeminer
  • Aprendizado ágil
  • Aprendizado baseado em agentes
  • Aprendizado distribuído
  • Introdução a Ferramentas de Código Aberto para análise preditiva : R, Rapidminer, Mahut

Dia 2: Sessão 4 Ecossistema de análise preditiva-2: Problemas comuns de análise preditiva no Governo.

  • Análise de insights
  • Análise de visualização
  • Análise preditiva estruturada
  • Análise preditiva não estruturada
  • Perfilamento de ameaças/fraudes/fornecedores
  • Motor de Recomendação
  • Detecção de padrões
  • Descoberta de Regras/Cenários –falha, fraude, otimização
  • Descoberta de causa raiz
  • Análise de sentimento
  • Análise de CRM
  • Análise de rede
  • Análise de Texto
  • Revisão assistida por tecnologia
  • Análise de fraudes
  • Análise em Tempo Real

Dia 3 : Sessão 1 : Análise em Tempo Real e Escalável sobre Hadoop

  • Por que algoritmos de análise comuns falham em Hadoop/HDFS
  • Apache Hama- para computação distribuída Bulk Synchronous
  • Apache SPARK- para computação em cluster para análise em tempo real
  • CMU Graphics Lab2- Abordagem assíncrona baseada em gráficos para computação distribuída
  • Abordagem baseada em KNN p-Algebra do Treeminer para redução de custo de hardware de operação

Dia 3: Sessão 2: Ferramentas para eDiscovery e Forense

  • eDiscovery sobre Big Data vs. dados Legados – uma comparação de custo e desempenho
  • Codificação preditiva e revisão assistida por tecnologia (TAR)
  • Demonstração ao vivo de um produto TAR (vMiner) para entender como o TAR funciona para descoberta mais rápida
  • Indexação mais rápida através do HDFS –velocidade de dados
  • NLP ou Processamento de Linguagem Natural –várias técnicas e produtos de código aberto
  • eDiscovery em línguas estrangeiras-tecnologia para processamento de idiomas estrangeiros

Dia 3 : Sessão 3: Big Data BI para Cibersegurança – Entendendo a visão 360 graus completa da coleta rápida de dados à identificação de ameaças

  • Entendendo os básicos da análise de segurança-superfície de ataque, configuração de segurança incorreta, defesas do host
  • Infraestrutura de rede/ Grande pipeline de dados / ETL de Resposta para análise em tempo real
  • Prescritivo vs preditivo – Regras fixas baseadas em regras vs auto-descoberta de regras de ameaças a partir de Metadados

Dia 3: Sessão 4: Big Data na USDA : Aplicação na Agricultura

  • Introdução ao IoT ( Internet das Coisas) para agricultura-Big Data baseado em sensores e controle
  • Introdução à imagem de satélite e sua aplicação na agricultura
  • Integrando dados de sensores e imagens para fertilidade do solo, recomendação de cultivo e previsão
  • Seguro agrícola e Big Data
  • Previsão de Perda de Safra

Dia 4 : Sessão 1: Prevenção de Fraudes BI de Big Data no Governo-Análise de Fraudes:

  • Classificação básica de análise de fraudes- baseada em regras vs análise preditiva
  • Machine learning supervisionado vs não supervisionado para detecção de padrões de fraude
  • Fraude/faturamento excessivo de fornecedores em projetos
  • Fraude em Medicare e Medicaid- técnicas de detecção de fraude para processamento de solicitações
  • Fraudes em reembolso de viagens
  • Fraudes em reembolso da IRS
  • Estudos de caso e demonstrações ao vivo serão fornecidos sempre que houver dados disponíveis.

Dia 4 : Sessão 2: Análise de Mídias Sociais- Coleta e análise de inteligência

  • API de ETL de Big Data para extração de dados de mídias sociais
  • Texto, imagem, metadados e vídeo
  • Análise de sentimento de feeds de mídias sociais
  • Filtragem contextual e não contextual de feeds de mídias sociais
  • Dashboard de Mídias Sociais para integrar diversas mídias sociais
  • Perfilamento automatizado de perfis de mídias sociais
  • Demonstração ao vivo de cada análise será fornecida através da Ferramenta Treeminer.

Dia 4 : Sessão 3: Análise de Big Data em processamento de imagem e feeds de vídeo

  • Técnicas de Armazenamento de Imagem em Big Data- Solução de armazenamento para dados excedendo petabytes
  • LTFS e LTO
  • GPFS-LTFS ( Solução de armazenamento em camadas para Big image data)
  • Fundamentos da análise de imagem
  • Reconhecimento de objetos
  • Segmentação de imagem
  • Rastreamento de movimento
  • Reconstrução de imagem 3-D

Dia 4: Sessão 4: Aplicações de Big Data no NIH:

  • Áreas emergentes da Bio-informática
  • Meta-genômica e questões de mineração de Big Data
  • Análise Preditiva de Big Data para Farmacogenômica, Metabolômica e Proteômica
  • Big Data no processo descendente de Genômica
  • Aplicação da análise preditiva de Big Data na Saúde Pública

Dashboard de Big Data para acessibilidade rápida a dados diversos e exibição :

  • Integração da plataforma de aplicação existente com o Dashboard de Big Data
  • Gerenciamento de Big Data
  • Estudo de Caso de Dashboard de Big Data: Tableau e Pentaho
  • Use app de Big Data para empregar serviços baseados em localização no Governo.
  • Sistema de rastreamento e gerenciamento

Dia 5 : Sessão 1: Como justificar a implementação de BI de Big Data dentro de uma organização:

  • Definindo ROI para a implementação de Big Data
  • Estudos de caso para economia de Tempo de Analista para coleta e preparação de Dados –aumento no ganho de produtividade
  • Estudos de caso de ganho de receita da economia do custo de banco de dados licenciado
  • Ganho de receita de serviços baseados em localização
  • Economia da prevenção de fraudes
  • Uma abordagem integrada de planilha eletrônica para calcular aproximadamente despesa vs. ganho de receita/economia da implementação de Big Data.

Dia 5 : Sessão 2: Procedimento passo a passo para substituir o sistema de dados legado pelo Sistema de Big Data:

  • Entendendo o Mapa da Rota Prático de Migração de Big Data
  • Quais são as informações importantes necessárias antes de projetar uma implementação de Big Data
  • Quais são as diferentes formas de calcular volume, velocidade, variedade e veracidade de dados
  • Como estimar o crescimento de dados
  • Estudos de caso

Dia 5: Sessão 4: Revisão de Vendedores de Big Data e revisão de seus produtos. Sessão de Q/A:

  • Accenture
  • APTEAN (Antes CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Antes 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Parte da EMC)

Requisitos

  • Conhecimento básico de operações de negócios e sistemas de dados no governo em sua área de atuação
  • Compreensão básica de SQL/Oracle ou banco de dados relacional
  • Compreensão básica de Estatística (nível de planilha eletrônica)
 35 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (1)

Próximas Formações Provisórias

Categorias Relacionadas