Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Programa do Curso
Cada sessão tem 2 horas
Dia-1: Sessão-1: Visão Geral de Negócios sobre Por que Inteligência de Negócios com Big Data no Governo
- Estudos de caso do NIH e DoE
- Taxa de adaptação do Big Data nas Agências Governamentais & como elas estão alinhando suas operações futuras em torno da Análise Preditiva com Big Data
- Ampla gama de áreas de aplicação no DoD, NSA, IRS, USDA, etc.
- Integração do Big Data com dados legados
- Compreensão básica das tecnologias habilitadoras na análise preditiva
- Integração de Dados & Visualização em painéis (Dashboards)
- Gestão de Fraudes
- Geração de Regras de Negócio / Detecção de Fraudes
- Detecção e perfilamento de ameaças
- Análise custo-benefício para implementação de Big Data
Dia-1: Sessão-2: Introdução ao Big Data-1
- Principais características do Big Data: volume, variedade, velocidade e veracidade. Arquitetura MPP para volume.
- Data Warehouses – esquema estático, conjunto de dados de evolução lenta
- Bancos de Dados MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluções baseadas em Hadoop – sem restrições quanto à estrutura do conjunto de dados.
- Padrão típico: HDFS, MapReduce (processamento), recuperação do HDFS
- Lote (Batch) - adequado para análise/não interativo
- Volume: streaming de CEP (Event Processing)
- Escolhas típicas – produtos CEP (ex. Infostreams, Apama, MarkLogic, etc.)
- Pouco pronto para produção – Storm/S4
- Bancos de Dados NoSQL – (colunar e chave-valor): Mais adequados como complemento analítico ao data warehouse/banco de dados
Dia-1: Sessão-3: Introdução ao Big Data-2
Soluções NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB
- KV Store (Hierárquico) - GT.m, Cache
- KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Cachê KV - Memcached, Repcached, Coherence, Infinispan, ExtremeScale, JBossCache, Velocity, Terracotta
- Tuple Store - Gigaspaces, Coord, Apache River
- Banco de Dados de Objetos - ZopeDB, DB4J, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Preserve, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variety of Data: Introdução à questão da limpeza de dados no Big Data
- RDBMS – estrutura/esquema estático, não promove um ambiente ágil e exploratório.
- NoSQL – semiestruturado, estrutura suficiente para armazenar dados sem um esquema exato antes do armazenamento
- Questões de limpeza de dados
Dia-1: Sessão-4: Introdução ao Big Data-3 : Hadoop
- Quando selecionar o Hadoop?
- ESTRUTURADO - Data warehouses/databases empresariais podem armazenar dados massivos (a um custo), mas impõem estrutura (não é bom para exploração ativa)
- Dados SEMI ESTRUTURADOS – difíceis de lidar com soluções tradicionais (DW/DB)
- Armazenamento em data warehouse = ESFORÇO ENORME e estático mesmo após a implementação
- Para variedade & volume de dados, processado em hardware genérico – HADOOP
- Hardware genérico necessário para criar um Cluster Hadoop
Introdução ao MapReduce / HDFS
- MapReduce – distribuir computação entre vários servidores
- HDFS – tornar os dados disponíveis localmente para o processo de computação (com redundância)
- Dados – podem ser não estruturados/sem esquema (diferente do RDBMS)
- O desenvolvedor é responsável por dar sentido aos dados
- Programação MapReduce = trabalhar com Java (prós/contras), carregamento manual de dados no HDFS
Dia-2: Sessão-1: Ecossistema de Big Data - Construindo ETL de Big Data: universo de ferramentas de Big Data - qual usar e quando?
- Hadoop vs. Outras soluções NoSQL
- Para acesso interativo e aleatório aos dados
- HBase (banco de dados orientado a colunas) sobre o Hadoop
- Acesso aleatório aos dados, mas com restrições impostas (máx. 1 PB)
- Não é bom para análises ad-hoc, bom para logs, contagens e séries temporais
- Sqoop - Importar de bancos de dados para Hive ou HDFS (acesso JDBC/ODBC)
- Flume – Streams de dados (ex. log data) para o HDFS
Dia-2: Sessão-2: Sistema de Gerenciamento de Big Data
- Componentes móveis, nós de computação iniciam/falham: ZooKeeper - Para serviços de configuração/coordenação/nomeação
- Pipeline/workflow complexo: Oozie – gerenciar workflow, dependências e cadeia (daisy chain)
- Implantar, configurar, gerenciar clusters, atualizar etc. (sys admin): Ambari
- Na Nuvem: Whirr
Dia-2: Sessão-3: Análise Preditiva em Inteligência de Negócios -1: Técnicas Fundamentais & BI baseado em Machine Learning :
- Introdução ao Machine Learning
- Aprendizado de técnicas de classificação
- Predição Bayesiana - preparando arquivo de treinamento
- Máquinas de Vetores de Suporte (SVM)
- KNN p-Tree Algebra & mineração vertical
- Rede Neural
- Problema de grandes variáveis no Big Data - Random Forest (RF)
- Problema de Automação no Big Data – Ensemble Multi-modelo RF
- Automação através do Soft10-M
- Ferramenta de Análise de Texto - Treeminer
- Aprendizado Ágil
- Aprendizado baseado em agentes
- Aprendizado Distribuído
- Introdução às Ferramentas Open Source para Análise Preditiva: R, Rapidminer, Mahout
Dia-2: Sessão-4 Ecossistema de Análise Preditiva-2: Problemas comuns de análise preditiva no Governo
- Análise de insights
- Análise visual
- Análise preditiva estruturada
- Análise preditiva não estruturada
- Perfilamento de ameaças/fraude/fornecedor
- Motor de Recomendação
- Detecção de padrões
- Descoberta de regras/cenários – falha, fraude, otimização
- Descoberta da causa raiz
- Análise de sentimento
- Análise CRM
- Análise de rede
- Análise de texto
- Revisão assistida por tecnologia
- Análise de fraude
- Análise em Tempo Real
Dia-3: Sessão-1: Análise em Tempo Real e Escalável sobre Hadoop
- Por que algoritmos de análise comuns falham no Hadoop/HDFS
- Apache Hama - para computação distribuída síncrona em massa (Bulk Synchronous)
- Apache SPARK - para computação em cluster para análise em tempo real
- Laboratório de Gráficos CMU2 - Abordagem assíncrona baseada em grafos para computação distribuída
- Abordagem baseada em p-Algebra KNN do Treeminer para reduzir o custo operacional de hardware
Dia-3: Sessão-2: Ferramentas eDiscovery e Forense
- eDiscovery sobre Big Data vs. Dados Legados – uma comparação de custo e desempenho
- Codificação Preditiva e revisão assistida por tecnologia (TAR)
- Demo ao vivo de um produto TAR (vMiner) para entender como o TAR funciona para descoberta mais rápida
- Indexação mais rápida através do HDFS – velocidade dos dados
- PNL ou Processamento de Linguagem Natural – várias técnicas e produtos open source
- eDiscovery em idiomas estrangeiros - tecnologia para processamento de línguas estrangeiras
Dia-3: Sessão 3: Big Data BI para Segurança Cibernética – Compreendendo visões completas de 360 graus da coleta rápida de dados até a identificação de ameaças
- Compreender os fundamentos da análise de segurança - superfície de ataque, configurações incorretas de segurança, defesas de host
- Infraestrutura de rede / grande pipeline de dados / ETL de resposta para análise em tempo real
- Preditivo prescritivo vs. Preditivo – baseado em regras fixas vs. descoberta automática de regras de ameaça a partir de metadados
Dia-3: Sessão 4: Big Data no USDA : Aplicação na Agricultura
- Introdução à IoT (Internet das Coisas) para agricultura - sensor based Big Data e controle
- Introdução à imagem de satélite e sua aplicação na agricultura
- Integração de dados de sensores e imagens para fertilidade do solo, recomendação de cultivo e previsão
- Seguro agrícola e Big Data
- Previsão de perda de safras
Dia-4: Sessão-1: Prevenção de Fraudes com BI a partir de Big Data no Governo - Análise de Fraude:
- Classificação básica da análise de fraude - baseada em regras vs. análise preditiva
- Aprendizado supervisionado vs não supervisionado para detecção de padrões de fraude
- Fraude de fornecedores / cobrança excessiva por projetos
- Fraude no Medicare e Medicaid - técnicas de detecção de fraudes para processamento de reivindicações
- Fraudes em reembolsos de viagem
- Fraudes em restituições do IRS
- Estudos de caso e demonstração ao vivo serão fornecidos sempre que os dados estiverem disponíveis.
Dia-4: Sessão-2: Análise de Mídias Sociais - Coleta e análise de inteligência
- API ETL de Big Data para extração de dados de mídias sociais
- Texto, imagem, metadados e vídeo
- Análise de sentimento a partir do feed de mídias sociais
- Filtragem contextual e não contextual do feed de mídias sociais
- Painel de Mídias Sociais para integrar diversas mídias sociais
- Perfilamento automatizado de perfis de mídias sociais
- Demonstração ao vivo de cada análise será fornecida através da ferramenta Treeminer.
Dia-4: Sessão-3: Análise de Big Data em processamento de imagens e feeds de vídeo
- Técnicas de armazenamento de imagens no Big Data - Solução de armazenamento para dados que excedem petabytes
- LTFS e LTO
- GPFS-LTFS (Solução de armazenamento em camadas para dados de imagem grande)
- Fundamentos da análise de imagens
- Reconhecimento de objetos
- Ssegmentação de imagem
- Rastreamento de movimento
- Reconstrução de imagem 3D
Dia-4: Sessão-4: Aplicações de Big Data no NIH:
- Áreas emergentes da Bioinformática
- Metagenômica e questões de mineração de Big Data
- Análise Preditiva com Big Data para Farmacogenômica, Metabolômica e Proteômica
- Big Data no processo downstream de genômica
- Aplicação da análise preditiva de Big Data na saúde pública
Painel (Dashboard) de Big Data para acesso rápido e exibição diversificada de dados :
- Integração da plataforma de aplicativos existente com o Painel de Big Data
- Gestão de Big Data
- Estudo de Caso do Painel de Big Data: Tableau e Pentaho
- Uso de aplicativos de Big Data para impulsionar serviços baseados em localização no Governo
- Sistema de rastreamento e gestão
Dia-5 : Sessão-1: Como justificar a implementação de BI com Big Data dentro de uma organização:
- Definindo ROI para implementação de Big Data
- Estudos de caso para economia de tempo do analista na coleta e preparação de dados – aumento no ganho de produtividade
- Estudos de caso de ganho de receita ao economizar custos de banco de dados licenciado
- Ganho de receita a partir de serviços baseados em localização
- Economia proveniente da prevenção de fraudes
- Uma abordagem integrada de planilha para calcular despesa aproximada vs. ganho/economia de receita da implementação de Big Data.
Dia-5 : Sessão-2: Procedimento passo a passo para substituir o sistema de dados legado por um sistema de Big Data:
- Compreendendo o roteiro prático de migração de Big Data
- Quais são as informações importantes necessárias antes de projetar uma implementação de Big Data
- Quais são as diferentes maneiras de calcular volume, velocidade, variedade e veracidade dos dados
- Como estimar o crescimento dos dados
- Estudos de caso
Dia-5: Sessão 4: Revisão de fornecedores de Big Data e revisão de seus produtos. Sessão de Perguntas e Respostas:
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte da EMC)
Requisitos
- Conhecimento básico de operações de negócios e sistemas de dados governamentais no seu domínio
- Compreensão básica de SQL/Oracle ou bancos de dados relacionais
- Compreensão básica de Estatísticas (ao nível de planilha)
35 Horas
Testemunhos de Clientes (1)
A capacidade do instrutor de alinhar o curso com os requisitos da organização, e não apenas oferecer o curso por mera formalidade.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Máquina Traduzida