Programa do Curso
Introdução ao Machine Learning
- Tipos de machine learning – supervisionado vs não supervisionado
- Da aprendizagem estatística ao machine learning
- O fluxo de trabalho de mineração de dados: compreensão do negócio, preparação dos dados, modelagem e implantação
- Escolha do algoritmo adequado para a tarefa
- Sobreajuste (overfitting) e o trade-off entre viés e variância
Visão Geral das Bibliotecas Python e ML
- Por que usar linguagens de programação para ML
- Escolhendo entre R e Python
- Introdução prática a Python e Notebooks Jupyter
- Bibliotecas Python: pandas, NumPy, scikit-learn, matplotlib, seaborn
Teste e Avaliação de Algoritmos de ML
- Generalização, sobreajuste (overfitting) e validação de modelos
- Estratégias de avaliação: holdout, validação cruzada, bootstrapping
- Métricas para regressão: ME, MSE, RMSE, MAPE
- Métricas para classificação: precisão, matriz de confusão, classes desbalanceadas
- Visualização do desempenho do modelo: curva de lucro, curva ROC, curva lift
- Seleção de modelos e busca em grade (grid search) para ajuste
Preparação dos Dados
- Importação e armazenamento de dados em Python
- Análise exploratória e estatísticas resumidas
- Tratamento de valores ausentes e outliers
- Estandardização, normalização e transformação
- Recodificação de dados qualitativos e manipulação de dados com pandas
Algoritmos de Classificação
- Classificação binária vs multiclasificador
- Regressão logística e funções discriminantes
- Naïve Bayes, k-vizinhos mais próximos (k-NN)
- Árvores de decisão: CART, Random Forests, Bagging, Boosting, XGBoost
- Máquinas de Vetores de Suporte (SVM) e kernels
- Técnicas de aprendizado por conjuntos (ensemble learning)
Regressão e Previsão Numérica
- Mínimos quadrados e seleção de variáveis
- Métodos de regularização: L1, L2
- Regressão polinomial e modelos não lineares
- Árvores de regressão e splines
Aprendizado Não Supervisionado
- Técnicas de agrupamento (clustering): k-means, k-medoids, clustering hierárquico, SOMs
- Redução de dimensionalidade: PCA, análise fatorial, SVD
- Escalonamento multidimensional
Mineração de Texto
- Pré-processamento e tokenização de texto
- Bag-of-words, stemming (redução a raiz) e lematização
- Análise de sentimentos e frequência de palavras
- Visualização de dados de texto com nuvens de palavras
Sistemas de Recomendação
- Filtragem colaborativa baseada no usuário e no item
- Design e avaliação de motores de recomendação
Mineração de Padrões de Associação
- Itemsets frequentes e algoritmo Apriori
- Análise de cesta de compras e relação lift
Detectação de Outliers
- Análise de valores extremos
- Métodos baseados em distância e densidade
- Detectação de outliers em dados de alta dimensão
Caso Prático de Machine Learning
- Compreensão do problema de negócio
- Pré-processamento dos dados e engenharia de features
- Seleção do modelo e ajuste de parâmetros
- Avaliação e apresentação das descobertas
- Implantação
Resumo e Próximos Passos
Requisitos
- Conhecimento básico de estatística e álgebra linear
- Familiaridade com conceitos de análise de dados ou inteligência empresarial (business intelligence)
- Algum conhecimento prévio de programação (preferencialmente Python ou R) é recomendado
- Interesse em aprender machine learning aplicado para projetos baseados em dados
Público-Alvo
- Analistas e cientistas de dados
- Estatísticos e profissionais de pesquisa
- Desenvolvedores e profissionais de TI que exploram ferramentas de machine learning
- Qualquer pessoa envolvida em projetos de ciência de dados ou análise preditiva
Testemunhos de Clientes (3)
Mesmo tendo que faltar um dia devido a reuniões com clientes, sinto que tenho uma compreensão muito mais clara dos processos e técnicas usados no Aprendizado de Máquina e quando eu usaria uma abordagem em vez de outra. Nosso desafio agora é praticar o que aprendemos e começar a aplicá-lo ao nosso domínio de problemas.
Richard Blewett - Rock Solid Knowledge Ltd
Curso - Machine Learning – Data science
Máquina Traduzida
Gostei que o treinamento se concentrou em exemplos e codificação. Eu pensei que seria impossível encaixar tanto conteúdo em três dias de treinamento, mas estava enganado. O treinamento abordou muitos tópicos e tudo foi feito de forma muito detalhada (especialmente o ajuste dos parâmetros do modelo - não esperava que houvesse tempo para isso e fiquei muito surpreso).
Bartosz Rosiek - GE Medical Systems Polska Sp. Zoo
Curso - Machine Learning – Data science
Máquina Traduzida
Ele mostra muitos métodos com scripts pré-preparados - materiais muito bem preparados e fáceis de rastrear.
Kamila Begej - GE Medical Systems Polska Sp. Zoo
Curso - Machine Learning – Data science
Máquina Traduzida