Unindo tabelas no R (Join/Merge)

Quem trabalha muito com bases de dados com certeza já usou algum comando com o nome merge ou os famosos joins. Esse eu acho que é de longe o tipo de comando que eu mais uso quando trabalho com base de dados. Como você nunca tem todas as informações possíveis em uma tabela, você sempre vai precisar enriquecer suas bases com informações de outros locais.  Continuar a ler “Unindo tabelas no R (Join/Merge)”

Como retirar duplicidades no R

Sempre que você trabalha com um conjunto de dados é importante saber se ele tem alguma duplicidade. I.e., se algum elemento aparece mais de uma vez, sendo que não deveria. No R, a função mais trivial para retirar duplicidade na sua tabela, vetor, data frame, é a unique(). Continuar a ler “Como retirar duplicidades no R”

Estatística Tradicional e Machine Learning, qual a melhor?

Junto ao crescimento exponencial de informações e tipos de dados, surgem atualmente, de maneira acelerada, novas tecnologias e metodologias capazes de suportar, processar e analisar todo esse volume de informações. Com isso, alguns temas e discussões acabam vindo à tona no mundo do cientista de dados e dois dos que causam mais polêmica são justamente o que é melhor usar e como usar determinadas técnicas de análise de dados.  Continuar a ler “Estatística Tradicional e Machine Learning, qual a melhor?”

Artigos que utilizam o Diff-in-Diff

Falei pouco sobre Diff-in-Diff aqui, somente nos posts Regressão Diff-In-Diff com Efeitos Fixos no R e Diferenças em Diferenças (Diff-in-Diff). Porém, é um modelo muito interessante para quem vai fazer pesquisa, principalmente quando se avalia políticas públicas. Continuar a ler “Artigos que utilizam o Diff-in-Diff”