|
via Udemy |
Go to Course: https://www.udemy.com/course/analisis-exploratorio-de-datos-con-python-y-r/
Certainly! Here is a comprehensive review and recommendation of the Coursera course on Exploratory Data Analysis (EDA): --- **Course Review: Exploratory Data Analysis (EDA) on Coursera** This Coursera course on Exploratory Data Analysis (EDA) is an excellent starting point for anyone interested in entering the field of data science. Designed for beginners, the course provides a solid foundation in understanding, analyzing, and visualizing data, which are crucial skills for aspiring data scientists. **Content Overview** The course is structured into six sections, each progressively building your skills and knowledge: - **Section 1:** Focuses on the ubiquitous presence of data in daily life and emphasizes the importance of understanding the data behind statistics we encounter. It sets the tone for why EDA is vital in making informed decisions. - **Section 2:** Offers an introduction to basic statistical concepts, differentiating between descriptive and inferential statistics, and explains the choice of programming tools used in the course. - **Section 3:** Guides students through installing and exploring the main programming environments supporting Python and R across different operating systems, including an overview of their interfaces and key data structures. - **Section 4:** Introduces the fundamental techniques in EDA using iconic libraries such as Pandas, Numpy, Matplotlib for Python, and dplyr, tidyr, ggplot for R. This section teaches data importation, transformation, and initial exploration. - **Section 5:** Focuses on visual data representation, teaching students how to create a variety of informative and appealing charts, from bar graphs to pie charts, aiding in effective data storytelling. - **Section 6:** Delves into central statistical measures—mean, median, mode, and percentiles—alongside graphical representations like histograms and boxplots, providing critical insights into data distribution. **Review** This course excels in making the complex concepts of data analysis accessible. The practical approach of combining theoretical intro with hands-on programming exercises ensures that learners gain both understanding and real-world skills. The inclusion of both Python and R allows learners to choose their preferred language or learn both, making the course versatile. The instructional materials are clear, concise, and well-suited for beginners, offering step-by-step guidance on software setup, data handling, and visualization techniques. The course’s emphasis on understanding the nature of data through visualization and statistical measures equips students with essential analytical thinking skills. **Recommendations** - **Ideal for Beginners:** If you are just starting your journey in data science or data analysis, this course is highly recommended. It provides the necessary foundation to move on to more advanced topics. - **Practical Skills Focused:** The extensive exercises in data import, transformation, and visualization are invaluable for building practical, marketable skills. - **Complementary Learning:** To maximize learning, consider supplementing this course with projects or additional courses on statistical inference and machine learning, as well as real datasets to practice your newfound skills. **Conclusion** Overall, this course on Exploratory Data Analysis on Coursera is a well-structured, practical, and accessible program that can serve as the stepping stone toward a successful data science career. It bridges the gap between theoretical statistical knowledge and real-world data handling, making it a valuable investment for aspiring data analysts and scientists. --- Would you like a shorter summary or specific recommendations for next courses to follow up on this one?
El análisis exploratorio de datos (EDA, por sus siglas en inglés, Exploratory Data Analysis) es el proceso o tratamiento estadístico al cual se someten los datos de una muestra con la que se busca representar a una población. Incluye la elaboración de gráficos y estadísticos que permiten explorar la distribución de los datos, identificando características como: valores atípicos o outliers, saltos o discontinuidades, concentraciones de valores, forma de la distribución, etc. Esto permite conocer la naturaleza de los datos, entender su distribución y explorarlos mediante análisis estadístico, para posteriormente realizar el mejor modelo posible que permita sacar conclusiones sobre dichos datos. Este curso puede ser tenido en cuenta como un paso inicial para arrancar tu carrera como científico de datos (Data Scientist). Sección 1: Día a día vivimos rodeados de datos y estadísticas: cuando abrimos el periódico, cuando hacemos una transacción financiera, cuando vemos el noticiero, entre otros. Tenemos que asegurarnos de entender qué hay detrás de esos datos para asegurarnos de si debemos confiar o no en ellos. Además, podemos aprender a generarlos. Esta sección contiene la introdicción del curso y los pasos a seguir para completarlo satisfactoriamente.Sección 2: Esta parte del curso es una introducción a qué es la estadística, qué es el análisis exploratorio de datos y cuáles son las principales diferencias entre la estadística descriptiva y la inferencial. Además, veremos cuáles son los programas que se utilizarán durante el curso y cuál es la razón de que sean estos y no otros. Hasta acá, las dos primeras secciones del curso son cortas y concisas. En adelante, las siguientes son mucho más largas y contienen más material. Sección 3: En esta sección vamos a ver cómo se descargar los programas que soportan los lenguajes de programación Python y R, y vamos a ver cómo instalarlos en los dispositivos con sistema operativo Mac y Windows para poder usarlos de la mejor manera posible. Además, estudiaremos sus interfaces, para entender cómo funcionan y qué características tienen. Finalmente, veremos cuáles son las principales estructuras de datos en esos dos lenguajes de programación y cómo deben ser manejadas para no obtener errores en los resultados al manejar bases de datos y/o al crear nuevas variables.Sección 4: Una vez hemos instalado los principales programas que nos permite ejecutar Python y R, y habiendo explorado los principales tipos y estructuras de datos en estos dos lenguajes, esta sección nos introduce al Análisis Exploratorio de Datos (EDA, por sus siglas en inglés), a través de un conjunto de funciones iniciales que traen consigo las principales librerías descargadas e instaladas en la sección final del tema anterior: Pandas, Numpy y Matplotlib, en el caso de Python y; dplyr, tidyr y ggplot en R. Aprenderemos a importar bases de datos de Excel y otro tipo de archivos con extensión csv, siglas que responden a Comma Separated Values (en inglés) o valores separados por comas, así como archivos del programa estadístico Stata. A las variables contenidas en las bases abiertas les aplicaremos algunas transformaciones, agrupaciones, filtros y otras técnicas para su respectivo manejo y exploración. ¡Vamos con toda!Sección 5: Adicional a las librerías utilizadas para hacer transformaciones y manejos directamente a la base de datos, Python y R también tienen paquetes especializados para la generación de gráficos a partir de datos contenidos en datasets o a partir de datos que se le pueden indicar dentro del mismo código al gráfico deseado. En este caso, estaremos viendo algunos de los gráficos más utilizados en el análisis de datos, por lo básicos, pero efectivos que son a la hora de mostrar de una forma más agradable la información contenida en la base de datos: gráfico de barras, gráficos de porcentajes como el pie o torta, y otros gráficos un poco más avanzados.Sección 6: Ya ha conocido los dos programas y lenguajes de programación usados principalmente en la ciencia de datos, así como sus principales librerías, paquetes y funciones. Además, ha trabajado algunos de los manejos que se les pueden dar a los datos a través de Python y R, como filtros, agrupaciones, unión o pegado. Ahora, vamos a ver uno de los conceptos y mediciones primordiales de la estadística descriptiva: las medidas de tendencia central. Veremos acá la media, la mediana, la moda y los percentiles (cuartiles, quintiles, entre otros), así como los histogramas y boxplot para verlos gráficamente.