Boost Academy
FormaciónEvaluacionesPerfil
Volver
  • En directo

Estadística — Intermedio

8h de clase en directo·HACK A BOSS·Español

Skills que aprenderás

  • Estadística

Convocatorias

Necesitas un plan activo

Para acceder a los cursos en directo necesitas un plan activo. Estamos trabajando para que los planes estén disponibles pronto — ¡mantente atento!

No hay convocatorias abiertas ahora mismo, pero no te pierdas la oportunidad: guarda este curso y te avisamos en cuanto se abra una convocatoria.

Descripción

Objetivos

Temario

Requisitos técnicos

Conocimientos previos

Detalles de la convocatoria

Recursos

No hay recursos disponibles todavía para esta convocatoria

Dirigido a analistas y perfiles técnicos que ya describen correctamente un dataset y ahora necesitan sostener afirmaciones sobre él —que un grupo rinde mejor que otro, que dos variables están asociadas, que un cambio ha tenido efecto—, este curso cubre el salto de la descripción a la inferencia, donde se concentran los errores más caros: aplicar un test paramétrico sin comprobar sus supuestos, leer un p-valor como si midiera la importancia del efecto o afirmar que no hay diferencia porque el resultado no ha salido significativo. El participante aprenderá a reconocer qué distribución teórica modela un fenómeno, a apoyarse en el teorema central del límite para justificar la validez de un contraste, a medir la forma de una distribución con asimetría y curtosis, a elegir el coeficiente de correlación adecuado, a verificar normalidad y homocedasticidad con pruebas formales y a seleccionar entre tests paramétricos, no paramétricos y chi-cuadrado según el tipo de variable. Al finalizar, el participante será capaz de partir de una pregunta de negocio sobre un dataset real, elegir y ejecutar el contraste correcto en un notebook, verificar sus supuestos, reaccionar de forma documentada cuando fallan y comunicar la conclusión con el gráfico que la respalda.

Al finalizar el curso, el participante será capaz de:

  • Distinguir entre las distribuciones teóricas uniforme, normal y binomial identificando cuál modela un fenómeno dado, y relacionar la función de densidad con la probabilidad de un intervalo de valores
  • Justificar por qué la distribución muestral de la media se aproxima a la normal al aumentar el tamaño de muestra (teorema central del límite), y explicar qué consecuencia tiene ese resultado sobre la validez de un contraste de hipótesis
  • Diagnosticar la forma de una distribución calculando su asimetría y su curtosis, e interpretar ambos coeficientes frente a la referencia de la distribución normal
  • Justificar la interpretación del coeficiente de correlación de Pearson entre dos variables cuantitativas, argumentando signo y magnitud y señalando los límites del coeficiente ante relaciones no lineales y presencia de valores atípicos
  • Diseñar un análisis de correlación entre variables cuantitativas y cualitativas ordinales eligiendo el coeficiente adecuado (Pearson o Spearman) según la naturaleza de los datos y el cumplimiento de los supuestos
  • Comparar al menos dos pruebas de contraste de hipótesis (paramétrica frente a no paramétrica) justificando la elección según el tipo de variable y el tamaño muestral disponible
  • Diagnosticar el cumplimiento de los supuestos de normalidad y homocedasticidad aplicando pruebas formales (Shapiro-Wilk, Kolmogorov-Smirnov y Levene) sobre un conjunto de datos proporcionado
  • Adaptar la selección de la prueba estadística cuando los supuestos iniciales no se cumplen, documentando el razonamiento del cambio de enfoque
  • Diseñar un contraste de independencia entre dos variables categóricas construyendo la tabla de contingencia y aplicando la prueba de chi-cuadrado, e interpretar el resultado en términos de asociación
  • Comparar las distribuciones de dos o más grupos mediante visualizaciones estadísticas adecuadas (diagrama de caja, violin plot, Q-Q plot) argumentando qué revela cada representación
  1. Distribuciones teóricas y funciones de densidad Distribución uniforme como modelo de equiprobabilidad; distribución normal, sus parámetros y la regla empírica; distribución binomial para conteos de éxitos; función de densidad de probabilidad y por qué la probabilidad de un valor exacto es cero en una variable continua; cálculo de la probabilidad de un intervalo como área bajo la curva con scipy.stats; criterio para decidir qué distribución modela un fenómeno a partir de la forma de los datos observados

  2. Teorema central del límite y distribución muestral Diferencia entre la distribución de la población y la distribución muestral de la media; efecto del tamaño de muestra sobre la forma de esa distribución, verificado por simulación con numpy.random; error estándar de la media; por qué el teorema central del límite es la pieza que permite aplicar un contraste paramétrico sobre datos cuya población no es normal, y dónde deja de servir cuando la muestra es pequeña

  3. Forma de la distribución y correlación Valor esperado y varianza como momentos; momentos centrales y estandarizados; asimetría (skewness) e interpretación de su signo; curtosis y exceso de curtosis frente a la referencia normal; covarianza y su dependencia de las unidades; coeficiente de correlación de Pearson como covarianza estandarizada, es decir el promedio del producto de los Z-scores; interpretación de signo y magnitud; límites de Pearson ante relaciones no lineales y atípicos; Spearman sobre rangos como alternativa para relaciones monótonas y variables ordinales; matriz de correlación y mapa de calor; correlación espuria y la distancia entre correlación y causalidad

  4. Marco del contraste de hipótesis Traducción de una pregunta de negocio a hipótesis nula y alternativa; nivel de significación y qué afirma exactamente un p-valor; errores de tipo I y tipo II y noción de potencia; familia paramétrica —t de Student para una muestra, para muestras independientes y para muestras emparejadas— frente a la no paramétrica —U de Mann-Whitney—; criterios de selección: escala de la variable, número de grupos, diseño independiente o emparejado y tamaño muestral disponible; qué se gana en potencia con la prueba paramétrica y qué se gana en robustez con la alternativa de rangos

  5. Tests paramétricos y verificación de supuestos Normalidad con Shapiro-Wilk y con Kolmogorov-Smirnov: qué afirma la hipótesis nula de cada una, cuándo se prefiere cada test y por qué ambos se vuelven excesivamente sensibles con muestras grandes; homocedasticidad con la prueba de Levene y consecuencias de la desigualdad de varianzas; ejecución de ttest_ind, ttest_1samp y el contraste emparejado con scipy.stats; ruta de decisión cuando un supuesto falla: transformación de la variable (logarítmica), t de Welch ante varianzas desiguales o cambio a la alternativa no paramétrica, y registro del cambio para que el análisis quede auditable

  6. Tests no paramétricos y chi-cuadrado U de Mann-Whitney sobre rangos para comparar dos grupos sin supuesto de normalidad; construcción de la tabla de contingencia con pd.crosstab; prueba de chi-cuadrado de independencia entre dos variables categóricas, frecuencias esperadas frente a observadas e interpretación del resultado en términos de asociación; requisitos de tamaño de celda y qué hacer cuando no se cumplen

  7. Comparación visual de distribuciones Diagrama de caja para mediana, dispersión y atípicos por grupo; violin plot para la densidad y la bimodalidad que el diagrama de caja oculta; Q-Q plot como contraste visual de normalidad e interpretación de las desviaciones en las colas; por qué la prueba formal y el gráfico son complementarios y no sustitutivos; elección del gráfico que respalda la conclusión al comunicar un resultado inferencial

  • Python 3.10 o superior, o acceso a Google Colab como alternativa sin instalación local
  • Jupyter Notebook, JupyterLab o VS Code con extensión Python e IPython kernel
  • numpy 1.24 o superior y pandas 2.0 o superior para la manipulación de los datasets y las tablas de contingencia
  • scipy 1.11 o superior para las distribuciones teóricas, Shapiro-Wilk, Kolmogorov-Smirnov, Levene, t de Student, Welch, U de Mann-Whitney, chi-cuadrado y los coeficientes de Pearson y Spearman
  • matplotlib 3.7 o superior y seaborn 0.13 o superior para diagrama de caja, violin plot, Q-Q plot y mapa de calor de correlaciones
  • Datasets tabulares provistos por el curso en CSV, Parquet y Excel, con variables numéricas y categóricas y grupos de tamaño desigual para que los supuestos fallen de forma realista
  • Acceso a internet para la instalación de bibliotecas y consulta de documentación
  • Sin coste de laboratorio: no se requieren servicios cloud de pago ni software licenciado

→ EST01 — Estadística — Iniciación (Iniciación, 8h)

  • Identificar el tipo de variable (nominal, ordinal, discreta o continua) de cada atributo de un conjunto de datos tabulado
  • Calcular e interpretar media, mediana, moda, rango, varianza y desviación típica con NumPy y pandas
  • Calcular cuartiles y percentiles e identificar valores atípicos por Z-score y por rango intercuartílico
  • Describir la forma de una distribución a partir de un histograma o un diagrama de caja
  • Seleccionar y justificar el gráfico adecuado para una variable o para la relación entre dos variables
  • Aplicar las reglas de la probabilidad y el teorema de Bayes sobre enunciados guiados

Del stack, se da por asentado lo que EST01 introduce: carga de un CSV con pandas, selección de columnas y filtrado booleano, y gráficos básicos con matplotlib. Este curso añade scipy y seaborn sobre esa base.