Skills que aprenderás
Convocatorias
No hay convocatorias abiertas ahora mismo, pero no te pierdas la oportunidad: guarda este curso y te avisamos en cuanto se abra una convocatoria.
Recursos
No hay recursos disponibles todavía para esta convocatoria
Dirigido a analistas y perfiles técnicos que ya describen correctamente un dataset y ahora necesitan sostener afirmaciones sobre él —que un grupo rinde mejor que otro, que dos variables están asociadas, que un cambio ha tenido efecto—, este curso cubre el salto de la descripción a la inferencia, donde se concentran los errores más caros: aplicar un test paramétrico sin comprobar sus supuestos, leer un p-valor como si midiera la importancia del efecto o afirmar que no hay diferencia porque el resultado no ha salido significativo. El participante aprenderá a reconocer qué distribución teórica modela un fenómeno, a apoyarse en el teorema central del límite para justificar la validez de un contraste, a medir la forma de una distribución con asimetría y curtosis, a elegir el coeficiente de correlación adecuado, a verificar normalidad y homocedasticidad con pruebas formales y a seleccionar entre tests paramétricos, no paramétricos y chi-cuadrado según el tipo de variable. Al finalizar, el participante será capaz de partir de una pregunta de negocio sobre un dataset real, elegir y ejecutar el contraste correcto en un notebook, verificar sus supuestos, reaccionar de forma documentada cuando fallan y comunicar la conclusión con el gráfico que la respalda.
Al finalizar el curso, el participante será capaz de:
Distribuciones teóricas y funciones de densidad Distribución uniforme como modelo de
equiprobabilidad; distribución normal, sus parámetros y la regla empírica; distribución
binomial para conteos de éxitos; función de densidad de probabilidad y por qué la
probabilidad de un valor exacto es cero en una variable continua; cálculo de la probabilidad
de un intervalo como área bajo la curva con scipy.stats; criterio para decidir qué
distribución modela un fenómeno a partir de la forma de los datos observados
Teorema central del límite y distribución muestral Diferencia entre la distribución de la
población y la distribución muestral de la media; efecto del tamaño de muestra sobre la forma
de esa distribución, verificado por simulación con numpy.random; error estándar de la media;
por qué el teorema central del límite es la pieza que permite aplicar un contraste
paramétrico sobre datos cuya población no es normal, y dónde deja de servir cuando la muestra
es pequeña
Forma de la distribución y correlación Valor esperado y varianza como momentos; momentos centrales y estandarizados; asimetría (skewness) e interpretación de su signo; curtosis y exceso de curtosis frente a la referencia normal; covarianza y su dependencia de las unidades; coeficiente de correlación de Pearson como covarianza estandarizada, es decir el promedio del producto de los Z-scores; interpretación de signo y magnitud; límites de Pearson ante relaciones no lineales y atípicos; Spearman sobre rangos como alternativa para relaciones monótonas y variables ordinales; matriz de correlación y mapa de calor; correlación espuria y la distancia entre correlación y causalidad
Marco del contraste de hipótesis Traducción de una pregunta de negocio a hipótesis nula y alternativa; nivel de significación y qué afirma exactamente un p-valor; errores de tipo I y tipo II y noción de potencia; familia paramétrica —t de Student para una muestra, para muestras independientes y para muestras emparejadas— frente a la no paramétrica —U de Mann-Whitney—; criterios de selección: escala de la variable, número de grupos, diseño independiente o emparejado y tamaño muestral disponible; qué se gana en potencia con la prueba paramétrica y qué se gana en robustez con la alternativa de rangos
Tests paramétricos y verificación de supuestos Normalidad con Shapiro-Wilk y con
Kolmogorov-Smirnov: qué afirma la hipótesis nula de cada una, cuándo se prefiere cada test y
por qué ambos se vuelven excesivamente sensibles con muestras grandes; homocedasticidad con
la prueba de Levene y consecuencias de la desigualdad de varianzas; ejecución de ttest_ind,
ttest_1samp y el contraste emparejado con scipy.stats; ruta de decisión cuando un
supuesto falla: transformación de la variable (logarítmica), t de Welch ante varianzas
desiguales o cambio a la alternativa no paramétrica, y registro del cambio para que el
análisis quede auditable
Tests no paramétricos y chi-cuadrado U de Mann-Whitney sobre rangos para comparar dos grupos
sin supuesto de normalidad; construcción de la tabla de contingencia con pd.crosstab;
prueba de chi-cuadrado de independencia entre dos variables categóricas, frecuencias
esperadas frente a observadas e interpretación del resultado en términos de asociación;
requisitos de tamaño de celda y qué hacer cuando no se cumplen
Comparación visual de distribuciones Diagrama de caja para mediana, dispersión y atípicos por grupo; violin plot para la densidad y la bimodalidad que el diagrama de caja oculta; Q-Q plot como contraste visual de normalidad e interpretación de las desviaciones en las colas; por qué la prueba formal y el gráfico son complementarios y no sustitutivos; elección del gráfico que respalda la conclusión al comunicar un resultado inferencial
→ EST01 — Estadística — Iniciación (Iniciación, 8h)
Del stack, se da por asentado lo que EST01 introduce: carga de un CSV con pandas, selección de columnas y filtrado booleano, y gráficos básicos con matplotlib. Este curso añade scipy y seaborn sobre esa base.