Skills que aprenderás
Convocatorias
No hay convocatorias abiertas ahora mismo, pero no te pierdas la oportunidad: guarda este curso y te avisamos en cuanto se abra una convocatoria.
Recursos
No hay recursos disponibles todavía para esta convocatoria
Dirigido a perfiles que ya escriben Python básico y quieren empezar a razonar sobre datos con criterio estadístico, este curso cubre el salto entre tener un CSV cargado y poder decir algo defendible sobre él: si la media representa al conjunto o lo distorsiona, si un valor extremo es un error o información, qué gráfico cuenta la historia sin falsearla. El participante aprenderá a clasificar las variables de un dataset, a construir distribuciones de frecuencias, a calcular e interpretar medidas de tendencia central, dispersión y posición con NumPy y pandas, a detectar valores atípicos por Z-score y por rango intercuartílico, a leer la forma de una distribución y a calcular probabilidades con las reglas básicas y el teorema de Bayes. Al finalizar, el participante será capaz de tomar un dataset tabular real, producir su resumen descriptivo completo en un notebook —medidas, atípicos marcados por ambos criterios, forma de la distribución y gráfico justificado— y defender cada decisión tomada.
Al finalizar el curso, el participante será capaz de:
Variables estadísticas y distribución de frecuencias Vocabulario de un dataset tabulado: observaciones como filas, atributos como columnas, población y muestra; clasificación de variables cualitativas (nominal y ordinal) y cuantitativas (discreta y continua); casos ambiguos habituales, como un código postal almacenado como entero o una escala de satisfacción de 1 a 5; carga de un dataset con pandas e inspección inicial de tipos; construcción de la distribución de frecuencias absolutas, relativas y acumuladas sobre variables categóricas, y lectura de la tabla como primer diagnóstico de la composición del conjunto
Medidas de tendencia central Media aritmética, mediana y moda: definición, cálculo y comportamiento frente a valores extremos; por qué la mediana resiste los atípicos y la media no; contextos en los que cada medida es la más representativa —rentas, tiempos de respuesta, variables categóricas—; distribuciones multimodales y conjuntos sin moda; el error de reportar la media de una variable ordinal
Dispersión y posición con NumPy y pandas Rango, varianza y desviación típica: cálculo
vectorizado y diferencia entre varianza muestral y poblacional (el parámetro ddof y por
qué NumPy y pandas no coinciden por defecto); interpretación de la desviación típica en las
unidades del dato frente a la varianza, que no es directamente interpretable; cuartiles y
percentiles sobre datos ordenados, rango intercuartílico como dispersión robusta y lectura
de la posición relativa de una observación; el resumen de cinco números con describe()
Visualización descriptiva Histograma y efecto de la anchura del intervalo sobre la forma percibida; diagrama de caja y su relación con el resumen de cinco números; diagrama de dispersión para la relación entre dos cuantitativas; diagrama de barras para categóricas; correspondencia entre tipo de variable y tipo de gráfico, con justificación explícita frente a las alternativas descartadas; lectura de la forma de una distribución —simetría, sesgo positivo y negativo— y relación entre la posición relativa de media y mediana y el sentido del sesgo; errores frecuentes: barras para variables continuas y ejes truncados
Detección de anomalías por dos criterios Z-score: estandarización de la variable y umbral convencional de tres desviaciones típicas, con su dependencia de la normalidad; criterio del rango intercuartílico: límites Q1 − 1,5 · IQR y Q3 + 1,5 · IQR; comparación de qué observaciones marca cada criterio sobre el mismo conjunto y por qué difieren; qué hacer y qué no hacer con un atípico detectado, distinguiendo el error de registro del valor legítimo e informativo
Probabilidad y teorema de Bayes Espacio muestral y suceso; la ley de los grandes números verificada por simulación; reglas de adición para sucesos compatibles e incompatibles; probabilidad condicional y reglas de multiplicación para sucesos dependientes e independientes; probabilidad total; teorema de Bayes y actualización de una probabilidad a la luz de evidencia nueva, con el caso clásico del test diagnóstico y los falsos positivos
numpy.random para las simulaciones
de probabilidadNo hay curso prerrequisito de estadística. Se espera manejo básico de Python: variables, tipos, listas y diccionarios, condicionales y bucles, definición de funciones e importación de módulos. El curso PYD01 — Python — Iniciación cubre ese punto de partida. No hace falta haber usado NumPy, pandas ni matplotlib antes: las tres se introducen dentro del curso al servicio de los cálculos estadísticos, no como fin en sí mismas. Tampoco se requiere base previa de estadística ni de notación matemática formal; basta con la aritmética de secundaria.