Boost Academy
FormaciónEvaluacionesPerfil
Volver
  • En directo

Estadística — Iniciación

8h de clase en directo·HACK A BOSS·Español

Skills que aprenderás

  • Estadística

Convocatorias

Necesitas un plan activo

Para acceder a los cursos en directo necesitas un plan activo. Estamos trabajando para que los planes estén disponibles pronto — ¡mantente atento!

No hay convocatorias abiertas ahora mismo, pero no te pierdas la oportunidad: guarda este curso y te avisamos en cuanto se abra una convocatoria.

Descripción

Objetivos

Temario

Requisitos técnicos

Conocimientos previos

Detalles de la convocatoria

Recursos

No hay recursos disponibles todavía para esta convocatoria

Dirigido a perfiles que ya escriben Python básico y quieren empezar a razonar sobre datos con criterio estadístico, este curso cubre el salto entre tener un CSV cargado y poder decir algo defendible sobre él: si la media representa al conjunto o lo distorsiona, si un valor extremo es un error o información, qué gráfico cuenta la historia sin falsearla. El participante aprenderá a clasificar las variables de un dataset, a construir distribuciones de frecuencias, a calcular e interpretar medidas de tendencia central, dispersión y posición con NumPy y pandas, a detectar valores atípicos por Z-score y por rango intercuartílico, a leer la forma de una distribución y a calcular probabilidades con las reglas básicas y el teorema de Bayes. Al finalizar, el participante será capaz de tomar un dataset tabular real, producir su resumen descriptivo completo en un notebook —medidas, atípicos marcados por ambos criterios, forma de la distribución y gráfico justificado— y defender cada decisión tomada.

Al finalizar el curso, el participante será capaz de:

  • Identificar el tipo de variable (nominal, ordinal, discreta o continua) de cada atributo en un conjunto de datos tabulado dado
  • Construir tablas de frecuencias absolutas y relativas a partir de un conjunto de datos categóricos siguiendo un procedimiento guiado
  • Describir la diferencia entre media, mediana y moda señalando en qué contexto cada medida es más representativa
  • Calcular media, mediana, moda, rango, varianza y desviación típica de una variable de un dataset con NumPy y pandas, e interpretar cada medida en las unidades del dato
  • Ejecutar el cálculo de percentiles y cuartiles sobre un conjunto de datos ordenado siguiendo un procedimiento paso a paso
  • Describir la forma de una distribución (simétrica, sesgada positiva o sesgada negativa) a partir de un histograma o un diagrama de caja proporcionado
  • Seleccionar y justificar el tipo de gráfico adecuado (barras, histograma, diagrama de caja o diagrama de dispersión) para representar una variable o la relación entre dos variables
  • Identificar valores atípicos en una serie numérica aplicando los dos criterios habituales —Z-score y rango intercuartílico— y contrastar qué observaciones marca cada uno
  • Aplicar las reglas de la probabilidad (adición, multiplicación y probabilidad condicional) y el teorema de Bayes para calcular la probabilidad de un suceso en un enunciado guiado, interpretando el resultado en términos del problema planteado
  1. Variables estadísticas y distribución de frecuencias Vocabulario de un dataset tabulado: observaciones como filas, atributos como columnas, población y muestra; clasificación de variables cualitativas (nominal y ordinal) y cuantitativas (discreta y continua); casos ambiguos habituales, como un código postal almacenado como entero o una escala de satisfacción de 1 a 5; carga de un dataset con pandas e inspección inicial de tipos; construcción de la distribución de frecuencias absolutas, relativas y acumuladas sobre variables categóricas, y lectura de la tabla como primer diagnóstico de la composición del conjunto

  2. Medidas de tendencia central Media aritmética, mediana y moda: definición, cálculo y comportamiento frente a valores extremos; por qué la mediana resiste los atípicos y la media no; contextos en los que cada medida es la más representativa —rentas, tiempos de respuesta, variables categóricas—; distribuciones multimodales y conjuntos sin moda; el error de reportar la media de una variable ordinal

  3. Dispersión y posición con NumPy y pandas Rango, varianza y desviación típica: cálculo vectorizado y diferencia entre varianza muestral y poblacional (el parámetro ddof y por qué NumPy y pandas no coinciden por defecto); interpretación de la desviación típica en las unidades del dato frente a la varianza, que no es directamente interpretable; cuartiles y percentiles sobre datos ordenados, rango intercuartílico como dispersión robusta y lectura de la posición relativa de una observación; el resumen de cinco números con describe()

  4. Visualización descriptiva Histograma y efecto de la anchura del intervalo sobre la forma percibida; diagrama de caja y su relación con el resumen de cinco números; diagrama de dispersión para la relación entre dos cuantitativas; diagrama de barras para categóricas; correspondencia entre tipo de variable y tipo de gráfico, con justificación explícita frente a las alternativas descartadas; lectura de la forma de una distribución —simetría, sesgo positivo y negativo— y relación entre la posición relativa de media y mediana y el sentido del sesgo; errores frecuentes: barras para variables continuas y ejes truncados

  5. Detección de anomalías por dos criterios Z-score: estandarización de la variable y umbral convencional de tres desviaciones típicas, con su dependencia de la normalidad; criterio del rango intercuartílico: límites Q1 − 1,5 · IQR y Q3 + 1,5 · IQR; comparación de qué observaciones marca cada criterio sobre el mismo conjunto y por qué difieren; qué hacer y qué no hacer con un atípico detectado, distinguiendo el error de registro del valor legítimo e informativo

  6. Probabilidad y teorema de Bayes Espacio muestral y suceso; la ley de los grandes números verificada por simulación; reglas de adición para sucesos compatibles e incompatibles; probabilidad condicional y reglas de multiplicación para sucesos dependientes e independientes; probabilidad total; teorema de Bayes y actualización de una probabilidad a la luz de evidencia nueva, con el caso clásico del test diagnóstico y los falsos positivos

  • Python 3.10 o superior, o acceso a Google Colab como alternativa sin instalación local
  • Jupyter Notebook, JupyterLab o VS Code con extensión Python e IPython kernel
  • numpy 1.24 o superior y pandas 2.0 o superior para el cálculo de medidas descriptivas
  • matplotlib 3.7 o superior para histogramas, diagramas de caja, dispersión y barras
  • Datasets tabulares provistos por el curso en CSV y Excel (del orden de cientos a pocos miles de filas), más un generador de muestras aleatorias con numpy.random para las simulaciones de probabilidad
  • Acceso a internet para la instalación de bibliotecas y consulta de documentación
  • Sin coste de laboratorio: no se requieren servicios cloud de pago ni software licenciado

No hay curso prerrequisito de estadística. Se espera manejo básico de Python: variables, tipos, listas y diccionarios, condicionales y bucles, definición de funciones e importación de módulos. El curso PYD01 — Python — Iniciación cubre ese punto de partida. No hace falta haber usado NumPy, pandas ni matplotlib antes: las tres se introducen dentro del curso al servicio de los cálculos estadísticos, no como fin en sí mismas. Tampoco se requiere base previa de estadística ni de notación matemática formal; basta con la aritmética de secundaria.