Boost Academy
FormaciónEvaluacionesPerfil
Volver
  • En directo

Databricks — Iniciación

8h de clase en directo·HACK A BOSS·Español

Skills que aprenderás

  • Databricks

Convocatorias

Necesitas un plan activo

Para acceder a los cursos en directo necesitas un plan activo. Estamos trabajando para que los planes estén disponibles pronto — ¡mantente atento!

No hay convocatorias abiertas ahora mismo, pero no te pierdas la oportunidad: guarda este curso y te avisamos en cuanto se abra una convocatoria.

Descripción

Objetivos

Temario

Requisitos técnicos

Conocimientos previos

Microcertificados relacionados

Detalles de la convocatoria

Recursos

No hay recursos disponibles todavía para esta convocatoria

Este curso está dirigido a profesionales que se incorporan por primera vez al entorno Databricks y que necesitan adquirir una base sólida para trabajar con notebooks y datos distribuidos en proyectos de ciencia de datos o analítica. A lo largo de las 8 horas, el participante conocerá los elementos básicos del entorno —notebook, compute, Unity Catalog y Git folders—, aprenderá a navegar por ellos y ejecutará sus primeros notebooks sobre un compute ya configurado, verificando resultados desde un estado limpio; progresará después hacia la manipulación de DataFrames con la API de PySpark, la lectura y escritura de ficheros sobre Volúmenes de Unity Catalog, y el uso de las herramientas de visualización integradas. Al finalizar, la persona será capaz de llevar a cabo un flujo de trabajo analítico completo —desde la ingesta de un fichero CSV o Parquet hasta la presentación visual de resultados— siguiendo criterios objetivos de legibilidad y organización del notebook.

Al finalizar el curso, el participante será capaz de:

  • Describir los elementos básicos del entorno Databricks (notebook, compute, Unity Catalog, Git folders), su función, un ejemplo de uso y su relación entre ellos
  • Ejecutar un notebook desde un estado limpio verificando el compute asignado, comprobando los resultados esperados indicados en el enunciado y explicando qué celda produce cada uno
  • Identificar la causa de errores preparados en celdas de notebook (sintaxis Python, referencia a tabla inexistente, referencia a columna inexistente), explicando la causa e indicando su corrección mínima
  • Describir la diferencia entre una celda Python y una celda SQL dentro de un mismo notebook, demostrándolo con una misma selección o agregación ejecutada en ambos modos
  • Aplicar las operaciones básicas de la API de DataFrames de PySpark (select, filter, groupBy con una agregación, withColumn) sobre un dataset de ejemplo para responder preguntas analíticas concretas
  • Ejecutar la lectura de un dataset CSV desde un Volumen de Unity Catalog, escribir el resultado transformado en formato Parquet y recargarlo para comprobar que conserva el esquema y los datos esperados
  • Aplicar las funciones de visualización integradas de Databricks para representar un histograma de una variable numérica y un gráfico de barras de una agregación por categoría, indicando eje, función de agregación y título esperados
  • Identificar en un notebook dado carencias objetivas (ausencia de título o introducción, falta de celdas Markdown de etapas, nombres ambiguos, código duplicado, salidas sin contexto, dependencia de estado previo) y proponer su corrección
  1. El entorno Databricks: elementos básicos y modos de trabajo Se presentan los elementos que componen el entorno de trabajo diario en Databricks: el notebook como unidad de trabajo, el compute como recurso de ejecución asignado, Unity Catalog como sistema de organización y gobierno de los datos, y los Git folders como mecanismo de control de versiones; los participantes elaboran un diagrama o glosario propio con la función, un ejemplo de uso y la relación entre estos elementos. Se introduce también la dualidad de celdas Python y SQL dentro de un mismo notebook, demostrando con una misma selección o agregación ejecutada en ambos modos cuál conviene usar para transformaciones programáticas y cuál para consultas declarativas.
  2. Primeros pasos con notebooks y diagnóstico de errores Se guía a los participantes en la ejecución de un notebook completo desde un estado limpio ("Clear state" + "Run all") sobre un compute ya asignado, verificando dos resultados concretos indicados en el enunciado y explicando qué celda produce cada uno. A continuación se trabaja el diagnóstico de tres errores preparados y homogéneos —error de sintaxis Python, referencia a una tabla inexistente y referencia a una columna inexistente—, explicando brevemente la causa de cada uno e indicando su corrección mínima.
  3. Manipulación de datos con la API de DataFrames de PySpark y Unity Catalog Volumes Se abordan las operaciones fundamentales de la API de DataFrames de PySpark —select, filter, groupBy acompañado de una función de agregación y withColumn— aplicadas, de forma parcialmente guiada, sobre un dataset de ejemplo para responder preguntas analíticas concretas. Se practica la lectura de un dataset CSV desde una ruta de un Volumen de Unity Catalog, la escritura del resultado transformado en formato Parquet en otra ruta del mismo volumen, y la recarga posterior del resultado para comprobar que conserva el esquema y los datos esperados.
  4. Visualización y revisión de notebooks Se exploran las capacidades de visualización integradas de Databricks mediante la función display y la selección del tipo de gráfico, representando un histograma de una variable numérica y un gráfico de barras de una agregación por categoría, con el eje, la función de agregación y el título esperados indicados en el enunciado. El bloque cierra con un ejercicio de revisión de código: los participantes identifican en un notebook dado al menos dos carencias objetivas —entre ausencia de título, falta de celdas Markdown de etapas, nombres ambiguos, código duplicado, salidas sin contexto o dependencia del estado dejado por una ejecución anterior— y proponen y aplican las correcciones oportunas para dejar el notebook ejecutable desde un estado limpio.
  • Acceso a un workspace de Databricks activo con Unity Catalog habilitado, y al menos un catálogo/esquema/volumen provisionado con permisos de escritura para el alumnado
  • Compute de Databricks Runtime 13.x LTS o superior, compatible con Python, ya asignado y en estado Running al inicio de cada sesión (puede ser facilitado por el instructor)
  • Navegador web moderno (Chrome 110+, Firefox 110+ o Edge 110+) con conexión estable a internet; no se requiere instalación local de software adicional
  • Dataset de ejemplo en formato CSV y Parquet cargado en un Volumen de Unity Catalog o proporcionado como adjunto del curso antes de la sesión práctica

Se espera un perfil que ya programa en Python de forma básica (variables, funciones, estructuras de control y manejo de colecciones) y que está familiarizado con el concepto de tabla y operaciones elementales de consulta (filtrar, agrupar, agregar), independientemente del lenguaje o herramienta utilizada previamente. Bastan nociones generales sobre ficheros CSV y entornos cloud; no se requiere experiencia previa con Spark ni con Databricks.

Lakehouse y Pipelines en Databricks

Construir y orquestar pipelines de datos en la plataforma Databricks

28h de clase en directo3 Cursos
    Databricks