
Este curso desarrolla de forma práctica las competencias actuales de DP-750 para implementar soluciones de ingeniería de datos con Azure Databricks. Recorre la configuración del entorno, Unity Catalog, preparación de datos, pipelines y operación en producción.
Las actividades combinan SQL y Python sobre Spark, patrones batch y streaming, calidad, seguridad, control de versiones, Declarative Automation Bundles, Lakeflow Jobs y observabilidad.
El proyecto final entrega un pipeline lakehouse gobernado, desplegable y monitorizado, con documentación de acceso, calidad, rendimiento y recuperación.
- Conocimientos prácticos de SQL y Python.
- Fundamentos de ingeniería de datos, almacenamiento cloud y Git.
- Familiaridad básica con Azure, Microsoft Entra ID y conceptos lakehouse.
- Workspace de Azure Databricks habilitado para laboratorios.
- Duración: 30 horas distribuidas en 6 módulos.
- Alineación: DP-750.
- Metodología: laboratorios guiados, retos aplicados y proyecto final.
- Evaluación: evidencias prácticas, revisión técnica y condición de superación del 80%.
- Resultado: portfolio de artefactos reutilizables y proyecto defendible.
Esta formación está dirigida a:
- Data engineers que implementan plataformas lakehouse.
- Desarrolladores de pipelines batch y streaming.
- Administradores y platform engineers de Databricks.
- Profesionales que preparan la ruta DP-750.
Módulo 1. Entorno y arquitectura de Azure Databricks — 5 horas
- Workspace, planos de control y datos, regiones y red.
- Compute, runtimes, políticas, Photon y costes.
- Repositorios Git, secretos y configuración de desarrollo.
- Práctica aplicada: Configuración de un entorno seguro y reproducible.
Módulo 2. Unity Catalog, seguridad y gobierno — 5 horas
- Metastore, catálogos, esquemas, tablas, vistas y volúmenes.
- Identidades, privilegios, credenciales y ubicaciones externas.
- Linaje, auditoría, descubrimiento y acceso mínimo.
- Práctica aplicada: Modelo de permisos y trazabilidad para varios equipos.
Módulo 3. Modelado, ingesta y procesamiento — 5 horas
- Delta Lake, granularidad, particionado y clustering.
- Batch, streaming, Auto Loader, CDC y conectores.
- SQL, DataFrames, joins, ventanas y transformaciones.
- Práctica aplicada: Pipeline de ingesta incremental con modelo optimizado.
Módulo 4. Calidad y pipelines declarativos — 5 horas
- Esquemas, expectativas, nulos, duplicados y deriva.
- Lakeflow Spark Declarative Pipelines y dependencias.
- Manejo de errores, cuarentena y reprocesamiento.
- Práctica aplicada: Pipeline medallion con reglas y evidencias de calidad.
Módulo 5. Despliegue y operación de cargas — 5 horas
- Lakeflow Jobs, tareas, triggers, parámetros y alertas.
- Git, pruebas y Declarative Automation Bundles.
- Promoción entre entornos, rollback y automatización.
- Práctica aplicada: Despliegue versionado de un job multi-tarea.
Módulo 6. Rendimiento, observabilidad y proyecto final — 5 horas
- Spark UI, logs, métricas, skew, shuffle, spill y caché.
- Coste, capacidad, SLA y resolución de incidencias.
- Arquitectura, seguridad, calidad, despliegue y documentación.
- Práctica aplicada: Lakehouse de producción monitorizado y defendido técnicamente.

