Azure

DP-750: Ingeniería de Datos con Azure Databricks

Data engineers revisando gobierno, calidad, procesamiento distribuido y operación de pipelines lakehouse

Este curso desarrolla de forma práctica las competencias actuales de DP-750 para implementar soluciones de ingeniería de datos con Azure Databricks. Recorre la configuración del entorno, Unity Catalog, preparación de datos, pipelines y operación en producción.

Las actividades combinan SQL y Python sobre Spark, patrones batch y streaming, calidad, seguridad, control de versiones, Declarative Automation Bundles, Lakeflow Jobs y observabilidad.

El proyecto final entrega un pipeline lakehouse gobernado, desplegable y monitorizado, con documentación de acceso, calidad, rendimiento y recuperación.

  • Conocimientos prácticos de SQL y Python.
  • Fundamentos de ingeniería de datos, almacenamiento cloud y Git.
  • Familiaridad básica con Azure, Microsoft Entra ID y conceptos lakehouse.
  • Workspace de Azure Databricks habilitado para laboratorios.
  • Duración: 30 horas distribuidas en 6 módulos.
  • Alineación: DP-750.
  • Metodología: laboratorios guiados, retos aplicados y proyecto final.
  • Evaluación: evidencias prácticas, revisión técnica y condición de superación del 80%.
  • Resultado: portfolio de artefactos reutilizables y proyecto defendible.

Esta formación está dirigida a:

  • Data engineers que implementan plataformas lakehouse.
  • Desarrolladores de pipelines batch y streaming.
  • Administradores y platform engineers de Databricks.
  • Profesionales que preparan la ruta DP-750.

Módulo 1. Entorno y arquitectura de Azure Databricks — 5 horas

  • Workspace, planos de control y datos, regiones y red.
  • Compute, runtimes, políticas, Photon y costes.
  • Repositorios Git, secretos y configuración de desarrollo.
  • Práctica aplicada: Configuración de un entorno seguro y reproducible.

Módulo 2. Unity Catalog, seguridad y gobierno — 5 horas

  • Metastore, catálogos, esquemas, tablas, vistas y volúmenes.
  • Identidades, privilegios, credenciales y ubicaciones externas.
  • Linaje, auditoría, descubrimiento y acceso mínimo.
  • Práctica aplicada: Modelo de permisos y trazabilidad para varios equipos.

Módulo 3. Modelado, ingesta y procesamiento — 5 horas

  • Delta Lake, granularidad, particionado y clustering.
  • Batch, streaming, Auto Loader, CDC y conectores.
  • SQL, DataFrames, joins, ventanas y transformaciones.
  • Práctica aplicada: Pipeline de ingesta incremental con modelo optimizado.

Módulo 4. Calidad y pipelines declarativos — 5 horas

  • Esquemas, expectativas, nulos, duplicados y deriva.
  • Lakeflow Spark Declarative Pipelines y dependencias.
  • Manejo de errores, cuarentena y reprocesamiento.
  • Práctica aplicada: Pipeline medallion con reglas y evidencias de calidad.

Módulo 5. Despliegue y operación de cargas — 5 horas

  • Lakeflow Jobs, tareas, triggers, parámetros y alertas.
  • Git, pruebas y Declarative Automation Bundles.
  • Promoción entre entornos, rollback y automatización.
  • Práctica aplicada: Despliegue versionado de un job multi-tarea.

Módulo 6. Rendimiento, observabilidad y proyecto final — 5 horas

  • Spark UI, logs, métricas, skew, shuffle, spill y caché.
  • Coste, capacidad, SLA y resolución de incidencias.
  • Arquitectura, seguridad, calidad, despliegue y documentación.
  • Práctica aplicada: Lakehouse de producción monitorizado y defendido técnicamente.

Winnya Analytics S.L.
Cipriano Hebrero, 10
28864 Ajalvir (Madrid)

654 949 454

Te mantenemos formado e informado.

Simplemente suscríbete a nuestro newsletter.

Winnya Analytics S.L. © 2026. Todos los derechos reservados.

¡Suscríbete a nuestro newsletter!

Te mantendremos informado de todas las novedades de Winnya Analytics y te mandaremos contenidos gratuitos para que puedas estar al día de las tecnologías más avanzadas y puedas mejorar profesionalmente.