
Este máster cubre el ciclo completo de una plataforma de datos moderna: fuentes, ingesta, almacenamiento, procesamiento, gobierno, modelado, servicio, análisis y operación. Integra Azure, Microsoft Fabric, Cosmos DB, SQL con capacidades de IA y Azure Databricks.
La ruta mantiene los fundamentos duraderos de DP-203, retirado y sustituido por DP-700, y los conecta con DP-420, DP-600, DP-750 y DP-800. Cada bloque desemboca en artefactos prácticos y decisiones de arquitectura.
El proyecto final entrega una plataforma lakehouse gobernada, con datos operacionales y analíticos, pipelines desplegables, modelo semántico, observabilidad, seguridad y un caso de IA sobre datos.
- Conocimientos de SQL y modelado de datos.
- Experiencia inicial con Python o PySpark y control de versiones.
- Fundamentos de Azure, almacenamiento cloud y analítica.
- Acceso a entornos de Microsoft Fabric, Azure y Databricks para laboratorios.
- Duración: 120 horas distribuidas en 12 módulos.
- Alineación: DP-420, DP-600, DP-700, DP-750 y DP-800; actualiza DP-203 hacia DP-700.
- Metodología: laboratorios guiados, retos aplicados y proyecto final.
- Evaluación: evidencias prácticas, revisión técnica y condición de superación del 80%.
- Resultado: portfolio de artefactos reutilizables y proyecto defendible.
Esta formación está dirigida a:
- Data engineers, analytics engineers y desarrolladores de datos.
- Arquitectos y consultores de plataformas analíticas.
- Profesionales de BI que evolucionan hacia Fabric y lakehouse.
- Equipos que preparan rutas DP-420, DP-600, DP-700, DP-750 o DP-800.
Módulo 1. Arquitectura y gobierno de plataformas de datos — 10 horas
- Dominios, productos de datos, lakehouse, warehouse y bases operacionales.
- Requisitos funcionales, no funcionales, soberanía y coste.
- Catálogo, linaje, clasificación, propiedad y calidad.
- Práctica aplicada: Arquitectura objetivo y modelo operativo de una plataforma empresarial.
Módulo 2. Ingesta batch, streaming y CDC — 10 horas
- Fuentes, conectores, archivos, APIs, eventos y cambio incremental.
- Patrones de carga, idempotencia, reintentos y datos tardíos.
- Orquestación, contratos y observabilidad de ingesta.
- Práctica aplicada: Pipeline de ingesta robusto con controles y recuperación.
Módulo 3. Almacenamiento, Delta y diseño lakehouse — 10 horas
- Formatos abiertos, Delta Lake, tablas y transacciones.
- Capas de refinamiento, particionado, clustering y retención.
- OneLake, accesos directos y organización por dominios.
- Práctica aplicada: Diseño físico con estrategia de rendimiento y ciclo de vida.
Módulo 4. Procesamiento con Spark y SQL — 10 horas
- DataFrames, Spark SQL, joins, ventanas y optimización.
- Transformaciones incrementales y cargas MERGE.
- Pruebas, expectativas, esquema y control de deriva.
- Práctica aplicada: Pipeline medallion con pruebas de calidad y rendimiento.
Módulo 5. Microsoft Fabric para ingeniería de datos — 10 horas
- Workspaces, lakehouses, notebooks, pipelines y Dataflow Gen2.
- Seguridad, dominios, despliegue y monitorización.
- Integración entre ingeniería, warehouse, ciencia de datos y BI.
- Práctica aplicada: Solución de ingeniería en Fabric promovida entre entornos.
Módulo 6. Cosmos DB y aplicaciones cloud-native — 10 horas
- Modelado por acceso, particionado y unidades de solicitud.
- Consistencia, índices, cambios, rendimiento y coste.
- Seguridad, SDK, resiliencia y patrones de integración.
- Práctica aplicada: Backend de datos distribuido con partición y consultas justificadas.
Módulo 7. Analítica avanzada con Fabric — 10 horas
- Modelos semánticos, Direct Lake y diseño estrella.
- DAX, seguridad, rendimiento y gobernanza de métricas.
- Informes, consumo, autoservicio y ciclo de vida.
- Práctica aplicada: Modelo semántico certificado y cuadro analítico gobernado.
Módulo 8. SQL con capacidades de IA — 10 horas
- Vectores, embeddings, búsqueda y enriquecimiento con modelos.
- Aplicaciones con bases SQL preparadas para IA.
- Seguridad, evaluación, coste y observabilidad de consultas inteligentes.
- Práctica aplicada: Prototipo SQL con búsqueda semántica y evaluación.
Módulo 9. Azure Databricks y Unity Catalog — 10 horas
- Workspaces, compute, metastore, catálogos, esquemas y tablas.
- Identidad, privilegios, credenciales, ubicaciones y linaje.
- Lakeflow, Spark, calidad y operación de cargas.
- Práctica aplicada: Entorno gobernado con pipeline de Databricks.
Módulo 10. DataOps, CI/CD y observabilidad — 10 horas
- Git, pruebas, bundles, pipelines y promoción.
- Telemetría de plataforma, jobs, calidad y frescura.
- Incidentes, recuperación, optimización y FinOps.
- Práctica aplicada: Flujo de entrega con puertas y panel operativo.
Módulo 11. Seguridad, privacidad y cumplimiento — 10 horas
- Entra ID, RBAC, ABAC, aislamiento y cifrado.
- Acceso por filas/columnas, enmascarado y uso autorizado.
- Auditoría, retención, borrado y respuesta a incidentes.
- Práctica aplicada: Modelo de amenazas y matriz de controles de datos.
Módulo 12. Proyecto final de plataforma de datos — 10 horas
- Caso empresarial, arquitectura y backlog de productos de datos.
- Implementación integrada en Fabric, Azure o Databricks.
- Calidad, seguridad, BI, IA, operación y defensa técnica.
- Práctica aplicada: Plataforma de datos demostrable con documentación y hoja de ruta.

