
En un mundo donde el análisis de datos en tiempo real es clave para la toma de decisiones, Apache Flink se posiciona como una de las tecnologías más potentes y versátiles para el procesamiento de flujos de datos. Este curso está diseñado para proporcionarte una comprensión sólida y práctica de Flink, permitiéndote construir aplicaciones escalables y tolerantes a fallos que procesen grandes volúmenes de datos en movimiento.
A lo largo de 24 horas de formación intensiva, aprenderás a dominar las APIs principales de Flink, trabajar con ventanas temporales, gestionar el estado de las aplicaciones, integrar con sistemas como Kafka y ejecutar consultas SQL en tiempo real. También exploraremos las estrategias de despliegue, supervisión y ajuste para ejecutar tus aplicaciones Flink en entornos reales.
Con este curso, te situarás a la vanguardia del análisis en tiempo real y te capacitarás para responder a los retos más exigentes del procesamiento de datos moderno.
¿Qué aprenderás?
En un curso intensivo de Apache Flink, aprenderás a desarrollar aplicaciones eficientes para el procesamiento de grandes volúmenes de datos en tiempo real y por lotes, utilizando la API de DataStream y dominando conceptos clave de procesamiento distribuido en entornos distribuidos.
- Conocimientos básicos de programación en Java o Scala.
- Familiaridad con conceptos de bases de datos, especialmente modelos de datos relacional y NoSQL.
- Experiencia con Linux y terminal (recomendado para el entorno de desarrollo).
- Comprensión básica de sistemas distribuidos y arquitectura orientada a eventos.
- Opcional: conocimientos de Apache Kafka y herramientas de análisis de datos en tiempo real.
- Enfoque práctico: se trabaja directamente con Flink y sus APIs mediante ejercicios en cada bloque.
- Actualización constante: se incluyen las últimas mejoras de Flink y su ecosistema.
- Ejemplos reales: casos de uso de análisis en tiempo real aplicados a entornos de negocio y streaming de datos.
- Compatibilidad con ecosistemas modernos: integración con Kafka, bases de datos NoSQL y herramientas de orquestación.
- Preparación para entornos productivos: se incluyen prácticas de despliegue, escalabilidad y tolerancia a fallos.
- Ingenieros de datos que trabajan con sistemas distribuidos y flujos de datos en tiempo real.
- Desarrolladores backend interesados en integrar capacidades de análisis en streaming en sus aplicaciones.
- Analistas de datos que necesitan procesar grandes volúmenes de datos en movimiento.
- Administradores de sistemas que busquen desplegar y gestionar aplicaciones basadas en Apache Flink.
- Estudiantes avanzados de informática o ciencia de datos que quieran profundizar en el procesamiento distribuido.
Contenidos del curso
Bloque 1 – Introducción a Apache Flink (2 horas)
- ¿Qué es Apache Flink? Arquitectura general
- Comparativa con Spark, Storm y Kafka Streams
- Casos de uso típicos: monitorización, IoT, detección de fraudes
Bloque 2 – Instalación y primeros pasos (2 horas)
- Instalación local y configuración del entorno
- Flink Dashboard y herramientas de desarrollo
- Ejecutar el primer job de ejemplo
Bloque 3 – Fundamentos de Flink: DataStream API (4 horas)
- Tipos de flujos: bounded y unbounded
- Operaciones básicas con DataStream API
- Map, Filter, FlatMap, KeyBy, Reduce
- Ejercicios prácticos de transformación de datos
Bloque 4 – Time Windows y procesamiento temporal (4 horas)
- Event time vs. processing time
- Ventanas de tiempo: tumbling, sliding, session
- Timers y procesamiento basado en tiempo
- Late data y watermarking
Bloque 5 – Integración con Apache Kafka y otras fuentes (4 horas)
- Flink + Kafka: configuración y uso
- Lectura y escritura de streams desde Kafka
- Conectores a fuentes JDBC, archivos, sockets, etc.
- Estado de Flink: stateful operators y checkpointing
Bloque 6 – Procesamiento con Flink SQL y Table API (4 horas)
- Introducción a Flink SQL
- Transformaciones declarativas con Table API
- Consultas continuas en tiempo real
- Ejercicios de consultas sobre streams en SQL
Bloque 7 – Deploy en producción y monitorización (4 horas)
- Despliegue en cluster: Flink Standalone y Kubernetes
- Uso de Flink Dashboard y métricas
- Estrategias de escalado y tolerancia a fallos
- Integración con Prometheus y Grafana
Duración total estimada: 24 horas

