Formación & Consultoría info@tallerdetecnologia.net

Apache Iceberg

  • ¿Qué aprenderás? A construir arquitecturas Lakehouse con Apache Iceberg utilizando tablas abiertas, snapshots, evolución de esquemas, particionado y Time Travel.
  • ¿Qué conseguirás al finalizar? Al finalizar el workshop serás capaz de diseñar una arquitectura Lakehouse moderna con Iceberg y Parquet para datos escalables.
  • - Inversión: 96 € 💰
  • - ¿Qué incluye tu inversión?: 💻 12h en directo + 📂 Materiales + 🚀 Proyecto final + 🔍 Corrección 1-to-1 + 🏅 Certificado

Apache Iceberg

¿Por qué aprender Apache Iceberg?

Las arquitecturas modernas de datos están evolucionando desde los Data Warehouses tradicionales hacia plataformas más abiertas, flexibles y capaces de trabajar directamente sobre grandes volúmenes de datos almacenados en Data Lakes.

Apache Iceberg es un formato de tabla abierto diseñado para gestionar grandes datasets analíticos sobre almacenamiento de objetos, incorporando funcionalidades que tradicionalmente asociábamos a una base de datos o un Data Warehouse.

Permite trabajar con transacciones, evolución de esquemas, particionado, snapshots y consultas sobre versiones anteriores de los datos, manteniendo los datos almacenados en formatos abiertos como Parquet.

En este workshop aprenderás los fundamentos de Apache Iceberg y construirás una arquitectura analítica moderna basada en tablas Iceberg.

Todo el workshop está orientado a comprender no solamente cómo utilizar Iceberg, sino qué problema resuelve y cuál es su papel dentro de arquitecturas modernas como Data Lakes y Lakehouses.

¿Qué aprenderás?

✅ Comprender qué es Apache Iceberg y qué problema resuelve.
✅ Entender la diferencia entre archivos y tablas.
✅ Comprender la arquitectura de una tabla Iceberg.
✅ Trabajar con formatos columnares como Apache Parquet.
✅ Crear y consultar tablas Iceberg.
✅ Insertar, actualizar y eliminar datos.
✅ Comprender las transacciones ACID.
✅ Trabajar con snapshots.
✅ Consultar versiones anteriores mediante Time Travel.
✅ Gestionar la evolución del esquema.
✅ Comprender la evolución del particionado.
✅ Analizar el funcionamiento de los metadatos.
✅ Comprender el papel del catálogo.
✅ Trabajar con grandes datasets analíticos.
✅ Entender el concepto de Lakehouse.
✅ Diseñar arquitecturas abiertas basadas en Iceberg.
✅ Integrar Iceberg dentro de una plataforma moderna de datos.

Ficha técnica

  • Modalidad: online en directo.
  • Duración: 12 horas.
  • Distribución: 4 sesiones de 3 horas.
  • Proyecto final: asíncrono.
  • Plazo de entrega: 14 días.
  • Corrección personalizada: incluida.
  • Plazas: máximo 12 participantes.
  • Nivel: intermedio.
  • Idioma: castellano.

Metodología Taller de Tecnología®

  • #1 Sesión: Data Lakes, Lakehouse y fundamentos de Iceberg (síncrono).
  • #2 Sesión: Tablas, metadatos y gestión de datos (síncrono).
  • #3 Sesión: Snapshots, Time Travel y evolución de tablas (síncrono).
  • #4 Sesión: Arquitectura Lakehouse y proyecto completo (síncrono).
  • Proyecto final + certificación (asíncrono).

Temario del Workshop

  • Introducción a las arquitecturas modernas de datos.
  • Data Warehouse vs Data Lake vs Lakehouse.
  • Limitaciones de trabajar únicamente con archivos.
  • Introducción a los Open Table Formats.
  • Qué es Apache Iceberg.
  • Arquitectura de Apache Iceberg.
  • Data Files.
  • Apache Parquet.
  • Metadata Files.
  • Manifest Files.
  • Manifest Lists.
  • Snapshots.
  • Catálogos.
  • Creación de tablas Iceberg.
  • Lectura de tablas.
  • Inserción de datos.
  • Actualización de datos.
  • Eliminación de datos.
  • Operaciones MERGE.
  • Transacciones ACID.
  • Schema Evolution.
  • Partition Evolution.
  • Hidden Partitioning.
  • Partition Pruning.
  • Snapshots y versionado.
  • Time Travel.
  • Rollback de datos.
  • Metadata Tables.
  • Optimización de tablas.
  • Compactación de archivos.
  • Gestión del ciclo de vida de snapshots.
  • Expiración de snapshots.
  • Gestión de archivos.
  • Almacenamiento de objetos.
  • Iceberg y arquitecturas Lakehouse.
  • Interoperabilidad entre motores.
  • Iceberg dentro de una Modern Data Platform.
  • Diseño de una arquitectura analítica abierta.
  • Casos de uso de Apache Iceberg.
  • Buenas prácticas.

Workshop Apache Iceberg

Proyecto Final + Certificación (Asíncrono)

Al finalizar el workshop, los alumnos realizarán de manera individual un proyecto práctico que deberá ser entregado dentro del plazo establecido.

El proyecto consistirá en diseñar y construir una pequeña arquitectura Lakehouse utilizando Apache Iceberg como formato de tabla.

El alumno deberá crear tablas Iceberg sobre datos almacenados en formato Parquet, cargar y transformar información y realizar diferentes operaciones sobre los datos.

Durante el proyecto se aplicarán conceptos como evolución del esquema, particionado, snapshots y Time Travel, permitiendo consultar diferentes estados de los datos y comprender cómo Iceberg gestiona internamente los cambios.

También se analizarán los metadatos generados por las tablas para comprender la relación entre Data Files, Manifest Files, Metadata Files y Snapshots.

Finalmente, el alumno deberá proponer una arquitectura en la que diferentes herramientas puedan trabajar sobre una misma capa de datos abierta basada en Apache Iceberg.

El proyecto será evaluado por el instructor, quien proporcionará comentarios personalizados, propuestas de mejora y una valoración técnica de la solución presentada.

Los alumnos que superen satisfactoriamente la evaluación recibirán el Certificado de Aprovechamiento de Taller de Tecnología, acreditando las competencias adquiridas durante el workshop.

Certificado Workshop Apache Iceberg

 

Formador: Daniel Castillo Garrosset

Formador especializado en Data Engineering, Business Intelligence e IA Generativa, con más de 25 años de experiencia impartiendo formación técnica a empresas, universidades y entidades públicas. Formador de Data Science en el Cibernarium de Barcelona Activa.

  • Experiencia real como formador.
  • Metodología y enfoque práctico.
  • Corrección individual del proyecto.

Daniel Castillo Garrosset - Formador

Requisitos

  • SQL (nivel básico-intermedio).
  • Conceptos básicos de Data Engineering.
  • Conocimientos básicos sobre Data Lakes y almacenamiento de datos recomendables.

No es necesario conocer Apache Iceberg previamente.

Público objetivo

  • Data Engineers.
  • Analytics Engineers.
  • Data Architects.
  • Data Analysts con perfil técnico.
  • Profesionales que trabajen con Data Lakes.
  • Profesionales que trabajen con plataformas cloud de datos.
  • Profesionales interesados en arquitecturas Lakehouse.
  • Profesionales que quieran conocer tecnologías abiertas para plataformas modernas de datos.

¿Por qué elegir este workshop?

✔ Material descargable
✔ Proyecto real
✔ Soporte durante el workshop
✔ Certificación
✔ Corrección personalizada
✔ Enfoque 100 % práctico
✔ Arquitectura Lakehouse
✔ Open Table Formats
✔ Apache Parquet + Apache Iceberg

FAQs

  • ¿Necesito conocer Apache Iceberg?: No. El workshop parte desde los fundamentos.
  • ¿Necesito conocimientos de SQL?: Sí. Es recomendable disponer de un nivel básico-intermedio.
  • ¿Qué diferencia existe entre Parquet e Iceberg?: Parquet es un formato de archivo columnar. Iceberg añade una capa de gestión de tablas y metadatos sobre archivos como Parquet.
  • ¿Qué es un Open Table Format?: Es un formato abierto que permite gestionar datasets almacenados en un Data Lake como tablas analíticas, incorporando metadatos y funcionalidades avanzadas.
  • ¿Trabajaremos con Time Travel?: Sí. Se crearán snapshots y se consultarán diferentes versiones de los datos.
  • ¿Veremos Schema Evolution?: Sí. Se trabajará con cambios en la estructura de las tablas sin necesidad de reconstruir completamente los datasets.
  • ¿Qué relación tiene Iceberg con el concepto Lakehouse?: Iceberg permite incorporar funcionalidades propias de las tablas de un Data Warehouse sobre datos almacenados en un Data Lake, por lo que es una de las tecnologías fundamentales en muchas arquitecturas Lakehouse.
  • ¿Apache Iceberg sustituye a Snowflake o BigQuery?: No necesariamente. Iceberg es un formato de tabla abierto, mientras que Snowflake y BigQuery son plataformas analíticas. Pueden formar parte de arquitecturas diferentes e incluso integrarse en determinados escenarios.
  • ¿Es un curso teórico?: No, más del 80 % del tiempo estará dedicado a ejercicios, creación de tablas y prácticas sobre una arquitectura Lakehouse.
  • ¿Obtendré certificado?: Sí, una vez superado satisfactoriamente el proyecto final.
  • ¿Puedo utilizar el proyecto como portfolio?: Sí. El proyecto estará diseñado para demostrar conocimientos de arquitecturas Lakehouse y Open Table Formats.