📂 Querying Files en Databricks (Parte 1): Spark SQL + Volumes
- 16 jul
- 1 min de lectura
Introducción
Hasta este punto la mayoría de los laboratorios estuvieron enfocados en Delta Tables, aprovechando las capacidades que ofrece Delta Lake para gestionar información dentro de Unity Catalog. Sin embargo, antes de convertir los datos en tablas, normalmente trabajamos con archivos como CSV, JSON, Parquet o Excel.
Es aquí donde aparecen los Volumes, una forma gobernada de almacenar archivos en su estado original dentro de Unity Catalog. En esta primera parte de la serie me enfoqué en aprender cómo consultar esos archivos utilizando Spark SQL.
¿Qué veremos?
Durante este laboratorio exploré las dos formas principales de lectura disponibles en Spark SQL:
⚡ Lectura directa del archivo especificando su formato.
⚡ Lectura mediante la función read_files(), que permite configurar opciones adicionales según el tipo de archivo.
También revisé el uso de wildcards (*), una característica muy útil para consultar múltiples archivos utilizando patrones de búsqueda.
¿Por qué comenzar por Spark SQL?
Antes de trabajar con transformaciones más avanzadas, resulta importante comprender cómo acceder a la información almacenada en un Volume y conocer las alternativas que ofrece Spark SQL para realizar estas consultas. Este constituye el primer paso para entender el flujo de trabajo con archivos dentro de Databricks.
📌 En el notebook asociado a este capítulo encontrarás ejemplos completos de ambos métodos de lectura, el uso de wildcards y una comparación entre los distintos enfoques. 🚀 En la segunda parte de esta serie exploraremos cómo realizar estas mismas operaciones utilizando PySpark, ampliando las posibilidades para trabajar con archivos almacenados en Volumes. (Repositorio-GitHub)


Comentarios