top of page

📂Writing Files en Databricks (Parte 2)

  • 6 ago
  • 2 min de lectura

Después de revisar cómo crear Delta Tables a partir de archivos almacenados en Volúmenes, aún quedaban dos enfoques por explorar para completar el panorama de escritura en Databricks:

  • 🔄 CTAS + read_files()

  • 🐍 PySpark

🔄 CTAS + read_files()

  • En capítulos anteriores vimos que USING + OPTIONS permite crear tablas directamente desde un archivo, pero con una limitación importante: únicamente genera External Tables.

  • Para superar esta restricción, podemos combinar CTAS (Create Table As Select) con read_files(). Este enfoque híbrido permite leer archivos con la flexibilidad de read_files() y persistir el resultado como una Managed Table, aprovechando todas las capacidades de Delta Lake.

  • La estrategia consiste en dos pasos:

    • 📄 Crear una Vista que encapsule la lectura mediante read_files().

    • 🗄️ Utilizar CTAS para materializar esa consulta en una Managed Table.

De esta forma obtenemos una solución flexible para la lectura de archivos y, al mismo tiempo, dejamos que Databricks administre completamente la nueva tabla.

🐍 PySpark

El segundo enfoque utiliza PySpark, la API de DataFrames basada en Python y Apache Spark, y, a diferencia de SQL, PySpark ofrece una mayor flexibilidad para desarrollar procesos de transformación, permitiendo combinar la sencillez de Python con el procesamiento distribuido de Spark.

Resulta especialmente útil cuando:

  • 🐍 Preferimos trabajar con Python.

  • ⚙️ Necesitamos transformaciones más complejas.

  • 📊 Queremos aprovechar la API de DataFrames de Spark.

  • 🚀 Procesamos grandes volúmenes de información antes de escribirlos como Delta Tables.

🎯 Conclusión

Con estos dos enfoques se completa el recorrido por las principales formas de escribir información en Delta Lake desde archivos almacenados en Volúmenes. Más que aprender una única sintaxis, el objetivo es comprender cuándo conviene utilizar cada alternativa según el tipo de proyecto y el nivel de flexibilidad que necesitemos.

En el notebook del proyecto muestro la implementación paso a paso y ejemplos prácticos de cada una de estas estrategias (Repositorio-GitHub).

Comentarios


IngenieriaDatos.jpg

Tomar decisiones sin datos es como navegar en la oscuridad...

En la era digital, los datos son el activo más valioso de las empresas; su correcta recopilación, análisis y aplicación estratégica son clave para impulsar la toma de decisiones informada, la innovación y el éxito empresarial

  • GitHub
  • LinkedIn
  • Youtube

Copyrights © 2026 Brayan Neciosup Bolaños All rights reserved.

bottom of page