Este proyecto consiste en la implementación de un pipeline ETL de extremo a extremo utilizando Databricks y PySpark, bajo el paradigma de Arquitectura Medallion (Bronze → Silver → Gold), orientado al área de ventas de una empresa distribuidora de accesorios para celulares (protectores de pantalla, audífonos y accesorios complementarios).
El pipeline automatiza el flujo completo de datos desde la fuente hasta la visualización, optimizando los reportes de ventas para la toma de decisiones gerenciales.
| Herramienta | Uso |
|---|---|
| Databricks | Plataforma de ingeniería de datos y orquestación |
| PySpark | Transformación y procesamiento distribuido de datos |
| Databricks SQL / Power BI | Visualización y reportería para el área de ventas |
| Python | Scripts de automatización y validación de datos |
Fuentes de Datos
│
▼
┌─────────────┐
│ BRONZE │ ← Datos crudos sin transformación
│ (Raw Data) │ Ingesta desde archivos CSV / Excel / BD
└──────┬──────┘
│
▼
┌─────────────┐
│ SILVER │ ← Datos limpios y estandarizados
│ (Cleaned) │ Filtrado, deduplicación, tipado correcto
└──────┬──────┘
│
▼
┌─────────────┐
│ GOLD │ ← Datos agregados listos para reportes
│ (Business) │ KPIs, métricas de ventas, rankings
└──────┬──────┘
│
▼
Dashboard /
Reportes de Ventas
| Métrica | Antes | Después | Mejora |
|---|---|---|---|
| Tiempo de preparación del reporte | Manual | Automatizado | Automática |
| Consistencia de datos | Inconsistente | Validada y trazable | ✅ Confiable |
| Acceso a métricas históricas | Limitado | Histórico completo | ✅ Full history |


