Este stack tecnológico se enfoca en el análisis, procesamiento y visualización de datos utilizando Google Cloud Services, Python y un conjunto de librerías especializadas. A continuación, se describen los componentes del stack y sus funciones dentro de un flujo de trabajo típico.
- Google Cloud Platform (GCP):
- Cloud Storage: Almacenamiento centralizado de datos en crudo, transformados y generados por los modelos de Machine Learning.
- BigQuery: Plataforma de almacenamiento y procesamiento de datos escalable para consultas analíticas sobre grandes volúmenes de información.
- Vertex AI: Desarrollo, entrenamiento e implementación de modelos de Machine Learning.
- Google Functions: Automatización de tareas en la nube mediante funciones serverless para procesamiento de datos.
-
Pandas:
- Función: Manipulación y análisis de datos en estructuras eficientes como DataFrames y Series.
- Uso Típico: Limpieza de datos, transformaciones y agregaciones.
-
BigQuery-Python SDK:
- Función: Interacción con BigQuery desde Python para consulta y procesamiento de datos.
- Uso Típico: Extracción y carga de datos, integración con flujos ETL.
-
Dask:
- Función: Procesamiento paralelo y distribuido para datos que no caben en memoria.
- Uso Típico: Escalado de operaciones en datasets de gran volumen.
-
Datetime:
- Función: Manejo de fechas y horas.
- Uso Típico: Análisis de series temporales.
-
Power BI:
- Función: Creación de dashboards interactivos con datos ingeridos desde Google Cloud.
- Uso Típico: Análisis y presentación de resultados de negocio.
-
Matplotlib y Seaborn:
- Función: Generación de visualizaciones estáticas y análisis exploratorio.
- Uso Típico: Exploración inicial de datos y validación de patrones.
-
BigQuery y Cloud Storage:
- Función: Almacenamiento, consulta y procesamiento de datos estructurados y no estructurados.
- Uso Típico: Consolidación de datos para su posterior análisis.
-
Google Functions:
- Función: Automatización de ingesta y procesamiento de datos.
- Uso Típico: ETL serverless para integración de datos en la nube.
-
Vertex AI:
- Función: Entrenamiento y despliegue de modelos de ML en la nube.
- Uso Típico: Análisis de sentimientos, predicción de tendencias y sistemas de recomendación.
-
NLTK:
- Función: Procesamiento de lenguaje natural para análisis de textos y opiniones.
- Uso Típico: Tokenización, lematización y análisis de sentimientos en datos textuales.
-
Streamlit:
- Función: Creación de aplicaciones web interactivas para visualización de modelos.
- Uso Típico: Interfaz para mostrar resultados de predicciones en tiempo real.
-
Google Cloud Logging y Monitoring:
- Función: Seguimiento y depuración de modelos y flujos de datos.
- Uso Típico: Análisis de rendimiento y ajuste de modelos.
-
Python:
Es el lenguaje principal del stack, ampliamente utilizado en ciencia de datos y análisis por su sintaxis sencilla y la gran cantidad de librerías disponibles. -
Dax Es el lenguaje de programacion que utiliza Power By, diseñado para la creación de medidas, columnas calculadas y tablas
- Infraestructura: Google Cloud Platform (Cloud Storage, BigQuery, Vertex AI, Google Functions)
- Procesamiento de Datos: Pandas, Dask, BigQuery SDK
- Visualización: Power BI, Matplotlib, Seaborn
- Machine Learning: Vertex AI, NLTK
- Despliegue: Streamlit
- Monitoreo: Google Cloud Logging y Monitoring
Este stack optimiza el flujo de trabajo en la nube, facilitando la escalabilidad y automatización del análisis de datos, con visualización e interactividad mediante Power BI y Streamlit.
