Big Data Architecture
Pipeline Distribuido de Big Data y Curación para LLMs (UNI PIT)
Pipeline distribuido y escalable con PySpark para preprocesamiento, tokenización, filtrado de calidad y deduplicación de grandes volúmenes de datos orientados al entrenamiento de modelos LLM (GPT, LLaMA). Aprobado con calificación perfecta de 20/20 en la UNI.
Categorías
BIG-DATAAICLOUD
Stack Tecnológico
PySparkApache SparkSparkSQLCatalyst OptimizerParquetHugging FacePython
Caso de Estudio & Arquitectura
Arquitectura de Procesamiento Distribuido
- Institución: Universidad Nacional de Ingeniería (UNI) — Programa de Iniciación Tecnológica (PIT).
- Calificación: 20/20 (Nota Perfecta).
- Características: Particionamiento optimizado, ejecución distribuida en clúster con SparkSQL Catalyst Optimizer y almacenamiento columnar Parquet.
- Aplicación: Preparación y curación de datasets masivos para fine-tuning y pre-entrenamiento de Large Language Models.