Big Data Architecture

Pipeline Distribuido de Big Data y Curación para LLMs (UNI PIT)

Pipeline distribuido y escalable con PySpark para preprocesamiento, tokenización, filtrado de calidad y deduplicación de grandes volúmenes de datos orientados al entrenamiento de modelos LLM (GPT, LLaMA). Aprobado con calificación perfecta de 20/20 en la UNI.

Pipeline Distribuido de Big Data y Curación para LLMs (UNI PIT)
Categorías
BIG-DATAAICLOUD
Stack Tecnológico
PySparkApache SparkSparkSQLCatalyst OptimizerParquetHugging FacePython

Caso de Estudio & Arquitectura

Arquitectura de Procesamiento Distribuido

  • Institución: Universidad Nacional de Ingeniería (UNI) — Programa de Iniciación Tecnológica (PIT).
  • Calificación: 20/20 (Nota Perfecta).
  • Características: Particionamiento optimizado, ejecución distribuida en clúster con SparkSQL Catalyst Optimizer y almacenamiento columnar Parquet.
  • Aplicación: Preparación y curación de datasets masivos para fine-tuning y pre-entrenamiento de Large Language Models.