Guía del track

Bolivia Data Track

Calidad del dato, no solo cantidad

¿De qué trata?

No se trata de cuántos datos tienes — se trata de qué problema resuelven y qué tan bien están trabajados. Bolivia tiene déficit real de datos curados, accesibles y útiles. Este track premia datasets trabajados, pipelines reproducibles y productos construidos sobre datos — todo deployado y consumible.

Cantidad ≠ calidad. Un dataset de 500 filas limpio, documentado y útil vale más que 500k filas crudas sin estructura.

¿Quién debería postular?

  • ·Data engineers y analistas que quieran pipelines reales
  • ·Investigadores con acceso a fuentes bolivianas o latinoamericanas
  • ·Equipos con scraping, APIs públicas o datos gubernamentales
  • ·Builders que quieran productos útiles a partir de datos como insumo central

Formas válidas de proyecto

  • Dataset curado y publicado — limpio, documentado, con metadata y pipeline reproducible
  • Arquitectura de procesamiento — pipeline ETL/ELT funcional con documentación
  • Producto sobre datos — app, dashboard, API o herramienta que consume un dataset curado
  • Datos sintéticos — generación documentada con validación de calidad
  • Sistema RAG o retrieval — consulta de datos estructurados en lenguaje natural

Entregables mínimos

  • Dataset publicado y accesible (HuggingFace, GitHub o equivalente)
  • Pipeline reproducible — alguien puede clonar el repo y reproducir sin ayuda
  • Documentación: fuentes, método, columnas, limitaciones y licencia
  • Visualización interactiva deployada (dashboard, mapa o gráfica)
  • Deploy en producción — no se acepta “corre en mi máquina”
  • Pitch de 4 min + 2 min Q&A

Lo que no se acepta

  • Datos crudos sin procesar — CSV descargado sin transformación
  • Datos que requieren software especial o licencias pagas para consumirlos
  • Dataset sin documentación de fuente
  • Datos sintéticos sin documentar el proceso de generación
  • Proyectos donde los datos son decorativos — aquí los datos son el producto

Criterios de evaluación

CriterioPesoDescripción
Claridad del problema y caso de uso20%¿Qué problema de datos resuelve? ¿Por qué no existían o no eran accesibles?
Nivel de ejecución técnica25%¿El pipeline corre? ¿Es reproducible? ¿La arquitectura tiene sentido?
Calidad del dato y rigor metodológico20%Estructura, metadata, diversidad, validación y documentación de fuente.
Demo y visualización15%¿Se puede explorar el dataset? ¿La visualización comunica algo útil? ¿Está deployado?
Potencial real y originalidad20%¿Genera impacto real? ¿Alguien más podría usarlos después del hackathon?

La rúbrica general del Buildathon aplica; en este track el criterio de datos/IA se adapta como se indica arriba.

Herramientas recomendadas

Cursor

Escribir y refactorizar el pipeline con asistencia de IA

Exa

Búsqueda semántica sobre fuentes web estructuradas

Firecrawl

Scraping estructurado de fuentes bolivianas para construir datasets

HuggingFace Datasets

Publicar y hostear el dataset final

Vercel / FastAPI

Deploy de API o producto construido sobre los datos

Créditos de sponsors se comparten durante el evento. Ver Créditos.

Inspiración (no son requisitos)

Dataset agrícola boliviano

Producción por municipio desde INE y SEDAG, pipeline de limpieza y dashboard deployado.

Base de incendios en Bolivia

NASA FIRMS + SENAMHI cruzados por zona, API pública y mapa interactivo.

Corpus de texto boliviano

Scraping de medios locales, limpieza, etiquetado temático y búsqueda semántica.

Dataset de licitaciones públicas

Datos del SICOES normalizados con extracción de entidades y dashboard de patrones.

Proyectos de bajo valor diferencial

  • ·Descargar un dataset de Kaggle y poner un modelo encima
  • ·Scraping que devuelve HTML sin procesar
  • ·“Tenemos 2 millones de filas” sin mostrar qué las hace útiles

La diferencia entre un proyecto genérico y uno de alto valor casi siempre está en: datos locales + problema que el mercado boliviano enfrenta hoy y nadie resolvió bien.

Preguntas frecuentes

¿Puedo usar datasets públicos existentes?

Sí, si citás la fuente y documentás qué aporte nuevo hacés: limpieza, enriquecimiento, cruces o columnas derivadas.

¿Los datos sintéticos cuentan?

Sí, especialmente cuando los datos reales no existen. Documentá el método, validación y limitaciones.

¿Qué licencia debo usar?

Dataset: CC BY 4.0 si es original. Código del pipeline: MIT. Siempre declará licencia y fuentes en el README.

¿Calidad o cantidad?

Calidad siempre. Un dataset de 1.000 filas perfectamente curado puede ganar a un millón sin estructura.

Reglas y entrega

  • · Deadline de entrega: 26 de julio, 08:30 — sin extensiones.
  • · Un equipo elige un track principal al kick-off. La elección es final.
  • · Reglas completas en Reglas oficiales.