Dataset agrícola boliviano
Producción por municipio desde INE y SEDAG, pipeline de limpieza y dashboard deployado.
Guía del track
Calidad del dato, no solo cantidad
No se trata de cuántos datos tienes — se trata de qué problema resuelven y qué tan bien están trabajados. Bolivia tiene déficit real de datos curados, accesibles y útiles. Este track premia datasets trabajados, pipelines reproducibles y productos construidos sobre datos — todo deployado y consumible.
Cantidad ≠ calidad. Un dataset de 500 filas limpio, documentado y útil vale más que 500k filas crudas sin estructura.
| Criterio | Peso | Descripción |
|---|---|---|
| Claridad del problema y caso de uso | 20% | ¿Qué problema de datos resuelve? ¿Por qué no existían o no eran accesibles? |
| Nivel de ejecución técnica | 25% | ¿El pipeline corre? ¿Es reproducible? ¿La arquitectura tiene sentido? |
| Calidad del dato y rigor metodológico | 20% | Estructura, metadata, diversidad, validación y documentación de fuente. |
| Demo y visualización | 15% | ¿Se puede explorar el dataset? ¿La visualización comunica algo útil? ¿Está deployado? |
| Potencial real y originalidad | 20% | ¿Genera impacto real? ¿Alguien más podría usarlos después del hackathon? |
La rúbrica general del Buildathon aplica; en este track el criterio de datos/IA se adapta como se indica arriba.
Cursor
Escribir y refactorizar el pipeline con asistencia de IA
Exa
Búsqueda semántica sobre fuentes web estructuradas
Firecrawl
Scraping estructurado de fuentes bolivianas para construir datasets
HuggingFace Datasets
Publicar y hostear el dataset final
Vercel / FastAPI
Deploy de API o producto construido sobre los datos
Créditos de sponsors se comparten durante el evento. Ver Créditos.
Producción por municipio desde INE y SEDAG, pipeline de limpieza y dashboard deployado.
NASA FIRMS + SENAMHI cruzados por zona, API pública y mapa interactivo.
Scraping de medios locales, limpieza, etiquetado temático y búsqueda semántica.
Datos del SICOES normalizados con extracción de entidades y dashboard de patrones.
La diferencia entre un proyecto genérico y uno de alto valor casi siempre está en: datos locales + problema que el mercado boliviano enfrenta hoy y nadie resolvió bien.
¿Puedo usar datasets públicos existentes?
Sí, si citás la fuente y documentás qué aporte nuevo hacés: limpieza, enriquecimiento, cruces o columnas derivadas.
¿Los datos sintéticos cuentan?
Sí, especialmente cuando los datos reales no existen. Documentá el método, validación y limitaciones.
¿Qué licencia debo usar?
Dataset: CC BY 4.0 si es original. Código del pipeline: MIT. Siempre declará licencia y fuentes en el README.
¿Calidad o cantidad?
Calidad siempre. Un dataset de 1.000 filas perfectamente curado puede ganar a un millón sin estructura.