Skip to content

data-infra · open-source · python

Data Curator

Librería open source (MIT) detrás del stack de datos de Kaxanuk: descarga, valida, homogeniza y combina datos de mercado y fundamentales multi-proveedor con tags basados en US GAAP y disciplina point-in-time.

https://github.com/alanvaa06/Data-Curator

Resumen

Data Curator es la librería open source que impulsa la infraestructura de datos de Kaxanuk — un desarrollo independiente de Alan, no la empresa en sí. Descarga, valida, homogeniza y combina datos de mercado y fundamentales de múltiples proveedores, exponiéndolos mediante una taxonomía de tags basada en US GAAP con disciplina point-in-time. Publicada bajo licencia MIT, corre como librería de Python, imagen Docker, o a través de un panel de parámetros en el navegador.

Qué hace

  • Nombres de tags homogenizados entre proveedores, basados en la taxonomía US GAAP — cambia de proveedor de datos sin modificar código.
  • Validación automática de datos de mercado y fundamentales — descarta datasets imposibles (ej. precio máximo por debajo del mínimo) y estados financieros modificados que rompen la disciplina point-in-time.
  • Funciones de features calculadas definidas por el usuario, sin necesidad de NumPy ni Pandas.
  • Salida a CSV, Parquet, o DataFrames de Pandas en memoria.
  • Arquitectura extensible: conecta tus propios proveedores de datos, combinaciones de features y manejadores de salida sobre interfaces estables.
  • Panel de parámetros basado en navegador para la configuración, más una imagen Docker para ejecuciones en contenedores.

Stack

Python 3.12-3.14 · pandas · Docker

Estado

Open source, licencia MIT.

GitHub →