Un Data Lake es un repositorio que almacena grandes volúmenes de datos en su formato original, sin necesidad de estructurarlos de antemano. Admite datos estructurados, semiestructurados y no estructurados: tablas, ficheros de registro, documentos, imágenes o datos de sensores.
En qué se diferencia de un Data Warehouse
La diferencia está en cuándo se ordena la información. Un Data Warehouse estructura los datos antes de guardarlos, con un modelo definido y orientado al análisis. Un Data Lake los guarda tal como llegan y aplica la estructura en el momento de consultarlos.
- Data Warehouse: datos ya depurados y modelados. Pensado para informes y cuadros de mando.
- Data Lake: datos en bruto y de cualquier tipo. Pensado para exploración, ciencia de datos y modelos de aprendizaje automático.
Cuándo tiene sentido
Un Data Lake aporta valor cuando existen volúmenes elevados de datos heterogéneos y casos de uso analíticos que aún no están definidos. Para la mayoría de las empresas medianas, la necesidad real suele ser un Data Warehouse bien construido, no un Data Lake.
¿Un Data Lake sustituye al Data Warehouse?
No. Son complementarios y responden a preguntas distintas. Muchas organizaciones combinan ambos en una arquitectura de tipo lakehouse.
¿Qué riesgo tiene?
Sin gobierno del dato, un Data Lake se convierte en un almacén donde nadie sabe qué hay ni si es fiable.

