¿Cuál es la diferencia entre datos estructurados, semi-estructurados y no estructurados?
Los datos estructurados tienen un schema fijo y viven en filas y columnas — una tabla de base de datos, un CSV. Los semi-estructurados llevan su schema consigo y varían fila a fila — JSON, XML, Avro. Los no estructurados no tienen schema en absoluto: texto, imágenes, audio. La distinción decide dónde se puede almacenar y cómo se consulta, por eso un pipeline usualmente convierte input semi-estructurado en algo columnar antes de que alguien lo analice.