DataScrub

Perfilador de datos

Abre un archivo y obtén un informe de salud instantáneo — tipos de columna, valores faltantes, unicidad, valores atípicos y más.

Arrastra y suelta tu archivo aquí

o haz clic para buscar

CSVTSVExcelODSJSON

¿No tienes un archivo a mano?

¿Qué es un perfilador de datos?

Un perfilador de datos te da un informe de salud instantáneo sobre tu conjunto de datos. Inspecciona tipos de columna, porcentajes de valores faltantes, estadísticas de unicidad, detección de duplicados e identificación de valores atípicos. El perfilado es el primer paso en cualquier flujo de limpieza de datos porque te indica exactamente qué necesita corrección.

Por qué perfilar tus datos primero

No puedes arreglar lo que no puedes ver. Un perfilador revela problemas ocultos que corrompen silenciosamente tu análisis: columnas con un 30% de valores faltantes, texto mezclado en columnas numéricas, formatos de fecha que no se pueden analizar y filas duplicadas que nunca supiste que existían. Ejecutar el Perfilador de datos antes que cualquier otra herramienta ahorra tiempo y evita errores.

Cómo usar el perfilador de datos

  1. Abre tu archivo — arrastra y suelta o haz clic para buscar.
  2. Revisa la puntuación de calidad instantánea — te da una vista rápida de la salud general de los datos.
  3. Consulta las estadísticas por columna — ve tipos, completitud, unicidad y distribuciones.
  4. Identifica problemas — busca tipos mixtos, alta tasa de valores faltantes y valores atípicos.
  5. Salta a la herramienta adecuada — usa los hallazgos del Perfilador para elegir la mejor herramienta de limpieza.

Qué detecta el perfilador

  • Tipos de columna — número, texto, fecha, email, booleano o mixto.
  • Completitud — porcentaje de valores faltantes por columna.
  • Unicidad — cuántos valores distintos existen y con qué frecuencia se repiten.
  • Filas duplicadas — duplicados exactos detectados en todas las columnas.
  • Estadísticas numéricas — mín, máx, media y mediana para columnas numéricas.
  • Valores atípicos — valores fuera de 1.5x IQR marcados automáticamente.
  • Distribución de valores principales — los valores más comunes en cada columna.

Consejos para un mejor perfilado

  • Siempre perfila antes de limpiar — necesitas una línea base antes de hacer cambios.
  • Presta atención a las columnas de tipo "mixto" — casi siempre necesitan atención antes del análisis.
  • Comprueba la tendencia de la puntuación de calidad — si baja tras una transformación, algo salió mal.

Preguntas frecuentes

¿Qué significa la puntuación de calidad?

La puntuación de calidad es un número del 0 al 100 que resume la salud general de los datos. Tiene en cuenta la completitud (valores faltantes), la consistencia (tipos mixtos) y la unicidad (duplicados). Una puntuación superior a 80 es buena, de 50 a 80 es aceptable, e inferior a 50 necesita atención.

¿Cómo se detectan los valores atípicos?

Los valores atípicos se detectan mediante el método del Rango Intercuartílico (IQR). Se marcan los valores inferiores a Q1 menos 1.5 veces IQR o superiores a Q3 más 1.5 veces IQR. Este es un enfoque estadístico estándar que funciona bien para la mayoría de los conjuntos de datos.

¿Puedo perfilar archivos grandes?

Sí. DataScrub procesa todo en tu navegador, por lo que el tamaño del archivo está limitado por la memoria de tu dispositivo. Archivos con unos cientos de miles de filas suelen perfilarse sin problemas en hardware moderno.

¿Qué significa el tipo "mixto"?

Una columna se etiqueta como mixta cuando contiene valores de diferentes tipos — por ejemplo, números y texto en la misma columna. Esto suele indicar un problema de entrada de datos o formato inconsistente que debe resolverse antes del análisis.