Cómo eliminar filas duplicadas de un archivo CSV
Cómo encontrar y eliminar filas duplicadas en una exportación CSV correctamente: eligiendo las columnas de coincidencia adecuadas y decidiendo qué copia conservar.
Elimina filas duplicadas de un único CSV directamente en tu navegador sin subir el archivo, hasta 500 MB. Ese límite publicado se comprobó con cinco tipos distintos de archivo, tres veces cada uno, para verificar que los resultados fueran correctos (15 ejecuciones en total).
Esas 15 ejecuciones cubrieron cinco formas de archivo: datos típicos, muchos valores distintos en las columnas de coincidencia, valores de coincidencia largos, filas muy anchas y datos con muchos duplicados usando la opción de conservar el último. Cada forma se ejecutó tres veces y se comprobó que la salida fuera correcta. El caso más exigente de 500 MiB fue el que tenía muchos valores de coincidencia distintos: sus tres ejecuciones tardaron 43,1, 57,9 y 85,7 minutos y necesitaron aproximadamente 1,472 GiB de espacio temporal en tu propio equipo. Esa evidencia respalda el límite actual que muestra la herramienta, aunque este tipo de archivo puede tardar mucho y necesita suficiente espacio libre.
Las filas duplicadas se cuelan en las exportaciones CSV por motivos mundanos: un formulario enviado dos veces, un trabajo de sincronización ejecutado dos veces o una exportación de hoja de cálculo que incluyó el mismo registro desde dos sistemas de origen. Antes de poder confiar en un archivo para importarlo, necesitas eliminar los duplicados — correctamente, no solo las coincidencias exactas obvias.
Duplicados exactos frente a duplicados lógicos
Un duplicado exacto es una fila que coincide exactamente con otra en todos sus campos. Esos son fáciles de detectar. Un duplicado lógico es más complicado: dos filas que representan el mismo registro del mundo real pero difieren ligeramente, como el mismo cliente con dos números de teléfono distintos, o el mismo producto con una errata en el nombre.
Decidir qué cuenta como «el mismo registro» es una decisión de negocio, no técnica: depende de qué columna, o combinación de columnas, identifique de forma fiable una entidad única en tus datos.
Elegir las columnas de coincidencia
| Tipo de dato | Clave fuerte | Clave débil (evitar sola) |
|---|---|---|
| Clientes | correo electrónico | nombre de pila |
| Productos | SKU | nombre del producto |
| Empresas | dominio / NIF | nombre de la empresa |
Cuando ninguna columna es fiable por sí sola, coincide por una combinación — por ejemplo, nombre y fecha de nacimiento, o empresa y dirección de facturación. Coincidir con una combinación demasiado amplia produce falsos positivos; con una demasiado estrecha, falsos negativos.
Prueba tu regla de coincidencia con una muestra antes de ejecutarla sobre el archivo completo. Una clave demasiado laxa puede fusionar dos clientes distintos en uno; una clave demasiado estricta puede dejar duplicados reales sin detectar.
Qué cuenta como duplicado
La herramienta trata dos filas como duplicadas solo cuando cada columna clave seleccionada tiene el mismo valor recortado. Los espacios al inicio o al final de una celda clave se ignoran, así que dos filas que solo difieren en los espacios circundantes siguen siendo un duplicado. Las mayúsculas y la puntuación dentro de la celda no se normalizan — "Acme Corp" y "acme corp." son claves diferentes.
Cuando seleccionas más de una columna clave, dos filas solo coinciden cuando todas las columnas seleccionadas coinciden. El límite actual es 500 MB por archivo. El trabajo se queda en tu dispositivo — no se sube nada.
- 01
Sube un archivo CSV.
Elige el archivo con las filas duplicadas. No se sube nada: el archivo se lee y procesa en tu navegador.
- 02
Elige una o más columnas para la coincidencia de duplicados.
Selecciona las columnas que juntas identifican un registro único, como el correo electrónico solo, o la empresa y el nombre de contacto. Seleccionar la columna equivocada lanza un error de análisis en lugar de producir silenciosamente un resultado incorrecto.
- 03
Conserva la primera o la última aparición.
Conservar la primera mantiene la fila que apareció antes en el archivo. Conservar la última mantiene la entrada más reciente. Elige la que coincida con cómo está ordenado tu archivo y con qué copia contiene los datos en los que confías.
- 04
Revisa los grupos de duplicados y la vista previa limpia.
La herramienta muestra cuántos grupos de duplicados se encontraron y una vista previa del archivo limpio antes de descargarlo. Este es el momento para confirmar que la regla de clave coincidió realmente con lo que pretendías.
- 05
Descarga el archivo limpio o las filas eliminadas.
Se generan ambos archivos: uno con los duplicados eliminados y otro con todo lo que se filtró. El archivo de origen nunca se modifica.
¿Conservar la primera o la última?
Una vez agrupados los duplicados, necesitas una regla para decidir qué copia sobrevive.
- 01
Conservar la primera
Mantiene la fila que apareció antes — útil cuando el archivo está ordenado de más antiguo a más reciente y quieres el registro original.
- 02
Conservar la última
Mantiene la entrada más reciente — útil cuando las filas posteriores representan correcciones o actualizaciones.
- 03
Revisar manualmente
Si ninguna regla encaja, inspecciona los grupos de duplicados antes de decidir. Una regla automática puede descartar silenciosamente datos buenos.
Conserva siempre las filas eliminadas
Un proceso responsable de eliminación de duplicados no se limita a borrar filas: exporta lo que se eliminó junto con el archivo limpio, para que puedas revisar la decisión y recuperar una fila si la regla de coincidencia fue demasiado agresiva. El archivo de filas eliminadas usa el mismo orden de columnas y el mismo delimitador que el origen, así que puede abrirse o re fusionarse sin más trabajo. Si una fila se elimina por error, cópiala de vuelta desde ese archivo en lugar de volver a ejecutar la limpieza sobre un origen nuevo.
Si las filas duplicadas tienen valores distintos y necesitas decidir cuál conservar, consulta primero la guía para conservar la primera o la última aparición.
Eliminar duplicados CSVMira la transformación
Los registros repetidos se convierten en un archivo limpio y revisable.
Las filas repetidas se eliminan del archivo limpio y siguen siendo fáciles de revisar.
✓ El archivo limpio conserva una copia
¿Necesitas hacer esto ahora?
Eliminar duplicados CSVHerramientas relacionadas
Abre la herramienta de esta guía o explora otra relacionada.
- Limpiar y reparar archivos CSV sin subirlosRepara problemas comunes de CSV, incluidos delimitadores incorrectos, filas desiguales, líneas vacías, espacios en blanco, marcadores BOM y encabezados duplicados.
- Comparar archivos CSV online gratisCompara dos archivos CSV y revisa filas añadidas, eliminadas y modificadas directamente en tu navegador.
- Mapeador y renombrador de columnas CSVRenombra, reordena y elimina columnas CSV antes de importar datos a un CRM, tienda, base de datos o sistema de contabilidad, sin subir el archivo.