Para el índice completo de documentación legible por agentes, consulta llms.txt.
← Volver a proyectos

2025-05-10

Desduplicación y análisis de calidad de datos de anunciantes multi-origen

Kit que limpia, normaliza y cruza los registros de anunciantes provenientes de múltiples fuentes para eliminar duplicados y advertir sobre inconsistencias.

DatosAutomatizaciónLLM

Impacto

Normalización, clustering y validación de CIF con agentes LLM.

Stack

PythonAzure Data FactoryDatabricksLangChainAzure OpenAI

Servicio relacionado

Automation Engineering

Automatización de workflows productivos, tooling batch, integraciones y sistemas operativos que reducen handoffs y trabajo manual.

Ver Automation Engineering

Alcance

Los datos de anunciantes llegaban desde CRM, pasarelas de pago y hojas de cálculo manuales, creando duplicados y errores en los identificadores fiscales.

Enfoque

  • Pipeline en Python que normaliza campos clave, corrige signos y empata registros combinando clustering y uniones probabilísticas.
  • Reportes de calidad en CSV/Excel mientras agentes LangChain consultan Azure OpenAI para validar CIF y completar direcciones faltantes.
  • La tabla limpia se publica en Azure SQL y los alertas llegan a dashboards de Databricks.

Impacto

Se consiguió una vista única y auditada del anunciante, se detectaron anomalías para finanzas y se automatizaron informes periódicos.

Proyectos

¿Necesitas un sistema así en tu equipo?

Ayudo a equipos a llevar agentes documentales, copilotos RAG, pipelines de visión artificial y automatizaciones operativas a producción sin quedarse en prototipos.