Productdata wordt vaak door meerdere bronnen en mensen opgebouwd: leveranciersbestanden, handmatige invoer, imports en oudere systemen. Daardoor ontstaan dubbele velden, verschillende schrijfwijzen en ontbrekende waarden. De gevolgen ziet u terug in filters, varianten, zoekfuncties, marketplaces en het dagelijks beheer.

Opschonen is meer dan fouten corrigeren. U legt vast hoe goede data eruitziet en maakt die kwaliteit controleerbaar. De volgorde hieronder voorkomt dat u duizenden regels aanpast voordat duidelijk is wat het doelmodel moet zijn.

1. Maak eerst een veilige werkkopie

Werk nooit als eerste stap in het enige bronbestand of direct in de live catalogus. Exporteer de relevante records, bewaar het origineel ongewijzigd en voeg een versienummer en datum toe. Zorg dat ieder product een stabiele sleutel houdt, zoals SKU of intern product-ID.

Controleer vóór bewerking ook de tekencodering, getalnotatie, voorloopnullen en scheidingstekens. Een spreadsheet kan productcodes als getallen interpreteren of datums automatisch omzetten. Zulke stille wijzigingen zijn later lastig te herstellen.

2. Inventariseer velden en bronnen

Maak per kolom of eigenschap duidelijk:

  • wat het veld betekent;
  • welke bron leidend is;
  • of het verplicht, optioneel of verouderd is;
  • welk datatype en formaat wordt verwacht;
  • welke waarden zijn toegestaan;
  • of het veld wordt gebruikt voor filters, varianten, SEO of logistiek.

Velden met bijna dezelfde naam verdienen extra aandacht. “Lengte”, “productlengte” en “afmeting lang” kunnen hetzelfde betekenen, maar soms juist niet. Samenvoegen zonder inhoudelijke controle kan data verliezen.

3. Definieer een doelmodel

Een datadictionary beschrijft de nieuwe standaard. Noteer per veld de naam, definitie, voorbeeldwaarde, eenheid en validatieregel. Bijvoorbeeld: kleur gebruikt een vaste keuzelijst; gewicht wordt numeriek opgeslagen in gram; de zichtbare eenheid wordt pas op de website toegevoegd.

Maak onderscheid tussen bronwaarde en presentatiewaarde. “1000” kan de opgeslagen massa in gram zijn, terwijl de website “1 kg” toont. Als deze rollen door elkaar lopen, worden sorteren, filteren en exporteren onbetrouwbaar.

4. Normaliseer schrijfwijzen en eenheden

Maak een mappingtabel waarin oude waarden aan de nieuwe standaard worden gekoppeld. Voor kleur kan “antraciet”, “antr.” en “anthracite” naar één waarde gaan, zolang ze inhoudelijk echt gelijk zijn. Voor afmetingen moet u eerst naar één basiseenheid converteren.

Belangrijk: automatiseer alleen wat u inhoudelijk kunt bewijzen. Een lege waarde is niet hetzelfde als “niet van toepassing” en een onbekende maat mag niet uit een producttitel worden gegokt zonder betrouwbare regel.

5. Controleer categorieën en producttypen

Categorieën worden door de jaren heen vaak gebruikt als tijdelijke oplossing. Vergelijk broncategorieën met de gewenste navigatie en maak een expliciete mapping. Houd producttype en webshoppresentatie uit elkaar: één producttype kan in meerdere commerciële categorieën zichtbaar zijn, maar heeft nog steeds één consistente set kenmerken nodig.

Noteer uitzonderingen afzonderlijk. Een mapping “alles uit categorie A gaat naar B” is riskant wanneer de oude categorie ook accessoires of reserveonderdelen bevat.

6. Herstel variantrelaties

Bepaal welke kenmerken een variant vormen, zoals kleur of maat, en welke kenmerken het basismodel definiëren. Controleer of iedere variant een unieke sleutel heeft en naar het juiste hoofdproduct verwijst. Zorg dat variantwaarden op dezelfde manier geschreven zijn als filterwaarden.

Let op producten die alleen schijnbaar varianten zijn. Als uitvoering, toepassing en specificaties sterk verschillen, kan een eigen productpagina duidelijker zijn. Dit is niet alleen een datakeuze, maar ook een klantkeuze.

7. Werk met een representatieve proefset

Kies niet alleen de makkelijkste twintig regels. Neem eenvoudige producten, producten met varianten, records met ontbrekende informatie, uitzonderlijke waarden en verschillende leveranciers op. Pas alle voorgenomen regels op deze proefset toe en laat het resultaat inhoudelijk controleren.

Een goede proefset beantwoordt drie vragen: blijven identificerende sleutels intact, klopt de inhoud na omzetting en kan de webshop het bestand zonder ongewenste bijwerkingen verwerken?

8. Voeg validatieregels toe

Controleer minimaal op:

  • dubbele SKU’s of product-ID’s;
  • ontbrekende verplichte velden;
  • waarden buiten de toegestane lijst;
  • ongeldige eenheden en getalformaten;
  • varianten zonder hoofdproduct of dubbele variantcombinaties;
  • categorieën zonder mapping;
  • titels of teksten die leeg of onverwacht identiek zijn.

Leg niet alleen het aantal fouten vast, maar ook welke records zijn geraakt. Zo blijft herstel controleerbaar.

9. Importeer in stappen en controleer de voorkant

Na een geslaagde proef importeert u bij voorkeur in batches. Controleer per batch zowel het systeem als de zichtbare webshop: filters, varianten, producttitels, sortering, prijzen en afbeeldingen. Data kan technisch correct zijn en toch verkeerd worden gepresenteerd.

10. Voorkom dat vervuiling terugkomt

Maak de datadictionary onderdeel van de normale productinvoer. Gebruik keuzelijsten waar vrije tekst niet nodig is, wijs een eigenaar per veld aan en voer periodiek kwaliteitscontroles uit. Nieuwe leveranciersbestanden worden eerst gemapt naar uw standaard, niet rechtstreeks geïmporteerd.

Productdata opschonen is geslaagd wanneer niet alleen de huidige fouten zijn hersteld, maar ook duidelijk is hoe nieuwe data voortaan wordt beoordeeld en verwerkt.