De meest gemaakte fout in AI-dataprojecten is alles embedden. Vector search is voor ongestructureerde taal. Bedrijfsrecords zijn gestructureerd, en die query je in plaats van ze op gelijkenis op te halen.
Trek de grens
Velden als registratienummer, status, sectorcode, groottecategorie, oprichtingsdatum en adres horen in een relationele store met filters en aggregaties. Similarity search op een groottecategorie geeft vrolijk de verkeerde categorie terug.
Beschrijvingen, nieuwsartikelen, deponeringsteksten en reviews zijn taal. Dat zijn de juiste kandidaten voor embeddings.
Een hybride patroon
Filter eerst in SQL — land, sector, grootte, status — doe daarna vector search binnen die selectie en laat het model de top samenvatten met citaten. Antwoorden blijven juist omdat tellen en filteren nooit bij het model komen.
Chunk per document, bewaar het bedrijfsidentifier in de metadata van elke chunk en geef dat identifier altijd terug, zodat elke bewering herleidbaar is.
Evalueer op echte vragen
Schrijf dertig vragen die je team echt stelt en beoordeel antwoorden op juistheid en citatie, niet op toon. Herhaal die set bij elke prompt- of modelwijziging.
Let op numerieke vragen: 'hoeveel bedrijven in deze regio' hoort altijd door een query beantwoord te worden, nooit door een taalmodel dat chunks leest.
Veelgestelde vragen
Heb ik embeddings wel nodig voor bedrijfsdata?
Alleen voor de taaldelen: beschrijvingen, nieuws, toelichtingen. Identiteit en firmografie zijn beter gediend met filters en exacte lookups.
Hoe actueel moet de index zijn?
Afhankelijk van de veranderlijkheid van het veld. Status en adres tellen binnen dagen; sectorcodes en oprichtingsdata veranderen bijna nooit.




