Terug naar InspiratieData

    RAG op bedrijfsdata: wanneer embedden en wanneer gewoon queryen

    8 september 20269 min lezen
    RAG op bedrijfsdata: wanneer embedden en wanneer gewoon queryen

    De meest gemaakte fout in AI-dataprojecten is alles embedden. Vector search is voor ongestructureerde taal. Bedrijfsrecords zijn gestructureerd, en die query je in plaats van ze op gelijkenis op te halen.

    Trek de grens

    Velden als registratienummer, status, sectorcode, groottecategorie, oprichtingsdatum en adres horen in een relationele store met filters en aggregaties. Similarity search op een groottecategorie geeft vrolijk de verkeerde categorie terug.

    Beschrijvingen, nieuwsartikelen, deponeringsteksten en reviews zijn taal. Dat zijn de juiste kandidaten voor embeddings.

    Een hybride patroon

    Filter eerst in SQL — land, sector, grootte, status — doe daarna vector search binnen die selectie en laat het model de top samenvatten met citaten. Antwoorden blijven juist omdat tellen en filteren nooit bij het model komen.

    Chunk per document, bewaar het bedrijfsidentifier in de metadata van elke chunk en geef dat identifier altijd terug, zodat elke bewering herleidbaar is.

    Evalueer op echte vragen

    Schrijf dertig vragen die je team echt stelt en beoordeel antwoorden op juistheid en citatie, niet op toon. Herhaal die set bij elke prompt- of modelwijziging.

    Let op numerieke vragen: 'hoeveel bedrijven in deze regio' hoort altijd door een query beantwoord te worden, nooit door een taalmodel dat chunks leest.

    Veelgestelde vragen

    Heb ik embeddings wel nodig voor bedrijfsdata?

    Alleen voor de taaldelen: beschrijvingen, nieuws, toelichtingen. Identiteit en firmografie zijn beter gediend met filters en exacte lookups.

    Hoe actueel moet de index zijn?

    Afhankelijk van de veranderlijkheid van het veld. Status en adres tellen binnen dagen; sectorcodes en oprichtingsdata veranderen bijna nooit.