In dit artikel10
RAG AI (retrieval augmented generation) is een techniek waarbij een taalmodel eerst relevante stukken uit jouw eigen documenten opzoekt en pas daarna een antwoord schrijft, op basis van die stukken. Zo krijg je antwoorden over je eigen offertes, handboeken, contracten of productinformatie, met een verwijzing naar de bron. Het model hoeft daarvoor niet opnieuw getraind te worden: je data blijft in je eigen opslag en wordt per vraag opgehaald.
In het kort:
- RAG koppelt een taalmodel aan je eigen kennisbank, zonder dat het model op jouw data getraind wordt.
- De kwaliteit hangt vooral af van je documenten en het zoekdeel, niet van het model.
- RAG verkleint hallucinaties, maar haalt ze niet weg: bronvermelding en een "weet ik niet"-optie zijn verplicht.
- Voor de meeste bedrijfsvragen is RAG goedkoper en beter controleerbaar dan fine-tuning.
Wat is RAG AI precies?
De term komt uit een onderzoekspaper van Facebook AI Research uit 2020: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks van Lewis en collega's. Het idee was simpel: een taalmodel weet alleen wat er in zijn trainingsdata zat. Wil je dat het antwoorden geeft over informatie die het niet kent, dan geef je die informatie op het moment van de vraag mee.
Een taalmodel als ChatGPT of Claude kent jouw prijslijst, je leveringsvoorwaarden of de installatiehandleiding van je product niet. Vraag je ernaar, dan krijg je een algemeen of verzonnen antwoord. Met RAG zoek je eerst de relevante passages op in je eigen bronnen en stop je die in de prompt. Het model schrijft dan een antwoord op basis van wat er in die passages staat.
Is ChatGPT zelf een RAG-model? Nee. ChatGPT is een taalmodel. Wel gebruikt ChatGPT RAG-achtige technieken als het op internet zoekt of als je bestanden uploadt. Het verschil met een eigen RAG-systeem: jij bepaalt welke bronnen erin zitten, wie wat mag zien en waar de data staat.
Hoe werkt RAG, stap voor stap
Een RAG-systeem heeft twee delen: het klaarzetten van je kennis (eenmalig en bij elke wijziging) en het beantwoorden van een vraag (elke keer).
Kennis klaarzetten:
- Bronnen verzamelen. PDF's, Word-bestanden, SharePoint, Google Drive, je helpdesk, je ERP-artikelinformatie.
- Opknippen. Documenten worden in stukken ("chunks") van een paar alinea's verdeeld, met metadata zoals documentnaam, datum en afdeling.
- Embedden. Elk stuk wordt omgezet in een reeks getallen (een vector) die de betekenis vastlegt. Stukken met vergelijkbare betekenis liggen dicht bij elkaar.
- Opslaan. De vectoren gaan in een vectordatabase of een database met vectorzoekfunctie.
Vraag beantwoorden:
- De vraag van de gebruiker wordt ook een vector.
- Het systeem zoekt de stukken die het dichtst bij de vraag liggen, vaak gecombineerd met klassiek zoeken op trefwoorden.
- De beste vijf tot twintig stukken gaan samen met de vraag en een instructie naar het taalmodel.
- Het model schrijft een antwoord en noemt de bronnen die het gebruikte.
Een voorbeeld uit de praktijk: een installatiebedrijf heeft honderden productbladen en storingshandleidingen. Een monteur vraagt via een interne chat: "Welke foutcode geeft een E4 op het binnendeel van type X en wat moet ik controleren?" Het systeem vindt de juiste pagina uit de handleiding, het model vat samen wat te doen en linkt naar de pagina. De monteur hoeft niet meer door een map met PDF's te bladeren.
Waarom RAG hallucinaties verkleint, maar niet oplost
Een taalmodel voorspelt tekst. Weet het iets niet, dan vult het soms een plausibel klinkend antwoord in. RAG helpt omdat het model de feiten krijgt aangereikt, maar er blijven drie foutbronnen:
- Het zoekdeel vindt de verkeerde stukken. Dan antwoordt het model netjes, maar op basis van de verkeerde bron. In onze ervaring zit hier het grootste deel van de fouten.
- De bron zelf klopt niet. Oude versies van een handleiding, twee tegenstrijdige prijslijsten, een half bijgewerkt beleidsdocument. RAG maakt rommel in je documenten zichtbaar.
- Het model combineert te vrij. Het vult een gat in met algemene kennis in plaats van te zeggen dat de bron er niets over zegt.
Wat werkt in productie:
- Laat het model altijd de gebruikte bronnen tonen, met link naar het originele document.
- Instrueer het expliciet om "dat staat niet in de beschikbare documenten" te zeggen als het antwoord ontbreekt, en test daarop.
- Bouw een testset van 50 tot 100 echte vragen met de juiste antwoorden, en draai die bij elke wijziging.
- Houd versies bij: verwijder verouderde documenten uit de index, in plaats van ze te laten staan.
Waarom AI-projecten vaak op dit soort punten stranden, lees je in waarom AI-projecten mislukken. Kort gezegd: zelden door het model, vaak door data en eigenaarschap.
RAG vs fine-tuning: wat kies je?
Een veelgestelde vraag is of je een model niet beter op je eigen data kunt trainen. Dat heet fine-tuning. Het zijn verschillende gereedschappen voor verschillende problemen.
| RAG | Fine-tuning | |
|---|---|---|
| Wat het doet | Haalt per vraag actuele informatie op | Past het gedrag of de stijl van het model aan |
| Geschikt voor | Feiten, documenten, prijzen, procedures | Vaste schrijfstijl, specifiek formaat, classificatie |
| Actualiteit | Direct: nieuw document, nieuw antwoord | Opnieuw trainen bij elke wijziging |
| Bronvermelding | Ja, per antwoord | Nee, kennis zit "in" het model |
| Toegangsrechten | Per gebruiker te filteren | Niet te scheiden: wat erin zit, zit erin |
| Kosten | Opslag plus tokens per vraag | Trainingsrun plus hosting van het eigen model |
Voor bijna elke bedrijfsvraag van het type "wat staat er in onze documenten over X" is RAG de juiste keuze. Fine-tuning heeft zin als je een model iets wilt leren doen, zoals facturen classificeren in je eigen grootboekstructuur, en je daar duizenden goede voorbeelden van hebt. Beide combineren kan, maar is zelden nodig: een goed RAG-systeem met een heldere instructie haalt voor de meeste bedrijven genoeg.
Is RAG nog nodig nu modellen 1 miljoen tokens aankunnen?
Claude Opus 5.5 en Sonnet 5 hebben een contextvenster van 1 miljoen tokens. Dat is honderden pagina's tekst. Kun je dan niet gewoon alles in de prompt stoppen? Voor een klein documentpakket soms wel. Maar voor een kennisbank met duizenden documenten niet, en ook als het past, betaal je bij elke vraag voor alle tokens. Daarnaast wil je dat een medewerker alleen antwoorden krijgt uit documenten die hij mag zien. RAG is dus niet achterhaald, wel verandert het: je haalt grotere stukken op en laat het model meer zelf bepalen wat het nodig heeft. Dat laatste is precies wat een AI agent doet, die zoeken als een van zijn tools gebruikt.
Wat kost een RAG-systeem?
Er zijn drie kostenposten: bouw, draaien en onderhoud.
Draaikosten per vraag. Die zijn laag. Stel dat een vraag met opgehaalde context 8.000 input tokens en 500 output tokens gebruikt. Met Claude Haiku 4.5 ($1 per miljoen input, $5 per miljoen output) kost dat ongeveer $0,01 per vraag. Met GPT-6 Luna ($0,10 / $0,50) is het een fractie daarvan. Met een zwaarder model als Claude Opus 5.5 ($4 / $20) kom je rond $0,04. Prijzen per september 2026. Bij 5.000 vragen per maand praat je dus over tientallen tot een paar honderd dollar aan modelkosten. Embedding en opslag komen daar bovenop, maar zijn meestal kleiner.
Bouwkosten. Die hangen af van het aantal bronnen, de koppelingen en de eisen aan rechten. Een interne kennisassistent op één documentbron is een ander project dan een klantgerichte assistent die ook orderstatus uit je ERP haalt. Het grootste deel van het werk zit niet in het model, maar in het ophalen en opschonen van bronnen, rechten en de testset.
Onderhoud. Documenten veranderen, bronnen worden verplaatst, modellen krijgen nieuwe versies. Reken op periodiek werk aan de index en de tests.
Privacy en AVG: waar staat je data?
RAG stuurt stukken van je documenten naar een taalmodel. Zitten daar persoonsgegevens in, dan valt dat onder de AVG. Een paar harde punten:
- Zakelijke API's trainen standaard niet op je data. OpenAI zegt dat het API-platform en ChatGPT Business en Enterprise standaard niet voor training worden gebruikt. Anthropic zegt hetzelfde voor zakelijke Claude-plannen.
- Datalocatie verschilt per aanbieder. OpenAI biedt Europese data residency voor Enterprise, Edu en de API. De eigen API van Anthropic biedt als inferentielocatie alleen "global" of "us", geen EU-optie. Wil je strikt binnen de EU blijven, dan moet je dat bij de keuze van model en route meenemen.
- Onbedoeld delen is een datalek. De Autoriteit Persoonsgegevens waarschuwt dat medewerkers die tegen de afspraken in persoonsgegevens in een AI-chatbot zetten een meldplichtig datalek kunnen veroorzaken. Een eigen RAG-systeem met duidelijke afspraken is juist een manier om dat te voorkomen.
- Toegangsrechten horen in het zoekdeel. Filter bij het ophalen al op wie wat mag zien. Laat het model niet zelf beslissen of iemand een HR-document mag lezen.
Meer over zakelijk gebruik van ChatGPT en de AVG lees je in ChatGPT, AVG en privacy.
Waar RAG goed werkt, en waar niet
Goede toepassingen:
- Interne kennisassistent voor procedures, handboeken en beleid.
- Klantenservice-concepten: het systeem stelt een antwoord op uit je kennisbank, een medewerker controleert en verstuurt. Zie ook AI in de klantenservice.
- Offertes en aanbestedingen: eerdere offertes en productspecificaties opzoeken voor een nieuw voorstel.
- Technische documentatie voor monteurs en supportmedewerkers.
Minder geschikt:
- Rekenen en tellen over veel data. "Hoeveel omzet hadden we in Q2 met klant X?" is een databasevraag, geen documentvraag. Daarvoor laat je een agent een query uitvoeren op je ERP of boekhouding.
- Vragen waarvoor de informatie nergens staat. RAG kan geen kennis uit het hoofd van je beste medewerker halen.
- Beslissingen met grote gevolgen zonder controle. RAG levert een onderbouwd concept, geen besluit.
Veelgestelde vragen
Wat is RAG in AI?
RAG staat voor retrieval augmented generation. Een taalmodel zoekt eerst relevante informatie op in een vastgestelde verzameling documenten en gebruikt die om zijn antwoord te schrijven. Zo kan het antwoorden geven over informatie die niet in zijn training zat, zoals je eigen bedrijfsdocumenten, met bronvermelding.
Wat is het verschil tussen een LLM en RAG?
Een LLM (large language model) is het taalmodel zelf, zoals GPT-6 of Claude. RAG is een architectuur rond dat model: een zoekstap die de juiste context ophaalt en meegeeft. Het LLM schrijft het antwoord, RAG zorgt dat het de juiste informatie heeft.
Is RAG aan het verdwijnen door grotere contextvensters?
Nee. Grotere contextvensters maken RAG flexibeler, omdat je grotere stukken kunt meegeven. Maar voor duizenden documenten, per-gebruiker rechten en beheersbare kosten per vraag blijft ophalen van de juiste stukken nodig.
Wordt mijn data gebruikt om het model te trainen?
Bij de zakelijke API's van OpenAI en Anthropic niet standaard, volgens hun eigen voorwaarden. Let wel op de datalocatie en leg afspraken vast in een verwerkersovereenkomst. Consumentenaccounts hebben andere voorwaarden en zijn niet geschikt voor bedrijfsdata.
Hoe snel heb je een werkend RAG-systeem?
Een eerste werkende versie op één bron kan binnen enkele weken staan. De meeste tijd gaat zitten in het opschonen van documenten, koppelen van bronnen, rechten en het testen met echte vragen. Een productiewaardig systeem met meerdere bronnen en koppelingen past in een MVP-traject van 4 tot 8 weken.
Zo pak je het aan
Begin met één afgebakende vraag: welke informatie zoeken medewerkers of klanten het vaakst op, en waar staat die? Verzamel 50 echte vragen en de documenten waar het antwoord in staat. Daarmee weet je binnen korte tijd of RAG hier werkt, en wat er aan je documenten moet gebeuren.
Wil je weten welke kennisbronnen in jouw bedrijf zich hiervoor lenen? Doe de gratis AI-scan of bekijk hoe we AI agents en kennissystemen bouwen, met de code en data in jouw eigendom.
Bronnen
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (arXiv, 22 mei 2020)
- Models overview, Claude Platform Docs (geraadpleegd 26 september 2026)
- Introducing Claude Opus 5.5, Anthropic (22 september 2026)
- Introducing GPT-6 Sol and Luna, OpenAI (22 september 2026)
- Data residency, Claude Platform Docs (geraadpleegd 26 september 2026)
- Business data privacy, security, and compliance, OpenAI (geraadpleegd 26 september 2026)
- Let op: gebruik AI-chatbot kan leiden tot datalekken, Autoriteit Persoonsgegevens (6 augustus 2024)

Bouwt bij Airflows AI agents, automatiseringen en maatwerk software voor Nederlandse bedrijven.



