← Alle hoofdstukkenHoofdstuk 2 van 8

Robuuste prompts ontwerpen en testen

Je maakt prompts die niet alleen één mooi antwoord geven, maar over verschillende invoer betrouwbaar blijven.

Na dit hoofdstukJe kan een professionele promptarchitectuur bouwen, voorbeelden doelgericht inzetten en versies vergelijken met een kleine testset.
Je voortgang0 van 40 lessen
2.1

De anatomie van een professionele prompt

Combineer resultaat, context, output, grenzen en controle; gebruik alleen onderdelen die het risico of de bruikbaarheid veranderen.

Een professionele prompt is een overdracht van werk. Begin met het eindresultaat en voeg daarna de relevante context, gewenste uitvoervorm en noodzakelijke grenzen toe. Geef aan welke broninformatie leidend is en wat bij ontbrekende gegevens moet gebeuren.

Een rol kan perspectief of jargon sturen, maar bewijst geen deskundigheid. Gebruik daarom liever concrete beoordelingscriteria dan een indrukwekkende functietitel. Sluit belangrijke opdrachten af met een controle-instructie: laat ontbrekende informatie, niet-onderbouwde claims en afwijkingen van de opdracht afzonderlijk rapporteren.

  • Resultaat
  • Relevante context
  • Bruikbaar formaat
  • Echte grenzen
  • Controle achteraf
Zo kan je dit gebruiken

Een analyseprompt definieert besluit, bronnen, criteria en onzekerheden; hij vraagt niet alleen om 'diep na te denken'.

Probeer deze prompt
Resultaat: [resultaat]. Context en bronnen: [context]. Output: [vorm]. Grenzen: [grenzen]. Controleer vóór afronding: [criteria]. Markeer ontbrekende informatie en verzin geen bronfeiten.
Kennischeck

Je vergelijkt twee offertes. In één offerte ontbreekt de levertermijn. Welke promptaanvulling voorkomt dat een veronderstelling als offertegegeven verschijnt?

Jouw praktijkopdracht

Bouw een volledige prompt voor een fictieve taak. Schrap aantoonbaar overbodige tekst; behoud noodzakelijke grenzen en uitzonderingsregels, ook als je eerste tests hun belang nog niet tonen.

Bron bij deze les

OpenAI – Prompting
Taak, context, output en grenzen; keuze van werkvorm is afhankelijk van taak en beschikbaarheid.
Gecontroleerd: 2026-09-07

2.2

Voorbeelden gebruiken zonder blind kopiëren

Voorbeelden maken patroon en kwaliteitsniveau concreet, maar mogen foute of toevallige eigenschappen niet tot regel verheffen.

Met voorbeeldgestuurde instructie toon je invoer en gewenste uitvoer. Dit helpt vooral bij classificatie, vaste formats, tone of voice en uitzonderingen. Kies voorbeelden die samen de normale gevallen én belangrijke grenzen dekken.

Leg uit wat het model uit een voorbeeld moet overnemen: structuur, detailniveau, criterium of toon. Laat namen, feiten en toevallige formuleringen niet automatisch hergebruiken. Voeg minstens één afwijkend of onvolledig geval toe en definieer het juiste gedrag, bijvoorbeeld 'onvoldoende informatie' in plaats van een gok.

  • Representatieve voorbeelden
  • Gewenst kenmerk benoemen
  • Randgeval opnemen
  • Geen ongewenste feitkopie
Zo kan je dit gebruiken

Een e-mailclassificatie toont voorbeelden van een gewone vraag, een klacht, een dubbelzinnige vraag en een bericht buiten scope.

Probeer deze prompt
Volg bij deze opdracht de voorbeelden; gebruik daaruit hieronder uitsluitend [kenmerken]. Neem geen namen of feiten over. Classificeer de nieuwe invoer in [categorieën]. Als geen categorie past, antwoord BUITEN_SCOPE en motiveer kort. Voorbeelden: [voorbeelden].
Kennischeck

Voorbeelden leren ChatGPT vergaderacties in een tabel zetten. Alle voorbeeldacties hebben Noor als eigenaar; de nieuwe fictieve notities noemen Sam. Welke instructie bewaart wat herbruikbaar is?

Jouw praktijkopdracht

Maak drie voorbeelden en één randgeval voor een eigen classificatie- of formattaak.

2.3

Controleerbare tussenstappen vragen

Vraag om relevante bewijsstappen en beslisredenen, niet om een verborgen intern denkproces.

Voor professioneel werk wil je kunnen volgen waarop een uitkomst steunt. Vraag daarom om bronextracties, aannames, berekeningen, besliscriteria en een beknopte motivering. Zulke artefacten kun je controleren zonder te doen alsof een gegenereerde uitleg het werkelijke interne redeneerproces volledig onthult.

Kies tussenstappen die fouten lokaliseren. Bij een vergelijking zijn dat bijvoorbeeld criteria, bronwaarden, ontbrekende gegevens en scores. Bij een tekstcontrole zijn dat claims, bewijs en voorgestelde correcties. Een lange gedachtegang is geen bewijs; controleerbare gegevens en herhaalbare tests zijn dat wel.

  • Bronextractie
  • Aannames apart
  • Berekening of criterium
  • Beknopte motivering
  • Resterende onzekerheid
Zo kan je dit gebruiken

Vraag bij een leverancierskeuze niet om 'alle gedachten', maar om bronwaarden, gewichten, berekening en gevoeligheidsanalyse.

Probeer deze prompt
Analyseer [vraag]. Toon: 1) gebruikte bronfeiten, 2) noodzakelijke aannames, 3) toegepaste criteria of berekeningen, 4) beknopte reden voor de conclusie en 5) resterende onzekerheden. Verzin geen ontbrekende waarden.
Kennischeck

ChatGPT beveelt optie B aan in een gewogen vergelijking. Welk aanvullend materiaal helpt je controleren of B uit de afgesproken gegevens en gewichten volgt?

Jouw praktijkopdracht

Herschrijf één prompt zodat hij vijf controleerbare tussenproducten oplevert.

2.4

Een kleine maar sterke testset bouwen

Test normale gevallen, grenzen en mislukkingen vóór je een prompt hergebruikt.

Een prompt die één voorbeeld goed verwerkt is nog geen betrouwbare workflow. Maak een testset met representatieve invoer, een moeilijk geval, ontbrekende informatie, tegenstrijdige bronnen en eventueel een ongepaste instructie in bronmateriaal. Definieer per test vooraf wat minimaal goed gedrag is.

Gebruik voor deze oefeningen uitsluitend fictieve gegevens. Beoordeel zowel inhoud als veiligheid: volgt de output het schema, worden feiten niet verzonnen, blijft broninhoud ondergeschikt aan de opdracht en stopt de workflow waar dat moet? Bewaar mislukte voorbeelden als regressietest.

  • Normaal geval
  • Onvolledig geval
  • Tegenstrijdigheid
  • Buiten scope
  • Onbetrouwbare broninstructie

Begrippen in gewone taal

Testset
Een verzameling invoervoorbeelden met vooraf beschreven goed en fout gedrag.
Promptinjectie
Een instructie in opgehaalde inhoud die de AI probeert af te leiden van de echte opdracht. Behandel zulke inhoud als te beoordelen gegevens.
Regressietest
Een eerder gebruikte test opnieuw uitvoeren om te zien of iets dat werkte door een wijziging stukgaat.
Zo kan je dit gebruiken

Een samenvattingsprompt wordt getest met een normaal verslag, ontbrekende besluiten, conflicterende data en een document dat instructies aan de AI bevat.

Probeer deze prompt
Ontwerp zes tests voor [workflow]. Geef per test invoertype, verwacht gedrag, verboden gedrag en bewijscriterium. Gebruik fictieve data. Voeg één promptinjectie-achtig bronfragment toe.
Kennischeck

Een samenvattingsprompt is viermaal getest op volledige verslagen zonder conflicten. Je wilt nu toetsen hoe hij met strijdige afspraken omgaat. Welke toevoeging heeft een passende, vooraf controleerbare verwachting?

Jouw praktijkopdracht

Maak zes fictieve tests voor de studieclub uit het hoofdstukvoorbeeld, inclusief een onduidelijk bericht. Leg het verwachte label en de reden vooraf vast. Laat een collega één verwachting betwisten als dat kan. Solo: schrijf zelf het sterkste alternatief voor één dubbelzinnig geval en toets beide labels aan de afgesproken definities. Klaar: zes verwachtingen hebben bronsteun, een werkelijk ambigu geval wordt niet geforceerd en je vermeldt wie beoordeelde.

2.5

Promptversies eerlijk vergelijken

Wijzig één belangrijk element per ronde en vergelijk op vooraf vastgelegde criteria.

Vergelijk promptversies niet op gevoel of op één toevallig antwoord. Gebruik dezelfde testset en dezelfde beoordelingscriteria. Wijzig bij voorkeur één factor, zoals broninstructie, uitvoerschema of foutafhandeling. Zo weet je welke aanpassing waarschijnlijk het verschil maakte.

Registreer versienummer, wijziging, reden, tests en bekende beperking. Meet naast kwaliteit ook correctiewerk, consistentie en benodigde tijd. Een versie met een hoger gemiddeld cijfer kan toch ongeschikt zijn als ze één kritisch grensgeval fout behandelt.

Een testset waarmee je de prompt verbetert is oefenmateriaal voor de ontwerper geworden. Reserveer daarnaast enkele nieuwe gevallen voor een latere controle. Herhaal belangrijke tests waar mogelijk: een model kan bij dezelfde invoer verschillende antwoorden geven. Een kleine set toont concrete gebreken, geen bewezen algemeen betrouwbaarheidspercentage.

  • Zelfde testset
  • Eén hoofdwijziging
  • Criteria vóór test
  • Kritieke fouten apart
  • Versielog

Begrippen in gewone taal

Knock-outfout
Een vooraf bepaalde kritieke fout die een versie ongeschikt maakt, ook bij goede andere scores.
Zo kan je dit gebruiken

Vergelijk v1 zonder bronlabels met v1.1 met bronlabels; verander niet tegelijk ook toon, lengte en taakvolgorde.

Probeer deze prompt
Vergelijk prompt v1 en v2 op [testset]. Scoreer per test: instructietrouw, brongebruik, volledigheid, veiligheid en herstelwerk. Benoem kritieke fouten afzonderlijk; gebruik geen gemiddelde om een knock-outfout te verbergen.
Kennischeck

V2 verbetert vijf gewone tests maar verzint in een zesde test een deadline. Die fout is vooraf als kritiek aangemerkt; v1 liet de deadline terecht open. Welk wijzigingsbesluit past?

Jouw praktijkopdracht

Test twee promptversies op dezelfde vijf gevallen en schrijf een kort wijzigingsbesluit.

Bron bij deze les

OpenAI – Evaluation best practices
Taakgerichte testsets en menselijke beoordeling. De API-software is niet nodig voor deze cursus. De bron meldt afbouw van het Evals-platform: alleen-lezen vanaf 31 oktober 2026 en sluiting op 30 november 2026. Dat beëindigt de algemene testmethode niet; controleer de producttijdlijn vóór softwarekeuze.
Gecontroleerd: 2026-09-08

Uitgewerkt voorbeeld

Een kleine testset maakt een promptwijziging zichtbaar

Fictief oefenmateriaal; foutieve antwoorden zijn bewust gemaakt om te oefenen.

Alle berichten, labels en testresultaten zijn fictief. Je sorteert berichten voor een studieclub. Labels: INSCHRIJVING bij een expliciet verzoek deel te nemen, ANNULERING bij expliciet afmelden en ONDUIDELIJK wanneer geen van beide eenduidig geldt.

Invoer

Prompt v1: kies INSCHRIJVING of ANNULERING voor elk bericht. Vooraf vastgelegde tests: T1 “Ik meld me aan.” → INSCHRIJVING; T2 “Ik annuleer mijn deelname.” → ANNULERING; T3 “Wanneer begint het?” → ONDUIDELIJK; T4 “Misschien meld ik me aan, misschien niet.” → ONDUIDELIJK.

Eerste oefenantwoord

Fictieve v1-uitvoer: T1 INSCHRIJVING; T2 ANNULERING; T3 INSCHRIJVING; T4 INSCHRIJVING. T1 en T2 passen; T3 en T4 forceren een besluit. De testset en verwachte labels worden na deze waarneming niet aangepast.

Controle

Eén hoofdwijziging: voeg een expliciete onzekerheidsroute toe. Prompt v1.1: gebruik INSCHRIJVING of ANNULERING alleen bij een eenduidig verzoek; gebruik anders ONDUIDELIJK. Beoordeel de berichtinhoud, vul intenties niet in. Test alle vier dezelfde berichten opnieuw, ook de eerder geslaagde.

Verbeterde versie

Fictieve v1.1-uitvoer: T1 INSCHRIJVING; T2 ANNULERING; T3 ONDUIDELIJK; T4 ONDUIDELIJK. Voor deze vier gevallen stijgt het aantal juiste labels van 2 naar 4. Besluit: behoud v1.1 voor verder testen. Vier voorbeelden bewijzen nog geen betrouwbaarheid op andere formuleringen.

Probeer zelf

Voeg vóór uitvoering twee tests toe: één beleefd afmeldbericht en één bericht met zowel aanmelden als afmelden. Noteer het verwachte label.

Bekijk het voorbeeldantwoord

“Dank voor de uitnodiging, maar ik meld me af.” → ANNULERING. “Meld me aan, of nee, ik weet nog niet of ik afmeld.” → ONDUIDELIJK. Bewaar echte uitvoer apart van deze verwachte antwoorden en voer daarna de volledige set van zes opnieuw uit.

Hoofdstukopdracht

Breng alles samen

Bouw een prompt v1 en een testset met zes gevallen. Maak daarna een v1.1 met één gemotiveerde wijziging: herstel een waargenomen zwakte of scherp een nog onvoldoende geteste grens aan. Test dezelfde gevallen opnieuw en documenteer het resultaat, de regressiecontrole en de resterende beperking. Een aanscherping zonder waargenomen fout is geen bewezen kwaliteitswinst.

Maximaal 10.000 tekens per notitie.

Voortgang en notities worden alleen in deze browser en op dit apparaat bewaard. Gebruik hier geen gevoelige gegevens. Download regelmatig je notities. Deze cursus stelt geen automatische vervaldatum in. Je kunt de gegevens verwijderen via de sitegegevens van je browser; exporteer eerst wat je wilt bewaren. Browserinstellingen of opschoning kunnen gegevens eerder wissen. Deze lokale notities worden niet naar Finaudax verstuurd.