3.3.1 — Kwaliteit van de dataverzameling Regeling beoordelingskader voor de toetsen behorende tot leerling- en onderwijsvolgsystemen PO BES
Kwaliteit van de dataverzameling
Deze paragraaf beschrijft de kwaliteitseisen voor Fase 1 van de psychometrische verantwoording van een LVS-instrument van het type (III) en (IV), zijnde de kwaliteit van de dataverzameling in een pretestprocedure.
De kwaliteit van de normering van een LVS-instrument type (III) en (IV) en van de betrouwbaarheid van de beslissingen die op basis van de genormeerde scores worden genomen, hangt grotendeels af van de kwaliteit van de dataverzameling. Hierop zijn de normering en de betrouwbaarheidsgegevens gebaseerd. Daarom wordt de kwaliteit van de dataverzameling eerst behandeld.
De kwaliteit van de dataverzameling wordt beoordeeld volgens onderstaande kwaliteitseisen.
De dataverzameling kan plaatsvinden door nieuwe items aan te bieden aan scholen via een vrijwillige proeftoets, of door nieuwe items direct toe te voegen aan (de itembank van) het bestaande LVS-instrument. Wanneer, in dit tweede scenario, blijkt dat de nieuw geconstrueerde items naar behoren functioneren, kan de toetsaanbieder ervoor kiezen om deze direct mee te laten tellen. Voor een leerling mag het niet herkenbaar zijn of een vraag wel of niet meetelt.
Voor beide scenario’s geldt dat de toetsaanbieder er voor kan kiezen om (een deel van) de nieuwe items die worden gepretest eerst door het CvTE te laten beoordelen op de kwaliteitseisen voor inhoudsvaliditeit O.IV.2 en O.IV.3 uit paragraaf 2.3.2.
Voor een tussentijdse check dient de aanbieder te onderzoeken of er vaardigheidsverschillen zijn tussen de huidige steekproef van het instrument en de steekproef waarop het instrument oorspronkelijk is gebaseerd. Daarnaast moet de aanbieder aantonen dat er geen sprake is van differential item functioning (DIF) tussen de initiële afname en de huidige afname van het instrument. Als er geen vaardigheidsverschillen zijn en geen DIF is tussen de afnames, kan worden aangenomen dat de psychometrische kwaliteit van het instrument in de tussentijd niet is veranderd en dat het instrument aan de gestelde eisen voldoet. Indien er wel vaardigheidsverschillen worden gevonden en/of DIF is tussen de afnames, moet de aanbieder op basis van de onderstaande psychometrische eisen aantonen dat het instrument alsnog voldoet aan de gestelde eisen.
Code | Vragen | Mogelijke antwoorden
P.IV.1 | Is de steekproef van leerlingen groot genoeg voor het gekozen model en representatief voor de doelpopulatie? | ja/nee
P.IV.2 | Indien er sprake is van een onvolledig dataverzamelingsdesign: is het dataverzamelingsdesign adequaat? | ja/nee/n.v.t.
Toelichting P.IV.1:
De steekproef dient groot genoeg te zijn voor het schatten van de moeilijkheidsgraad, het discriminerend vermogen en de kwaliteit van de afleiders van de items. Voor het pretesten van nieuwe items in een proeftoets omgeving, volstaan zowel het gebruik van de klassieke toets theorie als de itemresponstheorie (1PLM of 2PLM).
Voor alle genoemde pretestmogelijkheden en toetsvormen geldt in ieder geval dat de steekproef representatief is voor de doelgroep (in voorkomend geval de landelijke populatie leerlingen). De steekproef dient beschreven te worden op basis van belangrijke deelpopulaties (bijvoorbeeld eilanden of leerjaren) en indien nodig te worden gestratificeerd/gewogen.
Bij de steekproef is in een steekproefkader een beschrijving gegeven van de procedure waarmee de steekproef tot stand is gekomen. Daarnaast zijn de omstandigheden waaronder de data verzameld zijn, vergelijkbaar met de omstandigheden waaronder de operationele toets wordt afgenomen. De steekproefgegevens over SBO en SO scholen worden buiten beschouwing gelaten en, indien van toepassing, aanvullend separaat gerapporteerd en verantwoord.
Bij het pretesten van nieuwe items in een proeftoets of in een operationele toets bij gebruik van KTT is een steekproefgrootte van minimaal 200 observaties van elk pretest item vereist. Voor het pretesten van nieuwe items in een proeftoets of in een operationele toets bij gebruik van een 1PL is een steekproefgrootte van minimaal 300 observaties van elk pretest item vereist bij gebruik van een 2PL model en minimaal 600 observaties.
Wanneer de LVS-instrumenten worden ontwikkeld voor een specifiek vaardigheidsschaal, dan geldt het minimumaantal observaties per pretest item voor die specifieke schaal.
Aanbieders mogen van de boven genoemde aantallen afwijken, mits dit gedegen en volledig wordt onderbouwd.
Toelichting P.IV.2:
Wanneer een LVS-instrument van het type (III) of (IV) of eventueel de itembank van het betreffende instrument uit afzonderlijke items bestaat, worden data vaak verzameld in een onvolledig verbonden design, waarbij niet alle leerlingen alle items maken. Men spreekt vaak van een boekjesdesign. Het staat de toetsaanbieder vrij om zelf een best passend dataverzamelingsdesign te kiezen, mits de keuze wordt onderbouwd.
Als gebruik wordt gemaakt van een verbonden design, dan dient deze te bestaan uit een overzicht of beschrijving van:
– het totaal aantal boekjes (‘booklets’);
– het aantal booklets per deelpopulatie óf het aantal beantwoorde items per kandidaat bij een adaptieve toets;
– het aantal items per domein én per niveau.
Verder gelden de volgende aanvullende eisen:
– Met het oog op de kalibratie moeten de boekjes voldoende verbonden zijn. Dat betekent dat er voldoende overlap in observaties tussen de verschillende items en boekjes moet zijn.
– Bij gebruik van een IRT model moet er voldoende evidentie voor de passing van dat IRT model worden gepresenteerd, zodat kan worden nagegaan of de dataverzameling adequaat is en of er aan de eisen van steekproefgrootten voor het schatten van (item)parameters is voldaan. De toetsaanbieder beschrijft hiertoe als volgt hoe de passing van het IRT model is geëvalueerd:
○ de aanbieder toont aan dat de itemparameters tussen verschillende afnamen of boekjes niet veranderen, en;
○ de aanbieder voert een DIF analyse (differential item functioning) op itemniveau uit op basis van belangrijke deelpopulaties (bijvoorbeeld eilanden of leerjaren), waarbij de itemparameterschattingen uit de verschillende boekjes in de pretest worden vergeleken. Wanneer er sprake is van DIF op itemniveau, dient de toetsaanbieder aan te tonen dat dit in overeenstemming is met de verwachting op basis van de relevante literatuur. De aanbieder wordt verzocht ook effectgroottes te vermelden.
○ De aanbieder vermeldt effectgroottes waarop de modelpassing is geëvalueerd berekend als het gemiddelde absolute verschil tussen de geobserveerde en verwachte proporties juiste antwoorden, gegeven het IRT-model. De aanbieder toont aan dat dit verschil op itemniveau ≤ 10%. De toetsaanbieder mag hier met de juiste motivering van afwijken.
○ de toetsaanbieder onderbouwt de modelpassing aan de hand van een grafische weergave van de modelfit en de geobserveerde scores van alle items.
– De aanbieder wordt verzocht om informatie over de scoreverdeling aan te leveren, zodat inzichtelijk is welke informatiewaarde (en omgekeerd de standard error) correspondeert met een klassieke betrouwbaarheidscoëfficiënt van 0,70.
– Andere kalibratiemethoden, zoals bijvoorbeeld kernel-equating van Von Davier en Holland (2004), zijn ook toegestaan, zolang de betrouwbaarheid analoog is aan de voor IRT geformuleerde eisen.
– Er is beargumenteerd op welke wijze er rekening is gehouden met vermoeidheids- en/of volgorde effecten.
– Wanneer de pretestdata zijn verzameld met een CAT of MST is het niet zinvol om het hele onvolledige design weer te geven, omdat iedere leerling dan in principe een unieke verzameling items maakt. Ook dan moet de aanbieder duidelijk verantwoorden op welke gegevens de linking en normering gebaseerd zijn.
- Regeling
- Regeling beoordelingskader voor de toetsen behorende tot leerling- en onderwijsvolgsystemen PO BES
- Soort
- ZBO-regeling
- Geldend vanaf
- 01-08-2025
- BWB-id
- BWBR0050938
- Versie
- 2025-08-01_0