3.3.5 — Volgaspect Regeling beoordelingskader voor de toetsen behorende tot leerling- en onderwijsvolgsystemen PO BES
Volgaspect
Deze paragraaf beschrijft de kwaliteitseisen voor Fase 5 van de psychometrische verantwoording van een LVS-instrument van het type (III) en (IV), zijnde de kwaliteit van het volgaspect of de signaleringsfunctie.
Om leervorderingen te kunnen meten, moeten de scores van de leerling op een schaal te plaatsen zijn die de ontwikkeling van leerlingen zichtbaar maakt. Dit leidt voor LVS-instrumenten van het type (III) of (IV) tot drie criteria met betrekking tot de schaal waarop groei wordt uitgedrukt: (1) de opbouw van de schaal, (2) de betrouwbaarheid van de metingen, en (3) het gebruik van de schaal.
Code | Vragen | Mogelijke antwoorden
P.VIII.1 | Is er een voldoende empirische onderbouwing van de schaal waarop de groei van een leerling wordt uitgedrukt? Wordt groei op een adequate manier gemeten? | ja/nee
P.VIII.2 | Wordt de groei van een leerling nauwkeurig en betrouwbaar gemeten? | ja/nee
P.VIII.3 | Worden er gegevens verstrekt over hoe groei geïnterpreteerd dient te worden? | ja/nee
Toelichting P.VIII.1:
Er dient duidelijk invulling te worden gegeven aan het begrip ‘volgsysteem’. Het betreft een systeem met onderliggende data waarmee de ontwikkeling van de leerling kan worden gevolgd over de tijd heen en waarmee kan worden geïnterpreteerd in hoeverre deze ontwikkeling in lijn is met de leerdoelen van de verschillende leerjaren en/of met de ontwikkeling van de andere leerlingen uit hetzelfde leerjaar. Het volgsysteem moet hierom bestaan uit werkelijke gegevens om scores van verschillende afnames met elkaar te kunnen vergelijken en/of om duiding te kunnen geven in termen van bijvoorbeeld groei. Tevens dienen er duidelijke handvatten voor testgebruikers te komen hoe zij de toetsresultaten kunnen gebruiken als volgsysteem. Bij het gebruik van bijvoorbeeld IRT modellen wordt de vergelijkbaarheid al iets makkelijker (uitgaande van een juiste linking tussen alle items/toetsversies). Omdat veel docenten en ouders niet weten hoe IRT werkt en hoe dit moet worden toegepast, moeten de toetsaanbieders uitleggen hoe zij de resultaten moeten lezen en interpreteren.
Alle overwegingen over steekproeftrekking, betrouwbaarheid en normering gelden eveneens voor een reeks van twee of meer opeenvolgende meetmomenten. Dus beide steekproeven moeten representatief zijn en het design, dat in dit geval bijna per definitie onvolledig is, moet adequaat zijn in de termen die hierboven zijn gedefinieerd.
Verder moet er empirische informatie zijn over de schaalbaarheid van opeenvolgende meetmomenten. Het hoeft niet het geval te zijn dat de schaal strikt uni-dimensioneel is in de zin van een uni-dimensioneel IRT model (hoewel dit wel de meest voor de hand liggende schaal is). Wel dient er in ieder geval betekenisvolle informatie gegeven te worden over de samenhang tussen de twee (of meer) meetmomenten. Essentieel is dat de aanbieder de schaal waarop de groei wordt weergegeven grondig en compleet onderbouwt.
De aanbieder dient ook aan te geven of het instrument deel uitmaakt van een overkoepelend LVS (bijvoorbeeld, als alleen de toetsen voor groepen 3 tot en met 5 zijn ingediend voor een leerlingvolgsysteem dat bedoeld is voor groepen 3 tot en met 8). Als dit het geval is, dient de aanbieder duidelijk en volledig te onderbouwen hoe de schalen van de verschillende toetsen binnenhet overkoepelend LVS aan elkaar zijn gekoppeld.
Toelichting P.VIII.2:
Voor een LVS-instrument van het type (III) of (IV) is het van belang om een indicatie van de betrouwbaarheid van die gevolgtrekking weer te geven.
Hiervoor is het belangrijk om te bepalen of de focus ligt op individuele verandering of op verschillen tussen personen op groepsniveau.
3 Zie bijvoorbeeld: Gu, Z., Emons, W.H.M. & Sijtsma, K. (2018). Review of Issues About Classical Change Scores: A Multilevel Modeling Perspective on Some Enduring Beliefs. Psychometrika 83, 674–695. https://doi.org/10.1007/s11336-018-9611-3
Wanneer het instrument bedoeld is voor het nemen van beslissingen op individueel niveau, dient de aanbieder de meetprecisie van de verschillende meetmomenten in kaart te brengen en de betrouwbaarheid van de verschilscores (reliable change index
4 Zie bijvoorbeeld: Gu, Z., Emons, W.H.M. & Sijtsma, K. (2018). Review of Issues About Classical Change Scores: A Multilevel Modeling Perspective on Some Enduring Beliefs. Psychometrika 83, 674–695. https://doi.org/10.1007/s11336-018-9611-3
en
5 Zie bijvoorbeeld: Jacobson, N.S., & Truax, P. (1991) Clinical significance: A statistical approach to defining
meaningful change in psychotherapy research. Journal of Consulting and Clinical
Psychology, 59, 12-19. https://psycnet.apa.org/record/1992-97624-042
te berekenen en de gekozen methode te onderbouwen. Als het instrument wordt gebruikt om de groei van leerlingen relatief te positioneren, bijvoorbeeld ten opzichte van een gemiddelde groeiscore, moet de aanbieder ook de betrouwbaarheid van de groeimetingen berekenen en deze zorgvuldig onderbouwen.
6 Zie bijvoorbeeld: Trafimow, D. (2015) A defense against the alleged unreliability of difference scores, Cogent Mathematics, 2:1, 1064626, DOI: 10.1080/23311835.2015.1064626
Bij gebruik van percentielscores moet de betrouwbaarheid van de verandering van de percentielscores geschat zijn. Binnen de CTT-methodologie zijn percentielscores gebaseerd op een somscore die een meetfout bevat. Het verschil in percentielscores kan vertaald worden in het verschil in onderliggende scores en hun betrouwbaarheid. Bij IRT zijn de percentielscores gebaseerd op vaardigheidsscores die geschat zijn met een zekere mate van betrouwbaarheid.
7 Zie bijvoorbeeld: May, K., & Nicewander, W. A. (1994). Reliability and information functions for percentile ranks. Journal of Educational Measurement, 31(4), 313-325.
Omdat de transformatie van ruwe scores of theta scores naar percentielscores niet lineair is, kan dit wel resulteren in een zekere bias
8 Zie bijvoorbeeld: Rogosa, D. R. (2000). Accuracy of individual scores expressed in percentile ranks: Classical test theory calculations. Center for the Study of Evaluation, National Center for Research on Evaluation, Standards, and Student Testing, Graduate School of Education & Information Studies, University of California, Los Angeles.
.
Toelichting P.VIII.3:
De handleiding moet een beschrijving bevatten van hoe de gebruiker (zoals docenten en ouders) de gegevens met betrekking tot de groei (en/of stagnatie) van een leerling inhoudelijk en/of relatief ten opzichte van een referentiepopulatie dient te interpreteren. De geschreven toelichting moet consistent zijn met de resultaten uit het betrouwbaarheids-, validiteits- en normeringsonderzoek, dat wil zeggen dat de gebruiker een goed beeld moet krijgen van de (relatieve) onderwijskundige waarde en meetpretentie van de resultaten en de meetpretentie van het instrument als geheel.
- Regeling
- Regeling beoordelingskader voor de toetsen behorende tot leerling- en onderwijsvolgsystemen PO BES
- Soort
- ZBO-regeling
- Geldend vanaf
- 01-08-2025
- BWB-id
- BWBR0050938
- Versie
- 2025-08-01_0