wetzoeker

3.3.4 — Constructvaliditeit Regeling beoordelingskader voor de toetsen behorende tot leerling- en onderwijsvolgsystemen po

Constructvaliditeit

Deze paragraaf beschrijft de kwaliteitseisen voor Fase 4 van de psychometrische verantwoording van een LVS-instrument van het type (III) en (IV), zijnde de kwaliteit van de constructvaliditeit van het LVS-instrument.

De construct- of begripsvaliditeit is de eigenschap die het LVS-instrument heeft als kan worden aangetoond dat het instrument het door de constructeur beoogde kenmerk van de leerling (onderliggende trek, vaardigheid) meet. De toetsaanbieder kan de constructvaliditeit kwantitatief en/of kwalitatief aantonen.

Code | Vragen | Mogelijke antwoorden

P.VII.1 | Is aangetoond dat er sprake is van unidimensionaliteit? | ja/nee/n.v.t.

P.VII.2 | Is aangetoond dat de itemkwaliteit op orde is? | ja/nee/n.v.t.

P.VII.3 | Is de convergente en divergente validiteit van het instrument door onderzoek aangetoond? | ja/nee

P.VII.4 | Is aangetoond dat er geen sprake is van item bias voor relevante subgroepen/categorieën? | ja/nee/n.v.t.

P.VII.5 | Zijn verschillen in prestaties van relevante subgroepen voldoende onderbouwd? | ja/nee

Toelichting P.VII.1:

De resultaten van de uitgevoerde kalibratie maken het aannemelijk dat er bij het LVS-instrument van het type (III) of (IV) sprake is van unidimensionaliteit. Dit betekent dat met elke willekeurige subset van items uit de gekalibreerde itembank dezelfde onderliggende vaardigheid kan worden vastgesteld. De unidimensionaliteit kan op klassieke wijze worden aangetoond met bijvoorbeeld latente correlaties tussen verschillende inhoudelijke subvaardigheden of een confirmatieve factoranalyse gekoppeld aan multidimensionale betrouwbaarheidsindices

2 Zie bijvoorbeeld: Widhiarso, W., & Ravand, H. (2014). Estimating reliability coefficient for multidimensional measures: A pedagogical illustration. Review of psychology, 21(2), 111-121.)

. Het gebruik van IRT biedt daarnaast de mogelijkheid om met multidimensionele IRT modellen, testlet modellen of bi-factormodellen een complexere dimensiestructuur te modelleren.

Toelichting P.VII.2:

De itemkwaliteit wordt aangetoond met een passende moeilijkheidsparameter en met voldoende discriminerend vermogen. De aanbieder onderbouwt de gekozen grenswaarden voor de p- en rit-waarden op een juiste en gedegen wijze.

Toelichting P.VII.3:

De aanbieder laat op basis van onderzoek zien dat het te meten onderdeel hoog correleert met andere toetsen die hetzelfde construct meten (convergente validiteit) en laag correleert met andere toetsen die een ander construct meten (divergente validiteit). Indien het aantonen van convergente validiteit niet mogelijk is, bijv. als er geen vergelijkbare instrumenten beschikbaar zijn of als naar mate de complexiteit van het te meten onderdeel toeneemt (bv. het meer complexe onderdeel sociaal-emotionele ontwikkeling versus het meer overzichtelijk terrein Rekenen) wegen de inhoudelijke argumenten zwaarder dan de kwantitatieve argumenten. Met bijvoorbeeld een Multi Trait Multi Method matrix kan worden onderbouwd hoe een instrument zich gedraagt. Voor de meer complexe onderdelen is er vaak beperkt of geen extern vergelijkingsmateriaal om de convergente validiteit te onderzoeken. In die situatie biedt een meer argument-based approach (Kane, 2004) of bijvoorbeeld een operationalisering van de inhoudsvaliditeit uitkomst. Dit betreft een meer beschrijvende manier op basis van de blueprint /toetsmatrijs, waarbij gelet wordt op de representativiteit en evenwichtigheid.

Toelichting P.VII.4:

In het kader van itembias is er onderzoek uitgevoerd naar differentieel item functioneren (DIF) voor relevante subgroepen en/of categorieën, zoals bijvoorbeeld afnamevormen (papier/digitaal).

Als er sprake is van een tussentijdse check dient de aanbieder onderzoek naar DIF uit te voeren tussen de afnames van de initiële indiening en de tussentijdse check om aan te tonen dat de items nog hetzelfde functioneren.

Toelichting P.VII.5:

De prestaties van relevante subgroepen is onderzocht door de gemiddelde score en standaarddeviatie per subgroep te bepalen. Tevens dienen de effectgroottes te worden toegevoegd, waarbij geldt dat een klein effect < 0.2 voldoende is. Op gedegen en complete wijze onderbouwt de aanbieder de keuze van de relevante subgroepen en verantwoordt eventuele verschillen op basis van theoretische inzichten en/of eerder onderzoek.

Regeling
Regeling beoordelingskader voor de toetsen behorende tot leerling- en onderwijsvolgsystemen po
Soort
ZBO-regeling
Geldend vanaf
01-03-2025
BWB-id
BWBR0047445
Versie
2025-03-01_0

In de hele regeling · Officiële tekst op wetten.overheid.nl