
Prima ancora dei voti, la qualità dello strumento di misura. Non basta insomma misurare, il passaggio reale è costruire sistema e strumenti di valutazione che siano davvero affidabili. Questo significa che la qualità di una valutazione “non si misura dai risultati che produce, ma dalla fiducia che possiamo riporre in quei risultati”.
Questa volta è l’Invalsi a tornare sul terreno della valutazione degli apprendimenti in classe con un report fresco di pubblicazione, un documento per sottolineare che oltre al rispetto e all’esigenza di equità, la valutazione rispetta il rigore e la correttezza scientifici solo se garantisce la corretta comparazione dei dati raccolti e dei risultati registrati. Solo una misura tecnicamente solida e imparziale può consentire di interpretare correttamente le differenze osservate tra studenti, classi, scuole e territori.
Non è un caso che Invalsi esca proprio ora con questo pamphlet (N, 59 Servizio Statistico INVALSI), una guida vera e propria pochi giorni dopo la partenza della Sperimentazione nazionale a scuola di nuovi modelli e paradigmi didattici per lo sviluppo e l’allenamento delle competenze non cognitive (skill life e soft skill).
Se lo sguardo iniziale di Invalsi è tutto posato sui contesti sociali di partenza degli studenti – le disuguaglianze educative sono una dimensione che non si può trascurare quando si rileva il livello degli apprendimenti e la valutazione può però renderle visibili, comprensibili e quindi affrontabili -, allora il vero problema non è soltanto leggere i risultati degli studenti, ma essere certi che quei risultati siano stati misurati in modo corretto, affidabile e imparziale.
Secondo il documento, quindi, una misurazione accurata non serve a produrre classifiche o graduatorie sempre più sofisticate. Serve piuttosto a comprendere se le differenze osservate tra studenti, fra classi, scuole e territori riflettano effettivamente differenze negli apprendimenti oppure siano influenzate da fattori estranei a ciò che la prova dovrebbe rilevare. Solo quando la qualità della misurazione è garantita, infatti, i dati possono diventare uno strumento utile per verificare modelli innovativi didattici e orientare decisioni educative e politiche scolastiche.

Al contrario, una buona valutazione deve rendere le differenze interpretabili, consentendo di distinguere ciò che dipende realmente dagli apprendimenti da ciò che potrebbe essere generato da imperfezioni dello strumento di misura. Questa riflessione si colloca “nel campo della moderna misurazione educativa, dove la qualità di una prova – spiegano i ricercatori Invlasi – non dipende soltanto dalla correttezza disciplinare delle domande o dalla loro coerenza con il curricolo, ma anche dalla capacità di evitare interferenze che alterino la rilevazione delle competenze effettivamente possedute dagli studenti”.
L’intera riflessione proposta da Invalsi ruota attorno a una domanda fondamentale: possiamo davvero fidarci di ciò che stiamo misurando? Una domanda solo apparentemente tecnica, ma che in realtà riguarda il cuore della valutazione. Se uno strumento introduce elementi che favoriscono alcuni studenti e ne penalizzano altri, il risultato rischia di restituire una rappresentazione distorta delle competenze possedute. Una prova può essere statisticamente valida e coerente con gli obiettivi disciplinari, ma non per questo essere automaticamente imparziale.
È qui che emerge uno dei concetti chiave del rapporto: sono tre le dimensioni fondamentali della misurazione educativa. La prima è l’affidabilità: una prova deve produrre risultati coerenti e stabili. La seconda è la validità: deve misurare effettivamente la competenza che dichiara di voler osservare. La terza è l’imparzialità.
Sono aspetti importanti perché una prova può risultare valida sotto molti punti di vista e, allo stesso tempo, contenere elementi che avvantaggiano alcuni gruppi di studenti e ne svantaggiano altri. Quando ciò accade, è il monito del report Invalsi, il punteggio finale rischia di non rappresentare più una fotografia fedele delle competenze possedute.
Altro punto sottolineato: equità non significa uguaglianza. Invalsi distingue due idee che “spesso vengono confuse”. L’uguaglianza “consiste nell’offrire a tutti gli studenti le stesse condizioni di somministrazione: stessi tempi, stesse istruzioni, stessi quesiti”. L’equità, invece, riguarda “la capacità della prova di permettere a ciascuno di dimostrare realmente ciò che sa e sa fare, senza essere ostacolato da fattori non pertinenti rispetto alla competenza che si intende valutare”.

Invalsi propone un esempio illuminante sotto questo profilo: se una prova di matematica richiede prima di tutto di decifrare un testo linguisticamente molto complesso, “il punteggio ottenuto potrebbe riflettere almeno in parte una difficoltà di comprensione del linguaggio – spiegano i ricercatori Invalsi – piuttosto che una reale carenza nella competenza matematica. In questo caso la prova non fotograferebbe con precisione l’apprendimento che intende misurare”.
Per questo l’imparzialità non viene considerata da Invalsi una fase finale del processo di valutazione, ma la condizione per costruire lo strumento statistico. Ogni scelta può incidere sulla qualità della misura: dalla definizione degli obiettivi di apprendimento alla formulazione linguistica dei quesiti, dalla selezione dei contenuti alle procedure di revisione e sperimentazione. Invalsi su questo è quasi categorica: la revisione dei quesiti va affidata a professionisti con competenze differenti. “Uno specialista disciplinare può non individuare ambiguità linguistiche o implicazioni culturali che invece emergono grazie a uno sguardo multidisciplinare” sottolinea il report.
Ma c’è un’altra dimensione, successiva, da tenere presente: la sperimentazione attraverso dei pre-test condotti con studenti veri. Solo l’osservazione delle risposte e l’analisi statistica consentono di verificare come i quesiti funzionino concretamente sul campo, per esempio, fra questi il livello di difficoltà delle domande dei questionari, comportamenti non previste nelle risposte, forti differenze fra gruppi di studenti.

Il report poi ha anche un passaggio fortemente tecnico e metodologico, quasi per addetti ai lavori come i ricercatori sociali o gli statistici: tra gli strumenti viene richiamata l’analisi del cosiddetto Differential Item Functioning (DIF), una metodologia statistica utilizzata per individuare quesiti che presentano comportamenti differenti tra gruppi di studenti con livelli comparabili di competenza. Se due studenti possiedono lo stesso livello di preparazione rispetto all’obiettivo misurato, ci si aspetta che abbiano probabilità simili di rispondere correttamente a una domanda. Quando ciò non avviene, il quesito merita un approfondimento.
L’accenno a questo passaggio è importante da capire perché subito dopo Invalsi sottolinea che la presenza di un Dif (stesso punto di partenza, ma risposte differenti degli studenti) non significa l’esistenza di una distorsione. La differenza potrebbe dipendere da un ostacolo improprio, ma potrebbe anche essere legata a caratteristiche che fanno parte della competenza che si sta rilevando: “Per questo l’analisi statistica – sottolineano i ricercatori – deve sempre essere integrata da una riflessione pedagogica e disciplinare.
E qui poi si passa al tema centrale del documento, la comparabilità dei risultati e come si costruisce la metodologia corretta. Le prove su una vasto campione o su larga scala non servono solo a contare risposte corrette e sbagliate. Devono consentire confronti affidabili tra studenti, scuole, territori e momenti diversi nel tempo. Per raggiungere questo obiettivo occorrono modelli statistici capaci di costruire scale di misura coerenti e stabili. La comparabilità richiede inoltre verifiche continue sulle proprietà della misura e sul collegamento tra prove utilizzate in momenti diversi.

Un piccolo ma significativo “dettaglio del diavolo” si potrebbe nascondere nella crescente diffusione dei questionari per la raccolta dati attraverso i computer. È una delle nuove sfide. Gli strumenti digitali infatti, va detto, standardizzano molte procedure e certamente favoriscono e facilitano migliorandola la raccolta dei dati. Ma gli studenti possiedono livelli diversi di familiarità tecnologica. “Anche questa variabile deve essere monitorata attentamente – viene osservato nel report – per evitare che la modalità di risposta condizioni la misurazione dell’apprendimento”.
Un’altra questione sviluppata nel report riguarda la comparabilità dei risultati nel tempo e tra contesti differenti. Da qui emerge il passaggio finale del modello proposto da Invalsi: i dati, da soli, non bastano. La valutazione acquista valore soltanto quando le informazioni prodotte vengono comprese, interpretate e trasformate in decisioni, “nella progettazione del miglioramento e aiutano a individuare i contesti che necessitano di maggiore attenzione o interventi mirati”.
Il messaggio conclusivo del rapporto è netto e attuale sempre con uno sguardo alla Sperimentazione triennale sulle competenze non cognitive appena partito. Misurare in modo accurato e imparziale non significa aspettarsi che tutti gli studenti ottengano gli stessi risultati. Significa creare le condizioni affinché le differenze osservate siano realmente interpretabili. Solo allora la valutazione può svolgere la sua funzione più importante: comprendere. E verificare l’efficacia di un modello educativo, didattico, pedagogico.




