Certificazione EDD e capacità operativa: che cosa misura davvero una prova?

Un team EDD può superare una certificazione e incontrare comunque difficoltà quando cambiano il campione, il contenimento, l’ambiente o il modo in cui l’odore è disponibile. Allo stesso tempo, una prova standardizzata resta indispensabile per confrontare prestazioni e criteri. Il problema non è scegliere tra test e operatività, ma verificare quanto il primo riesca a rappresentare la seconda.

Lo studio di Michelle Karpinsky e collaboratori, pubblicato su Frontiers in Veterinary Science, propone una prima validazione black box dello Standard ANSI/ASB 092 per i cani da rilevamento esplosivi. La ricerca confronta direttamente prove standardizzate e scenari costruiti per avvicinarsi alle condizioni operative.

Come è stata organizzata la valutazione

Hanno partecipato 56 team operativi provenienti da forze dell’ordine, organismi governativi e aziende private. Le attività si sono svolte in tre regioni degli Stati Uniti: Sud-Ovest, Sud-Est e Ovest, con 20, 17 e 19 team.

Ogni prova occupava due giornate. La sezione basata sullo Standard 092 comprendeva ricerche in stanze, veicoli, pacchi e bagagli, oltre agli odor recognition test. Gli scenari operativi includevano persone con bagagli, pile di scatole, aree esterne, interni di veicoli e bagagli ammassati.

I target appartenevano alle sei tipologie di esplosivo richieste dallo standard, indicate nello studio con numeri per ragioni di sicurezza. Le ricerche erano single blind: il conduttore non conosceva numero e posizione dei target, mentre i valutatori ne erano informati. L’esito dipendeva dalla dichiarazione del conduttore, non dalla sola osservazione del comportamento del cane.

Il team come unità di misura

La validazione black box registra ciò che il sistema produce senza tentare di ricostruire, per ogni errore, quale passaggio interno lo abbia determinato. In un sistema EDD il cane individua e segnala, ma è il conduttore che interpreta e comunica l’allerta.

Un miss non dimostra automaticamente un problema olfattivo del cane. Potrebbe dipendere dalla condotta della ricerca, dalla mancata risposta, da una lettura incompleta o da una decisione del conduttore. Per lo stesso motivo, un falso allarme deve essere analizzato come esito del team.

La misura black box è quindi concreta, ma non diagnostica. Quantifica la prestazione nell’insieme delle condizioni sperimentali; per comprendere le cause occorrono osservazioni e analisi aggiuntive.

La soglia che nessun team raggiunse

Per superare i criteri dello Standard 092 applicati nello studio erano necessari almeno il 90% di risposte corrette e meno del 10% di falsi allarmi. L’analisi individuale incluse 54 team che avevano completato almeno una giornata intera. Nessuno raggiunse entrambi i valori.

Il miglior risultato fu l’88% di risposte corrette con il 6% di falsi allarmi. Cinque team ottennero almeno il 70% di risposte corrette restando sotto il 10% di falsi allarmi; altri tre superarono il 70%, ma oltrepassarono la soglia dei falsi allarmi.

Questo dato descrive l’esito di uno specifico studio e non equivale a dichiarare inidonei tutti i partecipanti. Molti avevano già lavorato operativamente e superato altre certificazioni. Il protocollo valutato era lungo, impegnativo e più esteso di molte procedure abituali.

Quanto il test standard anticipava gli scenari

La prestazione nelle prove standard e quella negli scenari si muovevano generalmente nella stessa direzione. Gli otto team con almeno il 70% di risposte corrette nello Standard 092 ottennero in media il 79% nella parte standard e l’86% negli scenari. Quattro di loro completarono gli scenari con il 100% di risposte corrette.

I team nella fascia fra il 36 e il 50% ottennero in media il 43% nelle prove standard e il 38% negli scenari. Quelli collocati al 35% o meno raggiunsero il 25% nello standard e il 29% negli scenari. Due team costituirono eccezioni importanti: dalla fascia intermedia delle prove standard passarono all’80 e al 100% negli scenari.

Il rapporto osservato indica che la prova standardizzata conteneva informazione utile sulla prestazione negli scenari. Non autorizza però a usare un singolo risultato come prova completa dell’efficacia operativa.

La sede e il criterio di risposta

Le percentuali cambiarono sensibilmente tra i tre gruppi. Nella prima sede furono registrati il 45% di risposte corrette negli scenari e il 41% nello standard. Nella seconda, 65 e 62%. Nella terza, 30 e 44%.

Il secondo gruppo produsse anche più falsi allarmi: 15% negli scenari e 13% nella parte standard. Gli autori ipotizzano un criterio di risposta più liberale, nel quale una maggiore propensione a dichiarare l’allerta aumenta contemporaneamente hit e falsi allarmi.

Questo è un punto operativo importante. La percentuale di ritrovamenti non dovrebbe essere letta separatamente dai falsi allarmi. Due team con la stessa sensibilità possono adottare criteri decisionali differenti e produrre conseguenze operative diverse.

La prestazione non fu uguale per tutti gli esplosivi

Fra i sei target, l’“Explosive 2” ottenne le percentuali più alte nelle tre sedi: 87, 74 e 64%. L’“Explosive 6” ebbe le percentuali più basse in tutte le sedi. Anche l’“Explosive 5” risultò problematico nella prima e nella terza.

In alcuni casi la seconda esposizione fu associata a un miglioramento: nella prima sede l’“Explosive 4” passò dal 28 al 74% e l’“Explosive 5” dall’8 al 50%; nella seconda sede l’“Explosive 5” passò dal 25 al 74%. La terza sede mostrò invece andamenti meno stabili, compresa una diminuzione dal 92 al 35% per l’“Explosive 2”.

La disponibilità dei training aid è una possibile spiegazione proposta dagli autori. Non è stata dimostrata come causa esclusiva. Frequenza dell’addestramento, familiarità con il protocollo, fatica, ambiente e differenze fra i team potrebbero avere contribuito e non furono isolati sperimentalmente.

Il caso delle scatole chiuse

La ricerca nei pacchi evidenzia l’importanza della modalità di presentazione. Nella prima sede, con scatole riempite e chiuse con nastro adesivo, l’“Explosive 4” fu rilevato dal 5% dei team il primo giorno e dal 67% il secondo. Nella seconda sede, con una configurazione meno sigillata, i risultati furono 70 e 100%.

Non si tratta di un confronto controllato fra il solo nastro adesivo e l’assenza di nastro, perché cambiavano partecipanti, sede e condizioni. Dimostra però che la disponibilità dell’odore, il contenimento e la preparazione del campione possono alterare profondamente ciò che una prova sembra misurare.

Tre piani da non confondere

La certificazione controlla se il team soddisfa uno standard in una determinata prova. L’addestramento sviluppa e mantiene le competenze. La capacità operativa emerge quando il team affronta il compito reale con le sue variabili.

Un test coerente e ripetibile è necessario, ma rappresenta un campionamento della prestazione. Un programma addestrativo ampio può aumentare generalizzazione e resilienza, ma deve essere verificato attraverso valutazioni indipendenti. L’esperienza operativa, infine, non elimina la necessità di misurazioni periodiche.

Possibili sviluppi per un programma EDD

La ricerca suggerisce aree di lavoro da approfondire, senza introdurre nuovi requisiti normativi: prove cieche e double blind, rotazione dei campioni, verifica delle varianti, registrazione degli esiti per target e rivalutazioni periodiche.

Un database utile dovrebbe distinguere hit, miss e falsi allarmi, collegandoli alla tipologia di target, al campione, alla quantità, al contenimento e allo scenario. In questo modo una media generale non nasconde una difficoltà specifica.

La rotazione non dovrebbe significare casualità priva di criterio. Dovrebbe permettere di verificare la generalizzazione verso varianti pertinenti senza trasformare ogni prova in un’esperienza irripetibile. La ripetizione periodica consente invece di distinguere un risultato occasionale da una tendenza stabile.

Uno studio statunitense, non una nuova norma italiana

Lo studio valuta il sistema OSAC e ANSI/ASB negli Stati Uniti. Non cambia automaticamente standard, procedure o certificazioni italiane e non può essere trasferito senza una validazione nel nostro contesto.

Il contributo applicabile è il metodo: confrontare ciò che una certificazione dichiara di misurare con gli esiti ottenuti in scenari più vicini al lavoro, conservando dati abbastanza dettagliati da individuare differenze fra target e condizioni.

La domanda utile per un programma EDD non è soltanto se il team abbia superato la prova. È se quella prova sia stata validata rispetto alle prestazioni operative che si propone di rappresentare.

Francesco Piliego

Francesco Piliego è Canine Security Advisor, specialista EDD, formatore ed esperto in detection. È CEO di FP GROUP SRL, azienda specializzata in servizi cinofili professionali per la sicurezza, la difesa e l’ambiente. Ex specialista delle unità cinofile antiesplosivo della Polizia di Stato, svolge attività di formazione e divulgazione attraverso podcast su Spotify ed è autore e proprietario del canale YouTube @francescopiliegoreal, che ha superato le 100.000 visualizzazioni.

Fonte scientifica

Michelle Karpinsky et al., “Explosive detection canines in the field: a multi-site black box validation study”, Frontiers in Veterinary Science, 16 ottobre 2025. https://doi.org/10.3389/fvets.2025.1668317

Torna in alto