Clicker e marker nella detection: cosa mostra la ricerca sul rinforzo differito?

Il rinforzo efficace non dipende soltanto dal valore del premio, ma anche dalla precisione con cui il cane può collegarlo alla risposta appena eseguita. Questo diventa particolarmente rilevante nella detection, dove la segnalazione deve comunicare non soltanto la presenza del target, ma anche la posizione della sorgente.

Il lavoro pubblicato da Lucia Lazarowski e collaboratori su Frontiers in Veterinary Science offre dati sperimentali sull’impiego di un clicker come marker condizionato. Il risultato non è una dimostrazione della superiorità universale del clicker, ma un’analisi di quali componenti della prestazione possano beneficiare di un segnale che precede il premio primario.

Il problema temporale del rinforzo

Un marker condizionato è un segnale inizialmente neutro che, attraverso ripetute associazioni con un premio, acquisisce la capacità di predirne l’arrivo. Nello studio, il segnale era il suono di un clicker e il premio primario consisteva in una pallina seguita dal gioco con il conduttore.

Il click permetteva al trainer di identificare immediatamente la risposta corretta. La pallina poteva arrivare alcuni secondi dopo senza lasciare completamente indefinito il comportamento che aveva determinato il rinforzo.

La distinzione è rilevante quando il cane lavora lontano dal conduttore o quando il premio non può essere consegnato direttamente presso la sorgente. Senza un segnale intermedio, il cane può allontanarsi, modificare la postura o rivolgersi alla persona prima di ricevere il premio. Uno di questi comportamenti potrebbe essere involontariamente incluso nella sequenza rinforzata.

Ventotto cani e due condizioni di addestramento

Lo studio ha utilizzato 28 Labrador retriever candidati provenienti dal programma di Auburn University. I cani avevano approssimativamente dieci mesi e non erano stati precedentemente addestrati nella detection formale o nella risposta passiva richiesta.

I soggetti furono suddivisi in due gruppi da 14, bilanciando sesso e valore motivazionale attribuito alla pallina. Un gruppo riceveva il click dopo la risposta corretta e successivamente il premio; l’altro riceveva direttamente la pallina.

Il target sperimentale era acetato di amile allo 0,1% in olio minerale. La segnalazione richiesta era il seduto. Tutti i cani lavorarono con gli stessi professionisti e seguirono lo stesso percorso generale.

Prima della detection, il gruppo marker ricevette 20 associazioni click-pallina. Il gruppo di confronto ricevette 20 presentazioni della pallina con un clicker silenzioso, così da mantenere comparabili il tempo trascorso con il trainer e l’esposizione al premio.

Dove il marker ridusse il numero di prove

La prima fase riguardava la costruzione della segnalazione. La media fu di 51,9 prove nel gruppo marker e 60,1 nel gruppo senza marker. Seguirono quattro fasi di addestramento olfattivo progressivamente più complesse.

Nelle prime tre fasi, le medie furono 39,2 contro 34,7 prove, 40 contro 43,9 e 44,8 contro 50,4. Nessuna di queste differenze risultò significativa.

Nell’ultima fase, che richiedeva maggiore precisione della postura, una risposta più vicina alla sorgente, una durata definita e una distanza superiore dal trainer e dal conduttore, la differenza divenne significativa. Il gruppo marker completò il passaggio in 36 prove, mentre quello con il solo premio ne impiegò mediamente 68,2.

Il dato non autorizza a sostenere che il marker acceleri ogni apprendimento. Suggerisce che il vantaggio possa emergere quando il comportamento richiesto comprende più criteri e quando il trainer deve selezionare con precisione il momento corretto.

Il click arrivava mediamente un secondo dopo la risposta. Il premio primario veniva consegnato dopo 3,13 secondi nel gruppo marker e 3,54 secondi nel gruppo senza marker. I tempi della pallina non erano significativamente differenti: ciò rafforza l’ipotesi che fosse la funzione informativa del click, e non semplicemente una consegna più rapida del premio, a incidere sul risultato.

Riconoscere il target e indicarlo correttamente

Nel test di discriminazione successivo, i cani addestrati con il marker produssero il 93,57% di hit e quelli del gruppo senza marker il 97,86%. La differenza non risultò significativa. Anche il tasso medio di falsi allarmi fu identico, pari al 7,14%.

Non emerse quindi un aumento generale dell’accuratezza nel riconoscimento olfattivo. Il vantaggio riguardò la forma dell’indicazione.

Il gruppo marker orientò correttamente la risposta verso il contenitore target nel 92,1% dei casi, mentre il secondo gruppo raggiunse il 69,3%. I primi cani eseguirono inoltre la segnalazione a una distanza media di 43,2 centimetri dalla sorgente, contro 52,5 centimetri.

La latenza media del seduto, rispettivamente di 1,49 e 1,70 secondi, non risultò significativamente differente. Non cambiò in modo significativo neppure la probabilità di mantenere la risposta per i due secondi previsti.

La ricerca in un ambiente differente

Il trasferimento fu valutato attraverso sei ricerche libere in un contesto nuovo. Otto cani per ciascun gruppo eseguirono autonomamente la segnalazione al primo incontro con il target.

Il numero medio di segnalazioni autonome sulle sei ricerche fu 3,92 nel gruppo marker e 4,14 nel gruppo con il solo premio. La differenza non fu significativa e nessun cane produsse falsi allarmi sui distrattori predisposti o su altri elementi non target.

La percentuale di segnalazioni orientate correttamente verso il nascondiglio fu però del 59,2% nel gruppo marker e del 37,9% nell’altro gruppo. La proporzione di risposte eseguite entro circa un metro dalla sorgente non risultò invece differente.

Anche nel nuovo ambiente, quindi, il marker non aumentò il numero delle indicazioni autonome, ma contribuì a rendere più precisa la direzione comunicata dal cane.

Il test senza premio primario

La fase finale comprendeva dieci prove nelle quali la pallina veniva sospesa. I cani del gruppo marker continuavano a ricevere il click per le risposte corrette; gli altri non ricevevano alcun segnale o premio.

La sensibilità media fu del 97,85% nel gruppo marker e dell’85,47% nell’altro gruppo. Con il susseguirsi delle prove, la probabilità di un hit diminuì nel gruppo senza marker, mentre rimase stabile nel gruppo che riceveva ancora il click.

Anche la latenza aumentò progressivamente nel primo gruppo e rimase stabile nel secondo. Le segnalazioni dei cani addestrati con il marker conservarono inoltre una migliore posizione e un orientamento più preciso verso la sorgente.

I falsi allarmi furono il 2,86% nel gruppo marker e lo 0,71% nel gruppo senza marker, ma la differenza non risultò significativa.

Questa fase non rappresenta una vera estinzione completa per il gruppo marker, poiché il click continuava a essere somministrato. Dimostra invece che il segnale aveva acquisito proprietà rinforzanti sufficienti a mantenere temporaneamente il comportamento quando la pallina non era disponibile.

Ciò non significa che il click possa essere utilizzato indefinitamente senza premio. Se smettesse sistematicamente di predire il rinforzo primario, perderebbe progressivamente il proprio significato.

Applicazioni e limiti

La possibilità di confermare immediatamente una risposta senza avvicinarsi al cane potrebbe ridurre la dipendenza dai movimenti del conduttore e limitare gli aiuti involontari. Potrebbe inoltre essere utile nei sistemi nei quali la precisione dell’indicazione alla sorgente assume un valore specifico.

Queste applicazioni devono comunque essere verificate. Lo studio riguarda giovani Labrador candidati, un protocollo standardizzato, un target sperimentale molto volatile, una segnalazione mediante seduto e un particolare clicker. Non stabilisce che lo stesso effetto debba comparire con altre razze, cani operativi, differenti discipline, segnalazioni congelate, comportamenti attivi o marker verbali.

Non dimostra neppure che il clicker sia indispensabile. Un altro segnale breve, coerente e correttamente condizionato potrebbe svolgere una funzione analoga, ma questa possibilità richiede una valutazione specifica.

Misurare prima di concludere

Un centro di formazione che volesse valutare il marker dovrebbe confrontare il numero di prove necessario per il raggiungimento dei criteri, la latenza della risposta, la sua durata, la distanza dalla sorgente e l’orientamento del cane.

Dovrebbe inoltre rilevare l’eventuale ricerca di conferme nel conduttore, le risposte associate ai movimenti umani e la capacità di mantenere la segnalazione aumentando la distanza. La prestazione dovrebbe essere verificata in un ambiente nuovo, separando sempre hit, miss, falsi allarmi e precisione di localizzazione.

Il criterio finale non dovrebbe essere la semplice presenza del clicker, ma la qualità dell’informazione che il sistema di rinforzo fornisce al cane. La domanda operativa è quindi questa: possiamo dimostrare, attraverso dati comparabili, che il nostro marker rende la segnalazione più precisa senza alterare negativamente sensibilità, specificità e autonomia?

L’autore

Francesco Piliego è CEO di FP GROUP SRL, azienda specializzata in servizi cinofili professionali per la sicurezza, la difesa e l’ambiente. Ex specialista delle unità cinofile antiesplosivo della Polizia di Stato, è formatore, autore ed esperto in detection. Svolge attività di divulgazione attraverso podcast su Spotify ed è autore e proprietario del canale YouTube @francescopiliegoreal, che ha superato le 100.000 visualizzazioni. Attraverso la formazione, la divulgazione e l’esperienza operativa contribuisce allo sviluppo di unità K9 preparate, affidabili e adeguate ai diversi contesti d’impiego.

Fonte scientifica

Lazarowski, L., Rogers, B., Collins-Pisano, C., Krichbaum, S., Handley, M., Smith, J. G. e Waggoner, P. (2025). “Effectiveness of marker training for detection dogs”. Frontiers in Veterinary Science, 12, 1538452. https://doi.org/10.3389/fvets.2025.1538452

Torna in alto