Misure di Variabilità: il Teorema di Chebyshev e la Regola Empirica
Parte (2/2)
Potrebbe interessarti:
- Misure di Variabilità: Intervallo, Varianza e Deviazione Standard - (1/2)
- Misure di Tendenza Centrale: Media, Mediana e Moda
Il progetto Python, che comprende gli script mostrati in questo post, e quelli relativi alla creazione dei grafici Matplotlib, è disponibile assieme al corso Fondamenti di Statistica per il ML.
Il Coefficiente di Variazione (CV)
Il coefficiente di variazione (Coefficient of Variation, CV) è una misura di dispersione relativa, che esprime la deviazione standard rispetto al valore tipico del fenomeno, ovvero la media.
A differenza della deviazione standard, che è espressa nelle stesse unità di misura dei dati, il coefficiente di variazione è un numero puro (spesso espresso in percentuale), e permette di confrontare la variabilità di insiemi di dati con scale o unità di misura differenti.
Per una popolazione, il coefficiente di variazione è definito come:
$$ \text{CV} = \frac{\sigma}{\mu} $$mentre per un campione si utilizza la stima:
$$ \text{CV} = \frac{s}{\bar{x}} $$Spesso il risultato viene espresso in percentuale:
$$ \text{CV}\% = \frac{s}{\bar{x}} \cdot 100 $$Il coefficiente di variazione misura quanto i dati risultano dispersi rispetto al loro valore medio. Ad esempio:
- CV = $0.10$ ($10\%$) indica una variabilità relativamente bassa;
- CV = $0.50$ ($50\%$) indica una variabilità elevata;
- CV = $1.00$ ($100\%$) indica che la deviazione standard è pari alla media.
In generale, maggiore è il coefficiente di variazione, maggiore è la dispersione relativa dei dati. Consideriamo due gruppi di studenti che hanno sostenuto esami differenti. Il gruppo A contiene le seguenti osservazioni:
$$ \{48, 50, 52\} $$La sua media campionaria $\bar{x}_A = 50$, e la sua deviazione standard campionaria $s_A = 2$. Il coefficiente di variazione è calcolato come:
$$ \text{CV}_A = \frac{s}{\bar{x}} = \frac{2}{50}=0.04=4\% $$Il gruppo B contiene le seguenti osservazioni:
$$ \{9, 10, 11\} $$La sua media campionaria è $\bar{x}_B = 10$, e la sua deviazione standard campionaria $s_B = 1$. Il coefficiente di variazione è calcolato come:
$$ \text{CV}_B = \frac{1}{10}=0.10=10\% $$Osservando soltanto la deviazione standard, potremmo pensare che il Gruppo A sia più disperso del Gruppo B ($s_A = 2$ contro $s_B = 1$). Tuttavia, la media del Gruppo A è molto più grande: $50$ contro $10$. Rapportando la dispersione alla media, otteniamo:
- Gruppo A: CV = $4\%$
- Gruppo B: CV = $10\%$
Possiamo quindi concludere che il Gruppo B presenta una variabilità relativa maggiore, nonostante abbia una deviazione standard più piccola:

Il coefficiente di variazione è particolarmente utile quando si vogliono confrontare distribuzioni che hanno medie molto diverse, sono espresse in unità di misura differenti, o rappresentano fenomeni di natura diversa. È invece poco significativo quando la media (che sta al denominatore) è uguale o molto vicina a zero, poiché il rapporto può diventare instabile o addirittura non essere definito.
In Python, possiamo calcolare il coefficiente di variazione in questo modo:
# campioni A e B
A = [48, 50, 52]
B = [9, 10, 11]
# Calcolo con le API standard di Python
# =====================================
import statistics
mean_A = statistics.mean(A)
mean_B = statistics.mean(B)
print(f"Mean A: {mean_A:.2f}")
print(f"Mean B: {mean_B:.2f}")
# Mean A: 50.00
# Mean B: 10.00
# deviazione standard campionaria
std_A = statistics.stdev(A)
std_B = statistics.stdev(B)
print(f"Std A: {std_A:.2f}")
print(f"Std B: {std_B:.2f}")
# Std A: 2.00
# Std B: 1.00
cv_A = (std_A / mean_A) * 100
cv_B = (std_B / mean_B) * 100
print(f"CV A: {cv_A:.2f}%")
print(f"CV B: {cv_B:.2f}%")
# CV A: 4.00%
# CV B: 10.00%
# Calcolo con Numpy
# =================
import numpy as np
mean_A = np.mean(A)
mean_B = np.mean(B)
# deviazione standard campionaria (ddof=1)
std_A = np.std(A, ddof=1)
std_B = np.std(B, ddof=1)
cv_A = (std_A / mean_A) * 100
cv_B = (std_B / mean_B) * 100
print(f"CV A: {cv_A:.2f}%")
print(f"CV B: {cv_B:.2f}%")
# CV A: 4.00%
# CV B: 10.00%
Il Teorema di Chebyshev
Il teorema di Chebyshev descrive la distribuzione minima dei dati attorno alla propria media. La sua importanza risiede nell’estrema generalità: a differenza della Regola Empirica (che richiede una distribuzione a campana), questo teorema è applicabile a qualsiasi set di dati quantitativi, indipendentemente dalla forma della distribuzione.
Per ogni dataset e per ogni numero reale $k \ge 1$, la proporzione di osservazioni che giace entro $k$ deviazioni standard dalla media è almeno pari a:
$$1 - \frac{1}{k^2}$$In termini di intervallo, ciò significa che almeno la frazione indicata dei dati si trova tra $\bar{x} - ks$ e $\bar{x} + ks$ per un campione, o tra $\mu - k\sigma$ e $\mu + k\sigma$ per una popolazione.
Casi Specifici comuni
Sebbene il teorema valga per ogni valore di $k \ge 1$, i casi più utilizzati nella pratica statistica sono $k = 2$ e $k = 3$:
Per $\bf{k = 2}$:
almeno il $75\%$ delle osservazioni cade entro due deviazioni standard dalla media:
$1 - \frac{1}{2^2} = 1 - \frac{1}{4} = 0.75 \rightarrow 75\%$L’intervallo è definito come: $[\bar{x} - 2s, \bar{x} + 2s]$
Per $\bf{k = 3}$:
almeno l’$88.9\%$ (spesso approssimato all’$89\%$) delle osservazioni cade entro tre deviazioni standard dalla media:
$1 - \frac{1}{3^2} = 1 - \frac{1}{9} \approx 0.889 \rightarrow 88.9\%$L’intervallo è definito come: $[\bar{x} - 3s, \bar{x} + 3s]$
Ad esempio:

La percentuale osservata sarà normalmente superiore al limite di Chebyshev, perché il teorema fornisce soltanto una garanzia minima, non la percentuale esatta.
La potenza di questa regola risiede nella sua universalità. È possibile trarre conclusioni significative su un set di dati conoscendo esclusivamente la media $\bar{x}$ e la deviazione standard $s$, anche senza informazioni sulla simmetria o sulla modalità della distribuzione.
Ad esempio, se sappiamo che la media degli stipendi in un’azienda è $2{,}000$€ con una deviazione standard di $200$€, possiamo affermare con certezza matematica che almeno il $75\%$ dei dipendenti guadagna tra $1{,}600$€ e $2{,}400$€, a prescindere da come sono distribuiti i salari.
A livello industriale, Il Teorema di Chebyshev fornisce un limite prudenziale alla percentuale di valori fuori tolleranza. Tale limite rappresenta il massimo rischio che non può essere escluso conoscendo soltanto la media e la deviazione standard. Supponiamo che il diametro medio di un componente sia $\mu = 10$ mm, con deviazione standard $\sigma = 0.1$ mm. Supponiamo inoltre che i limiti di tolleranza siano: $10 \pm 0.2$ mm, corrispondenti a $\mu \pm 2\sigma$.
Chebyshev garantisce che almeno il $75\%$ dei componenti rientri tra $9.8$ mm e $10.2$ mm. Pertanto, nel caso più sfavorevole compatibile con quella media e quella deviazione standard, fino al $25\%$ dei pezzi potrebbe risultare fuori tolleranza. Questo non significa che il $25\%$ sarà realmente difettoso. Significa che, senza conoscere la forma della distribuzione, non è possibile escludere matematicamente una percentuale così elevata:

In Python:
mu = 10.0
sigma = 0.1
for k in [1, 2, 3]:
# Proporzione minima garantita dal Teorema di Chebyshev
proportion = 1 - (1 / k**2)
# Intervallo μ ± kσ
lower_bound = mu - k * sigma
upper_bound = mu + k * sigma
print(f"k = {k}")
print(f"Proporzione minima: {proportion:.2%}")
print(f"Intervallo: [{lower_bound:.1f}, {upper_bound:.1f}] mm")
print()
L’output è:
k = 1
Proporzione minima: 0.00%
Intervallo: [9.9, 10.1] mm
k = 2
Proporzione minima: 75.00%
Intervallo: [9.8, 10.2] mm
k = 3
Proporzione minima: 88.89%
Intervallo: [9.7, 10.3] mm
La Regola Empirica
Per insiemi di dati che presentano una distribuzione approssimativamente a campana, è possibile ottenere stime più precise rispetto a quelle fornite dal Teorema di Chebyshev, applicando la Regola Empirica, la quale afferma che:
- Circa il $68\%$ dei valori dei dati rientra in 1 deviazione standard dalla media.
- Circa il $95\%$ dei valori dei dati rientra in 2 deviazioni standard dalla media.
- Circa il $99.7\%$ dei valori dei dati rientra in 3 deviazioni standard dalla media.
Questo indica che, in presenza di una distribuzione a campana, la maggior parte dei dati è fortemente concentrata attorno alla media, e i valori estremi sono rari. Se la distribuzione è molto asimmetrica o presenta outlier significativi, la regola può risultare inaccurata.

Supponiamo che i punteggi di un test abbiano:
- media $\mu = 70$;
- deviazione standard $\sigma = 10$.
Allora i punteggi saranno distribuiti in questo modo:
| Intervallo | Percentuale Attesa |
|---|---|
| 60 – 80 ($\mu \pm 1\sigma$) | circa il $\bf{68\%}$ degli studenti |
| 50 – 90 ($\mu \pm 2\sigma$) | circa il $\bf{95\%}$ degli studenti |
| 40 – 100 ($\mu \pm 3\sigma$) | circa il $\bf{99.7\%}$ degli studenti |
In sintesi, la Regola Empirica ci permette di:
Capire rapidamente la dispersione dei dati:
conoscendo solo la media e la deviazione standard, possiamo stimare dove si trova la maggior parte dei dati della distribuzione.Individuare gli Outlier:
valori oltre $\mu \pm 3\sigma$ sono estremamente rari. Quindi spesso vengono considerati outlier.Effettuare controlli veloci sulla distribuzione:
se i dati sono veramente normali, allora dovremmo osservare circa il $68\%$ entro $1\sigma$ e il $95\%$ entro $2\sigma$.
La Regola Empirica contro il Teorema di Chebyshev
Diversamente dal Teorema di Chebyshev, la Regola Empirica non fornisce un limite inferiore garantito. Quando afferma che “circa il $68\%$ dei valori rientra entro una deviazione standard dalla media”, non significa “almeno il $68\%$”, bensì che la probabilità è di circa il $68\%$. Analogamente, circa il $95\%$ dei valori si trova entro due deviazioni standard e circa il $99.7\%$ entro tre.
La Regola Empirica descrive quindi la probabilità effettiva di osservare un valore entro uno, due o tre scarti standard dalla media, assumendo che la distribuzione sia normale (o approssimativamente normale).
Riprendiamo ora l’esempio dei componenti industriali già utilizzato per illustrare il Teorema di Chebyshev. Supponiamo che il diametro dei bulloni segua una distribuzione normale con media $\mu = 10$ mm e deviazione standard $\sigma = 0.1$ mm. I limiti di tolleranza sono fissati a $10 \pm 0.2$ mm, ossia nell’intervallo $\mu \pm 2\sigma$.
Applicando il Teorema di Chebyshev possiamo affermare soltanto che:
Almeno il $\bf{75\%}$ dei componenti rientra nelle tolleranze stabilite.
Questa è una garanzia minima, valida per qualunque distribuzione avente media e varianza finite.
Se, invece, sappiamo che il processo produttivo genera diametri distribuiti normalmente, possiamo applicare la Regola Empirica e concludere che:
Ci aspettiamo che circa il $\bf{95\%}$ dei componenti rientri nelle tolleranze stabilite.
La differenza è sostanziale: mentre il Teorema di Chebyshev fornisce un limite prudenziale valido in ogni situazione, la Regola Empirica sfrutta la conoscenza della distribuzione normale per stimare con maggiore precisione la reale percentuale di componenti conformi:
