Fondamenti di Statistica per il Machine Learning

(con Python, NumPy, SciPy e Matplotlib)

Dalla statistica descrittiva all'inferenza: probabilità, distribuzioni, test d'ipotesi, correlazione e regressione.

Banner Fondamenti di Statistica

La Statistica e il Mondo dei Dati

Lo studio della statistica serve a trasformare una massa caotica di dati in informazioni chiare e decisioni più consapevoli. In un mondo pieno di notizie e numeri, dobbiamo essere in grado di non farci ingannare, capire cosa dicono i fenomeni collettivi, e gestire l'incertezza.

Ogni volta che lavoriamo con dei dati dobbiamo affrontare alcune domande fondamentali:

  • Come possiamo descrivere e sintetizzare questi dati?
  • Quali relazioni esistono tra le variabili?
  • Quello che osserviamo è un fenomeno reale oppure potrebbe essere semplicemente dovuto al caso?

La statistica fornisce gli strumenti matematici e concettuali per rispondere a queste domande e, soprattutto, per ragionare in condizioni di incertezza.

Quando cominciamo lo studio della statistica, il percorso parte dalla dalla statistica descrittiva, con cui impariamo a rappresentare e sintetizzare un insieme di dati attraverso distribuzioni di frequenza, grafici, media, mediana, varianza, deviazione standard, percentili e altre misure.

Successivamente introduciamo la probabilità, che ci permette di descrivere matematicamente l'incertezza attraverso variabili casuali e distribuzioni di probabilità, come la Binomiale, la Poisson, la Normale e l'Esponenziale.

Da queste basi arriviamo alla statistica inferenziale: partendo da un campione di dati, cerchiamo di ottenere informazioni sulla popolazione da cui proviene. Entrano quindi in gioco concetti come distribuzioni campionarie, stimatori, errore standard, intervalli di confidenza, test di ipotesi, p-value, dimensione dell'effetto e potenza statistica.

Infine, attraverso covarianza, correlazione, regressione lineare e analisi della varianza, iniziamo a studiare le relazioni tra le variabili e a quantificarne alcune caratteristiche.

Al termine del percorso avremo quindi gli strumenti per passare dai dati osservati a conclusioni quantitative, tenendo conto dell'incertezza che inevitabilmente accompagna i dati.

Perché usare Python?

La statistica può essere studiata utilizzando carta, penna, calcolatrice e tavole statistiche. In un contesto moderno, però, è utile affiancare alla teoria uno strumento con cui applicare concretamente ciò che si sta imparando.

Nel corso utilizziamo Python come strumento di calcolo statistico e di generazione di grafici, perché è un linguaggio relativamente semplice, veloce da imparare, e dotato di un ecosistema di librerie orientate al data science come NumPy, SciPy, Pandas e Matplotlib.

Python permette di passare facilmente dall'analisi dei dati al Machine Learning, integrandosi con sistemi software e applicazioni web.

L'obiettivo non è sostituire la comprensione delle formule con una chiamata a una funzione. Al contrario: prima cerchiamo di capire cosa stiamo calcolando e perché, poi utilizziamo Python per eseguire il calcolo, sperimentare con i dati e osservare cosa accade modificando campioni, parametri e distribuzioni.

Questo approccio ha anche un vantaggio pratico: Python è uno degli strumenti utilizzati nell'analisi dei dati e nel Machine Learning. Il passaggio dallo studio della statistica alle sue applicazioni successive avviene quindi utilizzando lo stesso ambiente di lavoro.

Logo Librerie Python

E se volessi solo Studiare Machine Learning?

Machine Learning, Deep Learning, Modelli Generativi e Large Language Models (LLM) mettono a disposizione modelli e algoritmi sofisticati, ma molti dei concetti su cui si basano diventano più comprensibili quando si possiedono solide basi di probabilità e statistica.

Un dataset, prima di essere utilizzato per addestrare un modello, è innanzitutto un campione di osservazioni. Le sue variabili possiedono distribuzioni, valori centrali, variabilità, outlier e relazioni reciproche.

Concetti come media, varianza, deviazione standard, distribuzione normale, standardizzazione, covarianza e correlazione ricompaiono continuamente nell'analisi dei dati e nel Machine Learning.

Perché usiamo la media per calcolare la MSE e non la mediana? Che relazione c'è tra MSE e assunzione di errori normalmente distribuiti? Perché due feature con scale molto diverse possono creare problemi durante l'addestramento? Perché un modello funziona bene sul training set ma male su nuovi dati?

Ma c'è un aspetto ancora più importante: imparare la statistica significa imparare a ragionare in presenza di variabilità e incertezza.

Perché le prestazioni osservate su un campione possono essere diverse da quelle ottenute su un altro? Quanto possiamo fidarci di una stima? Una differenza osservata è sufficientemente grande da essere interessante? Quanto conta la dimensione del campione? Che relazione esiste tra due variabili? Quando una correlazione può essere fuorviante?

Distribuzioni campionarie, errore standard, intervalli di confidenza, test di ipotesi, errori di Tipo I e Tipo II, potenza statistica ed Effect Size forniscono il linguaggio necessario per affrontare questo genere di problemi.

Contattami

Grafico Data Spread

Cosa Impari con Questo Corso?

Il corso costruisce progressivamente un percorso che parte dalla descrizione dei dati e arriva ai principali strumenti della statistica inferenziale e allo studio delle relazioni tra variabili.

Nella prima parte impariamo a leggere e descrivere un dataset: distinguiamo popolazione e campione, variabili qualitative e quantitative, costruiamo distribuzioni di frequenza e impariamo a rappresentarle mediante grafici, istogrammi e curve di densità.

Studiamo quindi le principali misure statistiche: media, mediana, moda, varianza, deviazione standard, coefficiente di variazione, percentili, quartili e intervallo interquartile. Vediamo come riconoscere gli outlier e introduciamo trasformazioni molto utilizzate nell'analisi dei dati, come Z-score e normalizzazione Min-Max.

Passiamo poi alla teoria della probabilità, introducendo eventi, spazio campionario, probabilità condizionata, regole di addizione e moltiplicazione, Teorema di Bayes e Legge dei Grandi Numeri.

Da questi concetti costruiamo lo studio delle variabili casuali e delle distribuzioni di probabilità, distinguendo distribuzioni discrete e continue e introducendo PMF, PDF, CDF, valore atteso e varianza. Studiamo quindi alcune distribuzioni fondamentali, tra cui Bernoulli, Binomiale, Geometrica, Poisson, Uniforme, Normale ed Esponenziale.

Il passo successivo è comprendere come sia possibile passare dal campione alla popolazione. Studiamo la distribuzione campionaria della media, il Teorema del Limite Centrale e distribuzioni come la t di Student, la Chi-Quadrato e la F di Fisher.

Su queste basi introduciamo la stima statistica: bias, varianza di uno stimatore, errore standard, accuratezza e precisione, fino ad arrivare agli intervalli di confidenza.

Affrontiamo quindi i test di ipotesi, imparando a formulare ipotesi nulla e alternativa e a interpretare livello di significatività, valore critico e p-value. Studiamo test per medie e proporzioni, confronti tra campioni indipendenti e appaiati e alcuni test non parametrici. Completiamo questa parte introducendo errore di Tipo II, potenza statistica ed Effect Size.

Infine studiamo covarianza, correlazione e regressione lineare, arrivando al metodo dei minimi quadrati, al coefficiente di determinazione, agli errori del modello e alle principali assunzioni della regressione. Il percorso prevede inoltre l'introduzione all'Analisi della Varianza (ANOVA).

Grafico Potenza - Alpha

Ok, Fammi Vedere Qualcosa!

Per farti un'idea del tipo di contenuti che troverai nel corso, dai un’occhiata ai post sulla Statistica e a quelli sul Machine Learning. Ad esempio:

Poi guarda l'indice degli argomenti, e, se vuoi, contattami per avere ulteriori informazioni a riguardo.

Contattami

Indice Degli Argomenti

Di seguito puoi consultare l’indice degli argomenti completo. Ti ricordo che il corso segue un approccio pratico e orientato al codice: ogni argomento è spiegato con il supporto di script Python pronti all’uso e facilmente adattabili ai tuoi progetti.

Parte I: Statistica Descrittiva

  • La Natura della Statistica
  • Statistica Descrittiva
  • Statistica Inferenziale
  • Dati della Popolazione
  • Dati del Campione
  • Tecniche di Campionamento
    • Campionamento Casuale Semplice
    • Campione Sistematico
    • Campione Stratificato

  • Variabili Statistiche e Dati
  • Variabili Qualitative
  • Variabili Quantitative
  • Distribuzione di Frequenza
  • Distribuzione di Frequenza Cumulativa
  • Distribuzione di Frequenza Categoriale
  • Distribuzione di Frequenza Raggruppata
  • Distribuzione Empirica dei Dati
  • Rappresentazione Grafica della Distribuzione Empirica
    • Distribuzioni Discrete: Grafico a Barre e a Punti
    • Distribuzioni Continue: Istogramma, Poligono di Frequenza, Curva KDE

  • La Media
  • La Media della Popolazione VS la Media del Campione
  • La Media Pesata
  • La Media Troncata
  • La Mediana
  • La Moda

  • La Forma della Distribuzione Empirica
  • Modalità
  • Simmetria
  • Asimmetria
  • Alcuni Esempi di Forme di Distribuzione

  • L’Intervallo (Range)
  • Varianza della Popolazione
  • Deviazione standard della Popolazione
  • Varianza Campionaria
  • Deviazione Standard Campionaria
  • Il Coefficiente di Variazione (CV)
  • Il Teorema di Chebyshev
  • La Regola Empirica

  • Percentili
  • Quartili
  • Intervallo Interquartile (IQR)
  • Il Riassunto a Cinque Numeri (Five-Number Summary)
  • Identificazione degli Outlier
  • Identificazione tramite Quartili e IQR
  • Effetto degli outlier sulle misure statistiche
  • Il Grafico Boxplot

  • Perché trasformare i dati
  • Standardizzazione (Z-score)
  • Normalizzazione Min-Max
  • Trasformazione Logaritmica
  • Trasformazione Radice Quadrata
  • Trasformazione Reciproca

Parte II: Probabilità, Variabili Casuali e Distribuzioni Campionarie

  • La Teoria della Probabilità
  • Concetti Fondamentali
    • Esperimento
    • Evento (Event)
    • Esito (Outcome)
    • Spazio campionario (Sample Space)
  • Notazione e Rappresentazione Grafica degli Eventi
    • Relazioni tra Eventi
    • Complemento
    • Intersezione
    • Unione
    • Eventi Mutuamente Esclusivi
  • Notazione delle Probabilità
  • Interpretazioni della Probabilità
    • Probabilità Classica
    • Probabilità Empirica
    • Probabilità Soggettiva (Bayesiana)
  • Regole Fondamentali della Probabilità
  • La Regola del Complemento
  • La Regola di Addizione
  • Probabilità Condizionata
  • La Regola di Moltiplicazione
  • Il Teorema di Bayes
  • La Legge dei Grandi Numeri
  • Calcolo delle Probabilità per Dati Continui
  • La Regola di Addizione per Dati Continui

  • Cosa sono gli Odds
  • Odds "A Favore" e Odds "Contro"

  • La Regola Fondamentale del Conteggio
  • La Regola della Permutazione
    • Permutazioni Parziali
    • Permutazioni con Ripetizioni
  • La Regola della Combinazione
  • Combinazioni VS Permutazioni

  • Le Variabili Casuali Discrete
  • Cos’è una Distribuzione di Probabilità Discreta
  • La Funzione di Massa di Probabilità (PMF)
  • Dal Dato Reale al Modello Teorico
  • Il Grafico di una Distribuzione di Probabilità Discreta
  • Indici Statistici in una Distribuzione di Probabilità Discreta

  • Distribuzione Uniforme Discreta
  • Distribuzione di Bernoulli
  • Distribuzione Binomiale
  • Distribuzione Geometrica
  • Distribuzione di Poisson

  • Le Variabili Casuali Continue
  • Cos'è una Distribuzione di Probabilità Continua?
  • La Funzione di Densità di Probabilità
  • Proprietà Fondamentali della PDF
  • Differenza tra Distribuzione Discreta e Continua
  • Grafico di una Distribuzione di Probabilità Continua
  • Indici Statistici della Distribuzione di Probabilità Continua

  • Che cos'è la Funzione di Distribuzione Cumulativa?
  • Proprietà fondamentali della CDF
  • CDF di una Distribuzione Discreta
  • CDF di una Distribuzione Continua
  • Calcolo delle Probabilità della CDF

  • Distribuzione Uniforme Continua
  • Distribuzione Normale
  • Distribuzione Esponenziale
  • Distribuzione Campionaria della Media Campionaria
  • Distribuzione t di Student
  • Distribuzione Chi-Quadrato
  • Distribuzione F di Fisher
  • Distribuzione Campionaria della Proporzione Campionaria

Parte III: Statistica Inferenziale

  • Parametri e Statistiche
  • Stimatori e loro Proprietà
    • Bias
    • Varianza dello Stimatore
    • Errore Standard
    • Accuratezza
    • Precisione

  • Stima Puntuale
  • Intervallo di Confidenza (IC)
  • Intervalli di Confidenza per la Media di una Popolazione quando sigma è nota
  • Intervalli di Confidenza per la Media di una Popolazione quando sigma è sconosciuta
  • Interpretazione Corretta dell'Intervallo di Confidenza

  • Stima Puntuale della Proporzione
  • Errore Standard della Proporzione
  • Intervallo di Confidenza
  • Condizioni di Applicabilità

  • La Natura dei Test di Ipotesi
  • La Formulazione delle Ipotesi: L'Ipotesi Nulla e L'Ipotesi Alternativa
  • La Logica dei Test di Ipotesi
  • La Distribuzione delle Medie Campionarie nel Test di Ipotesi
  • Errori di Tipo I e Tipo II
  • Probabilità degli Errori di Tipo I e Tipo II
  • Possibili Conclusioni di un Test di Ipotesi
  • Assunzioni dei Test Parametrici
  • Z-Test: Metodo del Valore Critico e del P-Value
  • T-Test
  • Test dei ranghi con segno di Wilcoxon

  • Z-Test per una Proporzione

  • Z-test
  • t-Test Pooled
  • t-Test Nonpooled
  • U-Test di Mann–Whitney
  • Campioni Accoppiati
    • t-Paired Test
    • Test di Wilcoxon

  • Test di Ipotesi per Due Proporzioni

  • Errore di Tipo I
  • Errore di Tipo II
  • Calcolo delle Probabilità per l’Errore di Tipo II
  • Potenza Statistica
    • Relazione con Beta
    • Interpretazione Geometrica
  • Fattori che Influenzano la Potenza
    • Dimensione del Campione
    • Dimensione dell'Effetto (Effect Size)
    • Livello di Significatività Alpha
    • Test Unilaterale o Bilaterale

  • Perché il P-value non basta
  • Cohen's d
  • Interpretazione della Dimensione dell'Effetto
  • Relazione con la Potenza Statistica

Parte IV: Regressione, Correlazione e ANOVA

  • Covarianza della Popolazione
  • Covarianza Campionaria
  • Covarianza come Generalizzazione della Varianza
  • Interpretazione Geometrica
  • Segno della Covarianza
  • La Matrice di Covarianza
  • Limiti della Covarianza
  • Dalla Covarianza alla Correlazione Lineare

  • I Problemi della Covarianza
  • Il Coefficiente di Correlazione Lineare di Pearson
  • Caratteristiche del Coefficiente di Correlazione Lineare
  • Limiti e Corretto Utilizzo del Coefficiente di Correlazione Lineare

  • Equazioni Lineari con Una Variabile Indipendente
  • Interpretazione Geometrica
  • Il Metodo dei Minimi Quadrati
  • Variabile Predittiva e Variabile di Risposta
  • Estrapolazione
  • Outlier e Osservazioni Influenti
  • Avvertenza sull'uso della Regressione Lineare
  • Assunzioni del Modello Lineare
  • Diagnostica dei Residui

  • Il Modello Basato sulla Media
  • Scomposizione della Variabilità
  • Il Coefficiente di Determinazione r^2
  • Somma dei Quadrati dell'Errore (SSE)
  • Relazione tra il Coefficiente di Correlazione e il Coefficiente di Determinazione

  • Perché serve l'ANOVA
  • Assunzioni dell'ANOVA
  • Confronto tra t-test e ANOVA
  • Variabilità Entro i Gruppi
  • Variabilità Tra i Gruppi
  • La Statistica F
  • Decisione del Test
  • Interpretazione dei risultati
  • Limiti dell'ANOVA

Costo e Modalità di Offerta

Il corso online “Fondamenti di Statistica per il Machine Learning”, con docente in presenza, della durata di 3 giorni (21 ore), è pensato per essere flessibile e modellabile sulle esigenze di professionisti e aziende. Ogni richiesta può variare per:

  • Tipologia di corso: a catalogo (open class), oppure aziendale.
  • Numero di partecipanti.
  • Personalizzazione degli argomenti.
  • Riduzione o estensione della durata.

Le soluzioni partono da €1.190,00 a persona per corsi a catalogo, e includono il materiale usato dal docente, gli esempi mostrati durante le lezioni, la registrazione dei video, ed il supporto via e-mail.

Il corso è disponibile anche in formato aziendale, con condizioni agevolate per gruppi e team di lavoro. Offriamo sconti personalizzati in base al numero di partecipanti, e alle esigenze formative specifiche della tua organizzazione.

Se desideri ricevere un’offerta adatta alle tue necessità, ti invitiamo a prenotare una call conoscitiva senza impegno.

Contattami

Domande Frequenti (FAQ)

Il corso dura 3 giorni, di 7 ore ciascuno, per un totale di 21 ore. E' possibile personalizzare la durata, togliendo argomenti che, in un contesto di tempo limitato, possono apparire secondari. Contattaci per avere informazioni a riguardo.

Le lezioni vengono fornite online, con docente in presenza, a seconda delle necessità del cliente. La frequenza migliore è due volte a settimana, e la durata di ogni lezione è di 3,5 ore (tre ore e mezza).

Si, è possibile, ma lo sconsigliamo. L'argomento non è dei più facili, e per nostra esperienza, lezioni di 3,5 ore sono maggiormente produttive.

Si. Anzi, se vuoi imparare, è una cosa che ti consigliamo di fare!

Certamente. Per i team aziendali prevediamo forti sconti personalizzati in base al numero di partecipanti. Contattaci per avere informazioni a riguardo.

Questo corso è adatto a chi abbia almeno una conoscenza base di programmazione software (se conosci almeno un linguaggio di programmazione), e una conoscenza di matematica a livello di liceo scientifico o istituto tecnico. Dovresti sapere cos'è una funzione, cos'è una derivata, e cos'è un integrale (perlomeno a livello concettuale).

Non serve una laurea in materie scientifiche, ma la voglia di rispolverare qualche libro di scuola (di matematica, calcolo e statistica), di imparare, e di "stare sul pezzo". Il corso segue un approccio "top-down", dove si approfondiscono solo i concetti utili alla comprensione dell'argomento, e alla relativa implementazione software.

No, basta avere la conoscenza di un qualsiasi linguaggio di programmazione, e la voglia di imparare.

Il corso propone 48 argomenti, 156 esempi pratici in Python, e le registrazioni audio / video delle lezioni.

Si, il corso propone le istruzioni per l'installazione dell'ambiente Miniconda, e delle librerie necessarie. Viene inoltre suggerito l'uso della versione gratuita dell'IDE PyCharm.

Si, il materiale didattico rilasciato ai partecipanti include 156 esempi in Python, commentati, che illustrano tutti i concetti spiegati durante il corso.

Sì, ti verranno fornite le registrazioni audio / video delle lezioni, che potrai vedere ogni volta che lo desideri.

Contattami

Desideri maggiori informazioni sul corso "Fondamenti di Statistica per il Machine Learning" per te o per il tuo team aziendale? Compila il modulo sottostante, e ti fornirò tutti i dettagli su contenuti, modalità e personalizzazioni aziendali. Se preferisci un contatto immediato, scrivimi direttamente a [ ], ti risponderò personalmente entro 48 ore.
Inserisci il Nome
Inserisci l'Indirizzo Email
Inserisci il Messaggio
Seleziona il Checkbox