Skip to content

About

Analisi esplorativa COVID-19 su 420k osservazioni (Python, Pandas, Seaborn). Trend continentali, benchmarking ICU europeo, e gestione etica di anomalie nei dati. Focus su Data Quality e decisioni analitiche trasparenti.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 

Repository files navigation

Analisi Diffusione Globale COVID-19

Analisi esplorativa su oltre 420.000 osservazioni per identificare trend continentali, pattern europei e anomalie nei dati sanitari. prima seconda terza 4 5


🎯 Obiettivo del Progetto

Trasformare dati grezzi sul COVID-19 in insight strategici per:

  • Analizzare trend di diffusione a livello continentale
  • Confrontare l'impatto sanitario tra nazioni europee (Italia, Francia, Germania, Spagna)
  • Identificare anomalie nei dati che compromettono l'affidabilità delle analisi
  • Dimostrare competenze di Data Quality Assessment e pulizia dati complessi

Dataset

Fonte: Our World in Data - COVID-19 Dataset

Caratteristiche:

  • Osservazioni totali: 420.000+
  • Periodo temporale: 2020-2023
  • Granularità: Dati giornalieri per nazione
  • Metriche principali:
    • new_cases: Nuovi casi confermati
    • hosp_patients: Pazienti ospedalizzati
    • icu_patients: Pazienti in terapia intensiva
    • new_deaths: Nuovi decessi

Sfide del dataset:

  • Presenza di aggregazioni geografiche (World, Income groups) mescolate con dati nazionali
  • Valori nulli strutturali in alcune nazioni
  • Frequenza di registrazione variabile (giornaliera vs settimanale)

1. Exploratory Data Analysis (EDA) & Cleaning

Problema: Il dataset includeva righe aggregate (es. "World", "High income") che distorcevano le analisi nazionali.

Soluzione:

# Filtraggio righe con continent valido (esclude aggregazioni)
df_clean = df[df['continent'].notna()]

# Risultato: da 420k a 400k osservazioni puntuali per nazione

2. Analisi Temporale (Focus Italia 2022)

Problema: Visualizzazione "a scalini" della curva contagi dovuta a registrazioni settimanali.

Soluzione:

# Rimozione date con valori nulli per ottenere trend lineare coerente
df_italy_2022 = df_italy_2022[df_italy_2022['new_cases'].notna()]

Risultato: Curva smooth che mostra chiaramente i picchi stagionali.

3. Benchmarking Europeo (ICU & Ospedalizzazioni)

Confronto: Italia, Francia, Germania, Spagna (2021-2022)

Metriche:

  • Pazienti in terapia intensiva (icu_patients)
  • Pazienti ospedalizzati (hosp_patients)

Tools: Boxplot per variabilità, Bar Chart per confronto diretto.


Analisi 1: Trend Italia 2022

Insight:

  • Picco massimo: Gennaio 2022 (periodo Omicron)
  • Discesa graduale fino a Estate 2022
  • Ripresa autunnale contenuta

Analisi 2: Confronto ICU Europa

Insight:

  • Italia: Stabilità maggiore (IQR ridotto)
  • Germania: Alta variabilità (picchi improvvisi)
  • Francia/Spagna: Pattern intermedio

Analisi 3: Data Quality Issue - Germania 2021

Anomalia critica identificata:

# Check valori nulli Germania 2021 - hosp_patients
germany_2021_null = df_germany_2021['hosp_patients'].isna().sum()
# Risultato: 365/365 giorni (100%)

Decisione: ❌ NO imputation (media, mediana, modelli predittivi)
✅ Documentazione trasparente: "Dati non disponibili - impossibile stimare con attendibilità"

  • L'assenza totale di dati impedisce qualsiasi stima ragionevole
  • Inventare valori compromette l'integrità dell'analisi
  • Un Data Analyst deve saper dire "questo non posso calcolarlo"

Risultati Chiave

  1. Pulizia Dati:

    • Riduzione rumore del 5% (filtraggio aggregazioni)
    • Gestione corretta di valori nulli strutturali
  2. Insight Sanitari:

    • Italia mostra resilienza superiore nei reparti intensivi
    • Germania ha maggiore volatilità (possibile sottoreporting?)
  3. Data Quality:

    • Identificazione e documentazione anomalia critica (Germania 2021)
    • Approccio etico: trasparenza > completezza forzata

Tech Stack

Categoria Tecnologia
Linguaggio Python 3.10
Data Manipulation Pandas, NumPy
Visualizzazione Matplotlib, Seaborn
Notebook Jupyter Notebook
Version Control Git, GitHub

Autore

Simone Vitale
Data Analyst | Roma, Italia


📄 Licenza

Questo progetto è rilasciato sotto licenza MIT.


Ringraziamenti

  • Our World in Data per il dataset pubblico
  • EPICODE Institute of Technology per il supporto formativo
  • Community Python per documentazione e best practices

About

Analisi esplorativa COVID-19 su 420k osservazioni (Python, Pandas, Seaborn). Trend continentali, benchmarking ICU europeo, e gestione etica di anomalie nei dati. Focus su Data Quality e decisioni analitiche trasparenti.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages