Data Science per le Decisioni Strategiche è una materia del secondo anno di LM56 Pegaso — oggi Economia, Digital Data Analysis, Amministrazioni Pubbliche — da 6 CFU nel settore SECS-S/03. Nonostante il nome, non è un corso di programmazione: il suo filo conduttore è il percorso che porta un'azienda dalla strategia ai dati. Parte da come si costruisce e si valuta una strategia, passa alla statistica come primo strumento di misura, e arriva a data warehouse, data mining e big data. Un aspetto da sapere subito: lo Statutario e il curriculum PA hanno due codici con programmi diversi, e lo Statutario aggiunge due moduli giuridici su protezione dei dati e open data. Chi l'ha già sostenuto lo descrive come un esame fattibile ma da non sottovalutare, perché tocca discipline molto diverse tra loro.
Di cosa parla il programma
Obiettivi formativi ufficiali — programma Pegaso
- Inquadrare il tema della data science dal punto di vista teorico, alla luce dei più importanti contributi scientifici
- Descrivere i principali approcci di integrazione nelle decisioni strategiche alla base della data science
- Esaminare la correlazione, in termini di successione, tra statistica e scienza dei dati
- Individuare i principali campi applicativi in cui testare la validità e l'efficacia dell'interazione tra data science e decisioni strategiche
Cosa trovi in questa guida
Prima le differenze tra i due programmi, poi gli argomenti in quattro passaggi: la strategia, la statistica, le tecniche della data science e — solo per lo Statutario — le regole sui dati. La sezione si chiude con uno schema interattivo che ricollega tutto il percorso. Il metodo di studio operativo è in fondo, nella sezione Metodo di studio.
Il programma dichiara un obiettivo preciso: seguire il passaggio dalla statistica alla scienza dei dati e capire come i dati entrano nei processi decisionali dell'azienda. Per questo non parte dai dati, ma dalla strategia: prima si capisce che cosa un'azienda deve decidere, poi con quali informazioni.
- Direzione strategica — la strategia nel successo aziendale, creazione di valore, valutazione delle prestazioni, ambiente competitivo e posizionamento
- Dall'analisi di settore all'implementazione — analisi di settore e business model, teoria dei giochi, risorse e capitale umano, processo strategico, struttura organizzativa
- Statistica e dati — la statistica per la gestione aziendale, fonti interne ed esterne, indagine campionaria, interpretazione e comparazione dei dati, numeri indici sintetici
- Data science — data warehousing (architettura, modelli concettuali, ciclo di vita), data mining (regole associative, classificazione, clustering), big data (caratteristiche, aree di applicazione, impatti aziendali)
- Solo Statutario: dati personali e data protection — disciplina di riferimento, principi e liceità del trattamento, diritti dell'interessato, obblighi del titolare, strumenti giuridici
- Solo Statutario: open data e big data — diritti digitali dei cittadini e responsabilità della PA, open data, governo dei dati e degli algoritmi, profili giuridici ed etici dei big data
Due curricula, due programmi
Il codice non si sceglie: dipende dal curriculum. Nel piano dell'A.A. 2026/2027 lo Statutario ha il codice 0612406SECSS03, mentre il curriculum Governo e trasformazione digitale per la pubblica amministrazione ha il codice 0612506SECS03INM. Il nome è identico, il gruppo WhatsApp è lo stesso, ma i programmi ufficiali non coincidono: condividono strategia, numeri indici e data science, e divergono sul resto.
Controlla il PDF del tuo codice. Questa guida copre entrambi i programmi e segnala nei titoli le parti presenti in uno solo. I programmi possono essere aggiornati da un anno accademico all'altro: all'inizio del corso verifica sempre la versione pubblicata nella sezione Piano di studi della piattaforma.
| Codice | Curriculum | Lezioni | Tratti distintivi |
|---|---|---|---|
| 0612406SECSS03 | Statutario | 36 | 6 moduli; include protezione dei dati personali, open data e governance dei big data |
| 0612506SECS03INM | Governo e trasformazione digitale per la PA | 30 | Più statistica applicata: indagini statistiche, campionamento da popolazioni finite, regressione, casi di studio su clustering e regressione |
| 0612506SECS03NM | Innovation and Sustainability in the Digital Economy | — | Erogata in inglese come Data Science for Strategic Decisions; il PDF ufficiale non riporta ancora l'elenco delle lezioni |
Schema — Cosa cambia tra i due programmi in italiano
| Presenza | Argomenti |
|---|---|
| In entrambi | Strategia e direzione strategica, valore e prestazioni, analisi di settore, teoria dei giochi, risorse e vantaggio competitivo, struttura organizzativa, statistica per la gestione aziendale, fonti interne ed esterne, indagine campionaria, interpretazione dei dati, numeri indici, data warehousing, data mining (regole associative, classificazione, clustering), big data |
| Solo Statutario | Protezione dei dati personali (disciplina, principi, diritti, obblighi del titolare, strumenti giuridici), diritti digitali dei cittadini, open data, governo dei dati e degli algoritmi, profili giuridici, etici e sociali dei big data |
| Solo curriculum PA | Le indagini statistiche, campionamento da popolazioni finite e applicazioni su dati aziendali, regressione nel data mining, casi di studio su clustering e regressione |
Stai preparando questo esame? Nel gruppo trovi riassunti, schemi di studio e materiali condivisi dagli studenti — è lo stesso gruppo per Statutario e curriculum PA.
Argomenti del programma da approfondire
Il corso si capisce meglio come una catena: una strategia richiede decisioni; le decisioni richiedono informazioni; la statistica è stata il primo modo sistematico di produrle; quando i dati diventano tanti, integrati e continui, servono gli strumenti della data science; e quando i dati riguardano persone e istituzioni, servono regole. Rispetto all'ordine dei moduli ufficiali dello Statutario, qui le parti giuridiche vengono dopo le tecniche: per capire il governo dei big data è più semplice sapere prima che cosa sono.
| Passaggio | Domanda guida | Curricula |
|---|---|---|
| Strategia | Che cosa deve decidere un'azienda per avere successo? | Entrambi |
| Statistica | Come si producono e si leggono informazioni affidabili? | Entrambi (più ampia nel curriculum PA) |
| Data science | Come si organizzano e si esplorano grandi quantità di dati? | Entrambi |
| Regole sui dati | Quali limiti e quali opportunità pone il diritto? | Solo Statutario |
Mappa — la sequenza di questa guida
Strategia
- Strategia e direzione strategica
- Creazione di valore e valutazione delle prestazioni
- Analisi di settore, business model e posizionamento
- Strategia e teoria dei giochi
- Risorse, capitale umano e vantaggio competitivo
- Implementazione e struttura organizzativa
Statistica
- La statistica per la gestione aziendale e le fonti
- Indagini statistiche e campionamento
- Interpretare e confrontare i dati: rapporti e numeri indici
Data science
- Data warehousing
- Data mining
- Big data: caratteristiche, applicazioni e impatti
Regole sui dati (solo Statutario)
- Protezione dei dati personali
- Diritti digitali e open data
- Governo dei big data e degli algoritmi
- Sintesi: dalla statistica alla data science
Strategia e direzione strategica
Il corso parte da una domanda semplice: perché alcune aziende hanno successo e altre no? La risposta del programma è che il successo raramente è casuale, ma dipende da una strategia coerente: obiettivi chiari e di lungo periodo, una comprensione profonda dell'ambiente competitivo, una valutazione oggettiva delle proprie risorse e un'implementazione efficace. La pianificazione strategica è il processo con cui l'azienda traduce questa visione in obiettivi, scelte e allocazione delle risorse; la direzione strategica è la funzione che la guida nel tempo.
Una distinzione utile per leggere tutto il blocco è quella tra strategia deliberata, pianificata in anticipo dal vertice, e strategia emergente, che prende forma nel tempo dalle decisioni e dagli adattamenti quotidiani. Nella realtà le strategie efficaci combinano le due componenti: un disegno di fondo e la capacità di correggerlo quando l'ambiente cambia. Un rischio opposto è la cosiddetta miopia strategica, cioè concentrarsi sul prodotto o sui risultati di breve periodo perdendo di vista i bisogni dei clienti e l'evoluzione del mercato.
Schema — Gli ingredienti di una strategia di successo
| Elemento | Domanda a cui risponde |
|---|---|
| Obiettivi | Dove vuole arrivare l'azienda nel lungo periodo? |
| Ambiente esterno | Che cosa succede nel settore e tra i concorrenti? |
| Risorse interne | Su quali risorse e competenze può contare? |
| Implementazione | Come si traducono le scelte in organizzazione e azioni? |
Collegamento: per sapere se una strategia funziona serve un criterio di misura. Il programma lo individua nella creazione di valore e nella valutazione delle prestazioni.
Creazione di valore e valutazione delle prestazioni
Un'azienda crea valore quando ciò che produce vale, per i clienti, più delle risorse impiegate per produrlo. Il valore creato viene poi ripartito tra clienti, lavoratori, fornitori, finanziatori e proprietari. Dal punto di vista strategico il riferimento più usato è il profitto economico: il risultato che resta dopo aver remunerato anche il capitale investito, a differenza del profitto contabile che non considera il costo del capitale proprio. Un'azienda può quindi chiudere il bilancio in utile e, allo stesso tempo, non creare valore.
La valutazione delle prestazioni usa indicatori economico-finanziari — margini, redditività del capitale investito, flussi di cassa — e li scompone per capire da dove nascono i risultati: da prezzi, costi, efficienza nell'uso del capitale. Il programma sottolinea anche la componente ambientale: le prestazioni dipendono non solo dalle scelte interne ma dal contesto esterno in cui l'azienda opera, ed è per questo che la valutazione conduce naturalmente al posizionamento strategico, cioè alla scelta di dove e come competere.
Schema — Profitto contabile e profitto economico
| Misura | Cosa considera | Cosa segnala |
|---|---|---|
| Profitto contabile | Ricavi meno costi registrati in contabilità | Se l'azienda è in utile |
| Profitto economico | Profitto contabile meno il costo di tutto il capitale investito | Se l'azienda crea davvero valore |
Collegamento: se le prestazioni dipendono anche dall'ambiente, il passo successivo è analizzarlo in modo sistematico — a partire dal settore in cui l'azienda compete.
Analisi di settore, business model e posizionamento
Lo strumento classico per analizzare un settore è il modello delle cinque forze competitive di Michael Porter: la redditività di un settore dipende dalla rivalità tra i concorrenti esistenti, dalla minaccia di nuovi entranti, dalla minaccia di prodotti sostitutivi e dal potere contrattuale di fornitori e clienti. Più queste forze sono intense, più è difficile ottenere profitti elevati. L'analisi permette di capire la composizione del mercato e dove l'impresa può collocarsi.
Il business model descrive invece come una specifica azienda crea, distribuisce e trattiene valore: a quali clienti si rivolge, con quale proposta, attraverso quali canali, con quale struttura di costi e ricavi. Da qui nasce il posizionamento strategico: la scelta di competere, ad esempio, puntando su costi più bassi dei concorrenti oppure su un'offerta differenziata per cui i clienti sono disposti a pagare di più, rivolgendosi all'intero mercato o a un segmento specifico.
Schema — Le cinque forze competitive
| Forza | Quando è forte |
|---|---|
| Rivalità tra concorrenti | Molti concorrenti simili, crescita lenta, costi fissi alti |
| Minaccia di nuovi entranti | Barriere all'ingresso basse |
| Minaccia di sostituti | Esistono alternative che soddisfano lo stesso bisogno |
| Potere dei fornitori | Pochi fornitori, input difficili da sostituire |
| Potere dei clienti | Clienti concentrati, prodotti standardizzati, bassi costi di cambio |
Collegamento: le cinque forze fotografano la struttura del settore, ma non spiegano come i concorrenti reagiscono alle mosse l'uno dell'altro. Per questo il programma introduce la teoria dei giochi.
Strategia e teoria dei giochi
La teoria dei giochi studia le situazioni in cui il risultato di una decisione dipende anche dalle decisioni degli altri. Applicata alla strategia, aiuta a prevedere come reagiranno i concorrenti a un taglio dei prezzi, a un nuovo prodotto, a un investimento. L'esempio più noto è il dilemma del prigioniero: ciascun giocatore ha interesse a scegliere l'opzione più aggressiva qualunque cosa faccia l'altro, ma se lo fanno entrambi finiscono in una situazione peggiore di quella che otterrebbero cooperando. La combinazione in cui nessuno ha convenienza a cambiare scelta da solo è l'equilibrio di Nash.
Il programma usa questi concetti per leggere comportamenti strategici concreti: la cooperazione che può emergere quando il gioco si ripete nel tempo; il commitment strategico, cioè un impegno credibile e difficilmente reversibile (ad esempio un grande investimento in capacità produttiva) che modifica le aspettative dei concorrenti; la dissuasione all'ingresso di nuovi concorrenti, e i segnali con cui un'impresa comunica le proprie intenzioni al mercato.
Schema — Un dilemma del prigioniero sui prezzi (profitti illustrativi: impresa A / impresa B)
| B mantiene il prezzo alto | B taglia il prezzo | |
|---|---|---|
| A mantiene il prezzo alto | 10 / 10 | 3 / 15 |
| A taglia il prezzo | 15 / 3 | 5 / 5 — equilibrio di Nash |
Qualunque cosa faccia l'altra impresa, a ciascuna conviene tagliare il prezzo (15 > 10 e 5 > 3): entrambe lo fanno e ottengono 5, meno dei 10 che avrebbero con prezzi alti. È il motivo per cui nei settori concentrati la cooperazione tacita, il commitment e la reputazione contano quanto il prezzo.
Collegamento: sapersi muovere rispetto ai concorrenti non basta se l'azienda non ha qualcosa che gli altri non possono facilmente copiare. Il programma passa quindi dall'esterno all'interno: risorse e competenze.
Risorse, capitale umano e vantaggio competitivo
Gli asset aziendali si distinguono in risorse tangibili (impianti, liquidità), intangibili (tecnologia, marchi, reputazione, cultura organizzativa) e umane. Le competenze sono la capacità di combinare queste risorse per svolgere attività in modo efficace: un'azienda non vince perché possiede un macchinario, ma perché sa usarlo meglio degli altri. Un vantaggio competitivo nasce quando risorse e competenze sono rilevanti per il mercato, scarse e, per durare nel tempo, difficili da imitare o da acquistare da parte dei concorrenti.
Il programma dedica una lezione specifica al capitale umano: conoscenze, abilità ed esperienza delle persone sono spesso la risorsa più difficile da replicare, perché incorporata nelle relazioni e nei modi di lavorare dell'organizzazione. È anche il collegamento naturale con la data science: senza persone capaci di interpretare i dati, i dati da soli non producono vantaggio.
Schema — Quando una risorsa genera vantaggio duraturo
| Condizione | Domanda di verifica |
|---|---|
| Rilevanza | Serve davvero a creare valore per i clienti? |
| Scarsità | È posseduta da poche imprese? |
| Difficile imitabilità | I concorrenti faticano a replicarla o sostituirla? |
| Appropriabilità | Il valore generato resta all'azienda? |
Collegamento: una strategia costruita su ambiente e risorse deve infine diventare operativa. L'ultimo passaggio del blocco strategico riguarda il processo di implementazione e l'organizzazione.
Implementazione e struttura organizzativa
Il processo della strategia d'impresa non si ferma alla formulazione: comprende la traduzione delle scelte in obiettivi, piani e budget, l'allocazione delle risorse, il monitoraggio dei risultati e la loro correzione. Perché funzioni, l'organizzazione deve essere coerente con la strategia — l'idea sintetizzata nella formula "la struttura segue la strategia". Il programma presenta le principali strutture organizzative: la struttura funzionale, organizzata per specializzazione; la struttura divisionale, organizzata per prodotti, mercati o aree geografiche; la struttura a matrice, che combina le due dimensioni.
Schema — Strutture organizzative a confronto
| Struttura | Criterio | Punto di forza | Limite |
|---|---|---|---|
| Funzionale | Funzioni (produzione, marketing, finanza) | Specializzazione ed efficienza | Coordinamento difficile con molti prodotti |
| Divisionale | Prodotti, mercati o aree | Vicinanza al mercato, responsabilità chiare | Duplicazione di risorse |
| A matrice | Funzioni e prodotti insieme | Flessibilità e integrazione | Doppia linea di comando, possibili conflitti |
Collegamento: formulare, implementare e controllare una strategia richiede informazioni affidabili in ogni fase. Il primo strumento con cui le aziende le hanno prodotte in modo sistematico è la statistica — ed è da qui che il programma costruisce il ponte verso la data science.
La statistica per la gestione aziendale e le fonti
La statistica entra nella gestione aziendale ogni volta che una decisione richiede di misurare un fenomeno: l'andamento delle vendite, la soddisfazione dei clienti, i costi, il mercato. Il programma distingue innanzitutto le fonti interne, prodotte dall'attività stessa dell'azienda — contabilità e bilancio, vendite, magazzino, personale, sistemi di gestione dei clienti — dalle fonti esterne, prodotte da altri soggetti: istituti statistici come ISTAT ed Eurostat, banche centrali, camere di commercio, associazioni di categoria, ricerche di mercato. Tra le fonti esterne rientrano oggi anche i big data generati da web, social network, sensori e transazioni digitali.
Una seconda distinzione riguarda la natura del dato: i dati primari vengono raccolti appositamente per lo scopo dell'analisi (ad esempio con un'indagine), i dati secondari esistono già perché raccolti per altri fini. I secondi sono più economici e rapidi, i primi più aderenti alla domanda di ricerca.
Schema — Fonti di informazione aziendale
| Fonte | Esempi | Vantaggi | Limiti |
|---|---|---|---|
| Interna | Contabilità, vendite, magazzino, CRM | Disponibile, specifica dell'azienda | Non dice nulla del mercato esterno |
| Esterna ufficiale | ISTAT, Eurostat, camere di commercio | Affidabile, confrontabile nel tempo | Poco dettagliata, pubblicata con ritardo |
| Big data | Web, social, sensori, transazioni | Volumi enormi, quasi in tempo reale | Qualità e rappresentatività da verificare |
Collegamento: quando i dati che servono non esistono, bisogna produrli. Il modo più diffuso di farlo senza interrogare tutta la popolazione è l'indagine campionaria.
Indagini statistiche e campionamento
Un'indagine statistica può essere totale, quando rileva tutte le unità della popolazione (come un censimento), o campionaria, quando ne osserva solo una parte per trarre conclusioni sull'intero. Il campione riduce costi e tempi, ma introduce un'incertezza che va governata. Le fasi tipiche sono: definizione degli obiettivi e della popolazione di riferimento, scelta della lista da cui estrarre le unità, disegno del campione, costruzione del questionario, rilevazione, controllo ed elaborazione dei dati.
Il campionamento probabilistico assegna a ogni unità una probabilità nota di essere estratta — casuale semplice, sistematico, stratificato, a grappoli — e consente di misurare l'errore. Il campionamento non probabilistico (per quote, di convenienza) è più rapido ma non permette la stessa inferenza. Va distinto l'errore campionario, dovuto al fatto di osservare solo una parte della popolazione, dagli errori non campionari — mancate risposte, domande mal formulate, liste incomplete — che possono essere anche più gravi e non si riducono aumentando il campione. Il curriculum PA approfondisce il campionamento da popolazioni finite, tipico dei dati aziendali: quando si estrae senza reinserimento da una popolazione di dimensione nota, la variabilità delle stime va corretta per tenere conto della quota di popolazione già osservata.
Schema — Tecniche di campionamento probabilistico
| Tecnica | Come funziona | Esempio aziendale |
|---|---|---|
| Casuale semplice | Ogni unità ha la stessa probabilità di essere estratta | Estrarre 200 clienti a caso dall'anagrafica |
| Sistematico | Si estrae un'unità ogni k dalla lista | Controllare una fattura ogni 50 |
| Stratificato | Si divide la popolazione in strati omogenei e si campiona in ciascuno | Clienti divisi per area geografica |
| A grappoli | Si estraggono gruppi interi di unità | Intervistare tutti i dipendenti di alcuni punti vendita |
Collegamento: raccolti i dati, bisogna renderli leggibili e confrontabili — tra periodi, aziende e territori diversi. È il compito di rapporti statistici e numeri indici.
Interpretare e confrontare i dati: rapporti e numeri indici
Un dato assoluto dice poco se non viene messo in relazione con altro. I rapporti statistici servono a questo: i rapporti di composizione confrontano una parte con il tutto (quota delle vendite online sul fatturato), quelli di derivazione mettono in relazione un fenomeno con quello da cui deriva (reclami per cliente servito), quelli di densità rapportano un fenomeno a un'estensione (vendite per metro quadro), quelli di coesistenza confrontano due fenomeni che convivono (dipendenti a tempo determinato su indeterminato). Per il confronto nel tempo si usano variazioni assolute e percentuali e i numeri indici semplici, a base fissa (tutti i periodi confrontati con un anno di riferimento) o a base mobile (ogni periodo confrontato con il precedente).
Quando si vuole sintetizzare in un solo numero la variazione dei prezzi di molti beni diversi servono i numeri indici sintetici, che pesano ciascun prezzo con le quantità. L'indice di Laspeyres usa le quantità dell'anno base, quello di Paasche le quantità dell'anno corrente, quello di Fisher è la media geometrica dei due. Sono gli stessi strumenti alla base degli indici dei prezzi ufficiali: l'ISTAT pubblica ad esempio l'indice NIC (per l'intera collettività nazionale), il FOI (per le famiglie di operai e impiegati) e l'IPCA armonizzato a livello europeo, costruiti come indici a catena di tipo Laspeyres.
Schema — Prezzi e quantità di due beni (dati illustrativi)
| Bene | Prezzo base p₀ | Quantità base q₀ | Prezzo corrente p₁ | Quantità corrente q₁ |
|---|---|---|---|---|
| A | 2,00 € | 10 | 3,00 € | 8 |
| B | 5,00 € | 4 | 5,50 € | 6 |
Prova a calcolare l'indice dei prezzi
Laspeyres = 130,0: i prezzi sono aumentati del 30% se si mantengono le quantità dell'anno base. Poiché il bene A è rincarato molto e i consumatori ne hanno comprato meno, pesarlo con le vecchie quantità dà un aumento più alto. L'indice di Fisher, media geometrica tra 130,0 e 123,9, vale circa 126,9.
Collegamento: rapporti e indici funzionano bene su dati ordinati e circoscritti. Quando un'azienda accumula dati da decine di sistemi diversi, prima di analizzarli deve integrarli e organizzarli: nasce così il data warehouse.
Data warehousing
I sistemi operativi di un'azienda (contabilità, ordini, magazzino) sono progettati per registrare transazioni rapidamente, non per analizzarle: si parla di sistemi OLTP. Il data warehouse nasce per l'analisi: è un archivio orientato ai soggetti di interesse (clienti, prodotti, vendite), integrato a partire da fonti diverse, storicizzato nel tempo e non volatile, cioè i dati caricati non vengono sovrascritti dalle operazioni quotidiane. Su di esso lavorano gli strumenti di analisi OLAP, che permettono di aggregare i dati (roll-up), scendere nel dettaglio (drill-down) e selezionare porzioni di interesse (slice and dice).
La metodologia e architettura ruota attorno al processo di alimentazione ETL — estrazione dai sistemi sorgente, trasformazione e pulizia, caricamento — e può prevedere, oltre al data warehouse centrale, dei data mart dedicati a singole aree aziendali. I modelli concettuali descrivono i dati in termini di fatti (gli eventi da analizzare, come una vendita), misure (le quantità numeriche, come importo e quantità) e dimensioni (le prospettive di analisi, come tempo, prodotto, punto vendita), organizzate in gerarchie; a livello logico si traducono tipicamente in uno schema a stella, con una tabella dei fatti al centro collegata alle tabelle delle dimensioni. Il ciclo di vita comprende analisi dei requisiti, progettazione concettuale, logica e fisica, alimentazione, verifica e manutenzione, spesso con uno sviluppo incrementale un data mart alla volta.
Schema — Sistemi operazionali e data warehouse
| Aspetto | Sistema operazionale (OLTP) | Data warehouse (OLAP) |
|---|---|---|
| Scopo | Registrare le transazioni | Analizzare e supportare le decisioni |
| Dati | Correnti, dettagliati, aggiornati di continuo | Storici, integrati, spesso aggregati |
| Operazioni tipiche | Inserimenti e modifiche puntuali | Interrogazioni complesse su grandi volumi |
| Utenti | Operatori | Analisti e management |
Collegamento: il data warehouse risponde bene a domande che l'analista sa già porre. Per scoprire schemi che nessuno ha ancora ipotizzato servono le tecniche del data mining.
Data mining
Il data mining è la fase centrale di un processo più ampio di scoperta della conoscenza nei dati: selezione dei dati, pulizia e preparazione, trasformazione, applicazione degli algoritmi, interpretazione e valutazione dei risultati. Il programma presenta le principali famiglie di tecniche. Le analisi associative cercano elementi che compaiono spesso insieme, come i prodotti acquistati nello stesso scontrino (market basket analysis), e valutano ogni regola con supporto (quanto spesso la combinazione compare), confidenza (quanto spesso, dato il primo elemento, compare anche il secondo) e lift (quanto la relazione è più forte di quella attesa per caso).
La classificazione assegna nuovi casi a categorie già note, imparando da esempi di cui la categoria è conosciuta: ad esempio con un albero decisionale addestrato su clienti passati. Il clustering fa l'opposto: raggruppa i casi simili senza categorie decise in anticipo, con metodi gerarchici, partizionali (come k-means) o basati sulla densità, che individuano i gruppi come zone dense di punti e riconoscono i punti isolati come anomalie. Il curriculum PA aggiunge la regressione, che stima una variabile numerica — come le vendite — a partire da altre variabili, e due casi di studio applicativi su clustering e regressione.
Schema — Una regola associativa su 1.000 scontrini (dati illustrativi)
| Misura | Calcolo per la regola "pane → burro" | Lettura |
|---|---|---|
| Supporto | 150 scontrini con pane e burro / 1.000 = 15% | La combinazione è frequente |
| Confidenza | 150 / 400 scontrini con pane = 37,5% | Chi compra pane compra burro nel 37,5% dei casi |
| Lift | 37,5% / 20% (scontrini con burro: 200 / 1.000) = 1,875 | Maggiore di 1: il pane rende l'acquisto di burro più probabile del normale |
Prova a classificare: che tipo di tecnica serve?
Supervisionata
—
Non supervisionata
—
Collegamento: data warehouse e data mining sono nati su dati strutturati e di dimensioni gestibili. Quando i dati diventano enormi, velocissimi ed eterogenei, cambiano le tecnologie e cambia l'impatto sull'azienda: è il tema dei big data.
Big data: caratteristiche, applicazioni e impatti
I big data vengono descritti attraverso alcune caratteristiche, spesso chiamate "V": volume (quantità di dati tali da superare gli strumenti tradizionali), velocità (dati generati e da elaborare in tempo quasi reale), varietà (dati strutturati, semi-strutturati e non strutturati, come testi, immagini, log e flussi da sensori), a cui si aggiungono veridicità (affidabilità e qualità del dato) e valore (la capacità di trasformarli in decisioni utili). Per gestirli si usano architetture distribuite e database NoSQL, che rinunciano allo schema rigido delle tabelle relazionali per scalare su grandi volumi e dati eterogenei, ed elaborazioni in streaming quando la latenza — il tempo tra la produzione del dato e la sua disponibilità per l'analisi — deve essere minima.
Le aree di applicazione sono ampie: personalizzazione delle offerte e prezzi dinamici nel marketing, manutenzione predittiva nell'industria, ottimizzazione della logistica, individuazione delle frodi nella finanza, gestione dei servizi pubblici e della mobilità. Gli impatti aziendali riguardano il modo stesso di decidere — più basato sull'evidenza e più rapido — ma anche l'organizzazione: servono nuove competenze, nuove figure professionali e una cultura del dato diffusa, oltre a investimenti in qualità, sicurezza e governo dei dati.
Schema — Le caratteristiche dei big data
| Caratteristica | Significato | Conseguenza tecnologica o gestionale |
|---|---|---|
| Volume | Quantità di dati molto elevate | Archiviazione ed elaborazione distribuite |
| Velocità | Flussi continui, da analizzare in fretta | Elaborazione in streaming, bassa latenza |
| Varietà | Formati strutturati e non strutturati | Database NoSQL e schemi flessibili |
| Veridicità | Qualità e affidabilità variabili | Controlli di qualità e pulizia dei dati |
| Valore | Utilità per le decisioni | Competenze analitiche e obiettivi chiari |
Collegamento: gran parte dei big data riguarda persone — clienti, utenti, cittadini. Per questo il programma dello Statutario affianca alle tecniche un blocco giuridico, che parte dalla protezione dei dati personali. Chi segue il curriculum PA può passare direttamente alla sintesi finale.
Protezione dei dati personali (solo Statutario)
La protezione dei dati personali è un diritto fondamentale riconosciuto dalla Carta dei diritti fondamentali dell'Unione europea. La disciplina di riferimento è il Regolamento (UE) 2016/679, il GDPR, applicabile dal 25 maggio 2018, affiancato in Italia dal Codice privacy (D.Lgs. 196/2003) adeguato con il D.Lgs. 101/2018. Il suo ambito di applicazione copre i trattamenti di dati di persone fisiche identificate o identificabili, svolti da chi è stabilito nell'Unione o da chi, pur fuori dall'UE, offre beni e servizi o monitora il comportamento di persone che si trovano nell'Unione.
Ogni trattamento deve rispettare i principi dell'art. 5 — liceità, correttezza e trasparenza; limitazione della finalità; minimizzazione dei dati; esattezza; limitazione della conservazione; integrità e riservatezza; responsabilizzazione — e poggiare su una delle condizioni di liceità dell'art. 6: consenso, esecuzione di un contratto, obbligo legale, interessi vitali, interesse pubblico, legittimo interesse. La trasparenza si traduce nell'informativa, che spiega all'interessato chi tratta i suoi dati, per quali finalità e con quali diritti. I diritti dell'interessato comprendono accesso, rettifica, cancellazione (il cosiddetto diritto all'oblio), limitazione, portabilità, opposizione e il diritto a non essere sottoposto a decisioni basate unicamente su trattamenti automatizzati — un punto che tocca direttamente l'uso della data science.
Sul fronte degli obblighi e responsabilità, il titolare del trattamento decide finalità e mezzi e deve essere in grado di dimostrare il rispetto del Regolamento (accountability): protezione dei dati fin dalla progettazione e per impostazione predefinita, registro dei trattamenti, misure di sicurezza, valutazione d'impatto per i trattamenti ad alto rischio, notifica delle violazioni all'autorità entro 72 ore. Il responsabile del trattamento tratta i dati per conto del titolare; in alcuni casi va nominato un responsabile della protezione dei dati (DPO). Tra gli strumenti giuridici rientrano l'autorità di controllo — in Italia il Garante per la protezione dei dati personali — i codici di condotta, le certificazioni, le regole sui trasferimenti di dati fuori dall'UE e le sanzioni amministrative, che possono arrivare a 20 milioni di euro o al 4% del fatturato mondiale annuo.
Schema — Dati, trattamento e soggetti
| Soggetto / concetto | Ruolo |
|---|---|
| Interessato | La persona fisica a cui i dati si riferiscono |
| Titolare | Decide finalità e mezzi del trattamento e ne risponde |
| Responsabile | Tratta i dati per conto del titolare, sulla base di un contratto |
| DPO | Figura di consulenza e controllo interno sulla protezione dei dati |
| Trattamento | Qualsiasi operazione sui dati: raccolta, conservazione, consultazione, comunicazione, cancellazione |
Collegamento: il GDPR tutela le persone dall'uso improprio dei loro dati. Il programma considera poi il lato opposto: i dati che la pubblica amministrazione deve rendere accessibili a tutti, e i diritti digitali dei cittadini.
Diritti digitali e open data (solo Statutario)
In Italia i diritti digitali dei cittadini sono raccolti nel Codice dell'Amministrazione Digitale (D.Lgs. 82/2005), che riconosce ad esempio il diritto a usare le tecnologie nei rapporti con la pubblica amministrazione, l'identità e il domicilio digitale, e pone in capo alle amministrazioni la responsabilità di organizzare servizi e dati in modo digitale e accessibile. Tra questi obblighi rientra la valorizzazione del patrimonio informativo pubblico.
Gli open data sono dati resi disponibili con una licenza che ne consente il riuso da parte di chiunque, anche per fini commerciali, in formati aperti e leggibili automaticamente, gratuitamente o a costi marginali. Le loro finalità sono la trasparenza dell'azione pubblica, la partecipazione dei cittadini e la creazione di valore economico da parte di imprese che li riutilizzano. Il CAD stabilisce il principio dell'"open by default": i dati pubblicati dalle amministrazioni senza una licenza specifica si considerano aperti. Tra norme e strategie spiccano la Direttiva (UE) 2019/1024 sui dati aperti, recepita in Italia con il D.Lgs. 200/2021, che introduce anche le serie di dati di elevato valore da rendere disponibili gratuitamente; la strategia europea per i dati, con il Data Governance Act e il Data Act; e, a livello nazionale, le linee guida AgID e il catalogo nazionale dati.gov.it.
Schema — Dati personali e open data a confronto
| Aspetto | Dati personali | Open data |
|---|---|---|
| Logica di fondo | Protezione della persona | Apertura e riuso |
| Riferimento normativo | GDPR e Codice privacy | CAD, Direttiva (UE) 2019/1024 |
| Esempio | Dati anagrafici e sanitari di un cittadino | Orari del trasporto pubblico, bilanci comunali |
| Punto di contatto | Prima di aprire un dataset va verificato che non contenga dati personali o che siano resi anonimi | |
Collegamento: open data e dati personali sono due casi particolari di un problema più generale — come governare dati e algoritmi quando assumono le dimensioni dei big data.
Governo dei big data e degli algoritmi (solo Statutario)
Il governo dei dati e degli algoritmi parte da un riconoscimento: i big data non sono solo una risorsa tecnica, ma un fattore di potere economico e sociale. I loro profili giuridici riguardano la protezione dei dati personali e la profilazione, la proprietà e l'accesso ai dati, la concorrenza tra grandi piattaforme; quelli etici e sociali riguardano il rischio di discriminazioni prodotte da algoritmi addestrati su dati distorti, l'opacità di decisioni automatizzate difficili da spiegare, la sorveglianza e le disuguaglianze nell'accesso alle tecnologie. A livello europeo, il Regolamento sull'intelligenza artificiale (2024) introduce obblighi graduati in base al rischio dei sistemi.
I framework e gli strumenti di governance traducono questi principi in organizzazione: politiche su chi può accedere a quali dati e a quali condizioni, ruoli definiti (chi è responsabile di un insieme di dati e chi ne cura la qualità), processi di controllo della qualità e della sicurezza, gestione dell'intero ciclo di vita del dato, valutazioni d'impatto sui trattamenti più rischiosi. Un riferimento diffuso per i dati della ricerca e della PA sono i principi FAIR: dati reperibili, accessibili, interoperabili e riutilizzabili.
Schema — Dai rischi agli strumenti di governance
| Rischio | Strumento di governo |
|---|---|
| Violazione della privacy e profilazione eccessiva | Minimizzazione, anonimizzazione, valutazione d'impatto |
| Discriminazione algoritmica | Controllo dei dati di addestramento, verifiche sui risultati |
| Decisioni opache | Trasparenza, spiegabilità, supervisione umana |
| Dati di scarsa qualità | Ruoli di responsabilità sui dati, controlli di qualità |
Collegamento: con le regole si chiude il percorso che il corso aveva annunciato fin dagli obiettivi — dalla statistica alla scienza dei dati. Lo schema finale lo rilegge tutto in parallelo.
Sintesi: dalla statistica alla data science
Uno degli obiettivi formativi del corso è comprendere la successione tra statistica e scienza dei dati. Non si tratta di strumenti che si sostituiscono, ma di livelli che si sommano: la statistica misura e confronta, il data warehouse integra, il data mining scopre, i big data estendono tutto a volumi e velocità nuovi. Scegli una dimensione per vedere come cambia ciascun passaggio.
Confronta i quattro livelli
| Dimensione | Statistica aziendale | Data warehouse | Data mining | Big data |
|---|---|---|---|---|
| Domanda | Quanto misura il fenomeno e come cambia? | Dove trovo dati integrati e storicizzati? | Quali schemi nascosti ci sono nei dati? | Come usare dati enormi, veloci ed eterogenei? |
| Dati | Campioni e fonti interne o esterne strutturate | Dati di più sistemi, integrati per fatti e dimensioni | Grandi basi di dati già preparate | Volumi massivi, anche non strutturati e in tempo reale |
| Strumenti | Indagini campionarie, rapporti, numeri indici | ETL, schema a stella, analisi OLAP | Regole associative, classificazione, clustering, regressione | Database NoSQL, elaborazione distribuita e in streaming |
| Esempio di decisione | Confrontare l'andamento dei propri prezzi con l'inflazione | Analizzare le vendite per area, periodo e prodotto | Individuare segmenti di clienti per il posizionamento | Adattare offerte e prezzi quasi in tempo reale |
Ogni livello risponde a una domanda diversa: dalla misura di un fenomeno alla scoperta di schemi nascosti, fino alla gestione di dati che cambiano in continuo.
Metodo di studio consigliato
Alcuni criteri utili per organizzare lo studio, tra struttura del programma e consigli condivisi da chi ha già dato l'esame:
- Parti dal PDF del tuo codice. Statutario e curriculum PA non studiano esattamente le stesse lezioni: sapere subito se hai i moduli giuridici o la statistica applicata evita di perdere tempo su parti non previste.
- Leggi il blocco strategico come una sequenza di domande, non come un elenco di modelli: che cosa vuole ottenere l'azienda, in che settore compete, come reagiscono i concorrenti, su quali risorse può contare, come si organizza.
- Esercitati a mano su rapporti e numeri indici con piccoli esempi come quello di questa guida. Chi ha già sostenuto l'esame segnala questa parte quantitativa come quella che richiede più attenzione, perché non basta memorizzarla.
- Fissa le coppie di concetti vicini: strategia deliberata ed emergente, profitto contabile ed economico, indagine totale e campionaria, errore campionario e non campionario, OLTP e OLAP, classificazione e clustering, supporto e confidenza, titolare e responsabile del trattamento.
- Collega ogni tecnica a una decisione aziendale. È l'ultimo obiettivo formativo del corso, e il modo più efficace per ricordare a che cosa serve ciascuno strumento.
- Non limitarti a una sola fonte. Tra i consigli più condivisi da chi l'ha già dato c'è quello di seguire le videolezioni, studiare le dispense e usare i testi consigliati nel programma sugli argomenti meno chiari.
- Usa i test di autovalutazione di fine lezione per verificare la comprensione, e torna sulle dispense degli argomenti in cui sbagli di più.
Studia con chi sta preparando questo esame ora — unisciti al gruppo e confrontati sulle parti più quantitative del programma.
Domande e dubbi frequenti tra chi si prepara a questo esame
- Le dispense bastano o conviene integrarle?
- Il programma ufficiale indica che il materiale fornito è sufficiente per l'esame. Chi l'ha già sostenuto consiglia comunque di affiancare videolezioni e dispense e, sugli argomenti meno chiari come campionamento e numeri indici, di consultare i testi consigliati nel programma.
- Bisogna sapere le formule?
- Il programma contiene argomenti quantitativi — rapporti statistici, numeri indici sintetici, campionamento, misure delle regole associative — quindi conviene conoscere la logica delle formule principali e saperle applicare su esempi semplici. Non è però un corso di statistica matematica né di programmazione.
- È prevista la didattica interattiva?
- Sì: il programma prevede attività di didattica interattiva come web conference, forum tematico e prove in itinere con feedback. Calendario ed eventuali premialità seguono le regole pubblicate in piattaforma, che possono cambiare da un anno accademico all'altro.
- Seguo il curriculum in inglese: questa guida vale anche per me?
- In parte. Data Science for Strategic Decisions ha lo stesso settore e gli stessi CFU, ma il PDF ufficiale non riporta ancora l'elenco delle lezioni: gli argomenti comuni ai due programmi in italiano (strategia, statistica, data mining, big data) sono un buon riferimento, ma controlla il programma del tuo codice in piattaforma.
Come funziona l'esame
Come tutti gli esami Pegaso, Mercatorum e San Raffaele dal 2026: prova intermedia online seguita da prova finale strutturata in presenza per verbalizzare il voto definitivo.
Le modalità cambiano frequentemente: numero di domande, sessioni in presenza, punti premialità. Trovi tutto spiegato nella guida completa, sempre aggiornata:
Come funzionano gli esami Pegaso, Mercatorum e San Raffaele →Quanto tempo serve
Per 6 CFU, chi arriva da una triennale economica con basi di statistica e di strategia d'impresa può mettere in conto circa 2 settimane di studio costante: una per strategia e statistica, una per data science e — nello Statutario — i moduli giuridici, lasciando qualche giorno al ripasso. Senza basi statistiche conviene prevedere almeno 3 settimane, dedicando tempo in più a campionamento, rapporti e numeri indici.
Il blocco giuridico dello Statutario è concettualmente più lineare ma denso di definizioni e riferimenti normativi: meglio studiarlo a piccole dosi e ripassarlo più volte, invece di concentrarlo negli ultimi giorni.
Questa materia ti prepara a…
Data Science per le Decisioni Strategiche è la prima materia di LM56 pubblicata su questa guida — le altre arriveranno progressivamente. Si collega direttamente a:
- Sistemi di Reporting, Programmazione e Controllo (1° anno, Statutario) — dove i dati diventano indicatori per pianificare e controllare le prestazioni
- Marketing Internazionale (2° anno, Statutario) — dove segmentazione e analisi dei dati di mercato sostengono il posizionamento
- Contabilità Pubblica e Valutazione della Performance nella PA (1° anno, curriculum PA) — per l'uso di dati e indicatori nella valutazione delle amministrazioni
- Procedimento Amministrativo e Trasparenza (2° anno, curriculum PA) — per il legame tra dati pubblici, accesso e trasparenza
- Statistica L18 Pegaso e Teorie e Governo dell'Impresa L18 Pegaso — utili come ripasso delle basi per chi arriva dalla triennale
- Gruppi studio LM56 Pegaso — i tre curricula, il piano di studi e tutti i gruppi del corso
Prepari Data Science per le Decisioni Strategiche in questo periodo? Trova il gruppo della tua materia.
Domande frequenti
6 CFU, settore SECS-S/03, al 2° anno. Il codice dipende dal curriculum: 0612406SECSS03 per lo Statutario e 0612506SECS03INM per Governo e trasformazione digitale per la pubblica amministrazione. Nel curriculum Innovation and Sustainability in the Digital Economy la materia è erogata in inglese come Data Science for Strategic Decisions (0612506SECS03NM).
No. Il codice dello Statutario (0612406SECSS03) ha 36 lezioni in 6 moduli e include due moduli giuridici, su protezione dei dati personali e su open data e big data. Il codice del curriculum PA (0612506SECS03INM) ha 30 lezioni: non ha quei due moduli, ma approfondisce indagini statistiche, campionamento, regressione e casi di studio. Strategia aziendale, numeri indici, data warehousing, data mining e big data sono comuni.
No: nel programma non ci sono lezioni di programmazione. Il corso affronta la data science dal punto di vista delle decisioni aziendali — strategia, statistica, numeri indici, logica di data warehouse e data mining, caratteristiche dei big data — e, nel curriculum Statutario, i profili giuridici dei dati. Servono però familiarità con i concetti statistici di base e la capacità di leggere formule semplici.
Sono numeri indici sintetici dei prezzi. Laspeyres pesa le variazioni di prezzo con le quantità dell'anno base, Paasche con le quantità dell'anno corrente, Fisher è la media geometrica dei due. Quando i consumatori sostituiscono i beni rincarati con altri, Laspeyres tende a dare un valore più alto e Paasche uno più basso; Fisher si colloca tra i due.
Il data warehouse è l'archivio: raccoglie dati da più fonti aziendali, li integra e li conserva nel tempo in una struttura pensata per l'analisi. Il data mining è l'insieme delle tecniche che esplorano quei dati per scoprire schemi non evidenti, come regole associative, classificazioni e cluster. Il primo prepara il terreno, il secondo estrae conoscenza.
Come per gli altri esami Pegaso: prova intermedia online seguita da una prova finale in presenza per verbalizzare il voto. Le modalità cambiano spesso: per i dettagli aggiornati leggi la guida sugli esami Pegaso, Mercatorum e San Raffaele.
Il programma dello Statutario precisa che per l'esame è sufficiente il materiale didattico fornito. Per approfondimenti volontari rimanda alla bibliografia delle dispense e a due manuali Pearson: Statistica per le decisioni aziendali (seconda edizione, 2023) e Sistemi informativi aziendali (terza edizione, 2018).