I dati personali non restano nel luogo in cui vengono raccolti. Attraversano infrastrutture cloud, applicazioni, fornitori, archivi e sistemi di analisi. Possono essere combinati, arricchiti, trasformati e, in alcuni casi, utilizzati per addestrare modelli di intelligenza artificiale.
Il GDPR offre già strumenti essenziali per governare il trattamento dei dati personali lungo il loro ciclo di vita, dalla definizione delle finalità alla valutazione dei rischi, fino alla documentazione delle responsabilità e dei flussi.
Nelle infrastrutture digitali più complesse, tuttavia, tali strumenti possono essere utilmente integrati da una ricostruzione più puntuale di origine, trasformazioni e impieghi dei dataset.
Il GDPR presidia la liceità del trattamento lungo la traiettoria dei dati personali e l’AI Act, per i sistemi ad alto rischio, attribuisce rilievo alla formazione dei dataset di training, validazione e test.
Fonti, selezioni, modalità di preparazione, qualità, lacune e bias diventano elementi rilevanti per la conformità e per la gestione dei rischi del sistema. Ne deriva un’accountability meno formale, fondata sulla capacità di collegare provenienza dei dati, trasformazioni, responsabilità, documentazione tecnica, log e conseguenze degli output.
Ecco come distinguere fra ciclo di vita, filiera del dato, data lineage e accountability.
Indice degli argomenti
Dalla raccolta all’output: perché la governance deve seguire i dati in movimento
A riconoscere la fisiologica dinamicità dei dati personali è lo stesso GDPR. Dalla lettura dell’epigrafe, si legge infatti che il Regolamento disciplina non solo la protezione delle persone fisiche con riguardo al trattamento dei dati personali, ma anche la libera circolazione di questi ultimi.
Nella società e nell’economia contemporanee, questa caratteristica è tanto inevitabile quanto evidente; l’innovazione tecnologica ha poi, soprattutto negli ultimi anni, esasperato questa circostanza.
La gestione della governance di infrastrutture
Un dato personale può essere raccolto su un’applicazione, copiato in un data lake, associato ad altri dati, normalizzato, pseudonimizzato, analizzato da un fornitore esterno e restituito come report, punteggio, previsione o raccomandazione; allo stesso tempo, può conservare la sua natura personale o contribuire a formare dati aggregati o alimentare dataset destinati all’addestramento di un modello linguistico di grandi dimensioni, senza che il cambio di formato o l’inclusione in una struttura più ampia interrompano automaticamente la rilevanza giuridica del dato né i vincoli collegati alla sua origine e alla finalità originaria.
Nella gestione della governance di infrastrutture sempre più complesse, come quelle basate sul cloud computing, diventa importante sapere non soltanto quali dati siano presenti nell’organizzazione, ma anche cosa sia accaduto loro prima di arrivare nella forma e nel sistema in cui vengono oggi utilizzati.
È qui che entrano in gioco quattro concetti legati fra loro, ma non sinonimi né perfettamente sovrapponibili: ciclo di vita, filiera, genealogia (data lineage) e
accountability.
Quattro concetti vicini, ma non sovrapponibili, per leggere la traiettoria del dato
Il ciclo di vita del dato è l’insieme delle fasi in cui un dato si può trovare durante la sua esistenza; la filiera chiarisce attraverso chi, quali sistemi e quali ruoli, responsabilità e relazioni esso passi; la genealogia (lineage) permette di ricostruirne la dimensione interna, cioè fonti, origine e provenienza, trasformazioni e forma corrente; l’accountability fa tesoro della ricostruzione dei tre precedenti domini e trasforma questa conoscenza in una prova verificabile di conformità e di governo delle conseguenze.
Mentre l’espressione “filiera del dato” non compare, per quanto qui rileva, in una definizione normativa generale, il termine lineage è utilizzato nel regolamento (CE) n. 1205/2008 della Commissione, attuativo della direttiva Inspire, che lo definisce come la storia del dataset e del suo ciclo di vita, dalla raccolta e acquisizione fino alla forma attuale.
I concetti elencati si atteggiano in modo simile e allo stesso tempo diverso nel GDPR e nell’AI Act, come si dirà meglio nei prossimi paragrafi, ma è necessario che coesistano per dare completezza ed effettività alla conformità normativa, soprattutto al rispetto dei principi.
La tabella
| Livello | Domanda guida | Che cosa comprende | Limite se isolato |
| Ciclo di vita | Che cosa accade al dato durante la sua esistenza? | Creazione, raccolta, utilizzo, consultazione, modifica, conservazione, comunicazione, aggiornamento e cancellazione. | Non chiarisce necessariamente chi interviene, in quali sistemi, con quali passaggi e quali ruoli e responsabilità. |
| Filiera del dato | Attraverso chi, quali sistemi e relazioni passa il dato? | Fonti, titolari, responsabili, fornitori, cloud, subfornitori, contratti, piattaforme, accessi, trasferimenti e riusi. | Può descrivere soggetti e flussi senza rendere ricostruibili trasformazioni e versioni di dati o dataset. |
| Data lineage | Come ricostruire ciò che è accaduto? | Origine, provenienza, fonti, raccolta, selezione, derivazioni, trasformazioni, pulizia, arricchimento, versioni e forma attuale. | Non dimostra da solo liceità, proporzionalità o adeguatezza delle misure. |
| Accountability | Come dimostrare e spiegare il percorso? | Registro, DPIA, contratti, data mapping, cataloghi, datasheet, documentazione tecnica, log, audit e monitoraggio. | Senza mappa e lineage affidabili rischia di restare dichiarativa o formale. |
La domanda su che cosa accada al dato lungo il suo ciclo di vita è già al centro del GDPR. Il problema è verificare se gli strumenti tradizionali di accountability riescano a descriverne anche le traiettorie più complesse.
Dall’inventario dei trattamenti alla ricostruzione delle trasformazioni
Il GDPR tutela le persone fisiche con riguardo al trattamento dei dati personali e costruisce la propria disciplina attorno alle operazioni compiute su tali dati.
Dal momento che è trattamento qualsiasi operazione compiuta sui dati personali e dovendo tutti i trattamenti rispettare i principi del Regolamento, si può concludere che questi ultimi seguano i dati personali lungo l’intero loro ciclo di vita.
I principi di minimizzazione e di limitazione delle finalità hanno un’evidente valenza preventiva, perché limitano il trattamento sin dalla sua ideazione e progettazione, in coerenza col principio della privacy by design e by default; quello di limitazione delle finalità, poi, continua ad operare quando il dato viene trasferito, combinato con altre fonti, arricchito o utilizzato per uno scopo ulteriore.
Per questa ragione, una valutazione seria della compatibilità presuppone la capacità di ricostruire il percorso del dato, non soltanto di localizzarlo.
I riscontri complementari nel GDPR
Nel GDPR, il registro dei trattamenti, le valutazioni di impatto (DPIA), la gestione dei responsabili e dei sub-responsabili, le autorizzazioni interne e le assegnazioni di ruoli e responsabilità, la sicurezza, il tracciamento dei log e la gestione degli incidenti costituiscono riscontri complementari.
Tuttavia, il registro dei trattamenti e la mappatura dei dati potrebbero non essere in grado di ricostruire la storia e la genealogia dei dati stessi: il registro può descrivere correttamente un trattamento senza rendere immediatamente conoscibile la fonte, le trasformazioni subite da un dataset, le versioni o i passaggi.
Conoscere la filiera non basta: occorre ricostruire ciò che è accaduto ai dati
Nei sistemi di intelligenza artificiale, questa esigenza si intensifica.
Il dataset non è soltanto il luogo nel quale i dati sono disponibili, ma il risultato di una serie di decisioni che concorrono a determinare il comportamento futuro di un modello linguistico, per esempio.
In questi casi, conoscere attori e responsabilità potrebbe non bastare: occorre poter ricostruire che cosa sia avvenuto ai dati durante i vari passaggi.
Ma è bene sin da ora precisare che genealogia del dato non coincide con la registrazione indistinta e ipertrofica di ogni evento relativo al dato stesso: va invece vista come la capacità di ricostruire a un adeguato livello di granularità la provenienza e le trasformazioni rilevanti che hanno condotto un dato o un dataset alla forma nella quale si presenta e viene utilizzato.
Se la filiera è il fenomeno da governare, il data lineage è una memoria strutturata che può renderlo osservabile, controllabile, ricostruibile e verificabile.
Non costituisce un adempimento autonomamente nominato dall’AI Act, ma può rappresentare uno strumento idoneo a documentare le pratiche di data governance richieste dall’art. 10 e le informazioni da inserire, ove pertinenti, nella documentazione tecnica prevista dall’art. 11 e dall’Allegato IV.
Con tutte le dovute cautele e differenze, in un certo senso, la genealogia del dato rende dimostrabile la corretta gestione della filiera di un dataset, come la corretta tenuta del registro dei trattamenti e l’accurato svolgimento della valutazione d’impatto rendono dimostrabile l’accountability (concetto per la verità trasversale all’intero corpus normativo europeo sul digitale).
L’AI Act rende la storia di formazione del dataset rilevante per la conformità
Il Regolamento sull’intelligenza artificiale, al pari del Regolamento sui dati personali, non usa esplicitamente le espressioni filiera del dato e genealogia del dato, ma ne presuppone i relativi concetti.
Per i sistemi di IA ad alto rischio che impiegano tecniche di addestramento dei modelli basate sui dati, l’art. 10 richiede tuttavia dataset di training, validazione e test soggetti a pratiche di data governance e data management appropriate alla finalità del sistema.
Il salto dell’AI Act non consiste quindi nell’introduzione testuale delle espressioni, ma nell’attribuire alla storia di formazione del dataset una rilevanza diretta per la conformità del sistema: fonti, selezione, trasformazioni, lacune e bias possono incidere sulla qualità del modello e sui rischi che esso produce.
Il GDPR continua a governare il trattamento dei dati personali impiegati nella filiera e nel sistema. E l’AI Act aggiunge, per i sistemi ad alto rischio, una domanda che il solo censimento delle operazioni non esaurisce: come si è formato il dataset, che cosa rappresenta, quali lacune o distorsioni incorpora e in che modo tali elementi possono avere condizionato il modello.
La tabella sul confronto
| GDPR | AI Act per sistemi ad alto rischio |
| Disciplina liceità e correttezza delle operazioni su dati personali. | Disciplina requisiti del sistema, compresa la governance di dataset di training, validazione e test. |
| Richiede governo di finalità, basi giuridiche, minimizzazione, trasparenza, sicurezza e riusi. | Richiede anche valutazione di qualità, rappresentatività, completezza, pertinenza e possibili bias dei dataset. |
| Protegge gli interessati nel trattamento dei loro dati. | Mira a presidiare salute, sicurezza e diritti fondamentali rispetto ai rischi del sistema. |
| Richiede accountability del titolare | Richiede conformità e documentazione del provider, senza escludere l’applicazione del GDPR. |
Perché il controllo sia effettivo, la governance dei dataset deve tradursi in documentazione e tracciabilità capaci di collegare la formazione del modello al suo utilizzo concreto.
Lineage, log e documentazione: tre prospettive temporali sulla conformità
Il quadro si completa con i successivi articoli 11 e 12, rispettivamente disciplinanti la documentazione tecnica dei sistemi di IA ad alto rischio, che deve rispettare i requisiti elencati nell’Allegato IV, e la registrazione delle operazioni e degli eventi tramite log per l’intero ciclo di vita del sistema stesso.
Il lineage guarda al passato dei dati, alla loro origine e alla loro formazione; la registrazione dei file di log si focalizza sul presente e sull’operatività del sistema nel tempo; la documentazione tecnica, collegata a entrambe le dimensioni, nasce prima dell’immissione del sistema sul mercato e mantenuta aggiornata lungo il ciclo di vita del sistema, così da rifletterne le modifiche e consentire la verifica della conformità.
L’accountability letta con la lente dell’AI Act si nutre delle tre citate dimensioni per alimentare una capacità di dimostrazione concreta di aderenza alla normativa, di conformità del prodotto e adeguata gestione dei rischi.
La tabella sulla dimensione della tracciabilità
| Strumento | Domanda a cui risponde | Esempio |
| Data lineage | Come si è formato il dato o dataset? | Fonti, trasformazioni e versioni che hanno prodotto il dataset impiegato. |
| Documentazione tecnica | Come è stato progettato, verificato e gestito il sistema? | Metodi di addestramento, dati, test, misure di governance e rischio. |
| Log | Che cosa è accaduto nell’uso del sistema nella sua operatività quotidiana? | Eventi, operazioni, anomalie, input rilevanti, output, errori e supervisione. |
| Accountability | Posso dimostrare che dati, modello e sistema siano stati governati in modo conforme? | Collegamento coerente fra evidenze, responsabilità, controlli, feedback, decisioni e misure correttive. |
La dimensione della tracciabilità, introdotta dall’articolo 12, attribuisce alla compliance dei sistemi di IA ad alto rischio una dimensione continuativa della conformità: l’idea implicita sottesa al Regolamento è che non basta conoscere e provare il passato dei dati in termini di origine e formazione del dataset e di rispetto dei requisiti tecnici: occorre un controllo quotidiano e continuativo dell’uso del sistema, reso possibile dal logging, che è il vero ponte fra il presente e il futuro, quest’ultimo fatto (anche) di audit, ispezioni e prove di reputazione.
Dai documenti isolati a una narrazione verificabile dei dati e dei sistemi
Il GDPR e il salto dell’AI Act per i sistemi ad alto rischio segnano il passaggio da un’accountability fatta di documenti isolati alla capacità di collegare passato e presente dei dati e dei dataset, fonti, flussi, trasformazioni, responsabilità, controlli e rischi individuati e gestiti.
Registro dei trattamenti, DPIA, mappature varie, contratti e istruzioni a terzi, documentazione tecnica, log e attività di monitoraggio non devono restare archivi separati, ma devono contribuire a una narrazione verificabile dei dati e dei sistemi.
Il ciclo di vita descrive cosa accade al dato, la filiera individua i soggetti, i sistemi e i rapporti attraverso cui esso circola, il data lineage ne rende ricostruibili origine e trasformazioni, mentre l’accountability impone di tradurre queste ricostruzioni in prove e basi utili a governare rischi e conseguenze.
Il GDPR resta il presidio principale della liceità, della trasparenza e della sicurezza dei trattamenti di dati; l’AI Act, per i sistemi ad alto rischio, aggiunge senza nominarlo il tassello della genealogia, chiedendo di focalizzarsi anche sulle fonti dei dati e sulle trasformazioni subite da questi ultimi.
Tutto con l’obiettivo di costruire un’organizzazione capace di ricostruire e spiegare le vicende dei dati.














Partecipa alla community