La teoria dell’informazione è una delle fondamenta invisibili del mondo digitale. Risponde a domande apparentemente semplici ma a lungo difficili da formulare matematicamente: quanta informazione contiene un messaggio? Quanto può essere compresso? Quanto rapidamente può essere trasmesso in modo affidabile attraverso un canale rumoroso?
Nel 1948 il matematico e ingegnere americano Claude Shannon fornì un quadro rivoluzionario con A Mathematical Theory of Communication. Non cercava di comprendere il significato del messaggio, ma di misurarne l’informazione e studiare i limiti fisici e matematici della trasmissione.
Prima di Shannon: trasmettere messaggi in modo affidabile
Telegrafo, telefono e radio avevano già posto domande essenziali: come trasmettere un segnale fedelmente? Come utilizzare una linea in modo efficiente? Come distinguere un messaggio utile dal rumore che lo altera?
Shannon lavorava ai Bell Telephone Laboratories negli anni Quaranta. La sua idea decisiva fu separare due problemi: cosa significa un messaggio e quanta informazione serve per rappresentarlo e trasmetterlo. Questa separazione trasformò la comunicazione in un problema matematico.
Il modello generale della comunicazione
Una sorgente di informazione produce un messaggio. Un trasmettitore lo converte in un segnale adatto al canale. Il segnale attraversa un canale di comunicazione, dove il rumore può disturbarlo. Un ricevitore tenta infine di ricostruire il messaggio.
Lo stesso modello si applica a telefonia, radio, fibra ottica, pacchetti di rete e lettura di dati da un supporto di memoria.
Il bit: misurare l’informazione
Shannon utilizzò un’unità destinata a diventare universale: il bit. Un bit rappresenta una scelta tra due possibilità, spesso indicate come 0 e 1.
Più precisamente, rappresenta la quantità di informazione necessaria a distinguere tra due possibilità equiprobabili. Il risultato del lancio di una moneta equa fornisce un bit. Quattro possibilità equiprobabili richiedono due bit, otto ne richiedono tre.
Questo spiega il ruolo centrale del logaritmo in base 2.
Informazione e sorpresa
Un messaggio porta più informazione quando era più difficile da prevedere. Un evento quasi certo aggiunge poca informazione; un evento molto improbabile ne aggiunge di più.
La teoria formalizza questa intuizione: quanto meno probabile è un evento, tanto più informativo è il suo verificarsi.
Entropia: misurare l’incertezza
L’entropia misura l’incertezza media associata a una sorgente. Se produce sempre lo stesso simbolo, l’entropia è zero. Se più simboli hanno probabilità simili, l’incertezza aumenta.
Per una variabile casuale X con probabilità p(x), l’entropia di Shannon è:
H(X) = - Σ p(x) log₂ p(x)
Con logaritmo in base 2 il risultato è espresso in bit. Intuitivamente misura quanta informazione otteniamo in media quando apprendiamo il risultato.
Una moneta equa ha entropia 1 bit. Una moneta che dà testa nel 99% dei casi ha entropia inferiore; se dà sempre testa, l’entropia è zero.
Perché i dati possono essere compressi?
I dati reali contengono spesso ridondanza. In un testo, caratteri e sequenze non hanno tutti la stessa frequenza. La compressione sfrutta queste regolarità assegnando rappresentazioni più brevi agli eventi frequenti e più lunghe a quelli rari.
È il principio alla base di tecniche come la codifica di Huffman. Metodi moderni più sofisticati sfruttano comunque struttura, ripetizione e prevedibilità.
Compressione senza perdita e con perdita
Con la compressione senza perdita, i dati originali possono essere ricostruiti esattamente. È essenziale per testo, codice sorgente, documenti e dati strutturati. ZIP, PNG e FLAC utilizzano tecniche lossless.
La compressione con perdita elimina deliberatamente parte dell’informazione per produrre file molto più piccoli. JPEG, MP3 e molti codec video adottano questo approccio, preservando una qualità sufficiente all’uso previsto.
Esiste un limite alla compressione?
Sì. Se una sorgente possiede una certa entropia, esiste un limite teorico alla compressione media ottenibile senza perdere informazione.
Nessun algoritmo può comprimere indefinitamente ogni file garantendo la ricostruzione perfetta. Dati ridondanti si comprimono molto; dati già efficienti o quasi imprevedibili, poco.
La teoria di Shannon non indica necessariamente quale algoritmo usare: indica il limite che gli algoritmi non possono superare in media.
Rumore: quando il messaggio viene alterato
In un sistema reale, interferenze elettromagnetiche, imperfezioni hardware, attenuazione o fenomeni casuali possono alterare un segnale. Un 1 inviato può essere ricevuto come 0.
Shannon dimostrò un risultato fondamentale: l’informazione può essere trasmessa con affidabilità arbitrariamente elevata su un canale rumoroso, purché la velocità rimanga sotto un determinato limite e si utilizzi una codifica adeguata.
Capacità di canale
Ogni canale ha una quantità massima di informazione che può trasmettere in modo affidabile: la capacità di canale.
Per un canale con rumore gaussiano, la formula di Shannon-Hartley collega capacità C, larghezza di banda B e rapporto segnale-rumore:
C = B log₂(1 + S/N)
Aumentare la larghezza di banda o migliorare il rapporto segnale-rumore può aumentare la capacità, ma nelle condizioni date esiste sempre un limite fisico.
Aggiungere ridondanza per correggere gli errori
Nella compressione eliminiamo ridondanza. Per proteggere i dati, a volte facciamo l’opposto: aggiungiamo deliberatamente ridondanza.
Invece di inviare 1, potremmo inviare 111. Se arriva 101, il ricevitore può dedurre che probabilmente il valore originale era 1. I moderni codici di correzione degli errori sono molto più efficienti ma seguono lo stesso principio.
Sono usati in comunicazioni satellitari, reti mobili, Wi-Fi, memorie, supporti di archiviazione, comunicazioni spaziali e codici QR.
Una teoria che non misura il significato
La teoria dell’informazione non cerca di misurare il significato o l’importanza di un messaggio. Due messaggi con significati completamente diversi possono contenere la stessa quantità di informazione nel senso di Shannon.
Studia struttura statistica, quantità necessaria per la rappresentazione e condizioni di trasmissione. Proprio questa astrazione la rende applicabile a campi molto diversi.
Dalla teoria alle reti digitali
Quando uno smartphone invia una fotografia, l’immagine può essere compressa, codificata per il sistema di comunicazione, protetta con meccanismi di rilevamento o correzione degli errori, trasmessa attraverso un canale fisicamente limitato, decodificata e decompressa.
Dietro un’operazione quotidiana si trovano decenni di ricerca su rappresentazione, compressione, trasmissione e affidabilità dell’informazione.
Memorizzare significa trasmettere nel tempo
Un supporto di memoria può essere visto come un canale che trasmette informazione nel tempo. Un file salvato oggi viene codificato fisicamente e recuperato in seguito.
Poiché i supporti non sono perfetti, gli stessi principi di rilevamento e correzione degli errori migliorano anche l’affidabilità dell’archiviazione. Comunicazione e memoria sono due aspetti dello stesso problema: preservare l’informazione nonostante le imperfezioni del mondo fisico.
Informazione, probabilità e intelligenza artificiale
Concetti della teoria dell’informazione compaiono anche nel machine learning. L’entropia misura l’incertezza di una distribuzione di probabilità; la cross-entropy è una funzione molto comune nell’addestramento di classificatori e reti neurali; l’informazione mutua aiuta a studiare dipendenze tra variabili.
Shannon non sviluppò ovviamente la teoria per l’IA moderna. I suoi strumenti matematici si sono semplicemente dimostrati abbastanza generali da essere riutilizzati decenni dopo.
Un’influenza oltre l’informatica
La teoria dell’informazione ha influenzato statistica, biologia, neuroscienze, linguistica, fisica, crittografia, teoria dei sistemi e machine learning.
L’informazione nel senso di Shannon è però un concetto matematico preciso e non deve essere automaticamente confusa con conoscenza, verità, significato o valore di un messaggio.
Perché è ancora fondamentale?
Il mondo digitale produce, comprime, memorizza, trasmette e copia continuamente dati. Le stesse domande ritornano: quanti dati sono davvero necessari? Quali parti sono prevedibili o ridondanti? Quanta informazione può attraversare un canale? Come rilevare e correggere un errore? Quanto possiamo comprimere senza perdita?
La teoria di Shannon fornisce non soltanto tecniche, ma limiti matematici rispetto ai quali possono essere valutati i sistemi reali.
Domande frequenti
Chi ha fondato la teoria dell’informazione?
Claude Shannon pose le basi matematiche della moderna teoria dell’informazione nel 1948 con A Mathematical Theory of Communication.
Cos’è un bit nella teoria dell’informazione?
È la quantità di informazione necessaria per distinguere tra due possibilità equiprobabili.
Cos’è l’entropia?
Misura l’incertezza media di una sorgente e quindi la quantità media di informazione fornita dai suoi risultati.
Perché l’entropia è importante per la compressione?
Stabilisce un limite teorico a quanto compatta possa essere, in media, una rappresentazione senza perdita dei dati prodotti da una sorgente.
Cos’è la capacità di canale?
È la velocità massima di informazione che può essere trasmessa con affidabilità arbitrariamente elevata attraverso un canale nelle condizioni date.
Perché la correzione degli errori aggiunge ridondanza?
L’informazione strutturata aggiuntiva permette al ricevitore di rilevare e talvolta correggere dati alterati senza richiedere una nuova trasmissione.
Scopri Alan Turing, i suoi lavori sulla computabilità, il ruolo a Bletchley Park, i progetti di computer e il contributo fondativo all'intelligenza artificiale.