Passa ai contenuti principali

Post

Discesa del Gradiente

Tutto l’apprendimento delle reti neurali moderne si fonda sulla discesa del gradiente. Pensate che l’idea di questo algoritmo risale al 1800, ma solo negli anni ’80 è stata riscoperta grazie alla backpropagation. C’è stata una fase buia nell’intelligenza artificiale, denominata “la seconda era glaciale” (vedi post omonimo), quando, dopo le critiche di Minsky e Papert al Perceptron, sembrava che le reti neurali si dovessero accantonare per sempre. Poi, nel 1986, Rumelhart, Hinton e Williams hanno trovato un modo per aggiornare i pesi negli strati nascosti e hanno dato vita al cosiddetto “disgelo” delle reti neurali. Il deep learning, così come lo conosciamo oggi – capace di interpretare immagini e testo – è esploso solo quando è stato possibile combinare hardware potente, montagne di dati e versioni migliorate della discesa del gradiente. La cosa bella di questo algoritmo è che funziona secondo una logica semplicissima: Definisci cosa vuoi minimizzare (funzione di costo). Calco...

Bill No. 246

Nel 1897, Edward J. Goodwin, un medico e matematico dilettante dell'Indiana, sostenne di aver risolto l'antico problema della quadratura del cerchio e propose il disegno legge “Indiana House Bill No. 246”, meglio noto come “PI Bill”, che avrebbe dovuto “legalizzare” il valore errato 3,2 per il π. La Camera dell’Indiana approvò il disegno di legge, che però fu bloccato al Senato grazie all’intervento di un professore di matematica. Questa vicenda bizzarra mostra quanto sia rischioso legiferare su concetti matematici senza comprenderli a fondo. Facciamo qualcosa di più serio: stimare π simulando il lancio di dardi a caso su un quadrato. Se il quadrato a lato 2 e il cerchio incritto di raggio 1, lanciando dei dardi a caso nel quadrato, la proporzione di dardi che cadono dentro il cerchio rispetto al totale dovrebbe avvicinarsi a π/4. Perché? L’area del cerchio è π×1² = π, l’area del quadrato è 2×2 = 4 ⇒ quindi π ≈ 4 × (dardi nel cerchio/dardi totali) Col metodo Monte Carlo stimia...

Composizione Simbolica Graduale

Smolensky affronta una delle questioni fondamentali delle scienze cognitive: come conciliare la natura simbolica del pensiero umano (espressa nella grammatica e nel ragionamento logico) con i meccanismi neurali del cervello. Ancora oggi, questi due sistemi sembrano incompatibili: Il pensiero simbolico è discreto, governato da regole ed elementi definiti con precisione, come parole o concetti. Il funzionamento neurale è continuo, distribuito e parallelo. Smolensky propone il concetto di “gradualità” per superare questa dicotomia, delineando due livelli cognitivi: Livello mentale superiore: invece di considerare i simboli come semplicemente presenti o assenti (analogamente ai bit 0 e 1 dei computer tradizionali), essi possono manifestarsi “parzialmente” con diversi gradi di attivazione. Ad esempio, un'idea può esistere nella mente in uno stato di "quasi-presenza". Livello neurale inferiore: questi stati intermedi corrispondono a configurazioni distribuite di attivazione tra...

Un dualismo metodologico

Alcune speculazioni oltre l’affermazione “Il computer non capirà mai un tubo”. Dal mio esperimento sul percettrone multistrato addestrato ad approssimare le soluzioni di equazioni cubiche è emersa la dicotomia tra il rigore analitico di Tartaglia e l'approssimazione empirica delle reti neurali. Formula di Tartaglia vs Reti Neurali La formula di Tartaglia rappresenta la comprensione profonda, la verità matematica esatta che trascende le contingenze storiche - un ideale platonico. La rete neurale incarna l'approccio strumentale, che non comprenderà mai la struttura ma produce approssimazioni utili.  Questa distinzione prepara alla regina delle domande sull'IA: può una rete neurale che approssima risultati senza comprendere la natura dei calcoli essere considerata veramente cosciente? L’interrogativo richiama la teoria della “composizione delle cause” di John Stuart Mill e la più recente “teoria integrata dell'informazione” di Giulio Tononi, che considera la coscienza come...

Da Tartaglia all’Intelligenza Artificiale

Riprendiamo l'equazione cubica, nella forma depressa x³ + px + q = 0 vista nel blog precedente, per mettere a confronto l'eleganza del pensiero matematico classico con la forza bruta del calcolo numerico delle moderne reti neurali.   Grazie a Tartaglia, per la prima volta nella storia dell’umanità si potevano trovare facilmente le radici reali di un'equazione di grado superiore al secondo. La soluzione è un capolavoro: l'equazione cubica viene trasformata in un sistema di equazioni più semplici, fino a ottenere una formula che esprime le radici mediante operazioni elementari.   Questo procedimento incarna perfettamente lo spirito delle dimostrazioni matematiche: ricondurre problemi complessi a casi noti per poterli così risolvere. Eppure, la formula di Tartaglia portava in grembo un apparente paradosso che avrebbe tormentato i matematici per secoli: il cosiddetto “caso irriducibile”, ossia espressioni con radici di numeri negativi pur essendo le soluzioni reali....

Casus irreducibilis

La matematica non è solo un insieme di simboli freddi, irreggimentati da regole ferree, ma un vero e proprio universo narrativo ricco di misteri e colpi di scena. Una delle storie più affascinanti di questo universo vede come protagonista Niccolò Tartaglia.  Tartaglia era un brillante autodidatta che riuscì in un'impresa allora considerata impossibile, ossia risolvere pubblicamente le equazioni di terzo grado. È doveroso precisare che fu Scipione del Ferro nel 1505 il primo a inventare un modo per risolvere le equazioni di terzo grado, che però rivelò solo ai suoi allievi.  La formula rivoluzionaria per risolvere equazioni del tipo \[x^3 + px + q = 0\] rappresentò un vero e proprio salto quantico nella storia dell'algebra.  Tuttavia, questa rivoluzione portava in grembo un apparente paradosso: in alcuni casi, pur esistendo evidenti soluzioni reali, la formula conduceva oltre i confini noti della matematica di quel tempo. Studiando l'equazione \[x^3 - 15x = 4\]Tartagl...

Il suono del violino

In questo esperimento ho simulato le valutazioni nei test per diverse classi (analisi aggregata di tutti i voti), ipotizzando due categorie di studenti con livelli di apprendimento significativamente diversi. Studenti in difficoltà: 35 studenti con un punteggio medio di 5 e una deviazione standard di 0.5 Studenti bravi: 120 studenti con un punteggio medio di 8.5 e una deviazione standard di 0.5 La scelta di un grafico a violino è particolarmente indicata se si vogliono scovare le distribuzioni bimodali. Diversamente da un istogramma o un box plot tradizionale, il grafico a violino mostra: La densità di probabilità : le aree più larghe del violino indicano dove i dati sono più concentrati, mentre le aree più strette mostrano dove i dati sono più rari. La distribuzione dei dati : la forma del violino mostra come i valori sono distribuiti, ossia se sono raggruppati attorno a un valore centrale o dispersi su un intervallo più ampio. La multimodalità : se hanno più di un picco (distribuzi...