Esplora le guide

Articoli AI Glossary

162

Dati di addestramento

I dati di addestramento sono il corpus usato per calibrare i parametri di un modello. La loro copertura fissa il tetto del modello: lacune, errori e squilibri nei dati riappaiono come lacune, errori e bias negli output. Nell’AI Act dell’UE i dati di addestramento hanno una definizione formale e, per i sistemi ad alto rischio, obblighi di governance associati. In pratica: Un modello per le assunzioni addestrato per lo più su assunzioni passate da un solo gruppo demografico riprodurrà quello schema. ...

Dati di test

I dati di test sono la pagella onesta. Devono restare intoccati durante lo sviluppo, perché qualsiasi decisione presa in base ai risultati del test li trasforma in dati di validazione. Quando esempi di test finiscono nell’addestramento — la contaminazione — i punteggi riportati perdono ogni significato. In pratica: Un modello che ottiene il 95% su un benchmark le cui risposte erano nei suoi dati di addestramento non ha imparato nulla. ...

Dati di validazione

I dati di validazione stanno tra addestramento e test. Li usi per scegliere gli iperparametri e per accorgerti presto dell’overfitting, perché il modello non impara mai direttamente da essi. Riutilizzarli in modo troppo aggressivo fa trapelare informazioni e li trasforma silenziosamente in un secondo set di addestramento. In pratica: Se la loss di validazione inizia a salire mentre quella di addestramento continua a scendere, stai facendo overfitting — fermati.

Dati sintetici

I dati sintetici colmano i vuoti dove i dati reali sono scarsi, sensibili o costosi — casi limite rari, dati soggetti a vincoli di privacy, esempi bilanciati di una classe minoritaria. Il rischio è che l’effetto si accumuli: un modello addestrato sul proprio stesso tipo di output può allontanarsi dalla realtà e amplificare i bias esistenti invece di correggerli. In pratica: Generare 5,000 ticket di supporto plausibili per coprire uno scenario di cui hai tre esempi reali. ...

Deep Learning

Il deep learning impila molti livelli di semplici unità matematiche, in modo che ogni livello apprenda una rappresentazione un po’ più astratta di quello sottostante. È la profondità a permettere a un modello di passare dai pixel ai bordi alle forme fino a ‘gatto’ senza che nessuno definisca cosa sia un bordo. Ogni grande modello linguistico e ogni generatore di immagini oggi in uso è deep learning. In pratica: I primi livelli di un modello di visione rilevano i bordi; gli ultimi rilevano i volti — nessuno ha programmato né l’uno né l’altro passaggio. ...

Deepfake

I deepfake combinano la generazione video o la clonazione vocale con le sembianze di una persona reale. Il rilevamento è inaffidabile e sta peggiorando, quindi le difese pratiche sono i segnali di provenienza, i canali di verifica e i processi organizzativi. L’AI Act europeo impone obblighi di trasparenza per questo tipo di contenuti. In pratica: Una voce clonata dell’amministratore delegato che durante una chiamata autorizza un bonifico.

Deployer

Se la tua azienda usa un sistema di IA al lavoro, con ogni probabilità sei un deployer. L’uso puramente personale e non professionale è escluso. Gli obblighi del deployer sono più leggeri di quelli del fornitore, ma reali per i sistemi ad alto rischio: usare il sistema secondo le istruzioni, affidare la sorveglianza umana a persone competenti, conservare i log e informare le persone interessate. In pratica: Un team HR che usa uno strumento di terze parti per lo screening dei CV è deployer di un sistema ad alto rischio. ...

Discesa del gradiente

La discesa del gradiente calcola in che direzione deve muoversi ogni parametro per ridurre la loss, poi fa un piccolo passo in quel verso. Ripeti milioni di volte e il modello converge. Quasi tutto l’addestramento moderno usa una sua variante, di solito Adam. In pratica: Come camminare in discesa nella nebbia: non vedi la valle, ma senti la pendenza sotto i piedi.

Distillazione

Nella distillazione un grande modello insegnante genera output che addestrano uno studente più piccolo. Lo studente risulta più economico e più veloce, pur conservando molto del comportamento dell’insegnante sulla distribuzione di riferimento. La maggior parte dei modelli di produzione accessibili è distillata da qualcosa di più grande. In pratica: Un modello 10× più piccolo e 20× più economico che gestisce il 90% del tuo traffico altrettanto bene.

Documentazione tecnica

L’articolo 11 e l’allegato IV stabiliscono cosa deve contenere il fascicolo: descrizione del sistema, scelte di progettazione, dati, addestramento e test, metriche di prestazione, gestione del rischio e piano post-commercializzazione. Deve esistere prima che il sistema arrivi sul mercato ed essere mantenuto in seguito. È l’artefatto di conformità — niente fascicolo, niente conformità. In pratica: Il documento che un’autorità chiede per primo, e che i team iniziano a scrivere troppo tardi. ...