Esplora le guide

Articoli AI Glossary

162

Speech-to-Text

Lo speech-to-text moderno è abbastanza accurato sulla maggior parte degli accenti e in condizioni rumorose da poter essere usato senza supervisione per le bozze. Sta alla base di note di riunione, sottotitoli e interfacce vocali. L’accuratezza cala ancora sul gergo di settore, sui parlanti sovrapposti e sulle lingue poco rappresentate. In pratica: Una call di un’ora trascritta e riassunta prima che tu esca dalla stanza.

Spiegabilità

La spiegabilità riguarda il destinatario: una spiegazione deve essere utilizzabile da chi ne ha bisogno — un richiedente, un auditor, un ingegnere. Spesso si ottiene con metodi post-hoc che approssimano il comportamento del modello invece di rivelarne il meccanismo reale. Quell’approssimazione è un limite concreto, non un tecnicismo. In pratica: ‘Respinta principalmente per il rapporto debito/reddito e la breve storia creditizia.’

System Prompt

Il system prompt sta sopra il turno dell’utente e persiste per tutta la sessione, definendo chi è l’assistente e cosa deve e non deve fare. È lì che i team di prodotto mettono voce, ambito e regole di rifiuto. È influente ma non è un confine di sicurezza — trattalo come configurazione, non come un controllo irraggiungibile per gli utenti. In pratica: ‘Sei un agente di supporto per una fintech europea. Non dare mai consigli finanziari. Rispondi in meno di 120 parole.’ ...

Temperatura

La temperatura ridisegna la distribuzione di probabilità sul token successivo. Vicino allo zero il modello sceglie quasi sempre la sua opzione migliore, con output ripetibili e conservativi. Valori più alti appiattiscono la distribuzione e lasciano passare token meno probabili, il che si legge come creatività e, oltre un certo punto, come sciocchezze. In pratica: Temperatura 0 per l’estrazione di dati; 0.8 per il brainstorming di slogan.

Template di prompt

Un template congela le parti che funzionano e parametrizza quelle che cambiano. È il punto in cui il prompting smette di essere un trucco personale e diventa qualcosa che un team può versionare, testare e migliorare. I template sono anche ciò che rende possibile valutare i prompt, perché puoi tenere costante la struttura. In pratica: ‘Riassumi {document} per {audience} in {n} punti elenco.’

Test-Time Compute

Il test-time compute è il secondo asse di scaling. Invece di un modello più grande, lasci che il modello esistente rifletta più a lungo, provi più tentativi o controlli il proprio lavoro. Ti dà una manopola qualità-costo regolabile dal vivo, che prima era fissata al momento dell’addestramento. In pratica: Stesso modello, dieci volte il budget di ragionamento, matematica sensibilmente migliore.

Text-to-Image

I sistemi text-to-image accoppiano un componente di comprensione del linguaggio con un generatore a diffusione, così il prompt guida il denoising verso i pixel corrispondenti. La qualità dell’output dipende molto dalla specificità del prompt — soggetto, stile, composizione e illuminazione vanno tutti esplicitati. L’uso commerciale solleva questioni di diritti che variano da strumento a strumento e da giurisdizione a giurisdizione. In pratica: ‘Illustrazione isometrica di un data center, palette tenue, luce di contorno morbida.’ ...

Text-to-Speech

Il text-to-speech attuale produce una prosodia naturale e può clonare una voce da un breve campione. È questa capacità la ragione per cui il consenso e la trasparenza sulla clonazione vocale sono diventati questioni legali ed etiche concrete, non più teoriche. In pratica: Un corso narrato con una voce coerente lungo 40 lezioni, senza uno studio di registrazione.

Text-to-Video

Il text-to-video estende la diffusione nel tempo, il che aggiunge il vincolo difficile che i fotogrammi restino coerenti tra loro. Durata delle clip, plausibilità fisica e coerenza dei personaggi sono i limiti attuali. Il campo si muove abbastanza in fretta da far invecchiare in pochi mesi qualsiasi affermazione specifica sulle capacità. In pratica: Uno spot di prodotto di dieci secondi generato invece che girato.

Throughput

Il throughput è la questione della capacità, distinta dalla questione della velocità posta dalla latenza. Il batching alza il throughput alzando la latenza individuale, che è esattamente il compromesso che vuoi per i job offline ed esattamente quello sbagliato per la chat. In pratica: Metti in batch un milione di classificazioni durante la notte; nessuno sta guardando l’orologio.