Inferenza

Definizione rapida

Fase in cui un modello già addestrato riceve input ed elabora una previsione o una risposta.

Spiegazione

Durante l’inferenza il modello applica i parametri appresi senza aggiornare normalmente i pesi. Costi, latenza, memoria e parametri di decoding influenzano il comportamento osservato.

Esempio pratico

Un modello riceve una frase e restituisce la probabilità delle continuazioni oppure una classificazione.

Spiegazione tecnica

L’inferenza esegue il forward pass su input tokenizzati e produce logits o altre uscite, che possono essere decodificate o post-processate.

Da non confondere con

Non è l’addestramento: l’addestramento modifica i parametri, l’inferenza li usa per calcolare un risultato.