Inferenza
Definizione rapida
Fase in cui un modello già addestrato riceve input ed elabora una previsione o una risposta.
Spiegazione
Durante l’inferenza il modello applica i parametri appresi senza aggiornare normalmente i pesi. Costi, latenza, memoria e parametri di decoding influenzano il comportamento osservato.
Esempio pratico
Un modello riceve una frase e restituisce la probabilità delle continuazioni oppure una classificazione.
Spiegazione tecnica
L’inferenza esegue il forward pass su input tokenizzati e produce logits o altre uscite, che possono essere decodificate o post-processate.
Da non confondere con
Non è l’addestramento: l’addestramento modifica i parametri, l’inferenza li usa per calcolare un risultato.