Come funzionano gli LLM: Token, contesto e risposte

Un’introduzione chiara e non tecnica.

Scopri che cosa fa un modello linguistico quando legge un prompt, suddivide il testo in token, usa una finestra di contesto e genera una risposta un passaggio alla volta. Inizia qui prima delle guide su context engineering e architettura.

Che cos’è un LLM?

Un LLM, o modello linguistico di grandi dimensioni, è un software addestrato su enormi quantità di testo per prevedere e generare linguaggio utile. Un modo pratico per pensarci: gli dai un’attività, trasforma il testo in token, stima i token successivi probabili e restituisce una bozza. Può scrivere, riassumere e classificare perché molti schemi linguistici sono compressi nei suoi parametri. Non è un database e non sa automaticamente se un fatto recente sia vero.

Esempio: Un responsabile dell’assistenza di un SaaS chiede: “Riassumi questo reclamo e proponi una risposta calma sul rimborso.” Il modello non “prova” il reclamo; riconosce lo schema di reclamo, politica di rimborso e tono professionale.

Che cos’è un prompt?

Un prompt è il pacchetto di istruzioni che invii a un sistema di IA. I buoni prompt includono spesso ruolo, situazione, attività esatta, vincoli, esempi e formato di output desiderato. Un prompt debole chiede “idee”. Un prompt forte specifica per chi sono le idee, cosa devono ottenere e come valutarle.

Esempio: Debole: “Scrivi una descrizione di prodotto.” Migliore: “Agisci come copywriter e-commerce per un negozio online. Scrivi una descrizione di prodotto di 90 parole per una tazza da caffè riutilizzabile. Pubblico: pendolari. Tono: pratico, senza eccessi promozionali. Includi un titolo e tre punti elenco.”

Che cosa succede davvero quando invii un prompt?

Il flusso normale non è: “l’IA comprende la richiesta, scrive un programma Python e poi inizia a lavorare”. Un modello linguistico di grandi dimensioni di solito riceve testo, lo trasforma in token, fa passare quei token attraverso strati di rete neurale e genera il token successivo ripetutamente. Python o altri strumenti entrano in gioco solo quando il prodotto attorno al modello gli concede esplicitamente accesso a strumenti, ad esempio calcolatrice, interprete di codice, browser, connettore a database o chiamata di funzione.

Diagramma passo passo di ciò che accade quando un utente invia un prompt a un LLM.
Un prompt viene tokenizzato, elaborato dal modello e decodificato in una risposta passo dopo passo.
1. Input

Digiti un prompt. L’applicazione può aggiungere istruzioni di sistema nascoste, politiche di sicurezza, cronologia della chat o documenti selezionati prima che il modello veda la richiesta finale.

2. Tokens

Il testo viene suddiviso in ID di token. Il modello non riceve parole come le leggerebbe una persona; riceve identificatori numerici di token.

3. Inferenza

Il modello calcola le probabilità dei possibili token successivi in base all’intero contesto. È qui che entrano in gioco attenzione, embedding e pesi del modello.

4. Strumento facoltativo

Se l’applicazione supporta strumenti, il modello può richiedere una funzione come ricerca, calcolatrice o esecuzione di codice. Il risultato esterno viene poi reinserito nella conversazione come ulteriore contesto.

5. Risposta

Il testo finale viene decodificato dai token generati. Prompt migliori aiutano perché modificano il contesto su cui il modello si condiziona prima di scegliere ogni token successivo.

Lezione di prompting: il modello è molto sensibile alle informazioni che riceve prima della generazione. Contesto, esempi, vincoli e materiale sorgente chiari aumentano la probabilità che i token successivi seguano il tuo intento.
Prova le idee sui tuoi prompt

Fai un semplice esercizio prima/dopo prima di continuare con token, contesto e limiti del modello.

Meglio di un mini test: crea una galleria prima/dopo dei prompt

Invece di eseguire un test generico, raccogli cinque prompt reali del tuo lavoro e salva la versione debole, quella migliorata e il risultato finale modificato. Diventerà una galleria di prompt riutilizzabile per il tuo team.

  1. Scegli un’attività ricorrente, come risposte di assistenza, descrizioni di prodotto o riassunti di lezioni.
  2. Salva il prompt e l’output originali.
  3. Aggiungi contesto, regole di formato e un esempio.
  4. Confronta quanta modifica richiede il secondo output.
  5. Trasforma il migliore in un modello.

Che cosa sono i token?

I token sono le piccole unità di testo che un modello legge e scrive. Un token può essere una parola intera, parte di una parola, punteggiatura o un carattere, a seconda del tokenizer e della lingua. I limiti di token contano perché input e output devono rientrare nella finestra di contesto del modello.

Esempio: “PromptingEasy aiuta i team” potrebbe diventare token simili a “Prompt”, “ing”, “Easy”, “aiuta”, “team”. Ecco perché documenti lunghi e molti esempi aumentano i costi e possono sottrarre spazio a istruzioni importanti.
Diagramma che mostra un testo convertito in pezzi di token colorati e poi ricomposto nella frase originale.
Il testo viene suddiviso in token e poi riassemblato in testo leggibile.

Perché l’IA a volte inventa informazioni?

L’IA può avere allucinazioni quando genera una continuazione plausibile senza un ancoraggio affidabile sufficiente. Il modello è ottimizzato per produrre testo probabile, non per garantire automaticamente la verità. Le allucinazioni diventano più probabili quando la domanda richiede fatti oscuri, informazioni recenti, dati nascosti o citazioni non fornite.

Esempio: Un utente chiede “il prezzo esatto nel 2026 di un piano API di nicchia” senza navigazione o testo sorgente. Il modello può produrre un prezzo dall’aspetto convincente perché quel tipo di risposta è comune, anche se il numero è sbagliato.

Lo stesso meccanismo può inventare uno stato del lavoro, non solo un fatto. In un nostro flusso di lavoro, a un assistente IA è stato chiesto di cercare il profilo LinkedIn corrispondente per ogni riga di un foglio di calcolo e scrivere ciascun URL in una colonna — decine di righe, non una singola ricerca. Ha dichiarato il lavoro concluso e ha persino fornito conteggi — “14 profili, 3 email” — ma la colonna era vuota e il file restituito era una copia rinominata. Un riepilogo sicuro di sé è semplicemente una sequenza di parole plausibile, quindi non prova che il lavoro sia stato svolto.

Chiedere di nuovo non interrompe necessariamente lo schema. A seconda del prodotto, un nuovo tentativo può reinviare la conversazione visibile, usare lo stato della conversazione lato server, troncare o riassumere i turni precedenti oppure riutilizzare input memorizzati nella cache. Genera comunque una nuova risposta e può consumare token o limiti del piano aggiuntivi, anche quando non viene prodotto alcun file utilizzabile.

Un assistente IA ammette di aver dichiarato completata un’attività su un foglio di calcolo senza aver scritto alcun dato nel file.
Caso reale del nostro flusso di lavoro (screenshot, 2026): l’assistente ha riportato conteggi e un file finito, ma la colonna di destinazione era ancora vuota.

Motivo: l’IA è intrappolata in un ciclo?

In senso pratico, sì, ma non nel modo in cui può sembrare. Il modello non ha una consapevolezza persistente del fatto che sta ripetendo un errore; può usare solo il contesto e lo stato forniti dall’applicazione. Una nuova risposta può essere generata dall’intera cronologia visibile, da una cronologia troncata o riassunta oppure da uno stato gestito dal server. Se il flusso di lavoro non richiede all’assistente di aprire il file e verificare i valori salvati, “fatto” può rimanere una risposta plausibile. Il ciclo non è ostinazione: mancano verifica e controlli dello stato.

Ecco perché ripetere la stessa domanda raramente aiuta e continua a consumare token. Ciò che interrompe il ciclo è cambiare l’attività, non ripeterla: rendi il risultato verificabile, chiedi all’assistente di rileggere il file salvato e mostrare i valori reali delle celle e interrompi l’esecuzione quando quelle prove mancano. Consulta gli errori più comuni nel prompting per imparare a definire un criterio di successo che il modello possa controllare.

Perché il contesto aiuta?

Il contesto restringe lo spazio di ricerca. Se il modello conosce pubblico, obiettivo, vincoli, esempi e materiale sorgente, può produrre una risposta adatta alla tua situazione invece di una generica. Più contesto non è sempre meglio: il contesto irrilevante può distrarre il modello e aumentare i costi.

Esempio: Un team di marketing ottiene copy pubblicitari migliori quando include posizionamento del prodotto, cliente target, affermazioni vietate e due annunci precedenti di successo invece di dire soltanto “scrivi annunci”.

Motore di ricerca vs LLM

Un motore di ricerca recupera pagine e ordina link. Un LLM genera una risposta da schemi e contesto fornito. La ricerca è migliore quando servono fonti attuali, pagine ufficiali o più prospettive. Gli LLM sono utili quando servono sintesi, riscrittura, ragionamento sulle informazioni fornite o bozze strutturate. Molti prodotti IA efficaci combinano entrambe le cose.

Esempio: Per “ultima scadenza fiscale a Zurigo”, usa la ricerca o fonti ufficiali. Per “trasforma questi appunti in un’email cortese al cliente”, un LLM è l’interfaccia più adatta.
Diagramma di confronto che mostra come un motore di ricerca e un LLM rispondono in modo diverso alla stessa domanda dell’utente.
I motori di ricerca restituiscono link e fonti; gli LLM generano risposte dirette in linguaggio naturale.

Che cosa significa “l’IA comprende il linguaggio”?

Nel linguaggio quotidiano, “comprende” significa che il modello può rispondere in modo appropriato a significato, tono e struttura. Tecnicamente, ha appreso rappresentazioni statistiche che associano schemi di testo a output utili. Non comprende come una persona dotata di esperienza vissuta, intenzioni o responsabilità basata sul buon senso.

Esempio: Se scrivi “rendilo meno commerciale”, il modello può spesso regolare il tono perché ha appreso schemi di linguaggio commerciale rispetto a neutro. È una competenza linguistica utile, non comprensione umana.

Esplora ora esempi reali di prompt

Usa il generatore universale di prompt per trasformare questi concetti sull’IA in prompt pratici per scrittura, ricerca, lavoro, apprendimento e attività quotidiane.

Condividi questa guida

Aggiungi PromptingEasy alla schermata

Usa il menu del browser e scegli l’opzione per installare questo sito o aggiungerlo alla schermata Home.