Teoria AI

Articoli educativi su LLM, architetture agent, prompt engineering e le tecnologie che alimentano gli strumenti di AI coding. Teoria spiegata per sviluppatori.

24 contenuti trovati

La prima risposta è lenta, le altre volano: cosa conserva davvero la KV cache
Teoria
Teoria
Intermedio
11 min23 set 2026

La prima risposta è lenta, le altre volano: cosa conserva davvero la KV cache

Per un modello da 13 miliardi di parametri la cache di un singolo token occupa 800 KB, e una richiesta da 2048 token arriva a 1,6 GB. Da quella memoria nasce lo sconto del 90% sul prompt caching, e anche la regola che quasi nessuno applica: la cache è un prefisso, e un byte cambiato in testa la butta via tutta.

#KV cache #Prompt caching #Costi
AS
Alessandro Saiani
Leggi
Partire dal rumore: e se il codice non si scrivesse da sinistra a destra?
Teoria
Teoria
Intermedio
11 min17 set 2026

Partire dal rumore: e se il codice non si scrivesse da sinistra a destra?

I modelli a diffusione partono da una tela di rumore e la raffinano tutta insieme, quindi possono tornare sui propri passi. Nel 2026 scrivono codice a oltre mille token al secondo. La tabella di Google dice anche quanto costa: perdono su tutti e quattro i benchmark contro il fratello autoregressivo.

#Diffusion #Teoria #Generazione
AS
Alessandro Saiani
Leggi
«Aspetta, ricontrollo»: quando un modello ragiona davvero e quando recita
Teoria
Teoria
Intermedio
10 min14 set 2026

«Aspetta, ricontrollo»: quando un modello ragiona davvero e quando recita

Nel ragionamento dei modelli c'è un punto dopo il quale la risposta non cambia più: su alcuni modelli arriva dopo il 13% del testo. Sulle domande facili il resto è teatro, sulle difficili no. E quando un'informazione arriva da un tool, il ragionamento tende a non dirlo.

#Reasoning #Chain of Thought #Interpretabilità
AS
Alessandro Saiani
Leggi
Siamo in un esponenziale?
Teoria
Teoria
10 min17 giu 2026

Siamo in un esponenziale?

Tre curve esponenziali reali. Tre che non lo sono. La differenza tra fare il dev oggi con realismo o con hype.

#scaling-laws #metr #agentic-coding
AS
Alessandro Saiani
Leggi
Long-running agents: l'autonomia lunga è meno nuova (e più fragile) di come la raccontano
Teoria
Teoria
Intermedio
12 min1 giu 2026

Long-running agents: l'autonomia lunga è meno nuova (e più fragile) di come la raccontano

Anthropic dichiara agenti che girano per ore. Cognition parla di giorni. Il pattern in sé però ha 80 anni — cibernetica, servomeccanismi, planner anni '70. La novità è il controller. E con la novità arriva la fragilità.

#Long-Running Agents #Cibernetica #Architetture Agentiche
AS
Alessandro Saiani
Leggi
Wiener aveva già scritto il manuale degli agenti nel 1948
Teoria
Teoria
Intermedio
10 min5 mag 2026

Wiener aveva già scritto il manuale degli agenti nel 1948

Il loop sense→decide→act→feedback che chiamiamo 'agentic AI' è cibernetica del 1948. Cosa Wiener e Ashby avevano già capito, e cosa davvero è nuovo oggi.

#Cibernetica #Storia AI #Agenti
AS
Alessandro Saiani
Leggi
MoE: l'idea di attivare solo gli esperti che servono
Teoria
Teoria
Intermedio
11 min4 mag 2026

MoE: l'idea di attivare solo gli esperti che servono

Cos'è davvero un Mixture of Experts: router, top-k, active vs total. Da Jacobs/Hinton 1991 a DeepSeek V4-Pro, Mixtral, Qwen3 e Llama 4. Senza formule pesanti.

#MoE #Architetture LLM #DeepSeek
AS
Alessandro Saiani
Leggi
Il 27B che batte il 397B: fine della favola dello scaling
Teoria
Teoria
12 min24 apr 2026

Il 27B che batte il 397B: fine della favola dello scaling

Qwen3.6-27B supera un MoE da 397B su benchmark di coding. Ma non è 15x meno parametri: è una storia di scaling laws, Chinchilla, Densing Law e — sorpresa — del fatto che RLVR funziona male su MoE.

#Scaling Laws #Qwen #MoE
AS
Alessandro Saiani
Leggi
Pre-training: Come un LLM Legge Internet e Impara a Parlare
Teoria
Fondamenti
Intermedio
13 min15 apr 2026

Pre-training: Come un LLM Legge Internet e Impara a Parlare

Da 300B a 15T token. Da $900 a $191M. Il pre-training è la fase dove un LLM legge tutto internet e impara a prevedere la prossima parola. Ecco come funziona.

#Pre-training #LLM #Training
AS
Alessandro Saiani
Leggi