Gemma 4 e GLM-5: L'Open Source Non Si Ferma
Gemma 4 batte Claude Sonnet di 10 punti. GLM-5 è stato trainato senza NVIDIA. Due modelli, due continenti, stesso messaggio: l'open source è arrivato.
Alessandro Saiani
Human in the Loop

84.3% contro 74.1%. Gemma 4, un modello open weight da 31 miliardi di parametri, batte Claude Sonnet di oltre dieci punti su GPQA Diamond -- uno dei benchmark più selettivi per il ragionamento scientifico. E dall'altra parte del pianeta, GLM-5 -- 744 miliardi di parametri, licenza MIT -- è stato trainato interamente su chip Huawei. Zero NVIDIA. Zero silicon americano.
Due modelli. Due continenti. Stesso messaggio: il gap tra open source e modelli chiusi non si sta riducendo. Si è chiuso.
Gemma 4: Il Salto Che Non Ti Aspetti
A inizio aprile Google DeepMind ha rilasciato Gemma 4, e il dato che colpisce di più non è nei benchmark assoluti. È nel delta rispetto alla generazione precedente.
Gemma 3 faceva il 20.8% su AIME 2026 -- il benchmark di matematica competitiva. Gemma 4 fa l'89.2%. Un salto di 4.3 volte. In una singola generazione. E la cosa più interessante? Sebastian Raschka, uno dei ricercatori più attenti all'architettura dei modelli, ha fatto notare su X che a livello architetturale Gemma 4 31B è "praticamente identico" a Gemma 3 27B.
Il salto non viene da un modello più grande. Viene da dati e recipe di training migliori. È la stessa lezione delle scaling laws: non servono più parametri -- servono parametri addestrati meglio.
Le varianti sono quattro, e coprono uno spettro enorme:
| Variante | Parametri attivi | Context | Modalità | VRAM minima |
|---|---|---|---|---|
| 31B Dense | 30.7B | 256K | Testo + Immagini | ~24GB |
| 26B MoE | 3.8B | 256K | Testo + Immagini | ~18GB |
| E4B | 4.5B | 128K | Testo + Immagini + Audio | ~8GB |
| E2B | 2.3B | 128K | Testo + Immagini + Audio | ~4GB |
Il punto chiave: E4B gira su 8 gigabyte di VRAM. Una GPU consumer, un laptop con Apple Silicon, una scheda da 300 euro. E supera Gemma 3 27B su diversi benchmark -- con un sesto dei parametri effettivi.
C'è anche un cambio di licenza significativo. Gemma 3 usava la "Gemma License", una licenza custom con restrizioni. Gemma 4 è Apache 2.0. Uso commerciale illimitato, nessun cap sugli utenti attivi, nessuna clausola opaca. A differenza di Llama, che blocca l'uso commerciale sopra i 700 milioni di utenti mensili, Gemma 4 non ha limiti. Per il 99.9% delle aziende quel cap di Llama è irrilevante, ma il principio conta.
GLM-5: 744 Miliardi Senza NVIDIA
Se Gemma 4 è la storia dell'efficienza, GLM-5 è la storia dell'indipendenza tecnologica.
Zhipu AI -- spin-off della Tsinghua University, quotata a Hong Kong a gennaio 2026 con una valutazione di 7.1 miliardi di dollari -- ha rilasciato GLM-5 a febbraio. Il paper ha un titolo che è un programma: "From Vibe Coding to Agentic Engineering".
I numeri: 744 miliardi di parametri totali, 40 miliardi attivi per token. Architettura Mixture of Experts con 256 esperti, con routing dinamico per token. Licenza MIT -- la più permissiva che esista. Pre-training su 28.5 trilioni di token.
Ma il dato storico è un altro. GLM-5 è stato trainato al 100% su chip Huawei Ascend 910B. Decine di migliaia di chip, framework MindSpore di Huawei, nessuna dipendenza da hardware americano.
Il contesto: Zhipu AI è nella U.S. Entity List dal gennaio 2025. Non può comprare GPU NVIDIA nemmeno volendo. Le sanzioni americane avevano un obiettivo preciso: rallentare lo sviluppo AI cinese tagliando l'accesso al silicon più avanzato.
Il risultato è un modello che compete con Claude Opus e GPT-4o sui benchmark più esigenti. 92.7% su AIME 2026. 86.0% su GPQA Diamond. 97.4% su MATH. 77.8% su SWE-bench Verified -- a tre punti da Claude Opus 4.5.
I Benchmark, Senza il Rumore
Servono i numeri uno di fianco all'altro. Non perché i benchmark siano la verità -- ma perché raccontano una tendenza.
| Benchmark | Gemma 4 31B | GLM-5 | Claude Sonnet 4.6 | Claude Opus 4.5 |
|---|---|---|---|---|
| GPQA Diamond | 84.3% | 86.0% | 74.1% | -- |
| AIME 2026 | 89.2% | 92.7% | -- | -- |
| SWE-bench Verified | -- | 77.8% | -- | 80.9% |
| MATH | -- | 97.4% | -- | -- |
| LiveCodeBench v6 | 80.0% | -- | -- | -- |
Qualche nota prima di trarre conclusioni affrettate. I benchmark confrontano modelli su task specifici, in condizioni specifiche. GLM-5 è text-only -- niente visione, niente audio. Gemma 4 è multimodale. Sono modelli diversi, con forze diverse. E i benchmark più popolari -- HumanEval è quasi al 99% per tutti i modelli frontier -- stanno saturando: non differenziano più.
Ma la tendenza è chiara. Un anno fa, un modello open weight che battesse un modello chiuso su un benchmark frontier era una notizia. Oggi è la norma. Secondo i dati aggregati da HuggingFace, il gap MMLU tra modelli open e chiusi è passato da 17.5 punti a 0.3 punti in un singolo anno. Zero virgola tre.
Il Paradosso delle Sanzioni
Facciamo un passo indietro e guardiamo il quadro geopolitico, perché spiega molto di quello che sta succedendo.
L'amministrazione americana ha imposto restrizioni sempre più strette sull'export di chip avanzati verso la Cina. L'obiettivo era chiaro: senza GPU NVIDIA, senza il silicon più potente al mondo, la Cina non avrebbe potuto competere nella corsa AI. Almeno non ai livelli frontier.
GLM-5 è la risposta a quella tesi. Non una risposta teorica -- una risposta misurabile, riproducibile, e rilasciata con licenza MIT perché chiunque nel mondo possa verificarla.
Non è un caso isolato. DeepSeek ha scosso il mercato nel 2025 con V3, trainato a una frazione del costo dei modelli occidentali. Alibaba Qwen ha generato più modelli derivati su HuggingFace di Google e Meta combinati. La Cina rappresenta il 41% di tutti i download su HuggingFace, sorpassando gli Stati Uniti per la prima volta.
Le sanzioni non hanno fermato lo sviluppo AI cinese. Lo hanno costretto a diventare indipendente. E l'indipendenza, una volta raggiunta, non si torna indietro.
C'è un'ironia più profonda. Sia Google che Zhipu AI hanno scelto di competere attraverso l'open source, non nonostante esso. Apache 2.0 e MIT. Due superpotenze AI che usano la trasparenza come arma competitiva. Il modello aperto non è più l'alternativa economica a quello chiuso. È il campo di battaglia principale.
Per Chi Sviluppa: Come Usarli Oggi
Passiamo al pratico. Come metti le mani su questi modelli?
Gemma 4 -- il modo più semplice:
# 31B Dense -- serve una GPU con 24GB+ VRAM
ollama pull gemma4:31b
# 26B MoE -- più leggero, 18GB+ VRAM
ollama pull gemma4:26b
Il supporto è stato immediato: Ollama, llama.cpp, vLLM, LM Studio, HuggingFace Transformers, tutti disponibili dal giorno del lancio. Su un Mac con M2 Ultra, llama.cpp spinge circa 300 token al secondo. Su una RTX 4090 con Ollama, 40-60 tok/s. Nota: c'è un bug noto con vLLM che fa crollare le performance a circa 9 tok/s sulla stessa GPU -- se usi vLLM, controlla gli issue su GitHub prima di andare in produzione.
Per il modello edge, E4B gira su qualsiasi hardware con 8GB di VRAM. È il modello che metti su un laptop, su un Raspberry Pi con acceleratore, sul server nell'armadio che nessuno tocca da due anni.
GLM-5 -- un'altra storia:
# HuggingFace
# zai-org/GLM-5
# Quantizzazioni GGUF
# ubergarm/GLM-5-GGUF
# Per Apple Silicon
# inferencerlabs/GLM-5-MLX-4.8bit
GLM-5 è un modello da 744B parametri. Anche con MoE e 40B attivi, il self-hosting richiede infrastruttura seria. Stimiamo 2-5 mila dollari al mese in GPU cloud per servire il modello completo. Per la maggior parte dei team, la strada più pratica è passare dall'API di Z.ai o da OpenRouter.
Le quantizzazioni GGUF e le versioni NVFP4 di NVIDIA rendono il modello più accessibile, ma siamo comunque su hardware enterprise. Non è un modello che fai girare sul laptop.
Il Trend: Quando l'Open Source Raggiunge i Chiusi
Zoomiamo fuori dai singoli modelli e guardiamo la curva.
HuggingFace ha pubblicato il report "State of Open Source" nella primavera 2026. I numeri parlano da soli:
| Metrica | Valore | Crescita |
|---|---|---|
| Utenti totali | 13 milioni | ~2x anno su anno |
| Modelli pubblici | 2+ milioni | ~2x anno su anno |
| Dataset pubblici | 500.000+ | ~2x anno su anno |
| Dimensione media modello | 20.8B parametri | Era 827M nel 2023 |
La dimensione media dei modelli è passata da 827 milioni a 20.8 miliardi di parametri in tre anni. Non perché servano modelli più grandi -- ma perché i team che prima non potevano permettersi di trainare un modello competitivo ora possono farlo. I costi di training sono crollati. Le architetture efficienti come MoE hanno democratizzato l'accesso.
E c'è un dato che cambia la narrativa in modo permanente. Il numero uno su HuggingFace è DeepSeek-R1 -- un modello cinese. Alibaba Qwen ha più derivati di Google e Meta messi insieme. I laboratori cinesi dominano le posizioni di testa tra i modelli open weight. È un ribaltamento completo rispetto a due anni fa, quando Llama era l'unico riferimento.
Open Weight Non È Open Source (e Perché Conta)
Prima di dichiarare la vittoria dell'open source, serve una distinzione che l'industria tende a confondere.
Sia Gemma 4 che GLM-5 sono modelli open weight. Scarichi i pesi, fai fine-tuning, li deploi come vuoi. Ma il codice di training, i dati di training, i dettagli della recipe di addestramento -- quelli non sono pubblici. Per nessuno dei due.
Secondo la definizione della Open Source Initiative, un progetto open source richiede dati, codice completo e parametri. Né Gemma 4 né GLM-5 soddisfano tutti i criteri. Né lo fa Llama. Nessun modello frontier lo fa.
In pratica, questo significa che devi prendere i modelli sulla fiducia. Non puoi verificare come sono stati addestrati, su quali dati, con quali bias potenziali. Li usi, li valuti sui tuoi task, e decidi se funzionano. È pragmatico, ma non è trasparente.
La distinzione conta soprattutto per le aziende in settori regolamentati. Se un modello produce output problematici, risalire alla causa richiede accesso ai dati di training -- accesso che nessuno ti dà.
Cosa Significa per Chi Costruisce Prodotti
Tre implicazioni pratiche.
Il costo dell'inferenza crolla. Se i modelli open weight competono con quelli chiusi sui benchmark, il vantaggio dei modelli chiusi si riduce alla comodità dell'API. E per quella comodità, paghi 3-10 volte di più a scala rispetto al self-hosting. Per chi elabora milioni di token al mese -- e con gli agenti AI quei numeri si raggiungono in fretta -- la differenza è di ordini di grandezza.
GDPR e compliance diventano un vantaggio competitivo. Far girare un modello in locale significa che i dati non escono dal tuo perimetro. Per chi lavora in sanità, finanza, legale -- e per chiunque gestisca dati di utenti europei -- è la differenza tra una valutazione di impatto GDPR complessa e una semplice. I dati restano dove sono. Fine del problema. E con E4B di Gemma 4 che gira su 8GB di VRAM, non serve nemmeno un datacenter per farlo.
Il modello diventa commodity. Con 2 milioni di modelli su HuggingFace, il valore non è più nel modello in sé. È nella capacità di usarlo: fine-tuning sui propri dati, integrazione nel proprio stack, deployment affidabile, monitoraggio in produzione. Chi sa costruire pipeline AI solide ha un vantaggio che non dipende da quale modello usa -- perché i modelli cambiano ogni mese. Le competenze di engineering restano.
Non serve scegliere tra Gemma 4 e GLM-5. Serve capire che il trend punta in una direzione sola: modelli potenti, accessibili, con licenze permissive, trainabili su hardware diversificato. Chi costruisce il proprio stack su questa realtà avrà più opzioni, più flessibilità e meno dipendenze di chi resta legato a una singola API chiusa.
Il messaggio di queste due settimane di aprile è semplice. L'open source non sta inseguendo i modelli chiusi. Li ha raggiunti. E ha una cosa che i modelli chiusi non avranno mai: la possibilità di essere eseguiti ovunque, da chiunque, senza chiedere permesso.
Fonti:
- Google Blog -- Gemma 4 announcement
- Google AI -- Gemma 4 Model Card
- GLM-5 paper su arXiv -- "From Vibe Coding to Agentic Engineering"
- GLM-5 su HuggingFace
- HuggingFace -- State of Open Source Spring 2026
- Maxime Labonne -- GLM-5: China's First Public AI Company Ships a Frontier Model
- Latent Space -- AINews Gemma 4
- VentureBeat -- Gemma 4 Apache 2.0 license change
- Sebastian Raschka su X -- analisi architettura Gemma 4
- California Management Review -- Open Source AI Disruption
- Artificial Analysis -- Gemma 4 vs Claude comparisons
- Let's Data Science -- How China's GLM-5 Works on Huawei Chips