📄 Analisi10 minuti di lettura

Gemma 4 e GLM-5: L'Open Source Non Si Ferma

Gemma 4 batte Claude Sonnet di 10 punti. GLM-5 è stato trainato senza NVIDIA. Due modelli, due continenti, stesso messaggio: l'open source è arrivato.

AS

Alessandro Saiani

Human in the Loop

Gemma 4 e GLM-5: L'Open Source Non Si Ferma

84.3% contro 74.1%. Gemma 4, un modello open weight da 31 miliardi di parametri, batte Claude Sonnet di oltre dieci punti su GPQA Diamond -- uno dei benchmark più selettivi per il ragionamento scientifico. E dall'altra parte del pianeta, GLM-5 -- 744 miliardi di parametri, licenza MIT -- è stato trainato interamente su chip Huawei. Zero NVIDIA. Zero silicon americano.

Due modelli. Due continenti. Stesso messaggio: il gap tra open source e modelli chiusi non si sta riducendo. Si è chiuso.


Gemma 4: Il Salto Che Non Ti Aspetti

A inizio aprile Google DeepMind ha rilasciato Gemma 4, e il dato che colpisce di più non è nei benchmark assoluti. È nel delta rispetto alla generazione precedente.

Gemma 3 faceva il 20.8% su AIME 2026 -- il benchmark di matematica competitiva. Gemma 4 fa l'89.2%. Un salto di 4.3 volte. In una singola generazione. E la cosa più interessante? Sebastian Raschka, uno dei ricercatori più attenti all'architettura dei modelli, ha fatto notare su X che a livello architetturale Gemma 4 31B è "praticamente identico" a Gemma 3 27B.

Il salto non viene da un modello più grande. Viene da dati e recipe di training migliori. È la stessa lezione delle scaling laws: non servono più parametri -- servono parametri addestrati meglio.

Le varianti sono quattro, e coprono uno spettro enorme:

VarianteParametri attiviContextModalitàVRAM minima
31B Dense30.7B256KTesto + Immagini~24GB
26B MoE3.8B256KTesto + Immagini~18GB
E4B4.5B128KTesto + Immagini + Audio~8GB
E2B2.3B128KTesto + Immagini + Audio~4GB

Il punto chiave: E4B gira su 8 gigabyte di VRAM. Una GPU consumer, un laptop con Apple Silicon, una scheda da 300 euro. E supera Gemma 3 27B su diversi benchmark -- con un sesto dei parametri effettivi.

C'è anche un cambio di licenza significativo. Gemma 3 usava la "Gemma License", una licenza custom con restrizioni. Gemma 4 è Apache 2.0. Uso commerciale illimitato, nessun cap sugli utenti attivi, nessuna clausola opaca. A differenza di Llama, che blocca l'uso commerciale sopra i 700 milioni di utenti mensili, Gemma 4 non ha limiti. Per il 99.9% delle aziende quel cap di Llama è irrilevante, ma il principio conta.


GLM-5: 744 Miliardi Senza NVIDIA

Se Gemma 4 è la storia dell'efficienza, GLM-5 è la storia dell'indipendenza tecnologica.

Zhipu AI -- spin-off della Tsinghua University, quotata a Hong Kong a gennaio 2026 con una valutazione di 7.1 miliardi di dollari -- ha rilasciato GLM-5 a febbraio. Il paper ha un titolo che è un programma: "From Vibe Coding to Agentic Engineering".

I numeri: 744 miliardi di parametri totali, 40 miliardi attivi per token. Architettura Mixture of Experts con 256 esperti, con routing dinamico per token. Licenza MIT -- la più permissiva che esista. Pre-training su 28.5 trilioni di token.

Ma il dato storico è un altro. GLM-5 è stato trainato al 100% su chip Huawei Ascend 910B. Decine di migliaia di chip, framework MindSpore di Huawei, nessuna dipendenza da hardware americano.

Il contesto: Zhipu AI è nella U.S. Entity List dal gennaio 2025. Non può comprare GPU NVIDIA nemmeno volendo. Le sanzioni americane avevano un obiettivo preciso: rallentare lo sviluppo AI cinese tagliando l'accesso al silicon più avanzato.

Il risultato è un modello che compete con Claude Opus e GPT-4o sui benchmark più esigenti. 92.7% su AIME 2026. 86.0% su GPQA Diamond. 97.4% su MATH. 77.8% su SWE-bench Verified -- a tre punti da Claude Opus 4.5.


I Benchmark, Senza il Rumore

Servono i numeri uno di fianco all'altro. Non perché i benchmark siano la verità -- ma perché raccontano una tendenza.

BenchmarkGemma 4 31BGLM-5Claude Sonnet 4.6Claude Opus 4.5
GPQA Diamond84.3%86.0%74.1%--
AIME 202689.2%92.7%----
SWE-bench Verified--77.8%--80.9%
MATH--97.4%----
LiveCodeBench v680.0%------

Qualche nota prima di trarre conclusioni affrettate. I benchmark confrontano modelli su task specifici, in condizioni specifiche. GLM-5 è text-only -- niente visione, niente audio. Gemma 4 è multimodale. Sono modelli diversi, con forze diverse. E i benchmark più popolari -- HumanEval è quasi al 99% per tutti i modelli frontier -- stanno saturando: non differenziano più.

Ma la tendenza è chiara. Un anno fa, un modello open weight che battesse un modello chiuso su un benchmark frontier era una notizia. Oggi è la norma. Secondo i dati aggregati da HuggingFace, il gap MMLU tra modelli open e chiusi è passato da 17.5 punti a 0.3 punti in un singolo anno. Zero virgola tre.


Il Paradosso delle Sanzioni

Facciamo un passo indietro e guardiamo il quadro geopolitico, perché spiega molto di quello che sta succedendo.

L'amministrazione americana ha imposto restrizioni sempre più strette sull'export di chip avanzati verso la Cina. L'obiettivo era chiaro: senza GPU NVIDIA, senza il silicon più potente al mondo, la Cina non avrebbe potuto competere nella corsa AI. Almeno non ai livelli frontier.

GLM-5 è la risposta a quella tesi. Non una risposta teorica -- una risposta misurabile, riproducibile, e rilasciata con licenza MIT perché chiunque nel mondo possa verificarla.

Non è un caso isolato. DeepSeek ha scosso il mercato nel 2025 con V3, trainato a una frazione del costo dei modelli occidentali. Alibaba Qwen ha generato più modelli derivati su HuggingFace di Google e Meta combinati. La Cina rappresenta il 41% di tutti i download su HuggingFace, sorpassando gli Stati Uniti per la prima volta.

Le sanzioni non hanno fermato lo sviluppo AI cinese. Lo hanno costretto a diventare indipendente. E l'indipendenza, una volta raggiunta, non si torna indietro.

C'è un'ironia più profonda. Sia Google che Zhipu AI hanno scelto di competere attraverso l'open source, non nonostante esso. Apache 2.0 e MIT. Due superpotenze AI che usano la trasparenza come arma competitiva. Il modello aperto non è più l'alternativa economica a quello chiuso. È il campo di battaglia principale.


Per Chi Sviluppa: Come Usarli Oggi

Passiamo al pratico. Come metti le mani su questi modelli?

Gemma 4 -- il modo più semplice:

# 31B Dense -- serve una GPU con 24GB+ VRAM
ollama pull gemma4:31b

# 26B MoE -- più leggero, 18GB+ VRAM
ollama pull gemma4:26b

Il supporto è stato immediato: Ollama, llama.cpp, vLLM, LM Studio, HuggingFace Transformers, tutti disponibili dal giorno del lancio. Su un Mac con M2 Ultra, llama.cpp spinge circa 300 token al secondo. Su una RTX 4090 con Ollama, 40-60 tok/s. Nota: c'è un bug noto con vLLM che fa crollare le performance a circa 9 tok/s sulla stessa GPU -- se usi vLLM, controlla gli issue su GitHub prima di andare in produzione.

Per il modello edge, E4B gira su qualsiasi hardware con 8GB di VRAM. È il modello che metti su un laptop, su un Raspberry Pi con acceleratore, sul server nell'armadio che nessuno tocca da due anni.

GLM-5 -- un'altra storia:

# HuggingFace
# zai-org/GLM-5

# Quantizzazioni GGUF
# ubergarm/GLM-5-GGUF

# Per Apple Silicon
# inferencerlabs/GLM-5-MLX-4.8bit

GLM-5 è un modello da 744B parametri. Anche con MoE e 40B attivi, il self-hosting richiede infrastruttura seria. Stimiamo 2-5 mila dollari al mese in GPU cloud per servire il modello completo. Per la maggior parte dei team, la strada più pratica è passare dall'API di Z.ai o da OpenRouter.

Le quantizzazioni GGUF e le versioni NVFP4 di NVIDIA rendono il modello più accessibile, ma siamo comunque su hardware enterprise. Non è un modello che fai girare sul laptop.


Il Trend: Quando l'Open Source Raggiunge i Chiusi

Zoomiamo fuori dai singoli modelli e guardiamo la curva.

HuggingFace ha pubblicato il report "State of Open Source" nella primavera 2026. I numeri parlano da soli:

MetricaValoreCrescita
Utenti totali13 milioni~2x anno su anno
Modelli pubblici2+ milioni~2x anno su anno
Dataset pubblici500.000+~2x anno su anno
Dimensione media modello20.8B parametriEra 827M nel 2023

La dimensione media dei modelli è passata da 827 milioni a 20.8 miliardi di parametri in tre anni. Non perché servano modelli più grandi -- ma perché i team che prima non potevano permettersi di trainare un modello competitivo ora possono farlo. I costi di training sono crollati. Le architetture efficienti come MoE hanno democratizzato l'accesso.

E c'è un dato che cambia la narrativa in modo permanente. Il numero uno su HuggingFace è DeepSeek-R1 -- un modello cinese. Alibaba Qwen ha più derivati di Google e Meta messi insieme. I laboratori cinesi dominano le posizioni di testa tra i modelli open weight. È un ribaltamento completo rispetto a due anni fa, quando Llama era l'unico riferimento.


Open Weight Non È Open Source (e Perché Conta)

Prima di dichiarare la vittoria dell'open source, serve una distinzione che l'industria tende a confondere.

Sia Gemma 4 che GLM-5 sono modelli open weight. Scarichi i pesi, fai fine-tuning, li deploi come vuoi. Ma il codice di training, i dati di training, i dettagli della recipe di addestramento -- quelli non sono pubblici. Per nessuno dei due.

Secondo la definizione della Open Source Initiative, un progetto open source richiede dati, codice completo e parametri. Né Gemma 4 né GLM-5 soddisfano tutti i criteri. Né lo fa Llama. Nessun modello frontier lo fa.

In pratica, questo significa che devi prendere i modelli sulla fiducia. Non puoi verificare come sono stati addestrati, su quali dati, con quali bias potenziali. Li usi, li valuti sui tuoi task, e decidi se funzionano. È pragmatico, ma non è trasparente.

La distinzione conta soprattutto per le aziende in settori regolamentati. Se un modello produce output problematici, risalire alla causa richiede accesso ai dati di training -- accesso che nessuno ti dà.


Cosa Significa per Chi Costruisce Prodotti

Tre implicazioni pratiche.

Il costo dell'inferenza crolla. Se i modelli open weight competono con quelli chiusi sui benchmark, il vantaggio dei modelli chiusi si riduce alla comodità dell'API. E per quella comodità, paghi 3-10 volte di più a scala rispetto al self-hosting. Per chi elabora milioni di token al mese -- e con gli agenti AI quei numeri si raggiungono in fretta -- la differenza è di ordini di grandezza.

GDPR e compliance diventano un vantaggio competitivo. Far girare un modello in locale significa che i dati non escono dal tuo perimetro. Per chi lavora in sanità, finanza, legale -- e per chiunque gestisca dati di utenti europei -- è la differenza tra una valutazione di impatto GDPR complessa e una semplice. I dati restano dove sono. Fine del problema. E con E4B di Gemma 4 che gira su 8GB di VRAM, non serve nemmeno un datacenter per farlo.

Il modello diventa commodity. Con 2 milioni di modelli su HuggingFace, il valore non è più nel modello in sé. È nella capacità di usarlo: fine-tuning sui propri dati, integrazione nel proprio stack, deployment affidabile, monitoraggio in produzione. Chi sa costruire pipeline AI solide ha un vantaggio che non dipende da quale modello usa -- perché i modelli cambiano ogni mese. Le competenze di engineering restano.

Non serve scegliere tra Gemma 4 e GLM-5. Serve capire che il trend punta in una direzione sola: modelli potenti, accessibili, con licenze permissive, trainabili su hardware diversificato. Chi costruisce il proprio stack su questa realtà avrà più opzioni, più flessibilità e meno dipendenze di chi resta legato a una singola API chiusa.

Il messaggio di queste due settimane di aprile è semplice. L'open source non sta inseguendo i modelli chiusi. Li ha raggiunti. E ha una cosa che i modelli chiusi non avranno mai: la possibilità di essere eseguiti ovunque, da chiunque, senza chiedere permesso.


Fonti:

  1. Google Blog -- Gemma 4 announcement
  2. Google AI -- Gemma 4 Model Card
  3. GLM-5 paper su arXiv -- "From Vibe Coding to Agentic Engineering"
  4. GLM-5 su HuggingFace
  5. HuggingFace -- State of Open Source Spring 2026
  6. Maxime Labonne -- GLM-5: China's First Public AI Company Ships a Frontier Model
  7. Latent Space -- AINews Gemma 4
  8. VentureBeat -- Gemma 4 Apache 2.0 license change
  9. Sebastian Raschka su X -- analisi architettura Gemma 4
  10. California Management Review -- Open Source AI Disruption
  11. Artificial Analysis -- Gemma 4 vs Claude comparisons
  12. Let's Data Science -- How China's GLM-5 Works on Huawei Chips