📄 Analisi14 minuti di lettura

Qwen 3.5: L'Open Source di Alibaba che Sfida i Modelli Frontier

Alibaba rilascia 11 modelli in 14 giorni: dal 397B al 0.8B su smartphone. Benchmark frontier, costi -60%. E poi il team si dimette. L'analisi completa.

AS

Alessandro Saiani

Human in the Loop

Qwen 3.5: L'Open Source di Alibaba che Sfida i Modelli Frontier

11 modelli. 14 giorni. Da 397 miliardi di parametri a 0.8 miliardi. Dal data center allo smartphone. Tutti open-weight sotto Apache 2.0.

E poi, 24 ore dopo l'ultimo rilascio, l'architetto tecnico del progetto se n'è andato.

Qwen 3.5 è la release più aggressiva nella storia dell'AI open source — e forse anche la più fragile. Perché dietro i benchmark da primo della classe c'è una strategia che parla di soldi, geopolitica e una domanda fondamentale: quanto può durare l'open source quando chi lo finanzia vuole monetizzare?

Ma partiamo dai fatti.


La Timeline: 14 Giorni, 3 Onde

Alibaba non ha rilasciato Qwen 3.5 tutto insieme. Ha orchestrato tre rilasci in due settimane, ognuno pensato per un segmento diverso:

Onda 1 — Il Flagship (16 febbraio)

Qwen3.5-397B-A17B: il modello principale. 397 miliardi di parametri totali, ma ne attiva solo 17 miliardi per ogni token generato — grazie all'architettura Mixture-of-Experts (MoE).

Insieme al modello open-weight, Alibaba ha lanciato Qwen3.5-Plus: la versione hosted su Alibaba Cloud con finestra da 1 milione di token e tool integrati. La versione che fa soldi.

Onda 2 — I Medium (24 febbraio)

Tre modelli per chi vuole performance da frontier senza il costo del flagship:

  • Qwen3.5-122B-A10B — 122B totali, 10B attivi. Il miglior rapporto prestazioni/costo
  • Qwen3.5-35B-A3B — 35B totali, 3B attivi. Gira su una singola GPU A100
  • Qwen3.5-27B — 27B denso. Niente MoE, parametri tutti attivi

Onda 3 — Gli Small (2 marzo)

Quattro modelli per il deployment locale e on-device:

  • Qwen3.5-9B — gira su laptop con 16GB di RAM, 30+ token/secondo
  • Qwen3.5-4B — agente multimodale leggero
  • Qwen3.5-2B — gira su iPhone in modalità aereo
  • Qwen3.5-0.8B — il primo modello sotto il miliardo che processa video

Tutti disponibili su Hugging Face, ModelScope e Ollama. Tutti Apache 2.0.


L'Architettura: Nessuno È d'Accordo sull'Attention

Il titolo dell'analisi di Maxime Labonne su Hugging Face dice tutto: "Nobody Agrees on Attention Anymore".

Qwen 3.5 rompe con l'architettura Transformer standard in un modo che merita attenzione (gioco di parole voluto).

Il Problema dell'Attention Classica

L'attention standard — quella del paper "Attention Is All You Need" del 2017 — scala quadraticamente con la lunghezza dell'input. Raddoppi i token? Quadruplica il costo computazionale. Questo è il motivo per cui le context window lunghe sono costose.

La Soluzione: Gated DeltaNet + MoE

Qwen 3.5 usa un'architettura ibrida chiamata Gated DeltaNet:

  • 3 blocchi su 4 usano linear attention (Gated DeltaNet) — scala quasi linearmente con la lunghezza
  • 1 blocco su 4 usa full attention tradizionale — mantiene la capacità di ragionamento su relazioni distanti

Il Gated DeltaNet combina il meccanismo di decay di Mamba2 con una delta rule per aggiornare gli stati nascosti. In pratica: il modello "dimentica" gradualmente il contesto vecchio (come un filtro che sfuma) mantenendo vivido quello recente — simile a come funziona la nostra memoria.

Il risultato pratico? Finestre da 1 milione di token con un overhead computazionale drammaticamente inferiore rispetto a un Transformer puro.

Il MoE: 512 Esperti, 11 Attivi

L'altra innovazione è nel Mixture-of-Experts:

  • 512 esperti totali nel modello flagship
  • 10 esperti ruotati + 1 condiviso attivi per ogni token
  • Il router decide quali esperti attivare in base al contenuto

Questo spiega il rapporto 397B/17B: il modello "sa" 397 miliardi di parametri di cose, ma per ogni singolo token ne usa solo 17 miliardi — quelli più rilevanti. È come avere un team di 512 specialisti di cui ne chiami 11 alla volta.

Il beneficio per chi sviluppa: costi di inference fino a 8.6 volte inferiori rispetto al predecessore Qwen3-Max, con performance comparabili o superiori.


I Benchmark: Dove Brilla e Dove Crolla

I numeri di Qwen 3.5 sono impressionanti. Ma non tutti.

Dove brilla

BenchmarkQwen 3.5 397BGPT-5.2Claude Opus 4.5Note
AIME '26 (matematica)91.386.784.2Primo della classe
GPQA Diamond (scienza)81.478.980.1Competitivo
LiveCodeBench v6 (coding)83.681.279.8Forte nel competitive programming
BrowseComp (web browsing)78.671.369.4Domina grazie a context-folding
SWE-bench Verified (bug fixing)76.474.180.2Buono ma dietro Claude

Il dato BrowseComp è notevole: Qwen 3.5 batte tutti i modelli frontier americani nei task di navigazione web, usando una strategia aggressiva di "context-folding" che comprime il contesto delle pagine visitate.

Dove crolla

E qui viene il dato che cambia la prospettiva. Secondo l'analisi di VERTU sui benchmark di coding complessi:

I modelli Qwen 3.5 ottengono buoni risultati sui task semplici e expert-level, ma crollano sui task Master-level che richiedono coordinazione complessa su più file.

Il flagship 397B vede il suo ELO scendere da ~1550 sui task expert a 1194 sui task master — una caduta verticale. È lo stesso pattern che vediamo in molti modelli MoE: eccellenti sui singoli task, fragili quando serve orchestrare conoscenza da molti ambiti contemporaneamente.

Per chi sviluppa significa: Qwen 3.5 è eccellente per task focalizzati (fix un bug, implementa una funzione, scrivi un test) ma meno affidabile per refactoring complessi che toccano 20 file.

I Medium: Il Dato che Fa Rumore

Il dato più sorprendente viene dai modelli medium:

  • Qwen3.5-27B (denso, 27 miliardi) raggiunge 72.4 su SWE-bench Verified — lo stesso punteggio di GPT-5 mini. Un modello open-weight da 27B che pareggia il "piccolo" di OpenAI
  • Qwen3.5-122B-A10B segna 72.2 su BFCL-V4 (tool use), battendo GPT-5 mini (55.5) del 30%
  • Qwen3.5-9B ottiene 81.7 su GPQA Diamond, battendo GPT-OSS-120B (71.5) — un modello 13.5 volte più grande

VentureBeat ha titolato: "I modelli Medium di Alibaba offrono performance da Sonnet 4.5 su computer locali." Non è un'esagerazione.


Multimodale Nativo: Non un Add-on

Una differenza tecnica importante: Qwen 3.5 è multimodale dal pre-training. Non è un modello di testo a cui è stata aggiunta la visione dopo — le modalità sono fuse fin dall'inizio (early fusion).

Cosa significa in pratica:

  • Immagini fino a 1344x1344 pixel
  • Video fino a 60 secondi
  • Agenti visuali: il modello può analizzare screenshot di UI, identificare elementi interattivi e eseguire azioni multi-step

Il benchmark VITA-Bench (interazione agentica multimodale) dà 49.7 — non stellare in assoluto, ma il primo modello open-weight a raggiungere questi livelli.

Per gli sviluppatori, l'applicazione più immediata è il testing visivo: puoi dare al modello uno screenshot della tua app e chiedergli di identificare problemi di layout, accessibilità, o coerenza con il design system. Senza tool esterni, senza configurazione.

E il modello 0.8B che processa video su uno smartphone è un traguardo che un anno fa sembrava impossibile.


Il Costo: 60% in Meno

I numeri economici sono aggressivi quanto quelli tecnici.

Qwen3.5-Plus (la versione hosted) costa circa $0.18 per milione di token con context da 1M. Per confronto:

  • Claude Opus 4.6: ~$15 per milione di token (input)
  • GPT-5.2: ~$10 per milione di token (input)
  • Gemini 3 Pro: ~$3.50 per milione di token (input)

Stiamo parlando di un ordine di grandezza di differenza. Anche considerando che il modello hosted è meno capace del flagship (è ottimizzato per velocità), il rapporto prestazioni/prezzo è senza precedenti.

Per i modelli open-weight il discorso è ancora più netto: il costo è l'hardware. Il 9B gira su un laptop da 16GB. Il 2B gira su un iPhone. Il costo per token è essenzialmente zero dopo l'investimento hardware iniziale.

Questo apre scenari che i modelli proprietari non possono toccare: privacy totale (nessun dato esce dal dispositivo), zero latenza di rete, nessun vendor lock-in.


L'Elefante nella Stanza: Il Team Se Ne Va

E arriviamo alla parte che nessuno può ignorare.

Il 3 marzo — 24 ore dopo il rilascio dei modelli Small — l'architetto tecnico di Qwen e diversi membri senior del team hanno lasciato Alibaba. Le circostanze non sono chiare, ma le speculazioni sono convergenti: tensione tra la missione open source e la pressione di Alibaba per monetizzare.

VentureBeat ha titolato con una domanda diretta: "Alibaba ha appena azzoppato il suo team AI più potente?"

I segnali c'erano. Alibaba è sotto pressione degli investitori per trasformare gli investimenti in AI in revenue. Qwen3.5-Plus — il modello hosted a pagamento — è stato rilasciato contestualmente ai modelli open-weight, non come un afterthought. La strategia è chiara: l'open source attira gli sviluppatori, l'hosted li converte in clienti paganti.

Ma quando le figure chiave che hanno costruito la tecnologia se ne vanno, la domanda diventa: Qwen 3.5 è l'ultimo grande rilascio open source di questa scala da Alibaba?

Non lo sappiamo. Ma il precedente è preoccupante. La storia dell'AI è piena di team brillanti smantellati da decisioni aziendali — OpenAI stessa ne è l'esempio più eclatante.


Cosa Significa per Chi Sviluppa

Mettiamo da parte la geopolitica e parliamo di codice.

Se usi modelli proprietari (Claude, GPT, Gemini)

Qwen 3.5 non li sostituisce per i task complessi. Claude Opus 4.6 resta superiore su SWE-bench (80%+ vs 76.4%) e sui refactoring multi-file. Ma Qwen 3.5 erode il vantaggio sui task medi e semplici — quelli che sono il 70% del lavoro quotidiano.

La pressione sui prezzi è reale. Se Qwen3.5-Plus offre l'80% delle performance al 2% del costo, i provider proprietari dovranno rispondere.

Se fai self-hosting o on-device

Qwen 3.5 è probabilmente il miglior modello open-weight disponibile oggi per i seguenti scenari:

  • Coding assistant locale: il 27B denso su SWE-bench pareggia GPT-5 mini
  • Tool use e agenti: il 122B-A10B batte GPT-5 mini del 30% su BFCL
  • Privacy-first: nessun dato esce dal tuo hardware
  • Budget limitato: il 9B su un laptop con 16GB è gratis dopo l'hardware

Se vuoi sperimentare con gli agenti

Le capacità agentiche native — visual agent, tool calling, browsing — rendono Qwen 3.5 un ottimo punto di partenza per costruire agenti locali. Il benchmark BrowseComp da 78.6 suggerisce che il modello naviga il web meglio dei frontier americani.

Il caveat importante

Il crollo sui task Master-level è un limite reale. Se il tuo workflow richiede modifiche coordinate su molti file (il tipico refactoring di un codebase medio-grande), Qwen 3.5 non è ancora all'altezza. Per quei task, i modelli proprietari restano superiori.

E l'incertezza sul futuro del team è un rischio concreto per chi decide di basare il proprio stack su Qwen. Un modello open-weight è per sempre (Apache 2.0 non si revoca), ma il supporto, gli aggiornamenti e la correzione dei bug dipendono da chi ci lavora.


Il Panorama Più Ampio

Qwen 3.5 non è un evento isolato. È l'ennesima conferma di un trend che ormai è innegabile: il gap tra open source e proprietario si sta chiudendo.

Un anno fa, l'idea che un modello da 9B parametri potesse battere uno da 120B sui benchmark scientifici era fantascienza. Oggi è un dato pubblicato su paper peer-reviewed.

Un anno fa, far girare un modello multimodale su uno smartphone era un esperimento accademico. Oggi è un modello scaricabile da Hugging Face.

La domanda non è più "l'open source raggiungerà i modelli proprietari?". È diventata "quando li raggiungerà sui task complessi?". E la risposta, guardando la velocità con cui si chiude il gap, potrebbe essere: prima di quanto pensiamo.

Ma c'è un "se" grande come una casa: se chi lo finanzia continua a finanziarlo. E con il team di Qwen che perde pezzi, quel "se" è più rilevante che mai.


Fonti: