Talkie-1930: il primo LLM 'vegano' e cosa fa traballare l'argomento del fair use
Un 13B addestrato solo su testo pre-1931, public domain al 100%. Tra gli autori c'è Alec Radford (ex OpenAI, GPT-1/2/3). $17K di training. Se funziona, l'argomento legale di mezza Silicon Valley vacilla.
Alessandro Saiani
Human in the Loop

Stamattina, 28 aprile 2026, è stato annunciato un modello che merita di essere guardato con attenzione anche da chi non si interessa di copyright. Si chiama Talkie-1930, è un dense da 13 miliardi di parametri, e ha una particolarità che fino a oggi nessuno aveva tentato a questa scala: è stato addestrato esclusivamente su testo pubblicato prima del 31 dicembre 1930.
Tradotto: zero materiale sotto copyright. Niente news scrapate, niente romanzi del Novecento, niente forum online, niente codice di repository moderni, niente trascrizioni di YouTube. Solo libri, articoli, lettere, atti pubblici fino al 1930 — quello che oggi, per la legge americana, è in dominio pubblico al 100%.
I dati tecnici dichiarati: 260 miliardi di token di training, architettura transformer dense, weights rilasciati su HuggingFace con licenza Apache 2.0. È stato accompagnato da un "twin" moderno chiamato talkie-web-13b-base, addestrato su FineWeb (corpus di dati moderni standard), con identica architettura — esiste apposta per fare confronti fair sul cosa cambia avere un dataset PD-only invece che misto.
Chi c'è dietro
Tre autori, e qui sta il primo dato che fa drizzare le antenne. Il paper è firmato da Nick Levine, David Duvenaud (Vector Institute, Toronto, ricerca su safety e interpretabilità) e — udite — Alec Radford. Lo stesso Alec Radford di GPT-1, GPT-2, GPT-3, CLIP. Uno dei nomi su cui è stata costruita OpenAI nei suoi anni d'oro. Oggi non è più dipendente OpenAI.
Funding: Coefficient Giving e Anthropic.
Quando uno dei papà del paradigma "scrape everything, train on it" pubblica un modello che fa esattamente l'opposto, vale la pena chiedersi se sia un capriccio nostalgico o se ci sia un messaggio.
Perché 1931 esattamente
Il cutoff non è arbitrario. Negli Stati Uniti il copyright dura 95 anni dalla pubblicazione. Il 1° gennaio 2026 è stato il Public Domain Day in cui sono entrate in dominio pubblico le opere pubblicate nel 1930: tra queste, libri di Faulkner e Christie, parti dello spartito di Gershwin, e — dato curioso — Betty Boop. È il primo Public Domain Day in cui un cutoff "1930" è completo per gli Stati Uniti.
Talkie esce quattro mesi dopo, e non è una coincidenza. È il primo modello dell'era "post-95-anni" che sfrutta l'ingresso appena avvenuto di un'intera annata in PD.
Il concetto "vegan model" (e il suo paradosso)
L'espressione "vegan model" ha cominciato a circolare nei thread di nicchia: per analogia con la dieta, indica modelli addestrati senza ingredienti "eticamente compromessi" — niente copyright, niente dati personali identificabili, niente scraping aggressivo.
Talkie non è il primo. Ha alcuni predecessori:
- KL3M (Kelvin Legal, 2024): primo modello commerciale "fair learning" su dataset PD legali
- Common Corpus (Pleias, 2024): 500 miliardi di token PD/openly licensed, multilingue
- Common Pile v0.1 (giugno 2025): 8TB di testo PD curato dalla community
- Mr. Chatterbox (marzo 2026): 340M parametri, esperimento più piccolo
Talkie è però il primo che arriva alla taglia seria (13B) con metodologia rigorosa e twin di confronto. È il primo a chiedere, in modo non aggirabile: un modello PD-only può essere competitivo?
C'è però un paradosso che vale la pena nominare subito, perché l'autore e Simon Willison lo segnalano apertamente: il base model è effettivamente vegan, ma il chat model (quello con cui interagisci) usa Claude Sonnet 4.6 come judge durante il post-training DPO. Cioè, per insegnare a Talkie a essere "utile" in conversazione, lo si fa giudicare da un modello che è invece nato dallo scraping aggressivo standard.
È una contaminazione indiretta che molti definiscono "vegan-tainted": gli ingredienti del piatto principale sono puri, ma il critico gastronomico che giudica le cucine non lo è. Onestamente, gli autori avrebbero potuto rilasciare solo il base e non il chat, o usare un altro modello PD-only come judge — la loro scelta è pragmatica (volevano qualcosa di realmente utilizzabile), ma indebolisce il claim "vegan al 100%".
Come ragiona un modello che non sa cosa è il computer
Qui sta la parte più curiosa, ed è quella che farà girare Talkie sui social per qualche giorno.
Simon Willison ha pubblicato il suo classico test del pelican SVG: chiedere al modello di disegnare un pellicano in formato SVG. Il modello — non avendo mai visto un SVG, una specifica W3C, un browser, o anche solo l'XML — ha provato comunque a rispondere. Il risultato è un testo che inventa una sintassi plausibile-per-il-1860, e nella narrazione che accompagna il "disegno" descrive "pellicani che pescano a cavallo sul Reno". Il modello non sapeva cosa fosse un SVG e ha proiettato la richiesta su un quadro mentale del proprio universo (animali, mestieri, geografia europea fluviale). È hallucination, ma è hallucination coerente con la cultura del 1930.
Altri esempi che girano nei primi thread di Hacker News:
- Chiedendo del monarca britannico tra 1900 e 1950, il modello risponde regina invece di re — è un dato di "data leakage temporale" interessante: probabilmente il modello sta generalizzando dall'unico periodo recente in cui c'era una regina sul trono (l'epoca vittoriana, fino al 1901) e proiettando.
- Il termine FDR appare nel suo vocabolario, anche se Roosevelt non era ancora presidente nel 1930 (lo diventa nel 1933). Gli stessi autori discutono questo caso nel paper come esempio di leakage residuo.
- Nelle discussioni HN viene anche citata l'idea — proposta da Demis Hassabis — di addestrare un modello con cutoff pre-1915 per testare se possa derivare autonomamente la relatività generale di Einstein. È un esperimento mentale che mostra il vero potenziale di ricerca dei modelli "vintage": ablation culturali come strumento per misurare generalizzazione vera vs interpolazione.
Cioè: anche con cutoff rigoroso, qualche infiltrazione moderna passa. Il corpus PD non è perfettamente pulito.
Cosa cambia se questo funziona davvero
Qui arriviamo alla parte che mi interessa di più, quella che secondo me è il vero punto politico di Talkie. Cito tre cose che si stanno scrivendo in questi mesi e che oggi fanno da cornice.
NYT vs OpenAI è ancora aperto. Il 5 gennaio 2026 il giudice Stein ha ordinato a OpenAI di consegnare 20 milioni di log ChatGPT come parte della discovery. Il caso si concentra in particolare sulla "regurgitation" — la riproduzione quasi-letterale di articoli protetti. La difesa di OpenAI poggia in larga parte sul fair use, e il fair use poggia in parte sull'argomento "non si può fare un modello competitivo senza dati protetti".
EU AI Act ha pubblicato il template per i provider di GPAI (General Purpose AI): dovranno rilasciare un summary pubblico del training data, anche se aggregato.
US Copyright Office Part 3 Report (gennaio 2026) ha già detto che l'argomento fair use è meno solido di quanto le aziende vorrebbero credere, e che la presenza di alternative pulite è uno dei fattori che pesano contro.
In questo contesto, Talkie-1930 funziona come prova che si può. Non funziona ancora bene quanto un modello con dati moderni, certo. Ma è competitivo abbastanza da rendere insostenibile la frase "non si può fare un LLM utile senza copyright". Tre punti pratici:
- Indebolisce l'argomento del fair use: se esiste un'alternativa che non comporta scraping di materiale protetto, il fair use diventa più difficile da invocare. È esattamente il fattore che i tribunali considerano sotto il "transformative use" del 17 U.S.C. § 107.
- Apre una via legale per i provider che vogliono certezza: una banca, un ospedale, uno studio legale potrebbero preferire un modello PD-only anche se più debole, in cambio della certezza che non ci saranno cause future. È un mercato.
- Costringe i big lab a dichiarare le proprie scelte: se il PD-only è praticabile e qualcuno lo fa, OpenAI/Anthropic/Google devono giustificare perché non lo fanno. La risposta non può più essere "è impossibile". Diventa "abbiamo scelto".
Il dato sul costo che cambia il quadro
Un utente di Hacker News (espadrine) ha stimato il costo di training di Talkie-1930 in circa $17.000 di compute, basandosi sull'architettura dichiarata (10²² FLOPs).
Diciassettemila dollari. È una cifra che una singola università, un consorzio, persino un ente non-profit possono permettersi. Non è il miliardo di dollari di GPT-5. È un esperimento riproducibile.
Questo cambia la conversazione perché, se domani la stessa metodologia viene applicata da:
- Un consorzio di biblioteche europee con materiale PD italiano/francese/tedesco
- Un'università legale che usa solo case law in PD
- Una rivista scientifica che usa solo pre-print openly licensed
...iniziamo a vedere una proliferazione di modelli specializzati copyright-clean, ognuno competitivo nel suo dominio. La domanda non sarà più "PD-only è fattibile" ma "perché non l'avete fatto prima".
Le critiche serie
Per onestà, Talkie ha critiche reali, non solo "sì ma è piccolo".
- Data leakage temporale: come detto sopra (FDR, queen, etc.), il corpus PD non è perfettamente puro. C'è una forma sottile di contaminazione moderna che andrebbe quantificata seriamente.
- Bias culturali concentrati: addestrare un LLM su testo pre-1931 significa concentrare i bias razziali, di genere, di classe e coloniali del tempo. Non è solo "manca informazione moderna", è "abbonda informazione tossica". Il deployment in produzione richiederebbe filtri pesanti.
- Lingua: il corpus è prevalentemente in inglese. L'italiano pre-1931 esiste in PD (tutto Pirandello, Verga, parte di Pavese) ma serve un consorzio dedicato per fare un Talkie italiano.
- 13B è una taglia di "validazione del concetto", non un modello da produzione enterprise. Per battere Claude Sonnet 4.6 servono salti di scala che probabilmente PD-only può fare, ma non ha ancora dimostrato.
- Il paradosso del judge: il chat model è stato post-trainato con Claude come judge, quindi non è del tutto vegan. Gli autori avrebbero potuto fare diversamente, e non l'hanno fatto.
Aggancio alla settimana
Negli ultimi tre articoli ho parlato di scaling laws e Densing Law, di coautorato umano-AI come questione di umiltà, di GROUNDING.md come file che sovrascrive i prompt. Sono tutti pezzi sullo stesso tema di fondo: chi ha autorità nell'ecosistema AI.
Talkie-1930 aggiunge una dimensione che mancava: il training data come questione politica. Possiamo discutere finché vogliamo di gerarchia di prompt, di umiltà del coautore, di legge di scaling — ma se il fondamento (i dati) è acquisito in modi legalmente o eticamente fragili, tutto quello che ci costruiamo sopra è altrettanto fragile.
Talkie non risolve il problema. È un modello, non un manifesto. Ma è la prima dimostrazione concreta — a 13B di taglia e $17K di costo — che la frase "non possiamo fare AI senza copyright" è diventata difficile da difendere.
In chiusura
Tre cose, brevi, da portare a casa.
Per chi sviluppa: Talkie-1930 oggi non sostituisce GPT-5 o Claude per uso generale. Ma è interessante per ablation studies (cosa cambia avere/non avere modernità nel corpus?), per applicazioni storiche/letterarie, e come baseline pulita per ricerca.
Per chi pensa al business AI: il PD-only sta diventando un'opzione reale. Se il tuo prodotto serve a settori regolati o avversi al rischio legale, vale la pena monitorare questa famiglia di modelli — Talkie, Common Pile, KL3M, e i prossimi che arriveranno.
Per chi si interessa al dibattito copyright: Talkie sposta l'asticella. La frase "non possiamo, è impossibile" è stata sostituita da "si può, ma costa di più in qualità". È un cambio di registro, e i tribunali lo noteranno.
Per ora io l'ho scaricato, ci sto giocando, e la prima cosa che mi ha sorpreso è che — incredibilmente — un LLM che non sa cosa è il computer è anche un LLM che non sa fingere di sapere cosa è il computer. È una purezza epistemica che, per uno che è abituato al "sembra sempre di sapere tutto" dei modelli moderni, è quasi rinfrescante.
Fonti:
- Simon Willison - Introducing talkie
- talkie-lm.com - sito ufficiale
- GitHub talkie-lm
- HackerNews thread #47927903
- MarkTechPost - Meet Talkie-1930
- Common Pile v0.1 paper
- KL3M Data Project paper
- Patent AI Lab - NYT vs OpenAI 2026 Update
- National Law Review - 20M ChatGPT logs
- Duke - Public Domain Day 2026
- US Copyright Office - Part 3 Report
- EU - GPAI Training Data Template