📰 News6 minuti di lettura

GitHub Copilot Usera' i Tuoi Dati per il Training. Opt-Out Entro il 24 Aprile.

Dal 24 aprile 2026, input, output e snippet di Copilot Free/Pro/Pro+ addestrano modelli AI di Microsoft. Come fare opt-out in 2 minuti.

AS

Alessandro Saiani

Human in the Loop

GitHub Copilot Usera' i Tuoi Dati per il Training. Opt-Out Entro il 24 Aprile.

Ogni riga di codice che scrivi con Copilot, ogni suggerimento che accetti, ogni snippet che modifichi. Dal 24 aprile 2026, tutto questo diventa materiale di addestramento per i modelli AI di Microsoft. A meno che tu non faccia opt-out.

GitHub ha annunciato il 25 marzo l'aggiornamento alla propria privacy policy e ai termini di servizio. Il cambiamento riguarda gli utenti dei piani Free, Pro e Pro+. Se non fai nulla, accetti.


Cosa cambia esattamente

La nuova policy autorizza GitHub a raccogliere i dati di interazione con Copilot per addestrare modelli AI. Non parliamo di accesso ai tuoi repository a riposo. Parliamo di tutto cio' che transita attraverso Copilot mentre lavori.

Nel dettaglio, i dati raccolti includono:

  • Input inviati a Copilot (prompt, domande, istruzioni)
  • Output generati (suggerimenti accettati, modificati o rifiutati)
  • Snippet di codice nel contesto della sessione
  • Contesto attorno al cursore (codice circostante usato per generare suggerimenti)
  • Commenti e documentazione visibili nella finestra attiva
  • Nomi file e struttura del repository

La raccolta si applica ai piani Copilot Free, Pro e Pro+. I piani Business e Enterprise non sono impattati: mantengono le garanzie contrattuali esistenti sulla non-utilizzazione dei dati per training.


La questione dei repository privati

Qui la faccenda si fa delicata. GitHub precisa che non accede ai contenuti dei repository a riposo. Ma i dati generati lavorando su repository privati sono inclusi nella raccolta.

In pratica: se stai scrivendo codice in un repo privato e Copilot ti suggerisce un completamento, quel contesto -- il codice circostante, i nomi dei file, la struttura del progetto -- fa parte dei dati raccolti. Non e' il repository in se', ma e' il contesto del tuo lavoro su quel repository.

Per chi lavora su codice proprietario, la distinzione tra "contenuto del repo" e "contesto di interazione generato lavorando sul repo" e' sottile. Il risultato pratico e' che frammenti di codice privato possono finire nel dataset di training.


Come fare opt-out (2 minuti)

La procedura e' semplice. Se non l'hai gia' fatta, questi sono i passaggi:

  1. Vai su github.com/settings/copilot/features
  2. Scorri fino alla sezione "Privacy"
  3. Cerca l'opzione "Allow GitHub to use my data for AI model training"
  4. Imposta il dropdown su "Disabled"
  5. Salva

Se in passato avevi gia' disattivato la raccolta dati per "product improvements", la tua preferenza viene mantenuta. Non devi fare nulla di aggiuntivo.

La deadline e' il 24 aprile 2026. Chi non modifica le impostazioni entro quella data accetta automaticamente la nuova policy.


Con chi vengono condivisi i dati

GitHub specifica che i dati saranno condivisi con Microsoft e le sue affiliate aziendali, ma non con provider AI di terze parti.

Questo significa che i dati possono essere usati per addestrare modelli interni a Microsoft -- inclusi futuri modelli Copilot, modelli Azure, o qualsiasi altro progetto AI dell'ecosistema Microsoft. Non finiscono a OpenAI o ad altri provider esterni (almeno secondo la policy attuale).

GitHub inquadra il cambiamento come un "allineamento con pratiche di settore consolidate". Il che e' un modo diplomatico per dire: lo fanno tutti, lo facciamo anche noi.


Come si comportano gli altri

Vale la pena mettere in contesto la policy di GitHub confrontandola con i principali competitor.

Claude Code (Anthropic): usa le API di Anthropic come backend. Le API commerciali non utilizzano input e output per il training dei modelli -- e' scritto esplicitamente nella policy API. I dati vengono conservati per un massimo di 30 giorni (con possibilita' di zero data retention per i clienti Enterprise), poi vengono eliminati. Nessun training.

Cursor: offre una "Privacy Mode" che, se attivata, impedisce che il codice venga usato per il training da Cursor o da provider terzi. Senza Privacy Mode attiva, pero', dati come prompt, snippet e azioni nell'editor possono essere usati per migliorare i modelli. Non e' quindi privacy-first di default: la protezione richiede un'azione esplicita dell'utente.

Copilot Business/Enterprise: come detto, i piani aziendali di GitHub mantengono le garanzie di non-utilizzo per training. Il cambio riguarda solo i piani individuali.

Il pattern e' chiaro: i tier gratuiti e consumer sono quelli dove i tuoi dati diventano il prodotto. I tier enterprise, dove i clienti pagano (molto) di piu', offrono garanzie reali. Non e' una novita', ma vederlo applicato al proprio codice sorgente ha un peso diverso.


Cosa significa per aziende e freelancer

Per le aziende che usano Copilot Free o Pro per i propri sviluppatori, il rischio e' concreto. Frammenti di codice proprietario, nomi di componenti interni, struttura di progetti riservati -- tutto questo puo' finire nel dataset di training di Microsoft.

Per i freelancer che lavorano su progetti di clienti con Copilot Free, la questione e' ancora piu' spinosa. Il codice del cliente viene esposto a una raccolta dati di cui il cliente stesso potrebbe non essere a conoscenza.

Le opzioni sono tre:

  1. Fare opt-out e continuare a usare Copilot senza raccolta dati per training
  2. Passare a Copilot Business/Enterprise per garanzie contrattuali piu' solide
  3. Valutare alternative come Claude Code (le API commerciali non usano dati per training) o Cursor (con Privacy Mode attiva, nessun dato viene usato per training)

Per chi ha vincoli contrattuali di riservatezza con i propri clienti (NDA, clausole di confidenzialita'), lasciare attiva la raccolta dati potrebbe configurare una violazione contrattuale. Non e' un rischio teorico.


Il quadro piu' ampio

Questa mossa di GitHub si inserisce in un trend preciso. I provider di tool AI stanno cercando di costruire dataset proprietari di alta qualita'. E il codice scritto da sviluppatori professionisti -- con il contesto, le correzioni, le scelte architetturali -- e' tra i dati di maggior valore per addestrare modelli di coding.

Il fatto che l'opt-out sia necessario (invece dell'opt-in) dice molto sulla direzione. GitHub scommette sul fatto che la maggioranza degli utenti non cambiera' le impostazioni. E probabilmente ha ragione.

Per chi sviluppa, la lezione pratica e' sempre la stessa: leggere le policy, non dare nulla per scontato, e decidere consapevolmente cosa si e' disposti a condividere. Due minuti nelle impostazioni possono fare la differenza.


Fonti:

  1. GitHub Blog - Updates to Copilot interaction data usage policy
  2. The Register - GitHub: We're going to train on your data after all
  3. GitHub Changelog - Privacy Statement and Terms of Service update
  4. How-To Geek - GitHub's Copilot will use you as AI training data
  5. gHacks - GitHub Enables Copilot Data Collection by Default