I 9,396 record di questa sezione sono in larghissima parte ricostruzioni, non dichiarazioni. Questa pagina spiega come si arriva a ciascun tipo di numero e quanta fiducia merita.
Tutti provengono da Epoch AI, un istituto di ricerca indipendente che segue la traiettoria dell’IA. Pubblica i suoi set di dati con licenza CC BY 4.0, che consente riutilizzo, ridistribuzione e riproduzione a condizione che siano citati la fonte e gli autori. Quella citazione compare su ogni pagina di questa sezione, accanto ai dati a cui si riferisce.
Nulla qui viene estratto dal loro sito con scraping. Ogni set di dati e preso dai file che pubblicano per il download, normalizzato in un database e ripubblicato come pagine singole. La ricerca e loro; la struttura, i collegamenti incrociati e i testi sono nostri.
Il calcolo di addestramento non viene quasi mai pubblicato da un laboratorio. Viene ricostruito o dall’hardware impiegato (numero di chip moltiplicato per il throughput, la durata dell’addestramento e un fattore di utilizzo) oppure dall’architettura e dalla dimensione del set di dati. Ogni record di modello indica quale metodo ha prodotto la sua cifra.
Capacita e potenza dei data center provengono da permessi di costruzione, immagini satellitari, contratti di fornitura elettrica, ordini di chip e spese riportate. Questi numeri portano circa 1,4x-1,6x di incertezza a seconda della metrica: un sito indicato a 900 MW potrebbe plausibilmente essere da 600 o da 1.400.
Offerta e scorte di chip sono modellate a partire da relazioni finanziarie, dati di spedizione e capacita della catena di fornitura. Sono pubblicate come mediana con una banda tra il 5o e il 95o percentile, e tutti e tre i valori vengono conservati anziche ridotti al valore centrale.
I dati finanziari delle aziende provengono dalla stampa, non da depositi ufficiali: la maggior parte di queste aziende non e quotata. Testate diverse riportano cifre diverse per lo stesso trimestre, percio ogni resoconto viene mantenuto come punto datato a se invece di essere mediato in un’unica serie. La cifra in evidenza sulla pagina di un’azienda e semplicemente il resoconto piu recente, e ne indica la data.
Epoch pubblica un indirizzo per ogni data center ma nessuna coordinata: la loro mappa le risolve nel browser. La mappa del calcolo geocodifica quindi quegli indirizzi con OpenStreetMap e registra fino a che livello ciascuno e stato risolto: l’edificio, la via, il quartiere, il comune, o soltanto la provincia. Alcuni siti indicano una descrizione di cantiere anziche un indirizzo postale; quelli vengono collocati in base al comune citato nel record e non sono mai presentati come piu precisi di cosi.
Ogni corrispondenza candidata viene verificata rispetto al paese e, negli Stati Uniti, rispetto allo stato estratto dall’indirizzo, e scartata se non concorda: senza quel controllo un nome di via identico nello stato sbagliato sposterebbe in silenzio un sito da un gigawatt. Le coordinate dei cluster GPU provengono dall’esportazione di Epoch e sono usate cosi come pubblicate.
Le attribuzioni — chi possiede un data center, chi ne usa il calcolo — portano un’etichetta di affidabilita esplicita: confident, likely o speculative. Quelle etichette restano sul record e vengono mostrate, perche «Microsoft probabilmente possiede questo» e «Microsoft possiede questo» sono affermazioni diverse.
Lo stesso vale per i record dei modelli, che portano una valutazione di affidabilita sull’intera voce, e per i cluster GPU, che portano un campo di certezza e spesso una nota che spiega cosa e in discussione. Quando una cifra ha una banda percentile, la banda viene conservata; quando una cifra manca, la pagina non dice nulla anziche tirare a indovinare.
Epoch ripubblica spesso: alcuni set di dati cambiano ogni settimana. Questo sito si risincronizza dai loro file pubblicati e ogni record conserva la data in cui e stato prelevato, che e cio che riporta la riga della fonte in fondo a ogni pagina. Se un numero qui diverge dal loro, la data di prelievo e la prima cosa da controllare.