Os 9,396 registos desta seccao sao esmagadoramente reconstrucoes, nao divulgacoes. Esta pagina explica como se chega a cada tipo de numero e que confianca merece.
Todos vem da Epoch AI, um instituto de investigacao independente que acompanha a trajetoria da IA. Publicam os seus conjuntos de dados sob licenca CC BY 4.0, que permite a reutilizacao, a redistribuicao e a reproducao desde que a fonte e os autores sejam creditados. Esse credito aparece em cada pagina desta seccao, ao lado dos dados a que se aplica.
Nada aqui e extraido do site deles por scraping. Cada conjunto de dados e retirado dos ficheiros que publicam para descarga, normalizado numa base de dados e republicado como paginas individuais. A investigacao e deles; a estrutura, as ligacoes cruzadas e os textos sao nossos.
A computacao de treino quase nunca e publicada por um laboratorio. E reconstruida a partir do hardware utilizado (numero de chips multiplicado pelo debito, pela duracao do treino e por um fator de utilizacao) ou a partir da arquitetura e do tamanho do conjunto de dados. Cada registo de modelo indica que metodo produziu o seu numero.
A capacidade e a potencia dos centros de dados vem de licencas de construcao, imagens de satelite, contratos de compra de eletricidade, encomendas de chips e despesa reportada. Estes numeros carregam cerca de 1,4x a 1,6x de incerteza consoante a metrica: um local indicado com 900 MW poderia plausivelmente ter 600 ou 1.400.
A oferta e o stock de chips sao modelados a partir de relatorios de resultados, dados de expedicao e capacidade da cadeia de abastecimento. Sao publicados como mediana com uma banda entre o percentil 5 e o 95, e os tres valores sao guardados em vez de reduzidos ao valor central.
As financas das empresas vem da imprensa, nao de documentos oficiais — a maioria destas empresas nao esta cotada. Diferentes orgaos noticiam numeros diferentes para o mesmo trimestre, por isso cada relato e mantido como o seu proprio ponto datado em vez de ser calculada uma media numa unica serie. O numero em destaque na pagina de uma empresa e simplesmente o relato mais recente, e indica a data a que se refere.
A Epoch publica uma morada para cada centro de dados mas nenhuma coordenada — o mapa deles resolve-as no navegador. O mapa de computacao geocodifica portanto essas moradas contra o OpenStreetMap e regista ate que nivel cada uma foi resolvida: o edificio, a rua, o bairro, a localidade, ou apenas o concelho. Alguns locais indicam uma descricao de obra em vez de uma morada postal; esses sao situados a partir da localidade nomeada no registo e nunca sao apresentados como mais precisos do que isso.
Cada correspondencia candidata e verificada contra o pais e, nos Estados Unidos, contra o estado extraido da morada, e rejeitada se divergir — sem essa verificacao, um nome de rua igual no estado errado deslocaria silenciosamente um local de um gigawatt. As coordenadas dos clusters de GPU vem da propria exportacao da Epoch e sao usadas tal como publicadas.
As atribuicoes — quem detem um centro de dados, quem usa a sua computacao — trazem uma etiqueta de confianca explicita: confident, likely ou speculative. Essas etiquetas ficam no registo e sao mostradas, porque «a Microsoft provavelmente detem isto» e «a Microsoft detem isto» sao afirmacoes diferentes.
O mesmo se aplica aos registos de modelos, que trazem uma classificacao de confianca sobre a entrada inteira, e aos clusters de GPU, que trazem um campo de certeza e muitas vezes uma nota a explicar o que esta em disputa. Quando um numero tem uma banda de percentis, a banda e guardada; quando falta um numero, a pagina nao diz nada em vez de adivinhar.
A Epoch republica com frequencia — alguns conjuntos de dados mudam semanalmente. Este site volta a sincronizar a partir dos ficheiros publicados e cada registo guarda a data em que foi obtido, que e o que a linha de fonte no fundo de cada pagina indica. Se um numero aqui divergir do deles, a data de obtencao e a primeira coisa a verificar.