本板块的 9,396 条记录绝大多数是重建结果,而非官方披露。本页说明每一类数字是如何得出的,以及应当在多大程度上信任它。
全部来自 Epoch AI,一家追踪 AI 发展轨迹的独立研究机构。他们以 CC BY 4.0 许可发布数据集,该许可允许再利用、再分发和复制,前提是标注来源与作者。这一署名出现在本板块的每个页面上,就在其所对应的数据旁边。
这里没有任何内容是从他们网站抓取的。每个数据集都取自他们公开提供下载的文件,规范化后存入数据库,再以独立页面的形式重新发布。研究是他们的;结构、交叉链接和文字是我们的。
训练算力几乎从不由实验室公布。它要么根据所用硬件重建(芯片数量乘以吞吐量、训练时长和利用率系数),要么根据模型架构与数据集规模推算。每条模型记录都注明其数字由哪种方法得出。
数据中心容量与功率来自施工许可、卫星影像、购电协议、芯片订单和已披露的支出。视指标不同,这些数字带有约 1.4 倍至 1.6 倍的不确定性——一个标注为 900 MW 的站点,实际也可能是 600 或 1,400。
芯片供应与存量依据财报、出货数据和供应链产能建模。它们以中位数并附第 5 与第 95 百分位区间的形式发布,三个值全部保留,而不是压缩为中间值。
公司财务数据来自媒体报道而非申报文件——这些公司多数未上市。不同媒体对同一季度报道的数字并不一致,因此每份报道都作为各自带日期的数据点保留,而不是平均成一条序列。公司页面上的主要数字就是最新的一份报道,并注明其日期。
Epoch 为每个数据中心公布了街道地址但没有坐标——他们自己的地图在浏览器中解析。因此算力地图使用 OpenStreetMap 对这些地址进行地理编码,并记录每一条解析到了哪一级:建筑、街道、城区、城镇,或仅到县。少数站点给出的是工程描述而非邮政地址;这些按记录中提到的城镇定位,并且从不宣称比这更精确。
每一个候选匹配都会与国家进行校验,在美国还会与从地址中解析出的州进行校验,不一致则予以拒绝——没有这道校验,错误州份中同名的街道会悄无声息地把一个吉瓦级站点挪走。GPU 集群坐标来自 Epoch 自己的导出文件,按发布原样使用。
归属信息——谁拥有某个数据中心、谁在使用它的算力——都带有明确的置信标签:confident、likely 或 speculative。这些标签保留在记录上并予以显示,因为「微软可能拥有它」和「微软拥有它」是两种不同的说法。
模型记录同样如此,它们对整条条目带有置信评级;GPU 集群也是,它们带有确定性字段,并常附注说明存在哪些争议。当某个数字带有百分位区间时,该区间会被保存;当某个数字缺失时,页面选择不作陈述,而不是猜测。
Epoch 经常重新发布——有些数据集每周都会变动。本站会从他们发布的文件重新同步,每条记录都保存其获取日期,也就是每页底部来源行所标注的日期。如果这里的某个数字与他们的不一致,首先应当核对获取日期。