इस खंड के 9,396 रिकॉर्ड अधिकांशतः पुनर्निर्मित अनुमान हैं, आधिकारिक रूप से जारी आंकड़े नहीं। यह पृष्ठ बताता है कि हर तरह का आंकड़ा कैसे निकाला जाता है और उस पर कितना भरोसा किया जाना चाहिए।
यह सब Epoch AI से आता है, एक स्वतंत्र शोध संस्थान जो AI की दिशा पर नज़र रखता है। वे अपने डेटासेट CC BY 4.0 लाइसेंस के तहत प्रकाशित करते हैं, जो स्रोत और लेखकों को श्रेय देने की शर्त पर पुनः उपयोग, पुनर्वितरण और पुनरुत्पादन की अनुमति देता है। वह श्रेय इस खंड के हर पृष्ठ पर, उसी डेटा के बगल में दिखाई देता है जिस पर वह लागू होता है।
यहां कुछ भी उनकी साइट से स्क्रैप नहीं किया गया है। हर डेटासेट उन्हीं फ़ाइलों से लिया जाता है जो वे डाउनलोड के लिए प्रकाशित करते हैं, एक डेटाबेस में सामान्यीकृत किया जाता है, और अलग-अलग पृष्ठों के रूप में फिर से प्रकाशित किया जाता है। शोध उनका है; संरचना, आपसी लिंक और लेखन हमारा है।
प्रशिक्षण कंप्यूट किसी प्रयोगशाला द्वारा लगभग कभी प्रकाशित नहीं किया जाता। इसे या तो उपयोग किए गए हार्डवेयर से पुनर्निर्मित किया जाता है (चिप संख्या को थ्रूपुट, प्रशिक्षण अवधि और उपयोग कारक से गुणा करके) या आर्किटेक्चर और डेटासेट के आकार से। हर मॉडल रिकॉर्ड बताता है कि उसका आंकड़ा किस विधि से निकला।
डेटा सेंटर क्षमता और बिजली निर्माण अनुमतियों, उपग्रह चित्रों, बिजली खरीद समझौतों, चिप ऑर्डरों और रिपोर्ट किए गए खर्च से आती है। मापदंड के अनुसार इनमें लगभग 1.4 से 1.6 गुना अनिश्चितता होती है — 900 मेगावाट बताया गया कोई स्थल वास्तव में 600 या 1,400 का भी हो सकता है।
चिप आपूर्ति और भंडार का मॉडल आय रिपोर्टों, शिपमेंट डेटा और आपूर्ति श्रृंखला क्षमता से बनाया जाता है। इन्हें माध्यिका के साथ 5वें और 95वें प्रतिशतक की सीमा के रूप में प्रकाशित किया जाता है, और तीनों मान संग्रहीत किए जाते हैं, बीच के मान तक सीमित नहीं किए जाते।
कंपनियों के वित्तीय आंकड़े दाखिल दस्तावेज़ों से नहीं, प्रेस रिपोर्टिंग से आते हैं — इनमें से अधिकांश कंपनियां निजी हैं। अलग-अलग माध्यम एक ही तिमाही के लिए अलग-अलग आंकड़े देते हैं, इसलिए हर रिपोर्ट को एक ही श्रृंखला में औसत करने के बजाय तिथि सहित अपने अलग बिंदु के रूप में रखा जाता है। किसी कंपनी के पृष्ठ पर मुख्य आंकड़ा बस सबसे हालिया रिपोर्ट है, और उसकी तिथि भी बताई जाती है।
Epoch हर डेटा सेंटर का डाक पता प्रकाशित करता है पर निर्देशांक नहीं — उनका अपना मानचित्र उन्हें ब्राउज़र में हल करता है। इसलिए कंप्यूट मानचित्र उन पतों को OpenStreetMap के विरुद्ध जियोकोड करता है, और दर्ज करता है कि हर एक किस स्तर तक हल हुआ: इमारत, सड़क, ज़िला, कस्बा, या केवल काउंटी तक। कुछ स्थल डाक पते के बजाय निर्माण विवरण देते हैं; उन्हें रिकॉर्ड में नामित कस्बे से रखा जाता है और उससे अधिक सटीक कभी नहीं बताया जाता।
हर संभावित मिलान देश के विरुद्ध जांचा जाता है और, संयुक्त राज्य में, पते से निकाले गए राज्य के विरुद्ध भी, और असहमति होने पर अस्वीकार कर दिया जाता है — इस जांच के बिना गलत राज्य में एक ही नाम की सड़क चुपचाप किसी गीगावाट स्थल को खिसका देगी। GPU क्लस्टर के निर्देशांक Epoch के अपने निर्यात से आते हैं और प्रकाशित रूप में ही उपयोग होते हैं।
श्रेय संबंधी जानकारी — कोई डेटा सेंटर किसका है, उसका कंप्यूट कौन इस्तेमाल करता है — पर एक स्पष्ट विश्वास टैग होता है: confident, likely या speculative। ये टैग रिकॉर्ड पर बने रहते हैं और दिखाए जाते हैं, क्योंकि "शायद माइक्रोसॉफ्ट का है" और "माइक्रोसॉफ्ट का है" अलग-अलग दावे हैं।
यही बात मॉडल रिकॉर्ड पर भी लागू होती है, जिन पर पूरी प्रविष्टि के लिए विश्वास रेटिंग होती है, और GPU क्लस्टर पर भी, जिनमें निश्चितता का क्षेत्र होता है और अक्सर एक टिप्पणी जो बताती है कि विवाद किस बात पर है। जहां किसी आंकड़े की प्रतिशतक सीमा होती है, वह सीमा संग्रहीत की जाती है; जहां आंकड़ा नहीं है, वहां पृष्ठ अनुमान लगाने के बजाय कुछ नहीं कहता।
Epoch बार-बार दोबारा प्रकाशित करता है — कुछ डेटासेट हर सप्ताह बदलते हैं। यह साइट उनकी प्रकाशित फ़ाइलों से फिर से सिंक करती है और हर रिकॉर्ड वह तिथि संग्रहीत करता है जब उसे लिया गया था, और यही हर पृष्ठ के नीचे स्रोत पंक्ति में दिखती है। यदि यहां का कोई आंकड़ा उनके आंकड़े से अलग हो, तो सबसे पहले यही तिथि जांचनी चाहिए।