Czy strategia AI Microsoftu jest spowalniana przez niedobór chipów?

Czy strategia AI Microsoftu jest spowalniana przez niedobór chipów?

Układy są dość małe — niektóre mieszczą się na dłoni. Ale są niezbędne do budowania modeli sztucznej inteligencji, a największe firmy technologiczne na świecie potrzebują ich ogromnych ilości, aby pozostać na czele.

Microsoft jest jedną z tych firm. I na papierze wydaje się mieć problem. Dochodzenie przeprowadzone przez Guardiana wykazało pozorną rozbieżność między tym, co Microsoft mówi o swojej mocy obliczeniowej AI, a liczbą zaawansowanych układów AI, które faktycznie ma w użyciu.

To nie jest też mała luka. Microsoft podobno zamierzał mieć 1,8 miliona układów AI zainstalowanych w swoich centrach danych na całym świecie do końca 2024 roku. Prawie dwa lata później, w trakcie ekspansji wartej 280 miliardów dolarów, firma ma zainstalowane 2,2 miliona układów AI, zgodnie z wewnętrznymi dokumentami, do których dotarł Guardian. To mniej niż połowa liczby, jakiej spodziewali się niektórzy eksperci.

Mówiąc wprost, globalny wyścig AI wymaga budowy ogromnych centrów danych działających na niezwykle drogich układach. Pozorna rozbieżność sugeruje, że najnowsze centra danych Microsoftu mogą nie być w pełni operacyjne — albo, jeśli są, nie mają układów, których potrzebują.

To wskazuje również na większy problem: trudno jest śledzić, jak faktycznie postępuje technologia AI. Układy napędzające AI są produkowane przez Nvidię, jedną z dwóch najcenniejszych firm na świecie. Jej łańcuch dostaw jest jedną z najlepiej strzeżonych tajemnic w branży.

Prawie bez wyjątków Nvidia nie raportuje, ile tych układów sprzedaje ani komu. Jej klienci — największe firmy technologiczne na świecie — również nie ujawniają, ile ich mają. Bez tych informacji bardzo trudno jest komukolwiek wiedzieć, czy AI naprawdę się rozwija, czy nie.

Microsoft: Próżnia władzy?

W ciągu ostatnich dwóch lat Microsoft twierdzi, że budował infrastrukturę AI w zawrotnym tempie. Jego dyrektor generalny, Satya Nadella, powiedział w zeszłym roku, że podwoi globalną powierzchnię centrów danych do połowy 2027 roku. Od 2022 roku zainwestował około 280 miliardów dolarów w grunty, budynki i infrastrukturę obliczeniową, aby zbudować AI. To obejmuje ponad 41 miliardów dolarów tylko w ostatnim kwartale.

Ale trudno jest oszacować, ile centrów danych Microsoft zbudował za te pieniądze.

Jednym ze sposobów oceny postępów firmy jest spojrzenie na jej publiczne ogłoszenia, zwłaszcza dotyczące zapotrzebowania na energię. Centra danych wymagają energii elektrycznej, więc sposobem na oszacowanie, ile z nich jest operacyjnych, jest zsumowanie energii, którą Microsoft ma dostępną — jego mocy obliczeniowej AI.

Własne deklaracje Microsoftu, w raportach rocznych i kwartalnych wynikach finansowych, sugerują, że dodał 5 gigawatów (GW) mocy centrów danych w ciągu ostatnich dwóch lat w ramach rozbudowy AI. Firma twierdzi, że ma teraz setki centrów danych na pięciu kontynentach.

Pięć gigawatów to ogromna ilość energii — cztery razy więcej niż największy park centrów danych w Europie. Ale całkowita moc Microsoftu powinna być jeszcze większa; firma buduje infrastrukturę AI od 2022 roku. O ile większa, to otwarte pytanie.

W wewnętrznej prezentacji z 2024 roku Microsoft podobno twierdził, że ma już zainstalowane 5 GW mocy centrów danych. To sugerowałoby, że teraz może mieć łącznie 10 GW. Nie jest jasne, czy wszystkie to centra danych AI — niektóre mogą być przeznaczone na inne usługi chmurowe. Ale własne oświadczenia Microsoftu wskazują, że zdecydowana większość jego ostatnich wydatków była skoncentrowana na budowie infrastruktury AI.

Dziesięć gigawatów centrów danych AI sugerowałoby, że Microsoft powinien mieć około 6,4 miliona procesorów graficznych (GPU). Shaolei Ren, profesor na Uniwersytecie Kalifornijskim w Riverside, powiedział, że raporty zrównoważonego rozwoju Microsoftu — które zawierają dane dotyczące zużycia energii i są publikowane oddzielnie od wyników finansowych — przedstawiają inny obraz. Powiedział, że te raporty sugerują, iż moc obliczeniowa AI Microsoftu w 2024 roku wynosiła prawdopodobnie bliżej 1,2 GW. Ale nawet ta niższa liczba oznaczałaby, że Microsoft potrzebowałby około 4 milionów układów AI — jeśli dodał 5 GW centrów danych AI w ciągu ostatnich dwóch lat.

„Zgodnie z ich własnymi wskaźnikami Microsoft może mieć rację. Ale nie jest jasne, co mają na myśli, mówiąc, że dodali moc centrów danych. Podają niewystarczający kontekst" — powiedział Ren. „Raporty zrównoważonego rozwoju są audytowane przez stronę trzecią. Mają większą wiarygodność niż ogłoszenia".

Analityk specjalizujący się w Nvidii powiedział, że jego zdaniem Microsoft powinien mieć więcej układów, biorąc pod uwagę jego publiczne oświadczenia. „To dla mnie mało. To mniej, niż się spodziewałem, że Microsoft będzie miał" — powiedział.

Microsoft nalegał, że obliczenia Guardiana opierają się na nieprawidłowych informacjach. Nie przedstawił żadnych wyjaśnień, które z liczb Guardiana są nieprawidłowe ani dlaczego. Jasne jest, że rozbudowa mocy obliczeniowej AI przez Microsoft wydaje się postępować znacznie wolniej, niż mogą sugerować jego raporty roczne.

Ren powiedział: „Zabezpieczenie lub ogłoszenie 1 GW mocy w ciągu jednego kwartału na papierze może być prawdopodobne. Ale uruchomienie tej mocy i faktyczne wykorzystanie jej do obliczeń w tym samym kwartale byłoby znacznie trudniejsze".

Źródła wewnątrz Microsoftu mówią, że całkowita liczba układów AI firmy „prawie się nie zmieniła" w ciągu ostatniego roku.

Część pozornej rozbieżności może tłumaczyć współpraca Microsoftu z OpenAI. Dokładne warunki ich komercyjnego partnerstwa nie są publiczne, ale ta jednostka może odpowiadać za część wdrożeń centrów danych Microsoftu, których nie ma w dokumentach, do których dotarł Guardian.

Zobacz obraz w pełnym rozmiarze
Centrum danych Microsoftu w Middenmeer w Holandii. Fotografia: ANP/Shutterstock

„Możesz mieć mnóstwo układów… których nie możesz podłączyć"

Jest jeszcze jeden czynnik: niektóre z dużych projektów Microsoftu wydają się dalekie od operacyjności.

Weźmy największy projekt AI Microsoftu w USA, parę centrów danych w Wisconsin i Georgii o nazwie Fairwater. W kwietniu Nadella, dyrektor generalny Microsoftu, powiedział, że projekt Fairwater w Wisconsin „wchodzi do użytku". Jednak zdjęcia satelitarne budynku od Epoch AI wydają się wskazywać, że tylko jego część jest operacyjna. W maju Microsoft przyznał gazecie z Wisconsin, że Fairwater nie jest jeszcze online.

To bardzo częste zjawisko, powiedział Ren. Początkowo była to inwestycja o mocy wielu gigawatów i wartości wielu miliardów dolarów. Trzy lata później zbudowano tylko 300 MW.

Zobacz obraz w pełnym rozmiarze
Satya Nadella powiedział w zeszłym roku, że Microsoft podwoi globalną powierzchnię centrów danych do połowy 2027 roku. Fotografia: Jeff Chiu/AP

Wewnętrzny dokument wskazuje również, że Microsoft ma mniej najnowszego modelu układów Nvidii, Blackwella, niż można by się spodziewać, biorąc pod uwagę publiczne ogłoszenia Nvidii. W marcu zeszłego roku dyrektor generalny Nvidii, Jensen Huang, powiedział, że zamówienia na Blackwell od czterech największych klientów Nvidii — powszechnie uważanych za Amazon, Oracle, Microsoft i Google — wyniosły 3,6 miliona.

Nie podano szczegółowego podziału tej liczby, ale Microsoft historycznie był jednym z największych klientów Nvidii. Jeśli tak było nadal, powinno to oznaczać, że łączne zasoby Blackwella Microsoftu wynoszą blisko 1 miliona układów. W rzeczywistości firma ma zainstalowane mniej niż połowę tej liczby.

Gdzie są układy, jeśli nie w centrach danych?

Bilans Nvidii wydaje się wskazywać, że sprzedała ona bardzo wiele układów; w lutym odnotowała przychody w wysokości 215,9 miliarda dolarów. Czy Microsoft je kupił, ale ich nie zainstalował? Ile, i czy wszystkie są w jego posiadaniu?

Nadella zdawał się nawiązywać do tego pytania w podcaście pod koniec zeszłego roku o nazwie All Things AI, gdzie mówił o rozbudowie centrów danych Microsoftu. Największym problemem, jak powiedział, była energia elektryczna i budowa centrów danych wystarczająco blisko miejsc, gdzie znajduje się energia.

„Jeśli nie możesz tego zrobić, możesz faktycznie mieć mnóstwo układów siedzących w magazynie, których nie mogę podłączyć. W rzeczywistości to jest mój problem dzisiaj. To nie jest problem z dostawami układów. To właściwie to, że nie mam ciepłych powłok, do których mógłbym je podłączyć".

Rzecznik Microsoftu powiedział: „Przez kilka dekad Microsoft zbudował globalną infrastrukturę, aby sprostać szybko rosnącemu zapotrzebowaniu klientów na usługi chmurowe i AI. Nasze centra danych łączą niestandardowe krzem, układy AMD, Intel i Nvidia w wielu generacjach, wraz z infrastrukturą sieciową, pamięci masowej i systemową potrzebną do działania na dużą skalę. Microsoft nie raportuje liczby konkretnych układów w swojej infrastrukturze AI. Szacunki, które Guardian nam przekazał, są niedokładne i wyciągają błędne wnioski z nieprawidłowych założeń".

Nvidia nie odpowiedziała na prośbę o komentarz.

Jak obliczyć liczbę układów na podstawie „mocy obliczeniowej AI" firmy

Największe firmy technologiczne na świecie mierzą swoją moc obliczeniową AI w kategoriach energii: gigawatów. Jeden gigawat zasila od 700 000 do 1 miliona domów. Meta twierdzi, że jej kontrowersyjne centrum danych Hyperion w Luizjanie będzie miało moc 5 GW. Brytyjska firma DataVita planuje centrum danych o mocy 1 GW w Lanarkshire.

Aby przeliczyć te liczby na układy, trzeba obliczyć, ile układów może działać przy tej ilości energii. Guardian zastosował następującą metodę, weryfikując te obliczenia z Abdeltawabem Hendawim, profesorem Uniwersytetu Rhode Island, oraz Renem.

Pierwszy protestujący przeciwko AI, który trafił do więzienia, ma przesłanie dla OpenAI, Anthropic i Meta: „Odzyskajcie swoją ludzkość" — czytaj więcej.

Aby uzyskać przybliżone pojęcie, ile układów znajduje się w centrum danych, można podzielić zużycie energii centrum danych przez zużycie energii układu AI, takiego jak H100. Pojedynczy H100 zużywa 700 W. Jeśli Microsoft ma 10 GW mocy, podzielenie tego przez 700 watów sugeruje, że powinien mieć około 12 milionów układów.

H100 stanowią większość układów wymienionych w wewnętrznym dokumencie. Wskazuje on również, że Microsoft ma A100, które zużywają mniej energii, oraz Blackwell, które zużywają więcej.

Ale ten przybliżony szacunek nie uwzględnia kilku czynników. Po pierwsze, centra danych mają systemy chłodzenia i inne urządzenia, które również zużywają energię elektryczną. Ren szacuje, że w typowym centrum danych AI 80% energii elektrycznej trafia do układów komputerowych. To mniej więcej zgodne z danymi Międzynarodowej Agencji Energetycznej, chociaż dokładna liczba zależy od wydajności centrum danych. 80% z 10 GW sugerowałoby, że około 8 GW jest faktycznie w użyciu.

To nieco mniej niż własne dane Microsoftu dotyczące wydajności centrów danych, które pojawiają się w raporcie zrównoważonego rozwoju z 2024 roku. Ten raport sugeruje, że 89% energii elektrycznej w jego nowych centrach danych zasila systemy IT, z 11% narzutem.

Po drugie, nie wszystkie układy w centrum danych to układy AI. Układy AI są montowane na stojakach serwerowych wraz z innymi układami komputerowymi, takimi jak układy pamięci, które pomagają im wykonywać obliczenia. Serwer z ośmioma GPU H100 zużywa maksymalnie około 10 kW energii.

Podzielenie 8 GW przez 10 kW daje 800 000 serwerów, czyli 6,4 miliona układów.

To konserwatywny szacunek, ponieważ w praktyce firmy takie jak Microsoft w pewnym stopniu nadsubskrybują swoją moc — umieszczając więcej układów w centrum danych, niż ich moc IT może w pełni obsłużyć, powiedział Ren.

Często zadawane pytania
Oto lista często zadawanych pytań na temat strategii AI Microsoftu i niedoboru układów, napisana w naturalnym, przyjaznym dla użytkownika tonie



Pytania dla początkujących



1 Czy Microsoft faktycznie spowalnia swoje plany AI z powodu układów

Odpowiedź Nie do końca Microsoft wciąż działa bardzo szybko, ale musi być mądrzejszy w kwestii tego, gdzie umieszcza swoje funkcje AI. Priorytetowo traktuje dużych, wartościowych klientów i własne podstawowe produkty, zamiast wdrażać funkcje dla wszystkich naraz. Projektuje również swoje oprogramowanie tak, aby efektywniej wykorzystywać układy



2 Co niedobór układów oznacza dla zwykłej osoby korzystającej z produktów Microsoftu

Odpowiedź Dla ciebie może to oznaczać, że nowa funkcja AI pojawi się nieco później niż oczekiwano lub zostanie najpierw wdrożona dla mniejszej grupy użytkowników, zanim trafi do wszystkich. Rzadko oznacza to anulowanie funkcji — raczej opóźnienia lub rozłożenie w czasie



3 Dlaczego Microsoft potrzebuje tak wielu układów do AI

Odpowiedź Modele AI są jak ogromne, skomplikowane kalkulatory. Muszą przetworzyć miliardy obliczeń, aby odpowiedzieć na jedno pytanie. Wyspecjalizowane układy to jedyny sposób, aby zrobić to wystarczająco szybko, aby AI działało natychmiastowo. Microsoft potrzebuje milionów tych układów, aby zasilać AI dla wszystkich swoich klientów jednocześnie



4 Czy ten niedobór dotyczy tylko produkcji większej liczby układów, czy czegoś innego

Odpowiedź To trochę jedno i drugie. Fabryki nie są w stanie produkować ich wystarczająco szybko, ale chodzi też o to, które układy mogą produkować. Konkretne układy wysokiej klasy używane do AI są najtrudniejsze do wyprodukowania i tylko kilka firm na świecie może je wytwarzać



Pytania zaawansowane i techniczne



5 Których konkretnych układów Microsoft ma trudności zdobyć

Odpowiedź Głównym wąskim gardłem jest pamięć o wysokiej przepustowości i zaawansowane GPU, konkretnie serie H100 i H200 od Nvidii. Te GPU są standardem branżowym do trenowania i uruchamiania modeli AI, a podaż nie nadąża za ogromnym popytem ze strony Microsoftu, Google i Amazonu jednocześnie



6 Czy Microsoft robi coś, aby to naprawić? Czy buduje własne układy