Introducere: internetul pe care îl folosim în fiecare zi nu „plutește în aer”
Atunci când deschidem Google, urmărim un videoclip pe YouTube, trimitem un mesaj pe WhatsApp, intrăm pe Instagram, folosim ChatGPT, salvăm o fotografie în iCloud sau cumpărăm ceva online, totul pare extrem de simplu.
Apăsăm pe un buton, iar informația apare aproape instantaneu.
În realitate, în spatele acestor acțiuni se află unele dintre cele mai complexe sisteme tehnologice construite vreodată.
Internetul modern este susținut de milioane de servere, centre de date, rețele de fibră optică, sisteme de stocare, procesoare, GPU-uri, acceleratoare AI, echipamente de rețea, sisteme de răcire, instalații electrice și software capabil să coordoneze milioane sau chiar miliarde de operațiuni simultan.
Cele mai mari companii tehnologice din lume au construit infrastructuri uriașe pentru a putea furniza servicii către utilizatori din aproape orice colț al planetei.
Google, Microsoft, Amazon Web Services, Meta, Apple, Oracle, Cloudflare, Netflix și OpenAI sunt doar câteva dintre companiile care operează sau folosesc infrastructuri la o scară extraordinară.
În cazul inteligenței artificiale, dimensiunea infrastructurii a devenit și mai importantă. Modelele moderne nu pot fi antrenate sau utilizate eficient pe un singur calculator obișnuit. Ele necesită clustere formate din foarte multe acceleratoare, conectate prin rețele extrem de rapide și alimentate de infrastructuri electrice și de răcire capabile să funcționeze continuu.
Acest articol explică, pe înțelesul tuturor, ce se află în spatele acestor sisteme, cum funcționează centrele de date și ce au construit cele mai importante companii tehnologice.
1. Ce este, de fapt, un server?
Un server este, în esență, un calculator proiectat să ofere servicii altor calculatoare.
Un calculator obișnuit este folosit de o persoană. Un server poate răspunde simultan la cereri provenite de la mii, milioane sau, printr-o infrastructură distribuită, chiar de la miliarde de utilizatori.
Un server poate:
- procesa date;
- stoca fișiere;
- rula aplicații;
- procesa baze de date;
- transmite videoclipuri;
- răspunde la solicitări web;
- procesa modele de inteligență artificială;
- autentifica utilizatori;
- executa cod;
- gestiona conexiuni;
- distribui conținut;
- efectua calcule matematice;
- coordona alte servere.
Într-un centru de date modern nu există, de regulă, un singur server care face totul.
Există grupuri uriașe de servere.
Aceste servere sunt organizate în rack-uri, iar rack-urile sunt instalate în săli special proiectate.
2. Ce este un centru de date?
Un centru de date este o clădire sau un campus special construit pentru găzduirea infrastructurii informatice.
Din exterior, poate părea o clădire industrială obișnuită.
În interior însă, situația este complet diferită.
Un centru de date poate include:
- servere;
- rack-uri;
- switch-uri;
- routere;
- cabluri de fibră optică;
- sisteme UPS;
- generatoare;
- baterii;
- transformatoare;
- sisteme de răcire;
- instalații de stingere a incendiilor;
- sisteme de monitorizare;
- sisteme de securitate;
- sisteme de control al accesului;
- depozite de componente;
- software de administrare.
Google explică faptul că infrastructura sa este controlată și securizată de companie de la nivelul spațiilor fizice și al serverelor până la echipamentele de rețea, cipurile de securitate și software-ul de nivel foarte jos. Centrele sale de date folosesc mai multe straturi de securitate fizică și sunt monitorizate permanent.
3. De ce companiile nu folosesc pur și simplu câteva servere foarte puternice?
Pentru că un singur server nu poate susține în mod realist serviciile globale ale unui gigant tehnologic.
Să presupunem că un server poate procesa 1.000 de cereri pe secundă.
Dacă utilizatorii trimit 10.000 de cereri pe secundă, avem nevoie de mai multă capacitate.
Dacă avem 1 milion de cereri pe secundă, avem nevoie de o infrastructură complet diferită.
Iar dacă avem miliarde de utilizatori și servicii care trebuie să funcționeze 24 de ore din 24, infrastructura trebuie să fie distribuită.
De aceea marile companii folosesc:
servere + clustere + centre de date + regiuni + rețele globale.
4. Cum ajunge o cerere de la telefon la server?
Să luăm un exemplu simplu.
Deschizi o aplicație și apeși un buton.
Telefonul trimite o solicitare.
Aceasta trece prin rețeaua operatorului sau prin Wi-Fi, apoi prin internet.
Cererea ajunge la infrastructura companiei.
Acolo poate trece prin:
- DNS;
- sisteme de protecție;
- load balancer;
- firewall;
- server web;
- server de aplicație;
- cache;
- baze de date;
- sisteme de stocare;
- alte servicii interne.
După procesare, răspunsul este trimis înapoi.
Totul poate dura foarte puțin.
Dar în spatele acelei fracțiuni de secundă se pot afla zeci sau sute de componente software și hardware.
5. Load balancing: cum împart companiile traficul?
Una dintre cele mai importante idei din infrastructura modernă este distribuirea sarcinii.
Dacă există 100 de servere, nu vrem ca toate cererile să ajungă pe unul singur.
Un sistem de load balancing poate distribui traficul.
De exemplu:
Utilizatori
|
v
Load Balancer
|
-----------------------------
| | | | |
v v v v v
S1 S2 S3 S4 S5
Dacă un server devine indisponibil, sistemul poate redirecționa traficul către alte servere.
La scară foarte mare, acest principiu este folosit în combinație cu regiuni, centre de date, sisteme de replicare și mecanisme automate de recuperare.
6. Google: una dintre cele mai impresionante infrastructuri din lume
Google este un exemplu extraordinar de companie care și-a construit propriul ecosistem de infrastructură.
Google nu înseamnă doar motorul de căutare.
În infrastructura Google rulează servicii precum:
- Google Search;
- YouTube;
- Gmail;
- Google Maps;
- Google Photos;
- Google Drive;
- Android;
- Google Play;
- Gemini;
- Google Cloud;
- numeroase servicii interne.
Google controlează o parte foarte importantă din infrastructura sa hardware și software.
Compania afirmă oficial că centrele sale de date folosesc servere proiectate special, echipamente de rețea și cipuri de securitate dezvoltate pentru infrastructura proprie.
7. Google și procesoarele TPU
Una dintre cele mai importante invenții ale Google pentru inteligența artificială este TPU — Tensor Processing Unit.
TPU-urile sunt acceleratoare special concepute pentru sarcini de machine learning.
Google explică faptul că TPU-urile sunt utilizate pentru antrenarea și rularea modelelor AI, inclusiv pentru produse precum Search, Photos și Maps și pentru sisteme de inteligență artificială precum Gemini.
Ideea este simplă:
Un CPU este foarte flexibil.
Un GPU este foarte bun pentru paralelizare.
Un accelerator AI poate fi proiectat special pentru operațiuni întâlnite frecvent în modelele de inteligență artificială.
Astfel, în loc să folosească exclusiv procesoare generale, Google poate construi sisteme optimizate pentru propriile nevoi.
8. Google TPU 8: infrastructura AI intră într-o nouă etapă
În 2026, Google a prezentat a opta generație de TPU-uri, TPU 8t și TPU 8i.
Google spune că TPU 8t este orientat către training, iar TPU 8i către inferență și sarcini precum reasoning și reinforcement learning.
Google afirmă că un singur superpod TPU 8t poate integra 9.600 de cipuri și 2 petabytes de memorie partajată, cu 121 exaflops de putere de calcul.
Pentru a înțelege cât de mare este această scară, trebuie să ne imaginăm că nu vorbim despre „un calculator foarte puternic”.
Vorbim despre un sistem format din mii de acceleratoare care trebuie să funcționeze ca o singură infrastructură logică.
9. Virgo Network: când serverele trebuie să comunice extrem de rapid
Unul dintre cele mai importante aspecte ale AI nu este doar puterea de calcul.
Este comunicarea dintre acceleratoare.
Dacă avem mii de procesoare care lucrează împreună, acestea trebuie să schimbe cantități enorme de date.
Google a prezentat Virgo Network ca parte a infrastructurii sale pentru TPU 8.
Compania spune că această rețea poate conecta până la 134.000 de TPU 8t într-un singur fabric, cu până la 47 petabiți pe secundă de lățime de bandă non-blocking.
Acest lucru demonstrează un principiu esențial al AI modern:
nu este suficient să ai cipuri rapide; trebuie să ai și o rețea capabilă să le conecteze.
10. Google și răcirea
Serverele produc căldură.
Cu cât infrastructura este mai densă și mai puternică, cu atât problema răcirii devine mai dificilă.
În cazul infrastructurii AI, utilizarea acceleratoarelor în densități foarte mari a făcut răcirea și mai importantă.
Google prezintă sisteme de răcire cu apă și infrastructuri integrate de centru de date pentru sistemele TPU.
În infrastructurile moderne pot fi folosite:
- aer;
- apă;
- schimbătoare de căldură;
- răcire directă;
- răcire lichidă;
- sisteme specializate pentru cipuri.
11. Google Cloud
Google nu construiește infrastructură doar pentru propriile servicii.
Prin Google Cloud, companii din întreaga lume pot folosi infrastructura Google.
Printre serviciile disponibile se află:
- mașini virtuale;
- containere;
- Kubernetes;
- stocare;
- baze de date;
- rețele;
- acceleratoare AI;
- TPU-uri.
Google Cloud descrie AI Hypercomputer drept o arhitectură care combină hardware, software și infrastructură de rețea pentru antrenarea și rularea aplicațiilor AI la scară foarte mare.
12. Amazon Web Services: AWS
Amazon Web Services, cunoscut drept AWS, este una dintre cele mai importante platforme cloud din lume.
AWS permite companiilor să închirieze practic infrastructură informatică fără să fie nevoite să construiască propriile centre de date.
Un client poate porni:
- servere virtuale;
- baze de date;
- stocare;
- rețele;
- sisteme de analiză;
- servicii AI;
- containere;
- sisteme de securitate.
13. Regiunile AWS
AWS își împarte infrastructura în regiuni geografice.
O regiune este o zonă geografică separată.
În interiorul unei regiuni există Availability Zones.
AWS explică oficial că Availability Zones sunt locații izolate din punct de vedere fizic, conectate prin rețele cu latență redusă și lățime de bandă mare.
În acest fel, o aplicație poate fi distribuită în mai multe locații.
Dacă o zonă are o problemă, celelalte pot continua să funcționeze.
AWS recomandă distribuirea aplicațiilor în mai multe Availability Zones pentru creșterea disponibilității.
14. De ce sunt importante regiunile?
Imaginează-ți că o companie din Europa are toți utilizatorii într-un singur centru de date din America.
Datele ar trebui să călătorească o distanță foarte mare.
Asta înseamnă:
- latență mai mare;
- trafic internațional;
- dependență de o anumită zonă;
- probleme potențiale de conformitate.
Prin distribuirea infrastructurii în regiuni diferite, serviciile pot fi mai aproape de utilizatori.
AWS listează regiuni în America de Nord, Europa, Asia-Pacific, Africa, Orientul Mijlociu și America de Sud.
15. AWS și centrele de date
Centrele de date AWS sunt proiectate pentru disponibilitate și eficiență.
AWS afirmă că investește în sisteme mai eficiente de energie, răcire și hardware pentru noile generații de centre de date. Compania spune că anumite îmbunătățiri ale răcirii pot reduce consumul mecanic de energie cu până la 50% în condițiile analizate.
16. Microsoft Azure
Microsoft este un alt gigant care operează o infrastructură globală masivă.
Azure reprezintă platforma cloud a Microsoft.
Pe Azure pot rula:
- aplicații web;
- baze de date;
- servere virtuale;
- sisteme AI;
- servicii enterprise;
- infrastructuri de dezvoltare;
- mașini virtuale;
- sisteme de analiză;
- servicii pentru dezvoltatori.
Microsoft afirmă oficial că infrastructura sa de centre de date include peste 80 de regiuni anunțate și peste 500 de centre de date la nivel mondial, în peste 30 de țări.
17. Microsoft și OpenAI
Relația dintre Microsoft și OpenAI este una dintre cele mai importante colaborări tehnologice din era AI.
În 2019, Microsoft și OpenAI au anunțat o investiție și un parteneriat pentru construirea unei platforme hardware și software în Microsoft Azure capabile să susțină cercetarea în AI la scară foarte mare.
Această colaborare a contribuit la dezvoltarea infrastructurii necesare pentru modelele OpenAI.
18. OpenAI: de la software la infrastructură fizică
OpenAI este cunoscută în primul rând pentru ChatGPT și modelele GPT.
Dar dezvoltarea modelelor AI moderne necesită mai mult decât software.
OpenAI are nevoie de:
- GPU-uri;
- centre de date;
- energie;
- rețele;
- sisteme de stocare;
- răcire;
- software distribuit;
- sisteme de management;
- infrastructură de training;
- infrastructură de inferență.
OpenAI spune explicit că echipa sa de Compute lucrează simultan cu software, hardware, facilități, operațiuni și inginerie pentru a pune la dispoziție cantități foarte mari de compute.
19. Stargate: unul dintre cele mai ambițioase proiecte de infrastructură AI
În ianuarie 2025, OpenAI a anunțat Stargate.
Compania a spus că proiectul intenționează să investească 500 de miliarde de dolari în infrastructură AI în Statele Unite pe parcursul a patru ani, cu o implementare inițială de 100 de miliarde de dolari.
Partenerii inițiali menționați oficial au fost SoftBank, OpenAI, Oracle și MGX, iar printre partenerii tehnologici inițiali se numără Arm, Microsoft, NVIDIA și Oracle.
Important: suma de 500 de miliarde de dolari reprezintă angajamentul anunțat pentru proiect și nu trebuie interpretată ca și cum întreaga sumă ar fi fost deja cheltuită într-o singură zi.
20. Abilene, Texas
Unul dintre primele proiecte Stargate a fost construit în Abilene, Texas.
OpenAI a descris această locație ca primul campus major al proiectului.
În 2026, OpenAI a spus că primul site din Abilene deja antrenează și deservește sisteme AI de frontieră.
Asta este foarte important.
Un centru de date AI nu este doar un depozit plin cu servere.
Este o instalație industrială complexă în care energia, răcirea, rețeaua, hardware-ul și software-ul trebuie să funcționeze împreună.
21. Stargate și energia
Unul dintre cele mai mari obstacole pentru AI nu mai este doar numărul de cipuri.
Este energia.
Centrele de date AI pot necesita cantități enorme de energie.
OpenAI spune că proiectele Stargate sunt dezvoltate împreună cu parteneri din infrastructura energetică și că în anumite locații sunt dezvoltate noi capacități de producție și stocare a energiei.
Acest lucru arată cât de mult s-a schimbat industria.
În trecut, un server era problema principală.
Astăzi, pentru AI la scară foarte mare, trebuie gândite simultan:
cipul + rack-ul + clădirea + energia + răcirea + rețeaua + software-ul.
22. Stargate Michigan
În 2026, OpenAI a anunțat începerea construcției proiectului „The Barn” din Saline, Michigan.
OpenAI îl descrie ca pe un campus de centru de date de 1 GW.
Compania spune că proiectul este dezvoltat împreună cu Oracle, Related Digital și Walbridge.
Acest tip de proiect demonstrează cum infrastructura AI devine o combinație între:
- tehnologie;
- construcții;
- energie;
- industrie;
- telecomunicații;
- producție;
- software;
- inginerie.
23. Stargate și Oracle
Oracle este unul dintre partenerii importanți ai Stargate.
În 2025, OpenAI și Oracle au anunțat un acord pentru dezvoltarea a încă 4,5 GW de capacitate de centre de date Stargate în Statele Unite.
OpenAI a spus că, împreună cu Stargate I din Abilene, această capacitate urma să ducă proiectele dezvoltate la peste 5 GW și peste 2 milioane de cipuri.
Ulterior, OpenAI a anunțat extinderi suplimentare.
24. OpenAI și Stargate Norway
Proiectele AI nu sunt limitate la Statele Unite.
OpenAI a anunțat Stargate Norway, prima inițiativă Stargate de centru de date AI în Europa.
Proiectul este planificat pentru aproximativ 230 MW, cu posibilitatea unei extinderi suplimentare de 290 MW.
OpenAI spune că obiectivul este utilizarea energiei regenerabile și că proiectul este conceput pentru răcire lichidă directă cu circuit închis.
Este un exemplu foarte bun despre cum locația unui centru de date poate fi aleasă și în funcție de:
- energie;
- climă;
- infrastructură;
- conectivitate;
- disponibilitatea terenului;
- costuri.
25. OpenAI și Stargate UAE
OpenAI a anunțat și Stargate UAE, o infrastructură AI planificată în Abu Dhabi.
Proiectul anunțat include un cluster de 1 GW, cu 200 MW planificați pentru intrarea în funcțiune în 2026.
Partenerii anunțați includ G42, Oracle, NVIDIA, Cisco și SoftBank.
Acest proiect demonstrează un alt trend important:
infrastructura AI începe să fie tratată ca infrastructură strategică națională.
26. Meta: Facebook, Instagram, WhatsApp și AI
Meta operează unele dintre cele mai mari servicii sociale din lume.
În ecosistemul Meta intră:
- Facebook;
- Instagram;
- WhatsApp;
- Messenger;
- Meta AI;
- infrastructura pentru realitatea virtuală și metavers;
- numeroase servicii interne.
Toate acestea necesită o infrastructură enormă.
27. Meta și supercomputerele AI
Meta a publicat informații despre infrastructura sa AI, inclusiv un supercomputer format din GPU-uri.
În 2023, compania a anunțat că faza a doua a supercomputerului său pentru cercetare AI avea 16.000 de GPU-uri.
Meta a descris în același timp o nouă generație de centre de date optimizate pentru AI și dezvoltarea unui cip propriu pentru rularea modelelor AI.
Această strategie este asemănătoare cu cea a Google:
compania nu se limitează la cumpărarea de calculatoare; proiectează și optimizează întregul sistem.
28. De ce Meta își proiectează propriile componente?
Pentru că la scară foarte mare chiar și o mică optimizare poate produce economii uriașe.
Dacă ai un milion de componente și reușești să reduci consumul fiecăreia cu o cantitate mică, efectul total poate deveni enorm.
De aceea marile companii dezvoltă:
- cipuri proprii;
- servere proprii;
- rack-uri proprii;
- sisteme de răcire;
- software propriu;
- rețele proprii.
29. Apple: o strategie diferită
Apple este cunoscută pentru iPhone, iPad, Mac și Apple Watch.
Dar în spatele serviciilor Apple există o infrastructură globală.
Servicii precum:
- iCloud;
- iCloud Photos;
- Apple Music;
- App Store;
- Apple TV;
- Find My;
- sincronizarea dispozitivelor;
au nevoie de servere și centre de date.
Apple folosește atât infrastructură proprie, cât și infrastructură furnizată de parteneri și furnizori cloud, în funcție de serviciu și de necesități.
30. Apple și ecosistemul său
Un lucru foarte important la Apple este că serviciile sunt strâns integrate cu hardware-ul.
Când faci o fotografie pe iPhone și aceasta apare pe Mac, nu vezi infrastructura din spate.
Dar în spatele procesului există:
- autentificare;
- criptare;
- transfer de date;
- stocare;
- sincronizare;
- verificări;
- sisteme de distribuție.
Utilizatorul vede doar fotografia.
Infrastructura vede milioane de operațiuni.
31. Cloudflare: infrastructura de la marginea internetului
Cloudflare are o abordare diferită de companiile care construiesc doar centre de date tradiționale.
Cloudflare operează o rețea globală folosită pentru:
- DNS;
- CDN;
- securitate;
- protecție DDoS;
- edge computing;
- proxy;
- aplicații web.
Ideea principală este apropierea serviciului de utilizator.
Dacă utilizatorul este în Europa, nu este întotdeauna eficient ca fiecare solicitare să ajungă până în Statele Unite.
O parte din procesare poate fi realizată mai aproape de utilizator.
32. Ce este edge computing?
Edge computing înseamnă mutarea anumitor operațiuni cât mai aproape de utilizator sau de dispozitiv.
În loc:
Telefon → America → Server → America → Telefon
putem avea:
Telefon → Edge apropiat → Răspuns
Acest lucru poate reduce latența.
Este foarte important pentru:
- jocuri;
- streaming;
- aplicații interactive;
- securitate;
- IoT;
- telecomunicații;
- AI în timp real.
33. Netflix: streaming la scară globală
Netflix are o problemă foarte diferită.
Compania trebuie să livreze cantități uriașe de video.
Dacă fiecare utilizator ar descărca videoclipul direct dintr-un singur centru de date, infrastructura ar deveni ineficientă.
De aceea Netflix folosește infrastructură de distribuție a conținutului și servere apropiate de utilizatori.
Un concept important este Open Connect.
Ideea este ca videoclipurile populare să fie disponibile cât mai aproape de utilizator, astfel încât traficul să nu traverseze inutil distanțe foarte mari.
34. De ce streamingul are nevoie de atât de multă infrastructură?
Un videoclip nu este un singur fișier simplu.
Același conținut poate exista în:
- mai multe rezoluții;
- mai multe formate;
- mai multe bitrate-uri;
- versiuni adaptate diferitelor dispozitive;
- mai multe limbi;
- subtitrări;
- piste audio diferite.
Un serviciu modern trebuie să aleagă automat versiunea potrivită în funcție de conexiunea utilizatorului.
35. Oracle Cloud Infrastructure
Oracle este cunoscută în special pentru baze de date și software enterprise, dar compania operează și Oracle Cloud Infrastructure, cunoscută drept OCI.
OCI oferă:
- compute;
- storage;
- networking;
- baze de date;
- servicii AI;
- infrastructură pentru companii.
Oracle este deosebit de importantă în infrastructura AI actuală datorită colaborărilor sale cu alte companii mari, inclusiv OpenAI în cadrul Stargate.
36. IBM
IBM are o istorie extrem de lungă în infrastructura enterprise.
Compania a trecut prin mai multe generații de calculatoare și continuă să ofere:
- cloud;
- infrastructură enterprise;
- mainframe-uri;
- baze de date;
- AI;
- sisteme pentru companii.
IBM este un exemplu important pentru că demonstrează că infrastructura informatică nu înseamnă doar social media și aplicații mobile.
Băncile, spitalele, companiile aeriene și instituțiile mari folosesc sisteme enterprise care trebuie să funcționeze extrem de stabil.
37. Mainframe-ul: un tip foarte diferit de calculator
Mainframe-urile IBM sunt proiectate pentru sarcini enterprise și procesarea unor volume foarte mari de tranzacții.
Un mainframe nu este pur și simplu un „PC gigantic”.
Este proiectat pentru:
- fiabilitate;
- procesare continuă;
- securitate;
- tranzacții;
- virtualizare;
- disponibilitate.
Aceste sisteme sunt folosite în special în domenii unde întreruperile pot fi extrem de costisitoare.
38. NVIDIA: compania care furnizează „motoarele” AI
NVIDIA nu este, în principal, un operator de cloud precum AWS sau Azure.
Este însă unul dintre cei mai importanți producători de acceleratoare utilizate în infrastructura AI.
GPU-urile NVIDIA sunt utilizate în numeroase centre de date și supercomputere.
În AI modern, GPU-ul nu mai este folosit doar pentru grafică.
El poate executa operații matematice masiv paralele necesare pentru antrenarea și rularea modelelor AI.
39. Un GPU nu lucrează singur
Un sistem AI modern poate include:
GPU-uri
↓
CPU-uri
↓
Memorie
↓
Rețea foarte rapidă
↓
Stocare
↓
Software distribuit
Dacă una dintre componente este prea lentă, întregul sistem poate pierde eficiență.
De aceea companiile proiectează sisteme complete.
40. AMD și acceleratoarele AI
AMD este un alt producător important de procesoare și acceleratoare.
Compania dezvoltă procesoare CPU și acceleratoare GPU pentru centre de date și AI.
În infrastructura cloud modernă, companiile pot folosi hardware de la mai mulți furnizori pentru a evita dependența de un singur tip de arhitectură.
41. Intel și centrele de date
Intel are o istorie foarte lungă în procesoarele pentru servere.
Procesoarele Intel Xeon au fost utilizate pe scară largă în centre de date.
În plus, Intel dezvoltă tehnologii pentru accelerarea AI și infrastructura modernă de centre de date.
Un centru de date nu este alcătuit doar din acceleratoare AI.
CPU-urile rămân importante pentru:
- orchestrare;
- sisteme de operare;
- servicii;
- baze de date;
- procesare generală;
- control.
42. Cisco: rețeaua care leagă calculatoarele
Cisco este unul dintre numele importante din networking.
Într-un centru de date, calculatoarele trebuie să comunice.
Aici intră:
- switch-uri;
- routere;
- firewall-uri;
- sisteme de securitate;
- software de rețea.
Fără rețea, mii de servere ar fi doar calculatoare separate.
Rețeaua le transformă într-un sistem.
43. Arista Networks
Arista este un alt furnizor important de echipamente de rețea pentru centre de date.
În infrastructurile AI, rețelele de mare viteză sunt foarte importante deoarece acceleratoarele trebuie să comunice rapid.
Pe măsură ce clusterele AI cresc, rețeaua devine aproape la fel de importantă ca procesorul.
44. Equinix
Equinix operează centre de date și infrastructură de interconectare.
Un astfel de operator este important pentru companiile care vor să își conecteze infrastructura la:
- furnizori cloud;
- operatori telecom;
- parteneri;
- clienți;
- internet exchange-uri.
Nu toate companiile își construiesc singure fiecare clădire.
Unele folosesc centre de date specializate.
45. Digital Realty
Digital Realty este un alt mare operator de infrastructură pentru centre de date.
Modelul este diferit de cel al unei companii precum Google.
În loc să ofere utilizatorilor un motor de căutare, compania oferă infrastructura fizică și conectivitatea de care alte organizații au nevoie.
Este o parte mai puțin vizibilă, dar extrem de importantă a internetului.
46. Ce se întâmplă dacă se oprește curentul?
Un centru de date nu poate depinde de o singură sursă de electricitate.
Sunt folosite sisteme precum:
- UPS;
- baterii;
- generatoare;
- surse redundante;
- distribuție electrică redundantă.
UPS-ul poate menține alimentarea în intervalul în care sursa principală este întreruptă.
Generatoarele pot prelua ulterior alimentarea pentru perioade mai lungi.
Scopul este ca serverele să nu se oprească.
47. De ce centrele de date au nevoie de atât de multă răcire?
Un procesor consumă energie.
O mare parte din acea energie devine căldură.
Dacă temperatura crește prea mult, componentele pot:
- reduce frecvența;
- deveni instabile;
- se pot deteriora;
- opri sistemele.
Într-un PC ai un ventilator.
Într-un centru de date ai o infrastructură industrială de răcire.
48. Răcirea cu aer
Răcirea cu aer este relativ ușor de înțeles.
Aerul rece este introdus în zona serverelor.
Aerul cald este evacuat.
Rack-urile pot fi organizate astfel încât fluxurile de aer rece și cald să fie separate.
Aceasta este una dintre metodele tradiționale.
49. Răcirea lichidă
Pe măsură ce cipurile devin mai puternice, răcirea lichidă devine tot mai importantă.
Lichidul poate transporta căldura mai eficient decât aerul.
În infrastructura AI modernă se folosesc tehnologii precum:
- direct-to-chip cooling;
- cold plates;
- sisteme cu circuit închis;
- schimbătoare de căldură.
Stargate Norway, de exemplu, este planificat cu răcire lichidă directă cu circuit închis.
50. Stocarea datelor
Un centru de date nu are doar procesoare.
Are și sisteme masive de stocare.
Datele pot fi păstrate pe:
- SSD;
- HDD;
- sisteme distribuite de storage;
- obiect storage;
- baze de date;
- sisteme de fișiere distribuite.
Într-o companie precum Google, Amazon sau Microsoft, datele nu sunt de obicei păstrate pe un singur disc.
Sunt distribuite și replicate.
51. De ce se replică datele?
Să presupunem că există o singură copie a unei fotografii.
Dacă discul se defectează, fotografia poate fi pierdută.
Dacă există mai multe copii în locații diferite, riscul scade.
În infrastructura enterprise se folosesc mecanisme de redundanță și replicare.
Astfel:
Date originale
|
----------------
| |
Copie 1 Copie 2
| |
Centru A Centru B
Dacă un centru are o problemă, informația poate continua să fie disponibilă.
52. Baze de date distribuite
Serviciile moderne nu folosesc doar un singur server de baze de date.
Sistemele pot fi distribuite.
Asta înseamnă că datele și operațiunile pot fi împărțite între mai multe mașini.
Avantajele pot include:
- scalare;
- redundanță;
- disponibilitate;
- performanță.
Dar sistemele distribuite sunt extrem de complicate.
Trebuie gestionate:
- sincronizarea;
- consistența;
- erorile;
- rețeaua;
- replicarea;
- recuperarea.
53. Kubernetes și containere
Un alt element important al infrastructurii moderne este containerizarea.
O aplicație poate fi împachetată într-un container.
Apoi poate fi mutată între servere.
Kubernetes poate coordona containerele.
Poate:
- porni containere;
- opri containere;
- muta sarcini;
- distribui trafic;
- detecta probleme;
- scala aplicațiile.
Google Cloud oferă Google Kubernetes Engine, iar infrastructura sa AI este integrată cu Kubernetes și alte sisteme de orchestrare.
54. Cum funcționează ChatGPT la nivel conceptual?
Atunci când un utilizator trimite un mesaj către ChatGPT, sistemul trebuie să:
- primească cererea;
- autentifice și gestioneze sesiunea;
- direcționeze cererea către infrastructura potrivită;
- pregătească inputul;
- execute modelul;
- producă tokenii de ieșire;
- transmită rezultatul utilizatorului.
În realitate, arhitectura este mult mai complexă decât această schemă simplificată.
OpenAI nu publică toate detaliile interne despre topologia exactă a infrastructurii sale, iar astfel de detalii nu trebuie inventate.
Ceea ce compania spune public este că infrastructura sa de compute implică hardware, software, GPU fleets, energie, răcire, networking, manufacturing, supply chain și data-center delivery.
55. Training versus inference
Există o diferență importantă între training și inference.
Training
Modelul este antrenat folosind cantități uriașe de date și calcule.
Procesul poate necesita clustere foarte mari de acceleratoare.
Inference
Modelul deja antrenat primește o cerere și generează un rezultat.
De exemplu, atunci când îi scrii o întrebare unui chatbot, aceasta este o formă de inference.
Ambele necesită infrastructură.
56. De ce AI consumă atât de multă putere de calcul?
Modelele moderne au foarte mulți parametri.
În timpul procesării, sistemul efectuează operații matematice masive.
Într-un model de limbaj, textul este împărțit în tokeni.
Modelul procesează acești tokeni și calculează probabilități pentru următorii pași.
Procesul implică operații matematice pe scară foarte mare.
57. Tokenii
Să presupunem că scriem:
„Salut, ce faci?”
Modelul nu vede neapărat textul exact ca un om.
Textul este transformat într-o reprezentare formată din tokeni.
Acești tokeni sunt apoi procesați de rețeaua neuronală.
La fiecare pas, modelul calculează ce ar trebui să urmeze.
Acest proces se repetă pentru generarea răspunsului.
58. De ce sunt necesare GPU-uri și TPU-uri?
Operațiile AI pot fi extrem de paralele.
Dacă trebuie efectuate milioane sau miliarde de calcule similare, este avantajos să le execuți în paralel.
GPU-urile sunt foarte bune la acest tip de sarcini.
TPU-urile sunt proiectate special pentru machine learning.
Google explică oficial că TPU-urile sunt acceleratoare construite special pentru workload-uri AI și sunt utilizate pentru training și inference.
59. Supercomputerul modern nu mai seamănă cu un singur calculator
În trecut, când spuneai „supercomputer”, te puteai gândi la o singură mașină foarte puternică.
În AI modern, un supercomputer poate fi un cluster uriaș.
De exemplu:
GPU GPU GPU GPU
| | | |
+----+----+----+
|
Network
|
+----+----+----+
| | | |
GPU GPU GPU GPU
Mii de acceleratoare pot lucra împreună.
60. Google și AI Hypercomputer
Google folosește conceptul de AI Hypercomputer pentru a combina:
- acceleratoare;
- CPU-uri;
- rețele;
- storage;
- software;
- Kubernetes;
- sisteme de orchestrare.
Compania spune că infrastructura este concepută pentru întregul ciclu AI: training, tuning, inference și operare.
61. Energia devine noua limită
În trecut, problema principală putea fi:
„Avem suficiente procesoare?”
În AI modern, întrebarea devine:
„Avem suficiente procesoare, suficientă energie, suficientă răcire și suficientă conectivitate?”
Un campus AI de dimensiuni foarte mari poate necesita infrastructură electrică comparabilă cu cea a unor facilități industriale.
De aceea companiile discută tot mai mult despre:
- energie regenerabilă;
- baterii;
- rețele electrice;
- generare locală;
- nuclear;
- hidroenergie;
- stocare;
- eficiență.
62. De ce sunt importante locațiile reci?
Un climat mai rece poate ajuta la răcirea infrastructurii.
Nu este singurul factor.
Companiile trebuie să analizeze:
- energia;
- terenul;
- conectivitatea;
- reglementările;
- taxele;
- disponibilitatea apei;
- apropierea de rețele;
- riscurile naturale;
- forța de muncă.
Stargate Norway este un exemplu în care OpenAI a menționat explicit clima, hidroenergia și infrastructura industrială din regiune ca factori importanți.
63. De ce au nevoie centrele de date de fibră optică?
Serverele trebuie să comunice.
Pentru cantități foarte mari de date, fibra optică este esențială.
În loc să transmită informația prin cabluri electrice obișnuite, fibra folosește lumină.
Avantajele includ:
- viteze foarte mari;
- distanțe mari;
- latență redusă;
- capacitate enormă.
Centrele de date sunt conectate prin rețele interne și externe de mare capacitate.
64. Rețeaua internă a unui centru de date
În interiorul unui centru de date pot exista mii de switch-uri și legături.
În cazul AI, rețeaua trebuie să transporte date între acceleratoare cu latență foarte mică.
Dacă acceleratorul stă și așteaptă datele, o parte din puterea de calcul este irosită.
De aceea Google a investit în tehnologii precum ICI și Virgo Network pentru infrastructura TPU.
65. Securitatea centrelor de date
Un centru de date trebuie protejat fizic și digital.
Google descrie măsuri precum:
- control electronic al accesului;
- bariere;
- garduri;
- detectoare;
- biometrie;
- monitorizare video;
- sisteme de detecție a intruziunilor.
Accesul este limitat la angajați autorizați.
În paralel există securitate software:
- criptare;
- autentificare;
- firewall;
- segmentare;
- monitorizare;
- sisteme anti-abuz.
66. Redundanța
Una dintre cele mai importante reguli ale centrelor de date este:
nu trebuie să existe un singur punct critic de defectare.
Dacă ai:
Server
|
Switch
|
Router
și routerul moare, conexiunea se pierde.
În infrastructura enterprise se folosesc mai multe căi:
Router A
/ \
Server Network
\ /
Router B
Dacă un element cade, altul poate prelua sarcina.
67. Ce se întâmplă când un server moare?
Într-o infrastructură bine proiectată, utilizatorul poate să nu observe nimic.
Sistemele detectează că serverul nu mai răspunde.
Load balancer-ul îl poate elimina temporar din grup.
Un orchestrator poate porni o altă instanță.
Datele pot exista în alte locații.
Acesta este unul dintre motivele pentru care utilizatorii pot folosi servicii online fără să știe că anumite servere se defectează permanent.
68. Centrele de date sunt construite pentru defecte
Un lucru interesant este că proiectanții nu presupun că hardware-ul nu se va defecta.
Dimpotrivă.
Se presupune că:
- un disc va muri;
- un server se va opri;
- un switch poate avea probleme;
- o sursă poate cădea;
- o conexiune poate fi întreruptă.
Sistemul este proiectat astfel încât defectele individuale să nu producă automat o întrerupere globală.
69. Software-ul este la fel de important ca hardware-ul
Ai putea avea:
- 100.000 de GPU-uri;
- energie;
- răcire;
- rețea.
Dar fără software bun, infrastructura nu este eficientă.
Ai nevoie de software pentru:
- programarea joburilor;
- distribuirea datelor;
- monitorizare;
- detectarea erorilor;
- management;
- securitate;
- orchestration;
- training;
- inference.
70. Google, Microsoft, AWS și Meta nu construiesc doar servere
Aici se află una dintre cele mai importante lecții.
Un gigant tehnologic nu este doar o companie care cumpără servere.
El construiește un ecosistem:
Hardware
↓
Firmware
↓
Sistem de operare
↓
Virtualizare
↓
Containere
↓
Orchestrare
↓
Rețea
↓
Storage
↓
Aplicații
↓
Servicii pentru utilizatori
71. De ce companiile își construiesc propriile cipuri?
Pentru control și optimizare.
Dacă un cip este proiectat special pentru o anumită sarcină, poate fi mai eficient decât unul general.
Google are TPU.
Meta a prezentat cipuri proprii pentru AI.
Amazon dezvoltă propriile cipuri pentru cloud, inclusiv procesoare și acceleratoare AI.
Microsoft dezvoltă, de asemenea, hardware și acceleratoare pentru propriile infrastructuri.
Acest trend este important deoarece marile companii vor să controleze mai mult din „full stack”.
72. Full stack
„Full stack” în acest context poate însemna:
Cip
↓
Server
↓
Rack
↓
Rețea
↓
Data Center
↓
Cloud
↓
Software
↓
Aplicație
Cu cât o companie controlează mai multe straturi, cu atât poate optimiza mai bine întregul sistem.
73. De ce Google este atât de diferit?
Google a avut avantajul de a construi infrastructură globală încă din perioada în care internetul începea să crească masiv.
Compania a investit în:
- centre de date;
- rețele;
- fibre;
- servere;
- sisteme distribuite;
- acceleratoare proprii.
Această infrastructură a devenit baza pentru produse precum Search, YouTube și Gmail, dar și pentru Google Cloud și AI.
74. De ce Amazon este atât de important?
Amazon a transformat infrastructura informatică într-un serviciu.
În loc ca fiecare companie să cumpere:
- servere;
- rack-uri;
- switch-uri;
- UPS-uri;
- generatoare;
- spații;
poate folosi cloud-ul.
Compania plătește pentru resursele pe care le folosește.
Acest model a schimbat industria software.
75. De ce Microsoft este atât de important?
Microsoft combină mai multe lumi:
- Windows;
- Office;
- Azure;
- Xbox;
- LinkedIn;
- GitHub;
- servicii enterprise;
- AI.
Azure poate furniza infrastructură pentru organizații care au nevoie de servicii globale.
76. De ce Meta are o problemă specială?
Meta trebuie să proceseze cantități enorme de:
- fotografii;
- videoclipuri;
- mesaje;
- postări;
- interacțiuni;
- recomandări.
În plus, algoritmii de recomandare și AI trebuie să analizeze foarte multe date.
De aceea infrastructura AI este critică pentru Meta.
77. De ce Apple are o problemă specială?
Apple controlează hardware-ul utilizatorului, dar trebuie să sincronizeze acel hardware cu servicii cloud.
Dacă faci o fotografie, o editezi și apoi o vezi pe Mac, experiența pare simplă.
Dar în spate există un sistem distribuit foarte complex.
78. De ce OpenAI are o problemă specială?
OpenAI trebuie să rezolve două probleme simultan.
Prima:
antrenarea modelelor.
A doua:
servirea modelelor către utilizatori.
Un model poate necesita cantități enorme de compute pentru training.
După training, milioane de utilizatori pot genera simultan cereri.
Prin urmare, infrastructura trebuie să fie suficient de mare atât pentru dezvoltarea modelelor, cât și pentru inferența la scară.
79. AI schimbă arhitectura centrelor de date
Centrele de date tradiționale erau construite în jurul CPU-urilor și workload-urilor generale.
Centrele de date AI sunt tot mai mult proiectate în jurul:
- GPU-urilor;
- TPU-urilor;
- acceleratoarelor;
- rețelelor foarte rapide;
- răcirii lichide;
- densității mari de putere.
Google și OpenAI oferă exemple clare ale acestei transformări.
80. Cât de mare poate deveni un centru de date?
Dimensiunea poate fi exprimată în mai multe moduri.
Nu doar în metri pătrați.
Putem vorbi despre:
- număr de servere;
- număr de GPU-uri;
- putere electrică;
- capacitate de stocare;
- lățime de bandă;
- număr de rack-uri;
- capacitate de calcul.
În AI, puterea electrică și numărul de acceleratoare au devenit indicatori foarte importanți.
81. Ce înseamnă un gigawatt?
Un gigawatt înseamnă 1.000 de megawați.
Când OpenAI descrie campusuri Stargate de ordinul gigawaților, nu vorbește despre un PC sau chiar despre un server foarte mare.
Vorbește despre infrastructură industrială.
Un campus AI de 1 GW necesită:
- infrastructură electrică;
- transformatoare;
- distribuție;
- răcire;
- clădiri;
- rețea;
- generare sau acces la energie;
- securitate;
- sisteme de backup.
82. De ce AI are nevoie de atât de multe GPU-uri?
Pentru că un model mare nu trebuie neapărat să încapă pe un singur accelerator.
Modelul poate fi împărțit.
Pot fi împărțite:
- datele;
- straturile modelului;
- experimentele;
- batch-urile;
- operațiile.
Apoi acceleratoarele lucrează împreună.
Acest proces este numit, în sens larg, distributed computing.
83. Distributed computing
Calculul distribuit înseamnă că o sarcină mare este împărțită între mai multe mașini.
Exemplu:
Sarcină mare
|
-----------------
| | |
v v v
CPU/GPU CPU/GPU CPU/GPU
| | |
-----------------
|
Rezultat
Dacă ai suficiente mașini și software-ul este proiectat corect, poți realiza calcule imposibil de executat eficient pe un singur calculator.
84. Problema sincronizării
Există însă o problemă.
Dacă un GPU termină mai repede decât celelalte, poate ajunge să aștepte.
Dacă rețeaua este prea lentă, acceleratoarele așteaptă date.
Dacă storage-ul este prea lent, datele nu ajung suficient de repede.
De aceea performanța unui supercomputer AI nu este determinată doar de numărul de GPU-uri.
85. Goodput
În infrastructura AI modernă apare tot mai des conceptul de „goodput”.
Ideea este simplă:
Nu contează doar câte operații teoretice poate executa hardware-ul.
Contează cât de multă muncă utilă reușește să realizeze efectiv.
Dacă acceleratorul stă și așteaptă:
- date;
- rețea;
- memorie;
- alt proces;
- recuperarea unei erori;
capacitatea teoretică nu este folosită complet.
86. Eficiența energetică
Google publică date despre eficiența generațiilor sale de TPU.
Compania a raportat, de exemplu, îmbunătățiri semnificative de eficiență pentru generațiile TPU și spune că infrastructura sa AI este proiectată pentru a obține mai multă putere de calcul din energia utilizată.
Aceasta devine o problemă critică.
Dacă AI-ul crește, dar consumul crește prea repede, costurile și presiunea asupra infrastructurii energetice cresc.
87. Centrele de date și apa
Răcirea poate implica apă, în funcție de tehnologia folosită.
Din acest motiv, companiile caută soluții mai eficiente.
OpenAI a descris pentru unele proiecte Stargate utilizarea sistemelor cu circuit închis, iar Google discută public despre tehnologii de răcire și eficiență pentru infrastructura sa.
Nu există o singură soluție universală.
Fiecare centru de date trebuie proiectat în funcție de:
- climat;
- densitatea serverelor;
- disponibilitatea apei;
- energie;
- cost;
- legislație.
88. Ce se întâmplă cu căldura?
Căldura trebuie transportată departe de cipuri.
Într-un sistem cu aer:
Cip → radiator → aer → sistem HVAC
Într-un sistem lichid:
Cip → cold plate → lichid → heat exchanger → exterior
În centrele de date moderne, proiectarea termică este o parte fundamentală a arhitecturii.
89. Internetul este un ecosistem, nu o singură companie
Este foarte important să înțelegem că internetul nu aparține unei singure firme.
Poate implica simultan:
- operatorul telecom;
- furnizorul de internet;
- DNS;
- CDN;
- cloud;
- data center;
- compania care deține aplicația;
- operatori de fibră;
- internet exchange;
- furnizori de hardware.
Un simplu videoclip poate traversa mai multe sisteme înainte să ajungă pe ecranul tău.
90. De ce nu vedem centrele de date?
Pentru că ele sunt infrastructură.
Când deschizi YouTube, nu vezi serverele.
Când folosești ChatGPT, nu vezi GPU-urile.
Când deschizi Google Maps, nu vezi centrele de date.
Acesta este unul dintre lucrurile fascinante ale internetului:
cea mai mare parte a infrastructurii este invizibilă utilizatorului.
91. Serverul de acasă versus serverul unui gigant tehnologic
Un server de acasă poate avea:
- 1 CPU;
- câteva zeci de GB RAM;
- câteva SSD-uri;
- o placă de rețea.
Un centru de date poate avea:
- mii de servere;
- sute de mii de procesoare;
- acceleratoare;
- rețele redundante;
- storage distribuit;
- sisteme industriale de energie;
- sisteme de răcire.
Diferența este uriașă.
92. Poți construi și tu un mini-centru de date?
Da.
Un proiect de acasă poate include:
- un mini-PC;
- un server refurbished;
- un NAS;
- Docker;
- Proxmox;
- Linux;
- Kubernetes;
- Pi-hole;
- Nextcloud;
- Home Assistant;
- un server web.
Dar nu trebuie confundat cu infrastructura unui gigant cloud.
Un server de acasă este o infrastructură locală.
Un centru de date Google este o infrastructură globală.
93. De ce Linux este atât de important?
Linux este foarte folosit în servere și cloud.
Motivele includ:
- flexibilitate;
- automatizare;
- ecosistem open-source;
- control;
- performanță;
- suport hardware;
- posibilitatea de personalizare.
Multe dintre infrastructurile gigantice de internet se bazează pe software derivat din ecosistemul Linux sau pe tehnologii open-source.
94. Google, AWS, Azure și software-ul open-source
Marile companii nu dezvoltă totul de la zero.
Folosesc și contribuie la:
- Linux;
- Kubernetes;
- TensorFlow;
- PyTorch;
- JAX;
- containere;
- biblioteci de rețea;
- sisteme de storage.
În același timp, dezvoltă software proprietar pentru problemele lor specifice.
95. De ce există atât de multe companii în infrastructura AI?
Pentru că nimeni nu produce absolut totul.
Un proiect AI poate implica:
NVIDIA → GPU-uri
AMD / Intel / Arm → procesoare și arhitecturi
Cisco / Arista → networking
Oracle / Microsoft / AWS / Google Cloud → cloud și infrastructură
OpenAI / Meta / Google / Anthropic → modele și aplicații AI
companii de energie → electricitate
constructori → centre de date
operatori telecom → conectivitate
producători de storage → stocare
Aceasta este o industrie gigantică.
96. AI a devenit o industrie hardware
Aceasta este poate una dintre cele mai importante schimbări ale ultimilor ani.
Inteligența artificială nu mai este doar:
Cod + algoritm
A devenit:
Algoritm
+
Date
+
GPU/TPU
+
Server
+
Rețea
+
Storage
+
Energie
+
Răcire
+
Data Center
+
Software
97. Competiția pentru compute
Companiile AI concurează nu numai prin modele.
Ele concurează și pentru:
- acceleratoare;
- energie;
- capacitate de centre de date;
- ingineri;
- rețele;
- furnizori;
- terenuri;
- infrastructură.
OpenAI afirmă explicit că extinderea infrastructurii sale este necesară pentru a face față cererii crescânde de AI și pentru a aduce capacitate nouă online.
98. De ce se construiesc atât de multe centre de date AI?
Pentru că cererea pentru AI crește.
Fiecare utilizator poate genera:
- întrebări;
- imagini;
- cod;
- audio;
- video;
- documente;
- agenți AI.
Companiile au nevoie de infrastructură care să proceseze toate aceste cereri.
99. Viitorul: AI la marginea rețelei
Nu totul va fi procesat în centrele de date.
Unele sarcini pot fi procesate pe:
- telefoane;
- laptopuri;
- mașini;
- camere;
- roboți;
- dispozitive IoT.
Acesta este conceptul de edge AI.
Unele modele pot fi mici și eficiente și pot rula local.
Altele vor necesita centre de date.
Probabil viitorul va combina ambele variante.
100. Viitorul: centre de date și mai mari
Pe măsură ce modelele devin mai capabile, infrastructura poate deveni mai mare.
Vom vedea probabil:
- mai multe acceleratoare;
- rețele mai rapide;
- răcire mai avansată;
- centre de date mai dense;
- energie regenerabilă;
- baterii;
- noi tipuri de procesoare;
- sisteme AI specializate.
Google deja descrie sisteme în care infrastructura AI este proiectată să scaleze către sute de mii și chiar către scări de milioane de acceleratoare într-un cluster logic.
101. Ce înseamnă asta pentru utilizatorul obișnuit?
Poate părea că toate aceste tehnologii sunt foarte departe de viața de zi cu zi.
Dar nu sunt.
Atunci când:
- cauți ceva pe Google;
- urmărești YouTube;
- trimiți o fotografie;
- folosești Google Maps;
- intri pe Instagram;
- vorbești cu ChatGPT;
- folosești iCloud;
- te joci online;
folosești infrastructura construită de aceste companii.
102. Cea mai mare lecție
Un telefon modern este foarte puternic.
Dar telefonul nu este singur.
El este conectat la un sistem global.
Poți privi internetul astfel:
INTERNET
|
--------------------------------
| | |
Cloud CDN Telecom
| | |
Data Center Edge Fibră
| |
Servers Servers
|
-----------------------------
| | | | |
CPU GPU Storage Network AI
Totul lucrează împreună.
103. Cine sunt, în linii mari, cei mai importanți jucători?
Printre companiile și organizațiile importante din ecosistemul infrastructurii globale se numără:
- Google;
- Microsoft;
- Amazon Web Services;
- Meta;
- Apple;
- OpenAI;
- Oracle;
- NVIDIA;
- AMD;
- Intel;
- Arm;
- Cisco;
- Arista Networks;
- Cloudflare;
- IBM;
- Equinix;
- Digital Realty;
- Netflix;
- CoreWeave;
- SoftBank;
- și numeroși furnizori de energie, telecomunicații, construcții și hardware.
Fiecare ocupă un loc diferit în ecosistem.
104. Google versus Microsoft versus AWS
O comparație simplificată arată astfel:
| Companie | Rol important |
|---|---|
| Search, YouTube, AI, Google Cloud, TPU | |
| Microsoft | Azure, enterprise, Windows, AI |
| AWS | Cloud și infrastructură globală |
| Meta | Social media, AI, infrastructură proprie |
| Apple | Hardware + servicii + cloud |
| OpenAI | Modele AI, ChatGPT, infrastructură AI |
| Oracle | Cloud, baze de date, infrastructură AI |
| NVIDIA | GPU-uri și platforme AI |
| Cloudflare | Edge, CDN, securitate, DNS |
| Netflix | Streaming și distribuție video |
Aceasta nu este o clasificare a „celei mai bune” companii.
Este doar o reprezentare simplificată a rolurilor lor.
105. De ce OpenAI este un caz special
OpenAI a pornit în primul rând ca organizație de cercetare AI.
Dar evoluția AI a făcut ca infrastructura să devină esențială.
Astăzi, compania spune explicit că dezvoltarea modelelor sale implică infrastructură de compute, GPU-uri, energie, răcire, rețele și centre de date.
Prin Stargate, OpenAI a intrat și mai profund în zona infrastructurii fizice.
106. De la software la fabrică de inteligență
Aceasta este una dintre cele mai interesante transformări.
În trecut, pentru a crea un serviciu software aveai nevoie în principal de:
- programatori;
- servere;
- internet.
Pentru AI la scară de frontieră ai nevoie de:
- cercetători;
- programatori;
- GPU-uri;
- ingineri hardware;
- ingineri de rețea;
- centre de date;
- energie;
- răcire;
- constructori;
- operatori;
- logistică.
Inteligența artificială a devenit, într-un anumit sens, o industrie industrială.
107. De ce aceste centre sunt atât de importante pentru viitor?
Pentru că infrastructura determină ce modele pot fi antrenate și câți utilizatori pot beneficia de ele.
Un model mai bun poate necesita:
- mai mult training;
- mai multe experimente;
- mai multă inferență;
- mai multă memorie;
- mai multă rețea.
Dacă infrastructura nu poate susține aceste cerințe, dezvoltarea încetinește.
108. Concluzie
Internetul modern este construit pe o infrastructură uriașă pe care utilizatorii aproape niciodată nu o văd.
În spatele unei simple căutări, a unei fotografii, a unui videoclip sau a unei întrebări către un chatbot pot exista:
- servere;
- centre de date;
- GPU-uri;
- CPU-uri;
- TPU-uri;
- SSD-uri;
- rețele de fibră;
- switch-uri;
- routere;
- baze de date;
- sisteme de securitate;
- sisteme de răcire;
- sisteme electrice;
- software distribuit;
- inteligență artificială.
Google și-a construit propriile TPU-uri și infrastructuri de rețea pentru AI. Google descrie sisteme TPU 8 care pot scala la mii de acceleratoare într-un singur superpod și rețele capabile să conecteze volume uriașe de acceleratoare.
AWS a construit un cloud global bazat pe regiuni și Availability Zones independente, astfel încât aplicațiile să poată fi proiectate pentru disponibilitate ridicată.
Microsoft operează o rețea globală Azure formată din sute de centre de date și zeci de regiuni.
Meta dezvoltă infrastructură specializată pentru AI, inclusiv supercomputere și hardware propriu.
OpenAI construiește, prin Stargate și alte parteneriate, o infrastructură AI de o scară foarte mare, incluzând campusuri în Statele Unite și proiecte internaționale.
Iar toate aceste companii fac parte dintr-un ecosistem mult mai mare în care producătorii de cipuri, operatorii de centre de date, furnizorii de cloud, companiile de networking, furnizorii de energie și operatorii telecom lucrează împreună.
În final, atunci când cineva spune:
„Internetul este în cloud.”
realitatea este mult mai interesantă.
Cloud-ul nu este magic.
Cloud-ul înseamnă:
clădiri + electricitate + servere + cipuri + rețele + stocare + răcire + software + oameni.
Iar în era inteligenței artificiale, aceste infrastructuri devin din ce în ce mai mari, mai rapide și mai sofisticate.
Ceea ce vedem pe ecran este doar partea vizibilă.
În spatele ei se află una dintre cele mai mari construcții tehnologice din istoria omenirii.
