Przejdź do treści
Jak działa / mapa mechanizmów

Jak Scaling Laws naprawdę działa.

To nie jest lista funkcji. To maszyneria pod nią: jak model dostaje wynik, dlaczego sprzęt staje się złym aktywem, dlaczego badań nie da się przepchnąć samą gotówką, jak reagują rywale i które liczby są pomiarem, a które abstrakcją gry.

Start kampanii1 stycznia 2022
Krok symulacjiJeden deterministyczny dzień
Jakość modeluPrawo skalowania, nie losowa ocena
Dane o przyszłościWartości prognozowane są oznaczone
01 / Jakość modelu

Większy model to nie automatycznie lepsze wykorzystanie mocy.

Jakość treningu bierze się z jednego parametrycznego prawa skalowania. Liczy się i liczba parametrów, i tokeny treningowe, a ten sam budżet mocy można zmarnować, przeciągając którąkolwiek stronę.

Scaling Laws używa parametrycznej formy straty w stylu Chinchilli jako jedynego miejsca, w którym liczona jest jakość modelu. Gracz wybiera skalę parametrów i skalę danych, a gra zamienia ten plan na moc treningową i względną prognozę zdolności.

ScalingLaw / jedyna funkcja jakościsymulacja względna
L(N, D) = E + A / Nα + B / Dβ
N to liczba parametrów. D to tokeny treningowe. Wynik zdolności pokazywany przez grę jest względną skalą gry, a nie wynikiem benchmarku w rodzaju MMLU.

Region optymalny obliczeniowo w obecnym modelu wypada w okolicach dwudziestu tokenów treningowych na parametr. Dziesięciokrotność efektywnej mocy treningowej mapuje się na mniej więcej dziesięć punktów zdolności na każdej skali. Ta stała bieżnia sprawia, że ruchoma granica pozostaje czytelna dla gracza.

Dlaczego dopasowanie nie jest kopiowane na ślepo

Projekt używa poprawionego, ponownie wyprowadzonego dopasowania Chinchilli, zamiast po cichu traktować każdą stałą wydrukowaną w pracy z 2022 roku jako niepodważalną. Próba replikacji z 2024 roku wykazała, że trzecia procedura estymacji w tej pracy była niespójna z dwiema pierwszymi, i wyprowadziła dopasowanie zgodne z nimi.

Etapowy kreator modelu w Scaling Laws: fundament, skala, dane, moc i przegląd
Aktualny kreator modelu. Prognoza przelicza się na nowo, gdy zmienia się plan.
Odniesienie do świata rzeczywistego

Co mówią badania

Hoffmann i współautorzy wytrenowali ponad 400 modeli i pokazali, że optymalny obliczeniowo rozmiar modelu i liczba tokenów treningowych powinny rosnąć razem. Scaling Laws bierze tę zależność jako odniesienie projektowe, a nie jako twierdzenie, że jego skala zdolności 0–100 jest prawdziwym benchmarkiem.

Abstrakcja gry

Co dostaje gracz

Jedna zrozumiała liczba, prognozowana zmiana po każdym wyborze, czas treningu i rachunek. Niepewność zamienia się w ostateczną zdolność dopiero wtedy, gdy przebieg naprawdę się skończy.

02 / Ekonomia sprzętu

Własna moc starzeje się, kiedy jeszcze pracuje.

Wartość sprzętu spada na dwa osobne sposoby: przez wiek kalendarzowy i przez generacje następców. Premiera, która wypada po twoim zakupie, potrafi drugi raz uderzyć w wartość odsprzedaży.

Katalog sprzętu trzyma dane akceleratorów, procesorów hosta, pamięci węzła i sieci wewnętrznej. Posiadane akceleratory nie są trwałym ulepszeniem statystyki. Są aktywami z datą. Model wyceny nakłada amortyzację zależną od czasu i drugą karę, gdy pojawiają się nowsze generacje tej samej klasy.

Czas: wartość spada, nawet jeśli nic nowego nie wychodzi.
Następcy: istotnie nowsze podzespoły dokładają drugie, rozłożone w czasie uderzenie.

Dlatego ekran sprzętu nie może stać się „wybierz najbardziej zieloną kartę”. Czekanie potrafi zachować kapitał na generację, która poprawia wydajność na dolara. Zbyt długie czekanie potrafi też zostawić firmę przy najdroższych stawkach chmury, podczas gdy rywal trenuje na własnych zasobach.

Specyfikacje producentów mają znaczenie, bo wydajność akceleratora to tylko część maszyny. Referencyjne H100 SXM od NVIDII podaje na przykład 80 GB pamięci, 3,35 TB/s przepustowości pamięci, do 700 W TDP i 900 GB/s NVLink. Dokładnie dlatego gra przechowuje dane o pamięci, poborze mocy i połączeniach, zamiast sprowadzać każdy podzespół do jednej liczby FLOPS.

Zasada katalogu

Publiczne specyfikacje, kiedy istnieją

Wpisy sprzętowe opierają się na publicznych specyfikacjach producentów i informacjach o premierach, zaokrąglonych na potrzeby symulacji. Wpis przyszły albo szacowany ma nosić flagę prognozy, a nie udawać danych zmierzonych.

Problem gracza

Dobry zakup potrafi być złym zakupem

Mocny akcelerator kupiony kilka dni przed wejściem generacji o lepszym stosunku ceny do wydajności potrafi być dla firmy gorszy niż wolniejszy klaster kupiony w dobrym momencie cyklu.

03 / Moc obliczeniowa

Wynajem zdejmuje jedno ryzyko. Posiadanie tworzy pięć kolejnych.

Moc w chmurze przychodzi gotowa do pracy. Własną moc trzeba nakarmić procesorami hosta, pamięcią węzła i siecią, a potem płacić za nią niezależnie od tego, czy klaster ma co robić.

Wynajęta chmuraDostępna od ręki. Kontraktowana w petaflopsach, a nie w liczbie sztuk. Droga, elastyczna i przygotowana za gracza.
Serwery w kolokacjiŚrodkowy poziom infrastruktury z czasem oczekiwania i własnością. Firma kupuje sprzęt, nie prowadząc jeszcze pełnego centrum danych.
Własne centrum danychPóźna infrastruktura z dużo dłuższym czasem oczekiwania, wysokimi progami kapitałowymi i ryzykiem niewykorzystanej mocy.

Sprzęt pomocniczy nie jest dekoracją. Pula mocy mierzy, czy procesory, pamięć i sieć są w stanie faktycznie nakarmić posiadaną flotę akceleratorów. Źle zbalansowany klaster potrafi pracować sporo poniżej swojej nominalnej wartości. Wynajęta moc nie dostaje tej kary, bo przygotowanie środowiska jest częścią tego, za co płaci rachunek z chmury.

Trening traci też efektywność skalowania wraz ze wzrostem liczby akceleratorów. Inferencja jest modelowana inaczej: bardziej ogranicza ją przepustowość i nie płaci tego samego podatku od sieci. Oba obciążenia dzielą sprzęt, bez udawania, że korzystają z niego identycznie.

01Dostawy przychodzą
02Trening zjada moc
03Rynek dzieli popyt
04Wychodzą rachunki
05Bramki sprawdzają się na nowo
06Kontrola wypłacalności
04 / Badania i architektura

Pieniądze są słabą bramką technologiczną. Kalendarz trudniej oszukać.

Badania odblokowują architektury, zbiory danych, typy modeli i infrastrukturę. Własne programy architektoniczne dokładają kolejny kompromis: budżet, czas, skupienie i niepewność.

Drzewko technologii istnieje, bo gotówka się kumuluje. Jeśli każda zaawansowana zdolność jest tylko droga, skuteczny gracz w końcu kupuje resztę gry od ręki. Węzeł badawczy kosztuje pieniądze, wymagania wstępne i czas, a tylko jednego z tych trzech nie da się odkumulować.

Własne programy architektoniczne działają na tej samej zasadzie. Firma rozdziela wysiłek między rzadkość, przepustowość, jakość na parametr, koszt obsługi i rozumowanie. Program goniący za każdym kierunkiem rozmienia się na drobne. Program krótki i niedofinansowany niesie szerszy rozrzut wyników.

Drzewko badań w Scaling Laws rozpięte na kilku epokach technologicznych
Aktualne drzewko badań. Odblokowania mają i wymagania wstępne, i bramki kalendarzowe.
Własny program architektoniczny w Scaling Laws z pięcioma kierunkami badań, budżetem i czasem trwania
Własny program architektoniczny wymienia budżet, kalendarz, skupienie i rozrzut wyniku.
05 / Rywale i wywiad

Ranking nie czeka grzecznie na twoje kolejne wydanie.

Konkurencyjne laboratoria są agentami zasianymi z historycznej osi premier, a potem mogą czekać, przyspieszać i odchodzić od niej wraz ze zmianami w kampanii.

Cierpliwy rywal potrafi zauważyć, że lepsza generacja akceleratorów wypada blisko jego planowanego okna treningowego, i świadomie poczekać. Rywal nastawiony na granicę możliwości, który zbytnio odstaje, potrafi przyspieszyć i przyjąć karę do zdolności, żeby wydać wcześniej. Między premierami laboratoria dalej się poprawiają, zamiast stać zamrożone do kolejnego wiersza w tabeli.

Gracz może zapłacić za wywiad, ale gra rozdziela rzeczywistą trafność od deklarowanej pewności. Najtańszy poziom plotek jest zaprojektowany tak, żeby brzmieć pewniej, niż jest w rzeczywistości. Raport może więc być użyteczny i mimo to błędny.

Notatka wywiadu / poglądowy interfejsDział plotek
Rywal może wstrzymywać kolejny przebieg, czekając na nadchodzące układy.
Dział ma prawo zgłosić wiarygodny sygnał nawet wtedy, gdy sygnał u podstawy jest fałszywy. Ukryta wartość prawdy nigdy nie jest pokazywana graczowi.
80%deklarowana pewność
Ważne rozróżnienie

W obecnym projekcie tani poziom plotek potrafi mieć rację w 58% przypadków, przedstawiając się z 80% pewnością. Ta różnica jest zamierzona. Płacenie za informację kupuje lepszą podstawę decyzji, a nie wszechwiedzę.

06 / Rynek, odbiorcy i kapitał

Zdolność ma znaczenie. Tak samo cena, marka i sześć miesięcy spóźnienia.

Popyt nie jest prostym przeliczeniem wyniku modelu na przychód. Produkty na rynku konkurują zdolnością, marką, ceną i wiekiem, i z graczem, i z konkurencyjnymi laboratoriami.

Zdolność
+
Marka
+
Cena
+
Wiek

Odbiorcy też zmieniają się w czasie. Segment konsumencki, deweloperski, korporacyjny, kreatywny i autonomiczny mają w kampanii różne krzywe wielkości. Wyspecjalizowane typy modeli potrafią docierać do mniejszej liczby ludzi, sprzedając odbiorcom, którzy akceptują wyższą cenę. To zamierzony kompromis, a nie ukryty mnożnik.

Finansowanie ma własny problem z czasem. Model wyceny łączy bliskość granicy możliwości z rocznym tempem przychodów i mnoży wynik przez nastroje inwestorów. Zbiórka na gorącym rynku potrafi więc zachować dużo więcej udziałów założyciela niż zbiórka tej samej kwoty na rynku zimnym.

FundingMarket / wzór z grymoment na udziały
wycena = (granica4 × 2 mld + ARR × 20) × nastroje
To wzór z ekonomii gry. Nie jest przedstawiany jako ogólny model wyceny startupów.
Ekran biznesowy w Scaling Laws z cenami, darmowym progiem i decyzjami marketingowymi
Warstwa biznesowa stoi na tym samym modelu popytu co ranking i ekonomia firmy.
07 / Uczciwość danych

Prognoza powinna wyglądać jak prognoza.

Projekt trzyma szacowany przyszły sprzęt i premiery modeli osobno od znanych danych referencyjnych, a prognozę treningu osobno od gotowego modelu.

Znane odniesienie

Dane producentów i premier

Publiczne specyfikacje i informacje o premierach są zaokrąglane do katalogów. Znane wpisy są traktowane jako dane referencyjne, nie jako zgadywanie.

Prognoza

Przyszły sprzęt i premiery

Wpisy wychodzące poza znaną oś czasu noszą flagę prognozy, żeby interfejs mógł je oznaczyć, zamiast mieszać przewidywanie z historią.

Wynik

Prognoza treningu ≠ zdolność modelu

Prognozowany przebieg nigdy nie zamienia się po cichu we wdrożony wynik. Zdolność tworzy dopiero przebieg zakończony, a rezultat wypada blisko szacunku, a nie dokładnie na nim.

Ta sama zasada dotyczy tej strony. Systemy planowane są opisane jako planowane. Ekran istniejący w Unity nie jest automatycznie nazywany „wydanym”, a wewnętrzna prognoza nie awansuje na fakt historyczny dlatego, że wygląda wiarygodnie.

08 / Testy i determinizm

Zielony build dalej może być błędny. Dlatego testy biorą się też za ekonomię.

Symulacja jest odizolowana od Unity, deterministyczna i testowalna bez ładowania sceny. Osobne testy pilnują potem grywalności, spójności między katalogami i podpięcia sceny.

Grywalność

Czy zwykła firma przetrwa?

Skryptowana, wieloletnia kampania odniesienia sprawdza, czy zwykły gracz jest w stanie utrzymać wypłacalność i konkurencyjność, nie dominując przy tym pola bez wysiłku.

Spójność

Czy katalogi mogą sobie przeczyć?

Przeglądy katalogów szukają wartości NaN, niemożliwych zakresów, wiszących odwołań i łańcuchów odblokowań, do których nigdy nie da się dojść.

Determinizm

Czy tę samą kampanię da się odtworzyć?

Losowość symulacji pochodzi z zapisanego, deterministycznego generatora. To samo ziarno i te same decyzje dają te same liczby.

Trwałość zapisu

Czy stary zapis pójdzie dalej?

Migracje zapisu przechodzą po jednej wersji naraz, zachowują stare kształty danych i odnotowują, kiedy historyczne pole trzeba było odtworzyć.

Ta struktura znalazła już błędy, które na ekranie wyglądały sensownie. Trzy są szczególnie ciekawe, bo zmieniły projekt, a nie tylko poprawiły literówkę:

01
Koszt wynajmu skakał przy zmianie generacji sprzętu w chmurze.Wynajem był trzymany jako liczba sztuk. Teraz jest kontraktowany w petaflopsach, więc odświeżenie oferty producenta nie potraja rachunku bez decyzji gracza.
02
Obsługa przy pełnych parametrach aktywnych w treningu sprawiała, że zdolność prawie nie miała znaczenia.Wszystkich ograniczała moc, więc przychód sprowadzał się do równania obliczeniowego. Obsługa produkcyjna używa teraz mniejszego współczynnika pochodnego, żeby jakość modelu znów się liczyła.
03
Węzeł badawczy odblokowywał się przed własnym wymaganiem wstępnym.W oderwaniu wyglądał poprawnie, a w prawdziwym drzewku był trwale nieosiągalny. Test spójności sprawdza teraz cały graf zależności.
09 / Aktualna linia prac

Co wciąż zamienia się z symulacji w grę.

Rdzeń ekonomii jest dalej niż fizyczna warstwa firmy. Kolejna praca zamienia istniejący stan symulacji w rzeczy, które gracz może zobaczyć, ustawić i po których może chodzić.

W budowie

Kupowanie i konfiguracja sprzętu

Osobny interfejs do wynajmu albo zakupu mocy, a potem do łączenia akceleratorów z procesorami, pamięcią i siecią, zamiast kupowania magicznego „wyniku serwera”.

Planned layer

Pracownicy i większe biura

Startowy dom staje się pierwszym szczeblem. Zatrudnieni potrzebują fizycznego miejsca, w którym się pojawią, a późniejsze biura mają sprawić, że wzrost firmy będzie widoczny, a nie tylko finansowy.

Planned layer

Incydenty bezpieczeństwa

Bezpieczeństwo wpływa już na systemy modelu i założyciela. Incydenty są brakującą stroną ujemną, która potrafi zamienić słabą decyzję o bezpieczeństwie w szkodę wizerunkową i regulacyjną.

Świat fizyczny

Ruch założyciela

Chodzenie do stanowiska pracy, garażu i późniejszych przestrzeni firmy jest prezentacją nałożoną na symulację, a nie nowym źródłem prawdy dla zasad.

Badania i materiały źródłowe

Skąd biorą się elementy ze świata rzeczywistego.

Te źródła stoją za wyborem prawa skalowania albo za danymi referencyjnymi o sprzęcie. Nie oznaczają, że gra odwzorowuje prawdziwe laboratorium czy centrum danych jeden do jednego.

Praca naukowa / 2022
Training Compute-Optimal Large Language Models

Hoffmann i współautorzy. Praca o Chinchilli stojąca za odniesieniem do skalowania optymalnego obliczeniowo.

Czytaj pracę
Praca naukowa / 2024
Chinchilla Scaling: A replication attempt

Besiroglu i współautorzy. Ponownie badają trzecią procedurę dopasowania i wyprowadzają dopasowanie zgodne z dwoma pierwszymi podejściami z tamtej pracy.

Czytaj pracę
Specyfikacje producenta
NVIDIA H100 Tensor Core GPU

Oficjalne specyfikacje produktu użyte jako przykład wymiarów pamięci, przepustowości, poboru mocy i połączeń, które przechowuje model sprzętu.

Otwórz NVIDIA
Producent / 2024
NVIDIA Blackwell platform announcement

Publiczne informacje o generacji i systemach pokazujące, dlaczego granica sprzętowa jest traktowana jak kalendarz, a nie jak statyczny katalog.

Otwórz NVIDIA
Kod projektu
Repozytorium kodu Scaling Laws

Implementacja, notatki inżynierskie i historia prac pozostają publiczne, kiedy gra się zmienia.

Otwórz GitHub

Wzory z gry, takie jak amortyzacja, opóźnienie chmury, nastroje inwestorów, reguły decyzji rywali i względny indeks zdolności, są decyzjami projektowymi symulacji. Tam, gdzie projekt używa szacowanych wpisów o przyszłości, zasadą interfejsu jest oznaczanie ich jako prognoz.

Wróć do gry

Mapa mechanizmów jest coś warta tylko wtedy, gdy decyzje dobrze się gra.

Publiczna roadmapa będzie pokazywać, co przeszło z fundamentu do grywalnego, potem do dopracowanego i w końcu do wydanego. Do tego czasu strona główna pokazuje aktualny build od strony wizualnej, a repozytorium pracę pod spodem.