ML Atlas

11 · Prawa i prawdy · 4 min czytania · aktualizacja

Czy duże modele językowe naprawdę nabywają nagle nowych umiejętności (emergencja)?

W skrócie

Niektóre umiejętności LLM wydają się pojawiać skokowo po przekroczeniu pewnej skali. Część tych skoków może być artefaktem metryki — to zjawisko sporne.

Co to jest

Zdolność emergentna to umiejętność, której nie widać w mniejszych modelach, a która pojawia się w większych — tak że jej wystąpienia nie da się przewidzieć przez prostą ekstrapolację wyników małych modeli. Taką definicję podali Jason Wei i współautorzy w 2022 roku, zbierając dziesiątki zadań (arytmetyka wielocyfrowa, transliteracja, niektóre zadania z zestawu BIG-bench), w których wynik był bliski losowego aż do pewnej skali, a potem gwałtownie rósł.

Pojęcie nawiązuje do eseju fizyka Philipa Andersona „More Is Different” (1972): ilościowa zmiana może dać jakościowo nowe zachowanie, jak przejście fazowe wody w lód.

Trzeba powiedzieć wprost: to zjawisko jest sporne. W 2023 roku Rylan Schaeffer, Brando Miranda i Sanmi Koyejo pokazali, że wiele „skoków” znika, gdy zmieni się sposób mierzenia — co sugeruje, że część emergencji to własność metryki, a nie modelu.

Mechanizm — dlaczego tak działa

Argument za realną emergencją: niektóre zadania wymagają złożenia kilku umiejętności naraz (zrozumienie polecenia, wykonanie kilku kroków, sformatowanie odpowiedzi). Dopóki model nie opanuje wszystkich, wynik jest zerowy; gdy opanuje ostatnią — skacze. Dodatkowo wiele zdolności zależy od tego, jak model reaguje na podpowiedzi (np. łańcuch myśli), a ta reakcja sama może pojawić się dopiero powyżej pewnej skali.

Argument przeciw — „miraż metryki”. Wiele zadań ocenia się dokładnym dopasowaniem: odpowiedź jest dobra tylko wtedy, gdy wszystkie jej tokeny są poprawne. Jeśli model poprawia trafność pojedynczego tokenu płynnie i przewidywalnie (tak jak mówią prawa skalowania), to szansa trafienia wszystkich L tokenów naraz wynosi w przybliżeniu p^L. Taka potęga jest płaska przy małym p i stroma przy p bliskim 1. Gładki postęp wygląda wtedy jak nagły skok. Schaeffer i in. pokazali, że po zamianie metryki nieciągłej (dokładne dopasowanie) na ciągłą (np. odległość edycyjną, prawdopodobieństwo poprawnej odpowiedzi) większość krzywych staje się gładka.

Obecny stan wiedzy: oba mechanizmy prawdopodobnie istnieją. Część raportowanych emergencji to artefakt metryki i rzadkiego próbkowania skali (mało modeli pośrednich), część może być realnym efektem złożonych zadań. Praktyczny wniosek nie zależy od rozstrzygnięcia: o tym, czy skok „wygląda na nagły”, decyduje także wybór miary.

Na przykładzie

Prosty rachunek bez danych: załóżmy, że trafność pojedynczego tokenu rośnie płynnie wraz ze skalą modelu, a zadanie wymaga 10 poprawnych tokenów naraz. Przy trafności tokenu 0,5 dokładne dopasowanie wynosi 0,001; przy 0,7 — 0,028; przy 0,8 — 0,107; przy 0,9 — 0,349; przy 0,95 — 0,599; przy 0,99 — 0,904. Dla odpowiedzi 30-tokenowej jest jeszcze ostrzej: 0,042 przy trafności tokenu 0,9 i 0,74 przy 0,99.

Gdyby trafność tokenu rosła liniowo z logarytmem liczby parametrów od 0,60 przy 10 mln do 0,99 przy 100 mld (hipotetyczny, gładki postęp), dokładne dopasowanie dla 10 tokenów wynosiłoby 0,006, 0,027, 0,101, 0,321 i 0,904 dla kolejnych dziesięciokrotności skali. Przez trzy rzędy wielkości „nic się nie dzieje”, a potem następuje „emergencja” — choć w modelu nic nie zmieniło się skokowo.

W praktyce

  • Oceniając modele różnej wielkości, raportuj metryki ciągłe (log-prawdopodobieństwo poprawnej odpowiedzi, częściowe dopasowanie) obok dokładnego dopasowania.
  • Wykres wyniku w funkcji skali rysuj w skali log-log i z gęstym próbkowaniem — trzy punkty nie wystarczą, by stwierdzić skok.
  • Nie zakładaj, że brak umiejętności w małym modelu oznacza brak jej w dużym, ani odwrotnie; testuj na docelowej skali.
  • W zadaniach wieloetapowych mierz każdy etap osobno, aby zobaczyć, który element ogranicza wynik.
  • Uważaj na kontaminację: „nagła” umiejętność bywa skutkiem tego, że zadanie trafiło do danych treningowych.

Najczęstsze pytania

Czy zdolności emergentne to dowód, że modele „myślą”?
Nie. Nawet jeśli skok jest realny, oznacza tylko nieliniową zależność wyniku od skali. Nie mówi nic o świadomości ani o rodzaju wewnętrznych procesów modelu.
Czy można przewidzieć, kiedy pojawi się nowa umiejętność?
Jeśli skok jest artefaktem metryki — częściowo tak, śledząc metryki ciągłe na mniejszych modelach. Jeśli jest realnym efektem złożenia umiejętności — przewidywanie jest trudne i to właśnie budzi obawy dotyczące bezpieczeństwa.
Kto ma rację: Wei czy Schaeffer?
Spór nie jest rozstrzygnięty. Prace Schaeffera i in. przekonująco pokazały, że wybór metryki może wytworzyć pozorny skok, ale nie dowiodły, że każdy skok jest pozorny.

Źródła

  • Wei J. i in. (2022). Emergent Abilities of Large Language Models. Transactions on Machine Learning Research, arXiv:2206.07682.
  • Schaeffer R., Miranda B., Koyejo S. (2023). Are Emergent Abilities of Large Language Models a Mirage? NeurIPS 2023, arXiv:2304.15004.
  • Srivastava A. i in. (2023). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. Transactions on Machine Learning Research.
  • Anderson P. W. (1972). More Is Different. Science, 177(4047), 393–396.

Zobacz też