ML Atlas

Dział 09 · 5 haseł

Uczenie ze wzmocnieniem i ewolucja

Agent, nagroda, eksploracja i eksploatacja, algorytmy ewolucyjne: uczenie się z konsekwencji zamiast z etykiet.

  1. Uczenie ze wzmocnieniem InteraktywneUczenie ze wzmocnieniem to uczenie z nagród za własne działania, bez podanej poprawnej odpowiedzi. Agent zna tylko skutki swoich akcji, więc musi próbować.
  2. Problem wielorękiego bandyty InteraktywneWieloręki bandyta to dylemat: grać na opcji, która dotąd działała najlepiej, czy sprawdzać inne? Strategie ε-zachłanna, UCB i Thompsona godzą oba cele.
  3. Q-learning InteraktywneQ-learning uczy agenta, ile warta jest każda akcja w każdym stanie, poprawiając oszacowania po każdym kroku. Znajduje strategię optymalną mimo eksploracji.
  4. Nagroda a etykieta InteraktywneEtykieta mówi, co należało zrobić, i daje gradient wprost w tę stronę. Nagroda mówi tylko, czy wybrana akcja była dobra — kierunek trzeba odgadnąć z prób.
  5. Algorytmy ewolucyjneAlgorytm ewolucyjny optymalizuje bez gradientu: ocenia populację, zostawia najlepszych (selekcja), łączy ich geny (krzyżowanie) i losowo je zmienia (mutacja).

Inne działy

01 Podstawy02 Dane03 Nadzorowane04 Ocena05 Bez nadzoru06 Sieci07 Architektury08 LLM10 Praktyka11 Prawa i prawdy