RLVMR: Wzmocnione Uczenie z Weryfikowalnymi Nagradzającymi Meta‑Rozumowaniem

RLVMR dokłada do nagrody środowiskowej weryfikowalny składnik za meta-rozumowanie: agent unika błędnych skrótów w zadaniach o długim horyzoncie czasowym.

Read this article in English

Artykuł przedstawia RLVMR, innowacyjną metodę wzmocnionego uczenia (RL), która wprowadza weryfikowalne nagrody meta‑rozumowania wzmacniające zdolność działania na długich horyzontach czasowych. Agent generuje wewnętrzne sygnały wyjaśniające, które są oceniane pod względem weryfikowalności, co zwiększa odporność i jakość planowania :contentReference[oaicite:4]{index=4}.

Wkład

  1. Formalizacja nagród meta‑rozumowania: agenci otrzymują dodatkowe sygnały nagród za weryfikowalność łańcuchów rozumowania.
  2. Protokół weryfikacji: pomocnicze ślady rozumowania są sprawdzalne i służą ocenie uzasadnień.
  3. Walidacja empiryczna na zadaniach RL z długim horyzontem – RLVMR przewyższa standardowe podejścia RL :contentReference[oaicite:5]{index=5}.

Metoda

Agent generuje łańcuch rozumowania wraz z akcjami . Całkowita nagroda wynosi:

gdzie jest duża tylko, jeśli łańcuch rozumowania przejdzie weryfikację; reguluje wpływ meta‑rozumowania.

Eksperymenty

Testowano na środowiskach wymagających działania w długiej sekwencji – wyniki pokazują, że agent RLVMR utrzymuje stabilną wydajność i unika błędnych skrótów semantycznych lepiej niż standardowy RL :contentReference[oaicite:6]{index=6}.

Wnioski

RLVMR otwiera obiecującą ścieżkę: połączenie nagród środowiskowych i weryfikowalnych feedbacków rozumowania skutkuje agentami lepszymi w zadaniach wymagających głębokiego rozumowania.


📎 Linki

Powiązane artykuły

Komentarze

Komentarze są moderowane przed publikacją.

  • Wczytuję komentarze…