· 4 min czytania
DIALTREE‑RPO — prosty przewodnik po Tree‑based Dialogue Reinforced Policy Optimization
DIALTREE-RPO prowadzi wieloturne ataki red-teamingowe na LLM: drzewo dialogów z przycinaniem, RL z karą KL i adaptacyjne maskowanie gradientów formatu.