Artykuły z tagiem
reinforcement-learning
10 artykułów
ClawGUI: Otwarty full-stack pipeline dla agentów GUI
ClawGUI łączy online RL, odtwarzalną ewaluację i deploy agentów GUI na realnych urządzeniach w jeden otwarty pipeline — i pokazuje, że trenowany w nim model 2B bije nietrenowane modele 72B na MobileWorld.
AI Co-Scientist: Jak nauczyć model pisać plany badawcze lepsze niż człowiek?
Rubryki wyciągnięte z publikacji i zamrożony grader uczą Qwen3-30B pisać plany badawcze: eksperci wolą je w 70% od baseline i w 52% od planów z oryginalnych prac.
DIALTREE‑RPO — prosty przewodnik po Tree‑based Dialogue Reinforced Policy Optimization
DIALTREE-RPO prowadzi wieloturne ataki red-teamingowe na LLM: drzewo dialogów z przycinaniem, RL z karą KL i adaptacyjne maskowanie gradientów formatu.
Quantum Trading – AI i komputery kwantowe w inwestowaniu
QLSTM przewiduje trend USD/TWD, a agent QA3C handluje: 11,87% zysku w latach 2020-2025 przy obsunięciu 0,92% i 244 parametrach wobec 3332 w klasycznym A3C.
Uczenie ze Wzmocnieniem w Reklamach na Pinterest – DRL-PUT w akcji!
DRL-PUT z Pinteresta zastępuje ręczne strojenie wag funkcji utility polityką RL uczoną z logów: testy A/B dały wzrost CTR o 9,7% i LC-CTR o 7,7%.
Uczenie ze Wzmocnieniem w Reklamach na Pinterest
DRL-PUT z Pinteresta zastępuje ręczne strojenie wag funkcji utility spersonalizowaną polityką RL: w testach A/B CTR wzrósł o 9,7%, a LC-CTR o 7,7%.
Kulisy Hiperwydajnego Trenowania w Seamless Flow
Seamless Flow izoluje trenera od agenta i przydziela GPU po tagach: do 100% wyższa przepustowość niż VERL, a Qwen3-32B skacze na SWE-Bench z 23,0% na 45,8%.
Dynamiczne Dostrajanie (DFT): Jak jedna linijka kodu rewolucjonizuje trenowanie AI
Dynamic Fine-Tuning skaluje stratę odwrotnie do prawdopodobieństwa tokenu i prostuje ukrytą nagrodę SFT: jedna linijka kodu, wyniki na poziomie offline RL.
Optymalizacja pracy call center za pomocą uczenia ze wzmocnieniem: PPO kontra Value Iteration
PPO kontra Value Iteration w symulacji call center ze skills-based routingiem: PPO daje krótsze kolejki, mniej bezczynności agentów i najwyższe nagrody RL.
SOPHIA: wzmacnianie wolnomyślenia w dużych modelach wizualno‑językowych
SOPHIA łączy on-policy percepcję wizualną z off-policy wolnomyśleniem: InternVL3.0 zyskuje 8,5 p.p. dokładności i przewyższa GPT-4.1 na MathVision.