Artykuły z tagiem

reinforcement-learning

10 artykułów

10 min czytania

ClawGUI: Otwarty full-stack pipeline dla agentów GUI

ClawGUI łączy online RL, odtwarzalną ewaluację i deploy agentów GUI na realnych urządzeniach w jeden otwarty pipeline — i pokazuje, że trenowany w nim model 2B bije nietrenowane modele 72B na MobileWorld.

gui-agentsreinforcement-learningbenchmarking
4 min czytania

AI Co-Scientist: Jak nauczyć model pisać plany badawcze lepsze niż człowiek?

Rubryki wyciągnięte z publikacji i zamrożony grader uczą Qwen3-30B pisać plany badawcze: eksperci wolą je w 70% od baseline i w 52% od planów z oryginalnych prac.

Uczenie MaszynoweLLMReinforcement Learning
4 min czytania

DIALTREE‑RPO — prosty przewodnik po Tree‑based Dialogue Reinforced Policy Optimization

DIALTREE-RPO prowadzi wieloturne ataki red-teamingowe na LLM: drzewo dialogów z przycinaniem, RL z karą KL i adaptacyjne maskowanie gradientów formatu.

AIred-teamingLLM
3 min czytania

Quantum Trading – AI i komputery kwantowe w inwestowaniu

QLSTM przewiduje trend USD/TWD, a agent QA3C handluje: 11,87% zysku w latach 2020-2025 przy obsunięciu 0,92% i 244 parametrach wobec 3332 w klasycznym A3C.

AIQuantum ComputingReinforcement Learning
3 min czytania

Uczenie ze Wzmocnieniem w Reklamach na Pinterest – DRL-PUT w akcji!

DRL-PUT z Pinteresta zastępuje ręczne strojenie wag funkcji utility polityką RL uczoną z logów: testy A/B dały wzrost CTR o 9,7% i LC-CTR o 7,7%.

reinforcement learningrekomendacjePinterest
3 min czytania

Uczenie ze Wzmocnieniem w Reklamach na Pinterest

DRL-PUT z Pinteresta zastępuje ręczne strojenie wag funkcji utility spersonalizowaną polityką RL: w testach A/B CTR wzrósł o 9,7%, a LC-CTR o 7,7%.

reinforcement learningrekomendacjePinterest
6 min czytania

Kulisy Hiperwydajnego Trenowania w Seamless Flow

Seamless Flow izoluje trenera od agenta i przydziela GPU po tagach: do 100% wyższa przepustowość niż VERL, a Qwen3-32B skacze na SWE-Bench z 23,0% na 45,8%.

AIReinforcement LearningLLM
4 min czytania

Dynamiczne Dostrajanie (DFT): Jak jedna linijka kodu rewolucjonizuje trenowanie AI

Dynamic Fine-Tuning skaluje stratę odwrotnie do prawdopodobieństwa tokenu i prostuje ukrytą nagrodę SFT: jedna linijka kodu, wyniki na poziomie offline RL.

AILLMMachine Learning
2 min czytania

Optymalizacja pracy call center za pomocą uczenia ze wzmocnieniem: PPO kontra Value Iteration

PPO kontra Value Iteration w symulacji call center ze skills-based routingiem: PPO daje krótsze kolejki, mniej bezczynności agentów i najwyższe nagrody RL.

Reinforcement LearningPPOValue Iteration
2 min czytania

SOPHIA: wzmacnianie wolnomyślenia w dużych modelach wizualno‑językowych

SOPHIA łączy on-policy percepcję wizualną z off-policy wolnomyśleniem: InternVL3.0 zyskuje 8,5 p.p. dokładności i przewyższa GPT-4.1 na MathVision.

AILVLMreinforcement learning