Artykuły z tagiem
llm
16 artykułów
SkillOpt: Jak wytrenować umiejętności agenta AI bez dotykania modelu
SkillOpt stosuje pełną dyscyplinę deep learningu - ograniczone budżety edycji, bramkę walidacyjną, pamięć odrzuconych zmian - do dokumentów skill w języku naturalnym, poprawiając zamrożone LLM-y o nawet +39 punktów w 52/52 ewaluowanych komórkach.
TAPS: Dlaczego dane treningowe modelu-draftu mają większe znaczenie niż jego architektura
TAPS pokazuje, że dane treningowe modelu-draftu ważą więcej niż architektura: scalone drzewa dają średnią długość akceptacji 5,11, uśrednianie wag tylko 2,59.
Zgubieni w Opowieściach: Jak LLM-y Gubią Wątek w Długich Historiach
ConStory-Bench mierzy błędy spójności w długich opowiadaniach LLM: GPT-5-Reasoning ma 0,113 błędu na 10 000 słów, a ludzcy eksperci wyłapują tylko 17,1% z nich.
SAGE: Twój Model Wie, Kiedy Przestać Myśleć — Tylko Mu Nie Pozwalasz
SAGE zamienia prawdopodobieństwo następnego tokenu na skumulowane, dzięki czemu model sam kończy myślenie: 40-50% mniej tokenów bez straty dokładności.
OPUS: Jak Trenować LLM 6x Szybciej Wybierając Właściwe Dane
OPUS wybiera dane w każdej iteracji pretreningu: Qwen3-8B na 0,5B tokenów bije pełny trening na 3B, a narzut to 4,7% dzięki ghost gradients i CountSketch.
AI Co-Scientist: Jak nauczyć model pisać plany badawcze lepsze niż człowiek?
Rubryki wyciągnięte z publikacji i zamrożony grader uczą Qwen3-30B pisać plany badawcze: eksperci wolą je w 70% od baseline i w 52% od planów z oryginalnych prac.
Comp-LLM: Kiedy Armia Ekspertów Wygrywa z Gigantem – Analiza Rewolucji w Architekturze AI
Comp-LLM rozbija zapytanie na DAG podzapytań dla wyspecjalizowanych ekspertów: kompozyt ~35B osiąga F1 0,83 wobec 0,85 dla monolitycznej Llamy-2 70B.
LLM-kaskady z ograniczeniami kosztów — poznaj C3PO
C3PO buduje kaskady LLM z probabilistycznym ograniczeniem kosztu zamiast sztywnego budżetu, osiągając jakość najcięższego modelu przy dużo niższym rachunku.
DIALTREE‑RPO — prosty przewodnik po Tree‑based Dialogue Reinforced Policy Optimization
DIALTREE-RPO prowadzi wieloturne ataki red-teamingowe na LLM: drzewo dialogów z przycinaniem, RL z karą KL i adaptacyjne maskowanie gradientów formatu.
Attention as a Compass – jak uczyć modele rozumowania mądrzej?
AttnRL wykorzystuje macierze uwagi jako kompas wskazujący punkty rozgałęzienia w process-supervised RL: +1,8 pp nad GRPO i TreeRL przy 8% krótszym treningu.
Anatomia Kłamstwa AI: Jak Modele Językowe Mogą Nas Oszukiwać
Can LLMs Lie pokazuje, że modele kłamią strategicznie: logit lens łapie próby kłamstwa, zerowanie warstw 10-15 przywraca prawdę, a wektor sterujący ją reguluje.
Kulisy Hiperwydajnego Trenowania w Seamless Flow
Seamless Flow izoluje trenera od agenta i przydziela GPU po tagach: do 100% wyższa przepustowość niż VERL, a Qwen3-32B skacze na SWE-Bench z 23,0% na 45,8%.
Głębokie Spojrzenie na Rewolucję w Text-to-SQL: Analiza Metody Adaptacyjnej
End-to-End Text-to-SQL z selekcją zbioru: Selektor wyszukuje koncepcyjnie podobne przykłady, a Generator pisze zapytanie in-context, bez fine-tuningu domeny.
Dynamiczne Dostrajanie (DFT): Jak jedna linijka kodu rewolucjonizuje trenowanie AI
Dynamic Fine-Tuning skaluje stratę odwrotnie do prawdopodobieństwa tokenu i prostuje ukrytą nagrodę SFT: jedna linijka kodu, wyniki na poziomie offline RL.
Goedel-Prover-V2: Rewolucja w Automatycznym Dowodzeniu Twierdzeń
Goedel-Prover-V2 łączy syntezę danych opartą na rusztowaniach z autokorektą w asystencie Lean. Na miniF2F i PutnamBench bije AlphaProof oraz DeepSeek-Prover.
RetrySQL: samokorekta w generacji zapytań SQL
RetrySQL wplata błędne kroki i token [BACK] w dane treningowe: OpenCoder 1.5B zyskuje ok. 4 pkt proc. EX na BIRD i dorównuje GPT-4o w pipeline end-to-end.