Artykuły z tagiem

llm

16 artykułów

11 min czytania

SkillOpt: Jak wytrenować umiejętności agenta AI bez dotykania modelu

SkillOpt stosuje pełną dyscyplinę deep learningu - ograniczone budżety edycji, bramkę walidacyjną, pamięć odrzuconych zmian - do dokumentów skill w języku naturalnym, poprawiając zamrożone LLM-y o nawet +39 punktów w 52/52 ewaluowanych komórkach.

agentsprompt-optimizationllm
7 min czytania

TAPS: Dlaczego dane treningowe modelu-draftu mają większe znaczenie niż jego architektura

TAPS pokazuje, że dane treningowe modelu-draftu ważą więcej niż architektura: scalone drzewa dają średnią długość akceptacji 5,11, uśrednianie wag tylko 2,59.

AINLPLLM
5 min czytania

Zgubieni w Opowieściach: Jak LLM-y Gubią Wątek w Długich Historiach

ConStory-Bench mierzy błędy spójności w długich opowiadaniach LLM: GPT-5-Reasoning ma 0,113 błędu na 10 000 słów, a ludzcy eksperci wyłapują tylko 17,1% z nich.

AILLMNLP
4 min czytania

SAGE: Twój Model Wie, Kiedy Przestać Myśleć — Tylko Mu Nie Pozwalasz

SAGE zamienia prawdopodobieństwo następnego tokenu na skumulowane, dzięki czemu model sam kończy myślenie: 40-50% mniej tokenów bez straty dokładności.

AILLMRozumowanie
4 min czytania

OPUS: Jak Trenować LLM 6x Szybciej Wybierając Właściwe Dane

OPUS wybiera dane w każdej iteracji pretreningu: Qwen3-8B na 0,5B tokenów bije pełny trening na 3B, a narzut to 4,7% dzięki ghost gradients i CountSketch.

AILLMUczenie Maszynowe
4 min czytania

AI Co-Scientist: Jak nauczyć model pisać plany badawcze lepsze niż człowiek?

Rubryki wyciągnięte z publikacji i zamrożony grader uczą Qwen3-30B pisać plany badawcze: eksperci wolą je w 70% od baseline i w 52% od planów z oryginalnych prac.

Uczenie MaszynoweLLMReinforcement Learning
4 min czytania

Comp-LLM: Kiedy Armia Ekspertów Wygrywa z Gigantem – Analiza Rewolucji w Architekturze AI

Comp-LLM rozbija zapytanie na DAG podzapytań dla wyspecjalizowanych ekspertów: kompozyt ~35B osiąga F1 0,83 wobec 0,85 dla monolitycznej Llamy-2 70B.

AILLMMachine Learning
3 min czytania

LLM-kaskady z ograniczeniami kosztów — poznaj C3PO

C3PO buduje kaskady LLM z probabilistycznym ograniczeniem kosztu zamiast sztywnego budżetu, osiągając jakość najcięższego modelu przy dużo niższym rachunku.

AILLMMachine Learning
4 min czytania

DIALTREE‑RPO — prosty przewodnik po Tree‑based Dialogue Reinforced Policy Optimization

DIALTREE-RPO prowadzi wieloturne ataki red-teamingowe na LLM: drzewo dialogów z przycinaniem, RL z karą KL i adaptacyjne maskowanie gradientów formatu.

AIred-teamingLLM
3 min czytania

Attention as a Compass – jak uczyć modele rozumowania mądrzej?

AttnRL wykorzystuje macierze uwagi jako kompas wskazujący punkty rozgałęzienia w process-supervised RL: +1,8 pp nad GRPO i TreeRL przy 8% krótszym treningu.

AIuczenie ze wzmocnieniemLLM
4 min czytania

Anatomia Kłamstwa AI: Jak Modele Językowe Mogą Nas Oszukiwać

Can LLMs Lie pokazuje, że modele kłamią strategicznie: logit lens łapie próby kłamstwa, zerowanie warstw 10-15 przywraca prawdę, a wektor sterujący ją reguluje.

AISztuczna InteligencjaLLM
6 min czytania

Kulisy Hiperwydajnego Trenowania w Seamless Flow

Seamless Flow izoluje trenera od agenta i przydziela GPU po tagach: do 100% wyższa przepustowość niż VERL, a Qwen3-32B skacze na SWE-Bench z 23,0% na 45,8%.

AIReinforcement LearningLLM
5 min czytania

Głębokie Spojrzenie na Rewolucję w Text-to-SQL: Analiza Metody Adaptacyjnej

End-to-End Text-to-SQL z selekcją zbioru: Selektor wyszukuje koncepcyjnie podobne przykłady, a Generator pisze zapytanie in-context, bez fine-tuningu domeny.

Sztuczna InteligencjaPrzetwarzanie Języka NaturalnegoSQL
4 min czytania

Dynamiczne Dostrajanie (DFT): Jak jedna linijka kodu rewolucjonizuje trenowanie AI

Dynamic Fine-Tuning skaluje stratę odwrotnie do prawdopodobieństwa tokenu i prostuje ukrytą nagrodę SFT: jedna linijka kodu, wyniki na poziomie offline RL.

AILLMMachine Learning
4 min czytania

Goedel-Prover-V2: Rewolucja w Automatycznym Dowodzeniu Twierdzeń

Goedel-Prover-V2 łączy syntezę danych opartą na rusztowaniach z autokorektą w asystencie Lean. Na miniF2F i PutnamBench bije AlphaProof oraz DeepSeek-Prover.

AISztuczna InteligencjaMatematyka
2 min czytania

RetrySQL: samokorekta w generacji zapytań SQL

RetrySQL wplata błędne kroki i token [BACK] w dane treningowe: OpenCoder 1.5B zyskuje ok. 4 pkt proc. EX na BIRD i dorównuje GPT-4o w pipeline end-to-end.

RetrySQLtext-to-SQLLLM