Artykuły
Wszystkie opracowania publikacji z ML/AI, od najnowszych.
Orca: robot, który nauczył się rąk z samego patrzenia
Orca (BAAI) zastępuje next-token, next-frame i next-action prediction jednym celem: Next-State-Prediction. Zamrożony backbone 4B, pre-trenowany na 12.5K godzin wideo bez ani jednej etykiety akcji, karmi trzy lekkie dekodery — a readout akcji, uczony na ledwie 200 trajektoriach na zadanie, wygrywa z π0.5 w manipulacji OOD (32.4 vs 29.4).
SWE-Explore: Benchmark oceniający jak agenci kodujący eksplorują repozytoria
SWE-Explore izoluje eksplorację repozytorium od generowania patchy - 848 issue'ów, 10 języków, 203 repozytoria. Benchmark ujawnia, że agenci świetnie znajdują właściwe pliki, ale fatalnie celują na poziomie linii kodu, a efektywność kontekstu koreluje z resolve rate na poziomie r = 0.950.
SkillOpt: Jak wytrenować umiejętności agenta AI bez dotykania modelu
SkillOpt stosuje pełną dyscyplinę deep learningu - ograniczone budżety edycji, bramkę walidacyjną, pamięć odrzuconych zmian - do dokumentów skill w języku naturalnym, poprawiając zamrożone LLM-y o nawet +39 punktów w 52/52 ewaluowanych komórkach.
MolmoAct2: Jak Allen AI zbudowało otwarty model robota, który bije zamknięte giganty
MolmoAct2 to w pełni otwarty model Vision-Language-Action, który przewyższa π0.5 i Gemini Robotics ER, osiągając 97.2% na LIBERO i 87.1% w rzeczywistym świecie - dzięki kondycjonowaniu akcji na KV-cache co warstwę i adaptacyjnemu rozumowaniu głębokościowemu.
Rekurencyjne systemy wieloagentowe: jak LLM-y uczą się współpracować w przestrzeni ukrytej
RecursiveMAS rozszerza rekurencyjne obliczenia z pojedynczych LLM-ów na systemy wieloagentowe - agenty komunikują się w przestrzeni ukrytej przez lekkie moduły RecursiveLink, osiągając +8.3% dokładności przy 2.4x przyspieszeniu.
Tstars-Tryon 1.0: wirtualna przymierzalnia jako edycja wieloobrazowa w skali Taobao
Jak zunifikowany 5B MMDiT z wielowymiarowym RL i destylacją kroków przeformułowuje virtual try-on jako edycję wieloobrazową - i działa poniżej 4 sekund na produkcji.
ClawGUI: Otwarty full-stack pipeline dla agentów GUI
ClawGUI łączy online RL, odtwarzalną ewaluację i deploy agentów GUI na realnych urządzeniach w jeden otwarty pipeline — i pokazuje, że trenowany w nim model 2B bije nietrenowane modele 72B na MobileWorld.
SkillClaw: Jak sprawić, by umiejętności agentów LLM ewoluowały kolektywnie
SkillClaw to framework umożliwiający kolektywną ewolucję umiejętności agentów LLM w ekosystemie wieloużytkownikowym. Zamiast statycznych bibliotek skills, system automatycznie uczy się z interakcji wielu użytkowników i propaguje ulepszenia do wszystkich.
TAPS: Dlaczego dane treningowe modelu-draftu mają większe znaczenie niż jego architektura
TAPS pokazuje, że dane treningowe modelu-draftu ważą więcej niż architektura: scalone drzewa dają średnią długość akceptacji 5,11, uśrednianie wag tylko 2,59.
Demystifying Video Reasoning: Modele nie myślą klatkami - myślą krokami odszumiania
Chain-of-Steps: modele dyfuzyjne wideo rozumują wzdłuż kroków odszumiania, nie klatek. Ensemble różnych seedów poprawia wyniki bez żadnego dotrenowania.
Seoul World Model: AI generujące wideo prawdziwych miast ze zdjęć ulicznych
Seoul World Model generuje fotorealistyczne wideo prawdziwych ulic ze zdjęć street view: FID 28,43 w Busan wobec 62,14 najlepszego baseline'u, zero-shot.
Zgubieni w Opowieściach: Jak LLM-y Gubią Wątek w Długich Historiach
ConStory-Bench mierzy błędy spójności w długich opowiadaniach LLM: GPT-5-Reasoning ma 0,113 błędu na 10 000 słów, a ludzcy eksperci wyłapują tylko 17,1% z nich.
Utonia: Jeden Enkoder Dla Wszystkich Chmur Punktów
Utonia to jeden enkoder o 137M parametrów dla pięciu domen chmur punktów: 81,1% mIoU na ScanNet, 82,2% na NuScenes i emergentne dopasowanie międzydomenowe.
SAGE: Twój Model Wie, Kiedy Przestać Myśleć — Tylko Mu Nie Pozwalasz
SAGE zamienia prawdopodobieństwo następnego tokenu na skumulowane, dzięki czemu model sam kończy myślenie: 40-50% mniej tokenów bez straty dokładności.
Gdy GPT Odkrywa Prawa Fizyki: Przełom w Teorii Gluonów
GPT-5.2 Pro zaproponował wzór na amplitudy single-minus gluonów: niezerowe w przestrzeni Kleina, o wartościach -1, 0 lub 1. Wzór przeszedł pięć testów spójności.
OPUS: Jak Trenować LLM 6x Szybciej Wybierając Właściwe Dane
OPUS wybiera dane w każdej iteracji pretreningu: Qwen3-8B na 0,5B tokenów bije pełny trening na 3B, a narzut to 4,7% dzięki ghost gradients i CountSketch.
Green-VLA: Jeden Mózg AI dla Wszystkich Robotów
Green-VLA trenuje jedną politykę w pięciu etapach na 3000 godzinach demonstracji z humanoidów, manipulatorów mobilnych i ramion; wyniki SOTA na CALVIN ABC-D.
To Grok Grokking: Dlaczego sieci neuronowe czasem rozumieją z opóźnieniem
Grokking pojawia się już w regresji grzbietowej: dowód trzech faz treningu pokazuje, że opóźnienie generalizacji skaluje się jak 1/λ i steruje nim weight decay.
Sieci tensorowe: Matematyczny most między AI neuronowym a symbolicznym
Sieci tensorowe jako most neuro-symboliczny: formuły logiczne dają tensory rzadkie, rozkłady prawdopodobieństwa nisko-rzędowe, a wnioskowanie to kontrakcja.
M²FMoE: Gdy eksperci uczą się przewidywać powodzie
M²FMoE wykrywa ekstremalne zdarzenia po sygnaturach częstotliwościowych bez etykiet; na zbiornikach w Kalifornii ścina błąd prognozy 8-godzinnej nawet o 45,7%.
BALLAST: Gdy bandyta uczy bazę danych jak długo czekać
BALLAST zastępuje losowe timeouty wyborów w protokole Raft bandytą LinUCB z bezpieczną eksploracją; symulator w Rust pokazuje 84% mniej niedostępności klastra.
AI Co-Scientist: Jak nauczyć model pisać plany badawcze lepsze niż człowiek?
Rubryki wyciągnięte z publikacji i zamrożony grader uczą Qwen3-30B pisać plany badawcze: eksperci wolą je w 70% od baseline i w 52% od planów z oryginalnych prac.
HyDRA: Jak nauczyć telefon rozumieć obrazy bez palenia budżetu
HyDRA przydziela rangę LoRA hierarchicznie między warstwami VLM i dynamicznie wewnątrz nich, dając 4,7% poprawy bez wzrostu liczby trenowalnych parametrów.
Comp-LLM: Kiedy Armia Ekspertów Wygrywa z Gigantem – Analiza Rewolucji w Architekturze AI
Comp-LLM rozbija zapytanie na DAG podzapytań dla wyspecjalizowanych ekspertów: kompozyt ~35B osiąga F1 0,83 wobec 0,85 dla monolitycznej Llamy-2 70B.
NVIDIA Nemotron Parse v1.1: Kompletna Anatomia Rewolucji w Cyfrowym Rozumieniu Dokumentów
Nemotron Parse v1.1 ma ~885M parametrów: enkoder C-RADIO ViT-H, kompresja z 13 184 do 3 201 tokenów i dekoder mBART zwracający Markdown, LaTeX i bounding boxy.
LLM-kaskady z ograniczeniami kosztów — poznaj C3PO
C3PO buduje kaskady LLM z probabilistycznym ograniczeniem kosztu zamiast sztywnego budżetu, osiągając jakość najcięższego modelu przy dużo niższym rachunku.
Skuteczne prognozowanie opadów satelitarnych dzięki sieciom fizyko-warunkowanym
TUPANN prognozuje opady na 10-180 minut wyłącznie z danych satelitarnych: wariacyjny encoder, MaxViT i różniczkowalna adwekcja działają tam, gdzie nie ma radarów.
Universalny predyktor przestępczości – jak hipersieci i wiedza z grafów zmieniają prognozy
HYSTL generuje parametry modelu hipersiecią zasilaną grafem wiedzy o przestępstwach, więc jeden GNN prognozuje w miastach o zupełnie różnych katalogach zdarzeń.
CHORD — sprytne rekomendacje na telefonie bez duszenia baterii
CHORD kwantuje model rekomendacji osobno dla każdego telefonu: hypernetwork generuje mapę bitów z profilu użytkownika, więc nie trzeba trenować lokalnie.
DIALTREE‑RPO — prosty przewodnik po Tree‑based Dialogue Reinforced Policy Optimization
DIALTREE-RPO prowadzi wieloturne ataki red-teamingowe na LLM: drzewo dialogów z przycinaniem, RL z karą KL i adaptacyjne maskowanie gradientów formatu.
Attention as a Compass – jak uczyć modele rozumowania mądrzej?
AttnRL wykorzystuje macierze uwagi jako kompas wskazujący punkty rozgałęzienia w process-supervised RL: +1,8 pp nad GRPO i TreeRL przy 8% krótszym treningu.
Jak wykrywać oszustwa kartą kredytową?
Wykrywanie fraudów na zbiorze 284 807 transakcji z zaledwie 492 oszustwami: hybryda undersamplingu i SMOTE daje najlepszy balans dla modeli MLP oraz KNN.
Quantum Trading – AI i komputery kwantowe w inwestowaniu
QLSTM przewiduje trend USD/TWD, a agent QA3C handluje: 11,87% zysku w latach 2020-2025 przy obsunięciu 0,92% i 244 parametrach wobec 3332 w klasycznym A3C.
Uczenie ze Wzmocnieniem w Reklamach na Pinterest – DRL-PUT w akcji!
DRL-PUT z Pinteresta zastępuje ręczne strojenie wag funkcji utility polityką RL uczoną z logów: testy A/B dały wzrost CTR o 9,7% i LC-CTR o 7,7%.
Uczenie ze Wzmocnieniem w Reklamach na Pinterest
DRL-PUT z Pinteresta zastępuje ręczne strojenie wag funkcji utility spersonalizowaną polityką RL: w testach A/B CTR wzrósł o 9,7%, a LC-CTR o 7,7%.
Anatomia Kłamstwa AI: Jak Modele Językowe Mogą Nas Oszukiwać
Can LLMs Lie pokazuje, że modele kłamią strategicznie: logit lens łapie próby kłamstwa, zerowanie warstw 10-15 przywraca prawdę, a wektor sterujący ją reguluje.
AI na Krawędzi: Jak Przyspieszyć Sieci Neuronowe na Specjalistycznym Sprzęcie
SLAC łączy bibliotekę SNL, Auto-SNL i system Rogue, by wdrażać sieci neuronowe na FPGA w MPSoC: opóźnienia jak w hls4ml lub niższe, przy mniejszym zużyciu zasobów.
Globalne Gwarancje Odporności: Probabilistyczne Podejście do Bezpieczeństwa AI
Mu i Lim zamieniają certyfikację punkt po punkcie na estymację statystyczną: kilkaset próbek i przedział Cloppera-Pearsona dają globalną gwarancję odporności.
Intern-S1: Nowy Naukowiec AI, Który Redefiniuje Badania Naukowe
Intern-S1 z Shanghai AI Laboratory to otwarty model MoE z 28 mld aktywnych parametrów, trenowany na 5 bln tokenów, mocny w planowaniu syntezy molekularnej.
Kulisy Hiperwydajnego Trenowania w Seamless Flow
Seamless Flow izoluje trenera od agenta i przydziela GPU po tagach: do 100% wyższa przepustowość niż VERL, a Qwen3-32B skacze na SWE-Bench z 23,0% na 45,8%.
Systematyzacja Wiedzy: Minimalizacja Danych w Uczeniu Maszynowym
SoK o minimalizacji danych w ML: ramy porządkujące selekcję cech, k-anonimowość i uczenie federacyjne z podziałem na minimalizację horyzontalną i wertykalną.
Uczące się Maszyny, które nie zapominają: Nowa Metoda dla Zmieniających się Danych
DyMoE walczy z katastroficznym zapominaniem w grafach: zamiast douczać stare modele, dodaje nowego eksperta na każdą porcję danych i łączy je przez bramkę.
Głębokie Spojrzenie na Rewolucję w Text-to-SQL: Analiza Metody Adaptacyjnej
End-to-End Text-to-SQL z selekcją zbioru: Selektor wyszukuje koncepcyjnie podobne przykłady, a Generator pisze zapytanie in-context, bez fine-tuningu domeny.
Dynamiczne Dostrajanie (DFT): Jak jedna linijka kodu rewolucjonizuje trenowanie AI
Dynamic Fine-Tuning skaluje stratę odwrotnie do prawdopodobieństwa tokenu i prostuje ukrytą nagrodę SFT: jedna linijka kodu, wyniki na poziomie offline RL.
ASkDAgger: Jak Sztuczna Inteligencja Uczy Się Efektywniej Dzięki Zadawaniu Pytań
ASkDAgger odwraca DAgger: robot pyta o ocenę planu, zanim wykona ruch. Mechanizmy SAG, FIER i PIER tną liczbę zapytań, podnosząc wskaźnik sukcesu w CLIPort.
CaPulse: Jak Nauczyć Maszyny Słyszeć Rytm Danych?
CaPulse wykrywa anomalie w szeregach czasowych, ucząc się przyczynowego rytmu danych: alarm rusza po złamaniu kolejności przyczyn, a nie po przekroczeniu progu.
Goedel-Prover-V2: Rewolucja w Automatycznym Dowodzeniu Twierdzeń
Goedel-Prover-V2 łączy syntezę danych opartą na rusztowaniach z autokorektą w asystencie Lean. Na miniF2F i PutnamBench bije AlphaProof oraz DeepSeek-Prover.
Jak nauczyć AI radzić sobie z błędami? Poznaj ε-Softmax
ε-Softmax zmiękcza wektory one-hot, by błędna etykieta nie karała modelu za trafną intuicję. Praca z NeurIPS 2024 o odporności na szum w etykietach danych.
Prosta i Efektywna Metoda Kwantyfikacji Niepewności
Estymacja gęstości jądrowej w przestrzeni cech jednego deterministycznego modelu to tania alternatywa dla BNN i deep ensembles w detekcji OOD: CIFAR-10 kontra SVHN.
Deep Learning do prognozowania rekrutacji w badaniach klinicznych z oszacowaniem niepewności
Multimodalny model z Clinical Longformerem prognozuje rekrutację do badań klinicznych: MAE 7,52 wobec 10,55 miesiąca i przedziały ufności z rozkładu Gamma.
Aktywna selekcja modeli oparta na konsensusie – CODA
CODA wybiera najlepszy model z puli kandydatów na podstawie konsensusu predykcji: wygrywa 18 z 26 benchmarków przy nawet 70% mniejszej liczbie etykiet.
RLVMR: Wzmocnione Uczenie z Weryfikowalnymi Nagradzającymi Meta‑Rozumowaniem
RLVMR dokłada do nagrody środowiskowej weryfikowalny składnik za meta-rozumowanie: agent unika błędnych skrótów w zadaniach o długim horyzoncie czasowym.
Jak sztuczna inteligencja może ujawnić pochodzenie miodu — spojrzenie na mineralne odciski palców
Random Forest na 12 pierwiastkach śladowych z 429 próbek miodu rozpoznaje pochodzenie botaniczne z dokładnością 99,50% i region geograficzny z 98,01%.
Optymalizacja pracy call center za pomocą uczenia ze wzmocnieniem: PPO kontra Value Iteration
PPO kontra Value Iteration w symulacji call center ze skills-based routingiem: PPO daje krótsze kolejki, mniej bezczynności agentów i najwyższe nagrody RL.
Efektywna i geometrycznie inteligentna: Liniowa pamięć i uwaga inwariantna SE(2)
Uwaga inwariantna względem SE(2) mieści się w pamięci O(n) zamiast O(n^2): kodowanie pozycji szeregiem Fouriera z błędem pod 0,001, Best Paper warsztatu RSS 2025.
Lekki silnik AI do wykrywania raka skóry w urządzeniach ubieralnych
MobileNetV2 skompresowany przez TensorRT do INT8 na Jetson Orin Nano wykrywa raka skóry z F1 87,2%, zajmując 41% rozmiaru i zużywając nawet o 93% mniej energii.
SOPHIA: wzmacnianie wolnomyślenia w dużych modelach wizualno‑językowych
SOPHIA łączy on-policy percepcję wizualną z off-policy wolnomyśleniem: InternVL3.0 zyskuje 8,5 p.p. dokładności i przewyższa GPT-4.1 na MathVision.
Rola AI w zarządzaniu konstelacjami satelitarnymi
ConstellAI, projekt ESA, uczy agentów RL trasowania i przydziału pasma w mega-konstelacjach; w symulatorze bije Dijkstrę niższymi opóźnieniami.
O fundamentalnych ograniczeniach dwuetapowych dekompozycji CVaR w procesach decyzyjnych Markowa
Dualne dekompozycje CVaR w MDP mają fundamentalne ograniczenia: dwie formuły dualne dają różne wyniki, a jedna polityka nie musi być optymalna dla każdego alfa.
PinFM: Foundation Model dla sekwencji aktywności użytkowników na platformie odkrywania wizualnego na skalę miliardową
PinFM, transformer ponad 20 mld parametrów na sekwencjach aktywności z Pinteresta: deduplikowana cross-uwaga i int4 dały +600% przepustowości i +20% zaangażowania.
GradNetOT: Uczenie optymalnych map transportu za pomocą GradNets
GradNetOT uczy map optymalnego transportu jako gradientu funkcji wypukłej: architektura mGradNet gwarantuje wypukłość, a strata minimalizuje resztę Monge-Ampère.
Niestabilna Moc: Jak Sharpness Napędza Uczenie Głębokich Sieci
Ewolucja NTK na krawędzi stabilności: gdy ostrość maleje w fazie oscylacji wokół 2/η, Kernel Target Alignment rośnie skokowo i jądro wyrównuje się z etykietami.
RiemannLoRA: Zunifikowane ramy Riemanna dla bezdyskusyjnej optymalizacji LoRA
RiemannLoRA traktuje przyrost wag LoRA jako punkt na rozmaitości niskiego rzędu i usuwa niejednoznaczność faktoryzacji: 50% mniej kroków treningu, +1,2 BLEU.
Model sieci neuronowej oparty na Complementary Learning Systems: separacja i uzupełnianie wzorców w uczeniu ciągłym
Architektura oparta na Complementary Learning Systems łączy VAE z nowoczesną siecią Hopfielda: separacja i uzupełnianie wzorców dają ~90% na Split-MNIST.
Target Polish: Jak „polerować” dane i wydobywać z nich prawdę
Target Polish koryguje dane przed faktoryzacją NMF, przycinając wartości odstające do otoczenia rekonstrukcji WH — odporny rozkład macierzy i tensorów.
Optymistyczna eksploracja w ostrożnym uczeniu ze wzmocnieniem z ograniczeniami
ORAC łączy optymistyczną eksplorację po górnej granicy nagrody z ostrożnym dolnym oszacowaniem kosztu, poprawiając wyniki w Safety-Gymnasium i CityLearn.
Nie tylko większe modele: dlaczego AI powinno lepiej widzieć, a nie tylko rosnąć
Zamiast skalować modele w nieskończoność, warto lepiej zbierać dane: EfficientNet-B0 z adaptacyjną sensoryką pokonuje znacznie większy OpenCLIP-H w percepcji.
HGMP: Rewolucja w analizie złożonych grafów dzięki prompt learning
HGMP sprowadza zadania na grafach heterogenicznych do wspólnego promptu: kontrastowy pre-trening i prompty cech pozwalają uczyć wiele zadań jednym modelem.
Predykcja i generacja antybiotyków przeciw przyszłym patogenom za pomocą ApexOracle
ApexOracle łączy embedding genomu z Evo2, opis fenotypu i dyfuzyjny model SELFIES: przewiduje MIC nowych szczepów (wzrost R² do 15%) i tworzy antybiotyki de novo.
HeLo – Nowa ścieżka rozwoju rozpoznawania emocji z danych multimodalnych
HeLo przewiduje rozkład emocji zamiast jednej etykiety, łącząc mimikę i sygnały fizjologiczne przez cross-attention, transport optymalny i korelacje etykiet.
Nowoczesne Metody w Pamięci Asocjacyjnej
Sieci Hopfielda od pojemności 0,14N do wykładniczej O(e^N): przegląd Krotova wyjaśnia formalizm Lagrangianów i pokrewieństwo z uwagą w Transformerach.
QuEst: Łączenie danych i predykcji dla solidnej estymacji kwantylowej
QuEst łączy małą próbkę pomiarów z tysiącami symulacji, odejmując estymatę modelu z tej samej próby: nieobciążone kwantyle i wariancja minimalizowana wagą lambda.
RetrySQL: samokorekta w generacji zapytań SQL
RetrySQL wplata błędne kroki i token [BACK] w dane treningowe: OpenCoder 1.5B zyskuje ok. 4 pkt proc. EX na BIRD i dorównuje GPT-4o w pipeline end-to-end.
Jak nowoczesna teoria informacji pomaga diagnozować choroby psychiczne – MvHo‑IB w akcji
MvHo-IB łączy klasyczne połączenia funkcjonalne z tensorem interakcji trójek regionów (O-information) i zyskuje do 7% dokładności na ABIDE, ADHD-200 i COBRE.
Wielopoziomowe wskazówki krokowe w uczeniu przez wzmacnianie
StepHint dzieli łańcuch rozumowania w punktach spadku prawdopodobieństwa zakończenia kroku i podaje wskazówki różnej szczegółowości, redukując błędy near-miss.
Jak przewidzieć popyt na hulajnogi? XGBoost i mikromobilność w mieście
XGBoost na 341 cechach czasowych, przestrzennych i sieciowych przewiduje popyt na hulajnogi trafniej o 27-49% niż inne podejścia i do 90% lepiej niż Prophet.
Ghost Nodes – duchy, które przyspieszają naukę sieci neuronowych
Ghost nodes to dodatkowe wyjścia klasyfikatora liczone w softmaxie, ale poza stratą: dają gradientom nowe kierunki, przyspieszają trening i same zanikają.
Framework ochrony prywatności służący do przewidywania epidemii
Hybryda sieci neuronowej i mechanistycznego modelu SEIR trenowana pod różnicową prywatnością: nawet mocno zaszumione dane prywatne poprawiają prognozy epidemii.
Niepokonani na fali zakłóceń: ARMOR – Resilient UAV Control
ARMOR uczy drona odpornej reprezentacji latentnej: enkoder teacher z VAE przekazuje wiedzę studentowi z LSTM, dając zero-shot odporność na nieznany jamming GPS.
Mind2Web 2: Nowa era 'agentycznego' wyszukiwania w sieci
Mind2Web 2 ocenia agentów wyszukiwania na 130 realnych zadaniach przez Agent-as-a-Judge; najlepsze systemy sięgają 50-70% skuteczności człowieka, dwa razy szybciej.
Maszyna, która odkrywa prawa fizyki. Jak działa H‑FEX i co z tego dla nas?
H-FEX odzyskuje jawny wzór hamiltonianu z danych o pozycji i pędzie, dopasowując stałe 1.0003 i 1.1002, i bije SINDy niemal zerowym dryfem energii.
Kiedy bandyta jest silniejszy niż Twój model – o ograniczeniach uczenia przez eksplorację
Uczenie bandytowe nie ma odpowiednika wymiaru VC: istnieją klasy, w których dwa zapytania wystarczą do znalezienia optimum, ale żaden szybki algorytm tego nie zrobi.
Nic nie pasuje do tych filtrów.