Artykuły z tagiem
Uczenie Maszynowe
25 artykułów
OPUS: Jak Trenować LLM 6x Szybciej Wybierając Właściwe Dane
OPUS wybiera dane w każdej iteracji pretreningu: Qwen3-8B na 0,5B tokenów bije pełny trening na 3B, a narzut to 4,7% dzięki ghost gradients i CountSketch.
Green-VLA: Jeden Mózg AI dla Wszystkich Robotów
Green-VLA trenuje jedną politykę w pięciu etapach na 3000 godzinach demonstracji z humanoidów, manipulatorów mobilnych i ramion; wyniki SOTA na CALVIN ABC-D.
To Grok Grokking: Dlaczego sieci neuronowe czasem rozumieją z opóźnieniem
Grokking pojawia się już w regresji grzbietowej: dowód trzech faz treningu pokazuje, że opóźnienie generalizacji skaluje się jak 1/λ i steruje nim weight decay.
Sieci tensorowe: Matematyczny most między AI neuronowym a symbolicznym
Sieci tensorowe jako most neuro-symboliczny: formuły logiczne dają tensory rzadkie, rozkłady prawdopodobieństwa nisko-rzędowe, a wnioskowanie to kontrakcja.
M²FMoE: Gdy eksperci uczą się przewidywać powodzie
M²FMoE wykrywa ekstremalne zdarzenia po sygnaturach częstotliwościowych bez etykiet; na zbiornikach w Kalifornii ścina błąd prognozy 8-godzinnej nawet o 45,7%.
BALLAST: Gdy bandyta uczy bazę danych jak długo czekać
BALLAST zastępuje losowe timeouty wyborów w protokole Raft bandytą LinUCB z bezpieczną eksploracją; symulator w Rust pokazuje 84% mniej niedostępności klastra.
AI Co-Scientist: Jak nauczyć model pisać plany badawcze lepsze niż człowiek?
Rubryki wyciągnięte z publikacji i zamrożony grader uczą Qwen3-30B pisać plany badawcze: eksperci wolą je w 70% od baseline i w 52% od planów z oryginalnych prac.
HyDRA: Jak nauczyć telefon rozumieć obrazy bez palenia budżetu
HyDRA przydziela rangę LoRA hierarchicznie między warstwami VLM i dynamicznie wewnątrz nich, dając 4,7% poprawy bez wzrostu liczby trenowalnych parametrów.
Skuteczne prognozowanie opadów satelitarnych dzięki sieciom fizyko-warunkowanym
TUPANN prognozuje opady na 10-180 minut wyłącznie z danych satelitarnych: wariacyjny encoder, MaxViT i różniczkowalna adwekcja działają tam, gdzie nie ma radarów.
Jak wykrywać oszustwa kartą kredytową?
Wykrywanie fraudów na zbiorze 284 807 transakcji z zaledwie 492 oszustwami: hybryda undersamplingu i SMOTE daje najlepszy balans dla modeli MLP oraz KNN.
AI na Krawędzi: Jak Przyspieszyć Sieci Neuronowe na Specjalistycznym Sprzęcie
SLAC łączy bibliotekę SNL, Auto-SNL i system Rogue, by wdrażać sieci neuronowe na FPGA w MPSoC: opóźnienia jak w hls4ml lub niższe, przy mniejszym zużyciu zasobów.
Globalne Gwarancje Odporności: Probabilistyczne Podejście do Bezpieczeństwa AI
Mu i Lim zamieniają certyfikację punkt po punkcie na estymację statystyczną: kilkaset próbek i przedział Cloppera-Pearsona dają globalną gwarancję odporności.
Intern-S1: Nowy Naukowiec AI, Który Redefiniuje Badania Naukowe
Intern-S1 z Shanghai AI Laboratory to otwarty model MoE z 28 mld aktywnych parametrów, trenowany na 5 bln tokenów, mocny w planowaniu syntezy molekularnej.
Systematyzacja Wiedzy: Minimalizacja Danych w Uczeniu Maszynowym
SoK o minimalizacji danych w ML: ramy porządkujące selekcję cech, k-anonimowość i uczenie federacyjne z podziałem na minimalizację horyzontalną i wertykalną.
Uczące się Maszyny, które nie zapominają: Nowa Metoda dla Zmieniających się Danych
DyMoE walczy z katastroficznym zapominaniem w grafach: zamiast douczać stare modele, dodaje nowego eksperta na każdą porcję danych i łączy je przez bramkę.
Głębokie Spojrzenie na Rewolucję w Text-to-SQL: Analiza Metody Adaptacyjnej
End-to-End Text-to-SQL z selekcją zbioru: Selektor wyszukuje koncepcyjnie podobne przykłady, a Generator pisze zapytanie in-context, bez fine-tuningu domeny.
CaPulse: Jak Nauczyć Maszyny Słyszeć Rytm Danych?
CaPulse wykrywa anomalie w szeregach czasowych, ucząc się przyczynowego rytmu danych: alarm rusza po złamaniu kolejności przyczyn, a nie po przekroczeniu progu.
Jak nauczyć AI radzić sobie z błędami? Poznaj ε-Softmax
ε-Softmax zmiękcza wektory one-hot, by błędna etykieta nie karała modelu za trafną intuicję. Praca z NeurIPS 2024 o odporności na szum w etykietach danych.
Prosta i Efektywna Metoda Kwantyfikacji Niepewności
Estymacja gęstości jądrowej w przestrzeni cech jednego deterministycznego modelu to tania alternatywa dla BNN i deep ensembles w detekcji OOD: CIFAR-10 kontra SVHN.
Deep Learning do prognozowania rekrutacji w badaniach klinicznych z oszacowaniem niepewności
Multimodalny model z Clinical Longformerem prognozuje rekrutację do badań klinicznych: MAE 7,52 wobec 10,55 miesiąca i przedziały ufności z rozkładu Gamma.
Aktywna selekcja modeli oparta na konsensusie – CODA
CODA wybiera najlepszy model z puli kandydatów na podstawie konsensusu predykcji: wygrywa 18 z 26 benchmarków przy nawet 70% mniejszej liczbie etykiet.
Efektywna i geometrycznie inteligentna: Liniowa pamięć i uwaga inwariantna SE(2)
Uwaga inwariantna względem SE(2) mieści się w pamięci O(n) zamiast O(n^2): kodowanie pozycji szeregiem Fouriera z błędem pod 0,001, Best Paper warsztatu RSS 2025.
Niestabilna Moc: Jak Sharpness Napędza Uczenie Głębokich Sieci
Ewolucja NTK na krawędzi stabilności: gdy ostrość maleje w fazie oscylacji wokół 2/η, Kernel Target Alignment rośnie skokowo i jądro wyrównuje się z etykietami.
RiemannLoRA: Zunifikowane ramy Riemanna dla bezdyskusyjnej optymalizacji LoRA
RiemannLoRA traktuje przyrost wag LoRA jako punkt na rozmaitości niskiego rzędu i usuwa niejednoznaczność faktoryzacji: 50% mniej kroków treningu, +1,2 BLEU.
Target Polish: Jak „polerować” dane i wydobywać z nich prawdę
Target Polish koryguje dane przed faktoryzacją NMF, przycinając wartości odstające do otoczenia rekonstrukcji WH — odporny rozkład macierzy i tensorów.