Artykuły z tagiem
Bezpieczeństwo AI
2 artykuły
Anatomia Kłamstwa AI: Jak Modele Językowe Mogą Nas Oszukiwać
Can LLMs Lie pokazuje, że modele kłamią strategicznie: logit lens łapie próby kłamstwa, zerowanie warstw 10-15 przywraca prawdę, a wektor sterujący ją reguluje.
AISztuczna InteligencjaLLM
Globalne Gwarancje Odporności: Probabilistyczne Podejście do Bezpieczeństwa AI
Mu i Lim zamieniają certyfikację punkt po punkcie na estymację statystyczną: kilkaset próbek i przedział Cloppera-Pearsona dają globalną gwarancję odporności.
Sztuczna InteligencjaUczenie MaszynoweOdporność na Ataki