
Wyobraź sobie, że rejestrujesz czas swojego porannego dojazdu, wykonując 50 pomiarów GPS. Uruchamiasz też symulator ruchu drogowego, generując 5 000 scenariuszy. Chcesz oszacować 95-ty percentyl czasu dojazdu — czas, którego nie przekroczysz w 95% dni. Korzystając tylko z 50 pomiarów, masz szeroki przedział ufności. Symulator może natomiast systematycznie zaniżać czas (nie uwzględnia korków czy zamknięć dróg).
QuEst sprytnie łączy oba źródła:
- Oblicza 95-ty percentyl na danych rzeczywistych i na symulacjach.
- Odejmuje wynik symulatora obliczony na tych samych 50 symulacjach, znosząc przesunięcie.
- Miesza dwie estymaty wagą , dobraną tak, by zminimalizować wariancję.
Daje to nieobciążony, precyzyjny wynik i węższy przedział ufności niż przy użyciu tylko jednego źródła.
Czym jest metoda QuEst?
QuEst estymuje dowolną miarę opartą na kwantylach
gdzie to funkcja wagowa (np. delta dla pojedynczego kwantyla lub krok dla CVaR). Wykorzystuje:
- Małą próbkę wiarygodnych pomiarów (, empiryczna dystrybuanta ).
- Dużą próbkę imputacji z modelu (, empiryczna dystrybuanta ).
Estymator QuEst to
gdzie to dystrybuanta symulacji w próbce. Taka forma gwarantuje nieobciążoność nawet przy błędnym modelu.
Dlaczego działa i nie wprowadza biasu?
- Korekta biasu: Odejście estymaty symulatora od tej samej próby usuwa stałe przesunięcie.
- Optymalna waga: Waga minimalizuje wariancję: Jeśli symulacje źle korelują z pomiarami, i QuEst użyje wyłącznie danych rzeczywistych.
Jak QuEst sam się koryguje?
- Szacuje wariancje i kowariancje na podstawie danych, by dobrać .
- W rozszerzeniu parametryzuje wagę i rozwiązuje problem wypukłej optymalizacji dla jeszcze mniejszej wariancji.
- Przy napływie nowych danych realnych aktualizuje oszacowania i adaptuje wagę online.
Szacowanie 90. percentyla czasu ładowania strony
Załóżmy, że mamy następujące dane:
- Zebrano rzeczywistych pomiarów czasu ładowania strony, co daje oszacowanie 90. percentyla s oraz wariancję próbki .
- Wygenerowano imputacji modelowych, co daje s oraz wariancję .
- Na tej samej 100-próbkowej podpróbce imputacji obliczono s.
- Kowariancja między dwoma estymatami wynosi .
-
Obliczenie optymalnej wagi :
W praktyce przycinamy do 1, więc .
-
Sformułowanie estymatora QuEst:
-
Interpretacja:
- Estymat czysto na podstawie danych: 2,5 s (wysoka wariancja).
- Estymat czysto modelowy: 2,3 s (możliwa stronniczość).
- Połączony estymat QuEst: 2,4 s (wyeliminowane przesunięcie, zminimalizowana wariancja).
Ten przykład numeryczny pokazuje, jak w praktyce podstawić obserwowane kwantyle, wariancje i kowariancje do wzorów QuEst, aby uzyskać skorygowane i stabilne estymacje.
📎 Linki
- Na podstawie publikacji 📄 2507.05220
Komentarze