Dziennik uczenia maszynowego

MLLog.dev

82 artykułów 215 tagów PL / EN

Ostatnio opublikowane

Zobacz wszystkie artykuły

SWE-Explore: Benchmark oceniający jak agenci kodujący eksplorują repozytoria

SWE-Explore izoluje eksplorację repozytorium od generowania patchy - 848 issue'ów, 10 języków, 203 repozytoria. Benchmark ujawnia, że agenci świetnie znajdują właściwe pliki, ale fatalnie celują na poziomie linii kodu, a efektywność kontekstu koreluje z resolve rate na poziomie r = 0.950.

13 min czytania

SkillOpt: Jak wytrenować umiejętności agenta AI bez dotykania modelu

SkillOpt stosuje pełną dyscyplinę deep learningu - ograniczone budżety edycji, bramkę walidacyjną, pamięć odrzuconych zmian - do dokumentów skill w języku naturalnym, poprawiając zamrożone LLM-y o nawet +39 punktów w 52/52 ewaluowanych komórkach.

11 min czytania

MolmoAct2: Jak Allen AI zbudowało otwarty model robota, który bije zamknięte giganty

MolmoAct2 to w pełni otwarty model Vision-Language-Action, który przewyższa π0.5 i Gemini Robotics ER, osiągając 97.2% na LIBERO i 87.1% w rzeczywistym świecie - dzięki kondycjonowaniu akcji na KV-cache co warstwę i adaptacyjnemu rozumowaniu głębokościowemu.

8 min czytania

Rekurencyjne systemy wieloagentowe: jak LLM-y uczą się współpracować w przestrzeni ukrytej

RecursiveMAS rozszerza rekurencyjne obliczenia z pojedynczych LLM-ów na systemy wieloagentowe - agenty komunikują się w przestrzeni ukrytej przez lekkie moduły RecursiveLink, osiągając +8.3% dokładności przy 2.4x przyspieszeniu.

9 min czytania

Tstars-Tryon 1.0: wirtualna przymierzalnia jako edycja wieloobrazowa w skali Taobao

Jak zunifikowany 5B MMDiT z wielowymiarowym RL i destylacją kroków przeformułowuje virtual try-on jako edycję wieloobrazową - i działa poniżej 4 sekund na produkcji.

12 min czytania

ClawGUI: Otwarty full-stack pipeline dla agentów GUI

ClawGUI łączy online RL, odtwarzalną ewaluację i deploy agentów GUI na realnych urządzeniach w jeden otwarty pipeline — i pokazuje, że trenowany w nim model 2B bije nietrenowane modele 72B na MobileWorld.

10 min czytania

SkillClaw: Jak sprawić, by umiejętności agentów LLM ewoluowały kolektywnie

SkillClaw to framework umożliwiający kolektywną ewolucję umiejętności agentów LLM w ekosystemie wieloużytkownikowym. Zamiast statycznych bibliotek skills, system automatycznie uczy się z interakcji wielu użytkowników i propaguje ulepszenia do wszystkich.

11 min czytania

TAPS: Dlaczego dane treningowe modelu-draftu mają większe znaczenie niż jego architektura

TAPS pokazuje, że dane treningowe modelu-draftu ważą więcej niż architektura: scalone drzewa dają średnią długość akceptacji 5,11, uśrednianie wag tylko 2,59.

7 min czytania

Demystifying Video Reasoning: Modele nie myślą klatkami - myślą krokami odszumiania

Chain-of-Steps: modele dyfuzyjne wideo rozumują wzdłuż kroków odszumiania, nie klatek. Ensemble różnych seedów poprawia wyniki bez żadnego dotrenowania.

5 min czytania

Przeglądaj według tematu

Tagi

82 artykuły