Artykuły w kategorii
papers
8 artykułów
Orca: robot, który nauczył się rąk z samego patrzenia
Orca (BAAI) zastępuje next-token, next-frame i next-action prediction jednym celem: Next-State-Prediction. Zamrożony backbone 4B, pre-trenowany na 12.5K godzin wideo bez ani jednej etykiety akcji, karmi trzy lekkie dekodery — a readout akcji, uczony na ledwie 200 trajektoriach na zadanie, wygrywa z π0.5 w manipulacji OOD (32.4 vs 29.4).
SWE-Explore: Benchmark oceniający jak agenci kodujący eksplorują repozytoria
SWE-Explore izoluje eksplorację repozytorium od generowania patchy - 848 issue'ów, 10 języków, 203 repozytoria. Benchmark ujawnia, że agenci świetnie znajdują właściwe pliki, ale fatalnie celują na poziomie linii kodu, a efektywność kontekstu koreluje z resolve rate na poziomie r = 0.950.
SkillOpt: Jak wytrenować umiejętności agenta AI bez dotykania modelu
SkillOpt stosuje pełną dyscyplinę deep learningu - ograniczone budżety edycji, bramkę walidacyjną, pamięć odrzuconych zmian - do dokumentów skill w języku naturalnym, poprawiając zamrożone LLM-y o nawet +39 punktów w 52/52 ewaluowanych komórkach.
MolmoAct2: Jak Allen AI zbudowało otwarty model robota, który bije zamknięte giganty
MolmoAct2 to w pełni otwarty model Vision-Language-Action, który przewyższa π0.5 i Gemini Robotics ER, osiągając 97.2% na LIBERO i 87.1% w rzeczywistym świecie - dzięki kondycjonowaniu akcji na KV-cache co warstwę i adaptacyjnemu rozumowaniu głębokościowemu.
Rekurencyjne systemy wieloagentowe: jak LLM-y uczą się współpracować w przestrzeni ukrytej
RecursiveMAS rozszerza rekurencyjne obliczenia z pojedynczych LLM-ów na systemy wieloagentowe - agenty komunikują się w przestrzeni ukrytej przez lekkie moduły RecursiveLink, osiągając +8.3% dokładności przy 2.4x przyspieszeniu.
Tstars-Tryon 1.0: wirtualna przymierzalnia jako edycja wieloobrazowa w skali Taobao
Jak zunifikowany 5B MMDiT z wielowymiarowym RL i destylacją kroków przeformułowuje virtual try-on jako edycję wieloobrazową - i działa poniżej 4 sekund na produkcji.
ClawGUI: Otwarty full-stack pipeline dla agentów GUI
ClawGUI łączy online RL, odtwarzalną ewaluację i deploy agentów GUI na realnych urządzeniach w jeden otwarty pipeline — i pokazuje, że trenowany w nim model 2B bije nietrenowane modele 72B na MobileWorld.
SkillClaw: Jak sprawić, by umiejętności agentów LLM ewoluowały kolektywnie
SkillClaw to framework umożliwiający kolektywną ewolucję umiejętności agentów LLM w ekosystemie wieloużytkownikowym. Zamiast statycznych bibliotek skills, system automatycznie uczy się z interakcji wielu użytkowników i propaguje ulepszenia do wszystkich.