Artykuły w kategorii

papers

8 artykułów

19 min czytania

Orca: robot, który nauczył się rąk z samego patrzenia

Orca (BAAI) zastępuje next-token, next-frame i next-action prediction jednym celem: Next-State-Prediction. Zamrożony backbone 4B, pre-trenowany na 12.5K godzin wideo bez ani jednej etykiety akcji, karmi trzy lekkie dekodery — a readout akcji, uczony na ledwie 200 trajektoriach na zadanie, wygrywa z π0.5 w manipulacji OOD (32.4 vs 29.4).

world-modelsnext-state-predictionrepresentation-learning
13 min czytania

SWE-Explore: Benchmark oceniający jak agenci kodujący eksplorują repozytoria

SWE-Explore izoluje eksplorację repozytorium od generowania patchy - 848 issue'ów, 10 języków, 203 repozytoria. Benchmark ujawnia, że agenci świetnie znajdują właściwe pliki, ale fatalnie celują na poziomie linii kodu, a efektywność kontekstu koreluje z resolve rate na poziomie r = 0.950.

coding-agentsbenchmarkscode-localization
11 min czytania

SkillOpt: Jak wytrenować umiejętności agenta AI bez dotykania modelu

SkillOpt stosuje pełną dyscyplinę deep learningu - ograniczone budżety edycji, bramkę walidacyjną, pamięć odrzuconych zmian - do dokumentów skill w języku naturalnym, poprawiając zamrożone LLM-y o nawet +39 punktów w 52/52 ewaluowanych komórkach.

agentsprompt-optimizationllm
8 min czytania

MolmoAct2: Jak Allen AI zbudowało otwarty model robota, który bije zamknięte giganty

MolmoAct2 to w pełni otwarty model Vision-Language-Action, który przewyższa π0.5 i Gemini Robotics ER, osiągając 97.2% na LIBERO i 87.1% w rzeczywistym świecie - dzięki kondycjonowaniu akcji na KV-cache co warstwę i adaptacyjnemu rozumowaniu głębokościowemu.

roboticsVLAembodied-reasoning
9 min czytania

Rekurencyjne systemy wieloagentowe: jak LLM-y uczą się współpracować w przestrzeni ukrytej

RecursiveMAS rozszerza rekurencyjne obliczenia z pojedynczych LLM-ów na systemy wieloagentowe - agenty komunikują się w przestrzeni ukrytej przez lekkie moduły RecursiveLink, osiągając +8.3% dokładności przy 2.4x przyspieszeniu.

AImulti-agent-systemsrecursive-computation
12 min czytania

Tstars-Tryon 1.0: wirtualna przymierzalnia jako edycja wieloobrazowa w skali Taobao

Jak zunifikowany 5B MMDiT z wielowymiarowym RL i destylacją kroków przeformułowuje virtual try-on jako edycję wieloobrazową - i działa poniżej 4 sekund na produkcji.

AIdiffusionvirtual-try-on
10 min czytania

ClawGUI: Otwarty full-stack pipeline dla agentów GUI

ClawGUI łączy online RL, odtwarzalną ewaluację i deploy agentów GUI na realnych urządzeniach w jeden otwarty pipeline — i pokazuje, że trenowany w nim model 2B bije nietrenowane modele 72B na MobileWorld.

gui-agentsreinforcement-learningbenchmarking
11 min czytania

SkillClaw: Jak sprawić, by umiejętności agentów LLM ewoluowały kolektywnie

SkillClaw to framework umożliwiający kolektywną ewolucję umiejętności agentów LLM w ekosystemie wieloużytkownikowym. Zamiast statycznych bibliotek skills, system automatycznie uczy się z interakcji wielu użytkowników i propaguje ulepszenia do wszystkich.

llm-agentsskill-evolutionmulti-user