, июль 24, 2026

Жылдар бойы RL-оқыту орта кері байланысын елемей келді. Бекер болып шықты


ECHO, PaW, Qwen-AgentWorld (2026): агенттерді RL-оқытуда ортаның жауабы — оқыту сигналының тегін көзі.

  •   1 мин чтения
Жылдар бойы RL-оқыту орта кері байланысын елемей келді. Бекер болып шықты

Содержание

Агентті оқыту кезінде әр әрекетке ортаның жауабын әдетте пайдаланбайтын. Ал бұл сигнал әр өтуде (rollout) бұрыннан бар еді — оны іске қосу шамалы ғана шығын.

📌 Агентті қазір қалай оқытады

Сынақ пен қателік әдісі: бүкіл траектория үшін — бір сирек сыйақы, «болды / болмады». Ортаның жауаптары (команда шығысы, қате, файл) оқыту кезінде әдетте маскаланады, сондықтан модель оларға үйренбейді. Сигнал сирек, оқыту баяу әрі деректерге ашкөз.

✅ Не ұсынды

ECHO, PaW және Qwen-AgentWorld жұмыстарында оқытуға екінші міндет қосылады: әрекетке ортаның жауабын болжау. Агент ls орындайды — әрі қатар қандай файлдарды көретінін болжауды үйренеді; қате команда жазса — қате мәтінін болжауды үйренеді. Бұл дерек әр өтуде бұрыннан бар, бөлек орта моделі қажет емес. Агент табысты нәтижелерді жаттамай, әрекеттердің салдарын модельдейді.

🚀 Сандар (ECHO, терминалдық агенттер)

Күрделі Terminal-Bench 2.0-де Qwen3 модельдерінің pass rate таза RL-ге қарағанда екі есе өсті — бірақ пайыздар төмен базада қатты естіледі, абсолютті pass rate әзірге төмен. 8B модельдер бұрынғы сапаға 1,5–2,3 есе аз оқыту қадамымен жетеді. Таймаут: 19,8% → 9%, жауап ұзындығы — −30%-ға дейін.

⚠️ Ескертпелер

«Тегін» — деректер бойынша, тәуекел бойынша емес: негізгі оқытумен теңгерімді таңдау қажет, әйтпесе әдіс қайта оқып кетеді (бір сынақта оқыту ~500 қадамнан кейін құлдырады). Инференс кезінде агент әдеттегідей жұмыс істейді — «әрекет алдында ойлау» деген жоқ. ECHO мен PaW — негізінен бір идеяның нұсқалары, үш тәуелсіз растау емес. World modeling RL-ді күшейтеді, бірақ алмастырмайды.

💡 Неге маңызды

Бәлкім, RL-дегі келесі өсім тек ірі модельдерден емес, жиналған тәжірибені қалай пайдаланатынымыздан келеді. Компактілі ашық модельдермен жұмыс істейтін командалар үшін бұл — перспективалы бағыт, бірақ әзірге препринттердегі research, продакшн рецепті емес.

Источник: Cameron R. Wolfe — Agentic World Models

Похожие материалы