, июль 24, 2026

Годами RL-обучение игнорировало обратную связь среды. Оказалось — зря


Три работы 2026-го (ECHO, PaW, Qwen-AgentWorld): ответы среды в RL-обучении агентов — почти бесплатный источник обучающего сигнала.

  •   1 мин чтения
Годами RL-обучение игнорировало обратную связь среды. Оказалось — зря

Содержание

При обучении агента ответы среды на каждое действие обычно не использовали. А этот сигнал уже лежал в каждом прогоне — задействовать его почти ничего не стоит.

📌 Как обучают агента сейчас

Метод проб и ошибок: за всю траекторию — одна редкая награда, «получилось / не получилось». Ответы среды (вывод команды, ошибка, файл) при обучении обычно маскируются, поэтому модель на них не учится. Сигнал разреженный, обучение медленное и жадное до данных.

✅ Что предложили

В работах ECHO, PaW и Qwen-AgentWorld к обучению добавляют вторую задачу: предсказывать реакцию среды на действие. Агент выполняет ls — и параллельно учится предсказывать, какие файлы увидит; пишет неверную команду — учится предсказывать текст ошибки. Данные для этого уже есть в каждом прогоне, отдельная модель среды для этого не нужна. Агент моделирует последствия действий, а не зубрит успешные исходы.

🚀 Цифры (ECHO, терминальные агенты)

На сложном Terminal-Bench 2.0 pass rate моделей Qwen3 удвоился против чистого RL — но проценты выглядят громко на низкой базе, абсолютный pass rate пока невысок. Модели на 8B достигают прежнего качества за 1,5–2,3 раза меньше шагов обучения. Таймауты: 19,8% → 9%, длина ответов — до −30%.

⚠️ Оговорки

«Бесплатно» — по данным, не по риску: нужен подбор баланса с основным обучением, иначе метод переобучается (в одном тесте обучение схлопнулось после ~500 шагов). На инференсе агент работает как обычный — никакого «думает перед действием». ECHO и PaW — по сути вариации одной идеи, а не три независимых подтверждения. World modeling усиливает RL, но не заменяет.

💡 Почему это важно

Похоже, следующий прирост в RL придёт не только от более крупных моделей, но и от того, как мы используем уже собранный опыт. Для команд на компактных открытых моделях это перспективное направление — но пока research на препринтах, а не рецепт для продакшена.

Источник: Cameron R. Wolfe — Agentic World Models

Похожие материалы