При обучении агента ответы среды на каждое действие обычно не использовали. А этот сигнал уже лежал в каждом прогоне — задействовать его почти ничего не стоит.
📌 Как обучают агента сейчас
Метод проб и ошибок: за всю траекторию — одна редкая награда, «получилось / не получилось». Ответы среды (вывод команды, ошибка, файл) при обучении обычно маскируются, поэтому модель на них не учится. Сигнал разреженный, обучение медленное и жадное до данных.
✅ Что предложили
В работах ECHO, PaW и Qwen-AgentWorld к обучению добавляют вторую задачу: предсказывать реакцию среды на действие. Агент выполняет ls — и параллельно учится предсказывать, какие файлы увидит; пишет неверную команду — учится предсказывать текст ошибки. Данные для этого уже есть в каждом прогоне, отдельная модель среды для этого не нужна. Агент моделирует последствия действий, а не зубрит успешные исходы.
🚀 Цифры (ECHO, терминальные агенты)
На сложном Terminal-Bench 2.0 pass rate моделей Qwen3 удвоился против чистого RL — но проценты выглядят громко на низкой базе, абсолютный pass rate пока невысок. Модели на 8B достигают прежнего качества за 1,5–2,3 раза меньше шагов обучения. Таймауты: 19,8% → 9%, длина ответов — до −30%.
⚠️ Оговорки
«Бесплатно» — по данным, не по риску: нужен подбор баланса с основным обучением, иначе метод переобучается (в одном тесте обучение схлопнулось после ~500 шагов). На инференсе агент работает как обычный — никакого «думает перед действием». ECHO и PaW — по сути вариации одной идеи, а не три независимых подтверждения. World modeling усиливает RL, но не заменяет.
💡 Почему это важно
Похоже, следующий прирост в RL придёт не только от более крупных моделей, но и от того, как мы используем уже собранный опыт. Для команд на компактных открытых моделях это перспективное направление — но пока research на препринтах, а не рецепт для продакшена.
Источник: Cameron R. Wolfe — Agentic World Models
Похожие материалы
Большой открытый компендиум по математике, CS и AI — от векторов до продакшена
июль 24, 2026
🇰🇿 Казахстан вошёл в учредители мирового AI-института — редкий шанс, который легко растратить
июль 24, 2026
🇨🇳 Речь Си об ИИ: четыре красивых принципа и три реальных хода
июль 23, 2026