Подготовлено RD media
Коротко: механизм Attention («внимание»), описанный в статье 2017 года «Attention Is All You Need», позволяет модели оценивать, какие слова в тексте важнее сейчас, и лежит в основе архитектуры Transformer — на ней построены GPT, Claude, Gemini, Llama, Qwen, DeepSeek, Kimi.
Если дистилляция объясняет, как создавать компактные модели, а Mixture of Experts — как строить гигантские, то Attention отвечает совсем на другой вопрос: как модель вообще понимает текст? Раньше языковые модели читали предложения почти последовательно, постепенно забывая начало длинного текста. В 2017 году исследователи предложили механизм Attention.
Как работает Attention
Когда человек читает предложение, он не придаёт одинаковое значение каждому слову — мозг автоматически выделяет наиболее важные связи между словами. Attention делает примерно то же самое: при обработке каждого слова модель оценивает, какие другие слова в тексте сейчас наиболее важны, и уделяет им больше вычислительных ресурсов. Поэтому она может учитывать контекст не только соседних слов, но и информации, появившейся значительно раньше.
Почему это стало прорывом
Эта идея легла в основу архитектуры Transformer, опубликованной в статье «Attention Is All You Need» в 2017 году. Практически все современные большие языковые модели — GPT, Llama, Qwen, DeepSeek, Gemini, Claude, Kimi и многие другие — построены именно на этой архитектуре.
Что Attention не может
Attention не делает модель «разумной» — он лишь позволяет значительно эффективнее находить связи внутри текста и учитывать контекст при генерации ответа. Именно этот механизм стал фундаментом, на котором построена практически вся индустрия больших языковых моделей.
Частые вопросы
Attention — это то же самое, что Transformer?
Нет. Attention — это механизм (способ оценивать важность слов друг относительно друга), а Transformer — архитектура модели, построенная на этом механизме.
Какие модели используют Attention?
Практически все современные крупные LLM — GPT, Claude, Gemini, Llama, Qwen, DeepSeek, Kimi и большинство других построены на архитектуре Transformer с механизмом Attention.
Источники
Vaswani et al., "Attention Is All You Need" (2017)
Серия: этим выпуском завершается блок «Как устроена модель изнутри» — дистилляция, Mixture of Experts и Attention.
Похожие материалы
40°C вместо 70°C: южнокорейские инженеры научили адсорбционные системы работать на бросовом тепле
авг. 14, 2026
Google Pixel 11: первый смартфон на 2nm-чипе обогнал Apple. Разбираем, что это значит
авг. 14, 2026
Перевод в наушниках в 2026: системная функция вместо отдельного устройства
авг. 14, 2026