Градиент.

Что на самом деле изменило внимание в архитектурах

Когда говорят «трансформер лучше RNN», обычно имеют в виду одно из двух: качество или удобство обучения. Это разные вещи, и путаница мешает выбирать архитектуру.

Два реальных изменения

Первое — путь между далёкими элементами последовательности стал коротким. В рекуррентной сети, чтобы связать начало и конец абзаца, сигналу нужно пройти через все промежуточные состояния и не растеряться. Внимание связывает их напрямую.

Второе — вычисления перестали быть последовательными по времени. Все позиции обрабатываются одновременно, и это ровно то, что умеет видеокарта. Отсюда и масштабирование обучения.

Чего внимание не делает

  • Не «понимает» смысл: это взвешенное усреднение представлений.
  • Не бесплатно: стоимость растёт квадратично по длине последовательности.
  • Не отменяет индуктивных смещений — их просто перенесли в позиционные кодировки и в данные.

Практический смысл этого разбора простой: когда задача требует длинного контекста, смотрите не на «модность» архитектуры, а на то, как в ней устроены позиционные представления и сколько стоит внимание на вашей длине.

Кирилл Астахов

ML-инженер, собираю и гоняю модели в проде. Пишу о том, что проверил руками: инференс, обучение, оценка качества. Замечания и вопросы — на hello@p.my01.ru.