Что на самом деле изменило внимание в архитектурах
Когда говорят «трансформер лучше RNN», обычно имеют в виду одно из двух: качество или удобство обучения. Это разные вещи, и путаница мешает выбирать архитектуру.
Два реальных изменения
Первое — путь между далёкими элементами последовательности стал коротким. В рекуррентной сети, чтобы связать начало и конец абзаца, сигналу нужно пройти через все промежуточные состояния и не растеряться. Внимание связывает их напрямую.
Второе — вычисления перестали быть последовательными по времени. Все позиции обрабатываются одновременно, и это ровно то, что умеет видеокарта. Отсюда и масштабирование обучения.
Чего внимание не делает
- Не «понимает» смысл: это взвешенное усреднение представлений.
- Не бесплатно: стоимость растёт квадратично по длине последовательности.
- Не отменяет индуктивных смещений — их просто перенесли в позиционные кодировки и в данные.
Практический смысл этого разбора простой: когда задача требует длинного контекста, смотрите не на «модность» архитектуры, а на то, как в ней устроены позиционные представления и сколько стоит внимание на вашей длине.