Искусственный интеллектМодельОсновы ИИLLM

Трансформер (архитектура нейросети)

Архитектура нейросети из статьи «Attention Is All You Need» (2017), на которой построены почти все современные большие языковые модели.

КРАТКО
Трансформер — это архитектура нейросети, предложенная исследователями Google в 2017 году. Её главная идея — механизм внимания: каждое слово во входе смотрит на любые другие слова и решает, какие из них важны. До трансформеров модели читали текст последовательно, что было медленно и плохо ловило длинные связи. На этой архитектуре построены GPT, Claude, Gemini, LLaMA и почти все современные большие языковые модели.
СИНОНИМЫ:Трансформерархитектура трансформераTransformer

До трансформеров главными архитектурами для текста были рекуррентные сети (RNN, LSTM). Они читали текст слово за словом и плохо помнили далёкие связи. Трансформер изменил подход: вся последовательность обрабатывается параллельно, и каждое положение видит все остальные.

Ключевые элементы

  • Внимание (attention) — механизм, по которому модель решает, на какие части входа смотреть при обработке каждого токена.
  • Многоголовое внимание — параллельные «головы» внимания, каждая ищет свой тип связей.
  • Слои нормализации и полносвязные слои — стандартные строительные блоки, идущие после внимания.

Почему это сработало

  • Параллельные вычисления — отлично легли на видеокарты, ускорили обучение в десятки раз.
  • Хорошая работа с длинными связями в тексте.
  • Универсальность — оказалось, что та же архитектура работает и на изображениях, и на звуке, и на коде.
КОГДА ПРИМЕНЯТЬ
  • Любые задачи понимания и генерации текста
  • Понимание и генерация кода
  • Современные задачи компьютерного зрения и обработки звука всё чаще тоже решаются на трансформерах
КОГДА НЕ СТОИТ
  • Простые задачи с табличными данными — здесь градиентный бустинг обычно быстрее и точнее
  • Очень ограниченные ресурсы — большие трансформеры дороги в эксплуатации
ПРИМЕР

Когда модель отвечает на вопрос по длинному документу, механизм внимания позволяет ей при работе над конкретным фрагментом «подсветить» именно те абзацы, которые касаются вопроса, и не отвлекаться на остальные. Не так давно для этого приходилось писать отдельные алгоритмы поиска и компоновки, теперь это часть стандартной работы трансформера.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

На уровне продукта обычно не нужно знать внутренности трансформера. Достаточно понимать, что от размера контекстного окна и числа параметров зависят скорость, стоимость и возможности модели, а архитектурные детали можно оставить разработчикам моделей.

Попробовать бесплатно

Вопросы про «Трансформер (архитектура нейросети)»

Главное — параллельные вычисления и работа с длинными связями. Рекуррентная сеть читает текст слово за словом, поэтому обучается медленно и теряет информацию на длинных фрагментах. Трансформер видит всю последовательность сразу и через механизм внимания связывает даже очень далёкие друг от друга слова. Дополнительный плюс — такие вычисления хорошо ложатся на видеокарты, поэтому обучение больших моделей стало практически возможным.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.