[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"general-list":3,"footer-feature-tags":4,"slate-glossary-term-transformer":66},true,[5,14,20,29,34,40,46,52,56,62],{"id":6,"name":7,"hex":8,"translations":9,"count_pages":13},8,"Компания","#f40925",{"ru":10,"en":11},{"name":7},{"name":12},"Company",9,{"id":15,"name":16,"hex":17,"translations":18,"count_pages":6},26,"Главная страница",null,{"ru":19},{"name":16},{"id":21,"name":22,"hex":23,"translations":24,"count_pages":28},2,"Проекты","#3027ff",{"ru":25,"en":26},{"name":22},{"name":27},"Project",15,{"id":30,"name":31,"hex":17,"translations":32,"count_pages":21},33,"ИИ",{"ru":33},{"name":31},{"id":35,"name":36,"hex":17,"translations":37,"count_pages":39},34,"Комментарии",{"ru":38},{"name":36},4,{"id":41,"name":42,"hex":17,"translations":43,"count_pages":45},25,"Задачи",{"ru":44},{"name":42},24,{"id":47,"name":48,"hex":17,"translations":49,"count_pages":51},27,"Рабочие пространства",{"ru":50},{"name":48},3,{"id":45,"name":53,"hex":17,"translations":54,"count_pages":6},"Kanban-доска",{"ru":55},{"name":53},{"id":57,"name":58,"hex":17,"translations":59,"count_pages":61},23,"Диаграмма Ганта",{"ru":60},{"name":58},1,{"id":28,"name":63,"hex":17,"translations":64,"count_pages":61},"Календарь",{"ru":65},{"name":63},{"detail":67,"more":162},{"id":68,"slug":69,"translations":70,"category":84,"tags":92,"letter":118,"og_image":17,"cover":17,"author_name":17,"author_position":17,"author_avatar":17,"faqs":119,"related":133,"views_count":159,"helpful_yes_count":122,"helpful_no_count":122,"created_at":160,"updated_at":161,"published_at":17},265,"transformer",{"ru":71},{"title":72,"short_definition":73,"tldr":74,"full_explanation":75,"when_to_apply":76,"when_not_to_apply":77,"examples":78,"tips":79,"synonyms":80,"translation_en":81,"seo_title":82,"seo_description":83},"Трансформер (архитектура нейросети)","Архитектура нейросети из статьи «Attention Is All You Need» (2017), на которой построены почти все современные большие языковые модели.","Трансформер — это архитектура нейросети, предложенная исследователями Google в 2017 году. Её главная идея — механизм внимания: каждое слово во входе смотрит на любые другие слова и решает, какие из них важны. До трансформеров модели читали текст последовательно, что было медленно и плохо ловило длинные связи. На этой архитектуре построены GPT, Claude, Gemini, LLaMA и почти все современные большие языковые модели.","\u003Cp>До трансформеров главными архитектурами для текста были рекуррентные сети (RNN, LSTM). Они читали текст слово за словом и плохо помнили далёкие связи. Трансформер изменил подход: вся последовательность обрабатывается параллельно, и каждое положение видит все остальные.\u003C\u002Fp>\u003Ch3>Ключевые элементы\u003C\u002Fh3>\u003Cul>\u003Cli>\u003Cstrong>Внимание (attention)\u003C\u002Fstrong> — механизм, по которому модель решает, на какие части входа смотреть при обработке каждого токена.\u003C\u002Fli>\u003Cli>\u003Cstrong>Многоголовое внимание\u003C\u002Fstrong> — параллельные «головы» внимания, каждая ищет свой тип связей.\u003C\u002Fli>\u003Cli>\u003Cstrong>Слои нормализации и полносвязные слои\u003C\u002Fstrong> — стандартные строительные блоки, идущие после внимания.\u003C\u002Fli>\u003C\u002Ful>\u003Ch3>Почему это сработало\u003C\u002Fh3>\u003Cul>\u003Cli>Параллельные вычисления — отлично легли на видеокарты, ускорили обучение в десятки раз.\u003C\u002Fli>\u003Cli>Хорошая работа с длинными связями в тексте.\u003C\u002Fli>\u003Cli>Универсальность — оказалось, что та же архитектура работает и на изображениях, и на звуке, и на коде.\u003C\u002Fli>\u003C\u002Ful>","\u003Cul>\u003Cli>Любые задачи понимания и генерации текста\u003C\u002Fli>\u003Cli>Понимание и генерация кода\u003C\u002Fli>\u003Cli>Современные задачи компьютерного зрения и обработки звука всё чаще тоже решаются на трансформерах\u003C\u002Fli>\u003C\u002Ful>","\u003Cul>\u003Cli>Простые задачи с табличными данными — здесь градиентный бустинг обычно быстрее и точнее\u003C\u002Fli>\u003Cli>Очень ограниченные ресурсы — большие трансформеры дороги в эксплуатации\u003C\u002Fli>\u003C\u002Ful>","\u003Cp>Когда модель отвечает на вопрос по длинному документу, механизм внимания позволяет ей при работе над конкретным фрагментом «подсветить» именно те абзацы, которые касаются вопроса, и не отвлекаться на остальные. Не так давно для этого приходилось писать отдельные алгоритмы поиска и компоновки, теперь это часть стандартной работы трансформера.\u003C\u002Fp>","\u003Cp>На уровне продукта обычно не нужно знать внутренности трансформера. Достаточно понимать, что от размера контекстного окна и числа параметров зависят скорость, стоимость и возможности модели, а архитектурные детали можно оставить разработчикам моделей.\u003C\u002Fp>","Трансформер, архитектура трансформера, Transformer","Transformer","Трансформер (Transformer): архитектура LLM | Глоссарий Shtab","Трансформер — архитектура нейросети 2017 года, на которой построены GPT, Claude, Gemini. Как работает механизм внимания и почему трансформеры обогнали RNN.",{"id":85,"slug":86,"hex":87,"icon":17,"order":85,"translations":88},10,"ai","#a855f7",{"ru":89},{"title":90,"description":91},"Искусственный интеллект","Терминология ИИ и больших языковых моделей: машинное обучение, нейросети, LLM, эмбеддинги, промптинг, RAG, агенты, MLOps, безопасность и этика моделей.",[93,102,110],{"id":94,"slug":95,"kind":96,"hex":97,"order":98,"translations":99},17,"model","framework","#352eb3",30,{"ru":100},{"title":101},"Модель",{"id":103,"slug":104,"kind":105,"hex":87,"order":106,"translations":107},36,"ai-foundation","other",90,{"ru":108},{"title":109},"Основы ИИ",{"id":111,"slug":112,"kind":96,"hex":113,"order":114,"translations":115},37,"llm","#7c5ce6",91,{"ru":116},{"title":117},"LLM","Т",[120,127],{"id":121,"order":122,"translations":123},1605,0,{"ru":124},{"question":125,"answer":126},"Чем трансформер лучше рекуррентных сетей?","\u003Cp>Главное — параллельные вычисления и работа с длинными связями. Рекуррентная сеть читает текст слово за словом, поэтому обучается медленно и теряет информацию на длинных фрагментах. Трансформер видит всю последовательность сразу и через механизм внимания связывает даже очень далёкие друг от друга слова. Дополнительный плюс — такие вычисления хорошо ложатся на видеокарты, поэтому обучение больших моделей стало практически возможным.\u003C\u002Fp>",{"id":128,"order":61,"translations":129},1606,{"ru":130},{"question":131,"answer":132},"Все ли большие языковые модели построены на трансформерах?","\u003Cp>Подавляющее большинство — да. Существуют и альтернативные архитектуры, например Mamba и RWKV, но в промышленной эксплуатации они пока встречаются редко и заметной доли рынка не занимают. На горизонте ближайших лет трансформер остаётся основной архитектурой: под него написаны библиотеки, оптимизированы видеокарты и накоплен огромный опыт обучения, и отказаться от него разом никто не готов.\u003C\u002Fp>",{"parent":134,"related":149},[135,142],{"id":136,"slug":137,"translations":138},262,"neural-network",{"ru":139},{"title":140,"short_definition":141},"Нейронная сеть","Математическая модель из связанных «нейронов», в которой каждое соединение имеет вес, подбираемый во время обучения.",{"id":143,"slug":144,"translations":145},261,"deep-learning",{"ru":146},{"title":147,"short_definition":148},"Глубокое обучение","Раздел машинного обучения, использующий многослойные нейросети для работы с изображениями, текстом, звуком и другими сложными данными.",[150,156],{"id":151,"slug":112,"translations":152},264,{"ru":153},{"title":154,"short_definition":155},"Большая языковая модель","Нейросеть с миллиардами параметров, обученная предсказывать следующий токен в тексте и способная отвечать на вопросы, писать код и рассуждать.",{"id":136,"slug":137,"translations":157},{"ru":158},{"title":140,"short_definition":141},105,"2026-05-11T19:55:47.398066+03:00","2026-05-11T19:55:47.398082+03:00",[163,189,210],{"id":164,"slug":165,"translations":166,"category":171,"tags":174,"letter":187,"cover":17,"updated_at":188,"published_at":17},282,"mcp",{"ru":167},{"title":168,"short_definition":169,"translation_en":170},"MCP (Model Context Protocol, протокол контекста модели)","Открытый протокол, по которому языковые модели и агенты единообразно подключаются к внешним инструментам, данным и сервисам.","Model Context Protocol (MCP)",{"id":85,"slug":86,"hex":87,"icon":17,"order":85,"translations":172},{"ru":173},{"title":90,"description":91},[175,178],{"id":111,"slug":112,"kind":96,"hex":113,"order":114,"translations":176},{"ru":177},{"title":117},{"id":179,"slug":180,"kind":181,"hex":182,"order":183,"translations":184},40,"ai-tool","tool","#5e79ec",94,{"ru":185},{"title":186},"Инструмент ИИ","M","2026-05-11T19:55:53.687297+03:00",{"id":190,"slug":191,"translations":192,"category":197,"tags":200,"letter":187,"cover":17,"updated_at":209,"published_at":17},287,"mlops",{"ru":193},{"title":194,"short_definition":195,"translation_en":196},"MLOps (эксплуатация ML-моделей)","Практики и инструменты для разработки, выкатки и эксплуатации моделей машинного обучения и ИИ в боевой среде — аналог DevOps для машинного обучения.","MLOps",{"id":85,"slug":86,"hex":87,"icon":17,"order":85,"translations":198},{"ru":199},{"title":90,"description":91},[201,206],{"id":61,"slug":202,"kind":202,"hex":182,"order":61,"translations":203},"methodology",{"ru":204},{"title":205},"Методология",{"id":179,"slug":180,"kind":181,"hex":182,"order":183,"translations":207},{"ru":208},{"title":186},"2026-05-11T19:55:55.482827+03:00",{"id":211,"slug":212,"translations":213,"category":218,"tags":221,"letter":228,"cover":17,"updated_at":229,"published_at":17},278,"rag",{"ru":214},{"title":215,"short_definition":216,"translation_en":217},"RAG (поиск с дополнением генерации)","Подход, при котором перед ответом языковая модель ищет подходящие документы в базе знаний и использует их как контекст.","Retrieval-Augmented Generation (RAG)",{"id":85,"slug":86,"hex":87,"icon":17,"order":85,"translations":219},{"ru":220},{"title":90,"description":91},[222,225],{"id":111,"slug":112,"kind":96,"hex":113,"order":114,"translations":223},{"ru":224},{"title":117},{"id":179,"slug":180,"kind":181,"hex":182,"order":183,"translations":226},{"ru":227},{"title":186},"R","2026-05-11T19:55:52.147205+03:00"]