Большая языковая модель (LLM) — это огромная нейросеть на архитектуре трансформера. Она обучается на терабайтах текста из интернета, книг, кода и других источников, после чего отдельно дообучается следовать инструкциям и быть полезным собеседником.
Как работает на простом уровне
- Текст разбивается на токены — кусочки слов.
- Модель смотрит на все предыдущие токены и предсказывает распределение вероятностей следующего.
- Один из вероятных токенов выбирается, добавляется к тексту, и цикл повторяется.
Что отличает большую модель от маленькой
- Число параметров — миллиарды, иногда сотни миллиардов.
- Объём и разнообразие обучающих данных.
- Способность решать задачи, которым модель явно не учили: без единого примера или по паре примеров прямо в запросе (в английской терминологии zero-shot и few-shot).
Чего LLM делать не умеет
- Гарантированно говорить правду — модель часто уверенно ошибается (галлюцинирует).
- Считать большие числа и выполнять точные алгоритмы без внешних инструментов.
- Помнить разговор дольше своего контекстного окна без специальных механизмов памяти.
- Задача связана с пониманием или генерацией текста
- Можно жить с тем, что ответ может быть неточным и требует проверки
- Цена единичной ошибки не катастрофическая или есть слой контроля сверху
- Нужны точные числовые расчёты — лучше встроить калькулятор или классический алгоритм
- Цена ошибки очень высока (медицинские диагнозы, юридические выводы), и нет человека-проверяющего
- Чисто структурированная задача с понятными правилами — здесь LLM не нужна
Команда поддержки клиентов внедряет LLM как «первую линию»: модель сама отвечает на частые вопросы, а сложные случаи передаёт человеку. По метрикам количество обращений, требующих участия оператора, падает в два раза, средняя скорость ответа клиенту — с часа до минуты. При этом ответы модели регулярно выборочно проверяются, и на основе ошибок дорабатывается системный промпт и база знаний.
Запоминать «знания мира» в самой модели — плохая идея: мир меняется, а каждое переобучение стоит дорого. Гораздо удобнее подключить к модели поиск по своим документам (RAG): модель остаётся универсальным «языковым процессором», а фактическая база — отдельным компонентом, который можно обновлять без переобучения.