Искусственный интеллектLLMОбучение моделей

Дистилляция модели

Метод, при котором маленькая «ученическая» модель обучается имитировать ответы большой «учительской» — получается дешёвая модель с близким качеством.

КРАТКО
Дистилляция — это способ получить компактную и дешёвую модель, которая ведёт себя как большая, но требует в разы меньше ресурсов. Большая модель играет роль учителя: на ваших запросах она выдаёт ответы, а маленькая модель учится их повторять. Так удаётся вместить полезное поведение в модель, которая помещается на одну видеокарту или даже на ноутбук.
СИНОНИМЫ:дистилляциядистилляция моделиперенос знанийKnowledge Distillation

Идея дистилляции — переложить знания и навыки из дорогой модели в более компактную. Это особенно важно для боевой эксплуатации, где важны скорость, стоимость и иногда работа без интернета.

Как работает

  1. Берётся большая обученная модель-учитель.
  2. Готовится набор запросов, желательно близких к реальной задаче.
  3. Учитель отвечает на каждый запрос, иногда несколькими вариантами.
  4. Маленькая модель-ученик обучается воспроизводить ответы и распределения вероятностей учителя.

Что получается

  • Модель в 5–50 раз меньше по числу параметров.
  • Заметно дешевле и быстрее в эксплуатации.
  • На целевых задачах качество близкое к учителю; на задачах за пределами обучающего набора часто заметно хуже.
КОГДА ПРИМЕНЯТЬ
  • Нужна модель для массовой эксплуатации с низкой стоимостью запроса
  • Хотите запускать модель на собственной инфраструктуре или на устройстве клиента
  • Задача узкая и хорошо описывается набором запросов
КОГДА НЕ СТОИТ
  • Требуется универсальный ассистент по любым темам — дистиллированная модель обычно проигрывает учителю на широком наборе задач
  • Учитель и ученик принадлежат разным поставщикам и лицензии не позволяют такой перенос
ПРИМЕР

Команда поддержки запускает чат-бота, который обрабатывает тысячи запросов в день. Использовать самую сильную модель напрямую слишком дорого. Они собирают набор реальных вопросов клиентов, прогоняют их через большую модель и затем обучают маленькую модель повторять её ответы. На конкретной задаче поддержки качество получается почти такое же, а стоимость одного диалога падает в десять раз.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

Качество дистилляции напрямую зависит от того, насколько хорошо набор обучающих запросов покрывает реальные сценарии. Если в работе начинают появляться новые типы вопросов, дистиллированная модель быстро деградирует. Поэтому такие модели имеет смысл регулярно переобучать на свежих данных.

Попробовать бесплатно

Вопросы про «Дистилляция модели»

Тонкая настройка приспосабливает одну и ту же модель под задачу. Дистилляция — это перенос знаний из большой модели в маленькую, как правило другую по устройству. Обычно эти подходы сочетают: сначала дистиллируют большую модель, потом тонко настраивают полученную маленькую на узкой задаче.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.