Small Language Models: когда меньше — значит лучше

Гонка за размером создала впечатление, что больше — всегда лучше. Для открытых вопросов о мире это верно. Для большинства производственных задач — нет, и разница в цене и скорости настолько велика, что вопрос стоит рассматривать всерьёз.
Малой обычно называют модель до 7-8 миллиардов параметров. Такая запускается на обычной видеокарте, отвечает за доли секунды и в пакетной обработке стоит в десятки раз дешевле флагмана.
Где малая модель не хуже
| Задача | Почему хватает |
|---|---|
| Классификация текста | Нужен выбор из списка, а не рассуждение |
| Извлечение полей из шаблонного текста | Структура повторяется, вариативность мала |
| Нормализация и переформатирование | Механическое преобразование |
| Оценка тональности и разметка | Простой критерий, большой объём |
| Маршрутизация запросов | Решение из нескольких вариантов за миллисекунды |
| Ответы по своей базе знаний | Знание берётся из документа, не из модели |
Последняя строка самая важная. В схеме, где нужный текст находит поиск, а модель только формулирует ответ по найденному, эрудиция модели почти не нужна — нужна аккуратность в следовании тексту. Малые модели с этим справляются.
Где заметно проигрывают
- Длинные цепочки рассуждений. Многошаговые задачи, где ошибка на третьем шаге ломает всё.
- Редкие знания. Специальные области, малораспространённые языки и библиотеки.
- Сложные составные инструкции. Промт с восемью условиями будет выполнен частично.
- Длинный контекст. Формально поддерживают, фактически теряют детали из середины.
- Творческие задачи. Заметно однообразнее.
Как проверить, хватит ли малой
1. Соберите 100 реальных примеров вашей задачи с известными правильными ответами. 2. Прогоните через флагманскую модель — это ваш потолок качества. 3. Прогоните через малую с тем же промтом. 4. Посчитайте разницу в доле правильных ответов. 5. Посчитайте разницу в стоимости и в задержке на вашем месячном объёме. 6. Решайте: если разрыв в качестве 2-3 процента, а в цене — десятки раз, ответ очевиден. Отдельно посмотрите, где именно ошибается малая. Если ошибки сосредоточены в узнаваемом классе случаев, их можно отправлять на большую модель.
Приёмы, которые вытягивают малую модель
- Сузить задачу. Один промт — одно действие. Составные инструкции разбить на цепочку простых.
- Дать примеры. Два-три образца ответа в промте поднимают качество сильнее, чем на больших моделях.
- Жёстко задать формат. Перечислить допустимые варианты ответа явно.
- Убрать необходимость знать. Всё нужное — в контексте, из ваших документов.
- Дообучить. На узкой задаче с несколькими сотнями примеров дообученная малая модель часто обходит флагман без дообучения — и это самый недооценённый ход.
Двухуровневая схема
Практичнее всего не выбирать, а сочетать: малая модель обрабатывает поток и помечает случаи, в которых не уверена, флагман разбирает только их. При типичном распределении наверх уходит 10-20% объёма, а итоговое качество почти не отличается от флагманского при кратно меньшей стоимости.
Промт для нижнего уровня: Классифицируй [объект] в одну из категорий: [список]. Если признаков недостаточно для уверенного выбора — верни «неопределённо». Не выбирай наугад. «Неопределённо» — нормальный ответ. Верни только название категории, без пояснений.
Разрешение отвечать «неопределённо» — то, что делает схему рабочей. Без него малая модель угадывает, и брак уходит дальше незамеченным.
Конкретные названия и версии малых моделей здесь не приводятся: список обновляется каждые несколько месяцев. Критерии применимости и двухуровневая схема от этого не зависят.