Крупные модели от 100B: когда они оправданы

Модели от ста миллиардов параметров — верхний эшелон открытых весов. Локально их запускают единицы, большинство работает через API. Вопрос не в том, лучше ли они, а в том, окупается ли разница.
Где отрыв заметен сразу
- Многошаговые задачи с условиями. Там, где нужно удержать десяток ограничений одновременно и не потерять ни одного.
- Работа с большим документом целиком. Договор, техзадание, объёмный отчёт — крупная модель реже теряет детали из середины.
- Редкие и узкие темы. Отраслевая терминология, специфические стандарты, малораспространённые языки.
- Код в контексте проекта. Не отдельная функция, а изменение с учётом связей между модулями.
- Нюансы стиля. Когда важен не смысл, а тон, и текст идёт читателю почти без правки.
Чем платите
| Ресурс | Порядок величины |
|---|---|
| Видеопамять для локального запуска | Десятки гигабайт даже в 4-битном квантовании |
| Скорость ответа | В разы медленнее компактных моделей |
| Стоимость через API | Кратно выше за тот же объём текста |
Архитектура MoE меняет расклад
Часть крупных моделей построена по схеме mixture of experts: параметров много, но на каждый запрос активируется лишь их доля. Такая модель отвечает заметно быстрее плотной модели того же формального размера. Если в описании встречается пометка MoE, привычная связка «больше значит медленнее» работает уже не так прямолинейно.
Практический подход
Держать крупную модель как основной инструмент дорого и обычно не нужно. Рабочая схема — двухуровневая: повседневные задачи закрывает средняя модель, а к крупной обращаются точечно, когда задача действительно сложная. Разница в счёте за месяц получается кратной, а в качестве результата — почти незаметной.
Проверить, нужен ли вам этот уровень, просто: возьмите пять задач, где средняя модель ошибалась, и прогоните их через крупную. Если ошибок стало меньше — вы нашли свой сценарий. Если нет — размер вам не нужен, нужен другой промт.