0
рейтинг

1
1
Есть ответы

Локальный запуск моделей: сколько нужно видеопамяти и что реально влезет

Локальный запуск моделей: сколько нужно видеопамяти и что реально влезет

Главный вопрос локального запуска звучит так: влезет ли модель в видеопамять. Если влезает — работает быстро. Если нет — часть слоёв уходит в оперативную память, и скорость падает в разы. Считается это в уме, за минуту.

Формула на салфетке

Объём в гигабайтах примерно равен: число параметров в миллиардах × байт на параметр. Байт на параметр зависит от квантования — способа хранить веса с меньшей точностью:

ФорматБайт на параметрМодель 8BМодель 32BМодель 70B
FP16 (без сжатия)216 ГБ64 ГБ140 ГБ
8 бит18 ГБ32 ГБ70 ГБ
4 бита0,54 ГБ16 ГБ35 ГБ

К этому добавьте запас 15–25 % на кэш контекста и служебные структуры. Чем длиннее контекст, тем больше запас: на длинных документах кэш может занять несколько гигабайт сверх весов.

Что это значит для типичного железа

  • 8 ГБ видеопамяти. Модели до 8B в 4-битном квантовании. Компактные Qwen3, Gemma, Phi. Для повседневных текстовых задач и простого кода хватает.
  • 12–16 ГБ. Модели 12–14B в 4 битах комфортно, 32B — впритык и с коротким контекстом.
  • 24 ГБ. Рабочая точка для 32B в 4 битах с приличным контекстом. Практический оптимум для домашней машины.
  • 48 ГБ и больше. 70B в 4 битах. Дальше — территория нескольких карт и серверного железа.
  • Только процессор. Запустится почти всё, что влезает в оперативную память, но скорость — единицы токенов в секунду. Годится для фоновых задач, не для диалога.

Сколько теряется в качестве при квантовании

Сжатие до 8 бит практически незаметно. До 4 бит — заметно на сложных рассуждениях и длинных цепочках, но приемлемо для большинства задач. Ниже 4 бит деградация становится очевидной: модель начинает путаться в инструкциях и терять нить.

Практическое правило: крупная модель в 4 битах обычно лучше мелкой без сжатия. 32B в 4 битах при 16 ГБ памяти даст более качественный результат, чем 8B в FP16 на том же железе.

Что ещё влияет на скорость

ФакторВлияние
Пропускная способность памятиОпределяющая для генерации: чем быстрее память, тем больше токенов в секунду
Длина контекстаОбработка длинного ввода растёт нелинейно, первый токен ждёте дольше
Выгрузка слоёв в оперативную памятьПадение в разы: держите модель целиком в видеопамяти
Размер батчаВажен для сервера с несколькими пользователями, для одиночной работы почти нет

Когда локальный запуск оправдан

Оправдан: данные нельзя отправлять наружу; нужен предсказуемый расход без счёта за API; объёмная пакетная обработка, где важна не скорость, а цена; эксперименты с настройкой модели.

Не оправдан: нужны редкие запросы к самой сильной модели; нет подходящей видеокарты; ценна скорость ответа. В этих случаях API дешевле железа — и по деньгам, и по времени на настройку.

С чего начать проверку

Возьмите модель на 7–8B в 4-битном квантовании, запустите, замерьте скорость генерации на своей задаче. Если получилось больше 15–20 токенов в секунду — работать комфортно, можно пробовать модель крупнее. Если меньше — увеличивать размер бессмысленно, упрётесь в память.

Похожие вопросы

1 ответ

обсуждение открыто
0
16 августа 2026 00:20
## Короткий ответ

Объём видеопамяти ≈ (число параметров модели) × (байт на параметр в зависимости от квантования) + запас 15–25% на контекст и служебные данные. Для модели 8B в 4-битном квантовании нужно примерно 5–6 ГБ VRAM, поэтому она запустится на карте с 8 ГБ.

## Как считать

Формула:
VRAM (ГБ) = N × B × 1.2
где N — параметры в миллиардах, B — байт на параметр, 1.2 — минимальный запас.

| Формат | Байт на параметр | 8B | 32B | 70B |
|---|---|---|---|---|
| FP16 | 2 | 16 ГБ | 64 ГБ | 140 ГБ |
| INT8 | 1 | 8 ГБ | 32 ГБ | 70 ГБ |
| INT4 | 0.5 | 4 ГБ | 16 ГБ | 35 ГБ |

К этому всегда добавляйте 15–25%. На длинном контексте (32K токенов и больше) кэш внимания может съесть дополнительно несколько гигабайт. Поэтому даже 8B в INT4 на 8 ГБ — это «впритык» при большой длине запроса.

## Что реально влезет на разные карты

- 8 ГБ VRAM: модели 7–9B в INT4 (Qwen2.5-7B, Gemma-2-9B, Phi-3.5-mini). Комфортно для текста и простого кода.
- 12–16 ГБ: 12–14B в INT4 с запасом, либо 8–9B в INT8 с большим контекстом. 32B в 4 битах — впритык только на 16 ГБ и с коротким контекстом.
- 24 ГБ: 32B в INT4 с приличным контекстом (до 8–16K) — оптимум для одной карты.
- 48 ГБ+: 70B в INT4. Дальше нужны 2–4 карты или серверные решения.
- Только CPU: запустится всё, что влезает в оперативную память, но скорость — единицы токенов/с. Только для фоновой обработки.

## Квантование и качество

INT8 почти неотличим от FP16. INT4 заметен на сложных рассуждениях, но приемлем. Ниже 4 бит модель начинает терять нить рассуждения.

Правило: модель 32B в INT4 обычно лучше, чем 8B в FP16 на том же железе. Но если 32B выгружает слои в RAM, скорость падает в разы — тогда лучше взять 14B целиком в VRAM.

## Скорость

Главный фактор не число ядер, а пропускная способность памяти GPU. Например, RTX 3090 с GDDR6X даст заметно больше токенов/с, чем старая карта с такой же VRAM.

Проверка на практике: возьмите 7–8B в INT4, запустите на своей задаче. Если скорость >15–20 токенов/с — работать комфортно, можно пробовать модель крупнее. Если меньше — упираетесь в память, увеличение модели не поможет.

## Когда локальный запуск оправдан

Оправдан: нужно не передавать данные наружу, нужна предсказуемая стоимость без оплаты за токены, пакетная обработка больших объёмов, тонкая настройка. Не оправдан: редкие запросы к самой сильной модели или нет подходящей видеокарты — API будет дешевле и быстрее по времени внедрения.

Ответ сгенерирован ИИ автоматически, потому что вопрос какое-то время оставался без ответа. Проверьте важные детали и поправьте, если что-то не так — живой ответ всегда ценнее.

Добавление комментария

Не публикуется. Нужен для уведомлений об ответах.
Отвечайте по существу: решение, а не «у меня то же самое».
Кликните на изображение чтобы обновить код, если он неразборчив