Модели для слабого ПК: что реально запустится на ноутбуке

Компактная модель — не урезанная версия большой, а отдельно обученная под ограниченные ресурсы. Современные модели на 4–8 миллиардов параметров решают то, что три года назад требовало серверной стойки.
Кто в классе
- Phi-4-mini 3.8B — очень компактная, обучена на тщательно отобранных данных, сильна для своего размера в рассуждениях.
- Qwen3-8B — лучший баланс качества и требований, хорошая многоязычность.
- Gemma 3 4B — широкий языковой охват при малом размере.
- Ministral 8B — быстрая, ориентирована на потоковую обработку.
Что нужно от железа
| Конфигурация | Что запустится | Ожидаемая скорость |
|---|---|---|
| 8 ГБ видеопамяти | 8B в 4-битном квантовании | Комфортная, 20+ токенов в секунду |
| 6 ГБ видеопамяти | 4B в 4 битах, 8B впритык | Приемлемая |
| Только процессор, 16 ГБ ОЗУ | 4B в 4 битах | Медленно: единицы токенов в секунду |
| Ноутбук с общей памятью | 8B при 16 ГБ и выше | Зависит от пропускной способности памяти |
Что компактные модели делают хорошо
- Переформулирование, сокращение, исправление стиля.
- Извлечение данных из текста по шаблону — имена, даты, суммы.
- Классификация: тональность, категория, спам или нет.
- Простые ответы по приложенному документу.
- Черновики писем и коротких текстов.
Чего от них не ждать
Длинных рассуждений. На третьем-четвёртом шаге компактная модель начинает терять нить.
Знания редких фактов. Чем меньше модель, тем меньше в ней «запомненного» — и тем выше риск уверенной выдумки. Компактным моделям всегда лучше давать источник в запросе, а не полагаться на их память.
Сложного кода. Функция на 20 строк — да. Модуль с зависимостями — нет.
Как выжать больше скорости
- Держите модель целиком в видеопамяти. Выгрузка части слоёв в оперативную память роняет скорость в разы.
- Не раздувайте контекст. Обработка длинного ввода — самая дорогая часть; лишние 10 тысяч токенов истории заметно увеличат ожидание первого ответа.
- Используйте 4-битное квантование. Для компактных моделей потери приемлемы, а выигрыш в скорости и памяти существенный.
- Сформулируйте задачу узко. Компактная модель тем лучше, чем конкретнее запрос: у неё меньше запаса, чтобы догадываться.
Когда компактная модель — правильный выбор
Массовая однотипная обработка: тысяча писем, десять тысяч отзывов, поток документов. Здесь скорость и стоимость важнее последнего процента качества. Плюс сценарии, где данные не должны покидать машину, — компактная модель локально закрывает задачу без единого сетевого запроса.