Локальные LLM в 2026: топ-5 моделей для запуска на домашнем ПК

Список лучших локальных моделей устаревает за пару месяцев, а способ выбирать — нет. Он начинается с одного числа: сколько у вас видеопамяти. Всё остальное — следствие.
Считаем, что влезет
Грубая, но рабочая прикидка: модель в 4-битном квантовании занимает примерно половину числа своих параметров в гигабайтах. Семь миллиардов параметров — около 4 ГБ, четырнадцать — около 8 ГБ, тридцать два — около 18 ГБ, семьдесят — около 40 ГБ. Сверху добавьте память под контекст: она растёт с длиной диалога и на длинном контексте легко съедает ещё несколько гигабайт.
| Видеопамять | Что помещается комфортно | Чего ждать |
|---|---|---|
| 8 ГБ | Модели до 8B в 4 бит | Короткие ответы, простые задачи, помощь с текстом |
| 12 ГБ | До 14B в 4 бит | Приемлемый код, разбор документов, средний контекст |
| 16 ГБ | 14B свободно, 32B впритык | Рабочий уровень для большинства задач |
| 24 ГБ | 32B комфортно | Близко к качеству лёгких облачных моделей |
| 48 ГБ и больше | 70B в 4 бит | Серьёзные задачи, но это уже не домашний бюджет |
Без видеокарты запускать можно, но медленно: на процессоре скорость падает в разы, и для интерактивной работы это годится плохо. Исключение — системы с общей памятью процессора и видеоядра, где предел определяется объёмом всей памяти.
Что даёт квантование
Квантование уменьшает точность весов ради размера. Практическое правило: 8 бит — качество почти без потерь, но вдвое больше памяти; 4 бита — оптимум для домашнего запуска, потери заметны редко; ниже 4 бит — модель начинает ощутимо глупеть, и лучше взять модель поменьше в 4 битах, чем большую в 2.
Отсюда следствие, которое экономит деньги: модель на 14B в 4 битах обычно полезнее, чем 32B в 2 битах на том же железе.
Как выбирать конкретную модель
- Сначала класс задач. Код, тексты на русском, рассуждения и работа с документами — разные сильные стороны. Универсальная модель проигрывает специализированной на её поле.
- Потом лицензия. Если результат идёт в коммерческий продукт, проверьте условия: часть популярных моделей ограничивает использование.
- Потом язык. Качество русского у моделей различается сильнее, чем качество английского. Проверяйте на своих текстах, а не по описанию.
- И только потом рейтинги. Они полезны для отсева совсем слабых, дальше решает ваш тест.
Тест на своих задачах
Соберите 10 типичных для вас запросов и прогоняйте каждую модель по ним. Замеряйте: - скорость генерации (токенов в секунду) на вашем железе; - время до первого токена — на нём чувствуется отзывчивость; - качество на русском отдельно от качества на английском; - поведение при длинном контексте: сохраняется ли скорость; - сколько памяти реально занято при полном контексте, а не при пустом.
Последний пункт частая причина разочарования: модель загрузилась и работает, а на пятом сообщении диалога упирается в предел памяти.
Когда локальный запуск оправдан
- Данные не должны покидать контур. Главная и часто единственная настоящая причина.
- Постоянный поток однотипных запросов. При больших объёмах локальный запуск дешевле оплаты по токенам.
- Нужна работа без интернета.
- Интерес и обучение. Тоже нормальная причина, только не путайте её с экономией.
Когда не оправдан
Если вы делаете десяток запросов в день, экономии не будет: стоимость железа и электричества перевесит оплату API многократно. Если нужна максимальная точность на сложных задачах, разрыв между локальными и флагманскими облачными моделями всё ещё заметен. И если вам важно, чтобы всё просто работало без настройки драйверов и подбора квантования, локальный запуск отнимет больше времени, чем сэкономит.
Конкретные названия и версии моделей здесь не приводятся намеренно: список меняется каждые несколько месяцев. Считайте по формуле памяти, отбирайте по классу задач и лицензии, проверяйте на своих десяти запросах — этот порядок работает независимо от того, что вышло на этой неделе.