<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:media="http://search.yahoo.com/mrss/" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:georss="http://www.georss.org/georss">
<channel>
<title>Экспертный уровень - Вопросы и ответы про нейросети без магии askmeai.ru</title>
<link>https://askmeai.ru/</link>
<language>ru</language><item>
<title>Локальный запуск моделей: сколько нужно видеопамяти и что реально влезет</title>
<link>https://askmeai.ru/a/expert/15-lokalnyi-zapusk-trebovaniya.html</link>
<pdalink>https://askmeai.ru/a/expert/15-lokalnyi-zapusk-trebovaniya.html</pdalink>
<guid>https://askmeai.ru/a/expert/15-lokalnyi-zapusk-trebovaniya.html</guid>
<pubDate>Sat, 15 Aug 2026 22:48:56 +0300</pubDate>
<category>index</category>

<enclosure url="/uploads/posts/lokalnyi-zapusk-trebovaniya.jpg" type="image/jpeg" />
<content:encoded><![CDATA[<figure class="story-cover"><img src="/uploads/posts/lokalnyi-zapusk-trebovaniya.jpg" alt="Локальный запуск моделей: сколько нужно видеопамяти и что реально влезет" width="1600" height="900" loading="lazy"></figure><p>Главный вопрос локального запуска звучит так: влезет ли модель в видеопамять. Если влезает — работает быстро. Если нет — часть слоёв уходит в оперативную память, и скорость падает в разы. Считается это в уме, за минуту.</p><h2>Формула на салфетке</h2><p>Объём в гигабайтах примерно равен: <strong>число параметров в миллиардах × байт на параметр</strong>. Байт на параметр зависит от квантования — способа хранить веса с меньшей точностью:</p><table><tr><th>Формат</th><th>Байт на параметр</th><th>Модель 8B</th><th>Модель 32B</th><th>Модель 70B</th></tr><tr><td>FP16 (без сжатия)</td><td>2</td><td>16 ГБ</td><td>64 ГБ</td><td>140 ГБ</td></tr><tr><td>8 бит</td><td>1</td><td>8 ГБ</td><td>32 ГБ</td><td>70 ГБ</td></tr><tr><td>4 бита</td><td>0,5</td><td>4 ГБ</td><td>16 ГБ</td><td>35 ГБ</td></tr></table><p>К этому добавьте <strong>запас 15–25 %</strong> на кэш контекста и служебные структуры. Чем длиннее контекст, тем больше запас: на длинных документах кэш может занять несколько гигабайт сверх весов.</p><h2>Что это значит для типичного железа</h2><ul><li><strong>8 ГБ видеопамяти.</strong> Модели до 8B в 4-битном квантовании. Компактные Qwen3, Gemma, Phi. Для повседневных текстовых задач и простого кода хватает.</li><li><strong>12–16 ГБ.</strong> Модели 12–14B в 4 битах комфортно, 32B — впритык и с коротким контекстом.</li><li><strong>24 ГБ.</strong> Рабочая точка для 32B в 4 битах с приличным контекстом. Практический оптимум для домашней машины.</li><li><strong>48 ГБ и больше.</strong> 70B в 4 битах. Дальше — территория нескольких карт и серверного железа.</li><li><strong>Только процессор.</strong> Запустится почти всё, что влезает в оперативную память, но скорость — единицы токенов в секунду. Годится для фоновых задач, не для диалога.</li></ul><h2>Сколько теряется в качестве при квантовании</h2><p>Сжатие до 8 бит практически незаметно. До 4 бит — заметно на сложных рассуждениях и длинных цепочках, но приемлемо для большинства задач. Ниже 4 бит деградация становится очевидной: модель начинает путаться в инструкциях и терять нить.</p><p>Практическое правило: <strong>крупная модель в 4 битах обычно лучше мелкой без сжатия</strong>. 32B в 4 битах при 16 ГБ памяти даст более качественный результат, чем 8B в FP16 на том же железе.</p><h2>Что ещё влияет на скорость</h2><table><tr><th>Фактор</th><th>Влияние</th></tr><tr><td>Пропускная способность памяти</td><td>Определяющая для генерации: чем быстрее память, тем больше токенов в секунду</td></tr><tr><td>Длина контекста</td><td>Обработка длинного ввода растёт нелинейно, первый токен ждёте дольше</td></tr><tr><td>Выгрузка слоёв в оперативную память</td><td>Падение в разы: держите модель целиком в видеопамяти</td></tr><tr><td>Размер батча</td><td>Важен для сервера с несколькими пользователями, для одиночной работы почти нет</td></tr></table><h2>Когда локальный запуск оправдан</h2><p><strong>Оправдан:</strong> данные нельзя отправлять наружу; нужен предсказуемый расход без счёта за API; объёмная пакетная обработка, где важна не скорость, а цена; эксперименты с настройкой модели.</p><p><strong>Не оправдан:</strong> нужны редкие запросы к самой сильной модели; нет подходящей видеокарты; ценна скорость ответа. В этих случаях API дешевле железа — и по деньгам, и по времени на настройку.</p><h2>С чего начать проверку</h2><p>Возьмите модель на 7–8B в 4-битном квантовании, запустите, замерьте скорость генерации на своей задаче. Если получилось больше 15–20 токенов в секунду — работать комфортно, можно пробовать модель крупнее. Если меньше — увеличивать размер бессмысленно, упрётесь в память.</p>]]></content:encoded>
</item></channel></rss>