Средние модели 30–70B: рабочий оптимум

Диапазон 30–70 миллиардов параметров — то место, где качество уже высокое, а требования ещё разумные. Для большинства практических задач именно здесь находится правильный ответ.
Что они делают уверенно
- Тексты любого типа: черновики, редактура, переписывание, адаптация под аудиторию.
- Код среднего объёма: функции, модули, тесты, разбор чужого кода.
- Анализ документов: выжимки, сравнение версий, поиск противоречий.
- Рассуждения на несколько шагов — с явной просьбой рассуждать пошагово.
- Перевод и локализация с приемлемым стилем.
Где начинают уступать крупным
На задачах, где нужно одновременно удерживать много условий, разбираться в редкой предметной области или работать с очень длинным документом целиком. Разрыв не драматический, но на сложных случаях виден.
Требования к железу
| Размер | 4-битное квантование | 8-битное |
|---|---|---|
| 32B | около 16 ГБ + запас на контекст | около 32 ГБ |
| 70B | около 35 ГБ | около 70 ГБ |
Практический вывод: видеокарта на 24 ГБ комфортно тянет модель на 32B в 4 битах с приличным контекстом. Это самая распространённая точка входа для локальной работы.
Кто в классе
Qwen3-32B, Llama 3.3 70B, актуальные выпуски Mistral и GLM. Внутри диапазона модели заметно отличаются по профилю: одна сильнее в коде, другая в языках. Выбирать стоит не по размеру, а по совпадению профиля с вашими задачами — разница внутри класса больше, чем разница между соседними классами.
Стратегия на практике
Возьмите одну среднюю модель как основную рабочую и держитесь её. Добавляйте вторую только под конкретную регулярную задачу — например, специализированную кодовую, если пишете код каждый день. Постоянные метания между моделями съедают больше времени, чем приносит выигрыш в пару процентов качества.