DeepSeek V4: китайский конкурент OpenAI — реальность или хайп?

Сценарий повторяется с каждым заметным релизом. Появляется модель с рекордами по бенчмаркам и ценой в разы ниже, чем у флагманов. Неделя восторгов, вторая неделя — сообщения, что на реальных задачах всё не так однозначно, третья — устоявшееся мнение, обычно среднее между первыми двумя. Полезно уметь проскочить первые две недели.
Что проверять в заявленных результатах
| Вопрос к цифрам | Почему это важно |
|---|---|
| С чем сравнивали | Сравнение с прошлым поколением конкурента — не сравнение |
| Какая версия конкурента | Настройки и режим рассуждений сильно меняют результат |
| Сколько прогонов | Один прогон на разброс не проверяет |
| Публичный или закрытый набор задач | Публичные задачи попадают в обучающие данные |
| Кто проводил замер | Замер разработчика модели — это не независимая проверка |
| Цена в сравнении | Учтены ли токены рассуждений, которые не видны в ответе |
Последняя строка регулярно портит расчёты. Модели с длинной внутренней цепочкой рассуждений тратят на неё токены, и итоговая стоимость запроса оказывается заметно выше, чем следует из цены за тысячу токенов.
Проверка за час
- Задачи, которых не может быть в обучающих данных. Ваш внутренний код, ваши документы, свежие события. Разрыв между результатом здесь и на публичных задачах — самый информативный показатель.
- Задачи с подвохом. Вопрос о несуществующей функции библиотеки. Признает незнание или придумает?
- Русский язык. Модели, обученные преимущественно на английском и китайском, на русском часто проседают сильнее, чем следует из общих оценок.
- Длинный контекст. Спрячьте факт в середину большого текста и спросите о нём.
- Стабильность формата. Десять одинаковых запросов с требованием строгой структуры ответа — сколько раз структура соблюдена.
- Реальная стоимость. Посчитайте по счётчику после сотни запросов, а не по прайсу.
Где такие релизы обычно действительно хороши
Модели, которые выходят с заявкой «качество флагмана за долю цены», как правило, не блефуют полностью — но их сила распределена неравномерно. Чаще всего они сильны в задачах с чёткой проверяемой правильностью: математика, алгоритмический код, структурированные преобразования. Слабее — в длинных диалогах с удержанием контекста, в работе с малораспространёнными языками, в следовании сложным составным инструкциям и в отказе от ответа при нехватке данных.
Это не приговор, а карта применимости: под пакетную обработку однотипных задач такая модель часто идеальна, под роль основного ассистента — не всегда.
Вопросы, которые стоит задать до внедрения
- Где обрабатываются данные и что говорит политика провайдера о хранении и обучении на ваших запросах. Для корпоративного использования это решается до технических тестов, а не после.
- Есть ли открытые веса. Возможность запустить у себя снимает половину вопросов о приватности и о том, что будет, если сервис закроется.
- Лицензия на использование результатов.
- Стабильность доступа. Лимиты, доступность из вашего региона, история сбоев.
- Что будет с версией. Модели обновляются молча, и поведение может измениться без предупреждения.
Разумная стратегия
Не переносить всё сразу. Взять один участок работы с понятной метрикой, прогнать его на новой модели параллельно с текущей неделю, сравнить по своим числам. Если выигрыш есть — расширять. Такой подход стоит недели наблюдения и защищает от обеих крайностей: и от игнорирования действительно хорошего инструмента, и от миграции всего хозяйства на модель, которая через месяц окажется не тем, чем казалась.
Конкретные результаты замеров и цены в этом материале не приводятся: они меняются с каждым обновлением. Методика проверки за час работает для любого нового релиза, независимо от его названия.