Мультимодальные модели: как выбрать между GPT-5o, Gemini и Claude

Сравнивать мультимодальные модели «вообще» бессмысленно: у каждой сильные и слабые места распределены по разным типам входа, и на вашем сценарии картина может оказаться обратной общему мнению. Практичнее не выбирать лучшую, а прогнать три-четыре кандидата на своём материале — благо доступ к каждой стоит копейки, пока речь о тестовой сотне запросов.
Первое: чем определяется выбор
| Фактор | Как влияет |
|---|---|
| Тип входа | Скан документа, фото, скриншот, схема, видео — разные задачи с разным качеством |
| Объём | При тысячах запросов в день разница в цене решает больше, чем разница в качестве |
| Цена ошибки | Определяет, нужен ли режим с явным «не разобрал» |
| Требования к данным | Где обрабатывается, хранится ли, используется ли для обучения |
| Формат ответа | Если ответ парсится программно, важна стабильность структуры |
| Задержка | Для интерактивного интерфейса важнее качества |
Второе: как считать стоимость
Изображения тарифицируются не так, как текст, и разница между провайдерами тут больше, чем в цене за текстовый токен. Считайте так:
1. Возьмите 50 реальных файлов вашего типа и размера. 2. Прогоните через каждого кандидата с одинаковым промтом. 3. Снимите фактический расход по счётчику провайдера, не по прайсу. 4. Разделите на 50 — получите цену за документ. 5. Умножьте на месячный объём. 6. Добавьте стоимость ручной проверки: доля неуверенных ответов, умноженная на время оператора.
Шестой пункт меняет расклад чаще всего. Модель дешевле на 30%, но дающая вдвое больше случаев, требующих ручной проверки, обходится дороже.
Третье: единый промт для честного сравнения
Извлеки из изображения: [поля]. - Для каждого поля укажи уверенность: высокая / средняя / не разобрано. - Не подставляй правдоподобные значения вместо нечитаемых. - Ответ верни строго в формате: [опишите структуру]. - Ничего не вычисляй и не суммируй. - Если изображение повёрнуто, обрезано или это не тот тип документа — сообщи первой строкой.
Один и тот же промт для всех кандидатов — обязательное условие. Подстройка формулировки под каждую модель превращает сравнение моделей в сравнение промтов.
Что замерять
- Полнота. Доля полей, извлечённых верно.
- Тихие ошибки. Случаи, когда выдано значение, которого в документе нет, без пометки неуверенности. Это главная метрика для встраивания в процесс.
- Честные отказы. Доля случаев, где модель правильно сказала «не разобрано». Высокая доля здесь — достоинство, а не недостаток.
- Соблюдение формата. Сколько ответов из ста распарсились без ручной правки.
- Задержка. Медиана и худшие 10% — второе важнее для интерфейса.
- Устойчивость к мусору. Перевёрнутые, смазанные, не те документы.
Типичное распределение сил
Не привязываясь к конкретным версиям, устойчиво наблюдается следующее: одни семейства аккуратнее в признании нечитаемого и строже держат заданный формат, другие агрессивнее достраивают недостающее и потому лучше выглядят в демонстрациях и хуже в конвейере. Для интерактивного помощника, где ответ читает человек, второе поведение приемлемо. Для автоматической обработки, где ответ идёт дальше без проверки, оно недопустимо. Это различие важнее, чем разница в процентах точности.
Гибридная схема
Часто оптимально не выбирать одну модель, а построить два уровня: дешёвая и быстрая обрабатывает поток, а всё, что она пометила как неуверенное, уходит на дорогую. При типичном распределении на дорогую попадает 10-20% объёма, а итоговое качество близко к её собственному.
Схема: - уровень 1: дешёвая модель, промт с обязательной оценкой уверенности; - фильтр: всё со средней и низкой уверенностью — дальше; - уровень 2: дорогая модель, тот же промт; - фильтр: всё, что и она пометила как неразобранное, — человеку. Замерьте долю, доходящую до каждого уровня, — от неё зависит вся экономика схемы.
Названия версий и цены здесь не приводятся: они меняются каждые несколько месяцев, а расстановка сил между семействами — после каждого крупного обновления. Прогоняйте свои пятьдесят файлов заново раз в квартал, это полчаса работы и защита от устаревшего выбора.