В понедельник продуктовая команда открывает таблицу с пятью названиями: GPT-5.6 Sol, Claude Opus 5, Gemini 3.7 Flash, Grok 4.20 и DeepSeek-V4-Pro. Рядом — пять срочных задач. Нужно исправить ошибку в коде, разобрать договор, ответить сотне клиентов, сверить макет с готовой страницей и собрать отчёт из нескольких сервисов.
Вопрос звучит привычно: «Какая ИИ-модель сейчас лучшая?» Именно с него обычно начинается дорогая ошибка. Модель, которая аккуратнее всех переписывает сложный модуль, может оказаться расточительной на классификации обращений. Самая дешёвая может потребовать столько повторных проверок, что экономия исчезнет. А миллион токенов контекста мало что значит, если система теряет главную инструкцию на середине документа.
Мы поставили пять новейших ИИ-моделей на один редакционный стенд: сравнили актуальные спецификации на 21 августа 2026 года, цены API и рабочие роли. Не будем объявлять чемпиона по чужой диаграмме. Разберём более полезный вопрос: кому доверить каждую из пяти задач и как проверить выбор до того, как он попадёт в продукт.
Рынок больше не делится на «умную» и «дешёвую» модель
Ещё недавно выбор напоминал регулятор мощности: большая модель для сложного, маленькая для массового. В 2026 году эта шкала рассыпалась. Производители меняют уже не размер, а само устройство продукта: уровень рассуждения, работу с инструментами, кэширование, компьютерное управление, мультимодальность и правила обработки длинного контекста.
Поэтому сравнивать названия поколений напрямую бессмысленно. Flash у Google — не аналог Haiku у Anthropic только потому, что оба обещают скорость. Sol у OpenAI и Opus у Anthropic стоят близко на входе, но по-разному тарифицируют выход и длинные запросы. DeepSeek берёт заметно меньше за токен, однако цена токена ничего не говорит о числе попыток до приемлемого ответа.
Есть и ещё одна ловушка: вендорские бенчмарки отвечают на вопросы, которые сформулировал сам вендор. Условия тестов, набор инструментов и вычислительный бюджет различаются. Свести проценты из пяти пресс-релизов в одну турнирную таблицу — всё равно что сравнить расход автомобиля на полигоне, гоночном круге и зимней трассе.
Ниже мы используем только сопоставимые паспортные данные. Заявления о качестве соотносим с задачами, под которые производитель продвигает модель.
Пять моделей на одном стенде: возможности и тарифы
| Модель |
Контекст |
Максимальный ответ |
API: вход / выход за 1 млн токенов |
Разумная стартовая роль |
| GPT-5.6 Sol |
1,05 млн |
128 тыс. |
$5 / $30 |
Сложная универсальная и агентная работа |
| Claude Opus 5 |
1 млн |
128 тыс. |
$5 / $25 |
Длинные задачи, код, документы, агенты |
| Gemini 3.7 Flash |
1 млн |
64 тыс. |
$0,75 / $3,75 до конца 2026 года |
Быстрый мультимодальный рабочий поток |
| Grok 4.20 |
1 млн |
— |
$1,25 / $2,50 |
Быстрые агенты и вызов инструментов |
| DeepSeek-V4-Pro |
1 млн |
384 тыс. |
$0,435 / $0,87 при промахе кэша |
Экономичный код и массовая обработка |
Цифры взяты из актуальных страниц разработчиков: OpenAI для GPT-5.6 Sol, Anthropic для Claude Opus 5, Google для Gemini 3.7 Flash, xAI для Grok 4.20 и DeepSeek для V4. Тире у Grok означает не слабое место модели, а отсутствие лимита ответа в открытой карточке. Додумывать число ради красивой таблицы мы не стали.
Эта таблица — начало разговора, не вердикт. В ней нет стоимости веб-поиска, хранения кэша, повторных вызовов и инженерной обвязки. Но она уже показывает, почему закупать одну «самую сильную» модель для всех процессов — плохая финансовая привычка.
GPT-5.6 Sol и Claude Opus 5: два дорогих универсала с разным характером
GPT-5.6 Sol OpenAI называет флагманом для сложной профессиональной работы. У модели контекст 1,05 млн токенов, изображение на входе, управляемый уровень рассуждения и широкий набор инструментов в Responses API — от поиска по файлам до computer use и hosted shell. Это сильный кандидат, когда задача меняется по ходу работы: сначала прочитать требования, затем исследовать код, вызвать инструменты и собрать результат в нужном формате.
Но длинный контекст здесь имеет ценовую оговорку. Запросы свыше 272 тысяч входных токенов тарифицируются по повышенному коэффициенту: вход удваивается, выход дорожает в полтора раза. Загружать весь репозиторий «на всякий случай» — не преимущество, а дорогой способ отказаться от отбора информации.
Claude Opus 5 Anthropic позиционирует для сложного агентного программирования, многочасовой автономной работы, больших рефакторингов и документов. Его окно — 1 млн токенов, максимальный ответ — 128 тысяч. Вход стоит столько же, сколько у GPT-5.6 Sol, выход немного дешевле: $25 против $30 за миллион токенов.
У Anthropic есть и более дорогой Claude Fable 5: сама компания называет его наиболее способной широко доступной моделью и просит $10 за вход и $50 за выход. Мы не ставим его в базовую пятёрку намеренно. Для большинства команд Opus 5 — содержательнее как отправная точка: он рассчитан на сложный код и корпоративную работу, но стоит вдвое дешевле Fable. Высший потолок возможностей ещё не делает модель разумным значением по умолчанию.
На бумаге разрыв невелик. На практике выбирать надо по тому, как модель ведёт себя на вашем коде и ваших документах. Если команда уже сидит в Клод Коде, учитывайте не столько тариф API, сколько дисциплину контекста: мы отдельно разбирали, почему Claude Code повторно читает историю и как снизить расход токенов. Миграция ради свежего номера модели не окупится, если процесс продолжает отправлять лишние файлы и километровые логи.
Для нашей понедельничной доски оба кандидата подходят к исправлению сложной ошибки и разбору большого договора. Победителя определит не логотип, а контрольный набор из ваших репозиториев, форматов документов и правил приёмки.
Gemini, Grok и DeepSeek меняют экономику повседневной работы
Gemini 3.7 Flash попал в сравнение именно потому, что слово Flash больше не означает «только для простых ответов». Google описывает модель как инструмент для сложного кода, агентных цепочек и мультимодального анализа. Она принимает текст, изображения, видео, аудио и PDF, поддерживает поиск, выполнение кода, function calling и computer use в статусе preview.
До 31 декабря 2026 года действует стартовая цена: $0,75 за миллион входных и $3,75 за миллион выходных токенов. Для разбора скриншотов, документов и большого потока задач это делает Gemini первым кандидатом на пилот — не автоматическим победителем, а моделью, которую слишком дёшево проверить, чтобы игнорировать.
Grok 4.20 стоит $1,25 за вход и $2,50 за выход, поддерживает миллионный контекст, изображения, function calling, структурированный вывод и регулируемое рассуждение. xAI делает акцент на скорости и агентном использовании. Значит, Grok логично испытывать там, где модель часто вызывает инструменты и где задержка видна пользователю. Но обещание «минимальных галлюцинаций» на странице производителя — повод открыть тестовый набор, а не закрыть дискуссию.
DeepSeek-V4-Pro сбивает цену радикальнее остальных: $0,435 за миллион входных токенов при промахе кэша и $0,87 за выход. У модели миллионный контекст, до 384 тысяч токенов ответа, thinking и non-thinking режимы, tool calls, а API совместим с форматами OpenAI и Anthropic. Для массовой классификации, черновой обработки документов и кодовых подзадач эту модель стоит включить в тест хотя бы из-за тарифа.
Именно здесь особенно легко перепутать тариф с совокупной стоимостью. Если дешёвый вызов надо перепроверять дорогой моделью или человеком, платить придётся за всю цепочку. Так устроены и обычные процессы автоматизации: в нашем сравнении n8n и Make выбор тоже зависит не от цены одного шага, а от стоимости поддержки всего маршрута.
Сколько стоит одинаковый объём работы
Возьмём условную задачу: 100 тысяч входных и 20 тысяч выходных токенов. Кэш, поиск и другие платные инструменты пока исключим. Это не счёт за проект, а чистая проверка масштаба тарифов.
| Модель |
Стоимость такого объёма |
| GPT-5.6 Sol |
$1,10 |
| Claude Opus 5 |
$1,00 |
| Gemini 3.7 Flash |
$0,15 |
| Grok 4.20 |
$0,175 |
| DeepSeek-V4-Pro |
$0,061 |
Разница между крайними строками — примерно в 18 раз. Однако вывод «DeepSeek в 18 раз выгоднее» был бы недобросовестным. У моделей разные токенизаторы, объём внутреннего рассуждения, качество первой попытки и правила оплаты инструментов. Один удачный запрос за доллар дешевле пяти неудачных по шесть центов.
Поэтому в нормальном бюджете появляются ещё три колонки:
- доля задач, принятых без ручной переделки;
- среднее число повторных вызовов;
- минуты специалиста на проверку результата.
Последняя строка часто дороже API. Если юрист тратит двадцать минут на восстановление пропущенного пункта договора, экономия в 94 цента выглядит мелкой бухгалтерской шуткой.
Как мы бы провели честный тест моделей за три дня
Покупать месячные подписки и просить каждую модель «рассказать о себе» не нужно. Соберите 30–50 обезличенных задач из реальной очереди. Для нашей условной команды это десять ошибок из трекера, десять документов, десять обращений клиентов и несколько мультимодальных кейсов со скриншотами.
Затем зафиксируйте одинаковые условия:
- Один системный промпт, одинаковые инструменты и исходные данные.
- Конкретный критерий готовности: прошедший тест, найденный пункт, валидный JSON, совпадение с эталоном.
- Лимит попыток и времени, иначе сильная модель выиграет просто большим вычислительным бюджетом.
- Слепая проверка результата без названия модели.
- Учёт полной цены, включая повторные вызовы и работу проверяющего.
Для кода критерием служат тесты и статический анализ, для извлечения данных — точность по эталонной выборке, для поддержки — доля ответов, которые сотрудник отправил без правок. В агентном сценарии отдельно считайте лишние вызовы инструментов и тупиковые циклы. Они съедают деньги и время, даже если финальный ответ выглядит убедительно.
Такой тест продолжает подход, о котором мы писали в материале про AI-агентов и управляемую автоматизацию: модель — лишь двигатель. Маршрут, ограничения, проверка и журнал действий определяют, доедет ли система до результата.
Если собственного стенда нет, мы в Feature IT проектируем AI-автоматизацию с контрольной выборкой и измеримыми критериями. Сначала доказываем полезность на ограниченном процессе, затем расширяем трафик — не наоборот.
Экспертное мнение: одной модели в компании недостаточно
Позиция редакции Feature IT: выбирать единственную ИИ-модель на год вперёд — значит покупать организационное удобство ценой качества и денег. Рациональная система использует минимум два класса моделей: сильную для дорогих решений и рабочую для массовых операций. Третья остаётся резервом на случай сбоя, изменения цены или деградации качества.
Это не призыв строить зоопарк из десяти API. Пять интеграций без общих логов и тестов создадут больше проблем, чем решат. Нужен тонкий маршрутизатор: тип задачи, уровень риска, лимит бюджета, основной исполнитель и заранее проверенный fallback.
Например, обращения клиентов можно сначала классифицировать на Gemini, Grok или DeepSeek. Сложные случаи отправлять GPT-5.6 Sol либо Claude Opus 5. Критическое действие — платёж, удаление данных, юридически значимый ответ — всё равно останавливать перед человеком. Состояние цепочки следует наблюдать так же внимательно, как обычный сервис; принципы мониторинга и алертинга веб-приложений здесь работают без скидки на модное слово AI.
Кого выбрать для пяти задач с понедельничной доски
Теперь можно вернуться к команде, с которой мы начали.
Сложная ошибка в большом репозитории. Первую пару для теста составят GPT-5.6 Sol и Claude Opus 5. Оценивать стоит не красоту объяснения, а точность патча, число прочитанных файлов, прошедшие тесты и отсутствие побочных изменений.
Длинный договор. Claude Opus 5 получает сильную стартовую позицию благодаря специализации на длинной профессиональной работе. Но если документов тысячи, Gemini 3.7 Flash и DeepSeek-V4-Pro надо включить в ценовой тест на извлечение полей. Финальное юридическое решение модели не делегируют.
Сотня клиентских обращений. Здесь флагман обычно избыточен. Gemini, Grok и DeepSeek соревнуются по задержке, точности маршрутизации и цене принятого ответа. Сложные обращения уходят на более сильную модель или сотруднику.
Сверка макета со страницей. GPT-5.6 Sol и Gemini 3.7 Flash логично проверить первыми: обе модели работают с изображениями и инструментами, а OpenAI отдельно отмечает улучшения GPT-5.6 во фронтенд-дизайне. Победит та, которая найдёт больше реальных расхождений и предложит меньше декоративной самодеятельности.
Отчёт из нескольких сервисов. Grok 4.20, Gemini 3.7 Flash и GPT-5.6 Sol подходят для агентного испытания. Здесь главный показатель — не текст отчёта, а надёжность вызовов инструментов: модель должна получить данные, заметить сбой источника и не выдать догадку за число.
Так у команды появляется не рейтинг, а карта маршрутизации. Самая сильная модель перестаёт выполнять работу сортировщика, а самая дешёвая не принимает решения, где цена ошибки выше стоимости тысячи запросов.
Лучшей модели нет — есть проверенный маршрут
На 21 августа 2026 года рынок выглядит необычно плотным. GPT-5.6 Sol и Claude Opus 5 претендуют на сложную профессиональную работу. Gemini 3.7 Flash предлагает агрессивное сочетание мультимодальности и цены. Grok 4.20 делает ставку на скорость и инструменты. DeepSeek-V4-Pro опускает стоимость массовой обработки до уровня, который недавно казался нереальным.
Из сравнения следуют четыре рабочих правила:
- замораживайте дату сравнения: названия, цены и доступность меняются быстро;
- проверяйте модели на собственных задачах, а не на диаграммах производителей;
- считайте принятый результат, повторные попытки и человеческую проверку;
- держите сильную модель для дорогих решений, рабочую — для потока, резервную — для устойчивости.
Если вы выбираете модель для чат-бота, внутренней базы знаний или автономного процесса, обсудим архитектуру и проведём пилот. Один трёхдневный тест на ваших данных полезнее, чем месяц чтения рейтингов.
Читайте также