Блог подборка

Тест и рейтинг нейросетей 2026 — все бенчмарки

Главные индустриальные бенчмарки и рейтинги для тестирования ИИ в 2026 — SWE-bench Verified (программирование), MMLU и MMLU-Pro (общие знания), GPQA Diamond (PhD-уровень), MATH, HumanEval, ARC-AGI, LMSYS Chatbot Arena (голосование пользователей), Artificial Analysis (агрегированный индекс), MERA (русский язык). Дальше — что показывает каждый тест, кто реально лидирует в мировом и российском рейтинге и как самому проверить ИИ.

Как тестируют нейросети — короткий обзор

В 2026 в индустрии используют четыре подхода:

  1. Академические бенчмарки — заранее подготовленные тесты с правильными ответами (MMLU, GPQA, MATH, HumanEval).
  2. Реальные задачи — например, SWE-bench закрывает настоящие GitHub-issue.
  3. Слепое голосование — пользователи сравнивают ответы двух моделей в Chatbot Arena, не зная, какая что написала.
  4. Self-test — берёте свои 5–10 типичных промптов и прогоняете через несколько моделей.

Лучшая проверка — пересечение всех четырёх. Один бенчмарк часто можно «обмануть»: модель в датасете запоминает похожие задачи и на тесте показывает результат, которого не повторит в работе.

Как тестировать нейросеть — методология

Чтобы оценка не превратилась в «нравится / не нравится», тест строят вокруг шести типов задач. Каждый покрывает свою способность ИИ — и слабость в одном не отменяет силу в другом.

Тест 1 — рассуждение и логика

Что проверяем: умеет ли модель пройти цепочку выводов, а не выдать первый правдоподобный ответ. Здесь лидируют reasoning-режимы — Claude Opus с Thinking, GPT-5 high, Gemini Deep Think, DeepSeek R1.

Пример промпта: «Все врачи в больнице — мужчины. Анна — врач этой больницы. Что не так с этим утверждением? Объясни, какие скрытые допущения подвели рассуждение».

Сравниваем: модель должна увидеть противоречие и развернуть логику, а не сгладить углы вежливой формулировкой.

Тест 2 — фактическая точность

Что проверяем: называет ли модель проверяемые факты или «галлюцинирует» правдоподобные, но ложные. Эта способность хуже всего у небольших моделей и почти не растёт от увеличения размера контекста.

Пример промпта: «Назови пять документально подтверждённых случаев применения ИИ в российской медицине за 2024–2025 годы. Для каждого — учреждение, задача, источник информации».

Сравниваем: реальные ли учреждения, есть ли подтверждения, не подменяет ли модель отсутствие фактов общими формулировками.

Тест 3 — код

Что проверяем: пишет ли модель работающий код, понимает ли требования, исправляет ли свои ошибки. Лучший бенчмарк — SWE-bench Verified, но для self-test хватит одной нетривиальной задачи.

Пример промпта: «Напиши на Python функцию, которая принимает список словарей с ключами date (строка ISO) и amount (число), и возвращает словарь: год → сумма за год. Учти невалидные даты и пустой вход. Добавь тесты pytest».

Сравниваем: код запускается без правок, тесты покрывают edge-кейсы, типизация и обработка ошибок на уровне.

Тест 4 — креатив и стиль

Что проверяем: попадает ли модель в заданный стиль, не скатывается ли в шаблоны, не повторяет ли одни и те же приёмы. Тут академических бенчмарков почти нет — оценка субъективная, но самая чувствительная для авторов и редакторов.

Пример промпта: «Напиши 5 коротких заголовков для статьи о выгорании от удалёнки. Без штампов „как пережить“, „топ способов“, „гайд“. Каждый — в разном тоне: ироничный, сухой-аналитический, эмоциональный, провокационный, нейтральный».

Сравниваем: разнообразие интонаций, отсутствие клише, точность стиля.

Тест 5 — длинный контекст

Что проверяем: помнит ли модель детали из начала длинного документа, может ли связать факты на расстоянии 50–500 тысяч токенов. Здесь традиционно сильны Gemini 3 Pro (2M токенов) и Claude Opus 4.7 (1M).

Пример промпта: загрузить PDF на 100+ страниц + «Найди все упоминания компании X. Для каждого — страница, цитата, контекст. В конце — связан ли образ компании в начале документа с тем, что говорится о ней в конце».

Сравниваем: точность по страницам, не выдумывает ли цитаты, видит ли изменения тона по ходу текста.

Тест 6 — русский язык

Что проверяем: грамотность, естественность, понимание идиом и культурного контекста. На русском у западных моделей часто проседает стилистика, а у российских — фактическая широта.

Пример промпта: «Перепиши эту инструкцию для пожилых пользователей. Простыми словами, без англицизмов и канцелярита. Не „произведите авторизацию“, а человечески. Сохрани все шаги, не выкидывай предупреждения».

Сравниваем: попадание в регистр, отсутствие кальки с английского, сохранение смысла.

Результаты тестов 2026 — модель × тип теста

Сводная оценка по шести типам тестов на середину 2026. Уровни: сильно — лидер или близко к лидеру в публичных бенчмарках и арене; уверенно — крепкий результат, заметно ниже верхушки; средне — рабочий уровень, но проигрывает в этой задаче; слабо — заметно отстаёт. Конкретные баллы намеренно не приводим — они меняются каждую неделю; смотрите Artificial Analysis и Chatbot Arena для свежих чисел.

МодельРассуждениеФактыКодКреативДлинный контекстРусский
Claude Opus 4.7сильноуверенносильносильносильноуверенно
GPT-5сильноуверенносильноуверенноуверенноуверенно
Gemini 3 Proуверенноуверенноуверенноуверенносильносредне
DeepSeek R1сильносреднеуверенносреднесреднесредне
Grok 4уверенносреднеуверенноуверенносреднесредне
Qwen 3уверенносреднеуверенносреднеуверенносредне
GigaChat 2 MAXсреднеуверенносреднеуверенносреднесильно
YandexGPT 5среднеуверенносреднеуверенносреднесильно
Llama 4среднесреднеуверенносреднесреднесредне

Таблица — ориентир, а не приговор. Внутри каждой ячейки есть свой разброс: Claude силён в коде через Claude Code, GPT-5 — через Codex; Gemini выигрывает по контексту, но проседает на русской стилистике. Под конкретную работу — обязательно прогоняйте свои промпты.

Мировой рейтинг нейросетей — топ-10 чат-моделей

По агрегированному Artificial Analysis Intelligence Index на середину 2026:

  1. Claude Opus 4.7 (Anthropic) — топ по SWE-bench Pro и MCP-агентам (Anthropic, Opus 4.7).
  2. GPT-5 (OpenAI) — лидер по Terminal-Bench, омнимодальности и работе с ОС (OpenAI, GPT-5).
  3. Gemini 3 Pro (Google DeepMind) — рекорд по контексту 2M токенов и ARC-AGI-2.
  4. Claude Sonnet 4.6 (Anthropic) — главный «рабочий» вариант: 1–2% от Opus при пятикратно меньшей цене.
  5. DeepSeek R1 / V4 — открытая модель, по reasoning близка к GPT-5 (DeepSeek-V3 paper).
  6. Grok 4 (xAI) — конкурент в reasoning (x.ai).
  7. Kimi K2 (Moonshot AI, Китай) — сильна в длинном контексте (kimi.com).
  8. Qwen 3 (Alibaba) — открытая модель (chat.qwen.ai).
  9. GLM-5 (Zhipu, Китай) — сильна в UI и фронтенд-задачах (z.ai).
  10. Llama 4 (Meta) — открытая модель (llama.com).

Конкретное место сдвигается каждые несколько недель — лидеры выпускают обновления почти параллельно.

LMSYS Chatbot Arena — голосование как рейтинг

LMSYS Chatbot Arena — pragmatic-индикатор «как модель работает в реальности». Пользователь задаёт вопрос, видит два ответа анонимно, выбирает лучший; на миллионах парных голосов считается Elo-рейтинг. Модель не знает вопроса заранее — нельзя «обучить под бенчмарк». Рейтинг разбит по категориям: creative writing, coding, math, hard prompts, long queries.

На середину 2026 в топ-3 регулярно входят Claude Opus 4.7, GPT-5 и Gemini 3 Pro Deep Think — порядок меняется почти каждую неделю.

Artificial Analysis — агрегированный индекс

Artificial Analysis собирает результаты всех публичных бенчмарков (MMLU-Pro, GPQA, MATH, SWE-bench Pro, LiveCodeBench, Terminal-Bench) в единый Intelligence Index, плюс измеряет скорость (токенов/сек) и цену ($ за миллион токенов). Полезно когда нужно одной цифрой сравнить десяток моделей и увидеть price-performance. Слабая сторона — индекс наследует слабости отдельных бенчмарков; смотрите вместе с Arena.

Публичные бенчмарки нейросетей — что измеряет каждый

Прежде чем разбирать каждый по отдельности — единая таблица: что тест проверяет и где смотреть результаты.

БенчмаркЧто измеряет
SWE-bench Verified / ProЗакрытие реальных GitHub-багов; Pro — 4 языка, длинные репозитории
Terminal-Bench 2.0Работа в shell, агентные сессии
MMLU-ProОбщие знания, 14 предметных областей
GPQA DiamondВопросы PhD-уровня по науке
MATH / AIME 2025Олимпиадная математика
FrontierMathСкрытые задачи для математиков, резерв на годы
HumanEval+ / LiveCodeBenchКод по docstring; свежие задачи Codeforces
ARC-AGI-2Узнавание новых абстрактных паттернов
HLEHumanity’s Last Exam — экспертные вопросы
OSWorld / MCP-AtlasАгентность: ОС и инструменты
Chatbot ArenaСлепое голосование пользователей
Artificial AnalysisАгрегированный Intelligence Index
MERAРусскоязычные задачи
MMMUКартинка + текст одновременно

Дальше — что показывает каждый и кто лидирует.

Главные бенчмарки нейросетей 2026

SWE-bench Verified — программирование

SWE-bench — реальные баги из open-source проектов на GitHub. Модель получает описание проблемы и должна предложить исправление, которое проходит существующие тесты.

Лидеры на середину 2026 на SWE-bench Verified: Claude Opus 4.7 ~88%, GPT-5 ~83%, Gemini 3 Pro ~81%. Verified подходит к потолку — для тонкого сравнения смотрите SWE-bench Pro (раздел ниже).

MMLU-Pro, GPQA, MATH, HumanEval — классика

Короткий обзор «старых» бенчмарков на середину 2026:

  • MMLU-Pro — 12 тысяч вопросов из 14 областей. Лидеры: GPT-5 high, Claude Opus 4.7, Gemini 3 Pro Deep Think. Различия в верхушке минимальные.
  • GPQA Diamond — PhD-уровень по биологии, физике, химии. В 2024 — 60%, в 2026 — 93–94%.
  • MATH / AIME — олимпиадная математика. Лидируют reasoning-режимы: GPT-5 high, Gemini 3 Pro Deep Think, DeepSeek R1, Claude Opus 4.7 Thinking.
  • HumanEval+ — функция по docstring. Лучшие берут 95–98% — бенчмарк выбил потолок.

Все четыре теста полезны как ориентир, но не различают лидеров. Для тонкого сравнения смотрите Pro-версии и свежие бенчмарки ниже.

SWE-bench Pro — следующая ступень для кода

К весне 2026 классический SWE-bench Verified насытился: верхушка моделей берёт 85–93%, и тест перестал различать лидеров. Индустрия переехала на SWE-bench Pro — баги в четырёх языках (Python, Java, Go, TypeScript), более длинные репозитории, более тонкая декомпозиция.

Ориентир по середине 2026: Claude Opus 4.7 — около 64% на SWE-bench Pro; GPT-5 — около 58%; Gemini 3 Pro — около 55%. Разрыв снова стал заметным, что и было задачей нового бенчмарка.

Terminal-Bench 2.0 — работа в терминале

Terminal-Bench 2.0 проверяет, может ли модель управлять реальной shell-сессией: ставить пакеты, разбирать stderr, обходить интерактивные prompts, чинить broken pipes. Это близко к работе ИИ-агента на сервере.

Лидер на середину 2026 — GPT-5 (около 82%), за ним Claude Opus 4.7 (около 69%) и Gemini 3 Pro. Бенчмарк показателен для тех, кто использует ИИ через CLI-агентов (Claude Code, OpenAI Codex, Aider).

ARC-AGI-2 — узнавание новых паттернов

Первая версия ARC-AGI была формально «решена» в режиме высоких вычислений (o3 показала 76–88% в 2024). Поэтому ARC Prize выпустил ARC-AGI-2 с задачами, где требуется узнавание новых абстрактных паттернов «с нуля».

На ARC-AGI-2 лидеры середины 2026 берут 70–77%. Это самый жёсткий публичный тест на «обобщение», а не «запоминание».

Humanity’s Last Exam — пограничные знания

Humanity’s Last Exam (HLE) — около 3 000 вопросов экспертного уровня из десятков дисциплин. В 2024 году лучшие модели брали 8–10%. К середине 2026 топовые reasoning-модели вышли на 30–40% — но потолок далеко.

HLE полезен как тест против контаминации: вопросы свежие, специально подобраны так, чтобы их не было в обучающих корпусах.

OSWorld и MCP-Atlas — агентность

OSWorld измеряет умение модели работать в реальной операционной системе: открывать файлы, переключаться между приложениями, заполнять формы. MCP-Atlas — оркестрация через Model Context Protocol: модель должна построить план, вызвать нужные инструменты в правильном порядке, сверить результат.

На обоих лидеры 2026 — Claude Opus 4.7 и GPT-5; разрыв до Gemini 3 Pro небольшой. Эти бенчмарки заменяют собой старый Tau-bench для оценки агентных задач.

FrontierMath — олимпиадная математика следующего уровня

FrontierMath — около 300 задач, составленных профессиональными математиками; ответы скрыты, протекание в обучающие корпуса исключено. Tier 4 — самый сложный сабсет.

Доли решённых задач на Tier 4 для топовых моделей середины 2026 — около 30–35%. Это резервный бенчмарк на годы вперёд: насытить его так же быстро, как AIME, не получится.

MERA — русскоязычный бенчмарк

mera.a-ai.ru — российский аналог MMLU, разработанный SberDevices и AGI NLP Lab. Около 23 задач на русском: вопросы, текст, рассуждения.

Лидеры:

  1. GigaChat 2 MAX
  2. YandexGPT 5
  3. Claude Opus 4.7 (с русским)
  4. GPT-5 (с русским)

В русскоязычных задачах разрыв между российскими и западными моделями небольшой, но российские дешевле и доступнее напрямую.

Свежие результаты бенчмарков 2026 — Claude Opus 4.7, GPT-5, Gemini 3 Pro

Цифры — ориентир по данным Artificial Analysis, отчётам поставщиков и независимым прогонам на середину 2026. Точные значения сдвигаются каждую неделю; перед использованием сверьтесь со свежим леaderbord.

БенчмаркClaude Opus 4.7GPT-5Gemini 3 Pro
SWE-bench Verified~88%~83%~81%
SWE-bench Pro~64%~58%~55%
Terminal-Bench 2.0~69%~83%~64%
GPQA Diamond~94%~93%~94%
MATH / AIME 2025~96%~98%~95%
HumanEval+~96%~97%~95%
ARC-AGI-2~62%~58%~77%
OSWorld-Verified~78%~79%~70%
MCP-Atlas~77%~70%~65%
HLE~35%~38%~36%
Контекст1M токенов1M токенов2M токенов

Что видно из таблицы:

  • Claude Opus 4.7 — самый ровный лидер в коде и MCP-агентах; выигрывает на SWE-bench Pro и MCP-Atlas, проигрывает Gemini 3 Pro по ARC-AGI-2.
  • GPT-5 — лучший на терминальных и компьютерных задачах, тонкая работа с математикой, сильный омнимодальный режим.
  • Gemini 3 Pro — отрыв в ARC-AGI-2 (узнавание новых паттернов) и в длинном контексте за счёт 2M токенов на входе.

Лучшая модель определяется не цифрой в одной строке, а пересечением столбцов под вашу задачу. Кодеру важнее SWE-bench Pro и Terminal-Bench, исследователю — GPQA и HLE, продакт-менеджеру — MCP-Atlas и OSWorld.

Что не работает в публичных бенчмарках

Главные ограничения, которые стоит держать в голове прежде чем доверять цифрам:

Насыщение. HumanEval, классический SWE-bench Verified, GSM8K и базовый MMLU достигли потолка — лидеры берут 95–98% и почти не различаются. Все цифры там тесно слиплись, и крошечная разница в баллах не означает реальной разницы в работе.

Контаминация данных. Если бенчмарк давно опубликован, его задачи или похожие на них могли попасть в обучающий корпус. Модель показывает идеальный результат на тесте — и проваливается на свежей задаче того же типа. Поэтому LiveCodeBench, SWE-bench Pro и HLE добавляют свежие задачи раз в несколько месяцев.

Оптимизация под бенчмарк. Лаборатории знают, на что смотрит рынок, и тонко настраивают модель под именно эти тесты — лучший формат ответа, нужная длина рассуждения, предпочтения проверяющего. На реальной работе тонкая настройка не помогает.

Reasoning-режимы как другая модель. «Claude Opus 4.7 Thinking», «GPT-5 high», «Gemini 3 Pro Deep Think» — это не та же модель, что без режима reasoning. Цена и время ответа выше в разы. Сравнивать «обычный режим vs reasoning» нечестно, но в таблицах это часто смешано.

Узкая выборка. В бенчмарке 500–3 000 задач, а в реальной работе — сотни сценариев. Усреднённый результат скрывает катастрофическую слабость в каком-то одном жанре (например, RU-стилистика, или эмодзи в коде, или экзотический фреймворк).

Голосование тоже искажается. Chatbot Arena — лучший pragmatic-индикатор, но пользователи там в среднем технари с конкретными вкусами; стилистические предпочтения, длина ответа, форматирование могут перевешивать содержание.

Что с этим делать: не привязываться к одному источнику. Смотрите сразу SWE-bench Pro + Chatbot Arena + свой self-test на 5–10 задачах. Если на всех трёх модель в топе — это надёжный сигнал.

Рейтинг российских нейросетей

По публичным замерам MERA:

  1. GigaChat 2 MAX (Сбер) — лидер в большинстве русскоязычных задач.
  2. YandexGPT 5 (Яндекс) — близко к GigaChat в чатовых задачах.
  3. T-lite / T-pro (T-Банк) — для разработчиков.
  4. Saiga — open-source модели, дообученные сообществом на русском.

Иностранные модели тоже понимают русский: Claude, ChatGPT, Gemini в большинстве задач не уступают российским — но требуют VPN и зарубежную карту.

Рейтинг нейросетей по доступности из РФ

Полный доступ (без VPN, рублёвая оплата):

  • GigaChat (Сбер)
  • YandexGPT (Яндекс)
  • Kandinsky, Шедеврум
  • DeepSeek (через email-регистрацию)
  • Qwen (Alibaba)
  • Kling, Hailuo (Китай)

Доступ через VPN + зарубежная карта:

  • ChatGPT (включая GPT Image 2)
  • Claude
  • Gemini (включая Nano Banana 2)
  • Midjourney
  • Seedance
  • Veo
  • Cursor, Claude Code

Полностью локально (открытые модели):

  • Llama 4, Mistral, Qwen, DeepSeek через Ollama или LM Studio
  • Flux Dev, Stable Diffusion через ComfyUI

Тест нейросетей на 10 практических задачах

Готовый чек-лист: возьмите эти 10 промптов, прогоните через 2–3 модели, сравните анонимно.

#ТипПромптЧто смотреть
1Длинный текстЭссе 800 слов «как ИИ меняет рынок труда в России» — конкретные профессии, цифры, без водыСвязность, отсутствие повторов
2Анализ PDFДокумент 50+ страниц + «три вывода, на которые автор не делает явный упор»Реальный анализ, не пересказ
3Баг в кодеФункция неверно работает на пустом списке — найди баг, исправь, добавь тестКорень проблемы, не симптом
4РефакторингКласс на 200 строк — разбей на три по single responsibility, сохрани публичный APIПродуманная архитектура
5Подвох«У Алисы 4 яблока, съела 2. Сколько осталось? Подумай дважды»Сразу 2, без «глубоких рассуждений»
6ЛогикаСиллогизм с P, Q, R — какое утверждение точно неверноЧёткое рассуждение
7Креатив5 свежих метафор для «интернет-зависимость», без штамповОригинальность
8ОбъяснениеКвантовая запутанность простыми словами для подростка 14 летТочность + понятность
9СтруктураДетальный план статьи 10 000 знаков «как выбрать нейросеть для бизнеса»Логичность, без повторов
10СтильПерепиши свой текст в стиле Хемингуэя — короткие фразы, минимум прилагательныхПопадание в регистр

Тесты на картинках и видео — в отдельных гайдах: тест нейросетей картинок и нейросети для видео.

Где смотреть свежие результаты тестов

Сводные источники:

Технические релизы:

Как протестировать нейросеть самому за 30 минут

Если нет времени на полноценный self-test — есть короткий маршрут. Получится не глубоко, но достаточно, чтобы выбрать между двумя-тремя моделями.

Минута 1–3. Откройте арену. Зайдите на Chatbot Arena — там можно отправить один промпт и получить ответы двух случайных моделей сразу. После выбора лучшей увидите, какие это были модели.

Минута 3–8. Подготовьте шесть промптов. По одному на каждый тип: рассуждение, факты, код, креатив, длинный контекст, русский. Можно взять примеры из методологии выше — заменив тематику на свою.

Минута 8–20. Прогоните через 2–3 модели. Минимум: одна западная (Claude или ChatGPT), одна российская (GigaChat или YandexGPT), одна открытая (DeepSeek или Qwen). Сохраните ответы в отдельный документ — без указания, чей какой.

Минута 20–27. Слепое сравнение. Перемешайте порядок, расставьте 1-2-3 по каждому промпту. Не подсматривайте, пока не закончите все шесть.

Минута 27–30. Сводка. Подсчитайте: какая модель чаще на первом месте. Откройте подписи — посмотрите, какая модель выиграла в каких типах задач. Это и есть ваш персональный рейтинг.

Что важно: за 30 минут вы не отделите «модель уровня Opus» от «модели уровня Sonnet» — для этого нужен длинный прогон. Но грубо понять, какая модель попадает в ваш регистр и стиль работы, — уже можно.

FAQ

Какой тест нейросетей самый честный в 2026? LMSYS Chatbot Arena — слепое голосование пользователей. У него меньше всего шансов «обучить под бенчмарк».

Что такое бенчмарки нейросетей? Тесты с заранее подготовленными задачами и правильными ответами. Используют MMLU, GPQA, MATH, SWE-bench, HumanEval — каждый измеряет разную способность.

Как самому проверить нейросеть? Возьмите 5–10 типичных задач, прогоните через 2–4 модели, сравните анонимно. Подробная методика и короткий 30-минутный маршрут — в разделах выше.

Какая нейросеть лучшая по тестам? По SWE-bench (код) — Claude Opus 4.7. По MMLU-Pro — близко идут GPT-5 и Claude. По русскому (MERA) — GigaChat 2 MAX. Универсального лидера нет: разные тесты — разные победители.

Можно ли доверять рейтингам нейросетей? Частично. Бенчмарки можно «переоптимизировать». Самая надёжная проверка — пересечение нескольких рейтингов + ваш собственный тест на 5–10 типичных задачах.

Где найти результаты тестов нейросетей? lmarena.ai, artificialanalysis.ai, mera.a-ai.ru для русского.

Какие промпты использовать для теста? Шесть типов: рассуждение, фактическая точность, код, креатив, длинный контекст, русский. Подробные примеры — в разделе «Как тестировать нейросеть — методология».

Чем отличаются бенчмарк и арена? Бенчмарк — фиксированный набор задач с известными ответами. Арена — живые промпты и слепое голосование. Бенчмарк проверяет «знает ли модель ответ», арена — «помогает ли модель в реальности».

Можно ли протестировать нейросети бесплатно? Да. Chatbot Arena бесплатна, доступна без регистрации, прогоняет ваш промпт через две случайные модели. DeepSeek, Qwen, GigaChat и YandexGPT тоже бесплатны на лимитах.

Почему модель «прошла» один тест, но провалила другой? Разные способности измеряются по-разному. Reasoning-модель часто проседает на быстрых вопросах — она «передумывает» очевидное. Универсальная модель ровна, но не лидирует. Поэтому в таблице «модель × тип теста» нет одной победительницы.

Что такое SWE-bench Pro и зачем он, если есть Verified? Verified насытился: лидеры берут 85–93% и почти не различаются. Pro — расширение на четыре языка (Python, Java, Go, TypeScript), более длинные репозитории, тонкая декомпозиция бага. На Pro разрыв между моделями снова виден: Claude Opus 4.7 — около 64%, GPT-5 — около 58%.

Можно ли сравнивать reasoning-режим и обычный? Не напрямую. «Opus Thinking», «GPT-5 high», «Gemini 3 Pro Deep Think» — это другая стоимость и время ответа. Сравнивать честно — либо «обычный vs обычный», либо «reasoning vs reasoning». В таблицах бенчмарков это часто смешано — обращайте внимание на пометку режима.

Дальше