Блог обзор

Qwen — линейка языковых моделей от Alibaba Cloud. В 2025 — «китайский ChatGPT для разработчиков», в 2026 — полноценный конкурент GPT-5.5, Claude Opus 4.8 и DeepSeek V4. Главная особенность: часть моделей раздаётся под Apache 2.0, их можно скачать и запустить у себя. Закрытый флагман Qwen 3.7 Max работает только через API.

Разбираем линейку 2026 года, цены, доступ из России и чем Qwen отличается от DeepSeek, Llama, Mistral.

Что такое Qwen и кто за ним стоит

Qwen («千问», qiānwèn — «тысяча вопросов») — проект Alibaba Cloud и Alibaba DAMO Academy. Первые модели вышли в августе 2023, к 2026-му — десяток вариантов от 0.6B на телефон до 235B-A22B на серверный кластер. Двойная стратегия: открытые Qwen 3 — вклад в экосистему и давление на западных вендоров, закрытые Qwen 3.7 Max и Plus — коммерческий API. В 2026-м линейка обновлялась 4 раза (3.4, 3.5, 3.6, 3.7) — каждые 2–3 месяца.

Команда около 600 исследователей, центр в Ханчжоу. Коммерческий слой — DashScope (Model Studio), публичные веса — на Hugging Face, ModelScope и в репо QwenLM. К июню 2026 модели Qwen занимают пять из десяти позиций топа OpenRouter по объёму запросов — больше, чем у любого вендора, включая OpenAI и Anthropic.

Хронология: Qwen-7B (август 2023, 8K контекст) → Qwen 1.5 (январь 2024, 32K, многоязычие) → Qwen 2.5 (сентябрь 2024, отдельные Coder и VL) → Qwen 3 (апрель 2025, 119 языков, hybrid thinking) → серии 3.4–3.6 (январь–март 2026) → Qwen 3.7 Max и Plus (май 2026, 1M токенов). Параллельно — Qwen3-ASR, Qwen3-Image, Qwen3-Omni. Темп обновлений выше, чем у любого open-source-вендора: Llama — раз в 6–9 месяцев, Mistral — раз в 4–6, Alibaba — раз в 2–3.

Архитектура: MoE и гибридный thinking

Две инженерные особенности отличают Qwen 3 от предыдущих поколений.

Mixture of Experts (MoE). Часть моделей построена по принципу «смеси экспертов»: общее число параметров большое (например, 235B или 397B), но при каждом проходе активируется только подмножество (22B, 17B, 10B). За счёт этого качество соответствует крупной dense-модели, а стоимость генерации — средней. Конкретно: Qwen3-235B-A22B имеет 235 миллиардов параметров суммарно и 22 миллиарда активных, Qwen3.5-Plus — 397/17, Qwen3.5-122B-A10B — 122/10.

Гибридный thinking-режим. Внутри одной модели сосуществуют два режима: быстрый ответ (non-thinking) и развёрнутая цепочка рассуждений (thinking). Переключение происходит параметром запроса или специальным токеном — пользователь решает, нужна ли расширенная цепочка для конкретной задачи. Это снимает классическую проблему «или быстрая модель, или думающая» — в Qwen 3 одна модель работает в обоих режимах. Аналогичный подход появился у Claude 4 и GPT-5, но в открытых весах Qwen реализовал это раньше других.

Третья особенность — длинный контекст. Qwen 3.7 Max обрабатывает до 1 миллиона токенов в одном окне (примерно 750 тысяч слов или средний роман плюс полный код проекта). Конкурент с похожим контекстом — Gemini 2.5 Pro, но у Gemini это закрытая модель, а Qwen 3.7 Max доступен в РФ без VPN.

Данные обучения. Qwen 3 обучен на корпусе около 36 триллионов токенов — вдвое больше, чем у Qwen 2.5: веб, книги, код, научные статьи, синтетика. 119 локалей с акцентом на китайский, английский, русский. По русскому объём корпуса несравнимо больше, чем у Llama 4 и Mistral — отсюда более устойчивая грамматика.

Tokenizer. Собственный BPE-словарь на 152 064 токена. На русском одно слово занимает 2-3 токена против 1.5-2 на английском — русские промпты по биллингу выходят примерно в полтора раза дороже англоязычных. У Qwen разница меньше, чем у Llama.

Линейка моделей Qwen в 2026 году

Qwen 3.7 Max — флагман для агентов

Релиз: 19–20 мая 2026 на Alibaba Cloud Summit. Закрытая, доступна только через API. Контекст 1M токенов (с 256K у 3.6 Max), максимальный выход 65 536 токенов, автономная работа свыше 35 часов с удержанием 1000+ вызовов инструментов, поддержка OpenAI и Anthropic API spec (Claude Code, Cursor, OpenClaw без правок клиента), thinking-режим с раздельным биллингом.

Alibaba позиционирует 3.7 Max как «The Agent Frontier» — для долгих автономных цепочек: code-агенты, deep research, многошаговый анализ документов.

Цена: $2.50 input / $7.50 output за миллион токенов. При кэшированном входе — $0.25/млн (90% скидка). На Yotta — $1.25 / $3.75.

Qwen 3.7 Plus — мультимодальный середняк

Plus умеет работать с изображениями на входе (Max — только текст): читает и описывает картинки, графики, скриншоты, схемы. По vision-бенчмаркам — около 16-го места в мире. Используется, когда нужна и текстовая логика, и работа с визуалом: разбор PDF со скринами, описание дашбордов, анализ интерфейсов. Цена: $0.40 / $1.20 за миллион токенов — в 6 раз дешевле Max.

Qwen Coder — отдельная линейка под код

Coder выходит как отдельный релиз, не «функция» Max. В 2026-м основной вариант — 480B MoE: смесь экспертов на 480 миллиардов с активацией только нужных. Заточен под FIM (fill-in-the-middle), агентское программирование, длинные репозитории. SWE-Bench Verified — 80.4%, уровень Claude Sonnet, но дешевле. Доступна через API и открытыми весами на Hugging Face.

Qwen-VL — vision-language

Мультимодальное семейство: понимание изображений, OCR, описание сцен, чтение сложной вёрстки. Qwen3-VL поддерживает видео-фреймы и интерактивные интерфейсы (агенты, которые «видят» экран и кликают). Веса до 72B открытые под Apache 2.0. Сценарии: разбор PDF-договоров со сложной вёрсткой, описание скриншотов интерфейсов, чтение чертежей, анализ инфографики.

Qwen3-Omni — единая мультимодальная модель

Omni принимает на вход текст, картинку, аудио и видео, на выход выдаёт текст или аудио. Архитектура — единый трансформер, а не «несколько моделей через адаптеры». Для разработчиков — один API-вызов на смешанный ввод и согласованное поведение. Веса открытые, размер сопоставим с базовой 3.6-серией. Используется для голосовых помощников, видеоассистентов, агентов с live-камерой.

Qwen3-Image — генерация картинок без VPN

Text-to-image модель, бесплатно через chat.qwen.ai в режиме «изображение». В отличие от Midjourney и Sora, работает из РФ напрямую без оплаты карточкой. Сильные стороны: фотореализм, иероглифический текст на картинке, сложные сцены. Слабое: кириллица искажается, надписи на русском лучше добавлять в Photoshop или Figma. Для дизайн-задач без русского текста — рабочая бесплатная альтернатива западным сервисам.

Qwen3-Video и Qwen3-ASR

Qwen3-Video — генерация коротких HD-клипов из текста или стартового кадра. Качество ниже Sora и Runway, но бесплатно и без VPN — приемлемо для прототипов и соцсетей.

Qwen3-ASR — открытая линейка speech-to-text на 0.6B и 1.7B параметров, 52 языка включая русский. По метрикам — конкурент Whisper Large v3 при меньшем размере и Apache 2.0. Qwen3-ForcedAligner размечает транскрипт по времени для субтитров и dubbing-пайплайнов.

Открытые малые модели — Qwen 3 0.6B–14B

Линейка для запуска на ноутбуках и edge-устройствах: 0.6B — микроконтроллеры и умные колонки; 1.5B / 3B — телефоны через MLC LLM, embedded; 7B / 8B — рабочий ноутбук с 16 ГБ RAM, локальный RAG, оффлайн-помощник; 14B — десктоп с GPU 12+ ГБ VRAM.

Qwen-Turbo и Qwen-Plus (текстовые)

Это «рабочие лошадки» Alibaba Cloud:

  • Turbo — $0.05 input / $0.20 output. Самая дешёвая модель в линейке. Подходит для классификаций, простых ответов в чат-боте, обработки больших объёмов писем.
  • Plus — $0.40 / $1.20. Универсальная модель для продакшена: пишет тексты, отвечает в саппорте, делает базовый код.

Открытая линейка Qwen 3 (Apache 2.0)

Все Qwen 3 — от 0.6B до 235B-A22B (Mixture of Experts) — под Apache 2.0. Веса лежат на Hugging Face, ModelScope и в репозитории QwenLM на GitHub. Запуск — через vLLM, llama.cpp, Ollama, LM Studio.

Самая интересная для self-host — 235B-A22B: активирует 22B параметров на токен, по качеству близка к закрытому Plus, требует одну-две A100/H100. Модели 8B и 32B запускаются на потребительском железе (RTX 4090, M3 Max с 64 ГБ).

Скачать Qwen: веб, приложение, локально

Qwen «скачивать» в привычном смысле не нужно — основной вход через браузер. Но варианты разные.

Веб-версия (chat.qwen.ai). Официальный чат, аналог ChatGPT: диалог, история, выбор модели, загрузка файлов и картинок (для Plus и VL). Работает из России без VPN, регистрация по email с любого адреса. Внутри — выбор 3.7 Max / Plus / Coder / VL, режим thinking, загрузка PDF / картинок / аудио, генерация изображений и видео (Qwen-Image, Qwen-Video), встроенный поиск. Базовый чат бесплатный; Pro-подписка оплачивается только китайскими картами или Alipay.

Мобильное приложение. У Alibaba есть приложение Qwen для iOS и Android (в App Store и Google Play оно публикуется и под названием Qwen, и как часть приложений Tongyi). По функциям повторяет веб: чат, картинки, голос. В РФ ставится не всегда напрямую через стор — проще открыть chat.qwen.ai в мобильном браузере, интерфейс адаптивный.

Локально (open-source). Это и есть полноценное «скачать Qwen»: открытые модели Qwen 3 лежат на Hugging Face и в репозитории QwenLM на GitHub под Apache 2.0. Их можно скачать и запустить у себя без интернета — через Ollama (ollama run qwen3:8b), LM Studio, llama.cpp или vLLM. Что для какого железа подходит — в разделе про self-host ниже. Закрытые 3.7 Max и Plus так скачать нельзя, только через API.

API через Alibaba Cloud Model Studio

Прямой путь: dashscope.aliyun.com или Model Studio в Alibaba Cloud. Совместим с OpenAI SDK — меняете base_url и api_key, остальной код не трогаете.

Минусы для России: регистрация требует загранпаспорта и иногда китайского номера, оплата — с китайских банков, Alipay или корпоративных счетов, бесплатный developer tier закрыт с 15 апреля 2026 (остался 70M-токен trial на 90 дней, Singapore endpoint). Поэтому российские разработчики чаще идут через посредников.

OpenRouter — самый удобный путь из России

OpenRouter (openrouter.ai) — агрегатор API: один ключ, доступ к 200+ моделям, включая всю линейку Qwen. Оплата картой любой страны (российские — через USDT-пополнение), без VPN, без китайских документов. Подключение — стандартный OpenAI SDK с base_url=https://openrouter.ai/api/v1, биллинг pay-as-you-go, минимальный депозит $5. Наценка 5-10% к ценам Alibaba, но без китайской регистрации и валютных проблем.

Сторонние провайдеры

Together AI, Fireworks, DeepInfra хостят открытые Qwen 3 дешевле Alibaba. Yotta AI Gateway даёт 3.7 Max за $1.25 / $3.75 — вдвое ниже официальных. Self-host — в разделе ниже.

Тарифы и API pricing

Цены Alibaba Cloud (за миллион токенов, в долларах):

МодельInputOutputКонтекст
Qwen-Turbo$0.05$0.20128K
Qwen-Plus$0.40$1.20128K
Qwen 3.7 Plus$0.40$1.20256K
Qwen Coder 480B$0.60$1.80256K
Qwen-VL$0.50$1.50128K
Qwen 3.7 Max$2.50$7.501M

Дополнительно: кэшированный input — $0.25/млн для Max (90% скидка); batch processing — 50% скидка для офлайн-обработки (ответ за 24 часа); thinking-режим тарифицируется как обычный output, но токенов в 3–10 раз больше. Открытые Qwen 3 при self-host стоят только аренды GPU: H100 на vast.ai — $1.5-2/час, миллион токенов на 32B — около $0.15-0.30.

На бесплатном chat.qwen.ai лимиты щадящие — около 50-100 запросов в день для Max, без явного потолка для младших моделей. Pro-подписка ($15/мес) — только китайскими картами или Alipay.

Бенчмарки и сравнение с конкурентами

Цифры ниже — официальные данные Alibaba и публичные leaderboard-замеры на июнь 2026. Это ориентир, не истина: модели обучаются на близких корпусах, и разница в 1-2 пункта обычно несущественна для рабочих задач.

Общий интеллект и рассуждения.

БенчмаркQwen 3.7 MaxClaude Opus 4.6GPT-5.5DeepSeek V4 Pro
MMLU-Pro84868783
GPQA Diamond92.491.392.090.8
HLE41.440.042.138.5
HMMT 2026 Feb97.196.296.895.0
AIME 202691.390.591.089.2

MMLU-Pro у фронтир-моделей упёрся в потолок 84-88. Разницу делают GPQA Diamond (вопросы PhD-уровня) и HLE — Qwen 3.7 Max впервые обошёл Claude Opus 4.6 на 1.1 пункта.

Программирование.

БенчмаркQwen Coder / 3.7 MaxClaude Opus 4.6DeepSeek V4 ProGLM 5.1
SWE-Bench Verified80.480.878.276.5
HumanEval95969492
LiveCodeBench v683.682.181.078.8
Terminal Bench 2.069.770.265.460.1
SWE-Multilingual78.377.573.070.2

SWE-Bench Verified — автотест на реальных issue из GitHub: модель читает баг, ищет места в коде, пишет патч, прогоняет тесты. 80% — уровень мидл-разработчика на знакомой базе. Qwen Coder в открытых весах впервые догнал закрытый Claude Opus.

Агентские способности. MCP-Mark (внешние инструменты через Model Context Protocol): Qwen 3.7 Max — 60.8, Claude Opus 4.6 — 56.7. Автономная работа — 35 часов с 1158 вызовами инструментов без потери стратегии.

Длинный контекст. Qwen 3.7 Max и Gemini 2.5 Pro — окно 1M, остальные фронтиры 200-256K. На тесте Needle-in-a-Haystack Qwen держит 99% на 1M токенов — модели прошлых поколений теряли середину уже на 32K.

Self-host: требования к железу

Главный плюс открытых Qwen — запуск локально, без передачи данных Alibaba. Железо зависит от размера модели и квантования.

МодельQ4 VRAMРеальное железо
Qwen3-1.5B1 ГБтелефон, любой ноут
Qwen3-8B5 ГБM2 Pro 16 ГБ, RTX 3060 12 ГБ
Qwen3-14B9 ГБM3 Max, RTX 4080 16 ГБ
Qwen3-32B18 ГБM3 Max 64 ГБ, RTX 4090 24 ГБ
Qwen3-72B40 ГБдве RTX 4090 или A100 80 ГБ
Qwen3-235B-A22B (MoE)130 ГБH100 80 ГБ + Q4
Qwen Coder 480B (MoE)250 ГБдва-четыре H100

Q4 (4-bit квантизация) — сжатие весов с потерей около 1-2% качества; для большинства задач разница незаметна. GGUF-файлы для llama.cpp/Ollama уже квантованы.

Скорость. На RTX 4090: 8B Q4 — 80-100 токенов/сек, 14B — 45-55, 32B с offload — 12-15. На M3 Max 64 ГБ: 8B — 35-45, 32B Q4 — 18-22. Человек читает 5-7 токенов в секунду, так что 15+ токенов/сек комфортно для чата.

Софт. Ollama (ollama run qwen3:32b) — для личного использования. LM Studio — десктоп для тестов. vLLM — продакшен-сервер с батчингом и OpenAI-совместимым API. llama.cpp — CPU-only режим. MLC LLM — телефоны и WebGPU.

Сценарии применения

  • Программирование. Qwen Coder 480B через OpenRouter в Cursor или Claude Code — дешевле Claude Sonnet при сопоставимом качестве. Для агентских сценариев — 3.7 Max.
  • Анализ длинных документов. 1M-окно — годовой отчёт, контракт на 500 страниц, 50 PDF одновременно. Поиск несовпадений, рисков, упоминаний условий.
  • Многоязычный контент. Перевод на 119 языков, стабильнее Google Translate и DeepL на технических текстах.
  • Vision и OCR. Qwen3-VL разбирает PDF со сложной вёрсткой, таблицы, чертежи, скриншоты, дашборды.
  • Edge и offline. 0.6B на микроконтроллере, 1.5B на телефоне — для сценариев без облака.
  • Бесплатные картинки. Qwen3-Image через chat.qwen.ai — альтернатива Midjourney для прототипов, если кириллица не нужна.

Русский язык: где сильно, где слабо

Где сильно. Юридический и официально-деловой стиль — на уровне рабочего шаблона. Код с русскими комментариями на Python и JavaScript — без машинного перевода. Технические переводы — стабильнее DeepL.

Где слабо. Литературная тонкость, поэзия, рифма — Claude Opus и GPT-5.5 пишут заметно живее. Голос Qwen3-Omni на русском — стерильное звучание без интонации, для подкастов и дубляжа лучше ElevenLabs. Text-to-image на кириллице (Qwen3-Image) — модель путает буквы, надписи лучше добавлять в Photoshop. Системные промпты на русском работают хуже англоязычных — для строгого следования формату лучше держать system prompt на английском.

Слабые места по сравнению с конкурентами

  • Экосистема и IDE-интеграции. OpenAI и Anthropic — стандарт индустрии. Qwen подключается через OpenAI-совместимый endpoint, но поля thinking-режима и нюансы streaming могут потребовать ручной настройки.
  • Скорость на коротких запросах. Latency выше, чем у Groq-хостинга Llama или Mistral Small — иногда секунда против 200 мс. Для чат-ботов с моментальным ответом заметно.
  • Юрисдикция данных. Серверы Alibaba в КНР — главный минус для регулируемого бизнеса. Снимается только self-host.
  • Документация. Часть гайдов по продвинутым фичам есть только на китайском, английская версия отстаёт.

Qwen в России и на русском

Доступ из РФ без VPN. Qwen Chat и API работают из России напрямую — Alibaba не блокирует российские IP, в отличие от ChatGPT, Claude и Gemini. VPN не нужен ни на одном пути: веб (chat.qwen.ai), OpenRouter, self-host через Hugging Face, сторонние хосты (Together AI, Fireworks, DeepInfra), прямой Alibaba Cloud. Различаются только оплатой и регистрацией — детали в разделах про API и тарифы выше.

Русский язык. Qwen 3 обучен на крупном русском корпусе и отвечает по-русски без машинного перевода: держит грамматику и согласования в длинных текстах стабильнее DeepSeek и Llama 4, реже скатывается в кальки с английского. Подробности — в разделе про русский язык ниже.

Qwen не работает: частые проблемы

  • Не открывается chat.qwen.ai или просит вход. Обычно региональная капча или сбой сессии: очистить cookies домена и зайти заново. Код по email иногда приходит не сразу — повторить запрос.
  • Pro не оплатить картой РФ. Не баг: Pro принимает только китайские карты или Alipay. Базовый чат бесплатный; платный доступ без китайских реквизитов — через OpenRouter (оплата USDT).
  • API возвращает 401 / 403. Неверный api_key или регион endpoint. Для Alibaba — ключ от того же региона (China или Singapore dashscope-intl); для OpenRouter — base_url=https://openrouter.ai/api/v1.
  • Модель «не думает» или игнорирует формат. Thinking включается флагом enable_thinking=true; строгий формат лучше задавать system-промптом на английском.
  • Локальная модель не запускается / мало памяти. Взять версию меньше или квантизацию Q4 (таблица железа ниже): на 16 ГБ RAM идёт 8B, не 32B.

Китайская юрисдикция и 152-ФЗ

Главный нефункциональный риск Qwen для бизнеса. Alibaba Cloud — китайская компания, серверы по умолчанию в материковом Китае, Гонконге и Сингапуре. На них распространяется китайское законодательство (Cybersecurity Law, Data Security Law, PIPL): Alibaba обязана хранить логи и при официальном запросе властей предоставлять доступ.

Для российских компаний это конфликт со 152-ФЗ — персональные данные граждан РФ должны храниться на серверах в России. Для европейских — с GDPR. Singapore endpoint (dashscope-intl.aliyuncs.com) частично снимает вопрос, но владелец инфраструктуры остаётся Alibaba.

Рекомендации: персональные данные клиентов маскировать перед запросом; внутренние документы приемлемо для R&D, не приемлемо для банков, медицины, госконтрактов; публичный код и контент без секретов — без ограничений; полное снятие риска — только self-host открытых весов.

Qwen vs DeepSeek vs Llama vs Mistral

Все четыре — основные альтернативы американским моделям. Сводно по ключевым осям:

Лицензия. Qwen 3 — Apache 2.0 на все модели до 235B-A22B (закрыт только 3.7 Max). DeepSeek — R1 и V3 под MIT, V4 Pro закрытый. Llama 4 — Community License с ограничением для компаний свыше 700M MAU. Mistral — открытые Small / Medium / Codestral, закрытые Large. Самые либеральные — Qwen и DeepSeek.

Качество. Qwen 3.7 Max и DeepSeek V4 Pro близко в топ-5 мира; Llama 4 Maverick отстаёт на 5-10 пунктов; Mistral Large 3 — между Llama и Qwen Plus. На программировании Qwen Coder 480B и DeepSeek V4 Pro — паритет. Длинный контекст: Qwen 3.7 Max (1M) — лидер.

Цена. DeepSeek V4 Pro — примерно в 6 раз дешевле Qwen 3.7 Max на сравнимой задаче. Llama через Together дешевле обоих, Mistral дороже. Решает цена — DeepSeek; нужны агенты, длинный контекст, качество цепочек — Qwen.

Языки и юрисдикция. Qwen стабильнее DeepSeek и Llama на русском, особенно на технических текстах и коде с русскими комментариями. Qwen и DeepSeek — Китай, Llama — США, Mistral — Франция (GDPR-совместима). Для регулируемых кейсов — Mistral или self-host.

FAQ

Qwen бесплатный?

Да, в трёх режимах. (1) Qwen Chat в браузере — без оплаты, как ChatGPT. (2) Открытые модели Qwen 3 — скачать с Hugging Face и запустить у себя. (3) Trial для новых аккаунтов Alibaba Cloud — 70M токенов на 90 дней. Платный — только API на коммерческих моделях вроде 3.7 Max и Plus.

Нужен ли VPN для Qwen?

Нет. Qwen Chat и API доступны из России напрямую. В этом ключевое отличие от ChatGPT, Claude, Gemini, которые блокируют российские IP.

Чем Qwen 3.7 Max отличается от 3.7 Plus?

Max — текст, без работы с изображениями, контекст 1M, цена $2.50/$7.50. Plus — мультимодальный (работает с картинками), контекст 256K, цена $0.40/$1.20. Max сильнее в рассуждениях и агентских задачах, Plus — универсальнее и дешевле.

Можно ли использовать Qwen для коммерческих продуктов?

Да, и это одно из главных преимуществ. Apache 2.0 на открытые модели разрешает любые коммерческие применения без отчислений Alibaba — в отличие от Llama Community License с ограничением на крупные сервисы.

Подходит ли Qwen для русского языка?

Да. По русскому Qwen стабильнее DeepSeek и Llama: лучше держит грамматику в длинных текстах, реже путает падежи и предлоги. На уровне GPT-4 и Claude — не дотягивает в тонкой стилистике, но для рабочих задач (резюме, посты, документы, код с русскими комментариями) — подходит.

Как подключить Qwen из Python?

Через OpenAI SDK:

from openai import OpenAI

client = OpenAI(
 api_key="<ваш ключ>",
 base_url="https://openrouter.ai/api/v1"
)

response = client.chat.completions.create(
 model="qwen/qwen3.7-max",
 messages=[{"role": "user", "content": "Привет"}]
)

Меняете base_url и model — остальной код от ChatGPT-интеграции остаётся.

Что такое thinking-режим Qwen и сколько он стоит?

Это режим, где модель выводит развёрнутую цепочку рассуждений перед ответом — как o1 у OpenAI или R1 у DeepSeek. Качество выше, но output-токенов в 3-10 раз больше, и каждый тарифицируется по обычной ставке. На сложных задачах оправдывается, на простых — переплата.

Qwen или DeepSeek — что выбрать?

DeepSeek — если цена решает (в 6 раз дешевле). Qwen — если нужны долгие агенты, контекст 1M токенов и стабильный русский. На программировании паритет.

Совместим ли Qwen с Claude Code, Cursor, OpenClaw?

Да. Qwen 3.7 Max поддерживает OpenAI и Anthropic API spec — подключается в Cursor, Claude Code, OpenClaw, Aider, Cline сменой base_url и api_key. Через OpenRouter — одна строка в конфиге.

В чём разница Qwen Coder и 3.7 Max для программирования?

Coder 480B специально дообучен под код: FIM, агентское программирование, длинные репозитории. По SWE-Bench Verified — на уровне 3.7 Max при цене в 4 раза ниже. 3.7 Max выгоднее, когда нужны и код, и общие рассуждения, и долгая агентская сессия. Для чистой генерации кода в IDE — Coder.

Qwen или GigaChat для русских задач?

GigaChat — российская юрисдикция, данные на серверах Сбера, проще для регулируемых отраслей. Qwen — сильнее в коде, длинном контексте, мультимодале, дешевле на агентских задачах. Нужна 152-ФЗ — GigaChat или self-host Qwen.

Можно ли дообучить Qwen на своих данных?

Да, Apache 2.0 разрешает любой fine-tuning: LoRA, QLoRA, полный SFT. Дешёвый путь — LoRA на Qwen3-8B или 14B: одна RTX 4090 и 4-8 часов на корпусе в десятки тысяч примеров. Закрытые 3.7 Max и Plus тоже поддерживают fine-tuning через Alibaba Cloud, но это платная услуга и данные отправляются Alibaba.

Что делать, если нужна российская юрисдикция?

Два варианта. (1) Self-host открытых Qwen 3 на своём железе или в Yandex Cloud, Selectel, Timeweb — данные не покидают периметр, Apache 2.0 разрешает коммерческое использование. (2) GigaChat или YandexGPT — российские модели, серверы в РФ, готовая 152-ФЗ интеграция. Первый путь — ближе к фронтиру по качеству, второй — проще по комплаенсу.

Дальше

Если вы выбираете между моделями для конкретной задачи, посмотрите соседние материалы. DeepSeek — главный китайский конкурент Qwen с другим балансом цена-качество (дешевле, но слабее на длинном контексте и агентах). ChatGPT в России и Claude в России — что делать тем, кому нужны западные флагманы, и какие пути доступа работают без VPN. GigaChat — российский аналог с серверами в РФ и готовой 152-ФЗ интеграцией. Llama и Mistral — открытые альтернативы из США и Европы, разница в лицензиях и юрисдикции. Если вас интересует подключение из России в целом — API нейросетей: как подключить разбирает провайдеров и способы оплаты. Для сравнения западных флагманов есть отдельный материал ChatGPT или Claude, в который можно добавить Qwen как третий вариант с открытыми весами.