Блог инфра

Хостинг для ИИ-проекта 2026

Куда задеплоить ИИ-проект — один из главных вопросов после написания кода. Выбор хостинга влияет на скорость отклика, стоимость, доступность из РФ, соответствие 152-ФЗ и удобство деплоя.

В 2026 рабочих вариантов четыре: managed-платформы (Timeweb Cloud Apps, Vercel, Netlify) — деплой одним git push; VPS (Yandex Cloud, Selectel, Hetzner) — полный контроль; GPU-хостинг (vast.ai, RunPod, Lambda Labs, Selectel GPU) — для inference тяжёлых моделей; серверлесс (Cloudflare Workers AI, Modal, Vercel AI SDK) — оплата по факту вызова.

Эта страница — гид по всем четырём типам с реальными ценами 2026.

Что нужно ИИ-проекту: пять слоёв инфры

ИИ-проект — это не один сервер, а набор слоёв. Если упустить хоть один, продакшен встанет на первой же нагрузке.

  • Compute (CPU + GPU). Бэкенд на CPU тянет API-роуты, очереди, фоновые задачи. GPU нужен, когда поднимается свой инференс — Llama, Mistral, Stable Diffusion. Без GPU тяжёлый инференс не работает в реальном времени.
  • Storage. Объектное хранилище для медиа, моделей, артефактов обучения (S3-совместимое — Timeweb S3, Selectel S3, Yandex Object Storage). NVMe — для горячих данных и кеша моделей.
  • База данных. Реляционная (Postgres) — пользователи, биллинг, контент. Векторная (pgvector, Qdrant) — эмбеддинги для RAG. Кеш (Redis / Valkey) — сессии, очереди, rate-limit.
  • Edge / CDN. Cloudflare, BunnyCDN или встроенный CDN провайдера. Кешируют статику и снижают задержку. Edge-инференс (Workers AI) — выносит лёгкие модели ближе к пользователю.
  • Наблюдаемость. Логи, метрики, трейсы, алерты. Минимум — Sentry на ошибки и Prometheus + Grafana на метрики. Для ИИ дополнительно: счётчики токенов, стоимость по моделям, доля кеш-хитов.

Без любого слоя проект работает — но первый же инцидент в проде вскроет, чего не хватает.

Стек ИИ-стартапа на 2026 — типовой набор

Что обычно стоит в продакшене у небольшой ИИ-команды:

СлойБазовый выборРоссийская альтернатива
ФронтNext.js / Astro на VercelAstro на Timeweb Cloud Apps
APINode.js (Hono / Fastify) или Python (FastAPI)то же — на VPS Timeweb / Yandex Cloud
ОчередиBullMQ + RedisRedis от Timeweb / Yandex Managed Redis
Реляционная БДPostgres (Supabase / Neon)Timeweb Managed Postgres, Yandex Managed Postgres
Векторная БДpgvector / Qdrant Cloudpgvector на той же Postgres
ФайлыS3 (AWS / Cloudflare R2)Timeweb S3, Yandex Object Storage
LLM-инференсOpenAI / Anthropic через OpenRouterGigaChat API, YandexGPT API
Картинки / видеоReplicate, ModalYandexART, Kandinsky API
МониторингSentry + Prometheus + GrafanaYandex Monitoring, Selectel Monitoring
AuthClerk, Auth.jsсвой magic-link + Postgres

Главный принцип: держать слои на одном провайдере, если возможно. Это сокращает задержку, упрощает биллинг и снимает вопросы по 152-ФЗ.

Главное в 30 секунд

ТипИгрокиСтарт ценаКогда брать
Managed (PaaS)Timeweb Cloud Apps, Vercel, Netlify, Render, Railway0–600 ₽/меспрототипы, лендинги, MVP с лёгким API
VPSTimeweb, Yandex Cloud, Selectel, Hetzner, DigitalOceanот 200 ₽/мессвой контроль, фоновые задачи, локальные модели
GPU dedicatedSelectel GPU, vast.ai, RunPod, Lambda Labs, Yandex DataSphereот 50 ₽/часinference 7B+, fine-tuning, обучение
СерверлессCloudflare Workers AI, Vercel AI SDK, Modal, Replicateоплата за вызовредкие пики, неравномерная нагрузка

Четыре типа хостинга — в чём разница

  • Managed (PaaS) — платформа сама собирает проект, ставит зависимости, выдаёт SSL и CDN. Игроки: Timeweb Cloud Apps, Vercel, Netlify, Render, Railway, Fly.io. Плюсы: нулевой DevOps, превью каждого PR, авто-масштабирование. Минусы: дорого на объёмах, лимиты runtime, нет доступа к ОС. Когда: прототип, MVP, лендинг, лёгкий API-бэк.
  • VPS — виртуальная машина с root-доступом, любой софт. Игроки: Timeweb, Yandex Cloud Compute, Selectel, Hetzner, DigitalOcean. Плюсы: дешевле PaaS в долгосроке, фоновые процессы без ограничений, Ollama / vLLM. Минусы: нужны навыки администрирования, бэкапы и мониторинг сами. Когда: тяжёлые задачи, фоновые воркеры, Docker-стек.
  • GPU dedicated — сервер с NVIDIA RTX 4090 / A100 / H100. Без GPU нормальный inference LLM 7B+ невозможен — на CPU Llama 3 8B выдаёт 2–5 токенов/сек, на RTX 4090 — 80–120. Игроки: vast.ai, RunPod, Lambda Labs, Selectel GPU, Yandex DataSphere. Когда: свой inference 7B+, fine-tuning, обучение, генерация Stable Diffusion / FLUX.
  • Серверлесс — оплата по факту вызова. Игроки: Cloudflare Workers AI, Vercel AI SDK, Modal, Replicate, AWS Lambda. Плюсы: ноль платы в простой, авто-масштабирование от 0. Минусы: cold start, лимиты на время и память, дороже при равномерной нагрузке. Когда: редкие пики, телеграм-бот, MVP-демо.

Российские провайдеры

Timeweb Cloud — самый массовый российский cloud для разработчиков. Cloud Apps (managed-деплой через git push, от 200 ₽/мес), VPS от 200 ₽/мес с GPU-конфигурациями, managed Postgres / MySQL с автобэкапами от 400 ₽/мес, S3-хранилище. Серверы в Москве и Питере, оплата ЮKassa и юр.лицу с НДС, без санкционных рисков. Выбор по умолчанию: российская аудитория, MVP, оплата картой РФ.

Yandex Cloud — корпоративное облако с полным набором managed-сервисов: Compute Cloud, Managed Kubernetes, Managed Postgres / Redis / Kafka, Object Storage, DataSphere для ML, Foundation Models для inference YandexGPT. Цены выше Timeweb (VPS 4 vCPU / 16 ГБ — от 4 000 ₽/мес), есть GPU-инстансы с A100. Сертификация 152-ФЗ, серверы во Владимире и Рязани. Подходит: корпоративные проекты, УЗ-1/УЗ-2, Kubernetes, YandexGPT.

Selectel — лидер по GPU-конфигурациям в РФ. VPS от 200 ₽/мес, GPU-серверы (RTX 4090, A100, H100) помесячно и почасово, bare metal, managed Postgres и Kubernetes. 152-ФЗ, дата-центры в Москве, Питере, Новосибирске. Подходит: GPU в РФ, корпоративный inference, локальная модель без API.

VK Cloud — облако VK с интеграцией GigaChat, managed Kubernetes, Postgres и S3. 152-ФЗ, оплата по счёту юр.лицу. Подходит: проекты на экосистеме VK, GigaChat-интеграция.

Reg.RU — массовый российский хостинг, дешёвый VPS от 100 ₽/мес, без GPU. Подходит: простые лендинги, ИИ-функции через внешний API.

Зарубежные managed

Vercel — создатель Next.js, идеальная интеграция. Деплой через git push, serverless-функции, edge runtime, SSL и CDN. Hobby — бесплатно, Pro — от $20/мес, на больших проектах счёт растёт до $100–500/мес. Из РФ — нужна зарубежная карта.

Railway — современная альтернатива Heroku, щедрый free-tier, Docker / Node / Python, встроенные Postgres, Redis, фоновые воркеры без лимита по времени. От $5/мес. Подходит: Python-бэк, телеграм-боты, очереди.

Render — «Heroku без болей». Web-сервисы, background workers, cron, managed Postgres и Redis. От $7/мес. Подходит: ИИ-агент с фоновыми задачами и cron.

Netlify — конкурент Vercel в нише статики и Jamstack. Подходит: лендинг на Astro / Hugo / Eleventy.

Fly.io — микро-ВМ Firecracker в 30+ регионах, Docker, persistent volumes, GPU-инстансы. Подходит: глобальная аудитория с упором на задержку.

AWS, GCP, Azure — энтерпрайз: полный стек, GPU (A100, H100, L4), managed-БД, ML-платформы (SageMaker, Vertex AI, Azure ML). Цены высокие, биллинг сложный, оплата только зарубежной картой. Для российского ИИ-стартапа в большинстве случаев избыточно.

LLM API для разработки — обзор

Свой инференс держать не обязательно. Большая часть продуктовых задач закрывается API-провайдерами.

  • OpenAI API — GPT-5, o5-pro, эмбеддинги, Whisper. Из РФ нужна зарубежная карта.
  • Anthropic API — Claude Opus 4.7, Sonnet 4.7, Haiku 4.5. Сильны на длинном контексте и разработке.
  • Google AI Studio / Vertex — Gemini 2.5 Pro / Flash. Огромный контекст, мультимодальность.
  • Together AI, Fireworks AI, Groq — open-source модели (Llama, Mistral, Qwen) через быстрый API, дешевле OpenAI.
  • Replicate — каталог open-source моделей: Stable Diffusion, FLUX, Whisper, LLM.
  • OpenRouter — единый шлюз ко всем перечисленным провайдерам, один API-ключ, оплата российской картой через посредников.
  • GigaChat API (Сбер) — российский LLM, корпоративный SLA, оплата по счёту юр.лица.
  • YandexGPT API — российский LLM от Яндекса, интеграция с Yandex Cloud и DataSphere.

Совет на старте: подключайтесь через OpenRouter и API нейросетей — это снимает большую часть вопросов с биллингом и переключением моделей.

Векторные базы данных — RAG-слой

Для RAG нужна векторная база. Основные варианты:

  • pgvector — расширение Postgres, индексы HNSW и IVFFlat. Базовый и самый дешёвый выбор. Доступен в Timeweb Managed Postgres, Yandex Managed Postgres, Supabase, Neon.
  • Qdrant — векторная БД на Rust, managed и self-hosted, масштабируется на десятки миллионов векторов.
  • Weaviate — встроенный GraphQL, гибридный поиск, подходит для сложного семантического поиска.
  • Pinecone — managed-only, самая простая интеграция, дорогая на масштабе, серверы за рубежом.
  • Milvus — open-source, для сотен миллионов векторов в проде.

Правило: до 5 миллионов эмбеддингов — pgvector в той же Postgres. Дальше — Qdrant или Milvus.

Edge-инференс и self-hosted LLM

Edge-платформы запускают модели на POP-сети и сокращают задержку до 30–80 мс. Cloudflare Workers AI — готовые модели (Llama, Mistral, Whisper, эмбеддинги) на 300+ локациях, оплата за нейроны. Vercel AI SDK — стриминг ответов LLM и AI Gateway как прокси к моделям с кешем и rate-limit. Edge не отменяет основной API — это вспомогательный слой.

Self-hosted LLM — три базовых движка. Ollama: самый простой, моделей много через ollama pull, для прототипа. vLLM: production-grade, параллельные запросы и PagedAttention, в 3–10 раз быстрее Ollama. llama.cpp: C++ с квантованием (Q4–Q8), запускает модели на CPU и слабых GPU. Для прода — vLLM на RunPod или Selectel GPU в Docker.

GPU-хостинг для inference — цены 2026

GPU нужен для двух задач: inference (запуск готовой модели) и обучение / fine-tuning. Для inference достаточно RTX 4090 (24 ГБ VRAM) или A100 (40–80 ГБ), для тренировки больших моделей — H100.

  • vast.ai — peer-to-peer marketplace. Самые низкие цены, без гарантий uptime. RTX 4090 от $0,27/час, A100 40 ГБ от $0,52/час, A100 80 ГБ от $0,67/час. Подходит: эксперименты, fine-tuning, R&D без жёсткого SLA.
  • RunPod Secure Cloud — 99% uptime SLA. RTX 4090 от $0,34/час, A100 от $1,39/час, H100 PCIe от $1,99/час, L40S от $0,79/час. Подходит: production inference без управления железом.
  • Lambda Labs — премиум: США, корпоративная поддержка, лучшая стабильность. A100 от $1,29/час, H100 от $2,49/час. Подходит: enterprise SLA, обучение крупных моделей.
  • Selectel GPU — единственный массовый GPU-провайдер в РФ. RTX 4090 от 15 000 ₽/мес, A100 от 80 000 ₽/мес. 152-ФЗ, данные не покидают РФ. Подходит: корпоративный inference в РФ.
  • Yandex DataSphere — managed-ML, почасовая аренда GPU (A100, V100), Jupyter, MLflow, интеграция с Foundation Models. Подходит: ML-эксперименты внутри экосистемы Яндекса.

Серверлесс для ИИ — оплата за вызов

  • Cloudflare Workers AI — managed-inference на 300+ edge-локациях. Готовые модели: Llama 3, Mistral, Stable Diffusion, Whisper, эмбеддинги. Цена за нейроны, стартовый план $0. Минимальная задержка, нет cold start для популярных моделей. Минус: ограниченный набор моделей, нельзя катить свою без апрува.
  • Vercel AI SDK + AI Gateway — стриминг LLM из Next.js, единый прокси к OpenAI, Anthropic, Google, Mistral, OpenRouter с одним ключом, лимитами и логами. Подходит: Next.js на Vercel, чат-интерфейс поверх внешних LLM.
  • Modal — serverless-платформа для Python с GPU. Декоратор на функции, запуск на A100 / H100, оплата за секунды. Подходит: свой inference open-source без управления сервером, batch-обработка.
  • Replicate — каталог open-source моделей (Stable Diffusion, FLUX, Llama, Whisper, MusicGen) с REST-API. Оплата за секунды inference. Подходит: генерация картинок / видео / аудио без своей инфры.

Сравнительная таблица провайдеров

ПровайдерЛокацияGPU152-ФЗСтарт ценаОсобенность
Timeweb CloudМосква, СПбRTX 4090даот 200 ₽/месCloud Apps, Managed Postgres, S3
Yandex CloudВладимир, РязаньA100да, УЗ-1от 4 000 ₽/месFoundation Models, DataSphere
SelectelМосква, СПб, Новосиб.RTX 4090, A100, H100даот 200 ₽/меслучший GPU в РФ, bare metal
VK CloudМоскваA100даот 500 ₽/месинтеграция с GigaChat, K8s
Reg.RUМоскванетдаот 100 ₽/месдешёвый VPS, без GPU
VercelСША, EUнетнет$0 / $20эталон деплоя Next.js
RenderСША, EUнетнет$7/месфоновые задачи, cron
Fly.io30+ регионовA100, L40Sнетот $5/месFirecracker, edge
RailwayСШАнетнет$5/месPostgres, Redis в комплекте
AWSглобальноA100, H100нетот $5полный стек, сложный биллинг
RunPodСША, EURTX 4090, A100, H100нетот $0,34/часsecure cloud, SLA
vast.aiглобальноRTX 4090, A100нетот $0,27/часmarketplace, без SLA

Для российской ИИ-команды дефолт — Timeweb (фронт + API + БД) + Selectel (GPU, если нужен) + OpenRouter для внешних LLM.

Tier хостинга по требованиям

Выбор не «один лучший провайдер», а правильный tier под этап проекта.

  • Tier 0 — лендинг и статика (0 ₽/мес). Cloudflare Pages, GitHub Pages, Vercel Hobby, Timeweb Cloud Apps Start. Подходит: визитка, лендинг, документация. ИИ-функций нет или внешние через API.
  • Tier 1 — MVP / прототип ($20–100/мес). Managed-платформа (Timeweb Cloud Apps, Railway, Render) + managed Postgres + OpenRouter. Подходит: первая 1 000 пользователей, чат-бот, демо-SaaS.
  • Tier 2 — продакшен ($500–5 000/мес). VPS с балансировщиком, managed-БД, Redis, фоновые воркеры, мониторинг, S3, CDN. Inference — внешние LLM + serverless GPU (Modal, Replicate). Подходит: SaaS на 1k–100k MAU.
  • Tier 3 — энтерпрайз ($10 000+/мес). Managed Kubernetes (Yandex Cloud, Selectel), шардинг Postgres, очереди (Kafka), свой inference на выделенных GPU (Selectel H100 / RunPod), observability-стек, on-call. Подходит: 100k+ MAU, SLA.

Главная ошибка: брать сразу Tier 3 «на вырост». Каждый лишний слой — оплата и сопровождение. Растите по факту нагрузки.

Под задачу — что брать

Хостинг зависит от типа ИИ-продукта.

  • Чат-бот (Telegram, веб). Managed (Timeweb Cloud Apps, Railway) для бэка + Postgres для диалогов + Redis для rate-limit + OpenRouter или GigaChat для LLM.
  • RAG (поиск по документам). VPS или managed для API + Postgres с pgvector + S3 для исходников + OpenAI / Anthropic для генерации.
  • ИИ-агенты (с инструментами и долгими задачами). VPS или Render с фоновыми воркерами без лимита по времени + Postgres для состояния + BullMQ для очередей + LLM с tool-use (Claude Sonnet, GPT-5) + trace-платформа (Langfuse, Helicone).
  • Генерация изображений. Replicate, Modal или Vercel AI SDK для FLUX / SDXL + S3 + CDN. Свой GPU окупается с 5k генераций в день и выше.
  • Генерация видео. Replicate (Kling, Runway, Veo) + S3 c поддержкой больших файлов + очередь на долгие рендеры.

152-ФЗ и российская локализация

Если ИИ-проект обрабатывает персональные данные граждан РФ (имя + телефон, email + что-то ещё), вступает 152-ФЗ. Первичная база с персональными данными россиян обязана физически находиться в РФ.

Что это значит для хостинга:

  • Vercel, Netlify, Cloudflare, Render, Fly.io, vast.ai, RunPod, Lambda Labs, Modal, Replicate — серверы за рубежом. Можно использовать для обработки обезличенных данных, но первичная БД должна быть в РФ.
  • Timeweb, Yandex Cloud, Selectel — серверы в РФ, есть сертификация для УЗ-3 / УЗ-2 / УЗ-1.
  • Корпоративные проекты с медицинскими, финансовыми, биометрическими данными — только аттестованный российский провайдер.
  • Уведомление в Роскомнадзор как оператора ПД подаётся независимо от выбора хостинга.

Безопасный паттерн для ИИ-проекта с РФ-аудиторией: основная БД и приложение — в Timeweb / Yandex Cloud / Selectel, тяжёлый inference — через OpenRouter или GigaChat / YandexGPT по API.

Что можно и что нельзя по 152-ФЗ — короткий чек-лист

  • Можно за рубежом: обезличенные эмбеддинги без связки с пользователем, агрегированная аналитика, кеш статики, фронт без форм.
  • Только в РФ: ФИО, телефон, email, паспорт, СНИЛС, биометрия, медицинские, финансовые данные. Это первичная база.
  • Серая зона: диалоги пользователей с ИИ. Если в них может быть имя или контакт — храните в РФ.
  • Обработчик за рубежом (OpenAI / Anthropic / Replicate) допустим, если данные обезличены и не пересылается связка «персональные данные + контент».

Подробно про уведомление РКН и хранение — на странице 152-ФЗ и персональные данные.

Где хостинг не нужен — крайние случаи

Не каждому ИИ-проекту нужен сервер.

  • Статический сайт-визитка. Astro, Hugo, Eleventy — сборка кладётся на Cloudflare Pages или GitHub Pages бесплатно. Никаких ВМ.
  • Лендинг с формой. Cloudflare Pages + Telegram-бот через webhook на бесплатном Cloudflare Worker. Сервер не нужен.
  • Прототип ИИ-функции внутри n8n / Make. Воркфлоу-платформа сама держит исполнение, ИИ через подключённый OpenAI / OpenRouter.
  • Чат-бот на готовых платформах. Salebot, BotHelp, Telegram Mini Apps + Cloudflare Workers — серверов под управление нет.
  • Демо-сайт в Notion / Tilda. Если задача — собрать обратную связь, поднимать инфру под это не нужно.

Правило: если ИИ-функция вызывается реже 100 раз в сутки и нет своих моделей — обходитесь без своей инфры. Подключайте API из платформы no-code.

Стоимость в год — три ключевых сценария

Чат-бот в Telegram (1 000 диалогов/день). Cloudflare Workers AI + KV — $0–10/мес. Timeweb VPS + OpenRouter — около 2 300 ₽/мес с учётом токенов.

MVP SaaS с ИИ-фичами (Next.js + Postgres + 1 000 пользователей). Vercel Pro + Vercel Postgres + OpenRouter — около $90/мес. Timeweb Cloud Apps + Managed Postgres + OpenRouter — около 5 400 ₽/мес. Railway + OpenRouter — около $60/мес. Для РФ-аудитории выигрывает Timeweb по совокупности (локализация + цена).

Свой inference Llama 3 8B 24/7. vast.ai RTX 4090 — около $194/мес без SLA. RunPod RTX 4090 Secure — около $245/мес с 99% SLA. Selectel RTX 4090 в РФ — 15 000 ₽/мес. Modal A10G по факту вызовов (1 000 запросов/день) — $30–60/мес.

При неравномерной нагрузке serverless GPU выигрывает в 3–5 раз. При постоянной — выделенный сервер дешевле.

Масштабирование — что меняется с ростом

  • 0–100 пользователей — managed бесплатных планов хватает. Не оптимизируйте раньше времени.
  • 100–10 000 — переход на платный managed-план или дешёвый VPS. БД на managed Postgres.
  • 10 000–100 000 — VPS с балансировщиком, отдельная БД, CDN, кеш Redis, фоновые воркеры.
  • 100 000+ — Kubernetes, шардинг БД, очереди (RabbitMQ / Kafka), мониторинг (Prometheus / Grafana), либо managed-Kubernetes в Yandex Cloud / Selectel.

ИИ-нагрузку выносите на отдельный слой раньше остального: inference — самая дорогая и непредсказуемая часть.

Главные ошибки выбора

  • Vercel для российской аудитории. Серверы в США / Европе — задержка, риск блокировок, персональные данные россиян за рубежом. Лучше Timeweb / Yandex Cloud.
  • Бесплатный план для production. Free-tier’ы имеют лимиты (трафик, build-минуты, время функций). При росте — внезапные счета или отключение.
  • VPS без знания администрирования. Next.js на VPS требует знаний nginx, systemd, SSL. Если нет времени учиться — managed.
  • Свой inference на CPU. Llama 3 8B на CPU выдаёт 2–5 токенов/сек — неюзабельно. Используйте OpenRouter или Cloudflare Workers AI.
  • Игнорирование 152-ФЗ. Хранение персональных данных россиян за рубежом — нарушение. Основная БД — в РФ.
  • Хардкод API-ключей. Ключи в коде утекают через git и приводят к блокировке аккаунтов. Только через env-переменные.
  • Без бэкапов. На VPS обязательно настройте регулярные бэкапы БД и файлов. На managed — встроенные.

FAQ

Какой хостинг лучше для российского ИИ-проекта? Timeweb Cloud Apps для лёгкого API + managed Postgres + OpenRouter для inference. Свой inference в РФ — Selectel GPU. Корпоративный 152-ФЗ — Yandex Cloud или Selectel с аттестацией.

Можно ли разместить ИИ-проект бесплатно? Для прототипа — да. Cloudflare Workers AI даёт бесплатный inference готовых моделей, Vercel Hobby и Cloudflare Pages деплоят фронт, Timeweb Cloud Apps Start работает без оплаты до лимита трафика.

Vercel или Timeweb? Для глобальной аудитории и Next.js — Vercel. Для российской аудитории и оплаты картой РФ — Timeweb. Для проекта с персональными данными россиян — Timeweb / Yandex Cloud / Selectel из-за 152-ФЗ.

Нужен ли GPU для ИИ-проекта? Нет, если используете внешние API (OpenRouter, GigaChat, YandexGPT, OpenAI). Да, если хотите свой inference open-source моделей и есть смысл по экономике.

Что дешевле — свой GPU или API? API дешевле при нагрузке до 100k–500k токенов в день. Свой GPU окупается с миллиона токенов в день и выше при постоянной загрузке. Промежуточный вариант — serverless GPU (Modal, Replicate).

vast.ai или RunPod? vast.ai дешевле на 30–50%, без SLA — для экспериментов и fine-tuning. RunPod дороже, 99% uptime — для production inference.

Можно ли запускать локальные нейросети на обычном VPS? Технически — да через Ollama / vLLM, но без GPU скорость 2–5 токенов/сек. Для CPU подходят квантованные модели до 3B (Phi-3 mini, Llama 3.2 1B). Серьёзный inference 7B+ требует GPU.

Сколько RAM нужно для ИИ-проекта на Next.js? Минимум 2 ГБ для лёгкого MVP, реалистично — 4–8 ГБ. Image processing или локальный inference — 16+ ГБ. Inference 7B без GPU — 16–24 ГБ.

Что выбрать для масштабирования с 1 до 100 000 пользователей? Старт на managed (Timeweb Cloud Apps / Render / Railway), при росте — VPS с балансировщиком и отдельная БД, при 100k+ — managed Kubernetes (Yandex Cloud / Selectel) с шардингом и очередями.

Какой бюджет нужен на ИИ-MVP? Базовый MVP — 3 000–10 000 ₽/мес: managed-платформа, managed Postgres, лимит токенов через OpenRouter. Без своего GPU.

Как мигрировать с Vercel на российский хостинг? Вынести env, перенести БД (pg_dumppg_restore), залить S3-файлы через rclone, развернуть Docker-образ в Timeweb Cloud Apps или Yandex Cloud, перевести DNS. Подробности — на странице Timeweb Cloud.

Что такое cold start и как он мешает ИИ? Задержка первого запроса после простоя на serverless. Для лёгких функций 200–500 мс, для GPU-инференса 5–30 секунд. Решения: warm pool (Modal), edge-инференс (Cloudflare Workers AI), пинг-запросы.

Нужен ли Kubernetes на старте? Нет. Окупается с 5+ сервисов и команды от трёх человек. До этого — Docker Compose на одном VPS или managed-платформа.

Чем отличается inference от training по требованиям? Inference — VRAM под веса (Llama 8B — около 8 ГБ в Q4). Training — VRAM под веса + градиенты + оптимизатор (в 4–5 раз больше). Для обучения 70B — кластер из 8× H100.

Как страховаться от падения внешнего LLM-провайдера? Прокси-слой (OpenRouter, Vercel AI Gateway) с автоматическим fallback на резервный провайдер, retry с exponential backoff, кеш популярных ответов.

Дальше