Хостинг для ИИ-проекта 2026
Куда задеплоить ИИ-проект — один из главных вопросов после написания кода. Выбор хостинга влияет на скорость отклика, стоимость, доступность из РФ, соответствие 152-ФЗ и удобство деплоя.
В 2026 рабочих вариантов четыре: managed-платформы (Timeweb Cloud Apps, Vercel, Netlify) — деплой одним git push; VPS (Yandex Cloud, Selectel, Hetzner) — полный контроль; GPU-хостинг (vast.ai, RunPod, Lambda Labs, Selectel GPU) — для inference тяжёлых моделей; серверлесс (Cloudflare Workers AI, Modal, Vercel AI SDK) — оплата по факту вызова.
Эта страница — гид по всем четырём типам с реальными ценами 2026.
Что нужно ИИ-проекту: пять слоёв инфры
ИИ-проект — это не один сервер, а набор слоёв. Если упустить хоть один, продакшен встанет на первой же нагрузке.
- Compute (CPU + GPU). Бэкенд на CPU тянет API-роуты, очереди, фоновые задачи. GPU нужен, когда поднимается свой инференс — Llama, Mistral, Stable Diffusion. Без GPU тяжёлый инференс не работает в реальном времени.
- Storage. Объектное хранилище для медиа, моделей, артефактов обучения (S3-совместимое — Timeweb S3, Selectel S3, Yandex Object Storage). NVMe — для горячих данных и кеша моделей.
- База данных. Реляционная (Postgres) — пользователи, биллинг, контент. Векторная (pgvector, Qdrant) — эмбеддинги для RAG. Кеш (Redis / Valkey) — сессии, очереди, rate-limit.
- Edge / CDN. Cloudflare, BunnyCDN или встроенный CDN провайдера. Кешируют статику и снижают задержку. Edge-инференс (Workers AI) — выносит лёгкие модели ближе к пользователю.
- Наблюдаемость. Логи, метрики, трейсы, алерты. Минимум — Sentry на ошибки и Prometheus + Grafana на метрики. Для ИИ дополнительно: счётчики токенов, стоимость по моделям, доля кеш-хитов.
Без любого слоя проект работает — но первый же инцидент в проде вскроет, чего не хватает.
Стек ИИ-стартапа на 2026 — типовой набор
Что обычно стоит в продакшене у небольшой ИИ-команды:
| Слой | Базовый выбор | Российская альтернатива |
|---|---|---|
| Фронт | Next.js / Astro на Vercel | Astro на Timeweb Cloud Apps |
| API | Node.js (Hono / Fastify) или Python (FastAPI) | то же — на VPS Timeweb / Yandex Cloud |
| Очереди | BullMQ + Redis | Redis от Timeweb / Yandex Managed Redis |
| Реляционная БД | Postgres (Supabase / Neon) | Timeweb Managed Postgres, Yandex Managed Postgres |
| Векторная БД | pgvector / Qdrant Cloud | pgvector на той же Postgres |
| Файлы | S3 (AWS / Cloudflare R2) | Timeweb S3, Yandex Object Storage |
| LLM-инференс | OpenAI / Anthropic через OpenRouter | GigaChat API, YandexGPT API |
| Картинки / видео | Replicate, Modal | YandexART, Kandinsky API |
| Мониторинг | Sentry + Prometheus + Grafana | Yandex Monitoring, Selectel Monitoring |
| Auth | Clerk, Auth.js | свой magic-link + Postgres |
Главный принцип: держать слои на одном провайдере, если возможно. Это сокращает задержку, упрощает биллинг и снимает вопросы по 152-ФЗ.
Главное в 30 секунд
| Тип | Игроки | Старт цена | Когда брать |
|---|---|---|---|
| Managed (PaaS) | Timeweb Cloud Apps, Vercel, Netlify, Render, Railway | 0–600 ₽/мес | прототипы, лендинги, MVP с лёгким API |
| VPS | Timeweb, Yandex Cloud, Selectel, Hetzner, DigitalOcean | от 200 ₽/мес | свой контроль, фоновые задачи, локальные модели |
| GPU dedicated | Selectel GPU, vast.ai, RunPod, Lambda Labs, Yandex DataSphere | от 50 ₽/час | inference 7B+, fine-tuning, обучение |
| Серверлесс | Cloudflare Workers AI, Vercel AI SDK, Modal, Replicate | оплата за вызов | редкие пики, неравномерная нагрузка |
Четыре типа хостинга — в чём разница
- Managed (PaaS) — платформа сама собирает проект, ставит зависимости, выдаёт SSL и CDN. Игроки: Timeweb Cloud Apps, Vercel, Netlify, Render, Railway, Fly.io. Плюсы: нулевой DevOps, превью каждого PR, авто-масштабирование. Минусы: дорого на объёмах, лимиты runtime, нет доступа к ОС. Когда: прототип, MVP, лендинг, лёгкий API-бэк.
- VPS — виртуальная машина с root-доступом, любой софт. Игроки: Timeweb, Yandex Cloud Compute, Selectel, Hetzner, DigitalOcean. Плюсы: дешевле PaaS в долгосроке, фоновые процессы без ограничений, Ollama / vLLM. Минусы: нужны навыки администрирования, бэкапы и мониторинг сами. Когда: тяжёлые задачи, фоновые воркеры, Docker-стек.
- GPU dedicated — сервер с NVIDIA RTX 4090 / A100 / H100. Без GPU нормальный inference LLM 7B+ невозможен — на CPU Llama 3 8B выдаёт 2–5 токенов/сек, на RTX 4090 — 80–120. Игроки: vast.ai, RunPod, Lambda Labs, Selectel GPU, Yandex DataSphere. Когда: свой inference 7B+, fine-tuning, обучение, генерация Stable Diffusion / FLUX.
- Серверлесс — оплата по факту вызова. Игроки: Cloudflare Workers AI, Vercel AI SDK, Modal, Replicate, AWS Lambda. Плюсы: ноль платы в простой, авто-масштабирование от 0. Минусы: cold start, лимиты на время и память, дороже при равномерной нагрузке. Когда: редкие пики, телеграм-бот, MVP-демо.
Российские провайдеры
Timeweb Cloud — самый массовый российский cloud для разработчиков. Cloud Apps (managed-деплой через git push, от 200 ₽/мес), VPS от 200 ₽/мес с GPU-конфигурациями, managed Postgres / MySQL с автобэкапами от 400 ₽/мес, S3-хранилище. Серверы в Москве и Питере, оплата ЮKassa и юр.лицу с НДС, без санкционных рисков. Выбор по умолчанию: российская аудитория, MVP, оплата картой РФ.
Yandex Cloud — корпоративное облако с полным набором managed-сервисов: Compute Cloud, Managed Kubernetes, Managed Postgres / Redis / Kafka, Object Storage, DataSphere для ML, Foundation Models для inference YandexGPT. Цены выше Timeweb (VPS 4 vCPU / 16 ГБ — от 4 000 ₽/мес), есть GPU-инстансы с A100. Сертификация 152-ФЗ, серверы во Владимире и Рязани. Подходит: корпоративные проекты, УЗ-1/УЗ-2, Kubernetes, YandexGPT.
Selectel — лидер по GPU-конфигурациям в РФ. VPS от 200 ₽/мес, GPU-серверы (RTX 4090, A100, H100) помесячно и почасово, bare metal, managed Postgres и Kubernetes. 152-ФЗ, дата-центры в Москве, Питере, Новосибирске. Подходит: GPU в РФ, корпоративный inference, локальная модель без API.
VK Cloud — облако VK с интеграцией GigaChat, managed Kubernetes, Postgres и S3. 152-ФЗ, оплата по счёту юр.лицу. Подходит: проекты на экосистеме VK, GigaChat-интеграция.
Reg.RU — массовый российский хостинг, дешёвый VPS от 100 ₽/мес, без GPU. Подходит: простые лендинги, ИИ-функции через внешний API.
Зарубежные managed
Vercel — создатель Next.js, идеальная интеграция. Деплой через git push, serverless-функции, edge runtime, SSL и CDN. Hobby — бесплатно, Pro — от $20/мес, на больших проектах счёт растёт до $100–500/мес. Из РФ — нужна зарубежная карта.
Railway — современная альтернатива Heroku, щедрый free-tier, Docker / Node / Python, встроенные Postgres, Redis, фоновые воркеры без лимита по времени. От $5/мес. Подходит: Python-бэк, телеграм-боты, очереди.
Render — «Heroku без болей». Web-сервисы, background workers, cron, managed Postgres и Redis. От $7/мес. Подходит: ИИ-агент с фоновыми задачами и cron.
Netlify — конкурент Vercel в нише статики и Jamstack. Подходит: лендинг на Astro / Hugo / Eleventy.
Fly.io — микро-ВМ Firecracker в 30+ регионах, Docker, persistent volumes, GPU-инстансы. Подходит: глобальная аудитория с упором на задержку.
AWS, GCP, Azure — энтерпрайз: полный стек, GPU (A100, H100, L4), managed-БД, ML-платформы (SageMaker, Vertex AI, Azure ML). Цены высокие, биллинг сложный, оплата только зарубежной картой. Для российского ИИ-стартапа в большинстве случаев избыточно.
LLM API для разработки — обзор
Свой инференс держать не обязательно. Большая часть продуктовых задач закрывается API-провайдерами.
- OpenAI API — GPT-5, o5-pro, эмбеддинги, Whisper. Из РФ нужна зарубежная карта.
- Anthropic API — Claude Opus 4.7, Sonnet 4.7, Haiku 4.5. Сильны на длинном контексте и разработке.
- Google AI Studio / Vertex — Gemini 2.5 Pro / Flash. Огромный контекст, мультимодальность.
- Together AI, Fireworks AI, Groq — open-source модели (Llama, Mistral, Qwen) через быстрый API, дешевле OpenAI.
- Replicate — каталог open-source моделей: Stable Diffusion, FLUX, Whisper, LLM.
- OpenRouter — единый шлюз ко всем перечисленным провайдерам, один API-ключ, оплата российской картой через посредников.
- GigaChat API (Сбер) — российский LLM, корпоративный SLA, оплата по счёту юр.лица.
- YandexGPT API — российский LLM от Яндекса, интеграция с Yandex Cloud и DataSphere.
Совет на старте: подключайтесь через OpenRouter и API нейросетей — это снимает большую часть вопросов с биллингом и переключением моделей.
Векторные базы данных — RAG-слой
Для RAG нужна векторная база. Основные варианты:
- pgvector — расширение Postgres, индексы HNSW и IVFFlat. Базовый и самый дешёвый выбор. Доступен в Timeweb Managed Postgres, Yandex Managed Postgres, Supabase, Neon.
- Qdrant — векторная БД на Rust, managed и self-hosted, масштабируется на десятки миллионов векторов.
- Weaviate — встроенный GraphQL, гибридный поиск, подходит для сложного семантического поиска.
- Pinecone — managed-only, самая простая интеграция, дорогая на масштабе, серверы за рубежом.
- Milvus — open-source, для сотен миллионов векторов в проде.
Правило: до 5 миллионов эмбеддингов — pgvector в той же Postgres. Дальше — Qdrant или Milvus.
Edge-инференс и self-hosted LLM
Edge-платформы запускают модели на POP-сети и сокращают задержку до 30–80 мс. Cloudflare Workers AI — готовые модели (Llama, Mistral, Whisper, эмбеддинги) на 300+ локациях, оплата за нейроны. Vercel AI SDK — стриминг ответов LLM и AI Gateway как прокси к моделям с кешем и rate-limit. Edge не отменяет основной API — это вспомогательный слой.
Self-hosted LLM — три базовых движка. Ollama: самый простой, моделей много через ollama pull, для прототипа. vLLM: production-grade, параллельные запросы и PagedAttention, в 3–10 раз быстрее Ollama. llama.cpp: C++ с квантованием (Q4–Q8), запускает модели на CPU и слабых GPU. Для прода — vLLM на RunPod или Selectel GPU в Docker.
GPU-хостинг для inference — цены 2026
GPU нужен для двух задач: inference (запуск готовой модели) и обучение / fine-tuning. Для inference достаточно RTX 4090 (24 ГБ VRAM) или A100 (40–80 ГБ), для тренировки больших моделей — H100.
- vast.ai — peer-to-peer marketplace. Самые низкие цены, без гарантий uptime. RTX 4090 от $0,27/час, A100 40 ГБ от $0,52/час, A100 80 ГБ от $0,67/час. Подходит: эксперименты, fine-tuning, R&D без жёсткого SLA.
- RunPod Secure Cloud — 99% uptime SLA. RTX 4090 от $0,34/час, A100 от $1,39/час, H100 PCIe от $1,99/час, L40S от $0,79/час. Подходит: production inference без управления железом.
- Lambda Labs — премиум: США, корпоративная поддержка, лучшая стабильность. A100 от $1,29/час, H100 от $2,49/час. Подходит: enterprise SLA, обучение крупных моделей.
- Selectel GPU — единственный массовый GPU-провайдер в РФ. RTX 4090 от 15 000 ₽/мес, A100 от 80 000 ₽/мес. 152-ФЗ, данные не покидают РФ. Подходит: корпоративный inference в РФ.
- Yandex DataSphere — managed-ML, почасовая аренда GPU (A100, V100), Jupyter, MLflow, интеграция с Foundation Models. Подходит: ML-эксперименты внутри экосистемы Яндекса.
Серверлесс для ИИ — оплата за вызов
- Cloudflare Workers AI — managed-inference на 300+ edge-локациях. Готовые модели: Llama 3, Mistral, Stable Diffusion, Whisper, эмбеддинги. Цена за нейроны, стартовый план $0. Минимальная задержка, нет cold start для популярных моделей. Минус: ограниченный набор моделей, нельзя катить свою без апрува.
- Vercel AI SDK + AI Gateway — стриминг LLM из Next.js, единый прокси к OpenAI, Anthropic, Google, Mistral, OpenRouter с одним ключом, лимитами и логами. Подходит: Next.js на Vercel, чат-интерфейс поверх внешних LLM.
- Modal — serverless-платформа для Python с GPU. Декоратор на функции, запуск на A100 / H100, оплата за секунды. Подходит: свой inference open-source без управления сервером, batch-обработка.
- Replicate — каталог open-source моделей (Stable Diffusion, FLUX, Llama, Whisper, MusicGen) с REST-API. Оплата за секунды inference. Подходит: генерация картинок / видео / аудио без своей инфры.
Сравнительная таблица провайдеров
| Провайдер | Локация | GPU | 152-ФЗ | Старт цена | Особенность |
|---|---|---|---|---|---|
| Timeweb Cloud | Москва, СПб | RTX 4090 | да | от 200 ₽/мес | Cloud Apps, Managed Postgres, S3 |
| Yandex Cloud | Владимир, Рязань | A100 | да, УЗ-1 | от 4 000 ₽/мес | Foundation Models, DataSphere |
| Selectel | Москва, СПб, Новосиб. | RTX 4090, A100, H100 | да | от 200 ₽/мес | лучший GPU в РФ, bare metal |
| VK Cloud | Москва | A100 | да | от 500 ₽/мес | интеграция с GigaChat, K8s |
| Reg.RU | Москва | нет | да | от 100 ₽/мес | дешёвый VPS, без GPU |
| Vercel | США, EU | нет | нет | $0 / $20 | эталон деплоя Next.js |
| Render | США, EU | нет | нет | $7/мес | фоновые задачи, cron |
| Fly.io | 30+ регионов | A100, L40S | нет | от $5/мес | Firecracker, edge |
| Railway | США | нет | нет | $5/мес | Postgres, Redis в комплекте |
| AWS | глобально | A100, H100 | нет | от $5 | полный стек, сложный биллинг |
| RunPod | США, EU | RTX 4090, A100, H100 | нет | от $0,34/час | secure cloud, SLA |
| vast.ai | глобально | RTX 4090, A100 | нет | от $0,27/час | marketplace, без SLA |
Для российской ИИ-команды дефолт — Timeweb (фронт + API + БД) + Selectel (GPU, если нужен) + OpenRouter для внешних LLM.
Tier хостинга по требованиям
Выбор не «один лучший провайдер», а правильный tier под этап проекта.
- Tier 0 — лендинг и статика (0 ₽/мес). Cloudflare Pages, GitHub Pages, Vercel Hobby, Timeweb Cloud Apps Start. Подходит: визитка, лендинг, документация. ИИ-функций нет или внешние через API.
- Tier 1 — MVP / прототип ($20–100/мес). Managed-платформа (Timeweb Cloud Apps, Railway, Render) + managed Postgres + OpenRouter. Подходит: первая 1 000 пользователей, чат-бот, демо-SaaS.
- Tier 2 — продакшен ($500–5 000/мес). VPS с балансировщиком, managed-БД, Redis, фоновые воркеры, мониторинг, S3, CDN. Inference — внешние LLM + serverless GPU (Modal, Replicate). Подходит: SaaS на 1k–100k MAU.
- Tier 3 — энтерпрайз ($10 000+/мес). Managed Kubernetes (Yandex Cloud, Selectel), шардинг Postgres, очереди (Kafka), свой inference на выделенных GPU (Selectel H100 / RunPod), observability-стек, on-call. Подходит: 100k+ MAU, SLA.
Главная ошибка: брать сразу Tier 3 «на вырост». Каждый лишний слой — оплата и сопровождение. Растите по факту нагрузки.
Под задачу — что брать
Хостинг зависит от типа ИИ-продукта.
- Чат-бот (Telegram, веб). Managed (Timeweb Cloud Apps, Railway) для бэка + Postgres для диалогов + Redis для rate-limit + OpenRouter или GigaChat для LLM.
- RAG (поиск по документам). VPS или managed для API + Postgres с pgvector + S3 для исходников + OpenAI / Anthropic для генерации.
- ИИ-агенты (с инструментами и долгими задачами). VPS или Render с фоновыми воркерами без лимита по времени + Postgres для состояния + BullMQ для очередей + LLM с tool-use (Claude Sonnet, GPT-5) + trace-платформа (Langfuse, Helicone).
- Генерация изображений. Replicate, Modal или Vercel AI SDK для FLUX / SDXL + S3 + CDN. Свой GPU окупается с 5k генераций в день и выше.
- Генерация видео. Replicate (Kling, Runway, Veo) + S3 c поддержкой больших файлов + очередь на долгие рендеры.
152-ФЗ и российская локализация
Если ИИ-проект обрабатывает персональные данные граждан РФ (имя + телефон, email + что-то ещё), вступает 152-ФЗ. Первичная база с персональными данными россиян обязана физически находиться в РФ.
Что это значит для хостинга:
- Vercel, Netlify, Cloudflare, Render, Fly.io, vast.ai, RunPod, Lambda Labs, Modal, Replicate — серверы за рубежом. Можно использовать для обработки обезличенных данных, но первичная БД должна быть в РФ.
- Timeweb, Yandex Cloud, Selectel — серверы в РФ, есть сертификация для УЗ-3 / УЗ-2 / УЗ-1.
- Корпоративные проекты с медицинскими, финансовыми, биометрическими данными — только аттестованный российский провайдер.
- Уведомление в Роскомнадзор как оператора ПД подаётся независимо от выбора хостинга.
Безопасный паттерн для ИИ-проекта с РФ-аудиторией: основная БД и приложение — в Timeweb / Yandex Cloud / Selectel, тяжёлый inference — через OpenRouter или GigaChat / YandexGPT по API.
Что можно и что нельзя по 152-ФЗ — короткий чек-лист
- Можно за рубежом: обезличенные эмбеддинги без связки с пользователем, агрегированная аналитика, кеш статики, фронт без форм.
- Только в РФ: ФИО, телефон, email, паспорт, СНИЛС, биометрия, медицинские, финансовые данные. Это первичная база.
- Серая зона: диалоги пользователей с ИИ. Если в них может быть имя или контакт — храните в РФ.
- Обработчик за рубежом (OpenAI / Anthropic / Replicate) допустим, если данные обезличены и не пересылается связка «персональные данные + контент».
Подробно про уведомление РКН и хранение — на странице 152-ФЗ и персональные данные.
Где хостинг не нужен — крайние случаи
Не каждому ИИ-проекту нужен сервер.
- Статический сайт-визитка. Astro, Hugo, Eleventy — сборка кладётся на Cloudflare Pages или GitHub Pages бесплатно. Никаких ВМ.
- Лендинг с формой. Cloudflare Pages + Telegram-бот через webhook на бесплатном Cloudflare Worker. Сервер не нужен.
- Прототип ИИ-функции внутри n8n / Make. Воркфлоу-платформа сама держит исполнение, ИИ через подключённый OpenAI / OpenRouter.
- Чат-бот на готовых платформах. Salebot, BotHelp, Telegram Mini Apps + Cloudflare Workers — серверов под управление нет.
- Демо-сайт в Notion / Tilda. Если задача — собрать обратную связь, поднимать инфру под это не нужно.
Правило: если ИИ-функция вызывается реже 100 раз в сутки и нет своих моделей — обходитесь без своей инфры. Подключайте API из платформы no-code.
Стоимость в год — три ключевых сценария
Чат-бот в Telegram (1 000 диалогов/день). Cloudflare Workers AI + KV — $0–10/мес. Timeweb VPS + OpenRouter — около 2 300 ₽/мес с учётом токенов.
MVP SaaS с ИИ-фичами (Next.js + Postgres + 1 000 пользователей). Vercel Pro + Vercel Postgres + OpenRouter — около $90/мес. Timeweb Cloud Apps + Managed Postgres + OpenRouter — около 5 400 ₽/мес. Railway + OpenRouter — около $60/мес. Для РФ-аудитории выигрывает Timeweb по совокупности (локализация + цена).
Свой inference Llama 3 8B 24/7. vast.ai RTX 4090 — около $194/мес без SLA. RunPod RTX 4090 Secure — около $245/мес с 99% SLA. Selectel RTX 4090 в РФ — 15 000 ₽/мес. Modal A10G по факту вызовов (1 000 запросов/день) — $30–60/мес.
При неравномерной нагрузке serverless GPU выигрывает в 3–5 раз. При постоянной — выделенный сервер дешевле.
Масштабирование — что меняется с ростом
- 0–100 пользователей — managed бесплатных планов хватает. Не оптимизируйте раньше времени.
- 100–10 000 — переход на платный managed-план или дешёвый VPS. БД на managed Postgres.
- 10 000–100 000 — VPS с балансировщиком, отдельная БД, CDN, кеш Redis, фоновые воркеры.
- 100 000+ — Kubernetes, шардинг БД, очереди (RabbitMQ / Kafka), мониторинг (Prometheus / Grafana), либо managed-Kubernetes в Yandex Cloud / Selectel.
ИИ-нагрузку выносите на отдельный слой раньше остального: inference — самая дорогая и непредсказуемая часть.
Главные ошибки выбора
- Vercel для российской аудитории. Серверы в США / Европе — задержка, риск блокировок, персональные данные россиян за рубежом. Лучше Timeweb / Yandex Cloud.
- Бесплатный план для production. Free-tier’ы имеют лимиты (трафик, build-минуты, время функций). При росте — внезапные счета или отключение.
- VPS без знания администрирования. Next.js на VPS требует знаний nginx, systemd, SSL. Если нет времени учиться — managed.
- Свой inference на CPU. Llama 3 8B на CPU выдаёт 2–5 токенов/сек — неюзабельно. Используйте OpenRouter или Cloudflare Workers AI.
- Игнорирование 152-ФЗ. Хранение персональных данных россиян за рубежом — нарушение. Основная БД — в РФ.
- Хардкод API-ключей. Ключи в коде утекают через git и приводят к блокировке аккаунтов. Только через env-переменные.
- Без бэкапов. На VPS обязательно настройте регулярные бэкапы БД и файлов. На managed — встроенные.
FAQ
Какой хостинг лучше для российского ИИ-проекта? Timeweb Cloud Apps для лёгкого API + managed Postgres + OpenRouter для inference. Свой inference в РФ — Selectel GPU. Корпоративный 152-ФЗ — Yandex Cloud или Selectel с аттестацией.
Можно ли разместить ИИ-проект бесплатно? Для прототипа — да. Cloudflare Workers AI даёт бесплатный inference готовых моделей, Vercel Hobby и Cloudflare Pages деплоят фронт, Timeweb Cloud Apps Start работает без оплаты до лимита трафика.
Vercel или Timeweb? Для глобальной аудитории и Next.js — Vercel. Для российской аудитории и оплаты картой РФ — Timeweb. Для проекта с персональными данными россиян — Timeweb / Yandex Cloud / Selectel из-за 152-ФЗ.
Нужен ли GPU для ИИ-проекта? Нет, если используете внешние API (OpenRouter, GigaChat, YandexGPT, OpenAI). Да, если хотите свой inference open-source моделей и есть смысл по экономике.
Что дешевле — свой GPU или API? API дешевле при нагрузке до 100k–500k токенов в день. Свой GPU окупается с миллиона токенов в день и выше при постоянной загрузке. Промежуточный вариант — serverless GPU (Modal, Replicate).
vast.ai или RunPod? vast.ai дешевле на 30–50%, без SLA — для экспериментов и fine-tuning. RunPod дороже, 99% uptime — для production inference.
Можно ли запускать локальные нейросети на обычном VPS? Технически — да через Ollama / vLLM, но без GPU скорость 2–5 токенов/сек. Для CPU подходят квантованные модели до 3B (Phi-3 mini, Llama 3.2 1B). Серьёзный inference 7B+ требует GPU.
Сколько RAM нужно для ИИ-проекта на Next.js? Минимум 2 ГБ для лёгкого MVP, реалистично — 4–8 ГБ. Image processing или локальный inference — 16+ ГБ. Inference 7B без GPU — 16–24 ГБ.
Что выбрать для масштабирования с 1 до 100 000 пользователей? Старт на managed (Timeweb Cloud Apps / Render / Railway), при росте — VPS с балансировщиком и отдельная БД, при 100k+ — managed Kubernetes (Yandex Cloud / Selectel) с шардингом и очередями.
Какой бюджет нужен на ИИ-MVP? Базовый MVP — 3 000–10 000 ₽/мес: managed-платформа, managed Postgres, лимит токенов через OpenRouter. Без своего GPU.
Как мигрировать с Vercel на российский хостинг?
Вынести env, перенести БД (pg_dump → pg_restore), залить S3-файлы через rclone, развернуть Docker-образ в Timeweb Cloud Apps или Yandex Cloud, перевести DNS. Подробности — на странице Timeweb Cloud.
Что такое cold start и как он мешает ИИ? Задержка первого запроса после простоя на serverless. Для лёгких функций 200–500 мс, для GPU-инференса 5–30 секунд. Решения: warm pool (Modal), edge-инференс (Cloudflare Workers AI), пинг-запросы.
Нужен ли Kubernetes на старте? Нет. Окупается с 5+ сервисов и команды от трёх человек. До этого — Docker Compose на одном VPS или managed-платформа.
Чем отличается inference от training по требованиям? Inference — VRAM под веса (Llama 8B — около 8 ГБ в Q4). Training — VRAM под веса + градиенты + оптимизатор (в 4–5 раз больше). Для обучения 70B — кластер из 8× H100.
Как страховаться от падения внешнего LLM-провайдера? Прокси-слой (OpenRouter, Vercel AI Gateway) с автоматическим fallback на резервный провайдер, retry с exponential backoff, кеш популярных ответов.
Дальше
- Vercel — деплой Next.js — managed-платформа для Next.js / Astro / Nuxt
- Selectel — GPU и облако в РФ — единственный массовый GPU-провайдер с 152-ФЗ
- Yandex Cloud — облако Яндекса — Foundation Models, DataSphere, Managed Kubernetes
- Timeweb Cloud — баланс цены и простоты — Cloud Apps, Managed Postgres, S3
- VK Cloud — облако VK — GigaChat-интеграция, Kubernetes, 152-ФЗ
- Supabase — open-source Firebase — Postgres, Auth, Storage, Edge Functions
- Neon — serverless Postgres — branching БД, autoscale, edge-доступ
- OpenRouter — единый шлюз к LLM — как платить за inference из РФ без своего GPU
- База данных для проекта — Managed Postgres, MySQL, S3, Redis
- 152-ФЗ и персональные данные — что хранить в РФ и как уведомить Роскомнадзор
- API нейросетей — обзор API OpenAI, Anthropic, Google, Mistral, GigaChat, YandexGPT
- ИИ для разработчика — инструменты, фреймворки, паттерны
Читайте также
- Clip.co: $2M на анимации + 1 млрд просмотров на свой контент — $170K/мес
- Hush: $48M из $4 000 за 48 месяцев через обзвон клиентов — $1M/мес
- Нейросеть для презентаций бесплатно: 7 рабочих вариантов в 2026
- Бесплатные нейросети для картинок: подборка 2026 (лимиты, доступ из РФ)
- Автоматизация консультаций через ИИ 2026 — стек и сценарии
- Early: $50K/мес на будильнике с отжиманиями — $50K/мес
- GoTall: приложение-предсказатель роста на $100K/мес — $100K/мес