Блог подборка

API нейросетей: обзор провайдеров и цен в 2026

API нейросети — программный интерфейс, через который приложение шлёт промт модели и получает сгенерированный ответ. Нужен для продукта на ИИ: бот, ассистент, фича внутри сервиса, RAG. В 2026 рынок поделён между западными (OpenAI, Anthropic, Google, Mistral), российскими (GigaChat, YandexGPT, MWS GPT), китайскими и open-weight (DeepSeek, Qwen, Llama) и агрегаторами (OpenRouter, Together, российские прокси).

Что такое API нейросети

API — контракт: код шлёт HTTPS-запрос с промтом и параметрами, в ответ приходит JSON со сгенерированным текстом. Схема: регистрация → пополнение баланса → API-ключ → SDK или прямой HTTPS-запрос → оплата по факту за каждый входной и выходной токен.

Токен — минимальная единица, на которые модель разбивает текст. Один токен — около 0.75 английского слова или 0.5-0.7 русского. Цена считается за 1M токенов отдельно для входа (prompt) и выхода (completion). Короткий тех-документ на 5 страниц — 3-4 тысячи токенов.

Большинство API совместимо с форматом OpenAI Chat Completions — один клиент работает с Anthropic, Gemini, DeepSeek, Mistral, OpenRouter, Together. Это drop-in совместимость: подменили base_url и model — логику выше клиента переписывать не нужно. Несовместимы лишь GigaChat (свой OAuth), YandexGPT (REST с JWT) и нативный AWS Bedrock.

REST endpoint и формат

Каноничный endpoint — POST /v1/chat/completions. Body — JSON с массивом messages (роли system / user / assistant), model, temperature, max_tokens. Ответ — JSON с choices[0].message.content и блоком usage. Для streaming — "stream": true, чанки в формате SSE. У Anthropic Messages API system — отдельное поле, ответ — массив content блоков (text, tool_use, thinking). Gemini параллельно с нативным API держит OpenAI-совместимый endpoint.

Провайдеры API нейросетей

OpenAI API — ChatGPT API

Что: GPT-5.4 ($2.50/$15, кэш $0.25), Mini ($0.75/$4.50), Nano ($0.20/$1.25), o4 reasoning ($20/$80), Whisper, DALL-E 4, embeddings.

Когда выбрать: универсальные задачи, multimodal, tool calling, reasoning уровня o4. Из РФ: регистрация через VPN с не-российским номером, после API работает с российского IP, оплата зарубежной картой или через OpenRouter. Контекст до 1M, prompt caching (10% входа), Batch API −50%, Realtime API для голоса, structured outputs. Подробнее — ChatGPT обзор.

Anthropic API — Claude API

Что: Claude Opus 4.8 ($5/$25, кэш $0.50), Sonnet 4.6 ($3/$15, кэш $0.30), Haiku 4.5 ($1/$5, кэш $0.10).

Когда выбрать: длинные тексты, программирование, рассуждения, ИИ-агенты, code review. Sonnet 4.6 — баланс. Opus 4.8 — флагман для кода, основная модель Claude Code. Доступ из РФ — VPN при регистрации, дальше напрямую. Оплата — зарубежной картой или через OpenRouter. Контекст 1M, prompt caching, Message Batches −50%, tool use, computer use, vision. Подробнее — Anthropic обзор.

Google Gemini API

Что: Gemini 3.1 Pro ($2/$12), Flash ($0.30/$2.50), Flash-Lite ($0.075/$0.30), Imagen 4, Veo 3.

Когда выбрать: длинный контекст до 2M на Pro, мультимодальность с видео, бесплатный tier, нативная работа с PDF и аудио. Из РФ — VPN при регистрации, оплата через Google Cloud Billing зарубежной картой. На контексте больше 200k цены удваиваются. Free tier 50 RPD к Pro, разбор PDF без OCR, function calling, code execution.

GigaChat API — Сбер

Что: GigaChat-2-Max (~1850/1950 ₽ за 1M), GigaChat-2-Pro (~1455/1500), GigaChat Lite (~190/200), Кандинский 4.0, эмбеддинги.

Когда выбрать: русский, 152-ФЗ, оплата картой РФ, независимость от запада. Без VPN, авторизация через Сбер ID, оплата Сбербанк / СБП / банковский перевод. Серверы в РФ, хороший русский, OAuth 2.0, function calling. Подробнее — GigaChat обзор.

YandexGPT API — Yandex AI Studio

Что: YandexGPT 5 Pro, YandexGPT 5 Lite, YandexART, SpeechKit, эмбеддинги. Цена 0.20-1.20 ₽ за 1k токенов; асинхронный режим в 2 раза дешевле.

Когда выбрать: русский, экосистема Yandex.Cloud (БД, S3, Functions), карта РФ, 152-ФЗ. Без VPN, через Yandex ID. Оплата — Yandex.Cloud billing. Function calling, structured output, IAM-токены, SLA 99.9%. Подробнее — YandexGPT обзор.

DeepSeek API

Что: DeepSeek V4 Pro ($1.74/$7), V3.2 ($0.27/$1.10), R1 reasoning ($0.55/$2.20).

Когда выбрать: самая выгодная цена среди флагманов, open-source веса. Из РФ без VPN, российские карты не принимаются, удобнее через OpenRouter. В 6-19 раз дешевле GPT-5.4 и Claude Opus при сопоставимом качестве, открытые веса (vLLM, Ollama), OpenAI-совместимый формат. Подробнее — DeepSeek обзор.

Mistral API

Что: Mistral Large 3 ($2/$6), Medium 3 ($0.40/$2), Small 3 ($0.10/$0.30), Codestral ($0.30/$0.90), Pixtral (vision), embeddings.

Когда выбрать: европейский провайдер, серверы во Франции, открытые веса у части моделей, Codestral для FIM-генерации кода. VPN при регистрации, зарубежная карта. Бесплатный tier (~1 req/sec), function calling, JSON mode.

OpenRouter — агрегатор API нейросетей

Что: единый API, через который доступно 300+ моделей: OpenAI, Anthropic, Google, DeepSeek, Mistral, Meta Llama, xAI, Qwen.

Цена: прайс провайдера плюс комиссия около 5% при пополнении. На бесплатных моделях (часть Llama, часть DeepSeek free-tier) — без оплаты, но с лимитом 20 запросов в минуту.

Когда выбрать: MVP, A/B-тест моделей, отказ от vendor lock-in, один ключ вместо десяти, без VPN. Регистрация и работа без VPN. Оплата — зарубежной картой или криптой. Автоматический fallback на резервную модель, статистика по провайдерам (задержка, uptime). Подробнее — OpenRouter обзор.

Replicate и fal.ai — агрегаторы под медиа

Replicate — маркетплейс image / video / audio моделей (FLUX, SDXL, Whisper, MusicGen), оплата — секунды GPU-времени. fal.ai — низкая латентность генерации картинок и видео (FLUX, Recraft, Hailuo, Kling) для real-time UI. Оба — для медиа, не чат-LLM. Доступ из РФ — VPN на регистрацию, зарубежная карта.

Together AI — хостинг open-source

Что: Llama 3.3/4 ($0.27/$0.85 Maverick), Qwen 3 235B ($0.18/$0.60), DeepSeek V3.2 ($0.27/$1.10), Mixtral 8x22B ($1.20/$1.20), Mistral, FLUX.

Когда выбрать: open-weight модели без своей инфры, скорость inference, fine-tuning под свой домен. VPN при регистрации, зарубежная карта. OpenAI-совместимый формат, dedicated endpoints, fine-tuning через API.

MWS GPT и другие российские

MWS GPT (МТС AI) — LLM от МТС в B2B-формате, контракт через менеджера, серверы в РФ, 152-ФЗ. T-Bank AI / T-Lite (8B, open-weight, Apache 2.0) — на HuggingFace, публичного API нет, запускают через vLLM / Ollama. SaluteSpeech (Сбер) — аналог Whisper для русского STT.

Российские агрегаторы LLM-API

Параллельно с OpenRouter рынок РФ закрывают локальные прокси — принимают карту РФ или счёт юрлица.

СервисНаценка над ЦБОплатаОсобенности
ProxyAPI×3.7–4.3карта, СБП, счёткаталог, документы
AITUNNEL×2–2.3карта, счёт200+ моделей
VseGPT×2.0карта, счётинженерный фокус
Polza.ai×1.5–1.8картабюджетный
BotHubсредняякартагибрид чат + API
PromptraЦБ + 5%карта, счётближе к OpenRouter

Для MVP разница в наценке некритична, для production каждый множитель режет маржу. Юрлицам с НДС нужен агрегатор-ООО. Все российские агрегаторы — OpenAI-совместимы.

Сравнительная таблица

ПровайдерЛучшее вЦена флагманаИз РФОплата РФ
OpenAIuniversal + multimodal$2.5 / $15VPN при регнет
Anthropicкод, длинные тексты$5 / $25VPN при регнет
Google Geminiдлинный контекст, видео$2 / $12VPN при регнет
Mistralевропейский, открытые веса$2 / $6VPN при регнет
GigaChatрусский, 152-ФЗ~1 950 ₽/1Mбез VPNда
YandexGPTрусский, экосистема~1 200 ₽/1Mбез VPNда
DeepSeekдёшево, качество$1.74 / $7без VPNнет
Togetheropen-weight, fine-tune$0.27 / $1.10VPN при регнет
OpenRouterудобство, агрегаторпрайс +5%без VPNкрипта
Promptraагрегатор RU, ОООпрайс +5%без VPNда

Сравнение моделей: цена, контекст, латентность

TTFT — медиана time-to-first-token, округлено и варьируется по регионам.

МодельВход $/1MВыход $/1MКонтекстTTFT
GPT-5.4$2.50$15.001M0.6 c
GPT-5.4 Mini$0.75$4.50400k0.4 c
GPT-5.4 Nano$0.20$1.25200k0.3 c
o4 reasoning$20.00$80.00400k2-30 c
Claude Opus 4.8$5.00$25.001M0.8 c
Claude Sonnet 4.6$3.00$15.001M0.5 c
Claude Haiku 4.5$1.00$5.00400k0.3 c
Gemini 3.1 Pro$2.00$12.002M0.7 c
Gemini 2.5 Flash$0.30$2.501M0.4 c
Gemini Flash-Lite$0.075$0.301M0.3 c
Mistral Large 3$2.00$6.00256k0.5 c
DeepSeek V4 Pro$1.74$7.00256k0.7 c
DeepSeek V3.2$0.27$1.10128k0.5 c
DeepSeek R1$0.55$2.20128k1-15 c
Llama 4 Maverick$0.27$0.85128k0.3 c
Qwen 3 235B$0.18$0.60128k0.4 c

Reasoning-модели (o4, R1) дают TTFT в десятки секунд — модель прогоняет внутренний chain-of-thought, и каждый токен тарифицируется как выходной. Для интерактива не подходят.

Аутентификация: API key, OAuth, JWT

Статичный API-ключ. OpenAI, Anthropic, Gemini, DeepSeek, Mistral, OpenRouter, Together. Заголовок Authorization: Bearer sk-... или x-api-key. Ротация — вручную через панель. Хранить в секрет-менеджере (Yandex Lockbox, Vault, GitHub Secrets), не в коде и не на фронте.

OAuth 2.0. GigaChat — обмен client_id:secret на access-токен с TTL 30 минут. Подходит для корпоративных интеграций.

IAM-токен (JWT). YandexGPT и Yandex.Cloud. Сервисный аккаунт → JWT → IAM-токен на 12 часов. Даёт привязку к ролям Yandex.Cloud (S3, Functions, Lockbox).

Workload identity. Vertex AI и AWS Bedrock — авторизация по identity процесса (Cloud Run, Lambda) без ключа. Лучше всего для production внутри облака.

Rate limits и Tier system

Лимиты делятся на RPM (запросы/мин), TPM (токены/мин), RPD (запросы/день).

  • OpenAI — 5 уровней. Tier 1 (без истории) — 500 RPM, 30k TPM. Tier 5 (от $1000 + 30 дней) — 10 000 RPM, 30M TPM.
  • Anthropic — 4 уровня. Tier 1 (депозит $5) — 50 RPM, 50k/10k TPM на Sonnet. Tier 4 (от $400 + 7 дней) — 4000 RPM.
  • Gemini — Free 50 RPD к Pro. Paid Tier 1 — 1000 RPM. Дальше по тратам.
  • GigaChat / YandexGPT — per workspace, 100-300 RPM, поднимаются заявкой.
  • OpenRouter — лимит провайдера + общий. На free-моделях 20 RPM, 200 RPD.

На превышении — 429 Too Many Requests с Retry-After. Обязательно: backoff с jitter, circuit breaker, fallback. Без этого первый всплеск выбьет сервис.

Multimodal API: vision, audio, video

Vision. GPT-5.4, Claude Opus/Sonnet, Gemini 3.1 Pro, YandexGPT 5 Pro, GigaChat-2-Max принимают image_url или base64. Картинка 1024×1024 ≈ 1500-2000 токенов. Сценарии: распознавание чеков, разбор документов, описание скриншотов.

Audio. OpenAI Whisper API ($0.006/мин), GPT-5.4 Realtime для синхронного диалога, ElevenLabs для TTS, Yandex SpeechKit для русского STT/TTS. Gemini принимает аудио файлом.

Video. Gemini 3.1 Pro принимает видео как input — единственный среди флагманов с нативной поддержкой в чат-API. Генерация — Veo 3, Sora API, Kling, Runway Gen-4.

Function calling и tool use

Function calling — модель возвращает не текст, а вызов функции с JSON-аргументами. Клиент выполняет, отдаёт результат, модель формирует финальный ответ. Основа ИИ-агентов и RAG.

Поддерживают: OpenAI (tools в Chat Completions), Anthropic (tool_use в Messages API), Gemini (function_declarations), Mistral, GigaChat, YandexGPT (свой формат), DeepSeek и Llama через Together. Описание — JSON-схема с name, description, parameters. В ответе — tool_calls с распарсенным объектом, без regex по тексту.

Поверх function calling строятся ReAct-агенты, доступ к БД через SQL-tool, MCP-серверы, computer use у Claude (модель двигает курсором через tool calls).

Доступ из РФ

Без VPN и российской картой работают только GigaChat и YandexGPT. Остальные — через прокси-агрегатор (OpenRouter с оплатой криптой или Vsegpt.ru с картой РФ и наценкой ~20%) либо через зарубежную карту и VPN на регистрацию. Сам API западных провайдеров российские IP обычно не блокирует — production с прямого ключа работает без VPN. Для проектов с клиентскими данными — GigaChat или YandexGPT. Для остального — OpenRouter как точка входа плюс прямой ключ провайдера на основной объём.

Способы оплаты API из РФ

  • Карта РФ — через российские агрегаторы (ProxyAPI, AITUNNEL, VseGPT, Polza.ai, Promptra) или провайдеров (GigaChat, YandexGPT, MWS GPT).
  • Зарубежная карта — Казахстан, Кыргызстан, Армения, ОАЭ или виртуальные эмитенты (Cardvcc, Bybit Card, Wirex). Принимают OpenAI, Anthropic, Gemini, Mistral, Together.
  • Криптовалюта (USDT / BTC / ETH) — OpenRouter, Together AI, fal.ai, Replicate.
  • Расчётный счёт юрлица — российские провайдеры и агрегаторы-ООО, с договором, актом, счёт-фактурой.
  • СБП — GigaChat, YandexGPT, часть российских агрегаторов.
  • Yandex.Cloud / VK Cloud Billing — пополнение облака, оттуда списываются YandexGPT и Sber-модели.

Drop-in совместимость

OpenAI-протокол /v1/chat/completions стал де-факто стандартом. Anthropic, Google, DeepSeek, Mistral, Together, OpenRouter, российские агрегаторы — все держат совместимый endpoint. Локальные движки (Ollama, vLLM, LM Studio, llama.cpp) тоже поднимают OpenAI-совместимый endpoint. Прикладной код не отличает локальную Qwen 3 от облачного GPT-5.4 — vendor lock-in снимается до уровня переменной окружения.

Примеры запросов

curl — OpenRouter

curl https://openrouter.ai/api/v1/chat/completions \
 -H "Authorization: Bearer $OPENROUTER_API_KEY" \
 -H "Content-Type: application/json" \
 -d '{"model":"anthropic/claude-sonnet-4.6",
 "messages":[{"role":"system","content":"Ты опытный редактор."},
 {"role":"user","content":"Исправь грамматику:..."}],
 "temperature":0.7, "max_tokens":1000}'

Python — Anthropic SDK с prompt caching

from anthropic import Anthropic
client = Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])

response = client.messages.create(
 model="claude-sonnet-4-6",
 max_tokens=1024,
 system=[{"type": "text", "text": "Ты опытный редактор...",
 "cache_control": {"type": "ephemeral"}}],
 messages=[{"role": "user", "content": "Исправь грамматику:..."}]
)
print(response.content[0].text)
print("cache_read:", response.usage.cache_read_input_tokens)

JavaScript — OpenAI SDK через OpenRouter

import OpenAI from "openai";
const client = new OpenAI({
 apiKey: process.env.OPENROUTER_API_KEY,
 baseURL: "https://openrouter.ai/api/v1",
});
const response = await client.chat.completions.create({
 model: "openai/gpt-5.4-mini",
 messages: [
 { role: "system", content: "Ты опытный редактор." },
 { role: "user", content: "Исправь грамматику:..." },
 ],
 stream: true,
});
for await (const chunk of response) {
 process.stdout.write(chunk.choices[0]?.delta?.content || "");
}

GigaChat и YandexGPT — не OpenAI-совместимые. У GigaChat собственный SDK с OAuth, у YandexGPT — REST с IAM-токеном. Примеры — на страницах GigaChat и YandexGPT.

Что нужно для production

Pet-проект запускается на одном ключе. Боевой продукт требует семи слоёв:

  1. Retry + backoff. 5xx и таймауты — exponential backoff (1s → 2s → 4s → 8s) с jitter. 4xx — отдавать наверх. Idempotency-key против дублей.
  2. Circuit breaker. На 5-10 подряд 429 / 5xx — закрыть провайдера на 30 секунд, переключить на fallback.
  3. Fallback. Резервный провайдер на случай простоя основного. OpenRouter делает это нативно через параметр models.
  4. Streaming. SSE для чат-интерфейсов: первые токены через 200-400 мс вместо 5-15 секунд ожидания.
  5. Кэширование. Provider prompt caching (−90% на повторяющийся вход) плюс прикладное (Redis на одинаковые запросы).
  6. Batch API. Задачи до 24 часов (разметка, заголовки, аналитика) через Batch у OpenAI и Anthropic, цена −50%.
  7. Мониторинг. Лог каждого вызова: токены, стоимость, latency, статус. Метрики в Prometheus / Yandex Monitoring, алерты на 5xx и превышение бюджета.

Типичный обмен (500 input + 1000 output) — $0.028 на Claude Opus 4.8, $0.016 на GPT-5.4, $0.0012 на DeepSeek V3.2, ~1.5 ₽ на GigaChat-2-Max. На 10 000 запросов в день это около $8 400, $4 800, $360, 450 000 ₽ в месяц. Точный прогноз — по замерам пилота.

152-ФЗ при API-вызовах с клиентскими данными

Если в API улетают персональные данные клиентов (имя, телефон, email, переписка, фото) — продукт попадает под 152-ФЗ. Требования:

  • Согласие клиента на обработку с упоминанием передачи провайдеру ИИ в политике конфиденциальности.
  • Хранение ПДн на серверах в РФ (Yandex.Cloud, Selectel, Timeweb, VK Cloud), не AWS / GCP / Azure.
  • Регистрация оператора ПДн через pd.rkn.gov.ru.
  • Локализация ИИ-обработки. Данные клиента напрямую в OpenAI / Anthropic — формально нарушение. Решения: GigaChat или YandexGPT (серверы в РФ), локальная open-weight модель на своём GPU, либо обезличивание перед отправкой.
  • Договор с обработчиком. У Yandex.Cloud есть стандартное поручение на обработку ПДн. DPA OpenAI и Anthropic к 152-ФЗ не приравнивается.

Чистый вариант для B2C с российскими пользователями — GigaChat или YandexGPT. Зарубежные провайдеры — для задач без ПДн.

Векторные API: pgvector, Pinecone, Weaviate, Qdrant

RAG-сценарий: документ режется на куски, каждый кусок переводится в вектор через embedding-модель и кладётся в векторную базу. На запрос ищется N ближайших по косинусу, куски подкладываются в промт как контекст.

pgvector — расширение PostgreSQL, векторы в обычной таблице, индекс HNSW или IVFFlat. Подходит до 50M векторов. Доступен в Yandex.Cloud Postgres, Timeweb, VK Cloud — 152-ФЗ, сервер в РФ. Pinecone — managed SaaS, vector-only, серверы в США/ЕС, от $50/мес, карту РФ не принимает. Weaviate — open-source, гибридный поиск (вектор + BM25). Qdrant — open-source на Rust, один из лидеров по скорости.

Embedding-API: text-embedding-3-large OpenAI ($0.13/1M), voyage-3 ($0.18/1M), Cohere embed-multilingual-v4, эмбеддинги GigaChat и YandexGPT для русского. Для русскоязычного RAG лучше работают GigaChat / YandexGPT или multilingual-модели.

Use-cases: чат-бот, RAG, агент, аналитика

Чат-бот. System-prompt + история + streaming. FAQ, поддержка, продуктовый помощник.

RAG. Документы → chunks (300-800 токенов) → embeddings → vector-DB. На запрос: embed → топ-N чанков → промт «отвечай по контексту» → ответ. Сценарии: поиск по корпоративной базе, помощник по документации, «спроси у договоров».

Агент (ReAct). Модель вызывает инструменты через function calling — search, SQL, code-exec, MCP-сервер. Цикл «модель → tool_call → результат → модель» крутится до финала. Сценарии: аналитик-бот к БД, триаж тикетов, Claude Code как dev-агент.

Аналитика. Тональность отзывов, выделение сущностей, категоризация — через Batch API (−50%) с structured output.

Генерация контента. SEO, описания товаров, перевод. Связка: reasoning — план, дешёвая — текст, средняя — fact-check.

Self-host: Ollama, vLLM, llama.cpp

Когда облако не подходит — данные не должны покидать сервер, либо объём такой, что железо дешевле API.

Ollama — daemon с OpenAI-совместимым endpoint на localhost:11434. Llama 4, Qwen 3, DeepSeek, Mistral, Phi, Gemma из коробки. Для разработки и personal use. vLLM — production-сервер с PagedAttention и continuous batching. Стандарт серьёзного inference. llama.cpp server — GGUF, квантование Q4/Q5/Q8, работа на CPU и потребительских GPU. TGI от Hugging Face — альтернатива vLLM.

GPU-аренда: Yandex.Cloud Compute, VK Cloud, Selectel — для 152-ФЗ; RunPod, vast.ai, Lambda Cloud — вне РФ. Подробнее — хостинг для AI-проекта.

Когда API не нужен

Включать API стоит, если есть конкретный сценарий — диалог, генерация уникальных текстов, поиск по своей базе, агент. Без сценария API превращается в строку расхода.

Простой контентный сайт. Лендинг, визитка, статичные услуги — текст пишет редактор один раз. Подключать LLM «для генерации описаний» — лишняя зависимость и месячный счёт без отдачи.

Статика. Документация, прайс, контакты, FAQ — чат-виджет здесь не открывают. Если статистика обращений показывает поток вопросов вне FAQ, бот оправдан, иначе нет.

Одноразовая задача. «Один раз переписать 50 заголовков», «один раз перевести 200 карточек» — нет смысла в API-интеграции. Откройте ChatGPT / Claude / GigaChat-чат и сделайте партиями в браузере, либо разовый Batch.

Жёсткая логика по правилам. Валидация форм, расчёт скидок, статусные переходы — это if / else. LLM на детерминированной логике медленнее, дороже и менее предсказуема.

Тривиальное преобразование данных. Парсинг CSV, конвертация форматов, сортировка — обычный код. LLM нужна только там, где правило задать невозможно.

FAQ

Что такое API нейросети простыми словами? Способ подключить чужую нейросеть к вашему коду. Шлёте текст провайдеру, провайдер запускает модель и возвращает ответ. Платите за фактические токены, не за месячную подписку.

Сколько стоит API нейросети? От $0.075 за 1M входных токенов (Gemini 2.5 Flash-Lite) до $80 за 1M выходных (OpenAI o4). Флагманы Claude Opus и GPT-5.4 — $2.5-$5 за вход и $15-$25 за выход. GigaChat и YandexGPT — 0.2-1.95 ₽ за 1k токенов.

Можно ли подключить API из России? Да, всех. GigaChat и YandexGPT — без VPN и с картой РФ. OpenAI, Anthropic, Gemini, DeepSeek, Mistral, Together — VPN при регистрации и зарубежная карта или крипта. Альтернатива — OpenRouter, без VPN, с криптой, либо российские агрегаторы (ProxyAPI, Promptra, AITUNNEL).

Какой API самый дешёвый? DeepSeek V3.2 — $0.27 / $1.10 за 1M, бюджетный флагман. Qwen 3 на Together — $0.18 / $0.60. Gemini 2.5 Flash-Lite — $0.075 / $0.30. Бесплатные tier — Google AI Studio, OpenRouter, Mistral, Groq.

Какой API лучший для российского продукта? При требовании 152-ФЗ — GigaChat или YandexGPT. Без VPN, рубли, серверы в РФ. Для качества на международных задачах — Claude Sonnet через OpenRouter.

Прямой API или OpenRouter? MVP и прототипы — OpenRouter, снимает проблему оплаты. Production с объёмом больше $1k/мес — прямой ключ провайдера. Можно совмещать: основной трафик на прямом ключе, fallback на OpenRouter.

Безопасно ли отправлять клиентские данные в API? На платных тарифах OpenAI и Anthropic данные не используются для обучения и хранятся ~30 дней для расследования инцидентов. На бесплатных tier’ах — обычно используются. Для конфиденциальных данных — Zero Retention на Enterprise либо локальная open-weight модель.

Может ли API работать офлайн? Облачные — нет. Open-weight модели (Llama 4, Qwen 3, Mistral, DeepSeek с открытыми весами) запускаются через Ollama или vLLM. Качество отстаёт от облачных Claude и GPT на 1-2 поколения, но Qwen 3 235B и DeepSeek V3.2 уже подбираются к флагманам.

Чем отличаются Batch API и обычный? Batch — асинхронный режим: до 50 000 запросов одним файлом, результат за 24 часа, цена −50%. Подходит для разметки, заголовков, массовой суммаризации. Для интерактива — обычный синхронный API.

С чего начать работу с API нейросети? Выберите провайдера: для русского B2C — GigaChat / YandexGPT, для прототипа без VPN — OpenRouter, для дешёвого сценария — DeepSeek. Получите ключ, положите в .env, поставьте SDK (openai, anthropic) или используйте curl. После рабочего ответа добавляйте retry/backoff, streaming, кэш, мониторинг бюджета.

Что такое prompt caching? Повторяющаяся часть промта (system-инструкция, длинный контекст) запоминается провайдером и оплачивается со скидкой ~90%. У Anthropic — cache_control с TTL 5 минут / 1 час. У OpenAI — автоматически на префиксе ≥1024 токенов. У DeepSeek — нативный кэш с отдельным тарифом на чтение.

Можно ли подключить API без программирования? Частично. No-code-инструменты (n8n, Make, Zapier, Albato) дают визуальные блоки OpenAI / Anthropic / Gemini / GigaChat. Для прототипа достаточно. Сложные сценарии (агенты, RAG) требуют кода.

Дальше

Для практики — точка входа без VPN — OpenRouter; open-weight на быстром inference — Together AI; флагманы — ChatGPT API и Claude API. Для русскоязычного B2C — GigaChat и YandexGPT. Для дешёвого массового сценария — DeepSeek с Batch. Self-host (152-ФЗ или закрытый контур) — гайд хостинг для AI-проекта.