API нейросетей: обзор провайдеров и цен в 2026
API нейросети — программный интерфейс, через который приложение шлёт промт модели и получает сгенерированный ответ. Нужен для продукта на ИИ: бот, ассистент, фича внутри сервиса, RAG. В 2026 рынок поделён между западными (OpenAI, Anthropic, Google, Mistral), российскими (GigaChat, YandexGPT, MWS GPT), китайскими и open-weight (DeepSeek, Qwen, Llama) и агрегаторами (OpenRouter, Together, российские прокси).
Что такое API нейросети
API — контракт: код шлёт HTTPS-запрос с промтом и параметрами, в ответ приходит JSON со сгенерированным текстом. Схема: регистрация → пополнение баланса → API-ключ → SDK или прямой HTTPS-запрос → оплата по факту за каждый входной и выходной токен.
Токен — минимальная единица, на которые модель разбивает текст. Один токен — около 0.75 английского слова или 0.5-0.7 русского. Цена считается за 1M токенов отдельно для входа (prompt) и выхода (completion). Короткий тех-документ на 5 страниц — 3-4 тысячи токенов.
Большинство API совместимо с форматом OpenAI Chat Completions — один клиент работает с Anthropic, Gemini, DeepSeek, Mistral, OpenRouter, Together. Это drop-in совместимость: подменили base_url и model — логику выше клиента переписывать не нужно. Несовместимы лишь GigaChat (свой OAuth), YandexGPT (REST с JWT) и нативный AWS Bedrock.
REST endpoint и формат
Каноничный endpoint — POST /v1/chat/completions. Body — JSON с массивом messages (роли system / user / assistant), model, temperature, max_tokens. Ответ — JSON с choices[0].message.content и блоком usage. Для streaming — "stream": true, чанки в формате SSE. У Anthropic Messages API system — отдельное поле, ответ — массив content блоков (text, tool_use, thinking). Gemini параллельно с нативным API держит OpenAI-совместимый endpoint.
Провайдеры API нейросетей
OpenAI API — ChatGPT API
Что: GPT-5.4 ($2.50/$15, кэш $0.25), Mini ($0.75/$4.50), Nano ($0.20/$1.25), o4 reasoning ($20/$80), Whisper, DALL-E 4, embeddings.
Когда выбрать: универсальные задачи, multimodal, tool calling, reasoning уровня o4. Из РФ: регистрация через VPN с не-российским номером, после API работает с российского IP, оплата зарубежной картой или через OpenRouter. Контекст до 1M, prompt caching (10% входа), Batch API −50%, Realtime API для голоса, structured outputs. Подробнее — ChatGPT обзор.
Anthropic API — Claude API
Что: Claude Opus 4.8 ($5/$25, кэш $0.50), Sonnet 4.6 ($3/$15, кэш $0.30), Haiku 4.5 ($1/$5, кэш $0.10).
Когда выбрать: длинные тексты, программирование, рассуждения, ИИ-агенты, code review. Sonnet 4.6 — баланс. Opus 4.8 — флагман для кода, основная модель Claude Code. Доступ из РФ — VPN при регистрации, дальше напрямую. Оплата — зарубежной картой или через OpenRouter. Контекст 1M, prompt caching, Message Batches −50%, tool use, computer use, vision. Подробнее — Anthropic обзор.
Google Gemini API
Что: Gemini 3.1 Pro ($2/$12), Flash ($0.30/$2.50), Flash-Lite ($0.075/$0.30), Imagen 4, Veo 3.
Когда выбрать: длинный контекст до 2M на Pro, мультимодальность с видео, бесплатный tier, нативная работа с PDF и аудио. Из РФ — VPN при регистрации, оплата через Google Cloud Billing зарубежной картой. На контексте больше 200k цены удваиваются. Free tier 50 RPD к Pro, разбор PDF без OCR, function calling, code execution.
GigaChat API — Сбер
Что: GigaChat-2-Max (~1850/1950 ₽ за 1M), GigaChat-2-Pro (~1455/1500), GigaChat Lite (~190/200), Кандинский 4.0, эмбеддинги.
Когда выбрать: русский, 152-ФЗ, оплата картой РФ, независимость от запада. Без VPN, авторизация через Сбер ID, оплата Сбербанк / СБП / банковский перевод. Серверы в РФ, хороший русский, OAuth 2.0, function calling. Подробнее — GigaChat обзор.
YandexGPT API — Yandex AI Studio
Что: YandexGPT 5 Pro, YandexGPT 5 Lite, YandexART, SpeechKit, эмбеддинги. Цена 0.20-1.20 ₽ за 1k токенов; асинхронный режим в 2 раза дешевле.
Когда выбрать: русский, экосистема Yandex.Cloud (БД, S3, Functions), карта РФ, 152-ФЗ. Без VPN, через Yandex ID. Оплата — Yandex.Cloud billing. Function calling, structured output, IAM-токены, SLA 99.9%. Подробнее — YandexGPT обзор.
DeepSeek API
Что: DeepSeek V4 Pro ($1.74/$7), V3.2 ($0.27/$1.10), R1 reasoning ($0.55/$2.20).
Когда выбрать: самая выгодная цена среди флагманов, open-source веса. Из РФ без VPN, российские карты не принимаются, удобнее через OpenRouter. В 6-19 раз дешевле GPT-5.4 и Claude Opus при сопоставимом качестве, открытые веса (vLLM, Ollama), OpenAI-совместимый формат. Подробнее — DeepSeek обзор.
Mistral API
Что: Mistral Large 3 ($2/$6), Medium 3 ($0.40/$2), Small 3 ($0.10/$0.30), Codestral ($0.30/$0.90), Pixtral (vision), embeddings.
Когда выбрать: европейский провайдер, серверы во Франции, открытые веса у части моделей, Codestral для FIM-генерации кода. VPN при регистрации, зарубежная карта. Бесплатный tier (~1 req/sec), function calling, JSON mode.
OpenRouter — агрегатор API нейросетей
Что: единый API, через который доступно 300+ моделей: OpenAI, Anthropic, Google, DeepSeek, Mistral, Meta Llama, xAI, Qwen.
Цена: прайс провайдера плюс комиссия около 5% при пополнении. На бесплатных моделях (часть Llama, часть DeepSeek free-tier) — без оплаты, но с лимитом 20 запросов в минуту.
Когда выбрать: MVP, A/B-тест моделей, отказ от vendor lock-in, один ключ вместо десяти, без VPN. Регистрация и работа без VPN. Оплата — зарубежной картой или криптой. Автоматический fallback на резервную модель, статистика по провайдерам (задержка, uptime). Подробнее — OpenRouter обзор.
Replicate и fal.ai — агрегаторы под медиа
Replicate — маркетплейс image / video / audio моделей (FLUX, SDXL, Whisper, MusicGen), оплата — секунды GPU-времени. fal.ai — низкая латентность генерации картинок и видео (FLUX, Recraft, Hailuo, Kling) для real-time UI. Оба — для медиа, не чат-LLM. Доступ из РФ — VPN на регистрацию, зарубежная карта.
Together AI — хостинг open-source
Что: Llama 3.3/4 ($0.27/$0.85 Maverick), Qwen 3 235B ($0.18/$0.60), DeepSeek V3.2 ($0.27/$1.10), Mixtral 8x22B ($1.20/$1.20), Mistral, FLUX.
Когда выбрать: open-weight модели без своей инфры, скорость inference, fine-tuning под свой домен. VPN при регистрации, зарубежная карта. OpenAI-совместимый формат, dedicated endpoints, fine-tuning через API.
MWS GPT и другие российские
MWS GPT (МТС AI) — LLM от МТС в B2B-формате, контракт через менеджера, серверы в РФ, 152-ФЗ. T-Bank AI / T-Lite (8B, open-weight, Apache 2.0) — на HuggingFace, публичного API нет, запускают через vLLM / Ollama. SaluteSpeech (Сбер) — аналог Whisper для русского STT.
Российские агрегаторы LLM-API
Параллельно с OpenRouter рынок РФ закрывают локальные прокси — принимают карту РФ или счёт юрлица.
| Сервис | Наценка над ЦБ | Оплата | Особенности |
|---|---|---|---|
| ProxyAPI | ×3.7–4.3 | карта, СБП, счёт | каталог, документы |
| AITUNNEL | ×2–2.3 | карта, счёт | 200+ моделей |
| VseGPT | ×2.0 | карта, счёт | инженерный фокус |
| Polza.ai | ×1.5–1.8 | карта | бюджетный |
| BotHub | средняя | карта | гибрид чат + API |
| Promptra | ЦБ + 5% | карта, счёт | ближе к OpenRouter |
Для MVP разница в наценке некритична, для production каждый множитель режет маржу. Юрлицам с НДС нужен агрегатор-ООО. Все российские агрегаторы — OpenAI-совместимы.
Сравнительная таблица
| Провайдер | Лучшее в | Цена флагмана | Из РФ | Оплата РФ |
|---|---|---|---|---|
| OpenAI | universal + multimodal | $2.5 / $15 | VPN при рег | нет |
| Anthropic | код, длинные тексты | $5 / $25 | VPN при рег | нет |
| Google Gemini | длинный контекст, видео | $2 / $12 | VPN при рег | нет |
| Mistral | европейский, открытые веса | $2 / $6 | VPN при рег | нет |
| GigaChat | русский, 152-ФЗ | ~1 950 ₽/1M | без VPN | да |
| YandexGPT | русский, экосистема | ~1 200 ₽/1M | без VPN | да |
| DeepSeek | дёшево, качество | $1.74 / $7 | без VPN | нет |
| Together | open-weight, fine-tune | $0.27 / $1.10 | VPN при рег | нет |
| OpenRouter | удобство, агрегатор | прайс +5% | без VPN | крипта |
| Promptra | агрегатор RU, ООО | прайс +5% | без VPN | да |
Сравнение моделей: цена, контекст, латентность
TTFT — медиана time-to-first-token, округлено и варьируется по регионам.
| Модель | Вход $/1M | Выход $/1M | Контекст | TTFT |
|---|---|---|---|---|
| GPT-5.4 | $2.50 | $15.00 | 1M | 0.6 c |
| GPT-5.4 Mini | $0.75 | $4.50 | 400k | 0.4 c |
| GPT-5.4 Nano | $0.20 | $1.25 | 200k | 0.3 c |
| o4 reasoning | $20.00 | $80.00 | 400k | 2-30 c |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | 0.8 c |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | 0.5 c |
| Claude Haiku 4.5 | $1.00 | $5.00 | 400k | 0.3 c |
| Gemini 3.1 Pro | $2.00 | $12.00 | 2M | 0.7 c |
| Gemini 2.5 Flash | $0.30 | $2.50 | 1M | 0.4 c |
| Gemini Flash-Lite | $0.075 | $0.30 | 1M | 0.3 c |
| Mistral Large 3 | $2.00 | $6.00 | 256k | 0.5 c |
| DeepSeek V4 Pro | $1.74 | $7.00 | 256k | 0.7 c |
| DeepSeek V3.2 | $0.27 | $1.10 | 128k | 0.5 c |
| DeepSeek R1 | $0.55 | $2.20 | 128k | 1-15 c |
| Llama 4 Maverick | $0.27 | $0.85 | 128k | 0.3 c |
| Qwen 3 235B | $0.18 | $0.60 | 128k | 0.4 c |
Reasoning-модели (o4, R1) дают TTFT в десятки секунд — модель прогоняет внутренний chain-of-thought, и каждый токен тарифицируется как выходной. Для интерактива не подходят.
Аутентификация: API key, OAuth, JWT
Статичный API-ключ. OpenAI, Anthropic, Gemini, DeepSeek, Mistral, OpenRouter, Together. Заголовок Authorization: Bearer sk-... или x-api-key. Ротация — вручную через панель. Хранить в секрет-менеджере (Yandex Lockbox, Vault, GitHub Secrets), не в коде и не на фронте.
OAuth 2.0. GigaChat — обмен client_id:secret на access-токен с TTL 30 минут. Подходит для корпоративных интеграций.
IAM-токен (JWT). YandexGPT и Yandex.Cloud. Сервисный аккаунт → JWT → IAM-токен на 12 часов. Даёт привязку к ролям Yandex.Cloud (S3, Functions, Lockbox).
Workload identity. Vertex AI и AWS Bedrock — авторизация по identity процесса (Cloud Run, Lambda) без ключа. Лучше всего для production внутри облака.
Rate limits и Tier system
Лимиты делятся на RPM (запросы/мин), TPM (токены/мин), RPD (запросы/день).
- OpenAI — 5 уровней. Tier 1 (без истории) — 500 RPM, 30k TPM. Tier 5 (от $1000 + 30 дней) — 10 000 RPM, 30M TPM.
- Anthropic — 4 уровня. Tier 1 (депозит $5) — 50 RPM, 50k/10k TPM на Sonnet. Tier 4 (от $400 + 7 дней) — 4000 RPM.
- Gemini — Free 50 RPD к Pro. Paid Tier 1 — 1000 RPM. Дальше по тратам.
- GigaChat / YandexGPT — per workspace, 100-300 RPM, поднимаются заявкой.
- OpenRouter — лимит провайдера + общий. На free-моделях 20 RPM, 200 RPD.
На превышении — 429 Too Many Requests с Retry-After. Обязательно: backoff с jitter, circuit breaker, fallback. Без этого первый всплеск выбьет сервис.
Multimodal API: vision, audio, video
Vision. GPT-5.4, Claude Opus/Sonnet, Gemini 3.1 Pro, YandexGPT 5 Pro, GigaChat-2-Max принимают image_url или base64. Картинка 1024×1024 ≈ 1500-2000 токенов. Сценарии: распознавание чеков, разбор документов, описание скриншотов.
Audio. OpenAI Whisper API ($0.006/мин), GPT-5.4 Realtime для синхронного диалога, ElevenLabs для TTS, Yandex SpeechKit для русского STT/TTS. Gemini принимает аудио файлом.
Video. Gemini 3.1 Pro принимает видео как input — единственный среди флагманов с нативной поддержкой в чат-API. Генерация — Veo 3, Sora API, Kling, Runway Gen-4.
Function calling и tool use
Function calling — модель возвращает не текст, а вызов функции с JSON-аргументами. Клиент выполняет, отдаёт результат, модель формирует финальный ответ. Основа ИИ-агентов и RAG.
Поддерживают: OpenAI (tools в Chat Completions), Anthropic (tool_use в Messages API), Gemini (function_declarations), Mistral, GigaChat, YandexGPT (свой формат), DeepSeek и Llama через Together. Описание — JSON-схема с name, description, parameters. В ответе — tool_calls с распарсенным объектом, без regex по тексту.
Поверх function calling строятся ReAct-агенты, доступ к БД через SQL-tool, MCP-серверы, computer use у Claude (модель двигает курсором через tool calls).
Доступ из РФ
Без VPN и российской картой работают только GigaChat и YandexGPT. Остальные — через прокси-агрегатор (OpenRouter с оплатой криптой или Vsegpt.ru с картой РФ и наценкой ~20%) либо через зарубежную карту и VPN на регистрацию. Сам API западных провайдеров российские IP обычно не блокирует — production с прямого ключа работает без VPN. Для проектов с клиентскими данными — GigaChat или YandexGPT. Для остального — OpenRouter как точка входа плюс прямой ключ провайдера на основной объём.
Способы оплаты API из РФ
- Карта РФ — через российские агрегаторы (ProxyAPI, AITUNNEL, VseGPT, Polza.ai, Promptra) или провайдеров (GigaChat, YandexGPT, MWS GPT).
- Зарубежная карта — Казахстан, Кыргызстан, Армения, ОАЭ или виртуальные эмитенты (Cardvcc, Bybit Card, Wirex). Принимают OpenAI, Anthropic, Gemini, Mistral, Together.
- Криптовалюта (USDT / BTC / ETH) — OpenRouter, Together AI, fal.ai, Replicate.
- Расчётный счёт юрлица — российские провайдеры и агрегаторы-ООО, с договором, актом, счёт-фактурой.
- СБП — GigaChat, YandexGPT, часть российских агрегаторов.
- Yandex.Cloud / VK Cloud Billing — пополнение облака, оттуда списываются YandexGPT и Sber-модели.
Drop-in совместимость
OpenAI-протокол /v1/chat/completions стал де-факто стандартом. Anthropic, Google, DeepSeek, Mistral, Together, OpenRouter, российские агрегаторы — все держат совместимый endpoint. Локальные движки (Ollama, vLLM, LM Studio, llama.cpp) тоже поднимают OpenAI-совместимый endpoint. Прикладной код не отличает локальную Qwen 3 от облачного GPT-5.4 — vendor lock-in снимается до уровня переменной окружения.
Примеры запросов
curl — OpenRouter
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"anthropic/claude-sonnet-4.6",
"messages":[{"role":"system","content":"Ты опытный редактор."},
{"role":"user","content":"Исправь грамматику:..."}],
"temperature":0.7, "max_tokens":1000}'
Python — Anthropic SDK с prompt caching
from anthropic import Anthropic
client = Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
response = client.messages.create(
model="claude-sonnet-4-6",
max_tokens=1024,
system=[{"type": "text", "text": "Ты опытный редактор...",
"cache_control": {"type": "ephemeral"}}],
messages=[{"role": "user", "content": "Исправь грамматику:..."}]
)
print(response.content[0].text)
print("cache_read:", response.usage.cache_read_input_tokens)
JavaScript — OpenAI SDK через OpenRouter
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.OPENROUTER_API_KEY,
baseURL: "https://openrouter.ai/api/v1",
});
const response = await client.chat.completions.create({
model: "openai/gpt-5.4-mini",
messages: [
{ role: "system", content: "Ты опытный редактор." },
{ role: "user", content: "Исправь грамматику:..." },
],
stream: true,
});
for await (const chunk of response) {
process.stdout.write(chunk.choices[0]?.delta?.content || "");
}
GigaChat и YandexGPT — не OpenAI-совместимые. У GigaChat собственный SDK с OAuth, у YandexGPT — REST с IAM-токеном. Примеры — на страницах GigaChat и YandexGPT.
Что нужно для production
Pet-проект запускается на одном ключе. Боевой продукт требует семи слоёв:
- Retry + backoff. 5xx и таймауты — exponential backoff (1s → 2s → 4s → 8s) с jitter. 4xx — отдавать наверх. Idempotency-key против дублей.
- Circuit breaker. На 5-10 подряд 429 / 5xx — закрыть провайдера на 30 секунд, переключить на fallback.
- Fallback. Резервный провайдер на случай простоя основного. OpenRouter делает это нативно через параметр
models. - Streaming. SSE для чат-интерфейсов: первые токены через 200-400 мс вместо 5-15 секунд ожидания.
- Кэширование. Provider prompt caching (−90% на повторяющийся вход) плюс прикладное (Redis на одинаковые запросы).
- Batch API. Задачи до 24 часов (разметка, заголовки, аналитика) через Batch у OpenAI и Anthropic, цена −50%.
- Мониторинг. Лог каждого вызова: токены, стоимость, latency, статус. Метрики в Prometheus / Yandex Monitoring, алерты на 5xx и превышение бюджета.
Типичный обмен (500 input + 1000 output) — $0.028 на Claude Opus 4.8, $0.016 на GPT-5.4, $0.0012 на DeepSeek V3.2, ~1.5 ₽ на GigaChat-2-Max. На 10 000 запросов в день это около $8 400, $4 800, $360, 450 000 ₽ в месяц. Точный прогноз — по замерам пилота.
152-ФЗ при API-вызовах с клиентскими данными
Если в API улетают персональные данные клиентов (имя, телефон, email, переписка, фото) — продукт попадает под 152-ФЗ. Требования:
- Согласие клиента на обработку с упоминанием передачи провайдеру ИИ в политике конфиденциальности.
- Хранение ПДн на серверах в РФ (Yandex.Cloud, Selectel, Timeweb, VK Cloud), не AWS / GCP / Azure.
- Регистрация оператора ПДн через pd.rkn.gov.ru.
- Локализация ИИ-обработки. Данные клиента напрямую в OpenAI / Anthropic — формально нарушение. Решения: GigaChat или YandexGPT (серверы в РФ), локальная open-weight модель на своём GPU, либо обезличивание перед отправкой.
- Договор с обработчиком. У Yandex.Cloud есть стандартное поручение на обработку ПДн. DPA OpenAI и Anthropic к 152-ФЗ не приравнивается.
Чистый вариант для B2C с российскими пользователями — GigaChat или YandexGPT. Зарубежные провайдеры — для задач без ПДн.
Векторные API: pgvector, Pinecone, Weaviate, Qdrant
RAG-сценарий: документ режется на куски, каждый кусок переводится в вектор через embedding-модель и кладётся в векторную базу. На запрос ищется N ближайших по косинусу, куски подкладываются в промт как контекст.
pgvector — расширение PostgreSQL, векторы в обычной таблице, индекс HNSW или IVFFlat. Подходит до 50M векторов. Доступен в Yandex.Cloud Postgres, Timeweb, VK Cloud — 152-ФЗ, сервер в РФ. Pinecone — managed SaaS, vector-only, серверы в США/ЕС, от $50/мес, карту РФ не принимает. Weaviate — open-source, гибридный поиск (вектор + BM25). Qdrant — open-source на Rust, один из лидеров по скорости.
Embedding-API: text-embedding-3-large OpenAI ($0.13/1M), voyage-3 ($0.18/1M), Cohere embed-multilingual-v4, эмбеддинги GigaChat и YandexGPT для русского. Для русскоязычного RAG лучше работают GigaChat / YandexGPT или multilingual-модели.
Use-cases: чат-бот, RAG, агент, аналитика
Чат-бот. System-prompt + история + streaming. FAQ, поддержка, продуктовый помощник.
RAG. Документы → chunks (300-800 токенов) → embeddings → vector-DB. На запрос: embed → топ-N чанков → промт «отвечай по контексту» → ответ. Сценарии: поиск по корпоративной базе, помощник по документации, «спроси у договоров».
Агент (ReAct). Модель вызывает инструменты через function calling — search, SQL, code-exec, MCP-сервер. Цикл «модель → tool_call → результат → модель» крутится до финала. Сценарии: аналитик-бот к БД, триаж тикетов, Claude Code как dev-агент.
Аналитика. Тональность отзывов, выделение сущностей, категоризация — через Batch API (−50%) с structured output.
Генерация контента. SEO, описания товаров, перевод. Связка: reasoning — план, дешёвая — текст, средняя — fact-check.
Self-host: Ollama, vLLM, llama.cpp
Когда облако не подходит — данные не должны покидать сервер, либо объём такой, что железо дешевле API.
Ollama — daemon с OpenAI-совместимым endpoint на localhost:11434. Llama 4, Qwen 3, DeepSeek, Mistral, Phi, Gemma из коробки. Для разработки и personal use. vLLM — production-сервер с PagedAttention и continuous batching. Стандарт серьёзного inference. llama.cpp server — GGUF, квантование Q4/Q5/Q8, работа на CPU и потребительских GPU. TGI от Hugging Face — альтернатива vLLM.
GPU-аренда: Yandex.Cloud Compute, VK Cloud, Selectel — для 152-ФЗ; RunPod, vast.ai, Lambda Cloud — вне РФ. Подробнее — хостинг для AI-проекта.
Когда API не нужен
Включать API стоит, если есть конкретный сценарий — диалог, генерация уникальных текстов, поиск по своей базе, агент. Без сценария API превращается в строку расхода.
Простой контентный сайт. Лендинг, визитка, статичные услуги — текст пишет редактор один раз. Подключать LLM «для генерации описаний» — лишняя зависимость и месячный счёт без отдачи.
Статика. Документация, прайс, контакты, FAQ — чат-виджет здесь не открывают. Если статистика обращений показывает поток вопросов вне FAQ, бот оправдан, иначе нет.
Одноразовая задача. «Один раз переписать 50 заголовков», «один раз перевести 200 карточек» — нет смысла в API-интеграции. Откройте ChatGPT / Claude / GigaChat-чат и сделайте партиями в браузере, либо разовый Batch.
Жёсткая логика по правилам. Валидация форм, расчёт скидок, статусные переходы — это if / else. LLM на детерминированной логике медленнее, дороже и менее предсказуема.
Тривиальное преобразование данных. Парсинг CSV, конвертация форматов, сортировка — обычный код. LLM нужна только там, где правило задать невозможно.
FAQ
Что такое API нейросети простыми словами? Способ подключить чужую нейросеть к вашему коду. Шлёте текст провайдеру, провайдер запускает модель и возвращает ответ. Платите за фактические токены, не за месячную подписку.
Сколько стоит API нейросети? От $0.075 за 1M входных токенов (Gemini 2.5 Flash-Lite) до $80 за 1M выходных (OpenAI o4). Флагманы Claude Opus и GPT-5.4 — $2.5-$5 за вход и $15-$25 за выход. GigaChat и YandexGPT — 0.2-1.95 ₽ за 1k токенов.
Можно ли подключить API из России? Да, всех. GigaChat и YandexGPT — без VPN и с картой РФ. OpenAI, Anthropic, Gemini, DeepSeek, Mistral, Together — VPN при регистрации и зарубежная карта или крипта. Альтернатива — OpenRouter, без VPN, с криптой, либо российские агрегаторы (ProxyAPI, Promptra, AITUNNEL).
Какой API самый дешёвый? DeepSeek V3.2 — $0.27 / $1.10 за 1M, бюджетный флагман. Qwen 3 на Together — $0.18 / $0.60. Gemini 2.5 Flash-Lite — $0.075 / $0.30. Бесплатные tier — Google AI Studio, OpenRouter, Mistral, Groq.
Какой API лучший для российского продукта? При требовании 152-ФЗ — GigaChat или YandexGPT. Без VPN, рубли, серверы в РФ. Для качества на международных задачах — Claude Sonnet через OpenRouter.
Прямой API или OpenRouter? MVP и прототипы — OpenRouter, снимает проблему оплаты. Production с объёмом больше $1k/мес — прямой ключ провайдера. Можно совмещать: основной трафик на прямом ключе, fallback на OpenRouter.
Безопасно ли отправлять клиентские данные в API? На платных тарифах OpenAI и Anthropic данные не используются для обучения и хранятся ~30 дней для расследования инцидентов. На бесплатных tier’ах — обычно используются. Для конфиденциальных данных — Zero Retention на Enterprise либо локальная open-weight модель.
Может ли API работать офлайн? Облачные — нет. Open-weight модели (Llama 4, Qwen 3, Mistral, DeepSeek с открытыми весами) запускаются через Ollama или vLLM. Качество отстаёт от облачных Claude и GPT на 1-2 поколения, но Qwen 3 235B и DeepSeek V3.2 уже подбираются к флагманам.
Чем отличаются Batch API и обычный? Batch — асинхронный режим: до 50 000 запросов одним файлом, результат за 24 часа, цена −50%. Подходит для разметки, заголовков, массовой суммаризации. Для интерактива — обычный синхронный API.
С чего начать работу с API нейросети?
Выберите провайдера: для русского B2C — GigaChat / YandexGPT, для прототипа без VPN — OpenRouter, для дешёвого сценария — DeepSeek. Получите ключ, положите в .env, поставьте SDK (openai, anthropic) или используйте curl. После рабочего ответа добавляйте retry/backoff, streaming, кэш, мониторинг бюджета.
Что такое prompt caching?
Повторяющаяся часть промта (system-инструкция, длинный контекст) запоминается провайдером и оплачивается со скидкой ~90%. У Anthropic — cache_control с TTL 5 минут / 1 час. У OpenAI — автоматически на префиксе ≥1024 токенов. У DeepSeek — нативный кэш с отдельным тарифом на чтение.
Можно ли подключить API без программирования? Частично. No-code-инструменты (n8n, Make, Zapier, Albato) дают визуальные блоки OpenAI / Anthropic / Gemini / GigaChat. Для прототипа достаточно. Сложные сценарии (агенты, RAG) требуют кода.
Дальше
Для практики — точка входа без VPN — OpenRouter; open-weight на быстром inference — Together AI; флагманы — ChatGPT API и Claude API. Для русскоязычного B2C — GigaChat и YandexGPT. Для дешёвого массового сценария — DeepSeek с Batch. Self-host (152-ФЗ или закрытый контур) — гайд хостинг для AI-проекта.
Читайте также
- Assembly: $4M ARR за 4 месяца на 4 бизнесах с креейторами — $330K/мес
- Creator Buddy: $300K/год на Cursor без программирования — $25K/мес
- Промты для Алисы: команды, сценарии, гайд по Алисе Про 2026
- Нейросети для работы: офисные сценарии, отделы и корпоративные тарифы 2026
- Нейросеть для дизайнера: ИИ для веба, графики, интерьера в 2026
- Live Tourney: $30K/мес — сервис для гольф-турниров — $30K/мес
- Early: $50K/мес на будильнике с отжиманиями — $50K/мес