Блог обзор

ElevenLabs — нейросеть для синтеза и клонирования голоса

ElevenLabs — ИИ-сервис, который синтезирует речь из текста и клонирует голос по короткому образцу. По состоянию на 2026 год — самая качественная публичная модель для эмоциональной интонации, естественной артикуляции и сохранения тембра при переводе на другой язык.

Сервис закрывает пять задач: озвучка контента, дубляж и локализация, голосовые ассистенты, звуковые эффекты и музыка, омниканальные агенты. Подробности — на сайте, тарифы — на pricing.

История ElevenLabs

Компанию основали в 2022 году Пётр Дабковский (ex-Google) и Мати Стэняшэк (ex-Palantir). Идея пришла из личного опыта: оба выросли в Польше и смотрели голливудские фильмы в плохом дубляже. Публичная beta вышла в январе 2023 года и разошлась по соцсетям — пользователи делились примерами, где синтезированная речь звучала неотличимо от живого диктора.

Точки роста: 2023 — beta, релиз Voice Cloning; 2024 — Dubbing Studio и Conversational AI; 2025 — preview Eleven v3, релиз Music и Flash v2.5; 2026 — ребрендинг на три блока, полноценный v3, Expressive Mode, Flows, Scribe v2 Realtime.

Что нового в 2026

В 2026 году платформа прошла большой ребрендинг и разделилась на три блока: ElevenCreative (единое рабочее пространство для контента — речь, видео, музыка, звуковые эффекты, Studio для длинных проектов), ElevenAgents (омниканальные агенты для голоса, чата, email, WhatsApp с возможностью вызывать функции и обновлять CRM), ElevenAPI (линейка для разработчиков — Text-to-Speech, Speech-to-Text, Music API).

Ключевые релизы первой половины 2026 года: Eleven v3 — самая выразительная TTS-модель, точнее ловит сарказм, шёпот, смех, паузы; Expressive Mode для ElevenAgents — агент адаптирует тон и эмоцию на 70+ языках; Flows in ElevenCreative — конструктор пайплайнов «текст → голос → видео → дубляж → публикация» в одном проекте; Scribe v2 Realtime — распознавание речи в реальном времени; Music v2 и Dubbing v2 — музыка с улучшенным вокалом и дубляж с сохранением интонации.

Что такое ElevenLabs

ElevenLabs — набор моделей для работы с голосом в одной платформе: Text-to-Speech, Voice Cloning (клон голоса по записи), Voice Library (10 000+ голосов от пользователей), Studio (длинные проекты), Dubbing (перевод видео с сохранением тембра), Voice Design (голос по текстовому описанию), Speech-to-Speech, Sound Effects, Music и ElevenAgents (агенты для голоса, чата, email, WhatsApp).

Главное отличие от российских конкурентов и OpenAI TTS — качество интонации. Модель воспроизводит микропаузы и эмоциональные оттенки так, что слепое сравнение с реальным диктором часто не даёт однозначного ответа.

Линейка моделей 2026

МодельСильная сторонаГде применять
Eleven v3Самая выразительная, актёрская подача, эмоцииАудиокниги, драматическая озвучка, реклама
Multilingual v2Стабильная, предсказуемая, 70+ языковДикторские задачи, длинные тексты, корпоративная озвучка
Flash v2.5Низкая задержка ~75 мсRealtime-диалоги, голосовые агенты, телефония
Turbo v2.5Скорость + цена (0,5 кредита/символ)Массовая генерация, локализация большого объёма, ранние прототипы
Scribe v2 RealtimeРаспознавание речи в реальном времениТранскрипция звонков, субтитры live-эфиров
Music v2Генерация музыки с вокаломСаундтреки, рекламные джинглы, фон подкаста
Dubbing v2Перевод с сохранением эмоцииЛокализация видео, многоязычные YouTube-каналы

Для большинства задач хватает Multilingual v2; v3 — там, где важна актёрская подача, Flash — где задержка ниже 100 мс.

Основные функции

Text-to-Speech

Подставляете текст, выбираете голос — получаете аудио. 70+ языков, включая русский. Параметры стабильности, выразительности и стиля настраиваются под спокойную диктовку или эмоциональную подачу. Качество аудио по тарифу: Free — 128 kbps MP3, Creator — 192 kbps, Pro и выше — 44.1 kHz PCM через API.

Voice Cloning — Instant и Professional

Instant Voice Cloning доступен от Starter. Загружаете 1-2 минуты чистой записи — клон готов за секунды. Качество приемлемое для подкастов, рассылок, внутренних видео. Эмоциональный диапазон сжатый — для драматической подачи слабо.

Professional Voice Cloning доступен от Creator. Требуется 30-180 минут чистой записи и голосовое согласие; тренировка занимает несколько часов. На выходе — модель, на коротких фразах практически неотличимая от оригинала. Используется в коммерческой озвучке аудиокниг, дубляже, персональных ИИ-аватарах. Для качества важна студийная запись без реверберации и разнообразный эмоциональный материал.

Voice Library

Библиотека из 10 000+ голосов, которые создали и поделились пользователи. У каждого — характеристика (пол, возраст, акцент, тон) и условия лицензии: некоторые бесплатные, для других автор устанавливает плату. Удобно, когда нужен конкретный типаж — пожилой мужчина с британским акцентом, диктор для детского контента — но нет ресурса записывать оригинального диктора.

Studio

Studio — рабочее пространство для длинных проектов: глав книги, эпизодов подкаста, видеоозвучек. Даёт разбивку текста на сцены, выбор голоса под персонажа, регенерацию конкретного предложения без пересчёта всего файла, экспорт по главам с тайм-кодами, историю версий. С релизом Flows в марте 2026 пайплайн «текст → голоса по персонажам → музыка → sound effects → финальный микс» собирается в одном проекте.

Dubbing — перевод видео и аудио

Dubbing Studio переводит ролик с одного языка на другой с сохранением голоса. Загружаете видео → выбираете целевой язык → сервис транскрибирует, переводит, генерирует озвучку клонированным голосом исходного спикера. Поддерживается 29 языков, включая русский. Dubbing v2 сохраняет эмоциональную окраску и интонацию. Для синхронизации губ нужен HeyGen — у ElevenLabs только аудиодорожка.

Voice Design

Генерация голоса по текстовому описанию: «мужской голос, 40 лет, тёплый тембр, лёгкая хрипота» — получаете новый голос, которого не существовало раньше. Полезно брендам, которым нужно уникальное звучание без юридических привязок к реальному человеку.

Speech-to-Speech, Sound Effects, Music v2

Speech-to-Speech переносит стиль произнесения с образца на целевой текст — используется в дубляже, аудиокнигах с разными персонажами, актёрской озвучке игр. Sound Effects генерирует звуки из текстового промпта («дождь по жестяной крыше», «шум кафе с разговорами»), длина до 22 секунд — для подкастов, игр, рекламы. Music v2 генерирует музыкальные дорожки с вокалом или инструментально, жанровая стилизация, длительность до нескольких минут, мульти-трек экспорт. На Starter и выше — коммерческая лицензия на музыку.

ElevenAgents — Conversational AI 2.0

Платформа для голосовых и омниканальных агентов в реальном времени. Агент состоит из четырёх блоков: распознавание речи (Scribe v2), LLM-логика (OpenAI / Anthropic / Gemini), синтез ответа (Flash), управление диалогом.

Ключевые возможности 2026 года: Expressive Mode (агент смеётся, шепчет, выдерживает паузу); каналы — голос, чат, email, WhatsApp, телефония через Twilio и SIP; действия — агент вызывает функции (записать клиента, создать тикет, отправить документ); мультимодальность (изображения и PDF в чат); SDK для Web, iOS, Android, Node, Python. LLM-стоимость тарифицируется отдельно от голоса.

Тарифы ElevenLabs 2026

По официальной странице тарифов:

ПланЦена/месКредитыЧто важно
Free$010 000TTS, STT, Sound Effects, Voice Design, Music, 3 проекта в Studio, без коммерческой лицензии
Starter$630 000Коммерческая лицензия, Instant Voice Cloning, Dubbing Studio, 20 проектов, коммерческая лицензия на музыку
Creator$22121 000Professional Voice Cloning, аудио 192 kbps, ~100 минут TTS
Pro$99600 000API 44.1 kHz PCM, ~500 минут TTS, production-уровень
Scale$2991 800 0003 командных места, low-latency TTS, 3 professional-клона
Business$9906 000 00010 мест, 10 professional-клонов, расширенный API
Enterpriseпо запросугибкоSSO, HIPAA, DPA, SLA, BAA, выделенная поддержка

Годовая подписка даёт скидку ~17% (эквивалент двух бесплатных месяцев) на всех платных тарифах.

Что считается кредитом

1 кредит — примерно один символ синтезированного текста. 1 000 символов = около 1 минуты речи. Eleven v3 и Multilingual v2 — 1 кредит за символ, Flash v2.5 и Turbo v2.5 — половинная ставка (0,5 кредита), ElevenAgents — поминутная тарификация разговора. Превышение лимита — overage по фиксированной ставке, она зависит от тарифа; актуальные цифры — на странице тарифов.

ElevenLabs API и ключ

API использует те же кредиты подписки — отдельной оплаты за вызовы нет, символы списываются из месячного лимита тарифа. Отдельная биллинг-линия — только у ElevenAgents (поминутно). LLM-расходы агентов считаются отдельно: подключаете свой ключ OpenAI / Anthropic / Gemini, платите провайдеру напрямую.

Как получить API-ключ

API-ключ доступен на любом тарифе, включая Free. После регистрации откройте профиль в личном кабинете → раздел API Keys (прямая ссылка) → создайте ключ. Ключ — это секрет: его не публикуют в клиентском коде и не коммитят в репозиторий. В запросах ключ передаётся в HTTP-заголовке xi-api-key. Запросы к API не блокируются для российских IP — после оплаты тарифа работа идёт напрямую, без прокси.

Эндпоинт Text-to-Speech

Синтез речи — это POST на https://api.elevenlabs.io/v1/text-to-speech/{voice_id}, где {voice_id} — идентификатор голоса из библиотеки или вашего клона. В теле запроса — text (обязательный), model_id (по умолчанию eleven_multilingual_v2) и блок voice_settings (стабильность, выразительность). Ответ — поток аудио. Минимальный пример на curl:

curl -X POST \
  "https://api.elevenlabs.io/v1/text-to-speech/{voice_id}" \
  -H "xi-api-key: ВАШ_КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{"text":"Привет!","model_id":"eleven_multilingual_v2"}' \
  --output audio.mp3

Отдельные эндпоинты — для Speech-to-Text (Scribe), дубляжа, музыки и списка голосов; полная спецификация — в документации. Есть SDK для Python и Node.

Лимит символов на один запрос

Лимит зависит от модели: Eleven v3 — 3 000 символов на запрос, Multilingual v2 — 10 000, Flash v2.5 и Turbo v2.5 — 40 000. Это лимит одного вызова, а не месячный — длинный текст бьётся на части и отправляется пачкой. Для realtime через Flash рекомендуют держать запрос ниже 1 000 символов: задержка ~75 мс — уровень, при котором разговор воспринимается без пауз.

Доступ из России

Сайт ElevenLabs открывается без VPN — блокировок по IP нет. Регистрация — через email или Google. Бесплатный тариф работает сразу, качество голосов на русском можно проверить без оплаты.

Оплата — только зарубежной картой. ElevenLabs работает через Stripe; российские карты не проходят. Криптой ElevenLabs не принимает.

4 рабочих способа оплаты из России в 2026 году

1. Иностранная карта банков СНГ. Карты Казахстана (Kaspi, Halyk), Армении (Ameriabank), Сербии, ОАЭ, Турции проходят через Stripe в большинстве случаев. Открытие требует личного присутствия, но даёт стабильный канал. Подходит для постоянной работы и команд.

2. Виртуальные карты посредников. Pyypl, EasyPay, PSTNet, Paysend — оформляются онлайн за час, пополняются с российской карты или СБП. Минус — Stripe иногда помечает BIN таких карт как «high risk» и блокирует повторные списания. Подходит для теста.

3. Сервис-посредник. Oplatym, Easypays, Cardvm вводят данные европейской карты под вас. Комиссия 350-550 ₽ на маленьких суммах, до 5-7% на больших, скорость 15-60 минут. Когда нужно «здесь и сейчас».

4. Российский агрегатор. Перепродают доступ к API пакетами; юзер платит рублёвой картой, агрегатор — со своего корпоративного аккаунта. Плюс — рубли и закрывающие для самозанятых. Минус — нет прямого доступа к кабинету, урезан набор фич.

Для production стоит закладывать резервный канал оплаты: Stripe иногда отклоняет повторные платежи с одного BIN.

Качество русского языка и кириллица

Multilingual v2 обучена на корпусе с большой долей русского: ударения в большинстве слов проставляются правильно (исключение — редкие омографы), мягкие согласные и редуцированные гласные звучат естественно, различается интонация повествования, вопроса и восклицания. Имена собственные и иностранные слова обрабатываются хуже — ударение имеет смысл расставить через SSML.

Eleven v3 на русском лучше в драматических сценах, но требует разметки эмоций; для длинных дикторских задач Multilingual v2 выигрывает по предсказуемости. Слабые места: редкие фамилии, длинные числительные, иностранные слова. Большие тексты проверяют «на слух» по абзацам и регенерируют проблемные предложения через Studio.

152-ФЗ и юридический контур

ElevenLabs — американская компания (Delaware), серверы на AWS в США и ЕС. Передача персональных данных граждан РФ требует согласия и уведомления Роскомнадзора по приказу №274 — голос диктора это биометрические данные. Для B2C-сценариев с нейтральным голосом без идентификации конкретного клиента рисков по 152-ФЗ практически нет. Для голосовых агентов с записью звонков на практике российский бизнес ставит ElevenLabs внутри собственного контура и не отправляет в API голос клиента — только текст транскрипции. Счёт-фактуру и акт в российском формате ElevenLabs не выдаёт — оплата через зарубежные счета или через агрегаторов с закрывающими.

Если 152-ФЗ критичен (медицина, финансы, госсектор) — смотрите Yandex SpeechKit и SaluteSpeech с серверами в РФ.

ElevenLabs vs Yandex SpeechKit vs Salute Speech vs OpenAI TTS

Четыре сервиса делят рынок синтеза речи. У каждого своя зона силы.

ElevenLabsYandex SpeechKitSalute SpeechOpenAI TTS
Качество интонации (рус)очень высокоевысокоевысокоесреднее
Качество интонации (англ)лидер рынкабазовоебазовоевысокое
Клонирование голосаInstant + Professionalесть, ограниченноестьнет (закрыто публично)
Voice Library10 000+ голосов~20 голосов~10 голосов9 голосов
Sound Effectsестьнетнетнет
Музыкаесть (Music v2)нетнетнет
Dubbing видеоестьнетнетнет
Conversational AIElevenAgents (полная платформа)есть, через Yandex Cloudбазоваячерез Realtime API
Realtime latency~75 мс (Flash)~200 мс~250 мс~300 мс
Языки70+4250+
Оплата из РФзарубежная картароссийская картароссийская картазарубежная карта
Цена входа$6/месот 0,4 ₽ за 1 000 символовот 0,3 ₽ за 1 000 символов$0,015 за 1 000 символов

ElevenLabs — выбор, когда критично качество эмоциональной интонации, нужен сильный клон голоса или дубляж. Минусы — оплата только зарубежной картой, мало русскоязычных голосов в библиотеке.

Yandex SpeechKit (обзор) — оплата с расчётного счёта или российской карты, работает без VPN, выдаёт счёт-фактуру. Качество русского — высокое, но интонационная палитра уже, чем у ElevenLabs. Подходит юрлицам с требованием закрывающих.

SaluteSpeech (обзор) от Сбера — встроен в экосистему GigaChat. Качество — на уровне Yandex SpeechKit. Сильная сторона — единый контракт со Сбером и соответствие 152-ФЗ.

Resemble AI — прямой американский конкурент. Сильные стороны — Voice Cloning с 10-секундного семпла, real-time API, встроенный watermarking. Уступает ElevenLabs по выразительности и размеру библиотеки, но лидирует в скорости клонирования и enterprise-фичах для финтеха и колл-центров.

OpenAI TTS (Whisper — отдельный продукт для распознавания) — голоса встроены в ChatGPT API и Realtime. Сильнее на английском. Не клонирует голос, не делает дубляж. Удобно встраивается в существующий GPT-проект через один API-ключ.

Для русскоязычного контента с документооборотом — Yandex или SaluteSpeech. Для эмоциональной озвучки и клона — ElevenLabs. Для встраивания в ChatGPT-проект — OpenAI TTS.

Use cases

Аудиокниги. Озвучка глав через Professional Voice Cloning или подбор из Voice Library. Studio + v3 для актёрских сцен, Multilingual v2 для нейтральных абзацев.

Дубляж и локализация. YouTube-канал, переведённый на 5-10 языков голосом оригинального спикера: аудиодорожка через Dubbing v2, синхронизация губ — через HeyGen.

Голосовые ассистенты. ElevenAgents — запись к врачу, выдача справок, входящие звонки; Expressive Mode делает разговор естественнее.

Подкасты. Клон ведущего делается раз в начале сезона, дальше эпизоды генерируются из текста. Джинглы — Music v2, sound design — Sound Effects.

Игры и курсы. Голоса NPC и диалоги на лету (Flash 75 мс). Локализация курса на разные языки с одним голосом-«учителем» — без перезаписи лекций.

Этика клонирования голоса

Этический контур у ElevenLabs самый строгий среди публичных платформ синтеза речи. Что встроено: согласие владельца голоса для Professional-клона (фраза с уникальным кодом, записанная в реальном времени); AI Speech Classifier — собственный детектор синтеза, доступен публично; watermarking — невидимая метка в сгенерированном аудио; запрет на клонов публичных лиц без подтверждённой связи; реестр согласий и канал жалоб.

Для пользователя из России: для Professional-клонирования собственного голоса нужно записать фразу подтверждения. Чужой голос без согласия клонировать нельзя — инфраструктура усложняет обход. Для коммерческой озвучки имеет смысл получить письменное согласие диктора заранее на случай аудита со стороны платформы.

Ограничения

Коммерческая лицензия. Бесплатный тариф — только личное использование; коммерческая лицензия начинается с Starter ($6/мес). Voice Library требует отдельной проверки лицензии у автора голоса.

Русский — высокое качество, но не лидер. Эмоциональная подача на английском заметно выше. Для премиум-проектов на русском команды совмещают ElevenLabs (черновая озвучка) и студию (финал ключевых сцен).

Кредитная тарификация сложно прогнозируется. 121 000 кредитов на Creator уходят за ~100 минут TTS. Команда на 5-10 часов аудио в месяц упирается в Pro или Scale.

LLM-расходы для агентов отдельно. При расчёте минуты разговора у ElevenAgents легко забыть про токены OpenAI/Anthropic — итоговый чек выходит выше прогноза по тарифам ElevenLabs.

Detection-инструменты ловят синтез. Голос опознаётся детекторами (включая собственный AI Speech Classifier) — критично для академических и юридически чувствительных контекстов.

FAQ

Что такое ElevenLabs? ИИ-платформа для работы с голосом: синтез речи из текста, клонирование голоса, дубляж видео, генерация звуковых эффектов и музыки, омниканальные агенты для голоса/чата/email/WhatsApp. По состоянию на 2026 год — лидер по качеству эмоциональной интонации.

Сколько стоит ElevenLabs в 2026 году? Free ($0, 10 000 кредитов, без коммерческой лицензии), Starter ($6/мес, 30 000 кредитов, Instant Voice Cloning), Creator ($22/мес, 121 000 кредитов, Professional Voice Cloning), Pro ($99/мес, 600 000 кредитов, production-API), Scale ($299/мес, 1,8 млн кредитов, 3 командных места), Business ($990/мес, 6 млн кредитов, 10 мест), Enterprise — по запросу. Годовая подписка — скидка ~17%.

Что нового в ElevenLabs в 2026 году? Eleven v3 (самая выразительная), Expressive Mode для ElevenAgents, Flows в ElevenCreative (пайплайн «текст → голос → видео → дубляж»), Scribe v2 Realtime, Music v2, Dubbing v2, ElevenLabs for Government.

Какие модели у ElevenLabs? TTS: Eleven v3 (выразительность), Multilingual v2 (стабильность), Flash v2.5 (~75 мс задержка для realtime), Turbo v2.5 (0,5 кредита/символ). STT: Scribe v2 Realtime. Музыка: Music v2. Дубляж: Dubbing v2.

Как получить и использовать API-ключ ElevenLabs? Ключ доступен на любом тарифе, включая Free. В личном кабинете откройте раздел API Keys и создайте ключ. В запросах он передаётся в заголовке xi-api-key. Синтез речи — POST на https://api.elevenlabs.io/v1/text-to-speech/{voice_id}. API использует кредиты подписки, отдельной оплаты за вызовы нет. Российские IP не блокируются.

Какой лимит символов на запрос к API? Зависит от модели: Eleven v3 — 3 000 символов, Multilingual v2 — 10 000, Flash v2.5 и Turbo v2.5 — 40 000. Это лимит одного вызова; длинный текст бьётся на части. Месячный лимит — это кредиты тарифа (1 символ ≈ 1 кредит).

Какие языки поддерживает ElevenLabs? 70+ языков для синтеза, 29 языков для дубляжа. Русский, украинский, казахский — есть. Эмоциональная подача на английском заметно выше.

Работает ли ElevenLabs в России? Сайт открывается без VPN. Оплата — только зарубежной картой через Stripe; российские карты не проходят. API не блокируется для российских IP, после оплаты можно работать напрямую.

Можно ли клонировать свой голос? Да. Instant Voice Cloning доступен с Starter — записываете 1–2 минуты, клон готов за секунды. Professional Voice Cloning доступен с Creator — нужно 30–180 минут записи и голосовое согласие; обучение занимает несколько часов, качество на коротких фразах практически неотличимо от оригинала.

ElevenLabs или Yandex SpeechKit? ElevenLabs — лучше эмоциональная подача, шире библиотека голосов (10 000+), есть дубляж, клон, музыка, агенты. Yandex SpeechKit — оплата российской картой, счёт-фактура, дешевле для юрлица, без VPN. Если важен документооборот — Yandex. Если важно качество — ElevenLabs.

ElevenLabs или OpenAI TTS? ElevenLabs — клонирование голоса, библиотека на 10 000+, дубляж, sound effects, музыка, Flash с задержкой 75 мс. OpenAI TTS — 9 встроенных голосов, тарификация по символам, удобно встраивается в существующий ChatGPT-проект через один API-ключ. Для эмоциональной озвучки — ElevenLabs, для интеграции с GPT-стеком — OpenAI.

Какое качество аудио на выходе? Free — 128 kbps MP3, Creator — 192 kbps, Pro и выше — 44.1 kHz PCM через API. Для большинства задач достаточно 192 kbps; для production-аудиокниг и студийных проектов — Pro.

Как оплатить ElevenLabs из России в 2026 году? Четыре способа: иностранная карта банков СНГ (Казахстан, Армения, Сербия, ОАЭ, Турция) — самый стабильный канал; виртуальная карта посредника (Pyypl, EasyPay, PSTNet) — оформляется онлайн за час; оплата через сервис-посредник (Oplatym, Easypays) — комиссия 350-550 ₽ или 5-7%; российский агрегатор — доступ через корпоративный аккаунт за рубли с закрывающими.

Соответствует ли ElevenLabs требованиям 152-ФЗ? ElevenLabs — американская компания, серверы в США и ЕС. Это означает трансграничную передачу данных. Для коммерческой обработки голоса гражданина РФ как биометрических данных требуется согласие и уведомление Роскомнадзора. Если 152-ФЗ критично — выбирайте Yandex SpeechKit или SaluteSpeech с серверами в РФ.

Хорошо ли работает ElevenLabs с русским языком и кириллицей? Да, многоязычная модель Multilingual v2 обучена на корпусе с большой долей русского. Ударения, мягкие согласные, интонация повествования — на высоком уровне. Слабые места: редкие фамилии, длинные числительные, иностранные слова — могут потребовать ручной правки через SSML или регенерации проблемного предложения в Studio.

Как ElevenLabs vs Resemble AI? ElevenLabs — глубже по выразительности и больше библиотека голосов (10 000+ против сотен у Resemble). Resemble — быстрее клонирует (10 секунд против минуты), сильнее в real-time API для финтеха, есть watermarking «из коробки». Для медиаконтента и аудиокниг — ElevenLabs. Для голосовых ассистентов в банке — Resemble.

Можно ли ElevenLabs для подкастов и YouTube-каналов коммерчески? Да, начиная с тарифа Starter ($6/мес) есть полная коммерческая лицензия на TTS, музыку и звуковые эффекты. На бесплатном тарифе — только для личного использования. В дубляже одного ролика на несколько языков голос оригинального спикера сохраняется через Dubbing v2 — для этого нужен Creator или выше.

Дальше

  • HeyGen — ИИ-аватары с lip sync и переводом видео; вместе с ElevenLabs для полного дубляжа.
  • Synthesia — корпоративные ИИ-аватары для обучающих видео; ElevenLabs часто как голос диктора.
  • Whisper — распознавание речи от OpenAI, обратная задача к ElevenLabs TTS.
  • Yandex SpeechKit — российский синтез с серверами в РФ и счёт-фактурой для юрлиц.
  • SaluteSpeech — голосовой синтез Сбера в экосистеме GigaChat; соответствует 152-ФЗ.
  • Resemble AI — прямой конкурент ElevenLabs из США: real-time клон, watermarking.
  • Сравнение российских нейросетей — где Yandex и SaluteSpeech сильнее зарубежных.
  • API нейросетей — как встроить ElevenLabs, OpenAI, GigaChat в свой продукт.