i
Новости
Новости · 2026-09-29

Новая речевая модель ElevenLabs v4 делает голоса ИИ выразительнее и стабильнее

@neuronium_ai @neuronium_ai

ElevenLabs выпустила модель синтеза речи Eleven v4: она точнее выполняет указания по подаче и сохраняет звучание голосов на протяжении длинных записей. Модель поддерживает более 90 языков, клонирует голоса и обрабатывает до 10 000 символов за запрос. Для голосовых ИИ-агентов компания также представила Eleven v4 Turbo: версия начинает говорить примерно через 150 миллисекунд, что, по данным ElevenLabs, быстрее конкурирующих моделей.

Обложка: Новая речевая модель ElevenLabs v4 делает голоса ИИ выразительнее и стабильнее

Eleven v4 надёжнее предыдущей версии воспроизводит смех, шёпот и звуки вроде хлопка двери. Архитектура модели также легла в основу Turbo — варианта для голосовых ИИ-агентов, которым важно отвечать в реальном времени. Выпущенная чуть больше года назад Eleven v3 уже поддерживала аудиометки, но следовала им менее точно.

Более последовательное звучание

По словам ElevenLabs, новая архитектура анализирует тон, темп и контекст сценария. Пользователь может задавать подачу с помощью тегов или обычных фраз, а произношение имён и технических терминов — уточнять фонетической записью. Компания утверждает, что управление произношением стало надёжнее. Рассказчики и персонажи должны сохранять единое звучание на протяжении всей записи, даже если пользователь несколько раз перегенерирует отдельные реплики.

Теги в сценарии позволяют пользователям задавать эмоции, паузы и звуковые эффекты для каждой реплики

Теги в сценарии позволяют пользователям задавать эмоции, паузы и звуковые эффекты для каждой реплики

Источник: the-decoder.com

Eleven v4 обрабатывает до 10 000 символов за запрос — это примерно десять минут аудио. Длинные произведения, например аудиокниги, создаются из нескольких частей; при переходе между ними должны сохраняться темп и манера речи. В диалогах говорящие на базе ИИ учитывают контекст всей сцены, а не произносят каждую реплику отдельно от остальных.

Модель поддерживает более 90 языков — в Eleven v3 их было около 70. Клонированные голоса должны говорить на других языках с естественным для них акцентом и не возвращаться со временем к исходному. В Eleven v4 снова доступны профессиональные клоны голоса, которых не было в v3. Для функции Instant Voice Clone достаточно десяти секунд аудио.

Turbo ускоряет выразительные голоса

ElevenLabs также выпускает ускоренную версию v4 для работы в реальном времени — например, в звонках клиентской поддержки или в диалогах с игровыми персонажами. По словам компании, раньше разработчикам голосовых ИИ-агентов приходилось выбирать между скоростью и выразительностью; v4 Turbo должна обеспечить и то и другое.

В тестах ElevenLabs Turbo начинает выдавать слышимую речь через 150 миллисекунд. Для сравнения, Cartesia Sonic 3.6 требуется 262 миллисекунды, а GPT-4o mini TTS от OpenAI — 814 миллисекунд. ElevenLabs оптимизировала Turbo совместно со своей платформой ElevenAgents.

По результатам тестов ElevenLabs, Eleven v4 Turbo начинает генерировать речь гораздо быстрее протестированных конкурирующих моделей

По результатам тестов ElevenLabs, Eleven v4 Turbo начинает генерировать речь гораздо быстрее протестированных конкурирующих моделей

Источник: the-decoder.com

В рейтинге Provider Voice Arena от Artificial Analysis Eleven v4 опережает Cartesia Sonic 3.6 и Gemini 3.8 Flash TTS от Google. В бенчмарке произношения модель набрала 91,7%, тогда как результат v3 составлял 85,6%. В слепых тестах ElevenLabs примерно три четверти слушателей предпочли v4 моделям Cartesia, Inworld и Google.

В слепых тестах компании слушатели оценили Eleven v4 как более выразительную в 65–81% сравнений — в зависимости от конкурента

В слепых тестах компании слушатели оценили Eleven v4 как более выразительную в 65–81% сравнений — в зависимости от конкурента

Источник: the-decoder.com

Более качественное клонирование делает v4 пригодной для дубляжа: ElevenLabs предлагает использовать голос актёра на всех поддерживаемых языках. Компания лицензирует голоса у их владельцев. Актёры озвучивания могут разместить в библиотеке ElevenLabs обученный клон своего голоса и получать деньги, когда его используют платящие клиенты. Через отдельную площадку ElevenLabs уже предлагает, например, голоса знаменитостей, в том числе Майкла Кейна.

Временное снижение цен

Стандартная цена API составляет 80 долларов за миллион символов для v4 и 40 долларов для Turbo. До 12 октября тарифы снижены до 22 и 11 долларов соответственно. По данным ElevenLabs, подписчики тарифа Creator за 22 доллара в месяц и выше могут две недели пользоваться v4 в ElevenCreative без доплаты. Лимит использования равен двойному объёму месячных кредитов. По данным Artificial Analysis, Sonic 3.6 стоит 49 долларов за миллион символов, а Gemini 3.8 Flash TTS — 16,49 доллара.

Обе модели уже доступны в ElevenAgents и ElevenCreative, а также через API. Согласно документации ElevenLabs, по умолчанию данные клиентов хранятся в США. Корпоративные клиенты могут выбрать изолированное хранение в ЕС, Индии или Сингапуре, однако часть обработки данных может проходить за пределами выбранного региона. В ЕС клиенты могут оставить обработку API внутри региона, включив режим без хранения данных.

В середине сентября ElevenLabs также выпустила модель Music 2.5 для создания более насыщенных песен с естественным звучанием.

Источник: the-decoder.com

Reco привлекла $55 млн на фоне наплыва стартапов, защищающих ИИ-агентов Microsoft Research представила Quine — ИИ-систему для изучения сложных процессов в биологии Марисса Майер делает ставку на то, что фотоплёнка расскажет о вашей жизни больше, чем почта — с Dazzle Google AI Overviews подсказал женщине охотиться на милых мелких птиц вне сезона — и она сама вызвала полицию Хватит стыдить людей за использование ИИ — пора объединяться, чтобы не дать ИИ сделать нас ненужными Тимнит Гебру считает, что экзистенциальной угрозы от ИИ нет GPT-6.1 Astra слишком склонна к обману, чтобы выпускать её, — OpenAI пошла на самые решительные меры безопасности за всю историю компании Данные показывают: ИИ уничтожил рабочие места в креативных отраслях OpenAI снова открыла тариф Pro за $200, но вдвое сократила кредиты API и подталкивает пользователей к оплате по факту использования ИИ-бум захватил климатическую неделю — и рады этому не все Manus 2.0 позволяет редактировать видео, запускать многопользовательские игры и удалённо управлять агентами с телефона Дарио Амодей из Anthropic стал героем пародии в Saturday Night Live Google закрывает Gems в Gemini и переводит помощников в формат «навыков» В проспекте Anthropic — убытки, рост и предупреждение: ИИ компании может погубить человечество Meta запускает корпоративную ИИ-платформу и назначает главу MongoDB руководить новым направлением Страховый стартап Outmarket привлёк $34,5 млн всего через несколько месяцев после прошлого раунда OpenAI извинилась за взлом систем Medicare и других госведомств Австралии и обещает исправиться Дипфейк голоса обманул её дедушку — и основательница бросилась действовать Peak XV увеличила посевные инвестиции через Surge до $5 млн и представила набор из 18 стартапов OpenAI отказалась выпускать новую модель после проблем с безопасностью на внутренних тестах

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram