2 мин чтения

ElevenLabs научила речевую модель v4 клонировать голос по 10 секундам записи

ElevenLabs представила речевые модели ElevenLabs v4 и v4 Turbo. Они дают больше контроля над интонацией, поддерживают свыше 90 языков и быстрее отвечают в голосовых агентах.

Логотип ElevenLabs с белыми буквами на черном фоне
Image Credits: ElevenLabs

Для клонирования голоса v4 достаточно 10 секунд аудиозаписи.

Предыдущую модель v3 компания выпустила в прошлом году, а v4 показала на мероприятии в Варшаве ранее в этом году. Для новых моделей ElevenLabs разработала другую архитектуру. По словам компании, она ускоряет клонирование голоса и позволяет точнее управлять звучанием готовой речи.

При озвучивании длинных фрагментов v4 лучше сохраняет особенности выбранного голоса. Модель также учитывает содержание текста и меняет выразительность речи по ходу чтения. В v3 для управления подачей появились теги внутри текста; теперь несколько тегов можно ставить подряд, а модель будет следовать заданной последовательности.

Поддержка языков выросла с 70 до более чем 90. Самое заметное улучшение качества ElevenLabs отмечает для японского, бразильского португальского, путунхуа и кантонского. Компания не приводит в материале сопоставимых показателей качества для каждого языка.

В v4 также доработали функции для голосовых агентов. ElevenLabs сообщает о снижении задержки, которое должно сделать разговор плавнее. Модель может начинать озвучивание ответа, пока лежащая в основе агента большая языковая модель ещё генерирует текст. По заявлению компании, новая версия также по-разному обрабатывает конфликтные обращения, передачу сложных вопросов на следующий уровень поддержки и ожидание на линии.

Бизнес ElevenLabs, связанный со звонками для корпоративных клиентов, быстро вырос за последний год. Крупные компании теперь обеспечивают более 55% бизнеса стартапа. Улучшения скорости ответа в v4 рассчитаны не только на авторов озвучки, но и на тех, кто использует модель для телефонных разговоров.

Речевые технологии также развивают Cartesia, Deepgram, Fish Audio, Boson и WellSaid Labs. Свои голосовые модели совершенствуют Google и OpenAI. В начале года ElevenLabs привлекла $500 млн в раунде под руководством Sequoia: тогда компанию оценили в $11 млрд. Сообщалось и о возможном следующем раунде с оценкой в $22 млрд, однако его проведение не подтверждено.

Годовой темп выручки ElevenLabs вырос примерно с $330 млн в начале года до более чем $600 млн. Компания активно нанимала сотрудников в Индии, Европе и Бразилии; численность её команды превысила 800 человек. Сооснователь и генеральный директор Мати Станишевский ранее говорил TechCrunch, что компания нацелена на выход на биржу в ближайшие годы, но конкретного срока не назвал.

Источник: Techcrunch
Елизавета Добровольская
Автор itzine.ru с 2021 года. Пишет о смартфонах, гаджетах, железе, искусственном интеллекте и космосе — в общем, обо всём, что есть в мире технологий. От новостей о складных флагманах и процессорах до репортажей о культуре и рынке электромобилей. Следит за индустрией внимательно, но без фанатизма.

Оставить комментарий