Представляю удобный интерфейс для синтеза и клонирования голоса, который я интегрировал в нашу экспериментальную площадку DEWIAR. Теперь вы можете создать цифровой отпечаток любого голоса (даже своего!) всего по короткому фрагменту записи. Всё работает локально, быстро и — самое главное — доступно для вас совершенно бесплатно.
*https://www.youtube.com/watch?v=Cut0_GWFKxo
**https://300.ya.ru/v_4SQ2ZVTF
таймкоды
00:00:10 Введение
- Миша, специалист по естественному интеллекту, давно не выходил на связь из-за интенсивной работы.
- В будущих видео он расскажет о важных направлениях в области искусственного интеллекта.
00:00:41 Синтез звука и клонирование голоса
- Миша рассказывает о своём проекте по синтезу звука и клонированию голоса.
- Упоминает библиотеки, позволяющие создавать такие решения в домашних условиях.
00:01:34 Интерфейс и использование
- Демонстрирует интерфейс для синтеза голоса, созданный в рамках системы «Дэви Дви».
- Объясняет, как использовать готовые голоса и загружать их в виде MP3-файлов.
00:03:06 Фильтры и эффекты
- Показывает, как применять фильтры для изменения настроения и эффектов голоса.
- Приводит примеры использования фильтров для создания футуристичного и сниженного тембра голоса.
00:04:22 Создание собственных голосов
- Рассказывает о возможности записи и синтеза собственного голоса.
- Подчёркивает простоту использования и локальность процесса.
00:05:21 Применение в автоматизации
- Показывает, как использовать API для синтеза речи в автоматизациях.
- Отмечает бесплатность и доступность решения.
00:06:33 Принцип работы нейросетей
- Объясняет, как нейросети превращают голос в вектор и создают «отпечаток» голоса в цифровом пространстве.
- Демонстрирует преобразование голоса в трёхмерные координаты.
00:09:07 Пример использования
- Показывает пример создания голосового помощника с голосом Патрика из мультфильма.
- Упоминает обучение помощника полезным функциям, таким как включение музыки и радио.
00:10:44 Заключение
- Подчёркивает важность охвата всех модальностей в работе с ИИ.
- Выражает надежду на дальнейшее развитие технологий и создание автономных агентов.
- Прощается с аудиторией, желая всего наилучшего.
Transcript
0:10
Всем привет. С вами Миша. Естественный
0:13
интеллект. Давно я не выходил на связь,
0:16
потому что много работал.
0:18
В ближайшие свои видео я покажу, чем
0:21
именно я занимался. достаточно важными
0:24
вещами, без которых
0:27
как-то
0:29
эффективно двигаться вперёд невозможно.
0:32
То есть есть в сфере искусственного
0:34
интеллекта
0:36
такие низшие направления, которые
0:38
глубокие, сложные, их нужно решать. Ну,
0:41
касательно контекстных окон. Я расскажу
0:43
об этом в будущих своих видео, если вам
0:46
будет интересно. В этом видео я просто
0:49
расскажу о некоторых побочных продуктах,
0:51
которые я сделал в процессе за это
0:52
время. не хотел отвлекаться, но сейчас я
0:54
в отпуске, как видно, по моей по моей
0:56
бороде.
0:58
Поэтому я, в принципе,
1:01
параллельно в перерывах между основной
1:02
работой, между тем направлением, которое
1:04
меня больше всего интересует и которое я
1:06
считаю суперважное,
1:09
я сделал ещё несколько решений. Об одном
1:11
из них сейчас расскажу.
1:13
Первое решение, которому посвящено
1:15
сегодняшнее видео наше — это синтез
1:18
звука, синтез голоса. И не просто
1:20
синтез, а клонирование вашего голоса. А
1:24
технологии так сейчас развиваются, что
1:27
появляются такие библиотеки, которые
1:29
позволяют в домашних условиях создавать
1:32
вот такие вот интереснейшие вещи.
1:35
В частности, вот один из представителей,
1:38
я пробовал раньше Барк, непредсказуемая
1:41
модель. Сейчас ещё доступен Кокви TTS,
1:46
то есть текст to spech, модель, которая
1:49
преобразует
1:50
текст в голос.
1:53
В принципе, попробовал, поставил,
1:54
система работает. Для того, чтобы вы
1:56
могли этим всем пользоваться, я вывел
1:58
это в отдельный интерфейс.
2:00
Кто знает,
2:02
я делаю продукты, проекты в рамках
2:05
системы DVR. DVR — это экспериментальная
2:07
площадка, на которой мы запускаем
2:08
различные решения, тестируем их,
2:10
экспериментируем с ними. Вот у нас уже
2:13
большая аудитория, больше 125.000
2:16
зарегистрированных пользователей,
2:18
множество энтузиастов,
2:19
экспериментаторов, людей, которые что-то
2:21
создают, придумывают.
2:23
И вот вот это вот приложение, вот такой
2:26
вот значок, это и есть наш синтезатор,
2:29
который я сделал. Всё очень просто, то
2:32
есть фактически я упаковал это решение
2:35
просто визуальную оболочку. При этом мы
2:39
можем использовать готовые голоса. На
2:41
самом деле это просто я взял голоса
2:43
различных дикторов, вот, и просто их
2:46
загрузил в виде обычных MP3 файлов.
2:49
Представляете? То есть насколько это
2:51
просто делается.
2:53
Просто загружаем голос, наживаем
2:56
синтезировать. Всё это происходит прямо
2:58
у меня локально, то есть не супермощном
3:01
сервере, на обычном.
3:01
Привет, я ваш виртуальный ассистент. Чем
3:04
могу помочь вам сегодня?
3:06
Видите, да? Акцент небольшой, работает
3:09
довольно быстро, и это всё локально,
3:12
представляете? То есть без каких-то
3:13
внешних зависимостей. Ну а раз я
3:15
разместил это всё локально, почему бы не
3:17
создать для голосов сразу же фильтры? И
3:20
я сделал кучу фильтров. Например,
3:22
которые придают настроение, придают
3:24
различные эффекты. Например, Вакодер
3:26
придаст некоторую футуристичность
3:28
голосу. Смотрите, тот же самый голос.
3:36
Слушаем.
3:36
Привет. Я ваш виртуальный экосистем. Чем
3:40
могу помочь вам сегодня?
3:42
Слышите? Да, довольно звучит уже
3:45
по-другому, как в фантастических
3:47
фильмах.
3:48
Привет, я ваш виртуальный ассистент. Чем
3:51
могу помочь вам сегодня?
3:53
Ну, то же самое, например, какой-нибудь
3:55
мужской голос выберем.
3:58
Привет,
3:59
я ваш виртуальный ассистент. Чем могу
4:02
помочь вам сегодня?
4:04
Раз мы выбрали мужской голос, возьмём
4:06
какой-нибудь ещё
4:09
фильтр такой, который снизит тембр. То
4:12
есть тот же самый голос, тот же слепок.
4:15
Тоже предложение, только
4:16
Привет, я ваш виртуальный ассистент. чем
4:20
могу помочь вам сегодня.
4:22
Ну и если, например, вы работаете с
4:24
голосами или с какими-нибуд с какой-то
4:25
озвучкой, сразу же вот этой кнопкой
4:28
можно скачать.
4:30
Ну или вот там сейчас сброшу фильтр,
4:32
например, поставлю чистый звук.
4:35
Например, Жириновский, да?
4:38
Привет, я ваш виртуальный ассистент. Чем
4:40
могу помочь вам сегодня?
4:42
Ээ, классно, похоже, правда? То есть, на
4:45
самом деле, я загрузил просто маленький
4:46
кусочек его голоса, шестисекундный, и
4:49
вот он уже звучит, похоже. Таким
4:51
образом, вы можете создавать свои
4:52
голоса. Сейчас вот я не знаю, микрофон у
4:55
меня подключен к записи, поэтому,
4:57
ну, да, он не даст. Но можете записывать
5:01
в реальном времени, просто несколько
5:02
секунд надиктовать своего голоса и
5:04
получите в ответ синтезированный то есть
5:06
возможность синтезировать вашим голосом
5:09
любые сообщения. Также можно загружать
5:11
сюда просто из файла. Вот, в принципе, и
5:14
всё. То есть доступную технологию я
5:17
развернул и написал оболочку для того,
5:19
чтобы это всё быстро работало. Но для
5:22
того, чтобы увеличить ваш опыт
5:25
использования, я покажу один небольшой
5:27
пример, как я использовал для
5:28
экспериментов своих, и покажу как этим
5:32
можно пользоваться, например, в
5:33
автоматизации в той же самой N8N или
5:36
Nat, как её называют. Смотрите, вот если
5:39
здесь правое меню мы откроем, здесь я
5:41
вывел API или API синтеза речи. И здесь
5:45
я показал, как это всё можно
5:47
синтезировать.
5:49
Это локальная версия. Поэтому здесь
5:50
можно все дал все примеры, как это всё
5:54
делается, как слать запросы. То есть
5:56
фактически вы можете о своих
5:57
автоматизациях, своих каких-то решениях
5:59
применять мо вот эту штуку, которую я
6:01
сделал совершенно свободно. при этом
6:04
иметь возможность накладывать фильтры,
6:06
накладывать эффекты, и всё будет
6:09
работать прекрасно. И самое главное,
6:12
самое интересное, это всё вам бесплатно.
6:14
То есть я развернул, сервер работает у
6:17
нас для своих задач, для нейросетей.
6:20
Эта сама модель, она не съедает очень
6:23
много ресурсов, поэтому пользуйтесь
6:27
бесплатно, используйте,
6:28
экспериментируйте,
6:30
сколько вам захочется. Хотелось ещё
6:34
буквально мелочь ещё сказать. То есть
6:37
вот мы уже познакомились с этим
6:40
решением, но как это вообще в принципе
6:43
работает? Что это за чудо такое? Почему
6:46
с такой скоростью ему удаётся наш голос
6:48
вот так вот подражать? Вот. Но на самом
6:51
деле существуют неросети для разных
6:54
задач, вы знаете. И вот есть такие
6:56
неросети, которые изучают,
6:58
э, они превращают ваш тембр, скорость,
7:03
высоту голоса в вектор. То есть все
7:07
знаем, да, что весь прорыв, э, у в
7:12
мощностях и возможностях стал доступен,
7:15
потому что
7:16
иишка работает с векторами, то есть
7:18
превращает любые данные, любую
7:20
информацию, изображение, текст, всё что
7:22
угодно в вектор, нмерное пространство.
7:24
То есть, например, модель мыслит,
7:27
допустим, двачетырёхмерным
7:28
пространством. Она превращает
7:32
наш голос в точку в этом пространстве, а
7:35
потом уже на выходе происходит
7:37
фактически создавая слепок или отпечаток
7:40
как отпечаток пальца, только отпечаток
7:42
нашего голоса в векторе, в цифре, то
7:43
есть в координаты в координатерного
7:46
пространства. Вот как это выглядит. Я
7:48
написал такое решение, которое не для
7:50
этого э приложения я делаю, расскажу в
7:54
будущих своих видео делаю систему знаний
7:58
для искусственного интеллекта. И вот она
7:59
работает с векторами. Здесь я, э,
8:01
документы, э, загоняю вектора, превращаю
8:05
их в цифру. И здесь вот я 4.6 мер
8:07
использую. Здесь я их просто преобразил
8:10
в 3D представление, в трёхмерные
8:13
координаты для того, чтобы понимать, как
8:14
это происходит. То есть, э, и
8:17
искусственный интеллект оперирует вот
8:19
такими вот вещами, то есть всякие
8:21
различными сущностями в энмерном
8:23
пространстве. То есть каждый вот этот,
8:25
каждая точка — это некие координаты в
8:28
каком-то пространстве. И вот ваш голос
8:29
превращается в одну из таких координат.
8:32
Вот. А потом воспроизводится там за счёт
8:34
того, что есть ещё система объединения
8:38
акоodдер, генерация спектрограмм, то
8:40
есть там уже обратный эффект. То есть
8:42
вся информация на самом деле вот я здесь
8:44
милос использую, вот как выглядит. То
8:46
есть ваш голос превращается вот в такую
8:49
штуку. Видите, это координата. Это моя
8:51
система управления знаниями. Здесь 4.600
8:55
мер — это координата вот одного
8:57
информационного блока, неважно какого.
9:00
Так это всё работает. Ну и теперь
9:02
простой пример, как я использую. Я об
9:03
этом в следующем ролике сниму, расскажу.
9:07
Например, вот так вот. То есть я создал
9:12
например голосового помощника. Вот он у
9:14
меня 3D.
9:16
И и для того, чтобы он мог работать, я
9:19
синтезировал голос Патрика.
9:22
Сейчас я посмотрю, может быть, покажу
9:24
его сразу.
9:25
То есть просто из мультфильма загрузил
9:27
его голос.
9:28
Привет,
9:29
я ваш виртуальный систем. Чем могу
9:33
помочь вам сегодня?
9:35
Ну и таким образом я сделал запустил э
9:39
как бы своего помощника, который
9:41
общается голосом Патрика, выполняет
9:44
задачи. Но единственное, что я сейчас,
9:46
так как видео снимаю, микрофон занят, не
9:48
могу продемонстрировать. Но он полностью
9:50
общается, э, разговаривает своим
9:53
голосом, смешно шутит.
9:55
И я тут ещё обучил его всяким штукам
9:57
полезным в виде включения музыки, радио,
10:02
различных всяких таких вот штук, которые
10:04
описаны. Ну, в следующем видео я покажу
10:05
об этом. Вот, в принципе, и всё. Я
10:09
надеюсь, полезно вам было послушать, что
10:11
такое звук, что такое как работают такие
10:14
модели, превращая ваш голос в уникальный
10:16
слепок. Ээ, вот удивительно, что пришло
10:19
время, когда это всё можно, э,
10:21
использовать фактически бесплатно. То
10:23
есть вот я развернул за один присест,
10:25
написал визуалку с помощью
10:27
искусственного интеллекта, так
10:28
называемый вайб-кодинг, только с,
10:30
конечно, с с наличием э ещё собственного
10:34
опыта для контроля качества
10:35
эффективности этого веб-кодинга. Ну и, в
10:38
принципе, всё. Пользуйтесь.
10:40
Ссылка на это решение будет под этим
10:42
видео. Э, если вы нашли это видео
10:45
полезным, буду рад. Если вы поставите
10:48
лайк, э, напишите комментарий,
10:51
если
10:52
интересно двигаться в эту сторону.
10:54
Почему это важно? Потому что когда мы
10:56
работаем с искусственным интеллектом
10:58
на перспективу нам важно хватить все
11:01
модальности, то есть все там цифровое
11:03
зрение, э преобразование голоса в текст,
11:07
текста в голос. То есть все вот эти вот
11:11
коммуникационные каналы, они должны быть
11:14
проработаны для того, чтобы мы в итоге
11:15
смогли собрать полностью автономных
11:17
агентов. Потому что многие знают, что
11:21
оно интересно наблюдать за развитием
11:23
технологий, которые происходят где-то на
11:25
другом континенте, да, читать об этом в
11:28
новостях, э, и просто смотреть, что вот
11:32
кто-то что-то создаёт, а мы только
11:33
зрители, э, такие пассажиры, которые
11:36
смотрят, наблюдают. Но на самом деле,
11:38
имея уже множество опорственных решений,
11:41
собирая их в различные комбинации, делая
11:44
на их основе какие-то интересные
11:45
продукты, мы сами можем влиять на вот
11:48
эти вещи, создавать что-то,
11:50
проектировать, экспериментировать,
11:52
получать результат. И это неимоверно
11:54
интересно, круто. Вот поэтому я думаю,
11:57
что те, кто увлекаются такими вещами,
11:59
поймут меня. Это настолько увлекательно,
12:01
что трудно остановиться. На этом всё.
12:05
Самого доброго, самого лучшего всем.
12:08
Пока.

