Озвучка на русском через бесплатную нейросеть QWEN

В этом видео показываю, как использовать китайскую нейросеть Qwen 2.5 TTS для озвучки текстов. Три режима работы: готовые голоса с эмоциями, создание голоса по описанию и клонирование своего голоса. Всё бесплатно через Google Colab — не нужен мощный компьютер, всё работает в облаке.

*https://www.youtube.com/watch?v=x5D_lOwycPo
**https://300.ya.ru/v_pfXfK5qa

таймкоды

00:00:00 Введение

  • Обучение озвучиванию текстов с помощью нейросетей бесплатно на старом ноутбуке.
  • Использование Google Collab и китайской нейросети QN3 TTS.
  • Возможность выбора языков и голосов, управления интонациями.

00:00:53 Установка Google Collab

  • Google Collab скрыт по умолчанию, нужно его активировать.
  • В настройках Google Collab найти «Google лаборатории», нажать «Действия» и «Установить».
  • Авторизоваться в Google для установки расширения.

00:01:39 Начало работы

  • После установки Google Collab файл откроется в новой вкладке.
  • Использование ресурсов Google для скачивания языковых моделей.
  • Подписка на YouTube-канал и Telegram-канал автора.

00:02:29 Установка библиотек

  • Установка необходимых библиотек в облаке Google.
  • Быстрое скачивание больших моделей.

00:03:07 Выбор голосов

  • Выбор из девяти премиальных голосов с управлением эмоциями.
  • Пример выбора русского языка и голоса «Райан».

00:03:42 Генерация текста

  • Редактирование текста, выбор языка и голоса.
  • Вставка эмоции и запуск генерации.

00:05:03 Создание голоса по описанию

  • Описание голоса: молодой мужской, энергичный, дружелюбный.
  • Генерация голоса по описанию.

00:06:29 Клонирование голоса

  • Загрузка собственного аудиофайла для клонирования голоса.
  • Пример загрузки короткого отрезка аудио 3–10 секунд.
  • Вставка текста, который произносил на записи, для обучения нейросети.

00:08:28 Результат клонирования

  • Получение клонированного голоса, который звучит похоже на исходный.

00:08:43 Заключение

  • Подчёркивание бесплатности метода.
  • Упоминание о возможных ограничениях ресурсов Google Collab.
  • Призыв подписаться на канал и Telegram-канал автора.

В этом видео

Эпизоды
Расшифровка видео
Что будет в видео
0:00
Хотите научиться озвучивать свои тексты с помощью нейросетей?
0:04
Абсолютно бесплатно, даже если у вас старенький дохлый ноут.
0:08
Просто с помощью Google Диска.
0:10
Точнее с помощью Google Коллаб, но это не важно.
0:13
Посмотрите это видео до конца и я пошагово покажу вам,
0:16
как использовать китайскую нейросеть QWEN 3TTS
0:20
для того, чтобы озвучивать свои тексты разными голосами и разными интонациями.
0:25
На выбор несколько языков и несколько голосов,
0:28
где вы можете управлять интонациями и можете даже собственный голос клонировать
0:33
или создать какой-то персонаж, который будет озвучивать ваши тексты.
Скачиваем файл для Google Colab
0:38
Показываю по шагам, что нужно сделать.
0:40
Откройте ваш Google Диск и скачайте по ссылке в описании файл, который я прикреплю.
0:47
Он имеет довольно странное расширение.
0:49
Это не текстовый файл, это файл блокнота Google Коллаб.
0:53
Дело в том, что Google не хочет, чтобы вы пользовались этой возможностью
0:57
и поэтому по умолчанию Google Коллаб на вашем аккаунте будет скрыт, не активирован.
1:01
Мы это исправим.
Устанавливаем Google Colaboratory
1:02
Заходим в правом верхнем углу в значок шестеренки, нажимаем на кнопку настройки.
1:08
Оттуда переходим в раздел управления приложениями и находим в списке Google Коллаборатории.
1:14
В нем необходимо нажать на кнопку действия и посмотреть сведения о сервисе.
1:19
Это официальное расширение Google.
1:21
Бояться ничего не стоит.
1:23
Для того, чтобы его установить, нажимаем на кнопку установить.
1:26
У нас появляется всплывающее окно, в котором нам нужно нажать на кнопку продолжить
1:31
и во всплывающем окне выбрать свой аккаунт и ввести от него пароль для того, чтобы авторизоваться.
1:39
Скорее всего, даже пароль не попросить, потому что вы уже авторизованы в Google.
1:42
Нажимаем продолжить.
1:44
Нажимаем на кнопку ок, когда все установится.
1:47
У нас сначала происходит установка.
1:49
И когда она завершится, нам нужно нажать на кнопку готово, затем на кнопку ок.
1:53
Закрываем это окошко и возвращаемся обратно в свой Google диск.
1:56
Берем тот файлик, который я вам дал.
1:59
И он откроется теперь в новой вкладке в окружении Google Коллаборатории.
2:04
Что это такое?
2:05
Это мы берем с вами и пользуемся бесплатно ресурсами Google для того, чтобы скачивать большие языковые модели,
2:12
которые будут озвучивать тексты.
2:14
Выглядит это все вот таким вот образом.
2:16
У нас есть блокнотик.
2:18
Сверху у нас есть там команды, код, текст и так далее.
2:21
Мы здесь пока что ничего не нажимаем.
2:22
Здесь для вас все должно быть очень просто.
2:25
Во-первых, вам нужно подписаться на YouTube канал и на канал в Telegram.
2:28
Ссылка будет в описании.
Шаг 1: Установка библиотек
2:29
Во-вторых, на шаге 1 вам нужно все установить.
2:33
Если хотите, если вас пугает вид вот этого кода, вы можете его свернуть и просто нажать на кнопку play.
2:39
Когда все установится, вы увидите процесс установки, что он завершен.
2:46
Что происходит на первом шаге?
2:48
Устанавливаются все необходимые библиотеки.
2:50
Они устанавливаются не в ваш Google Диск.
2:52
То есть они не тратят место на вашем Google Диске.
2:54
Они устанавливаются в облаке Google.
2:56
И они довольно большие.
2:59
Но из-за того, что мы пользуемся не своим компьютером и даже не своим интернетом,
3:03
эти библиотеки скачаются очень быстро, на большой скорости.
3:07
Просто нужно будет подождать пару минут.
3:09
Хотя скачиваться там будет несколько гигабайт.
3:12
То есть это 4 гигабайта, по-моему, весит модель.
Режим 1: Готовые голоса с эмоциями
3:15
Дальше.
3:16
У нас есть возможность выбирать Custom Voice, готовые голоса.
3:20
И это 9 премиальных готовых голосов, в которых мы можем управлять эмоциями.
3:26
То есть говорить, как должен произносить текст этот голос.
3:31
Например, шепотом, радостно и так далее.
3:34
Сейчас у нас происходит установка.
3:36
Когда она закончится, я продолжу.
3:38
Я вижу, что установка завершена.
3:41
Дальше мне необходимо перейти к следующему шагу.
3:45
Следующий шаг у меня называется Custom Voice.
3:47
Генерация.
3:48
Здесь прописан текст, который можно отредактировать.
3:52
Вы можете написать здесь свой текст.
3:53
Вы можете выбрать один из 9 представленных языков.
3:57
Или выбрать автоматический.
3:58
Я выберу русский.
3:59
Можно выбрать спикера, который все это будет произносить.
4:02
Например, Ryan.
4:03
И здесь можно вставить эмоцию.
4:05
Например, грустно.
4:08
И нажимаем на Play.
4:10
Здесь будет скачиваться модель.
4:12
То есть тоже нужно будет подождать.
4:13
Но если вы один раз все это запустили, все скачали,
4:16
то за один сеанс вы можете сделать много-много аудио.
4:20
И заново скачивать модели будет не нужно.
4:23
Сейчас я дождусь, когда процесс выполнится полностью.
4:26
Происходит загрузка модели.
4:28
Здесь загружается почти 4 гигабайта.
4:30
Когда это все закончится, я продолжу.
4:32
После того, как скрипт закончил свою работу, я увижу готовый файл.
4:36
Который автоматически, кстати, уже скачался.
4:38
Я просто не успел поймать его.
4:41
Нажимаем на Play.
4:41
Слушаем.
4:42
Привет.
4:44
Это демонстрация нейросети.
4:46
Подписывайтесь на канал Лысый из браузера.
4:49
Привет.
4:50
Это как бы не совсем грустно.
4:51
Ну ладно.
4:52
Лучше всего, конечно, эмоции прописывать на английском языке.
4:55
Тогда он будет их лучше понимать.
4:56
Но вы слышали эту интонацию?
4:59
Это клево.
5:00
С ударениями все тоже хорошо.
Режим 2: Создание голоса по описанию
5:02
Дальше мы можем перейти к режиму 2.
5:05
Это когда мы создаем дизайн голоса.
5:08
То есть мы создаем голос из описания.
5:10
То есть мы описываем, что это молодой мужской голос, энергичный, дружелюбный, говорит с энтузиазмом, как блогер.
5:17
И здесь у нас есть текст и язык.
5:21
Все.
5:21
Точно так же здесь все работает.
5:23
Мы просто запускаем загрузку.
5:25
Здесь из-за того, что это отдельная как бы песочница.
5:27
Здесь снова скачивается модель.
5:29
И после того, как она скачается, произойдет генерация голоса.
5:34
Модельки скачались.
5:35
Теперь происходит генерация.
5:37
С описанием мужской голос, энергичный, дружелюбный, говорит как блогер.
5:41
И после того, как все закончится…
5:45
Привет.
5:45
Это демонстрация создания голоса по описанию.
5:49
Да, с голосами, конечно, проблема.
5:52
С ударением в русском языке довольно сложно все.
Режим 3: Клонирование голоса
5:55
И последний режим это voice clone.
5:58
То есть клонирование голоса.
6:00
И здесь мы можем, во-первых, воспользоваться каким-то демо голосом.
6:05
Я сейчас нажму на play.
6:06
И демо голос английский загрузится.
6:08
Здесь будет английская озвучка.
6:09
Когда я выполню это, я перейду к самому интересному шагу,
6:13
где нужно будет загрузить свое собственное аудио
6:16
и клонировать свой собственный голос.
6:19
И это тоже будет бесплатно и тоже делается прямо на серверах Google.
6:23
Сейчас дождемся, пока у нас склонируется англоязычный голос.
6:26
И потом я покажу на своем примере.
6:29
Здесь загружаются все модели каждый раз, потому что я так прописал.
6:33
Потому что, возможно, вам не нужна будет предыдущая песочница,
6:35
а нужна будет только эта.
6:37
Но вообще можно не загружать модели каждый раз в каждом отдельном шаблоне.
6:40
Вот у меня тут проблема с тем, что я неправильную ссылку вставил на клонирование голоса.
6:46
Ну и ладно, пропустим этот этап.
Загружаем свой голос
6:47
Давайте лучше загрузим свой собственный голос.
6:50
Для этого нужно вот здесь выбрать файл.
6:53
Когда мы выбираем файл, нам нужно выбрать такой отрезок,
6:57
где мы четко говорим какой-то текст.
7:00
Причем желательно этот текст еще и записать.
7:03
В Ташкенте люди ходят на бизнес-завтраки.
7:05
Один из таких бизнес-завтраков называется иишница.
7:08
Вот такой вот пример голоса.
7:10
Добавляем его сюда.
7:12
Он прогрузится.
7:13
Желательно вообще делать короткие примеры.
7:15
То есть 3-10 секунд.
7:17
Я загружаю сюда 40 секунд или 30 секундный отрезок.
7:21
Из-за этого могут быть всякие артефакты.
7:23
Ну то есть ненужные мне результаты.
7:25
Поэтому всегда пример для голоса должен быть коротенький, такой маленький.
7:30
Дальше мы прописываем текст, который мы хотим озвучить.
7:34
Это мой клонированный голос.
7:36
А сюда нужно вставить текст, который я произносил на том аудио, который я загрузил,
7:41
чтобы нейросеть понимала, что за слова я произношу.
7:43
И я заранее подготовил весь этот текст.
7:46
В Ташкенте люди ходят на бизнес-завтраки.
7:49
Один из таких бизнес-завтраков называется иишница.
7:51
Я вставляю этот текст и запускаю клонирование голоса.
7:55
И он сгенерирует вот этот текст, который я сюда вписал.
8:00
Проверит, что на записи я говорю вот такой текст.
8:02
Привяжет мой голос к этим словам.
8:04
И сможет обучиться довольно быстро к клонированию моего голоса.
8:09
Модель здесь уже загружена.
8:10
И он просто сейчас клонирует мой голос для того, чтобы озвучить его.
8:14
Уверен, что здесь будет какая-то шляпа.
8:16
Но, тем не менее, спустя несколько попыток можно нормально клонировать свой голос, который будет похож.
8:22
Подождем.
8:28
И запустится скачивание файла.
Результат клонирования
8:31
Привет, это мой клонированный голос.
8:34
Звучит похоже?
8:35
Звучит, кстати, очень похоже.
8:37
Это получилось прям очень хорошо.
8:39
Еще раз.
8:39
Привет, это мой клонированный голос.
8:41
Звучит похоже?
8:43
Звучит действительно очень похоже.
Итоги
8:45
Итак, это все, что я хотел вам сегодня показать.
8:48
И вы можете делать все то же самое.
8:51
Можете изучать этот файл.
8:52
Получить его можно по ссылке в описании.
8:54
И повторюсь, этот метод бесплатный.
8:56
Единственное, что у вас могут закончиться ресурсы на использование как бы Google, Google Collab.
9:02
И он может сказать, что оплатите.
9:04
Но достаточно дать ему отдохнуть несколько часов, и он снова возобновит свою работу.
9:09
Подпишитесь на канал.
9:11
Ставьте лайк этому видео.
9:12
Это, по-моему, мега полезная вещь.
9:15
Это суперновая вышедшая библиотека, которая озвучивает совершенно на другом уровне.
9:20
Не так, как остальные бесплатные модели.
9:22
В комментариях пишите вопросы.
9:24
Меня зовут Артем Исламов.
9:25
Это Лысый из браузера.
9:26
Я рассказываю про нейросети так, чтобы ваша жизнь и работа становились лучше.
9:31
Подписывайтесь на меня в телеге.
9:33
И до скорой встречи.
9:34
Пока.
9:34
Продолжение следует…

Поделиться: