Каталогизация концертных аудиоархивов — Digercules

Digercules — что это и кому нужно

1. Кто вероятный потребитель

Прежде всего — хранители звуковых архивов: люди и организации, у которых скопились сотни или тысячи аудиозаписей, и которым важно знать что именно на них записано.

Конкретнее:

2. Что делает продукт

Digercules берёт папку с аудиофайлами — концертами, лекциями, записями выступлений — и автоматически превращает их в текст с указанием времени каждой фразы.

При этом он не просто "расшифровывает речь". Он также:

3. К какой категории относится этот инструмент

Это инструмент класса "автоматическая каталогизация аудиоархива" — нечто среднее между:

Но в отличие от каждого из этих классов по отдельности — Digercules заточен именно под живые выступления, где звучит текст песни, — неважно, бардовская это песня, рок, метал, регги или что угодно ещё на любом языке, — там, где обычные инструменты дают плохой результат. Без слов (чистый инструментал) программе распознавать и сверять нечего — пользы от неё в этом случае немного.

4. Чем это лучше других близких программных продуктов и общедоступных нейросетей

Стандартные транскрибаторы (Google, Yandex, Whisper «из коробки») работают плохо на:

Что делает Digercules иначе:

  1. Обучает модель специально под конкретный голос и репертуар. Он берёт образцовые расшифровки нескольких записей и "дообучает" нейросеть — как ученик, который сначала читает ноты, а потом слушает конкретного исполнителя. Результат: в 2–3 раза меньше ошибок на похожих записях.
  2. Знает тексты песен заранее. Перед распознаванием программа подсказывает нейросети: "сейчас, скорее всего, будет эта песня" — и модель гораздо точнее справляется с нестандартными словами и именами.
  3. Умеет фильтровать "мусор". У стандартных распознавателей есть известная проблема: на аплодисментах и тишине они начинают выдумывать фразы. Digercules ведёт список таких "галлюцинаций" и вычищает их автоматически.
  4. Работает на живом звуке любого жанра, где есть текст песни — рок, метал, регги, авторская песня, что угодно ещё, на любом языке, — а не только на студийных записях или деловых переговорах, под которые заточены коммерческие сервисы.

5. Какие задачи эта программа выполняет

Задача Что получает пользователь
Расшифровать 200 концертов Текстовый файл рядом с каждым MP3, с таймкодами по минутам
Узнать, что именно исполнялось Список песен с привязкой ко времени и ссылками на тексты
Найти конкретную песню в архиве Поиск по тексту через любой файловый менеджер
Подготовить материал для исследования Готовые транскрипты в текстовом формате
Создать "умную" нейросеть под свой архив Обученная модель, которая знает голос исполнителя и его репертуар
Передать результаты заказчику Лёгкий zip-архив с текстами (без аудио), распаковывается в одно нажатие

6. Как этот инструмент помогает

Представьте: у вас есть архив концертных записей — рок, бардовская песня, метал, регги, что угодно ещё с текстом песни. Чтобы прослушать их все и записать, что исполнялось — нужно несколько месяцев работы одного человека.

Digercules делает это за несколько дней машинного времени — пока вы занимаетесь другими делами.

Конкретный результат на реальном архиве (первый и пока крупнейший клиентский случай — архив русскоязычной бардовской песни, 25 проектов):

более 800 000
файлов обработано
около 85 ТБ
объём источников
более 66 000 ч
звука (около 7,5 лет)
1,8 ТБ
высвобождено дублями
3 507 ч
затрачено на обработку
~430
исполнителей опознано по видео

Три хаба обработки при этом почти без остановки проработали 96 суток подряд с момента запуска проекта в июне — то есть большую часть трёх месяцев его существования. Текст и метаданные для передачи через интернет получаются в 800+ раз компактнее исходного звука и видео — без потери смысла.

Почему это вообще делается на собственных машинах, а не в облаке: по реальному замеру имеющегося канала связи (~30 Мбит/с) одна только закачка около 85 ТБ туда заняла бы около 262 суток — против 96 суток, за которые архив целиком обработан на месте. Хранение того же объёма в облаке обходилось бы от $84 в месяц, а обработка на сопоставимом по мощности GPU (без премиальных видеокарт, без промо-тарифов) потребовала бы от $150–190 в месяц. И это без учёта ещё одного шага: данные из хранилища всё равно нужно перегнать на саму GPU-машину для обработки. Даже по каналу втрое быстрее (100 Мбит/с) партия среднего проекта (~3,4 ТБ на проект при 84,9 ТБ на 25 проектов) идёт около 3 суток, и так на каждый из проектов.

Для клиента это означает: архив, который раньше существовал только в виде сотен безымянных файлов, превращается в каталог с поиском — можно найти любую песню, любую фразу, любой момент выступления.

Показательный кейс: поиск конкретной оцифрованной записи выступления Визбора 1979 года — материала, которого нет в открытом доступе и который не находится обычным поиском. Именно такие записи, а не студийные альбомы, составляют основную ценность подобных архивов: 90% содержимого крупных бардовских коллекций не индексируется поисковиками вообще.

Если в архиве кроме аудио есть и видеозаписи концертов, та же система умеет узнавать лица в кадре — того, кто на сцене, и, если нужно, тех, кто в зале, — с тем же принципом: подсказывает похожесть, а подтверждает всегда человек. Как это устроено — отдельно, подробно.

Насколько велик бывает физический архив ещё до всякой цифровизации, наглядно показывает видео из Архивной Службы Авторской Песни: коробки и стеллажи с негативами, которые годами ждут своей очереди на оцифровку. Сканирование самих негативов — отдельный этап, до Digercules; программа начинает работу уже с готовыми цифровыми файлами, но именно такой объём непереведённого в цифру материала обычно и есть стартовая точка.

Оцифровка негативов в Архивной Службе Авторской Песни — реальный масштаб материала до цифровизации.

Есть возможность работать с архивом как на обычных пользовательских компьютерах без специального оборудования, передавая сжатый в сотни и тысячи раз материал для дообработки, так и непосредственно на компьютере заказчика вообще без передачи через интернет (при наличии достаточно мощной видеокарты). Результаты обработки передаются в виде архива с текстовыми файлами, пригодными для последующей индексации и поиска. Всё — без единого байта в облаке.