Digercules — что это и кому нужно
1. Кто вероятный потребитель
Прежде всего — хранители звуковых архивов: люди и организации, у которых скопились сотни или тысячи аудиозаписей, и которым важно знать что именно на них записано.
Конкретнее:
- Библиотеки, архивы, музеи — фонды с магнитофонными записями, концертами, лекциями, устной историей
- Частные коллекционеры — у кого дома лежат MP3, оцифрованные кассеты, концерты любимых исполнителей
- Исследователи и фольклористы — кому нужно не просто хранить, а искать и цитировать по тексту
- Звукозаписывающие студии и лейблы — для каталогизации архивного материала
- Организаторы песенных или стихотворных фестивалей — в первую очередь: наш первый и пока крупнейший клиентский случай — архив русскоязычной бардовской песни
- Музыкальные и литературные клубы — у которых из вечера в вечер копятся записи прошедших концертов, творческих встреч и поэтических чтений, а разобрать их руками уже некому
2. Что делает продукт
Digercules берёт папку с аудиофайлами — концертами, лекциями, записями выступлений — и автоматически превращает их в текст с указанием времени каждой фразы.
При этом он не просто "расшифровывает речь". Он также:
- Определяет, какие именно песни прозвучали в записи, сверяясь с базой текстов
- Помечает паузы и аплодисменты — чтобы было понятно, где заканчивается одна песня и начинается другая
- Конвертирует сопроводительные документы (HTML-страницы, PDF) в удобный текст
- Упаковывает результаты в архив, который клиент может распаковать прямо в свою папку с аудио — и тексты окажутся рядом с каждым файлом
3. К какой категории относится этот инструмент
Это инструмент класса "автоматическая каталогизация аудиоархива" — нечто среднее между:
- транскрибатором (расшифровщиком речи)
- поисковым индексатором для музыкальных коллекций
- системой управления цифровым архивом (Digital Asset Management)
Но в отличие от каждого из этих классов по отдельности — Digercules заточен именно под живые выступления, где звучит текст песни, — неважно, бардовская это песня, рок, метал, регги или что угодно ещё на любом языке, — там, где обычные инструменты дают плохой результат. Без слов (чистый инструментал) программе распознавать и сверять нечего — пользы от неё в этом случае немного.
4. Чем это лучше других близких программных продуктов и общедоступных нейросетей
Стандартные транскрибаторы (Google, Yandex, Whisper «из коробки») работают плохо на:
- живых концертах с шумом зала и несовершенной акустикой
- текстах со специфической лексикой, которой нет в стандартных обучающих данных — жанровый жаргон, редкие имена, региональные реалии
- длинных записях, где модель начинает "галлюцинировать" — повторять одну фразу снова и снова
Что делает Digercules иначе:
- Обучает модель специально под конкретный голос и репертуар. Он берёт образцовые расшифровки нескольких записей и "дообучает" нейросеть — как ученик, который сначала читает ноты, а потом слушает конкретного исполнителя. Результат: в 2–3 раза меньше ошибок на похожих записях.
- Знает тексты песен заранее. Перед распознаванием программа подсказывает нейросети: "сейчас, скорее всего, будет эта песня" — и модель гораздо точнее справляется с нестандартными словами и именами.
- Умеет фильтровать "мусор". У стандартных распознавателей есть известная проблема: на аплодисментах и тишине они начинают выдумывать фразы. Digercules ведёт список таких "галлюцинаций" и вычищает их автоматически.
- Работает на живом звуке любого жанра, где есть текст песни — рок, метал, регги, авторская песня, что угодно ещё, на любом языке, — а не только на студийных записях или деловых переговорах, под которые заточены коммерческие сервисы.
5. Какие задачи эта программа выполняет
| Задача | Что получает пользователь |
|---|---|
| Расшифровать 200 концертов | Текстовый файл рядом с каждым MP3, с таймкодами по минутам |
| Узнать, что именно исполнялось | Список песен с привязкой ко времени и ссылками на тексты |
| Найти конкретную песню в архиве | Поиск по тексту через любой файловый менеджер |
| Подготовить материал для исследования | Готовые транскрипты в текстовом формате |
| Создать "умную" нейросеть под свой архив | Обученная модель, которая знает голос исполнителя и его репертуар |
| Передать результаты заказчику | Лёгкий zip-архив с текстами (без аудио), распаковывается в одно нажатие |
6. Как этот инструмент помогает
Представьте: у вас есть архив концертных записей — рок, бардовская песня, метал, регги, что угодно ещё с текстом песни. Чтобы прослушать их все и записать, что исполнялось — нужно несколько месяцев работы одного человека.
Digercules делает это за несколько дней машинного времени — пока вы занимаетесь другими делами.
Конкретный результат на реальном архиве (первый и пока крупнейший клиентский случай — архив русскоязычной бардовской песни, 25 проектов):
Три хаба обработки при этом почти без остановки проработали 96 суток подряд с момента запуска проекта в июне — то есть большую часть трёх месяцев его существования. Текст и метаданные для передачи через интернет получаются в 800+ раз компактнее исходного звука и видео — без потери смысла.
Почему это вообще делается на собственных машинах, а не в облаке: по реальному замеру имеющегося канала связи (~30 Мбит/с) одна только закачка около 85 ТБ туда заняла бы около 262 суток — против 96 суток, за которые архив целиком обработан на месте. Хранение того же объёма в облаке обходилось бы от $84 в месяц, а обработка на сопоставимом по мощности GPU (без премиальных видеокарт, без промо-тарифов) потребовала бы от $150–190 в месяц. И это без учёта ещё одного шага: данные из хранилища всё равно нужно перегнать на саму GPU-машину для обработки. Даже по каналу втрое быстрее (100 Мбит/с) партия среднего проекта (~3,4 ТБ на проект при 84,9 ТБ на 25 проектов) идёт около 3 суток, и так на каждый из проектов.
- Для каждого концерта составлен список песен с таймкодами
- Нейросеть дообучается на голосах, фотоснимках и видеослайдкастах сотен исполнителей в тысячах архивных аудио- и видеозаписей (Визбор, Высоцкий, Камбурова, Окуджава, Ким, Галич, Никитины и десятки др.)
- Результаты упакованы и переданы в папку к исходным файлам — никакой переструктуризации архива
Для клиента это означает: архив, который раньше существовал только в виде сотен безымянных файлов, превращается в каталог с поиском — можно найти любую песню, любую фразу, любой момент выступления.
Показательный кейс: поиск конкретной оцифрованной записи выступления Визбора 1979 года — материала, которого нет в открытом доступе и который не находится обычным поиском. Именно такие записи, а не студийные альбомы, составляют основную ценность подобных архивов: 90% содержимого крупных бардовских коллекций не индексируется поисковиками вообще.
Если в архиве кроме аудио есть и видеозаписи концертов, та же система умеет узнавать лица в кадре — того, кто на сцене, и, если нужно, тех, кто в зале, — с тем же принципом: подсказывает похожесть, а подтверждает всегда человек. Как это устроено — отдельно, подробно.
Насколько велик бывает физический архив ещё до всякой цифровизации, наглядно показывает видео из Архивной Службы Авторской Песни: коробки и стеллажи с негативами, которые годами ждут своей очереди на оцифровку. Сканирование самих негативов — отдельный этап, до Digercules; программа начинает работу уже с готовыми цифровыми файлами, но именно такой объём непереведённого в цифру материала обычно и есть стартовая точка.
Есть возможность работать с архивом как на обычных пользовательских компьютерах без специального оборудования, передавая сжатый в сотни и тысячи раз материал для дообработки, так и непосредственно на компьютере заказчика вообще без передачи через интернет (при наличии достаточно мощной видеокарты). Результаты обработки передаются в виде архива с текстовыми файлами, пригодными для последующей индексации и поиска. Всё — без единого байта в облаке.