# Digercules — что это и кому нужно

## 1. Кто вероятный потребитель

Прежде всего — **хранители звуковых архивов**: люди и организации, у которых скопились сотни или тысячи аудиозаписей, и которым важно знать *что именно* на них записано.

Конкретнее:

- **Библиотеки, архивы, музеи** — фонды с магнитофонными записями, концертами, лекциями, устной историей
- **Частные коллекционеры** — у кого дома лежат MP3, оцифрованные кассеты, концерты любимых исполнителей
- **Исследователи** и фольклористы — кому нужно не просто хранить, а искать и цитировать по тексту
- **Звукозаписывающие студии и лейблы** — для каталогизации архивного материала
- **Организаторы песенных или стихотворных фестивалей** — в первую очередь: наш первый и пока крупнейший клиентский случай — архив русскоязычной бардовской песни
- **Музыкальные и литературные клубы** — у которых из вечера в вечер копятся записи прошедших концертов, творческих встреч и поэтических чтений, а разобрать их руками уже некому

## 2. Что делает продукт

Digercules берёт папку с аудиофайлами — концертами, лекциями, записями выступлений — и **автоматически превращает их в текст с указанием времени каждой фразы.**

При этом он не просто "расшифровывает речь". Он также:

- **Определяет, какие именно песни** прозвучали в записи, сверяясь с базой текстов
- **Помечает паузы и аплодисменты** — чтобы было понятно, где заканчивается одна песня и начинается другая
- **Конвертирует сопроводительные документы** (HTML-страницы, PDF) в удобный текст
- **Упаковывает результаты** в архив, который клиент может распаковать прямо в свою папку с аудио — и тексты окажутся рядом с каждым файлом

## 3. К какой категории относится этот инструмент

Это инструмент класса **"автоматическая каталогизация аудиоархива"** — нечто среднее между:

- транскрибатором (расшифровщиком речи)
- поисковым индексатором для музыкальных коллекций
- системой управления цифровым архивом (Digital Asset Management)

Но в отличие от каждого из этих классов по отдельности — Digercules заточен именно под **живые выступления, где звучит текст песни**, — неважно, бардовская это песня, рок, метал, регги или что угодно ещё на любом языке, — там, где обычные инструменты дают плохой результат. Без слов (чистый инструментал) программе распознавать и сверять нечего — пользы от неё в этом случае немного.

## 4. Чем это лучше других близких программных продуктов и общедоступных нейросетей

**Стандартные транскрибаторы** (Google, Yandex, Whisper «из коробки») работают плохо на:
- живых концертах с шумом зала и несовершенной акустикой
- текстах со специфической лексикой, которой нет в стандартных обучающих данных — жанровый жаргон, редкие имена, региональные реалии
- длинных записях, где модель начинает "галлюцинировать" — повторять одну фразу снова и снова

**Что делает Digercules иначе:**

1. **Обучает модель специально под конкретный голос и репертуар.** Он берёт образцовые расшифровки нескольких записей и "дообучает" нейросеть — как ученик, который сначала читает ноты, а потом слушает конкретного исполнителя. Результат: в 2–3 раза меньше ошибок на похожих записях.
2. **Знает тексты песен заранее.** Перед распознаванием программа подсказывает нейросети: "сейчас, скорее всего, будет эта песня" — и модель гораздо точнее справляется с нестандартными словами и именами.
3. **Умеет фильтровать "мусор".** У стандартных распознавателей есть известная проблема: на аплодисментах и тишине они начинают выдумывать фразы. Digercules ведёт список таких "галлюцинаций" и вычищает их автоматически.
4. **Работает на живом звуке любого жанра, где есть текст песни** — рок, метал, регги, авторская песня, что угодно ещё, на любом языке, — а не только на студийных записях или деловых переговорах, под которые заточены коммерческие сервисы.

## 5. Какие задачи эта программа выполняет

| Задача | Что получает пользователь |
|---|---|
| Расшифровать 200 концертов | Текстовый файл рядом с каждым MP3, с таймкодами по минутам |
| Узнать, что именно исполнялось | Список песен с привязкой ко времени и ссылками на тексты |
| Найти конкретную песню в архиве | Поиск по тексту через любой файловый менеджер |
| Подготовить материал для исследования | Готовые транскрипты в текстовом формате |
| Создать "умную" нейросеть под свой архив | Обученная модель, которая знает голос исполнителя и его репертуар |
| Передать результаты заказчику | Лёгкий zip-архив с текстами (без аудио), распаковывается в одно нажатие |

## 6. Как этот инструмент помогает

Представьте: у вас есть архив концертных записей — рок, бардовская песня, метал, регги, что угодно ещё с текстом песни. Чтобы прослушать их все и записать, *что* исполнялось — нужно несколько месяцев работы одного человека.

Digercules делает это за несколько дней машинного времени — пока вы занимаетесь другими делами.

**Конкретный результат на реальном архиве** (первый и пока крупнейший клиентский случай — архив русскоязычной бардовской песни, 25 проектов):

<div class="stat-grid">
  <div class="stat-tile"><div class="stat-value">более 800 000</div><div class="stat-label">файлов обработано</div></div>
  <div class="stat-tile"><div class="stat-value">около 85 ТБ</div><div class="stat-label">объём источников</div></div>
  <div class="stat-tile"><div class="stat-value">более 66 000 ч</div><div class="stat-label">звука (около 7,5 лет)</div></div>
  <div class="stat-tile"><div class="stat-value">1,8 ТБ</div><div class="stat-label">высвобождено дублями</div></div>
  <div class="stat-tile"><div class="stat-value">3 507 ч</div><div class="stat-label">затрачено на обработку</div></div>
  <div class="stat-tile"><div class="stat-value">~430</div><div class="stat-label">исполнителей опознано по видео</div></div>
</div>

Три хаба обработки при этом почти без остановки проработали 96 суток подряд с момента запуска проекта в июне — то есть большую часть трёх месяцев его существования. Текст и метаданные для передачи через интернет получаются в 800+ раз компактнее исходного звука и видео — без потери смысла.

Почему это вообще делается на собственных машинах, а не в облаке: по реальному замеру имеющегося канала связи (~30 Мбит/с) одна только закачка около 85 ТБ туда заняла бы около 262 суток — против 96 суток, за которые архив целиком обработан на месте. Хранение того же объёма в облаке обходилось бы от $84 в месяц, а обработка на сопоставимом по мощности GPU (без премиальных видеокарт, без промо-тарифов) потребовала бы от $150–190 в месяц. И это без учёта ещё одного шага: данные из хранилища всё равно нужно перегнать на саму GPU-машину для обработки. Даже по каналу втрое быстрее (100 Мбит/с) партия среднего проекта (~3,4 ТБ на проект при 84,9 ТБ на 25 проектов) идёт около 3 суток, и так на каждый из проектов.

- Для каждого концерта составлен список песен с таймкодами
- Нейросеть дообучается на голосах, фотоснимках и видеослайдкастах сотен исполнителей в тысячах архивных аудио- и видеозаписей (Визбор, Высоцкий, Камбурова, Окуджава, Ким, Галич, Никитины и десятки др.)
- Результаты упакованы и переданы в папку к исходным файлам — никакой переструктуризации архива

**Для клиента** это означает: архив, который раньше существовал только в виде сотен безымянных файлов, превращается в **каталог с поиском** — можно найти любую песню, любую фразу, любой момент выступления.

Показательный кейс: поиск конкретной оцифрованной записи выступления Визбора 1979 года — материала, которого нет в открытом доступе и который не находится обычным поиском. Именно такие записи, а не студийные альбомы, составляют основную ценность подобных архивов: 90% содержимого крупных бардовских коллекций не индексируется поисковиками вообще.

Если в архиве кроме аудио есть и видеозаписи концертов, та же система умеет узнавать лица в кадре — того, кто на сцене, и, если нужно, тех, кто в зале, — с тем же принципом: подсказывает похожесть, а подтверждает всегда человек. [Как это устроено](/face-identification/) — отдельно, подробно.

Насколько велик бывает физический архив ещё до всякой цифровизации, наглядно показывает видео из Архивной Службы Авторской Песни: коробки и стеллажи с негативами, которые годами ждут своей очереди на оцифровку. Сканирование самих негативов — отдельный этап, до Digercules; программа начинает работу уже с готовыми цифровыми файлами, но именно такой объём непереведённого в цифру материала обычно и есть стартовая точка.

<figure class="video-embed">
  <div class="video-embed-frame">
    <iframe src="https://www.youtube.com/embed/Y5ZritjU2io" title="Оцифровка негативов в АСАП" allow="accelerometer; encrypted-media; gyroscope; picture-in-picture" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
  </div>
  <figcaption>Оцифровка негативов в Архивной Службе Авторской Песни — реальный масштаб материала до цифровизации.</figcaption>
</figure>

---

Есть возможность работать с архивом как на обычных пользовательских компьютерах без специального оборудования, передавая сжатый в сотни и тысячи раз материал для дообработки, так и непосредственно на компьютере заказчика вообще без передачи через интернет (при наличии достаточно мощной видеокарты). Результаты обработки передаются в виде архива с текстовыми файлами, пригодными для последующей индексации и поиска. Всё — без единого байта в облаке.
