# Пятый подвиг Геракла: цифровая конюшня

*Царь Авгий получил от богов огромные стада скота. Скот был божественный — не болел, плодился, накапливался. Конюшни не чистились годами. Геракл справился за один день — направил через них две реки.*

У всех нас есть цифровая конюшня. Называется она по-разному: "АРХИВ 2012", "Старый ноут", "Диск D — разобрать потом". Файлы тоже накапливаются сами — мессенджер автосохраняет, скриншоты делаются одной кнопкой, почта тянет вложения, торрент качает про запас. Не болеют, не пахнут, места почти не занимают — вот и лежат.

**Вот доказательства на реальных архивах:**

<div class="stat-grid">
  <div class="stat-tile"><div class="stat-value">более 800 000</div><div class="stat-label">файлов обработано</div></div>
  <div class="stat-tile"><div class="stat-value">около 85 ТБ</div><div class="stat-label">объём источников</div></div>
  <div class="stat-tile"><div class="stat-value">более 66 000 ч</div><div class="stat-label">звука (около 7,5 лет)</div></div>
  <div class="stat-tile"><div class="stat-value">1,8 ТБ</div><div class="stat-label">высвобождено дублями</div></div>
  <div class="stat-tile"><div class="stat-value">3 507 ч</div><div class="stat-label">затрачено на обработку</div></div>
  <div class="stat-tile"><div class="stat-value">~430</div><div class="stat-label">исполнителей опознано по видео</div></div>
</div>

По имеющимся каналам связи (~30 Мбит/с, реальный замер) закачка этого объёма в облако заняла бы около 262 суток — против 96, за которые всё обработано на месте. Хранение обошлось бы от $84 в месяц, а обработка на сопоставимом по мощности GPU потребовала бы от $150–190 в месяц. И это без учёта ещё одного шага: данные из хранилища всё равно нужно перегнать на саму GPU-машину для обработки. Даже по каналу втрое быстрее (100 Мбит/с) партия в несколько терабайт идёт около 3 суток.

## 1. Кто вероятный потребитель

**Человек с дисками в шкафу.** Снаружи написано "ВАЖНОЕ". Внутри — несколько копий одного и того же, папка "фото разобрать" с тысячами файлов, архивы с неизвестным содержимым. Не выбросить, потому что вдруг там что-то ценное. Не разобрать, потому что когда?

**Маркетолог в десятках чатов одновременно.** Рабочие чаты с клиентами, тематические каналы, профессиональные сообщества. Где-то там — живые клиенты, незакрытые запросы, чужие боли. Но поток такой плотный, что читать некогда, а нанять аналитика дорого.

**Студент.** Годы конспектов, сканов методичек, записей лекций и семинаров — часто на нескольких языках сразу. Разложено по папкам с именами вроде "пары 3 курс" и "надо пересмотреть". Найти нужный фрагмент перед экзаменом — целое расследование.

**Преподаватель — школьный или университетский.** Учебные материалы накапливаются десятилетиями: конспекты курсов, записи лекций, переписка со студентами, черновики методичек на разных языках. Архив растёт быстрее, чем успеваешь его пересматривать и обновлять.

<figure class="person-photo">
  <img src="/assets/img/photos/university-lecture.jpg" alt="Преподаватель обращается к студентам, конспектирующим в университетской аудитории" loading="lazy">
  <figcaption>Десятилетия учебных материалов, по одной лекции за раз.</figcaption>
</figure>

**Инженер.** Даташиты, схемы, расчёты, техническая документация — годами, десятки гигабайт. В облако нельзя: конфиденциально или просто не хочется кормить чужой датацентр своими знаниями. Половина файлов — без распознавания текста, то есть для поиска они просто не существуют, — а где-то там другой инженер уже решил ровно ту задачу, на которой застряли вы, в такой же приватной папке. ([Подробнее](/net/diy-engineering-exchange/).)

**Музыкант или автор песен.** Концертные записи, черновики, дубли одной и той же вещи в разных исполнениях, магнитофонные плёнки, оцифровки. Знает, что где-то там есть уникальное исполнение или неизданная запись. Не знает, в каком из сотен файлов — и не знает, что кто-то в зале в тот вечер снял именно тот план, которого не хватает в его собственной записи. ([Подробнее](/net/shared-recordings/).)

**Музыкальный или литературный клуб.** Из вечера в вечер копятся записи концертов, творческих встреч, поэтических чтений — но разобрать, кто выступал и что именно звучало, руками уже некому: состав меняется, а архив остаётся общим и ничьим конкретно. Нередко один и тот же вечер снимали сразу несколько участников с разных мест в зале, и записи друг с другом никто никогда не сверял. ([Подробнее](/net/shared-recordings/).)

<figure class="person-photo">
  <img src="/assets/img/photos/camera-operator.jpg" alt="Видеокамера на штативе направлена на освещённую сцену" loading="lazy">
  <figcaption>Один ракурс из многих в тот вечер — остальные никто друг с другом не сверял.</figcaption>
</figure>

**Архивист музыкальной, поэтической или культурной сцены.** Самопровозглашённый хранитель записей с мероприятий целого жанра или сообщества — бардовский круг тут лишь один пример, далеко не единственный. Концерты, чтения, вечера за десятилетия, которые держатся на том, что кто-то ещё помнит, кто выступал, что и когда. Архив полон ровно настолько, насколько полны собственные записи одного человека — хотя другие, кто годами бывал на тех же вечерах, весьма вероятно вели запись со своих мест.

**Архивист.** Хранитель фонда — личного, семейного или переданного на попечение чужого архива. Носители, документы и записи разных эпох вперемешку, без единой системы описания. Задача не «удалить», а понять, что вообще есть, прежде чем что-то решать.

## 2. Что делает продукт

Четыре инструмента под одной крышей — четыре потока воды через четыре разные конюшни.

**Поток первый: библиотека.** Берёт папку с файлами любого типа — книги, даташиты, схемы, документы — и просит локальную нейросеть написать аннотацию к каждому. Нераспознанные PDF готовит к OCR. На выходе: нормальный индекс, в котором можно искать по смыслу, а не гадать по имени файла `doc_final_FINAL_v3_USE_THIS.pdf`.

**Поток второй: аудио и видео.** Берёт записи — концерты, голосовые, переговоры, кружочки из мессенджеров — и превращает их в текст с таймкодами. Если это музыка — пытается определить, что именно исполнялось. Если это разговоры или интервью с несколькими участниками — разделяет реплики по говорящим и суммаризирует, кто и о чём говорил.

**Поток третий: переписка.** Берёт полную выгрузку канала или чата, собирает весь текст, скачивает голосовые и видео, распознаёт их, складывает в длинный документ и суммаризирует. На выходе: кто эти люди, что их волнует, есть ли среди них потенциальные клиенты — плюс готовое задание для любой нейросети: вот аудитория, вот её язык, вот что ей предложить.

**Поток четвёртый: фотографии.** Берёт кластеры однотипных снимков — например, все фото одного события или периода — и просит локальную нейросеть с распознаванием изображений описать, что на них: кто и сколько человек в кадре, место, сюжет. Не по каждому снимку из тысяч, а по представительной выборке внутри каждого кластера — чтобы описание архива было готово за разумное время, а не за недели видеокарты.

Всё работает локально. Файлы никуда не уходят.

## 3. К какой категории относится эта программа

**Локальный ИИ-разведчик для личных коллекций** — новая категория без устоявшегося названия: не облачный транскрибатор, не корпоративный документооборот, не поисковик по файлам и не медиасервер, а нечто среднее — но с принципиальным отличием: работает на вашем железе, с вашими данными, и на выходе даёт не список файлов, а структурированную библиотеку. По каждому файлу — тема, язык, тип документа, ключевые сущности, краткое содержание. Это делается заранее, без спешки и дедлайна, пока никому это ещё не понадобилось срочно — а не в последний момент под конкретную задачу. Готовую библиотеку можно скормить любой нейросети, базе данных или поисковой системе — дальше они сами находят нужное и строят интерфейс; Digercules не заменяет этот следующий шаг, а делает его вообще возможным, беря на себя ту трудоёмкую подготовку, на которую обычно никогда не хватает ресурсов.

## 4. Чем это лучше других близких инструментов

Все эти инструменты — организаторы файлов с ИИ, десктопный поиск, системы документооборота с OCR, обычная транскрипция — работают только тогда, когда архив уже приведён в машиночитаемый вид: текст распознан, файлы описаны, всё разложено. Именно эту подготовку они не делают и сделать не могут — они на неё рассчитывают как на данность.

Digercules делает ровно эту недостающую часть: смешанный архив (текст + аудио + видео + фото + сканы) превращается в единую структурированную библиотеку, обученную под специфику конкретной коллекции — полностью локально. Дальше с этой библиотекой может работать уже любой из перечисленных инструментов, любая нейросеть или поисковая система — Digercules не конкурирует с ними, а даёт им то, без чего они бесполезны.

## 5. Какие задачи эта программа выполняет

| Задача | Результат |
|---|---|
| Разобраться, что на диске | Карта архива с аннотациями к каждой группе файлов |
| Убрать дубли и очевидный мусор | Дедупликация без потери чего-то важного |
| Сделать библиотеку searchable | Аннотации + OCR → поиск по смыслу |
| Расшифровать часы записей | Текст с таймкодами, суммаризация, идентификация |
| Понять, кто в чате | Портрет аудитории + промпт для следующего шага |
| Оценить, что уникально, а что мусор | Редкое / типовое / устаревшее / требует внимания |
| Разобраться в архиве фотографий | Описание по представительной выборке в каждом кластере снимков |

## 6. Как это помогает

**Человек с дисками в шкафу** запускает инструмент, указывает папку, уходит пить чай. Через несколько часов: вот мусор — удалить? Вот семейные фото. Вот рабочие документы — осторожно, может быть конфиденциальное.

**Маркетолог** загружает выгрузки каналов. Получает: эти — шум, не тратить время. Этот — там живут потенциальные клиенты, вот их боли, вот готовый промпт для следующего разговора.

**Инженер** впервые видит свою библиотеку целиком: что есть, что устарело, что нигде больше не найти. Аннотации написаны на его языке — потому что инструмент обучился на его же коллекции.

**Студент и преподаватель** получают searchable-архив конспектов, сканов и записей лекций даже на нескольких языках сразу — то, что раньше искалось листанием файлов вручную, теперь ищется по смыслу.

**Музыкант или автор** получает расшифровку и каталог концертных записей с определением, что именно исполнялось в каждой — включая дубли и черновики, которые иначе никто не переслушал бы.

**Клуб** получает каталог своих вечеров: кто выступал, что читал или исполнял, в какой записи что искать — вместо архива, который держится в памяти пары старожилов.

**Архивист** получает не список файлов, а структурированное заключение по всему фонду: что ценно, что дублирует уже известное, что требует немедленного внимания.

## 7. Сколько это стоит и что для этого нужно

**Бесплатно — только предварительная оценка.** По описанию архива или скриншоту папки мы скажем, реально ли его разобрать и сколько времени это займёт. Сама программа — платная, разовая покупка без ограничения по объёму или по времени: ставите её на свой компьютер и разбираете архив целиком локально, сколько бы там ни было данных. Если вашего железа хватает и на тяжёлую обработку (расшифровку, идентификацию) — лицензия не запрещает гонять её самостоятельно.

**Когда своей мощности не хватает.** Дальнейшая обработка либо арендуется на внешней GPU-машине на ваш выбор и за ваш счёт (ориентир по рынку — цифры выше на этой странице), либо эту многосуточную координацию берём на себя мы. Цена в этом случае формируется по факту обнаруженного объёма — конкретных цифр или потолка на сегодня нет, это отдельная договорённость под ваш архив.

**Что нужно от вас.** Сам архив (диск, папка, выгрузка чата) и ответ, что вы хотите узнать или получить на выходе.

**Если координируем мы.** Наружу уходит не архив, а его компактный рабочий экспорт (пример: 2 ТБ видеозаписей → около 2,7 ГБ), напрямую на согласованную машину — не в общедоступное облако.

**Если что-то пошло не так.** Окно поддержки на повторные попытки при сбое — 48–72 часа с момента обращения; повторный прогон — отдельная договорённость.

**Ещё не описано на сайте:** форма постановки задачи, образец договора, куда именно загружаются данные, график обработки и график оплаты, критерии приёмки результата.

---

Отдельная, эмоционально другая ситуация — когда архив не свой, а достался от кого-то. Об этом отдельно: [Унаследованный архив](/net/inherited-archive/).

---

Та же самая технология работает не только для личного архива — если вы представляете организацию (компанию, студию, бюро, клинику, библиотеку), см. [Digercules для организаций](/org/).
