Digercules — Digercules

Digercules

Digercules — это программа с нейросетевыми компонентами, которая берёт любую исходную неразобранную свалку файлов — архив, библиотеку, концертные записи, переписки в мессенджерах — и превращает её в структурированную библиотеку, включая умную дедупликацию: найти все копии одного и того же, убрать лишнее и при этом ничего важного не потерять. По каждому файлу — тема, язык, тип документа, ключевые сущности, краткое содержание. Это делается заранее, без спешки и дедлайна, пока никому это ещё не понадобилось срочно — а не в последний момент под конкретную задачу. Готовую библиотеку можно скормить любой нейросети, базе данных или поисковой системе — дальше они сами находят нужное и строят интерфейс; Digercules не заменяет этот следующий шаг, а делает его вообще возможным, беря на себя ту трудоёмкую подготовку, на которую обычно никогда не хватает ресурсов.

Данные обрабатываются без корпоративных облаков — либо на компьютере клиента целиком (при наличии необходимых мощностей видеокарты), либо автору программы передаются не исходники, а сжатые копии, подготовленные специально для распознавания, и обратно приходят только тексты.

Уже проверено на архивах разного масштаба — по реальной статистике обработанных проектов:

более 800 000
файлов обработано
около 85 ТБ
объём источников
более 66 000 ч
звука (около 7,5 лет)
1,8 ТБ
высвобождено дублями
3 507 ч
затрачено на обработку
~430
исполнителей опознано по видео

По имеющимся каналам связи (~30 Мбит/с, реальный замер) закачка этого объёма в облако заняла бы около 262 суток — против 96, за которые всё обработано на месте. Хранение обошлось бы от $84 в месяц, а обработка на сопоставимом по мощности GPU потребовала бы от $150–190 в месяц. И это без учёта ещё одного шага: данные из хранилища всё равно нужно перегнать на саму GPU-машину для обработки. Даже по каналу втрое быстрее (100 Мбит/с) партия в несколько терабайт идёт около 3 суток.

Что реально работает внутри

Digercules — не одна модель, а оркестрованный конвейер из 25+ фаз обработки: каждая решает одну узкую задачу, и результат одной становится входом для следующей.

Речь в текст. Аудио и видео проходят через faster-whisper (large-v3-turbo): сначала быстрый черновой проход — для сверки и отбора, затем медленный и тщательный основной проход с направляющими подсказками, построенными на собственной лексике архива. Если в архиве есть свой устойчивый круг голосов или своя специфическая терминология, модель можно дообучить (LoRA) именно на этом материале — проверено на сотнях часов одной конкретной коллекции.

Идентификация голоса. Модель голосовых эмбеддингов (ECAPA-TDNN) строит галерею голосов: кто говорит, сверяясь со всеми, кого система уже слышала раньше, — галерея растёт с каждым новым обработанным архивом.

Идентификация лиц. Та же логика, что и для голоса, но для лиц: галерея с несколькими эталонными образцами на человека — она умеет то, чего не может один усреднённый портрет, — узнавать одного и того же человека и в детстве, и сорок лет спустя. Экран подтверждения проверен на реальных 20 ТБ концертных видеозаписей.

Экран подтверждения лиц: собранная галерея по персоне с вариантами кластеров
Экран разбора: все подтверждённые варианты лица одного человека, сгруппированные по видео.
Экран подтверждения лиц: предложенные совпадения с процентом схожести
Тот же экран на этапе разметки: система предлагает совпадение с процентом схожести, человек подтверждает или отклоняет.

Решение всегда принимает человек: похожесть — это подсказка с процентом, а не готовый ответ, и безопасного порога, после которого её можно доверять автоматически, не существует — в интерфейсе это не скрывается. Лицо, которое никто не узнал, не выдаётся за опознанное, а ждёт того, кто архив знает лучше. Подробнее о принципах работы модуля.

Распознавание текста (OCR). Отсканированные документы проходят через Marker — открытый движок распознавания и конвертации PDF/сканов — и превращаются в текст, по которому можно искать, а не остаются картинкой с буквами.

Понимание фотографий — по уровням. Каждый фотобанк сначала проходит дешёвый проход на CPU (OpenCV DNN — EAST ищет текстовые области, YuNet считает лица), который работает одинаково на любой машине флота, включая десятилетний Windows 7. На более мощном железе добавляется второй проход — CLIP zero-shot классификация сцены на скорости GPU. Там, где это действительно важно, полноценная визуально-языковая модель (Ollama) пишет настоящее описание конкретного фото. Три уровня, от дешёвого к дорогому.

Понимание документов. Каждый файл читается и описывается локальной языковой моделью (Ollama): о чём он, на каком языке, для чего на самом деле нужен.

Дедупликация, которая заодно защищает файлы. Тот же хэш, что находит дублирующиеся копии, заодно побайтово подтверждает: файл, вернувшийся в архив после обработки, — тот же самый файл, что из него уходил.

Плотная галерея сотен распознанных лиц по одному архиву
Масштаб одного архива: сотни распознанных вариантов лица, сгруппированные автоматикой и уточнённые человеком.

Каждый из этих этапов выполняется либо локально, либо на конкретной, названной вам машине — никогда в безликом облаке.

Статус

Продукт в активной разработке. Инженерная библиотека — стабильно, в продакшне.

География команды

Разработка ведётся распределённой командой в нескольких странах: Израиль, Грузия, Россия. Реальные точки присутствия вычислительной инфраструктуры: Ришон-ле-Цион, Израиль · Тбилиси, Грузия · Челябинск, Россия · Москва, Россия.

Куда дальше

Digercules обслуживает разные типы заказчиков через отдельные сайты:

Как это оплачивается

Локальный самостоятельный прогон — разовая покупка программы без ограничения по объёму архива; бесплатна только предварительная оценка по описанию или скриншоту архива. Более тяжёлая координация, когда своей мощности не хватает, — отдельно, по цене, которая формируется по факту обнаруженного объёма работы: конкретных цифр здесь пока нет. Ориентир по рынку — цифры выше на этой странице (во сколько обошлась бы сопоставимая задача через обычное облако). Подробности по сценариям — на digercules.org и digercules.net.