Digercules — что это и кому нужно
1. Кто вероятный потребитель
Прежде всего — хранители звуковых архивов: люди и организации, у которых скопились сотни или тысячи аудиозаписей, и которым важно знать что именно на них записано.
Конкретнее:
- Библиотеки, архивы, музеи — фонды с магнитофонными записями, концертами, лекциями, устной историей
- Частные коллекционеры — у кого дома лежат MP3, оцифрованные кассеты, концерты любимых исполнителей
- Исследователи и фольклористы — кому нужно не просто хранить, а искать и цитировать по тексту
- Звукозаписывающие студии и лейблы — для каталогизации архивного материала
- Организаторы песенных или стихотворных фестивалей — в первую очередь, это и был исходный случай: 218 концертных записей бардовских песен
- Музыкальные и литературные клубы — у которых из вечера в вечер копятся записи прошедших концертов, творческих встреч и поэтических чтений, а разобрать их руками уже некому
2. Что делает продукт
Digercules берёт папку с аудиофайлами — концертами, лекциями, записями выступлений — и автоматически превращает их в текст с указанием времени каждой фразы.
При этом он не просто "расшифровывает речь". Он также:
- Определяет, какие именно песни прозвучали в записи, сверяясь с базой текстов
- Помечает паузы и аплодисменты — чтобы было понятно, где заканчивается одна песня и начинается другая
- Конвертирует сопроводительные документы (HTML-страницы, PDF) в удобный текст
- Упаковывает результаты в архив, который клиент может распаковать прямо в свою папку с аудио — и тексты окажутся рядом с каждым файлом
3. К какой категории он относится
Это инструмент класса "автоматическая каталогизация аудиоархива" — нечто среднее между:
- транскрибатором (расшифровщиком речи)
- поисковым индексатором для музыкальных коллекций
- системой управления цифровым архивом (Digital Asset Management)
Но в отличие от каждого из этих классов по отдельности — Digercules заточен именно под живые выступления на русском языке, где обычные инструменты дают плохой результат.
4. Чем это лучше других близких вещей
Стандартные транскрибаторы (Google, Yandex, Whisper «из коробки») работают плохо на:
- живых концертах с шумом зала и несовершенной акустикой
- бардовских текстах, которых нет в стандартных обучающих данных
- длинных записях, где модель начинает "галлюцинировать" — повторять одну фразу снова и снова
Что делает Digercules иначе:
- Обучает модель специально под конкретный голос и репертуар. Он берёт образцовые расшифровки нескольких записей и "дообучает" нейросеть — как ученик, который сначала читает ноты, а потом слушает конкретного исполнителя. Результат: в 2–3 раза меньше ошибок на похожих записях.
- Знает тексты песен заранее. Перед распознаванием программа подсказывает нейросети: "сейчас, скорее всего, будет эта песня" — и модель гораздо точнее справляется с нестандартными словами и именами.
- Умеет фильтровать "мусор". У стандартных распознавателей есть известная проблема: на аплодисментах и тишине они начинают выдумывать фразы. Digercules ведёт список таких "галлюцинаций" и вычищает их автоматически.
- Работает на русском, на живом звуке, на бардовской специфике — а не на студийных записях или деловых переговорах, под которые заточены коммерческие сервисы.
5. Какие задачи он может исполнить
| Задача | Что получает пользователь |
|---|---|
| Расшифровать 200 концертов | Текстовый файл рядом с каждым MP3, с таймкодами по минутам |
| Узнать, что именно исполнялось | Список песен с привязкой ко времени и ссылками на тексты |
| Найти конкретную песню в архиве | Поиск по тексту через любой файловый менеджер |
| Подготовить материал для исследования | Готовые транскрипты в текстовом формате |
| Создать "умную" нейросеть под свой архив | Обученная модель, которая знает голос исполнителя и его репертуар |
| Передать результаты заказчику | Лёгкий zip-архив с текстами (без аудио), распаковывается в одно нажатие |
6. Как этот инструмент помогает
Представьте: у вас есть 218 концертных записей, каждая по 1–2 часа. Чтобы прослушать их все и записать, что исполнялось — нужно несколько месяцев работы одного человека.
Digercules делает это за несколько дней машинного времени — пока вы занимаетесь другими делами.
Конкретный результат на реальном архиве (218 записей бардовских концертов, которые и стали основой проекта):
- Все 218 концертов автоматически расшифрованы; в целом по всем обработанным Digercules архивам (не только бардовским) — уже более 38 000 часов аудио- и видеозаписей
- Для каждого концерта составлен список песен с таймкодами
- Нейросеть обучена под голоса конкретных исполнителей (Окуджава, Городницкий, Визбор и др.)
- Результаты упакованы и переданы в папку к исходным файлам — никакой переструктуризации архива
Для клиента это означает: архив, который раньше существовал только в виде сотен безымянных файлов, превращается в каталог с поиском — можно найти любую песню, любую фразу, любой момент выступления.
Показательный кейс: поиск конкретной оцифрованной записи выступления Визбора 1979 года — материала, которого нет в открытом доступе и который не находится обычным поиском. Именно такие записи, а не студийные альбомы, составляют основную ценность подобных архивов: 90% содержимого крупных бардовских коллекций не индексируется поисковиками вообще.
Есть возможность работать как с архивом заказчика на мощном компьютере с видеокартой, так и передавать результаты в виде готовых текстовых файлов, которые клиент сам распаковывает рядом со своими аудиозаписями. Всё — без единого байта в облаке.