YOLO
Выделяет заголовки, текст, изображения и служебные области газетной полосы.
PereStruct распознаёт сложную многоколоночную вёрстку советских газет, исправляет OCR-ошибки и собирает разрозненные блоки в логические статьи.
Автоматическая система выделяет заголовки, колонки и отдельные текстовые блоки на отсканированной странице.
Оптическое распознавание переводит изображение в текст, сохраняя исходную историческую лексику.
Модель связывает заголовки и продолжения статей по геометрическим и смысловым признакам.
Каждая статья получает свой номер и цвет. Результат доступен как структурированный JSON и наглядное изображение.
Большие исходники загружаются напрямую в объектное хранилище по защищённой временной ссылке.
Авторизация через Яндекс ID защищает ресурсоёмкие операции и позволяет учитывать персональную квоту.
Детекция, OCR и коррекция выполняются серверлесно, а ML-сборка статей — на GPU в DataSphere.
Запущенные полосы сохраняются в этом браузере. Многостраничный пакет обрабатывается параллельно, а результат каждой страницы появляется сразу после готовности.
OCR и автокоррекция остаются неизменными. Пользовательская версия сохраняется отдельно.
Загрузка текстовых блоков…
Щёлкните по двум или нескольким частям одной открытки, объедините их и перезапустите распознавание. Поворот применяется к самому JPEG и координатам блоков.
Зелёные рамки — текст, красные — заголовки. Выбранные блоки подсвечиваются жёлтым. После объединения они показываются одной синей рамкой.
Выделяет заголовки, текст, изображения и служебные области газетной полосы.
Распознаёт русский текст в каждом найденном блоке параллельными запросами.
Исправляет только очевидные OCR-искажения и переносы, сохраняя исторический стиль.
Связывает блоки по TF-IDF, геометрии, типу и визуальным признакам YOLO.
Возвращает номера статей, координаты, распознанный текст и цветную разметку.
PereStruct создан Библиотекой имени Н. А. Некрасова совместно с Центром технологий для общества Yandex Cloud. Проект помогает работать с цифровыми газетными коллекциями Электронекрасовки и развивается в рамках продолжающейся совместной работы с Некрасовкой. Подробнее об этой работе в блоге Yandex Cloud ↗