PPereStruct
Исторические документы · AI

Из полосы — в статьи

PereStruct распознаёт сложную многоколоночную вёрстку советских газет, исправляет OCR-ошибки и собирает разрозненные блоки в логические статьи.

Совместный проект Библиотеки имени Н. А. Некрасова и Yandex Cloud для работы с историческими газетными коллекциями.
ПРАВДА
Структура газетной полосы

Автоматическая система выделяет заголовки, колонки и отдельные текстовые блоки на отсканированной странице.

Оптическое распознавание переводит изображение в текст, сохраняя исходную историческую лексику.

Модель связывает заголовки и продолжения статей по геометрическим и смысловым признакам.

Каждая статья получает свой номер и цвет. Результат доступен как структурированный JSON и наглядное изображение.

Большие исходники загружаются напрямую в объектное хранилище по защищённой временной ссылке.

Статья 1
Статья 2
Статья 3
Статья 4

Готовые примеры

Слева — исходная газетная полоса, справа — результат PereStruct. Эти примеры уже обработаны: открыть визуализацию и JSON можно без авторизации и без расходования квоты.
Загружаем готовые результаты…

Попробуйте на своей полосе

Поддерживается JPEG до 50 МБ. Начальные этапы запускаются через устойчивую очередь, а ресурсоёмкая сборка статей выполняется отдельным GPU Job в DataSphere. Сервис показывает текущий этап, прогресс GPU-пакетов и сохраняет результат на 7 дней.

1. Исходное изображение

Авторизация через Яндекс ID защищает ресурсоёмкие операции и позволяет учитывать персональную квоту.

Проверяем авторизацию…
Для запуска распознавания нужен Яндекс ID.
Войти с Яндекс ID
Квота распознавания
Доступ для интеграций и администраторов
0.50
Выберите JPEG для распознавания.

2. Ход обработки

Детекция, OCR и коррекция выполняются серверлесно, а ML-сборка статей — на GPU в DataSphere.

1
Object Storage
Прямая загрузка оригинала
ожидает
2
YOLO
Заголовки и текстовые блоки
ожидает
3
Vision OCR
Распознавание русского текста
ожидает
4
YandexGPT + ML
Коррекция и сборка статей
ожидает
5
Результаты
JSON и цветная визуализация
ожидает
Результаты этапов

История обработки

Запущенные полосы сохраняются в этом браузере. Многостраничный пакет обрабатывается параллельно, а результат каждой страницы появляется сразу после готовности.

История пока пуста — загрузите первую газетную полосу.
Готово

Результат обработки

страниц
блоков
статей
секунд
Визуализация найденных статей
Открыть PNG Повторить через API

Редактор распознанного текста

OCR и автокоррекция остаются неизменными. Пользовательская версия сохраняется отдельно.

Загрузка текстовых блоков…

Ручная коррекция

Исправьте разбиение

Щёлкните по двум или нескольким частям одной открытки, объедините их и перезапустите распознавание. Поворот применяется к самому JPEG и координатам блоков.

Поворот: 0° Ничего не выбрано

Зелёные рамки — текст, красные — заголовки. Выбранные блоки подсвечиваются жёлтым. После объединения они показываются одной синей рамкой.

Как это работает

Оригинальный исследовательский пайплайн запускается без переобучения: те же веса и алгоритм сборки работают в воспроизводимом DataSphere Job с GPU.
01 · Layout

YOLO

Выделяет заголовки, текст, изображения и служебные области газетной полосы.

02 · Text

Vision OCR

Распознаёт русский текст в каждом найденном блоке параллельными запросами.

03 · Restore

YandexGPT

Исправляет только очевидные OCR-искажения и переносы, сохраняя исторический стиль.

04 · Assemble

ML-кластеризация

Связывает блоки по TF-IDF, геометрии, типу и визуальным признакам YOLO.

05 · Export

JSON + PNG

Возвращает номера статей, координаты, распознанный текст и цветную разметку.

Авторы проекта

Библиотека × технологии

PereStruct создан Библиотекой имени Н. А. Некрасова совместно с Центром технологий для общества Yandex Cloud. Проект помогает работать с цифровыми газетными коллекциями Электронекрасовки и развивается в рамках продолжающейся совместной работы с Некрасовкой. Подробнее об этой работе в блоге Yandex Cloud ↗