ИИ расшифровал весь архив Циолковского: 51 008 листов рукописей и проверка точности без эталона

Прокомментировать Просмотры: 3

Стартовая страница поискового сервиса по фонду 555 — beskvladimir‑create.github.io/tsiolkovsky‑papers

Персональный архив К. Э. Циолковского находится на хранении в Архиве РАН (фонд № 555). Корпус насчитывает 2 019 архивных дел и 51 008 оцифрованных страниц. Невзирая на многолетнее присутствие сканов в открытом доступе, их практическое использование оставалось крайне затруднительным из-за отсутствия поискового каталога, транскрипций и структурированных датасетов.

Минувшим летом массив фонда был целиком транскрибирован и выложен в публичный доступ. Датасет распространяется по лицензии CC0 (постоянный DOI 10.5281/zenodo.21705221), исходный код под лицензией MIT доступен в репозитории на github.com/beskvladimir‑create/tsiolkovsky‑papers, полнотекстовый поиск развернут по адресу beskvladimir‑create.github.io/tsiolkovsky‑papers, а подробная методология изложена в препринте arXiv:2608.03617.

Непосредственно процесс распознавания оказался наименее трудоемким этапом. Главный вызов заключался в оценке качества: как верифицировать точность OCR/HTR при полном отсутствии эталонной разметки? С аналогичной проблемой регулярно сталкиваются промышленные LLM-системы: генерация десятков тысяч ответов делает ручную валидацию невозможной исключительно в силу колоссального объема данных.

Почему наличие цифровых копий не гарантирует доступности

Веб-интерфейс архива позволяет просматривать изображения, однако извлечение полноценного датасета сопряжено с нетривиальными препятствиями.

Идентификаторы в параметрах URL не соответствуют архивным номерам дел. Так, id=300 ведет на дело 297 первой описи. Рассогласование накапливается из-за литерных дел (например, 145а или 585а, коих насчитывается 31 единица) — в сквозной нумерации веб-системы они учитываются, а в архивной классификации нет. При наивном парсинге по URL каталог неизбежно ссылался бы на неверные материалы.

Параметр номера описи в адресе запроса и вовсе игнорируется: страницы вида 1_actview.aspx?id=834 и 5_actview.aspx?id=834 отдают идентичный документ. Корректные архивные координаты удалось восстановить исключительно из физических путей к графическим файлам.

Файлы объемом свыше ~800 КБ сервер отдавал урезанными до 130 КБ. Загрузить их без потерь удалось только посредством range-запросов; при этом стандартный браузер молча сохраняет дефектный фрагмент без генерации сетевых ошибок.

Это никоим образом не упрек архиву: учреждение выполнило колоссальную работу, оцифровав и опубликовав 51 008 страниц. Речь лишь о том, что между разрозненным набором графических файлов и структурированным массивом с возможностью поиска лежит огромная технологическая дистанция.

Каталог фонда. Датировка по годам, доля рукописных листов в каждом деле, у каждого дела ссылки на сканы архива и расшифровку
Сводный реестр фонда: хронологическая атрибуция, процент рукописных страниц в каждом деле, прямые ссылки на архивные исходники и полученные расшифровки

Методология валидации в условиях отсутствия ground truth

Для надежной оценки точности OCR требуется верифицированный человеком эталонный текст. В архивном массиве такой ground truth изначально отсутствовал — ведь при наличии готовых расшифровок отпала бы необходимость в автоматическом распознавании. Опираться же на внутреннюю метрику уверенности нейросети бессмысленно: правдоподобная галлюцинация генерирует столь же высокие скоры, как и безошибочное прочтение.

Решение подсказала специфика документации эпохи пишущих машинок. Персональные архивы того периода нередко содержат дубли: рукописный черновик автора соседствует в деле с созданной по нему машинописной копией. Обработав обе версии единым пайплайном и сопоставив результаты, можно выделить расхождения. Поскольку текст и алгоритм неизменны, единственным фактором дисперсии выступает читаемость исходника, что позволяет количественно оценить сложность рукописного почерка.

В рамках фонда было выявлено 1 759 подобных парных документов в 224 делах. Медианный уровень совпадения между версиями составил 37% слов. Медиана максимального непрерывного фрагмента точного пословного совпадения не превысила 10 слов, причем у 43% пар совпадений большей длины не зафиксировано вовсе. Таково объективное качество автоматического распознавания рукописей первой трети XX века.

Корректность предложенного подхода требовала верификации. Ее удалось провести на подмножестве дел, опубликованных в прижизненных печатных изданиях. Для этих документов парная кросс-валидация продемонстрировала несмещенную оценку с погрешностью в пределах одного процентного пункта. Ранжирование страниц по степени сложности полностью совпало с эталонным: ранговая корреляция составила 0,67 для всей выборки из 55 пар, 0,92 для 32 пар со строго доказанным текстологическим тождеством и 0,97 для 17 максимально выверенных документов.

Прямое сопоставление с эталонной печатью дает 98,1% посимвольной точности для машинописи и 81,1% для автографов. На уровне слов точность составила 91,7% и 73,7% соответственно.

Данная методика универсальна для промышленной разработки: абсолютный ground truth редко доступен для всего массива, однако локальные эталоны почти всегда достижимы. По ним калибруется прокси-метрика с последующим масштабированием на весь объем.

Отрицательные результаты: что осталось за рамками победных реляций

Рассмотрим три показательных вывода, которые обычно замалчиваются в корпоративных отчетах, хотя изначально воспринимались как полноценные результаты.

Коллация авторских редакций оказалась технически нереализуемой. В фонде представлена рукопись «Космического корабля» в двух авторских вариантах — эталонная база для текстологического анализа, ради которой во многом и задумывалось исследование. Однако степень совпадения между ними составила всего 19% слов — показатель ниже, чем расхождение двух машинных прочтений одного листа. Ниже этого порога текстовые вариации невозможно отличить от ошибок HTR-модели. Данное направление было закрыто, а в программный комплекс внедрена жесткая блокировка на отображение сопоставлений с метриками ниже шумового порога.

Успешно протестированный классификатор дал сбой на масштабе. Разделение рукописных и машинописных страниц строилось на анализе вариативности длины графических штрихов. На тестовой выборке с ручной разметкой точность классификатора была стопроцентной (19 из 19). Однако при валидации по независимому сигналу на 4 675 листах точность просела до 80%: пожелтевшая машинопись и копии через копировальную бумагу ошибочно распознавались как автографы. Микроскопический чистый тест-сет валидирует лишь прототип, но не готовую систему.

Артефакт генерации имитировал реальные данные. На 236 листах модель вошла в бесконечный цикл, повторяя служебный тег разметки до 635 раз подряд. Каждый подобный сбой парсер интерпретировал как маркер низкой уверенности, что искусственно раздуло итоговую статистику на 6 189 отметок. Ни один автоматический статистический тест не зафиксировал аномалию, так как 236 листов из 51 008 не нарушают общие распределения. Баг был обнаружен исключительно в ходе визуального аудита человеком.

Ключевое отличие строгих измерений от субъективных впечатлений заключается в возможности своевременно обнаружить собственные заблуждения, а открытая рефлексия над ошибками обеспечивает подлинную валидность оставшихся метрик.

Скрытые ловушки: лимиты рассуждений и фильтры контента

В современных моделях режим reasoning активен по умолчанию, расходуя общий токен-лимит генерации. При лимите в 4 096 токенов на внутренние рассуждения уходило вплоть до 3 929 токенов. В итоге транскрипция прерывалась на середине документа, причем незавершенный фрагмент визуально мимикрировал под некачественное распознавание. Снижение глубины рассуждений до минимального уровня позволило вдвое сократить объем выходных данных без малейшей деградации качества. Если в пайплайне не отслеживать скрытые усечения на ранних этапах, они непременно проявятся как мнимые проблемы качества на последующих шагах.

Кроме того, два документа оказались принципиально недоступны для стандартных моделей: немецкая машинописная рецензия 1927 года триггерила встроенный защитный фильтр от дословного воспроизведения защищенного копирайтом текста. Эти страницы пришлось обрабатывать альтернативным методом и снабдить отдельной маркировкой в датасете.

Эмпирический выбор архитектуры вместо слепого ориентирования на прайс-лист

Сравнение конкурирующих моделей проводилось на идентичном материале относительно машинописных контрольных копий при фиксации базовой линии. На типичных автографах ни одна флагманская модель не показала решающего превосходства: на тестовой выборке из 48 листов более дорогая модель оказалась точнее на 37 страницах и уступила на 11. Полученный прирост метрик не оправдывает кратного удорожания, поскольку верхний предел качества диктуется физическим состоянием оригинала.

Оптимальная по соотношению цены и качества легковесная модель пакетно обработала остаток фонда (41 212 листов) всего за одну ночь. Суммарная стоимость инференса уложилась в несколько десятков долларов. Бутылочным горлышком в подобных проектах выступает не бюджет вычислений, а построение надежной системы оценки качества.

Практический вывод однозначен: бенчмаркинг на собственных целевых данных с четким бейзлайном должен строго предшествовать выбору ценового уровня API.

Итоговые результаты проекта

Созданный корпус следует рассматривать как поисковый индекс, а не как академическое факсимильное издание. Весь массив транскрибирован алгоритмически и не проходил ручной редакторской вычитки; каждое дело снабжено прямой ссылкой на оригинальный скан. Фрагменты с низкой достоверностью распознавания помечены пословно. Выделены авторские вычеркивания (суммарно 36 446 случаев), сохранена оригинальная дореформенная орфография. В публикацию вошли только полностью распознанные дела во избежание иллюзии связного текста при незаметно пропущенных фрагментах.

Хронологическая атрибуция 1 969 дел позволила впервые проанализировать фонд во временном разрезе: 86% документов датируются последними 18 годами жизни ученого. На период 1930-х годов приходится 58% всех дел, однако они составляют лишь 40% от общего объема страниц. Творческая активность Циолковского в поздний период не снижалась, однако формат его работ стал существенно более лаконичным.

Все 39 пайплайн-скриптов выложены в открытый доступ — любое числовое значение из данной работы воспроизводится одной командой. Специальный валидационный скрипт сверяет 20 ключевых метрик статьи с актуальным состоянием базы данных; необходимость в нем возникла после того, как в аннотации и основном тексте обнаружилось расхождение в один процент.

Исследование носит независимый характер, не аффилировано с Архивом РАН и не имеет официального одобрения ведомства.


Об авторе: Владимир Бескоровайный, архитектор enterprise‑систем с ИИ, независимый исследователь. ORCID 0009–0004-7005-6242. besk.tech

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов