Как искусственный интеллект помогает расшифровывать древние архивы Ватикана
Таким образом можно распознавать старинные тексты на любом языке
Исследователи использовали искусственный интеллект и распознавание изображений для расшифровки одной из самых больших коллекций рукописных текстов в мире.
Секретные архивы Ватикана представляют собой одну из величайших исторических коллекций рукописей в мире. В ней хранятся такие редкие документы, как папская булла об отлучении Мартина Лютера от церкви и просьбы о помиловании Марии Стюарт, которые она отправила Папе Римскому Сиксту V перед казнью.
Но к сожалению, большинство этих текстов бесполезны. Архивы Ватикана занимают площадь в 85,2 километра, и лишь несколько миллиметров коллекции было отсканировано и выложено в сеть. Еще меньше страниц было переведено в цифровой текстовый формат и стало доступно для поиска. Если вам нужно что-то другое, необходимо подать заявление на получение специального доступа, добраться до Рима и пролистать каждую страницу вручную.
Новый проект In Codice Ratio должен решить эту проблему. Исследователи планируют использовать искусственный интеллект и программу для оптического распознавания букв (OCR), чтобы изучить тексты архивов и перевести их в цифровой вид. Если им это удастся, ученые смогут расшифровать несметное количество исторических архивов мира.
Технология OCR уже давно используется для сканирования и распознавания текста в книгах и других печатных документах. Однако она не совсем подходит для материалов Секретных архивов. Традиционная технология разбивает слова на серии изображений отдельных букв — для этого она распознает межбуквенные интервалы. Затем она сравнивает изображение с буквами из своей памяти. Найдя лучшее соответствие, программа переводит букву в компьютерный код (ASCII) и таким образом включается функция поиска по тексту.
Подобный метод работает только для машинных, но не рукописных текстов. Большинство документов Ватикана написаны именно от руки. Вот, например, пример бумаги начала 1200 годов. Алгоритм не понимает, где заканчивается одна буква и начинается другая.
Некоторые исследователи пытались научить OCR распознавать целые слова, а не буквы. Технически, такой метод должен сработать, ведь компьютерам неважно, что они обрабатывают. Но реализовать это решение оказалось очень сложно, потому что он требует гигантского запаса памяти. Системе необходимо знать не несколько десятков букв алфавита, а тысячи слов, а это значит, что для расшифровки архивов понадобится целая группа специалистов по средневековой латыни, которая будет сканировать изображения каждого слова в документах. Кроме того, все слова придется сканировать несколько раз, потому что из-за различного почерка писцов их изображения могут отличаться.
Создатели проекта In Codice Ratio решили разработать технологию OCR, которая будет разбивать слова не по буквам, а деталям начертания. Алгоритм будет изучать вертикальные и горизонтальные черточки и собирать из них возможные буквы, как головоломку.
Однако не всегда понятно, какие кусочки пазла действительно являются деталями буквы. Для этого ученые обратились к ученикам старших классов. Исследователи пригласили учащихся 24 итальянских школ, чтобы составить с их помощью банк памяти для программы. Школьники должны были зайти на сайт, где их ждал экран, поделенный на три секции:
В строке зеленого цвета были хорошие, четкие образцы текста на средневековой латыни (на примере показана буква g). В красной — так называемые ложные друзья, лишние пометки, не передающие на письме букву g. В нижней таблице показано ядро программы. Ученикам нужно было оценить качество попыток алгоритма распознать ту или иную буквы. Они должны сверять варианты, предлагаемые программой, с идеальным образцом в зеленой строке, и отмечать галочкой соответствия.
Таким образом учащиеся смогли обучить программу каждой из 22 букв средневекового латинского алфавита. При этом им не нужно было знать латынь, они просто искали схожие символы. Изучив их выбор, алгоритм стал экспертом в этой области. Ну, по крайней мере, частично.
Как оказалось, сбора визуальных головоломок оказалось недостаточно. В некоторых случаях написание букв и их сочетаний было слишком похожим. Например, в этом образце непонятно, что написал человек “clear” или “dear”, потому что рукописный вариант буквы “d” очень похож на “cl”.
А бывают и более сложные примеры, которые невозможно понять.
Было несколько вариантов — aimo, amio, aniio, aiino и даже aiiiio. Правильным оказался “anno”, слово, означающее на латыни «год». Программа смогла успешно распознать только буквы a и o, а четыре черточки между ними нет.
Для решения этой проблемы команда проекта решила научить программу думать. Исследователи взяли цифровую версию документа из 1,5 миллиона латинских слов и изучили в нем двух- и трехбуквенные комбинации. Затем они определили, какие комбинации случаются часто, а какие не происходят никогда. С помощью этих данных алгоритм смог рассчитать вероятность сочетания различных букв. В итоге программа поняла, что сочетание nn более вероятно, чем iiii.
Благодаря улучшениям алгоритм смог, наконец, самостоятельно распознать несколько текстов. Команда проекта дала ему на обработку несколько документов из архивов, среди которых есть письма европейским королям, приказы и прочие бумаги.
Первые результаты получились неоднозначными. Примерно треть слов в документах была распознана с ошибками. Чаще всего программа путала буквы m, n и i, а также f с архаичным удлиненным написанием s. Тем не менее 96% писем было расшифровано правильно. По словам одного из руководителей проекта, «даже неидеальная расшифровка может дать достаточно информации».
Как и любой искусственный интеллект, программа распознания древних текстов, будет совершенствоваться со временем по мере обработки большего количества материалов. И что самое прекрасное, технологии проекта In Codice Ratio можно будет легко адаптировать для расшифровки документов на разных языках.
Однако у этого метода есть ряд ограничений, утверждает Рега Вуд, историк философии и эксперт по древней письменности Индианского университета. Например, программе будет тяжело распознавать манускрипты, написанные не профессиональным писцом, а скопированные любителем, ведь почерк будет существенно отличаться. Кроме того, если речь идет о малых объемах текста, то быстрее и эффективнее будет расшифровать их вручную без применения такой технологии.
Материалы по теме:
SMM-гуру Папы Римского рассказал, как строится digital-стратегия Ватикана
Ватикан запускает «Синдер» для поиска ближайших мест для исповеди
Facebook разрабатывает технологию набора текста силой мысли
ABBYY научила смартфоны распознавать текст с предметов в реальном времени
-
Партнёрский материал Компании научились собирать данные. Принимать решения — нет: почему цифры не помогают сами по себе 21 июля 2026, 16:04
-
Технологии От бумажной фабрики через падение мобильной империи к инфраструктуре для ИИ: история Nokia 11 августа 2026, 10:30
-
Технологии От торговли сушёной рыбой до смартфонов и микросхем: история Samsung 06 августа 2026, 09:02
-
Технологии От ремонта радиоприёмников до глобальной платформы развлечений: история Sony 14 августа 2026, 19:24
-
Автомобили От гоночной команды до бизнеса на дефиците: история Ferrari 09 августа 2026, 09:53
-
Автомобили СССР, дефолт, уход Renault: история завода «Москвич» 07 августа 2026, 18:35
-
Бизнес От спора о будущем ИИ до большого бизнеса: история Claude 25 июля 2026, 17:00
-
Автомобили От ткацкого станка до Prius: история Toyota 22 июля 2026, 15:24
-
Искусственный интеллект Сбер предложил создать Совет по ИИ-разработке: эксперты уверены — инициатива ускорит развитие технологий в России 15 августа 2026, 09:00
-
Искусственный интеллект DeepSeek увеличит тарифы для разработчиков — цены на модели будут меняться в зависимости от времени суток 14 августа 2026, 16:30
-
Искусственный интеллект Яндекс Музыка начнёт маркировать ИИ-треки — стриминг собирает у правообладателей данные об использовании нейросетей 15 августа 2026, 19:00
-
Технологии Первый складной iPhone, новые Apple Watch и устройства для умного дома: что представит Apple в сентябре 2026-го 15 августа 2026, 15:00
-
Россия «Самокат» вводит проверку возраста по биометрии: технология поможет контролировать продажу энергетиков 14 августа 2026, 19:30
-
Деньги ЦБ готовится к борьбе с мисселингом на крипторынке — но эксперты сомневаются в эффективности мер 15 августа 2026, 17:00
-
Деньги Каждый третий считает необходимым обучать финансовой грамотности с 7 лет — почти половина недовольны знаниями детей 15 августа 2026, 13:00
-
Автомобили Продажи люксовых автомобилей в России растут седьмой месяц подряд: самый популярный бренд — Rolls-Royce 15 августа 2026, 11:00





