Искусственный интеллект и Древняя Русь

Созданный на основе ИИ инструмент позволил историку в одиночку обработать источники в количестве, прежде посильном только научному коллективу, и прийти к нетривиальным выводам — как по поводу предмета исследования, так и его метода

Читать на monocle.ru

Прошлым летом Microsoft Research опубликовала исследование, которое можно было легко превратить в тревожный заголовок. Авторы проанализировали 200 тыс. обезличенных диалогов пользователей с Copilot и сопоставили реальные способы применения искусственного интеллекта с задачами сотен профессий. Первыми в перечне оказались переводчики, вторыми — историки. Писатели заняли пятое место, журналисты — шестнадцатое, редакторы — двадцать первое. Для историков с возможностями Copilot в той или иной степени пересекались 91% учтенных видов деятельности.

Это не был прогноз увольнений. Исследователи не изучали сокращение штатов, зарплаты или кадровые планы. Они измеряли, насколько отдельные операции уже поддаются автоматизации, и специально предупреждали: профессия — это не простая сумма действий. За чтением, поиском и письмом стоят знание предмета, выбор цели, понимание контекста и ответственность за вывод.

Но высокий показатель все равно важен. Историк работает прежде всего с текстами и информацией: ищет, читает, сравнивает, классифицирует, объясняет и пишет. Именно здесь языковые модели особенно сильны. Они могут за минуты просмотреть массив, на который человек потратил бы месяцы, и выполнить большую часть подготовительной работы.

Практической проверкой этой возможности стала база данных ИРИС — «Интеллектуальная реконструкция исторических смыслов». Один историк без профессиональной команды программистов превратил большой массив данных в связанную исследовательскую систему. Главный вопрос теперь звучит не так: «уволит ли ИИ историка?» — а так: «что сможет сделать один историк, получив инструменты целого коллектива?»

Источниковая база была не опытной подборкой из нескольких книг. Она включала Полное собрание русских летописей — тома 1–2, 4–16, 18–28, 31, 33–37 и 39–42; семнадцать томов «Библиотеки литературы Древней Руси»; пять выпусков «Памятников русского права»; первые три тома «Российского законодательства X–XX веков»; первые три тома Первого собрания Полного собрания законов Российской империи и отдельное издание Новгородской первой летописи. Иными словами, речь шла уже не о чтении нескольких памятников, а о попытке увидеть общую систему смыслов в большой и самой важной части письменного наследия Древней Руси.

Невидимая половина профессии

Читателю работа историка представляется просто: найти документы, прочитать и написать книгу. В действительности между источником и выводом лежит длинный слой незаметного труда. Нужно собрать издания, разобраться в редакциях и составе многотомников, распознать страницы, исправить ошибки, отделить основной текст от примечаний, описать документ, разделить его на смысловые части, составить перечни имен, мест, событий и понятий, проверить исключения, найти цитаты и только затем переходить к обобщению.

До цифровой эпохи этот невидимый труд материализовался в тетрадях, карточках и коробках с выписками. Историк годами собирал собственную память о теме: одну карточку на имя, другую — на событие, третью — на цитату. Такая система могла быть глубокой, но почти всегда оставалась личной. Ее трудно было передать другому исследователю, проверить целиком или быстро перестроить под новый вопрос.

Здесь соединены две разные работы. Первая — ремесленная: повторяющиеся операции, которые можно описать правилом-алгоритмом. Очистить текст, перенести данные, найти совпадения, сгруппировать формулировки, подсчитать частоты, подготовить выборку сегодня может и скрипт. Вторая — исследовательская: поставить проблему, выбрать теорию, определить единицу анализа, отличить существенное от случайного, проверить источник и объяснить причины.

ИИ быстрее всего входит в первую область. Он не делает ее ненужной: ошибка в распознавании может исказить имя, неверная граница фрагмента — соединить тексты разных авторов, плохая классификация — породить несуществующую закономерность. Но машина способна повторять однажды сформулированное правило десятки тысяч раз. Поэтому она снимает старый выбор между глубиной и широтой: тщательно обработать небольшой корпус или поверхностно охватить большой.

Став проектировщиком исследования, историк должен уметь разложить замысел на проверяемые действия и распознать момент, когда технически безупречный результат научно бессмыслен

Парадокс в том, что автоматизация требует от историка лучше понимать собственный метод. Нельзя поручить модели «найти идеи», пока не объяснено, чем идея отличается от темы, оценки или действия. Нельзя приказать «разделить текст», не определив, какая смысловая целостность должна сохраниться. Чем быстрее работает машина, тем дороже обходится неясный или неправильно сформулированный вопрос.

Поэтому ИИ не просто ускоряет старую процедуру. Он заставляет превратить индивидуальный навык в явную методику. То, что раньше историк делал «по опыту» и не всегда мог подробно объяснить, теперь приходится формулировать как правило. В этом смысле машина становится строгим собеседником: она быстро показывает, где понятие расплывчато, а критерий допускает противоположные решения.

Историк — ChatGPT — Codex

ИРИС возникла не из увлечения программированием. Ее исходной точкой стал идеалистический подход к истории — представление, что идеи формируют цели людей, превращаются в нормы, воплощаются в действиях и институтах и таким образом «делают историю». Чтобы проверить эту гипотезу на большом материале, требовалось не несколько удачных цитат, а способ обнаруживать идеи в десятках тысяч фрагментов и прослеживать их путь к исторической реальности.

Обычного разговора с ChatGPT для этого недостаточно. Чат может объяснить отдельный текст, но исследование должно помнить происхождение каждого фрагмента, применять одинаковые правила, сохранять промежуточные решения и позволять исправлять ошибки без потери исходных данных. Поэтому понадобились база данных и последовательность программ, соединяющих источник, разметку, словари и анализ.

Работа строилась в связке «историк — ChatGPT — Codex». Историк формулировал научную задачу и критерии правильного результата. ChatGPT помогал переводить методику в устройство базы и последовательность операций. Codex (программный модуль входящий в состав ChatGPT и пишущий код) создавал и исправлял программы, обрабатывал файлы и готовил отчеты. Метод и программа развивались одновременно: новый смысловой вопрос мог потребовать изменить таблицу, правило разметки или весь аналитический слой.

Это не сделало историка программистом. Его новая роль — проектировщик исследования. Он должен уметь разложить замысел на проверяемые действия и распознать момент, когда технически безупречный результат научно бессмыслен. Раньше между идеей и работающим инструментом стояли бюджет, заявка и команда. Теперь опытную систему можно построить самостоятельно и сразу проверить на реальных источниках.

Разработка шла короткими циклами. Сначала ставилась содержательная задача, затем создавался небольшой рабочий модуль, после чего результат проверялся на реальных текстах. Если программа ошибалась технически, исправлялся код. Если она безошибочно выполняла неверно поставленную задачу, приходилось менять саму методику. Второй случай был важнее первого: машина нередко обнаруживала слабость исследовательского понятия раньше, чем это сделал бы научный оппонент.

Масштаб за несколько месяцев

Систематическая разработка началась в марте 2026 года. К концу июня она заняла около 82 рабочих дней. За это время появилась не одна программа, а инфраструктура, охватывающая путь от подготовки текста до аналитического вывода.

В базе оказалось более 1,3 млн строк данных. 375 документов были разделены на 70 671 смысловой сегмент; для них система сформировала 70 605 первичных идей и столько же контекстных описаний. Проект включал 975 программных файлов и около 192 тыс. эффективных строк кода. Профессиональные программисты не привлекались.

Прямые расходы на ИИ-сервисы и программные интерфейсы составили около 35 тыс. рублей. Предварительная грантовая смета четырехмесячной разработки, которая не получила финансирования, составляла 4,39 млн. Эти цифры нельзя считать рыночной оценкой готового продукта, но они показывают, насколько снизился порог входа.

ИРИС в цифрах

375 исторических документов

70 671 смысловой сегмент

70 605 первичных идей

Более 1,3 млн строк данных

975 программных файлов

82 рабочих дня систематической разработки

Были рассчитаны и возможные расходы на традиционную разработку силами команды профессиональных программистов, не использующих ИИ: от 29,7 до 208,1 млн рублей в зависимости от принятых предположений о производительности, сроках и уровне оплаты труда. Эти суммы нельзя считать точной рыночной стоимостью ИРИС: расчет основан на условных сценариях и не учитывает множества обстоятельств реальной разработки. Он показывает другое — различие в порядке прямых затрат и в доступности подобной работы для отдельного ученого.

ИРИС остается развивающейся системой. В ней менялись таблицы, правила деления текста и словари, отделялись надежные результаты от спорных. Однако именно возможность быстро переводить методическое решение в программное стала главным результатом. Отдельный исследователь получил контроль над всем циклом работы, который раньше требовал разных специалистов.

Масштаб важен не как соревнование в количестве программ. Он показывает изменение доступной исследователю власти над материалом. Один человек мог менять структуру корпуса, запускать повторную обработку, строить новые выборки и почти сразу видеть последствия методического решения. Раньше подобный поворот потребовал бы согласования с разработчиками и нового этапа финансирования; теперь он становился частью обычного научного поиска.

От источника к данным — и обратно

Документ → фрагмент → сегмент → первичная идея → обобщенная идея → мировоззренческая идея → историческое объяснение.

Эта цепочка описывает логику ИРИС. Источник загружается вместе со сведениями об издании и времени создания, делится на крупные части, затем — на небольшие смысловые сегменты. В каждом сегменте система формулирует конкретную идею. Близкие формулировки постепенно объединяются, пока не складывается верхний уровень из 28 мировоззренческих идей.

Построить эту иерархию оказалось едва ли не сложнее, чем создать сами программы. Простого совпадения слов здесь недостаточно. Формулировки «защитить Русь», «стать за землю» и «отразить врага» могут выражать близкую идею, хотя состоят из разных слов. И наоборот, одинаковое слово в различных источниках способно иметь неодинаковый смысл.

Поэтому в ИРИС использовались два взаимодополняющих способа группировки. Первый — лексический. Система сопоставляла ключевые слова и их формы, учитывала частоту, совместную встречаемость и устойчивые сочетания. Этот метод хорошо обнаруживает прямое родство формулировок, но может не заметить одну и ту же мысль, выраженную совершенно разными словами.

Второй способ основан на эмбеддингах — векторных представлениях текста. Каждая формулировка превращается в длинный набор чисел, задающий ее положение в многомерном смысловом пространстве. Чем ближе расположены два таких вектора, тем вероятнее, что выражения сходны по смыслу, даже если у них почти нет общих слов. Например, фразы о небесном заступничестве, победе по молитве и спасении города связываются не по одному обязательному слову, а по близости общего смысла. Современные модели эмбеддингов специально создаются так, чтобы близкие по значению предложения располагались рядом в векторном пространстве.

Это придает группировке относительную объективность. Одинаковый способ расчета применяется ко всем десяткам тысяч формулировок, расстояние между ними измеряется численно, а результат можно повторить и проверить. Такая процедура меньше зависит от памяти, усталости и первоначальных ожиданий исследователя, чем полностью ручная сортировка карточек.

Однако математическая близость еще не означает исторического тождества. Две фразы могут быть похожи по общему смыслу, но принадлежать разным эпохам, жанрам или системам представлений. Поэтому эмбеддинги не создавали окончательный словарь автоматически. Они собирали возможные группы, лексический анализ уточнял их состав, а затем проверялось, действительно ли объединенные формулировки выражают одну историческую идею. Объективность метода заключалась не в устранении исследователя, а в появлении измеримой и воспроизводимой основы для его решения.

Важнее всего обратный путь. От любого рейтинга или графика можно вернуться к идее, от нее — к фрагменту и цитате. Машина не просит поверить ее вывод: она показывает, из какого текста он получен.

При первом подсчете полная цепочка дала 40 733 строки, но лишь 18 402 уникальных сегмента. Один летописный эпизод мог одновременно выражать Божью помощь, защиту веры, княжескую власть и наказание за грех. Поэтому ИРИС разделила два вопроса: частотный слой считает, насколько распространена идея, а сетевой показывает, с какими другими идеями она соединяется. Несовпадение оказалось не помехой, а свойством самого мировоззрения.

Допустим, летописец рассказывает о победе князя после молитвы перед сражением. Для простого поиска это один абзац. Для историка в нем могут одновременно присутствовать представления о Божьей помощи, праведной власти, защите Руси и единстве перед врагом. Система должна сохранить эту многослойность, но не превратить один эпизод в четыре независимых события. Именно такие задачи отличают исследовательскую базу от обычного электронного архива.

Что увидела система

Для основного анализа были отобраны 14 273 наиболее надежных сегмента. Первое место заняла идея Божьей и святой помощи — 15,4%. Далее следовали спасение души и покаяние — 11,9%, защита веры и Руси — 11,9%, воздаяние за грех — 9,2%, мир и примирение — 5,7%.

Вывод не сводится к очевидной фразе «Древняя Русь была религиозной». Система показала устройство этой религиозности. Победа могла объясняться Божьей помощью, поражение — воздаянием за грех, война — защитой веры и Руси, договор — восстановлением мира, власть — частью должного порядка. Политика, война, право и нравственность существовали внутри общей православной картины мира.

Это меняет сам образ древнерусского человека в источниках. Он действует не в отдельном «религиозном» мире, существующем рядом с политикой, а в реальности, где земное событие сразу получает духовный смысл. Военная удача, княжеское решение, мирный договор или общественное бедствие оказываются частями одного нравственного порядка. Религия здесь не одна из сфер жизни, а язык, связывающий разные сферы между собой.

Второй результат дала разница между повествованием и правом. В летописях лидировали Божья помощь, спасение, защита веры и воздаяние. В законах — правда и верность, наказание, обязательный и церковно-властный порядок. Краткая формула такова: летопись объясняет, закон предписывает. Одна система смыслов в повествовании отвечала на вопрос, почему произошло событие, а в праве превращалась в обязанность, запрет и санкцию.

Особенно наглядно это видно в древнерусском понятии «правды». В современном языке правда чаще противопоставляется лжи. В правовых памятниках она означала также правильный, справедливый и признанный порядок отношений. Поэтому верность договору, наказание нарушителя и власть суда были не только юридическими процедурами: они воплощали представление о том, как должен быть устроен мир.

Третий результат — историческая динамика. До монгольского нашествия особенно заметно религиозно-нравственное ядро. В 1236–1480 годах усилилась защита веры и Руси, в период объединения земель выросло значение церковно-властного порядка, в XVII веке — правды, верности, наказания и обязательности правил. При этом все 28 идей присутствовали во всех крупных периодах. Мировоззрение не сменилось другим: менялись внутренние пропорции.

Такой вывод важнее поиска даты, когда якобы закончилось одно мировоззрение и началось другое. Культурные системы редко сменяются мгновенно. Старые идеи продолжают действовать, но исторические обстоятельства меняют их вес. Нашествие выдвигает защиту, объединение земель — порядок власти, усложнение государства — норму и закон. ИРИС позволяет увидеть не череду неподвижных эпох, а движение внутри устойчивой системы.

Наконец, ИРИС показала, что идеи жили не только в рассуждениях. Из 14 273 надежных сегментов 2743 содержали прямые утверждения, 1101 — нормы, а 10 360 — проявления идей в событиях и действиях: войнах, договорах, судах, наказаниях, княжеских решениях и церковных практиках. Это позволяет изучать переход от смысла к правилу и затем к исторической реальности.

Это принципиально для идеалистического подхода. Идея интересна не только тогда, когда автор прямо произносит ее как убеждение. Гораздо важнее момент, когда она становится нормой поведения, оправданием поступка или устройством института. Большое число описаний действий показывает: мировоззрение присутствовало в источниках не как отвлеченная проповедь, а как способ организовать и объяснить историческую жизнь.

Цифры не заменяют чтение. Частая формула может быть жанровым оборотом, редкая идея — определять важный институт. Но большой корпус показывает, где искать исключения, насколько типичен любимый историком пример и в каких пределах работает его вывод.

Когда источником становится целая библиотека

ИИ меняет не только скорость, но и класс доступных задач. Раньше тема неизбежно соотносилась с физическими возможностями исследователя: сколько томов он прочтет, сколько выписок сделает, какой объем удержит в памяти. Теперь единые правила можно применить к целой библиотеке, сохранив происхождение каждого результата.

Есть четыре основные опасности: ложная уверенность (модель не краснеет, когда ошибается), исчезновение оригинала за удобным пересказом, перевод прошлого на язык современных категорий и привыкание самого исследователя к готовым вопросам и ответам

Это позволяет находить массовые закономерности и редкие исключения, строить карты идей по времени, месту, действующим лицам и жанрам, сравнивать летописи, законы, жития и договоры. Особенно ценны отрицательные случаи: тексты, в которых ожидаемая идея отсутствует. Они не подтверждают красивую схему, а заставляют ограничить ее действие.

Следующий шаг — связать корпус источников с корпусом исторических исследований. Тогда можно будет увидеть, какие документы выбирали разные историки, как менялось объяснение одного события и где вывод действительно опирается на источники, а где десятилетиями живет как повторяемая научная традиция.

Такой подход способен изменить историографию не меньше, чем первый — источниковедение. Можно будет проследить судьбу научного тезиса: кто впервые его сформулировал, какие источники привел, кто повторил формулу без новой проверки и в какой момент она стала восприниматься как очевидность. История исторической науки предстанет не только как перечень школ и авторов, а как движение конкретных доказательств и объяснений.

Раньше историк сначала уменьшал вопрос до доступного объема материала. Теперь он может сначала поставить значимый вопрос, а затем собрать корпус для его проверки. Искусственный интеллект снимает ограничение объемом памяти и рабочего времени, но не ограничение качеством мысли — по крайней мере, пока.

Вместе с масштабом возрастает требование прозрачности. Чем больше записей обработала программа, тем труднее обнаружить незаметную ошибку по конечной таблице. Поэтому цифровое исследование должно показывать состав корпуса, правила разметки, долю сомнительных случаев и путь от вывода к источнику. Большие данные не освобождают от доказательства — они делают его устройство более сложным и потому более обязательным.

Пока машина не историк

Языковая модель легко создает впечатление самостоятельного исследователя. Она пишет гладко, быстро строит классификацию и уверенно объясняет результат. В этом и состоит опасность: ошибка звучит столь же убедительно, как верный вывод.

ИИ может подменить источник пересказом, навязать прошлому современные понятия и принять частоту за значимость. Он плохо чувствует, где автор лжет, умалчивает или следует обязательной риторике. Закон сообщает, как должно быть, но не доказывает, что так было. Летописное объяснение поражения грехами важно для истории мировоззрения, но не обязательно раскрывает военные причины.

Четыре опасности особенно заметны. Первая — ложная уверенность: модель не краснеет, когда ошибается. Вторая — исчезновение оригинала за удобным пересказом. Третья — перевод прошлого на язык современных категорий. Четвертая — привыкание самого исследователя к готовым вопросам и готовым ответам. Последний риск может оказаться самым серьезным: машина сначала экономит время человека, а затем незаметно начинает определять, на что это время будет потрачено.

Есть и риск интеллектуальной зависимости. Исследователь, привыкший получать готовый связный ответ, может разучиться удерживать противоречие и самостоятельно строить вопрос. ИРИС пытается этому противостоять: хранит исходный текст, требует цитату, отделяет сомнение и позволяет повторить путь вывода. В нынешней системе человек задает цель, а машина действует внутри установленных им правил.

Однако слово «нынешней» здесь важнее слова «человек».

В 2025 году японская компания Sakana AI испытала систему The AI Scientist-v2. Ей задавали лишь широкую тему. Далее она сама формулировала гипотезу, писала программный код, проводила эксперименты, анализировала результаты, строила графики и создавала весь текст научной статьи — от заголовка до списка литературы. Люди не редактировали выбранную работу.

Три полностью машинные статьи отправили на двойное слепое рецензирование семинара при одной из ведущих конференций по искусственному интеллекту ICLR. Две не прошли. Третья получила средний балл 6,33 — выше среднего порога принятия и выше оценок многих человеческих работ на том же семинаре. По заранее согласованным правилам эксперимента ее сняли с публикации. Сами разработчики признали: это еще не уровень основной конференции, в тексте находились ошибки, в том числе в ссылках. Но принципиальная граница была пересечена: машина прошла весь цикл от гипотезы до статьи, которую профессиональные рецензенты сочли достойной принятия.

Оговорки существенны. Это был семинар, а не основная программа конференции; люди задали общую область, отобрали лучшие результаты для подачи, а две из трех работ получили недостаточные оценки. Разработчики обнаружили у системы слабые объяснения и ошибочные ссылки. Но еще несколькими годами ранее спор шел о том, сможет ли ИИ написать правдоподобный научный текст. Теперь спор идет о качестве исследования, которое он провел сам.

Историческое исследование труднее автоматизировать, чем опыт с программным кодом: прошлое нельзя повторить в лаборатории, а источник требует критики и понимания языка эпохи. Но нет основания считать эту преграду вечной. Система будущего сможет сама найти аномалию в корпусе, сформулировать вопрос, собрать доказательства, сравнить их с историографией, проверить конкурирующие версии и написать статью еще до того, как человек откроет первый том.

Представим исторический аналог. Система получает доступ к корпусу летописей, законов и научных монографий. Она замечает, что привычное объяснение события плохо согласуется с частью источников, сама формулирует альтернативу, проверяет ее на разных жанрах и периодах, отбирает цитаты, строит графики и отправляет статью в журнал. Редактор видит связное исследование с проверяемыми ссылками, но у текста нет автора в человеческом смысле — только история выполненных машиной операций.

Сегодня историк остается главным, потому что именно так устроена ИРИС и большинство научных проектов с ИИ. Но если развитие продолжится, прежнее разделение труда может перевернуться. Человеку достанется роль того, кто проверяет уже проведенное машиной исследование, спорит с его выводами или разрешает публикацию.

Будущее может принадлежать не только историку, превратившему искусственный интеллект в продолжение своей методологии, но и искусственному интеллекту, превратившему историка в одного из своих рецензентов.