«Для среднего бизнеса работу с ИИ важно начинать с максимально простых решений»

Если у компании есть подготовленные данные и четкая бизнес-гипотеза, то она может кратно повысить финансовую эффективность с помощью внедрения ИИ, считает Дмитрий Жихарев, СРО платформы RAISA лаборатории ИИ департамента больших данных Россельхозбанка

Читать на monocle.ru

Скорее всего, вы сталкивались с искусственным интеллектом в рабочих процессах — еще в конце 2025 года доля крупных российских компаний, использующих генеративный ИИ хотя бы в одной функции бизнеса, уже перевалила за 70% (это следует из данных консалтинговой компании «Яков и партнеры» и «Яндекса»). При этом технология остается новой, и большинство компаний, да и их сотрудников либо не понимают, что с ней делать, либо не могут объективно оценить, насколько она полезна. О том, как превратить искусственный интеллект из модного тренда в реальный рабочий инструмент, мы побеседовали с Дмитрием Жихаревым, СРО платформы RAISA. В Россельхозбанке RAISA используется для исследования данных, отработки гипотез, прототипирования, обучения и промышленного мониторинга моделей ИИ. Сегодня платформой пользуются более трех тысяч сотрудников банка и дочерних организаций. С ее помощью прогнозируется риск оттока клиентов, определяется вероятность возврата просроченной задолженности и перевод заемщиков между стадиями взыскания, оптимизируются остатки наличных в кассах и банкоматах.

Что спросить про заемщика у ИИ

— Чем искусственный интеллект лучше в решении прикладных задач банка — ведь аналитики банков годами с этим справлялись без ИИ?

— Ландшафт данных банка — штука сложная. Платформа искусственного интеллекта возникает тогда, когда пройдены предшествующие этапы: построена платформа данных, есть операционная модель работы с ними и выстроена культура BI (Business Intelligence, бизнес-аналитика). Когда варианты оптимизации с использованием традиционной BI-аналитики исчерпаны, в ход идет продвинутая аналитика, и для нее требуются более сложные алгоритмы машинного обучения, включая модели нейронных сетей. Вот тогда уже нужны решения, которые позволяют работать с этими моделями: создавать, эксплуатировать, контролировать их качество. Это была одна из задач, которую мы себе ставили при создании платформы.

Вторая задача — создание единой точки входа в аналитический контур для сотен прикладных аналитиков, дата-инженеров и моделистов. Это позволяет нормализовать процесс работы со статистическими гипотезами и управлять жизненным циклом модели. Ведь в отличие от обычного кода, который, заработав один раз, дальше работает с неизменным результатом, качество работы модели зависит от дрейфа, и поэтому модель нужно постоянно проверять («дрейф» — изменение закономерностей со временем. — «Монокль»). Так родилась платформа RAISA — RSHB AI Systems and Applications, прикладные системы и решения для продвинутой аналитики.

— Вы сказали, что инструменты, которые уже были, исчерпали себя. В чем это выражалось? Нужно было подтягивать другие данные, или искать другие связи, или математический аппарат должен был стать другим?

— И то, и другое, и третье. Сначала появляется хранилище данных, затем базовая аналитика и BI, который показывает описательную статистику — например, сколько людей из когорты ушло в просрочку. Но когда нужна предиктивная аналитика, например на сороковой день просрочки предсказать, свалится ли клиент в категорию «более 90 дней» (просрочка более 90 дней считается уже безвозвратной. — «Монокль»), факторов становится несколько десятков. Поместить такую модель в BI уже не представляется возможным. Модель нужно разработать, применить, записать результаты и интегрировать их в бизнес-процесс. Только так данные превращаются в информацию, а информация — в знание и решение. То есть, допустим, несмотря на то что у человека сейчас сорок дней просрочки, мы его сразу кинули в Hard Collection («жесткое взыскание» — стадия взыскания просроченной задолженности, предполагающая личный контакт с коллектором. — «Монокль»), потому что модель показывает высокую вероятность такого исхода и мы понимаем, что нет смысла ждать. И если мы в итоге смогли взять с него задолженность, то тем самым повысили финансовую эффективность взыскания.

Нас ждет появление специфических отраслевых моделей в консалтинге и других сферах, которые значительно снизят затраты людей на поиск информации в больших массивах данных

Не всегда надо бежать к генеративному ИИ

— Раскройте кухню. Есть человек с просрочкой сорок дней и порядка двадцати параметров. Никто изначально не знает, какие данные смотреть и в каком соотношении. Как выясняется, что важно? Методом перебора?

— Для начала берутся данные, которые уже есть в банке. Методология исследования данных начинается с понимания бизнеса. Мы не спрашиваем бизнес, на каких данных построить модель. Они этого не знают. Мы спрашиваем, как сейчас работает процесс и что они уже пробовали. Затем мы проводим статистический эксперимент, получаем подтверждение или опровержение гипотезы. Собирая набор факторов, мы оцениваем предсказательную силу модели различными методами. Если точность существующего процесса повышается, двигаемся дальше. Если нет — эксперимент отправляется в помойку, и это нормально. Часто бывает, что перебрали гипотезы, но ни одна не улучшает силу модели или сбор данных просто дороже, чем потенциальная выгода. Поэтому мы всегда спрашиваем бизнес-заказчиков: исчерпали ли вы все возможности, прежде чем заниматься машинным обучением? Каждый следующий этап дороже, и не всегда стоит быстро бежать к ИИ, тем более к генеративному.

— Но ведь платформы уже есть, бизнес знает, что инструмент современный, почему бы не попробовать? Это просто затраты сотрудников и электроэнергии?

— Для генеративного ИИ это затраты на приобретение своих серверов или закупку токенов внешних моделей. Для классического машинного обучения это в основном затраты на людей: около 60 процентов трудозатрат — это подготовка данных. Их нужно собрать, обеспечить качество и регулярность. Для промышленного процесса это стоит денег, и, если не предвидится финансового эффекта, делать это бессмысленно. Но в банках есть стандартные случаи, такие как предсказание оттока или категоризация заемщиков в процессе работы с просрочкой, в которых уже давно используют машинное обучение, потому что классические методы давно себя исчерпали.

— Вы упомянули эксперименты. Какие это эксперименты и как вы их строите?

— Моделисты перебирают варианты архитектур моделей: бустинг, логистическая регрессия, нейросети (различные алгоритмы работы с данными. — «Монокль»). Настраиваются гиперпараметры, которые определяют, насколько модель будет чувствительна или нечувствительна к переобучению. Выборка разбивается на части: на одной модель обучается, на второй перебираются гиперпараметры, третья служит для подтверждения. Но 60‒80 процентов времени моделист занимается подготовкой данных, потому что чем они лучше, тем лучше модель.

— Кажется, что у малого или среднего бизнеса, даже если у него есть подготовленные данные, использовать ИИ не получится, если он не знает, что с ними делать. Может ли ИИ сам найти скрытые связи в накопленных данных?

— Может. Существует методология, которая называется CRISP-DM. О первом шаге мы уже говорили — понимание бизнеса. Второй — разведочный анализ данных: проверка на пропуски, распределение, наличие аутлаеров (аутлаеры — это точки данных, которые очень резко выбиваются из основного массива). Затем подготовка данных, модельный эксперимент и оценка предсказательной мощности. Сейчас часть этой работы можно поручить большой языковой модели, правильно ее запромптив. Но нужно базово понимать, как проверить результат на физический смысл. Например, если модель предсказывает возраст с вероятностью сто процентов по одному фактору, значит, произошла утечка данных: этот параметр уже содержал ответ. Можно поручить второй модели роль скептика, чтобы она критиковала результаты первой и искала утечки или перекосы выборки. Профессия дата-сайентиста меняется: они автоматизируют рутину с помощью этих инструментов, и среднему бизнесу теперь может хватить одного специалиста вместо трех.

— Реальна ли история, что ты пишешь нейросети: найди мне в этих данных то-то — и он находит?

— Реальна, он найдет. Хитрость в том, как понять, что он нашел правильно. Современный генеративный ИИ может галлюцинировать, но критикует он свои или чужие выводы неплохо. Однако от ошибок никто не застрахован. Были случаи, когда компания жила с управленческой отчетностью, сгенерированной ИИ, целый квартал, пока не поняла, что это галлюцинации, повлекшие убытки. Поэтому цифры всегда нужно проверять. Классическое машинное обучение всегда внедряется через A/B-тест (сравнение эффективности двух вариантов. — «Монокль») на небольшой группе клиентов, потому что мы могли ошибиться или внешняя среда могла измениться, и модель могла утратить предсказательную силу.

Все дело в правильных вопросах, или Где ИИ не нужен

— Как быть с внешними данными? Процессы в экономике, ставки — их тоже нужно заводить в модель?

— Абсолютно. Рано или поздно моделисты приходят к руководству и говорят, что внутренние данные исчерпаны, пора закупать внешние. Конечно, обязательные реестры или кредитные бюро уже используются. Но когда возникают дополнительные данные, нужно получить у поставщика слепок данных, провести эксперимент и сделать вывод, помогают они или нет. Внешние данные могут быть неполными, некачественными или не совпадать с тем, что нам нужно. Например, мы обслуживаем одну когорту, а в компании, где мы хотели закупить данные, данные по другой когорте, и пересечение маленькое. Или мы закупили данные и поняли, что они мало на что влияют. Развиваются также решения для федеративного обучения, когда несколько банков обмениваются информацией, не передавая сами данные напрямую, соблюдая 152-й ФЗ (так называемые распределенные вычисления).

— Чем слепок данных отличается от финальных данных?

— Поставщик не отдаст все данные сразу. Он готов отдать, например, два процента в качестве одноразового слепка под эксперимент. Для крупной выборки этого вполне достаточно, чтобы понять репрезентативность. Если данные полезны, заключается договор на поставку с понятной частотой обновления и соглашение об уровне обслуживания на качество.

— Вы говорили, что важный шаг — правильно запромптить агента. Как сформулировать задачу?

— Обычно определяют роль: ты дата-сайентист и решаешь такую-то задачу. Затем точно описывают задачу и дают пример того, как должен выглядеть вывод. В начале желательно определить граничные условия: чего модель ни в коем случае не должна делать. Но эффективность промптинга с каждым поколением моделей падает. Профессия промпт-инженера не оправдала надежд: то, что работало на одной версии модели, на следующей может вредить. Приходится постоянно переписывать промпты, делая их проще и понятнее. Помогает то, что крупные поставщики LLM предоставляют рекомендации по промптингу с каждым обновлением их моделей.

— Если у бизнеса нет гипотез, но руководитель понимает, что данные есть, есть ли техники поиска этих гипотез?

— Если у бизнеса нет идей, возможно, он просто не может их выразить. Нужно задавать правильные вопросы. Часто бывает так, что аналитики данных приходят к бизнесу и спрашивают: чего вы хотите? Бизнес рассказывает в максимально технических терминах, на которые он способен. Аналитики данных именно это и делают — например, двадцать разных отчетов. В каждый из них заказчик зайдет по одному разу, и этим все закончится — а все дело в том, что сами вопросы были заданы неправильно.

Аналитикам данных нужно в первую очередь разобраться в бизнес-модели компании: в чем ценностное предложение, где клиенты, как производится ценность, на чем компания зарабатывает или теряет. Затем нужно понять операционную модель: кто какие процессы выполняет и чем пользуется. Рядом с этим есть оргструктура, которая отвечает на вопрос, как все эти люди друг с другом связаны. Так появляется понимание, зачем вообще этот бизнес, на чем он зарабатывает и теряет и как работает на уровне процессов.

После этого можно прийти к людям, которые работают в этих процессах, и спросить, как они понимают, хорошо или плохо процесс работает. На этом этапе можно услышать ответ: «А мы не понимаем». Значит, здесь пока не нужен никакой искусственный интеллект или машинное обучение. Здесь нужен хотя бы отчет о продажах, если подразделение не может посчитать свои базовые показатели.

Когда стало понятно, хорошо или плохо работает процесс, можно спросить, какими данными в нем пользуются, что могло бы помочь сделать его эффективнее и что из этого уже пробовали. Так постепенно удастся вытащить гипотезы. Для среднего бизнеса особенно важно начинать с максимально простых решений, выполняющих бизнес-задачу, а потом их усложнять, потому что у него нет пространства для ошибки. К примеру, дать продающему подразделению улучшенный отчет о продажах с базовым прогнозом на этот квартал — для них это уже будет большим подспорьем. Позже они придут к продвинутой аналитике.

Как не утонуть в данных

— Где на пути от идеи до прогностической модели чаще всего бывают сбои?

—Бизнес должен верить в цифры и уметь подтвердить экономический эффект. Не все могут или хотят посчитать, сколько они заработают или сэкономят. Затем можно споткнуться о дороговизну содержания данных и адаптации модели, которую нужно регулярно переобучать. Но чаще всего хорошая модель разбивается о сопротивление бизнеса изменениям. Была история, когда система оптимизации наличности в кассах выдавала рекомендации уменьшить запас денег, а сотрудники все равно загружали кассы под завязку. Выяснилось, что процесс был заточен под то, чтобы в кассе не кончились деньги, иначе был бы штраф. А вариант положить денег меньше просто отсутствовал в регламенте. Процесс пришлось переделать. Любая крупная система предпочитает оставаться в гомеостазе и процессы свои не менять.

Из десяти гипотез одна выходит в прибыльную эксплуатацию. Остальные отваливаются, и это нормально

— Обучение людей — это самый сложный этап?

— Это точно самый важный этап. Если люди чего-то не понимают, они это игнорируют или боятся. С другой стороны, без обучения мы не получаем обратной связи, и это тоже может привести к фатальным ошибкам. Например, сейчас среди айтишников процентов девяносто уже пользуются генеративными помощниками негласно. Если прийти и сказать, что мы внедрим модель централизованно и повысим эффективность в два раза, они посмотрят с непониманием: они у себя это давно внедрили, никого не спрашивая. Нужно сначала собрать информацию, чем они пользуются, не утекают ли данные во внешние модели и стоит ли внутренней автоматизации конкурировать с рыночными решениями за пять долларов в месяц.

— Можете привести конкретный пример, когда ИИ предсказал что-то, что было неочевидно на старте?

— Что такое данные? Просто циферка, которая где-то хранится, например 42 градуса. А информация — это циферка с контекстом. Если 42 градуса вода в чайнике, это означает, что чай не заварится. Если 42 градуса — это температура человека, это означает, что срочно надо его лечить. Когда в зависимости от контекста мы принимаем какое-то решение, информация наконец превращается в знание.

Я хотел бы привести простой пример из банковской отрасли, когда люди, даже имея на руках понятный расчет, не верят в него до тех пор, пока этот расчет не увидят в жизни. Например, банк выдает в день кредитов на миллиард рублей. Предположим, он одобряет только каждый второй кредит и еще миллиард просто не выдает. В пиковый час обрабатывается 10 процентов объема: выдаем на 100 миллионов, отклоняем на 100 миллионов. Это означает, что если в этот час мы будем одобрять все кредиты, мы наберем в портфель 100 миллионов плохих кредитов. В свое время у моих коллег была такая проблема, что они в кредитный конвейер поставили модель, которая одобряла все кредиты. Они за один час набрали ту сумму, которая была озвучена в рисках. И только в этот момент у них данные об условных 100 миллионах плохих кредитов превратились в информацию, что эти 100 миллионов висят на балансе и теперь с ними надо что-то делать.

— И что потом?

— Моментально было принято решение на основе данных лучше тестировать модели. То же самое с платежными системами: если отвалится анализ фишинговых транзакций, пройдет ровно столько мошеннических операций, сколько предсказывает арифметика потока.

— Какие отрасли следующими будут массово внедрять ИИ?

— Все внедряют. Искусственный интеллект — это зонтичный термин. Нейронные сети существовали и двадцать лет назад, например в микросхеме ракеты, задолго до того, как придумали генеративное прикладное применение. Главные бенефициары сейчас — маркетплейсы и банки, потому что у них больше всего данных, которые можно монетизировать. Но мы увидим и рост отраслевых моделей. Например, «Норникель» сделал отраслевую модель Metal GPT. Она содержит в себе корпус специальных данных по металлургии. Они делали саму модель два‒четыре месяца, а собирали знания для нее больше полугода. Нас ждет появление специфических отраслевых моделей в консалтинге и других сферах, которые значительно снизят затраты людей на поиск информации в больших массивах данных. Барьер поиска информации — самый первый барьер, который надо преодолеть. Когда информации много, в ней можно утонуть.

— Могут ли у ИИ быть не глюки, а фантазии в сторону открытий? Прочитал базу знаний и сказал: эврика, вот новый способ обработки металла.

— ИИ не способен придумать что-то принципиально новое, но он способен обобщать и делать выводы. В научном сообществе дискутировали, считать ли ИИ соавтором разработок. В итоге посчитали его оборудованием, поскольку гипотеза в конечном счете принадлежит человеку. ИИ выступает как очень трудолюбивый лаборант, который перебирает множество методов, чтобы подтвердить или опровергнуть данную гипотезу. Пока идея остается за человеком.

Модели, которые нам не продадут

— Существует ли гонка ИИ между США и Китаем? И каков приз?

— Гонка существует. Помимо США и Китая в ней участвует Европа. Приз — алгоритм, обладающий наиболее широкими знаниями и высокой предсказательной точностью. Хотя модели среднего размера способны решить 95 процентов задач больших моделей, просто медленнее. Те же айтишники могут пользоваться топовыми моделями, за которые они будут платить. А могут пользоваться более дешевыми моделями, которые сделают примерно то же самое, но в пять раз медленнее. На фоне того, что раньше айтишник выполнял эту задачу несколько дней, то за десять минут или за полтора часа ее решит модель, уже не принципиально.

В феврале 2026 года более 90 стран, включая США, Китай, и Россию, подписали «Декларацию об этике ИИ», которая заявляет ориентир на демократизацию доступа к ИИ. но это, скорее, подчеркивает факт наличия конкуренции. Новые сверхбольшие модели остаются проприетарными (закрытые решения, которыми распоряжается разработчик. — «Монокль»). Я думаю, что в будущем экспорт таких моделей запретят, потому что они представляют слишком большую ценность для экономики.

— Как можно запретить экспорт IT-продукта?

— Нам просто никто это не продаст. Бизнесу, который рассчитывает на доступность внешних моделей, нужно понимать, что они могут вдруг стать недоступны и придется переехать на другие. Эту гибкость надо закладывать. Кроме того, в ближайшие год-два мы будем жить в так называемой токеномике: мы покупаем токены к модели, это наш бюджет, и мы зависим от тарифов владельца модели. Этим бюджетом надо грамотно распорядиться и не спалить на какие-то глупые вещи.

Технически заменить модель проще, чем банковскую автоматизированную систему (АБС), так как есть стандартизированные API (протоколы обмена. — «Монокль»). Но нужно постоянно проверять, что новая модель работает вменяемо, потому что вывод любой модели вероятностен и не детерминирован.

— Если агент готовит ежедневную отчетность, а модель никогда не делает одно и то же, не возникает ли противоречие?

— Если формат фиксирован и проверяется, вероятность ошибки сводится к минимуму. Но решение всегда принимает человек, и ответственность несет человек. Модель вполне может раз в год сгаллюцинировать. Нельзя строить систему без проверки, чтобы не позволять одним необдуманным действием разрушить бизнес. Были случаи, когда модель с неограниченным доступом к IT-инфраструктуре просто выносила ее и работа компании останавливалась.

— Есть ли статистика, сколько экспериментов заканчивается прибыльными гипотезами, которые идут в промышленную разработку?

— Из десяти гипотез одна выходит в прибыльную эксплуатацию. Остальные отваливаются, потому что не сходится экономика, недостаточно данных, их дорого собирать или предсказательная сила небольшая. Это нормально. Процентов 80‒90 инициатив не доходят до успеха, и это нормально, на то они и гипотезы. Главное, чтобы один полученный результат окупил все эти девять неудачных гипотез и принес прибыль.