Иллюзия безопасности: ученые исследовали влияние ИИ на решения врачей

Фото: iStock
Фото: iStock

Чрезмерное доверие врачей к искусственному интеллекту снижает их внимание к возможным ошибкам, связанным с ограниченностью данных для обучения ИИ. В результате может вырасти число неверных диагнозов. Чтобы избежать этого, разработчикам необходимо расширять и повышать качество обучающих данных, а врачам — более внимательно и критично относиться к выводам ИИ. Как это сделать, обсудили на очередном семинаре из цикла «Искусственный интеллект в мире людей», организованном Центром этики и онтологии роботов Института робототехнических систем НИУ ВШЭ.

Модератор семинара, директор Центра этики и онтологии роботов Института робототехнических систем, профессор Анастасия Углева отметила, что доклад объединяет темы медицины, когнитивной науки и этики искусственного интеллекта и показывает, как теория отражается в практике и, наоборот, как практика влияет на теорию.

С докладом «Когнитивно-поведенческое моделирование для оценки безопасности ИИ в лучевой диагностике» выступил эксперт по междисциплинарным исследованиям Андрей Власов. Он рассказал, что в исследовании безопасности ИИ в радиологии — в частности, в маммографии — участвовали врачи-рентгенологи из Москвы и Кыргызстана. Исследователей интересовало, как медики взаимодействуют с высокоточными системами и какова вероятность нанесения вреда здоровью пациентов при применении ИИ.

По словам докладчика, при сертификации системы ИИ тестируются не в динамике, а на стандартном наборе данных, и используемые метрики не всегда фиксируют, как алгоритм взаимодействует с врачом, когда у того есть возможность ознакомиться с мнением ИИ. Исследование показало, что 94% моделей были построены на ретроспективных данных, а врачи, как правило, не перепроверяли их выводы.

С этим докладчик связал так называемый валидационный разрыв. Он объясняется тем, что алгоритм демонстрирует высокую (до 99%) точность на ограниченном датасете, но при более широком применении может ухудшать 1,4–1,8% клинических исходов — а это тысячи случаев пропуска или неправильной диагностики заболеваний.

Сертификация ИИ по изолированным метрикам создает иллюзию безопасности: врач систематически получает подтверждения точности алгоритма и, теряя бдительность, может нарушить принцип «не навреди», доверившись «электронному помощнику» в диагностике болезни, с которой тот знаком недостаточно хорошо. Нейробиологический механизм экономии когнитивных ресурсов формирует автоматизированное предубеждение — основу для будущих ошибок.

Вычислительное моделирование показало, что с ростом доверия к ИИ частота ошибок увеличивается до 3,5–4,8%, а если точность модели оценивается выше 91%, риск ошибок еще выше. По мнению докладчика, это означает, что самая совершенная модель способна нанести наибольший ущерб: врач, полагающийся на нее, может пропустить больше онкологических случаев, а число ошибок — вырасти до 18 000 на миллион обследованных пациентов.

Фото: iStock

Расхождения в диагностике особенно велики там, где цена ошибки наиболее высока — в частности, при раке молочной железы. Анализ снимков, проведенный моделью и тремя опытными врачами, показал: диагнозы радиологов между собой коррелировали очень высоко, тогда как заключения ИИ, ранее демонстрировавшего высокую точность, и врачей существенно расходились.

Далее авторы исследования сформировали датасет маммографических данных из одного из регионов России и показали его восьми врачам-рентгенологам из разных городов России и Кыргызстана, одновременно проанализировав те же снимки с помощью трех систем ИИ, включая систему, работающую в контуре департамента здравоохранения Москвы. Была выявлена серия ложноотрицательных диагнозов, которые потребовали дополнительных обследований и вызвали стресс у пациентов, а также более серьезные случаи пропуска опухолей, чреватые неверными назначениями и тяжелым течением или исходом болезни.

Андрей Власов обратил внимание на то, что излишнее доверие к ИИ формирует у врачей уклонение от риска и снижение личной ответственности, чего следует избегать: если мнения врача и модели расходятся, итоговое решение должно быть консервативным, поскольку рекомендация дополнительного обследования менее опасна, чем пропущенное новообразование. Для радиолога это означает необходимость постоянной саморефлексии. Разработчикам, в свою очередь, стоит задуматься, как штрафовать модели — прежде всего за пропуск опухоли и ложноотрицательные результаты. Отдельный вопрос — компетенции специалистов, готовящих наборы данных для обучения, и формирование более ответственного подхода к обучению клинического ИИ.

Массовое применение ИИ в медицине позволяет снизить когнитивную нагрузку на врача и сосредоточиться на более сложных решениях. Однако чрезмерное доверие медиков к алгоритмам, склонность позитивно трактовать их выводы и снижение критического восприятия повышают риск ошибочного решения. Преодолеть это можно, только воспитывая у врачей независимость мышления и системную критичность, а также повышая качество взаимодействия с ИИ.

Исследование взаимодействия ряда моделей с врачами показало: когнитивная нагрузка снижала производительность связки «человек — ИИ» во всех моделях, а разрыв во мнениях врача и ИИ увеличивал вероятность ошибки даже без дополнительной когнитивной нагрузки.

Похожая проблема возникает и при разработке специализированного ИИ. Гипотеза о том, что он освободит радиолога от рутинной работы и сэкономит время, подтвердилась лишь отчасти: столкнувшись с нетипичным случаем, ИИ, как правило, «молчит», и врачу приходится перепроверять его выводы самостоятельно.

Взаимодействие врачей с моделями требует дальнейшего изучения, в том числе поведенческих исследований с их участием.

Главный результат работы — обнаружение разрыва в системе валидации: тестирование модели на входе не предполагает изучения того, как врач реагирует на мнение ИИ. Чем выше доверие к точности модели, тем больше вероятность ошибок: при точности 71% она составляет 3,5%, а после 90% — вырастает многократно. Это повышает риск серьезных промахов, особенно у молодых врачей, и требует развития критического отношения к заключениям ИИ и поддержки со стороны опытных коллег.

Для повышения безопасности, сохранения профессиональных компетенций врачей и одновременного снижения их когнитивной нагрузки следует использовать подход калиброванного доверия, при котором врачи критически оценивают выводы моделей, и разработать новый стандарт валидации ИИ — в том числе с учетом взаимодействия с медиками, подытожил Андрей Власов.

Фото: iStock

Дискуссант, врач-рентгенолог Ольга Пучкова, отметила важность исследования, проведенного Андреем Власовым и коллегами, которое осмысляет опыт внедрения ИИ в лучевую диагностику. Она напомнила, что первые результаты применения моделей в этой сфере были обнадеживающими: их точность даже превышала точность диагнозов среднего врача. Однако впоследствии валидация на ограниченных данных напрямую сказалась на результатах лечения более широкого круга пациентов, в том числе негативно.

По ее мнению, при подтверждении точности алгоритмов медицинского ИИ следует анализировать более широкий круг задач, в частности вероятность достижения конкретного клинического результата и то, какими методами он может быть получен.

Важно понимать, какая именно версия ИИ позволит эффективнее лечить то или иное заболевание. Например, в маммографии таким результатом может быть снижение смертности от рака молочной железы или инвалидности по этому диагнозу. Следует изучать, какая комбинация врача и технологии наиболее результативна в лечении. Пока врачи не определят, к какому именно клиническому эффекту они стремятся, применение ИИ рискует приводить к противоречивым результатам, в том числе к выгоранию медиков.

По мнению Ольги Пучковой, представленная работа подтверждает ключевую проблему применения ИИ в медицине — недостаточное понимание того, что это такой же инструмент, как скальпель или электронный микроскоп.

Будущее, считает врач, — это переход к моделированию ИИ в рамках заданных процессов, цель которых — улучшение жизни пациентов. Для этого нужны исследования, подобные представленному на семинаре.

В ходе обсуждения доклада участники семинара разобрали проблемы формирования новых принципов валидации с учетом реальных эффектов применения моделей, включая снижение числа смертей и случаев потери трудоспособности.

Для этого, полагают медики и эксперты, потребуются изменения в организации системы здравоохранения, в подходах к внедрению ИИ и к его аудиту. Отдельный вопрос — как выстроить взаимодействие врача и алгоритма так, чтобы постоянная необходимость перепроверки результатов не вызывала у медиков выгорания и неприятия.

По мнению участников семинара, необходимы дополнительная валидация и дообучение разработчиков — понимание ими принципов взаимодействия ИИ с человеком и готовность «штрафовать» модель за ошибки, особенно угрожающие жизни и здоровью пациента на практике. Важны также протоколы, которые позволяют врачу выразить сомнение и получить на него ответ ИИ. Наконец, обучение моделей должно строиться на реальных клинических случаях.

Анастасия Углева

Анастасия Углева поинтересовалась, какие новые метрики нужно ввести при сертификации моделей, стоит ли внедрять когнитивное тестирование, кто и по каким критериям должен его проводить. Она подчеркнула, что при этом важно сохранить преимущества ИИ для пациента — например, возможность быстро получить предварительное описание или заключение по снимку.

По мнению Ольги Пучковой, при сертификации ИИ стоит использовать опыт рандомизированных контролируемых исследований, применяемых в фармацевтике для изучения воздействия препаратов: они позволяют лучше понять, как те или иные действия приводят к желаемому результату, а затем оценить вероятный эффект — экономию времени и экономические результаты. Возможно, уже сейчас стоит предоставить пациенту право отказаться от использования ИИ и обратиться непосредственно к врачу.

Доцент кафедры управления и экономики здравоохранения Департамента политики и управления факультета социальных наук НИУ ВШЭ Ирина Петрова подняла вопрос о разделении ответственности врача. Она поддержала идею о праве пациента отказаться от применения ИИ в исследованиях и диагностике, отметила важность изучения проблемы субъектности ИИ, а также более детальной проработки этики и законодательства в сфере его использования в медицине.

Андрей Власов убежден, что ответственность за ошибки ИИ должен нести разработчик модели. Однако если модель рассчитывает вероятность и размер новообразования, а врач, доверившись ей, ставит ошибочный диагноз, юридический риск ложится на него и на систему здравоохранения в целом.

По его мнению, в диагностике и лечении заболеваний, угрожающих жизни человека, вероятность ошибок ИИ следует сокращать максимально. Для этого необходимо избегать галлюцинаций и отклонений в работе моделей, а также их отхода от целей, заданных человеком.

Ольга Пучкова подчеркнула, что точность моделей может быть условной, поскольку часто неясно, на каких данных они обучались — например, на крупных или мелких опухолях. В первом случае модель может демонстрировать высокую точность при диагностике крупных новообразований и «не замечать» слабо видимые. Датасеты должны быть открытыми: модель, обученная на данных жителей одного региона, будет хуже работать в другом. Нужны новые исследования, включающие изучение когнитивного взаимодействия врачей с ИИ.

Анастасия Углева подчеркнула, что привычка врача соглашаться с ИИ опасна для пациентов, поэтому у медика должно оставаться право вето — даже если алгоритм считается достаточно точным.

Завершая семинар, она отметила, что главное в применении искусственного интеллекта в медицине — не сами модели, а их взаимодействие с врачом и этичность принципов их применения, включая способность медиков критически оценивать выводы моделей, руководствуясь принципом «не навреди», а не стремлением снизить собственную нагрузку. Именно такие этические принципы позволяют избежать иллюзии гарантированной безопасности при применении ИИ в медицине.

Дата публикации: 03.08.2026

Автор: Павел Аптекарь

Будь всегда в курсе !
Подпишись на наши новости: