Выберите язык

    Новости

    Вежливость ИИ ещё не означает понимание

    Современный искусственный интеллект умеет отвечать так участливо, что порой возникает ощущение настоящего понимания. Он подбирает бережные слова, признаёт наши чувства и поддерживает разговор. Но способен ли он не только говорить об эмоциях, а действительно распознавать их по голосу и движениям?

    3 сентября 2026 года в журнале Scientific Reports были опубликованы результаты исследования Дэвида Питермана и его коллег, посвящённого способности генеративного ИИ распознавать невербальные проявления эмоций. Учёные проверили три мультимодальные модели семейства Gemini и сравнили их точность с результатами людей, выполнявших аналогичные задания.

    Моделям предлагали определить эмоции по коротким видеозаписям движений тела без изображения лица, а также по бессмысленным фразам, произнесённым с разной интонацией. Таким образом исследователи могли отдельно проверить, насколько хорошо ИИ понимает язык тела и эмоциональную окраску голоса, не опираясь на значение слов или выражение лица.

    Оказалось, что в некоторых заданиях современные системы уже приближаются к человеческим результатам, однако распознают эмоции крайне неравномерно. Положительные состояния они определяют лучше отрицательных — и именно там, где особенно важно заметить страх, боль или печаль, чаще возникают ошибки.

    Эмоции без слов и выражения лица

    Исследователи проверили три мультимодальные модели семейства Gemini — системы, способные анализировать не только текст, но также звук и видео.

    Им предлагали определить эмоцию по двум видам материалов. В одном случае это были короткие видеозаписи профессиональных актёров, снятых без лица: настроение передавалось исключительно позой и движениями тела. В другом — бессмысленные фразы, произнесённые с различной интонацией. Значение слов не могло подсказать ответ, поэтому оставались только тембр, высота голоса, ритм и другие особенности речи.

    Модели выбирали один вариант из шести предложенных. Их результаты сравнили с ответами участников более ранних исследований, на которых проверялись те же материалы.

    В распознавании эмоций по движениям тела люди справились лучше всех трёх систем. Наиболее совершенная из протестированных моделей подошла к человеческому результату довольно близко, но разница всё же сохранилась.

    С голосом картина оказалась иной: две новые модели показали примерно такую же точность, как люди. Правда, это не означает, что они безошибочно понимали интонацию. Правильный ответ и люди, и ИИ давали менее чем в половине случаев. Выраженные одним только голосом эмоции оказались непростой задачей для всех.

    Радость заметнее, чем страдание

    Самый интересный результат касался не общего количества правильных ответов, а характера ошибок.

    У людей точность распознавания положительных и отрицательных эмоций существенно не различалась. Модели ИИ, напротив, заметно лучше справлялись с положительными состояниями. Особенно отчётливо это проявилось при анализе движений тела.

    Возбуждение, заинтересованность, шутливость и доброжелательность системы определяли очень уверенно. С отрицательными переживаниями возникало больше путаницы: страх смешивался со стыдом, печаль — с отвращением, гнев — с неприязнью. Эмоцию, обозначенную исследователями как боль или душевная раненость, ни одна модель не смогла правильно распознать по движениям тела.

    Авторы называют эту особенность «позитивным смещением». Речь не о том, что ИИ испытывает оптимизм или сознательно старается видеть мир в лучшем свете. Модель не переживает увиденное так, как переживаем его мы. Она ищет в полученных данных закономерности, позволяющие выбрать наиболее вероятное название эмоции.

    Откуда возникло такое смещение, исследование не устанавливает. Возможно, положительные проявления были лучше представлены в данных, на которых обучались системы. Возможно, свою роль сыграла последующая настройка моделей, поощряющая доброжелательные и приемлемые ответы. Не исключено также, что отдельные отрицательные эмоции просто труднее отличить друг от друга по изолированным невербальным признакам.

    Убедительное сочувствие ещё не означает понимания

    Нам легко принять подходящий ответ за свидетельство того, что собеседник верно уловил наше состояние. В обычном общении это часто оправданно: слова, голос, паузы, выражение лица и история отношений дополняют друг друга. Но в разговоре с ИИ между впечатлением от ответа и способом его получения существует важное различие.

    Система может произнести: «Похоже, Вам сейчас очень тяжело», потому что хорошо знает языковые формы поддержки. Это ещё не доказывает, что она точно распознала тревогу в голосе, подавленность в позе или другое невербальное проявление неблагополучия.

    В дружеской беседе такая ошибка может остаться почти незаметной. Но значение результата меняется, когда ИИ предлагают использовать для психологической поддержки, дистанционного наблюдения за состоянием или помощи специалисту. Если система особенно хорошо замечает радость, но хуже различает боль, страх и печаль, внешняя доброжелательность может создавать преувеличенное ощущение её эмоциональной чуткости.

    Это не означает, что технологии распознавания эмоций бесполезны. Напротив, некоторые результаты показывают их быстрое развитие. Однако способность подобрать сочувственные слова и способность надёжно заметить чужое неблагополучие — не одно и то же.

    Что исследование пока не доказывает

    Эксперимент проводился в строго упрощённых условиях. Актёры намеренно изображали эмоции, причём достаточно ярко. Видео показывали движения без лиц, а аудиозаписи — голос без осмысленных слов. В настоящем разговоре все эти сигналы соединяются и зависят от ситуации, культуры, индивидуальной манеры выражать чувства и знакомства собеседников друг с другом.

    Кроме того, проверялись только три версии Gemini. Полученный результат нельзя автоматически переносить на все системы искусственного интеллекта — тем более что модели быстро обновляются. Формат с шестью готовыми ответами тоже гораздо проще свободного истолкования сложного эмоционального состояния.

    Поэтому работа не доказывает, что ИИ обязательно пропустит признаки тяжёлого состояния в реальном разговоре или причинит из-за этого вред. Она не исследовала пациентов, терапию либо последствия использования таких систем. В контролируемых условиях авторы обнаружили конкретную особенность распознавания, а её значение для реальной психологической помощи ещё предстоит проверить.

    Тем не менее исследование напоминает о важной границе. ИИ может очень убедительно воспроизводить язык участия, но убедительность не равна эмоциональному пониманию. Пока нам особенно нужна поддержка, лучше не считать тёплый ответ машины гарантией того, что она действительно заметила всё, что с нами происходит.

    РАССЫЛКА НОВОСТЕЙ И МАТЕРИАЛОВ

    Поиск