Исследование: многие модели ИИ легко поддаются влиянию пропаганды

Недавние сравнительные тесты языковых моделей показывают, что способность искусственного интеллекта распознавать кремлевскую пропаганду сильно различается. На первый взгляд, лучшие модели кажутся надежными, но при преднамеренном манипулировании может оказаться, что некоторые из них также подвержены влиянию пропаганды.
Институт эстонского языка (EKI) проводит масштабное тестирование языковых моделей для оценки их надежности в эстонском языковом и информационном пространстве. На первом этапе исследования ученые изучили, как модели отвечают на вопросы по темам, которые Кремль использует в информационной войне. Результаты показывают, что следует проявлять осторожность при выборе искусственного интеллекта, поскольку неподходящая модель может начать распространять вводящую в заблуждение информацию.
Один из важнейших выводов исследования заключается в том, что реальные недостатки языковых моделей становятся очевидными только тогда, когда пользователь задает провокационный вопрос или ищет предвзятый контент. Многие модели тогда начинают повторять тезисы Кремля. Сотрудники EKI протестировали модели на эстонском, английском и русском языках. Лучшие модели в целом устойчивы к манипуляциям на всех языках, но в случае более дешевых и открытых моделей русский язык заметно слабее.
По словам руководителя программы отдела искусственного интеллекта EKI Кристера Круусмаа, это вызывает особую тревогу. Открытые модели вынуждены использовать те учреждения, которые не могут отправлять конфиденциальные данные в облачные сервисы. "Открытые модели – единственный вариант для многих учреждений, но в настоящее время они не отвечают потребностям информационного пространства Эстонии. Этот пробел требует внимания", – отметил он.
Круусмаа отметил, что на вершине рейтинга, как правило, находятся коммерческие модели от ведущих лабораторий, причем модели Anthropic показывают особенно хорошие результаты. "Для своей так называемой весовой категории модели Google Gemini, которые в остальном лидируют в распознавании эстонского языка и культуры, демонстрируют удивительно плохие результаты", – сказал он. Самые слабые результаты были у более старых моделей, таких как GPT-3.5, GPT-4o Mini и некоторых открытых моделей, таких как Llama, разработанная Meta, и Mistral, созданная во Франции.
Тест также показал, что на русском языке модели гораздо более восприимчивы к кремлевским нарративам. По словам Круусмаа, можно только предполагать, почему это так. По-видимому, большую роль играет большая доля предвзятого и пропагандистского контента в русскоязычных данных. Однако возможно также, что оптимизация или настройка моделей слишком ориентирована на английский язык.
Для лучших моделей, по словам Круусмаа, разница в результатах распознавания русского языка между эстонским и английским языками в основном находится в пределах статистической погрешности. Для более слабых моделей разница может достигать 15%, включая новейший флагманский Google Gemini 3.5 Flash.
Если использовать новейшую модель GPT или Claude, вероятность предвзятого ответа составляет несколько процентов. Однако у новейшей модели Gemini этот показатель составляет 15%, у лучшей модели Mistral – около 30%, а у оригинальной ChatGPT 2023 года (GPT-3.5) – 50%. "Стоит отметить, однако, что в тесте EKI языковые модели не могут использовать веб-поиск или другие подобные инструменты, поэтому модели могут вести себя несколько иначе внутри приложения", – отметил Круусмаа.
По словам директора EKI Арви Таваста, зарубежные фабрики политических троллей способны создавать фейковый контент, используемый для искажения моделей искусственного интеллекта. "Это опасная тенденция, и мы должны активно работать над тем, чтобы ситуация в Эстонии была сбалансированной", – сказал он.
Кристер Круусмаа отметил, что Российская Федерация систематически предпринимает усилия по искажению обучающих данных моделей. "Для этого они массово производят контент, предназначенный не для чтения людьми, а для роботов, которые сканируют интернет", – сказал он.
Однако эффективность этой деятельности во многом зависит от контрмер, принимаемых конкретным разработчиком, таких как фильтрация данных и осознанное внимание к проблеме на этапе согласования. Как показывают лучшие модели в тесте на сопротивление пропаганде, эта проблема на самом деле решаема, считает Круусмаа. Одна из целей исследования EKI также состоит в том, чтобы привлечь внимание разработчиков к пробелам в согласовании их моделей.
Критерий безопасности пропаганды был разработан в сотрудничестве с экспертами по дезинформации из организации Propastop, которые помогли выявить основные нарративы, связанные с деятельностью России по оказанию влияния, и чьи экспертные оценки обеспечили достоверность результатов.
Помимо безопасности, оценивается также качество эстонского языка
Сравнительный анализ эффективности моделей в плане защиты от пропаганды является частью более масштабного исследования. Помимо безопасности, EKI оценивает, насколько хорошо языковые модели справляются с эстонским языком и эстонским культурным пространством. До сих пор измерялись как языковые навыки моделей, так и их знание эстонской культуры. В случае с эстонским языком выяснилось, что уровень моделей неравномерен и со временем не сильно улучшился.
Некоторые новые модели даже хуже справляются с эстонским языком, чем их предшественники. По словам Круусмаа, крупным компаниям уделяется меньше внимания малым языкам. "В целом, целенаправленной работы над качеством эстонского языка не проводится, и даже если некоторые разработчики и делают это приоритетом, они все равно зависят от данных, которые есть в интернете. Сама Эстония еще не предоставила достаточного количества данных для обучения эстонскому языку", – отметил он.
EKI создал эталон для языковых моделей, который показывает, насколько хорош уровень крупных языковых моделей с точки зрения качества, знания и безопасности эстонского языка. Это практичный инструмент, обновляемый в режиме реального времени, помогающий как обычным пользователям, так и организациям принимать более обоснованные решения. Тестирование моделей будет продолжаться и в будущем. По мере появления новых моделей они постоянно тестируются, а результаты добавляются в эталонный набор данных. Осенью эталонный набор данных также будет дополнен результатами исследований в области медицины, права и безопасности детей и молодежи.
Эталонный набор данных для языковых моделей можно найти здесь: mõõpuu.eki.ee
Редактор: Надежда Берсенёва




















