КиберпанкДеталиТехнологии

Почему инструменты для распознания ИИ-контента породили «охоту на ведьм» и как Anthropic пытается решить эту проблему

Чат-бот Claude теперь самостоятельно займется маркировкой сгенерированных материалов. Это будет невидимый водяной знак, встраиваемый в текст, или подписанные метаданные — в случае с изображениями. Так в Anthropic повышают прозрачность контента, созданного с помощью искусственного интеллекта — как раз в то время, когда в соцсетях и академическом сообществе разгорается новая «охота на ведьм»: люди регулярно обвиняют друг друга в использовании нейросетей.

Водяные знаки в текстах Claude: как это работает

Anthropic внедрила в Claude инструмент для «незаметной маркировки ИИ-контента», выяснил Business Insider. Все новые версии нейросети, выпущенные со 2 августа, будут поддерживать эту функцию с момента релиза. Более того, разработчики изучают возможность добавления инструмента в ранние модели. Так компания выполняет требования по повышению прозрачности контента, созданного искусственным интеллектом, — в рамках законодательства Европейского союза.

Предполагается, что невидимые водяные знаки будут встраиваться в сгенерированный текст. Это не повлияет на смысл и читаемость текста, утверждают в Anthropic. Маркировка сохраняется при копировании и в некоторых случаях после редактирования материала. При этом в компании отмечают: наличие метки — еще не доказательство того, что Claude был первоначальным автором материала. Пользователь мог обратиться к ИИ за переводом, редактурой или пересказом.

Фото: Kaitlyn Baker / Unsplash

Для файлов, созданных Claude (речь в первую очередь про изображения в форматах PNG, JPG, SVG и других), будут использоваться подписанные метаданные на основе открытого стандарта C2PA. Этот инструмент также сработает, если файл обрабатывался или подвергался изменениям с помощью ИИ. Anthropic планирует предоставить третьим сторонам (пользователям и сторонним организациям) инструменты для обнаружения маркировки.

Почему детекторы ИИ-контента обвиняют в неточности и предвзятости

Anthropic меняет политику как раз в то время, когда в Сети и академическом сообществе разворачивается «охота на ведьм» нового времени. Например, в конце июля издательство Minotaur отказалось от публикации рукописи дебютного романа американского писателя Джерри Фалейда «Позвони мне, я спрячу тело» — из-за опасений, что автор мог использовать искусственный интеллект (сам он это категорически отрицает). Так сорвалась крупная сделка в $2 млн. А гражданин Франции Тьерри Риньоль недавно подал в суд против одного из американских вузов — после того, как профессор обвинил его в написании выпускного экзамена с помощью нейросетей. Студент считает, что его необоснованно отстранили от занятий на год, а причина всему — «технологии, нацеленные против людей, не являющихся носителями английского языка».  

Дело в том, что учителя освоили инструменты для распознания контента, сгенерированного искусственным интеллектом, так же быстро, как школьники и студенты освоили ChatGPT, Gemini и Claude. Опрос, проведенный специалистами Center for Democracy and Technology, показал: 43% преподавателей 6–12 классов в США регулярно используют такие ИИ-детекторы, а школьные округа тратят на них тысячи долларов — несмотря на многочисленные исследования, доказывающие, что эти инструменты все еще далеки от абсолютной точности и надежности. 

Популярные ИИ-детекторы — GPTZero, Pangram, Turnitin и другие — оценивают вероятность того, что материал создан нейросетью (в процентах от 0% до 100%). Эксперты объясняют, что такие сервисы обучены выявлять закономерности, которые могут указывать на «присутствие» ИИ — например, повторяющиеся термины и фразы, слишком формальное или, наоборот, неформальное звучание, бессмысленные обороты и сравнения, повторяющуюся структуру предложений. Некоторые из них измеряют «непредсказуемость» текста: считается, что искусственный интеллект, как правило, выбирает наиболее очевидный вариант из возможных. Но все это довольно субъективно — у человека может быть просто такой стиль письма, отмечает The Verge. 

Разработчики признают вероятность «ложных срабатываний». Так, в Pangram приводят следующее соотношение: 1 ошибка к 10 тыс. верных результатов. В Turnitin утверждают, что их ИИ-детектор совершает ошибки в менее чем 1% случаев. Тем не менее на сайте проекта значится: «Наш алгоритм распознавания не всегда может быть точным, поэтому его не следует использовать в качестве единственного основания для санкций в отношении студента». В GPTZero предупреждают: «Ни один ИИ-детектор не может быть совершенным на 100%»

Исследования показывают, что системы распознавания демонстрируют технические недостатки и сбои. Журналисты The Washington Post провели эксперимент с участием пяти старшеклассников и сделали вывод: Turnitin, которым пользуются 2,1 млн учителей, ошибается в 50% случаев. Тем не менее преподаватели продолжают полагаться на детекторы. NPR рассказывает историю 17-летней отличницы Алисы Остовиц: девушку обвинили в использовании искусственного интеллекта и понизили ей оценку, отказавшись провести повторную проверку. Теперь она тоже использует ИИ-детекторы. 

Я все делаю и пишу сама, но потом прогоняю через детекторы и переписываю предложения, которые ПО идентифицирует как сгенерированные ИИ. Я трачу на это дополнительные полчаса к каждому заданию. Но я просто не хочу больше рисковать. 

Алиса Остовиц 

Проблема еще и в том, что алгоритмы «маркируют» как ИИ нейроотличных учащихся (с аутизмом, СДВГ, дислексией и так далее) и тех, для кого английский — второй язык: у таких студентов ниже показатели по сложности и разнообразию формулировок. В рамках одного из исследований алгоритмы ошибочно определили как «сгенерированные ИИ» 61,2% эссе иностранцев, написанных для экзамена TOEFL. Использование таких детекторов рушит инклюзивную среду обучения и нарушает языковое разнообразие, говорят эксперты. 

Как еще в школах и вузах борются с ИИ 

Многие американские преподаватели сами говорят, что к ИИ-детекторам стоит относиться с осторожностью: если инструмент показывает вероятность генерации выше 50%, стоит копнуть глубже — узнать у студента, сколько времени он потратил на выполнение задания и сколько правок вносил в процессе. Только в таком случае можно делать выводы и проводить соответствующие беседы.

Ряд вузов уже полностью отказались от использования любых средств распознавания ИИ-контента. В этом списке Университет Джонса Хопкинса, Джорджтаунский университет и Массачусетский технологический институт (MIT). В последнем безапелляционно утверждают: «Детекторы искусственного интеллекта попросту не работают»

Эксперты указывают и на еще одну проблему: нередко распознаватели ИИ-текста принимают сгенерированный материал за «человеческий». Дело в том, что студенты научились обходить детекторы — они перефразируют слишком «машинные» фрагменты, добавляют эмоции и синонимы, меняют структуру. Или просто — используют другие нейросети, созданные специально для того, чтобы сделать текст более «человеческим» (Writesonic, UndetectableAI и другие). 

Можно обойти любой ИИ-детектор. Достаточно просто сломать безошибочность сгенерированного текста или нарушить шаблон. Мне, например, в 80–90% случаев удается обмануть детектор, просто добавив одно-единственное слово cocky («Дерзкий». — Прим. ред.). Потому что для ИИ это слишком чувствительный термин (Сock на сленге обозначает мужской половой орган. — Прим. ред.).

Кэт Кейси
директор по развитию ИИ-платформы Reveal Brainspace 

С учетом всех аргументов против ИИ-детекторов преподавателей призывают переосмыслить подход к обучению. Например, Чикагский университет постепенно отказывается от длинных письменных заданий и проводит больше очных презентаций и устных обсуждений. MIT рекомендует профессорам предоставлять студентам возможность самостоятельно сообщать, использовали ли они ИИ для выполнения работы — без каких-либо штрафных санкций. А власти Дании из-за массового использования нейросетей и вовсе вводят для старшеклассников обязательную устную защиту экзаменационных работ.

Как понять, что текст написан ИИ на русском языке

Лингвисты и филологи в России постепенно анализируют закономерности и выявляют конструкции, которые чаще всего встречаются в текстах, сгенерированных искусственным интеллектом. 

Текст, созданный искусственным интеллектом, лишен индивидуальности, эмоциональности. Он содержит лишь общие, часто шаблонные фразы, известные сравнения, смысловые повторы, имеет четкую структуру. В этом смысле читать его скучно, глаза проскальзывают по строкам, глаз не цепляется за речевые неточности. 

Андрей Григорьев
доктор филологических наук, и.о. заведующего кафедрой общего языкознания имени И.Г. Добродомова МПГУ

Есть несколько базовых «примет», на которые эксперты советуют обращать внимание. В первую очередь — разделение на подпункты при каждом удобном случае: нейросети любят структуру «подзаголовок + краткое пояснение», а также списки под буллитами. Часто ИИ использует вводные конструкции («коротко суть такая: …», «главный вывод: …», «и самое интересное: …») и частицы «вот», «здесь», «это» («вот описание: …», «здесь примерный перевод…»). В целом предложения в сгенерированных текстах схожи по структуре и монотонны, встречаются конструкции вроде «Это не про то, чтобы… Это про то, чтобы…» и «Это не просто…, а…»

Фото обложки: Kaitlyn Baker / Unsplash 

Копировать ссылкуСкопировано