Категории Нейросети и ИИ

Генеративный ИИ портит наблюдения за птицами

Генеративный ИИ портит наблюдения за птицами

Исследователи предупреждают: генеративный ИИ уже мешает даже наблюдению за птицами. В свежем письме в Nature они описали, как поддельные и отредактированные изображения, а заодно и записи, размывают качество данных в гражданской науке — той самой, на которую опираются экологи и орнитологи.

Речь о платформах вроде iNaturalist, где любители отмечают, когда и где заметили тот или иной вид. Такие базы давно живут не как хобби-проекты. По ним смотрят ареалы, сезонные миграции, изменения численности. И вот тут проблема: если в массив всё чаще попадают картинки, сделанные нейросетью, доверие к данным начинает проседать вместе с их ценностью.

Авторы письма из Cornell и Manchester Metropolitan University пишут, что модераторы уже находят сгенерированные и усиленные ИИ изображения, но реальный масштаб пока неясен. И дело не только в орнитологии. То же самое работает в проектах по грибам, насекомым, растениям — везде, где снимок считается доказательством наблюдения.

Проблема усугубляется тем, что ИИ участвует и с другой стороны. Приложения для распознавания птиц, включая Merlin от Cornell Lab of Ornithology, сами используют машинное обучение: подсказывают вид по голосу, фото и месту наблюдения. Если в обучающие наборы попадает мусор, алгоритмы начинают путаться чаще. Потом ошибки пользователей снова летят в базы. И круг замыкается: плохие данные учат модели, а модели возвращают ещё больше плохих данных.

Генеративный ИИ в гражданской науке

Гражданская наука держится на очень простом обмене: человек увидел животное, отметил место, загрузил фото — и помог исследователям. Для больших проектов это не мелочь. Только один iNaturalist насчитывает десятки миллионов наблюдений, а похожие базы есть у наблюдателей за птицами, насекомыми и растениями по всему миру.

Читайте также:

Генеративный ИИ как раз хорошо подходит для имитации таких свидетельств. Он умеет делать правдоподобные кадры с редкими видами, менять фон у настоящей фотографии, подгонять детали под ожидаемый результат. Для модератора это уже отдельная работа: отличить подделку от плохого снимка и обычной ошибки становится куда сложнее.

У научных баз есть ещё одна слабая сторона. Их строили тогда, когда ложь там в основном была случайной: смазанный кадр, неверная подпись, перепутанный вид. Генеративный ИИ добавил к этому почти промышленный объём. По словам исследователей, речь уже не о единичных курьёзах, а о потоке контента, который способен тихо сдвигать статистику наблюдений.

Похожая история уже случалась с цифровыми архивами. Издатели и платформы сталкивались с массовыми фальшивыми изображениями в стоковых библиотеках, а научные журналы — с ростом числа сомнительных иллюстраций и графиков, созданных нейросетями. Но в гражданской науке ставка выше: сюда попадают записи, по которым потом делают выводы о миграциях, ареалах и состоянии популяций.

Самый неприятный эффект может проявиться не сразу. Даже если часть поддельных материалов потом вычистят, загрязнённые данные уже успеют попасть в подборки, на которых учатся новые модели и строятся аналитические инструменты. Тогда ошибка перестаёт быть разовой. Она накапливается, и каждый новый слой автоматизации только сильнее запутывает очистку.

Для платформ теперь вопрос уже не в том, попадёт ли туда ИИ-материал, а в том, хватит ли у модераторов и алгоритмов сил его вылавливать. Чем активнее такие базы используют на практике, тем дороже обходится одна поддельная фотография. Для любителя это может быть просто неудачный пост. Для науки — ещё одна ложная точка на карте вида.

Источник: Gizmodo
Опубликовано:
Елизавета Добровольская
Теги FEATURED_IMAGE: