Обучение ИИ на сгенерированном контенте разрушает модели — исследование
Авторский контент по-прежнему в цене
Полгода назад мир узнал о ChatGPT, и сегодня интернет заполнен текстами и изображениями, которые были сгенерированы ИИ. Пока крупные языковые модели обучаются на материалах, созданных человеком. Но что, если на замену им придет синтетический контент?
Группа исследователей из Великобритании и Канады пришла к неутешительному выводу — использование сгенерированных данных для обучения вызывает необратимые дефекты в моделях.
Рассматривая распределение вероятностей в моделях, генерирующих текст и изображения, авторы заключили: «обучение на данных, произведенных другими моделями, вызывает коллапс модели — дегенеративный процесс, который с течением времени заставляет модели забывать истинное базовое распределение вероятностей… этот процесс неизбежен, даже в случаях с практически идеальными условиями для долгосрочного обучения».
«Со временем ошибки в сгенерированных данных накапливаются, и в конечном счете модели, которые на них учатся, все хуже воспринимают реальность. Нас поразило, как быстро происходит коллапс моделей: они могут быстро забыть большую часть оригинальных данных, на которых изначально обучались» — прокомментировал один из ведущих авторов исследования Илья Шумайлов.
Еще один автор исследования, профессор информационной безопасности Кембриджа и Эдинбургского университета Росс Андерсон, сравнил это с загрязнением: подобно тому, как в океанах скапливается пластик, а в атмосфере — углекислый газ, мы заполняем интернет бессмысленным контентом.
В результате обучать новые модели будет сложнее, что даст преимущество компаниям, которые уже это сделали, либо тем, кто управляет доступом к человеческим интерфейсам. И некоторые стартапы, отмечает он, уже берут данные для обучения в веб-архиве.
Как происходит коллапс модели
Проблема начинается, когда данные, которые генерируют модели ИИ, загрязняют обучающий датасет для последующих моделей.
«Оригинальные данные, созданные людьми, более честно представляют мир, поскольку содержат и невозможные данные. С другой стороны, генеративные модели склонны слишком хорошо учиться на популярных данных и зачастую не понимают или недостаточно представляют менее популярные» — объяснил Шумайлов.
В качестве примера он привел гипотетический сценарий, в котором модель обучается на наборе с изображениями 100 кошек, у 10 из которых голубой мех, а у 90 — желтый.
Модель не только запоминает, что желтые кошки больше распространены, но и представляет голубых кошек более желтыми, чем на самом деле. В итоге, когда модель просят создать новые данные, среди результатов появляется несколько зеленых кошек.
После нескольких последовательных циклов обучения оригинальный признак голубого меха размывается, становясь сначала зеленым и в конечном итоге желтым. Такое постепенное искажение и потеря миноритарных данных — это коллапс модели.
Чтобы его избежать, важно обеспечить, чтобы миноритарные данные были представлены справедливо — в плане количества и точности изображения. И это сложно, поскольку моделям непросто учиться на редких явлениях.
Читайте по теме:
К 2026 году данные для обучения языковых моделей ИИ могут быть исчерпаны — прогноз
Рынок генеративного ИИ вырастет в 30 раз на горизонте 10 лет — Bloomberg
Такое загрязнение данных создает искаженное восприятие реальности. Даже если модель учат не создавать слишком много повторяющихся результатов, коллапс все равно происходит, потому что модели дают ошибочные ответы, чтобы избежать повторов.
Илья Шумайлов отметил, что могут быть и более серьезные последствия, например дискриминация по полу, этнической принадлежности или иным чувствительным признакам.
Авторы исследования обнаружили, что если в последующих генерациях используется даже 10% оригинального контента, созданного людьми, «коллапс модели все равно происходит, просто не так быстро».
Как избежать проблемы
Исследователи предлагают два решения.
- Создать авторитетную копию, состоящую исключительно или условно из данных, созданных человеком, и не вносить в нее синтетический контент. Таким образом можно будет обучать модель на этих данных повторно или с нуля.
- Использовать в обучении новые чистые наборы данных, созданных человеком.
Однако для этого, отмечают авторы, нужен способ отличить синтетические данные — при помощи механизма массовой разметки, усилий разработчиков ИИ или тех, кто производит контент. Пока надежного или массового способа это сделать нет.
Последствия для отрасли и пользователей
Это тревожные новости для генеративного ИИ и компаний, которые хотят заработать на технологии. В то же время это означает, что контент, созданный людьми, будет еще ценнее, чем сейчас — хотя бы в качестве обучающих данных для искусственного интеллекта.
Полученные результаты имеют важные последствия для области ИИ и указывают, как важно улучшить методологию для поддержания целостности моделей в течение времени.
«Ясно, что коллапс моделей остается проблемой для машинного обучения, и с этим необходимо что-то сделать, чтобы генеративный ИИ продолжил совершенствоваться» — отметил Шумайлов.
Обложка снегерирована нейросетью Midjourney
-
Партнёрский материал Онлайн-инкассация: как превратить наличную выручку в рабочий капитал 01 июня 2026, 10:00
-
Автомобили От ткацкого станка до Prius: история Toyota 22 июля 2026, 15:24
-
Игры От нишевой RPG до глобальной франшизы: история Fallout пережила крах создателей и гнев фанатов 21 июля 2026, 20:30
-
Игры Миллиарды долларов на чужих играх: история Valve 21 июля 2026, 11:48
-
Игры Как техническая ошибка превратилась в бизнес на миллиарды: история GTA 20 июля 2026, 15:35
-
IT От книжного магазина в гараже до облака и ИИ: история Amazon 19 июля 2026, 12:35
-
Бизнес Как поисковая строка превратилась в бизнес на $400 млрд: история Google 18 июля 2026, 18:00
-
Бизнес Компания, которая редко изобретала первой: история Apple 18 июля 2026, 10:40
-
Технологии Samsung представила новое поколение Galaxy Z Fold8 в двух версиях: базовую модель с широким экраном и тонкую Ultra 22 июля 2026, 18:23
-
IT Яндекс Музыка запустила «Мою волну на двоих» — ИИ-алгоритмы создают общий плейлист для двух пользователей 22 июля 2026, 13:51
-
Автомобили Россияне стали на 43% чаще интересоваться американскими автомобилями: информацию об отечественных марках ищут реже 23 июля 2026, 08:00
-
Маркетплейсы «Более 88 тыс. селлеров получат первые начисления»: Татьяна Ким — о выплатах пострадавшим продавцам Wildberries 22 июля 2026, 21:00
-
Автомобили Эксперты считают маловероятной отмену утильсбора до 2030 года — из-за рисков для отечественных автопроизводителей 22 июля 2026, 21:00
-
Банки Прибыль Сбера за II квартал 2026-го оценили в 500 млрд ₽ — это почти на 20% больше, чем годом ранее 22 июля 2026, 20:00
-
Кибербезопасность Минцифры представило доктрину по борьбе с киберпреступлениями — в стране появится единая база данных о мошенниках 22 июля 2026, 17:07
-
Россия Хостинг-провайдеры просят сохранить отдельный способ верификации для иностранных клиентов — через банковский платеж 20 июля 2026, 21:00