Обучение ИИ на сгенерированном контенте разрушает модели — исследование
Авторский контент по-прежнему в цене
Полгода назад мир узнал о ChatGPT, и сегодня интернет заполнен текстами и изображениями, которые были сгенерированы ИИ. Пока крупные языковые модели обучаются на материалах, созданных человеком. Но что, если на замену им придет синтетический контент?
Группа исследователей из Великобритании и Канады пришла к неутешительному выводу — использование сгенерированных данных для обучения вызывает необратимые дефекты в моделях.
Рассматривая распределение вероятностей в моделях, генерирующих текст и изображения, авторы заключили: «обучение на данных, произведенных другими моделями, вызывает коллапс модели — дегенеративный процесс, который с течением времени заставляет модели забывать истинное базовое распределение вероятностей… этот процесс неизбежен, даже в случаях с практически идеальными условиями для долгосрочного обучения».
«Со временем ошибки в сгенерированных данных накапливаются, и в конечном счете модели, которые на них учатся, все хуже воспринимают реальность. Нас поразило, как быстро происходит коллапс моделей: они могут быстро забыть большую часть оригинальных данных, на которых изначально обучались» — прокомментировал один из ведущих авторов исследования Илья Шумайлов.
Еще один автор исследования, профессор информационной безопасности Кембриджа и Эдинбургского университета Росс Андерсон, сравнил это с загрязнением: подобно тому, как в океанах скапливается пластик, а в атмосфере — углекислый газ, мы заполняем интернет бессмысленным контентом.
В результате обучать новые модели будет сложнее, что даст преимущество компаниям, которые уже это сделали, либо тем, кто управляет доступом к человеческим интерфейсам. И некоторые стартапы, отмечает он, уже берут данные для обучения в веб-архиве.
Как происходит коллапс модели
Проблема начинается, когда данные, которые генерируют модели ИИ, загрязняют обучающий датасет для последующих моделей.
«Оригинальные данные, созданные людьми, более честно представляют мир, поскольку содержат и невозможные данные. С другой стороны, генеративные модели склонны слишком хорошо учиться на популярных данных и зачастую не понимают или недостаточно представляют менее популярные» — объяснил Шумайлов.
В качестве примера он привел гипотетический сценарий, в котором модель обучается на наборе с изображениями 100 кошек, у 10 из которых голубой мех, а у 90 — желтый.
Модель не только запоминает, что желтые кошки больше распространены, но и представляет голубых кошек более желтыми, чем на самом деле. В итоге, когда модель просят создать новые данные, среди результатов появляется несколько зеленых кошек.
После нескольких последовательных циклов обучения оригинальный признак голубого меха размывается, становясь сначала зеленым и в конечном итоге желтым. Такое постепенное искажение и потеря миноритарных данных — это коллапс модели.
Чтобы его избежать, важно обеспечить, чтобы миноритарные данные были представлены справедливо — в плане количества и точности изображения. И это сложно, поскольку моделям непросто учиться на редких явлениях.
Читайте по теме:
К 2026 году данные для обучения языковых моделей ИИ могут быть исчерпаны — прогноз
Рынок генеративного ИИ вырастет в 30 раз на горизонте 10 лет — Bloomberg
Такое загрязнение данных создает искаженное восприятие реальности. Даже если модель учат не создавать слишком много повторяющихся результатов, коллапс все равно происходит, потому что модели дают ошибочные ответы, чтобы избежать повторов.
Илья Шумайлов отметил, что могут быть и более серьезные последствия, например дискриминация по полу, этнической принадлежности или иным чувствительным признакам.
Авторы исследования обнаружили, что если в последующих генерациях используется даже 10% оригинального контента, созданного людьми, «коллапс модели все равно происходит, просто не так быстро».
Как избежать проблемы
Исследователи предлагают два решения.
- Создать авторитетную копию, состоящую исключительно или условно из данных, созданных человеком, и не вносить в нее синтетический контент. Таким образом можно будет обучать модель на этих данных повторно или с нуля.
- Использовать в обучении новые чистые наборы данных, созданных человеком.
Однако для этого, отмечают авторы, нужен способ отличить синтетические данные — при помощи механизма массовой разметки, усилий разработчиков ИИ или тех, кто производит контент. Пока надежного или массового способа это сделать нет.
Последствия для отрасли и пользователей
Это тревожные новости для генеративного ИИ и компаний, которые хотят заработать на технологии. В то же время это означает, что контент, созданный людьми, будет еще ценнее, чем сейчас — хотя бы в качестве обучающих данных для искусственного интеллекта.
Полученные результаты имеют важные последствия для области ИИ и указывают, как важно улучшить методологию для поддержания целостности моделей в течение времени.
«Ясно, что коллапс моделей остается проблемой для машинного обучения, и с этим необходимо что-то сделать, чтобы генеративный ИИ продолжил совершенствоваться» — отметил Шумайлов.
Обложка снегерирована нейросетью Midjourney
-
Партнёрский материал Компании научились собирать данные. Принимать решения — нет: почему цифры не помогают сами по себе 21 июля 2026, 16:04
-
Технологии От ремонта радиоприёмников до глобальной платформы развлечений: история Sony 14 августа 2026, 19:24
-
Технологии От бумажной фабрики через падение мобильной империи к инфраструктуре для ИИ: история Nokia 11 августа 2026, 10:30
-
Технологии От торговли сушёной рыбой до смартфонов и микросхем: история Samsung 06 августа 2026, 09:02
-
Бизнес Собрать, разобрать, выжить: история LEGO 22 августа 2026, 10:00
-
Автомобили Электромобили, роботы и Илон Маск: история Tesla 21 августа 2026, 11:26
-
Бизнес Пришёл помочь — остался главным: история LVMH 19 августа 2026, 22:20
-
Бизнес От спора о будущем ИИ до большого бизнеса: история Claude 25 июля 2026, 17:00
-
Бизнес Tesla сворачивает проект Solar Roof — «солнечная черепица» от Илона Маска оказалась никому не нужна 21 августа 2026, 18:37
-
Технологии В России вышли умные часы HONOR Watch 6 — аксессуар работает до 35 дней без подзарядки и стоит 15 тыс. ₽ 21 августа 2026, 15:10
-
Искусственный интеллект Apple Music начнёт маркировать ИИ-музыку — нейротреки уже составляют уже 30% всех загрузок на сервисе 21 августа 2026, 14:39
-
Искусственный интеллект Нейросеть начнет читать переписки: в ChatGPT появился новый плагин, позволяющий связать нейросеть с iMessage и SMS 21 августа 2026, 12:16
-
Искусственный интеллект Wildberries запустил ИИ для анализа карточек товаров — нейросеть оценит заметность товара для покупателя 20 августа 2026, 15:00
-
Россия «Сикс-севен» стал самым популярным мемом в Рунете: за полгода фразу упомянули более 1 млн раз 21 августа 2026, 19:10
-
Маркетплейсы Маркетплейсы начнут принимать цифровые рубли — первыми новый способ оплаты протестируют Wildberries и Ozon 21 августа 2026, 16:00
-
Ритейл Lime вновь сменил генерального директора — уже третий раз за два года 21 августа 2026, 13:30