Как человечество пожертвовало свои знания ИИ
Он обучен на наших данных, взятых из сети
Случалось ли вам вести блог, создавать веб-страницу или болтать на форумах? Скорее всего, ваши слова были использованы для обучения чат-ботов. Это не только создает юридический казус, но и заставляет задуматься, как то, что мы оставили в сети, сформировало сегодняшний онлайн-мир.
Газета Washington Post изучила общедоступный набор данных, широко используемый для обучения алгоритмов, продемонстрировав, насколько современная индустрия ИИ полагается на 30-летний опыт интернет-публикаций.
Мы думали, что делимся своими сердцами и умами, и, конечно же, так оно и было. Но, сами того не осознавая, мы также создавали богатую, пусть и неполную, базу данных о человеческом самовыражении.
Поскольку такие визуальные инструменты, как Dall-E, Midjourney и Stable Diffusion, стали популярными еще до появления чат-ботов, создатели визуального контента — фотографы, иллюстраторы и художники — первыми осознали происходящее.
Читайте по теме:
Работы DALL-E — искусство или плагиат?
Netflix использовал ИИ для создания аниме и вызвал панику среди художников
Музыканты испытывают то же самое, наблюдая многочисленные копии своих работ, созданных ИИ, — как было с так и не состоявшейся на прошлой неделе коллаборацией Дрейка и The Weeknd.
Возможно, не все записывали песни или рисовали картинки, но большинство когда-нибудь писали что-то в интернете.
Проект Washington Post позволяет ввести любое доменное имя, чтобы узнать, использовалось ли оно в датасете для обучения ИИ и в какой степени. Отметим, что это не то же, что OpenAI использовала для ChatGPT, компания не раскрыла источники данных для обучения.
Команда Post выяснила, что набор данных содержал более полумиллиона личных блогов, что составляет 3,8% от общего количества токенов (отдельных языковых фрагментов) в данных. При этом публикации на проприетарных платформах социальных сетей, таких как Facebook*, Instagram и Twitter, не отображаются. Эти компании сохранили доступ к данным за собой.
Эти учебные базы данных огромны, но вряд ли репрезентативны. Некоторые культуры, группы и предметы представлены в выборке избыточно, а многие другие незаслуженно игнорируются. И все предубеждения, ограничения и токсичные аспекты интернет-культуры проявляются в данных обучения ИИ.
Найдя в списке свою работу, вы, вероятно, спросите себя: «Это то, чего я хотел?» и «Почему со мной не посоветовались?» и «Что, если бы я знал, что это произойдет?».
Потребность искусственного интеллекта в обучающих данных выставляет всю 30-летнюю историю популярного интернета в новом свете.
Сегодняшние прорывы в области ИИ не могли бы произойти без наличия цифровых хранилищ информации, идей и чувств, которые интернет побудил людей создавать.
Но мы создавали все это друг для друга, а не для обучения алгоритмов. С этой точки зрения появление этих массивов данных стало чрезвычайно важным побочным следствием возникновения интернета.
В 1995 году, когда одно поколение влюбилось в сеть и браузер, или десять лет спустя, когда другое поколение было увлечено блогами и «коллективной мудростью», этот результат не так бросался в глаза.
К началу 2010-х годов бурное развитие машинного обучения начала вызывать беспокойство у некоторых дальновидных экспертов. Но потребовалось очень пристальное внимание, чтобы понять, что вся сеть, возможно, вот-вот превратится в тренировочный материал для искусственного интеллекта.
Сегодня это непреднамеренное последствие занимает центральное место в нашем онлайн-опыте, напоминая нам о том, что все, что мы делаем прямо сейчас с искусственным интеллектом и для него, в свою очередь, будет формировать будущее так, как мы не можем предвидеть.
Например, если в общедоступных сетях появится множество имитаций, мы рискуем отбить у друг желание создавать собственные оригинальные работы и делиться ими. Это может привести к тому, что будущие модели искусственного интеллекта навсегда застрянут в 2000-2020 годах, и им не на чем будет учиться новому.
* Meta и входящие в нее Facebook и Instagram признаны экстремистскими организациями, деятельность которых запрещена в РФ.
Обложка и иллюстрация снегерированы нейросетью Midjourney
-
Партнёрский материал Компании научились собирать данные. Принимать решения — нет: почему цифры не помогают сами по себе 21 июля 2026, 16:04
-
Технологии От бумажной фабрики через падение мобильной империи к инфраструктуре для ИИ: история Nokia 11 августа 2026, 10:30
-
Технологии От торговли сушёной рыбой до смартфонов и микросхем: история Samsung 06 августа 2026, 09:02
-
Автомобили От гоночной команды до бизнеса на дефиците: история Ferrari 09 августа 2026, 09:53
-
Автомобили СССР, дефолт, уход Renault: история завода «Москвич» 07 августа 2026, 18:35
-
IT Как построить технологическую империю, когда против тебя весь рынок: история Huawei 03 августа 2026, 18:27
-
Бизнес От спора о будущем ИИ до большого бизнеса: история Claude 25 июля 2026, 17:00
-
IT От конкурента PlayStation до её поставщика: история Xbox 03 августа 2026, 00:07
-
Искусственный интеллект DeepSeek выпустила обновлённую модель V4 Pro — разработчики прокачали способности нейросети в программировании 13 августа 2026, 18:30
-
Искусственный интеллект Инвесторы Anthropic оценили компанию в $2 трлн перед IPO — размещение может стать крупнейшим в мире 13 августа 2026, 17:30
-
Бизнес Производитель чипов CXMT стал самой дорогой китайской компанией — бизнес оценили в $524 млрд 13 августа 2026, 17:10
-
Россия Госзаказчикам разрешили закупать электронику у зарубежных поставщиков — если российские компании не выполнят заказ 13 августа 2026, 20:00
-
Бизнес X5 опубликовала финансовые итоги за II квартал 2026 года: чистая прибыль компании упала почти на треть 13 августа 2026, 19:30
-
В России массово вырос спрос на костюмы Человека-паука — поводом послужил перенос показа одноименного фильма Marvel 13 августа 2026, 18:00
-
Автомобили Седан Volga C50 появится в бизнес-тарифе Яндекс Go — хотя модели нет в перечне авто, допущенных к работе в такси 13 августа 2026, 16:45
-
Искусственный интеллект Nvidia хочет привлечь до $500 млрд на развитие ИИ — для этого компания будет сотрудничать с Уолл-стрит 12 августа 2026, 15:00
