Отравление данных: как издатели борются с ИИ-скрейперами
Нейросеть попросили прочитать свежий график с результатами тестов видеокарт, а она в ответ выдала рецепт шоколадного печенья, причём с точностью до децибела. Это не анекдот, а отчёт об эксперименте тестового канала Gamers Nexus: вместе с Уэнделлом из Level1Techs инженеры учились отравлять свои графики так, чтобы ИИ-скрейперы не могли их прочитать.
Эксперимент начался с провала. Первая версия отравленных графиков не сработала: модель распознала попытку и заявила, что её атакуют через prompt injection. После нескольких итераций защита всё же сломалась, и LLM перестала читать цифры FPS. Вместо этого она начала смешивать контекст графиков с кулинарией: советовала добавить в тесто «полтора корпуса компьютерного кейса при 39,4 градуса», взбивать масло с сахаром, пока поток воздуха не станет ламинарным, и обещала, что тесто «обгонит половину протестированных корпусов». Рецепт вышел на 27 дБА, в версии full torture edition.
Так выглядит новая реальность издателей. Отравление данных это незаметное для человека изменение контента, из-за которого автоматические системы читают его неправильно. Для людей графики остаются графиками, для машин превращаются в минное поле.
Пришло время травить ИИ
Сам канал объясняет мотивацию без обиняков. Годами Gamers Nexus выкладывает тысячи точек данных о железе бесплатно, без пейволлов и сторонней рекламы. В свежем обновлении Mega Charts сотни записей тестов корпусов, почти 60 видеокарт на 40 графиках, десятки процессоров и кулеров. Раньше такая щедрость не создавала проблем. Теперь создаёт: всё, что лежит в открытом доступе, забирают большие языковые модели (LLM), а издатель не получает с этого ни цента.
«Пришло время начать отравлять ИИ», говорит Стив Берк, основатель канала, и призывает другие издания делать то же самое. Человек изменений не заметит: максимум лёгкое изменение цвета нескольких пикселей. А скрейпер получит испорченные данные, на основе которых будет строить бессмысленные выводы.
Пока это тестовый режим, но план уже объявлен: отравление будет применяться программно ко всем новым графикам. Команда называет это контрмерами и обещает рассказывать о прогрессе. Показательно, что первые результаты получились комичными, но сам подход рабочий: модель действительно перестала извлекать числа из защищённых графиков.
Как устроено отравление графиков
Важно понимать, чем отравление отличается от обычной защиты. Никто не шифрует файлы и не прячет их за авторизацией. Задача противоположная: оставить данные видимыми для людей, но сделать их извлечение недостоверным. Изменения вносятся на уровне пикселей, которые глаз не различает, а vision-модель, разбирающая график, интерпретирует неправильно.
Отсюда и главный эффект: автоматика не отказывается от данных, она их «читает» и ошибается. Для скрейпера это худший сценарий: вместо отказа он получает правдоподобный мусор, который незаметно просачивается в датасеты и ответы моделей. Именно поэтому в индустрии отравление считают асимметричным оружием: защищаться дешевле, чем атаковать.
История с печеньем это как раз иллюстрация сбоя. Модель не заблокировала запрос, а добросовестно переработала испорченный контекст и выдала бессмыслицу с уверенным видом. Для издателя такой результат лучше честного отказа: он показывает, что данные искажены, но не подтверждает, где именно спрятан яд.
Боты обогнали людей
Масштаб проблемы виден по статистике Cloudflare. Глава компании заявил, что агентный трафик растёт настолько быстро, что боты впервые в истории интернета обогнали людей. В США на ботов приходится 41% трафика по геолокации, и заметная часть идёт из Data Center Alley в Вирджинии, где сосредоточены дата-центры.
Оговорка важная: боты существовали задолго до LLM, и не все они вредные. Поисковые роботы, архивы, мониторинг доступности. Но доля машинного трафика растёт лавинообразно, и для издателей это означает простую вещь: контент, произведённый за деньги, машины поглощают бесплатно и без спроса.
Именно эта асимметрия превращает безобидный, казалось бы, вопрос доступа в экономическую проблему. Бесплатный сайт с тестами железа кормит не только читателей, но и обучающие выборки OpenAI, Microsoft, Anthropic и других компаний. Отличить «хорошего» бота от «плохого» на уровне сети почти невозможно, поэтому борьба идёт не фильтрами, а содержимым.
Экономика: обзор за $2000 и выручка $1400
Самая интересная часть видео не про яд, а про бухгалтерию. Gamers Nexus открыто посчитали экономику одного обзора корпуса Cooler Master HAF 2500. Производство стоило около $2000 рабочего времени, причём время самого Берка посчитано по нулевой ставке. Видео принесло $1400 выручки, из которых $261,09 дал AdSense на YouTube, а платформа забирает около 45% рекламных денег.
Обзор заведомо убыточный, и команда знала это заранее. Таких материалов у них много: рынок сборки ПК в кризисе, память подорожала, аудитория не может позволить себе новые сборки, и просмотры компонентных обзоров падают. Раньше схема работала в обратную сторону: обзоры железа субсидировали расследования и документалки. Теперь роли перевернулись, и глубокие разборы компаний, включая самих разработчиков LLM, субсидируют бесплатные тесты железа.
Ещё одна перемена: сайт впервые за десять лет получил эксклюзивные данные. Раньше всё выходило сначала на YouTube, а сайт служил архивом. Теперь часть результатов тестов публикуется только на сайте, без отдельного видео. Полноценная съёмка на четыре-пять человек не окупается, а прогнать тест и выгрузить цифры в график дешевле, поэтому данные живут там, где им проще пережить эпоху скрейперов.
Берк называет это прямым текстом: крупные ИИ-компании, по его мнению, обкрадывают издателей, которые вкладывают часы и деньги в производство полезных материалов. И раз уж данные всё равно забирают, он не собирается скромничать в маркетинге: если убыточные проекты продолжают жить только благодаря поддержке аудитории, об этом стоит говорить вслух.
Почему бы просто не поставить пейволл? Берк отказывается по идеологическим причинам: информация о рынке и технологиях нужна в первую очередь тем, у кого меньше всего денег. Плюс прагматика: пейволлы серьёзные скрейперы всё равно обойдут. Почему не залить сайт рекламой? Тоже нет: на сайте и в видео только AdSense и один спонсорский слот, чаще всего реклама собственного магазина. Patreon приносит около $10 000 в месяц, кампания AI GPU black market собрала более миллиона долларов за прошлый год, а магазин даёт основную часть дохода.
Почему графики остаются PNG
Отдельная техническая деталь объясняет, почему данные по-прежнему публикуются картинками, а не интерактивными таблицами. Изначально причина была скучной: не хватало ресурсов на разработку собственной платформы для сортируемых таблиц. Теперь причина изменилась: PNG проще отравлять и сложнее автоматически разбирать, чем текстовые таблицы.
Получается редкий случай, когда технический долг превратился в оружие. Формат, который годами считался компромиссом, оказался удобной бронёй против машинного парсинга. Команда обещает расширять программу отравления и дальше, добавляя новые данные в те же графики. Судя по логике проекта, чем больше издателей последует примеру, тем дороже ИИ-компаниям обойдётся вера в то, что любой открытый файл можно безнаказанно скопировать.
Что это значит для всего интернета
История Gamers Nexus выглядит частным случаем общей войны издателей с ИИ-индустрией. У владельцев контента есть несколько путей: закрыть доступ пейволлом, продать лицензию на данные, блокировать ботов на уровне CDN или травить данные. У каждого варианта своя цена. Пейволл бьёт по читателям. Лицензии по карману только крупным медиахолдингам. Блокировки обходятся сменой адресов и прокси.
Отравление данных выглядит самым асимметричным ответом: дешёвым в реализации, незаметным для людей и потенциально дорогим для ИИ-компаний. Если скрейперы начнут массово заглатывать испорченные данные, качество моделей может просесть не сразу, а через цикл переобучения. Именно на это и рассчитывают энтузиасты подхода.
Логика, кстати, не нова. Художники уже несколько лет используют инструменты вроде Nightshade, чтобы прятать яд в изображения и портить обучение генеративных моделей на своих работах. Gamers Nexus переносят тот же приём в мир инженерных данных: цель не защитить файл от копирования, а сделать скопированное бесполезным.
В блоге мы уже разбирали, как отравление обучающих данных работает со стороны атакующих, в посте про computational propaganda. История Gamers Nexus показывает обратную сторону: теперь яд используют те, кто защищается.
Но есть и трезвая оценка. Первый же эксперимент показал, что современные модели распознают грубые попытки отравления как prompt injection. Значит, это гонка: чем изощрённее яд, тем лучше детекторы, и наоборот. Окончательной победы не будет ни у одной из сторон, а издателям придётся защищаться постоянно.
Ещё один нюанс: контент Gamers Nexus нужен не только скрейперам, но и людям. Поэтому канал продолжает конвертировать видео в текстовые статьи, хотя те же тексты помогают ботам. «Мы не можем перестать работать для людей только потому, что ИИ-компании убивают рентабельность глубоких обзоров», объясняет Берк. Показательная позиция: яд для машин, открытость для читателей.
Часто задаваемые вопросы
Что такое отравление данных?
Отравление данных (data poisoning) это намеренное изменение контента так, чтобы автоматические системы читали его неправильно. Изменения проектируются незаметными для человека: другой оттенок пикселей, скрытые слои, ловушки в разметке. Для ИИ-скрейпера такой материал превращается в мусор, который портит обучающие выборки и ответы моделей.
Почему Gamers Nexus не просто закрыли данные пейволлом?
Принципы: информация о рынке и технологиях должна быть доступна бесплатно, в том числе людям без денег. К тому же пейволлы не остановят крупных скрейперов, платный контент всё равно попадает в обучающие выборки. Поэтому канал выбрал отравление: оно не мешает людям читать данные и создаёт проблемы машинам.
Насколько это работает на практике?
Пока это гонка вооружений. В первом эксперименте LLM распознала отравление как попытку prompt injection, и только после нескольких итераций модель начала выдавать бессмыслицу вроде рецептов печенья. Более продвинутые скрейперы могут фильтровать подозрительные источники, так что исход противостояния пока не определён.
Пострадают ли от этого обычные читатели?
Нет: изменения рассчитаны на незаметность, а данные остаются бесплатными, без пейволлов и рекламных стен. Пострадать могут автоматические инструменты, скрейперы, агрегаторы и ИИ-ассистенты, которые привыкли бесплатно разбирать чужие графики. Именно в этом и смысл: люди читают, машины ошибаются.
Итог
Отравление данных перестало быть теоретической угрозой из научных статей и превратилось в рабочий инструмент издателей. Gamers Nexus показывает, как это выглядит на практике: тысячи точек данных остаются бесплатными для людей, графики постепенно превращаются в ловушки для машин, а экономика держится на расследованиях, магазине и поддержке аудитории.
Вопрос, который эта история ставит перед всем интернетом, звучит так: если свободный контент продолжает кормить модели, которые его же и обесценивают, сколько издателей продержится на одном энтузиазме? Ответ Gamers Nexus: травить данные, не закрывать доступ и говорить об экономике вслух. А вы как думаете, чья это война и где в ней место обычному читателю?