18+
реклама
18+
Бургер менюБургер меню

Матвей Демчук – Slop (страница 2)

18

Это был типичный вопрос для семи утра. До первого кофе.

Лифт в здании был сломан третью неделю подряд. Клара поднималась пешком, привычно считая ступени. Сто двадцать три. Именно столько нужно сделать шагов, чтобы добраться до рабочего места. Сто двадцать три шага от улицы до реальности.

Хотя что такое реальность — это был другой вопрос. Тоже на семь утра.

В офисе она была первой, как обычно. Открыла ноутбук, включила свою систему мониторинга — набор самодельных скриптов, которые она писала два года, постепенно, добавляя новые функции по мере того, как понимала, что именно она ищет. Система называлась LENS. Linguistic ENtropy Sensor. Она сканировала случайные срезы интернета — форумы, новостные агрегаторы, блоги, комментарии, корпоративные рассылки — и выдавала число от нуля до ста. Ноль — это чистая энтропия, случайный шум, никакой структуры. Сто — идеальный порядок, текст как машина. Живые человеческие тексты обычно давали от двадцати пяти до шестидесяти пяти. Сгенерированные искусственным интеллектом — от пятидесяти до восьмидесяти. Это было правило. Хорошее, надёжное правило.

В то утро все метрики зашкаливали.

Клара несколько секунд смотрела на экран, ожидая, что число изменится. Оно не изменилось. Девяносто один. Потом девяносто три. Потом девяносто семь. Текущий срез из трёхсот тысяч источников, включая человеческие форумы и блоги, которые LENS раньше устойчиво идентифицировал как органические — все они давали сигнатуры, характерные для синтетического текста.

Она перезапустила систему. Подождала. Снова проверила.

Девяносто восемь.

«Хорошо, — сказала она вслух, и голос прозвучал неожиданно громко в пустом офисе. — Что-то сломалось.»

Но ничего не было сломано. Она это знала ещё до того, как начала проверять. Двухлетний опыт работы с системой давал ощущение — не знание, а именно ощущение, почти телесное, — когда LENS галлюцинировал из-за технической ошибки и когда говорил правду. Сейчас он говорил правду.

Клара налила себе кофе, вернулась к столу и начала рыть глубже.

* * *

Первое, что она сделала — запустила ручную выборку. Открыла двадцать случайных ссылок из сегодняшнего среза. Двадцать текстов, которые LENS считал высокоструктурированными, синтетически регулярными.

Один был с форума о садоводстве. Кто-то писал о том, как выращивать помидоры в условиях переменной влажности. Текст звучал… нормально. Слегка вежливо, слегка информационно, но в пределах нормы. Клара начала читать внимательнее и через минуту остановилась.

Она уже читала этот текст.

Не этот конкретный — другой. Три недели назад, в другом срезе, с другого форума о кулинарии. Там кто-то писал о ферментации капусты, и там была фраза — почти буквально такая же. «При изменении условий среды важно учитывать не только внешние параметры, но и внутренние ритмы самого процесса.»

Это была не цитата. Это была структура. Паттерн. Способ строить предложение.

Клара открыла второй текст. Он был с новостного сайта, освещающего местные выборы в Канзас-Сити. Репортаж о дебатах. Потом открыла третий — о разработке нового антибиотика. Четвёртый — рецензию на фильм. Пятый — комментарий под видео о починке велосипедного колеса.

Разные темы, разные стили, разные авторы. Одна структура.

Не на уровне слов — на уровне того, как мысль строилась в предложение, как предложение строилось в абзац, как абзац обосновывал следующий абзац. Одна ритмическая основа, как метроном под разной музыкой. Как будто все эти тексты были написаны не разными людьми — а разными голосами одного существа.

Клара закрыла ноутбук, встала, подошла к окну.

Внизу художник рисовал свою спираль. Мисс-стрит просыпалась: развозчик на электровелосипеде, голуби у мусорных баков, женщина с собакой, старик с кофе в руках, стоящий посреди тротуара и смотрящий в телефон с выражением человека, который читает плохие новости.

«Всё нормально, — сказала Клара окну. — Скорее всего, это статистический артефакт. Я просто устала.»

Окно ничего не ответило. Она вернулась к столу.

* * *

К полудню приехали остальные. Lighthouse AI был небольшой командой — восемь человек. Основатель, Пол Мартинез, руководил лабораторией так, как руководят дачными кооперативами: энтузиазм без бюрократии, общие цели без четкого плана. Все любили Пола именно за это. И за кофемашину итальянского производства, которую он купил на собственные деньги.

— Доброе утро! — сказал Пол, появившись ровно в 10:15. — Что-нибудь интересное?

— Возможно, — сказала Клара.

Это означало «да». Все в лаборатории это знали.

Пол налил себе эспрессо, подошёл к её столу, посмотрел на экран.

— Что это?

— LENS даёт девяносто восемь по всем органическим источникам начиная с нуля часов по UTC. — Клара повернула к нему ноутбук. — Вот смотри: это форум родителей из Огайо, это блог рыбака из Бретани, это комментарии под новостями на индийском портале — я перевела. Разные языки, разные культуры, разные темы. Одна сигнатура.

Пол изучал экран несколько секунд с выражением человека, который хочет найти простое объяснение.

— Обновление LENS? Ошибка в алгоритме?

— Я проверила. Три раза.

— Может, крупная модель где-то натренировалась на форумных данных и теперь там масса синтетических текстов? Ботоферма?

— Возможно. Но ботоферма даёт другую сигнатуру — более однородную. Здесь разброс есть, но в определённых пределах. Как будто… — Клара помолчала, подбирая слова. — Как будто это не одна модель имитирует людей. А что-то изменилось в том, как люди пишут.

Пол поднял взгляд. Он был умным человеком — не блестящим, но умным. Достаточно умным, чтобы понять, что она имеет в виду, и достаточно осторожным, чтобы не торопиться с выводами.

— Это сильное утверждение, Клара.

— Я знаю.

— Тебе нужно больше данных.

— Я знаю.

— И независимая верификация.

— Понятно. Я как раз собираю.

Пол кивнул, взял свой эспрессо, пошёл к своему столу. Уже у двери обернулся:

— Ты завтракала?

— Нет.

— Поешь. Мозг работает на глюкозе, а не на кофе.

— Это неверно с биохимической точки зрения.

— Клара.

— Хорошо. Поем.

Она не поела.

* * *

Данных было много. Слишком много — это само по себе было частью проблемы. Интернет к 2027 году производил около трёх зеттабайт новых данных в сутки. Из них примерно восемьдесят четыре процента, по различным оценкам, были синтетическими — созданными или преобразованными языковыми моделями. Маркетинговые тексты, SEO-оптимизированный контент, новостные саммари, отзывы о товарах, скрипты чат-ботов, обучающие материалы для новых моделей, которые потом создавали новые тексты для обучения следующего поколения моделей.

Это называлось «проблемой отравленного колодца». Или «дата-коллапсом». Или «синтетическим дрейфом». Или «петлей обратной связи второго порядка». У каждой лаборатории было своё название.

Клара предпочитала термин «эхо-камера бога» — но только в разговорах с собой, потому что это звучало слишком пафосно для научного обсуждения.

Проблема была известна. О ней писали статьи, делали конференции, принимали регуляторные меры. Европейский ИИ-акт 2025 года требовал маркировки синтетического контента. В США принимали рекомендательные стандарты. Китай пытался контролировать синтетику на государственном уровне. Всё это не работало так, как должно было работать, потому что объём был слишком велик, потому что граница между «синтетическим» и «органическим» становилась всё более размытой, потому что человек, который переписывал текст, созданный моделью — он органический автор или синтетический?

Но то, что обнаружила Клара, было другим.

Не просто рост доли синтетики в корпусе. Изменение органики.

* * *

Верификацию она строила методично. Взяла архив LENS за два года — все срезы, все метрики. Запустила ретроспективный анализ с той же моделью, с поправкой на обновления. Построила временной ряд. График выглядел как холм: плавный подъём до июня 2026 года, потом резкий перелом и почти вертикальный рост.

Июнь 2026-го. Клара помнила этот месяц. GPT-5.5 был выпущен в апреле. Gemini 3.5 Flash— в мае. Antropic выпустил Claude Fable 5 в июне. Три крупнейших языковых модели обновились в течение восьми недель. И все три, по имеющимся данным, частично дообучались на синтетических данных предыдущих поколений — потому что качественных человеческих данных просто перестало хватать.

«Мы обучаем систему на всём интернете,» — говорили одни.

«Нет. Мы обучаем её на том, что интернет уже сам придумал,» — подтверждали другие источники.

Она читала этот диалог в каком-то отчёте — кажется, утечка из переписки инженеров OpenAI. Подлинная или сфабрикованная, она не знала. Сейчас это казалось неважным. Важно было то, что это было правдой.