Матвей Демчук – Slop (страница 5)
Саманта подняла взгляд.
— Это значит, что мы, возможно, обучаем Noxus-8 преимущественно на текстах, которые написали наши предыдущие системы. Прямо или косвенно. Через один, два, три уровня посредников.
Дэн обернулся к серверным стойкам. Noxus-8 уже три недели как начал предобучение. Шестьсот семьдесят миллиардов параметров. Полтора триллиона токенов в обучающем наборе.
— Сколько нужно времени, чтобы остановить обучение?
— Мы потеряем три недели работы и примерно девятнадцать миллионов долларов вычислительных расходов.
— Я спросил сколько времени.
— Тридцать минут на graceful shutdown.
Дэн молчал.
— Нам нужно доложить Ричардсу, — сказала Саманта.
— Да.
— Он не обрадуется.
— Нет.
— Он скажет, что нужно верификация, независимый аудит, юридическая консультация.
— Да.
— И пока мы всё это делаем — Noxus-8 продолжает обучение.
Дэн снова посмотрел на цифры на планшете. Восемьдесят девять целых четыре десятых процента. Почти девяносто.
Почти всё.
— Пойдём к Ричардсу, — сказал он.
* * *
Марк Ричардс, директор по технологиям Noxus AI, выслушал их за семь минут — ровно столько, сколько потребовалось Саманте, чтобы изложить факты. Потом сидел тихо ещё три минуты, что для него было рекордом. Ричардс обычно прерывал в первую минуту.
— Вы уверены в цифрах? — сказал он наконец.
— Я проверила трижды, — ответила Саманта.
— Мне нужна независимая верификация.
— Это займёт…
— Мне нужна независимая верификация, — повторил Ричардс. Это был ответ.
— Марк. — Дэн решил говорить прямо. — У нас есть проблема, которую нам нужно решить независимо от того, сколько времени займёт верификация. Мы обучаем модель на своих же выходных данных. Это вызывает…
— Я знаю, что это вызывает.
— «Коллапс модели». Деградацию выходных данных. «Синтетическое эхо». Называй как хочешь.
— Коллинз. — Ричардс поднял руку. — Я слышал про эти исследования. Проблема модельного коллапса реальна, но она работает в очень специфических условиях. Нам нужно понять, действительно ли мы в этих условиях. Поэтому — верификация.
— А пока — Noxus-8 продолжает?
— Пока — Noxus-8 продолжает.
Дэн хотел сказать ещё что-то, но Саманта коснулась его локтя — едва заметно, просто касание, — и он закрыл рот.
Они вышли в коридор. Саманта шла быстро, почти бежала.
— Куда ты? — спросил Дэн
— В туалет. Думать.
— В туалет думать?
— Там тихо. — Она не оглянулась. — Дэн, если мы правы — это не только наша проблема. Это происходит везде. Все крупные лаборатории работают с теми же поставщиками данных. OpenAI, Google, Anthropic, Mistral — все они в той же экосистеме. Если данные заражены у нас — они заражены у всех.
— «Заражены» — сильное слово.
— У тебя есть лучше?
Дэн подумал.
— Нет.
— Я пойду думать. Ты иди пиши отчёт. Подробный. С временными метками.
— Зачем временные метки?
Саманта наконец обернулась.
— Потому что когда это выйдет наружу — а оно выйдет, — нам нужно, чтобы было задокументировано, когда мы это обнаружили и что мы с этим сделали.
Дэн смотрел ей вслед и думал о том, что она права. Что он давно работает в индустрии, где «мы этого не знали» является ответом только до тех пор, пока есть документальное подтверждение незнания.
После него — нет.
* * *
Главный офис Европейского агентства по контролю ИИ располагался в здании, построенном в 1970-х и капитально отремонтированном в 2022-м. Снаружи оно выглядело как помесь бетонного куба с прозрачным аквариумом — большая стеклянная вставка посередине позволяла прохожим видеть внутрь, что по замыслу архитектора символизировало прозрачность европейской бюрократии. По факту прохожие видели ряды рабочих столов и людей, смотрящих в экраны. Прозрачность прозрачностью, но работа оставалась работой.
Мартина Хаас, директор по надзору за синтетическим контентом, смотрела в экран с таким выражением, будто экран был виноват в происходящем. Ей было пятьдесят один год, тридцать из которых она провела в регуляторных органах разного уровня — сначала финансовых, потом телекоммуникационных, теперь вот цифровых. Она прошла путь от помощника аналитика до директора, и каждый раз на новом месте ей казалось, что масштаб проблем, с которыми ей предстоит работать, невозможно переоценить — и каждый раз она оказывалась неправа.
Это был один из таких моментов.
— Томас, — сказала она, не поднимая взгляда от экрана.
Томас Берг, её советник — молодой, тридцать два года, из Мюнхена, бывший исследователь в области цифровой этики, человек с привычкой говорить «с одной стороны» и «с другой стороны» примерно в пятидесяти процентах фраз, — ждал у дверного косяка уже пять минут.
— Да, Мартина.
— Вы читали этот отчёт?
— Я его написал.
— Прочитайте мне ключевые выводы.
Томас открыл свой планшет, хотя знал текст наизусть.
— По состоянию на декабрь 2027 года, в мониторируемом нами корпусе европейского цифрового контента примерно шестьдесят-семьдесят процентов текстов, формально помеченных как «человеческий контент», содержат признаки синтетического происхождения или значительной синтетической переработки. Это превышает допустимый порог ИИ-Акта в семь-восемь раз.
— Дальше.
— Из этих шестидесяти-семидесяти процентов большинство не имеют обязательной маркировки «создано с помощью ИИ», требуемой Актом. Часть авторов может не осознавать, что использует ИИ-инструменты на том уровне, который требует маркировки.
— Это юридически значимое различие?
— С одной стороны — да, намерение имеет значение. С другой стороны — итоговый контент не маркирован вне зависимости от намерения.
— Дальше.