18+
реклама
18+
Бургер менюБургер меню

Леха Захаров – «Слив топа Литрес» (страница 6)

18

Хорошая стартовая точка (Great starting point). Для базовой модели коллаборативной фильтрации нужна только матрица обратной связи. Никаких дополнительных данных о пользователях (возраст, пол, местоположение) или о товарах (жанр, описание) не требуется. Это значительно упрощает начальную разработку и внедрение системы.

Однако у коллаборативной фильтрации есть и фундаментальные ограничения, с которыми приходится бороться разработчикам.

Это главный и самый серьёзный недостаток. Коллаборативная фильтрация абсолютно бессильна перед новыми объектами, о которых ещё нет данных.

Новый пользователь (New User Cold-Start): Вы только зарегистрировались на «ЛитРес». Система не знает, что вы читали раньше. Ей не с чем сравнивать ваши вкусы. В этом случае рекомендации будут либо случайными, либо основанными на глобальной популярности.

Новый товар (New Item Cold-Start): Автор только что опубликовал свою книгу. Её никто не покупал и не оценивал. Для коллаборативной модели она не существует. Это одна из главных проблем для авторов-дебютантов: даже гениальная книга не будет рекомендована, пока не наберёт критическую массу взаимодействий.

Борьба с холодным стартом — одна из ключевых задач. Самые эффективные решения — гибридные системы, которые на старте используют контентную фильтрацию (анализ жанра, аннотации, автора) для построения начальных профилей новых книг и пользователей. Для новых товаров может использоваться эвристика: например, усреднить эмбеддинги других книг того же автора или из того же жанра.

Коллаборативные модели, особенно основанные на неявной обратной связи, имеют тенденцию рекомендовать популярные, «мейнстримные» товары. У них больше взаимодействий, они лучше «видны» алгоритму. Это создаёт порочный круг: популярные книги становятся ещё более популярными, а нишевые, качественные произведения так и остаются незамеченными, даже если они идеально подходят конкретному пользователю.

Коллаборативная фильтрация уязвима для злоумышленников. Группа пользователей может искусственно завысить рейтинг книги или создать ложные корреляции. Например, скупить сотню копий своей книги, заставить «ботов» поставить ей 5 звёзд или создать фальшивые связи с популярными бестселлерами. Хорошие системы включают механизмы обнаружения и подавления аномальной активности, но полностью исключить риск манипуляций невозможно.

Как понять, хороша ли модель? Для этого существует несколько метрик. Самые популярные — это метрики ранжирования, которые оценивают, насколько хорошо модель упорядочивает рекомендации.

NDCG (Normalized Discounted Cumulative Gain): Учитывает не только наличие релевантных книг в топе рекомендаций, но и их позицию. Высокое место для релевантной книги даёт больше «очков», чем низкое.

MAP (Mean Average Precision): Измеряет, насколько высока доля релевантных книг среди всех рекомендованных, усреднённая по разным уровням отсечения (top-5, top-10 и т.д.).

Recall@K: Доля релевантных книг, попавших в топ-K рекомендаций, от общего числа релевантных книг.

Эти метрики позволяют инженерам сравнивать разные модели и выбирать лучшую для A/B-тестирования на реальных пользователях.

Сегодня чистая коллаборативная фильтрация в отраслевых решениях встречается редко. Её эволюционным развитием стали гибридные системы, которые объединяют её с контентной фильтрацией и другими подходами.

Современные исследования двигаются в сторону Neural Collaborative Filtering (NCF), где нелинейные взаимодействия между пользователями и товарами моделируются с помощью нейронных сетей. Такие модели могут улавливать гораздо более сложные и тонкие паттерны, чем линейное скалярное произведение в ALS. Другие интересные направления — это обучение с подкреплением (RL) для оптимизации долгосрочной вовлечённости и федеративное обучение (Federated Learning) для повышения конфиденциальности данных.

Тем не менее, принцип «коллективного разума» остаётся фундаментальным. Какими бы сложными ни были нейронные сети, они по-прежнему ищут закономерности в поведении миллионов пользователей. Так что в следующий раз, когда «ЛитРес» порекомендует вам книгу, которая станет вашим новым любимым романом, знайте: это не магия и не слежка. Это просто невидимый книжный клуб из миллионов читателей, которые уже проголосовали за эту книгу своими сердцами и своими кошельками. И вы в этом клубе — полноправный участник.

Контекстный баннер, который вы не замечаете (а алгоритм – да)

Вы только что закрыли карточку какой-то книги на «ЛитРес». Может быть, полистали описание, глянули пару отзывов, но в итоге решили: «Нет, не сегодня». Или дочитали до конца захватывающий детектив, поставили твёрдые пять звёзд и отложили телефон в сторону. А потом потом случилось нечто странное.

Вы открываете совсем другой сайт — новостной портал, блог, форум. И вдруг на боковой панели или между абзацами статьи возникает рекламный баннер. На нём — та самая книга, которую вы только что смотрели. Или другая, но удивительно похожая. Или книга того же автора. Вы моргаете. Вы думаете: «Откуда они знают? Меня что, преследуют?». Спойлер: да, преследуют. Но преследуют не люди и не спецслужбы. Вас преследует контекстный баннер, который вы вроде бы не замечаете — но который алгоритм видит идеально.

В этой главе мы разберём, как «ЛитРес» (и любой другой крупный сервис) использует контекстную рекламу и ретаргетинг, чтобы догонять вас по всему интернету. Мы заглянем в скрытые механизмы, которые определяют, какой баннер увидит конкретный пользователь, почему одни видят «Войну и мир», а другие — любовные романы, и как это всё влияет на продажи книг. Но главное — мы поймём, что контекстный баннер — это не просто раздражающая картинка, а сложнейший вычислительный процесс, в котором сталкиваются миллионы данных о вашем поведении. И вы, возможно, даже не подозреваете, что каждое ваше движение на сайте — это сигнал для алгоритма, который решает, что именно показать вам следующим.

Чтобы понять, как работает контекстный баннер на «ЛитРес», нужно сначала разобраться, что такое контекстная реклама вообще. В классическом определении контекстный таргетинг предполагает отображение рекламы, соответствующей содержанию страницы. То есть если вы читаете статью о космосе, вы увидите рекламу телескопов, книг по астрономии или научно-фантастических романов. Просто, логично, эффективно.

Но современная контекстная реклама ушла далеко вперёд. Она перестала быть просто «рекламой на тематической странице». Она стала персонализированной. Это значит, что рекламное объявление адаптируется под уникальные характеристики отдельного пользователя или группы схожих пользователей — на основе его поведения, интересов, истории покупок и даже контекста в реальном времени.

Исследования показывают, что персонализированные объявления могут увеличить CTR рекламы (показатель кликабельности) на 90%. Девяносто процентов — это колоссальная цифра. Именно поэтому «ЛитРес» и другие крупные игроки вкладывают огромные ресурсы в настройку контекстной рекламы, сегментацию аудитории, персонализацию креативов и привлечение на сайт наиболее готовых к покупке посетителей.

Алгоритм, который управляет этой системой, — это не просто набор правил «если — то». Это сложная предиктивная модель, которая предсказывает вероятность совершения покупки каждым из посетителей интернет-ресурса. Она учитывает срок принятия решения о покупке, характерный для конкретного бизнеса, и на основе этого предсказания решает, кому и когда показывать рекламу. В случае «ЛитРес» такие модели, по некоторым данным, помогли увеличить продажи сервиса на 33%.

Тридцать три процента дополнительных продаж — это не просто цифра. Это миллионы рублей, которые зарабатывает платформа и авторы. И за этими процентами стоит невидимая работа алгоритмов, которые анализируют каждый ваш клик, каждую секунду, проведённую на странице, каждую книгу, которую вы пролистали и не купили.

Самое интересное начинается, когда вы покидаете «ЛитРес». Именно тогда контекстный баннер включает свой главный механизм — ретаргетинг.

Ретаргетинг — это технология повторного показа рекламы пользователям, которые уже взаимодействовали с брендом. Они посетили сайт, смотрели определённые страницы, кликали на рекламу или даже начали оформлять покупку. И вот вы ушли, думаете о своём, а алгоритм уже подготовил для вас персонализированный баннер и ждёт подходящего момента.

Как именно это работает на «ЛитРес»?

Смарт-баннеры. Это один из ключевых инструментов. Когда вы смотрите книгу на сайте или в приложении «ЛитРес», алгоритм запоминает это. Позже, когда вы заходите на другие сайты (которые участвуют в рекламной сети, например, в Яндекс.Рекламной сети), вы видите смарт-баннер с той самой книгой, которую вы смотрели. По клику на баннер вы попадаете прямо на карточку товара и можете купить книгу.

Конверсионные стратегии. «ЛитРес» использует так называемые конверсионные стратегии в Яндекс.Директе. Стратегия обучается на собранной статистике и показывает объявления пользователям, которые с наибольшей вероятностью совершат нужное действие на сайте. Это не просто «показать всем, кто заходил». Это сложный отбор: алгоритм анализирует, какие пользователи с большей вероятностью купят книгу, и концентрирует бюджет именно на них. Результаты впечатляют: за пять месяцев количество покупок контента выросло на 43%, а стоимость конверсии снизилась почти в три раза (на 65%). При этом общий бюджет оказался на 49% меньше, чем при ручном управлении кампаниями. А CTR вырос в 3,4 раза.