Две цифры сформировали то, как ритейл говорит о персонализации, и они не могут описывать одни и те же программы. Первая — McKinsey: персонализация даёт рост выручки на 10–15%, с разбросом от 5 до 25% в зависимости от сектора и качества исполнения. Эта цифра встречается почти в каждой презентации вендора, в каждом бизнес-кейсе и на каждом слайде совета директоров, оправдывающем семизначные инвестиции в маркетинговые технологии. Вторая — Gartner: ещё в декабре 2019 года аналитики предсказали, что к 2025 году 80% маркетологов, вложившихся в персонализацию, откажутся от этих усилий — из-за отсутствия измеримого ROI, сложностей с управлением клиентскими данными или по обеим причинам сразу.
На дворе 2026 год. Дедлайн наступил и прошёл. Насколько мне известно, никто не вернулся проверить, сбылся ли прогноз. Разрыв между этими двумя числами интересует меня больше, чем каждое из них по отдельности. Я провожу свои рабочие дни внутри аналитического стека — Adobe Analytics для поведенческих измерений, Adobe Experience Platform для единых клиентских профилей и Customer Journey Analytics для сквозного взгляда на путь клиента. В Gap Inc., а ранее в WSI, Macy’s и Kohl’s я наблюдал, как программы персонализации получают бюджеты, расширяются и отчитываются о результатах. Я строил сегменты, читал отчёты — и вот к чему пришёл: большинство программ персонализации не проваливаются, они просто не измеряются. Тот лифт, о котором сообщается, часто оказывается артефактом дизайна измерения, а не описанием реального эффекта программы.
Это более серьёзная проблема, чем недостаточная эффективность, потому что недостаточная эффективность в итоге отражается в P&L и вынуждает к разговору. Артефакт измерения — никогда. Он продолжает финансироваться квартал за кварталом на основании цифры, которая изначально не была сконструирована так, чтобы её можно было опровергнуть. Именно поэтому маркетинговое агентство Dragon Farm в своих проектах делает ставку на выстроенную аналитику, а не на «красивые» отчёты.
Самая уверенная цифра в комнате
Вот неудобная правда: клиенты, взаимодействующие с персонализированным модулем, почти по определению являются теми, кто уже был наиболее склонен к покупке. Высокий интент заставляет человека прокрутить страницу до карусели рекомендаций, прочитать её и кликнуть. Сравните конверсию этой группы с теми, кто не взаимодействовал, — и вы получите огромный лифт. Вы получите его каждый раз, на каждой кампании, независимо от того, были ли рекомендации хорошими. Но вы измерили не эффект воздействия, а намерение.
Это эквивалент оценки входной двери магазина путём сравнения доли покупок у тех, кто через неё прошёл, с теми, кто прошёл мимо по тротуару. Дверь будет выглядеть выдающейся, даже если она плохая. Важно понимать, насколько это распространено: сравнение «подвергшихся воздействию» и «не подвергшихся» — стандартный дизайн отчётности во множестве программ персонализации в крупных, хорошо обеспеченных ресурсами ритейлерах, включая программы на зрелых платформах, где инструменты для корректного тестирования находятся в двух кликах, но не используются. Ограничение редко в инструментах — оно в дизайне измерения.
И сообщаемая цифра обычно впечатляет, поэтому её никто не оспаривает. Программа с правдоподобными 3% подвергается scrutiny. Программа с 40% получает слайд в квартальном обзоре и увеличение бюджета.
Как рождается ложный лифт: шесть механизмов
Моя привычка как продакт-менеджера с бэкграундом в аналитике — не предлагать решения, пока я не пойму форму проблемы. В данном случае это означает конкретизацию различных механизмов, с помощью которых программа персонализации может отчитаться о лифте, которого она не создавала. Я вижу шесть, и это не вариации одного и того же — каждый требует отдельного исправления.
1. Систематическая ошибка отбора (Selection Bias)
Самый масштабный и всепроникающий механизм: сравнение клиентов, которые взаимодействовали с модулем, с теми, кто не взаимодействовал, при том что само взаимодействие вызвано тем же интентом, который вы пытаетесь измерить. Любая программа, чей отчёт сравнивает «подвергшихся» с «неподвергшимися» без случайного распределения, сообщает именно этот артефакт, называя его эффективностью.
2. Каннибализация (Cannibalization)
Тонкий и специфичный для мерчандайзинговых поверхностей механизм. Карусель рекомендаций приносит два миллиона долларов атрибутированной выручки. Вопрос, который никто не задаёт: изменилась ли выручка категории в целом — или модуль просто перенаправил покупки, которые всё равно случились бы, на те SKU, которые он показал? Атрибутированная и инкрементальная выручка здесь резко расходятся, и рекомендательные движки структурно склонны к этому разрыву, потому что обучены показывать то, что люди и так хотят.
3. Затухание новизны (Novelty Decay)
Проблема тайминга. Новый модуль привлекает внимание, потому что он новый. Лифт на первой неделе часто реален и почти всегда временен, существенно снижаясь к шестой неделе, когда поверхность становится частью визуального фона, который клиенты научились игнорировать. Ошибка не в том, что затухание происходит, а в том, что цифра первой недели попадает в презентацию и цитируется без изменений следующие два года.
4. Контаминация контрольной группы (Holdout Contamination)
Здесь особого внимания заслуживает split-стек. Предположим, вы корректно настроили контрольную группу в Optimizely. Рандомизация чистая, распределение равномерное, статистика корректна. Но в то же время тот же сегмент AEP, который питает этот опыт, активируется в email, push и платную социальную аудиторию — и ни одна из этих систем не знает, что Optimizely назначил клиента в контроль. Ваша контрольная группа получает воздействие через три других канала. Тест теперь измеряет разницу между четырьмя экспозициями и тремя и сообщает её как разницу между воздействием и ничем. Это структурный риск запуска экспериментов и активации на разных платформах: подавление применяется там, где определён тест, а не там, где клиент реально достигается. Подавление на уровне профиля должно жить в системе, владеющей профилем, иначе холдаут декоративен.
5. Метрика удобства (Metric of Convenience)
Это ошибка отчётности, а не эксперимента. CTR персонализированного модуля становится главной метрикой, потому что выручка на посетителя не сдвинулась. Вовлечённость с функцией — не бизнес-результат; в лучшем случае это диагностический показатель того, почему бизнес-результат не материализовался. Когда вовлечённость становится основным KPI, это почти всегда потому, что основной KPI был опробован первым и разочаровал.
6. Опциональная остановка (Optional Stopping)
Самый тихий из шести. Тест запускается, кто-то смотрит на дашборд ежедневно, и как только экспериментальная группа уверенно впереди, тест останавливают и запускают в продакшен. Это не мошенничество и редко ощущается как решение — это ощущается как эффективность. Но тест, остановленный при первом признаке хорошего результата, в существенной доле случаев выдаст победителя из чистого шума. Без заранее объявленного размера выборки и правила остановки фраза «мы следили, и всё явно работало» не является доказательством.
Причина, по которой эта таксономия важна, та же, что и для возвратов: каждый механизм требует совершенно разного вмешательства. Исправление правил остановки ничего не даёт против каннибализации. Построение чистого холдаута ничего не даёт против команды, которая отчитывается о CTR, потому что выручка не сдвинулась.
Что данные уже говорят (если вы готовы смотреть)
Инструментарий для ответа на эти вопросы в основном существует. Чего не хватает — аналитического процесса и, честнее говоря, желания. Вот как я подошёл бы к этому в CJA. Настройка сквозной аналитики и лидгена здесь становится фундаментом, без которого любые выводы остаются предположениями.
Для selection bias: полностью откажитесь от сравнения «подвергшиеся/неподвергшиеся» — не де-эмфазируйте, а выведите из обращения. Замените его случайным распределением, зафиксированным как атрибут профиля в AEP, чтобы тестовая и контрольная группы определялись до экспозиции, а не выводились после. Затем стройте сравнение в CJA на уровне человека, а не визита, чтобы клиент, назначенный в контроль, оставался в контроле между сессиями и устройствами. Число, которое это даст, будет меньше того, что оно заменяет. В этом и смысл.
Для каннибализации: проводите анализ на уровень выше, чем атрибуция. Если рекомендательный модуль кредитуется выручкой по набору SKU, выгрузите выручку на уровне категории и всего чека для тестовой и контрольной когорт в свободной таблице CJA за тот же период. Если модуль действительно создаёт спрос, выручка категории растёт. Если он перераспределяет спрос, атрибуция на уровне SKU растёт, а категория остаётся плоской — и эта плоская линия и есть реальное открытие. Я бы также следил за средним чеком и количеством единиц в заказе: модуль, который поднимает атрибутированную выручку при неизменном размере корзины, сообщает вам нечто конкретное.
Для novelty decay: когортируйте по неделе экспозиции и стройте лифт как кривую, а не точку. Каждая запущенная персонализация должна иметь стандартное окно измерения 8–12 недель, и именно цифра с поправкой на затухание, а не цифра запуска, должна стать числом для отчётности. В CJA это простой когортный анализ; сложная часть — организационная, потому что это означает, что цифра в презентации будет пересмотрена вниз через месяц после того, как все отпраздновали.
Для целостности холдаута: проверяйте его напрямую. Возьмите профили, назначенные в контроль, и запросите в CJA, получали ли они email-рассылки, push-уведомления или on-site опыты, связанные с тем же идентификатором кампании. Это по-настоящему разоблачающее упражнение, и я редко видел, чтобы его проводили. Холдаут, который вы не проверили, — это холдаут, который вы предполагаете, а предположение — то, что всё это упражнение должно устранять.
Для атрибуции: помечайте каждую экспозицию персонализации согласованным идентификатором кампании в AEP, чтобы экспозицию можно было связать с последующим поведением по единому профилю, по каналам и во времени. Без этого ничего из вышеперечисленного нельзя реконструировать постфактум, и вы ограничены тем анализом, который кто-то догадался настроить заранее.
Проблема «гонки моделей»
Есть версия этой проблемы, которую я хочу рассмотреть отдельно, потому что видел её в самых продвинутых организациях — и она вовсе не выглядит как ошибка измерения. Это «забег» рекомендательных движков: внутренняя модель против платформы вендора или модель A против модели B. Трафик разделён чисто, распределение действительно случайное, размер выборки настоящий, статистический вывод корректен. Все мои предыдущие замечания были правильно предвосхищены и учтены.
И всё равно результат не может сказать вам, чего стоит программа. Обе группы имеют карусель. Обе персонализированы. Вы измерили разницу между двумя видами воздействия — вопрос закупки, если вендор против внутренней, вопрос настройки, если модель A против B. Оба вопроса совершенно легитимны. Но ни один не является вопросом ROI, и ничто в отчёте не укажет на это различие.
Существует иерархия, которая на практике тихо схлопывается: должна ли эта поверхность существовать вообще? Какой движок должен её питать? Как этот движок настроить? Большинство организаций заходят на второй или третий вопрос, потому что к моменту оценки вендора существование модуля — это устоявшееся предположение, зашитое в RFP. Никто не решал пропустить первый вопрос — он просто никогда не появлялся ни в чьём списке.
Взаимодействие с каннибализацией делает это дорогим. Если карусель рекомендаций в основном перераспределительная — перемещает покупки между SKU, а не создаёт их — тогда лучшая модель лучше перераспределяет. Победитель забега — движок, который наиболее эффективно перетасовывает спрос, который у вас уже был. Он выиграет по атрибутированной выручке. Он ничего не покажет на уровне категории. И он выиграет контракт.
Это на три процента лучше базовой линии, которую никто не измерял. Если базовая линия равна нулю, то на три процента лучше нуля — всё ещё ноль. Исправление почти до смущения дешёвое, поэтому я продолжаю поднимать его в таких разговорах: проводите забег как трёхгрупповой тест, а не двухгрупповой. Внутренняя модель, вендор и настоящий контроль без рекомендаций. У вас уже есть инфраструктура экспериментов, распределение трафика и дисциплина рандомизации. Третья группа стоит доли трафика и превращает решение о закупке в решение о программе.
Есть и статистический бонус, который часто удивляет. Сравнение модели A и модели B — обычно самое сложное для обеспечения мощности, потому что истинная разница между двумя компетентными рекомендателями действительно мала — поэтому многие такие тесты идут месяцами и приходят к «нет значимой разницы». Разрыв между каруселью и отсутствием карусели, как правило, значительно больше. Группа, отвечающая на вопрос, который вас действительно волнует, — самая лёгкая для чтения.
И последнее, что стоит назвать. В забеге вендоров вендор часто поставляет систему измерения — окно атрибуции, определение ассоциированной конверсии, дашборд, который все читают. Это не заговор; это сервисное предложение, и система обычно компетентна. Но поставщик не должен быть единственным автором стандарта, по которому судят поставщика, и в большинстве других категорий корпоративных закупок этот принцип мы принимаем как должное.
Инструмент, который никто не хочет строить: постоянный глобальный холдаут
Трёхгрупповой тест отвечает на вопрос для одной поверхности. Более сложный вопрос — программа. Всё вышеперечисленное улучшает качество отдельных тестов, а контроль без рекомендаций говорит, заслуживает ли конкретный модуль своего места. Ни то, ни другое не отвечает на вопрос, который действительно хочет задать руководитель: не «сработала ли эта кампания», а «стоит ли эта программа — платформа, контракты с вендорами, команда, весь аппарат — того, что мы за неё платим».
Нельзя прийти к этому сложением. Десять поверхностей, каждая из которых бьёт свой контроль, не суммируются в число программы, потому что лифты перекрываются, аудитории взаимодействуют, и некоторые из этих поверхностей перемещают одну и ту же выручку туда-сюда между собой. Хорошо измерить части — не то же самое, что измерить целое, и разрыв между ними — то место, где живёт большинство бизнес-кейсов персонализации.
Инструмент, который отвечает на этот вопрос, — постоянный глобальный холдаут: 2–5% клиентских профилей, случайно распределённых в AEP, подавленных от всех активаций персонализации по всем каналам, поддерживаемых бессрочно, а не на время теста.
Тогда ценность программы — это вычитание. Выручка на профиль в генеральной совокупности минус выручка на профиль в холдауте, за квартал. Это единственное число и есть ROI всей программы, и это единственная версия этого числа, которая переживает контакт со скептичным CFO. Здесь на помощь приходит внедрение ИИ-агентов и n8n воркфлоу, позволяющее автоматизировать поддержание холдаута и мониторинг в реальном времени.
Возражения предсказуемы, и на них стоит ответить прямо.
«Мы не можем лишать клиентов нашего лучшего опыта». Если опыт действительно лучше, холдаут стоит вам лифта на 3% клиентов — примерно треть процента выручки при цифрах McKinsey. Это статистическая погрешность, а покупает она уверенность в остальных 97%. Если опыт не доказуемо лучше, холдаут не стоит ничего и reveals something important.
«Три процента клиентской базы — это много выручки». Это самая дешёвая страховка от продолжения финансирования того, что не работает. Сравните с полной годовой стоимостью платформы, контрактов и команды.
«Мы уже проводим A/B-тесты». Другой вопрос — другой инструмент, как описано выше.
Настоящее возражение — то, которое не произносится на совещании: постоянный холдаут может только уменьшить отчётную цифру. У него нет upside для того, кто владеет программой. Именно поэтому им должен владеть кто-то, кто программой не владеет.
Дисциплина уже существует — просто не перешла через коридор
Что делает это разочаровывающим, так это то, что ничего не является нерешённым. Всё решено в двадцати футах дальше по коридору. Performance-маркетинг уже более десяти лет считает инкрементальность входным билетом. Гео-холдауты, ghost ads, контрольные кампании PSA, тесты на сопоставимых рынках — весь аппарат существует потому, что команды платного трафика были вынуждены, самим размером бюджета, отвечать, вызвала ли реклама конверсию или просто предшествовала ей. Спросите компетентного менеджера по платному поиску, инкрементальны ли их брендовые кампании, — и вы получите строгий, неудобный, хорошо обоснованный ответ.
Задайте тот же вопрос команде onsite-персонализации о сопоставимом бюджете — и вы обычно получите атрибутированную выручку.
Вне ритейла компании с зрелой культурой экспериментов сделали тот же шаг годы назад. Booking.com управляет экспериментами как базовой инфраструктурой, с культурой, где нулевой результат — норма, а не провал. Использование Netflix holdback-групп для измерения долгосрочных эффектов хорошо задокументировано. Amazon построил Weblab, потому что решил, что запуск без измеренного контрфактуала неприемлем в масштабе.
Общая нить — не превосходство инструментов. Optimizely и AEP могут выполнить substantive части этого сегодня, в большинстве retail-стеков, без цикла закупок. Просто эти организации заранее решили, что лучше иметь маленькое истинное число, чем большое неопределённое, а затем построили структуры отчётности, которые закрепили это предпочтение. Это решение, а не способность. Оно доступно любому ритейлеру, который хочет его принять.
Десять идей, приоритизированных по влиянию и усилиям
Вопрос последовательности тот же, что и всегда: что мы можем сделать за девяносто дней, чтобы начать получать честный сигнал, и что требует реальных ресурсов?
Быстрые шаги — следующий квартал, минимальный инжиниринг
Предварительно регистрируйте каждый тест. Одна страница, заполняемая до запуска: основная метрика, минимальный детектируемый эффект, требуемый размер выборки, планируемая длительность и правило остановки. Это занимает двадцать минут и полностью устраняет опциональную остановку, потому что правило решения было согласовано до того, как кто-либо узнал, какая группа выиграет.
Уберите CTR модуля как метрику успеха. Оставьте его как диагностический — он полезен для понимания, почему что-то сработало или нет. Удалите отовсюду, где заявляется бизнес-результат.
Публикуйте журнал экспериментов. Каждый тест, его гипотеза, результат и был ли он запущен — включая проигрыши и плоские результаты. Следствия двояки: команды перестают тихо переформулировать нулевые результаты как победы, и организация строит реальную институциональную память о том, что работает и не работает на её собственных клиентах, что ценнее любого вендорского бенчмарка.
Делайте каждый тест рекомендаций трёхгрупповым. Что бы вы ни сравнивали — внутренний против вендора, модель A против модели B — добавляйте контроль без рекомендаций. Это стоит доли трафика и отвечает на два вопроса, на которые двухгрупповая версия структурно не может ответить: инкрементальна ли поверхность вообще и каннибализирует ли она. Выручка на уровне категории в группе без рекомендаций — это ваша проверка каннибализации, и она должна быть в отчёте, а не в сноске.
Ключевые инвестиции — в этом полугодии, с ресурсами
Постройте постоянный глобальный холдаут в AEP. Случайное распределение на уровне профиля, 3%, подавление от всех активаций. Это пункт с наибольшим рычагом в списке.
Обеспечьте подавление по всем каналам, а не только на сайте. Холдаут должен держаться в email, push, in-app и платных аудиториях, построенных из сегментов AEP. Это работа, которая делает предыдущий пункт реальным, а не номинальным, и именно здесь большинство внедрений тихо проваливаются.
Внедрите расчёт мощности в процесс запуска. Значительная часть тестов персонализации недостаточно мощна — у них никогда не было трафика, чтобы обнаружить эффект, который они были спроектированы найти, что означает, что они гарантированно давали либо нулевой результат, либо ложноположительный. Знание минимального детектируемого эффекта до запуска говорит, стоит ли вообще запускать тест.
Инструментируйте кривые затухания по умолчанию. Автоматическое окно измерения 8–12 недель на каждой запущенной персонализации, с цифрой с поправкой на затухание, заменяющей цифру запуска во всей отчётности.
Стратегические ставки — более длинный горизонт, кросс-функциональное выравнивание
Сделайте инкрементальность валютой финансирования. Измените то, что программа обязана отчитывать: инкрементальная выручка против глобального холдаута, а не атрибутированная выручка. Это изменение governance, а не аналитики, и именно оно делает всё вышеперечисленное долговечным, а не опциональным.
Управляйте персонализацией как портфелем. Некоторые опыты работают, большинство нейтральны, а некоторые активно негативны. Относитесь к набору как к инвестиционному портфелю — измеряйте каждую позицию, выводите убыточные и перераспределяйте. Большинство программ только добавляют. Ничто никогда не выключается, потому что выключение требует доказательств, которые никто не просил собирать.
Как я измерял бы всё это
Я глубоко скептичен к инициативам, которые не могут сформулировать план измерения до запуска, и этот скептицизм должен применяться к самой программе измерения. Основной KPI — инкрементальная выручка на профиль: генеральная совокупность минус глобальный холдаут, измеряемая ежеквартально и отчитываемая как диапазон с доверительным интервалом, а не точечная оценка. Доверительный интервал важен. Программа, сообщающая «где-то между 2 и 6 процентами», честна так, как «4,2 процента» — нет.
Вторичные метрики отслеживают здоровье системы измерения, а не программы: доля запущенных персонализаций, имевших валидный рандомизированный контроль (должна стремиться к 100%); медианный минимальный детектируемый эффект по текущим тестам (говорит, достаточно ли у вас мощности, чтобы чему-то научиться); лифт с поправкой на затухание на 90-й день против лифта на неделе запуска (количественно оценивает, насколько ваша историческая отчётность завышала результаты); и стоимость инкрементального доллара (число, которое в итоге определяет, переживёт ли программа бюджетный цикл).
Когортный анализ в CJA остаётся рабочей лошадкой. Для любого вмешательства сравнивайте экспонированную и контрольную когорты на 30, 60 и 90 дней по выручке на профиль, частоте заказов и — за чем стоит следить, учитывая мою предыдущую статью — уровню возвратов. Персонализационный движок, который поднимает конверсию, одновременно тихо увеличивая возвраты, не создал ценность. Он переместил издержку из одной строки в другую, и только анализ на уровне человека в достаточно длинном окне это поймает.
Всё это покоится на том же фундаменте, что и остальное: согласованные идентификаторы кампаний в AEP, корректно инструментированные, чтобы экспозицию можно было связать с последующим поведением по профилю. Блестящая система инкрементальности, построенная на неоднозначных данных об экспозиции, — просто более изощрённая ловушка уверенности.
Более широкий вывод
Я бывал в комнатах в нескольких ритейлерах, где представляли отчёт по персонализации, цифра была большой, все кивали, и совещание заканчивалось. Я бывал и в комнатах после, где кто-то тихо спрашивал, верим ли мы в это. Ответ обычно был какая-то версия «направленно».
Структурная проблема не в том, что кто-то нечестен. Она в том, что команда, которая управляет программой, — та же команда, которая отчитывается о результатах, и ни одна организация не должна ожидать, что такая расстановка родит строгий контрфактуал. Это не дефект характера. Это дизайн стимулов, который никто не выбирал сознательно и все унаследовали.
Поэтому здесь нужен продакт-менеджер, который не владеет кампанией — тот, чья репутация строится на доверии к измерению, а не на величине числа. Тот, кто может сидеть между аналитическим стеком, платформой экспериментов и бизнес-кейсом и держать линию на том, что на самом деле требуется для обоснованного утверждения.
Меньшее число, которое вы можете защитить, стоит больше, чем большее, которое не можете. В этом и заключается работа.