Применение машинного обучения
Машинное обучение решает множество задач за пределами рекламы и маркетинга. Оно используется для:
• распознавания спама (алгоритм по характеристикам письма определяет, вредоносное ли оно);
• поиска похожих картинок;
• распознавания рукописного текста;
• работы поисковых систем (Яндекс, Google);
• анализа генома в медицине;
• астрофизических открытий (поиск планет).
Яндекс применял нейронную сеть
Matrix Net для всех своих сервисов — от поиска до Такси, Диска и Денег. Сейчас компания перешла на алгоритмы нового поколения, а Matrix Net выложена в открытый доступ. Это общая практика: когда технология перестаёт быть передовой и монетизируемой, её публикуют, позволяя изучать достижения прошлых лет.
Как работает машинное обучение: задача классификации
Представьте задачу: по фотографии гриба определить, ядовитый он или нет. Это типичная задача
классификации — отнесения объекта к одной из категорий. Сначала необходимо выявить паттерн (шаблон), описывающий класс. Для этого используется
обучающая выборка — множество примеров (300–400 грибов), каждый из которых описан набором
признаков (атрибутов) — высота, размер шляпки, цвет и т.д. — и для каждого указан правильный ответ: «ядовитый» или «неядовитый». Это
размеченные данные.
Алгоритм обучается на этой выборке и для нового объекта (с неизвестным ответом, но известным набором атрибутов) пытается определить, к какому классу он ближе — к множеству ядовитых или неядовитых грибов. Ключевой вопрос — как измерить «близость» наборов атрибутов. Именно способ вычисления близости нового объекта к известным классам различает разные алгоритмы машинного обучения.
Таким образом, задача очередного алгоритма — предложить принцип сопоставления нового объекта с уже известными, для которых есть правильные ответы. На выходе получаем отнесение объекта к классу. В случае
бинарной классификации ответом является «да» или «нет» (1 или 0). Классификация может быть и
многотиповой — с тремя, четырьмя и более классами.
Пример работы классификации: определение группы по поисковым запросам. Для класса «мамы с детьми от 0 до 3 лет» типовые запросы: годовалый, ходунок, Катофей, биби-блок, брокколи, Дом-2, Джигурда. Для «игроков в онлайн-игры»: дота, КПД, массовка, чит, эмулятор, Warface, каппа, паркур, гайд, дрифт, замужество, партнёрша, прицел, приворот. Для «выпендрёжников» (околохипстерская аудитория): Уильямс, Рафаэль, Инканта, Azure, бирюза, Топ-Хотелс, татуаж, Пегий, Центробанк, Старец, Нептун, Парадис, Арга, Слендер, Ларидуд, вейп. Анализируя поисковые запросы, алгоритм с высокой вероятностью определяет принадлежность пользователя к тому или иному классу.
Таргетинг на практике: определение мобильного устройства
Рассмотрим задачу: определить, каким мобильным устройством владеет пользователь десктопа (iPhone, iPad или Android), чтобы показывать релевантную рекламу. Сравниваются три подхода к
таргетингу:
1.
Без таргетинга — универсальная кампания, не учитывающая тип устройства.
2.
Таргетинг по крипте (крипта (crypta) — совокупность данных, собираемых о пользователе при посещении сайтов: информация о браузере, поведении мыши, скроллинге, переключении вкладок и т.д.). После нажатия кнопки «ОК» на уведомлении о cookies часть этих данных становится доступна владельцу сайта. Крипта позволяет оценить возраст, уровень образования, предпочтения.
3.
Таргетинг по логину — самый прямой метод: когда пользователь авторизован в одном и том же сервисе (Google, Яндекс) на десктопе и мобильном устройстве, тип телефона определяется однозначно. Возможны искажения (один компьютер на несколько человек), но их процент крайне низок, поэтому точность почти абсолютная.
Результаты конверсии (вероятность клика по рекламе):
• без таргетинга — 23%;
• таргетинг по логину (Android login) — 36%;
• таргетинг по крипте (Android) — показатель оказался ещё выше, чем по логину.
Это означает: поведенческие данные из крипты могут характеризовать пользователя точнее, чем информация из его аккаунта. Анализ данных даёт более сильный экономический эффект, чем прямая идентификация по логину.
Поиск похожих аудиторий (look-alike): кейс телесмотрения
Метод
look-alike (поиск похожих объектов) помогает находить аудитории, схожие с уже известной группой. Пример — анализ уровня телесмотрения. По данным TNS Россия, 99% россиян смотрят ТВ ежемесячно, но 30% пользователей Рунета проводят у экрана менее часа в день.
Методология исследования: 28 000 респондентов ответили на 4 вопроса анкеты. Их ответы соединили с данными пользователей Яндекса, извлекли крипту и выделили 200 факторов поведения (скроллинг, движения мыши, переключение вкладок и др.). Поисковые запросы чётко разделили две группы.
• Много смотрящие ТВ: Сбербанк (отсутствие в запросах), коммунальные, шарлотка, выкройка, биглион, Ir (Из рук в руки), заработать, ТНТ, Дом-2, телепрограмма, СТС, Спартак, ЦИС, Капива.
• Мало смотрящие ТВ: книга, переводчик, словарь, формулы, японский, французский, немецкий, такси, С++, Wi-Fi, Photoshop, Torrent, Adobe, загранпаспорт, авиабилет, виза, самолёт, аэропорт, РЖД. Характерно обилие запросов латиницей — эти пользователи знают, что поисковики автоматически корректируют раскладку.
Такое разделение подтверждает, что поисковое поведение надёжно индицирует образ жизни и медиапотребление.
Данные как новая нефть и этические границы
Данные — главная ценность современного мира («новая нефть»). Владение данными определяет контроль над рынком. Персонализация услуг будет только усиливаться: каждый сервис станет заточенным под конкретного клиента, предсказывая желания и поведение. Это повышает комфортность жизни, но одновременно снижает уровень конфиденциальности. Где проходит моральная граница допустимого анализа личных данных — предмет текущей философской дискуссии. Однако вектор развития неизменен: будущее за тотально таргетированными, персонализированными продуктами.
Краткие итоги
Машинное обучение превращает разрозненные данные в предсказательные модели, способные классифицировать объекты и находить скрытые закономерности. Краеугольный камень этого процесса — размеченная выборка, где каждый пример наделён набором признаков и известным исходом. Алгоритм не запрограммирован жёсткими правилами, он учится на сопоставлении: новый объект относится к тому классу, чьи представители в обучающей выборке оказались ближе по заданной метрике. Различие между алгоритмами сводится к способу вычисления этой близости. Такой подход универсален: от фильтрации спама до диагностики в медицине и анализа астрономических данных.
В маркетинговом контексте классификация решает задачу поиска целевой аудитории. На примере определения мобильного устройства показательно сравнение трёх стратегий таргетинга. Отсутствие нацеливания даёт низкую конверсию. Логин-таргетинг, связывая устройства через аккаунт, даёт почти стопроцентную точность, однако именно анализ крипты — «цифрового следа» пользователя на сайтах — обеспечивает наибольшую экономическую эффективность. Поведенческие сигналы (движения мыши, скроллинг, поисковые запросы) настолько полно описывают человека, что превосходят по точности прямую авторизацию. Этот факт подчёркивает, насколько глубоко данные о поведении раскрывают личность и предпочтения.
Метод look-alike выводит таргетинг на новый уровень, позволяя не просто описать текущего клиента, а масштабировать найденный образ на похожие сегменты. Кейс с телесмотрением демонстрирует, как 200 факторов поведения и поисковые запросы формируют чёткий водораздел между группами с разным медиапотреблением. Повседневные бытовые запросы против профессиональных и компьютерно-ориентированных — это два образа жизни, легко разделяемых алгоритмом. Практическое применение — рекламодатель получает инструмент для точного отбора аудитории без прямого опроса.
Главный актив в этой экосистеме — данные. Их сравнивают с нефтью, поскольку они питают всю индустрию персонализации. Компании, владеющие большими массивами данных, получают конкурентное преимущество, предугадывая потребности пользователей и предлагая им индивидуальные сервисы. Это делает жизнь удобнее, но поднимает острейший этический вопрос: насколько глубоко можно заходить в анализ личности без нарушения приватности. Текущая правовая база не поспевает за технологиями, и общество стоит перед выбором между комфортом и конфиденциальностью. Независимо от исхода дискуссии, вектор на тотальную персонализацию и предсказательное обслуживание останется доминирующим трендом.
Машинное обучение широко применяется для распознавания спама, поиска похожих картинок, работы поисковых систем, анализа генома и астрофизических открытий. Яндекс использовал нейросеть Matrix Net во всех сервисах, позже открыл её код, когда технология перестала быть передовой.
Основа машинного обучения — задача классификации. Чтобы научить алгоритм отличать ядовитые грибы от неядовитых, ему предоставляют обучающую выборку: сотни примеров с признаками (высота, цвет шляпки) и правильным ответом. Это размеченные данные. Алгоритм учится определять, к какому классу ближе новый объект по набору его признаков. Разные алгоритмы различаются способом вычисления близости. Классификация бывает бинарной (да/нет) и многотиповой (несколько классов). На практике можно определять социально-демографические группы по поисковым запросам: «мамы с детьми» ищут ходунки и брокколи, игроки — доту и Warface, хипстеры — Уильямс и Пегий.
В рекламе классификация позволяет нацеливать таргетинг. Кейс: определение мобильного устройства (iPhone/iPad/Android) у пользователя десктопа для показа релевантной рекламы. Сравниваются три стратегии:
• Без таргетинга — конверсия 23%.
• По логину — точность почти абсолютная, конверсия 36%.
• По крипте (crypta) — совокупность данных браузера: поведение мыши, скроллинг, переключение вкладок. Эти данные собираются после согласия на cookies. Точность крипта-таргетинга оказалась выше логина. Это значит, что поведенческие факторы описывают пользователя точнее, чем факт авторизации.
Поиск похожих аудиторий (look-alike) иллюстрируется анализом телесмотрения. 99% россиян включают ТВ ежемесячно, но 30% пользователей Рунета проводят у экрана менее часа в день. Исследование: 28 000 респондентов, их данные соединили с профилями Яндекса, извлекли крипту и 200 факторов поведения. Поисковые запросы чётко делят аудиторию:
• Много ТВ: шарлотка, выкройка, коммунальные, Дом-2, СТС.
• Мало ТВ: С++, Wi-Fi, Photoshop, авиабилеты, визы, обилие латиницы.
Данные — ключевой актив («новая нефть»). Владение данными даёт власть на рынке. Персонализация повышает комфорт, но снижает приватность. Грань между пользой и вторжением — предмет этической дискуссии. Будущее за тотально таргетированными сервисами.
1. Машинное обучение решает задачу классификации, обучаясь на размеченных данных с известными признаками и правильными ответами.
2. Алгоритм относит новый объект к классу, чьи представители в обучающей выборке ближе по набору признаков.
3. Способ измерения близости признаков различает разные алгоритмы машинного обучения.
4. Классификация может быть бинарной (да/нет) или многотиповой (несколько классов).
5. В маркетинге классификация позволяет выделять целевую аудиторию по характерным атрибутам, например поисковым запросам.
6. Таргетинг без данных даёт низкую конверсию; таргетинг по логину обеспечивает высокую точность за счёт связывания устройств.
7. Крипта — совокупность поведенческих данных с сайтов — позволяет таргетировать с точностью, иногда превышающей логин-таргетинг.
8. Высокая точность крипта-таргетинга доказывает, что поведенческие данные полнее характеризуют пользователя, чем факт авторизации.
9. Метод look-alike ищет аудитории, похожие на заданную группу, анализируя множество поведенческих факторов.
10. На примере телесмотрения поисковые запросы чётко разделяют «много смотрящих ТВ» и «мало смотрящих ТВ», выделяя бытовые и профессиональные интересы.
11. Данные становятся ключевым активом («новая нефть»), позволяя создавать персонализированные сервисы и предсказывать поведение.
12. Персонализация повышает комфорт, но порождает этическую дилемму: граница между полезным анализом и вторжением в частную жизнь пока не определена.
1. Что такое размеченные данные и как они используются в задаче классификации?
2. Чем отличается бинарная классификация от многотиповой?
3. Почему точность таргетинга по крипте может оказаться выше, чем по логину?
4. Какие факторы поведения пользователя может включать крипта?
5. В чём заключается принцип метода look-alike?
6. Как поисковые запросы помогли разделить аудитории по уровню телесмотрения?
7. Приведите примеры запросов, характерных для класса «мамы с детьми 0–3 лет», и объясните, как они связаны с этим классом.
8. Какие три подхода к таргетингу сравнивались в кейсе с мобильными устройствами и какой показал наилучший результат?
9. Каким образом алгоритм классификации определяет, к какому классу отнести новый объект?
10. Почему данные называют «новой нефтью»?
11. Какие этические вопросы возникают при массовом сборе и анализе пользовательских данных?
12. В чём отличие экспертной системы от системы на основе машинного обучения в задаче распознавания спама?