Использование механизма внимания в графовых нейронных сетях для фильтрации обучающих данных на примере рекомендательных систем

Научная статья
  • Гудков Василий МихайловичВоронежский государственный университет, Воронеж, Российская Федерация
https://doi.org/10.60797/IRJ.2026.171.24
DOI:
https://doi.org/10.60797/IRJ.2026.171.24
EDN:
WADHGE
Предложена:
03.06.2026
Принята:
20.08.2026
Опубликована:
17.09.2026
Выпуск: № 9 (171), 2026
Выпуск: № 9 (171), 2026
Правообладатель:авторы.
Лицензия:Attribution 4.0 International (CC BY 4.0)
20
0
XML
PDF

Аннотация

Современные рекомендательные системы демонстрируют высокую точность, но характеризуются значительной ресурсоемкостью, что затрудняет их практическое внедрение и масштабирование. Статья посвящена методу оптимизации обучения рекомендательных систем путем сокращения объема обучающих данных с помощью механизма внимания в графовых нейронных сетях. Предложенный подход, основанный на фильтрации менее значимых взаимодействий на основе весов внимания, позволяет снизить вычислительные затраты и ускорить процесс обучения без существенной потери качества рекомендаций. Экспериментальная проверка на датасете Amazon Books подтвердила эффективность метода для различных архитектур (LightGCN, BPR, KNN). Результаты работы указывают на перспективность использования механизмов внимания как средства повышения эффективности обучения.

1. Введение

Рекомендательные системы стали неотъемлемой частью современных цифровых платформ, обеспечивая персонализированный доступ к информации, товарам и сервисам. Они используются в интернет-магазинах для формирования индивидуальных товарных подборок, в медиасервисах для ранжирования фильмов, музыки и новостей, в социальных сетях для рекомендации друзей и так далее. Эффективность таких систем напрямую влияет на удовлетворенность пользователей, время взаимодействия с платформой и коммерческие метрики, что делает область рекомендательных алгоритмов одной из наиболее интенсивно развивающихся в современном машинном обучении.

1.1. Современные подходы и механизм внимания

В последние годы активно развиваются алгоритмы использующие глубокие нейронные сети, в частности нейронные сети, включающие механизм внимания. К наиболее заметным подходам относятся нейро-факторизационные модели, архитектуры последовательных рекомендаций на основе Transformer, вдохновленные достижениями в области языковых моделей, а также графовые модели

,
,
,
,
.

1.2. Проблемы использования современных моделей машинного обучения

Современные рекомендательные модели демонстрируют впечатляющие результаты, однако их повсеместное внедрение часто оказывается существенно затруднено. Основная проблема заключается в высокой ресурсоемкости таких моделей, обусловленной несколькими факторами.

Во-первых, большинство актуальных архитектур — многослойные архитектуры, реализующие свое преимущество через масштабируемость за счет увеличения числа параметров.

Во-вторых, реальные рекомендательные системы работают в динамических условиях. Быстро появляются как новые алгоритмы, так и новые области, в которых необходимы точные рекомендации. Это приводит к необходимости частого обучения моделей. Для тяжелых моделей такая частота обновлений становится практически невыполнимой.

В-третьих, часто модели чувствительны к гиперпараметрам. Настройка и оценка требует полного цикла обучения, что в совокупности с ресурсоемкостью данного процесса приводит к невозможности полноценного анализа влияния параметров и в следствии использования эмпирических значений.

Таким образом, несмотря на высокую точность, современные рекомендательные модели оказываются трудными для использования в реальных системах из-за высокой вычислительной стоимости и требования к регулярному переобучению. Это формирует запрос на методы, которые позволяют ускорить обучение, уменьшить объем данных или снизить сложность модели без существенной потери качества.

2. Методы и принципы исследования

Ключевая идея настоящей работы концептуально опирается на подходы дистилляции знаний, активно развиваемые в области больших языковых моделей (LLM)

,
. В классической дистилляции знаний информация передаётся от сложной модели-учителя к более простой модели-ученику за счет использования внутренних состояний модели-учителя (обычно внутренних активаций). Однако в предлагаемом исследовании используется альтернативное направление дистилляции. Вместо внутренних состояний слоев нейросети источником знаний выступают веса внимания, формируемые крупной рекомендательной моделью. Значения внимания интерпретируются как индикатор важности отдельных взаимодействий пользователя с объектами. Это позволяет выделить наиболее информативные элементы обучающих данных и использовать их. Таким образом, предлагаемая работа переносит идеологию дистилляции из LLM в область рекомендательных систем, но делает это через механизм фильтрации данных, а не через передачу внутренних скрытых представлений.

2.1. Методы

Механизм внимания (attention) реализует предложение о том, что необходимо фокусироваться на наиболее значимых элементах входных данных. В рекомендательных системах это означает способность выявлять наиболее информативные пользовательские взаимодействия такие, которые вносят наибольший вклад в итоговые рекомендации.

Интуитивно внимание работает как механизм адаптивного взвешивания: алгоритм самостоятельно определяет важные элементы, присваивая им большие коэффициенты значимости.

Формально механизм внимания для рекомендательных систем можно ввести следующим образом. Пусть пользователь

имеет историю взаимодействий
и потенциального кандидата на рекомендацию
, тогда имеет место мера, которая будет показывать насколько стоит обращать внимание на каждый объект из истории в момент данной рекомендации

(1)

Тогда вес внимания для одного взаимодействия

(2)

В подавляющем большинстве методов машинного обучения адаптация модели происходит за счет минимизации функции потерь. В общем виде ее можно представить следующим образом

(3)

где

номер обучающего примера,
их общее количество,
предсказанное моделью значение,
точное значение,
функция потерь на одном примере,
обучаемые (оптимизируемые) параметры модели.

Заметим, что функция потерь, а следовательно, и оптимизируемое значение напрямую зависят от обучающей выборки, используемой для оптимизации параметров

. Как известно существуют функции, одинаково преобразующие множество входных аргументов во множество выходных, отличающихся при этом только представлением.

Из этих предпосылок и формируется идея данной статьи – преобразовать функцию потерь в более компактный вид с минимальной потерей показателей использующих ее моделей. Как следствие такой подход должен ускорить как процесс настройки параметров моделей за счет более быстрого процесса обучения, так и процесс внедрения новых моделей за счет возможности использовать оптимизированные наборы данных с произвольными алгоритмами машинного обучения.

В графовых нейронных сетях (архитектурах на основе GAT

,
) рекомендации строятся за счет формирования в процессе обучения латентных (скрытых) представлений вершин и пользователей. Релевантность рекомендации определяет близость полученных представлений, т.е. величиной скалярного произведения

(4)

где

представление пользователя
,
представление объекта
,
размерность пространства представлений.

В качестве графа рассматривается граф взаимодействий двудольный граф

, где
множество пользователей,
множество объектов, а
множество рёбер, отражающих взаимодействия между ними (например, факт покупки или оценки). Пример такого графа представлен на рисунке 1.

Граф взаимодействий

Граф взаимодействий

Представления обновляются итеративно по следующим формулам:
formula
(5)

где

обучаемые параметры модели, матрицы преобразования представления при передаче по графу,
коэффициент внимания,
множество вершин соседей вершины
.

Оценка внимания вводится следующим образом:

(6)

где

обучаемый параметр, вектор получения внимания.

Подставляя

в
получаем формулу для вычисления весов внимания:

(7)

Подбор обучаемых параметров

осуществляется за счет минимизации функции потерь. В рамках данной архитектуры используется Bayesian personalized ranking loss или BPRLoss [11]

(8)

где

тройки пользователь, верная рекомендация, неверная рекомендация. Идея данной функции ошибки состоит в максимизации вероятности (минимизации отрицательного логарифма вероятности) верного ранжирования, т.е. такого ранжирования, в котором оценка верной рекомендации выше неверной рекомендации.

По окончании процесса оптимизации функции потерь значения

сохраняются вместе с соответствующими взаимодействиями.

2.2. Материалы

Amazon Books

представляет собой поднабор крупномасштабного корпуса пользовательских отзывов Amazon и содержит данные о взаимодействиях пользователей с товарами категории «книги».

В рамках задачи рекомендаций данные интерпретируются в постановке неявной обратной связи (implicit feedback), где наличие взаимодействия между пользователем и книгой рассматривается как положительный сигнал, а отсутствие взаимодействия как неявный негативный сигнал.

Разделение на обучающую и тестовую выборку в обоих случаях производилось с использованием стратегии randomsplit, т.е. в качестве тестового набора используется случайная часть фиксированного размера. Размер тестовой выборки 20%.

2.3. Фильтрация

В связи с разреженностью данных могут существовать различия в результатах в зависимости от того, как будут отбираться взаимодействия по весам внимания:

- число k выбирается фиксированное число взаимодействий на каждого пользователя, независимо от длинны истории, т.е. каждый пользователь ограничивается абсолютным значением;

- доля p — выбирается доля от общего числа, т.е. каждый пользователь ограничивается относительно длинны своей истории взаимодействий.

Результаты моделей сравниваются при каждом различном количестве взаимодействий на пользователя, в одном из трёх сценариев:

- random для каждого пользователя выбирается k случайных или p процентов взаимодействий;

- top для каждого пользователя выбирается k или p процентов взаимодействий с наибольшими весами внимания;

- bottom для каждого пользователя выбирается k или p процентов взаимодействий с наименьшими весами внимания.

При этом полная модель GAT обучается на всем наборе и не участвует в оценке результатов после фильтрации. Параметры модели подбираются также по модели, использующей полный набор данных.

Максимальное значение k 95 перцентиль длинны истории пользовательских взаимодействий. Для Amazon Books это примерно 100.

3. Основные результаты

Результаты предлагаемого подхода оценивается в паре с тремя различными вариантами алгоритмов коллаборативной фильтрации LightGCN, BPR и базового алгоритма ближайших соседей item-based KNN.

LightGCN

графовая нейронная сеть основанная на тех же принципах, что и GAT, но использующая механизм обновления весов без обучаемых параметров

formula
(10)

где

степень вершины
.

Модель BPR напрямую оптимизирует представления пользователей и объектов путем минимизации ошибки в виде (8).

Item-based KNN

использует для рекомендаций близость объектов в user-item матрице по корреляционному коэффициенту Пирсона.

Для оценки эффективности были использованы две метрики: Hit Ratio и Mean Reciprocal Rank или же HR@K и MRR

.

Hit ratio показывает долю предсказаний по которым в верхних

рекомендованных объектах есть реально оцененный объект

(11)

где

первая позиция, на которой был рекомендован релевантный объект для пользователя
. Оценивает возможность рекомендовать правильные объекты в некотором окне.

Mean Reciprocal Rank измеряет среднее значение обратного ранга первого релевантного объекта в рекомендованном списке, отражая способность модели помещать релевантный элемент на максимально высокую позицию.

(12)

Таким образом, HR@30 оценивает вероятность появления правильной рекомендации в выдаче из 30 объектов, а MRR близость результата к началу выдачи.

Эксперименты над Amazon Books показывают следующие результаты (рисунки 2 и 3):

Результаты для k

Рисунок 2 - Результаты для k

Результаты для p

Рисунок 3 - Результаты для p

4. Обсуждение

Как может быть видно из графиков, результат разнится в зависимости от применяемой модели. При этом непосредственно в рамках одной модели наблюдаемые метрики демонстрируют одинаковую динамику.

Также стоит заметить, что для всех экспериментов свойственно падение метрик к 0 взаимодействий на пользователя. Это говорит как об адекватности моделей (отсутствие пользовательской истории приводит модели к случайным предсказаниям), так и о наличии некоторого оптимального значения длинны пользовательской истории.

Для вариации с k наиболее значимый вывод результаты с фильтрацией по значению внимания почти полностью совпадают со случайной выборкой. Второй вывод для отдельных моделей фильтрация позволяет сместить точку падения метрик, но в зависимости от самой модели лучшие результаты показывает фильтрация по максимальному вниманию (KNN), минимальному значению (BPR) или же вовсе не оказывают существенного влияния (LightGCN).

Интереснее выглядит вариация с p. Для всех трех моделей фильтрация показывает возможность снизить объем обучающих данных. При этом для LightGCN и BPR дополнительно наблюдается прирост метрик.

Недостатком же служит тот факт, что различные модели выдают различную динамику изменения метрик, что не дает универсальных рекомендаций к применению представленного подхода и требует проведения разведывательного анализа, что может в ряде сценариев свести к минимуму полезность применения представленного метода.

5. Заключение

В настоящей работе был исследован подход к сокращению объема обучающих данных рекомендательных систем на основе использования механизма внимания графовых нейронных сетей.

Проведенные эксперименты показали, что переиспользование оценок внимания модели GAT позволяет для представленных моделей сохранять качество при повышении скорости обучения.

Полученные результаты подтверждают перспективность использования механизмов внимания как инструмента оптимизации обучающих данных, особенно в условиях, в которых модели с механизмом внимания уже интегрированы в рекомендательные системы. Предложенный подход открывает возможности для снижения вычислительных затрат при обучении рекомендательных систем, ускорения подбора гиперпараметров и более эффективного применения ресурсоемких моделей в условиях регулярного обновления данных.

Развитием идеи, представленной в данной статье может послужить исследование других моделей с использованием внимания, например, вариантов генеративных и последовательных моделей.

Метрика статьи

Просмотров:20
Скачиваний:0
Просмотры
Всего:
Просмотров:20