Адаптивный двухуровневый подход обучения с подкреплением к оптимальному исполнению сделок
Сухан Ким, Чимён Ким, Хон Ки Соль, Ёнджун Хон · Department of Mathematics, Sungkyunkwan University; Department of Finance, Chung-Ang University, Республика Корея · 20 июля 2023
Оригинал: Kim, S., Kim, J., Sul, H. K., Hong, Y. «An Adaptive Dual-level Reinforcement Learning Approach for Optimal Trade Execution», 2023 — arxiv.org/abs/2307.10649 (PDF), лицензия CC BY 4.0.
Рисунки воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY 4.0.
Аннотация
Цель этого исследования — разработать тактику, способную точно отслеживать дневную кумулятивную средневзвешенную по объёму цену (VWAP) с помощью обучения с подкреплением. Предыдущие работы часто выбирают относительно короткий торговый горизонт для реализации своих моделей, из-за чего точно отслеживать дневной кумулятивный VWAP затруднительно: вариации финансовых данных на коротком торговом горизонте зачастую незначительны. В этой работе мы стремимся построить стратегию, которая точно отслеживает дневной кумулятивный VWAP, минимизируя отклонение от VWAP. Мы предлагаем метод, использующий U-образный паттерн внутридневных объёмов торгов, и применяем Proximal Policy Optimization (PPO) в качестве алгоритма обучения. Наш метод следует двухуровневому подходу: модель-трансформер улавливает общее (глобальное) распределение дневных объёмов в форме буквы U, а LSTM-модель управляет распределением заявок внутри меньших (локальных) временных интервалов. Результаты наших экспериментов показывают, что такая двухуровневая архитектура повышает точность аппроксимации кумулятивного VWAP по сравнению с предыдущими моделями на основе обучения с подкреплением.
Ключевые слова: Volume-Weighted Average Price, обучение с подкреплением, оптимальное исполнение сделок, Proximal Policy Optimization, марковский процесс принятия решений.
1. Введение
Задача оптимального исполнения сделок состоит в поиске стратегии оптимальной торговли крупными заявками в течение заданного периода времени. Один из наиболее распространённых и практичных методов, которым часто пользуются практики, известен как торговля по средневзвешенной по объёму цене (VWAP). VWAP вычисляется суммированием денежного оборота по каждой сделке (цена, умноженная на число проторгованных акций) с последующим делением на суммарное число акций, проторгованных за день. Это даёт среднюю цену, учитывающую и цену, и объём проторгованных акций. Фонды и трейдеры часто используют VWAP как бенчмарк: сравнивая цену исполнения своих сделок с общерыночной ценой бумаги, они оценивают качество своей торговли.
В последнее время использование обучения с подкреплением (RL) в оптимальном исполнении сделок стало популярным, поскольку это разновидность стохастического процесса принятия решений, автоматизирующая задачу практика — по прошлым данным решать, когда исполнять заявки. Поскольку RL-подходы обладают многими преимуществами (например, способны улавливать микроструктуру рынка), торговые результаты RL-решений часто превосходят традиционные подходы к трекингу VWAP, такие как Bialkowski et al. (2008) и Podobnik et al. (2009).
Эта работа нацелена на построение стратегии, способной устойчиво отслеживать дневной кумулятивный VWAP. Для достижения этой цели мы отталкиваемся от наблюдения важной характеристики торговли акциями — U-образного внутридневного паттерна торговли, задокументированного в Jain & Joh (1988) и Goodhart & O’Hara (1997). Это хорошо известный стилизованный факт: объём торгов акцией в течение дня часто следует U-образному паттерну. Это означает, что объём максимален на открытии, быстро падает до более низких уровней и снова растёт ближе к закрытию рынка, оставаясь относительно низким после полудня (см. рис. 1). С учётом этого наблюдения мы предлагаем новый двухуровневый подход, минимизирующий рыночное воздействие и точно и устойчиво отслеживающий дневной кумулятивный VWAP. Как следует из названия, наша модель состоит из двух этапов. На первом этапе модель решает, какой объём будет исполнен в каждом интервале, используя U-образное свойство как ориентир. На втором этапе RL-модель решает, как заявки будут исполняться внутри каждого интервала. Для первого этапа мы предлагаем два метода: статистический U-shape-метод и метод U-shape-трансформера. Статистический U-shape-метод распределяет объём на основе исторических средних объёмов торгов. Однако такой подход не может полностью уловить изменчивость от дня к дню (см. рис. 1). В качестве альтернативы мы предлагаем U-shape-трансформер для выявления этих вариаций. На следующем этапе мы применяем LSTM и PPO для эффективного распределения заявок внутри каждого интервала.
Мы ожидаем, что этот двухуровневый подход повышает точность аппроксимации кумулятивного VWAP за счёт правильного распределения общего объёма заявок. Наши вклады таковы:
- Мы предлагаем новый подход к оптимальному исполнению сделок, использующий двухуровневую стратегию. Заявки распределяются в два этапа: на первом этапе мы используем U-образный паттерн внутридневных объёмов, на втором — применяем глубокое обучение с подкреплением.
- Мы дополнительно предлагаем модель U-shape-трансформера для улавливания ежедневных колебаний внутридневного U-образного распределения.
- Мы проводим абляционные исследования, демонстрирующие сильные стороны наших методов в аппроксимации дневного кумулятивного VWAP, и показываем, что использование глубокого обучения с подкреплением на коротких торговых горизонтах неэффективно.
2. Основные понятия
В этом разделе мы обсуждаем основы книги лимитных заявок (LOB) и процесса оптимального исполнения сделок. Большинство современных финансовых бирж, включая Корейскую фондовую биржу (KRX), предлагают электронные торговые платформы с доступом к книгам лимитных заявок. Трейдеры часто опираются на информацию из книги лимитных заявок при разработке успешных торговых стратегий.
2.1. Книга лимитных заявок
На финансовых рынках лимитная заявка — это заявка на покупку или продажу фиксированного числа акций по указанной цене. Такая заявка становится частью книги лимитных заявок, в которой регистрируются все лимитные заявки по конкретной акции. Цена bid — наивысшая цена, которую покупатель готов заплатить за бумагу, а цена ask — наименьшая цена, по которой продавец готов продать. Рыночная заявка, напротив, — это заявка на покупку или продажу фиксированного числа акций по текущей рыночной цене без указания цены. Когда размещается рыночная заявка, она сводится с лучшими доступными лимитными заявками в LOB. LOB важна для оптимального исполнения сделок и помогает трейдерам отслеживать спрос и предложение по акции, облегчая определение лучшего времени и цены для покупки или продажи.
2.2. Оптимальное исполнение сделок
Оптимальное исполнение сделок — это процесс покупки или продажи финансового актива с достижением желаемой цели. В общем виде задача формулируется так: в рамках временного окна из $T$ шагов $0, 1, \cdots, T-1$ трейдер, обладающий запасом из $O$ акций, должен купить или продать весь запас целиком. На каждом шаге $t \in \{0, 1, \cdots, T-1\}$ трейдер определяет число акций для заявки $O_t$ на основе информации из LOB и совершает сделку по цене исполнения $p_t$. Для группы трейдеров, стремящихся максимизировать торговую прибыль, цель — найти стратегию, максимизирующую или минимизирующую среднюю цену исполнения $\bar{P}$, которая вычисляется как
\[ \bar{P} = \sum_{t=0}^{T-1} \frac{O_t}{O}\, p_t. \]Хотя многие финансовые фирмы стремятся к прибыли через торговлю, в финансовой отрасли есть и множество фирм, для которых важнее устойчиво отслеживать VWAP, чем максимизировать торговую прибыль. Фокус нашей работы ориентирован именно на эту вторую группу трейдеров. VWAP вычисляется как
\[ \mathrm{VWAP} = \frac{\sum_{t=0}^{T-1} p_t q_t}{\sum_{t=0}^{T-1} q_t}, \]где $q_t$ — объём исполнения, определяемый рынком. Таким образом, основная цель этой работы — минимизировать разницу между VWAP и $\bar{P}$ с помощью двухуровневого подхода.
3. Обзор литературы
3.1. Оптимальное исполнение без RL
В Bertsimas & Lo (1998) предложена фундаментальная работа по оптимальному исполнению сделок, где авторы предполагают, что рыночные цены следуют арифметическому случайному блужданию. С помощью принципа динамического программирования они находят явное решение в замкнутой форме. Развивая эту работу, Huberman & Stanzl (2005) и Almgren & Chriss (2001) расширили результат Bertsimas & Lo (1998), включив транзакционные издержки, более сложные функции ценового воздействия и параметры неприятия риска, в предположении, что рыночные цены следуют броуновскому движению. Эти динамические подходы, однако, трудно напрямую применять в реальном мире из-за расхождения между их сильными рыночными предположениями и сложностью фактических рыночных условий.
С другой стороны, и практики, и исследователи широко используют стратегию средневзвешенной по времени цены (TWAP) и стратегию средневзвешенной по объёму цены (VWAP) (Berkowitz et al. (1988); Kakade et al. (2004)), основанные либо на чистых правилах, либо на статистических правилах. В частности, в Kakade et al. (2004) авторы использовали исторические данные для оценки среднего объёма торгов в каждом временном интервале и соответственно делили заявку. Однако такая стратегия плохо подходит для улавливания неожиданной волатильности.
3.2. Оптимальное исполнение с RL
С точки зрения того, что задачи оптимального исполнения — это разновидность последовательного принятия решений, обучение с подкреплением (RL) широко применяется в этой области. Насколько нам известно, Nevmyvaka et al. (2006) — первая работа, применившая RL-каркасы, такие как Q-обучение (Watkins & Dayan (1992)), к задачам оптимального исполнения сделок. Важно отметить, что проклятие размерности в Q-обучении затрудняет работу с многомерными данными. Хотя Hendricks & Wilcox (2014) пытаются объединить RL с моделью Алмгрена–Крисса, это сложная задача, поскольку модель зависит от определённых предположений о рыночной динамике.
Благодаря прогрессу в глубоком RL недавние работы, такие как Ning et al. (2021) и Lin & Beling (2019), использовали Deep Q-Networks (DQN) (Mnih et al. (2013)) для оптимального исполнения сделок, решая проблемы многомерных данных и сложности финансового рынка без опоры на какие-либо рыночные предположения. Однако эти методы требуют проектирования специальных признаков, что может быть трудозатратно. Недавно несколько исследований изучали каркасы оптимального исполнения на основе proximal policy optimization (PPO) (Schulman et al. (2017)), не требующие ручного конструирования признаков. Например, Lin & Beling (2020), Fang et al. (2021) и Pan et al. (2022) исследовали этот подход в разных сценариях. В частности, Pan et al. (2022) сосредоточились на оптимальном исполнении лимитными заявками, тогда как Lin & Beling (2020) и Fang et al. (2021) использовали рыночные заявки.
Предшествующая литература часто рассматривает относительно короткий торговый горизонт или весь день целиком для реализации RL. Однако аппроксимация VWAP становится трудной при использовании короткого временного окна, поскольку вариации финансовых данных на коротких интервалах зачастую незначительны. Более того, наивный подход рассмотрения всего дня целиком может перегрузить сетевую архитектуру из-за большой длины последовательности. Чтобы решить эти проблемы, мы предлагаем двухуровневый метод, повышающий точность аппроксимации дневного кумулятивного VWAP. В нашем подходе мы используем тот факт, что практики обычно применяют статистическое U-образное свойство для деления суммарной дневной заявки с целью трекинга дневного кумулятивного VWAP.
4. Описание метода
В этом разделе мы описываем наш двухуровневый подход и формулировку задачи оптимального исполнения сделок через призму обучения с подкреплением. Мы также приводим детали архитектур нейронных сетей — трансформера и LSTM — и то, как они интегрированы в предлагаемый метод.
4.1. Двухуровневый подход
Наш подход включает два этапа распределения заявок. На первом этапе мы распределяем суммарный дневной объём $O$ по $L$ интервалам. На втором этапе мы дополнительно делим заявки каждого интервала на более мелкие исполняемые заявки с помощью RL. Подход начинается с разбиения торговых часов дня на $L$ интервалов. Для каждого интервала $l$ обозначим через $O^l$ суммарную заявку к исполнению, так что сумма заявок по всем интервалам равна суммарной дневной заявке: $\sum_{l=0}^{L-1} O^l = O$. Мы предлагаем два метода реализации первого этапа. Наивный подход — придерживаться статистического U-образного распределения объёма торгов для каждого интервала, полученного по прошлым данным (например, историческое среднее за прошедший год). Более продвинутый метод — использовать выход (предсказанное U-образное распределение), генерируемый моделью U-shape-трансформера. В последнем случае $O^l$ вычисляется последовательно, с опорой только на рыночную информацию прошлых дней и предыдущих интервалов текущего дня. Для такого $l$-го интервала, состоящего из $T$ шагов, LSTM-модель выдаёт $O^l_t$ — число заявок к исполнению на шаге $t$, так что $\sum_{t=0}^{T-1} O^l_t = O^l$. Как только $O^l_t$ определено, оно усредняется по $I$ шагам исполнения в соответствующем $t$-м подынтервале. Иными словами, на каждом шаге исполнения, заданном каждые 5 секунд, итоговое число исполняемых заявок равно $O^l_t / I$. Выбор усреднения подкреплён нашими выводами о том, что способ распределения заявок внутри подынтервалов не даёт значимой разницы в аппроксимации VWAP, как подробно описано в разделе 5.2. Схематическая иллюстрация этой конструкции приведена на рис. 2.
4.2. MDP-формулировка оптимального исполнения
В этом разделе мы объясняем нашу формулировку оптимального исполнения сделок как марковского процесса принятия решений (MDP). MDP обычно представляется кортежем $(\mathcal{S}, \mathcal{A}, \mathcal{P}, r, \gamma)$, где $\mathcal{S}$ — пространство состояний, $\mathcal{A}$ — пространство действий, $\mathcal{P}$ — вероятность перехода, $r$ — функция вознаграждения, $\gamma$ — коэффициент дисконтирования. Наши конфигурации пространства состояний $\mathcal{S}$ и пространства действий $\mathcal{A}$ аналогичны Lin & Beling (2020). Стоит отметить, что MDP в этой работе применяется отдельно для каждого $l$-го интервала данного дня.
4.2.1. Состояние
Состояние $s^l_t \in \mathcal{S}$ состоит из публичной и приватной информации. Публичное состояние составляют топ-5 цен bid и ask вместе с соответствующими объёмами, а приватное состояние включает прошедшее время и текущий оставшийся объём к исполнению. Прошедшее время меняется от 0 до $T-1$, а текущий оставшийся объём на шаге $t$ равен $O^l - \sum_{j=0}^{t-1} O^l_j$.
4.2.2. Действие
Наша LSTM-модель выдаёт политику $\pi(\cdot|s^l_t) \in \mathbb{R}^{21}$ — дискретное категориальное распределение вероятностей. Из него сэмплируется действие $a^l_t \in \mathcal{A} := \{0, 0.1, 0.2, \cdots, 2\}$, определяющее число заявок к исполнению: $O^l_t = a^l_t \frac{O^l}{T}$. Чтобы суммарное число заявок, исполненных за весь период, равнялось $O^l$, то есть $\sum_{t=0}^{T-1} O^l_t = O^l$, мы накладываем два ограничения:
- если $\sum_{t=0}^{j} O^l_t > O^l$ для некоторого $j \in \{0, 1, 2, \cdots, T-1\}$, то $O^l_j = O^l - \sum_{t=0}^{j-1} O^l_t$;
- $O^l_{T-1}$ равно оставшемуся объёму к исполнению на последнем шаге каждого интервала (т.е. $0 \le l \le L-1$).
Эти ограничения соответствуют тому, что брокерам необходимо оперативно приобрести или ликвидировать все акции, запрошенные их клиентами.
4.2.3. Вознаграждение
Функция вознаграждения устроена так, чтобы побуждать агента (LSTM-модель) генерировать действия, дающие заявки, близкие к целевому объёму $O^{l*}_t$, — ради трекинга VWAP. Это достигается через цену, вычисленную по исполненным заявкам. Здесь $O^{l*}_t$ обозначает желаемую VWAP-заявку на шаге $t$ в $l$-м интервале, такую что $O^l = \sum_{t=0}^{T-1} O^{l*}_t$. Дневной VWAP получается как
\[ \mathrm{VWAP}_{day} = \sum_{l=0}^{L-1} \sum_{t=0}^{T-1} \frac{O^{l*}_t}{O}\, p^l_t, \tag{1} \]где $p^l_t$ — соответствующая средняя рыночная цена сделок в $t$-м подынтервале.
Наша функция вознаграждения напрямую сравнивает $O^{l*}_t$ и $O^l_t$ для данного $a^l_t$:
\[ r(a^l_t) := \begin{cases} 1 & M^l_t < 0.01 \\ 0 & 0.01 \le M^l_t < 0.05 \\ -1 & \text{иначе} \end{cases} \tag{2} \]где $M^l_t := \dfrac{|O^l_t - O^{l*}_t|}{O^{l*}_t}$.
Когда MDP определён, цель policy-based RL — найти оптимальный параметр политики $\theta^*$, т.е.
\[ \theta^* = \arg\max_{\theta} \mathbb{E}\left[ \sum_{t=0}^{T} \gamma^t r_t \,\Big|\, a_t \sim \pi_\theta(\cdot|s_t),\ s_{t+1} \sim \mathcal{P}(\cdot|s_t, a_t) \right], \tag{3} \]где $r_t = r(a_t)$.
4.3. Архитектура нейронных сетей и обучение
Перейдём к архитектурным деталям моделей трансформера и LSTM и подробно опишем, как они используются в нашем двухуровневом подходе.
4.3.1. Уровень 1: трансформер для глобальной аппроксимации U-shape
Задача модели-трансформера — последовательно предсказывать U-shape-долю для каждого интервала данного дня. Мы используем структуру энкодера и декодера трансформера, предложенную в Vaswani et al. (2017). Общая архитектура используемой нами модели-трансформера изображена на рис. 3.
U-shape-энкодер. U-shape-энкодер $E$ состоит из трансформер-энкодера и $L$ линейных слоёв, все из которых отображают в одну и ту же размерность. Этот модуль отвечает за изучение общей динамики U-образного распределения. Вход $E_{in}$ — последовательность длины $L$ из векторов, каждый из которых содержит $N$ исторических дневных долей объёма соответствующего интервала последовательности. Дни, из которых берутся эти доли, выбираются случайно. Каждый вектор последовательности обрабатывается своим линейным слоем, служащим эмбеддингом для изучения уникальных особенностей каждого интервала. После прохождения слоя эмбеддинга входная последовательность обрабатывается трансформер-энкодером, давая выход $E_{out}$.
U-shape-декодер. Пока $E$ изучает общую динамику U-образного распределения, U-shape-декодер $D$ сосредоточен на обработке ежедневных вариаций распределения. U-shape-декодер состоит из трансформер-декодера и $L$ линейных слоёв, отображающих в разные размерности. В отличие от $E$, эти линейные слои применяются к выходу трансформер-декодера.
На каждом $l$-м ($l > 0$) шаге декодирования и $E_{out}$, и кумулятивная входная последовательность подаются на вход трансформер-декодеру $D$. Обозначим кумулятивную входную последовательность как $D^l_{in} = (D^l_{in,j})_{0 \le j \le l-1}$, где $D^l_{in,j} := \mathrm{CONCAT}(D^j_{out}, h^j_{T-1})$. Здесь $D^j_{out}$ — выход $D$ на $j$-м шаге, а $h^j_{T-1}$ — последний скрытый вектор LSTM из $j$-го интервала. Выход трансформер-декодера на $l$-м шаге декодирования — вектор размерности $L + H$, который затем проходит через линейный слой, уменьшающий его размерность до $L - l$. Функция softmax применяется для предсказания долей оставшихся $L - l$ интервалов, а первые $l$ компонент дополняются нулями. Отметим, что мы используем $h^j_{T-1}$ для улавливания ежедневных вариаций U-образного распределения, поскольку он содержит специфичную для интервала информацию этого конкретного дня. Чтобы обеспечить $\sum_{l=0}^{L-1} u^l_{pred} = 1$, итоговое предсказание доли объёма $l$-го интервала вычисляется как
\[ u^l_{pred} = \left(1 - \sum_{j=0}^{l-1} u^j_{pred}\right) \cdot D^l_{out}[l]. \tag{4} \]Стоит отметить, что $D^0_{in}$ строится применением дополнительного линейного слоя, преобразующего размерность вектора со средними объёмами топ-5 bid/ask предторговых данных к $L + H$.
4.3.2. Уровень 2: LSTM для локального распределения заявок
Задача LSTM-модели — оптимально распределять заявки внутри интервалов данного дня. Структура нашей LSTM-модели, изображённая на рис. 4, аналогична Lin & Beling (2020). Получив на вход $s^l_t$, он сначала проходит через два линейных слоя со скрытой размерностью 128, после чего конкатенируется с $a^l_{t-1}$ и $r^l_{t-1} := r(a^l_{t-1})$. Полученный вектор обрабатывается LSTM-ячейкой со скрытой размерностью $H$ для получения $h^l_t$, который затем отдельно проходит через два линейных слоя, порождая политику $\pi(\cdot|s^l_t)$ и ценность $V(s^l_t)$ соответственно. Заметим, что вектор $h^l_{T-1}$, полученный на последнем шаге, используется как вход трансформер-декодера. Действие $a^l_t$, вознаграждение $r^l_t$ и число заявок к исполнению $O^l_t$ вычисляются, как описано в разделе 4.2. LSTM-ячейка также получает на вход $h^l_{t-1}$ и $c^l_{t-1}$, а её выход включает и $c^l_t$.
4.3.3. Процедура обучения
U-shape-трансформер. Поскольку цель первого уровня распределения заявок — аппроксимировать U-образное распределение, одновременно отслеживая дневной кумулятивный VWAP, обучающая цель модели-трансформера — минимизировать
\[ J_{TF} := \mathbb{E}_{days}\left[ \frac{c_1}{L} \sum_{l=0}^{L-1} \left( u^l_{true} - u^l_{pred} \right)^2 + c_2\, VAA \right] \tag{5} \]где $c_1$ и $c_2$ — коэффициенты, а
\[ VAA := \left| \frac{MP_{day} - \mathrm{VWAP}_{day}}{\mathrm{VWAP}_{day}} \right| \]обозначает точность аппроксимации VWAP (VWAP Approximation Accuracy, VAA), которую мы далее используем как общую метрику качества в экспериментах, и
\[ MP_{day} := \sum_{l=0}^{L-1} \sum_{t=0}^{T-1} \frac{O^l_t}{O}\, p^l_t \]— цена, полученная нашей моделью. Это одна из мер, используемых на практике для оценки того, насколько близко трейдер торговал к своему бенчмарку — VWAP. Если трейдер торговал по цене, в точности равной VWAP, то $VAA = 0$; чем ниже VAA, тем лучше. Первое слагаемое под матожиданием в (5) учит делать предсказания долей ближе к истинным значениям. Второе слагаемое штрафует модель-трансформер, если итоговая дневная цена приобретения, порождённая комбинацией трансформера и LSTM, отклоняется от дневного VWAP. Основная задача U-shape-трансформера на первом уровне — точно распределить суммарную дневную заявку. Однако опоры только на первое слагаемое функции потерь может быть недостаточно для этой цели: $u^l_{true}$ не учитывает локальную информацию, такую как LOB, что может затруднить точный трекинг дневного VWAP. Более того, если учитывать только первое слагаемое в (5), каркас обучения с подкреплением не влиял бы на первый уровень, что привело бы к независимой работе первого и второго уровней. Чтобы микроинформация оказывала должное влияние на первый уровень, мы включаем в функцию потерь второе слагаемое.
LSTM. Для поиска оптимального параметра $\theta$ LSTM-модели мы используем PPO-алгоритм в стиле actor-critic (Schulman et al. (2017)) — один из самых популярных on-policy RL-алгоритмов — в качестве базового обучателя. Одно из главных преимуществ PPO в этой задаче — способность адаптироваться к меняющимся рыночным условиям и эффективно учиться на зашумлённых многомерных данных. Алгоритм использует функцию потерь актора $J^{CLIP}_{PPO}(\theta)$ и функцию потерь критика $J^{VF}_{PPO}(\theta)$, определяемые следующим образом:
\[ J^{CLIP}_{PPO}(\theta) := \mathbb{E}_t\left[ \min\left( q_t(\theta)\hat{A}_t,\ \mathrm{clip}(q_t(\theta), 1-\varepsilon, 1+\varepsilon)\hat{A}_t \right) \right], \tag{6} \]и
\[ J^{VF}_{PPO}(\theta) = \mathbb{E}_t\left[ \left( V^{targ}_t - V_\theta(s_t) \right)^2 \right], \tag{7} \]где $q_t(\theta) = \dfrac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$,
\[ V^{targ}_t = \sum_{k=t}^{T-1} \gamma^{k-t} r_k \quad\text{и}\quad \hat{A}_t = V^{targ}_t - V_\theta(s_t). \tag{8} \]Цель PPO — найти параметр $\theta$, максимизирующий основную целевую функцию $J_{PPO}(\theta)$, определяемую как
\[ J_{PPO}(\theta) = J^{CLIP}_{PPO}(\theta) - c_3 J^{VF}_{PPO}(\theta) + c_4\, \mathbb{E}_t[S[\pi_\theta](s_t)], \tag{9} \]где $c_3, c_4$ — коэффициенты, а $\mathbb{E}_t[S[\pi_\theta](s_t)]$ — энтропийное слагаемое, где $S[\pi_\theta](s_t)$ определяется как
\[ S[\pi_\theta](s_t) := -\sum_{a \in \mathcal{A}} \pi_\theta(a|s_t) \log \pi_\theta(a|s_t). \tag{10} \]Включая энтропийное слагаемое, PPO может стимулировать агента исследовать альтернативные действия, предотвращать застревание в субоптимальных политиках и смягчать переобучение на тренировочных данных (Williams, 1992; Mnih et al., 2016). Для поиска параметра $\theta$ PPO итеративно собирает эпизоды и обновляет параметр $\theta$ по схеме
\[ \theta_{k+1} = \arg\max_{\theta} \mathbb{E}_s\, \mathbb{E}_{a \sim \pi_{\theta_k}(\cdot|s)}\left[ J_{PPO}(\theta) \right], \tag{11} \]где $k$ обозначает $k$-й шаг. Оператор «clip» в (6) позволяет PPO учиться на прошлом опыте, не становясь чрезмерно зависимым от него. Более того, PPO может эффективно сохранять знания из прошлого опыта, одновременно приобретая инсайты из нового. Это ключевое свойство PPO — одно из его существенных преимуществ.
5. Эксперименты
Наш двухуровневый подход значительно повышает точность и устойчивость трекинга дневного кумулятивного VWAP, несмотря на трудности улучшения качества RL-каркасов оптимального исполнения на относительно коротких торговых горизонтах. Кроме того, U-shape-трансформер оказывается эффективным в улавливании ежедневных вариаций U-образного распределения. В следующем разделе мы проводим серию экспериментов для проверки этих утверждений.
5.1. Настройки экспериментов
5.1.1. Реализация
Во всех наших экспериментах гиперпараметры функций потерь, длина интервалов, число суммарных заявок и торговый горизонт фиксированы и заданы следующим образом:
- коэффициенты для $J_{TF}$: $c_1 = 0.5$, $c_2 = 0.5$;
- коэффициенты для $J_{PPO}$: $c_3 = 1$, $c_4 = 0.01$;
- длины интервалов: $L = 19$, $T = 20$;
- суммарный объём заявок: $O \sim \mathcal{N}(2.5 \times 10^{-3}\mu,\ 6.25 \times 10^{-6}\sigma^2)$, где $\mu$ и $\sigma$ — среднее и стандартное отклонение суммарного дневного объёма за предыдущие шестьдесят дней соответственно;
- торговый горизонт дня: 380 минут (с открытия рынка в 09:00:00 до закрытия в 15:20:00).
Поскольку типичный день допускает 380 минут торговли, наша модель сначала берёт суммарную дневную заявку $O$ и разбивает её на $O^l$ — 19 интервалов по 20 минут каждый ($l \in [0, 18]$). Для этого первого этапа распределения мы применяем либо статистический U-shape-метод, либо модель-трансформер. Затем внутри каждого интервала LSTM-модель дополнительно подразделяет $O^l$ на 20 наборов 1-минутных подынтервалов $O^l_t$ ($t \in [0, 19]$).
В каждом из этих подынтервалов $O^l_t$ делится на равные части и исполняется за 12 шагов в предположении, что заявки исполняются каждые 5 секунд. Метод и гиперпараметры, использованные для обучения наших агентов в эксперименте, сведены в алгоритмах 1, 2 и таблице 3, расположенных в конце статьи.
Для реалистичности симуляций мы определяем $O$ с учётом волатильности дневного объёма, что отличается от большинства предыдущих работ, где он фиксирован на определённом значении. Этот выбор призван смоделировать колебания суммарных заявок, которые финансовым фирмам приходится исполнять за день, с учётом недавней статистики объёмов торгов по каждой акции. Учитывая статистику объёмов по каждой акции, мы принимаем во внимание различия суммарных заявок для разных акций, что часто встречается в реальных сценариях. Кроме того, при тестировании мы используем для нашего трансформер-энкодера только дневные истинные U-shape-доли объёма дат из обучающих данных, чтобы исключить заглядывание в будущее. Как и в предыдущих работах Nevmyvaka et al. (2006), Hendricks & Wilcox (2014), Ning et al. (2021) и Lin & Beling (2020), мы делаем в экспериментах следующие предположения:
- Мы предполагаем, что действия нашей модели влияют на рынок лишь временно и что рынок восстанавливается до равновесного уровня на следующем временном шаге.
- Комиссии и биржевые сборы игнорируются.
- Заявки нашей модели исполняются немедленно, без задержек прихода заявок.
Мы считаем эти предположения разумными, поскольку рассматриваем относительно небольшие суммарные заявки по сравнению с суммарными дневными рыночными объёмами акций.
5.1.2. Данные
Наши миллисекундные тиковые данные сделок и книги лимитных заявок (LOB) — с Корейской биржи (KRX). Мы используем дневные данные сделок и LOB по Samsung Electronics (SE), SK Hynix (SH), Kia Corporation (KC) и POSCO Holdings Inc (PH) с 1 января 2021 года по 31 декабря 2021 года. Наш выбор четырёх фирм из индекса KOSPI основан на их ликвидности и объёме торгов, а также разнообразии рыночной капитализации и отраслей. Чтобы оценить эффективность нашего подхода в зависимости от объёма торгов, мы выбрали акции с разными объёмами (см. таблицу 1). Мы делим данные на два набора: с 1 января по 30 сентября — обучающие данные, с 1 октября по 31 декабря — тестовые.
| Акция | SE | SH | KC | PH |
|---|---|---|---|---|
| Объём | 17 000K | 3 800K | 3 900K | 430K |
Таблица 1. Средний объём для каждой акции.
Миллисекундные сырые данные предобрабатываются: сначала они делятся на группы по 5 секунд, и извлекаются данные, представляющие каждый 5-секундный интервал. Мы берём последние данные LOB 5-секундного интервала для построения состояния MDP, а также 5-секундный VWAP и суммарный проторгованный объём для вычисления дневного VWAP. Статистические U-shape-показатели строятся усреднением за год U-shape-долей 20-минутных интервалов дня. Данные, используемые для генерации $D^0_{in}$ из раздела 4.3, — средние объёмы топ-5 bid/ask сырых предторговых данных (с 08:30:00 до 09:00:00).
5.1.3. Абляционное исследование
Здесь мы кратко поясняем все методы, используемые для сравнения качества в наших экспериментах. Гиперпараметры каждого метода приведены в таблице 3.
- DQN — метод, предложенный в Ning et al. (2021). Для применения этой модели мы сначала делим данный день на шесть 1-часовых интервалов, исключая последние 20 минут торговых часов, чтобы воспроизвести экспериментальную постановку Ning et al. (2021). Суммарная дневная заявка затем равномерно распределяется по часам, и DQN далее распределяет заявку по пяти подынтервалам по 12 минут. Заявки исполняются равномерно на каждом 5-секундном шаге внутри 12-минутных подынтервалов. Для честности сравнений мы оцениваем дневную цену, полученную DQN, относительно дневного кумулятивного VWAP, вычисленного без учёта последних 20 минут.
- OPD — метод, предложенный в Fang et al. (2021). Для реализации этой модели мы сначала делим данный день на десять интервалов по 38 минут и используем OPD для распределения заявок по каждому интервалу. Внутри каждого интервала распределённая заявка равномерно делится по минутам.
- PPO — метод, предложенный в Lin & Beling (2020). Для применения этой модели мы равномерно распределяем суммарную дневную заявку по каждой минуте дня, т.е. $O_j = O/380$ для всех $j \in \{1, \cdots, 380\}$, как в Lin & Beling (2020).
- (HU-)PPO использует статистический U-shape для определения $O^l$, и внутри каждого интервала распределённая заявка равномерно делится по каждой минуте, т.е. $O^l_t = O^l/20$ для всех $t \in \{0, \cdots, 19\}$, где PPO в итоге используется для распределения заявок внутри минуты.
- HUL — наш предлагаемый двухуровневый подход, использующий статистический U-shape для определения $O^l$.
- TUL — наш предлагаемый двухуровневый подход, применяющий модель-трансформер для определения $O^l$.
5.2. Результаты экспериментов
Мы тестируем наши модели, обученные на протяжении 100 000 итераций, проводя торговые симуляции в направлении покупки. Сначала мы проверяем, что использование короткого торгового горизонта для распределения заявок ухудшает качество аппроксимации дневного кумулятивного VWAP. Для этого мы исследуем, действительно ли решения, принимаемые глубоким RL в моделях PPO и (HU-)PPO, способствуют снижению VAA на тесте. Отметим, что в обеих моделях глубокий RL использует 1-минутный торговый горизонт. Поэтому мы намеренно строим наивную альтернативную версию, в которой заявки просто исполняются в первые 5 секунд 1-минутного торгового горизонта. Процедуры получения суммарной заявки для 1-минутного интервала в этих версиях те же, что и у их исходных аналогов. Рис. 5 показывает сравнение VAA на тестовых датах для (HU-)PPO, PPO и их альтернативных версий.
И (HU-)PPO, и PPO демонстрируют практически идентичное качество по сравнению со своими альтернативными версиями, что говорит о том, что в контексте VWAP использование глубокого обучения с подкреплением не даёт значимого улучшения аппроксимации, если торговый горизонт слишком короткий. Это означает, что для эффективного использования преимуществ глубокого RL в последовательном принятии решений его следует применять на более длинном торговом горизонте.
Во-вторых, мы приводим таблицу 2 и рис. 6, чтобы продемонстрировать, насколько значительно наш двухуровневый подход улучшает качество. Таблица 2 сообщает средние и стандартные отклонения VAA, полученных DQN, OPD, PPO, HUL и TUL на тестовых датах, а также процент значений, попадающих в пределы 10 б.п. Эти меры используются практиками для оценки того, насколько трейдеры торговали относительно VWAP. Наш предлагаемый двухуровневый подход демонстрирует значительные улучшения по сравнению с короткими торговыми горизонтами и одноуровневыми нейросетями. Хотя HUL временами даёт лучшую точность, TUL в целом имеет гораздо меньшее отклонение от дневного кумулятивного VWAP, чем все остальные методы. Особенно для акции PH, относительно менее ликвидной по сравнению с другими, DQN и PPO показывают лучшие средние и стандартные отклонения, чем HUL. Однако TUL превосходит обе модели и демонстрирует лучшие значения среднего и стандартного отклонения. Гистограммы распределений VAA для DQN, OPD, PPO, HUL и TUL на тестовых данных каждой акции изображены на рис. 7, который показывает тенденцию кластеризации точностей, порождаемых TUL.
| Акция | Метрика | OPD | DQN | PPO | HUL | TUL |
|---|---|---|---|---|---|---|
| SE | Среднее | 26.27 | 11.53 | 12.00 | 8.77 | 7.13 |
| Ст. отклонение | 18.50 | 8.84 | 8.88 | 7.17 | 2.44 | |
| % в 10 б.п. | 25.00 | 57.38 | 49.18 | 65.57 | 88.52 | |
| SH | Среднее | 38.55 | 21.62 | 22.57 | 7.13 | 7.65 |
| Ст. отклонение | 24.90 | 17.71 | 16.92 | 2.81 | 3.63 | |
| % в 10 б.п. | 10.42 | 30.00 | 25.00 | 91.67 | 88.33 | |
| KA | Среднее | 27.79 | 13.16 | 12.47 | 6.59 | 6.03 |
| Ст. отклонение | 18.76 | 10.25 | 11.55 | 8.36 | 3.30 | |
| % в 10 б.п. | 18.75 | 46.67 | 56.67 | 90.00 | 86.67 | |
| PH | Среднее | 32.44 | 14.84 | 14.64 | 22.52 | 12.27 |
| Ст. отклонение | 20.89 | 13.47 | 12.63 | 47.11 | 7.90 | |
| % в 10 б.п. | 18.75 | 40.98 | 40.98 | 32.79 | 44.26 |
Таблица 2. Сводка средних, стандартных отклонений и процента VAA в диапазоне [0, 10 б.п.]. Среднее и стандартное отклонение представлены в базисных пунктах (б.п.), «% в 10 б.п.» — в процентах. Для OPD мы исключили VAA выше 80-го перцентиля для честности сравнений, поскольку наш обучающий набор был меньше, чем в Fang et al. (2021).
Наконец, мы демонстрируем эффективность предлагаемого U-shape-трансформера с помощью рис. 8 и 9. Рис. 8 показывает графики истинных и предсказанных трансформером U-shape-значений, где значения U-shape-долей для каждого 20-минутного интервала усреднены по всем тестовым датам. Мы наблюдаем, что наш U-shape-трансформер способен в среднем следовать U-образному паттерну тестовых дат для всех акций, что согласуется с сопоставимым (а иногда и лучшим) качеством TUL относительно HUL. Это дополнительно подкрепляется тем, что HUL использует только средние U-shape-доли прошлого, тогда как TUL точно аппроксимирует U-образное распределение тестовых дат и использует предсказанные значения для распределения заявок. Таким образом, TUL становится более адаптивным в трекинге дневного кумулятивного VWAP, поскольку включает предсказания флуктуаций, которые могут появиться в U-образном распределении в будущем.
Мы также подтверждаем улучшения качества TUL по сравнению с другими моделями, в частности HUL, исследуя способность TUL улавливать дневные флуктуации U-shape. Рис. 9 показывает истинное U-образное распределение и распределения, предсказанные трансформером, для двух выбранных тестовых дат акции PH. Мы намеренно выбираем PH, поскольку выигрыш TUL относительно HUL был наибольшим именно для этой акции, чьи дневные распределения объёма из-за относительно низкой ликвидности сильнее всего отклоняются от среднего. Хотя U-shape-трансформер может изредка делать ошибочные предсказания, он быстро корректирует себя и адаптируется к изменениям дневного распределения объёма, стремясь точно следовать изменениям долей в течение дня.
6. Заключение
В этом исследовании мы предлагаем двухуровневый подход к задаче точного и устойчивого трекинга VWAP. Наша модель уникальна тем, что учитывает хорошо известный U-образный внутридневной паттерн торговли. На первом этапе мы распределяем число заявок к исполнению по интервалам с учётом U-образного паттерна. Мы рассматриваем два метода реализации первого этапа: статистический U-shape и U-shape-трансформер. Наивный подход с использованием статистического U-образного распределения улучшает качество. Однако наши эксперименты демонстрируют, что U-shape-трансформер работает ещё лучше. После того как суммарные дневные заявки распределены по интервалам на первом этапе, LSTM-модель используется на втором этапе для определения того, как заявки каждого интервала должны исполняться. Результаты наших симуляций показывают, что двухуровневый подход устойчиво и точно отслеживает дневной кумулятивный VWAP.
Алгоритмы и гиперпараметры
Алгоритм 1. Двухуровневая нейронная сеть
Require: число внешних итераций outer_iterations и num_days
Случайно инициализировать обучаемые параметры θ_E, θ_D и θ_L
Инициализировать буфер траекторий T
for j = 1 to outer_iterations do
for d = 1 to num_days do
Случайно выбрать дату из обучающего набора
μ ← среднее дневного объёма за последние 60 дней
σ ← стандартное отклонение дневного объёма за последние 60 дней
T ← T ∪ GatheringEpisodes(date, μ, σ)
end for
Используя T, обновить E, D, оптимизируя функцию потерь J_TF из (5) по θ_E и θ_D
Оптимизировать функцию потерь J_PPO из (9) по θ_L
T ← ∅
end for
Алгоритм 2. Сбор эпизодов (Gathering Episodes)
Require: число интервалов в дне L
Input: Date, μ, σ
Output: буфер траекторий i-го дня T_i
Инициализировать T_i
O ~ N(2.5 × 10⁻³ μ, 6.25 × 10⁻⁶ σ²)
E_out = E(E_in)
for l = 0 to L − 1 do
if l = 0 then
Построить D⁰_in из сырых предторговых данных
else
Dˡ_in ← Dˡ⁻¹_in ∪ Concat(Dˡ⁻¹_out, h^{l−1}_{T−1})
end if
Получить uˡ_pred и Dˡ_out процедурой из раздела 4.3.1
Oˡ ← O · uˡ_pred
Получить τˡ = {sˡ_t, aˡ_t, r(aˡ_t), V(sˡ_t), π(aˡ_t|sˡ_t), Oˡ_t}_{t∈{0,1,2,···,T−1}} и hˡ_{T−1}
процедурой из раздела 4.3.2
T_i ← T_i ∪ τˡ
end for
| Гиперпараметр | DQN | OPD | PPO | HUL | TUL |
|---|---|---|---|---|---|
| Внешние итерации | 10000 | 10000 | 10000 | 10000 | 10000 |
| Внутренние итерации | 20 | 10 | 10 | 10 | 10 |
| Размер батча | 50 | 10 | 20 | 10 | 10 |
| PPO CLIP $\varepsilon$ | - | 0.2 | 0.2 | 0.2 | 0.2 |
| Коэффициент дисконтирования $\gamma$ | - | 1 | 1 | 1 | 1 |
| Число траекторий на внешнюю итерацию | 1000 | 160 | 200 | 152 | 228 |
| Скрытая размерность LSTM $H$ | - | - | 128 | 128 | 129 |
| Learning rate LSTM-модели | - | - | 5e-5↘1e-5 | 5e-5↘1e-5 | 5e-5↘1e-5 |
| Learning rate модели DQN или OPD | 1e-4 | 1e-4 | - | - | - |
| Размерность входного вектора U-shape-энкодера $N$ | - | - | - | - | 20 |
| Размерность эмбеддинга U-shape-энкодера | - | - | - | - | 148 |
| Число голов трансформер-энкодера и декодера | - | - | - | - | 4 |
| Число слоёв трансформер-энкодера и декодера | - | - | - | - | 1 |
| Размерность PFFN трансформер-энкодера и декодера | - | - | - | - | 128 |
| Learning rate модели-трансформера | - | - | - | - | 1e-3↘2e-4 |
Таблица 3. Гиперпараметры для DQN, OPD, PPO, HUL и TUL. Символ ↘ обозначает линейно затухающее расписание learning rate. Конфигурации сетей DQN и OPD следуют Ning et al. (2021) и Fang et al. (2021) соответственно.
Благодарности
Работа Ё. Хона поддержана программой Basic Science Research Program Национального исследовательского фонда Кореи (NRF), финансируемой Министерством образования (NRF-2021R1A2C1093579) и правительством Кореи (MSIT) (№ 2022R1A4A3033571).
Литература
- Almgren, R., & Chriss, N. (2001). Optimal execution of portfolio transactions. Journal of Risk, 3, 5–40.
- Berkowitz, S. A., Logue, D. E., & Noser Jr, E. A. (1988). The total cost of transactions on the NYSE. The Journal of Finance, 43, 97–112.
- Bertsimas, D., & Lo, A. W. (1998). Optimal control of execution costs. Journal of Financial Markets, 1, 1–50.
- Bialkowski, J., Darolles, S., & Fol, G. L. (2008). Improving VWAP strategies: A dynamic volume approach. Journal of Banking & Finance, 32, 1709–1722.
- Fang, Y., Ren, K., Liu, W., Zhou, D., Zhang, W., Bian, J., Yu, Y., & Liu, T.-Y. (2021). Universal trading for order execution with oracle policy distillation. In Proceedings of the AAAI Conference on Artificial Intelligence (pp. 107–115). volume 35.
- Goodhart, C. A., & O’Hara, M. (1997). High frequency data in financial markets: Issues and applications. Journal of Empirical Finance, 4, 73–114.
- Hendricks, D., & Wilcox, D. (2014). A reinforcement learning extension to the Almgren-Chriss framework for optimal trade execution. In 2014 IEEE Conference on Computational Intelligence for Financial Engineering & Economics (CIFEr) (pp. 457–464). IEEE.
- Huberman, G., & Stanzl, W. (2005). Optimal liquidity trading. Review of Finance, (pp. 165–200).
- Jain, P. C., & Joh, G.-H. (1988). The dependence between hourly prices and trading volume. The Journal of Financial and Quantitative Analysis, 23, 269–283.
- Kakade, S. M., Kearns, M., Mansour, Y., & Ortiz, L. E. (2004). Competitive algorithms for VWAP and limit order trading. In Proceedings of the 5th ACM Conference on Electronic Commerce (pp. 189–198).
- Lin, S., & Beling, P. A. (2019). Optimal liquidation with deep reinforcement learning. In Proceedings of the 33rd Conference on Neural Information Processing Systems, Deep Reinforcement Learning Workshop, Vancouver, Canada.
- Lin, S., & Beling, P. A. (2020). An end-to-end optimal trade execution framework based on proximal policy optimization. In IJCAI (pp. 4548–4554).
- Mnih, V., Badia, A. P., Mirza, M., Graves, A., Lillicrap, T., Harley, T., Silver, D., & Kavukcuoglu, K. (2016). Asynchronous methods for deep reinforcement learning. In International Conference on Machine Learning (pp. 1928–1937). PMLR.
- Mnih, V., Kavukcuoglu, K., Silver, D., Graves, A., Antonoglou, I., Wierstra, D., & Riedmiller, M. (2013). Playing Atari with deep reinforcement learning. arXiv:1312.5602. NIPS Deep Learning Workshop 2013.
- Nevmyvaka, Y., Feng, Y., & Kearns, M. (2006). Reinforcement learning for optimized trade execution. In Proceedings of the 23rd International Conference on Machine Learning (pp. 673–680).
- Ning, B., Lin, F. H. T., & Jaimungal, S. (2021). Double deep Q-learning for optimal execution. Applied Mathematical Finance, 28, 361–380.
- Pan, F., Zhang, T., Luo, L., He, J., & Liu, S. (2022). Learn continuously, act discretely: Hybrid action-space reinforcement learning for optimal execution. In IJCAI (pp. 3912–3918).
- Podobnik, B., Horvatic, D., Petersen, A. M., & Stanley, H. E. (2009). Cross-correlations between volume change and price change. Proceedings of the National Academy of Sciences, 106, 22079–22084.
- Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347.
- Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30.
- Watkins, C. J., & Dayan, P. (1992). Q-learning. Machine Learning, 8, 279–292.
- Williams, R. J. (1992). Simple statistical gradient-following algorithms for connectionist reinforcement learning. Reinforcement Learning, (pp. 5–32).
Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2307.10649 · Kim, Kim, Sul, Hong · CC BY 4.0.