Select and Trade: к единому парному трейдингу с иерархическим обучением с подкреплением
Weiguang Han, Boyi Zhang, Min Peng, Qianqian Xie, Yanzhao Lai, Jimin Huang
Wuhan University, Wuhan, Hubei, China · University of Manchester, Manchester, United Kingdom · Southwest Jiaotong University, Chengdu, Sichuan, China · Chancefocus AMC, Shanghai, China · 5 февраля 2023
Оригинал: Han, W. et al. «Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning», v2 — arxiv.org/abs/2301.10724 (PDF).
Рис. 1–5 воспроизведены из оригинальной публикации.
Ключевые слова: pair trading, hierarchical reinforcement learning, pair selection, automatic trading
arXiv: q-fin.CP · CCS: Applied computing → Forecasting; Computing methodologies → Partially-observable Markov decision processes
Аннотация
Парный трейдинг — одна из наиболее эффективных стратегий статистического арбитража, стремящаяся к нейтральной по рынку прибыли путём хеджирования выбранной пары активов. Существующие методы обычно разбивают задачу на два независимых этапа: отбор пары и торговлю. Однако разделение двух тесно связанных подзадач блокирует распространение информации и ограничивает суммарную производительность. При отборе пары игнорирование торговой результатности приводит к выбору активов с нерелевантными ценовыми движениями, тогда как агент, обученный только на заранее выбранных активах, может переобучиться и не использовать информацию о других активах. В данной работе мы предлагаем парадигму автоматического парного трейдинга как единой задачи, а не двухэтапного конвейера. Мы разрабатываем иерархический фреймворк обучения с подкреплением (RL) для совместного обучения и оптимизации обеих подзадач: политика верхнего уровня выбирает два актива из всех возможных комбинаций, а политика нижнего уровня выполняет серию торговых действий. Эксперименты на реальных биржевых данных демонстрируют эффективность метода TRIALS по сравнению с существующими методами отбора пар и торговли.
1. Введение
С 1987 года парный трейдинг — базовый подход статистического арбитража — интенсивно применяется и изучается. Он является неотъемлемой частью финансового рынка и играет важную роль в повышении рыночной эффективности. На мировых рынках и для различных классов активов — акций, фьючерсов, криптовалют — парный трейдинг считается эффективным в долгосрочной перспективе. В отличие от задачи выбора портфеля с максимальной «рискованной прибылью», парный трейдинг стремится к «безрисковой прибыли» за счёт арбитража аномальных ценовых движений двух коррелированных активов. Сначала выбираются два коррелированных актива и отслеживается спред между их ценами. Если спред аномально расширяется, выполняются противоположные операции на двух активах; прибыль фиксируется, когда спред возвращается к обычному уровню. Например, если цена Google обычно на $2 выше Facebook, а внезапно — на $5, стратегия продаёт Google (ожидая падения) и покупает Facebook (ожидая роста), закрывая позиции при возврате спреда к $2. Суммарная доходность зависит только от спреда и слабо связана с общерыночными рисками благодаря хеджированию.
Тем не менее успех зависит от двух факторов: (1) выбранная пара должна быть пригодна для парного трейдинга — спред с выраженным mean reversion и достаточной волатильностью; (2) гибкий агент, способный отличать аномальные изменения спреда от обычных колебаний.
Традиционные методы делят процесс на два этапа: отбор пары и торговлю. Для отбора применяют заранее заданные статистические тесты или метрики расстояния по историческим ценам — например, тест коинтegrации. После выбора пары торговля ведётся по правилам с фиксированными порогами. Недавно RL показал значительное улучшение над классическими методами при обучении гибкого торгового агента.
Однако существующие подходы имеют недостатки. Разделение отбора и торговли препятствует потоку информации между этапами. При отборе пары model-free метрики не учитывают будущую торговую производительность: оптимальная пара с минимальным евклидовым расстоянием может иметь нулевой спред и отсутствие торговых возможностей. Необходимо динамически обучать меру будущей прибыльности пар из данных. При торговле агент переобучается на заранее выбранной паре, не видя других активов и рынка в целом; на новых данных производительность может резко падать.
Несмотря на необходимость совместного моделирования обеих фаз, ранее таких попыток не было. Мы предлагаем новую парадигму автоматического парного трейдинга, формулируя двухэтапный процесс как единую задачу. Подход должен одновременно выбирать торговую пару на formation period и торговать ею на последующем trading period, оптимизируя торговую производительность. Это создаёт две трудности: (1) представить последовательный процесс «сначала отбор, затем торговля»; (2) полностью использовать сложные связи между отбором и торговлей — отбор задаёт вход торговли, торговля возвращает прибыль как выход отбора.
Для решения мы разрабатываем фреймворк TRIALS на основе feudal hierarchical reinforcement learning (FHRL): политика верхнего уровня (manager) отвечает за отбор пары, политика нижнего уровня (worker) — за торговлю. Агент сначала выбирает пару из всех комбинаций активов, затем выполняет серию торговых действий. Для manager состояния — исторические ценовые признаки активов на formation period; опции — все возможные пары; награда — суммарная производительность worker на trading period. Для worker при выбранной опции (например, Google и Facebook) состояния включают ценовые признаки двух активов и торговую информацию (исторические действия, cash, текущая чистая стоимость); действия — long, short и clear; награда — производительность на formation period. Награды manager и worker вычисляются на trading и formation period соответственно, но обе генерируются одним worker, что позволяет совместно оптимизировать оба уровня: manager выбирает пары по торговой результатности на новых данных, worker учится на разных парах и захватывает общие прибыльные паттерны.
Эксперименты на рынках США и Китая подтверждают превосходство TRIALS над методами отбора и торговли.
Наши вклады:
- Мы впервые формулируем парный трейдинг как единую задачу, объединяющую отбор пары и торговлю; для оптимизации суммарной производительности необходимо одновременно учитывать оба этапа.
- Мы разрабатываем end-to-end иерархический фреймворк на базе feudal HRL для совместной оптимизации high-level политики отбора и low-level политики торговли.
- Эксперименты на рынках США и Китая демонстрируют эффективность метода по сравнению с существующими подходами.
2. Обзор литературы
2.1. Традиционный отбор пар
Методы отбора пар ищут два актива, чьи цены исторически двигались вместе на formation period, предполагая mean reversion спреда в будущем. Применяются статистические или фундаментальные метрики сходства по историческим ценам. Distance approach использует сумму квадратов евклидовых расстояний (SSD) между ценовыми рядами. Идеальная пара в model-free методах — два актива с идентичным движением цен и нулевым спредом, то есть без торговых возможностей. Другие методы моделируют торгуемость пары через тест коинтegrации Engle–Granger: линейная регрессия по ценовым рядам с ожиданием стационарности остатка.
Однако mean-reverting свойства спреда в будущем могут не коррелировать с исторической силой mean reversion, что ограничивает торговую производительность. Методы с нейросетями измеряли прибыль отдельных активов, а не пар, что затрудняет подбор согласованной пары. Наиболее близкая работа рассматривает парный трейдинг как единую задачу управления портфелем, но метрика на основе исторического спреда страдает от той же проблемы.
2.2. Обучение с подкреплением для парного трейдинга
После отбора пары генерируются торговые сигналы — противоположные действия на двух активах в trading period. Классические методы используют пороговые правила относительно исторического среднего спреда, что требует экспертных знаний для выбора порогов на меняющемся рынке.
Вдохновлённые успехом RL в финансовой торговле, предыдущие работы применяли RL для обучения гибкого агента после отбора пары традиционными методами: Q-Learning для оптимизации торговых параметров, deep Q-network для порога коинтegrационного подхода, детекция структурных сдвигов, прямое RL-обучение агента, stop-loss границы. Эти методы показывают преимущества RL, но сохраняют традиционный отбор пар по исторической производительности; агент переобучается на единственной наблюдаемой паре. Ранее не было попыток совместно обучать отбор и торговлю.
2.3. Иерархическое обучение с подкреплением
Для иерархического RL (HRL) предложено множество подходов. Feudal framework — популярный вариант: action space политики верхнего уровня состоит из sub-goals (подзадач), а нижний уровень достигает заданной sub-goal. Разные временные масштабы обеспечивают эффективное credit assignment; подзадачи упрощают обучение и структурируют exploration. В предыдущих работах low-level политика обучалась на handcrafted sub-goals, discovered options или intrinsic rewards, high-level — на extrinsic rewards. Feudal HRL помогает моделировать сложные задачи, недоступные обычному RL.
Парный трейдинг из двух связанных этапов традиционно решается как двухшаговый конвейер с разными методами на каждом шаге, что блокирует информацию и накапливает ошибки. Нашей работе впервые применяется HRL для end-to-end обучения и inference в парном трейдинге.
3. Иерархический фреймворк парного трейдинга
В этом разделе описывается предложенный иерархический фреймворк (рис. 1).
3.1. Формализация
Парный трейдинг состоит из двух шагов: отбор пары и торговля. На этапе отбора выбираются два коррелированных актива из всех комбинаций; затем выполняется серия торговых действий для получения market-neutral прибыли. Цель — максимизировать торговую прибыль выбранной пары, что требует оптимального отбора и корректных торговых решений.
В отличие от предыдущих подходов, мы совместно обучаем отбор и торговлю в едином иерархическом фреймворке. Заданы formation period с $T_F$ временными точками $\{0, 1, \ldots, T_F - 1\}$, trading period с $T_T$ точками $\{0, 1, \ldots, T_T - 1\}$ и $N$ активов $\mathcal{X} = \{x_1, x_2, \ldots, x_N\}$. Для каждого актива $x \in \mathcal{X}$ — ценовые ряды на formation и trading period: $\{p_0^x, p_1^x, \ldots, p_{T_F-1}^x\}$ и $\{p_0^x, p_1^x, \ldots, p_{T_T-1}^x\}$.
Процесс формализуется как feudal hierarchical RL (рис. 2): два контроллера — manager (верхний уровень) и worker (нижний). Manager задаёт option, максимизирующую extrinsic reward; worker guided intrinsic reward — sub-goal manager при выбранной option. Декомпозиция позволяет удовлетворять требованиям на нескольких уровнях для сложных задач, недоступных централизованному RL.
High-level controller (manager) отвечает за отбор двух активов как пары и максимизацию их торговой производительности. Пара должна давать наибольшую прибыль среди всех комбинаций; extrinsic reward manager — прибыль выбранной пары на trading period.
Для достижения оптимальной прибыли необходима подзадача последовательных торговых решений на выбранной паре. Low-level controller (worker) фокусируется на обучении гибкой прибыльной торговой политики; intrinsic reward — прибыль пары на formation period. После обучения worker на исторических данных formation period он используется для торговли на новых данных trading period, формируя extrinsic reward manager.
3.2. Отбор пар с контроллером верхнего уровня
Отбор оптимальной пары из всех возможных комбинаций формулируется как contextual bandit $\mathcal{M} = (\mathcal{S}^h, \mathcal{O}, \mathcal{T}^h, \mathcal{R}^h, \Psi, Q^h)$ над options, где $\mathcal{S}^h$ — пространство состояний, $\mathcal{O}$ — пространство options, $\mathcal{T}^h$ — переходы, $\mathcal{R}^h$ — награда, $\Psi$ — наблюдаемое состояние из текущего $s^h \in \mathcal{S}^h$ и option $o \in \mathcal{O}$ по распределению $Q^h(s^h, o)$. Отбор — одношаговое решение: агент выбирает option $o_0 \in \mathcal{O}$ при состоянии $s_0^h$, переход $s_0^h \to s_1^h$ с вероятностью $\mathcal{T}(s_1^h \mid s_0^h, o_0)$. После выбора option запускается low-level POMDP (worker).
3.2.1. Наблюдение
Агент high-level contextual bandit наблюдает ограниченную информацию о рынке — ценовые признаки активов в истории. Наблюдение $v_0 \in \Psi$ с вероятностью $Q(s_0^h, o_0)$ — price features всех активов $x \in \mathcal{X}$ на каждом шаге $t \in \mathcal{T}_F$ formation period: open price $p_{x,t}^o$, close price $p_{x,t}^c$ и volume $vol_{x,t}$.
3.2.2. Option
Option $o$ — пара $(x_i, x_j)$ из всех комбинаций активов в $\mathcal{X}$. По завершении low-level POMDP агент выбирает следующую option по high-level contextual bandit.
3.2.3. Состояние
По наблюдению $v_0^h$ (open, close, volume для каждого $x \in \mathcal{X}$ на $t \in \mathcal{T}_F$) применяется Bi-directional GRU (Bi-GRU) для захвата временных корреляций. Предыдущее скрытое состояние $\overrightarrow{h}_{t-1}$ — для forward GRU, следующее $\overleftarrow{h}_{t+1}$ — для backward GRU. Цены активов обладают сильной автокорреляцией; моделирование связей из прошлого и будущего помогает захватить значимую информацию. Латентное состояние:
\[ \overrightarrow{h}_t = \mathrm{GRU}(v_{0,t}^h, \overrightarrow{h}_{t-1}),\quad \overleftarrow{h}_t = \mathrm{GRU}(v_{0,t}^h, \overleftarrow{h}_{t+1}),\quad h_t = [\overrightarrow{h}_t; \overleftarrow{h}_t] \tag{1} \]где $h_t \in \mathbb{R}^{d_h}$ — конкатенация forward и backward hidden states, $d_h$ — размерность скрытого слоя, $v_{0,t}^h \in \mathbb{R}^{N \times 3}$ — price features всех активов на шаге $t \in \mathcal{T}_F$.
Bi-GRU страдает от проблемы забывания на длинных интервалах (тысячи шагов formation period). Вводится temporal attention для динамического выбора значимой информации:
\[ \alpha_k = \frac{\exp(\mathrm{score}(h_{T_F}, h_k))}{\sum_{k'=0}^{T_F-1} \exp(\mathrm{score}(h_{T_F}, h_k'))},\quad c_{T_F} = \sum_k \alpha_k h_k \tag{2} \] \[ \hat{h}_{T_F} = \mathrm{LayerNorm}(\mathrm{LeakyReLU}(W_c [h_{T_F}; c_{T_F}])) \tag{3} \]где $\mathrm{score}(h_{T_F}, h_k) = \dfrac{h_{T_F}^\top h_k}{\sqrt{d_h}}$ — scaled dot-product attention. LeakyReLU и LayerNorm стабилизируют динамику скрытых состояний. Финальный выход $\hat{h}_{T_F} \in \mathbb{R}^{N \times d_h}$ используется как состояние $s_0^h \in \mathbb{R}^{N \times d_h}$ high-level contextual bandit.
3.2.4. Политика
Стохастическая политика отбора пар $\mu : \mathcal{S} \to \mathcal{O}$ — распределение вероятностей над options:
\[ o_0 \sim \mu(o_0 \mid s_0^h) = \mathrm{softmax}(\mathrm{triu}(s_0^h s_0^{h\top})) \tag{4} \]где $\mathrm{triu}$ извлекает верхний треугольник матрицы (уникальные пары без дублирования).
3.2.5. Награда
Награда high-level contextual bandit совпадает с целью задачи — максимизация прибыли trading period при option $o_0$. Для этого используется low-level POMDP: обучение на intrinsic reward formation period, затем торговля на trading period. Как в предыдущих RL-методах торговли, максимизируется кумулятивная прибыль за $T_T$ шагов:
\[ \mathcal{R}^h = \prod_{t \in \mathcal{T}_T} (1 + R_t^h) \tag{5} \]где $R_t^h$ — доходность low-level политики (подробности ниже).
3.3. Торговля с контроллером нижнего уровня
После выбора торговой пары high-level controller low-level controller выполняет серию торговых действий на trading period. Процесс формулируется как Partially Observable Markov Decision Process (POMDP) $\mathcal{M} = (\mathcal{S}^l, \mathcal{A}, \mathcal{T}^l, \mathcal{R}^l, \Omega, Q^l)$, где $\mathcal{S}^l$ — состояния, $\mathcal{A}$ — действия, $\mathcal{T}^l$ — переходы, $\mathcal{R}^l$ — награда, $\Omega$ — частичное наблюдение из $s^l \in \mathcal{S}^l$ и $a \in \mathcal{A}$ по $Q^l(s^l, a)$. На каждом шаге агент выбирает $a_t \in \mathcal{A}$ при $s_t^l$, переход $s_t^l \to s_{t+1}^l$ с вероятностью $\mathcal{T}^l(s_{t+1}^l \mid s_t^l, a_t)$. Рыночное состояние частично наблюдаемо: доступны исторические цены, объёмы и информация о счёте (действия, cash, доходность).
3.3.1. Наблюдение
Наблюдение $v_t^l \in \Omega$ включает: (1) account features $v_t^a \in \Omega^a$ — предыдущее действие $a_{t-1}$, текущий cash $C_t$, стоимость активов $V_t$, кумулятивная прибыль (net value) $N_t$; (2) price features $v_t^p \in \Omega^p$ — open $p_{i,t}^o$, close $p_{i,t}^c$, volume $vol_{i,t}$ для каждого $i \in \{X, Y\}$. По аналогии с предыдущими работами влияние сделок агента на рынок моделируется как постоянный loss; действия не меняют price features в наблюдении.
3.3.2. Действие
На каждом шаге выполняется пара противоположных операций на двух активах. Пространство действий $\mathcal{A} = \{L, C, S\} = \{1, 0, -1\}$: $L$ (long) — long $X$ и short $Y$; $C$ (clear) — закрыть предыдущие позиции; $S$ (short) — short $X$ и long $Y$. Для разных пар назначение действий может меняться.
3.3.3. Состояние
Агент оценивает латентное рыночное состояние $s_t^l$ по истории $H_t = \{v_1^l, a_1, v_2^l, \ldots, a_{t-1}, v_t^l\}$. Применяется Bi-GRU:
\[ \overrightarrow{h}_t = \mathrm{GRU}(v_{0,t}^l, \overrightarrow{h}_{t-1}),\quad \overleftarrow{h}_t = \mathrm{GRU}(v_{0,t}^l, \overleftarrow{h}_{t+1}),\quad h_t = [\overrightarrow{h}_t; \overleftarrow{h}_t] \tag{6} \]где $v_{0,t}^l \in \mathbb{R}^{2 \times M}$ — признаки двух выбранных активов, $M$ — размерность признаков. Дискретные переменные (например, $a_{t-1}$) преобразуются в непрерывные embeddings слоем $E_a \in \mathbb{R}^{3 \times d_a}$.
Temporal attention:
\[ \alpha_k = \frac{\exp(\mathrm{score}(h_t, h_k))}{\sum_{k'=0}^{t-1} \exp(\mathrm{score}(h_t, h_k'))},\quad c_t = \sum_k \alpha_k h_k \tag{7} \] \[ \hat{h}_t = \mathrm{LayerNorm}(\mathrm{LeakyReLU}(W_c [h_t; c_t])) \tag{8} \]где $\mathrm{score}(h_t, h_k) = \dfrac{h_t^\top h_k}{\sqrt{d_h}}$. Выход $\hat{h}_t \in \mathbb{R}^{d_h}$ — состояние $s_t^l \in \mathbb{R}^{d_h}$ low-level POMDP.
3.3.4. Политика
Стохастическая политика торговли $\pi : \mathcal{S} \to \mathcal{A}$ задаёт распределение над действиями при $s_t^l$ и option $o_0$:
\[ a_t \sim \pi(a_t \mid s_t^l; o_0) = \mathrm{softmax}(W_\pi s_t^l) \tag{9} \]3.3.5. Награда
Intrinsic reward low-level controller — кумулятивная прибыль за период с $T$ шагами:
\[ \mathcal{R} = \prod_{t \in \mathcal{T}} (1 + R_t) \tag{10} \]где $R_t$ — доходность агента при действии $a_t$:
\[ R_t = a_{t-1} r_{X,t} - a_{t-1} r_{Y,t} - c \lvert a_t - a_{t-1} \rvert = a_{t-1}(r_{X,t} - r_{Y,t}) - c \lvert a_t - a_{t-1} \rvert \tag{11} \]Доходность агента нейтральна к рынку благодаря хеджированию $r_{X,t} - r_{Y,t}$. Для положительной доходности нужны оптимальная пара и точные торговые действия. При обучении formation period направляет worker; trading period даёт extrinsic reward для manager.
3.4. Обучение иерархических политик
Обновление high-level политики по Advantage Actor-Critic (A2C):
\[ \nabla_{\theta^P_h} \log \mu(o_0 \mid s_0^h; \theta_h^P) A(s_0^h; \theta_h^A) + \frac{1}{2} \nabla_{\theta_h^A} A^2(s_0^h; \theta_h^A) \tag{12} \]где $A(s_0^h; \theta_h^A) = r_1^h + \gamma V(s_1^h; \theta_h^{A-}) - V(s_0^h; \theta_h^A)$ — оценка advantage function, option $o_0$ сэмплируется из $\mu(o_0 \mid s_0^h; \theta_h^P)$.
Обновление low-level политики аналогично:
\[ \nabla_{\theta_l^P} \log \pi(a_t \mid s_t^l; o_0, \theta_l^P) A(s_t^l; \theta_l^A) + \frac{1}{2} \nabla_{\theta_l^A} A^2(s_t^l; \theta_l^A) \tag{13} \]где $A(s_t^l; \theta_l^A) = r_{t+1}^l + \gamma V(s_{t+1}^l; \theta_l^{A-}) - V(s_t^l; \theta_l^A)$, действие $a_t$ из $\pi(a_t \mid s_t^l; o_0, \theta_l^P)$.
При обучении formation period используется для обеих политик; производительность low-level на trading period — награда high-level. При evaluation и testing option и действия выводятся без exploration.
Algorithm 1: Training TRIALS
Require: N assets X, loop conditions M, N
Ensure: Model parameters θʰ = {θʰ_P, θʰ_A}, θˡ = {θˡ_P, θˡ_A}
1: Initialize parameters θʰ, θˡ for high-level and low-level controllers
2: for iteration = 1, 2, 3, ..., M do
3: Sample option o₀ from μ(o₀ | sʰ₀)
4: Select pair from X and initialize trading environment
5: for iteration = 1, 2, 3, ..., N do
6: while not reach termination condition do
7: Sample action aₜ from π(aₜ | sˡₜ; o₀)
8: Execute action, obtain next state and intrinsic reward
9: Update θˡ by Eq. (13)
10: end while
11: end for
12: Obtain extrinsic reward from pair selection environment
13: Update θʰ by Eq. (12)
14: end for
4. Эксперименты
4.1. Данные
По аналогии с предыдущими работами построен датасет из 150 акций S&P 500 за 21 год (01/02/2000–12/31/2020), 5284 торговых дня; отфильтрованы бумаги с пропусками. Дополнительно введён датасет CSI 300 (китайский рынок): 300 акций, 5088 шагов из базы CSMAR за тот же период. Статистика — в табл. 1.
| Датасет | Рынок | Период | Активов | Шагов |
|---|---|---|---|---|
| S&P 500 | США | 2000–2020 | 150 | 5284 |
| CSI 300 | Китай | 2000–2020 | 300 | 5088 |
На каждый торговый день используются open price, close price и volume; цены нормализуются логарифмом. В отличие от предыдущих методов, акции случайно разбиты на пять непересекающихся подмножеств (приложение A). Для каждого подмножества проводятся эксперименты TRIALS и baselines. Первые 90% дней — train, следующие 5% — validation, остальные 5% — test. При обучении первые 85% дней используются для совместного отбора оптимальной пары и торговли на оставшихся 5% train; модель с лучшими гиперпараметрами по validation оценивается на test. Результаты независимо сообщаются для каждого подмножества и усредняются (mean ± std). Оптимизатор RMSProp, байесовский поиск гиперпараметров; реализация на PyTorch и stable-baselines, 2× NVIDIA Tesla V100.
4.2. Базовые методы
Методы отбора пар (торговля пороговыми правилами): GGR — среднее евклидово расстояние; Cointegration — augmented Engle–Granger two-step test; Correlation — максимальная корреляция.
Методы торговли (пара отбирается коинтegrацией): Wang et al. — RL для максимизации суммарной прибыли.
4.3. Метрики
Торговая производительность на test: (1) Sharpe ratio (SR) — $(E(R_t) - R_f) / V(R_t)$, $R_f = 0{,}000085$; (2) Annualized return (AR); (3) Maximum drawdown (MDD); (4) Annualized Volatility (AV).
Для отобранных пар: average Euclidean distance (ED) — среднее евклидово расстояние исторических ценовых рядов двух активов.
4.4. Основные результаты
Табл. 2 показывает, что TRIALS достигает лучших результатов по всем метрикам на обоих рынках. Детали по подмножествам — в приложении C. TRIALS имеет наивысшие средние SR и AR: обученный агент даёт заметную прибыль при контролируемом риске. Стабильно высокая производительность на S&P 500 и CSI 300 подтверждает взаимодополняемость отбора и торговли; TRIALS также даёт наименьший средний MDD на S&P 500 и относительно низкий на CSI 300. AV отражает колебания при росте и падении; у TRIALS относительно высокая средняя AV.
Классические методы отбора (GGR, Cointegration, Correlation) существенно уступают: средний SR GGR — $-1{,}37$ и $-1{,}19$, AR отрицательна; Cointegration — SR $-1{,}83$ и $-1{,}50$; Correlation — SR $-1{,}41$ и $-1{,}37$. Предопределённые статистические тесты не выбирают оптимальную пару без учёта торговой производительности и не измеряют прибыльность даже на test data. TRIALS имеет более высокий ED при значительной прибыли — ED не коррелирует с прибыльностью.
Wang et al. с RL-агентом превосходит чистые методы отбора при той же паре коинтegrации, но ограничен неэффективным отбором и уступает TRIALS по SR.
| Метрика | S&P 500 | CSI 300 | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GGR | Coint | Corr | Wang | TRIALS | TRIALS wo TR | GGR | Coint | Corr | Wang | TRIALS | TRIALS wo TR | |
| SR ↑ | −1,37 (0,79) | −1,83 (0,27) | −1,41 (0,21) | 1,18 (0,43) | 1,84 (0,24) | 0,07 (0,16) | −1,19 (0,74) | −1,50 (0,97) | −1,37 (0,25) | 0,75 (0,68) | 1,91 (0,88) | 0,95 (0,88) |
| AR ↑ | −0,15 (0,09) | −0,36 (0,20) | −0,14 (0,05) | 0,21 (0,11) | 0,50 (0,14) | 0,01 (0,20) | −0,17 (0,11) | −0,25 (0,17) | −0,21 (0,07) | 0,24 (0,23) | 0,68 (0,51) | 0,13 (0,12) |
| MDD ↑ | −0,20 (0,08) | −0,37 (0,20) | −0,20 (0,04) | −0,09 (0,05) | −0,09 (0,01) | −0,25 (0,07) | −0,29 (0,06) | −0,29 (0,13) | −0,25 (0,06) | −0,18 (0,09) | −0,14 (0,07) | −0,12 (0,09) |
| AV ↓ | 0,13 (0,03) | 0,27 (0,20) | 0,12 (0,02) | 0,16 (0,06) | 0,22 (0,04) | 0,22 (0,04) | 0,18 (0,03) | 0,19 (0,03) | 0,17 (0,05) | 0,25 (0,07) | 0,26 (0,09) | 0,17 (0,07) |
| ED ↓ | 0,014 (5e−3) | 0,021 (0,02) | 0,007 (0,002) | 0,021 (0,02) | 0,037 (0,01) | 0,01 (4e−3) | 0,013 (6e−3) | 0,017 (8e−3) | 0,015 (8e−3) | 0,017 (8e−3) | 0,046 (0,02) | 0,02 (8e−3) |
4.5. Абlation-исследование
Для оценки вклада двух подзадач сравниваем TRIALS с абlation TRIALS wo TR — фиксированный торговый агент с предопределёнными порогами после RL-отбора пары. Совместная оптимизация даёт наивысший SR и наименьший ED. TRIALS wo TR хуже из-за смещённой информации от пороговых правил (неверная оценка mean и std спреда), но всё же превосходит parameter-free методы — важность динамического обучения меры прибыльности по торговой результатности.
На рис. 3 — вероятности отбора пар TRIALS: метод захватывает сложные связи между парами. Например, EQR (недвижимость) и ABT (химия) без прямой связи оказываются стабильно коррелированными — возможен industry spillover. На рис. 4 — temporal attention: для AAPL больший вес у последних признаков.
4.6. Кейс-стади
На рис. 5 — детали торговли (действия, позиции, прибыль) на trading period для подмножества Set 2: TRIALS, TRIALS wo TR, GGR и Wang et al. GGR и Wang et al., игнорируя торговую производительность, выбирают пары с нерелевантными движениями (NEE и MS), что ведёт к убыткам. GGR и TRIALS wo TR принимают иррациональные решения из-за неверных порогов.
TRIALS совместно обучает отбор и торговлю: учитывает информацию обо всех активах, динамически обучает меру по оптимальной торговой производительности гибкого агента. Выбрана прибыльная пара CAT–IPG с множественными торговыми возможностями, точно захваченными worker. Наблюдение множества пар заставляет worker учить общий паттерн парного трейдинга вместо переобучения на одну пару. TRIALS wo TR динамически отбирает пары, но фиксированные пороги дают смещённую информацию и менее прибыльный отбор.
5. Заключение
Мы предложили новую парадигму автоматического парного трейдинга, объединяющую отбор пары и торговлю. На её основе разработан feudal hierarchical RL с manager для отбора и worker для торговли. Manager выбирал пару из всех комбинаций для максимизации торговой производительности; worker достигал заданной option и генерировал производительность после обучения на исторических данных. Эксперименты на реальных биржевых данных подтверждают тесную связь и взаимодополняемость двух этапов; TRIALS совместно их оптимизирует и значительно превосходит существующие методы. В будущем планируется интеграция более богатых представлений активов и учёт текстовых и макроэкономических данных.
Приложение A. Подмножества акций S&P 500
Акции случайно разбиты на пять непересекающихся подгрупп рынка США (табл. 3). Аналогичные подгруппы для CSI 300 приведены в оригинале (табл. 4).
| Set | Акции |
|---|---|
| 1 | AMAT, AXP, BA, BAX, EA, EBAY, ED, EOG, GLW, IBM, IRM, LMT, MAS, MCO, MMM, MOS, NUE, PFE, PG, PPL, QCOM, RTX, SLB, SPG, SWKS, TGT, TXT, UNH, USB, WY |
| 2 | AAPL, ABT, ADSK, ALB, AMGN, APD, BLK, CAT, CDNS, CLX, COF, DE, DHI, EMR, EQR, FE, FMC, GIS, IP, IPG, JPM, MS, NEE, NEM, NTAP, NWL, ROP, ROST, TJX, VLO |
| 3 | ADBE, AES, AVY, BSX, C, CAH, CCL, CL, CMI, CTSH, DOV, DUK, EXC, F, GE, HSY, KO, KR, LUV, MRO, MSFT, NKE, PEAK, PLD, PNC, SCHW, SYY, UPS, VFC, YUM |
| 4 | A, ADM, ALL, ATVI, AZO, BMY, COST, CSCO, CVX, FCX, FDX, GS, HAL, HD, INTC, K, KIM, LEN, LOW, MCD, MMC, MRK, MSI, NVDA, PHM, STT, T, WMB, XOM, XRAY |
| 5 | AMZN, AON, APA, BAC, BBY, BEN, BK, CMCSA, CPRT, CVS, DHR, EIX, ETN, FAST, HON, HUM, MCK, MO, MTB, NLOK, PCAR, PGR, SBUX, TER, TRV, UNP, VZ, WFC, WHR, WMT |
Приложения B и C
Приложение B (Result Presentation). Приведены увеличенные версии рис. 5 с детализацией торговых действий, позиций и прибыли на trading period для Set 2 S&P 500 (TRIALS, TRIALS wo TR, GGR, Wang et al.).
Приложение C (Detail Performance). Таблицы 5 и 6 оригинала содержат полную разбивку метрик SR, AR, MDD, AV и ED по всем пяти подгруппам S&P 500 и CSI 300 для GGR, Cointegration, Correlation, Wang, TRIALS и TRIALS wo TR; усреднённые значения совпадают с табл. 2.
Литература
- [1] Saud Almahdi and Steve Y Yang. 2019. A constrained portfolio trading system using particle swarm algorithm and recurrent reinforcement learning. Expert Systems with Applications 130 (2019), 145–156.
- [2] Jimmy Lei Ba, Jamie Ryan Kiros, and Geoffrey E. Hinton. 2016. Layer Normalization. https://doi.org/10.48550/ARXIV.1607.06450
- [3] Pierre-Luc Bacon, Jean Harb, and Doina Precup. 2017. The Option-Critic Architecture. ArXiv abs/1609.05140 (2017).
- [4] Dzmitry Bahdanau, Kyunghyun Cho, and Yoshua Bengio. 2014. Neural machine translation by jointly learning to align and translate. arXiv preprint arXiv:1409.0473 (2014).
- [5] William K. Bertram. 2009. Analytic Solutions for Optimal Statistical Arbitrage Trading. ERN: Optimization Techniques; Programming Models; Dynamic Analysis (Topic) (2009).
- [6] Andrew Brim. 2020. Deep Reinforcement Learning Pairs Trading with a Double Deep Q-Network. 2020 10th Annual Computing and Communication Workshop and Conference (CCWC) (2020), 0222–0227.
- [7] Cathy W. S. Chen, Max Chen, and Shu-Yu Chen. 2014. Pairs Trading via Three-Regime Threshold Autoregressive GARCH Models. In TES.
- [8] Huafeng (Jason) Chen, Shaojun Chen, Zhuo Chen, and Feng Li. 2019. Empirical Investigation of an Equity Pairs Trading Strategy. American Finance Association Meetings (AFA) (2019).
- [9] Peter Dayan and Geoffrey E Hinton. 1992. Feudal Reinforcement Learning. In Advances in Neural Information Processing Systems, S. Hanson, J. Cowan, and C. Giles (Eds.), Vol. 5. Morgan-Kaufmann.
- [10] Binh Huu Do and Robert W. Faff. 2012. Are Pairs Trading Profits Robust to Trading Costs. Journal of Financial Research 35 (2012), 261–287.
- [11] Robert J Elliott, John Van Der Hoek*, and William P Malcolm. 2005. Pairs trading. Quantitative Finance 5, 3 (2005), 271–276.
- [12] Robert J R Elliott, John Van Der Hoek *, and W. Paul Malcolm. 2005. Pairs trading. Quantitative Finance 5 (2005), 271 – 276.
- [13] Saeid Fallahpour, Hasan Hakimian, Khalil Taheri, and Ehsan Ramezanifar. 2016. Pairs trading strategy optimization using the reinforcement learning method: a cointegration approach. Soft Computing 20, 12 (2016), 5051–5066.
- [14] Thomas G Fischer. 2018. Reinforcement learning in financial markets-a survey. Technical Report. FAU Discussion Papers in Economics.
- [15] Alexander Galenko, Elmira Popova, and Ivilina Popova. 2012. Trading in the Presence of Cointegration. The Journal of Alternative Investments 15 (2012), 85 – 97.
- [16] Evan Gatev, William N Goetzmann, and K Geert Rouwenhorst. 2006. Pairs trading: Performance of a relative-value arbitrage rule. The Review of Financial Studies 19, 3 (2006), 797–827.
- [17] Matthew Hausknecht and Peter Stone. 2015. Deep recurrent q-learning for partially observable mdps. In 2015 aaai fall symposium series.
- [18] Sepp Hochreiter and Jürgen Schmidhuber. 1997. Long short-term memory. Neural computation 9, 8 (1997), 1735–1780.
- [19] Nicolas Huck and Komivi Afawubo. 2015. Pairs trading and selection methods: is cointegration superior? Applied Economics 47 (2015), 599 – 613.
- [20] Gevorg Hunanyan. 2019. Portfolio Selection. Finanzwirtschaft, Banken und Bankmanagement I Finance, Banks and Bank Management (2019).
- [21] Musonda Katongo and Ritabrata Bhattacharyya. 2021. The use of deep reinforcement learning in tactical asset allocation. Available at SSRN 3812609 (2021).
- [22] Sang-Ho Kim, Deog-Yeong Park, and Ki-Hoon Lee. 2022. Hybrid Deep Reinforcement Learning for Pairs Trading. Applied Sciences (2022).
- [23] Taewook Kim and Ha Young Kim. 2019. Optimizing the pairs-trading strategy using deep reinforcement learning with trading and stop-loss boundaries. Complexity 2019 (2019).
- [24] Christopher Krauss. 2017. Statistical Arbitrage Pairs Trading Strategies: Review and Outlook. Journal of Economic Surveys 31, 2 (2017), 513–545. https://doi.org/10.1111/joes.12153
- [25] Christopher Krauss, Xuan Anh Do, and Nicolas Huck. 2017. Deep neural networks, gradient-boosted trees, random forests: Statistical arbitrage on the S&P 500. Eur. J. Oper. Res. 259 (2017), 689–702.
- [26] Tejas D. Kulkarni, Karthik Narasimhan, Ardavan Saeedi, and Joshua B. Tenenbaum. 2016. Hierarchical Deep Reinforcement Learning: Integrating Temporal Abstraction and Intrinsic Motivation. In NIPS.
- [27] John Langford and Tong Zhang. 2007. The Epoch-Greedy algorithm for contextual multi-armed bandits. In NIPS 2007.
- [28] John P. Lehoczky and Mark J. Schervish. 2018. Overview and History of Statistics for Equity Markets.
- [29] David A. Lesmond, Michael J. Schill, and Chunsheng Zhou. 2003. The Illusory Nature of Momentum Profits. AFA 2002 Atlanta Meetings (Archive) (2003).
- [30] Yan-Xia Lin, Michael McCrae, and Chandra Gulati. 2006. Loss protection in pairs trading through minimum profit bounds: A cointegration approach. Adv. Decis. Sci. 2006 (2006), 73803:1–73803:14.
- [31] Jing-You Lu, Hsu-Chao Lai, Wen-Yueh Shih, Yi-Feng Chen, Shengkai Huang, Hao-Han Chang, Jun-Zhe Wang, Jiun-Long Huang, and Tian-Shyr Dai. 2022. Structural break-aware pairs trading strategy using deep reinforcement learning. The Journal of Supercomputing 78 (2022), 3843 – 3882.
- [32] Giorgio Lucarelli and Matteo Borrotti. 2019. A deep reinforcement learning approach for automated cryptocurrency trading. In IFIP International Conference on Artificial Intelligence Applications and Innovations. Springer, 247–258.
- [33] Ian Martin. 2021. On the Autocorrelation of the Stock Market*. Journal of Financial Econometrics 19, 1 (01 2021), 39–52. https://doi.org/10.1093/jjfinec/nbaa033
- [34] Volodymyr Mnih, Adria Puigdomenech Badia, Mehdi Mirza, Alex Graves, Timothy Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu. 2016. Asynchronous methods for deep reinforcement learning. In International conference on machine learning. PMLR, 1928–1937.
- [35] Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Andrei A Rusu, Joel Veness, Marc G Bellemare, Alex Graves, Martin Riedmiller, Andreas K Fidjeland, Georg Ostrovski, et al. 2015. Human-level control through deep reinforcement learning. nature 518, 7540 (2015), 529–533.
- [36] Ofir Nachum, Haoran Tang, Xingyu Lu, Shixiang Shane Gu, Honglak Lee, and Sergey Levine. 2019. Why Does Hierarchy (Sometimes) Work So Well in Reinforcement Learning? ArXiv abs/1909.10618 (2019).
- [37] Shubham Pateria, Budhitama Subagdja, Ah-Hwee Tan, and Hiok Chai Quek. 2021. Hierarchical Reinforcement Learning. ACM Computing Surveys (CSUR) 54 (2021), 1 – 35.
- [38] Marcelo Scherer Perlin. 2007. M of a Kind: A Multivariate Approach at Pairs Trading. Emerging Markets: Finance (2007).
- [39] Andy Pole. 2007. Statistical Arbitrage: Algorithmic Trading Insights and Techniques.
- [40] Adrian Pope, Jaime Shinsuke Ide, Daria Mićović, Henry Diaz, David Rosenbluth, Lee Ritholtz, Jason C. Twedt, Thayne T. Walker, Kevin Alcedo, and Daniel Javorsek. 2021. Hierarchical Reinforcement Learning for Air-to-Air Combat. 2021 International Conference on Unmanned Aircraft Systems (ICUAS) (2021), 275–284.
- [41] Heni Puspaningrum, Yan-Xia Lin, and Chandra Gulati. 2010. Finding the Optimal Pre-set Boundaries for Pairs Trading Strategy Based on Cointegration Technique. Journal of Statistical Theory and Practice 4 (2010), 391–419.
- [42] Hossein Rad, Rand Kwong Yew Low, and Robert W. Faff. 2015. The Profitability of Pairs Trading Strategies: Distance, Cointegration, and Copula Methods. Wharton Research Data Services (WRDS) Research Paper Series (2015).
- [43] Abdelrhman Saleh, Natasha Jaques, Asma Ghandeharioun, Judy Hanwen Shen, and Rosalind W. Picard. 2020. Hierarchical Reinforcement Learning for Open-Domain Dialog. In AAAI.
- [44] Bobak Shahriari, Kevin Swersky, Ziyu Wang, Ryan P Adams, and Nando De Freitas. 2015. Taking the human out of the loop: A review of Bayesian optimization. Proc. IEEE 104, 1 (2015), 148–175.
- [45] William F Sharpe. 1994. The sharpe ratio. Journal of portfolio management 21, 1 (1994), 49–58.
- [46] Megan Shearer, David Byrd, Tucker Hybinette Balch, and Michael P. Wellman. 2021. Stability effects of arbitrage in exchange traded funds: an agent-based model. Proceedings of the Second ACM International Conference on AI in Finance (2021).
- [47] Tijmen Tieleman and Geoffrey Hinton. 2012. Rmsprop: Divide the gradient by a running average of its recent magnitude. coursera: Neural networks for machine learning. COURSERA Neural Networks Mach. Learn (2012).
- [48] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Ł ukasz Kaiser, and Illia Polosukhin. 2017. Attention is All you Need. In Advances in Neural Information Processing Systems, I. Guyon, U. Von Luxburg, S. Bengio, H. Wallach, R. Fergus, S. Vishwanathan, and R. Garnett (Eds.), Vol. 30. Curran Associates, Inc.
- [49] Alexander Sasha Vezhnevets, Simon Osindero, Tom Schaul, Nicolas Manfred Otto Heess, Max Jaderberg, David Silver, and Koray Kavukcuoglu. 2017. FeUdal Networks for Hierarchical Reinforcement Learning. ArXiv abs/1703.01161 (2017).
- [50] Ganapathy Vidyamurthy. 2004. Pairs Trading: quantitative methods and analysis. Vol. 217. John Wiley & Sons.
- [51] Cheng Wang, Patrik Sandås, and Peter Beling. 2021. Improving Pairs Trading Strategies via Reinforcement Learning. In 2021 International Conference on Applied Artificial Intelligence (ICAPAI). IEEE, 1–7.
- [52] Christopher JCH Watkins and Peter Dayan. 1992. Q-learning. Machine learning 8, 3-4 (1992), 279–292.
- [53] Ruobing Xie, Shaoliang Zhang, Rui Wang, Feng Xia, and Leyu Lin. 2021. Hierarchical Reinforcement Learning for Integrated Recommendation. In AAAI.
- [54] Fucui Xu and Shannon Siew Ngee. Tan. 2020. Dynamic Portfolio Management Based on Pair Trading and Deep Reinforcement Learning. 2020 The 3rd International Conference on Computational Intelligence and Intelligent Systems (2020).
Оригинал статьи: Han et al., «Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning», arXiv:2301.10724