Select and Trade: к единому парному трейдингу с иерархическим обучением с подкреплением

7/10

Weiguang Han, Boyi Zhang, Min Peng, Qianqian Xie, Yanzhao Lai, Jimin Huang

Wuhan University, Wuhan, Hubei, China · University of Manchester, Manchester, United Kingdom · Southwest Jiaotong University, Chengdu, Sichuan, China · Chancefocus AMC, Shanghai, China · 5 февраля 2023

Оригинал: Han, W. et al. «Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning», v2 — arxiv.org/abs/2301.10724 (PDF).

Рис. 1–5 воспроизведены из оригинальной публикации.

Ключевые слова: pair trading, hierarchical reinforcement learning, pair selection, automatic trading

arXiv: q-fin.CP · CCS: Applied computing → Forecasting; Computing methodologies → Partially-observable Markov decision processes

Аннотация

Парный трейдинг — одна из наиболее эффективных стратегий статистического арбитража, стремящаяся к нейтральной по рынку прибыли путём хеджирования выбранной пары активов. Существующие методы обычно разбивают задачу на два независимых этапа: отбор пары и торговлю. Однако разделение двух тесно связанных подзадач блокирует распространение информации и ограничивает суммарную производительность. При отборе пары игнорирование торговой результатности приводит к выбору активов с нерелевантными ценовыми движениями, тогда как агент, обученный только на заранее выбранных активах, может переобучиться и не использовать информацию о других активах. В данной работе мы предлагаем парадигму автоматического парного трейдинга как единой задачи, а не двухэтапного конвейера. Мы разрабатываем иерархический фреймворк обучения с подкреплением (RL) для совместного обучения и оптимизации обеих подзадач: политика верхнего уровня выбирает два актива из всех возможных комбинаций, а политика нижнего уровня выполняет серию торговых действий. Эксперименты на реальных биржевых данных демонстрируют эффективность метода TRIALS по сравнению с существующими методами отбора пар и торговли.

1. Введение

С 1987 года парный трейдинг — базовый подход статистического арбитража — интенсивно применяется и изучается. Он является неотъемлемой частью финансового рынка и играет важную роль в повышении рыночной эффективности. На мировых рынках и для различных классов активов — акций, фьючерсов, криптовалют — парный трейдинг считается эффективным в долгосрочной перспективе. В отличие от задачи выбора портфеля с максимальной «рискованной прибылью», парный трейдинг стремится к «безрисковой прибыли» за счёт арбитража аномальных ценовых движений двух коррелированных активов. Сначала выбираются два коррелированных актива и отслеживается спред между их ценами. Если спред аномально расширяется, выполняются противоположные операции на двух активах; прибыль фиксируется, когда спред возвращается к обычному уровню. Например, если цена Google обычно на $2 выше Facebook, а внезапно — на $5, стратегия продаёт Google (ожидая падения) и покупает Facebook (ожидая роста), закрывая позиции при возврате спреда к $2. Суммарная доходность зависит только от спреда и слабо связана с общерыночными рисками благодаря хеджированию.

Тем не менее успех зависит от двух факторов: (1) выбранная пара должна быть пригодна для парного трейдинга — спред с выраженным mean reversion и достаточной волатильностью; (2) гибкий агент, способный отличать аномальные изменения спреда от обычных колебаний.

Традиционные методы делят процесс на два этапа: отбор пары и торговлю. Для отбора применяют заранее заданные статистические тесты или метрики расстояния по историческим ценам — например, тест коинтegrации. После выбора пары торговля ведётся по правилам с фиксированными порогами. Недавно RL показал значительное улучшение над классическими методами при обучении гибкого торгового агента.

Однако существующие подходы имеют недостатки. Разделение отбора и торговли препятствует потоку информации между этапами. При отборе пары model-free метрики не учитывают будущую торговую производительность: оптимальная пара с минимальным евклидовым расстоянием может иметь нулевой спред и отсутствие торговых возможностей. Необходимо динамически обучать меру будущей прибыльности пар из данных. При торговле агент переобучается на заранее выбранной паре, не видя других активов и рынка в целом; на новых данных производительность может резко падать.

Несмотря на необходимость совместного моделирования обеих фаз, ранее таких попыток не было. Мы предлагаем новую парадигму автоматического парного трейдинга, формулируя двухэтапный процесс как единую задачу. Подход должен одновременно выбирать торговую пару на formation period и торговать ею на последующем trading period, оптимизируя торговую производительность. Это создаёт две трудности: (1) представить последовательный процесс «сначала отбор, затем торговля»; (2) полностью использовать сложные связи между отбором и торговлей — отбор задаёт вход торговли, торговля возвращает прибыль как выход отбора.

Для решения мы разрабатываем фреймворк TRIALS на основе feudal hierarchical reinforcement learning (FHRL): политика верхнего уровня (manager) отвечает за отбор пары, политика нижнего уровня (worker) — за торговлю. Агент сначала выбирает пару из всех комбинаций активов, затем выполняет серию торговых действий. Для manager состояния — исторические ценовые признаки активов на formation period; опции — все возможные пары; награда — суммарная производительность worker на trading period. Для worker при выбранной опции (например, Google и Facebook) состояния включают ценовые признаки двух активов и торговую информацию (исторические действия, cash, текущая чистая стоимость); действия — long, short и clear; награда — производительность на formation period. Награды manager и worker вычисляются на trading и formation period соответственно, но обе генерируются одним worker, что позволяет совместно оптимизировать оба уровня: manager выбирает пары по торговой результатности на новых данных, worker учится на разных парах и захватывает общие прибыльные паттерны.

Эксперименты на рынках США и Китая подтверждают превосходство TRIALS над методами отбора и торговли.

Наши вклады:

  1. Мы впервые формулируем парный трейдинг как единую задачу, объединяющую отбор пары и торговлю; для оптимизации суммарной производительности необходимо одновременно учитывать оба этапа.
  2. Мы разрабатываем end-to-end иерархический фреймворк на базе feudal HRL для совместной оптимизации high-level политики отбора и low-level политики торговли.
  3. Эксперименты на рынках США и Китая демонстрируют эффективность метода по сравнению с существующими подходами.

2. Обзор литературы

2.1. Традиционный отбор пар

Методы отбора пар ищут два актива, чьи цены исторически двигались вместе на formation period, предполагая mean reversion спреда в будущем. Применяются статистические или фундаментальные метрики сходства по историческим ценам. Distance approach использует сумму квадратов евклидовых расстояний (SSD) между ценовыми рядами. Идеальная пара в model-free методах — два актива с идентичным движением цен и нулевым спредом, то есть без торговых возможностей. Другие методы моделируют торгуемость пары через тест коинтegrации Engle–Granger: линейная регрессия по ценовым рядам с ожиданием стационарности остатка.

Однако mean-reverting свойства спреда в будущем могут не коррелировать с исторической силой mean reversion, что ограничивает торговую производительность. Методы с нейросетями измеряли прибыль отдельных активов, а не пар, что затрудняет подбор согласованной пары. Наиболее близкая работа рассматривает парный трейдинг как единую задачу управления портфелем, но метрика на основе исторического спреда страдает от той же проблемы.

2.2. Обучение с подкреплением для парного трейдинга

После отбора пары генерируются торговые сигналы — противоположные действия на двух активах в trading period. Классические методы используют пороговые правила относительно исторического среднего спреда, что требует экспертных знаний для выбора порогов на меняющемся рынке.

Вдохновлённые успехом RL в финансовой торговле, предыдущие работы применяли RL для обучения гибкого агента после отбора пары традиционными методами: Q-Learning для оптимизации торговых параметров, deep Q-network для порога коинтegrационного подхода, детекция структурных сдвигов, прямое RL-обучение агента, stop-loss границы. Эти методы показывают преимущества RL, но сохраняют традиционный отбор пар по исторической производительности; агент переобучается на единственной наблюдаемой паре. Ранее не было попыток совместно обучать отбор и торговлю.

2.3. Иерархическое обучение с подкреплением

Для иерархического RL (HRL) предложено множество подходов. Feudal framework — популярный вариант: action space политики верхнего уровня состоит из sub-goals (подзадач), а нижний уровень достигает заданной sub-goal. Разные временные масштабы обеспечивают эффективное credit assignment; подзадачи упрощают обучение и структурируют exploration. В предыдущих работах low-level политика обучалась на handcrafted sub-goals, discovered options или intrinsic rewards, high-level — на extrinsic rewards. Feudal HRL помогает моделировать сложные задачи, недоступные обычному RL.

Парный трейдинг из двух связанных этапов традиционно решается как двухшаговый конвейер с разными методами на каждом шаге, что блокирует информацию и накапливает ошибки. Нашей работе впервые применяется HRL для end-to-end обучения и inference в парном трейдинге.

3. Иерархический фреймворк парного трейдинга

В этом разделе описывается предложенный иерархический фреймворк (рис. 1).

Рисунок 1. Иерархический фреймворк парного трейдинга
Рисунок 1. Иерархический фреймворк парного трейдинга: high-level controller (manager) для отбора пары и low-level controller (worker) для торговли с Bi-GRU, temporal attention и A2C.

3.1. Формализация

Парный трейдинг состоит из двух шагов: отбор пары и торговля. На этапе отбора выбираются два коррелированных актива из всех комбинаций; затем выполняется серия торговых действий для получения market-neutral прибыли. Цель — максимизировать торговую прибыль выбранной пары, что требует оптимального отбора и корректных торговых решений.

В отличие от предыдущих подходов, мы совместно обучаем отбор и торговлю в едином иерархическом фреймворке. Заданы formation period с $T_F$ временными точками $\{0, 1, \ldots, T_F - 1\}$, trading period с $T_T$ точками $\{0, 1, \ldots, T_T - 1\}$ и $N$ активов $\mathcal{X} = \{x_1, x_2, \ldots, x_N\}$. Для каждого актива $x \in \mathcal{X}$ — ценовые ряды на formation и trading period: $\{p_0^x, p_1^x, \ldots, p_{T_F-1}^x\}$ и $\{p_0^x, p_1^x, \ldots, p_{T_T-1}^x\}$.

Процесс формализуется как feudal hierarchical RL (рис. 2): два контроллера — manager (верхний уровень) и worker (нижний). Manager задаёт option, максимизирующую extrinsic reward; worker guided intrinsic reward — sub-goal manager при выбранной option. Декомпозиция позволяет удовлетворять требованиям на нескольких уровнях для сложных задач, недоступных централизованному RL.

Рисунок 2. Feudal hierarchical RL
Рисунок 2. Feudal hierarchical reinforcement learning: manager получает extrinsic reward, worker — intrinsic reward; option связывает уровни.

High-level controller (manager) отвечает за отбор двух активов как пары и максимизацию их торговой производительности. Пара должна давать наибольшую прибыль среди всех комбинаций; extrinsic reward manager — прибыль выбранной пары на trading period.

Для достижения оптимальной прибыли необходима подзадача последовательных торговых решений на выбранной паре. Low-level controller (worker) фокусируется на обучении гибкой прибыльной торговой политики; intrinsic reward — прибыль пары на formation period. После обучения worker на исторических данных formation period он используется для торговли на новых данных trading period, формируя extrinsic reward manager.

3.2. Отбор пар с контроллером верхнего уровня

Отбор оптимальной пары из всех возможных комбинаций формулируется как contextual bandit $\mathcal{M} = (\mathcal{S}^h, \mathcal{O}, \mathcal{T}^h, \mathcal{R}^h, \Psi, Q^h)$ над options, где $\mathcal{S}^h$ — пространство состояний, $\mathcal{O}$ — пространство options, $\mathcal{T}^h$ — переходы, $\mathcal{R}^h$ — награда, $\Psi$ — наблюдаемое состояние из текущего $s^h \in \mathcal{S}^h$ и option $o \in \mathcal{O}$ по распределению $Q^h(s^h, o)$. Отбор — одношаговое решение: агент выбирает option $o_0 \in \mathcal{O}$ при состоянии $s_0^h$, переход $s_0^h \to s_1^h$ с вероятностью $\mathcal{T}(s_1^h \mid s_0^h, o_0)$. После выбора option запускается low-level POMDP (worker).

3.2.1. Наблюдение

Агент high-level contextual bandit наблюдает ограниченную информацию о рынке — ценовые признаки активов в истории. Наблюдение $v_0 \in \Psi$ с вероятностью $Q(s_0^h, o_0)$ — price features всех активов $x \in \mathcal{X}$ на каждом шаге $t \in \mathcal{T}_F$ formation period: open price $p_{x,t}^o$, close price $p_{x,t}^c$ и volume $vol_{x,t}$.

3.2.2. Option

Option $o$ — пара $(x_i, x_j)$ из всех комбинаций активов в $\mathcal{X}$. По завершении low-level POMDP агент выбирает следующую option по high-level contextual bandit.

3.2.3. Состояние

По наблюдению $v_0^h$ (open, close, volume для каждого $x \in \mathcal{X}$ на $t \in \mathcal{T}_F$) применяется Bi-directional GRU (Bi-GRU) для захвата временных корреляций. Предыдущее скрытое состояние $\overrightarrow{h}_{t-1}$ — для forward GRU, следующее $\overleftarrow{h}_{t+1}$ — для backward GRU. Цены активов обладают сильной автокорреляцией; моделирование связей из прошлого и будущего помогает захватить значимую информацию. Латентное состояние:

\[ \overrightarrow{h}_t = \mathrm{GRU}(v_{0,t}^h, \overrightarrow{h}_{t-1}),\quad \overleftarrow{h}_t = \mathrm{GRU}(v_{0,t}^h, \overleftarrow{h}_{t+1}),\quad h_t = [\overrightarrow{h}_t; \overleftarrow{h}_t] \tag{1} \]

где $h_t \in \mathbb{R}^{d_h}$ — конкатенация forward и backward hidden states, $d_h$ — размерность скрытого слоя, $v_{0,t}^h \in \mathbb{R}^{N \times 3}$ — price features всех активов на шаге $t \in \mathcal{T}_F$.

Bi-GRU страдает от проблемы забывания на длинных интервалах (тысячи шагов formation period). Вводится temporal attention для динамического выбора значимой информации:

\[ \alpha_k = \frac{\exp(\mathrm{score}(h_{T_F}, h_k))}{\sum_{k'=0}^{T_F-1} \exp(\mathrm{score}(h_{T_F}, h_k'))},\quad c_{T_F} = \sum_k \alpha_k h_k \tag{2} \] \[ \hat{h}_{T_F} = \mathrm{LayerNorm}(\mathrm{LeakyReLU}(W_c [h_{T_F}; c_{T_F}])) \tag{3} \]

где $\mathrm{score}(h_{T_F}, h_k) = \dfrac{h_{T_F}^\top h_k}{\sqrt{d_h}}$ — scaled dot-product attention. LeakyReLU и LayerNorm стабилизируют динамику скрытых состояний. Финальный выход $\hat{h}_{T_F} \in \mathbb{R}^{N \times d_h}$ используется как состояние $s_0^h \in \mathbb{R}^{N \times d_h}$ high-level contextual bandit.

3.2.4. Политика

Стохастическая политика отбора пар $\mu : \mathcal{S} \to \mathcal{O}$ — распределение вероятностей над options:

\[ o_0 \sim \mu(o_0 \mid s_0^h) = \mathrm{softmax}(\mathrm{triu}(s_0^h s_0^{h\top})) \tag{4} \]

где $\mathrm{triu}$ извлекает верхний треугольник матрицы (уникальные пары без дублирования).

3.2.5. Награда

Награда high-level contextual bandit совпадает с целью задачи — максимизация прибыли trading period при option $o_0$. Для этого используется low-level POMDP: обучение на intrinsic reward formation period, затем торговля на trading period. Как в предыдущих RL-методах торговли, максимизируется кумулятивная прибыль за $T_T$ шагов:

\[ \mathcal{R}^h = \prod_{t \in \mathcal{T}_T} (1 + R_t^h) \tag{5} \]

где $R_t^h$ — доходность low-level политики (подробности ниже).

3.3. Торговля с контроллером нижнего уровня

После выбора торговой пары high-level controller low-level controller выполняет серию торговых действий на trading period. Процесс формулируется как Partially Observable Markov Decision Process (POMDP) $\mathcal{M} = (\mathcal{S}^l, \mathcal{A}, \mathcal{T}^l, \mathcal{R}^l, \Omega, Q^l)$, где $\mathcal{S}^l$ — состояния, $\mathcal{A}$ — действия, $\mathcal{T}^l$ — переходы, $\mathcal{R}^l$ — награда, $\Omega$ — частичное наблюдение из $s^l \in \mathcal{S}^l$ и $a \in \mathcal{A}$ по $Q^l(s^l, a)$. На каждом шаге агент выбирает $a_t \in \mathcal{A}$ при $s_t^l$, переход $s_t^l \to s_{t+1}^l$ с вероятностью $\mathcal{T}^l(s_{t+1}^l \mid s_t^l, a_t)$. Рыночное состояние частично наблюдаемо: доступны исторические цены, объёмы и информация о счёте (действия, cash, доходность).

3.3.1. Наблюдение

Наблюдение $v_t^l \in \Omega$ включает: (1) account features $v_t^a \in \Omega^a$ — предыдущее действие $a_{t-1}$, текущий cash $C_t$, стоимость активов $V_t$, кумулятивная прибыль (net value) $N_t$; (2) price features $v_t^p \in \Omega^p$ — open $p_{i,t}^o$, close $p_{i,t}^c$, volume $vol_{i,t}$ для каждого $i \in \{X, Y\}$. По аналогии с предыдущими работами влияние сделок агента на рынок моделируется как постоянный loss; действия не меняют price features в наблюдении.

3.3.2. Действие

На каждом шаге выполняется пара противоположных операций на двух активах. Пространство действий $\mathcal{A} = \{L, C, S\} = \{1, 0, -1\}$: $L$ (long) — long $X$ и short $Y$; $C$ (clear) — закрыть предыдущие позиции; $S$ (short) — short $X$ и long $Y$. Для разных пар назначение действий может меняться.

3.3.3. Состояние

Агент оценивает латентное рыночное состояние $s_t^l$ по истории $H_t = \{v_1^l, a_1, v_2^l, \ldots, a_{t-1}, v_t^l\}$. Применяется Bi-GRU:

\[ \overrightarrow{h}_t = \mathrm{GRU}(v_{0,t}^l, \overrightarrow{h}_{t-1}),\quad \overleftarrow{h}_t = \mathrm{GRU}(v_{0,t}^l, \overleftarrow{h}_{t+1}),\quad h_t = [\overrightarrow{h}_t; \overleftarrow{h}_t] \tag{6} \]

где $v_{0,t}^l \in \mathbb{R}^{2 \times M}$ — признаки двух выбранных активов, $M$ — размерность признаков. Дискретные переменные (например, $a_{t-1}$) преобразуются в непрерывные embeddings слоем $E_a \in \mathbb{R}^{3 \times d_a}$.

Temporal attention:

\[ \alpha_k = \frac{\exp(\mathrm{score}(h_t, h_k))}{\sum_{k'=0}^{t-1} \exp(\mathrm{score}(h_t, h_k'))},\quad c_t = \sum_k \alpha_k h_k \tag{7} \] \[ \hat{h}_t = \mathrm{LayerNorm}(\mathrm{LeakyReLU}(W_c [h_t; c_t])) \tag{8} \]

где $\mathrm{score}(h_t, h_k) = \dfrac{h_t^\top h_k}{\sqrt{d_h}}$. Выход $\hat{h}_t \in \mathbb{R}^{d_h}$ — состояние $s_t^l \in \mathbb{R}^{d_h}$ low-level POMDP.

3.3.4. Политика

Стохастическая политика торговли $\pi : \mathcal{S} \to \mathcal{A}$ задаёт распределение над действиями при $s_t^l$ и option $o_0$:

\[ a_t \sim \pi(a_t \mid s_t^l; o_0) = \mathrm{softmax}(W_\pi s_t^l) \tag{9} \]

3.3.5. Награда

Intrinsic reward low-level controller — кумулятивная прибыль за период с $T$ шагами:

\[ \mathcal{R} = \prod_{t \in \mathcal{T}} (1 + R_t) \tag{10} \]

где $R_t$ — доходность агента при действии $a_t$:

\[ R_t = a_{t-1} r_{X,t} - a_{t-1} r_{Y,t} - c \lvert a_t - a_{t-1} \rvert = a_{t-1}(r_{X,t} - r_{Y,t}) - c \lvert a_t - a_{t-1} \rvert \tag{11} \]

Доходность агента нейтральна к рынку благодаря хеджированию $r_{X,t} - r_{Y,t}$. Для положительной доходности нужны оптимальная пара и точные торговые действия. При обучении formation period направляет worker; trading period даёт extrinsic reward для manager.

3.4. Обучение иерархических политик

Обновление high-level политики по Advantage Actor-Critic (A2C):

\[ \nabla_{\theta^P_h} \log \mu(o_0 \mid s_0^h; \theta_h^P) A(s_0^h; \theta_h^A) + \frac{1}{2} \nabla_{\theta_h^A} A^2(s_0^h; \theta_h^A) \tag{12} \]

где $A(s_0^h; \theta_h^A) = r_1^h + \gamma V(s_1^h; \theta_h^{A-}) - V(s_0^h; \theta_h^A)$ — оценка advantage function, option $o_0$ сэмплируется из $\mu(o_0 \mid s_0^h; \theta_h^P)$.

Обновление low-level политики аналогично:

\[ \nabla_{\theta_l^P} \log \pi(a_t \mid s_t^l; o_0, \theta_l^P) A(s_t^l; \theta_l^A) + \frac{1}{2} \nabla_{\theta_l^A} A^2(s_t^l; \theta_l^A) \tag{13} \]

где $A(s_t^l; \theta_l^A) = r_{t+1}^l + \gamma V(s_{t+1}^l; \theta_l^{A-}) - V(s_t^l; \theta_l^A)$, действие $a_t$ из $\pi(a_t \mid s_t^l; o_0, \theta_l^P)$.

При обучении formation period используется для обеих политик; производительность low-level на trading period — награда high-level. При evaluation и testing option и действия выводятся без exploration.

Algorithm 1: Training TRIALS
Require: N assets X, loop conditions M, N
Ensure: Model parameters θʰ = {θʰ_P, θʰ_A}, θˡ = {θˡ_P, θˡ_A}
1: Initialize parameters θʰ, θˡ for high-level and low-level controllers
2: for iteration = 1, 2, 3, ..., M do
3:     Sample option o₀ from μ(o₀ | sʰ₀)
4:     Select pair from X and initialize trading environment
5:     for iteration = 1, 2, 3, ..., N do
6:         while not reach termination condition do
7:             Sample action aₜ from π(aₜ | sˡₜ; o₀)
8:             Execute action, obtain next state and intrinsic reward
9:             Update θˡ by Eq. (13)
10:        end while
11:    end for
12:    Obtain extrinsic reward from pair selection environment
13:    Update θʰ by Eq. (12)
14: end for

4. Эксперименты

4.1. Данные

По аналогии с предыдущими работами построен датасет из 150 акций S&P 500 за 21 год (01/02/2000–12/31/2020), 5284 торговых дня; отфильтрованы бумаги с пропусками. Дополнительно введён датасет CSI 300 (китайский рынок): 300 акций, 5088 шагов из базы CSMAR за тот же период. Статистика — в табл. 1.

Таблица 1. Статистика датасетов.
ДатасетРынокПериодАктивовШагов
S&P 500США2000–20201505284
CSI 300Китай2000–20203005088

На каждый торговый день используются open price, close price и volume; цены нормализуются логарифмом. В отличие от предыдущих методов, акции случайно разбиты на пять непересекающихся подмножеств (приложение A). Для каждого подмножества проводятся эксперименты TRIALS и baselines. Первые 90% дней — train, следующие 5% — validation, остальные 5% — test. При обучении первые 85% дней используются для совместного отбора оптимальной пары и торговли на оставшихся 5% train; модель с лучшими гиперпараметрами по validation оценивается на test. Результаты независимо сообщаются для каждого подмножества и усредняются (mean ± std). Оптимизатор RMSProp, байесовский поиск гиперпараметров; реализация на PyTorch и stable-baselines, 2× NVIDIA Tesla V100.

4.2. Базовые методы

Методы отбора пар (торговля пороговыми правилами): GGR — среднее евклидово расстояние; Cointegration — augmented Engle–Granger two-step test; Correlation — максимальная корреляция.

Методы торговли (пара отбирается коинтegrацией): Wang et al. — RL для максимизации суммарной прибыли.

4.3. Метрики

Торговая производительность на test: (1) Sharpe ratio (SR) — $(E(R_t) - R_f) / V(R_t)$, $R_f = 0{,}000085$; (2) Annualized return (AR); (3) Maximum drawdown (MDD); (4) Annualized Volatility (AV).

Для отобранных пар: average Euclidean distance (ED) — среднее евклидово расстояние исторических ценовых рядов двух активов.

4.4. Основные результаты

Табл. 2 показывает, что TRIALS достигает лучших результатов по всем метрикам на обоих рынках. Детали по подмножествам — в приложении C. TRIALS имеет наивысшие средние SR и AR: обученный агент даёт заметную прибыль при контролируемом риске. Стабильно высокая производительность на S&P 500 и CSI 300 подтверждает взаимодополняемость отбора и торговли; TRIALS также даёт наименьший средний MDD на S&P 500 и относительно низкий на CSI 300. AV отражает колебания при росте и падении; у TRIALS относительно высокая средняя AV.

Классические методы отбора (GGR, Cointegration, Correlation) существенно уступают: средний SR GGR — $-1{,}37$ и $-1{,}19$, AR отрицательна; Cointegration — SR $-1{,}83$ и $-1{,}50$; Correlation — SR $-1{,}41$ и $-1{,}37$. Предопределённые статистические тесты не выбирают оптимальную пару без учёта торговой производительности и не измеряют прибыльность даже на test data. TRIALS имеет более высокий ED при значительной прибыли — ED не коррелирует с прибыльностью.

Wang et al. с RL-агентом превосходит чистые методы отбора при той же паре коинтegrации, но ограничен неэффективным отбором и уступает TRIALS по SR.

Таблица 2. Среднее (стандартное отклонение) метрик на S&P 500 и CSI 300. ↑ — выше лучше для SR, AR; ↓ — ниже лучше для MDD, AV, ED.
МетрикаS&P 500CSI 300
GGRCointCorrWangTRIALSTRIALS wo TRGGRCointCorrWangTRIALSTRIALS wo TR
SR ↑−1,37 (0,79)−1,83 (0,27)−1,41 (0,21)1,18 (0,43)1,84 (0,24)0,07 (0,16)−1,19 (0,74)−1,50 (0,97)−1,37 (0,25)0,75 (0,68)1,91 (0,88)0,95 (0,88)
AR ↑−0,15 (0,09)−0,36 (0,20)−0,14 (0,05)0,21 (0,11)0,50 (0,14)0,01 (0,20)−0,17 (0,11)−0,25 (0,17)−0,21 (0,07)0,24 (0,23)0,68 (0,51)0,13 (0,12)
MDD ↑−0,20 (0,08)−0,37 (0,20)−0,20 (0,04)−0,09 (0,05)−0,09 (0,01)−0,25 (0,07)−0,29 (0,06)−0,29 (0,13)−0,25 (0,06)−0,18 (0,09)−0,14 (0,07)−0,12 (0,09)
AV ↓0,13 (0,03)0,27 (0,20)0,12 (0,02)0,16 (0,06)0,22 (0,04)0,22 (0,04)0,18 (0,03)0,19 (0,03)0,17 (0,05)0,25 (0,07)0,26 (0,09)0,17 (0,07)
ED ↓0,014 (5e−3)0,021 (0,02)0,007 (0,002)0,021 (0,02)0,037 (0,01)0,01 (4e−3)0,013 (6e−3)0,017 (8e−3)0,015 (8e−3)0,017 (8e−3)0,046 (0,02)0,02 (8e−3)

4.5. Абlation-исследование

Для оценки вклада двух подзадач сравниваем TRIALS с абlation TRIALS wo TR — фиксированный торговый агент с предопределёнными порогами после RL-отбора пары. Совместная оптимизация даёт наивысший SR и наименьший ED. TRIALS wo TR хуже из-за смещённой информации от пороговых правил (неверная оценка mean и std спреда), но всё же превосходит parameter-free методы — важность динамического обучения меры прибыльности по торговой результатности.

На рис. 3 — вероятности отбора пар TRIALS: метод захватывает сложные связи между парами. Например, EQR (недвижимость) и ABT (химия) без прямой связи оказываются стабильно коррелированными — возможен industry spillover. На рис. 4 — temporal attention: для AAPL больший вес у последних признаков.

Рисунок 3. Вероятности отбора пар TRIALS
Рисунок 3. Вероятности отбора пар, обученные TRIALS (heatmap по активам подмножества 2 S&P 500).
Рисунок 4. Temporal attention
Рисунок 4. Визуализация temporal attention: для AAPL модель фокусируется на недавних признаках.

4.6. Кейс-стади

На рис. 5 — детали торговли (действия, позиции, прибыль) на trading period для подмножества Set 2: TRIALS, TRIALS wo TR, GGR и Wang et al. GGR и Wang et al., игнорируя торговую производительность, выбирают пары с нерелевантными движениями (NEE и MS), что ведёт к убыткам. GGR и TRIALS wo TR принимают иррациональные решения из-за неверных порогов.

TRIALS совместно обучает отбор и торговлю: учитывает информацию обо всех активах, динамически обучает меру по оптимальной торговой производительности гибкого агента. Выбрана прибыльная пара CAT–IPG с множественными торговыми возможностями, точно захваченными worker. Наблюдение множества пар заставляет worker учить общий паттерн парного трейдинга вместо переобучения на одну пару. TRIALS wo TR динамически отбирает пары, но фиксированные пороги дают смещённую информацию и менее прибыльный отбор.

Рисунок 5. Детали торговли на Set 2
Рисунок 5. Детали торговли на trading period (Set 2, S&P 500): (a) TRIALS, (b) TRIALS wo TR, (c) GGR, (d) Wang et al.

5. Заключение

Мы предложили новую парадигму автоматического парного трейдинга, объединяющую отбор пары и торговлю. На её основе разработан feudal hierarchical RL с manager для отбора и worker для торговли. Manager выбирал пару из всех комбинаций для максимизации торговой производительности; worker достигал заданной option и генерировал производительность после обучения на исторических данных. Эксперименты на реальных биржевых данных подтверждают тесную связь и взаимодополняемость двух этапов; TRIALS совместно их оптимизирует и значительно превосходит существующие методы. В будущем планируется интеграция более богатых представлений активов и учёт текстовых и макроэкономических данных.

Приложение A. Подмножества акций S&P 500

Акции случайно разбиты на пять непересекающихся подгрупп рынка США (табл. 3). Аналогичные подгруппы для CSI 300 приведены в оригинале (табл. 4).

Таблица 3. Акции пяти подмножеств S&P 500.
SetАкции
1AMAT, AXP, BA, BAX, EA, EBAY, ED, EOG, GLW, IBM, IRM, LMT, MAS, MCO, MMM, MOS, NUE, PFE, PG, PPL, QCOM, RTX, SLB, SPG, SWKS, TGT, TXT, UNH, USB, WY
2AAPL, ABT, ADSK, ALB, AMGN, APD, BLK, CAT, CDNS, CLX, COF, DE, DHI, EMR, EQR, FE, FMC, GIS, IP, IPG, JPM, MS, NEE, NEM, NTAP, NWL, ROP, ROST, TJX, VLO
3ADBE, AES, AVY, BSX, C, CAH, CCL, CL, CMI, CTSH, DOV, DUK, EXC, F, GE, HSY, KO, KR, LUV, MRO, MSFT, NKE, PEAK, PLD, PNC, SCHW, SYY, UPS, VFC, YUM
4A, ADM, ALL, ATVI, AZO, BMY, COST, CSCO, CVX, FCX, FDX, GS, HAL, HD, INTC, K, KIM, LEN, LOW, MCD, MMC, MRK, MSI, NVDA, PHM, STT, T, WMB, XOM, XRAY
5AMZN, AON, APA, BAC, BBY, BEN, BK, CMCSA, CPRT, CVS, DHR, EIX, ETN, FAST, HON, HUM, MCK, MO, MTB, NLOK, PCAR, PGR, SBUX, TER, TRV, UNP, VZ, WFC, WHR, WMT

Приложения B и C

Приложение B (Result Presentation). Приведены увеличенные версии рис. 5 с детализацией торговых действий, позиций и прибыли на trading period для Set 2 S&P 500 (TRIALS, TRIALS wo TR, GGR, Wang et al.).

Приложение C (Detail Performance). Таблицы 5 и 6 оригинала содержат полную разбивку метрик SR, AR, MDD, AV и ED по всем пяти подгруппам S&P 500 и CSI 300 для GGR, Cointegration, Correlation, Wang, TRIALS и TRIALS wo TR; усреднённые значения совпадают с табл. 2.

Литература

Оригинал статьи: Han et al., «Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning», arXiv:2301.10724