Продвинутый статистический арбитраж с обучением с подкреплением

6/10

Boming Ning, Kiseop Lee

Department of Statistics, Purdue University · 20 марта 2024

Оригинал: Ning, B. and Lee, K. «Advanced Statistical Arbitrage with Reinforcement Learning», v1 — arxiv.org/abs/2403.12180 (PDF).

Рис. 1–3 воспроизведены из оригинальной публикации.

Ключевые слова: Statistical Arbitrage, Mean Reversion Trading, Empirical Mean Reversion Time, Reinforcement Learning

Классификация JEL: C14, C61 · arXiv: q-fin.ST

Аннотация

Статистический арбитраж — распространённая торговая стратегия, использующая свойство возврата к среднему спреда парных акций. Исследования этой стратегии часто сильно опираются на модельные допущения. В данной работе мы предлагаем инновационный model-free фреймворк на базе обучения с подкреплением (RL) для статистического арбитража. Для построения mean-reverting спредов мы вводим эмпирическую метрику времени возврата к среднему и оптимизируем коэффициенты активов минимизацией этого эмпирического времени. На торговой фазе применяем RL для поиска оптимальной mean reversion стратегии. В отличие от традиционных стратегий, фокусирующихся преимущественно на отклонении цены от долгосрочного среднего, наша методология нестандартно конструирует пространство состояний так, чтобы оно отражало недавние тренды в движении цены. Кроме того, функция награды тщательно подогнана под специфику mean reversion торговли.

1. Введение

Статистический арбитраж, также известный как mean reversion trading или pairs trading, — важная торговая стратегия на финансовых рынках. Суть статистического арбитража — создание спредов или портфелей с mean-reverting характеристиками, открывающих возможности для прибыли. Например, если цена спреда падает ниже долгосрочного среднего, трейдер может занять long-позицию и дождаться коррекции цены, стремясь извлечь прибыль из этого движения.

Подход к статистическому арбитражу включает три этапа. Сначала идентифицируют две или более ценных бумаги с историческим паттерном совместного движения. Затем формируют mean-reverting спред из этих коррелированных бумаг. Наконец, занимают позицию, когда спред отклоняется от долгосрочного среднего, используя ожидаемый возврат к равновесию для получения прибыли. Таким образом, mean reversion trading делится на три элемента: (1) идентификация бумаг с co-movement, (2) построение mean-reverting спредов, (3) разработка торговой стратегии на их основе. Первые два компонента — formation phase, третий — trading phase.

Первый шаг — идентификация похожих бумаг. Традиционные методы преимущественно используют метрики расстояния (Gatev et al. 2006): пары формируют, выбирая бумаги, минимизирующие сумму квадратов отклонений (SSD) между нормированными ценовыми рядами. Принцип отбора пар распространяется на пары представительных акций и ETF в конкретных секторах (Gatev et al. 2006; Avellaneda and Lee 2010; Montana and Triantafyllopoulos 2011; Leung and Li 2016), физические commodities и соответствующие акции/ETF (Kanamura et al. 2010), а также сущности на крипторынке (Leung and Nguyen 2019). Эти работы демонстрируют адаптивность и эффективность стат-арбитража на широком спектре рынков. В нашем исследовании мы выбираем десять представительных пар из разных секторов рынка США для построения mean reversion портфелей.

После идентификации групп похожих акций следующий шаг — построение стат-арбитражного портфеля или спреда с mean-reverting свойством. Базовый подход Gatev et al. (2006) — long в одной бумаге пары и short в другой, то есть торговля спредом $S_1 - S_2$ для двух похожих акций $S_1$ и $S_2$. Хотя метод прост, он часто не создаёт оптимальный портфель с выраженными mean-reverting характеристиками. Более сложная стратегия — Ornstein–Uhlenbeck (OU) mean reversion trading (Leung and Li 2016). Для пары похожих акций $S_1$ и $S_2$ цель — найти коэффициент $B$ такой, что спред $S_1 - B \cdot S_2$ максимально близок к OU-процессу; $B$ обычно определяют через maximum likelihood estimation по распределению OU-процесса. Однако на практике финансовые рынки не всегда соответствуют допущениям процесса Орнштейна–Уленбека, что может снижать эффективность стратегий, основанных на этой модели.

Чтобы преодолеть ограничения assumption-dependent методов, мы предлагаем подход, использующий введённое эмпирическое время возврата к среднему (empirical mean reversion time) любого временного ряда как меру скорости возврата. Это позволяет построить mean reversion спред без теоретических допущений. Методом grid search систематически исследуются разные комбинации для поиска оптимального спреда с наименьшим эмпирическим временем возврата к среднему. Техника даёт более гибкий и потенциально более устойчивый фреймворк для построения арбитражного портфеля.

Финальная фаза стат-арбитража — формулировка торговой стратегии на построенном mean-reverting спреде. Традиционные стратегии сильно опираются на оценку параметров модели. Например, Gatev et al. (2006) открывают сделку, когда отклонение цены спреда превышает два исторических стандартных отклонения от среднего, оценённого на formation phase, и закрывают при следующем схождении цен с историческим средним. В OU mean reversion trading оценки долгосрочного среднего и волатильности OU-модели определяют торговые критерии (Leung and Li 2015; Leung and Li 2016). Эти оценки основаны на исторических данных formation period с допущением, что параметры остаются постоянными на trading phase — допущение, которое может не выполняться из-за рыночных колебаний. Кроме того, выбор гиперпараметров существенно влияет на торговую производительность, но robust метод оптимального выбора гиперпараметров отсутствует. Например, нет консенсуса по порогу отклонения цены от среднего.

Чтобы решить эти проблемы, мы вводим RL-алгоритм, динамически оптимизирующий торговые решения во времени вместо заранее заданных правил. Задача моделируется в RL-фреймворке, где агенты выбирают действия, максимизирующие кумулятивную награду. Пространство состояний спроектировано так, чтобы захватывать недавние движения цены спреда, уходя от зависимости от исторических оценок среднего и стандартного отклонения. Агент принимает решения о будущих действиях, опираясь на текущие рыночные тренды, а не на оценки параметров formation period. Одновременно мы избавляемся от необходимости выбора универсальных гиперпараметров — таких как пороги, существенно влияющие на торговую производительность. Подход упрощает торговый процесс, фокусируясь на динамической адаптации без ограничений фиксированными параметрами.

Структура статьи: раздел 2 — обзор связанных исследований; раздел 3 — определение эмпирического времени возврата к среднему для спредов и методология поиска оптимальных коэффициентов активов; раздел 4 — RL-фреймворк для оптимальных торговых стратегий; раздел 5 — экспериментальные результаты на симulated данных и реальном рынке акций США; раздел 6 — выводы и направления будущих исследований.

2. Обзор литературы

Классическая работа Gatev et al. (2006) — краеугольный камень исследования pairs trading, основанного на принципе mean reversion. Используя Distance Method (DM), они анализировали акции CRSP за 1962–2002 гг., выявляя торговые возможности, когда цена пары активов отклонялась более чем на два исторических стандартных отклонения, и закрывая позиции при схождении цен. Подход дал избыточную доходность 1,3% для топ-5 пар и 1,4% для топ-20. Do and Faff (2012) дополнительно исследовали жизнеспособность pairs trading с учётом транзакционных издержек, подтверждая практическую применимость даже при торговых расходах.

Помимо Distance Method, значительной альтернативой является stochastic spread method, использующий стохастические процессы для анализа mean-reverting природы спредов. Спреды строят и торговые сигналы генерируют на основе параметров выбранной стохастической модели. Elliott et al. (2005) были пионерами, введя Gaussian Markov chain model для захвата mean-reverting динамики спредов. Do et al. (2006) расширили концепцию generalized stochastic residual spread method. Leung and Li (2016) подробно исследуют оптимальные mean reversion стратегии на различных стохастических моделях — Ornstein-Uhlenbeck, Exponential OU, CIR — демонстрируя универсальность stochastic approaches.

Тесты коинтegrации — критическая альтернатива для mean reversion стратегий. На основе error correction model Engle and Granger (1987) Vidyamurthy (2004) описал коинтegrационный фреймворк, ставший основой pairs trading analysis. Galenko et al. (2012) разработали активные торговые стратегии для ETF на коинтegrации. Huck and Afawubo (2015) сравнили Distance Method с коинтegrационными стратегиями на S&P 500. Leung and Nguyen (2019) построили коинтegrированные криптопортфели методами Engle-Granger и Johansen.

В последние годы область обогатилась инновационными методами: copulas (Liew and Wu 2013; Xie et al. 2016), оптимизационный подход Zhang et al. (2020) для sparse mean-reverting портфелей, machine learning (Guijarro-Ordonez et al. 2021; Sarmento and Horta 2020; Chang et al. 2021). Эти разработки расширяют инструментарий для стат-арбитража.

3. Эмпирическое время возврата к среднему: построение спреда

После идентификации групп похожих акций нужно сформировать арбитражный портфель с mean reversion свойством. В традиционном OU pairs trading для двух похожих акций $S_1$ и $S_2$ выбирают $B$ так, чтобы спред $S_1 - B S_2$ максимально следовал OU-процессу; разумный способ — MLE по распределению OU. Без модельного допущения MLE недоступен.

Мы расширяем paired trading до multi-asset портфеля. Для $n$ похожих акций $S_i$, $i = 1, 2, \ldots, n$, формируем спред $X = \sum_{i=1}^n a_i S_i$. Цель — найти портфель $(a_1, a_2, \ldots, a_n)$ с максимально выраженным mean-reverting свойством.

Рассмотрим популярный OU-процесс

\[ dX_t = \mu(\theta - X_t)\,dt + \sigma\,dW_t, \]

где $W_t$ — стандартное броуновское движение. Эмпирически $\mu$ сильнее всего влияет на прибыль среди параметров $\mu$, $\theta$ и $\sigma$: больший $\mu$ даёт более высокую доходность, поскольку означает более быстрый mean reversion. Трейдер может быстро извлечь прибыль из отклонения от среднего.

Мы хотим, чтобы спред $X = \sum_{i=1}^n a_i S_i$ обладал более быстрым mean reversion. Рассмотрим стратегию: покупка при $X_t = \theta - a$ и продажа при $X_t = \theta$ для $a > 0$ и заданного долгосрочного среднего $\theta$. Определим stopping time

\[ \tau_t = \inf\{s > t : X_s = \theta \mid X_t = \theta - a\}. \]

Более быстрый mean reversion соответствует меньшему $\tau_t$. Естественно сформулировать задачу отбора арбитражного портфеля так: в момент $t$ на training interval $[t - h, t]$ найти оптимальный портфель $(a_1, a_2, \ldots, a_n)$, минимизирующий sample mean $\tau$ на этом интервале при условии $\bar{Y} = \theta$ и $S^2(Y) < M$ для константы $M$. Верхняя граница $M$ на sample variance нужна из-за ограничения начального капитала и для предотвращения большого leverage, делающего портфель нестабильным.

3.1. Эмпирическое время возврата к среднему

Вводим понятие empirical mean reversion time по идее выше. По Fink and Gandhi (2007) сначала определим important extremes временного ряда. Пусть $s$ — sample standard deviation ряда $X_t$, $t \in [0, T]$. На реальном рынке доступны только дискретные точки $(X_1, \ldots, X_n)$. Пусть $C$ — положительная константа. Точка $X_m$ — important minimum, если существуют индексы $i$ и $j$, $i \leq m \leq j$, такие что:

Интуитивно, $X_m$ — минимальное значение сегмента $X_i, \ldots, X_j$, а конечные точки сегмента существенно выше $X_m$. Аналогично, $X_m$ — important maximum, если:

Опираясь на уравнение (1), предлагаем empirical mean reversion time — длительность, необходимую спреду для возврата к долгосрочному среднему от максимального наблюдаемого отклонения. Это позволяет подобрать оптимальные коэффициенты бумаг минимизацией empirical reversion time спреда.

Строим последовательность моментов времени $\{\tau_i\}_{i=0}^N$, рекурсивно выводимую из significant local extremes фактического ценового процесса. Начальный момент:

\[ \tau_1 = \inf\{u \in [0, T] : X_u \text{ — local extreme}\}. \]

Затем $\tau_2$ — первый момент пересечения sample mean $\hat{\theta}$:

\[ \tau_2 = \inf\{u \in [\tau_1, T] : X_u = \hat{\theta}\}. \]

Рекурсивно: $\tau_3$ — первый local extreme после $\tau_2$, $\tau_4$ — первое пересечение долгосрочного среднего после $\tau_3$, и т.д. Все нечётные $\{\tau_n\}_{n=1,3,5,\ldots}$ соответствуют local extremes:

\[ \tau_n = \inf\{u \in [\tau_{n-1}, T] : X_u \text{ — local maximum}\}. \]

Чётные $\{\tau_n\}_{n=2,4,6,\ldots}$ — пересечениям долгосрочного среднего:

\[ \tau_n = \inf\{u \in [\tau_{n-1}, T] : X_u = \hat{\theta}\}. \]

Последовательность $\{\tau_n\}_{n=1}^N$ строится индуктивно.

Имея timestamps $\{\tau_n\}$, empirical reversion time $r$ определяется как среднее интервалов от local extremes до crossing times:

\[ r = \frac{2}{N} \sum_{\substack{i=2 \\ i \text{ even}}}^{N} (\tau_i - \tau_{i-1}). \]

Далее кратко описан grid search для поиска оптимальных коэффициентов по empirical mean reversion time. Пусть ценовые процессы $n$ похожих активов — $S_1, S_2, \ldots, S_n$. Цель — найти $(a_1, a_2, \ldots, a_n)$ такие, что портфель $X = \sum_{i=1}^n a_i S_i$ имеет минимальное empirical mean reversion time. Без потери общности полагаем $a_1 = 1$. Для каждого $a_i$, $a_i \in [-3.00, -2.99, \ldots, 2.99, 3.00]$, $2 \leq i \leq N$, оцениваем empirical mean-reversion time $Y$; оптимальные коэффициенты — те, что минимизируют $r$.

4. Обучение с подкреплением: продвинутые торговые стратегии

Финальный этап стат-арбитража — разработка торговой стратегии на mean-reverting спреде. Традиционные подходы предполагают стабильность параметров от formation phase к trading phase, что рыночные изменения могут нарушить. Выбор гиперпараметров — например, порога отклонения — критически влияет на производительность, но стандартного метода их оптимального выбора нет.

Наша мотивация — использовать RL для динамической оптимизации торговых действий во времени вместо ручного проектирования preset rules. RL — метод машинного обучения, где intelligent agents выбирают optimal actions в среде для максимизации cumulative reward.

4.1. Основы обучения с подкреплением

В RL последовательная задача принятия решений моделируется как марковский процесс принятия решений (MDP) — расширение марковского процесса с возможностью выбора действия из action space и получения reward, оценивающего качество выбора на каждом шаге.

«Среда» — часть системы вне контроля RL-агента. На каждом шаге $t$ наблюдаем состояние $S_t \in \mathcal{S}$ и выбираем действие $A_t \in \mathcal{A}$. Выбор действия влияет на переход к следующему состоянию и на полученную награду $R_t$. Последовательность в MDP:

\[ S_0, A_0, R_1, S_1, A_1, R_2, S_2, A_2, R_3, \cdots \]

Каждый MDP однозначно определяется multivariate conditional distribution $p(s', r \mid s, a)$ — joint probability перехода в $s'$ и получения $r$ при предыдущем состоянии $s$ и действии $a$.

Политика $\pi$ — отображение состояний в probability distributions над action space. При политике $\pi$ в состоянии $s$ агент выбирает $a$ с вероятностью $\pi(a \mid s)$. Для поиска optimal policy задают goal function. Широко используемая discounted goal function:

\[ G_t = R_{t+1} + \gamma R_{t+2} + \gamma^2 R_{t+3} + \cdots = R_{t+1} + \gamma G_{t+1}, \]

где $R_t$ — instant reward в момент $t$, $\gamma \in (0, 1)$ — discount factor. Цель — найти политику, максимизирующую $\mathbb{E}[G_t]$:

\[ \max_\pi \mathbb{E}[G_t]. \]

Далее — Q-learning. Action-value function для политики $\pi$ — expectation goal function при старте в $s$, действии $a$ и следовании $\pi$:

\[ q_\pi(s, a) := \mathbb{E}[G_t \mid S_t = s, A_t = a]. \]

Optimal action-value function:

\[ q^*(s, a) = \max_\pi q_\pi(s, a). \]

Зная $q^*$, optimal policy — выбор $a \in \mathcal{A}$, максимизирующего $q^*(s, a)$. Задача сводится к поиску $q^*$ через Bellman equations. Bellman equation для action-value function:

\[ q^*(s, a) = \sum_{s', r} p(s', r \mid s, a)\left[r + \gamma \max_{a'} q^*(s', a')\right]. \]

Ядро Q-learning — value iteration update по Bellman equation с weighted average старого значения и новой информации. До обучения approximate action-value function $Q$ инициализируется произвольно. Sample update для $Q(S_t, A_t)$ при next state $S_{t+1}$ и instant reward $R_{t+1}$:

\[ Q_{\mathrm{new}}(S_t, A_t) \leftarrow Q(S_t, A_t) + \alpha \cdot \left(R_{t+1} + \gamma \cdot \max_a Q(S_{t+1}, a) - Q(S_t, A_t)\right), \]

где $\alpha$ — learning rate, $\gamma$ — discount factor. $Q_{\mathrm{new}}(S_t, A_t)$ — сумма трёх слагаемых: $(1-\alpha)Q(S_t, A_t)$, $\alpha \cdot R_{t+1}$, $\alpha \cdot \gamma \cdot \max_a Q(S_{t+1}, a)$. Величина $R_{t+1} + \gamma \cdot \max_a Q(S_{t+1}, a)$ называется target $Y_t$; итерация обновляет $Q(S_t, A_t)$ к target $Y_t$.

Для выбора действий применяется epsilon-greedy strategy: на training phase действия выбираются случайно с вероятностью $\epsilon$, иначе — action с highest Q-value с вероятностью $1 - \epsilon$. На testing phase $\epsilon = 0$: выбор только по highest Q-value — pure exploitation. Модель сочетает exploration и exploitation при обучении и pure exploitation при тестировании.

4.2. RL-модель для mean reversion trading

Теперь представим RL-модель для optimal mean reversion trading strategy. Пространство состояний строится по траектории движения цены на недавней последовательности временных точек. В момент $t$ состояние $S_t$ — вектор

\[ S_t = [d_{t-l+1}, d_{t-l+2}, \ldots, d_t], \]

где каждое $d_i$ характеризует направление и величину изменения цены в момент $i$. Положительное $d_i$ — рост цены относительно $i-1$, отрицательное — падение; $|d_i|$ — величина изменения. Для $t-l+1 \leq i \leq t$ пусть

\[ \pi_i = \frac{P_i - P_{i-1}}{P_{i-1}} \times 100 \]

— процентное изменение цены от $i-1$ к $i$. Состояния определяются так:

\[ d_i = \begin{cases} +2 & \text{если } \pi_i > k, \\ +1 & \text{если } 0 < \pi_i < k, \\ -1 & \text{если } -k < \pi_i < 0, \\ -2 & \text{если } \pi_i < -k. \end{cases} \]

«+2» — значительный рост, «+1» — умеренный рост, «-2» — значительное падение, «-1» — умеренное падение. Порог $k$ (например, 3%) настраивается под чувствительность. Пространство состояний содержит $4^l$ уникальных состояний, захватывая широкий спектр недавних сценариев движения цены.

Action space — три действия: продажа одной акции ($-1$), бездействие ($0$), покупка одной акции ($+1$). Доступные действия зависят от текущей позиции агента. Без позиции — buy ($+1$) или hold ($0$). В long-позиции — sell ($-1$) или hold ($0$). Модель не предусматривает начальный short.

Immediate reward $R_{t+1}$ за действие $A_t$:

\[ R_{t+1} = A_t \cdot (\theta - X_t) - c \cdot |A_t|, \]

где $X_t$ — текущая цена спреда, $\theta$ — истинное глобальное среднее $X_t$. Buy ($A_t = +1$) поощряется, когда $X_t$ ниже $\theta$; sell ($A_t = -1$) получает отрицательную награду в тех же условиях. Если $X_t$ выше среднего, награды корректируются, discouraging покупки на высоких ценах и encouraging продажи. $c$ — transaction cost за сделку.

Cumulative return от $t$ до terminal time $T$:

\[ G_t = \sum_{s=t+1}^{T} e^{-r\cdot(s-t)} \cdot R_s + I_T \cdot X_T, \]

где $r$ — interest rate (time value of money), $I_T$ — позиция на terminal time. Формулировка учитывает exponential decay наград из-за discounting и влияние удержания позиции до конца периода.

Для точной подгонки optimal Q-table нужны обширные training data, но реальный рынок даёт ограниченный observation path спредов. Кроме того, reward function (5) включает истинное долгосрочное среднее спреда — величину, недоступную на реальном рынке.

Стратегия преодоления: сначала симулируем множество mean reversion спредов с разными параметрами для обучения RL-агента, затем применяем обученную модель к реальной торговле. В терминах RL — simulated environment для training phase.

5. Эксперименты

В этом разделе оценивается производительность предложенного метода. Сначала тесты на simulated data для empirical mean reversion time и RL-модели, затем mean reversion trading experiments на S&P 500 в model-free фреймворке с сравнением с классическими методами стат-арбитража.

5.1. Эмпирическое время возврата к среднему

Исследуем empirical mean reversion time симуляциями процесса Орnstein-Uhlenbeck. Фиксируем $\theta = 0$ и $\sigma = 1$, варьируем $\mu$ от 2 до 20 с шагом 2. Для каждой комбинации симулируем 100 траекторий OU с $T = 1.0$ и $n = 1000$ точек, вычисляем average empirical mean reversion time с порогом $C = 2$, изучая влияние $\mu$ на EMRT.

Рисунок 1. Локальные экстремумы на симулированном OU-спреде
Рисунок 1. Локальные экстремумы на симулированном OU-спреде с $\mu = 10$, $\theta = 0$ и $\sigma = 1$.
Таблица 1. Изменение среднего empirical mean reversion time (EMRT) при варьировании $\mu$ в процессе Ornstein–Uhlenbeck.
Параметр $\mu$Среднее EMRTПараметр $\mu$Среднее EMRT
2,098,7912,049,22
4,083,4514,045,10
6,078,0916,038,04
8,059,2218,035,63
10,058,5120,031,15

Рис. 1 показывает identified local extremes на simulated OU path с $\mu = 10$, $\theta = 0$, $\sigma = 1$. Критерии extreme points эффективно выделяют почти каждый local maximum или minimum — robust метод анализа mean reversion. Табл. 1 подтверждает гипотезу об обратной связи между скоростью mean reversion $\mu$ и EMRT: при росте $\mu$ время возврата к среднему уменьшается, процесс быстрее возвращается к среднему уровню.

5.2. RL-торговля на симулированных данных

Предварительный simulated experiment эффективности предложенной RL-стратегии для mean reversion trading. При $\mu = 1$, $\theta = 1$, $\sigma = 0.1$ симулируем 10 000 траекторий OU с $T = 252$ и $n = 252$ точками (один год данных) как training samples. Конфигурация RL: lookback window $l = 4$ (16 состояний), learning rate 0,1, discount factor 0,99, epsilon 0,1 для epsilon-greedy, 10 training episodes.

После обучения применяем модель к новой OU-траектории для оценки decision-making.

Рисунок 2. Симулированная торговля на OU-процессе по RL
Рисунок 2. Симулированная торговля на OU-процессе в RL-фреймворке. Зелёные точки — buy, красные — sell.

Обученный агент выполняет серию стратегических buy/sell решений. На 100 новых samples средняя accumulated profit превышает 600%: начальный капитал 100 USD на каждый OU sample, при buy рекомендации агента весь доступный cash идёт в long по спреду, позиции закрываются в sell points.

5.3. Эксперименты на реальных данных

Real-world experiments на S&P 500: сравнение с Distance Method (DM) (Gatev et al. 2006) и Ornstein-Uhlenbeck (OU) mean reversion trading (Avellaneda and Lee 2010; Leung and Li 2016).

Бенчмарки

Distance Method. Вычисляется SSD между normalized price series всех потенциальных пар; выбираются пары с минимальной SSD. Mean-reverting спред $X = S_1 - S_2$: long в одной бумаге, short в другой. На formation period оцениваются long-term mean и standard deviations. Торговые правила:

где $\bar{x}$ и $s$ — sample mean и standard deviation formation period. Порог $k = 1$; рассматривается только initial long engagement.

OU mean reversion trading. Пары отбираются по минимальной SSD. Спреды $X = S_1 - B \cdot S_2$, где $B$ максимизирует likelihood score подгонки к OU-процессу. Оцениваются $\hat{\mu}$, $\hat{\theta}$, $\hat{\sigma}$. Equilibrium variance $\hat{\sigma}_{\mathrm{eq}} = \hat{\sigma}/\sqrt{2\hat{\mu}}$ (Avellaneda and Lee 2010). Сигналы:

где $k = 0.5$; торговля только initial long.

Данные

Formation period — один год, trading period — следующий год. Daily adjusted closing prices представительных акций разных секторов США для mean reversion spreads. Пары: MSFT–GOOGL (Technology), CVS–JNJ (Healthcare), CL–KMB (Consumer Goods), V–MA (Financials), GE–BA (Industrials), OXY–XOM (Energy), WELL–VTR (Real Estate), PPG–SHW (Materials), VZ–TMUS (Telecommunication), CSX–NSC (Transportation). Данные Yahoo! Finance за 1 января 2022 — 31 декабря 2023.

Экспериментальные результаты

One-year study: 2022 — formation, 2023 — trading. Mean reversion portfolios $X = S_1 - B \cdot S_2$. Для DM $B = 1$ для всех пар; для OU $B$ — по likelihood fit к OU; в нашей методологии $B$ калибруется минимизацией EMRT спреда. Табл. 2 — коэффициенты $B$ по методам.

Таблица 2. Сравнение коэффициентов пар по разным методам.
ПараDMOUEMRT
MSFT–GOOGL1,00,990,89
CVS–JNJ1,00,43−0,24
CL–KMB1,00,390,46
V–MA1,00,530,33
GE–BA1,00,200,34
OXY–XOM1,00,770,22
WELL–VTR1,00,990,98
PPG–SHW1,00,330,12
VZ–TMUS1,00,100,01
CSX–NSC1,00,120,14
Рисунок 3. Рост суммарного капитала в 2023 году по десяти парам
Рисунок 3. Рост total wealth в 2023 г. для mean-reverting портфелей: бенчмарки и предложенный RL-метод. Начальный капитал — 100 USD. Панели (a)–(j): MSFT–GOOGL, CVS–JNJ, CL–KMB, V–MA, GE–BA, OXY–XOM, WELL–VTR, PPG–SHW, VZ–TMUS, CSX–NSC.

Рис. 3 — эволюция total wealth в 2023 г. Табл. 3 и 4 — метрики: DailyRet, DailyStd, DailySR (daily Sharpe Ratio), MaxDD, CumulPnL. Предложенный RL-подход значительно превосходит традиционные бенчмарки по daily Sharpe Ratio и cumulative returns на разных секторах. Ключевой фактор — тщательный дизайн RL-фреймворка под нюансы финансовых приложений.

Таблица 3. Сводка производительности mean reversion портфелей (пары 1–5): DM, OU и RL.
Пара / метрикаDMOURL
MSFT–GOOGL
DailyRet (%)0,04460,03270,1344
DailyStd (%)0,46700,42851,0754
DailySR0,09550,07640,1250
MaxDD (%)−2,1344−2,14270,0000
CumulPnL (%)11,44438,244337,7555
CVS–JNJ
DailyRet (%)−0,0244−0,00730,0585
DailyStd (%)1,17961,49500,7506
DailySR−0,0207−0,00490,0780
MaxDD (%)−10,7238−25,66650,0000
CumulPnL (%)−7,4888−4,517914,8895
CL–KMB
DailyRet (%)0,27710,06590,0826
DailyStd (%)3,93561,23140,6000
DailySR0,07040,05350,1377
MaxDD (%)−18,1823−13,6791−1,9476
CumulPnL (%)64,238715,638522,2879
V–MA
DailyRet (%)0,03420,01980,0392
DailyStd (%)0,34750,75890,3890
DailySR0,09850,02610,1007
MaxDD (%)−1,0185−5,72530,0000
CumulPnL (%)8,73484,298010,0460
GE–BA
DailyRet (%)0,03300,02380,0330
DailyStd (%)0,31441,60120,3144
DailySR0,10490,01490,1049
MaxDD (%)−0,6211−14,5001−0,6211
CumulPnL (%)8,42482,78128,4248
Таблица 4. Сводка производительности mean reversion портфелей (пары 6–10): DM, OU и RL.
Пара / метрикаDMOURL
OXY–XOM
DailyRet (%)0,16790,03730,0609
DailyStd (%)1,28032,09500,9446
DailySR0,13120,01780,0861
MaxDD (%)0,0000−19,1535−2,0008
CumulPnL (%)48,81963,919415,0791
WELL–VTR
DailyRet (%)−0,11200,06940,0745
DailyStd (%)3,73110,65550,6794
DailySR−0,03000,10580,1097
MaxDD (%)−37,4779−1,4004−3,2895
CumulPnL (%)−36,175618,211419,6910
PPG–SHW
DailyRet (%)0,0000−0,07720,1124
DailyStd (%)0,00001,01131,0600
DailySR0,0000−0,07640,1061
MaxDD (%)0,0000−19,11960,0000
CumulPnL (%)0,0000−18,554730,4559
VZ–TMUS
DailyRet (%)−0,01230,02380,0539
DailyStd (%)1,32411,60120,5480
DailySR−0,00930,01490,0983
MaxDD (%)−18,6520−14,5001−1,3798
CumulPnL (%)−5,08692,781213,9245
CSX–NSC
DailyRet (%)0,01990,00000,0412
DailyStd (%)0,28790,00000,8037
DailySR0,06930,00000,0513
MaxDD (%)0,00000,0000−3,7306
CumulPnL (%)4,98250,00009,9163

6. Заключение и планы на будущее

Работа представила новый подход к статистическому арбитражу, объединивший model-free фреймворк с RL. Введена метрика empirical mean reversion time; коэффициенты активов оптимизируются минимизацией этой длительности — существенное уточнение построения mean reversion спредов. Для trading phase сформулирован RL-фреймворк: пространство состояний отражает недавние тренды движения цены, функции награды согласованы с атрибутами mean reversion trading. Эмпирический анализ по секторам рынка США подтвердил эффективность и consistency метода.

Для будущей работы планируем более sophisticated RL-алгоритмы — deep reinforcement learning и различные reward structures — для дальнейшей оптимизации торговых стратегий.

Литература

Оригинал статьи: Ning and Lee, «Advanced Statistical Arbitrage with Reinforcement Learning», arXiv:2403.12180