Динамическая мультипарная стратегия на крипторынках с глубоким обучением с подкреплением

7/10

Дамиан Лебедь · Faculty of Economic Sciences, University of Warsaw

Роберт Слепачук · Quantitative Finance Research Group, Department of Quantitative Finance and Machine Learning, University of Warsaw · v2, 25 июня 2026

Оригинал: Lebiedź, D. and Ślepaczuk, R. «Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning», 2026 — arxiv.org/abs/2606.04574 (PDF).

Код: github.com/damianlebiedz/pair-trading-with-rl. Приложение A (диагностики критика и equity чувствительности) опущено как набор повторяющихся графиков; таблицы 1–16 и формулы (1)–(17) сохранены. Рис. 1, 8 и 11 воспроизведены. Оригинал распространяется по лицензии CC BY-NC-ND 4.0; перевод выполнен на её условиях для личной коллекции, изменение по отношению к оригиналу — перевод на русский язык.

Ключевые слова: глубокое обучение с подкреплением; deterministic shielding; safe RL; иерархические системы; количественные финансы; статистический арбитраж.

Аннотация

Можно ли улучшить парный трейдинг на высоковолатильной крипте, если DRL поставить не вместо стратегии, а как слой исполнения? Классика работает на акциях, на крипте становится жёсткой и ломается на расхождении пары. Авторы предлагают иерархический отбор «Filter-then-Rank» и модель исполнения «Fixed Risk, Adaptive Mean». Агент — PPO с LSTM, решения об исполнении внутри жёстких детерминированных границ риска. Данные: часовые бары Binance USD-M Futures. Оптимизированная RL-политика существенно обходит эвристический бейзлайн out-of-sample. Stationary circular block bootstrap подтверждает превосходство по risk-adjusted метрикам на 10%, но не проходит 5% — авторы связывают это с идиосинкратической дисперсией цифровых активов. Вклад: гибрид статарбитража и DRL-исполнения и каркас safe RL через deterministic shielding.

1. Введение

Статарбитраж ловит временные аномалии цены между связанными активами. На акциях классика жива; крипта — высокая волатильность и смена режимов [2], трения и риск расхождения [28], поэтому парный трейдинг здесь труднее [12]. Цель диссертации — динамическая мультипарная стратегия, где DRL — специализированный слой исполнения, а не end-to-end замена.

H1. Динамический статистический бейзлайн (иерархический отбор пар + своя логика исполнения) обходит традиционные бенчмарки out-of-sample.

H2. DRL как overlay исполнения заметно поднимает прибыльность и risk-adjusted качество эвристического бейзлайна.

RQ1. Есть ли устойчивое преимущество у динамического мультипарного статарбитража на крипте?

RQ2. Улучшает ли DRL-overlay эвристику?

RQ3. Как награда, пространство наблюдений и риск-оверлей влияют на OOS-робастность в шумной среде?

Бейзлайн торгует «снимок равновесия», а не статическую [14] или непрерывно скользящую [4, 24] реверсию. End-to-end RL, который одновременно ищет сигнал и учит исполнение по сырым данным [15], часто нестабилен и переобучается OOS. Здесь процессы развязаны: PPO-LSTM только исполняет поверх статистически проверенного бейзлайна, внутри жёстких границ. Данные: Binance USD-M Futures, 1 час; in-sample 2024, out-of-sample 2025.

Вклады: (i) эмпирика safe RL via shielding в шумной среде; (ii) иерархический отбор: коинтеграция плюс Харст и бета, обмен концентрации альфы и диверсификации; (iii) эвристика исполнения под дрейф крипты; (iv) якорение нейрополитики на статистических границах против расхождения. Look-ahead и survivorship явно закрыты. Код открыт.

Структура PDF: §2 литература, §3 метод, §4 оптимизация бейзлайна, §5 оценка бейзлайна, §6 RL, §7 выводы. Приложение A — вспомогательные графики.

2. Обзор литературы

Дистанционный парный трейдинг Gatev et al. [14]: минимум суммы квадратов отклонений на формировании, торговля расхождений. Риск: прошлый co-movement не обязан жить дальше. Коинтеграция [10, 41] ищет настоящее долгосрочное равновесие. Йохансен мощнее и симметричен, но eigenvalue-разложение тяжело крутить на скользящем окне; Engle–Granger для бивариантного спреда практичнее [20, 6]. Современные пайплайны — многоступенчатый фильтр: Харст через R/S отделяет антиперсистентность ($H\lt 0.5$) от тренда; графовая кластеризация — топологические вселенные пар [7, 18, 33, 34, 23].

Моделирование спреда ушло от статики [14] к Калману и OU с s-score и half-life [9, 4]. На крипте скорость реверсии OU ломается, frictionless-хедж нереалистичен [2, 12, 24, 28]. DRL учит политику исполнения без жёсткой эконометрики [19, 26]; для пар — сайзинг под дисперсию [22, 40, 42]. Архитектура: PPO с trust region [35], LSTM под частичную наблюдаемость [11, 17]. Награда: обычный RL максимизирует ожидание без дисперсии; Prospect Theory и risk-sensitive RL — асимметричный штраф убытков [21, 29]. Неограниченный DRL хрупок OOD; литература предупреждает о переобучении бэктеста и зовёт «плато параметров», а не островки [5, 32, 25].

Safe RL via shielding: детерминированный невыученный слой ставит жёсткие ограждения над стохастической политикой [13, 1, 30, 8]. В робототехнике это стандарт; связка shielding с классическим риск-менеджментом для HFT-трения на крипте почти не изучена. End-to-end, который учит фичи, коинтеграцию, сайзинг и исполнение сразу, дорог по выборке и ломок при смене режима [15, 43]. Мотивация работы: коинтеграция, Харст и якоря как щит над risk-sensitive PPO-LSTM.

3. Методология

3.1–3.2. Реализация и данные

Свой движок с нуля, не готовый бэктестер: Python 3.12, Poetry, Docker, Hydra+Pydantic, Gymnasium, Stable-Baselines3 / SB3-Contrib (Recurrent PPO), Weights & Biases. Репозиторий — ссылка в шапке.

Источник: официальный архив Binance Data Vision, USD-M Futures, часовой OHLCV. IS — 2024, OOS — 2025. Для первой итерации (январь 2024) формирование начинается 1 ноября 2023; непрерывный ряд до 31 декабря 2025 23:59 UTC. Универсум пересобирается каждый месяц: по предыдущим двум месяцам сортировка по среднедневному quoted volume в USDT, дыры в данных выкидываются ex-ante, топ $N=100$ ликвидных идут в отбор пар. Это не «статическая корзина выживших».

OOS 2025 даёт 8760 часов на актив. 20 пар × 12 месяцев = 240 независимых pair-month эпизодов. Авторы сознательно берут один год высокой гранулярности вместо десятилетий дневных баров Gatev.

3.3. Четыре уровня оценки

Иерархия скользящих окон: формирование за t−2,t−1, торговля в месяце t, бета и окно W без заглядывания вперёд
Рис. 1. Уровень 1: двухмесячное формирование полностью отделено от месячной торговли. Бета и окно Z считаются только по закрытым данным.

3.4. Трения и плечо

Комиссия по умолчанию 0,05% на исполнение (тейкер USDT-M Binance). Стресс: 0,10% = 0,05% комиссия + 0,05% прокси проскальзывания. Плечо $L$: маржа × $L$ = нотионал; PnL и комиссии с нотионала; количество в сделке фиксировано. Ликвидация, когда нереализованный нетто-PnL (с ожидаемой комиссией выхода) достигает 100% исходной маржи; исчерпание капитала пары = банкротство этой пары. На бирже maintenance margin срабатывает раньше; здесь 100% — упрощение «риск разорения» [39]. Бейзлайн и агент на тесте — 10×, чтобы волатильность стратегии была сравнима с BTC / равновзвешенным портфелем без плеча. Обучение агента — 1×, чтобы не схлопнуть политику штрафом банкротства.

3.5. Отбор пар: Filter-then-Rank

Каждый месяц: лог-цены на окне формирования. Кандидаты — $N(N-1)/2=4950$ пар из топ-100.

Стадия 1, сырой скор (равные веса коинтеграции и $R^2$): \[ \mathrm{Raw\ Score}=0.5\cdot(1-p_{\mathrm{EG}})+0.5\cdot R^2. \] $p_{\mathrm{EG}}$ — p-value Augmented Engle–Granger [10]. Нет абсолютного порога вроде «скор $\gt 0{,}70$»: берут топ $n=20$ (крайние 0,4% распределения). Выпуклая комбинация на $[0,1]$ сама требует высоких обеих компонент.

Стадия 2, жёсткие фильтры на том же окне: OLS $p_{A,t}=\alpha+\beta p_{B,t}+\varepsilon_t$. Харст $H\lt 0.5$ (антиперсистентность), $\beta\gt 0$ (иначе лонг/шорт-хедж бессмыслен). Финальный скор: \[ \mathrm{Final\ Score}=\begin{cases} 0.5\cdot(1-p_{\mathrm{EG}})+0.5\cdot R^2,& H\lt 0.5\ \text{и}\ \beta\gt 0,\\ 0,& \text{иначе.} \end{cases} \] Йохансен отвергнут из-за $O(N^2)$ eigenvalue на 4950 парах; асимметрию EG режут Харст и $\beta$. Делистинг в торговом месяце: аварийная ликвидация по последней котировке (нет survivorship-чистки прошлого).

3.6. Бейзлайн: Fixed Risk, Adaptive Mean

Сигнал по close, исполнение по open следующего часа — нет look-ahead. В конце месяца все позиции принудительно закрываются: следующий месяц стартует в кэше с новым набором пар.

Дискретные действия: лонг-нога $1$, шорт-нога $-1$, вне рынка $0$; на сигнал — 100% капитала пары. Условный Z-скор: в рынке $\beta_t$ и $\sigma_t$ живые; в позиции $\beta_{t_0}$ и $\sigma_{t_0}$ заморожены, среднее $\mu_t$ всегда живое. \[ Z_t=\begin{cases} \dfrac{p_{A,t}-\beta_t p_{B,t}-\mu_t}{\sigma_t},& \mathrm{Position}_{t-1}=0,\\[1em] \dfrac{p_{A,t}-\beta_{t_0}p_{B,t}-\mu_t}{\sigma_{t_0}},& \mathrm{Position}_{t-1}\neq 0. \end{cases} \] Бета — OLS на месячном окне; $\mu,\sigma$ — неделя, $W=168$ часов по умолчанию. Спред в рынке: $p_{A,t}-\beta_t p_{B,t}$; в позиции: $p_{A,t}-\beta_{t_0}p_{B,t}$. Веса $w_A=1/(1+\beta_{t_0})$, $w_B=\beta_{t_0}/(1+\beta_{t_0})$. Заморозка беты в сделке: иначе ребаланс съест кромку комиссиями [4]. Заморозка $\sigma_{t_0}$: иначе шип волатильности тянет $Z$ к нулю («ошибка знаменателя»). Живое среднее: иначе стратегия ждёт мёртвое равновесие после сдвига режима. \[ \mu_t=\frac1W\sum_{k=0}^{W-1}\mathrm{Spread}_{t-k}. \]

Стоп-лосс, три яруса. Порог не от фактического $Z_{t_0}$ входа, а от параметра входа: $\mathrm{SL}_{\mathrm{thr}}=\mathrm{Entry}_{\mathrm{thr}}\times\mathrm{SL}$. Иначе свеча с $Z=5{,}5$ раздула бы SL до 11. SL Lock: после стопа пара в чёрном списке, пока $Z$ не пересечёт порог выхода (возврат к равновесию). Time Decay SL: после 50% окна $W$ порог SL линейно сжимается к выходу; к $W$ часам — принудительная ликвидация.

Сигналы. Лонг: пересечение $-{\mathrm{Entry}}$ сверху вниз, и $Z_t\gt -{\mathrm{SL}}_{\mathrm{thr}}$. Шорт: пересечение $+{\mathrm{Entry}}$ снизу вверх, и $Z_t\lt {\mathrm{SL}}_{\mathrm{thr}}$. Тейк-профит: возврат к $\mathrm{Exit}=0$. Стоп: $|Z|$ за $\mathrm{SL}_{\mathrm{thr}}$. Исполнение на open $t+1$.

3.7. RL как overlay исполнения

Не end-to-end: агент не ищет пары и не оценивает коинтеграцию. PPO+LSTM [35, 17]. Таблица 1: lr $3\cdot 10^{-4}$, batch 256, 10 эпох, $\epsilon=0.2$, $\gamma=0.999$, энтропия $0{,}01$, nsteps 256, LSTM 128×1, critic LSTM включён, 20 проходов на пару, seed 42. $\gamma^{168}\approx 0{,}846$ — награда в конце 168-часового эпизода ещё весома. Скрытое состояние LSTM сбрасывается в конце эпизода: нет запоминания глобальной хронологии.

Наблюдения. Autonomous $\mathbb{R}^3$: $Z_t$, позиция, $t_{\mathrm{pos}}/W$. Standard $\mathbb{R}^4$: плюс дискретный сигнал бейзлайна $\{-1,0,1\}$. Full $\mathbb{R}^5$: плюс $H_t$. Нормализация running mean/variance, клип выбросов [11].

Награды с асимметрией $\lambda\in\{1{,}0,\,1{,}2\}$; банкротство $\to -1$.

StepPnL (плотная): $r_t=(\Delta\mathrm{PnL}_t-f_t)/\mathrm{Equity}_t$, $R_t=r_t$ если $r_t\ge 0$, иначе $\lambda r_t$.

TradePnL (редкая): то же на закрытии сделки, иначе 0.

HybridAction: TradePnL плюс $\Phi_t$ относительно round-trip $2f_t$, множитель $m=0.2$: бонус за совпадение с сигналом бейзлайна, штраф за пропуск, двойной штраф за контртренд. Авторы прямо пишут: Hybrid — тест guided exploration, не автономный агент; omission penalty вшивает эвристику в ландшафт награды.

Щит на деплое, не на обучении. На IS overlay выключен: агент сам выходит, иначе цензура эпизодов портит value [30]. На OOS: жёсткий тейк-профит $\mathrm{Exit}=0$ и SL бейзлайна; если сеть не закрыла — оверлей закрывает. В обучении остаётся только Time Decay (усечение горизонта). Плечо 1× в train, 10× в OOS; наблюдение без капитала, логика масштабно-инвариантна.

3.8. Метрики

CAGR: $(V_T/V_0)^{1/Y}-1$. Годовая волатильность с $AF=8760$ для часов. Максимальная просадка. Шарп, Сортино, Кальмар. Trade-level метрики (винрейт, средняя сделка) — в неплечевых единицах, портфельные — после 10×. Бенчмарки: B&H BTC и равновзвешенный портфель (EWP), оба с комиссией 0,05% без плеча.

4. Оптимизация бейзлайна (in-sample 2024)

Заморожено без грида: пары $=20$, $W=168$, $\mathrm{Exit}=0$ (математическая идентичность mean-reversion, не «забыли оптимизировать»). Оптимизация последовательная, не полный грид: сначала Entry без SL по распределению месячных Сортино (без компаундинга между месяцами, комиссия 0,05%, без плеча), затем SL. Грубый грид Entry $\in\{2{,}0,\ldots,4{,}0\}$. Пики медианы около 3,0 и 3,5. Окрестность 3,5: медиана высокая, среднее ниже — левый скос, хрупкий островок. Окрестность 3,0 — плато. Итог: $\mathrm{Entry}=3{,}0$, $\mathrm{SL}=2{,}0$.

5. Бейзлайн out-of-sample

Кумулятивная доходность бейзлайна 2024 и 2025 против BTC и равновзвешенного портфеля
Рис. 8. Бейзлайн (комиссия 0,05%, плечо 10×) против B&H BTC и EWP. Слева IS 2024, справа OOS 2025. Параметры: Entry 3,0, SL 2,0, Exit 0, окно 168, 20 пар.
Таблица 2. OOS 2025, бейзлайн против бенчмарков.
МетрикаБейзлайн 10×BTC B&HEWP B&H
CAGR30,40%−6,43%−62,73%
Годовая волатильность61,78%44,36%61,45%
Макс. просадка34,13%34,75%69,36%
Винрейт60,23%
Средняя длительность, ч55,04
Шарп год.0,4921−0,1451−1,0208
Сортино год.0,5360−0,1848−1,2795
Кальмар0,8908−0,1852−0,9044

Чувствительность (табл. 3–4, графики в приложении A): Entry 2,5 или 3,5, Exit $-0{,}5$, SL 1,5, 10/30 пар, окно 120/216 — CAGR часто уходит в минус. Без комиссии CAGR 80,52%; при 0,10% уже −6,02%. Без беты −19,39%; без SL Lock 1,98%; без Time Decay −1,13%. Эвристика ловит реверсию, но жива только при жёстких структурных костылях — отсюда мотивация адаптивного исполнения внутри тех же костылей.

6. Оценка RL-стратегии

18 агентов: 3 награды × 3 пространства × 2 значения $\lambda$. Отбор модели на IS 2024 без риск-оверлея (иначе look-ahead от уже подогнанных границ §4). Два фильтра: средняя длительность сделки ≈ 55 ч бейзлайна (не скальп и не тренд), затем максимум винрейта. Агент 6 даёт лучший IS-Сортино 3,79 при 22 ч — это уже шум микроструктуры, его отвергают. Агент 2 (StepPnL, Autonomous, $\lambda=1{,}2$): длительность 45,61 ч, винрейт 73,33%.

Кумулятивная доходность агента 2 в 2025 против бейзлайна, BTC и EWP
Рис. 11. OOS 2025: агент 2 (оранжевый) против бейзлайна, BTC и EWP. Комиссия 0,05%, у агента и бейзлайна плечо 10×.
Таблица 7. OOS 2025, агент 2 против бейзлайна и бенчмарков.
МетрикаБейзлайн 10×Агент 2, 10×BTCEWP
CAGR30,40%199,45%−6,43%−62,73%
Годовая волатильность61,78%70,68%44,36%61,45%
Макс. просадка34,13%35,27%34,75%69,36%
Сделок выигр./проигр.371 / 245816 / 299
Винрейт60,23%73,18%
Средняя длительность, ч55,0433,07
Шарп год.0,49212,8220−0,1451−1,0208
Сортино год.0,53603,2494−0,1848−1,2795
Кальмар0,89085,6557−0,1852−0,9044

Просадка почти как у бейзлайна (35,27% против 34,13%), винрейт выше. Длительность короче (33 ч) — агент точнее входит/выходит, не ломая half-life отбора пар.

Чувствительность агента (табл. 8–9). 10 пар: CAGR 345,79%, Сортино 3,88 — концентрация альфы. 30 пар: CAGR 78,54%, волатильность и просадка ниже — диверсификация. Окно 120 ч ломает агента (CAGR −18%). Без комиссии CAGR 446,83%, Сортино 7,34; при 0,10% всё ещё CAGR 63,29%, Сортино 1,02. Без риск-оверлея: просадка 65,09%, волатильность 91,55%, Сортино 0,99 — щит не опция, а условие выживания. Без беты CAGR 300,72% (разбор в §6.5.1).

6.5. Post-hoc абляции

Бета-хедж. OLS дневных доходностей на BTC, OOS 2025 (табл. 10): хеджированный агент $\alpha=0{,}0038$ ($p=0{,}0594$), $\beta=0{,}1789$ ($p=0{,}0497$); нехеджированный $\alpha=0{,}0044$ ($p=0{,}0201$), $\beta=0{,}0461$ ($p=0{,}59$). Принудительный хедж сам вносит корреляцию с рынком и трение шортов; «нехедж лучше» — не направленная премия BTC.

Конфигурации. Рис. 12–14 (в оригинале, здесь описаны): плотный StepPnL даёт самые сильные OOS-кривые; Autonomous не хуже Full. Медленный Харст в наблюдении — информационное трение (VIF), не полезный сигнал. Hybrid с omission penalty не обгоняет автономный StepPnL: вшивание эвристики в награду не ускоряет обобщение.

Сиды (табл. 14). Пять инициализаций $\{0,1,42,100,999\}$. Seed 42 (основной результат) CAGR 199,45%; seed 100: −3,00%. Среднее CAGR 64,36%, средний Сортино 1,10; стд CAGR 69,91%. Четыре из пяти сидов в плюсе. Для живой торговли авторы сами зовут ансамбль / усреднение сидов: 199% — оптимистичный верх, не «ожидание».

Будущий блок-бутстреп (табл. 15). Stationary circular block bootstrap [31], 10 000 итераций, блок 168 ч, seed 42. $H_0$: $\Delta\le 0$ (агент не лучше бейзлайна). Разница Шарпа 2,33, 95% ДИ $[-0{,}43,\,11{,}37]$, $p=0{,}0603$; Сортино $p=0{,}0593$. Значимо на 10%, не на 5%. Широкий ДИ — цена годовой крипто-дисперсии.

Кварталы 2025 (табл. 16). Агент лучше бейзлайна в трёх из четырёх кварталов. Q4: бейзлайн CAGR −33,29%, агент +525,29% (Кальмар 17,58) — адаптация к сдвигу, не один «удачный месяц». В Q3 бейзлайн временно впереди; у агента всё равно плюс.

7. Заключение и ограничения

H1 и RQ1: бейзлайн с Filter-then-Rank и FRAM обходит BTC и EWP OOS (CAGR 30,40% при 10×). H2 и RQ2: PPO-LSTM overlay почти утраивает risk-adjusted (Сортино 3,25 против 0,54). Бутстреп — 10%, не 5%. RQ3: автономное трёхмерное состояние и плотная асимметричная награда лучше «полной» наблюдаемости; щит обязателен; принудительный хедж на этой политике скорее мешает.

Ограничения, которые авторы фиксируют сами. OOS — один календарный год. Дисперсия по сидам огромна (199% vs −3%). Комиссия 0,10% — прокси, нет симуляции стакана и импакта; для живого капитала нужны жёсткие лимиты ёмкости. Сравнение IS и OOS агрегатов методически нельзя: на IS щит выключен. 199% CAGR агента 2 — точка seed 42, не среднее по сидам (64%).

Дальше: Калман вместо статичных окон; веса капитала пропорционально Final Score; мета-агент на число пар; другие представления состояния.

Литература

  1. Alshiekh, M., et al. (2018). Safe reinforcement learning via shielding. AAAI.
  2. Bailey, D., Borwein, J.J., Lopez de Prado, M., Zhu, Q. (2014). Pseudo-mathematics and financial charlatanism. Notices AMS.
  3. Do, B., Faff, R. (2010/2012). Does simple pairs trading still work? related works on filter design.
  4. Elliott, R.J., Van Der Hoek, J., Malcolm, W.P. (2005). Pairs trading. Quantitative Finance.
  5. Engle, R.F., Granger, C.W.J. (1987). Co-integration and error correction.
  6. Gatev, E., Goetzmann, W.N., Rouwenhorst, K.G. (2006). Pairs trading: Performance of a relative-value arbitrage rule. Review of Financial Studies.
  7. Hurst, H.E. (1951); Ramos-Requena et al. (2017). Hurst exponent in pair trading. Physica A.
  8. Johansen, S. (1991). Estimation and hypothesis testing of cointegration vectors.
  9. Krauss, C. (2017). Statistical arbitrage pairs trading strategies: Review. J. Econ. Surveys.
  10. López de Prado, M. (2018). Advances in Financial Machine Learning. Wiley.
  11. Makarov, I., Schoar, A. (2020). Trading and arbitrage in cryptocurrency markets. JFE.
  12. Mihatsch, O., Neuneier, R. (2002). Risk-sensitive reinforcement learning. Machine Learning.
  13. Politis, D.N., Romano, J.P. (1994). The stationary bootstrap. JASA.
  14. Schulman, J., et al. (2017). Proximal policy optimization algorithms. arXiv:1707.06347.
  15. Sutton, R.S., Barto, A.G. (2018). Reinforcement Learning: An Introduction. 2nd ed. MIT Press.
  16. Vergara, G., Kristjanpoller, W. (2024). DRL applied to statistical arbitrage on cryptomarket. Applied Soft Computing.
  17. Yang, H., Malik, A. (2024). Reinforcement learning pair trading: A dynamic scaling approach. JRFM.
  18. Полный список из 43 позиций — в оригинальном PDF.

Перевод: полный основной текст §§1–7; приложение A опущено. · arXiv:2606.04574 · лицензия CC BY-NC-ND 4.0