Динамическая мультипарная стратегия на крипторынках с глубоким обучением с подкреплением
Дамиан Лебедь · Faculty of Economic Sciences, University of Warsaw
Роберт Слепачук · Quantitative Finance Research Group, Department of Quantitative Finance and Machine Learning, University of Warsaw · v2, 25 июня 2026
Оригинал: Lebiedź, D. and Ślepaczuk, R. «Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning», 2026 — arxiv.org/abs/2606.04574 (PDF).
Код: github.com/damianlebiedz/pair-trading-with-rl. Приложение A (диагностики критика и equity чувствительности) опущено как набор повторяющихся графиков; таблицы 1–16 и формулы (1)–(17) сохранены. Рис. 1, 8 и 11 воспроизведены. Оригинал распространяется по лицензии CC BY-NC-ND 4.0; перевод выполнен на её условиях для личной коллекции, изменение по отношению к оригиналу — перевод на русский язык.
Ключевые слова: глубокое обучение с подкреплением; deterministic shielding; safe RL; иерархические системы; количественные финансы; статистический арбитраж.
Аннотация
Можно ли улучшить парный трейдинг на высоковолатильной крипте, если DRL поставить не вместо стратегии, а как слой исполнения? Классика работает на акциях, на крипте становится жёсткой и ломается на расхождении пары. Авторы предлагают иерархический отбор «Filter-then-Rank» и модель исполнения «Fixed Risk, Adaptive Mean». Агент — PPO с LSTM, решения об исполнении внутри жёстких детерминированных границ риска. Данные: часовые бары Binance USD-M Futures. Оптимизированная RL-политика существенно обходит эвристический бейзлайн out-of-sample. Stationary circular block bootstrap подтверждает превосходство по risk-adjusted метрикам на 10%, но не проходит 5% — авторы связывают это с идиосинкратической дисперсией цифровых активов. Вклад: гибрид статарбитража и DRL-исполнения и каркас safe RL через deterministic shielding.
1. Введение
Статарбитраж ловит временные аномалии цены между связанными активами. На акциях классика жива; крипта — высокая волатильность и смена режимов [2], трения и риск расхождения [28], поэтому парный трейдинг здесь труднее [12]. Цель диссертации — динамическая мультипарная стратегия, где DRL — специализированный слой исполнения, а не end-to-end замена.
H1. Динамический статистический бейзлайн (иерархический отбор пар + своя логика исполнения) обходит традиционные бенчмарки out-of-sample.
H2. DRL как overlay исполнения заметно поднимает прибыльность и risk-adjusted качество эвристического бейзлайна.
RQ1. Есть ли устойчивое преимущество у динамического мультипарного статарбитража на крипте?
RQ2. Улучшает ли DRL-overlay эвристику?
RQ3. Как награда, пространство наблюдений и риск-оверлей влияют на OOS-робастность в шумной среде?
Бейзлайн торгует «снимок равновесия», а не статическую [14] или непрерывно скользящую [4, 24] реверсию. End-to-end RL, который одновременно ищет сигнал и учит исполнение по сырым данным [15], часто нестабилен и переобучается OOS. Здесь процессы развязаны: PPO-LSTM только исполняет поверх статистически проверенного бейзлайна, внутри жёстких границ. Данные: Binance USD-M Futures, 1 час; in-sample 2024, out-of-sample 2025.
Вклады: (i) эмпирика safe RL via shielding в шумной среде; (ii) иерархический отбор: коинтеграция плюс Харст и бета, обмен концентрации альфы и диверсификации; (iii) эвристика исполнения под дрейф крипты; (iv) якорение нейрополитики на статистических границах против расхождения. Look-ahead и survivorship явно закрыты. Код открыт.
Структура PDF: §2 литература, §3 метод, §4 оптимизация бейзлайна, §5 оценка бейзлайна, §6 RL, §7 выводы. Приложение A — вспомогательные графики.
2. Обзор литературы
Дистанционный парный трейдинг Gatev et al. [14]: минимум суммы квадратов отклонений на формировании, торговля расхождений. Риск: прошлый co-movement не обязан жить дальше. Коинтеграция [10, 41] ищет настоящее долгосрочное равновесие. Йохансен мощнее и симметричен, но eigenvalue-разложение тяжело крутить на скользящем окне; Engle–Granger для бивариантного спреда практичнее [20, 6]. Современные пайплайны — многоступенчатый фильтр: Харст через R/S отделяет антиперсистентность ($H\lt 0.5$) от тренда; графовая кластеризация — топологические вселенные пар [7, 18, 33, 34, 23].
Моделирование спреда ушло от статики [14] к Калману и OU с s-score и half-life [9, 4]. На крипте скорость реверсии OU ломается, frictionless-хедж нереалистичен [2, 12, 24, 28]. DRL учит политику исполнения без жёсткой эконометрики [19, 26]; для пар — сайзинг под дисперсию [22, 40, 42]. Архитектура: PPO с trust region [35], LSTM под частичную наблюдаемость [11, 17]. Награда: обычный RL максимизирует ожидание без дисперсии; Prospect Theory и risk-sensitive RL — асимметричный штраф убытков [21, 29]. Неограниченный DRL хрупок OOD; литература предупреждает о переобучении бэктеста и зовёт «плато параметров», а не островки [5, 32, 25].
Safe RL via shielding: детерминированный невыученный слой ставит жёсткие ограждения над стохастической политикой [13, 1, 30, 8]. В робототехнике это стандарт; связка shielding с классическим риск-менеджментом для HFT-трения на крипте почти не изучена. End-to-end, который учит фичи, коинтеграцию, сайзинг и исполнение сразу, дорог по выборке и ломок при смене режима [15, 43]. Мотивация работы: коинтеграция, Харст и якоря как щит над risk-sensitive PPO-LSTM.
3. Методология
3.1–3.2. Реализация и данные
Свой движок с нуля, не готовый бэктестер: Python 3.12, Poetry, Docker, Hydra+Pydantic, Gymnasium, Stable-Baselines3 / SB3-Contrib (Recurrent PPO), Weights & Biases. Репозиторий — ссылка в шапке.
Источник: официальный архив Binance Data Vision, USD-M Futures, часовой OHLCV. IS — 2024, OOS — 2025. Для первой итерации (январь 2024) формирование начинается 1 ноября 2023; непрерывный ряд до 31 декабря 2025 23:59 UTC. Универсум пересобирается каждый месяц: по предыдущим двум месяцам сортировка по среднедневному quoted volume в USDT, дыры в данных выкидываются ex-ante, топ $N=100$ ликвидных идут в отбор пар. Это не «статическая корзина выживших».
OOS 2025 даёт 8760 часов на актив. 20 пар × 12 месяцев = 240 независимых pair-month эпизодов. Авторы сознательно берут один год высокой гранулярности вместо десятилетий дневных баров Gatev.
3.3. Четыре уровня оценки
- Уровень 1. Одна пара, один месяц; компаундинг сделка-к-сделке, количество актива замораживается на входе.
- Уровень 2. Портфель $n=20$ пар в месяце, равные веса $1/n$.
- Уровень 3. 12 месяцев подряд: PnL месяца меняет капитал следующего.
- Уровень 4. Сшитый год 2024 = IS, год 2025 = OOS.
3.4. Трения и плечо
Комиссия по умолчанию 0,05% на исполнение (тейкер USDT-M Binance). Стресс: 0,10% = 0,05% комиссия + 0,05% прокси проскальзывания. Плечо $L$: маржа × $L$ = нотионал; PnL и комиссии с нотионала; количество в сделке фиксировано. Ликвидация, когда нереализованный нетто-PnL (с ожидаемой комиссией выхода) достигает 100% исходной маржи; исчерпание капитала пары = банкротство этой пары. На бирже maintenance margin срабатывает раньше; здесь 100% — упрощение «риск разорения» [39]. Бейзлайн и агент на тесте — 10×, чтобы волатильность стратегии была сравнима с BTC / равновзвешенным портфелем без плеча. Обучение агента — 1×, чтобы не схлопнуть политику штрафом банкротства.
3.5. Отбор пар: Filter-then-Rank
Каждый месяц: лог-цены на окне формирования. Кандидаты — $N(N-1)/2=4950$ пар из топ-100.
Стадия 1, сырой скор (равные веса коинтеграции и $R^2$): \[ \mathrm{Raw\ Score}=0.5\cdot(1-p_{\mathrm{EG}})+0.5\cdot R^2. \] $p_{\mathrm{EG}}$ — p-value Augmented Engle–Granger [10]. Нет абсолютного порога вроде «скор $\gt 0{,}70$»: берут топ $n=20$ (крайние 0,4% распределения). Выпуклая комбинация на $[0,1]$ сама требует высоких обеих компонент.
Стадия 2, жёсткие фильтры на том же окне: OLS $p_{A,t}=\alpha+\beta p_{B,t}+\varepsilon_t$. Харст $H\lt 0.5$ (антиперсистентность), $\beta\gt 0$ (иначе лонг/шорт-хедж бессмыслен). Финальный скор: \[ \mathrm{Final\ Score}=\begin{cases} 0.5\cdot(1-p_{\mathrm{EG}})+0.5\cdot R^2,& H\lt 0.5\ \text{и}\ \beta\gt 0,\\ 0,& \text{иначе.} \end{cases} \] Йохансен отвергнут из-за $O(N^2)$ eigenvalue на 4950 парах; асимметрию EG режут Харст и $\beta$. Делистинг в торговом месяце: аварийная ликвидация по последней котировке (нет survivorship-чистки прошлого).
3.6. Бейзлайн: Fixed Risk, Adaptive Mean
Сигнал по close, исполнение по open следующего часа — нет look-ahead. В конце месяца все позиции принудительно закрываются: следующий месяц стартует в кэше с новым набором пар.
Дискретные действия: лонг-нога $1$, шорт-нога $-1$, вне рынка $0$; на сигнал — 100% капитала пары. Условный Z-скор: в рынке $\beta_t$ и $\sigma_t$ живые; в позиции $\beta_{t_0}$ и $\sigma_{t_0}$ заморожены, среднее $\mu_t$ всегда живое. \[ Z_t=\begin{cases} \dfrac{p_{A,t}-\beta_t p_{B,t}-\mu_t}{\sigma_t},& \mathrm{Position}_{t-1}=0,\\[1em] \dfrac{p_{A,t}-\beta_{t_0}p_{B,t}-\mu_t}{\sigma_{t_0}},& \mathrm{Position}_{t-1}\neq 0. \end{cases} \] Бета — OLS на месячном окне; $\mu,\sigma$ — неделя, $W=168$ часов по умолчанию. Спред в рынке: $p_{A,t}-\beta_t p_{B,t}$; в позиции: $p_{A,t}-\beta_{t_0}p_{B,t}$. Веса $w_A=1/(1+\beta_{t_0})$, $w_B=\beta_{t_0}/(1+\beta_{t_0})$. Заморозка беты в сделке: иначе ребаланс съест кромку комиссиями [4]. Заморозка $\sigma_{t_0}$: иначе шип волатильности тянет $Z$ к нулю («ошибка знаменателя»). Живое среднее: иначе стратегия ждёт мёртвое равновесие после сдвига режима. \[ \mu_t=\frac1W\sum_{k=0}^{W-1}\mathrm{Spread}_{t-k}. \]
Стоп-лосс, три яруса. Порог не от фактического $Z_{t_0}$ входа, а от параметра входа: $\mathrm{SL}_{\mathrm{thr}}=\mathrm{Entry}_{\mathrm{thr}}\times\mathrm{SL}$. Иначе свеча с $Z=5{,}5$ раздула бы SL до 11. SL Lock: после стопа пара в чёрном списке, пока $Z$ не пересечёт порог выхода (возврат к равновесию). Time Decay SL: после 50% окна $W$ порог SL линейно сжимается к выходу; к $W$ часам — принудительная ликвидация.
Сигналы. Лонг: пересечение $-{\mathrm{Entry}}$ сверху вниз, и $Z_t\gt -{\mathrm{SL}}_{\mathrm{thr}}$. Шорт: пересечение $+{\mathrm{Entry}}$ снизу вверх, и $Z_t\lt {\mathrm{SL}}_{\mathrm{thr}}$. Тейк-профит: возврат к $\mathrm{Exit}=0$. Стоп: $|Z|$ за $\mathrm{SL}_{\mathrm{thr}}$. Исполнение на open $t+1$.
3.7. RL как overlay исполнения
Не end-to-end: агент не ищет пары и не оценивает коинтеграцию. PPO+LSTM [35, 17]. Таблица 1: lr $3\cdot 10^{-4}$, batch 256, 10 эпох, $\epsilon=0.2$, $\gamma=0.999$, энтропия $0{,}01$, nsteps 256, LSTM 128×1, critic LSTM включён, 20 проходов на пару, seed 42. $\gamma^{168}\approx 0{,}846$ — награда в конце 168-часового эпизода ещё весома. Скрытое состояние LSTM сбрасывается в конце эпизода: нет запоминания глобальной хронологии.
Наблюдения. Autonomous $\mathbb{R}^3$: $Z_t$, позиция, $t_{\mathrm{pos}}/W$. Standard $\mathbb{R}^4$: плюс дискретный сигнал бейзлайна $\{-1,0,1\}$. Full $\mathbb{R}^5$: плюс $H_t$. Нормализация running mean/variance, клип выбросов [11].
Награды с асимметрией $\lambda\in\{1{,}0,\,1{,}2\}$; банкротство $\to -1$.
StepPnL (плотная): $r_t=(\Delta\mathrm{PnL}_t-f_t)/\mathrm{Equity}_t$, $R_t=r_t$ если $r_t\ge 0$, иначе $\lambda r_t$.
TradePnL (редкая): то же на закрытии сделки, иначе 0.
HybridAction: TradePnL плюс $\Phi_t$ относительно round-trip $2f_t$, множитель $m=0.2$: бонус за совпадение с сигналом бейзлайна, штраф за пропуск, двойной штраф за контртренд. Авторы прямо пишут: Hybrid — тест guided exploration, не автономный агент; omission penalty вшивает эвристику в ландшафт награды.
Щит на деплое, не на обучении. На IS overlay выключен: агент сам выходит, иначе цензура эпизодов портит value [30]. На OOS: жёсткий тейк-профит $\mathrm{Exit}=0$ и SL бейзлайна; если сеть не закрыла — оверлей закрывает. В обучении остаётся только Time Decay (усечение горизонта). Плечо 1× в train, 10× в OOS; наблюдение без капитала, логика масштабно-инвариантна.
3.8. Метрики
CAGR: $(V_T/V_0)^{1/Y}-1$. Годовая волатильность с $AF=8760$ для часов. Максимальная просадка. Шарп, Сортино, Кальмар. Trade-level метрики (винрейт, средняя сделка) — в неплечевых единицах, портфельные — после 10×. Бенчмарки: B&H BTC и равновзвешенный портфель (EWP), оба с комиссией 0,05% без плеча.
4. Оптимизация бейзлайна (in-sample 2024)
Заморожено без грида: пары $=20$, $W=168$, $\mathrm{Exit}=0$ (математическая идентичность mean-reversion, не «забыли оптимизировать»). Оптимизация последовательная, не полный грид: сначала Entry без SL по распределению месячных Сортино (без компаундинга между месяцами, комиссия 0,05%, без плеча), затем SL. Грубый грид Entry $\in\{2{,}0,\ldots,4{,}0\}$. Пики медианы около 3,0 и 3,5. Окрестность 3,5: медиана высокая, среднее ниже — левый скос, хрупкий островок. Окрестность 3,0 — плато. Итог: $\mathrm{Entry}=3{,}0$, $\mathrm{SL}=2{,}0$.
5. Бейзлайн out-of-sample
| Метрика | Бейзлайн 10× | BTC B&H | EWP B&H |
|---|---|---|---|
| CAGR | 30,40% | −6,43% | −62,73% |
| Годовая волатильность | 61,78% | 44,36% | 61,45% |
| Макс. просадка | 34,13% | 34,75% | 69,36% |
| Винрейт | 60,23% | — | — |
| Средняя длительность, ч | 55,04 | — | — |
| Шарп год. | 0,4921 | −0,1451 | −1,0208 |
| Сортино год. | 0,5360 | −0,1848 | −1,2795 |
| Кальмар | 0,8908 | −0,1852 | −0,9044 |
Чувствительность (табл. 3–4, графики в приложении A): Entry 2,5 или 3,5, Exit $-0{,}5$, SL 1,5, 10/30 пар, окно 120/216 — CAGR часто уходит в минус. Без комиссии CAGR 80,52%; при 0,10% уже −6,02%. Без беты −19,39%; без SL Lock 1,98%; без Time Decay −1,13%. Эвристика ловит реверсию, но жива только при жёстких структурных костылях — отсюда мотивация адаптивного исполнения внутри тех же костылей.
6. Оценка RL-стратегии
18 агентов: 3 награды × 3 пространства × 2 значения $\lambda$. Отбор модели на IS 2024 без риск-оверлея (иначе look-ahead от уже подогнанных границ §4). Два фильтра: средняя длительность сделки ≈ 55 ч бейзлайна (не скальп и не тренд), затем максимум винрейта. Агент 6 даёт лучший IS-Сортино 3,79 при 22 ч — это уже шум микроструктуры, его отвергают. Агент 2 (StepPnL, Autonomous, $\lambda=1{,}2$): длительность 45,61 ч, винрейт 73,33%.
| Метрика | Бейзлайн 10× | Агент 2, 10× | BTC | EWP |
|---|---|---|---|---|
| CAGR | 30,40% | 199,45% | −6,43% | −62,73% |
| Годовая волатильность | 61,78% | 70,68% | 44,36% | 61,45% |
| Макс. просадка | 34,13% | 35,27% | 34,75% | 69,36% |
| Сделок выигр./проигр. | 371 / 245 | 816 / 299 | — | — |
| Винрейт | 60,23% | 73,18% | — | — |
| Средняя длительность, ч | 55,04 | 33,07 | — | — |
| Шарп год. | 0,4921 | 2,8220 | −0,1451 | −1,0208 |
| Сортино год. | 0,5360 | 3,2494 | −0,1848 | −1,2795 |
| Кальмар | 0,8908 | 5,6557 | −0,1852 | −0,9044 |
Просадка почти как у бейзлайна (35,27% против 34,13%), винрейт выше. Длительность короче (33 ч) — агент точнее входит/выходит, не ломая half-life отбора пар.
Чувствительность агента (табл. 8–9). 10 пар: CAGR 345,79%, Сортино 3,88 — концентрация альфы. 30 пар: CAGR 78,54%, волатильность и просадка ниже — диверсификация. Окно 120 ч ломает агента (CAGR −18%). Без комиссии CAGR 446,83%, Сортино 7,34; при 0,10% всё ещё CAGR 63,29%, Сортино 1,02. Без риск-оверлея: просадка 65,09%, волатильность 91,55%, Сортино 0,99 — щит не опция, а условие выживания. Без беты CAGR 300,72% (разбор в §6.5.1).
6.5. Post-hoc абляции
Бета-хедж. OLS дневных доходностей на BTC, OOS 2025 (табл. 10): хеджированный агент $\alpha=0{,}0038$ ($p=0{,}0594$), $\beta=0{,}1789$ ($p=0{,}0497$); нехеджированный $\alpha=0{,}0044$ ($p=0{,}0201$), $\beta=0{,}0461$ ($p=0{,}59$). Принудительный хедж сам вносит корреляцию с рынком и трение шортов; «нехедж лучше» — не направленная премия BTC.
Конфигурации. Рис. 12–14 (в оригинале, здесь описаны): плотный StepPnL даёт самые сильные OOS-кривые; Autonomous не хуже Full. Медленный Харст в наблюдении — информационное трение (VIF), не полезный сигнал. Hybrid с omission penalty не обгоняет автономный StepPnL: вшивание эвристики в награду не ускоряет обобщение.
Сиды (табл. 14). Пять инициализаций $\{0,1,42,100,999\}$. Seed 42 (основной результат) CAGR 199,45%; seed 100: −3,00%. Среднее CAGR 64,36%, средний Сортино 1,10; стд CAGR 69,91%. Четыре из пяти сидов в плюсе. Для живой торговли авторы сами зовут ансамбль / усреднение сидов: 199% — оптимистичный верх, не «ожидание».
Будущий блок-бутстреп (табл. 15). Stationary circular block bootstrap [31], 10 000 итераций, блок 168 ч, seed 42. $H_0$: $\Delta\le 0$ (агент не лучше бейзлайна). Разница Шарпа 2,33, 95% ДИ $[-0{,}43,\,11{,}37]$, $p=0{,}0603$; Сортино $p=0{,}0593$. Значимо на 10%, не на 5%. Широкий ДИ — цена годовой крипто-дисперсии.
Кварталы 2025 (табл. 16). Агент лучше бейзлайна в трёх из четырёх кварталов. Q4: бейзлайн CAGR −33,29%, агент +525,29% (Кальмар 17,58) — адаптация к сдвигу, не один «удачный месяц». В Q3 бейзлайн временно впереди; у агента всё равно плюс.
7. Заключение и ограничения
H1 и RQ1: бейзлайн с Filter-then-Rank и FRAM обходит BTC и EWP OOS (CAGR 30,40% при 10×). H2 и RQ2: PPO-LSTM overlay почти утраивает risk-adjusted (Сортино 3,25 против 0,54). Бутстреп — 10%, не 5%. RQ3: автономное трёхмерное состояние и плотная асимметричная награда лучше «полной» наблюдаемости; щит обязателен; принудительный хедж на этой политике скорее мешает.
Ограничения, которые авторы фиксируют сами. OOS — один календарный год. Дисперсия по сидам огромна (199% vs −3%). Комиссия 0,10% — прокси, нет симуляции стакана и импакта; для живого капитала нужны жёсткие лимиты ёмкости. Сравнение IS и OOS агрегатов методически нельзя: на IS щит выключен. 199% CAGR агента 2 — точка seed 42, не среднее по сидам (64%).
Дальше: Калман вместо статичных окон; веса капитала пропорционально Final Score; мета-агент на число пар; другие представления состояния.
Литература
- Alshiekh, M., et al. (2018). Safe reinforcement learning via shielding. AAAI.
- Bailey, D., Borwein, J.J., Lopez de Prado, M., Zhu, Q. (2014). Pseudo-mathematics and financial charlatanism. Notices AMS. ↑
- Do, B., Faff, R. (2010/2012). Does simple pairs trading still work? related works on filter design.
- Elliott, R.J., Van Der Hoek, J., Malcolm, W.P. (2005). Pairs trading. Quantitative Finance. ↑
- Engle, R.F., Granger, C.W.J. (1987). Co-integration and error correction.
- Gatev, E., Goetzmann, W.N., Rouwenhorst, K.G. (2006). Pairs trading: Performance of a relative-value arbitrage rule. Review of Financial Studies.
- Hurst, H.E. (1951); Ramos-Requena et al. (2017). Hurst exponent in pair trading. Physica A.
- Johansen, S. (1991). Estimation and hypothesis testing of cointegration vectors.
- Krauss, C. (2017). Statistical arbitrage pairs trading strategies: Review. J. Econ. Surveys. ↑
- López de Prado, M. (2018). Advances in Financial Machine Learning. Wiley. ↑
- Makarov, I., Schoar, A. (2020). Trading and arbitrage in cryptocurrency markets. JFE. ↑
- Mihatsch, O., Neuneier, R. (2002). Risk-sensitive reinforcement learning. Machine Learning. ↑
- Politis, D.N., Romano, J.P. (1994). The stationary bootstrap. JASA.
- Schulman, J., et al. (2017). Proximal policy optimization algorithms. arXiv:1707.06347. ↑
- Sutton, R.S., Barto, A.G. (2018). Reinforcement Learning: An Introduction. 2nd ed. MIT Press. ↑
- Vergara, G., Kristjanpoller, W. (2024). DRL applied to statistical arbitrage on cryptomarket. Applied Soft Computing.
- Yang, H., Malik, A. (2024). Reinforcement learning pair trading: A dynamic scaling approach. JRFM. ↑
- Полный список из 43 позиций — в оригинальном PDF.
Перевод: полный основной текст §§1–7; приложение A опущено. · arXiv:2606.04574 · лицензия CC BY-NC-ND 4.0