Deep RL для диверсифицированного управления портфелем на глобальных рынках акций
Kamil Kashif (ORCID: 0009-0004-0666-581X), Robert Ślepaczuk (ORCID: 0000-0001-5227-2014, corresponding author: rslepaczuk@wne.uw.edu.pl)
Quantitative Finance Research Group, Faculty of Economic Sciences, University of Warsaw, ul. Długa 44–50, 00-241 Warsaw, Poland
Оригинал: Kashif, K. & Ślepaczuk, R. «Deep Reinforcement Learning Framework for Diversified Portfolio Management Across Global Equity Markets», 17 мая 2026 — arxiv.org/abs/2605.17307 (PDF, 67 стр.).
Рис. 1–11 — из оригинала (67-страничный PDF). Ниже — полный русскоязычный пересказ основных разделов, ключевых уравнений и главных таблиц; формального приложения с доказательствами в работе нет.
Ключевые слова: Reinforcement Learning, Deep RL, Hierarchical RL, Soft Actor-Critic, распределение портфеля, алгоритмический трейдинг, market timing, Walk-Forward Optimization, rolling retraining, Nasdaq-100, Nikkei 225, Euro Stoxx 50, иерархическая политика, Dirichlet, MDP.
JEL: C4, C14, C45, C53, C58, G13.
Аннотация
В работе разрабатывается и оценивается фреймворк deep reinforcement learning для динамического распределения портфеля на глобальных рынках акций. Алгоритм Soft Actor–Critic (SAC) обучает непрерывные веса портфеля в рамках марковского процесса принятия решений (MDP), учитывая транзакционные издержки, штрафы за оборот и ограничения диверсификации непосредственно в функции вознаграждения.
Сравниваются пять конфигураций модели — LSTM_1, LSTM_2, LSTM_NC_1, LSTM_NC_2 и TRANSFORMERS — которые различаются формулировкой reward (абсолютная vs относительно бенчмарка), структурой политики (плоская vs иерархическая Dirichlet), портфельными ограничениями (полная инвестиция vs гибкая доля cash) и временным энкодером (LSTM vs Transformer). Оценка проводится методом walk-forward optimization на шестнадцати out-of-sample фолдах за период 2003–2026 по индексам Nasdaq-100, Nikkei 225 и Euro Stoxx 50.
Результаты показывают, что RL-стратегии достигают конкурентоспособной risk-adjusted доходности прежде всего на Euro Stoxx 50, где по регрессионному анализу наблюдаются статистически значимые аномальные доходности; центральная гипотеза подтверждается лишь частично: ни одна стратегия не демонстрирует HAC-устойчивого статистически значимого превышения доходности относительно Buy & Hold на всех рынках одновременно. Анализ режимов показывает, что RL добавляет наибольшую ценность в периоды повышенной неопределённости; агрегация ансамбля по рынкам улучшает risk-adjusted результат — конфигурация LSTM_1 достигает IR2 = 0,41 против 0,34 у общего бенчмарка.
1. Введение
Прогнозирование и навигация на финансовых рынках остаётся сложной задачей из-за их неизбежной волатильности, сложной структуры и постоянно меняющейся экономической среды. За последние десятилетия крупные события — глобальный финансовый кризис 2008 года и пандемия COVID-19 — показали, насколько быстро могут меняться рыночные условия, что затрудняет обобщение традиционных моделей на разные режимы. В ответ исследователи и практики исследуют широкий спектр подходов: от классических статистических моделей до продвинутых методов машинного обучения.
В последние годы reinforcement learning (RL) зарекомендовал себя как перспективный фреймворк для финансового принятия решений. В отличие от supervised learning, ориентированного на прогноз цен или доходностей, RL напрямую моделирует задачу распределения портфеля как последовательное принятие решений: агент взаимодействует со средой и оптимизирует долгосрочную цель, а не точечный прогноз.
Главная цель исследования — разработать и оценить RL-стратегии распределения портфеля при реалистичных рыночных условиях. Задача формулируется как MDP; для обучения динамических политик распределения используется алгоритм Soft Actor–Critic (SAC). Фреймворк включает транзакционные издержки, штрафы за оборот и ограничения диверсификации в целевой функции обучения, а также схему walk-forward optimization (WFO) с адаптивным переобучением, имитирующую реалистичное развёртывание стратегии.
Центральный аспект работы — систематическое сравнение проектных решений внутри RL-фреймворка: формулировка reward (абсолютная vs относительно бенчмарка), структура политики (плоская vs иерархическое распределение), портфельные ограничения (полная инвестиция vs гибкая экспозиция) и временное кодирование (LSTM vs Transformer).
Центральная гипотеза: RL-стратегии распределения портфеля способны достигать устойчивой и экономически значимой доходности при обучении с реалистичными ограничениями и процедурами оценки; их эффективность сильно зависит от архитектурных и экономических решений. Дополнительно предполагается, что относительная эффективность RL варьирует по макроэкономическим режимам: активное распределение добавляет большую ценность в периоды повышенной неопределённости и более низкой персистентности тренда.
Исследование отвечает на шесть исследовательских вопросов:
- RQ1. Как формулировка reward (absolute vs benchmark-relative) влияет на performance и stability?
- RQ2. Как структура политики (flat vs hierarchical) влияет на performance и diversification?
- RQ3. Как ограничения (fully invested vs flexible cash) влияют на trading behavior и risk-adjusted returns?
- RQ4. Улучшает ли temporal encoder (LSTM vs Transformer) захват dynamics и performance?
- RQ5. Улучшает ли ensemble по рынкам risk-adjusted performance vs single-market strategies?
- RQ6. Варьируется ли performance RL по макроэкономическим режимам и где RL adds most value?
Для оценки используется кросс-секционная вселенная из трёх крупных индексов: Nasdaq-100 (США), Nikkei 225 (Азия) и Euro Stoxx 50 (Европа). Полная выборка — с 2 января 2003 по 13 марта 2026, дневная частота, охватывает множество режимов, включая периоды высокой волатильности и структурных сдвигов.
Эмпирическая процедура — WFO: каждая итерация включает 5 лет обучения, 1 год validation и 1 год test (16 фолдов). Это позволяет модели адаптироваться к меняющимся условиям при строгой out-of-sample оценке.
Вклад работы: (1) единый мультирыночный WFO-фреймворк с идентичными процедурами на трёх экономически различных рынках; (2) иерархическая Dirichlet-политика, разделяющая решение «акции vs cash» и выбор отдельных активов; (3) критерий adaptive retraining по rolling validation Sharpe; (4) систематическая декомпозиция по трём макроэкономическим подпериодам.
Структура работы: раздел 2 — обзор литературы (2.1–2.5); раздел 3 — data engineering (3.1–3.3); раздел 4 — theoretical background MDP/RL/DRL (4.1–4.5); раздел 5 — methodology SAC/WFO (5.1–5.10); раздел 6 — empirical results и statistical inference (6.1–6.5); раздел 7 — regime analysis; раздел 8 — ensemble total fund; раздел 9 — discussion RQ1–RQ6; раздел 10 — conclusions и future work. Основной текст оригинала — 67 страниц PDF без formal proofs appendix.
2. Обзор литературы
Исторически алгоритмический трейдинг опирался на rule-based исполнение, эконометрическое моделирование и supervised ML для снижения человеческих biases при входе и выходе с рынка. Сейчас происходит смена парадигмы: исследователи выходят за рамки статического прогнозирования цен и всё активнее изучают RL — особенно в сочетании с deep architectures — как комплексный подход к последовательному принятию решений, распределению портфеля и оптимизации риска.
2.1. Оптимизация портфеля
Фундамент современной оптимизации портфеля заложил Markowitz (1952): mean-variance optimization (MVO) балансирует ожидаемую доходность и риск через ковариационные матрицы, строя efficient frontier. Математически элегантный, MVO на практике нестабилен: Black & Litterman (1992) показали, что он часто даёт чрезмерно концентрированные портфели, гиперчувствительные к ошибкам оценки параметров.
Современная литература интегрирует прогнозные модели в цикл оптимизации. Ślusarczyk & Ślepaczuk (2025) модернизируют MVO, прогнозируя доходности гибридами time series и ML (ARIMA-GARCH, XGBoost). Chaweewanchon & Chaysiri (2022) объединяют CNN-BiLSTM-прогноз с классической MV-моделью на SET50. López de Prado et al. (2025) исследуют включение ML в Markowitz-фреймворк для alpha, risk management и CVaR.
Важный бенчмарк — equal-weight (1/N) стратегия DeMiguel et al. (2009): наивная диверсификация без оценки параметров устойчиво конкурирует или превосходит сложные mean-variance портфели out-of-sample. Это устанавливает equal-weight как строгий бенчмарк для любой активной стратегии распределения.
2.2. Машинное и deep learning в финансах
Применение statistical learning к рынкам означает сдвиг от проверки экономических гипотез к максимизации прогнозной точности. Финансовые ряды нелинейны; исследователи используют supervised frameworks. SVM (Kim, 2003) и Random Forest (Khaidem et al., 2016) показали устойчивость к выбросам. Grudniewicz & Ślepaczuk (2023) на глобальных рынках отмечают преимущество Linear SVM над Bayesian GLM.
Однако шум в финансовых сигналах и риск backtest overfitting остаются критичными. Bailey et al. (2017) предложили model-free framework для количественной оценки вероятности overfitting; López de Prado (2018) указывает на частые провалы ML-фондов и предлагает walk-forward backtesting и deflated Sharpe ratio.
Для временных рядов эволюция шла от RNN (Lin et al., 2021) к LSTM (Fischer & Krauss, 2018; Krynska & Ślepaczuk, 2023; Kashif & Ślepaczuk, 2025) и далее к Transformer (Kabir et al., 2025; Stefaniuk & Ślepaczuk, 2025). Bieganowski & Ślepaczuk (2025) показывают, что supervised autoencoders с recurrent структурами эффективны при robust labeling (Triple Barrier Method). Точность прогноза не гарантирует качество торгового правила — RL оптимизирует непосредственно целевую функцию портфеля.
2.3. Reinforcement и deep reinforcement learning в финансах
RL в финансах — переход от статического прогнозирования к активному agentic decision-making. Hambly et al. (2023) систематизируют современный financial RL, контрастируя его с классическим stochastic control: model-free RL справляется с высокоразмерными задачами без полной спецификации динамики рынка и естественно объединяет прогноз и решение (optimal execution, portfolio optimization, smart order routing).
Moody & Saffell (2001) ввели Direct Reinforcement (DR) и Recurrent RL (RRL): оптимизация risk-adjusted returns через differential Sharpe ratio без explicit forecasting models, avoiding Bellman curse of dimensionality; empirical results на S&P 500 и T-Bills favor RRL over value-function methods.
FinRL-Meta (Liu et al., 2021) стандартизирует среды near-real-market для DRL, но часто упрощает издержки и не проводит строгий мультирыночный WFO. Jiang et al. (2024) используют TD3 с extended mean–variance reward. Soleymani & Paquet (2020) — DeepBreath с restricted stacked autoencoder; Yang et al. (2020) — ensemble PPO/A2C/DDPG на 30 Dow Jones stocks; Wu et al. (2020) — GRU-based GDQN/GDPG на US/UK/China markets.
Enkhsaikhan & Jo (2025) формулируют portfolio optimization как CMDP с augmented Lagrangian; Tamuly et al. (2024) — DQN с experience replay; Cheng & Sun (2024) и Shavandi & Khedmati (2022) — multi-agent DRL; Millea (2023) — hierarchical model-based RL на crypto; Hao et al. (2023) — fuzzy ensemble DRL. Bracha et al. (2025), Du et al. (2020), Kabbani & Duman (2022), Rani et al. (2025), Zhang et al. (2026) расширяют DRL на hedging, options, HFT и cluster embedding.
Sterling & Thorne (2026) рассматривают системный уровень развёртывания DRL (governance, systemic risk, infrastructure). Настоящее исследование отличается иерархической Dirichlet-политикой, adaptive retraining и единой WFO-процедурой на Nasdaq-100, Nikkei 225 и Euro Stoxx 50 одновременно.
2.4. Reinforcement learning за пределами финансов
Методы RL в работе восходят к DQN (Mnih et al., 2015), PPO (Schulman et al., 2017) и SAC (Haarnoja et al., 2018). SAC расширяет actor–critic maximum-entropy RL для exploration и стабильности в continuous action spaces. Эти advances релевантны для portfolio allocation: высокоразмерные нестационарные среды, long-term risk-adjusted objectives, реалистичные ограничения — отсюда WFO и штрафы за оборот в финансовом контексте.
2.5. Сводка обзора литературы
Литература демонстрирует прогрессию от статической mean-variance оптимизации к адаптивным data-driven системам. MVO дало математический фундамент, но чувствительно к ошибкам оценки в нестационарной среде. ML улучшил захват нелинейностей, однако low signal-to-noise, overfitting и зависимость от прогноза доходностей ограничивают robustness.
RL переформулирует финансовое decision-making как sequential optimization: агент учится политике, максимизирующей long-term risk-adjusted performance при transaction costs и frictions. Deep RL работает в high-dimensional state spaces, но performance чувствителен к reward specification, stability и non-stationarity — требуются careful design и WFO-оценка.
Вывод: supervised подходы полезны как foundation, но недостаточны для dynamic sequential nature финансовых решений. Это мотивирует DRL как unified framework, интегрирующий prediction, execution и risk management в одной adaptive system.
Связь с настоящим исследованием: prior DRL portfolio work (Deng et al., 2017; Soleymani & Paquet, 2020; Wu et al., 2020; Jiang et al., 2024; Yang et al., 2020) преимущественно single-market и rarely combines hierarchical policies, adaptive retraining, и identical WFO across three global indices — пробел, который заполняет данная работа на 67 страницах arXiv:2605.17307.
3. Данные
Исследование охватывает три крупных equity-индекса — Nasdaq-100, Nikkei 225 и Euro Stoxx 50 — представляющих рынки США, Азии и Европы и обеспечивающих географическую диверсификацию для кросс-рыночного анализа.
3.1. Описание данных
Эмпирический анализ основан на мультиисточниковом датасете для обучения и оценки RL-фреймворка динамического распределения портфеля. Датасет интегрирует ценовую информацию на уровне активов, динамику состава индексов и бенчмарк-серии.
Дневные цены всех конституентов получены через API yfinance (стандартные рыночные переменные). Историческая информация о составе индексов (добавления и исключения) — из Bloomberg Terminal Anywhere; используется для реконструкции time-varying membership и устранения survivorship bias.
Tradable бенчмарки: Invesco QQQ Trust (QQQ) для Nasdaq-100; SPDR Euro Stoxx 50 ETF (FEZ) для Euro Stoxx 50; iShares MSCI Japan ETF (EWJ) как прокси Nikkei 225. Полная выборка: 2 января 2003 — 13 марта 2026. После сбора все источники выровнены в едином preprocessing pipeline.
На рис. 1 — нормализованные ценовые траектории активов (каждый ряд масштабирован к 1 в первой доступной точке; красная линия — benchmark ETF). Три панели: Nasdaq-100, Nikkei 225, Euro Stoxx 50 — визуально демонстрируют различную long-term drift и volatility structure, мотивируя multi-market evaluation.
Описательная статистика индексов (табл. 1–2 PDF): Nasdaq-100 — count 5836 obs, mean price 154 (std 154), range [20, 635]; Nikkei 225 — 5676 obs, mean 51 (12); Euro Stoxx 50 — 5836 obs, mean 30 (11). Daily log-returns: mean около 0,0001–0,0005; std 0,013–0,016; skewness −0,12 to −0,33; excess kurtosis 7,1–9,9; min/max daily moves до ±14%; Jarque–Bera rejects normality at 1% для всех трёх рядов.
3.2. Подготовка данных
3.2.1. Состав индекса и survivorship bias
Survivorship bias возникает, когда учитываются только текущие конституенты, игнорируя исключённые активы — это завышает оценки доходности. Для устранения bias использована полная история membership из Bloomberg с реконструкцией true time-varying composition каждого индекса. Рис. 2 показывает эволюцию числа конституентов во времени (динамическая investable universe).
3.2.2. Построение tradable universe
Цены объединены с historical membership matrix, расширенной до daily frequency. Строится tradability mask: актив доступен, если он одновременно член индекса и имеет valid price observation. Это устраняет survivorship bias и look-ahead errors.
Bloomberg membership forward-fill между событиями добавления/удаления; yfinance prices выровнены на common daily index; пропуски — forward-fill последней цены закрытия. Активы без valid price исключаются независимо от membership. Эффективные диапазоны для всех трёх индексов: 2003-01-02 — 2026-03-13 (с minor различиями в числе торговых дней из-за национальных календарей).
3.3. Итог по данным
Рис. 3 суммирует pipeline: Bloomberg (historical membership) + yfinance (daily prices) → tradable mask → model-ready dataset. Обработанные данные служат входом RL-фреймворку (раздел 5).
4. Теоретические основы
Финансовое decision-making — последовательные решения под неопределённостью: действия в момент $t$ влияют на будущие исходы. В portfolio allocation инвестор наблюдает рынок, выбирает веса, получает доходности. Эта sequential structure естественно ложится на RL.
4.1. Марковские процессы принятия решений (MDP)
Portfolio allocation формулируется как sequential decision problem. MDP $(\mathcal{S}, \mathcal{A}, P, r, \gamma)$: $\mathcal{S}$ — состояния; $\mathcal{A}$ — действия (распределения); $P(s_{t+1} \mid s_t, a_t)$ — переходы; $r(s_t, a_t)$ — награда; $\gamma \in (0, 1)$ — discount factor.
Markov property:
\[ P(s_{t+1} \mid s_t, a_t, s_{t-1}, a_{t-1}, \ldots) = P(s_{t+1} \mid s_t, a_t). \]
В finance это аппроксимация; state включает recent observations через lookback window.
4.2. Reinforcement learning
Policy $\pi(a \mid s)$ максимизирует expected cumulative reward. Return:
\[ G_t = \sum_{k=0}^{\infty} \gamma^k r_{t+k+1}. \]
Value functions:
\[ V^{\pi}(s) = \mathbb{E}_{\pi}[G_t \mid s_t = s], \qquad Q^{\pi}(s,a) = \mathbb{E}_{\pi}[G_t \mid s_t = s, a_t = a]. \]
Actor–critic обучает policy (actor) и value estimates (critic) одновременно.
4.3. Deep reinforcement learning
High-dimensional state space требует neural function approximators. Challenges: correlated sequential data, moving targets — mitigated через experience replay, target networks, stochastic optimization.
4.4. Representation learning для sequential data
LSTM захватывает temporal dependencies через gating; Transformers — через self-attention over history window.
4.5. Portfolio allocation как sequential control
Portfolio weights $\mathbf{w}_t = (w_{1,t}, \ldots, w_{N_t,t})$ при constraint $\sum_i w_{i,t} = 1$, $w_{i,t} \geq 0$. Realized return:
\[ R_{p,t+1} = \sum_{i=1}^{N_t} w_{i,t} R_{i,t+1}. \]
Transaction costs создают trade-off responsiveness vs turnover; reward function отражает performance net of frictions. Рис. 4 — loop agent–environment.
5. Методология
Раздел описывает methodological framework RL-based portfolio allocation: state representation, action space, reward, SAC architecture, конфигурации, WFO с adaptive retraining, метрики и бенчмарки.
5.1. Представление состояния
State включает asset-level и global market features для cross-sectional и absolute signals. Перед подачей в агента — cross-sectional selection top-$k$ по 120-day momentum ($k \in \{20, 30\}$ или $\{10, 20\}$ в NC-конфигурациях):
\[ m_{i,t}^{(120)} = \frac{P_{i,t}}{P_{i,t-120}} - 1. \]
5.1.1. Momentum. Log-returns на горизонтах $X \in \{1, 5, 20, 60\}$:
\[ r_{i,t}^{(X)} = \log\!\left(\frac{P_{i,t}}{P_{i,t-X}}\right). \]
5.1.2. Volatility. Rolling standard deviation log-returns на $X \in \{5, 20\}$:
\[ \sigma_{i,t}^{(X)} = \sqrt{\frac{1}{X}\sum_{j=1}^{X}(r_{i,t-j} - \bar{r}_{i,t})^2}. \]
5.1.3. Technical indicators. RSI, MACD histogram, Bollinger %B, distance from 20-day high, mean-reversion signal от 20-day MA.
5.1.4. Market-relative. Rolling 60-day beta к market proxy (QQQ/FEZ/EWJ); 20-day log return как absolute performance.
5.1.5. Global features. VIX и его 5-day change; cross-sectional average return tradable assets и 5-day rolling vol; market breadth (доля активов с positive medium-term returns); normalized proxy returns на 5 и 20 дней.
5.1.6. Dynamic universe. Top-$k$ momentum selection фиксирует размерность state vector при time-varying $N_t$ (рис. 2).
5.2. Пространство действий
Action $a_t = \mathbf{w}_t = (w_{1,t}, \ldots, w_{N_t,t}, w_t^c)$ — веса активов и cash. Constraint:
\[ \sum_{i=1}^{N_t} w_{i,t} + w_t^c = 1. \]
Policy outputs параметры Dirichlet distribution; sampling даёт non-negative weights, сумма = 1. Flat: один Dirichlet на все активы + cash. Hierarchical: сначала equity vs cash, затем Dirichlet на equity portion. Конфигурации: fully invested long-only или flexible cash exposure.
5.3. Функция вознаграждения
Reward балансирует performance, trading frictions и diversification. Net portfolio log-return:
\[ \tilde{r}_{p,t} = \log(1 + r_{p,t}^{\text{net}}). \]
Herfindahl–Hirschman Index (HHI) концентрации:
\[ \text{HHI}_t = \sum_{i=1}^{N_t} w_{i,t}^2, \quad \text{HHI}_t^{\min} = 1/N_t. \]
Absolute reward:
\[ r_t = 1000 \cdot \tilde{r}_{p,t} - \lambda_{\text{TO}} \cdot \text{TO}_t \cdot 100 - \lambda_{\text{conc}} \cdot (\text{HHI}_t - \text{HHI}_t^{\min}) \cdot 100. \]
Benchmark-relative reward:
\[ r_t = 1000 \cdot (\tilde{r}_{p,t} - \tilde{r}_{b,t}) - \lambda_{\text{TO}} \cdot \text{TO}_t \cdot 100 - \lambda_{\text{conc}} \cdot (\text{HHI}_t - \text{HHI}_t^{\min}) \cdot 100. \]
Turnover $\text{TO}_t$ — L1 distance между consecutive weight vectors. Transaction costs в $r_{p,t}^{\text{net}}$; turnover penalty — дополнительная regularization. Scaling factors стабилизируют gradients. Рис. 5 — декомпозиция reward.
5.4. Архитектура модели (SAC)
5.4.1. Soft Actor–Critic. Off-policy actor–critic с entropy regularization для exploration и stable learning. Twin critics mitigates overestimation bias; experience replay decorrelates training data. Soft target updates: $\theta^- \leftarrow \tau\theta + (1-\tau)\theta^-$, $\tau = 0.005$. Entropy coefficient $\alpha = 0.2$ held fixed — adaptive tuning introduced instability across WFO folds из-за non-stationarity financial returns и коротких validation windows; fixed $\alpha$ ensures reproducible exploration-exploitation trade-off.
5.4.2. State encoding. Asset-level features encoded individually; historical sequence summarized LSTM (hidden 64/128) или Transformer (128 dim, 2 layers self-attention). Embeddings combined cross-sectional attention mechanism — captures inter-asset relationships. Transformer config (TRANSFORMERS) replaces LSTM for comparison temporal representation capacity.
5.4.3. Policy network. Encoded state → Dirichlet concentration parameters → sampled weight vector on simplex. Flat: single Dirichlet over all assets + cash. Hierarchical (LSTM_2): (1) Bernoulli/continuous split equity vs cash; (2) Dirichlet on equity subset — separates macro allocation from security selection, principled dynamic cash management within SAC.
5.4.4. Critic networks. Two independent Q-networks input (encoded state, action) → scalar Q-value; minimum of twin estimates used for target computation (standard SAC). Stabilizes training in noisy financial reward landscapes.
5.5. Пять конфигураций SAC
Табл. 3 — overview всех конфигураций (общая feature representation, различия в encoder, policy, reward, constraints, top-$k$):
| Конфигурация | Энкодер | Политика | Reward | Ограничения | Top-k |
|---|---|---|---|---|---|
| LSTM_1 | LSTM | Flat Dirichlet | Log-return | Cash + гибкая экспозиция | 20 / 30 |
| LSTM_2 | LSTM | Hierarchical | Log-return | Cash + гибкая экспозиция | 20 / 30 |
| LSTM_NC_1 | LSTM | Flat Dirichlet | Benchmark-relative | Fully invested (без cash) | 10 / 20 |
| LSTM_NC_2 | LSTM | Flat Dirichlet | Benchmark-relative | Fully invested (без cash) | 20 |
| TRANSFORMERS | Transformer | Flat Dirichlet | Log-return | Cash + гибкая экспозиция | 20 / 30 |
Табл. 4 — общие hyperparameters SAC:
| Параметр | Значение |
|---|---|
| Learning rate (actor) | $3 \times 10^{-4}$ |
| Learning rate (critic) | $5 \times 10^{-4}$ |
| Learning rate (entropy) | $3 \times 10^{-4}$ |
| Discount factor $\gamma$ | 0,99 |
| Target smoothing $\tau$ | 0,005 |
| Gradient steps | 2 |
| Batch size | 128 |
| Replay buffer size | 20 000 |
| Warm-up steps | 500 |
| Entropy coefficient $\alpha$ | 0,2 (fixed) |
Environment parameters (из PDF табл. 5–6): lookback 60 дней; transaction cost 2 bps (нижняя граница IBKR institutional tier, 0,05–0,35 bps/share по tiered schedule); turnover penalty $\lambda_{\text{TO}} = 0{,}003$; concentration penalty $\lambda_{\text{conc}} \in \{0{,}0;\ 0{,}1;\ 0{,}5\}$ config-dependent; max 50 epochs, early stopping patience 8, warm-up 500 steps. LSTM hidden 64/128 (1 layer); Transformer hidden 128 (2 self-attention layers).
5.6. Процедура обучения и validation
5.6.1. Walk-forward optimization. Non-anchored WFO (Carta et al., 2021): rolling windows фиксированной длины — 5 лет train, 1 год validation, 1 год test, 16 фолдов (рис. 6). Anchored WFO (expanding train window) отвергнут: non-anchored лучше reflects realistic portfolio management с constant training horizon. k-fold CV неприменим — нарушает temporal ordering, даёт optimistic estimates.
WFO simulates deployment: train on history → select hyperparameters on validation → evaluate strictly OOS on test. Cumulative dark-red bars на рис. 6 — full OOS period 2009–2026. Параметры WFO (5/1/1, adaptive retraining) не оптимизировались ex-post (Bailey et al., 2017 — meta-overfitting risk).
5.6.2. Adaptive retraining. На fold 1 модель always trained (cold start). На fold $k$ validation Sharpe:
\[ S_k = \frac{\bar{r}_k}{\sigma_k}\sqrt{252}. \]
Порог: $\theta_k = \text{median}(S_{k-m}, \ldots, S_{k-1}) - \frac{1}{2}\text{std}(S_{k-m}, \ldots, S_{k-1})$, $m=5$. For $k < 3$ threshold undefined — always retrain. Retraining triggers: $S_k < 0$; $S_k < \theta_k$; или >3 consecutive folds without retraining. Otherwise carry forward previous weights — reduces ~40% compute vs naive always-retrain while mimicking production monitoring.
5.6.3. Hyperparameter selection. На каждом train window — grid candidate configs; selection по validation Sharpe с monthly aggregation returns для noise reduction. Приоритет: согласованность train/validation performance.
5.7. Computational setup
Эксперименты на cloud GPU NVIDIA L4 (24 GB VRAM), 30 GB RAM. LSTM agent ~14 ч на WFO cycle; Transformer ~23 ч из-за self-attention.
5.8. Метрики производительности
Primary metric — Modified Information Ratio IR2 (drawdown-aware risk-adjusted return). Также: ARC, ASD, MD, MLD, Sharpe (SR), IR1 $= \text{ARC}/\text{ASD}$, IR3, average daily turnover (ADT).
ARC (annualized compounded return):
\[ \text{ARC} = \left(\prod_{t=1}^{N}(1+R_t)\right)^{252/N} - 1. \]
Modified IR2 (primary):
\[ \text{IR2} = \text{IR1} \times \frac{\text{ARC} \times \text{sign}(\text{ARC})}{\text{MD}}. \]
Extended Information Ratio IR3 одновременно penalizes volatility, MD и MLD:
\[ \text{IR3} = \frac{\text{ARC}^3}{\text{ASD} \times \text{MD} \times \text{MLD}}. \]
Maximum Drawdown MD — max percentage decline от peak; Maximum Loss Duration MLD — longest period (years) между consecutive local equity maxima (Michańków et al., 2022).
Portfolio turnover (ADT — average over evaluation period):
\[ \text{TO}_t = \sum_{i=1}^{N_t}|w_{i,t} - w_{i,t}^-| + |w_t^c - w_t^{c,-}|. \]
Sharpe Ratio: $\text{SR} = \bar{R}/\sigma_R \cdot \sqrt{252}$. Transaction costs proportional to turnover; ADT reflects economic feasibility стратегии.
5.9. Бенчмарк-стратегии
Buy & Hold — QQQ / EWJ / FEZ без rebalancing, без transaction costs; главная планка (DeMiguel et al., 2009). Outperform passive B&H on risk-adjusted basis — высокая планка в empirical portfolio research.
Momentum Top-20 — at each rebalancing date equal weight top 20 assets по 120-day price momentum. Isolates value added RL allocation policy beyond simple momentum pre-selection. На Nasdaq — high turnover (ADT 36%) и weak IR2; на Euro Stoxx 2020–2026 — near collapse.
Equal-Weight Monthly — uniform allocation в том же top-$k$ universe что RL agent, monthly rebalance. Если equal-weight ≈ RL, primary driver — momentum filter, не learned policy (DeMiguel et al., 2009).
Markowitz Min Variance — 5-year rolling training window для covariance; constrained min-variance (long-only, fully invested, max position size); monthly rebalance (21 trading days). Direct comparison RL vs classical optimization при identical data constraints.
5.10. Резюме методологии
Pipeline: data preprocessing → features → SAC training (WFO + adaptive retraining) → OOS portfolio allocations → metrics. Economic view: dynamic allocation, balancing return, risk, costs через reward penalties. Рис. 7 — end-to-end workflow.
6. Эмпирические результаты
Для каждого рынка — три панели RL (LSTM+cash, LSTM NC, Transformer) vs четыре бенчмарка (раздел 5.9). Primary selection criterion — IR2; главная планка — Buy & Hold. OOS period начинается 2009-04-06. Trading по трём индексам параллельно в единой WFO-процедure.
6.1. Nasdaq-100
Рис. 8 — equity curves. Buy & Hold и Equal-Weight Monthly показывают strongest long-term growth; RL consistently ниже passive benchmarks. LSTM_NC_1 — highest absolute return among RL, но с elevated volatility и drawdown. Transformer не даёт clear advantage над LSTM.
Табл. 7 (Panel A, LSTM+cash): B&H IR2 = 0,518; Equal-Weight 0,493; Markowitz 0,466; лучший RL — LSTM_2 (IR2 = 0,455, ASD = 18,67%, MD = 28,77%). Momentum Top-20 — weakest IR2 (0,176) при ADT = 36,2%.
Вывод: на Nasdaq-100 persistent bull trend систематически favor passive allocation; active RL не превосходит B&H по IR2 на полной OOS-выборке. Panel B: LSTM_NC_1 highest AR among all RL (1666% cumulative) но IR2 0,389 < LSTM_2 0,455 — quantifies cost of forbidding cash. Panel C: Transformer IR2 0,441 ≈ LSTM_1 0,443 без improvement from attention encoder на US growth stocks.
| Стратегия | ARC (%) | ASD (%) | MD (%) | IR2 | Sharpe | ADT |
|---|---|---|---|---|---|---|
| Panel A: LSTM + cash | ||||||
| Buy & Hold | 19,27 | 20,41 | 35,12 | 0,518 | 0,969 | 0,000 |
| Equal-Weight Monthly | 18,13 | 20,47 | 32,55 | 0,493 | 0,919 | 0,326 |
| Markowitz Min Var | 16,65 | 19,18 | 31,00 | 0,466 | 0,898 | 0,214 |
| LSTM_1 | 17,61 | 21,63 | 32,34 | 0,443 | 0,862 | 13,782 |
| LSTM_2 | 15,64 | 18,67 | 28,77 | 0,455 | 0,876 | 13,951 |
| Momentum Top-20 | 12,27 | 21,65 | 39,55 | 0,176 | 0,646 | 36,159 |
| Panel B: LSTM NC (fully invested) | ||||||
| LSTM_NC_1 | 19,70 | 24,20 | 41,23 | 0,389 | 0,868 | 16,326 |
| LSTM_NC_2 | 18,51 | 22,63 | 33,95 | 0,446 | 0,868 | 14,782 |
| Panel C: Transformer | ||||||
| TRANSFORMERS | 17,46 | 21,43 | 32,27 | 0,441 | 0,862 | 14,248 |
6.2. Nikkei 225
Рис. 9: Markowitz и Equal-Weight substantially outperform B&H и RL. B&H — weakest (ARC 4,57%, MLD 11,345 лет recovery после GFC). Among RL — LSTM_1 best (IR2 = 0,154, IR3 = 2,50).
| Стратегия | ARC (%) | ASD (%) | MD (%) | MLD | IR2 | Sharpe | ADT |
|---|---|---|---|---|---|---|---|
| Panel A: LSTM + cash | |||||||
| Buy & Hold | 4,57 | 20,41 | 55,80 | 11,345 | 0,018 | 0,319 | 0,000 |
| Equal-Weight Monthly | 12,40 | 20,86 | 39,33 | 3,060 | 0,187 | 0,663 | 0,261 |
| Markowitz Min Var | 13,17 | 21,76 | 46,23 | 1,048 | 0,172 | 0,677 | 0,239 |
| LSTM_1 | 11,22 | 20,96 | 39,09 | 0,690 | 0,154 | 0,611 | 23,497 |
| LSTM_2 | 9,12 | 18,37 | 38,27 | 0,571 | 0,118 | 0,565 | 18,858 |
| Panel B: LSTM NC | |||||||
| LSTM_NC_1 | 9,11 | 24,15 | 53,07 | 0,690 | 0,065 | 0,481 | 20,789 |
| LSTM_NC_2 | 9,22 | 23,72 | 49,98 | 0,690 | 0,072 | 0,490 | 20,036 |
| Panel C: Transformer | |||||||
| TRANSFORMERS | 9,09 | 21,47 | 38,83 | 0,690 | 0,099 | 0,511 | 20,650 |
На Nikkei 225 Markowitz достигает highest ARC (13,17%) и IR1 (0,605); Equal-Weight Monthly — highest IR2 (0,187). LSTM_1 среди RL — best IR2 (0,154) с MLD 0,690 years. B&H catastrophic MLD (11,345) — decade-long recovery после GFC. Panel B NC configs не улучшают Panel A — подтверждает RQ3. Naive diversification и min-variance add substantial value vs passive index; RL beats B&H, но не consistently matches classical benchmarks.
6.3. Euro Stoxx 50
Рис. 10 — наиболее favorable market для RL. Equal-Weight лидирует по ARC (10,24%); among RL — LSTM_2 (IR2 = 0,146, ASD = 15,97%, MD = 29,94%). Все RL configurations outperform B&H по IR2 — в отличие от Nasdaq и Nikkei. Lower trend persistence European market conducive к active allocation.
Panel A: LSTM_2 tracks leading benchmarks with smoother growth than FEZ buy-and-hold. Panel B: fully invested NC configs underperform Panel A but remain above B&H. Panel C: Transformer competitive, closely tracking LSTM_1. Markowitz — lowest MLD (0,413) и ADT (0,172). Regression intercepts significant для LSTM_1, LSTM_2, LSTM_NC_2, Transformer — evidence abnormal returns vs FEZ even after HAC correction (табл. 11 PDF).
| Стратегия | ARC (%) | ASD (%) | MD (%) | IR2 | Sharpe | ADT |
|---|---|---|---|---|---|---|
| Panel A: LSTM + cash | ||||||
| Buy & Hold | 7,81 | 23,92 | 39,69 | 0,064 | 0,433 | 0,000 |
| Equal-Weight Monthly | 10,24 | 20,63 | 39,40 | 0,129 | 0,574 | 0,859 |
| Markowitz Min Var | 9,11 | 18,31 | 36,24 | 0,125 | 0,565 | 0,172 |
| LSTM_1 | 8,55 | 18,71 | 33,52 | 0,117 | 0,530 | 10,613 |
| LSTM_2 | 8,36 | 15,97 | 29,94 | 0,146 | 0,581 | 11,416 |
| Momentum Top-20 | 7,22 | 21,07 | 33,37 | 0,074 | 0,435 | 39,184 |
| Panel B: LSTM NC | ||||||
| LSTM_NC_1 | 7,23 | 19,87 | 34,49 | 0,076 | 0,449 | 15,661 |
| LSTM_NC_2 | 8,64 | 19,52 | 34,50 | 0,111 | 0,520 | 12,697 |
| Panel C: Transformer | ||||||
| TRANSFORMERS | 8,71 | 18,78 | 33,16 | 0,122 | 0,537 | 8,418 |
6.4. Статистическая значимость
Competitive IR2 недостаточно — нужен formal inference. Daily returns violate i.i.d. assumptions: autocorrelation, heteroskedasticity (volatility clustering), heavy tails. Conventional paired t-tests underestimate standard errors.
HAC inference (Newey & West, 1987): robust standard errors для mean return differences $\mu_d = \mu_{\text{strategy}} - \mu_{\text{B&H}}$. Null: $H_0: \mu_d = 0$ vs $H_1: \mu_d > 0$ at 10% level.
Stationary bootstrap (Politis & Romano, 1994): empirical distributions Sharpe и IR2 differences без parametric assumptions — complements HAC for risk-adjusted metrics.
Regression abnormal returns:
\[ R_t^{\text{strategy}} = \alpha + \beta R_t^{\text{benchmark}} + \epsilon_t, \]
$H_0: \alpha = 0$ vs $H_1: \alpha > 0$ with Newey–West HAC standard errors on $\alpha$.
Табл. 10: ни одна RL strategy не достигает HAC-significant excess return vs B&H по mean differences на всех рынках. Regression (табл. 11 PDF): significant positive $\alpha$ at 10% для LSTM_1, LSTM_2, Transformer на Euro Stoxx 50 only.
| Модель | Mean Diff. | HAC p-val | $\Delta$Sharpe p-val | $\Delta$IR2 p-val |
|---|---|---|---|---|
| Panel A: Nasdaq-100 | ||||
| LSTM_1 | −0,0000 | 0,6654 | 0,8322 | 0,7872 |
| LSTM_2 | −0,0001 | 0,9489 | 0,7762 | 0,7502 |
| Transformer | −0,0000 | 0,6968 | 0,8282 | 0,7882 |
| LSTM-NC-1 | 0,0001 | 0,3129 | 0,7832 | 0,7313 |
| LSTM-NC-2 | 0,0000 | 0,4914 | 0,8062 | 0,7672 |
| Panel B: Nikkei 225 | ||||
| LSTM_1 | 0,0000 | 0,3381 | 0,3556 | 0,3636 |
| LSTM_2 | −0,0001 | 0,6949 | 0,5005 | 0,4725 |
| LSTM-NC-1 | −0,0000 | 0,5006 | 0,7403 | 0,7612 |
| LSTM-NC-2 | −0,0000 | 0,5025 | 0,7213 | 0,7273 |
| Transformer | −0,0000 | 0,6034 | 0,6913 | 0,6903 |
| Panel C: Euro Stoxx 50 | ||||
| LSTM_1 | 0,0000 | 0,4992 | 0,1538 | 0,1349 |
| LSTM_2 | −0,0000 | 0,5840 | 0,0719 | 0,0619 |
| LSTM-NC-1 | −0,0000 | 0,6263 | 0,4086 | 0,3786 |
| LSTM-NC-2 | 0,0000 | 0,4665 | 0,1928 | 0,1608 |
| Transformer | 0,0000 | 0,4758 | 0,1399 | 0,1229 |
Итог раздела 6: performance varies substantially across indices; Euro Stoxx — best RL environment; fully invested configs — higher AR, lower IR2; cash improves drawdown control; hypothesis partially supported.
6.5. Сводка эмпирических результатов
По IR2 лучшие RL per market: Nasdaq — LSTM_2 (0,455), но ниже B&H (0,518) и Equal-Weight (0,493); Nikkei — LSTM_1 (0,154), ниже Equal-Weight (0,187) и Markowitz (0,172 по IR2, 0,605 по IR1); Euro Stoxx — LSTM_2 (0,146), все RL > B&H (0,064). Fully invested LSTM_NC_1 на Nasdaq даёт AR 1666% при IR2 0,389 — иллюстрация trade-off absolute vs risk-adjusted return.
HAC tests (табл. 10): no strategy achieves significant mean excess vs B&H at 10%. Regression intercepts significant для LSTM_1 ($\alpha$ p = 0,033), LSTM_2 (p = 0,012), LSTM_NC_2 (p = 0,042), Transformer (p = 0,029) на Euro Stoxx only. Findings exploratory — RL may capture market-specific inefficiencies, но not robust global outperformance.
7. Анализ режимов
Aggregate full-sample metrics могут conceal regime-dependent performance. Section 7 decomposes OOS evaluation into three macroeconomic regimes with separate performance tables (12–14 в PDF). Methodology: same strategies, same metrics (IR2 primary), subset dates per regime. Buy & Hold benchmark per market: QQQ (Nasdaq), EWJ (Nikkei), FEZ (Euro Stoxx).
Aggregate results могут mask heterogeneous performance. Период декомпозирован на три макроэкономических режима (табл. 12–14 PDF):
- 2009–2013 — post-GFC recovery;
- 2014–2019 — secular bull market;
- 2020–2026 — COVID-19 shock + rate hike cycle.
Nasdaq-100 (табл. 12 PDF): 2009–2013 — Markowitz IR2 = 2,87, LSTM_2 = 2,01, B&H = 1,95; RL beat B&H. 2014–2019 — B&H IR2 = 0,82, Equal-Weight = 0,85, LSTM_2 = 0,62; passive dominates. 2020–2026 — B&H IR2 = 0,28, Equal-Weight = 0,17; Momentum Top-20 IR2 = 0,03 (collapse).
Nikkei 225 (табл. 13 PDF): 2009–2013 — Equal-Weight IR2 = 0,48, Markowitz = 0,35, B&H = 0,018. 2014–2019 — LSTM_2 IR2 = 0,62 (leads all strategies). 2020–2026 — Markowitz IR2 = 0,20, LSTM_2 = 0,17, B&H = 0,063.
Euro Stoxx 50 (табл. 14 PDF): 2009–2013 — Momentum Top-20 IR2 = 0,40. 2014–2019 — Markowitz IR2 = 0,25, LSTM_2 = 0,20. 2020–2026 — LSTM_2 IR2 = 0,10 (highest among all), Momentum IR2 ≈ 0,0001 (near collapse).
Общий вывод: no single strategy type dominates все markets/regimes. RL adds value vs B&H на Nikkei и Euro Stoxx в several settings, но не consistently beats Equal-Weight и Markowitz. Regime-dependence критична для evaluation active strategies.
8. Ансамбль total fund
Ensemble framework: equal-weight aggregation OOS daily returns Nasdaq-100 + Nikkei 225 + Euro Stoxx 50 для каждой RL configuration. Common date index с 2009-04-06. Benchmark — cross-sectional average B&H трёх рынков.
Рис. 11 — equity curves (growth of 1 unit capital). LSTM_1 — strongest absolute growth. Табл. 15 — metrics:
| Стратегия | AR (%) | ARC (%) | ASD (%) | MD (%) | MLD | IR1 | IR2 | Sharpe |
|---|---|---|---|---|---|---|---|---|
| Common Benchmark (avg B&H) | 486,79 | 12,68 | 16,53 | 28,63 | 1,70 | 0,767 | 0,340 | 0,806 |
| LSTM_1 | 514,60 | 13,03 | 14,72 | 28,16 | 1,79 | 0,885 | 0,410 | 0,906 |
| LSTM_2 | 390,49 | 11,33 | 12,75 | 25,46 | 1,75 | 0,889 | 0,395 | 0,905 |
| LSTM_NC_1 | 487,84 | 12,69 | 16,14 | 28,76 | 1,98 | 0,786 | 0,347 | 0,822 |
| LSTM_NC_2 | 483,44 | 12,64 | 15,76 | 28,77 | 1,79 | 0,802 | 0,352 | 0,834 |
| TRANSFORMERS | 451,32 | 12,21 | 14,77 | 27,92 | 1,77 | 0,827 | 0,362 | 0,854 |
LSTM_1 — highest IR2 (0,410) vs benchmark (0,340); also highest AR (514,6%) и ARC (13,03%). LSTM_2 — lowest ASD (12,75%) и MD (25,46%) among all strategies — superior risk control at slightly lower IR2 (0,395). NC configurations track benchmark closely (IR2 ≈ 0,347–0,352). TRANSFORMERS — competitive (IR2 0,362) с lower ADT implied turnover on Euro Stoxx panel.
Statistical assessment (табл. 16 PDF): HAC mean-diff p-values 0,49–0,83 — no significant excess returns. Bootstrap $\Delta$Sharpe p-values 0,18–0,34; $\Delta$IR2 p-values 0,25–0,49. Regression: LSTM_1 intercept p = 0,0496; LSTM_2 p = 0,0481 (significant at 10%) — partial evidence abnormal performance in ensemble, analogous Euro Stoxx single-market regression results. Economic improvement clear; statistical evidence limited — interpret as indicative.
Ensemble confirms RQ5: geographic diversification across US, Japan, Europe reduces single-market regime risk and improves aggregate IR2 relative to average passive exposure.
9. Обсуждение
Цель — оценить, улучшают ли RL portfolio strategies risk-adjusted performance при realistic constraints. SAC agents с architectural/economic variants vs четыре бенчмарка в WFO framework.
Табл. 7–9: effectiveness varies significantly. Strongest RL results — Euro Stoxx 50 (all RL > B&H по IR2). Nasdaq и Nikkei — passive/classical competitive or dominant. Equal-Weight Monthly и Markowitz Min Variance трудно beat consistently (DeMiguel et al., 2009).
Ensemble (табл. 15): LSTM_1 IR2 = 0,41 vs benchmark 0,34 — cross-market diversification benefits. Momentum Top-20 — high turnover, weak IR2 на Nasdaq; momentum breaks Euro Stoxx 2020–2026.
Central hypothesis — partially supported. HAC (табл. 10): no significant excess vs B&H globally; regression — abnormal returns Euro Stoxx only. Regime analysis: RL most valuable при elevated uncertainty, lower trend persistence.
RQ1 (reward formulation): benchmark-relative (LSTM_NC) не consistently dominates absolute-return models — exploratory, not ceteris paribus (reward co-varies с constraints).
RQ2 (policy structure): hierarchical LSTM_2 — lower volatility и MD vs LSTM_1 на всех рынках; decomposing equity-cash vs asset selection improves stability.
RQ3 (constraints): cash-allowed configs — higher IR2, lower drawdowns; fully invested — higher AR, worse risk-adjusted (видно на Nasdaq: LSTM_NC_1 AR 1666% vs IR2 0,39).
RQ4 (encoder): LSTM ≥ Transformer по IR2 на всех рынках; Transformer competitive absolute returns, но не superior stability.
RQ5 (ensemble): all ensemble configs beat common benchmark IR2; LSTM_1 strongest; reduced vol/MD vs single-market.
RQ6 (regimes): RL beats B&H на Nikkei/Euro Stoxx в multiple regimes; Nasdaq — RL only post-GFC; strongly trending markets favor passive.
Сложность systematic outperformance согласуется с DeMiguel et al. (2009): estimation error в expected returns и covariances limits practical edge sophisticated models; equal-weight (здесь — momentum-filtered monthly rebalance) остаётся formidable benchmark. RL strategies несут ADT 8–40% vs 0% B&H — conservative 2 bps assumption может underestimate real costs для high-turnover configs.
Практический вывод: RL наиболее перспективен как компонент geographically diversified program (ensemble LSTM_1, IR2 0,41) и active overlay на European equities (Euro Stoxx); standalone deployment на Nasdaq bull market не justified по IR2 и HAC tests.
10. Заключение
Разработан unified DRL framework для dynamic portfolio allocation на Nasdaq-100, Nikkei 225 и Euro Stoxx 50: SAC + WFO + adaptive retraining + realistic frictions; 5 configurations; 16 OOS folds; primary metric IR2; 4 benchmarks.
Empirical findings: competitive risk-adjusted performance на Euro Stoxx и в ensemble (LSTM_1 IR2 0,41 vs 0,34); hypothesis partially confirmed — no consistent beat of passive/classical across all markets; no HAC-significant excess vs B&H on mean returns; regime analysis — RL valuable при uncertainty, passive dominates strong trends (Nasdaq 2014–2019).
Contributions in detail: (1) unified multi-market WFO enables direct comparison US vs Japan vs Europe under identical SAC pipeline — absent in Yang et al. (2020) и Jiang et al. (2024) single-market designs; (2) hierarchical Dirichlet extends flat policies in Hambly et al. (2023) survey with explicit equity-cash separation; (3) adaptive retraining reduces compute vs naive retrain-every-fold while preserving deployment realism; (4) regime decomposition provides actionable guidance when to deploy active RL vs passive beta.
Limitations: no significant outperformance 2/3 markets on HAC mean-return tests; configs not ceteris paribus ablations (encoder, reward, constraints co-vary); fixed 2 bps costs without retraining under higher costs; WFO parameters (5/1/1, retraining threshold) not sensitivity-tested — meta-overfitting risk (Bailey et al., 2017); equal-weight ensemble only, not optimal cross-market allocation.
Despite limitations, work demonstrates that SAC-based dynamic allocation with hierarchical policies, adaptive retraining и multi-market WFO produces economically interpretable strategies competitive with classical benchmarks in selected markets and materially improved via geographic ensemble diversification.
Future work: high-frequency data и crypto (microstructure, liquidity, intraday costs); macro features (yield curve, credit spreads, PMI) + LLM news embeddings для richer regime characterization; meta-ensemble с learnable cross-market weights; dedicated ceteris paribus ablation varying one dimension at a time (reward, policy, encoder).
Таблицы и дополнительные детали
На этой странице воспроизведены ключевые таблицы из 67-страничного PDF. Полные sub-period tables (12–14), regression table 11 и ensemble statistics table 16 доступны только в оригинале.
Таблица 1 — descriptive statistics closing prices (2003–2026): Nasdaq count 5836 obs, mean 154; Nikkei 5676 obs, mean 51; Euro Stoxx 5836 obs, mean 30.
Таблица 2 — daily log-returns: Nasdaq std 0,0136, excess kurtosis 7,13; Nikkei std 0,0128, kurtosis 8,62; Euro Stoxx std 0,0159, kurtosis 9,90.
Таблицы 5–6 — encoder architecture (LSTM 64/128 hidden, Transformer 128×2 layers) и environment params (lookback 60, cost 2 bps, turnover penalty 0,003, epochs 50, patience 8).
Таблицы 12–14 — sub-period IR2 по трём режимам для каждого индекса; bold — best per metric per period в PDF.
Таблица 11 — regression $\alpha$ (HAC): significant at 10% для Euro Stoxx LSTM_1 (p=0,033), LSTM_2 (p=0,012), LSTM_NC_2 (p=0,042), Transformer (p=0,029); Nasdaq и Nikkei — no significant $\alpha$.
Таблица 16 — ensemble HAC/bootstrap: LSTM_1/LSTM_2 regression intercepts significant (p ≈ 0,049); mean-diff HAC not significant.
Примечания к рисункам 1–11
Рис. 1 — normalized price paths всех constituent assets; red line — benchmark ETF (non-normalized scale). Три панели по индексам.
Рис. 2 — evolution числа tradable stocks во времени (survivorship-aware universe); Nasdaq ~95–105, Nikkei ~223–225, Euro Stoxx ~46–50 constituents.
Рис. 3 — data pipeline: Bloomberg membership + yfinance prices → tradable mask → model dataset.
Рис. 4 — RL agent loop: observe $s_t$ → action $a_t \sim \pi_\theta(\cdot|s_t)$ → reward → transition $s_{t+1}$.
Рис. 5 — reward decomposition: log-return component, turnover penalty, concentration penalty (HHI).
Рис. 6 — 16 WFO folds: green train (5y), yellow validation (1y), red test (1y); cumulative OOS dark-red bar.
Рис. 7 — full methodology workflow from preprocessing through SAC training to OOS evaluation.
Рис. 8–10 — equity curves Nasdaq, Nikkei, Euro Stoxx; three panels each (LSTM+cash, LSTM NC, Transformer) vs four benchmarks.
Рис. 11 — cross-asset ensemble equity curves; equal-weight combination of per-market strategy returns; benchmark = average B&H.
Полный PDF (67 стр., arxiv.org/pdf/2605.17307)
Central hypothesis — partially supported. Euro Stoxx и ensemble LSTM_1 — strongest economic cases; HAC inference limits causal claims on alpha.
Документ охватывает полную структуру 67-страничной работы: введение, literature review (§2.1–2.5), data (§3.1–3.3), theory (§4.1–4.5), methodology (§5.1–5.10), results (§6.1–6.5), regimes (§7), ensemble (§8), discussion (§9), conclusion (§10). Таблицы 3, 4, 7–10, 15 воспроизведены inline; остальные — по ссылке на PDF.
Краткая сводка пяти SAC-конфигураций:
- LSTM_1 — baseline: LSTM, flat Dirichlet, log-return reward, cash allowed, top-k 20/30.
- LSTM_2 — hierarchical policy (equity/cash then assets), иначе как LSTM_1.
- LSTM_NC_1 — flat, benchmark-relative reward, fully invested, top-k 10/20.
- LSTM_NC_2 — как NC_1, top-k fixed 20.
- TRANSFORMERS — Transformer encoder, flat Dirichlet, log-return, cash allowed.
Primary OOS evaluation metric throughout: IR2 (Modified Information Ratio). Trading start date aligned across markets: 2009-04-06. Full sample data: 2003-01-02 — 2026-03-13.
Литература
- D. H. Bailey, J. M. Borwein, M. López de Prado, and Q. J. Zhu. The probability of backtest overfitting. The Journal of Computational Finance, 20(4):39–69, 2017. ISSN 1460-1559. doi: 10.21314/JCF.2016.322.
- B. Bieganowski and R. Ślepaczuk. Supervised autoencoder MLP for financial time series forecasting. Journal of Big Data, 12(1):207, 2025. ISSN 2196-1115. doi: 10.1186/s40537-025-01267-7.
- F. Black and R. Litterman. Global portfolio optimization. Financial Analysts Journal, 48(5):28–43, 1992. ISSN 0015-198X. doi: 10.2469/faj.v48.n5.28.
- Z. Bracha, P. Sakowski, and J. Michańków. Application of deep reinforcement learning to at-themoney S&P 500 options hedging. arXiv preprint arXiv:2510.09247, 2025. doi: 10.48550/arXiv.2 510.09247.
- H. Buehler, L. Gonon, J. Teichmann, and B. Wood. Deep hedging. Quantitative Finance, 19(8): 1271–1291, 2019. ISSN 1469-7688. doi: 10.1080/14697688.2019.1571683.
- Q. Bui and R. Ślepaczuk. Applying Hurst exponent in pair trading strategies on Nasdaq 100 index. Physica A: Statistical Mechanics and its Applications, 592:126784, 2022. ISSN 0378-4371. doi: 10.1016/j.physa.2021.126784.
- S. M. Carta, S. Consoli, L. Piras, A. S. Podda, and D. R. Recupero. Explainable machine learning exploiting news and domain-specific lexicon for stock market forecasting. IEEE Access, 9:30193– 30205, 2021. ISSN 2169-3536. doi: 10.1109/ACCESS.2021.3059960.
- A. Chaweewanchon and R. Chaysiri. Markowitz mean-variance portfolio optimization with predictive stock selection using machine learning. International Journal of Financial Studies, 10(3):64, 2022. ISSN 2227-7072. doi: 10.3390/ijfs10030064.
- L.-C. Cheng and J.-S. Sun. Multiagent-based deep reinforcement learning framework for multi-asset adaptive trading and portfolio management. Neurocomputing, 594:127800, 2024. ISSN 0925-2312. doi: 10.1016/j.neucom.2024.127800.
- V. DeMiguel, L. Garlappi, and R. Uppal. Optimal versus naive diversification: How inefficient is the 1/N portfolio strategy? The Review of Financial Studies, 22(5):1915–1953, 2009. ISSN 0893-9454. doi: 10.1093/rfs/hhm075.
- Y. Deng, F. Bao, Y. Kong, Z. Ren, and Q. Dai. Deep direct reinforcement learning for financial signal representation and trading. IEEE Transactions on Neural Networks and Learning Systems, 28(3):653–664, 2017. ISSN 2162-237X. doi: 10.1109/TNNLS.2016.2522401.
- J. Du, M. Jin, P. N. Kolm, G. Ritter, Y. Wang, and B. Zhang. Deep reinforcement learning for option replication and hedging. The Journal of Financial Data Science, 2(4):44–57, 2020. ISSN 2640-3943. doi: 10.3905/jfds.2020.1.045.
- B. Enkhsaikhan and O. Jo. Risk-constrained reinforcement learning with augmented Lagrangian multiplier for portfolio optimization. IEEE Transactions on Big Data, 11(5):2489–2502, 2025. ISSN 2332-7790. doi: 10.1109/TBDATA.2025.3533905.
- T. Fischer and C. Krauss. Deep learning with long short-term memory networks for financial market predictions. European Journal of Operational Research, 270(2):654–669, 2018. ISSN 0377-2217. doi: 10.1016/j.ejor.2017.11.054.
- J. Grudniewicz and R. Ślepaczuk. Application of machine learning in algorithmic investment strategies on global stock markets. Research in International Business and Finance, 66:102052, 2023. ISSN 0275-5319. doi: 10.1016/j.ribaf.2023.102052.
- T. Haarnoja, A. Zhou, P. Abbeel, and S. Levine. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor. In Proceedings of the 35th International Conference on Machine Learning, volume 80 of Proceedings of Machine Learning Research, pages 1861–1870. PMLR, 2018.
- B. Hambly, R. Xu, and H. Yang. Recent advances in reinforcement learning in finance. Mathematical Finance, 33(3):437–503, 2023. ISSN 0960-1627. doi: 10.1111/mafi.12382.
- Z. Hao, H. Zhang, and Y. Zhang. Stock portfolio management by using fuzzy ensemble deep reinforcement learning algorithm. Journal of Risk and Financial Management, 16(3):201, 2023. ISSN 1911-8074. doi: 10.3390/jrfm16030201.
- Y. Jiang, J. Olmo, and M. Atwi. Deep reinforcement learning for portfolio selection. Global Finance Journal, 62:101016, 2024. ISSN 1044-0283. doi: 10.1016/j.gfj.2024.101016.
- T. Kabbani and E. Duman. Deep reinforcement learning approach for trading automation in the stock market. IEEE Access, 10:93564–93574, 2022. ISSN 2169-3536. doi: 10.1109/ACCESS.2022.3203697.
- M. R. Kabir, D. Bhadra, M. Ridoy, and M. Milanova. LSTM–Transformer-based robust hybrid deep learning model for financial time series forecasting. Sci, 7(1):7, 2025. ISSN 2413-4155. doi: 10.3390/sci7010007.
- K. Kashif and R. Ślepaczuk. LSTM-ARIMA as a hybrid approach in algorithmic investment strategies. Knowledge-Based Systems, 320:113563, 2025. ISSN 0950-7051. doi: 10.1016/j.knosys.2025.113563.
- L. Khaidem, S. Saha, and S. R. Dey. Predicting the direction of stock market prices using random forest. arXiv preprint arXiv:1605.00003, 2016. doi: 10.48550/arXiv.1605.00003.
- K.-j. Kim. Financial time series forecasting using support vector machines. Neurocomputing, 55 (1–2):307–319, 2003. ISSN 0925-2312. doi: 10.1016/S0925-2312(03)00372-2.
- K. Krynska and R. Ślepaczuk. Daily and intraday application of various architectures of the LSTM model in algorithmic investment strategies on Bitcoin and the S&P 500 index. SSRN Electronic Journal, 2023. doi: 10.2139/ssrn.4628806. Available at SSRN: 4628806.
- Y.-F. Lin, T.-M. Huang, W.-H. Chung, and Y.-L. Ueng. Forecasting fluctuations in the financial index using a recurrent neural network based on price features. IEEE Transactions on Emerging Topics in Computational Intelligence, 5(5):780–791, 2021. ISSN 2471-285X. doi: 10.1109/TETCI. 2020.2971218.
- X.-Y. Liu, J. Rui, J. Gao, L. Yang, H. Yang, Z. Wang, C. D. Wang, and J. Guo. FinRL-Meta: A universe of near-real market environments for data-driven deep reinforcement learning in quantitative finance. arXiv preprint arXiv:2112.06753, 2021. doi: 10.48550/arXiv.2112.06753.
- M. López de Prado. The 10 reasons most machine learning funds fail. The Journal of Portfolio Management, 44(6):120–133, 2018. ISSN 0095-4918. doi: 10.3905/jpm.2018.44.6.120.
- M. López de Prado, J. Simonian, F. A. Fabozzi, and F. J. Fabozzi. Enhancing Markowitz’s portfolio selection paradigm with machine learning. Annals of Operations Research, 346(1):319–340, 2025. ISSN 0254-5330. doi: 10.1007/s10479-024-06257-1.
- D. Maringer and T. Ramtohul. Regime-switching recurrent reinforcement learning for investment decision making. Computational Management Science, 9(1):89–107, 2012. ISSN 1619-697X. doi: 10.1007/s10287-011-0131-1.
- H. Markowitz. Portfolio selection. The Journal of Finance, 7(1):77–91, 1952. ISSN 0022-1082. doi: 10.1111/j.1540-6261.1952.tb01525.x.
- J. Michańków, P. Sakowski, and R. Ślepaczuk. LSTM in algorithmic investment strategies on BTC and S&P500 index. Sensors, 22(3):917, 2022. ISSN 1424-8220. doi: 10.3390/s22030917.
- A. Millea. Hierarchical model-based deep reinforcement learning for single-asset trading. Analytics, 2(3):560–576, 2023. ISSN 2813-2203. doi: 10.3390/analytics2030031.
- V. Mnih, K. Kavukcuoglu, D. Silver, A. A. Rusu, J. Veness, M. G. Bellemare, A. Graves, M. Riedmiller, A. K. Fidjeland, G. Ostrovski, et al. Human-level control through deep reinforcement learning. Nature, 518(7540):529–533, 2015. ISSN 0028-0836. doi: 10.1038/nature14236.
- J. Moody and M. Saffell. Learning to trade via direct reinforcement. IEEE Transactions on Neural Networks, 12(4):875–889, 2001. ISSN 1045-9227. doi: 10.1109/72.935097.
- W. K. Newey and K. D. West. A simple, positive semi-definite, heteroskedasticity and autocorrelation consistent covariance matrix. Econometrica, 55(3):703–708, 1987. ISSN 0012-9682. doi: 10.2307/ 1913610.
- D. N. Politis and J. P. Romano. The stationary bootstrap. Journal of the American Statistical Association, 89(428):1303–1313, 1994. ISSN 0162-1459. doi: 10.1080/01621459.1994.10476870.
- I. Rani, H. Gandhi, R. Kumar, N. Marannan, N. K. Kim, and T. Kumar. Deep reinforcement learning for high-frequency trading with market impact modeling. In 2025 International Conference on Sustainability, Innovation & Technology (ICSIT), pages 1–6. IEEE, 2025. doi: 10.1109/ICSIT653 36.2025.11293906.
- J. Schulman, F. Wolski, P. Dhariwal, A. Radford, and O. Klimov. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347, 2017. doi: 10.48550/arXiv.1707.06347.
- A. Shavandi and M. Khedmati. A multi-agent deep reinforcement learning framework for algorithmic trading in financial markets. Expert Systems with Applications, 208:118124, 2022. ISSN 0957-4174. doi: 10.1016/j.eswa.2022.118124.
- D. Ślusarczyk and R. Ślepaczuk. Optimal Markowitz portfolio using returns forecasted with time series and machine learning models. Journal of Big Data, 12(1):127, 2025. ISSN 2196-1115. doi: 10.1186/s40537-025-01164-z.
- F. Soleymani and E. Paquet. Financial portfolio optimization with online deep reinforcement learning and restricted stacked autoencoder—DeepBreath. Expert Systems with Applications, 156:113456, 2020. ISSN 0957-4174. doi: 10.1016/j.eswa.2020.113456.
- F. Stefaniuk and R. Ślepaczuk. Informer in algorithmic investment strategies on high frequency bitcoin data. arXiv preprint arXiv:2503.18096, 2025. doi: 10.48550/arXiv.2503.18096.
- H. J. Sterling and M. V. Thorne. Deep reinforcement learning for dynamic portfolio optimization in financial markets. International Journal of Artificial Intelligence Research, 1(1), 2026.
- A. Tamuly, G. Bhutani, and Sukriti. Portfolio optimization using deep reinforcement learning. In 2024 IEEE 5th India Council International Subsections Conference (INDISCON), pages 1–6, Piscataway, NJ, USA, 2024. IEEE. doi: 10.1109/INDISCON62179.2024.10744403.
- X. Wu, H. Chen, J. Wang, L. Troiano, V. Loia, and H. Fujita. Adaptive stock trading strategies with deep reinforcement learning methods. Information Sciences, 538:142–158, 2020. ISSN 0020-0255. doi: 10.1016/j.ins.2020.05.066.
- H. Yang, X.-Y. Liu, S. Zhong, and A. Walid. Deep reinforcement learning for automated stock trading: An ensemble strategy. In Proceedings of the First ACM International Conference on AI in Finance (ICAIF ’20), pages 1–8, New York, NY, USA, 2020. Association for Computing Machinery. doi: 10.1145/3383455.3422540.
- H. Zhang, X. Li, T. Wan, and J. Du. Deep reinforcement learning for financial trading: Enhanced by cluster embedding and zero-shot prediction. Symmetry, 18(1):112, 2026. ISSN 2073-8994. doi: 10.3390/sym18010112.
Оригинал: arXiv:2605.17307 (PDF, 67 стр.). Перевод и адаптация для каталога маркетмейкинга — полный пересказ основного текста; численные значения сверены с PDF от 17 мая 2026.