Объяснимая post hoc политика управления портфелем на основе глубокого обучения с подкреплением

7.5/10

Alejandra de la Rica Escudero, Eduardo C. Garrido-Merchán, María Coronado-Vaca

Universidad Pontificia Comillas, Madrid, Spain · 19 июля 2024

Оригинал: de la Rica Escudero, A., Garrido-Merchán, E. C. and Coronado-Vaca, M. «Explainable Post hoc Portfolio Management Financial Policy of a Deep Reinforcement Learning agent», v1 — arxiv.org/abs/2407.14486 (PDF, 20 стр.).

Рис. 1–8 воспроизведены из оригинальной публикации. Код экспериментов: github.com/aleedelarica/XDRL-for-finance. Технические детали реализации и дополнительные материалы — в PDF оригинала.

Ключевые слова: Deep Reinforcement Learning; Portfolio Management; Explainable AI.

Классификация arXiv: cs.CE

Аннотация

Инвестиционные политики управления финансовым портфелем, вычисляемые количественными методами современной портфельной теории вроде модели Markowitz, опираются на набор допущений, которые не подтверждаются данными на высоковолатильных рынках — например, в технологическом секторе или на криптовалютных рынках. Поэтому количественные исследователи ищут альтернативные модели. Управление портфелем в последние годы успешно решается подходами Deep Reinforcement Learning (DRL): алгоритмы обучают агента, оценивая распределение ожидаемой награды каждого действия при любом финансовом состоянии в симуляторе (gymnasium).

Однако эти методы используют глубокие нейросети для представления такого распределения. Хотя DNN — универсальные аппроксиматоры и способны представлять распределение во времени, они не могут объяснить своё поведение: параметры модели неинтерпретируемы. Для финансовых инвесторов критична интерпретируемость прогнозов — чтобы оценить, следует ли политика разумному поведению. Поэтому DRL-агенты не подходят ни для следования конкретной политике, ни для объяснения своих действий.

В этой работе, мотивированные задачей сделать DRL объяснимым, мы разработали новый подход Explainable Deep Reinforcement Learning (XDRL) для управления портфелем: интегрировали алгоритм Proximal Policy Optimization (PPO) с модельно-агностическими методами объяснимого машинного обучения — feature importance, SHAP и LIME — для повышения прозрачности в момент предсказания. Применяя нашу методологию, можно интерпретировать действия агента в торговое время и проверять, соответствуют ли они требованиям инвестиционной политики, а также оценивать риск следования рекомендациям агента.

Насколько нам известно, предложенный подход — первый explainable post hoc финансовый policy управления портфелем DRL-агента. Эмпирически мы успешно идентифицируем ключевые признаки, влияющие на инвестиционные решения, и демонстрируем способность объяснять действия агента в prediction time — в отличие от существующих четырёх XDRL-работ, ограниченных training-time interpretability.

Ключевое отличие post hoc объяснимости: не нужно менять архитектуру policy network или внедрять rules до обучения — достаточно логировать state-action pairs и применять стандартные XAI-toolkit к уже обученному агенту в live trading loop. Это снижает barrier to adoption для desk, уже использующих PPO/DDPG portfolio agents.

1. Введение

Управление финансовым портфелем — критическая задача инвестиционной сферы (Peterson Drake and Fabozzi 2010), традиционно опирающаяся на методы современной портфельной теории, такие как модель Markowitz (Mangram 2013). Эти модели оптимизируют компромисс между риском и доходностью и основаны на допущениях о поведении рынка (Wilford 2012). Однако на высоковолатильных рынках — технологическом секторе или криптовалютах — допущения часто не выполняются (Hill 2013). Это побудило количественных исследователей искать альтернативные методы, лучше справляющиеся с динамичной и непредсказуемой природой таких рынков (Rather, Sastry, and Agarwal 2017).

Применение Deep Reinforcement Learning (Arulkumaran et al. 2017) к управлению портфелем набирает популярность. DRL-алгоритмы обучают агентов максимизировать ожидаемую доходность, изучая оптимальные действия через взаимодействие со симулированной средой (Sutton and Barto 2020), также называемой gymnasium (Brockman et al. 2016). Агенты используют глубокие нейросети (LeCun, Bengio, and Hinton 2015) для аппроксимации распределения ожидаемых наград при различных действиях в меняющихся финансовых состояниях. Несмотря на способность DNN быть универсальными аппроксиматорами функций (Lu and Lu 2020), им не хватает интерпретируемости (Castelvecchi 2016) — серьёзная проблема в финансах, где прозрачность решений критична для доверия инвесторов к автоматизированным стратегиям (Lowenstein 1996).

Потребность в объяснимости финансовых решений стимулирует развитие Explainable Artificial Intelligence (XAI) (Caruana et al. 2020; Angelov et al. 2021; Mehta, Palade, and Chatterjee 2023). В контексте DRL включение XAI-методов сочетает высокую производительность DRL-агентов с необходимостью прозрачных, интерпретируемых инвестиционных политик. Однако, как показано в разделе 2, несмотря на растущую литературу по DRL в управлении портфелем, литература по объяснимости DRL в этой области крайне скудна: насколько нам известно, существуют лишь четыре недавних исследования (Wang et al. 2019; Bougie and Ichise 2020; Guan and Liu 2021; Shi et al. 2021). Более того, все четыре опубликованных метода объяснимости DRL для портфеля дают объяснения модели лишь в training time, не позволяя мониторить предсказания агента в торговое время.

Мотивированные этим пробелом, мы представляем новый фреймворк Explainable Deep Reinforcement Learning (XDRL) для управления портфелем. Наш подход объединяет популярный алгоритм Proximal Policy Optimization (Schulman et al. 2017) — state-of-the-art DRL-технику — с модельно-агностическими XAI-методами: feature importance (Belle and Papantonis 2021), SHAP (Rozemberczki et al. 2022) и LIME (Visani et al. 2022). Три техники объяснимости можно реализовать независимо или совместно и применять для объяснения предсказаний DRL-агента в торговое время, отслеживая, действует ли политика ожидаемым образом — преимущество перед остальными четырьмя опубликованными методами. Рабочая гипотеза: предсказания DRL-агентов можно объяснять post hoc, получая интерпретацию, проверяемую относительно финансовых инвестиционных политик.

Статья вносит вклад в слабо развитую литературу XDRL для управления портфелем двумя способами: дополняет emerging literature из четырёх предыдущих работ с обнадёживающими результатами; и, насколько нам известно, впервые применяет объяснимую post hoc политику управления портфелем DRL-агента.

Markowitz portfolio theory assumes investors trade off expected return and variance under rationality and often normality of returns. When these fail — as in tech bull/bear cycles or crypto crashes — the mapping from market state to optimal weights becomes highly nonlinear. DRL with sufficient data and expressive network can learn such mappings implicitly; XDRL adds the missing layer: which inputs drove today's weights, enabling governance teams to veto or override agent suggestions when explanations conflict with mandate (ESG exclusions, sector limits, concentration caps).

Статья организована следующим образом.

Раздел 2 описывает landscape DRL/XDRL literature; раздел 3 — methodology; раздел 4 — experiments; раздел 5 — conclusions and future work.

Структура работы: раздел 2 — state of the art по DRL и XDRL в управлении портфелем; раздел 3 — методология (основы DRL, PPO, XAI-техники и их интеграция); раздел 4 — эксперименты с эмпирическими доказательствами; раздел 5 — заключение и направления дальнейших исследований.

2. Обзор литературы (state of the art)

Применение DRL в управлении финансовым портфелем набирает популярность благодаря росту вычислительных мощностей и архитектур, позволяющих разумно оценивать распределение наград действий относительно состояний в процессе обучения агентов на финансовых данных (Hambly, Xu, and Yang 2023). Однако литература по объяснимости DRL-алгоритмов, применённых к управлению портфелем, крайне скудна — лишь четыре недавних исследования (Wang et al. 2019; Bougie and Ichise 2020; Guan and Liu 2021; Shi et al. 2021). В этом разделе — подробный обзор DRL и XDRL в управлении портфелем и research gap, на который отвечает наша работа.

2.1 DRL для управления портфелем

Недавно предложено множество DRL-алгоритмов, что мотивировало их применение в нашей области. Liu et al. (2021) классифицируют state-of-the-art DRL-алгоритмы на три категории: (1) value-based — на основе Deep Q-Networks (DQN) (Mnih et al. 2015); (2) policy-based — прямое обновление параметров политики через policy gradient (PG) (Sutton et al. 1999); (3) Actor-Critic — Advantage Actor Critic (A2C) (Mnih et al. 2015), Proximal Policy Optimization (PPO) (Schulman et al. 2017), Deep Deterministic Policy Gradient (DDPG) (Lillicrap et al. 2015), Soft Actor-Critic (SAC) (Haarnoja et al. 2018), Twin Delayed DDPG (TD3) (Dankwa and Zheng 2019). Все они использовались для максимизации доходности портфеля при минимизации риска: например, Liu et al. (2018) применяют DDPG для торговли акциями; Liu et al. (2020) — DQN, DDPG, PPO, A2C, TD3, SAC для автоматизированной торговли; Liu et al. (2021) реализуют PPO, A2C, DDPG и TD3 для управления портфелем.

Liang et al. (2018) успешно применили три популярных DRL-алгоритма с непрерывными действиями — PPO, DDPG и PG — к управлению портфелем на китайском фондовом рынке: комплексные эксперименты с различными learning rates, целевыми функциями и комбинациями признаков для insights по настройке параметров, отбору признаков и подготовке данных. Учитывая полезность DRL на высоковолатильных рынках, методологию применяли к криптовалютным портфелям (Jiang and Liang 2017; Sadighian 2019; Sattarov et al. 2020; Liu et al. 2021). Zhang et al. (2019) применяют DRL к торговле фьючерсами; различные авторы реализуют hedging-стратегии с DRL (deep hedging) (Buehler et al. 2019; Cao et al. 2021; Carbonneau 2021). Pham, Luu, and Tran (2021) фокусируются на multi-agent DRL для автоматического построения hedging-стратегий; другие авторы применяют multi-agent DRL в управлении портфелем (Lussange et al. 2021; Huang and Tanaka 2022; Lee et al. 2020). Zhang et al. (2020) предлагают cost-sensitive portfolio selection с DRL — первые, кто включил transaction costs. Пока большинство DRL-подходов учитывают лишь изменения цен активов без связей между компаниями, Shi et al. (2022) предлагают DRL-фреймворк на Graph Convolutional Network (GCN) для relational features портфеля. Hao, Zhang, and Zhang (2023) включают ensemble-техники и fuzzy extension в DRL для управления портфелем. Jang and Seong (2023) предлагают DRL для оптимизации портфеля, сочетающий MPT и deep learning (Tucker decomposition на 28 акциях США с техническим анализом и ковариатами доходностей). Некоторые авторы включают sentiment analysis в DRL для учёта настроений рынка (Koratamaddi et al. 2021; Li et al. 2019; Nousi et al. 2023; Azhikodan, Bhat, and Jadhav 2019). Hambly, Xu, and Yang (2023) дают обзор recent developments RL и DRL в финансах, включая управление портфелем.

2.2 Четыре работы по XDRL и сравнение с нашим подходом

Несмотря на растущую литературу по DRL в управлении портфелем, литература по объяснимости DRL в этой области крайне скудна — лишь четыре недавних исследования.

Guan and Liu (2021) предлагают эмпирический подход explainable DRL для управления портфелем в ответ на вызов понимания DRL-based trading strategy из-за black-box природы deep neural networks. Конкретно, они используют линейный слой задним числом (hindsight) как reference model и находят связь между наградой (доходностью портфеля) и входом (признаками) через integrated gradients. Поскольку линейная модель (регрессия) интерпретируема — коэффициенты интерпретируемы — методология считается интерпретируемой. Ёмкость нейросети как универсального аппроксиматора значительно превосходит регрессию; авторы делают «компенсацию» между сетью и коэффициентами, чтобы оценить, насколько хорошо линейная регрессия «аппроксимирует» сеть. Если аппроксимация хороша — можно доверять коэффициентам; при плохой — объяснимость теряется. Кроме того, линейная интерпретация может не объяснять complex patterns. Подход зависит от модели (model-dependent), тогда как наш — model-agnostic и post hoc.

Bougie and Ichise (2020) представляют метод объединения внешних знаний и interpretable reinforcement learning в управлении портфелем. Они получают rule-based вариант алгоритма Sarsa (Sutton and Barto 2020, p. 140) — neurosymbolic подход: можно добавить a priori правила и data augmentation, чтобы «объяснить» политику, «внедряя» её до обучения. Это не post hoc подход, как наш, а a priori: мы объясняем предсказания агента, они внедряют политику в виде rules before training. Инвестор видит rules upfront, но не знает, как они evolve после exposure к market data. В разделе 5 мы отмечаем future work: hybridize их neurosymbolic injection с нашим post-hoc monitoring — observe, как training modifies injected rules.

Shi et al. (2021) — XPM framework — добавляют explainability через temporal neural network для извлечения significant time-varying features (vs наша CNN/static OHCL input), затем regularization для simplification и class activation mapping (CAM) для объяснения neural network features внутри модели, не at prediction time. Они explain the model (policy trained during training period); мы explain predictions during trading time. CAM heatmaps insightful для research, но не deployable для daily allocation audit без re-running CAM on full training set.

Wang et al. (2019) — AlphaStock — предлагают interpretable DRL investment strategy с interpretable deep attention networks. Ranking features через две neural networks «объясняет» training time data optimally; sensitivity analysis выбирает best features. Interpretation analysis: strategy selects assets по принципу «winners with high long-term growth, low volatility, high intrinsic value, undervalued recently». Полезно для explanatory research narrative; мы target predictive explainability — why this weight today, not why strategy class worked historically.

Таким образом, насколько нам известно, наше исследование — первое, предлагающее explainable post hoc portfolio management financial policy DRL-агента. Остальные четыре работы в underdeveloped strand литературы предлагают explainable «a priori» investment strategy с DRL-моделями — полезные, но не closing gap между trained black-box agent и daily fiduciary oversight в live trading.

3. Методология

Ниже — методологические детали post hoc explainable deep reinforcement learning для управления финансовым портфелем: сначала основы DRL в финансах, затем XAI-техники, затем интеграция объяснимости в DRL для объяснения предсказаний агента.

3.1 Основы Deep Reinforcement Learning для управления портфелем

Сначала — возражения к применению DRL для управления портфелем и аргументы в ответ (по Liang et al. 2018). DRL имеет потенциал благодаря способности захватывать нелинейные признаки, слабым prior assumptions и сходству с человеческим инвестированием. Однако есть особенности, требующие внимания:

Контраргументы: DNN способны аппроксимировать любую функцию при достаточных данных и архитектуре. Для конечного горизонта можно настроить гиперпараметр $\gamma$ для учёта будущих наград: $\gamma \in [0, 1]$ контролирует фокус на immediate vs far rewards; значение близкое к 1 — максимизация доходности на длинном периоде (discount rate для всех DRL-алгоритмов). Ближайшее будущее рынка можно объяснить технически и прошлой информацией — DRL подходит. Агент можно переобучать после предсказаний в real-time с новой информацией. Хотя модель Markowitz предполагает, что портфели — функция лишь expected reward и risk, при невыполнении допущений (например, нормальность доходностей) оптимальный портфель — black-box огромного набора признаков (технические индикаторы, fundamental ratios, social networks), с которыми DRL справляется благодаря neural scaling laws. В этой работе предполагаем, что рынок полностью объясняется техническими данными; любой источник данных можно интегрировать в state space, включая multimodal data.

DRL — класс методов, сочетающий reinforcement learning (Sutton and Barto 2020; Hambly, Xu, and Yang 2023) с deep neural networks (LeCun, Bengio, and Hinton 2015) для сложных задач принятия решений. В DRL агент взаимодействует со средой, заданной state space $S$ и action space $A$. Пространства могут быть ограниченными непрерывными: $S \in \mathbb{R}^d$, $A \in \mathbb{R}^d$, где $d$ — число признаков, воспринимаемых агентом на каждом шаге $t$. Deep RL кодирует политику $\pi(a_t|s_t)$, выученную методом trial and error в training process, в deep neural network, отображающую распределение состояний в действия $S \to A$, чтобы выбирать действие, максимизирующее expected reward за период с гиперпараметром $\gamma \in [0, 1]$.

На каждом дискретном шаге $t$ агент наблюдает состояние $s_t \in S$ и выбирает действие $a_t \in A$ по выученной политике $\pi(a_t|s_t)$ — условному распределению действий при данных состояниях, оцениваемому для максимизации expected reward. Среда переходит в новое состояние $s_{t+1}$ и выдаёт награду $r_t$ как эффект действия $a_t$ в состоянии $s_t$. Итеративно в симуляторе агент учит политику $\pi(a_t|s_t)$, которая может обобщаться за пределы симулятора, если допущения DNN выполняются на prediction data.

Формально цель обучения — политика $\pi$, максимизирующая expected cumulative reward. Return на каждом шаге $R_t$:

\[ R_t = \sum_{k=0}^{K} \gamma^k r_{t+k}, \tag{1} \]

где $\gamma \in [0, 1]$ — discount factor, балансирующий immediate и future rewards; $K$ — конец эпизода или желаемый prediction period. Оценив политику, максимизирующую expected $R_t$ (настраиваемую под задачу), определяем q-value function $Q(s,a)$ — полное распределение expected return от действия $a \in A$ в состоянии $s \in S$ при следовании политике $\pi(a_t|s_t)$:

\[ Q^\pi(s, a) = \mathbb{E}_\pi\left[R_t \mid s_t = s,\, a_t = a\right], \tag{2} \]

— распределение вероятностей, выученное DRL-алгоритмом и аппроксимированное в deep neural network $Q(s, a \mid \theta)$ параметрами $\theta$. Этот фреймворк иллюстрируется на рис. 1.

Компоненты DRL
Рисунок 1. Основные компоненты deep reinforcement learning, позволяющие оценить expected reward любого действия из action space агента при любом состоянии, воспринимаемом агентом. Выученная policy function закодирована в deep neural network, что даёт непрерывные действия и пространства и произвольную сложность отображения.

Proximal Policy Optimization (PPO)

В нашей работе используется Proximal Policy Optimization (PPO) (Schulman et al. 2017) — популярный и «лёгкий» вариант более дорогих алгоритмов. PPO обновляет политики без резких изменений, избегая outliers в training process, ухудшающих оценку политики. Это делает обучение стабильнее через «trust region»: новые политики не должны сильно отклоняться от старых. PPO вводит clipped objective function (clipped probability ratios), предотвращающую слишком большой шаг обновления от старой политики. Clipping ограничивает probability ratio между новой и старой политиками заданным диапазоном. Максимизируя clipped objective, PPO балансирует exploration (новые стратегии) и exploitation (проверенные стратегии).

Стандартная clipped surrogate objective function PPO (Schulman et al. 2017):

\[ L^{\mathrm{CLIP}}(\theta) = \mathbb{E}_t\left[\min\left(r_t(\theta)\,\hat{A}_t,\;\mathrm{clip}\big(r_t(\theta),\, 1-\epsilon,\, 1+\epsilon\big)\,\hat{A}_t\right)\right], \]

где $r_t(\theta) = \dfrac{\pi_\theta(a_t \mid s_t)}{\pi_{\theta_{\mathrm{old}}}(a_t \mid s_t)}$ — ratio вероятностей новой и старой политик; $\hat{A}_t$ — оценка advantage function (например, через Generalized Advantage Estimation); $\epsilon$ — параметр clipping (обычно 0,1–0,2), ограничивающий изменение политики за один шаг обновления.

Интуиция clipping: если $r_t(\theta)$ сильно превышает $1+\epsilon$ и advantage положителен, gradient обнуляется — policy не делает слишком aggressive step, который мог бы collapse performance на financial time series с heavy tails. Для portfolio management это особенно важно: один outlier trading day не должен доминировать over entire training batch. PPO также совместим с continuous action spaces через Gaussian policy head — natural fit для weight allocation без discretization artifacts.

3.2 Техники explainable artificial intelligence

Цель работы — интегрировать объяснимость финансовых признаков в DRL-фреймворк, делая decision-making прозрачным для финансовых экспертов. Кратко описываем три интегрированные техники.

Люди используют прогнозы ML-моделей, но usability ограничена, если нельзя обосновать доверие. Explanation — способ получить понимание, выбирая «что» сообщать и «как» представлять информацию. XAI необходим и для regulatory issues: GDPR EU обеспечивает «right to explanation» для automated decision-making models. Interpretability помогает разработчикам понимать и улучшать модель, troubleshooting, debugging, обнаружение biases и insights о поведении в разных обстоятельствах.

Vouros (2022) даёт comprehensive review explainable DRL methods — единственный обзор, фокусирующийся на XDRL. Мы используем три техники: SHAP (Lundberg and Lee 2017; Rozemberczki et al. 2022), LIME (Ribeiro, Singh, and Guestrin 2016; Visani et al. 2022) и feature importance methods.

SHAP (SHapley Additive exPlanations) — unified способ объяснить каждое предсказание instance (Lundberg and Lee 2017). Аналогия: в командном спорте нужно знать вклад каждого игрока в победу. SHAP «разбивает» предсказание на impact каждого признака по Shapley values из cooperative game theory — единственное allocation, удовлетворяющее axioms efficiency, symmetry, dummy и additivity.

Механизм SHAP в контексте portfolio weights:

LIME (Local Interpretable Model-agnostic Explanations) объясняет предсказания любого classifier понятным и точным способом (Ribeiro, Singh, and Guestrin 2016). Обучает упрощённую модель (часто Lasso regression) вокруг prediction на perturbations uniformly sampled features — local fidelity: поведение complex DNN approximated linearly в neighborhood конкретного $s_t$. Goal — ensure local fidelity для audit single allocation decision.

LIME originally designed для binary vector instance representation, но tabular variant applies к continuous OHCL states. Visual surface representation (horizontal bars на рис. 7–8) показывает positive/negative contributors с coefficient magnitude. Statistical stability indices (Visani et al. 2022) могут quantify reliability LIME explanations — relevant для production deployment.

Feature importance methods показывают, какие признаки наиболее влиятельны в overall decision-making. Анализ importance помогает понять приоритеты модели по входным данным, выявить key drivers поведения и повысить transparency и trust. В tree-based surrogate или permutation importance setting: shuffle feature $j$, measure drop in prediction accuracy или increase in MSE — aggregate over trading days yields ranking на рис. 2–4.

3.3 Интеграция объяснимости в финансовые предсказания DRL

Описываем интеграцию XAI-техник из §3.2 с DRL-методологией из §3.1. Работа опирается на фреймворк GitHub «Reinforcement learning in portfolio management» (DeepCrypto, 2018): github.com/deepcrypto/Reinforcement-learning-in-portfolio-management-. Цель — расширить фреймворк explainability features для прозрачности decision-making DRL-модели.

Отправная точка — уже разработанная PPO-based model во фреймворке, показавшая эффективность в portfolio management. PPO выбран за баланс exploration/exploitation — подходит для dynamic и unpredictable financial markets.

Training phase: финансовые данные с Yahoo Finance — OHCLV (Open, High, Close, Low, Volume) по нескольким тикерам для построения портфеля за период. Preprocessing включает: (1) нормализацию значений для стабильности gradient updates в PPO; (2) обработку missing data (forward-fill или exclusion проблемных dates); (3) structuring данных в формат, совместимый с gymnasium environment DeepCrypto — последовательности state vectors с lagged OHCL features (обозначения L1 в экспериментах — значение предыдущего дня). После preprocessing агент взаимодействует со средой financial market simulator, учится на historical data и iteratively refines policy через clipped surrogate updates.

Action space в portfolio management framing: continuous weights на каждый актив плюс cash allocation, суммирующиеся в 1 (или с soft constraint через softmax output layer). Reward function в базовом фреймворке — portfolio return или risk-adjusted variant; PPO оптимизирует expected discounted sum таких rewards с $\gamma$ near 1 для multi-year horizon (training 2015–2017).

Для post-hoc interpretability сохраняем state-action pairs на всех шагах training process — они используются для построения explainability models. Pipeline в trading period:

  1. Агент получает state $s_t$ (20 OHCL features) и output action $a_t$ (6 portfolio weights).
  2. Surrogate model или explainer (SHAP TreeExplainer / KernelExplainer, LIME tabular explainer) approximates mapping $s_t \mapsto a_t$ locally или globally.
  3. Feature importance ranks признаки по mean absolute contribution across trading days 2017–2018.
  4. SHAP force plot decomposes single prediction; LIME fits sparse linear model в neighborhood $s_t$.

Реализованы SHAP, LIME и feature importance — методы показывают, какие features и inputs наиболее влиятельны в decision-making агента, давая insights на global level и для specific predictions → interpretable DRL model. Три метода complementary и могут deployаться independently (например, LIME для real-time dashboard, SHAP для end-of-day compliance report).

4. Эксперименты

Описываем эксперименты, демонстрирующие полезность explainable deep reinforcement learning methodology. Для reproducibility и transparency весь код загружен: github.com/aleedelarica/XDRL-for-finance.

4.1 Данные, state space и обучение

Для эксперимента по управлению портфелем (reproducibility: GitHub repository authors):

После training period интерпретируем предсказания deep neural network в trading period (2017–2018, out-of-sample относительно training window) методами feature importance, SHAP и LIME. Важно: explainability применяется к already trained policy — без retraining и без access к gradients PPO network at inference (model-agnostic property).

Обозначения в figures: «L1» suffix — lag-1 feature (значение предыдущего торгового дня); «high», «low», «open», «close» — соответствующие OHCL components. Normalized feature values (например, V high L1 = 1,02) reflect z-score или min-max scaling из preprocessing pipeline — см. GitHub repository и PDF оригинала для exact normalization scheme и дополнительных experimental details.

4.2 Feature importance в trading period

Начинаем с экспериментов по извлечению feature importance для предсказаний агента в trading period. Конфигурируем портфель технологических активов и измеряем importance их OHCL-признаков — рис. 2.

Feature importance по признакам
Рисунок 2. Важность признаков state space DRL-агента в экспериментах по управлению портфелем. Видно, что close value Apple — наиболее важный для estimated policy DRL-агента.

Рис. 3 — средняя importance по всем признакам для каждой акции. Apple (AAPL) остаётся наиболее значимой, далее Visa (V), Alibaba (BABA), Adobe (ADBE), Sony (SNE). DRL-агент приоритизирует данные Apple для инвестиционных решений — consistently в предыдущем эксперименте. Для каждого актива неочевидно, какой из OHCL наиболее важен — varies по активам; разумно использовать все для robustness к разным портфелям.

Feature importance по активам
Рисунок 3. Feature importance state space DRL-агента, отсортированная по активам.

Рис. 4 — средняя importance каждого технического индикатора по всем активам портфеля за весь trading period. Close и open — наиболее критичные; high и low (экстремумы дня) также важны для предсказаний DRL-агента.

Средняя importance индикаторов
Рисунок 4. Средняя feature importance различных финансовых индикаторов по всем активам портфеля.

4.3 SHAP: объяснение предсказаний весов

Для объяснения предсказаний модели SHAP используем SHAP force plot. Модель — multi-output (6 actions: по одному на актив + cash). SHAP генерирует force plot для каждого weight allocation по всем samples. Force plot для Apple — рис. 5.

SHAP force plot AAPL все признаки
Рисунок 5. SHAP force plot для weight allocation Apple (AAPL) с contribution всех признаков.

SHAP values — contribution каждого признака в output модели для конкретного sample. Positive SHAP (красный) повышают prediction, negative (синий) понижают. Base value (горизонтальная линия) — средний output модели (logit) по всему dataset. Аналогично можно анализировать один признак — рис. 6: изолированный contribution closing price Apple.

SHAP force plot AAPL close
Рисунок 6. SHAP force plot для weight allocation AAPL с contribution только closing price Apple.

Plot помогает понять specific impact признака по всему dataset и в одном prediction без interference других. Пример: инвестор хочет понять, почему модель снизила weight allocation Apple в конкретный день — анализ признаков показывает, что closing price Apple significantly lowered prediction. Комбинация знаний инвестора и explanation модели даёт полное понимание prediction.

Продолжая сценарий: инвестор рассматривает другой instance, где модель увеличила weight allocation Apple. Анализируя это specific prediction, инвестор замечает красный segment: BABA open L1 (opening price Alibaba предыдущего дня) оказал positive impact. Поначалу это может показаться puzzling — BABA open L1 относится к opening price акций Alibaba, а не Apple. Однако инвестор вспоминает, что в этот день positive news о strong quarterly performance Alibaba вызвал ripple effect на tech sector, boosting overall market sentiment и косвенно benefiting Apple stock price. Чувствительность модели к таким interconnected market dynamics reassuring для инвестора: модель не рассматривает лишь isolated stock movements, но понимает broader market trends и их impacts на individual assets. Такое interconnected understanding критично для informed allocation decisions в diversified portfolio.

Этот comprehensive explainability method enhances investor trust в модель, ensuring они могут confidently rely на её predictions для guidance investment strategies. SHAP force plots особенно полезны, когда нужно отделить вклад одного признака (рис. 6) от совместного влияния всего state vector (рис. 5): base value показывает «среднее» поведение policy, а colored segments — deviation для конкретного trading day.

4.4 LIME: локальные объяснения weight allocation

LIME даёт insights в feature contributions для weight allocation каждого актива в конкретный moment — пример для Apple на рис. 7.

LIME Apple
Рисунок 7. LIME explanation для предсказания weight allocation Apple в конкретный момент.

Predicted weight allocation — maximum 0,21. Positive contributors: V high L1, BABA close L1, AAPL open L1, ADBE close L1, BABA low L1 — collectively push prediction higher. V high L1 (1,02) и BABA close L1 (0,96) significantly influence larger allocation to Apple. Significant negative contributors отсутствуют — strong overall positive sentiment для Apple allocation.

Для Adobe (рис. 8): predicted allocation 0,16 (range 0,15–0,25). Positive: V low L1, BABA open L1. Negative: AAPL low L1, AAPL high L1 reduce allocation. Adobe benefits от positive conditions в Visa и Alibaba; certain Apple metrics dampen allocation.

LIME Adobe
Рисунок 8. LIME explanation для предсказания weight allocation Adobe в конкретный момент.

LIME explanations помогают инвесторам: explicit explanations для каждого forecast, наблюдение взаимодействия факторов и влияния на решения DRL-агента. Если metrics Visa и Alibaba continuously increase allocations к tech stocks (Apple, Adobe) — можно monitor эти metrics proactively.

Understanding, почему модель cuts allocations в response to specific traits, помогает reduce risks. Если poor Apple metrics routinely reduce allocations к другим акциям — investigate cross-asset link и rebalance portfolio. LIME особенно ценен для instance-level audit: compliance officer может проверить, не опирается ли агент на признаки, inconsistent с investment mandate, в конкретный trading day.

Сравнение нашего XDRL с четырьмя prior works по ключевым осям:

Как показано в разделе, три explainability techniques реализуются independently или jointly, объясняя DRL agent predictions в trading time и отслеживая, действует ли policy ожидаемо — advantage перед published DRL explainability methods, дающими explanations лишь в training time, not being able to monitor predictions done by the agent in the trading time.

Ограничения текущего experimental setup (явно в оригинале): (1) только five tech stocks — generalization на broader universes требует validation; (2) OHCL-only state — без volume в reported 20 features (хотя pipeline supports OHCLV); (3) нет explicit comparison portfolio performance metrics (Sharpe, drawdown) — focus work на explainability, not alpha generation; (4) 100 epochs и default PPO hyperparameters — не claimed as optimally tuned trading system. Тем не менее, contribution — methodology bridge между black-box DRL deployment и regulatory / fiduciary need for interpretability.

5. Заключение и дальнейшая работа

Мы успешно использовали SHAP, LIME и feature importance для объяснения решений DRL-модели в portfolio management tasks. Методы дали clear и detailed insights, почему модель делала specific investment choices — подтверждая гипотезу, что DRL predictions в portfolio management можно объяснять explainability techniques post hoc, без модификации архитектуры policy network.

Prediction explainability analysis с SHAP и LIME revealed, что importance features varies across different market conditions и specific predictions: один OHCL-признак может быть dominant в одном instance и negligible в другом. Feature importance analysis на aggregate level показала consistent ranking: Apple data — top driver; среди индикаторов — close и open, но high/low также значимы для volatility-aware allocation.

Практический вывод: XDRL не заменяет DRL training pipeline, а надстраивается над обученным PPO-агентом (DeepCrypto framework). State-action logging и post-hoc SHAP/LIME — incremental cost относительно black-box deployment, но существенный gain в auditability и regulatory alignment (GDPR right to explanation).

Направления дальнейшей работы (из оригинала и наши extensions):

Детали hyperparameters PPO, network architecture и exact SHAP/LIME configuration — в PDF оригинала и репозитории XDRL-for-finance.

Литература

Оригинал статьи: de la Rica Escudero et al., «Explainable Post hoc Portfolio Management Financial Policy of a Deep Reinforcement Learning agent», arXiv:2407.14486