Хеджирование американских пут-опционов глубоким обучением с подкреплением

4/10

Рейли Пикард · Department of Mechanical and Industrial Engineering, University of Toronto

Финн Вреденхаген, Хулио ДеХесус, Марио Шленер · Ernst & Young LLP, Торонто

Юрий Лавришин · Department of Chemical Engineering and Applied Chemistry, University of Toronto · апрель 2024

Оригинал: Pickard, R., Wredenhagen, F., DeJesus, J., Schlener, M. and Lawryshyn, Y. «Hedging American Put Options with Deep Reinforcement Learning», 2024 — arxiv.org/abs/2405.06774 (PDF).

Оригинал распространяется по лицензии CC BY-NC-SA 4.0; перевод выполнен на её условиях.

Ключевые слова: обучение с подкреплением; нейросети; ценообразование деривативов; динамическое хеджирование; количественные финансы; риск-менеджмент.

Аннотация

DDPG для хеджирования американских путов. Сначала агенты учатся и тестируются на геометрическом броуновском движении (GBM) и обходят дельту Блэка–Шоулза, особенно при транзакционных издержках. Второй круг: 80 путов по 8 тикерам, для каждого тикера калибруется стохастическая волатильность, для каждого из 80 опционов — свой агент на симулированных путях этой модели. DRL бьёт BS-дельту и на тех же калиброванных путях, и на реализованной траектории актива между продажей и экспирацией. Заявлено как первые DRL-агенты именно под американский пут. Цену опциона на каждом шаге даёт модельно-агностическая интерполяция Чебышёва — каркас без привязки к конкретному процессу базового актива.

Введение

После продажи опциона хеджер гасит риск. Европейский пут — продажа дельты акций. Для европейца есть аналитика Блэка–Шоулза [Black and Scholes 1973]; непрерывный дельта-нейтральный портфель в модели убивает риск, на рынке ребаланс дискретный, волатильность не константа, есть комиссии. Хедж при трении — последовательные решения в неопределённости. DRL уже бьёт людей в играх [Mnih et al. 2013; Silver et al. 2016] и роботах [Lillicrap et al. 2015]. Обзор 17 работ по DRL-хеджу акций [Pickard and Lawryshyn 2023]: европейцы с комиссиями и стох. волатильностью — да; американцев нет. У американского пута нет формулы из-за досрочного исполнения, нужны численные методы [Hull 2012]. Этот пробел и закрывают DDPG-агенты.

Состояние, действие, награда — ниже. Обучение: 5000 эпизодов по 25 шагов. Награда требует цену опциона на каждом шаге: на GBM — интерполяция биномиального дерева; на стох. воле — Чебышёв [Glau, Mahlstedt, and Pötz 2018], без тысяч MC с текущего уровня до экспирации.

Кратко про RL

Агент в состоянии $s$ берёт $a$, получает $r$. Цель — ожидаемая отдача \[ G_t=r_{t+1}+\gamma r_{t+2}+\cdots+\gamma^{T-1}r_T. \] Политика $\pi(s)\to a$. $Q^\pi(s,a)=\mathbb{E}[G\mid a,s]$. SARSA: $Q(s,a)\leftarrow Q(s,a)+\alpha(r'+\gamma Q(s',a')-Q(s,a))$. Q-learning Watkins: вместо $Q(s',a')$ стоит $\max_{a'}Q(s',a')$. Таблица $|{\mathcal S}|\times|{\mathcal A}|$ не масштабируется; DQN аппроксимирует $Q(s,a;\theta)$ и минимизирует \[ L_i(\theta_i)=\mathbb{E}_{s,a}\bigl[(y_i-Q(s,a;\theta_i))^2\bigr]. \] Непрерывные действия — DDPG [Lillicrap et al. 2015]: актор-критик, таргет $y_i=r+\gamma Q'(s',\pi'(s');\theta^{Q'})$. Обзор хеджирования: Cao et al. (2021), Assa et al. (2021), Xu and Dai (2022), Fathi and Hientzsch (2023). Американский пут в этом списке отсутствует (Xu and Dai тренируют на эмпирике американцев, но не этот каркас DDPG+Чебышёв).

Методология

Агент

Актор и критик — полносвязные сети, два скрытых слоя по 64, ReLU. Актор: сигмоида в $[0,1]$, затем умножение на $-1$ (шорт акций под пут). Критик: линейный выход. Learning rate актора $5\times 10^{-6}$, критика $5\times 10^{-4}$. Состояние: цена актива, время до экспирации, текущий холдинг (прошлое действие) — как Kolm and Ritter, Cao et al., без BS-дельты в стейте (европейская дельта вредна американцу). Награда \[ R_t=-\bigl|A_t(S_t-S_{t-1})-(C_t-C_{t-1})\bigr|-\kappa(A_t-A_{t-1})^2 S_t, \] $\kappa=0.005$. Без комиссий оптимум — ноль. Линейный штраф Cao $\lambda|A_t-A_{t-1}|S_t$ на американце либо игнорирует косты, либо недохеджирует рано (опасно при досрочном исполнении). Квадрат сильнее бьёт крупные скачки позиции. На тесте комиссии линейные $\lambda|A_t-A_{t-1}|S_t$, как у Cao — реалистичнее обучения.

Контрагент в обучении не исполняет на границе: эпизод идёт ниже ожидаемой границы, чтобы агент видел эти цены.

GBM

\[ S_{t+\Delta t}=S_t\exp\Bigl((\mu-\tfrac12\sigma^2)\Delta t+\sigma\sqrt{\Delta t}\,Z_t\Bigr),\quad Z_t\sim\mathcal N(0,1). \] $\mu=5\%$, $\sigma=20\%$, $T=1$ год. Цена опциона — биномиальное американское дерево, интерполяция. Тест: 10 000 путей, 100 ребалансов, $S_0=K=100$ USD. Бенчмарки: биномиальный хедж \[ \beta_t=-\frac{C_t^u-C_t^d}{S_t^u-S_t^d} \] и европейская BS-дельта пута (не учитывает early exercise). $r=5\%$.

Стохастическая волатильность (адаптация SABR)

\[ \sigma_t=\sigma_{t-1}+\nu\sigma_{t-1}\Delta B_t,\qquad S_t=S_{t-1}+\mu S_{t-1}\Delta t+\sigma_t S_{t-1}\Delta W_t, \] с коррелированными броунами через $\rho$. У Хагана $\beta=1$ и без дрейфа; здесь добавлен $\mu$. Предварительный тест: $\rho=-0.4$ (leverage effect), $\nu=0.1$. Калибровка: Bloomberg composite, 17 августа 2023, 8 тикеров (AAPL, JNJ, MA, META, MSFT, NKE, NVDA, SPY), два срока (15 сен / 17 ноя 2023), по 5 страйков = 80 опционов. $\rho,\nu$ подгоняются trust-region: старт волы = implied, минимум разницы mid и среднего пей-оффа 10 000 путей. Калибруют на европейцах (без границы исполнения) — иначе граница требует уже калиброванных коэффициентов. Параметры тикера — среднее по его опционам.

Чебышёв [Glau et al. 2018]: на сетке времени узлы Чебышёва между экстремумами путей; назад от $t_{N-1}$ к $t_0$ continuation vs exercise; граница — узлы, где упражнение оптимально. Потом цена в любой $(S,t)$ — интерполяция без нового MC. 5000×25 = 125 000 наборов симуляций LSMC на обучение были бы неприемлемы. На GBM граница Чебышёва совпадает с биномиальным деревом 5000 узлов (Exhibit 2, ATM пут 100 USD, 1 год).

P&L теста

\[ B_0=C_0-S_0 A_0,\qquad B_n=B_{n-1}e^{r\Delta t}-(A_n-A_{n-1})S_n-\lambda|A_{n-1}-A_n|S_n. \] При исполнении в $T^*$: финальный P&L $=B_{T^*-\Delta t}e^{r\Delta t}+S_{T^*}A_{T^*-\Delta t}-(K-S_{T^*})^+$. На калиброванных моделях бенчмарк только BS-дельта с подстановкой текущей $\sigma_t$. Эмпирика: Yahoo, 17 авг – 17 ноя 2023, по одному истинному пути на тикер.

Результаты

Exhibit 5. Финальный P&L, 10 000 GBM-путей (USD).
$\lambda=0\%$$\lambda=3\%$
среднеестд.среднеестд.
DRL−0,101,20−7,902,30
BS-дельта−0,361,02−8,973,24
Бином−0,120,86−10,264,33

Без комиссий DRL лучше BS (европейская дельта не видит early exercise), но не лучше бинома и имеет большую дисперсию. При 3% DRL лучший и по среднему, и по стд. На ранних шагах позиция близка к биному; BS недохеджирует. На резких движениях DRL запаздывает: недохедж на шипе, перехедж на провале — плата за squaring комиссий, и поэтому он выигрывает при $\lambda=3\%$.

Exhibit 10. Робастность: агент учился при $\sigma=20\%$, покупатель исполняет по границе $24\%$.
$\lambda=0\%$$\lambda=3\%$
среднеестд.среднеестд.
DRL−1,721,11−10,023,35
BS-дельта−1,991,16−11,004,39
Бином−1,731,31−12,425,79

Опцион продан слишком дёшево (вола в цене 20%, мир 24%). DRL всё равно лучше обоих бенчмарков при комиссиях.

Exhibit 13. SABR с произвольными $\rho=-0.4$, $\nu=0.1$, 10 000 путей, 21 дневной ребаланс.
комиссия 0%комиссия 3%
среднеестд.среднеестд.
DRL0,0350,58−3,231,05
BS-дельта0,0420,44−3,791,39

Без комиссий BS чуть лучше по среднему и стд.; с 3% снова DRL. Калиброванные 80 агентов: Exhibits 14–15 усредняют среднее P&L по 5 страйкам (строки между тикерами несравнимы). При $\lambda=3\%$ среднее DRL лучше BS почти на всех тикер×срок, кроме NVDA 17 ноября (DRL −32,26 против BS −30,55). На истинных путях Yahoo DRL бьёт BS-дельту в 12 из 16 комбинаций тикер×срок (усреднение по 5 страйкам). Практический вывод авторов: корзину из 80 опционов можно хеджировать 80 отдельными агентами, обученными в день котировки. Следующий шаг — переучивать каждый день; плюс parametric study гиперпараметров — в литературе нет консенсуса.

Оговорки: 3% линейных комиссий — стресс, не типичный retail; один реализованный путь на тикер — не статистика по режимам; калибровка на европейцах, хедж американский; отдельный агент на каждый опцион, не одна политика на книгу.

Заключение

Пробел европейского DRL-хеджа закрыт американским путом на DDPG. Новизна награды — модуль рассогласования P&L плюс квадрат оборота. На GBM с комиссиями DRL бьёт BS и бином; при заниженной воле — тоже. На калиброванном SABR-подобном процессе Чебышёв даёт цену без LSMC. И симуляция, и истинный путь 2023 говорят, что BS-дельта не оптимум при трении. Каркас Чебышёва переносится на более сложные процессы базового актива.

Литература

  1. Assa, H., Kenyon, C., and Zhang, H. (2021). related DDPG hedging.
  2. Black, F. and Scholes, M. (1973). The pricing of options and corporate liabilities. JPE.
  3. Cao, J., Chen, J., Hull, J., and Poulos, Z. (2021). Deep hedging of derivatives using reinforcement learning. J. Financial Data Science.
  4. Chebyshev, P.L. (1864). Sur les questions de minima…
  5. Glau, K., Mahlstedt, M., and Pötz, C. (2018). A new approach for American option pricing: The dynamic Chebyshev method. SIAM J. Sci. Comput.
  6. Hagan, P.S., Kumar, D., Lesniewski, A.S., and Woodward, D.E. (2002). Managing smile risk. Wilmott. (SABR)
  7. Hull, J. (2012). Options, Futures, and Other Derivatives.
  8. Kolm, P.N. and Ritter, G. (2019). Dynamic replication and hedging: A reinforcement learning approach. J. Financial Data Science.
  9. Lillicrap, T.P., et al. (2015). Continuous control with deep reinforcement learning. arXiv:1509.02971. (DDPG)
  10. Longstaff, F.A. and Schwartz, E.S. (2001). Valuing American options by simulation: A simple least-squares approach. RFS.
  11. Mnih, V., et al. (2013). Playing Atari with deep reinforcement learning.
  12. Pickard, R. and Lawryshyn, Y. (2023). Deep reinforcement learning for dynamic stock option hedging: A review.
  13. Sutton, R.S. and Barto, A.G. (2018). Reinforcement Learning: An Introduction. 2nd ed.
  14. Watkins, C.J.C.H. (1989). Learning from delayed rewards. PhD thesis.
  15. Xu, X. and Dai, M. (2022). empirical American option DRL.

Перевод: основной текст. Приложение (Yahoo-ряды и 80 P&L) опущено. · arXiv:2405.06774 · лицензия CC BY-NC-SA 4.0