Маркетмейкинг при внешней конкуренции

6.5/10

Роберт Бойс · Department of Mathematics, Imperial College London

Мартин Хердеген · Department of Statistics, University of Warwick

Леандро Санчес-Бетанкур · Mathematical Institute, University of Oxford; Oxford-Man Institute of Quantitative Finance · 25 июля 2024

Оригинал: Boyce, R., Herdegen, M. and Sánchez-Betancourt, L. «Market Making with Exogenous Competition», 2024 — arxiv.org/abs/2407.17393 (PDF). Код: mm-pooled-competition, среда gym-mm-pooled-competition.

Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по лицензии CC BY 4.0; перевод выполнен на её условиях, изменение по отношению к оригиналу — перевод на русский язык. Рисунки приведены из оригинальной публикации.

MSC 2020: 93E20, 91B70, 49L20. JEL: C61, G11, G12. Ключевые слова: алгоритмическая торговля; маркетмейкинг; конкуренция; предоставление ликвидности; пропущенные сделки.

Аннотация

Мы изучаем предоставление ликвидности в присутствии внешней конкуренции. Рассматривается «референсный маркетмейкер», который следит за своим инвентарём и за агрегированным инвентарём конкурирующих маркетмейкеров. Предполагается, что конкуренты определяют выставляемые глубины по «правилу большого пальца»: линейно от своего инвентаря. Референсный маркетмейкер оптимизирует свои глубины; вероятность исполнения его заявок зависит от разности его глубин и глубин конкуренции экспоненциально. Для линейно-квадратичного функционала цели показано, что модель допускает приближённое решение в замкнутой форме. Мы иллюстрируем свойства модели и сравниваем с альтернативами: схемой Эйлера и современным обучением с подкреплением.

1. Введение

Лимитный стакан (LOB) — основная технология современных бирж. Часть участников, маркетмейкеры, стремится «зарабатывать спред», предоставляя ликвидность, и одновременно снижать экспозицию к колебаниям цены актива — инвентарный риск. Возникает компромисс между котировками, дающими большую прибыль, и котировками, которые лучше позволяют разгрузить позицию лимитными заявками. Если несколько маркетмейкеров оптимизируют этот компромисс, поток заявок, который не исполнил данный «референсный» маркетмейкер, влияет на его будущее оптимальное поведение: соответствующие рыночные заявки исполняет другой маркетмейкер, который подстраивает цены и тем самым меняет будущие вероятности исполнения лимитных заявок референсного. В этой работе изучается поведение референсного маркетмейкера в присутствии конкурентов.

Современная математическая литература по маркетмейкингу восходит к Avellaneda and Stoikov (2008), которые нашли оптимальные ask и bid для маркетмейкера, контролирующего инвентарный риск, опираясь на более раннюю работу Ho and Stoll (1983). В их постановке рыночные заявки приходят по пуассоновскому процессу и исполняются с экспоненциальной вероятностью, зависящей от расстояния — глубины — котировки маркетмейкера от midprice (незатронутой цены). Эта экспонента — абстракция «хождения по книге».¹

Приходы рыночных заявок моделировали по-разному. Cartea et al. (2014) используют процессы Хоукса, зависящие от «влиятельных» рыночных заявок. Cartea and Wang (2020) вводят сигналы. Jusselin (2021) учитывает информацию о потоке и тоже использует Хоукса. Bergault et al. (2021) обобщают приближения в замкнутой форме на мультиактивную постановку. Cartea et al. (2017) решают задачу при ошибке спецификации интенсивностей, вероятностей исполнения и процесса mid. Учебники: Guéant (2016a); Cartea et al. (2015).

Насколько нам известно, эффект рыночной заявки, которую маркетмейкер не исполнил, ранее не изучался.² Такая заявка влияет на глубины остальных маркетмейкеров; ср. Chordia et al. (2002). Модель Авельянеды–Стойкова и последующая литература не рассматривают взаимодействие нескольких маркетмейкеров: вероятности исполнения зависят только от референсного, без учёта остальных.³

Мы вводим модель в духе Avellaneda and Stoikov (2008), где неисполненные рыночные заявки меняют будущие вероятности исполнения, потому что конкуренты, которые их исполняют, подстраивают котировки. Конкуренты пользуются «правилом большого пальца»: глубины линейны по инвентарю. Поэтому их можно агрегировать в одного. Такой подход позволяет учесть влияние инвентаря конкурентов на рыночные условия, не прибегая к теории стохастических дифференциальных игр: модель трактабельнее и допускает приближённое решение в замкнутой форме. Референсный маркетмейкер постоянно балансирует управление собственным инвентарным риском и числом неисполненных рыночных заявок — чтобы сделать будущие условия выгоднее для себя. Когда интенсивности прихода заявок на разные стороны сильно различаются — как бывает при крупных движениях доходностей, см. Chordia et al. (2002), — этот компромисс особенно труден.

В духе решения задачи с инвентарным риском у Guéant et al. (2013) и линейно-квадратичного функционала у Cartea et al. (2015) мы выводим приближённое решение в замкнутой форме. Для этого делается допущение о связи глубин конкурентов и референсного, которое обычно выполняется при подходящих параметрах. Приближение аналогично Guéant et al. (2013) и сводится к матричному ОДУ.

Дальше: раздел 2 вводит модель и задачу оптимизации референсного маркетмейкера. Раздел 3 выводит оптимальную стратегию в форме обратной связи и приближённое решение в замкнутой форме (теорема 3.1) методом, вдохновлённым Guéant et al. (2013). Раздел 4 — сравнительная статика и краткое сравнение приближения со схемой Эйлера и агентом PPO. Раздел 5 — заключение.

2. Модель

Цель модели — понять, как референсный маркетмейкер учитывает конкуренцию. Есть один референсный маркетмейкер («она»), который принимает присутствие остальных во внимание, и конкурирующие маркетмейкеры, следующие «правилу большого пальца», выведенному из классической модели Avellaneda and Stoikov (2008). В той модели оптимальные глубины ask и bid приблизительно линейны по текущему инвентарю: отрицательная зависимость на ask, положительная на bid, постоянный спред; см. Guéant et al. (2013, предложение 3). Из-за линейности всех конкурентов без потери общности можно агрегировать в одного («он»).

Фиксируем фильтрованное вероятностное пространство $(\Omega,\mathcal{F},\mathbb{F}=\{\mathcal{F}_t\}_{0\le t\le T},\mathbb{P})$, где $\mathbb{P}$ — физическая мера, $T\gt 0$ — горизонт. Как у Avellaneda and Stoikov (2008), незатронутая цена актива

\[ S_t = S_0 + \sigma W_t,\qquad t\in[0,T], \]

где $(W_t)_{0\le t\le T}$ — $\mathbb{F}$-адаптированное стандартное броуновское движение.

Задача референсного маркетмейкера — выбрать оптимальные глубины ask и bid $\delta=(\delta^a,\delta^b)$. Предполагаем, что они $\mathbb{F}$-предсказуемы и интегрируемы: $\mathbb{E}\bigl[\int_0^T(|\delta^a_t|+|\delta^b_t|)\,dt\bigr]\lt\infty$. При управлении $\delta$ котировки

\[ S^{\delta,a}_t = S_t + \delta^a_t,\qquad S^{\delta,b}_t = S_t - \delta^b_t,\qquad t\in[0,T]. \]

Поскольку конкурент следует правилу большого пальца, референсный косвенно влияет на его глубины $\tilde\delta=(\tilde\delta^a,\tilde\delta^b)$ (детали ниже). Соответствующие котировки

\[ \tilde S^{\delta,a}_t = S_t + \tilde\delta^a_t,\qquad \tilde S^{\delta,b}_t = S_t - \tilde\delta^b_t,\qquad t\in[0,T]. \]

Mid конкурента: $\tilde S^\delta_t = \tfrac12\bigl(\tilde S^{\delta,a}_t + \tilde S^{\delta,b}_t\bigr)$.

Как у Avellaneda and Stoikov (2008), заявки на покупку и продажу, приходящие в стакан, моделируются $\mathbb{F}$-адаптированными пуассоновскими процессами $(M^a_t)_{0\le t\le T}$ и $(M^b_t)_{0\le t\le T}$ с постоянными интенсивностями $\lambda^a\gt 0$ и $\lambda^b\gt 0$.

Рыночные заявки, исполненные лимитными заявками референсного, — точечные процессы $(N^{\delta,a}_t)$ и $(N^{\delta,b}_t)$; исполненные конкурентом — $(\tilde N^{\delta,a}_t)$ и $(\tilde N^{\delta,b}_t)$.

Кумулятивный инвентарь референсного: $Q^\delta_t = N^{\delta,b}_t - N^{\delta,a}_t$. Инвентарь конкурента: $\tilde Q^\delta_t = \tilde N^{\delta,b}_t - \tilde N^{\delta,a}_t$.

Как подсказывает классическая модель (Guéant et al., 2013, предложение 3), глубины конкурента зависят от $\tilde Q^\delta$ линейно и дают постоянный спред. Мы не предполагаем, что $\tilde Q^\delta$ полностью объясняет глубины, и добавляем шум:

\[ \tilde\delta^a_t = \tilde a - \beta\tilde Q^\delta_{t-} - Z_t,\qquad \tilde\delta^b_t = \tilde b + \beta\tilde Q^\delta_{t-} + Z_t. \tag{2.1} \]

Здесь $\tilde a,\tilde b\gt 0$ — базовые уровни ask и bid конкурента, $\beta\gt 0$ — коэффициент пропорциональности, $Z_t=\sigma_Z W^Z_t$, где $\sigma_Z\gt 0$ и $(W^Z_t)$ — стандартное броуновское движение, независимое от $W$.

Как в литературе по модели Авельянеды–Стойкова (Guéant et al., 2013; Cartea et al., 2015), у референсного есть ограничения на инвентарь $\underline{q},\overline{q}\in\mathbb{Z}$, $\underline{q}\lt 0\lt\overline{q}$: (i) если $Q^\delta_{t-}=\underline{q}$, bid в момент $t$ не выставляется; (ii) если $Q^\delta_{t-}=\overline{q}$, ask не выставляется.

Осталось описать, как выбор глубин $\delta=(\delta^a,\delta^b)$ влияет на интенсивности $\Lambda^a$ и $\Lambda^b$ процессов $N^{\delta,a}$ и $N^{\delta,b}$ (и тем самым на интенсивности $\tilde N$). Как в классической модели — экспоненциальные вероятности исполнения, но референсный учитывает глубины конкурента. Пусть $\kappa\gt 0$ — скорость экспоненциального затухания, $\iota\gt 0$ — размер тика:

\[ \begin{aligned} \Lambda^a &:= \lambda^a \min\bigl(\exp\bigl(-\kappa(\delta^a-\tilde\delta^a+\iota)\bigr),\,1\bigr),\\ \Lambda^b &:= \lambda^b \min\bigl(\exp\bigl(-\kappa(\delta^b-\tilde\delta^b+\iota)\bigr),\,1\bigr). \end{aligned} \tag{2.2} \]

Экономический смысл: если референсный выставляет на один тик щедрее конкуренции, его лимитная заявка исполняется с вероятностью единица при приходе заявки на соответствующей стороне. Если он менее щедр, вероятность экспоненциально убывает с «недобором» щедрости. Классическая модель Авельянеды–Стойкова — частный случай $\tilde\delta^a=\tilde\delta^b=0$ (и $\iota=0$).

С математической точки зрения параметр $\iota$ в (2.2) можно «поглотить» в $\tilde a$ и $\tilde b$ в (2.1). Далее $\iota$ опускаем и считаем, что $\tilde a,\tilde b$ уже скорректированы на тик: $\tilde\delta^a$ и $\tilde\delta^b$ — глубины на один тик щедрее фактических глубин конкурента.

Функционал цели референсного:

\[ \begin{aligned} J(\delta) &= \mathbb{E}\Biggl[X^\delta_T + Q^\delta_T\tilde S^\delta_T - \gamma(Q^\delta_T)^2 - \varphi\int_0^T (Q^\delta_r)^2\,dr\Biggr]\\ &= \mathbb{E}\Biggl[X^\delta_T + Q^\delta_T\Biggl(S_T+\frac{\tilde a-\tilde b}{2}-\beta\tilde Q^\delta_T-Z_T\Biggr) -\gamma(Q^\delta_T)^2-\varphi\int_0^T(Q^\delta_r)^2\,dr\Biggr]. \end{aligned} \]

Денежный процесс $(X^\delta_t)$:

\[ X^\delta_t = X_0 + \int_{(0,t]} S^{\delta,a}_r\,dN^{\delta,a}_r - \int_{(0,t]} S^{\delta,b}_r\,dN^{\delta,b}_r = X_0 + \int_{(0,t]}(S_r+\delta^a_r)\,dN^{\delta,a}_r - \int_{(0,t]}(S_r-\delta^b_r)\,dN^{\delta,b}_r. \]

Здесь $\gamma$ — штраф за терминальную ликвидацию, $\varphi$ — параметр текущей риск-аверсии по инвентарю. Терминальная ликвидация идёт по mid конкурента $\tilde S^\delta_T$. Линейно-квадратичный функционал широко используется ради трактабельности; см. Cartea et al. (2015); Guéant (2016b).

3. Оптимальная стратегия

Референсный маркетмейкер максимизирует функцию ценности

\[ u(t,s,x,q,\tilde q,z)=\sup_{\delta\in\mathcal{A}_t} u^\delta(t,s,x,q,\tilde q,z), \]

где $\mathcal{A}_t$ — множество $\mathbb{F}$-предсказуемых $\delta=(\delta^a_u,\delta^b_u)_{t\le u\le T}$ с $\mathbb{E}\bigl[\int_t^T(|\delta^a_u|+|\delta^b_u|)\,du\bigr]\lt\infty$, и

\[ u^\delta(y)=\mathbb{E}\Biggl[ X^{y,\delta}_T + Q^{y,\delta}_T\Biggl(S^y_T+\frac{\tilde a-\tilde b}{2}-\beta\tilde Q^{y,\delta}_T-Z^y_T\Biggr) -\gamma(Q^{y,\delta}_T)^2-\varphi\int_t^T(Q^{y,\delta}_r)^2\,dr \Biggr], \]

где $y=(t,s,x,q,\tilde q,z)$, а процессы с верхним индексом $y,\delta$ — это $X^\delta$, $Q^\delta$, $\tilde Q^\delta$, $S$ и $Z$, перезапущенные в момент $t$ из $x$, $q$, $\tilde q$, $s$ и $z$.

Принцип динамического программирования даёт уравнение Гамильтона–Якоби–Беллмана

\[ \begin{aligned} 0 &= \partial_t u + \tfrac{\sigma^2}{2}\partial_{ss}u + \tfrac{\sigma_Z^2}{2}\partial_{zz}u - \varphi q^2 \\ &\quad + \lambda^a\bigl(u(t,s,x,q,\tilde q-1,z)-u(t,s,x,q,\tilde q,z)\bigr) \\ &\quad + \lambda^b\bigl(u(t,s,x,q,\tilde q+1,z)-u(t,s,x,q,\tilde q,z)\bigr) \\ &\quad + \sup_{\delta^a}\lambda^a\min\bigl(e^{-\kappa(\delta^a-\tilde a+\beta\tilde q+z)},1\bigr)\\ &\qquad\times\bigl(u(t,s,x+s+\delta^a,q-1,\tilde q,z)-u(t,s,x,q,\tilde q-1,z)\bigr)1_{\{q\gt\underline{q}\}} \\ &\quad + \sup_{\delta^b}\lambda^b\min\bigl(e^{-\kappa(\delta^b-\tilde b-\beta\tilde q-z)},1\bigr)\\ &\qquad\times\bigl(u(t,s,x-s+\delta^b,q+1,\tilde q,z)-u(t,s,x,q,\tilde q+1,z)\bigr)1_{\{q\lt\overline{q}\}}, \end{aligned} \] \[ u(T,s,x,q,\tilde q,z)=x+qs+\frac{\tilde a-\tilde b}{2}q-\gamma q^2-\beta\tilde q\,q-zq. \tag{3.1} \]

Слагаемые имеют прямую интерпретацию. Разности $u(\ldots,\tilde q-1,\ldots)-u$ и $u(\ldots,\tilde q+1,\ldots)-u$ — изменение ценности, если рыночную заявку исполнил конкурент, а не если заявка не пришла; они умножаются на интенсивность прихода заявок на рынок. Разности $u(\ldots,x+s+\delta^a,q-1,\tilde q,\ldots)-u(\ldots,q,\tilde q-1,\ldots)$ и аналогичная на bid — изменение ценности, если заявку исполнил референсный, а не конкурент; они умножаются на интенсивность прихода и на вероятность исполнения лимитной заявки референсного. Если вероятность исполнения равна единице, члены, отвечающие за исполнение конкурентом, сокращаются (это тогда невозможно), и остаётся изменение ценности при приходе заявки.

Линейно-квадратичный функционал подсказывает анзац

\[ u(t,s,x,q,\tilde q,z)=x+qs-\frac{\beta}{2}q^2-\beta\tilde q\,q-zq+g(t,q), \] \[ c^a:=\delta^a+\beta\tilde q+z-\frac{\beta}{2},\qquad c^b:=\delta^b-\beta\tilde q-z-\frac{\beta}{2}, \]

для некоторой $g(t,q)$. Здесь $c^a$ и $c^b$ — разности глубин референсного и конкурента с постоянной поправкой. Для $g$ получается

\[ \begin{aligned} 0 &= \partial_t g(t,q)-\varphi q^2+(\lambda^a-\lambda^b)\beta q \\ &\quad + \sup_{c^a}\lambda^a\min\bigl(e^{-\kappa(c^a+\beta/2-\tilde a)},1\bigr)\bigl(c^a+g(t,q-1)-g(t,q)\bigr)1_{\{q\gt\underline{q}\}} \\ &\quad + \sup_{c^b}\lambda^b\min\bigl(e^{-\kappa(c^b+\beta/2-\tilde b)},1\bigr)\bigl(c^b+g(t,q+1)-g(t,q)\bigr)1_{\{q\lt\overline{q}\}}, \end{aligned} \tag{3.2} \] \[ g(T,q)=\frac{\tilde a-\tilde b}{2}q-\Bigl(\gamma-\frac{\beta}{2}\Bigr)q^2. \]

Оптимизация по $c^a$ и $c^b$ даёт

\[ c^{*,a}(t,q)=\max\Bigl(\hat c^a(t,q),\,\tilde a-\tfrac{\beta}{2}\Bigr),\qquad c^{*,b}(t,q)=\max\Bigl(\hat c^b(t,q),\,\tilde b-\tfrac{\beta}{2}\Bigr), \]

где

\[ \hat c^a(t,q)=\frac1\kappa-g(t,q-1)+g(t,q),\qquad \hat c^b(t,q)=\frac1\kappa-g(t,q+1)+g(t,q). \]

Отсюда

\[ \begin{aligned} \delta^{*,a}(t,q,\tilde q,z)&=\max\bigl(\hat\delta^a(t,q,\tilde q,z),\,\tilde a-\beta\tilde q-z\bigr),\\ \delta^{*,b}(t,q,\tilde q,z)&=\max\bigl(\hat\delta^b(t,q,\tilde q,z),\,\tilde b+\beta\tilde q+z\bigr), \end{aligned} \tag{3.3} \]

где

\[ \begin{aligned} \hat\delta^a(t,q,\tilde q,z)&=\frac1\kappa-g(t,q-1)+g(t,q)-\beta\tilde q-z+\frac{\beta}{2},\\ \hat\delta^b(t,q,\tilde q,z)&=\frac1\kappa-g(t,q+1)+g(t,q)+\beta\tilde q+z+\frac{\beta}{2}. \end{aligned} \tag{3.4} \]

Величины $\tilde a-\beta\tilde q-z$ и $\tilde b+\beta\tilde q+z$ — глубины конкурента (на один тик щедрее) на ask и bid.

3.1. Приближённое решение в замкнутой форме

Как у Guéant et al. (2013), где решение классической задачи Avellaneda and Stoikov (2008) получают, предполагая неотрицательность неограниченных максимизаторов, мы предполагаем, что неограниченные максимизаторы (3.4) не меньше соответствующих (на тик щедрее) глубин конкурента. Тогда (3.2) упрощается до

\[ \begin{aligned} 0 &= \partial_t g(t,q)-\varphi q^2+(\lambda^a-\lambda^b)\beta q \\ &\quad + \frac{\lambda^a}{\kappa}\,e^{-1-\kappa(\beta/2-\tilde a)}\exp\bigl(-\kappa(g(t,q)-g(t,q-1))\bigr)1_{\{q\gt\underline{q}\}} \\ &\quad + \frac{\lambda^b}{\kappa}\,e^{-1-\kappa(\beta/2-\tilde b)}\exp\bigl(-\kappa(g(t,q)-g(t,q+1))\bigr)1_{\{q\lt\overline{q}\}}, \end{aligned} \] \[ g(T,q)=\frac{\tilde a-\tilde b}{2}q-\Bigl(\gamma-\frac{\beta}{2}\Bigr)q^2. \]

Подстановка $\omega(t,q)=\exp(\kappa g(t,q))$, как в решении классической задачи у Guéant et al. (2013), даёт линейную систему ОДУ

\[ \begin{aligned} 0 &= \partial_t\omega(t,q)+\kappa\bigl(-\varphi q^2+(\lambda^a-\lambda^b)\beta q\bigr)\omega(t,q) \\ &\quad + \lambda^a e^{-1-\kappa(\beta/2-\tilde a)}\,\omega(t,q-1)\,1_{\{q\gt\underline{q}\}} + \lambda^b e^{-1-\kappa(\beta/2-\tilde b)}\,\omega(t,q+1)\,1_{\{q\lt\overline{q}\}}, \end{aligned} \] \[ \omega(T,q)=\exp\Biggl(\kappa\Biggl(\frac{\tilde a-\tilde b}{2}q-\Bigl(\gamma-\frac{\beta}{2}\Bigr)q^2\Biggr)\Biggr). \]

Решая систему и идя назад, получаем следующий результат. Предполагаем $\underline{q}=-\overline{q}$, как у Guéant et al. (2013). Несложное доказательство оставляем читателю.

Теорема 3.1. Пусть $\underline{q}=-\overline{q}$. Определим трёхдиагональную матрицу $(A_{i,q})_{\underline{q}\le i,q\le\overline{q}}$:

\[ A_{i,q}= \begin{cases} -\varphi\kappa q^2+\beta\kappa(\lambda^a-\lambda^b)q, & \text{если }i=q,\\ \lambda^a\exp\bigl(-1-\kappa(\beta/2-\tilde a)\bigr), & \text{если }i=q-1,\\ \lambda^b\exp\bigl(-1-\kappa(\beta/2-\tilde b)\bigr), & \text{если }i=q+1,\\ 0, & \text{иначе.} \end{cases} \]

Столбец $(v_q)_{\underline{q}\le q\le\overline{q}}$:

\[ v_q:=\exp\Biggl(\kappa\Biggl(\frac{\tilde a-\tilde b}{2}q-\Bigl(\gamma-\frac{\beta}{2}\Bigr)q^2\Biggr)\Biggr). \]

Функция $\omega\colon[0,T]\times\{\underline{q},\ldots,\overline{q}\}\to\mathbb{R}$:

\[ \omega(t,q):=\bigl(\exp(A(T-t))\,v\bigr)_q, \]

и

\[ u(t,s,x,q,\tilde q,z)=x+qs-\frac{\beta}{2}q^2-\beta\tilde q\,q-zq+\frac1\kappa\log(\omega(t,q)). \]

Тогда $u$ решает приближённое HJB

\[ \begin{aligned} 0 &= \partial_t u + \tfrac{\sigma^2}{2}\partial_{ss}u + \tfrac{\sigma_Z^2}{2}\partial_{zz}u - \varphi q^2 \\ &\quad + \lambda^a\bigl(u(t,s,x,q,\tilde q-1,z)-u\bigr) + \lambda^b\bigl(u(t,s,x,q,\tilde q+1,z)-u\bigr) \\ &\quad + \sup_{\delta^a}\lambda^a e^{-\kappa(\delta^a-\tilde a+\beta\tilde q+z)} \bigl(u(t,s,x+s+\delta^a,q-1,\tilde q,z)-u(t,s,x,q,\tilde q-1,z)\bigr)1_{\{q\gt\underline{q}\}} \\ &\quad + \sup_{\delta^b}\lambda^b e^{-\kappa(\delta^b-\tilde b-\beta\tilde q-z)} \bigl(u(t,s,x-s+\delta^b,q+1,\tilde q,z)-u(t,s,x,q,\tilde q+1,z)\bigr)1_{\{q\lt\overline{q}\}}, \end{aligned} \] \[ u(T,s,x,q,\tilde q,z)=x+qs+\frac{\tilde a-\tilde b}{2}q-\gamma q^2-\beta\tilde q\,q-zq. \tag{3.5} \]

Соответствующие оптимизаторы $\hat\delta^a(t,q,\tilde q,z)$ и $\hat\delta^b(t,q,\tilde q,z)$ не зависят от $x$ и $s$ и для $q\in\{\underline{q}+1,\ldots,\overline{q}\}$ и $q\in\{\underline{q},\ldots,\overline{q}-1\}$ соответственно равны

\[ \begin{aligned} \hat\delta^a(t,q,\tilde q,z) &=\frac{\beta}{2}+\frac1\kappa\Biggl(1+\log\frac{\omega(t,q)}{\omega(t,q-1)}\Biggr)-\beta\tilde q-z,\\ \hat\delta^b(t,q,\tilde q,z) &=\frac{\beta}{2}+\frac1\kappa\Biggl(1+\log\frac{\omega(t,q)}{\omega(t,q+1)}\Biggr)+\beta\tilde q+z. \end{aligned} \tag{3.6} \]

Как применять теорему 3.1 на практике. Положим

\[ \begin{aligned} \delta^{**,a}(t,q,\tilde q,z)&:=\max\bigl(\hat\delta^a(t,q,\tilde q,z),\,\tilde a-\beta\tilde q-z\bigr),\\ \delta^{**,b}(t,q,\tilde q,z)&:=\max\bigl(\hat\delta^b(t,q,\tilde q,z),\,\tilde b+\beta\tilde q+z\bigr), \end{aligned} \tag{3.7} \]

где $\hat\delta^a$ и $\hat\delta^b$ из (3.6). Вообще говоря, $\delta^{**,a}$ и $\delta^{**,b}$ отличаются от $\delta^{*,a}$ и $\delta^{*,b}$ в (3.3), потому что решение $u$ приближённого HJB (3.5) не обязано решать истинное HJB (3.1). Тем не менее численно оба решения часто очень близки или даже совпадают (если максимумы в (3.7) даются $\hat\delta^a$ и $\hat\delta^b$). Поэтому работа с (3.7) даёт хорошие результаты. В симуляциях ниже оптимальные глубины референсного всегда считаются по (3.7).

4. Сравнительная статика и численные результаты

Сравнительная статика приближённого решения теоремы 3.1. Параметры незатронутой цены: $S_0=100$, $\sigma=1$. Горизонт $T=1$, базовые интенсивности $\lambda^a=\lambda^b=10$, границы инвентаря $\underline{q}=-10$ и $\overline{q}=10$, базовые уровни конкурента $\tilde a=\tilde b=0.1$, коэффициент $\beta=0.05$, скорость затухания $\kappa=2$. Размер тика (уже учтён в $\tilde a,\tilde b$) $\iota=0.01$, штрафы $\varphi=0.1$ и $\gamma=0.03$.

Рисунок 1 показывает оптимизированные глубины (3.6) как функцию (i) инвентаря конкурента $\tilde Q_t$ и инвентаря референсного $Q_t$ (левая панель) и (ii) времени и инвентаря референсного $Q_t$ (правая панель).

Рисунок 1
Рисунок 1. Левая панель: оптимизированные глубины ask $\hat\delta^a$ (сплошные) и bid $\hat\delta^b$ (пунктир) в момент $t=0.5$ (при $Z=0$) как функция инвентаря конкурента ($\tilde Q_t$ по оси $x$) и инвентаря референсного ($Q_t$ в цветовой шкале). Красные линии — глубина конкуренции, где произошла бы срезка для $\delta^{**,a}$ и $\delta^{**,b}$. Правая панель: $\hat\delta^a$ и $\hat\delta^b$ при $\tilde Q=0$ (и $Z=0$) как функция времени ($t$ по оси $x$) и инвентаря референсного ($Q_t$ в цветовой шкале). Красные линии — глубины конкурента $\tilde\delta^a$ и $\tilde\delta^b$, включая тик.

Как и ожидалось, чем больше инвентарь $Q_t$ референсного, тем щедрее (соответственно менее щедры) котировки ask (bid): есть стимул вернуть инвентарь к нулю. По инвентарю конкурента эффект обратный: чем больше $\tilde Q_t$, тем менее (более) щедры ask (bid) — это механика (2.1). Чтобы получить «фактические» глубины $\delta^{**,a}$ и $\delta^{**,b}$ в (3.7), нужно взять максимум между нарисованными $\hat\delta^a$, $\hat\delta^b$ и глубинами конкурента $\tilde\delta^a$, $\tilde\delta^b$.

Далее дискретизируем $[0,T]$ на 1000 шагов и запускаем 10 000 симуляций приближённого решения (3.6). В 13 из 10 000 симуляций (0,13%) референсный оказался щедрее конкуренции (на ask или на bid). Рисунок 2 — одна из этих тринадцати траекторий.

Рисунок 2
Рисунок 2. Симуляция, в которой референсный маркетмейкер становится щедрее конкуренции. Синие маркеры — лучшая котировка у конкуренции, красные — у референсного. Левая панель: лучшие bid за весь день. Средняя: увеличение участка, где bid референсного щедрее конкуренции. Правая: инвентари на том же участке.

Большой отрицательный инвентарь $Q_t$ вынуждает референсного быть на тик лучше конкуренции, пока не придёт рыночная заявка на продажу и инвентарь не уменьшится по модулю — после этого она покидает борьбу за вершину стакана.

Рисунок 3 показывает две выборочные траектории (оранжевая и синяя) основных процессов.

Рисунок 3
Рисунок 3. Первый ряд: две траектории инвентарей $Q_t$ (слева) и $\tilde Q_t$ (центр) и шума $Z_t$ (справа). Второй и третий ряды: приближённые глубины $\delta^{**,a}_t$, $\delta^{**,b}_t$ (левый столбец) из (3.6), глубины конкурента $\tilde\delta^a_t$, $\tilde\delta^b_t$ (средний) и разность (правый). Исполненные покупки — маркеры вверх: зелёные у референсного, фиолетовые у конкуренции; продажи — маркеры вниз, те же цвета. Две траектории окрашены синим и оранжевым.

Приближённые глубины $\delta^{**,a}_t$, $\delta^{**,b}_t$ в (3.6) следуют за конкуренцией, на которую сильно влияют шум $Z_t$ и инвентарь $\tilde Q_t$. Самые информативные панели — правые в среднем и нижнем рядах: разность котировок конкуренции и референсного (ask в среднем ряду, bid в нижнем). Как и ожидалось, зазор на ask (bid) сужается/расширяется, когда инвентарь растёт/падает (падает/растёт), и зазор закрывается к концу дня, потому что mark-to-market идёт по mid конкурента.

Наконец, сравниваем приближённое решение в замкнутой форме с численным приближением исходной задачи. Два бенчмарка: (i) схема Эйлера для исходной функции ценности на 1 000 000 равноотстоящих точек; (ii) обучение с подкреплением на исходной задаче методом proximal policy optimisation (PPO).

Среднее (со стандартным отклонением) критерия референсного: 3,64 (2,57) по приближённому решению в замкнутой форме; 3,66 (2,56) по схеме Эйлера для истинного решения; 3,14 (2,76) по политике PPO. Прирост 0,5% от замкнутой формы к схеме Эйлера статистически значим (парный $t$-тест, 99% доверия). Отставание PPO, возможно, снимается тонкой настройкой параметров политики (или функции ценности) и архитектур. Агент обучался 500 миллионов эпох; код в открытом доступе. Рисунок 4 суммирует результаты.

Рисунок 4
Рисунок 4. Левая панель: политика, выученная агентом PPO. Правая: сравнение PPO с (i) приближённым решением в замкнутой форме и (ii) схемой Эйлера для исходной задачи.

На левой панели выученная политика PPO имеет сходства с левой панелью рисунка 1: порядок линий, уровень, направление. Правая панель — средняя награда по ходу обучения (всего 500 миллионов эпох). И приближённое решение в замкнутой форме, и схема Эйлера лежат выше среднего наблюдаемого результата PPO.

5. Заключение

Рассмотрена модель, в которой маркетмейкер выставляет котировки, максимизируя торговую выручку и минимизируя инвентарный риск, в присутствии конкурентов, которые подстраивают котировки под исполненные ими заявки. Заявки, не исполненные референсным, исполняют конкуренты. Референсный балансирует управление своим инвентарём и инвентарём конкурентов. Выведены оптимальные котировки в форме обратной связи; методом, вдохновлённым Guéant et al. (2013), найдено приближённое решение в замкнутой форме. Численно сопоставлены истинное решение, приближение и современное обучение с подкреплением.

Сноски

  1. Есть и другие постановки задачи маркетмейкинга; см. Guilbaud and Pham (2013); Kühn and Muhle-Karbe (2015); Lu and Abergel (2018); Chávez-Casillas et al. (2024).
  2. Эффект пропущенных marketable limit orders изучался в Cartea et al. (2021) со стороны тейкера.
  3. Работы о других маркетмейкерах (но не для лимитных заявок): Herdegen et al. (2023) — конкуренция за рыночные заявки в одношаговом равновесии Нэша в игре Штакельберга; Luo and Zheng (2021) — теоретические свойства, включая существование и единственность равновесий Нэша, в непрерывной стохастической дифференциальной игре с неполной информацией.
  4. Алгоритм PPO введён в Schulman et al. (2017).
  5. Код: github.com/leandro-sbetancourt/mm-pooled-competition и gym-mm-pooled-competition. Основа — среда gym mbt_gym Jerome et al. (2023).

Литература

Оригинал статьи: Boyce, Herdegen and Sánchez-Betancourt, «Market Making with Exogenous Competition», arXiv:2407.17393 · лицензия CC BY 4.0