К мультиагентному RL-симулятору OTC-рынков

6.5/10

Nelson Vadori (corresponding author), Leo Ardon, Sumitra Ganesh, Thomas Spooner, Selim Amrouni, Jared Vann, Mengda Xu, Tucker Balch, Manuela Veloso · J.P. Morgan AI Research · Zeyu Zheng · University of Michigan and J.P. Morgan AI Research · ревизия 1 августа 2023

Оригинал: Vadori, N., Ardon, L., Ganesh, S., Spooner, T., Amrouni, S., Vann, J., Xu, M., Zheng, Z., Balch, T. and Veloso, M. «Towards Multi-Agent Reinforcement Learning driven Over-The-Counter Market Simulations», v2 — arxiv.org/abs/2210.07184 (PDF).

Рис. 1–20 воспроизведены из оригинальной публикации. Доказательства теорем, алгоритмические детали и дополнительные эксперименты — в приложении PDF.

Ключевые слова: multi-agent reinforcement learning, over-the-counter markets, market making, calibration, shared policy.

Классификация arXiv: cs.MA

Аннотация

Мы изучаем игру между агентами-поставщиками ликвидности (LP) и агентами-потребителями ликвидности (LT), взаимодействующими на OTC-рынке; типичный пример — валютный рынок (FX). Показываем, что подходящий дизайн параметризованных семейств функций награды в сочетании с обучением shared policy — эффективное решение. Играя друг против друга, агенты на базе глубокого RL вырабатывают эмерджентное поведение относительно широкого спектра целей: P&L, оптимальное исполнение и доля рынка. В частности, LP естественным образом учатся балансировать хеджирование и skewing — асимметричное выставление bid и ask как функцию инвентаря.

Дополнительно вводим новый RL-алгоритм калибровки, хорошо справляющийся с наложением ограничений на равновесие игры. На теоретической стороне доказываем скорости сходимости для мультиагентного policy gradient при предположении транзитивности, близком к обобщённым порядковым потенциальным играм.

1. Введение

Контекст рынка

Фокус — дилерский рынок (OTC), где торгуется одна ценная бумага. Примеры: валютный рынок — крупнейший финансовый рынок в мире; безопасность можно мыслить как евродоллар. В отличие от типичных акций, торговля между участниками не происходит на единой централизованной бирже: рынок децентрализован — агент торгует через приватное подключение к дилеру или через агрегатор ликвидности (Oomen 2017). Природа взаимодействий делает рынок частично наблюдаемым. Агенты также имеют доступ к ECN (Electronic Communication Networks) — референсная цена и площадка для срочной торговли при хеджировании. Для евродоллара пример ECN — EBS с tick size 0,5 bp. Обзор FX: Schrimpf and Sushko (2019a,b).

Агенты рынка

Участников можно разделить на Liquidity Providers (LP) — маркетмейкеры, транслирующие цены LT; и Liquidity Takers (LT), торгующих с LP по спекулятивным или экзогенным мотивам. Задача LP — управлять net inventory после сделок с LT: через skewing (асимметричная корректировка bid/ask, internalization) или externalization на ECN. Литература часто фокусируется на risk-penalized P&L, но LP также преследуют market share — долю суммарного LT-потока, нетривиально оцениваемую из-за частичной наблюдаемости OTC.

Схематично LP и LT максимизируют компромисс между risk-penalized P&L и чисто объёмной целью. В работе захватываем для каждого класса спектр таких целей.

Рисунок 1
Рисунок 1. Обзор симулятора. Разные цвета — разные цели агентов: компромисс между risk-penalized P&L, market share и целевым объёмом. Частичная структура связности.

Цель и desiderata

Цель — OTC-симуляция как формальная $n$-player partially observable general sum Markov game между LP, LT и ECN, где все агенты обучают оптимальные политики, играя друг против друга (MARL). Симуляция позволяет изучать what-if сценарии: влияние risk aversion конкурентов на market share, изменение связности. Это отличается от stochastic optimal control для одного LP (Guéant 2017; Barzykin et al. 2021, 2023), где остальной рынок — статистическая сущность «rest of the world».

Центральный вопрос — как задать характеристики агентов, включая utility functions. Мы можем знать flow response curve LP или средний market share — тогда нужно подобрать гиперпараметры симулятора. Вводим новый RL-подход к калибровке.

Игра близка к Bank et al. (2021). Desiderata:

  1. Desiderata 1. Учёт графа связности между агентами.
  2. Desiderata 2. Спектр целей реальных дилерских рынков.
  3. Desiderata 3. Обучение из правил игры и экспериментирования.
  4. Desiderata 4. Калибровка под наблюдения конкретных агентов.

Desiderata 2: цели LP — от P&L до market share; LT — от P&L до заданного объёма. Supertype-design эффективно обучает политики под эти компромиссы, включая optimal execution. Desiderata 3: политики возникают из игры. Desiderata 4: ограничения на эмерджентное поведение через баланс типов — нетривиально совместить с оптимальностью политик.

Наши вклады

  1. Формализация игры LP–LT через типы и супертипы (разд. 2.1); RL-обучение политик под спектр целей (разд. 2.2).
  2. ECN на LOB с continuous-time limit и нейросетевой non-Markov экстензией (разд. 2.3).
  3. Shared equilibrium, скорости сходимости policy gradient; potential-Hamiltonian decomposition (разд. 3).
  4. RL-алгоритм калибровки CALSHEQ (разд. 4–5).
  5. Эмерджентный баланс hedging/skewing у LP.

Связанные работы

Market making: Garman (1976), Amihud and Mendelson (1980), Ho and Stoll (1981), Avellaneda and Stoikov (2008), Guéant et al. (2013); adverse selection — Glosten and Milgrom (1985). Дилерские рынки: Guéant (2017), Bank et al. (2021), Barzykin et al. (2021, 2023). RL на LOB: Chan and Shelton (2001), Spooner et al. (2018); конкуренция — Cont and Xiong (2022); близкие MARL-работы — Ganesh et al. (2019), Ardon et al. (2021).

MARL: нет гарантий Nash в general sum partially observable Markov games с непрерывными пространствами. Markov potential games (Leonardos et al. 2021); мы — generalized ordinal potential games (Monderer and Shapley 1996). Parameter sharing (Gupta et al. 2017; Foerster et al. 2016), CTDE; PPO с 60–90 CPU (Yu et al. 2021). Калибровка ABM: Avegliano and Sichman (2019), Lamperti et al. (2018); наш dual-RL calibrator.

2. Мультиагентная модель симуляции на супертипах

2.1. Типы и супертипы агентов

Partially Observable Markov Game. Класс агента $\kappa \in \{\mathrm{LP}, \mathrm{LT}\}$. Игра среди $n_{\mathrm{LP}}$ LP и $n_{\mathrm{LT}}$ LT на горизонте $T$; $n_{\mathrm{tot}} = n_{\mathrm{LP}} + n_{\mathrm{LT}}$, $n_{\mathrm{ECN}}$ — число ECN. Связность задаётся входным графом: два элемента взаимодействуют только если связаны; агенты одного класса всегда отключены друг от друга. Время дискретизовано (шаг, например, 1 с) для совместимости с RL. Симуляция траектории — episode; агрегированная utility — cumulative reward.

На каждом $t \in [0,T]$: LP транслируют bid/ask и долю инвентаря для хеджа на ECN; LT выбирают размер и направление сделки; исполнение — по лучшей цене среди связанных LP и ECN. Это multi-stage (Stackelberg) игра: LT играют в ответ на LP. Формализация — $n$-player partially observable Markov game (Hansen et al. 2004).

Типы и супертипы. Внутри класса агенты различаются utility (reward). Agent type $\lambda_i^\kappa$ включает risk aversion, trade-off между P&L, market share и целевым объёмом, связность. Типы — параметризованное семейство reward functions. Supertype $\Lambda_i^\kappa$ — параметры распределения типов; типы семплируются в начале episode и фиксируются. Это позволяет масштабировать симуляцию и добавлять шум, помогающий сходимости (Hambly et al. 2021).

Формально: каждому агенту $i$ присвоен supertype $\Lambda_i^\kappa \in \mathcal{S}_{\Lambda_i^\kappa}$; в начале episode $\lambda_i^\kappa \sim p_{\Lambda_i^\kappa}$; начальные состояния $s_0^{(i,\kappa)} \sim \mu_0^{\lambda_i^\kappa}$. Reward $R^\kappa$ и transition kernel $T$ удовлетворяют Assumption 2.1 (Type symmetry): инвариантность к перестановкам аргументов — ожидаемая награда зависит только от supertype при фиксированных политиках.

Горизонт $T$ детерминирован и конечен — политики time-dependent; время включается в состояние. Расширение на случайный $T$ (episodic) или $T=+\infty$ с discount $\zeta < 1$ — прямолинейно.

2.2. Эффективное обучение спектра поведений через RL

2.2.1. Shared policy, conditioned on agent type

При одинаковых action/state spaces эффективно использовать одну shared policy $\pi$ на всех агентов (Foerster et al. 2016; Gupta et al. 2017) — парадигма CTDE. Два класса — две shared policies. Тип $\lambda_i^\kappa$ включается в локальное состояние:

\[ \pi^\kappa(da \mid s, \lambda) := P\!\left(a_t^{(i,\kappa)} \in da \mid s_t^{(i,\kappa)} = s,\, \lambda_i^\kappa = \lambda\right), \quad \pi^\kappa \in \mathcal{X}^\kappa. \]

Из-за partial observability оптимальные действия зависят от истории private states; на практике историю кодирует LSTM (Gupta et al. 2017). Ожидаемая награда агента $i$:

\[ V_{\Lambda_i^\kappa}(\pi^{\mathrm{LP}}, \pi^{\mathrm{LT}}) := \mathbb{E}\left[\sum_{t=0}^{T} \zeta^t R^\kappa(\cdot)\right], \]

где $\zeta \in [0,1]$ — discount. Цель — Nash equilibria; эмпирическая сходимость через RL (разд. 3.2, 5). При фиксированной $\pi^{\mathrm{LT}}$ анализируем equilibria LP с shared policy (разд. 3.1). Агенты не знают supertype profile $\Lambda$ (в отличие от Bayesian games с common knowledge type prior).

2.2.2. RL-дизайн OTC-агентов

Далее $n_{\mathrm{ECN}}=1$; $P_t$ — mid-price ECN. Utility LP и LT — компромисс risk-penalized P&L и объёмной компоненты (market share для LP; trade targets для LT).

P&L агента. Декомпозиция:

\[ \mathrm{PnL}_t = \mathrm{PnL}^{\mathrm{inv}}_t + \mathrm{PnL}^{\mathrm{spread}}_t + \ell(q_t), \]

где $\mathrm{PnL}^{\mathrm{inv}}_t = \sum_{i=1}^{t} q_i(P_i - P_{i-1})$, spread P&L — локальная прибыль сделок относительно mid; $\ell(q_t)$ — terminal inventory penalty (здесь $\ell \equiv 0$). Сделки LP–LT на OTC — market orders: LP транслируют price curves (bid/ask как функция объёма).

Liquidity Provider. Market share $m_t^i$ — доля LT-объёма, привлечённого LP $i$; running average $\bar{m}_t$. Target $m^{\mathrm{target}}$ (здесь $=1$). Reward:

\[ R^{\mathrm{LP}}_{t+1} := \omega \cdot \eta \cdot \Delta \mathrm{PnL}^{\gamma}_{t+1} - (1-\omega) \cdot \Delta M_{t+1}(m^{\mathrm{target}}), \] \[ \mathrm{PnL}^{\gamma}_t := \mathrm{PnL}_t - \gamma \sum_{k=1}^{t} |\Delta \mathrm{PnL}^{\mathrm{inv}}_k|, \quad \eta > 0,\; \omega \in [0,1]. \]

$\gamma$ — risk aversion (L1-penalty на inventory P&L variation). LP строит цены от референса ECN:

\[ P_t^a(q) = P_t + x_t(q) + \tfrac{1}{2}\epsilon_{t,\mathrm{spread}}\, x_t + \epsilon_{t,\mathrm{skew}}\, x_t, \quad P_t^b(q) = P_t - x_t(q) - \tfrac{1}{2}\epsilon_{t,\mathrm{spread}}\, x_t + \epsilon_{t,\mathrm{skew}}\, x_t. \]

$\epsilon_{t,\mathrm{spread}} \geq -1$ — симметричный spread tweak; $\epsilon_{t,\mathrm{skew}} \in \mathbb{R}$ — skewing/internalization. Действия LP: $(\epsilon_{t,\mathrm{spread}}, \epsilon_{t,\mathrm{skew}}, \epsilon_{t,\mathrm{hedge}})$, где hedge fraction $\epsilon_{t,\mathrm{hedge}} \in [0,1]$ — market order на ECN. Состояния: $P_t$, $q_t$, $T_t$, $\bar{m}_t$, ликвидность top-$m$ уровней ECN, cost of hedging. Тип: $(\gamma, \eta, \omega, m^{\mathrm{target}})$ и доли связанных LT supertypes.

Liquidity Taker. LT выбирает buy/sell $q^{\mathrm{LT}}$ или no trade $\{1,-1,0\}$. Reward:

\[ R^{\mathrm{LT}}_{t+1} := \omega \cdot \eta \cdot \Delta \mathrm{PnL}^{\gamma}_{t+1} - (1-\omega) \cdot \Delta Q_{t+1}(q^a, q^b), \] \[ Q_{t+1}(q^a, q^b) := \tfrac{1}{2}\sum_{j \in \{a,b\}} |\bar{q}_t^j - q^j|, \quad \bar{q}_t^j = \tfrac{1}{t+1}\sum_{k=0}^{t} \mathbf{1}_{\{a_k = j\}}. \]

При $0 < \omega < 1$ и высоком $\eta$ — optimal execution: достичь $(q^a, q^b)$ при максимизации P&L. LT с $\omega=0$ — flow LTs; с $\omega=1$ — PnL LTs.

Рисунок 2
Рисунок 2. Спектр выученных действий shared LT policy $\pi^{\mathrm{LT}}$ как функция P&L weight $\omega$ (0, 0.25, 0.75, 1). Mid-price (синий), покупки (зелёный), продажи (оранжевый). Цели $q^a=25\%$, $q^b=75\%$. Переход от точного достижения объёмных целей к максимизации P&L.
Рисунок 3
Рисунок 3. Flow response curve $\epsilon o F(\epsilon)$. Влияние роста числа PnL LT ($\omega=1$) на поток LP (0, 1, 3, 4 PnL LT). Синий — flow LT; оранжевый — PnL LT. Кривые нормированы на число агентов класса.
Таблица 1. Сводка RL-формулировки агентов.
КлассLPLT
Состояния $s_t$$P_t$, $q_t$, $T_t$, $\bar{m}_t$, ликвидность ECN, cost of hedging$P_t$, $q_t$, $T_t$, $\bar{q}_t^a$, $\bar{q}_t^b$, cost of trading $q^{\mathrm{LT}}$
Тип $\lambda$$\gamma, \eta, \omega, m^{\mathrm{target}}$, доли LT supertypes$\gamma, \eta, \omega, q^a, q^b, q^{\mathrm{LT}}$, доли LP supertypes
Действия $a_t$$\epsilon_{\mathrm{spread}}$, $\epsilon_{\mathrm{skew}}$, $\epsilon_{\mathrm{hedge}}$$\{1,-1,0\}$
Reward $R_{t+1}$$\omega \eta \Delta \mathrm{PnL}^\gamma - (1-\omega)\Delta M$$\omega \eta \Delta \mathrm{PnL}^\gamma - (1-\omega)\Delta Q$

2.3. Модель ECN

2.3.1. Базовая (vanilla) модель

ECN — референсная цена и площадка хеджа. LOB эволюционирует от заявок LP, LT и ECN-агента. ECN-агент строит список market/limit/cancel orders по модели (7)–(8); LOB не следует этим уравнениям напрямую — только от реальных заявок.

Фиксированная price grid с tick $\xi$ (для EBS eurodollar $\xi = 0{,}5$ bp). Snapshot LOB — пары векторов объёмов на bid/ask. Калибровка на level-2 data (top $m=5$ уровней); экстраполяция дальних уровней $e^{-\alpha k}$.

Вектор $S_{n+1}$ размерности $2m+2$: относительные изменения объёмов $(\delta_{i,n})$, spread и mid-price change (в тиках):

\[ S_{n+1} := \big((\delta_{i,n})_{i \in [1,2m]},\; \xi^{-1}(P_{n+1}^a - P_{n+1}^b),\; \xi^{-1}(P_{n+1} - P_n)\big). \]

Динамика объёма на уровне $i$:

\[ \Delta V_{i,n} = V_{i,n+1} - V_{i,n} = -\delta_{i,n}^- V_{i,n} + \delta_{i,n}^+, \quad \delta_{i,n}^+ := \max(\delta_{i,n},0),\; \delta_{i,n}^- := \max(-\delta_{i,n},0) \in [0,1]. \]

Гибридная multiplicative-absolute формулировка обеспечивает стабильность: $\lim_{n \to \infty} \mathbb{E}[V_{i,n}] < +\infty$.

Рисунок 4
Рисунок 4. Пример эволюции ECN LOB по динамике (7)–(8) без заявок LP/LT. Top 5 ask (красный), bid (синий); зелёные — экстраполированные уровни. Объёмы не vanish и не explode.

Theorem 2.2. Continuous-time limit динамики (8) — multivariate Ornstein–Uhlenbeck с квадратичной covariance structure $Q(V^*_t - \mu^\infty)$, обобщающей Cont and Müller (2021) (случай $\sigma^+ = 0$). Proposition 2.3 — long-range mean $\mu_i^\infty = \mu_i^+ / \mu_i^-$. Corollary 2.4 — univariate OU с $Q(x) = \sigma_\infty^2 + \sigma_-^2 x^2 + 2\sigma_-(\sigma_- \mu^\infty - \rho \sigma_+) x$. Proposition 2.6 — self-exciting/self-inhibiting regimes в зависимости от $(\sigma_\pm, \mu_\pm, \rho)$. Доказательства — приложение PDF.

2.3.2. Нейросетевая экстензия

Недостаток vanilla: snapshot variations $S_t$ независимы и i.i.d. Нейросетевая экстензия (Ha and Schmidhuber 2018): LSTM кодирует историю $(S_j)_{j \in [t-k+1,t]}$ ($k=20$) в latent 32; конкатенация с $S_t$ и MDN выдаёт параметры Gaussian mixture ($n_{\mathrm{mix}}=5$ компонент): weights, means, variances, correlations.

Рисунок 5
Рисунок 5. Архитектура Neural ECN: LSTM + fully connected → параметры multivariate Gaussian mixture для 12-мерного $S_t$. Hidden layers width 64.
Таблица 2. Log-likelihood ECN-моделей (LOBSTER INTC, Jan 28 2015).
МодельTrainValidationTest
Vanilla8.896.238.94
Neural w/ fixed correlation18.3215.7915.64
Neural w/ shared correlation23.4021.9021.63

3. Игровой анализ и свойства сходимости

3.1. Shared equilibria: сходимость shared-policy learning при стационарных LT

LT не обучаются: $\pi^{\mathrm{LT}}$ фиксирована — часть среды. LP разных типов обучаются под shared policy. Аналогия: шахматы — алгоритм должен быть хорош и за белых, и за чёрных.

Shared policy gradient (Gupta et al. 2017):

\[ \nabla^{\mathrm{shared}}_{\theta,B} = \frac{1}{n_{\mathrm{LP}}} \sum_{i=1}^{n_{\mathrm{LP}}} g_i^B. \]

Proposition 3.1. $\nabla^{\mathrm{shared}}_{\theta,\infty} = \nabla_1 \widehat{V}(\pi_\theta, \pi_\theta)$, где $\widehat{V}(\pi_1, \pi_2) := \mathbb{E}_{\alpha \sim U[1,n_{\mathrm{LP}}]}[\widetilde{V}_{\Lambda_\alpha^{\mathrm{LP}}}(\pi_1, \pi_2)]$ — utility случайно выбранного агента, улучшающего политику при фиксированных остальных.

Definition 3.3 (Shared Equilibrium). Shared (resp. $\epsilon$-shared) equilibrium $\pi^*$ — symmetric Nash (resp. $\epsilon$-Nash) на pure strategy space $\mathcal{X}^{\mathrm{LP}}$ с payoff $\widehat{V}$ — Functional Form Game (Balduzzi et al. 2019). Self-play по (11) — механизм policy sharing.

При $\Lambda_i^{\mathrm{LP}} := \lambda_i^{\mathrm{LP}} := i$ shared equilibria совпадают с Nash underlying game. При общих supertypes — symmetric Bayesian Nash equilibria. Parameter sharing интерполирует $\pi(\cdot \mid \cdot, \lambda)$ по типу через generalization нейросети.

Assumption 3.4 (Extended transitivity). Существует bounded $\Phi: \mathcal{S} \to \mathbb{R}$: если $u(y,x) - u(x,x) > \epsilon$, то $\Phi(y) - \Phi(x) > \delta_\epsilon$. Связь с generalized ordinal potential games (Monderer and Shapley 1996). Theorem 3.7: при extended transitivity существует $\epsilon$-shared equilibrium, достижимое за конечное число self-play шагов; при конечных spaces — exact shared equilibrium.

Theorem 3.9. Projected Gradient Ascent с direct parametrization: число итераций $N = O\!\left(\frac{\mathrm{diam}(\Phi)}{\phi}\cdot \frac{D_\epsilon^2 |S^{\mathrm{LP}}||S^{\lambda^{\mathrm{LP}}}|}{\alpha(2-\alpha\beta) \cdot \epsilon^2}\right)$ для $\epsilon$-shared equilibrium. Theorems 3.13, 3.14 — softmax + log-barrier при multiplicative noise; сходимость с высокой вероятностью при большом $K = |S^{\mathrm{LP}}||S^{\lambda^{\mathrm{LP}}}||A^{\mathrm{LP}}|$. Доказательства — PDF.

3.2. Эмпирический анализ компонент игры

Differentiable games (Letcher et al. 2019): game gradient $G = (\nabla_{\theta_i} V_i)$, Jacobian $J_{ij} = \nabla^2_{\theta_i,\theta_j} V_i$. Декомпозиция $J = S^* + A^*$ — potential vs Hamiltonian. Definition 3.17: Hamiltonian weight $\omega^A(\theta) = \|A^{eT} G\| / (\|A^{eT} G\| + \|S^e G\|)$; potential weight $\omega^S = 1 - \omega^A$. Self-interactions исключены из $S$ для fair comparison.

Рисунок 6
Рисунок 6. (Слева) Hamiltonian component $\omega^A$: 1 LP vs 1 LT (1v1) и 2 LP vs 1 LT (2v1). Конкуренция LP–LP во 2v1 снижает $\omega^A$ LP–LT — конкуренция провайдеров выгодна клиенту. (Справа) 1 LP vs PnL LT ($\omega=1$) vs flow LT ($\omega=0$): при flow LT $\omega^S pprox 0$ — нет общего «skill».

4. Калибровка супертипов к целевым равновесиям

Калибровка — подбор supertype profile $\Lambda := (\Lambda^{\mathrm{LP}}, \Lambda^{\mathrm{LT}})$ под внешние targets на shared equilibrium. Baseline — Bayesian optimization (BO): surrogate GP, но большие скачки $\Lambda$ мешают shared policy адаптироваться; BO замедляется из-за роста covariance matrix.

CALSHEQ (Algorithm 1): RL calibrator agent выбирает increments $\delta\Lambda$; обучается на slower timescale ($\alpha_n^{\mathrm{cal}} = o(\alpha_n^{\mathrm{shared}})$) — two-timescale SA (Borkar 1997). Reward calibrator:

\[ r_{\mathrm{cal}} = \sum_{k=1}^{K} w_k\, \ell_k^{-1}\!\left(f_*^{(k)} - f_{\mathrm{cal}}^{(k)}((z_t)_{t \geq 0})\right). \]

Objective: $V^{\mathrm{calib}}(\pi_n, \pi_n^\Lambda) := \mathbb{E}[r_{\mathrm{cal}}]$. Updates (22)–(23) для shared policy и calibrator. Theorem 4.7: при assumptions 4.1–4.6 iterates сходятся a.s. к $(f_{\mathrm{eq}}(\theta^{*\Lambda}), \theta^{*\Lambda})$. Extended transitivity calibrator game (Assumption 4.3) заменяет global asymptotic stability ODE. Детали assumptions и proof — PDF.

5. Эксперименты

Shared LP, LT и calibrator policies — PPO (clip 0.3, KL target 0.01, lr $10^{-4}$). Episodes $T=100$, $B=60$ parallel runs, batch $n_{\mathrm{agents}} \cdot T \cdot B$. FC net 2×256, tanh. Discount $\zeta=1$. RLlib на AWS C5.24xlarge (96 CPU), ~0.5 day/experiment.

5.1. Калибровка

Setup. Стационарные LT: buy/sell с равной вероятностью ($\omega=0$, $q^a=q^b=0.5$). 500 LT в 10 supertypes ($q^{\mathrm{LT}}=i$). LP: $\omega=1$, 2 supertypes, 5–10 LP, 20–23 параметра калибровки. Targets: market share supertype 1, percentiles распределения per-trade quantity (9 percentiles × supertypes). BO baseline: $M=100$ policy iterations между BO steps, UCB $\kappa=0.5$, Matérn kernel.

Рисунок 7
Рисунок 7. Cumulative rewards при калибровке (experiments 1–4): calibrator (верх), LP supertypes 1/2 (середина/низ). CALSHEQ vs BO. CALSHEQ сходится плавнее; в exp. 4 BO даёт отрицательный reward supertype 1.
Рисунок 8
Рисунок 8. Experiment 1: fit percentiles trade quantity distribution и market share. CALSHEQ точнее и плавнее BO.

CALSHEQ превосходит BO по: (1) calibrator reward — плавнее и быстрее; (2) LP rewards не diverge; (3) плавная эволюция $\Lambda$ (fig. 29–32 в PDF). Ablation (fig. 25 в PDF): CALSHEQ_no_state (без state, прямой sample $\Lambda$) существенно хуже.

5.2. Эмерджентное поведение агентов

Обучаем $\pi^{\mathrm{LT}}$ и $\pi^{\mathrm{LP}}$; варьируем атрибуты первого LP: connectivity к flow/PnL LT, P&L weight, risk aversion $\gamma \in [0,2]$. Base: 2 LP supertypes ($\gamma=0.5$, 1 и 2 агента); 12 flow LT + 2 PnL LT; fully connected.

Метрики после 100 episodes на фиксированном типе. Flow response $F(\epsilon)$ — средний поток при цене $\epsilon$. Skewing intensity — slope регрессии $\epsilon_{t,\mathrm{skew}} = f(q_t)$.

Рисунок 9
Рисунок 9. Средний $|q_t|$ LP как функция risk aversion — убывает с ростом $\gamma$.
Рисунок 10
Рисунок 10. Skew $\epsilon_{t,\mathrm{skew}}$ vs inventory при разной flow LT connectivity. Больше связность — интенсивнее skewing (отрицательнее slope).
Рисунок 11
Рисунок 11. Skew intensity vs flow/PnL LT connectivity, P&L weight, risk aversion.
Рисунок 12
Рисунок 12. Hedge fraction $\epsilon_{\mathrm{hedge}}$ vs connectivity, P&L weight, risk aversion. Растёт с risk aversion и PnL LT connectivity.
Рисунок 13
Рисунок 13. Mean inventory holding time vs connectivity, P&L weight, risk aversion.
Рисунок 14
Рисунок 14. Inventory holding time vs inventory для разных connectivity/weights/risk aversion.
Рисунок 15
Рисунок 15. Средняя цена $\epsilon_{t,lpha}$ — competitiveness pricing.
Рисунок 16
Рисунок 16. Flow от PnL LT (оранж.) и flow LT (син.) vs connectivity и weights.
Рисунок 17
Рисунок 17. Market share vs connectivity, P&L weight, risk aversion.
Рисунок 18
Рисунок 18. PnL vs connectivity, P&L weight, risk aversion.
Рисунок 19
Рисунок 19. LP cumulative reward при обучении: shared policy и supertypes 1/2.
Рисунок 20
Рисунок 20. LT cumulative reward при обучении: shared policy и supertypes 1/2.

Skewing. Больше flow LT connectivity → интенсивнее skewing (fig. 10–11): flow LT дают постоянный поток ликвидности. Выше risk aversion → интенсивнее skewing и ниже $|q_t|$ (fig. 9). Выше P&L weight → слабее skewing (cost P&L). Больше PnL LT connectivity → интенсивнее skewing (аналог risk aversion через inventory P&L penalty).

Hedging. Hedge fraction растёт с risk aversion и PnL LT connectivity; падает с P&L weight и flow LT connectivity (fig. 12) — internalization через skewing дешевле.

Pricing. Выше P&L weight или PnL LT connectivity → менее competitive pricing (fig. 15). Больше flow LT connectivity → competitive pricing (больше revenue).

Inventory holding time. Растёт с P&L weight; падает с risk aversion и flow LT connectivity (fig. 13–14).

Flow, market share, P&L. PnL LT flow падает резче при росте P&L weight (fig. 16). Market share и P&L — fig. 17–18: trade-off P&L vs market share при variation $\omega$.

6. Заключение

Формализовали взаимодействия LP и LT на дилерском рынке как multi-stage, multi-type stochastic game. Показали, что параметризованные семейства reward + shared policy learning позволяют RL-агентам вырабатывать эмерджентное поведение под спектр целей (P&L, optimal execution, market share). LP естественно балансируют hedging и skewing. Введён RL-алгоритм калибровки CALSHEQ, эффективно накладывающий ограничения на равновесие. Теоретически — скорости сходимости multi-agent policy gradient при extended transitivity, связанной с generalized ordinal potential games.

Благодарности. Arnaud Floesser, Cathy Lin, Chi Nzelu и FX ATS team, J.P. Morgan CIB.

Disclaimer. Документ подготовлен J.P. Morgan AI Research для информационных целей, не является investment research/advice.

Литература

Оригинал статьи: Vadori et al., «Towards Multi-Agent Reinforcement Learning driven Over-The-Counter Market Simulations», arXiv:2210.07184