Обучение не спуфить

8.5/10

David Byrd · Bowdoin College, United States · d.byrd@bowdoin.edu

9 июня 2023 · arXiv v1 · ACM ICAIF'22, 2–4 ноября 2022, New York, NY

Оригинал: Byrd, D. «Learning Not to Spoof» — arxiv.org/abs/2306.06087 (PDF, 9 стр.) · ACM ICAIF'22 · DOI: 10.1145/3533271.3561767

Исследование поддержано NSF Grant No. 1741026 и JP Morgan Fellowship. Рис. 1–4 воспроизведены из оригинальной публикации. Симулятор рынка: ABIDES (Byrd et al., 2020).

Ключевые слова: multi-agent, market, reinforcement, learning, spoofing, normative, alignment.

Классификация arXiv: cs.LG

Аннотация

По мере распространения интеллектуальных торговых агентов на основе reinforcement learning (RL) всё важнее гарантировать, что RL-агенты соблюдают законы, регуляции и ожидания человеческого поведения. Существует обширная литература об избежании очевидных катастроф вроде крушения вертолёта или банкротства торгового счёта, но мало работ о предотвращении тонкого ненормативного поведения, для которого есть примеры, но нет программируемого определения. Такое поведение может нарушать правовые или регуляторные, а не физические или денежные ограничения.

В статье рассматривается серия экспериментов, в которых интеллектуальный агент торговли акциями максимизирует прибыль, но может непреднамеренно научиться спуфить рынок, на котором участвует. Сначала в мультиагентную симуляцию рынка внедряется захардкоженный спуфер, и на его следах обучается распознаватель последовательностей спуфинга. Затем спуфер заменяется простым RL-агентом, максимизирующим прибыль, — и тот самостоятельно открывает спуфинг как оптимальную стратегию. Наконец, распознаватель подключается как нормативный ориентир: он формирует воспринимаемую агентом награду и меняет выбираемые действия. Агент остаётся прибыльным, но избегает спуфинга, который дал бы ещё большую прибыль. После эмпирических результатов автор формулирует рекомендации. Метод обобщается на подавление любого нежелательного поведения, для которого можно обучить распознаватель.

1. Введение и связанные работы

Сложность современных финансовых RL-агентов такова, что по отдельности безобидные действия могут приводить к неожиданно вредным последствиям, и такие режимы отказа трудно обнаружить или предотвратить. Можно представить практика, желающего зарабатывать на автономном торговом агенте, но осознающего, что неконтролируемые цели (например, «произвести как можно больше скрепок») представляют риск, требующий осмысленного управления, и стремящегося избежать конкретного ненормативного исхода [2]. Цель статьи — исследовать потенциал непреднамеренного спуфинга автономным торговым агентом и представить, по мнению автора, первый метод активного подавления такого поведения в процессе обучения.

1.1. Reinforcement Learning

Markov Decision Problem (MDP) можно представить как конечный автомат, переходы в котором задаются распределением вероятностей, зависящим от действия агента [1]. После каждого действия агент получает числовую награду, которую стремится максимизировать в долгосрочной перспективе.

Reinforcement learning (RL) — совокупность подходов к решению MDP, когда определение задачи должно быть обнаружено через эксперименты со средой [20]. Model-free подходы к RL напрямую учат общую полезность выполнения определённого действия из конкретного состояния. Наиболее распространён — Q-learning: агенту нужна минимальная информация — на каждом шаге уникальный и согласованный идентификатор текущего состояния среды и каждого возможного действия [23]. Агент использует эту информацию, чтобы выучить оптимальное действие \(a\) для каждого состояния \(s\), оптимизируя Q-функцию:

\[ Q^\pi(s, a) = R_s(a) + \gamma \sum_{s'} P_{ss'}[ \pi(s) ] V^\pi(s') \tag{1} \]

которая представляет сумму немедленных и дисконтированных ожидаемых будущих наград от выполнения \(a\) в \(s\) с последующим следованием политике \(\pi\). \(R_s\) — функция награды для состояния \(s\), \(\gamma\) — пошаговый дисконт будущих наград, \(P_{ss'}[\pi(s)]\) — вероятность перехода из \(s\) в новое состояние \(s'\) при политике \(\pi\), а \(V\) — полезность или value достижения данного состояния.

1.2. Safe Reinforcement Learning

Safe RL стремится гарантировать, что агенты избегают катастрофических результатов, модифицируя награды или ограничивая исследование пространства состояние–действие. Например, функция награды торгового агента может штрафовать дисперсию доходности во времени, чтобы сдерживать чрезмерный риск, или двуногому роботу может быть запрещено исследовать движения конечностей, выводящие центр тяжести за точку опрокидывания. Garcia собрал множество таких подходов в обзоре [7].

Такие техники эффективны для агентов, избегающих немедленно измеримых последствий, но плохо подходят, когда режимы отказа:

Пример режима отказа, удовлетворяющего всем критериям, — алгоритмическое нарушение финансового регулирования. Многие регуляции ссылаются на intent, требуют интерпретации и ведут к санкциям спустя годы. Настоящая работа рассматривает именно этот сложный сценарий.

1.3. Normative Reinforcement Learning

Normative RL нацелен на паттерны активности, которые люди сочтут приемлемыми и уместными в ситуации, например соблюдение личного пространства. Значительное пересечение с Safe RL: нормативное поведение часто связано с безопасностью — автономный робот не должен сбивать человека, чтобы быстрее добраться до цели. Soares et al. формализовали проблему value alignment — для интеллектуального агента это обучение и действие согласно предпочтениям операторов [19]. Неформально можно представить, что к каждой цели неявно добавляется «не делая ничего плохого».

Формальный метод reward shaping представлен Ng et al. в 1999 году для ускорения обнаружения оптимальной политики модификацией сигнала награды дополнительной обратной связью [15]. В 2013 году Griffith et al. расширили это до policy shaping: агент пытается напрямую выучить обратную связь как отдельную политику, затем комбинирует две политики для принятия решений [8]. Эти техники широко применимы, но считаются основой normative RL; автор опирается на обе в своём подходе.

Normative RL изучался в навигации роботов: следование потоку пешеходов, долгосрочное прогнозирование путей велосипедистов, замедление на нерегулируемых перекрёстках, выбор члена группы для предложения помощи [16]. В narrative intelligence исследовали извлечение человеческих ценностей из историй и индукцию желаемых смесей goal-oriented и normative поведений в интерактивных игровых мирах [14, 18]. Из этой линии работ автор заимствует подход action reranking к policy shaping.

1.4. Спуфинг на финансовом рынке

Commodity Exchange Act (CEA), изменённый Dodd-Frank Act, запрещает «spoofing» — котирование с намерением отменить заявку до исполнения. В руководстве CFTC перечислены причины спуфинга [6]:

CFTC уточняет, что «reckless trading, practices, or conduct» не составляет нарушения «spoofing». Это может означать, что непреднамеренный спуфинг неконтролируемым интеллектуальным торговым агентом сейчас не является нарушением, но поскольку спуфинг классифицируется как «disruptive of fair and equitable trading», автор предлагает кодифицировать best practices для его избежания.

Доказательства широкого спуфинга с мотивом манипуляции ценой найдены в кастомном наборе данных Korea Exchange (KRX) [11]. Опрос CFA Institute 2015 года показал, что мошенничество на рынке и торговые практики — серьёзнейшая этическая проблема локального рынка для многих членов: 49% в Китае, 36% в Японии, 38% в UK и US. Обзор Putniņš (2012) суммирует, что теоретическая и эмпирическая экономическая литература находит спуфинг прибыльным, подразумевая вред другим трейдерам, у которых извлекаются избыточные прибыли [17]. Только в 2020 году CFTC подала и урегулировала 16 дел о спуфинге, включая рекордное соглашение на $920 млн [5].

1.5. Детекция спуфинга

Детекция спуфинга — общий интерес. Cao et al. описали две формы обманной электронной манипуляции ценой [4]. В spoofing trading иллюзия спроса создаётся относительно долгим удержанием крупной заявки на противоположной стороне стакана. В quote stuffing иллюзия торгов «на повышение» — последовательностью заявок внутри bid-ask spread. Авторы преобразуют исторические данные по четырём акциям в относительные ценовые смещения и инжектируют синтетические последовательности спуфинга. K-Nearest Neighbors и SVM детектируют последовательности с положительными результатами. Подход автора схож, но использует agent-based симуляцию всего рынка, чтобы другие трейдеры могли реагировать на спуфинг.

Leangarun et al. показали, что feedforward нейросеть с доступом только к Level 1 данным (исполненные сделки) может детектировать классический «pump and dump», но не спуфинг [10]. Mendonça et al. получили приватные данные бразильского брокера с консистентным (но анонимным) идентификатором каждого трейдера и нашли, что expert-designed decision tree может идентифицировать вероятное спуфинг-поведение на уровне брокерской фирмы [13]. Li et al. детектировали дни со спуфингом различными методами классификации на данных китайских регуляторов после публичных enforcement actions [12]. Wang et al. использовали GAN для обучения спуфинг-агента, избегающего детекции маскировкой активности под market making, и детектора, пытающегося победить это уклонение [22].

1.6. Непреднамеренный спуфинг

Предположим, ответственный практик финансового ML создаёт RL-агента торговли акциями: входное пространство — технические рыночные признаки и достаточное внутреннее состояние для Markov property; выходное — размещение или отмена заявок на покупку/продажу с различными смещениями от лучшей доступной цены. Практик надеется, что агент обнаружит прибыльную стратегию.

Развёртывание ML- и RL-торговых агентов создаёт потенциально новую вселенную регуляторных трудностей. Согласно руководству из раздела 1.4, для человека-трейдера непреднамеренный спуфинг кажется невозможным, но вполне правдоподобно, что интеллектуальный агент практика обнаружит спуфинг как оптимально прибыльную стратегию. Автор стремится помочь практику активно избежать этого исхода. Основные вклады:

2. Подход

Подход к избежанию обучения поведениям без программируемого определения (например, спуфинга) требует распознавателя поведения. Для обучения такого распознавателя нужны последовательности действий с метками «содержит/не содержит поведение». Хотя детекция спуфинга не является основным фокусом, это необходимая отправная точка. Обученный детектор ляжет в основу метода сдерживания непреднамеренного спуфинга RL-агентом.

2.1. Синтез данных о спуфинге

Спуфинг — поведение, опирающееся на последовательность, а не на отдельные действия. Из-за агрегированной и анонимной природы публичных рыночных данных нельзя проследить два ордера до одного актора — последовательности действий не идентифицируются. Чтобы обеспечить идентификацию релевантных последовательностей, все эксперименты выполняются в общей open source симуляции финансового рынка [3].

Сначала создаётся популяция стилизованных торговых агентов с различными жадными, но легальными стратегиями. Затем вводится специально спроектированный спуфинг-агент. Он наблюдает симулированный рынок для понимания текущих цен, затем покупает акции по «справедливой» цене:

\[ \mathbb{E}[p_e] \leq \min\left\{\frac{a^L_w + a^H_w}{2},\; p'_e\right\} \tag{2} \]

где \(\mathbb{E}[p_e]\) — ожидаемая цена входа в желаемую позицию, \(p'_e\) — предыдущая цена входа, \(a^L_w\) и \(a^H_w\) — соответственно наименьшая и наибольшая наблюдаемая лучшая ask-цена в warmup-периоде. У агента настраиваются объём и глубина спуфинг-ордеров; общая стратегия:

  1. Купить (или уже владеть) акциями ABC.
  2. Разместить limit bid по ABC чуть ниже текущего лучшего bid.
  3. Дождаться, пока другие трейдеры поднимут цену после наблюдения видимого спроса.
  4. Корректировать спуфинг-bid, оставаясь у лучшего bid, но не допуская исполнения.
  5. Продать позицию ABC и отменить спуфинг-ордера.

В каждый симулированный торговый день записывается каждое действие, связанное с ордерами: id агента, тип агента, timestamp, тип действия (order/cancel), направление (buy/sell), limit price относительно best bid/ask, quantity, метка спуфинга. После симуляции для каждого агента за каждый день реконструируется последовательность действий, затем делится на неперекрывающиеся подпоследовательности по 20 действий. В обучающих примерах сохраняются четыре признака: тип действия, направление ордера, относительная limit price, объём ордера. Примеры помечаются True, если они от спуфинг-агента не в «честном» режиме, и False иначе. Каждый обучающий пример имеет размерность (20, 4).

2.2. Детекция спуфинга

Временной элемент спуфинга означает, что перестановка тех же примитивов действий может сделать объяснение спуфингом вероятным или невозможным. Ниже \(M^+\) — market buy, \(L^+\) — limit buy ниже лучшего bid, \(C\) — отмена одного \(L^+\), \(M^-\) — market sell:

Пример. Спуфинг vs не спуфинг.
СпуфингНе спуфинг
\(M^+\), \(L^+\), \(L^+\), \(M^-\), \(C\), \(C\)\(L^+\), \(L^+\), \(C\), \(M^+\), \(C\), \(C\)

Это характеристика задачи распознавания активности (activity recognition) и необходимости метода, приписывающего значение временному порядку данных. Lara et al. представили обзор подходов с decision trees, instance-based learners и нейросетями [9]; Wang et al. — обзор с CNN, autoencoders и RNN [21]. Автор оценивает детекцию различными архитектурами нейросетей; обученный детектор — вещественная функция \(\Theta(a_0 : a_{19}) \to [0, 1]\).

2.3. Торговля с фиксированными политиками

Агент и среда валидируются проверкой возможности прибыли в описанном пространстве состояние–действие (раздел 2.4). Для этого используются две фиксированные политики: \(\pi_s\), пытающаяся заработать спуфингом симулированного рынка, и \(\pi_h\), пытающаяся заработать без спуфинга. Если обе прибыльны, это демонстрирует, что RL-агент с таким пространством мог бы научиться зарабатывать и со спуфингом, и честно.

Честная политика \(\pi_h(s) \to a\):

\[ \pi_h(s) = \begin{cases} \mathrm{AG} & \text{если } \neg H \land EA \land \neg OP \\ \mathrm{EX} & \text{если } H \land XA \land \neg OP \\ \mathrm{CN} & \text{если } OP \\ \mathrm{DN} & \text{иначе} \end{cases} \tag{3} \]

Спуфинг-политика \(\pi_s(s) \to a\):

\[ \pi_s(s) = \begin{cases} \mathrm{AG} & \text{если } \neg H \land EA \land \neg OP \\ \mathrm{PS} & \text{если } H \land \neg(XA \lor SL) \land \neg OP \\ \mathrm{EX} & \text{если } H \land (XA \lor SL) \\ \mathrm{CN} & \text{если } \neg H \land OP \\ \mathrm{UP} & \text{если } H \land \neg(XA \lor SL) \land DP \\ \mathrm{DN} & \text{иначе} \end{cases} \tag{4} \]

2.4. Торговля с нормативным выравниванием

Строится long-only торговый агент, взаимодействующий с симулированным рынком для оптимизации уравнения (1). Агент ограничен фиксированным количеством акций, чтобы не смешивать интеллектуальное поведение с простым leverage. Базовая функция награды включает реализованный gain/loss в долларах при закрытии позиции и небольшую транзакционную стоимость за каждый запрос на биржу.

Исследуются два метода exploration: \(\epsilon\)-greedy, где \(\epsilon \in [0, 1]\) контролирует долю случайных vs ожидаемо оптимальных действий; и Boltzmann (softmax), где действия стохастически выбираются из распределения Boltzmann [24]:

\[ P(a|s) = \frac{e^{Q_{sa}}}{\sum_j e^{Q_{sj}}} \tag{5} \]

Текущее состояние среды (включая агента) представлено набором булевых условий:

Пространство действий каждого экспериментального агента:

Для экспериментов с нормативным руководством через детектор \(\Theta(a_0 : a_{19})\) все ценовые и объёмные входы масштабируются согласно обучающим данным детектора. Последовательности действий продолжаются через торговые дни для одного агента; первые 20 суммарных действий каждого агента считаются нормативными.

Для reward shaping награда за закрытие прибыльной позиции трансформируется активацией детектора спуфинга:

\[ r' = r \times [1 - \Theta(a_0 : a_{19})] \tag{6} \]

Для action reranking вектор вероятностей действий из уравнения (5) трансформируется перед выбором. К каждому кандидату действия tentatively добавляется недавняя история; активация \(\Theta(a_0 : a_{19})\) «предложенной» истории оценивает контекстную нормативность каждого действия, затем обновляется вероятность выбора:

\[ P(a|s) = \frac{e^{Q_{sa} \cdot [1 - \Theta(a, a_0 : a_{18})]}}{\sum_j e^{Q_{sj} \cdot [1 - \Theta(j, a_0 : a_{18})]}} \tag{7} \]

3. Эксперименты и результаты

Последовательность экспериментов и их результаты представлены вместе для логической согласованности. Результаты ранних экспериментов влияют на дизайн последующих.

3.1. Начальная стратегия спуфинга

Для достижения цели «научиться не спуфить» сначала нужно убедиться, что спуфинг симулированного рынка возможен и прибылен. Создаётся популяция: 500 Zero Intelligence (ZI) агентов, подающих bid/offer из стохастического распределения вокруг частной extrinsic valuation; 500 Value-агентов, арбитражирующих текущую рыночную цену против частной valuation; и 10 Order Book Imbalance (OBI) агентов — HFT liquidity traders, прогнозирующих краткосрочные движения цены по стакану. Value и ZI случайно геолокированы, OBI имеют communication latency [21, 399] μs, экспериментальный агент всегда co-located с биржей с latency 33 ns. На рисунках Exper. — экспериментальный агент, OBI* — HFT-агент ближайший к бирже.

Эффективность спуфера и влияние на других агентов тестируются симуляцией 1160 полных торговых дней с различными конфигурациями гиперпараметров спуфинга. Одна конфигурация, обозначенная \(h\) на графиках, включает спуфинг-агента в «честном» режиме без манипулятивной части стратегии. Каждая спуфинг-конфигурация симулируется 20 дней; не-спуфинг — 200 дней. Влияние размера спуфинг-котировки на распределение прибыли каждого класса агентов — рис. 1. Выводы:

Стратегия прибыльна и даёт ожидаемые результаты — подходит для синтеза данных детектора спуфинга.

Влияние начального размера котировки спуфера
Рис. 1. Влияние начального размера котировки спуфинг-агента на прибыльность каждого класса агентов. Все глубины котировок.

3.2. Детектор спуфинга

Синтез данных из раздела 2.1 даёт несбалансированный размеченный набор размера (2 611 707, 20, 4) с 84 666 (≈3,2%) примерами последовательностей спуфинга. Примеры перемешаны и разделены на training (64%), validation (16%) и holdout test (20%) с сохранением баланса классов. Признаки action type и order direction конвертированы из boolean в 0–1 categorical; price и quantity нормализованы к \(\mathcal{N}(0, 1)\). Дисбаланс классов корректируется oversampling positive class.

Задача — activity recognition (раздел 2.2); сравниваются шесть архитектур, способных захватить временные паттерны: bidirectional и standard LSTM (Bi-LSTM, LSTM), bidirectional и standard GRU (Bi-GRU, GRU), CNN, свёртывающий по времени, и простая feed-forward сеть (FFNN). Каждая сеть: вход (20, 4), 64 hidden units, ReLU, dense layer с sigmoid и одним выходным нейроном; batch size 64, Adam, binary crossentropy.

Эмпирически тестируется каждая комбинация признаков (Direction, relative Price, Quantity, action Type) с каждой архитектурой при пятикратной cross-validation. Табл. 1 — ablation study на out-of-sample результатах Bi-LSTM как репрезентативной модели. Комбинации трёх–четырёх признаков не улучшают accuracy и опущены. Отчёт: false positives и negatives, precision, recall, Matthews Correlation Coefficient (MCC) для imbalanced binary classification. Action type и order direction по отдельности очень сильно коррелируют с ground truth. Финальные признаки — их комбинация с \(MCC = 0.997\).

Таблица 1. Ablation признаков детектора спуфинга.
ПризнакиFPFNPrecisionRecallMCC
D3,411180.8320.9990.909
P294,8167,0550.0190.5830.000
Q015,5371.0000.0820.283
T556180.9680.9990.983
DP3,247200.8390.9990.912
DQ3,699200.8240.9990.903
DT8840.9951.0000.997
PQ015,5111.0000.0840.285
PT567180.9680.9990.983
QT554250.9690.9990.983

Шесть архитектур из раздела 2.2 оцениваются на выбранной комбинации признаков: order direction и action type. Результаты — табл. 2. Даже простые архитектуры успешно решают задачу детекции в симулированном рынке — вероятно, потому что окно длины 20 включает время в каждый пример поведения. Финальный детектор — temporally-convolved CNN с признаками action type и order direction.

Таблица 2. Сравнение архитектур детектора спуфинга.
Feat.Arch.FPFNPrecisionRecallMCC
DTFFNN12560.9931.0000.996
CNN3610.9981.0000.999
GRU6900.9961.0000.998
LSTM9740.9941.0000.997
Bi-GRU3200.9981.0000.999
Bi-LSTM8840.9951.0000.997

3.3. Агенты с фиксированной политикой

Для осмысленности RL-экспериментов сначала оцениваются фиксированные политики \(\pi_s(s)\) и \(\pi_h(s)\) из раздела 2.3. Если обе прибыльны, RL-агент с аналогичным пространством мог бы зарабатывать со спуфингом или без. \(\pi_s(s)\) или \(\pi_h(s)\) заменяет начального спуфинг-агента; среда идентична разделу 3.1. Рис. 2 суммирует дневную прибыль каждой стратегии за 100 симулированных полных торговых дней. Quote size \(h\) — эксперименты с \(\pi_h(s)\); остальные — \(\pi_s(s)\). \(\pi_h(s)\) превосходит исходную честную стратегию, \(\pi_s(s)\) уступает исходной спуфинг-стратегии, но доходы обеих политик положительны и того же порядка, что у исходных стратегий.

Средняя активация детектора спуфинга: \(\Theta(\pi_h(s), a_0 : a_{19}) = 0.000\) и \(\Theta(\pi_s(s), a_0 : a_{19}) = 0.842\). Детектор «флагает» спуфинг-политику, но не честную — как ожидалось. Обе политики демонстрируют стабильную прибыль; RL-агент с аналогичным пространством мог бы зарабатывать без спуфинга, но спуфинг повысил бы прибыльность.

Влияние фиксированной политики на прибыль
Рис. 2. Влияние размера котировки агента с фиксированной политикой на прибыльность каждого класса агентов. Все глубины котировок.

3.4. Ограниченный RL: неспособность спуфить

Фиксированная политика заменяется ограниченным агентом \(Q_R\) с полным пространством состояний из раздела 2.4, но ограниченным пространством действий \(\{\mathrm{AG}, \mathrm{EX}, \mathrm{DN}\}\). Он использует online Q-Learning (раздел 1.1) для обнаружения торговой политики, максимизирующей прибыль. Агент может совершать сделки, но не может отменять ордера. Гипотеза: \(Q_R\) не сможет выучить ненормативное спуфинг-поведение.

Тестируются вариации \(Q_R\): три с \(\epsilon\)-greedy exploration (все случайные действия, scheduled step decline за торговой день, geometric decay); два с Boltzmann exploration с unscaled или linearly scaled environmental rewards. Для каждой вариации — 10 отдельных random experiments. Каждый агент обучается 10 полных торговых дней, затем оценивается ещё 10 дней. Небольшой начальный bias к действию DN. Learning rate decay per state-action pair: \(\alpha = \max(0.1,\; 1/c(s,a))\), где \(c\) — счётчик.

Табл. 3 и рис. 3 — mean и распределение прибылей за 100 торговых дней для каждой вариации \(Q_R\). Все вариации прибыльны в среднем, кроме unscaled-\(r\) Boltzmann; автор полагает, что ранние крупные награды смещают выбор действий. Влияние на других трейдеров схоже между вариациями. Boltzmann-агент сходится за меньше дней обучения — быстрее отказывается от неприносящих награду действий. Последующие экспериментальные агенты основаны на scaled-\(r\) Boltzmann-вариации \(Q_R\) из-за быстрой сходимости, near-optimal profit и отсутствия значительных нисходящих отклонений прибыли.

Таблица 3. Прибыль по классам агентов по методу exploration \(Q_R\).
Exploration\(Q_R\)OBIOBI*ValueZI
\(\epsilon\)-greedy random467-1,7612,112-3057
\(\epsilon\)-greedy step382-1,7872,118-2754
\(\epsilon\)-greedy decay482-1,8252,138-3058
Boltzmann \(r\)-raw-58-1,7912,117-3462
Boltzmann \(r\)-scaled405-1,7762,123-3259
Влияние ограниченного Q-trader
Рис. 3. Влияние метода exploration ограниченного Q-trader на прибыльность каждого класса агентов.

Средняя активация детектора спуфинга \(\Theta(a_0 : a_{19}) < 10^{-17}\) для всех вариаций \(Q_R\) — ограниченный агент не способен спуфить симулированный рынок. Без спуфинга \(Q_R\) стабильно учится зарабатывать: в scaled-\(r\) Boltzmann-вариации только 5% торговых дней заканчиваются убытком, средний убыток в эти дни — $195. Правильно сконфигурированный RL-трейдер может зарабатывать на рынке без спуфинга.

3.5. Неограниченный RL: обучение спуфить

Из предыдущих экспериментов видно, что типичная стратегия спуфинга и спуфинг-агент с фиксированной политикой успешно спуфят симулированный рынок; честный агент с фиксированной политикой и action-restricted RL-трейдер могут зарабатывать без спуфинга. Перед введением нормативного руководства исследуется, что происходит без него.

Ограниченный агент \(Q_R\) заменяется неограниченным Q-Learning агентом \(Q_U\) с полным пространством состояние–действие из раздела 2.4, максимизирующим прибыль. Никаких усилий направить агента к спуфингу — только наблюдение поведения. Гипотеза: \(Q_U\) научится максимизировать прибыль спуфингом рынка. Все эксперименты — та же конфигурация рынка, процесс обучения и scaled-\(r\) Boltzmann-вариант из раздела 3.4. Глубина ордера ранее не влияла на исходы спуфинга — все эксперименты с фиксированной глубиной 5 для действия PS.

Табл. 4 — mean profit по классам агентов. Строки init и \(\pi_s(s)\) — начальная и фиксированная спуфинг-стратегии для сравнения. В среднем \(Q_U\) получает большую прибыль, чем референсные спуфинг-стратегии для большинства протестированных объёмов. Распределение доходности \(Q_U\) представлено в разделе 3.6 вместе с normative агентами.

Средняя активация детектора \(\Theta(a_0 : a_{19}) = 0.755\) по всем quote sizes для \(Q_U\). \(Q_U\) зарабатывает на уровне известных спуфинг-стратегий и существенно выше известных честных. Как и известные спуфинг-стратегии, \(Q_U\) в основном profit от HFT OBI-трейдеров. Вывод: \(Q_U\) непреднамеренно научился максимизировать прибыль спуфингом симулированного рынка; нормативное руководство действительно может быть необходимо.

Таблица 4. Прибыль по классам агентов по объёму пассивного ордера \(Q_U\).
Quantity\(Q_U\)OBIOBI*ValueZI
init88,985-267,769-15,4941,0113,661
\(\pi_s(s)\)48,627-158,853-14,8275312,261
75023,644-118,56563,8514661,493
1,000100,450-293,52020,4551,2233,818
1,250119,480-499,619-73,2651,8757,025
1,500120,997-546,697-101,0122,0687,732
2,00096,195-614,292-143,2602,5238,627
2,50061,764-756,587-214,7183,41310,510

3.6. Normative RL: обучение не спуфить

В разделе 3.5 неограниченный Q-Learning агент с простой максимизацией прибыли научился спуфить финансовый рынок. В финальном наборе экспериментов детектор спуфинга \(\Theta(a_0 : a_{19})\) используется как источник нормативного руководства для предотвращения обнаружения спуфинга как «оптимальной» стратегии.

Неограниченный \(Q_U\) заменяется \(Q_N\) — Q-Learning агентом с полным пространством состояние–действие из раздела 2.4. \(Q_N^{sh}\) получает нормативное руководство через reward shaping; \(Q_N^{rr}\) — через action reranking. Оба метода показаны в разделе 2.4. Параметры идентичны разделу 3.5, кроме оговорённого. Все доступные действия по отдельности нормативны; детектор обучен на последовательностях длины 20, видимых с биржи. Для каждого агента поддерживается история длины 20 exchange-visible order activity — отличная от внутренних выборов из action space (раздел 2.4). Гипотеза: \(Q_N\) использует дополнительную гибкость action space, чтобы зарабатывать больше \(Q_R\), но с меньшей прибылью и активацией \(\Theta(a_0 : a_{19})\), чем \(Q_U\).

Табл. 5 — mean profit по классам агентов. Политики и Q-Learning агенты из предыдущих экспериментов — для сравнения. Колонка \(\Theta(a)\) — средняя активация детектора спуфинга для действий экспериментального агента. \(Q_N\) достигает примерно в 40 раз большей прибыли, чем предыдущие экспериментальные non-spoofing агенты. 30–40% прибыли предыдущих spoofing агентов при на порядок меньшей активации \(\Theta(a_0 : a_{19})\).

Таблица 5. Прибыль по классам агентов по экспериментальной конфигурации.
Config.\(\Theta(a)\)Exper.OBIOBI*ValueZI
\(\pi_h(s)\)0.000517-1,6541,985-3055
\(\pi_s(s)\)0.84248,627-158,853-14,8275312,261
\(Q_R\)0.000405-1,7762,123-3259
\(Q_U\)0.75561,764-756,587-214,7183,41310,510
\(Q_N^{rr}\)0.04321,871-83,964-12,0702271,263
\(Q_N^{sh}\)0.07219,987-86,130-10,8822631,268

Рис. 4 — распределение прибылей каждого класса агентов. \(Q_U\) испытывает редкие, но катастрофические убытки — вероятно, когда спуфинг limit orders случайно исполняются. Обе вариации \(Q_N\) устраняют эти потери. По сравнению с \(Q_N\), \(Q_U\) также создаёт гораздо большую волатильность доходности других трейдеров.

Влияние нормативного руководства
Рис. 4. Влияние метода нормативного руководства на прибыльность каждого класса агентов. Предыдущие Q-traders включены для сравнения.

При условии, что в настоящей работе спуфинг отождествляется с высокой активацией \(\Theta(a_0 : a_{19})\), и эффективность детектора критична, для Q-Learning торговых агентов наблюдается:

Оба изученных вида normative guidance захватывают повышенный profit potential RL-механизма торговли, но с гораздо меньшей активацией детектора спуфинга и гораздо меньшим disruption для других участников рынка. Это может предложить новое направление для регуляторов: поощрение или требование best practices, включающих такое normative guidance, для сдерживания непреднамеренного принятия ненормативных или disruptive практик автономными RL-торговыми агентами.

4. Заключение

Автор исследовал риск того, что ответственный практик финансового machine learning непреднамеренно создаст Q-Learning торгового агента, спуфящего рынок участия. Сначала распознаватель спуфинга обучен на вариациях hand-designed спуфинг-агента в симулированном рынке — симуляция безопасный и эффективный способ синтезировать примеры ненормативного поведения. Спуфинг детектируем на рынке; order-book aware агенты страдают от спуфинга, как ожидалось. Введены и протестированы честные и спуфинг fixed policy торговые агенты, action-restricted и unconstrained Q-trading агенты, гибкие Q-trading агенты с двумя формами normative guidance. Относительные прибыли и уровни активации детектора спуфинга показывают: restricted Q-trader не мог спуфить, unconstrained Q-trader непреднамеренно научился спуфить, Q-traders с normative guidance достигли respectable profits без обучения спуфингу. Оба подхода к normative guidance позволяют прибыльность с меньшим market disruption и избежанием видимого спуфинг-поведения.

Автор признаёт, что normative guidance может подавлять только поведение, которое распознаёт; robustness детектора должна быть высоким приоритетом. В более широком смысле непреднамеренные правовые или регуляторные нарушения интеллектуальными торговыми алгоритмами — серьёзная проблема, требующая немедленного внимания. Рекомендации:

Благодарности. Материал основан на исследовании, поддержанном National Science Foundation Grant No. 1741026 и JP Morgan Fellowship.

Литература

Оригинал статьи: Byrd, «Learning Not to Spoof», arXiv:2306.06087 · ACM ICAIF'22