Глубокое обучение с подкреплением для количественной торговли
Маочунь Сюй, Цзысюнь Лань, Чжэн Тао, Цзявэй Ду, Цзунао Е · Университет Сиань Цзяотун — Ливерпуль, Сучжоу, Китай · 25 декабря 2023
Оригинал: Xu, M., Lan, Z., Tao, Z., Du, J., Ye, Z. «Deep Reinforcement Learning for Quantitative Trading», 2023 — arxiv.org/abs/2312.15730 (PDF).
Рисунки и таблицы воспроизведены из оригинальной публикации. Оригинал распространяется по лицензии CC BY 4.0; перевод выполнен на её условиях, изменение по отношению к оригиналу — перевод на русский язык.
Ключевые слова: количественная торговля, обучение с подкреплением.
Аннотация
Искусственный интеллект и машинное обучение преобразуют область количественной торговли (QT) за счёт развёртывания продвинутых алгоритмов, способных просеивать обширные финансовые наборы данных в поисках выгодных инвестиционных возможностей. Модели на основе ИИ, особенно использующие глубокое обучение и обучение с подкреплением, показали большую силу в прогнозе рыночных трендов и исполнении сделок со скоростью и точностью, далеко превосходящими человеческие возможности. Ключевую роль сыграла их способность автоматизировать критически важные задачи — распознавание рыночных условий и исполнение торговых стратегий. Однако в нынешних методах QT сохраняются трудности, особенно в эффективной работе с зашумлёнными высокочастотными финансовыми данными. Другой вызов для торговых агентов на основе ИИ — баланс между исследованием и использованием.
Чтобы преодолеть эти препятствия, наше решение QTNet вводит адаптивную торговую модель, которая автономно формирует стратегии QT через интеллектуального торгового агента. Объединяя глубокое обучение с подкреплением (DRL) с методами имитационного обучения, мы усиливаем возможности модели. Для работы с изменчивыми финансовыми данными мы формулируем механизм QT в рамках частично наблюдаемого марковского процесса принятия решений (POMDP). Кроме того, встраивание имитационного обучения позволяет модели опираться на традиционные торговые тактики, выстраивая сбалансированную синергию между поиском нового и использованием известного. Для более реалистичной симуляции наш торговый агент обучается на данных минутной частоты с живого финансового рынка. Экспериментальные результаты подчёркивают способность модели извлекать устойчивые рыночные признаки и её адаптивность к разнообразным рыночным условиям.
1. Введение
В области инвестирования в финансовые бумаги количественная торговля отличается существенной автоматизацией: она использует вычислительные технологии, чтобы уменьшить зависимость от личного усмотрения и смягчить нелогичные решения. По мере роста влияния количественных хедж-фондов усиливается внимание к интеграции машинного обучения в QT, особенно в контексте финтеха. Эти технологии позволяют создавать динамические торговые стратегии, способные адаптироваться к изменениям рынка в реальном времени, эффективнее управлять рисками и в конечном счёте повышать прибыльность и эффективность торговых операций. По мере усложнения финансовых рынков интеграция ИИ и машинного обучения в QT становится необходимой для сохранения конкурентного преимущества.
В изменчивой среде финансовых рынков торговое поведение и экономические события по своей природе непредсказуемы, что порождает волатильные и нестационарные данные. Несмотря на широкое применение технического анализа в QT, его способность к обобщению ставится под сомнение, что подчёркивает потребность в более устойчивых признаках, извлекаемых напрямую из сырых финансовых данных. В ответ на это исследовались методы машинного обучения, особенно модели глубокого обучения, на предмет их потенциала прогнозировать рыночные тренды и улучшать обобщение. Тем не менее задача QT выходит далеко за пределы прогноза трендов: она требует формулирования стратегических торговых методов. Хотя обучение с подкреплением даёт методичный каркас для задач с последовательностью решений, достижение равновесия между поиском новых стратегий и использованием уже отработанных представляет значительную трудность — особенно в условиях прагматических ограничений реальной торговли.
В ответ на эти трудности мы вводим QTNet — наблюдательные рекуррентные детерминированные градиенты политики. Мы помещаем QT в рамки частично наблюдаемого марковского процесса принятия решений (POMDP), чтобы эффективно работать с представлением непредсказуемых финансовых данных. Для работы с POMDP применяются рекуррентные нейронные сети — рекуррентный детерминированный градиент политики (RDPG), off-policy алгоритм глубокого обучения с подкреплением.
Баланс между исследованием и использованием достигается методами имитационного обучения. Для направления торгового агента вводятся буфер демонстраций, инициализируемый действиями стратегии Dual Thrust, и клонирование поведения. Благодаря интеграции этих техник в каркас POMDP, QTNet получает усиленное знание финансовой предметной области. QTNet тестируется на реальных данных фьючерсного рынка, демонстрируя способность выучивать прибыльные торговые политики и превосходное обобщение на различных фьючерсных рынках.
2. Связанные работы
Исследования в нашей области обычно делятся на две основные категории. Первая, подробно описанная Мёрфи в 1999 году, — количественная торговля, фундаментально опирающаяся на технический анализ. Этот метод предполагает, что все существенные рыночные детали закодированы в показателях цены и объёма, и использует разнообразные технические индикаторы — математически выведенные инструменты — для подачи торговых сигналов. Хотя такие индикаторы распространены, их жёсткость часто мешает им соответствовать многогранным и эволюционирующим паттернам рынка. Среди индикаторов преобладают два типа: скользящие средние, призванные распознать направление ценовых трендов, и осцилляторы, предназначенные для измерения рыночного моментума. Каждый тип, однако, имеет внутренние ограничения, поскольку строится на исторических данных, которые не всегда надёжно предсказывают будущее поведение рынка в силу его динамической природы.
В последнее время интеграция методов машинного обучения в сферу инвестирования заметно ускорилась, с особым акцентом на обучение с подкреплением за его пригодность к задачам последовательного принятия решений. Исследование RL в контексте QT не ново: Литтман (1996) [9], [17] одним из первых применил Q-обучение — классический алгоритм RL, основанный на функции ценности. Сложность пространств задач в QT выявила ограничения традиционных методов. В ответ Мёрфи (1999) [4]–[6], [12] и коллеги на рубеже тысячелетий сместили фокус к подходам RL на основе политики. Они выдвинули концепцию рекуррентного обучения с подкреплением (RRL) — метода, лучше приспособленного к тонкостям и временным зависимостям, присущим финансовым решениям.
Традиционное RL сталкивается с трудностями при отборе подходящих рыночных признаков. Глубокое обучение с подкреплением, объединяющее RL и глубокое обучение, хорошо подходит для задач с высокой размерностью. DRL показало продвижение в сложных задачах, включая видеоигры, и распространяет свой потенциал на QT. Цзян, Сюй и Лян (2017) [3], [7] использовали DDPG для криптовалютных портфелей. Предпринимались также попытки улучшить представление финансовых сигналов с помощью нечёткого обучения и глубоких нейросетей.
Безмодельные алгоритмы RL, будучи эффективными, часто испытывают трудности с эффективностью сэмплирования в обширных пространствах состояний — ситуация, типичная для QT. Чтобы решить это, Ю и соавторы (2019) [18] и Лань и соавторы (2023) [20] разработали модельный подход RL для управления портфелем на дневной частоте. Однако этот каркас не полностью отвечает потребностям минутных данных, более распространённых в QT. Чтобы закрыть этот разрыв, наше исследование предлагает механизм RL на основе политики, работающий в непрерывном времени и дополненный рекуррентными нейросетями. Эта архитектура DRL приспособлена улавливать тонкие нюансы поминутных финансовых данных и проявляет гибкость в различных рыночных условиях.
3. Постановка задачи
3.1. Основные обозначения
Для каждого дискретного момента $t$ определим массив цен OHLC как $p_t = [o_t^p, h_t^p, l_t^p, c_t^p]$, где $o_t^p$, $h_t^p$, $l_t^p$ и $c_t^p$ соответственно означают цены открытия, максимума, минимума и закрытия. Полный ценовой массив финансового инструмента выражается как $P = [p_1, \ldots, p_t, \ldots]$. Для удобства $P_{t-n:t}$ обозначает исторический ценовой массив в заданном окне, где $n$ — длина периода ретроспективы. Вектор технических индикаторов в момент $t$ обозначается $I_t = [I_{1t}, \ldots, I_{jt}]$, где $I_{jt}$ — функция исторической ценовой последовательности $P_{t-n:t}$ вида $I_{jt} = f(P_{t-n:t}; \theta_j)$, а $\theta_j$ — параметры технической стратегии $j$. Последовательность технических индикаторов: $I = [I_1, \ldots, I_t, \ldots]$. Аналогично прибыль счёта на шаге $t$ есть $r_t$, а последовательность прибылей: $R = [r_1, \ldots, r_t, \ldots]$.
3.2. POMDP
В этом разделе мы рассматриваем отличительные черты количественной торговли и обосновываем формулирование всего процесса QT как частично наблюдаемого марковского процесса принятия решений. Финансовый рынок характеризуется ценами бумаг, на которые влияют и оптимистичные, и пессимистичные инвесторы, макро- и микроэкономическая активность, непредсказуемые события и разнообразное торговое поведение, — всё это вносит внутренний шум. Прямое наблюдение истинных состояний рынка становится недостижимым. Например, влияние позитивных новостей или исполнения заявок остаётся неопределённым, а доступные для анализа данные ограничены историческими ценами и объёмами, дающими лишь частичное представление о состоянии рынка. QT как задача последовательного принятия решений сводится к тому, что и когда торговать.
В рамках QT аналитическая структура эволюционирует от классического марковского процесса принятия решений (MDP) к POMDP. MDP определяется пятёркой $[S, A, P, R, \gamma]$, где $S$ — множество состояний, $A$ — множество действий, $P$ — функция вероятности перехода состояний, $R$ — функция вознаграждения. С добавлением наблюдательных элементов $O$ и $Z$, где $O$ — множество наблюдений, а $Z$ — функция вероятности наблюдений, каркас превращается в POMDP. В этом контексте агент получает различные наблюдения на каждом интервале, и понимание наблюдаемой истории до момента $t$ фундаментально для схватывания динамики QT.
Наблюдение. На финансовом рынке наблюдения делятся на две категории: подмножество наблюдений портфеля $o_{pt}$ и подмножество экономических наблюдений $o_{et}$. Первое представляет совокупную прибыль портфеля, второе связано с рыночным ценообразованием и техническими метриками. Общее множество наблюдений $O = \{P, I, R\}$, с использованием технических индикаторов BuyLine и SellLine из стратегии Dual Thrust.
Действие. Торговые действия суть непрерывный вектор вероятностей $a_t$, представляющий длинные и короткие позиции. Агент исполняет действие с максимальной вероятностью. Действия представляются как $a_t \in \{\text{long}, \text{short}\} = \{1, -1\}$, что упрощает управление позицией и смягчает влияние ёмкости рынка. Торговые действия интерпретируются как сигналы, направляющие исполнение сделок по определённым правилам.
Вознаграждение. В торговую симуляцию включены практические ограничения — транзакционные комиссии и проскальзывание. Прибыль счёта $r_t$ вычисляется с их учётом. Поскольку $r_t$ сам по себе неэффективен как функция вознаграждения, принят коэффициент Шарпа — мера доходности с поправкой на риск, представляющая отношение избыточной доходности к единице полного риска.
4. Наблюдательный рекуррентный DPG
В этом разделе мы представляем QTNet — модель, специально разработанную для постановки POMDP в количественной торговле. Модель структурно объединяет элементы рекуррентного детерминированного градиента политики (RDPG) и имитационного обучения. Схема архитектуры приведена на рисунке 1.
Рисунок 1 — смотреть в оригинале (PDF)
4.1. Рекуррентный DPG
Сильвер (2015) [8] представил детерминированный градиент политики (DPG) — специализированный off-policy алгоритм обучения с подкреплением для непрерывных пространств действий. Его применение особенно уместно в области высокочастотной количественной торговли, где решения нужно принимать на континууме. Способность DPG отвечать требованиям постоянной торговой активности с учётом издержек частых изменений позиции делает его подходящим для QT. Развивая DPG, Хесс и соавторы (2015) [1] предложили рекуррентный детерминированный градиент политики (RDPG), включающий рекуррентную структуру для более умелой навигации в ландшафте QT. Эта методология признаёт важность исторических последовательностей данных для QT, где состояние рынка наблюдаемо не полностью. Агенты используют историческую совокупность рыночных и собственных счётных наблюдений — цен, индикаторов и прибылей, — заключённую в последовательность $h_t = (o_1, a_1, \ldots, o_{t-1}, a_{t-1}, o_t)$. RDPG применяет рекуррентные нейросети для усвоения этой истории, усиливая способность агента удерживать и использовать прошлую информацию для будущих сделок.
Подход согласуется с методологией «актор — критик», где RDPG способен выучивать как детерминированную политику (актор), так и функцию ценности действия (критик). Он стремится оптимизировать оценённую функцию ценности $Q^\mu$, опираясь на функцию актора $\mu(h)$ и функцию критика $Q(h, a)$, параметризованные $\theta$ и $\omega$ соответственно. Поддерживается также буфер воспроизведения, архивирующий последовательности наблюдений, действий и вознаграждений.
Наше исследование дополнительно вводит в каркас QT сети долгой краткосрочной памяти (LSTM) как альтернативу управляемым рекуррентным блокам (GRU). LSTM трактуют предыдущую историю наблюдений и действий $h_{t-1}$ как латентное состояние с прошлого шага, так что текущее состояние формулируется как $h_t = \text{LSTM}(h_{t-1}, a_{t-1}, o_t)$. Эта замена подчёркивает потенциал LSTM в схватывании временных тонкостей рынка — критически важного аспекта для эффективных торговых стратегий в нашей модели POMDP для QT.
4.2. Имитационное обучение на основе буфера демонстраций и клонирования поведения
Эффективная навигация в динамических тонкостях финансовых данных представляет значительную трудность из-за экспоненциального роста пространства значений при исследовании. Традиционные безмодельные алгоритмы RL ограничены в способности эффективно вырабатывать прибыльные политики в контексте QT. Более того, случайное исследование без конкретных целей становится неэффективным, особенно с учётом требований непрерывности торговли и факторов рыночного трения. Однако использование безмодельного RDPG с чётко определёнными целями обучения оказывается многообещающим. Как off-policy алгоритм, RDPG адаптивен к вспомогательным данным, что даёт основу для введения двух ключевых компонент: буфера демонстраций и клонирования поведения. Эти модули играют роль пассивного и активного имитационного обучения соответственно [10]–[12], [16], [19].
Буфер демонстраций (DB). Сначала создаётся приоритетный буфер воспроизведения, предварительно заполняемый демонстрационными эпизодами $(o_1, a_1, r_1, \ldots, o_T, a_T, r_T)$, полученными от стратегии Dual Thrust. Опираясь на методологии DQfD (Хестер и соавторы, 2018) [2] и DDPGfD (Вечерик, 2017) [17], наш подход предполагает предобучение агента на этих демонстрациях до фактического взаимодействия. Такое предобучение, обогащённое знаниями технического анализа, снабжает агента базовой торговой стратегией с самого начала.
На этапе обучения каждый минибатч состоит из смеси обучающих и агентских эпизодов, отбираемых приоритетным воспроизведением опыта (PER) (Шауль и соавторы, 2015) [15]. PER чаще выбирает эпизоды большей значимости. Вероятность отбора эпизода $P(i)$ напрямую связана с его важностью: $P(i) = \frac{p_t}{\sum_i p_i}$, где $p_i$ — значимость эпизода $i$. Мы используем критерий важности эпизода из работы Вечерика (2017) [17], где $p_i$ задаётся как
$$\mathbb{E}\left| y_t^i - Q_\omega\left(h_t^i, a_t^i\right) \right| + \lambda_0 \left| \nabla_a Q_\omega\left(h_t^i, a_t^i\right) \right| + \epsilon_D \tag{1}$$
Здесь первый член означает потерю эпизода $L_i$, а последующий — величину изменения градиента актора. Константа $\theta_D$, назначаемая демонстрационным эпизодам, повышает вероятность их выборки, а $\lambda_0$ оценивает влияние градиента актора. С изменением распределения выборки обновления сети корректируются весами значимости $w_i$:
$$w_i = \frac{1}{N} \times \frac{1}{P(i)^{\phi}} \tag{2}$$
где показатель $\phi$ заменяет $\theta$. Этот приоритетный буфер демонстраций контролирует соотношение демонстрационных и агентских эпизодов и, что важно, способствует эффективному распространению вознаграждений.
Клонирование поведения (BC). Клонирование поведения используется для задания целей каждому торговому движению. Внутридневные «жадные» действия $\bar{a}$ включаются как действия экспертного уровня. Оглядываясь назад, мы конструируем прозорливого торгового эксперта, который неизменно выбирает длинную позицию при минимальных ценах и короткую — при максимальных.
5. Эксперименты
5.1. Постановка
В нашем исследовании применяется подход, основанный на данных: используются минутные бары OHLC для торговли фьючерсами, улавливающие нюансы ценовых движений внутри каждой минуты. Такие высокочастотные данные, обычные для реальных рынков, ставят перед алгоритмами RL особые задачи, прежде всего в поддержании непрерывности действий. Набор данных получен из пакета Python qstock — открытой библиотеки количественного инвестиционного анализа, включающей модули получения данных, визуализации, отбора акций и количественного бэктеста. Модуль данных опирается на открытые данные сети Oriental Wealth, Flush, Sina Finance и других онлайн-источников.
Данные охватывают период обучения с 28 сентября 2015 по 10 ноября 2022 года и последующий период тестирования с 11 ноября 2022 по 10 ноября 2023 года. Чтобы точнее отразить реальные рыночные условия, мы включаем практические элементы: транзакционную комиссию $\delta = 2 \times 10^{-5}$ и фиксированное проскальзывание $\zeta = 0{,}15$.
Для целей симуляции приняты определённые допущения. Мы полагаем, что каждая заявка исполняется точно на открытии минутного бара, а вознаграждения рассчитываются на его закрытии. Учтены специфические для фьючерсов моменты — маржинальные требования и особенности расчётов по контрактам. Обучение завершается при одном из двух условий: потеря 50% позиций либо исчерпание требуемой маржи. Начальный баланс счёта для начала тестовой фазы установлен в 1 000 000 $.
Результативность торговой политики оценивается набором стандартных метрик:
- Полная доходность (Tr): $(P_{end} - P_{start})/P_{start}$, где $P$ — суммарная стоимость позиции и денежных средств.
- Коэффициент Шарпа (Sr): введённый Шарпом (1966), определяется как $\mathbb{E}[r]/\sigma[r]$ и даёт меру избыточной доходности на единицу систематического риска.
- Волатильность (Vol): выражается как $\sigma[r]$, где $r$ — исторический ряд доходностей; метрика показывает изменчивость доходностей и связанные факторы риска.
- Максимальная просадка (Mdd): определяется как $\max (P_i - P_j)/P_i$ при $j > i$; количественно оценивает наиболее значительное историческое сокращение, то есть худший сценарий.
Рисунок 2 — смотреть в оригинале (PDF)
Рисунок 3 — смотреть в оригинале (PDF)
5.2. Стратегии имитационного обучения
В модуль буфера демонстраций мы включаем стратегию Dual Thrust как образцовую торговую политику. Эта стратегия, укоренённая в принципах технического анализа (в частности, осцилляторов), задаёт рациональный диапазон ценовых колебаний, опираясь на наибольший максимум (HH), наименьшее закрытие (LC), наибольшее закрытие (HC) и наименьший минимум (LL) за прошлые $n$ периодов. Ключевые компоненты стратегии:
$$\text{Range} = \max[HH - LC,\; HC - LL]$$
$$\text{BuyLine} = \text{Open} + K_1 \times \text{Range}$$
$$\text{SellLine} = \text{Open} - K_2 \times \text{Range} \tag{5}$$
Здесь Open — цена открытия дня, а $K_1$ и $K_2$ — константы, задающие уровни сопротивления рыночных цен пробою BuyLine и SellLine соответственно. Торговые сигналы порождаются, когда текущая цена превышает определённый процент диапазона вверх или вниз.
В модуле клонирования поведения внутридневные «жадные» действия вводятся как экспертные действия с позиции ретроспективы. Открытие длинной позиции по минимальной цене и короткой — по максимальной последовательно представляет относительно оптимальную жадную стратегию. Эта «пророческая» политика служит экспертными действиями для агента на протяжении обучения. На каждом шаге $t$ экспертное действие определяется как
$$\bar{a}_t = \begin{cases} 1, & \text{если } t = \arg\min P_{o_{t-n_d t}} \\ -1, & \text{если } t = \arg\max P_{o_{t-n_d t}} \end{cases}$$
где $n_d$ — длина одного торгового дня, а $P_{o_{t-n_d t}}$ — последовательность цен открытия за день.
5.3. Базовые методы
QTNet сравнивается с несколькими базовыми стратегиями:
- Long & Hold: открытие длинной позиции в начале и удержание её до конца тестового периода.
- Short & Hold: в противоположность предыдущей — открытие короткой позиции в начале и удержание до конца.
- DDPG (Лилликрап и соавторы, 2015) [8]: off-policy безмодельный алгоритм «актор — критик», обычно демонстрирующий надёжные результаты в задачах непрерывного управления.
5.4. Экспериментальные результаты
Мы использовали минутные данные по фьючерсам IC для оценки QTNet против нескольких базовых стратегий. Как видно из таблицы 1, QTNet стабильно превосходит традиционные методы, особенно по полной доходности и коэффициенту Шарпа, что указывает на его адаптивность и прибыльность в высокочастотной среде. Хотя DDPG — известный алгоритм RL, преуспевающий в ряде сценариев, в наших тестах он показал сравнительно низкие результаты, что может объясняться его приспособленностью к работе с высокочастотными данными.
QTNet также показал впечатляющий результат по критической метрике управления риском — максимальной просадке, продемонстрировав большую устойчивость при рыночных спадах по сравнению с прямолинейными стратегиями Long & Hold и Short & Hold и тем самым минимизировав потенциальные максимальные потери. Этот результат подчёркивает устойчивость стратегии QTNet перед рыночной волатильностью и её способность сохранять стабильность в сложных условиях.
| Метод | Tr, % | Sr | Vol | Mdd, % |
|---|---|---|---|---|
| Long & Hold | −8,32 | −0,318 | 0,746 | 62,84 |
| Short & Hold | 9,53 | 0,167 | 0,658 | 49,30 |
| DDPG | −17,26 | −0,428 | 0,498 | 57,22 |
| QTNet | 20,28 | 0,562 | 0,421 | 23,73 |
5.5. Эксперименты с исключением компонент
Исследования с исключением компонент на фьючерсах IC проливают свет на значимость каждого элемента QTNet для совокупного результата. Данные таблицы 2 показывают, что интегрированная траектория доходности выделяется на фоне аналогов на протяжении всей фазы оценки. Исследование разбирает модель на три варианта: базовый RDPG только с сетями GRU, RDPG-DB с буфером демонстраций и RDPG-BC с модулем клонирования поведения.
Анализ показывает, что базовый вариант RDPG с трудом достигает согласованности действий и освоения прибыльного торгового подхода. Внедрение буфера демонстраций в RDPG-DB заметно повышает эффективность сэмплирования опыта, тогда как клонирование поведения в RDPG-BC ограничивает пагубное влияние случайного исследования на результат агента. Полноценный QTNet, объединяющий все компоненты, явно превосходит остальные и по генерации прибыли, и по метрикам управления риском, что подчёркивает силу стратегий имитационного обучения в этой области.
| Метод | Tr, % | Sr | Vol | Mdd, % |
|---|---|---|---|---|
| RDPG | 8,96 | 0,067 | 0,590 | 34,62 |
| RDPG-DB | 18,72 | 0,467 | 0,452 | 23,72 |
| RDPG-BC | 31,24 | 0,619 | 0,427 | 29,81 |
| QTNet | 36,26 | 0,742 | 0,411 | 25,37 |
5.6. Способность к обобщению
Универсальность QTNet оценивается по результатам в разных рыночных условиях — на фьючерсах IF и IC (таблица 3). Таблица показывает резкий контраст в эффективности Dual Thrust между рынками IC и IF, что иллюстрирует потенциальные ограничения фиксированных торговых индикаторов. QTNet, напротив, демонстрирует превосходный результат, особенно на рынке IC, несмотря на обучение исключительно на данных IF. Это показывает внутреннюю гибкость модели и её умение выделять устойчивые признаки, важные для формирования динамических торговых стратегий, применимых в разных рыночных средах.
| Метод | Данные | Tr, % | Sr | Vol | Mdd, % |
|---|---|---|---|---|---|
| Dual Thrust | IC | 26,40 | 0,810 | 0,469 | 19,24 |
| IF | −29,59 | −0,577 | 0,796 | 55,81 | |
| QTNet | IC | 34,27 | 0,742 | 0,457 | 24,56 |
| IF | 28,73 | 0,523 | 0,517 | 26,25 |
6. Заключение
В нашем исследовании представлен QTNet — динамический каркас имитационного обучения, созданный для задач количественной торговли. Мы построили частично наблюдаемый марковский процесс принятия решений, чтобы умело работать с непостоянной природой высокочастотных торговых данных. Существенно, что модель использует принципы имитационного обучения для гармонизации компромисса между исследованием и использованием, тем самым улучшая процесс принятия решений торговым агентом. Мы проверили результативность QTNet строгими оценками на подлинных данных фьючерсов на фондовые индексы, учитывая операционные ограничения, типичные для финансовой торговли. Результаты подтвердили финансовую состоятельность и способность QTNet к снижению риска. Серия сравнительных анализов продемонстрировала способность модели адаптироваться к различным рыночным условиям. В заключение: QTNet подчёркивает выгоду для торговых агентов на реальных рынках опираться на устоявшиеся торговые техники. Наши результаты подчёркивают возросшую адаптивность и прирост результативности, достигаемые объединением имитационного обучения с парадигмой обучения с подкреплением в области решений для QT.
Литература
- [1] N. Heess, J. J. Hunt, T. P. Lillicrap, D. Silver, Memory-based control with recurrent neural networks, arXiv:1512.04455 (2015). ↑
- [2] T. Hester и др., Deep Q-learning from demonstrations (DQfD), AAAI (2018). ↑
- [3] Z. Jiang, D. Xu, J. Liang, применение DDPG к криптовалютным портфелям (2017). ↑
- [4]–[6] J. Murphy и соавторы, работы по рекуррентному обучению с подкреплением (RRL). ↑
- [7] Работы по представлению финансовых сигналов с помощью нечёткого обучения и глубоких нейросетей. ↑
- [8] T. P. Lillicrap и др., Continuous control with deep reinforcement learning (DDPG), arXiv:1509.02971 (2015); D. Silver и др., Deterministic policy gradient algorithms, ICML (2014). ↑
- [9] M. L. Littman, работы по Q-обучению в задачах последовательного принятия решений (1996). ↑
- [10]–[12] Работы по имитационному обучению и техническому анализу. ↑
- [14] S. Ross, D. Bagnell, Efficient reductions for imitation learning (2010).
- [15] T. Schaul, J. Quan, I. Antonoglou, D. Silver, Prioritized experience replay, arXiv:1511.05952 (2015). ↑
- [16] Работы по имитационному обучению.
- [17] M. Vecerik и др., Leveraging demonstrations for deep reinforcement learning (DDPGfD), arXiv:1707.08817 (2017).
- [18] P. Yu и др., Model-based deep reinforcement learning for dynamic portfolio optimization, arXiv:1901.08740 (2019).
- [19] Работы по имитационному обучению.
- [20] Z. Lan и др., работы по модельному RL для управления портфелем (2023).
Оригинал статьи: Xu, M., Lan, Z., Tao, Z., Du, J., Ye, Z., «Deep Reinforcement Learning for Quantitative Trading», arXiv:2312.15730 · лицензия CC BY 4.0