FinRL-DeepSeek: обучение с подкреплением с учётом риска и подмешиванием LLM для торговых агентов

6/10

Мостафа Бенхенда · 11 февраля 2025

Оригинал: Benhenda, M. «FinRL-DeepSeek: LLM-Infused Risk-Sensitive Reinforcement Learning for Trading Agents», 2025 — arxiv.org/abs/2502.07393 (PDF).

Код, данные и агенты: github.com/benstaf/FinRL_DeepSeek.

Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по стандартной лицензии arXiv (non-exclusive distribution), которая производных произведений не разрешает: все права на оригинальный текст принадлежат автору, перевод выполнен для личного ознакомления с указанием источника.

Аннотация

В работе представлен новый торговый агент, чувствительный к риску, сочетающий обучение с подкреплением и большие языковые модели. Мы расширяем алгоритм оптимизации политики с ограничением по условной стоимости под риском (CVaR-PPO, он же CPPO), добавляя сигналы оценки риска и торговых рекомендаций, порождаемые языковой моделью из финансовых новостей. Подход протестирован на исторических данных по бенчмарку индекса Nasdaq-100 с использованием новостных данных из набора FNSPID и языковых моделей DeepSeek V3, Qwen 2.5 и Llama 3.3.

1. Введение

Автоматизированные торговые агенты всё активнее используют обучение с подкреплением, но часто упускают из виду два аспекта:

  1. интеграцию альтернативных источников данных, таких как финансовые новости;
  2. управление риском.

В работе вводится гибридный торговый агент RL + LLM, учитывающий сведения из финансовых новостей одновременно на уровне действий и на уровне риска. Основной вклад — введение оценки риска на основе LLM, извлекаемой из новостей, в дополнение к торговым рекомендациям, также порождаемым LLM. Это демонстрирует потенциал языковых моделей для извлечения признаков из новостей за пределами стандартного анализа тональности — за счёт тщательно спроектированных промптов.

2. Связанные работы

Существует растущий корпус работ по агентам RL, дополненным языковыми моделями. По сравнению с ними способ, которым LLM влияет на RL-агента, здесь проще.

В FinGPT обучение с подкреплением применяется к обучению самой языковой модели на ценах акций. Этот подход сложнее нашего, преимущество которого — в опоре на устоявшиеся API языковых моделей.

Другие гибридные подходы RL + LLM включают FinCon, где выполняется сложная дистилляция информации через синтезированный механизм многоагентного взаимодействия. В настоящей работе используются лишь простые промпты. Эти подходы отличаются также от «чисто LLM»-агентов, которые опираются только на рекомендации языковой модели.

3. Данные и промпты для LLM

Мы используем набор данных FNSPID, содержащий 15,7 млн выровненных по времени финансовых новостных записей за 1999–2023 годы. Чтобы снизить издержки на вызовы API языковых моделей, мы случайным образом отбираем по одной представительной новостной статье на акцию в день, сокращая набор до 2 млн записей. С помощью моделей DeepSeek V3, Qwen 2.5 72B и Llama 3.3 70B мы извлекаем рекомендации по акциям и оценку риска, используя следующие промпты.

Промпт торговой рекомендации (из работы по FNSPID):

«Вы — финансовый эксперт с опытом рекомендаций по акциям. Применительно к конкретной акции поставьте оценку в диапазоне от 1 до 5, где 1 — негативно, 2 — скорее негативно, 3 — нейтрально, 4 — скорее позитивно, 5 — позитивно».

Промпт оценки риска (новый):

«Вы — финансовый эксперт, специализирующийся на оценке риска для рекомендаций по акциям. Применительно к конкретной акции дайте оценку риска от 1 до 5, где: 1 означает очень низкий риск, 2 — низкий риск, 3 — умеренный риск (по умолчанию, если новость не содержит явных указаний на риск), 4 — высокий риск, 5 — очень высокий риск».

4. Торговые алгоритмы

4.1. Агенты RL только на ценовых данных

4.1.1. Проксимальная оптимизация политики (PPO)

Алгоритм PPO обеспечивает устойчивые обновления политики за счёт обрезания отношения вероятностей:

$$L^{\text{PPO}}(\theta) = \mathbb{E}\left[\min\left(r_t(\theta)\cdot A_t,\ \operatorname{clip}\left(r_t(\theta),\ 1-\epsilon,\ 1+\epsilon\right)\cdot A_t\right)\right]$$

где $r_t(\theta) = \frac{\pi_\theta(a_t \mid s_t)}{\pi_{\theta_{old}}(a_t \mid s_t)}$ — отношение вероятностей между новой политикой $\pi_\theta$ и старой $\pi_{\theta_{old}}$; $A_t$ — оценка преимущества в момент $t$; $\epsilon$ — параметр обрезания, ограничивающий большие обновления политики.

4.1.2. PPO с условной стоимостью под риском (CVaR-PPO)

CVaR-PPO расширяет PPO ограничением по риску, штрафующим траектории с крупными потерями:

$$L^{\text{CVaR-PPO}}(\theta, \eta, \lambda) = L^{\text{PPO}}(\theta) + \lambda\left(\frac{1}{1-\alpha}\mathbb{E}\left[(\eta - D(\pi_\theta))^+\right] - \eta + \beta\right) \tag{1}$$

где $D(\pi_\theta)$ — доходность траектории; $\eta$ — порог CVaR; $(\eta - D(\pi_\theta))^+ = \max(0,\ \eta - D(\pi_\theta))$ — потеря CVaR за порогом; $\lambda$ — множитель Лагранжа, обеспечивающий ограничение; $\alpha$ — уровень доверия CVaR (например, 0,05 для худших 5%); $\beta$ — вспомогательный штрафной параметр.

Насколько нам известно, мы первыми применяем CVaR-PPO к торговле акциями.

4.2. PPO с подмешиванием LLM

В этом варианте мы вычисляем по данным FNSPID специфичные для акции оценки рекомендаций $S_f$ с помощью языковой модели. Эти оценки влияют на торговые действия. Изменённое действие:

$$a_t^{\text{mod}} = S_f \cdot a_t$$

где $S_f > 1$ усиливает действие при позитивной рекомендации, $S_f < 1$ ослабляет при негативной, а $S_f = 1$ оставляет действие без изменений.

Возмущение $S_f$ выбирается близким к единице ради устойчивости алгоритма. Например:

4.3. CVaR-PPO с подмешиванием LLM (CPPO)

Финансовые новости из FNSPID обрабатываются языковой моделью для порождения оценок риска $R_f^i$ по каждой акции $i$ и каждому дню. Возмущение $R_f^i$ также выбирается близким к единице:

Агрегированная оценка риска определяется как

$$R_f = \sum_i w_i R_f^i$$

где $w_i$ — финансовый вес акции $i$ в портфеле, причём $\sum_i w_i = 1$.

Эти оценки корректируют доходности траекторий в CVaR-PPO, отражая рыночный риск. Скорректированная доходность:

$$D_{R_f}(\pi_\theta) = R_f \cdot D(\pi_\theta)$$

В итоге финансовые новости влияют на торговые действия двумя путями: через $S_f$ и через $R_f$.

5. Результаты

5.1. Ранняя остановка: 400–500 тыс. шагов обучения

В этих тестах используется 10-процентное подмешивание LLM, то есть исходные PPO и CPPO изменяются не более чем на 10%.

Рисунок 1
Рисунок 1. Тестирование после 500 тыс. шагов обучения: 3 года обучающей истории, 1 год торговли.

Рисунок 1. Период обучения 2019–2022, 500 тыс. итераций (25 эпох по 20 тыс. шагов), период торговли — 2023 год. Эти предварительные результаты с Qwen 2.5 показывают, что интеграция рекомендаций LLM стабильно улучшает PPO по накопленной доходности. Однако этого пока недостаточно, чтобы обойти бенчмарк Nasdaq-100.

Рисунок 2
Рисунок 2. Тестирование после 400 тыс. шагов обучения: 6 лет обучающей истории, 3 года торговли.

Рисунок 2. Период обучения 2013–2018, 400 тыс. итераций (20 эпох по 20 тыс. шагов), период торговли 2019–2023. Результаты показывают значительное улучшение при более длинном периоде обучения (6 лет против 3) как для PPO, так и для CPPO. Однако PPO остаётся слишком волатильным. DeepSeek V3 немного лучше Llama 3.3 при прочих равных. В этом тесте использование LLM всегда ухудшает результат.

5.2. После обучения на 2 млн шагов

Рисунок 3
Рисунок 3. После обучения на 2 млн шагов (100 эпох по 20 тыс. шагов).
Таблица 1. Метрики результативности разных моделей на 100 эпохах.
МодельInformation RatioCVaRКоэффициент Рачева
PPO (100 эпох)0,0100−0,03941,0637
CPPO (100 эпох)−0,0148−0,04391,0404
PPO-DeepSeek (100 эпох)−0,0093−0,03380,9890
CPPO-DeepSeek (100 эпох)0,0078−0,04370,9818
Рисунок 4
Рисунок 4. После обучения на 2 млн шагов (100 эпох по 20 тыс. шагов) — второй прогон.

В этих двух прогонах (RL-агенты стохастичны) PPO и CPPO-DeepSeek превосходят прочие методы, включая бенчмарк Nasdaq-100. PPO, по-видимому, лучше работает на бычьих рынках, а CPPO-DeepSeek — на медвежьих; переход приходится на конец 2021 года, перед войной на Украине и последовавшим кризисом.

5.3. Влияние силы подмешивания LLM

В следующих тестах параметры силы подмешивания LLM изменяются от 10% до 0,1% (то есть параметры возмущения варьируются от диапазона 0,9–1,1 до диапазона 0,999–1,001).

Рисунок 5
Рисунок 5. Влияние подмешивания LLM на PPO.
Таблица 2. Метрики результативности PPO и вариантов PPO-DeepSeek.
МодельInformation RatioCVaRКоэффициент Рачева
PPO0,0100−0,03941,0637
PPO-DeepSeek 10%−0,0093−0,03380,9890
PPO-DeepSeek 1%−0,0252−0,04591,0394
PPO-DeepSeek 0,1%−0,0011−0,03750,9536

Для PPO-DeepSeek более сильное подмешивание LLM преимущественно ухудшает результат — даже при крошечных возмущениях в 0,1%.

Рисунок 6
Рисунок 6. Влияние подмешивания LLM на CPPO.
Таблица 3. Метрики результативности CPPO и вариантов CPPO-DeepSeek.
МодельInformation RatioCVaRКоэффициент Рачева
CPPO−0,0148−0,04391,0404
CPPO-DeepSeek 10%0,0078−0,04370,9818
CPPO-DeepSeek 1%−0,0032−0,03650,9573
CPPO-DeepSeek 0,1%−0,0060−0,04410,9789

Для CPPO-DeepSeek, напротив, более сильное подмешивание LLM улучшает результат.

6. Заключение

Мы предлагаем RL-агентов с подмешиванием LLM для алгоритмической торговли, интегрирующих торговые рекомендации и оценки риска из новостей. Направления дальнейшей работы:

Литература

Оригинал статьи: Benhenda, M., «FinRL-DeepSeek: LLM-Infused Risk-Sensitive Reinforcement Learning for Trading Agents», arXiv:2502.07393 · код: benstaf/FinRL_DeepSeek