Исследование конкурентного и сговорного поведения в алгоритмическом ценообразовании с глубоким обучением с подкреплением

7/10

Shidi Deng · School of Management, Technical University of Munich, Germany

Maximilian Schiffer · School of Management & Munich Data Science Institute, Technical University of Munich, Germany

Martin Bichler · School of Computation, Information and Technology, Technical University of Munich, Germany · 14 марта 2025

Оригинал: Deng, S., Schiffer, M. and Bichler, M. «Exploring Competitive and Collusive Behaviors in Algorithmic Pricing with Deep Reinforcement Learning», v1 — arxiv.org/abs/2503.11270 (PDF, 38 стр.).

Рис. 1–6 и 9–22 воспроизведены из оригинальной публикации (рис. 7–8 в PDF не извлечены отдельными файлами). Работа финансировалась Deutsche Forschungsgemeinschaft (DFG) — Projektnummer 277991500.

Ключевые слова: Algorithmic Pricing, Tacit Collusion, Reinforcement Learning, Market Competition.

Классификация arXiv: econ.GN

Аннотация

Значительная доля сектора business-to-consumer сегодня опирается на онлайн-платформы вроде Amazon и Alibaba и использует искусственный интеллект (ИИ) для ценовых стратегий. Это вызвало дискуссию о том, могут ли алгоритмы ценообразования молчаливо сговариваться и устанавливать сверхконкурентные цены, хотя явно для этого не проектировались. Наше исследование адресует эти опасения, изучая риск сговора, когда алгоритмы обучения с подкреплением (Reinforcement Learning, RL) принимают решения о ценовых стратегиях на конкурентных рынках.

Предшествующие работы в этой области сосредоточены на табличном Q-learning (Tabular Q-learning, TQL) и привели к противоречивым выводам о том, способны ли обучающиеся алгоритмы давать сверхконкурентные цены. Опираясь на это, наша работа вносит вклад в дискуссию более нюансированным численным исследованием, выходящим за рамки TQL: мы дополнительно охватываем off-policy и on-policy алгоритмы глубокого RL (Deep Reinforcement Learning, DRL) — две различные семьи DRL, недавно привлекшие внимание в алгоритмическом ценообразовании.

Мы изучаем несколько вариантов олигополии Бертрана и показываем, что алгоритмический сговор зависит от используемого алгоритма. В экспериментах TQL склонен к более высокому сговору и разбросу цен. Кроме того, он страдает от нестабильности и неравенства: агенты с более высокой скоростью обучения стабильно получают более высокую прибыль; он неустойчив к представлению состояния — ценовая динамика существенно меняется в зависимости от доступа к информации. Напротив, DRL-алгоритмы, такие как Proximal Policy Optimization (PPO) и Deep Q-Networks (DQN), в целом сходятся к более низким ценам, ближе к равновесию Нэша.

Дополнительно мы показываем: когда предобученные TQL-агенты взаимодействуют с DRL-агентами, последние быстро обходят первых, подчёркивая преимущества DRL в ценовой конкуренции. Наконец, конкуренция между разнородными DRL-алгоритмами (PPO и DQN) снижает вероятность сверхконкурентного ценообразования.

1. Введение

За последние два десятилетия значительная доля B2C-бизнеса перешла к ведущим онлайн-ритейлерам вроде Amazon и Alibaba. С ростом искусственного интеллекта и big data продавцы на этих платформах всё чаще полагаются на алгоритмы ценообразования для изучения рыночной динамики и эластичности спроса. На практике алгоритмы помогают адаптироваться к изменениям рынка, находить оптимальные стратегии и повышать эффективность принятия решений.

Однако реальные случаи показали, что алгоритмическое принятие решений может приводить к сговорным исходам — сверхконкурентным ценам и устойчивому сговору (Assad et al. 2020, Brown & MacKay 2021). В этом контексте алгоритмический сговор — феномен, при котором независимо работающие алгоритмы ценообразования учатся согласовывать цены выше равновесия Нэша, давая сверхконкурентные результаты, хотя алгоритмы явно не проектировались для сговора.

Хотя такие молчаливо сговорные исходы проблематичны с рыночной точки зрения, независимо работающие алгоритмы нельзя привлечь к ответственности за сговор из-за отсутствия коммуникации и взаимного понимания (Harrington 2018). Это создаёт серьёзные вызовы для регуляторов в применении конкурентного права и антимонопольной политики (Mehra 2015). Соответственно, автоматизированные алгоритмы ценообразования представляют потенциальный риск молчаливого сговора на современных рынках, привлекая внимание учёных, антимонопольных органов и практиков (Ezrachi & Stucke 2017b, Varian 2018, Agrawal et al. 2019). В этой статье мы фокусируемся на сверхконкурентных исходах выше равновесия Нэша и называем феномен алгоритмическим сговором или сговорными ценами.

Эти опасения выходят за рамки намеренно спроектированных манипулятивных алгоритмов и особенно актуальны для гипотетических или экспериментальных самообучающихся алгоритмов, нацеленных на максимизацию прибыли. Среди таких алгоритмов RL — широко изучаемый пример, позволяющий автономно учить ценовые стратегии через self-play без предварительных знаний и явного руководства разработчиков. На основе наблюдаемой истории цен алгоритмы могут координировать сговорное поведение для поддержания вне-равновесного состояния. Однако в большинстве практических настроек длина ценовой истории в представлении состояния ограничена: включение более длинных историй резко увеличивает пространство состояний и вычислительную сложность. Тем не менее мы анализируем этот аспект в нашем исследовании.

Если такая ценовая динамика существует, она представляет серьёзную угрозу рынкам, потенциально ведя к неэффективности в пользу компаний за счёт потребителей. Хотя многие цены сегодня всё ещё устанавливаются людьми, эти алгоритмы могут стать массовыми на розничных рынках в ближайшем будущем (OECD 2017). Раннее выявление проблем критично для предотвращения широкого внедрения с непредвиденными последствиями — искажения рынка и снижение конкуренции в алгоритмическом принятии решений.

До сих пор нет консенсуса, существует ли алгоритмический сговор и ведёт ли он к сверхконкурентным ценам, негативно влияющим на общественное благосостояние. Отсутствие консенсуса подчёркивает теоретические и практические трудности анализа молчаливого сговора между алгоритмами. С одной стороны, нет чётких стандартов обнаружения алгоритмического сговора на реальных рынках; пробелы в данных, усугублённые конфиденциальностью, осложняют строгий анализ. С другой — изучение через стилизованные рыночные модели позволяет обнаружить молчаливый сговор, сравнивая результаты с аналитическими равновесиями, но существующие анализы часто ограничены одним простым алгоритмом, что вызывает вопросы об обобщаемости.

Большинство работ фокусируется на TQL и утверждает: если простые алгоритмы учатся сговариваться, более сложные, включая deep learning, представят ещё больший риск (Calvano et al. 2020, Klein 2021). Несколько исследований изучали DRL в алгоритмическом ценообразовании (Liu et al. 2019, Chen et al. 2021), подчёркивая потенциал для стратегических ценовых решений. Хотя большинство анализов остаётся академическим, растущий интерес к DRL делает эти алгоритмы сильными кандидатами для реального применения. Детали реализаций редко раскрываются — фирмы скрывают проприетарные алгоритмы. В этом контексте наше исследование даёт более нюансированный численный анализ DRL за пределами классического RL для выявления рисков сговора.

Вклад. Статья продвигает изучение алгоритмического сговора систематическим анализом ценового поведения DRL-алгоритмов в конкурентных условиях. Опираясь на исследования TQL, мы расширяем анализ на более сложные on-policy и off-policy DRL-методы, включая PPO и DQN. Используя численный симуляционный каркас на моделях конкуренции Бертрана с различными спецификациями спроса, мы сравниваем ценовые стратегии, появление сверхконкурентных цен и рыночную стабильность между парадигмами обучения.

Наши результаты дают несколько ключевых инсайтов. Во-первых, TQL демонстрирует более высокую склонность к сговору, ведя к сверхконкурентным ценам и нестабильности. Агенты с более высокой скоростью обучения систематически превосходят более медленных, создавая несправедливую динамику. Во-вторых, DRL-агенты, особенно PPO и DQN, проявляют более конкурентное поведение, стабильно сходясь к ценам ближе к равновесию Нэша. При конкуренции с предобученными TQL-агентами DRL быстро их обходят, что указывает на смягчение рисков сговора продвинутыми RL-подходами. Наконец, взаимодействие разнородных DRL-агентов (PPO и DQN) дополнительно снижает вероятность сговорного поведения — разнообразие алгоритмов способствует конкуренции.

Наше исследование даёт углублённую оценку рисков алгоритмического сговора в DRL-ценообразовании и подчёркивает потенциал конкурентной динамики на алгоритмически управляемых рынках. Продвигая понимание RL в ценовой конкуренции, мы способствуем усилиям по проектированию более справедливых и конкурентных цифровых маркетплейсов.

Далее: раздел 2 — обзор литературы; раздел 3 — постановка задачи; раздел 4 — алгоритмический каркас; раздел 5 — дизайн эксперимента; раздел 6 — результаты и обсуждение; раздел 7 — заключение.

2. Обзор литературы

Наша работа тесно связана с двумя направлениями: применение RL-алгоритмов на рынках ценообразования и дискуссия о том, могут ли автоматизированные алгоритмы ценообразования приводить к сговору. Ниже кратко обозреваем оба потока.

Применение RL в рынках ценообразования

Исследования применения RL в ценообразовании существенно эволюционировали. Ранние работы фокусировались на базовых RL-алгоритмах, особенно TQL. Kephart & Tesauro (2000) показали, что TQL может сходиться к равновесию в симулированном рынке двух конкурирующих pricebots; Kutschinski et al. (2003) — способность находить near-optimal стратегии на multi-agent рынках, хотя с ограничением нулевого discount factor. Rana & Oliveira (2014) предложили TQL для ценообразования нескольких продуктов со взаимозависимым спросом; Kim et al. (2015) применили TQL на энергетических рынках. Эти работы демонстрируют гибкость TQL, но также ограничения в сложных динамических средах.

Недавний прогресс в ИИ и big data сместил фокус к DRL. Liu et al. (2019) впервые применили DRL для дискретного и непрерывного динамического ценообразования на реальных e-commerce платформах Alibaba с превосходством над ручным ценообразованием в field experiments. Qiu et al. (2020) предложили deep deterministic policy gradient для ценообразования электромобилей; Chen et al. (2021) изучили spatial-temporal pricing для ride-hailing с PPO; Yan et al. (2022) — иерархический RL для community energy trading. Эти работы подчёркивают универсальность DRL для разнообразных задач ценообразования.

Автоматизированное ценообразование и сговор

Второй поток изучает, как алгоритмы могут способствовать сговору — сверхконкурентным ценам и снижению благосостояния потребителей. Феномен привлёк внимание к антимонопольному праву (Werner 2023, Constantine & Quitaz 2018, Capobianco & Gonzaga 2020). Исследования algorithm-driven collusion фокусируются на эмпирических и simulation-based подходах.

Эмпирические работы ограничены, но ценны. Assad et al. (2020) на немецком розничном рынке бензина показали, что с 2017 года алгоритмическое ценообразование увеличило среднюю маржу станций на 9%. Brown & MacKay (2021) на розничном рынке США — рост дисперсии цен и сверхконкурентное ценообразование. Прямых доказательств автономного сговора алгоритмов нет, поэтому исследователи обращаются к синтетическим средам. Утверждения о способности TQL поддерживать сверхконкурентные цены часто опираются на академические симуляции (Azzutti et al. 2021, Buckmann et al. 2021).

Klein (2021) симулировал последовательное ценообразование с TQL и показал автономное обучение сговорному поведению без явного вмешательства. Calvano et al. (2020) применили TQL к конкуренции Бертрана с logit-спросом — алгоритм поддерживал сверхконкурентные цены через reward-punishment стратегии. Abada & Lambin (2023) на рынке электроэнергии (Cournot) наблюдали сходное поведение. Calvano et al. (2020) отмечают ограничение TQL — медленное обучение, часто сотни тысяч циклов для формирования сговора.

Ограничения TQL породили дебаты о валидности выводов. Abada et al. (2024) критиковали однопериодную reward-punishment схему Calvano et al. (2020), указывая на недостаточное исследование как ключевой драйвер сговора. Asker et al. (2022) подчеркнули зависимость сверхконкурентных цен от learning protocol; синхронное обучение с учётом поведения конкурентов может давать более конкурентные исходы. Meylahn & V. den Boer (2022) и Epivent & Lambin (2022) призвали к дальнейшим исследованиям.

Большинство работ фокусируется на базовых RL (Brero et al. 2022, Dolgopolov 2022, Sanchez-Cartas & Katsamakas 2022, Bichler et al. 2024), тогда как DRL в pricing collusion набирает внимание — DQN и PPO (Friedrich et al. 2024, Kastius & Schlosser 2022, Schlechtinger et al. 2023), что поддерживает наш выбор алгоритмов. Однако эти работы фокусируются на отраслевых моделях. Наше исследование охватывает DRL на нескольких вариантах олигополии Бертрана, давая более широкую перспективу.

3. Постановка задачи

Мы изучаем модель Бертрана (Bertrand 1883) — олигополистическую ценовую конкуренцию фирм с однородными продуктами. Каждая фирма использует независимый алгоритм ценообразования. Анализ фокусируется на дуополии двух фирм \(i = 0, 1\). Каждая производит продукт качества \(g\) с предельными издержками \(c\). Фирмы одновременно задают цены \(p_i\); потребители выбирают продукты по ценам; спрос \(d_i\) определяет прибыль \(r_i = (p_i - c) \times d_i\).

Фирмы максимизируют прибыль, устанавливая цены одновременно в повторяющихся раундах. В начале каждого раунда обе фирмы одновременно выбирают цены; по ним определяется спрос; взаимодействие переходит к следующему раунду.

Мы исследуем расширения модели Бертрана с различными допущениями о ёмкости, качестве и форме функции спроса. Ниже — характеристики рыночных моделей (раздел 3.1) и цены Нэша с монопольной ценой (раздел 3.2).

3.1. Рыночные модели

Три модели: Standard Bertrand, Bertrand-Edgeworth с ограничениями производственной ёмкости и Logit Bertrand.

Standard Bertrand. Продукты однородны; потребители выбирают более дешёвый. Функция спроса \(d(p) = 1 - p\). Для двух фирм с ценами \(p_i\) и \(p_{-i}\):

\[ d_i(p_i, p_{-i}) = \begin{cases} d(p_i) & \text{если } p_i < p_{-i}, \\ \frac{1}{2} d(p_i) & \text{если } p_i = p_{-i}, \\ 0 & \text{если } p_i > p_{-i}. \end{cases} \]

Фирма с более низкой ценой получает весь спрос; при равных ценах — поровну; предполагается неограниченная производственная ёмкость.

Bertrand-Edgeworth. Фирмы сталкиваются с ограничениями ёмкости (Edgeworth 1925), что может вести к ценам выше предельных издержек при полной загрузке мощностей. Для well-defined равновесий рассматриваем случай двух фирм с одинаковой ёмкостью \(k > 0.5\), ценами из \([0, 1]\) и спросом \(d(p) = 1 - p\):

\[ d_i(p_i, p_{-i}) = \begin{cases} \min\{k, d(p_i)\} & \text{если } p_i < p_{-i}, \\ \frac{1}{2} d(p_i) & \text{если } p_i = p_{-i}, \\ 0 & \text{если } p_i > p_{-i}. \end{cases} \]

Logit Bertrand. Ослабляем допущение, что потребители всегда покупают у самого дешёвого. По Calvano et al. (2020) — logit-модель спроса с постоянными предельными издержками; потребители распределяют расходы между фирмами по ценам:

\[ d_i(p_i, p_{-i}) = \frac{e^{(g-p_i)/\mu}}{\sum_{j=0}^{1} e^{(g-p_j)/\mu} + 1}, \]

где \(g - p_i\) — полезность покупки продукта \(i\); параметр \(\mu\) — степень горизонтальной дифференциации. При \(\mu \to 0\) продукты — perfect substitutes; большие \(\mu\) — большая дифференциация.

Рисунок 1 визуализирует функции прибыли \(r\) для всех трёх моделей.

Функции прибыли одной фирмы: Standard Bertrand, Bertrand-Edgeworth, Logit Bertrand
Рис. 1. Функции прибыли одной фirmы при Standard Bertrand, Bertrand-Edgeworth и Logit Bertrand в однородной дуополии. Logit Bertrand даёт гладкую выпуклую поверхность награды; Standard Bertrand — промежуточную; Bertrand-Edgeworth — наибольшие нерегулярности.

В Standard Bertrand поверхность прибыли симметрична и вогнута — отражает однородность и жёсткую конкуренцию «всё или ничего». В Bertrand-Edgeworth сохраняется сходная структура с влиянием ограничений ёмкости. В Logit Bertrand — большая асимметрия и более плавные переходы, отражающие дифференциацию и гетерогенность предпочтений.

3.2. Цена Нэша и монопольная цена

Три модели спроса по-разному влияют на конкуренцию и ключевые ценовые стратегии — цену Нэша \(p^N\) и монопольную \(p^M\). Ниже — определения и экономический смысл; это теоретическая основа для изучения эволюции ценового поведения и потенциала сговора.

Цена Нэша \(p^N\) — цена, при которой ни одна фирма не имеет стимула односторонне отклоняться, максимизируя прибыль. Равновесие стабильно: отклонение не даёт дополнительной выгоды. Вычисление \(p^N\) различается между моделями.

В Standard Bertrand фирмы с однородными продуктами непрерывно снижают цены, пока они не упадут до предельных издержек \(c\); дальнейшее снижение unprofitable — \(p^N = c\) (Bertrand 1883).

В Bertrand-Edgeworth при ограниченной ёмкости \(k > 0.5\) ценовая война также ведёт к \(p^N = c\) (Levitan & Shubik 1972).

В Logit Bertrand продукты не perfect substitutes; потребители выбирают вероятностно — \(p^N \neq c\). Фирмы оптимизируют прибыль:

\[ \frac{d}{dp_i} r_i = \frac{d}{dp_i}\big((p_i - c_i) d_i\big) = 0. \]

Цена Нэша находится одновременным решением для всех фirm; на практике — итеративный поиск по диапазону цен.

Монопольная цена \(p^M\) максимизирует совместную прибыль при координации фirm как единого субъекта. Обычно \(p^M > p^N\) — отсутствие конкуренции и монопольная выгода.

В Standard Bertrand при \(d(p) = 1 - p\), \(c = 0\): \(r(p) = p(1-p)\), \(\frac{dr}{dp} = 1 - 2p = 0\) даёт \(p^M = 0.5\); каждая фирма получает \(d_i(p^M) = 0.25\), \(r_i(p^M) = 0.125\).

В Bertrand-Edgeworth при \(k > 0.5\) монопольная цена совпадает со standard case: \(p^M = 0.5\).

В Logit Bertrand совместная прибыль \(r(p_0, p_1) = \sum_i (p_i - c_i) d_i(p_i, p_{-i})\); частные производные обнуляются численными методами. \(p^M\) обычно выше \(p^N\). Сравнение \(p^N\) и \(p^M\) показывает, насколько фirmы ведут себя сговорно.

4. Алгоритмический каркас

Формализуем алгоритмический каркас: сначала обучение агента в рамках MDP, затем RL-алгоритмы исследования.

4.1. Марковский процесс принятия решений

Анализируем динамику алгоритмического сговора в ценовых решениях RL-агентов. Каждый агент — фирма в ценовой конкуренции, максимизирующая прибыль. Процесс — бесконечный горизонт MDP.

Пространство состояний. В момент \(t\) состояние \(s_t\) — история ценовых решений длины памяти \(l\): \(S = \{s_t \mid s_t = (p_{i,t-k})_{i=0,1,\, k=1,\ldots,l}\}\). При \(l = 1\): \(s_t = (p_{i,t-1})_{i=0,1}\).

Пространство действий. Агент выбирает цену \(p_t \in A\) из диапазона \([\underline{p}, \bar{p}]\). Для Standard и Edgeworth Bertrand — \([0, 1]\). Для Logit Bertrand по Calvano et al. (2020): \(\underline{p} = p^N - \zeta(p^M - p^N)\), \(\bar{p} = p^M + \zeta(p^M - p^N)\). При дискретном \(A\) диапазон делится на \(m\) равных значений; при \(l=1\) размерность \(S = A \times A\) растёт квадратично с \(m\).

Динамика переходов. Решения \((p_{i,t})_{i=0,1}\) определяют переход к \(S_{t+1}\). Награда \(R_{i,t} = (p_{i,t} - c) d_i(p_{i,t}, p_{-i,t})\).

Цель. Максимизация дисконтированных будущих наград:

\[ G_t = \sum_{k=0}^{\infty} \gamma^k R_{t+k+1}, \]

где \(\gamma \in [0, 1)\) — discount factor.

4.2. RL-подходы и выбор алгоритмов

RL-методы делятся на value-based и policy-based.

Value-based методы оценивают \(V(s)\) или \(Q(s,a)\) и выбирают действия, максимизирующие ожидаемый return. Уравнение Беллмана:

\[ V^{\pi^*}(s_t) = \max_{a_t} Q^{\pi^*}(s_t, a_t) = \max_{a_t} \sum_{s_{t+1}} p(s_t, a_t, s_{t+1}) \big[r(s_t, a_t, s_{t+1}) + \gamma V^{\pi^*}(s_{t+1})\big]. \]

Policy-based методы напрямую оптимизируют стохастическую политику \(\pi_\theta(a_t \mid s_t)\):

\[ \eta(\theta) = \mathbb{E}_{\tau \sim \pi_\theta(\tau)} \left[\sum_t r(a_t, s_t)\right]. \]

Tabular RL работает в табличной постановке; value-based и policy-based реализуются и в DRL. DRL использует нейросети для аппроксимации value functions, policies или представлений состояний — подходит для высокоразмерных и нелинейных задач.

Для комплексного анализа рассматриваем tabular RL и DRL. Помимо TQL выбраны DQN (value-based) и PPO (policy-based). DQN хорош для дискретных action spaces в ценовой конкуренции; PPO — гибок для дискретных и непрерывных пространств с ограничением обновлений policy для стабильности. Для fair comparison с DQN и TQL используем дискретный вариант PPO.

TQL. Tabular Q-Learning (Watkins 1989) хранит \(Q(s,a)\) размерности \(|S| \times |A|\). Обновление:

\[ Q_{t+1}(s, a) = (1 - \alpha) Q_t(s, a) + \alpha \big[R_{t+1} + \gamma \max_{a'} Q_t(s', a')\big], \]

где \(\alpha\) — learning rate. Хорошо работает в малых пространствах, плохо масштабируется.

DQN. Deep Q-Networks (Mnih et al. 2015) аппроксимируют \(Q(s,a;\theta)\) нейросетью. Experience replay и target networks стабилизируют обучение.

PPO. Proximal Policy Optimization (Schulman et al. 2017) оптимизирует \(\pi(s,a;\theta)\) с clipped surrogate objective:

\[ L^{\mathrm{CLIP}}(\theta) = \mathbb{E}_t \Big[\min\big(r_t(\theta) \hat{A}_t,\; \mathrm{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t\big)\Big], \]

где \(r_t(\theta)\) — ratio вероятностей новой и старой policy, \(\hat{A}_t\) — advantage estimate, \(\epsilon\) — диапазон clipping.

Псевдокод всех трёх алгоритмов — в приложении B.

5. Дизайн эксперимента

Исследуем три варианта конкуренции Бертрана. В Standard и Edgeworth Bertrand предельные издержки \(c = 0\). В Logit Bertrand \(c = 1\) по Calvano et al. (2020). В Bertrand-Edgeworth ёмкость \(k = 0.6\) у обоих агентов.

В Logit Bertrand: качество \(g = 2\), substitutability \(\mu = 0.25\). В Standard и Edgeworth: \(p^N = 0\), \(p^M = 0.5\), \(\pi^N = 0\), \(\pi^M = 0.125\). В Logit: \(p^N = 1.473\), \(p^M = 1.925\), \(\pi^N = 0.223\), \(\pi^M = 0.337\).

Согласованность алгоритмов и параметров. Для всех DRL — fully-connected feedforward сеть с двумя скрытыми слоями по 64 узла, ReLU, оптимизатор Adam. PPO настроен на дискретное action space как TQL и DQN. \(m = 15\) ценовых опций. В Logit Bertrand relaxation parameter \(\eta = 0.1\).

Конфигурация и сходимость. Два RL-агента симулируют две фirmы; фокус на TQL, DQN, PPO. Единый критерий сходимости для трёх алгоритмов не задан — каждый запускается на достаточно длинном горизонте \(T\) по эмпирической стабилизации цен. PPO сохраняет exploration; DQN подвержен catastrophic forgetting без decay learning rate. Горизонт \(T\) выбран по наблюдаемой стабильности цен и прибылей.

Эксперименты на AMD Ryzen 9 7950X (32 ядра @ 4.5 GHz), 128 GB RAM, NVIDIA RTX 4090 (24 GB). Каждый эксперимент — 20 независимых прогонов; отчитываем среднее и стандартное отклонение.

Критерии оценки. Два индикатора по Calvano et al. (2020): Relative Price Deviation Index (RPDI) и нормализованная прибыль \(\Delta\). RPDI измеряет цену относительно Нэша и монополии; \(\Delta\) — среднюю прибыль, нормализованную к \(\pi^N\) и \(\pi^M\). Используем средние за последние 10 000 шагов.

\[ \hat{p}_i = \frac{\bar{p}_i - p^N}{p^M - p^N}, \qquad \Delta_i = \frac{\bar{\pi}_i - \pi^N}{\pi^M - \pi^N}. \]

Значения около 0 — perfect competition; около 1 — склонность к сговору.

6. Результаты

Кратко обозначим пять блоков результатов: влияние learning rate в TQL; взаимодействие одинаковых RL-агентов; сравнение DRL и TQL; конкуренция разнородных DRL; влияние определения state space; затем обсуждение драйверов различий.

6.1. Влияние скорости обучения на стабильность рынка в TQL

Анализируем, как learning rates влияют на ценовые стратегии при конкуренции двух TQL-агентов. Agent 0 получает более высокий \(\alpha\), чем Agent 1. Exploration: \(\epsilon(t) = e^{-\beta t}\). Learning rates из \([0.01, 0.05, 0.1, 0.5]\) — шесть комбинаций. Сравниваем разности RPDI и \(\Delta\) относительно Agent 1; boxplots по 20 прогонам.

Основные выводы (Logit Bertrand). Рис. 2 показывает: агенты с более высоким \(\alpha\) агрессивнее корректируют цены и часто превосходят конкурентов. При большом разрыве (например, 0.5_0.01) Agent 0 ставит более низкие цены и захватывает большую долю рынка. В 0.5_0.01 прибыль Agent 0 существенно выше. При схожих learning rates различия сокращаются (0.5_0.1) — более сбалансированная конкуренция.

Logit Bertrand: разности RPDI и Δ между Agent 0 и Agent 1
Рис. 2. Logit Bertrand: разности RPDI и \(\Delta\) между Agent 0 и Agent 1. Отрицательная разность RPDI — Agent 0 ставит более низкие цены; положительная разность \(\Delta\) — Agent 0 получает более высокую прибыль.

В Standard и Edgeworth Bertrand (приложение A) тренды согласуются: более высокий learning rate — более низкие цены, эффект слабее, чем в Logit. Edgeworth — большая волатильность; при больших разрывах (0.5_0.01, 0.1_0.01) быстрые агенты стабильно прибыльнее.

Импликации. Высокий learning rate даёт преимущество в скорости адаптации, но создаёт структурное неравенство в пользу быстрых агентов. Фиксированные learning rates в TQL трудно сбалансировать. Дисбаланс может дестабилизировать рынок — доминирование агрессивных undercutters, снижение разнообразия, монополистическое поведение.

Insight 1. Более высокие learning rates в TQL ведут к агрессивному ценообразованию; быстро обучающиеся агенты получают значительное преимущество в более низких ценах и более высокой прибыли при больших разрывах \(\alpha\). Это создаёт структурные biases и риск дестабилизации — TQL не подходит для справедливой конкуренции.

6.2. Ценовое поведение одинаковых RL-агентов

Литература утверждает: идентичные стратегии могут повышать вероятность сговора (Ezrachi & Stucke 2017a, Beneke & Mackenrodt 2019) — hub-and-spoke сценарии, когда фirmы используют схожее ПО третьих сторон (Amazon, eBay — Chen et al. 2016; OTA — Wang et al. 2023).

Эксперименты с двумя homogeneous RL-агентами с идентичными параметрами и протоколами обучения; траектории расходятся из-за sampling paths. Baseline — два homogeneous TQL; DRL — 100 000 шагов; TQL — 1 000 000 шагов; 20 random seeds.

Основные выводы (Logit Bertrand). Рис. 3(a): PPO плотно кластеризует цены около \(p^N\); DQN — симметрично около Нэша; TQL — широкое асимметричное распределение со смещением к монопольным ценам.

Тепловые карты распределения цен для homogeneous DQN, PPO, TQL
Рис. 3. Тепловые карты выбора цен homogeneous DQN, PPO и TQL за последние 10 000 шагов (20 прогонов). Кластеризация около \(p^N\) — конкуренция; около \(p^M\) — сговор.

Рис. 4(a): DQN — \(\Delta \approx 0.1\); PPO — \(\Delta \approx 0\); TQL — \(\Delta \approx 0.6\) с большей вариативностью — более высокая прибыль, но меньшая стабильность.

В Standard и Edgeworth Bertrand (рис. 3(b,c)) DQN и PPO демонстрируют более dispersive ценовое поведение, хотя цены всё ещё кластеризуются около \(p^N\). Эта дисперсия отражает сниженную ценовую стабильность по сравнению с Logit Bertrand. TQL, напротив, показывает концентрированные распределения около монопольных цен с меньшей вариативностью — последовательное предпочтение high-price стратегий.

Рис. 4: в Standard и Edgeworth DQN \(\Delta \approx 0.3\) — более высокая склонность к supra-competitive pricing, чем в Logit. PPO \(\approx 0\) в Standard и \(\approx 0.34\) в Edgeworth — сильное конкурентное поведение. TQL \(\approx 0.5\) в обеих моделях — чуть ниже, чем 0.6 в Logit, suggesting marginally reduced collusion.

Импликации. DRL-агенты адаптируются и сходятся к конкурентным стратегиям около \(p^N\), особенно в Logit Bertrand. В Standard и Edgeworth — reduced pricing stability с большей dispersion. TQL consistently favoring high-price стратегии — collusion at the cost of stability and competitiveness.

Нормализованная прибыль Δ по трём моделям Бертрана
Рис. 4. Сравнение нормализованной прибыли \(\Delta\) по трём моделям. \(\Delta\) ближе к 0 — прибыль около Нэша; ближе к 1 — монопольная прибыль, сговор.

Insight 3. Homogeneous DRL (DQN, PPO) адаптируются к разным моделям спроса — сильная конкуренция около \(p^N\) в Logit, меньшая стабильность в Standard/Edgeworth. TQL стабильно favoring цены близкие к монополии — collusion.

6.3. Сравнение DRL и TQL в конкурентном ценообразовании

TQL предобучается перед взаимодействием с DRL-конкурентом — отражает incumbent с устоявшейся TQL-стратегией против newcomer на DRL. TQL предобучен 1 000 000 шагов двумя homogeneous агентами; в фазе взаимодействия не обновляется. 100 000 шагов, 100 epochs по 1000; DRL учится с нуля.

Основные выводы (Logit Bertrand). TQL стабилен около 1.8 (vs DQN) и 1.75 (vs PPO) — близко к \(p^M\). DQN и PPO снижают цены до ~1.6. Рис. 5 — learning curves; рис. 6 — \(\Delta\): DQN и PPO преимущественно выше 1.0; TQL около 0 с высокой вариативностью.

Logit Bertrand: кривые обучения цен TQL vs DQN и TQL vs PPO
Рис. 5. Logit Bertrand: кривые обучения цен — TQL vs DQN (слева) и TQL vs PPO (справа). 20 прогонов, среднее и 95% CI.
Logit Bertrand: boxplots нормализованной прибыли Δ TQL vs DQN и TQL vs PPO
Рис. 6. Logit Bertrand: boxplots \(\Delta\) — TQL vs DQN (слева) и TQL vs PPO (справа). DQN и PPO достигают более высокой прибыли с меньшей дисперсией.

Standard и Edgeworth (приложение A, рис. 13–16) подтверждают: TQL consistently поддерживает high-price стратегию около монополии. DQN и PPO сходятся к competitive low-price strategies с superior profitability. Edgeworth Bertrand — slightly higher volatility в pricing и profit trends, но DRL still outperform TQL.

Импликации. Ограничения TQL — static nature и inability dynamically adapt к стратегиям конкурентов. DRL excel в dynamic environments, learning competitive strategies → lower prices и higher profitability. Consistent performance DQN и PPO across Bertrand models underscores adaptability для automated pricing. Practitioners: transition от TQL к advanced DRL для competitive pricing.

Insight 2. DRL (DQN, PPO) стабильно превосходят TQL, сходясь к более низким ценам и более высокой стабильной прибыли — superior adaptability для конкурентного ценообразования.

6.4. Ценовое поведение разнородных DRL-агентов

Два heterogeneous агента: DQN и PPO в Bertrand competition. Два параллельных environment: в DQN-env Agent 0 — PPO, Agent 1 — DQN; в PPO-env наоборот. Веса policy обмениваются каждые 1000 шагов — agents integrate complementary strategies из alternate environment.

Комментарий к дизайну: мы intentionally разделяем обучение DQN и PPO в independent environments, чтобы избежать conflicts от distinct learning mechanisms. DQN (off-policy) — frequent updates via experience replay; PPO (on-policy) — complete trajectory collection, less frequent larger adjustments. Mixing в одной среде disrupt PPO stability. Setup replicates real-world conditions, где companies adapt algorithms gradually на long-term strategies.

Основные выводы (Logit Bertrand). В PPO-environment (рис. 7): PPO стабилизируется около \(p^N\); DQN повышает цену к \(p^M\). PPO — прибыль около монопольной; DQN — около Нэша. В DQN-environment (рис. 8): сходные mean prices; PPO стабильнее; изначально DQN чуть прибыльнее, затем PPO догоняет.

Примечание: рис. 7–8 в оригинале — двухпанельные графики цен и прибыли; отдельные PNG не извлечены скриптом.

Standard/Edgeworth (приложение A, рис. 17–20): в PPO-env PPO — low-price ~0.4, monopoly-level profit; DQN — higher prices, Nash-level profit. В DQN-env в Standard Bertrand DQN stabilizes at slightly lower prices than PPO, achieving higher profits — role reversal highlights influence learning environment. Edgeworth — profit gap narrows, overlapping curves; increased complexity diminishes algorithmic differences.

Импликации. PPO's consistent advantage в competitive low-price strategies и higher profits across most scenarios. DQN — environment-specific strengths, particularly DQN environment в Standard Bertrand. Narrowing profit gap в Edgeworth — market complexity reduces algorithmic differences. Findings highlight need consider market dynamics при deploying DRL в real-world settings.

Insight 4. PPO consistently ниже цены и выше прибыль; DQN — зависит от environment. В Edgeworth gap сужается — влияние сложности рынка.

6.5. Влияние дизайна пространства состояний

Как определения state space влияют на homogeneous TQL (DQN/PPO менее чувствительны). Полная информация: \(S = \{s_t \mid s_t = (p_{i,t-k})_{i=0,1,\, k=1,\ldots,l}\}\), размерность \(2l\). Ограниченная: только собственные цены — размерность \(l\). Три длины памяти \(l \in \{1,2,3\}\); 1 000 000 шагов; 20 seeds; метрики за последние 10 000 шагов.

Основные выводы (Logit Bertrand). Рис. 9: при полной информации (k1, k2, k3) нормализованные цены снижаются с длиной памяти, но остаются выше Нэша. При только self-information (self_k1, self_k2, self_k3) цены растут с памятью; при короткой памяти (self_k1, self_k2) — convergence около Нэша (рис. 10).

Logit Bertrand: boxplots RPDI и Δ по определениям состояния
Рис. 9. Logit Bertrand: boxplots нормализованной цены и прибыли по state definitions (20 прогонов). С информацией о конкуренте (k1–k3) цены снижаются с памятью, но остаются supra-competitive; без неё — более конкурентное ценообразование.
Logit Bertrand: кривые цен TQL при полной и ограниченной информации
Рис. 10. Logit Bertrand: кривые цен homogeneous TQL при полной информации (k1) и ограниченной (self_k1), \(l=1\). Доступ к ценам конкурента — supra-competitive pricing; ограниченная информация — convergence ближе к \(p^N\).

Standard и Edgeworth (приложение A, рис. 21–22) — согласованные тренды с minor variations; consistency reinforces generalizability.

Импликации. Availability opponent information crucially shapes pricing behavior homogeneous TQL agents. С полной информацией supra-competitive pricing persists, gradually declining с memory length. Relying solely на own pricing history — more competitive strategies, prices converging near Nash equilibrium.

Insight 5. С информацией о конкуренте TQL снижает цены с длиной памяти, но остаётся выше Нэша. Без неё — более конкурентные стратегии при короткой памяти. Богатое state space sustains higher, less competitive prices.

6.6. Обсуждение

Два вопроса: (1) почему DRL (DQN, PPO) менее склонны к сговору, чем TQL; (2) почему PPO ставит более низкие цены, чем DQN.

Сговор: TQL vs DRL. TQL foster collusion через сильные temporal correlations — немедленное обновление Q-values после каждого experience быстро закрепляет supra-competitive стратегии при относительно стабильных states/actions. DQN с experience replay разрушает temporal correlations — сложно stabilizировать collusive pricing. PPO обновляет policy incrementally — не lock-in на high prices. Non-stationarity multi-agent learning дополнительно ограничивает collusion в DRL: networks обновляются по random samples прошлого — нет стабилизации на сговорных ценах.

Цены: PPO vs DQN. Policy gradient (PPO) естественно favor competitive pricing; теоретически может достигать Nash (Hambly et al. 2023, Shi & Zhang 2020). DQN с \(\epsilon\)-greedy и replay — риск overfitting к local optima (supra-competitive); ограниченное exploration lower-price strategies. Clipping в PPO — stable refinement; DQN — outdated experiences, oscillation. PPO robust optimization → lower prices и higher profits в Bertrand competition.

7. Заключение

Статья вносит вклад в дискурс об алгоритмическом ценообразовании, сравнивая конкурентное и сговорное поведение RL-алгоритмов на олигополистических рынках через симуляции Bertrand competition — TQL, DQN, PPO.

TQL consistently склонен к supra-competitive pricing и collusion при доступе к информации о конкуренте; asymmetry по learning rates. DRL (PPO, DQN) — более конкурентное поведение, цены ближе к Нэшу. Предобученный TQL проигрывает DRL; разнородные DRL further снижают collusion — algorithmic diversity fosters competition.

Для business: выбор алгоритма критичен — DRL даёт более конкурентные stable outcomes. Для regulators: diversity pricing algorithms — natural countermeasure против tacit collusion.

Future work: более сложные market structures, MARL с dynamic entry/exit; regulatory interventions (price caps, transparency); sensitivity к demand elasticity и preference heterogeneity; field experiments.

Благодарности. Работа финансировалась Deutsche Forschungsgemeinschaft (DFG) — Projektnummer 277991500.

Декларация об использовании generative AI. При подготовке работы авторы использовали ChatGPT-4o для улучшения стиля и грамматики; после использования инструмента авторы проверили и отредактировали содержание и несут полную ответственность за публикацию.

Приложение A. Дополнительные результаты

A.1. Дисбаланс рынка из-за learning rate в TQL

Standard и Edgeworth Bertrand (рис. 11–12): более высокий learning rate — более низкие цены; эффект слабее Logit; Edgeworth — большая волатильность; при больших разрывах быстрые агенты прибыльнее.

Standard Bertrand: RPDI и Δ между агентами
Рис. 11. Standard Bertrand: разности RPDI и \(\Delta\) между Agent 0 и Agent 1.
Edgeworth Bertrand: RPDI и Δ между агентами
Рис. 12. Edgeworth Bertrand: разности RPDI и \(\Delta\) между Agent 0 и Agent 1.

A.2. DRL vs TQL: превосходные ценовые стратегии

Standard и Edgeworth (рис. 13–16) подтверждают Logit: TQL — high-price около монополии; DQN и PPO — competitive low-price, higher stable profits.

Standard Bertrand: кривые цен TQL vs DQN и TQL vs PPO
Рис. 13. Standard Bertrand: кривые обучения цен TQL vs DQN (слева) и TQL vs PPO (справа).
Standard Bertrand: boxplots Δ TQL vs DQN и TQL vs PPO
Рис. 14. Standard Bertrand: boxplots \(\Delta\) — TQL vs DQN и TQL vs PPO.
Edgeworth Bertrand: кривые цен TQL vs DQN и TQL vs PPO
Рис. 15. Edgeworth Bertrand: кривые обучения цен TQL vs DQN и TQL vs PPO.
Edgeworth Bertrand: boxplots Δ
Рис. 16. Edgeworth Bertrand: boxplots \(\Delta\) — TQL vs DQN и TQL vs PPO.

A.3. Взаимодействие разнородных DRL

Standard Bertrand (рис. 17–18): PPO — low-price в PPO-env, monopoly profit; DQN — higher prices, Nash profit. Edgeworth (рис. 19–20): profit gap сужается, overlapping curves.

Standard Bertrand: результаты в PPO environment
Рис. 17. Standard Bertrand, PPO environment: динамика цен (слева) и прибыль (справа).
Standard Bertrand: результаты в DQN environment
Рис. 18. Standard Bertrand, DQN environment: динамика цен и прибыль.
Edgeworth Bertrand: результаты в PPO environment
Рис. 19. Edgeworth Bertrand, PPO environment: цены и прибыль.
Edgeworth Bertrand: результаты в DQN environment
Рис. 20. Edgeworth Bertrand, DQN environment: цены и прибыль.

A.4. Влияние определений состояния на TQL

Standard Bertrand (рис. 21): без информации о конкуренте (self_k1) — competitive pricing около Нэша; с полной информацией (k1–k3) — более низкие цены с ростом памяти. Edgeworth (рис. 22): при полной информации больше state information — consistently lower pricing.

Standard Bertrand: RPDI и Δ по state definitions
Рис. 21. Standard Bertrand: без opponent info (self_k1) — competitive pricing около \(p^N\); с полной info (k1–k3) — lower prices; только self (self_k2, self_k3) — higher prices с длиной памяти.
Edgeworth Bertrand: влияние state information
Рис. 22. Edgeworth Bertrand: при полной информации о конкуренте (k1–k3) больше state information — consistently lower pricing.

Приложение B. Псевдокод алгоритмов

B.1. TQL

TQL — value-based, model-free алгоритм (Watkins 1989). Q-table размерности \(|S| \times |A|\); обновление уравнением Беллмана:

\[ Q_{t+1}(s, a) = (1 - \alpha) Q_t(s, a) + \alpha \big(r_t + \gamma \max_{a \in A} Q_t(s', a)\big). \]

Algorithm 1 (Tabular Q-learning): (1) Initialize \(Q(s,a)\) arbitrarily; (2) Initialize \(S_1\); (3) for \(t=1\) to \(T\): with probability \(\epsilon_t\) play random action \(A_t\), else \(A_t = \arg\max_a Q(S_t, a)\); observe \(R_{t+1}, S_{t+1}\); update \(Q(S_t, A_t) \leftarrow Q(S_t, A_t) + \alpha[R_{t+1} + \gamma \max_a Q(S_{t+1}, a) - Q(S_t, A_t)]\).

TQL requires trying all actions in all states для balance exploration/exploitation. \(\epsilon\)-greedy: random with prob. \(\epsilon_t\), greedy with \(1-\epsilon_t\). \(\epsilon_t = \exp(-\beta t)\) decreases over time — initially explore more, gradually exploit. Prevents premature convergence к suboptimal policies while improving efficiency focusing high-reward actions.

B.2. DQN

Algorithm 2 (DQN): Initialize local network \(Q(s,a;\theta)\), target \(\hat{Q}(s,a;\hat{\theta})\) with \(\hat{\theta}=\theta\), average reward \(\bar{R}\), state \(S_1\). Each step: \(\epsilon_t\)-greedy action; store transition in buffer \(B\); sample minibatch; target \(Y_j = R_{j+1} - \bar{R} + \max_a \hat{Q}(S_{j+1}, a, \hat{\theta})\); gradient descent on \([Y_j - Q(S_j, A_j, \theta)]^2\); update \(\bar{R}\); every \(C\) steps sync \(\hat{Q} \leftarrow Q\).

DNN: \(f(s) = W_2 \sigma(W_1 s + v_1) + v_2\). Experience replay reduces correlation; target network enhances stability. Mini-batch gradient update \(\theta_{\mathrm{new}} = \theta_{\mathrm{old}} - \alpha \nabla_\theta J(\theta_{\mathrm{old}})\). Despite computational demands, DQN integrates deep learning with RL — some researchers believe DQN accelerates collusive behavior (authors test this empirically and find opposite for their setting).

B.3. PPO

Algorithm 3 (PPO-Clip): Input \(\theta_0, \phi_0\). For \(k=0,1,2,\ldots\): collect trajectories \(D_k\) running \(\pi_k = \pi(\theta_k)\); compute rewards-to-go \(\hat{R}_t\) and advantages \(\hat{A}_t\); update policy maximizing clipped objective over batch; fit value function \(V_\phi\) by regression on \((V_\phi(s_t) - \hat{R}_t)^2\).

Clipping mitigates instability from excessively large updates. \(r_t(\theta) = \pi_\theta(a_t|s_t)/\pi_{\theta_k}(a_t|s_t)\); clip restricts \(r_t(\theta) \in [1-\epsilon, 1+\epsilon]\), capping objective when ratio exceeds range. Compared to DQN, PPO avoids Q-value overestimation; naturally suited for continuous actions (here discrete variant for fair comparison). Sensitive to hyperparameters \(\epsilon\) and learning rate.

Литература

Оригинал статьи: Deng, Schiffer and Bichler, «Exploring Competitive and Collusive Behaviors in Algorithmic Pricing with Deep Reinforcement Learning», arXiv:2503.11270