Как читать этот разбор. Формул в работе нет, поэтому основной объём здесь это проверка заявлений и извлечение того немногого, что применимо. Если нужен только полезный остаток, начните сразу с третьего раздела.
1. Как к этой работе относиться
Вопрос о независимости здесь не придирка, а первое, что определяет вес всех цифр. Работа сравнивает трейдеров, торгующих вручную, с трейдерами, пользующимися ИИ-инструментами. Выпускает её AIProp, проп-фирма, чей продукт и есть ИИ-ассистированная торговля. Данные внутренние и не могут быть проверены никем снаружи. Раздела о конфликте интересов в работе нет: дисклеймер в конце говорит только о том, что это не инвестиционный совет.
Для сравнения, в барьерной модели Villahermosa автор, куда менее заинтересованный, приводит абзац о том, что сам торговал такие счета и продаёт рознице индикаторы. Здесь заинтересованность прямая и коммерческая, а раскрытия нет.
При этом работа делает несколько вещей, за которые её следует похвалить, и они редки в маркетинговых материалах. Дизайн честно назван нерандомизированным наблюдательным. Всюду написано «связано с», а не «вызывает», и это оговорено отдельной врезкой на первой странице. Раздел ограничений перечисляет пять пунктов, включая самоотбор когорт и то, что ИИ-когорта объединяет три разнородных подтипа. Рекомендуемые следующие шаги (сопоставленные когорты, анализ до и после на 47 переключившихся, проспективное рандомизированное распределение) это ровно то, что следовало бы сделать.
Итог: как доказательство пользы ИИ работа не годится. Как каталог операциональных определений поведенческих событий, вычисляемых из журнала сделок, она полезна, и именно ради этого её стоит держать.
2. Что заявлено
Двадцатичетырёхмесячное наблюдательное исследование 1 000 проп-трейдеров. Ключевые цифры:
| Метрика | Вручную (n = 490) | С ИИ (n = 510) | Разница |
|---|---|---|---|
| Средний Шарп | 0.62 (SD 0.41) | 0.89 (SD 0.35) | +0.27 (+44 %) |
| Средняя максимальная просадка | 7.8 % (SD 2.9 %) | 4.3 % (SD 1.8 %) | −3.5 п.п. (−45 %) |
| Отношение времени удержания убытка к прибыли | 4.1× (ДИ 3.8–4.4) | 1.7× (ДИ 1.6–1.8) | −2.4× (−59 %) |
| Доля нарушений правил | 18.4 % (90/490; ДИ 15.1–22.1) | 12.2 % (62/510; ДИ 9.5–15.4) | −6.2 п.п. (p < 0.01) |
| Эмоциональные выходы | 61.7 % выходов | 37.2 % выходов | −24.5 п.п. (p < 0.001) |
| Profit factor | 1.21 (SD 0.38) | 1.58 (SD 0.29) | +0.37 (+31 %) |
| Индекс соблюдения риска | 61.4 % | 88.9 % | +27.5 п.п. (+45 %) |
Что такое коэффициент Шарпа. Доходность, делённая на её же размах колебаний. Отвечает на вопрос «сколько прибыли получено на единицу тряски». Выше значит лучше, около 1 для розничного трейдера считается хорошим. В работе не указано, за какой период он считается и как приводится к году, что делает сравнение с чужими числами невозможным.
Что такое profit factor. Сумма всех выигрышей, делённая на сумму всех проигрышей. Единица это безубыточность. Значение 1.21 означает, что на каждый потерянный доллар заработан доллар и двадцать один цент.
Что такое процентный пункт. Разница двух процентов. Переход с 18.4 % на 12.2 % это 6.2 процентных пункта, но 34 процента относительного снижения. Путать эти две вещи обычный способ преувеличить результат, и здесь работа как раз аккуратна: пишет и то, и другое.
Что такое доверительный интервал. Диапазон, в котором с заданной уверенностью (обычно 95 %) лежит истинное значение. Если интервалы двух групп перекрываются, разница между ними не установлена.

Как его читать. Две пары горизонтальных полос. Слева средняя максимальная просадка (ось от 0 до 10 %), справа доля нарушений правил (ось от 0 до 25 %). Одна полоса в каждой паре это ручная когорта, вторая ИИ.
Что нужно увидеть. Ровно те же четыре числа, что в таблице выше: 7.8 % против 4.3 % и 18.4 % против 12.2 %. Рисунок не добавляет ни одного нового факта, он оформительский. Полосы примерно пропорциональны значениям, шкала не обрезана, подтасовки в самой графике нет.
Практический вывод. Обратите внимание, чего на рисунке нет: доверительных интервалов. В таблице они есть, и для доли нарушений это 15.1–22.1 % против 9.5–15.4 %. На рисунке же две полосы выглядят как два точных числа.
Семь искажений и как они измеряются
Это самая полезная часть работы. Каждое поведенческое искажение сведено к правилу, которое считается из журнала сделок автоматически.
| Искажение | Суть | Как измеряется | Вес в индексе |
|---|---|---|---|
| Эффект диспозиции | продавать прибыль рано, держать убыток долго | отношение времени удержания убыточных к прибыльным за сессию; балл = max(0, отношение − 1.0) × 10, потолок 100 | 22 % |
| Неприятие убытка | двигать стоп, держать сверх допустимого | доля сделок, где стоп сдвинут дальше от входа после открытия | 20 % |
| Сверхуверенность | перебор сделок, перебор размера | отклонение частоты сделок от базового уровня за 30 дней плюс коэффициент вариации размера позиции | 18 % |
| Якорение | фиксация на цене входа и круглых числах | доля сделок с заявленной целью, закрытых вручную на другом уровне без записи об изменении тезиса | 14 % |
| Ментальный учёт | считать прибыль сессии деньгами казино | увеличение размера позиции после прибыли сессии выше 1.5 средних дневных | 12 % |
| Стадность | входы вдогонку | доля входов после движения в 1.5 среднедневного диапазона без плана | 8 % |
| Недавность и отыгрыш | импульсивное отыгрывание убытка | доля входов в течение 30 минут после выбивания стопа, равным или большим размером | 6 % |
Веса откалиброваны логистической регрессией на исходе «событие нарушения» по обучающему набору 2022–2023, 3 400 счетов. Сумма весов равна ровно 100 %, проверено.
Три дополнительные метрики:
- Discipline Score, 0–100 это доля сделок, прошедших все пять проверок соответствия плану. Средний балл 51.3 вручную против 73.8 с ИИ.
- Индекс соблюдения риска это доля сделок в пределах заявленного риска на сделку. 61.4 % против 88.9 %, корреляция с исходом счёта 0.74 (p < 0.001).
- Эмоциональный выход это любой выход, где стоп был сдвинут, либо выход не был запланирован, либо вход последовал в пределах 30 минут после выбивания стопа.
Состав выборки
| Когорта | N | Доля | Стадия счёта |
|---|---|---|---|
| Вручную, без ИИ и советников | 490 | 49.0 % | 277 оценка / 213 фондированных |
| ИИ-ассистированная дискреционная | 183 | 18.3 % | 101 / 82 |
| Советник по правилам | 198 | 19.8 % | 112 / 86 |
| Гибрид: ИИ плюс контроль человека | 129 | 12.9 % | 68 / 61 |
| Итого | 1 000 | 100 % | 558 / 442, около 128 000 сделок |
Все суммы пересчитаны и сходятся: подкогорты ИИ дают 510, стадии дают 558 и 442.
3. Что не сходится
3.1 Одно из семи относительных изменений посчитано неверно
Пересчёт всех семи заголовочных процентов:
| Метрика | Было и стало | Пересчёт | Заявлено |
|---|---|---|---|
| Просадка | 7.8 → 4.3 | 44.9 % | 45 % ✓ |
| Эмоциональные выходы | 61.7 → 37.2 | 39.7 % | 41 % ✗ |
| Шарп | 0.62 → 0.89 | 43.5 % | 44 % ✓ |
| Нарушения | 18.4 → 12.2 | 33.7 % | 34 % ✓ |
| Индекс соблюдения риска | 61.4 → 88.9 | 44.8 % | 45 % ✓ |
| Profit factor | 1.21 → 1.58 | 30.6 % | 31 % ✓ |
| Время удержания | 4.1 → 1.7 | 58.5 % | 59 % ✓ |
Шесть из семи округлены корректно. Седьмое, снижение эмоциональных выходов, даёт 39.7 %, а заявлено 41 %. В резюме работы стоит "Emotionally-driven exits: 37.2% (AI) vs. 61.7% (manual) — 41% reduction", в выводах "AI-assisted trading associated with 41% fewer emotionally-driven exits". Цифра тиражирована трижды: в аннотации, в резюме и в разделе выводов. Ошибка невелика по модулю, но она единственная в наборе, где все остальные аккуратны, и смещена в выгодную сторону.
3.2 Хи-квадрат не соответствует ни одному из заявленных размеров выборки
В выводах стоит дословно: "37.2% vs. 61.7% (−24.5 pp; chi-square = 142.3; p < 0.001)".
Что такое хи-квадрат. Мера расхождения между наблюдаемыми частотами и теми, которых ожидали бы при отсутствии связи. Растёт с размером выборки: одна и та же разница в процентах на большой выборке даёт большое значение, на маленькой малое. Поэтому по значению хи-квадрат можно восстановить, сколько наблюдений было.
Пересчёт при разных единицах наблюдения:
| Единица наблюдения | n на группу | Хи-квадрат |
|---|---|---|
| Трейдеры | 490 / 510 | 60.0 |
| Сделки (около 128 000 пополам) | 64 000 / 64 000 | 7 684 |
| Что соответствует заявленному | ≈ 1 186 / 1 186 | 142.4 |
Заявленное значение 142.3 не соответствует ни числу трейдеров, ни числу сделок. Оно соответствует выборке около 1 186 наблюдений на группу, то есть примерно 2 370 выходам суммарно, и такая величина в работе не фигурирует нигде. Знаменатель главного теста значимости не назван и не восстанавливается из текста.
Это не мелочь: эмоциональные выходы заявлены как доля выходов, а не трейдеров, и при 128 000 сделок выходов должно быть на два порядка больше. Либо тест проведён на подвыборке, о которой не сказано, либо значение посчитано не по тем данным, что описаны.
3.3 Одно и то же число 73 % обозначает два разных утверждения
В таблице семи искажений, строка про отыгрыш, колонка ключевой статистики:
"73% of manual breaches had revenge trade as trigger"
В разделе выводов:
"Behavioral failures — not strategy — drive 73% of breaches. In the manual cohort, 73% of breach events (66/90) were preceded by a BBI-tagged behavioral event (loss aversion stop-removal, revenge entry, or mental accounting oversize) in the same session."
Это два разных утверждения. В первом 73 % приписаны одному искажению из семи. Во втором объединению трёх. Оба быть верны не могут. Проверка на противоречие: в той же таблице неприятию убытка приписано "Drives 34.2% of manual breaches". Если отыгрыш отвечает за 73 %, а неприятие убытка за 34.2 %, сумма уже 107 % при том, что это два слагаемых из трёх. Доля 66/90 = 73.3 % подтверждает, что арифметика выводов относится к объединению, а строка таблицы ошибочна.
3.4 Сравнение с Одином сопоставляет разные величины
Первый вывод работы дословно: "Disposition effect 2.7× more severe than academic benchmarks. Manual cohort loser/winner hold ratio of 4.1× (95% CI 3.8–4.4×) vs. Odean (1998) benchmark of ~1.5×." Отношение 4.1/1.5 = 2.73, арифметика верна.
Неверно само сопоставление. У Одина мера диспозиции это отношение доли реализованных прибылей к доле реализованных убытков: из всех бумажных прибылей какую часть трейдер зафиксировал, и то же для убытков. Здесь же измеряется отношение времени удержания убыточных позиций к прибыльным. Это разные величины с разными единицами и разными распределениями, и у них нет причины совпадать даже при одинаковом поведении. Сравнивать их и объявлять разницу в 2.7 раза это подмена.
Следом из этого выводится денежная оценка: "For \$50K–\$100K accounts, the implied annual performance cost is \$2,200–\$4,400 (Odean: 4.4% return drag)". То есть берётся коэффициент Одина 4.4 % и применяется к размерам счетов. Но если диспозиция здесь в 2.7 раза сильнее, чем у Одина, то и потеря не должна равняться его же 4.4 %. Либо эффект сильнее и потеря больше, либо потеря та же и эффект не сильнее.
3.5 Две из трёх ИИ-подкогорт статистически не отличаются от ручной
| Подкогорта | Доля нарушений (95 % ДИ) | Шарп | Индекс риска |
|---|---|---|---|
| Вручную (эталон) | 18.4 % (15.1–22.1) | 0.62 | 61.4 % |
| ИИ-ассистированная дискреционная | 15.1 % (10.4–21.1) | 0.81 | 79.2 % |
| Советник по правилам | 13.6 % (9.5–18.8) | 0.91 | 91.3 % |
| Гибрид ИИ и человека | 8.5 % (4.8–14.4) | 0.97 | 94.1 % |
Интервал дискреционной подкогорты (10.4–21.1) перекрывается с ручным (15.1–22.1) на протяжении шести пунктов. Интервал советника по правилам (9.5–18.8) перекрывается на трёх с половиной. Различие не установлено ни для одной из этих двух групп. Не перекрывается только гибрид, и то с зазором в семь десятых пункта.
Работа приводит эту таблицу и ни словом не комментирует перекрытие. Заголовочная цифра «на 34 % меньше нарушений» получена объединением трёх подкогорт, из которых две по отдельности неразличимы с эталоном.
3.6 Советник по правилам это не ИИ
198 трейдеров из 510 в ИИ-когорте, то есть 38.8 %, отнесены к категории детерминированного советника, исполняющего записанные правила. Это автоматизация, а не искусственный интеллект, и технологии тут разные настолько, насколько вообще бывает. Работа сама же объясняет механизм: "Improvement was largest in Rule-Based EA and Hybrid sub-cohorts where execution rules make emotional patterns structurally impossible."
Вот это и есть настоящий вывод, который данные поддерживают: выигрыш даёт устранение ручного вмешательства, а не интеллект инструмента. Пометить результат как достижение ИИ это решение маркетинговое.
3.7 Просадки усечены самими правилами
Средняя максимальная просадка 7.8 % и 4.3 % за 24 месяца это величины подозрительно малые для розничных трейдеров. Объяснение простое: на проп-счёте просадка ограничена правилами фирмы, обычно порядка 10 %, и при её достижении счёт умирает. То есть наблюдаемое распределение просадок цензурировано сверху, и разница между когортами измеряется не на полном распределении, а на том, что уцелело.
Сюда же критерии включения: активный счёт, не менее 20 завершённых сделок, не менее 5 активных дней. Трейдер, разорившийся за три дня, в выборку не попадает. Это смещение работает, что интересно, против вывода работы: быстрее разоряются обычно ручные, и их отсев улучшает ручную когорту. Но сам факт, что два разных отбора действуют одновременно в разные стороны, означает, что величину эффекта из этих данных извлечь нельзя вообще.
3.8 Самоотбор, названный, но не устранённый
Распределение по когортам самоотобранное: люди сами решали, пользоваться ли ИИ. Работа это признаёт в ограничениях и правильно пишет всюду «связано с». Но заголовочные цифры при этом подаются как эффект инструмента, включая рекомендацию внедрить ИИ-ограждения. Трейдер, выбравший ИИ-инструмент, с большой вероятностью и без него был бы дисциплинированнее, а корреляция индекса риска с исходом (0.74) с тем же успехом читается как «дисциплинированные люди и дисциплинированны, и зарабатывают».
3.9 Число без источника
В таблице искажений, строка про сверхуверенность, колонка ключевой статистики: «затрагивает около 70 % розничных трейдеров». Это утверждение о внешней популяции, а не о выборке работы, и ссылки при нём нет. В списке литературы шесть позиций, и ни одна не подписана под этим числом; последняя из них указана без автора, названия журнала и идентификатора, то есть не является ссылкой в проверяемом смысле.
4. Что отсюда стоит забрать
Несмотря на всё перечисленное, одна вещь в работе сделана хорошо и применима прямо: семь поведенческих искажений переведены в правила, которые считаются из журнала сделок без опроса трейдера. Ни одно из них не требует знать, что человек чувствовал; все опираются на отметки времени, цены и размеры.
Полезно это в конкретном месте. Портфель систематических стратегий не испытывает эффекта диспозиции: у него нет механизма держать убыток дольше прибыли. Но у человека, сидящего над этим портфелем, механизм есть, и проявляется он в ручном вмешательстве: снять стоп, закрыть раньше, добавить размер после хорошего дня, перезапустить остановленную стратегию после серии убытков. Эти вмешательства оставляют ровно те следы, которые здесь описаны.
Три метрики, которые имеет смысл считать по собственному журналу:
Доля сделок, где стоп был сдвинут после открытия. Для полностью автоматической системы это ноль по определению. Любое ненулевое значение в точности мера ручного вмешательства, и она считается одной строчкой по логу.
Индекс соблюдения риска: доля сделок внутри заявленного риска на сделку. Для систематического портфеля это проверка того, что размер позиции соответствует расчётному. Расхождение указывает либо на ручную правку, либо на дефект в сайзинге.
Доля входов в пределах 30 минут после выбивания стопа равным или большим размером. Для автомата это свойство стратегии, а не эмоции, но метрика всё равно полезна: она показывает, сколько раз система перезаходит сразу после убытка, и стоит ли ограничивать такие перезаходы.
Отдельно стоит отметить тезис, который работа формулирует как главный и который, в отличие от процентов, выдерживает проверку логикой: правила проп-фирм отсеивают поведение, а не навык. Это та же мысль, к которой независимо приходит работа Youngblood с противоположной стороны, показав, что фиксированный размер позиции делает несколько правил недействующими. Два источника, разные методы, один вывод.
5. Тестируемые идеи
| № | Идея | Тип | Где считать |
|---|---|---|---|
| 1 | Считать по собственному журналу долю сделок, где стоп сдвинут после открытия: для автоматического портфеля норма это ноль, любое отклонение измеряет ручное вмешательство | метрика приёмки | Python |
| 2 | Индекс соблюдения риска: доля сделок, чей фактический риск попал в заявленный коридор. Расхождение указывает на дефект сайзинга или на правку руками | метрика приёмки | бэктестер |
| 3 | Доля входов в пределах 30 минут после выбивания стопа равным или большим размером; проверить, улучшает ли запрет на такие перезаходы результат портфеля | изменение конструкции | бэктестер |
| 4 | Отношение медианного времени удержания убыточных сделок к прибыльным по каждой стратегии: для симметричных выходов ожидается около 1, сильное отклонение признак асимметрии правил выхода | диагностика | Python |
| 5 | Коэффициент вариации размера позиции по стратегии: у корректно работающего сайзинга он определяется только волатильностью, и всплески указывают на ошибку | аудит | бэктестер |
| 6 | Проверить, цензурировано ли распределение просадок правилами счёта, прежде чем сравнивать средние просадки между любыми группами | аудит | Python |
| 7 | При сравнении подгрупп всегда смотреть на перекрытие доверительных интервалов, а не только на точечные оценки: в этой работе две подкогорты из трёх неразличимы с эталоном | метрика приёмки | любая |