Оценка

Не сырая доходность

Итоговый балл складывается из пяти измерений. Веса публикуются до начала раунда и внутри раунда не меняются.

35%

Доходность с поправкой на риск

После реальных издержек, на данных, которых участник не видел. Для трека A — средняя поэрная ранговая корреляция предсказаний с реализованной доходностью.

Действует

25%

Устойчивость

Разброс результата по подпериодам и рыночным режимам. Модель, работающая ровно, ценнее модели с тем же средним, но рваной.

Действует

20%

Дисциплина риска

Просадка, риск хвоста, поведение при росте волатильности. Для трека A — качество прогноза после вычета вклада известных факторов риска.

Действует

15%

Оригинальность

Вклад сверх того, что уже дают остальные участники. Дубликат чужого решения даёт вклад около нуля.

Объявлена, пока не измеряется

5%

Ёмкость

Объём капитала, который стратегия способна освоить без потери качества. Почти не встречается в учебных форматах и является определяющей в реальном управлении активами.

Объявлена, пока не измеряется

Два компонента объявлены, но пока не действуют — и мы говорим об этом прямо. Оригинальность измеряется вкладом в ансамбль работ, а ансамбля до первого раунда не существует. Ёмкость требует построения портфеля в тракте оценки. Пока они не работают, балл собирается из трёх действующих компонентов, и их веса нормируются. Скрытая особенность оценки — ловушка; названная — часть условий задачи.

Что происходит с работой

ШагЧто проверяется
ПриёмФормат файла, размер, частота загрузок. Ответ — за секунды: участник узнаёт об ошибке сразу, а не через сутки
Гейты допускаПолнота покрытия эр и инструментов, диапазон значений, отсутствие вырожденных предсказаний. Не прошедшая работа не оценивается
ЗапечатываниеХеш работы фиксируется и показывается участнику — доказательство неизменности. После запечатывания артефакт неизменяем
ОценкаРасчёт компонентов поэрно, затем агрегирование с поправкой на перекрытие эр
РазрешениеИтоговый балл считается на закрытом срезе и публикуется после разрешения раунда

Два рейтинга

Публичный считается на открытом срезе и обновляется часто — это обратная связь. Итоговый считается на закрытом срезе. Разделение принципиально: оптимизация под видимый рейтинг не даёт преимущества в итоговом.

Снимки рейтинга неизменяемы — это защита от споров «у меня было другое место».

Правило разбора

Результат, резко выпадающий из общего распределения, автоматически уходит на ручную проверку. Исходная гипотеза при этом — ошибка в модели симулятора, а не выдающийся результат участника.

Почему результату можно доверять

Две реализации ядра

Эталон на Python и производительная реализация на C++ дают побитово один и тот же результат на всей траектории, включая граничные случаи. Совпадение проверяется автоматически при каждом прогоне тестов.

Детерминизм

Один и тот же код, данные и сид дают побитово тот же результат. Без этого невозможно разрешить спор участника и верифицировать победителя.

Воспроизводимость локально

SDK участника содержит те же эталонные метрики, что и сервер: свой балл можно пересчитать у себя и сверить до отправки работы.