Что такое featminer
FeatMiner — алгоритм нового поколения, который автономно исследует данные, проверяет сотни тысяч гипотез и находит решения, способные существенно повысить качество модели.
Его задача — за 10 минут получить качество уровня top 1% Kaggle с минимально необходимым количеством признаков. Без блендинга, стэкинга и сложного тюнинга: результат достигается за счёт обнаруженных закономерностей, даже на стандартных настройках CatBoost.
FeatMiner воспроизводит полный исследовательский цикл сильного Data Scientist: анализирует данные, формулирует и проверяет гипотезы, оценивает их влияние на модель и развивает наиболее перспективные направления. То, на что специалисту могут потребоваться недели ручных экспериментов, система выполняет автономно за один запуск.
Поиск ориентирован непосредственно на качество модели. Каждое решение проверяется на данных, слабые направления прекращаются, а вычисления концентрируются на гипотезах с наибольшим потенциалом.
В результате FeatMiner возвращает компактный набор сильных и интерпретируемых признаков, готовых для обучения модели. Это воспроизводимое решение, найденное специально для конкретных данных и целевой метрики.
Для запуска достаточно описать структуру данных: указать target, ключ объекта, категориальные колонки и при необходимости временные оси. Остальной исследовательский процесс FeatMiner выполняет самостоятельно:
features = one_to_many_pipeline(
df=transactions,
aggregation_key="transaction_id",
target_col="target",
cat_features=["channel", "product_code"],
)
Посмотрите пример сгенерированного кода и полного цикла обучения CatBoost.