Вопросы на собеседовании по машинному обучению
Метрики и их выбор под задачу, переобучение, кросс-валидация, работа с пропусками и дисбалансом, ансамбли — ядро любого ML-интервью.
148 вопросов с реальных собеседований.
- В случайном лесе подмножество признаков выбирается один раз на дерево или на каждом разбиении?
- Где деревья глубже — в бустинге или в бэггинге? Почему?
- За что отвечает L2-регуляризация в бустинге на деревьях?
- Как глубина деревьев влияет на случайный лес?
- Как изменится MAE, если удалить первое дерево из бустинга? А если последнее?
- Как правильно разбивать данные при обучении стекинга?
- Как работает градиентный бустинг?
- Как разложение на смещение и разброс объясняет работу случайного леса?
- Как распараллелить инференс бэггинга и бустинга?
- Как распараллелить обучение бэггинга и бустинга?
- Как формируется итоговое предсказание градиентного бустинга?
- Какие у градиентного бустинга преимущества и недостатки?
- Какие у случайного леса плюсы и минусы?
- Можно ли переобучить бустинг? А бэггинг?
- По какому критерию бустинг выбирает разбиение в узле дерева для задачи регрессии?
- Почему в ансамблях не используют линейные модели как базовые алгоритмы?
- Почему в случайном лесе на каждом разбиении берут случайное подмножество признаков?
- Почему градиентный бустинг называется градиентным?
- Случайный лес обучен на строго положительных значениях, но выдаёт отрицательные предсказания. В чём может быть причина?
- Уменьшает ли стекинг смещение модели?
- Чем градиентный бустинг отличается от случайного леса?
- Чем отличаются LightGBM, XGBoost и CatBoost?
- Чем случайный лес отличается от одного дерева решений?
- Что будет, если первое дерево в бэггинге или бустинге сделать очень глубоким?
- Что произойдёт с качеством, если убрать одно случайное дерево из леса? А из бустинга?
- Что происходит с качеством случайного леса при добавлении новых деревьев?
- Что такое бустинг?
- Что такое бэггинг?
- Что такое случайный лес и как он строится?
- Что такое стекинг?
- Что уменьшает бэггинг, а что — бустинг: смещение или разброс?
- Как выбрать между логистической регрессией, случайным лесом и бустингом для задачи?
- Какие бывают виды кросс-валидации?
- Какие способы проверки качества модели есть в scikit-learn?
- Чем тестовая выборка отличается от валидационной?
- Что такое Pipeline в scikit-learn и какую проблему он решает?
- Что такое кросс-валидация?
- Как делать кросс-валидацию на временных рядах?
- Как с помощью разложения Фурье выделяют сезонность во временном ряде?
- Как строят модель для прогнозирования временного ряда?
- Какие подходы и библиотеки применяют для прогнозирования временных рядов?
- Что такое стационарность временного ряда и почему она важна?
- Как глубина дерева влияет на его качество и склонность к переобучению?
- Как дерево решений формирует предсказание для нового объекта?
- Как оценить важность признаков по дереву решений?
- Как регуляризовать дерево решений?
- Как строится дерево решений?
- Какая вычислительная сложность у обучения и предсказания дерева решений?
- Какие критерии разбиения используются в деревьях решений?
- Какие у дерева решений плюсы и минусы?
- Какой критерий минимизируется при выборе разбиения в регрессионном дереве?
- Когда останавливается построение дерева решений?
- Может ли дерево предсказать отрицательное значение, если обучалось только на положительных таргетах?
- Может ли дерево решений выдавать вероятности классов?
- Почему деревья не чувствительны к масштабированию признаков?
- Чем дерево классификации отличается от дерева регрессии?
- Что такое энтропия в дереве решений? Дерево её минимизирует или максимизирует?
- Что хранится в листьях дерева решений?
- Для каких задач применяют кластеризацию?
- Как выбрать оптимальное количество кластеров?
- Как работает алгоритм DBSCAN?
- Как работает алгоритм k-means?
- Как работает иерархическая агломеративная кластеризация?
- Как считают расстояние между кластерами?
- Как ускорить алгоритм k-means?
- Какие алгоритмы кластеризации вы знаете и чем они отличаются?
- Какие проблемы создаёт неудачная инициализация центроидов в k-means?
- Какими метриками оценивают качество кластеризации?
- Когда останавливают иерархическую кластеризацию?
- Чем мягкая кластеризация отличается от жёсткой?
- Что такое дендрограмма?
- Что такое кластеризация?
- В чём основная идея метода опорных векторов (SVM)?
- Как заподозрить переобучение у линейной модели?
- Как интерпретировать коэффициенты линейной модели?
- Как обучаются линейные модели?
- Как проверить статистическую значимость коэффициентов логистической регрессии?
- Какие линейные модели существуют кроме линейной и логистической регрессии?
- Какие основные ограничения у линейной регрессии?
- Какие у линейных моделей плюсы и минусы?
- Когда линейная регрессия окажется лучше градиентного бустинга?
- Напишите формулу логистической регрессии. Что такое логит и как модель разделяет классы?
- Почему в линейной регрессии функция потерь квадратичная, а не в четвёртой или иной степени?
- Чем логистическая регрессия отличается от линейной регрессии?
- Что такое log-loss и откуда он берётся?
- Что такое линейные модели и как они устроены?
- Что такое мультиколлинеарность и как с ней бороться?
- Как изменится ROC-AUC, если продублировать объекты класса 1 четыре раза, а класса 0 — семь раз?
- Как интерпретировать значения ROC-AUC и PR-AUC?
- Как строится ROC-кривая?
- Какие метрики бинарной классификации вы знаете? Как они выражаются через матрицу ошибок?
- Три модели дают ROC-AUC 0.51, 0.65 и 0.88. Какая предсказывает лучше и почему?
- Чем MAE отличается от MAPE и какая метрика понятнее бизнесу?
- Чем precision отличается от recall и когда что важнее?
- Чем метрика качества отличается от функции потерь? Когда смотреть на accuracy, а когда на loss?
- Что означает ROC-AUC, равный 0.5?
- Что произойдёт с ROC-кривой и ROC-AUC, если ко всем предсказаниям прибавить константу или умножить их на положительное число?
- Что такое accuracy?
- Что такое F1-мера?
- Что такое MAE, MSE, RMSE, R²?
- Что такое MAPE?
- Что такое PR-AUC и когда его смотрят вместо ROC-AUC?
- Что такое precision?
- Что такое recall?
- Что такое ROC-AUC?
- Что такое асимметричные метрики?
- Что такое микроусреднение и макроусреднение?
- Для каких задач применяют метрические модели?
- Как масштабирование признаков влияет на k-NN?
- Как работает k-NN?
- Как ускорить k-NN на большом датасете?
- Какая у k-NN вычислительная сложность обучения и предсказания?
- Какие метрики расстояния применяют в k-NN?
- Какие у метрических моделей и k-NN плюсы и минусы?
- Чем k-NN отличается от k-means?
- Что такое метрические модели?
- Как выглядит один шаг градиентного спуска при обновлении весов?
- Как добиться воспроизводимости результата при обучении градиентным спуском?
- Как работает градиентный спуск?
- Когда выбрать стохастический градиентный спуск вместо полного?
- Какие алгоритмы классификации вы знаете?
- Какие есть схемы сведения многоклассовой классификации к бинарной?
- Какие основные типы задач машинного обучения существуют?
- Когда модель стоит дообучать под задачу, а когда достаточно готовой?
- Что делать, если в данных есть дисбаланс классов?
- Что такое гиперпараметр модели?
- Что такое дисбаланс классов и почему это проблема?
- Что такое компромисс между смещением и разбросом (bias-variance tradeoff)?
- Что такое обучение без учителя и какие задачи оно решает?
- Зачем нужна стандартизация признаков?
- Как обрабатывать пропуски в данных?
- Какие бывают типы признаков?
- Какие методы снижения размерности вы знаете?
- Какие подходы к отбору признаков вы знаете?
- Каким моделям обязательно нужна нормализация признаков?
- Какими методами ищут выбросы в данных?
- Какими способами кодируют категориальные признаки и чем эти способы отличаются?
- Что делать, если признаков очень много?
- Что такое permutation importance и как он считается?
- Что такое Weight of Evidence (WOE) и зачем биннинговать признак вместо подачи его в модель напрямую?
- Что такое стандартизация и нормализация признаков?
- Какая геометрическая интерпретация у L1- и L2-регуляризации?
- Почему L1-регуляризация зануляет веса, а L2 — нет?
- Почему переобучение — это плохо?
- Чем L1-регуляризация отличается от L2?
- Что такое переобучение и как с ним бороться?
- Что такое регуляризация и какие её виды вы знаете?
- Что такое popularity bias в рекомендательных системах и как с ним борются?