База вопросов для собеседования ML-инженера
431 вопрос с реальных собеседований по 9 темам, разложенные на 53 этапа в порядке разбора — от входных понятий к специфике.
NLP и LLM
Трансформеры и внимание, эмбеддинги, токенизация, дообучение и RAG — самая большая тема банка и самая частая на интервью.
177 вопросов · 13 этапов
- Векторные представления текста — 5 вопросов
- Токенизация — 7 вопросов
- Языковое моделирование — 13 вопросов
- Трансформеры и внимание — 18 вопросов
- Позиционные эмбеддинги — 3 вопроса
- Архитектуры GPT и BERT — 17 вопросов
- Стратегии генерации — 25 вопросов
- Prompt-engineering — 16 вопросов
- Этапы обучения LLM — 12 вопросов
- Данные для обучения LLM — 14 вопросов
- Alignment — 16 вопросов
- Метрики оценки LLM — 28 вопросов
- Практические вопросы LLM — 3 вопроса
Машинное обучение
Метрики и их выбор под задачу, переобучение, кросс-валидация, работа с пропусками и дисбалансом, ансамбли — ядро любого ML-интервью.
148 вопросов · 13 этапов
- Основы ML — 9 вопросов
- Признаки и предобработка — 12 вопросов
- Метрики качества — 20 вопросов
- Валидация и отбор моделей — 6 вопросов
- Линейные модели — 15 вопросов
- Оптимизация и градиентный спуск — 4 вопроса
- Регуляризация и переобучение — 6 вопросов
- Метрические модели — 9 вопросов
- Деревья решений — 16 вопросов
- Ансамблевые методы — 31 вопрос
- Кластеризация — 14 вопросов
- Временные ряды — 5 вопросов
- Рекомендательные системы — 1 вопрос
Deep Learning
Обратное распространение, инициализация и нормализация, оптимизаторы, регуляризация и то, почему сеть не учится.
33 вопроса · 6 этапов
- Основы нейронных сетей — 5 вопросов
- Функции активации и потерь — 8 вопросов
- Обучение нейронных сетей — 8 вопросов
- Свёрточные сети (CNN) — 9 вопросов
- Рекуррентные сети (RNN) — 1 вопрос
- Эмбеддинги и автоэнкодеры — 2 вопроса
Математика
Линейная алгебра, производные и градиенты, оптимизация — ровно в том объёме, в каком их спрашивают на интервью, а не в курсе матанализа.
31 вопрос · 2 этапа
- Линейная алгебра — 20 вопросов
- Математический анализ — 11 вопросов
Статистика
Проверка гипотез, доверительные интервалы, ошибки первого и второго рода, устройство A/B-теста и распространённые ловушки.
19 вопросов · 6 этапов
- Описательная статистика — 3 вопроса
- Теория вероятностей — 2 вопроса
- Распределения — 3 вопроса
- Проверка гипотез — 6 вопросов
- Статистические методы — 4 вопроса
- A/B-тесты — 1 вопрос
SQL и базы данных
Соединения и группировки, оконные функции, индексы и планы запросов — то, что просят объяснить словами, а не написать на бумаге.
10 вопросов · 5 этапов
- Типы баз данных — 1 вопрос
- Основные операторы — 3 вопроса
- Объединения таблиц — 1 вопрос
- Оконные функции — 4 вопроса
- Оптимизация запросов — 1 вопрос
Python
Структуры данных и их сложность, генераторы, особенности интерпретатора — без алгоритмических задач на белой доске.
7 вопросов · 3 этапа
- Инструменты и окружение — 1 вопрос
- Pandas и NumPy — 4 вопроса
- Оптимизация кода — 2 вопроса
Инженерия и инфраструктура
Модель в продакшене: обучение и инференс, версии данных, мониторинг и дрейф, воспроизводимость.
3 вопроса · 3 этапа
- Инструменты разработки — 1 вопрос
- Распределённые вычисления — 1 вопрос
- MLOps и деплой — 1 вопрос
Компьютерное зрение
Свёртки и рецептивное поле, аугментации, детекция и сегментация, предобученные бэкбоны.
3 вопроса · 2 этапа
- Классические методы — 2 вопроса
- Нейросетевые методы — 1 вопрос
Вопросы попроще — с них начинают
- В чём геометрический смысл производной?
- В чём смысл первообразной и определённого интеграла?
- Для каких задач применяют кластеризацию?
- Для чего в SQL используется оператор LIKE?
- Как ещё называют полносвязные нейронные сети?
- Какие алгоритмы классификации вы знаете?
- Какие бывают типы признаков?
- Какие виды матриц существуют?
- Какие линтеры и форматтеры используют в Python-проектах и что они проверяют?
- Какие операции определены над матрицами?
- Какие основные типы задач машинного обучения существуют?
- Три модели дают ROC-AUC 0.51, 0.65 и 0.88. Какая предсказывает лучше и почему?
- Чем в Jupyter магическая команда % отличается от %%?
- Чем случайный лес отличается от одного дерева решений?
- Чем тестовая выборка отличается от валидационной?
- Чем функция нескольких переменных отличается от функции одной переменной?
- Чем max_length отличается от max_new_tokens?
- Чем precision отличается от recall и когда что важнее?
- Чему равно математическое ожидание константы?
- Что делает параметр temperature?
- Что такое автоэнкодер?
- Что такое базис пространства?
- Что такое бустинг?
- Что такое бэггинг?
- Что такое вектор и какие операции над ним определены?
- Что такое гиперпараметр модели?
- Что такое гладкая функция?
- Что такое градиент?
- Что такое дендрограмма?
- Что такое задача языкового моделирования (next token prediction)?