Вопросы на собеседовании по NLP и LLM
Трансформеры и внимание, эмбеддинги, токенизация, дообучение и RAG — самая большая тема банка и самая частая на интервью.
177 вопросов с реальных собеседований.
- Зачем в RLHF нужен PPO?
- Из каких этапов состоит RLHF-пайплайн?
- Почему alignment шире, чем просто preference tuning?
- Почему DPO не требует отдельной reward model?
- Почему helpfulness, honesty и harmlessness могут конфликтовать?
- Почему высокий reward не всегда означает хороший ответ для пользователя?
- Почему качество chosen/rejected пар критично для DPO?
- Почему при RLHF модель не дают сильно отклонять от SFT-версии?
- Чем DPO отличается от RLHF?
- Что reward model получает на вход и предсказывает на выходе?
- Что означает принцип Helpful, Honest, Harmless?
- Что такое alignment в контексте LLM?
- Что такое DPO?
- Что такое reward hacking?
- Что такое reward model?
- Что такое RLHF?
- Для каких задач chain-of-thought особенно полезен?
- Почему in-context learning не является fine-tuning?
- Почему качество промпта влияет на качество ответа, если веса модели не меняются?
- Почему промпт «верни JSON» не гарантирует валидный JSON?
- Чем chain-of-thought в промпте отличается от reasoning-моделей?
- Чем prompt engineering отличается от проектирования агентной системы?
- Чем плохой промпт отличается от хорошего?
- Что такое Chain-of-Thought prompting?
- Что такое few-shot режим?
- Что такое in-context learning?
- Что такое prompt engineering?
- Что такое role prompting?
- Что такое structured output prompting?
- Что такое test-time reasoning?
- Что такое tool-use prompting?
- Что такое zero-shot режим?
- Для каких задач обычно используются encoder-only модели?
- Для каких задач применяются encoder-decoder модели?
- Зачем decoder-only модели нужна causal mask?
- Зачем таргеты сдвигаются относительно входной последовательности на один токен?
- Как decoder-only модель генерирует текст авторегрессивно?
- Как формируются входы и таргеты для обучения GPT?
- Какие разновидности BERT вы знаете?
- Почему во время обучения модели передаются истинные предыдущие токены?
- Почему обучение можно выполнять параллельно по токенам, а генерацию — последовательно?
- Почему современные универсальные LLM чаще строятся как decoder-only модели?
- Почему текущий токен не должен видеть будущие токены?
- Чем BERT отличается от GPT?
- Чем decoder-блок GPT отличается от декодера исходного трансформера?
- Чем encoder-only, encoder-decoder и decoder-only архитектуры отличаются друг от друга?
- Чем обучение GPT отличается от обучения BERT?
- Что такое BERT?
- Что такое teacher forcing?
- Как получить векторное представление текста с помощью BERT?
- Как работает BM25 и чем он отличается от TF-IDF?
- Чем bi-encoder отличается от cross-encoder и когда какой применяют?
- Чем эмбеддинг word2vec отличается от эмбеддинга из трансформера?
- Что такое word2vec?
- Как фильтруют низкокачественные веб-данные?
- Какие основные проблемы есть у pretraining-датасетов?
- Какие проблемы у пользовательских лайков и дизлайков как сигнала качества?
- Какие форматы данных используют для alignment?
- Почему side-by-side разметка удобна для preference learning?
- Почему дубликаты в данных вредны для LLM?
- Почему качество pretraining-данных критично для качества LLM?
- Почему попадание тестовых данных в pretraining-корпус опасно?
- Почему токсичный контент в обучающих данных влияет на поведение модели?
- Чем exact deduplication отличается от near deduplication?
- Чем формат «instruction → answer» отличается от preference dataset?
- Что такое benchmark contamination?
- Что такое chosen/rejected пара?
- Что такое topic imbalance в pretraining-корпусе?
- В каких форматах LLM может оценивать ответы?
- Зачем в BLEU используется brevity penalty?
- Как perplexity связана с cross-entropy?
- Как выбор метрик зависит от задачи — перевод, суммаризация, чат-бот или генерация кода?
- Как построить гибридный пайплайн из автоматических метрик, LLM-as-a-Judge и ручной оценки?
- Как проверить, что оценки LLM-as-a-Judge коррелируют с оценками людей?
- Как работает BERTScore?
- Как работает BLEU?
- Как работает Exact Match и для каких задач он подходит?
- Как работает METEOR и чем он отличается от BLEU?
- Как работает ROUGE?
- Какие критерии обычно используют при ручной оценке ответа LLM?
- Какие преимущества есть у LLM-as-a-Judge?
- Какие продуктовые метрики стоит использовать вместе с offline-оценкой?
- Какие риски и bias есть у LLM-судьи?
- Когда вместо LLM-судьи лучше использовать детерминированную проверку?
- Почему BERTScore лучше учитывает перефразирование, чем BLEU и ROUGE?
- Почему BLEU и ROUGE плохо оценивают ответы современных LLM?
- Почему высокая семантическая близость не гарантирует фактологическую корректность?
- Почему качество генерации сложнее оценивать, чем качество классификации?
- Почему нельзя оценивать генеративную модель только одной метрикой?
- Почему низкая perplexity не гарантирует хорошее следование инструкциям?
- При каких условиях можно корректно сравнивать модели по perplexity?
- Чем BLEU отличается от ROUGE?
- Чем абсолютная оценка отличается от попарного side-by-side сравнения?
- Что такое LLM-as-a-Judge?
- Что такое perplexity?
- Что такое position bias при попарном сравнении ответов?
- Зачем трансформеру нужны позиционные эмбеддинги?
- Как устроено синусоидальное позиционное кодирование?
- Какие виды позиционного кодирования существуют?
- Как бы вы построили evaluation для instruction-following модели?
- Как понять, что задачу лучше решать prompt engineering, SFT, DPO/RLHF или агентной системой?
- У вас есть base LLM. Как превратить её в чат-ассистента?
- В каком порядке применяются temperature, фильтрация токенов и sampling?
- Как модель понимает, что генерацию нужно завершить?
- Как низкая и высокая temperature изменяют распределение вероятностей?
- Как работает beam search?
- Как работает greedy decoding?
- Как работает random sampling?
- Как работает top-k sampling?
- Как работает top-p (nucleus) sampling?
- Как связаны связность и разнообразие генерации?
- Какие ограничения у фиксированного k в top-k sampling?
- Какие преимущества и ограничения есть у greedy decoding?
- Можно ли одновременно использовать temperature, top-k и top-p?
- Почему sampling по полному распределению может приводить к неадекватным токенам?
- Почему top-p лучше адаптируется к форме распределения?
- Почему локально лучший токен не обязательно приводит к лучшей последовательности?
- Почему модель может начать повторяться или зацикливаться?
- Почему слишком высокая temperature ухудшает связность текста?
- Чем beam search отличается от greedy decoding?
- Чем max_length отличается от max_new_tokens?
- Чем no_repeat_ngram_size отличается от repetition_penalty?
- Чем top-p отличается от top-k?
- Чем процесс генерации отличается от обучения модели?
- Что делает параметр temperature?
- Что происходит на одном шаге авторегрессивной генерации?
- Что происходит при стремлении temperature к нулю?
- Есть ли у трансформера отдельный слой-токенизатор?
- Как для BERT выполняется токенизация и позиционное кодирование?
- Как обучаются эмбеддинги токенов?
- Как расширить словарь токенизатора?
- Какие виды токенизаторов бывают?
- Какие основные гиперпараметры есть у токенизатора?
- Почему BPE работает на уровне байтов, а не символов?
- В чём разница между query, key и value в механизме внимания?
- Зачем в трансформере нужны residual connections?
- Как работает механизм внимания? Напишите формулу.
- Как устроен блок декодера в трансформере?
- Как устроен блок энкодера в трансформере?
- Как устроена архитектура трансформера? Из каких блоков она состоит?
- Какие бывают трансформерные архитектуры? Приведите примеры моделей.
- Какие виды attention бывают?
- Чем трансформер отличается от RNN и CNN?
- Чем энкодер отличается от декодера в трансформере?
- Что подаётся на вход головы внимания в декодере?
- Что происходит с входными токенами до подачи в энкодер?
- Что такое causal self-attention?
- Что такое feed-forward блок (FFN) в трансформере?
- Что такое layer norm и чем он отличается от batch norm?
- Что такое masked multi-head attention?
- Что такое multi-head attention и зачем нужно несколько голов?
- Что такое трансформер?
- Из каких этапов состоит обучение современной LLM?
- Как выглядит датасет для SFT?
- Как от базовой GPT пришли к ChatGPT? Что изменилось?
- Какие способности усиливаются после SFT?
- Какой loss обычно используется при autoregressive pretraining?
- Почему SFT может усиливать галлюцинации?
- Почему SFT не решает полностью проблему безопасности?
- Почему после pretraining модель ещё не является хорошим ассистентом?
- Чем SFT отличается от pretraining?
- Что происходит на этапе pretraining?
- Что такое instruction tuning?
- Что такое supervised fine-tuning (SFT)?
- Зачем к логитам применяется softmax?
- Как cross-entropy связана с максимизацией вероятности обучающего текста?
- Как вероятность последовательности токенов раскладывается по цепному правилу?
- Как рассчитывается cross-entropy loss для языковой модели?
- Как текст преобразуется в распределение вероятностей следующего токена?
- Какова размерность выходных логитов языковой модели?
- Почему loss можно вычислять сразу для всех позиций последовательности?
- Почему next token prediction хорошо масштабируется на большие объёмы данных?
- Почему для обучения языковой модели не нужна ручная разметка?
- Почему предсказание следующего токена можно рассматривать как многоклассовую классификацию?
- Чем логиты отличаются от вероятностей?
- Что такое hidden state и какую информацию он содержит?
- Что такое задача языкового моделирования (next token prediction)?