LLM и генеративный AI
Большая языковая модель — это одна идея, повторённая до изнеможения: предсказать следующий токен, дописать его, предсказать снова. Почти всё, что спрашивают на собеседовании, — почему модель работает, почему её дорого раздавать, почему она всё ещё галлюцинирует — выводится из этого цикла и трансформера, который его крутит. Эта тема собирает модель изнутри наружу, а затем разбирает две системы, которыми индустрия её обёртывает.
Начинаем с архитектуры: внимание, KV-cache и приёмы (Mixture-of-Experts, grouped-query attention, RoPE), которые делают современную модель по карману. Затем обучение — как базовую модель предобучают и потом выравнивают, и почему LoRA и RAG решают разные задачи, которые кандидаты постоянно путают. Дальше раздача, где живут самые острые утверждения: FlashAttention точный, speculative decoding не меняет распределение, а квантизация обменивает точность на пропускную способность. Наконец, два прикладных слоя — RAG, который заземляет ответы на найденный текст, и агенты, которые дают модели вызывать инструменты в цикле.
Слои темы
- Архитектура LLM — блок трансформера и внимание, KV-cache и рост его размера, роутинг MoE, MQA/GQA, RoPE и почему победил decoder-only.
- Обучение LLM — pretraining против SFT против RLHF/DPO, LoRA как parameter-efficient дообучение, почему RAG — это не fine-tuning, законы масштабирования и катастрофическое забывание.
- Раздача LLM — KV-cache в проде, continuous batching, точный-по-распределению speculative decoding, точный FlashAttention, компромиссы квантизации, prefill против decode.
- RAG — чанкинг, эмбеддинги, векторный поиск и реранкинг, почему поиск заземляет ответы и снижает галлюцинации, лимиты контекста и оценка.
- AI-агенты — вызов инструментов, цикл планирования ReAct, память, многошаговая оркестрация, режимы отказа и ограждения.