Этап 3 — NLP / LLM
Цель: трансформеры, fine-tune и RAG на практике. Срок: 3–4 недели.
Программа
- ☐ HF LLM Course, главы 1–7: pipeline, токенизаторы, трансформер, fine-tune
- ☐ Токенизация: BPE, специальные токены, len/attention mask
- ☐ Fine-tune классификации: Trainer/LoRA, метрики, переобучение
- ☐ Embeddings и RAG: чанкинг, векторная база (faiss/qdrant), retrieval quality
- ☐ Практика: sentiment по отзывам CS-Cart (ru-en), RAG по GoClaw/wiki-доке
Квиз (проверь себя)
- Почему
attention is all you need: что заменила self-attention по сравнению с RNN? - Что делает
[CLS]-токен в BERT-классификации? - LoRA: что обучаем и почему это дёшево?
- RAG: почему «наивный» чанкинг по 512 токенов часто плохо работает и как чинить?
Мини-проект
Sentiment-классификатор отзывов (данные возвратов/отзывов RuOpt) + RAG-поиск по нашей внутренней документации. Это уже близко к прод-задачам.
Дальше — Этап 4 · Специализация.