Доменный плагин AI/ML-исследователя: континуальное обучение и пост-тренинг LLM как единый конвейер стадий — CPT (домен-дообучение) → SFT → RLHF (предпочтения) → RL на рубриках → RLVR (верифицируемые награды) → дистилляция (офлайн и онлайн/on-policy). Для каждой стадии: цель, данные, лосс, верификатор/reward, предпосылки и типовые отказы; плюс порядок стадий (DAG), диагностика «на какой стадии проблема» и антипаттерны конвейера. Триггеры: «пайплайн обучения», «что после SFT», «CPT/continued pretraining», «домен-дообучение», «выбор RLHF vs RLVR vs рубрики», «дистилляция учителя», «on-policy дистилляция», «reward hacking», «mode collapse», «катастрофическое забывание».
Agent Plugins