Самообучение LLM без изменений весов модели.
DIVE (Diversified Evolution of Instructional Variants) Метод «самообучения» без изменения весов модели. 1️⃣ Суть Модель сама генерирует памятки‑инструкции (skills) из своих прошлых попыток и фидбека верно/неверно. Вместо однопоточной правки создаются несколько независимых веток, каждая дорабатывается разными приёмами. В конце берётся набор дополняющих друг друга памяток, а не одна «лучшая» версия. 2️⃣ Как работает (пошагово) Шаг 1 – Собрать банк примеров с метками верно/неверно. Шаг 2 – Выделить K стартовых памяток (разные акценты). Шаг 3 – Для каждой ветки применяем 4 правки: • Reflective Repair • Exploratory Revision • Compression • Recombination (параллельное развитие) Шаг 4 – Тестируем всех кандидатов на отдельном наборе, выбираем M памяток, которые дополняют друг друга (модель‑судья сравнивает ответы). Шаг 5 (на новой задаче) – Каждая из M памяток решает задачу; модель сравнивает решения и выдаёт самый надёжный (итоговый выбор). 3️⃣ Пример применения Задача: репетитор готовит олимпиадных учеников к задачам «движение + проценты». text 1. Попросить 15 примеров с правильными ответами. 2. Сгенерировать 3 стартовые памятки (уравнения, таблицы, прикидка). 3. Для каждой памятки применить один из четырёх правок и получить 4 кандидата. 4. Проверить на 10 новых задачах, выбрать 2‑3 финальные памятки. 5. При новой задаче решить её через каждую памятку, сравнить ответы и выбрать лучший. 4️⃣ Шаблон промпта (копировать) text Дай мне {K} стартовых памяток для задачи типа “{тип_задачи}”. Каждая памятка должна содержать: пошаговую стратегию, типичные ошибки, формат финального ответа. Вот примеры с метками: {список задач и ответов} Улучши памятку одним из способов: - Reflective Repair - Exploratory Revision - Compression - Recombination Выбери способ и дай новую версию памятки. 5️⃣ Ограничения & риски • Требуется чёткий критерий «верно/неверно» – Почему: без однозначной метрики модель не может корректировать. • Много примеров и раундов – Почему: эффект виден после десятков‑сотен прогонов. • Не подходит для творческих задач – Почему: нет объективной обратной связи. • В ручном варианте без автоматизации – Почему: параллельные вычисления и UCB‑распределение бюджета не реализованы. 6️⃣ Ключевые выводы из экспериментов • DIVE превосходит все текстовые методы (zero-shot, self-consistency, RAG) на задачах математики/логики. • Рост качества достигается быстрее, чем при дообучении весов (SFT/GRPO). • Маленькая модель GPT‑5‑nano с DIVE иногда обгоняет большую GPT‑5 без промптинга.
Исследование № 2608.12486 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.