Как надо (не стоит) создавать шахматный движок . Часть 6
Пост 6. Что мы построили и что ещё предстоит Пост 5 = https://set.ki/post/a5afdKx
Промежуточные итоги проекта.
Достигнуто: ✅ Рабочая архитектура с двумя моделями ✅ Цикл self-play (300 игр, чередование режимов) ✅ Механизм синтеза оценок ✅ Буфер обучающих данных
Не достигнуто: ❌ Валидируемая метрика стилевой близости ❌ Устойчивость к нелогичным ходам ❌ Полноценный поиск (alpha-beta, MCTS) ❌ Использование базы партий гроссмейстера
Последний пункт особенно важен. Imitation learning на партиях GM заявлен в цели, но не реализован. Это ключевой дефицит.
Куда двигаться:
1. Формализация метрики стиля — точность предсказания ходов GM, KL-дивергенция, слепая экспертиза 2. Разделение обучения — imitation learning + self-play с регуляризацией 3. Расширение оценочной функции стилевыми признаками 4. Переход от двух моделей к лиге (5–10 вариаций) 5. Внедрение полноценного поиска
Архитектура — рабочий прототип. Не движок общего назначения. И это нормально.