Разделение ролей: почему проверяющий не должен помнить, как
Модель, которая только что написала решение, не может его оценить. Она не перечитывает написанное свежим взглядом, а продолжает разговор, в котором уже согласилась, что решение верное. Знакомая сцена: вы просите написать код, а потом в том же окне просите проверить. Она находит пару мелочей и говорит, что всё хорошо. Почему так происходит Проверяющий и пишущий делят один контекст. В нём лежат все допущения, которые привели к решению: почему выбран этот подход, почему отброшены остальные, что считалось само собой разумеющимся. Свежий взгляд отличается от несвежего тем, что не знает этих допущений. Он видит результат и спрашивает, откуда тот взялся. Тот, кто помнит дорогу, такой вопрос не задаёт. С людьми ровно так же. Автор документа не вычитывает свои опечатки не потому, что невнимателен, а потому что читает то, что хотел написать. Три роли Исследователь собирает материал: читает источники, выписывает, что где сказано, отмечает расхождения. Решений не предлагает. Исполнитель получает материал и делает работу. Не видит, как исследователь спорил сам с собой, и не наследует его сомнений. Занудный скептик получает только результат и задачу его сломать. Ход рассуждений ему не показывают: он должен прийти к результату с той же стороны, с которой придёт читатель. Оснастка тут ни при чём. Это три вкладки с разными инструкциями, а не платная платформа. Что показали замеры Тот же принцип работает на выборе моделей. Харнесс проверяет локальные модели на десяти ролевых сценариях: черновик, поиск пробелов, скан конфликтов, подготовка задач, длинный документ. Оценивает не другая модель, а детерминированный код. Модель на 1,5 миллиарда параметров проходит все десять при медиане 29 секунд. Модель на 8 миллиардов тоже все десять, за 87 секунд, но заметно сильнее на пробелах и конфликтах. Лучший результат дала не модель, а разделение труда: быстрая берёт черновики и общий анализ, медленная — пробелы, конфликты, подготовку задач и длинные документы. Десять из десяти, один ремонт, медиана 71 секунда. Оговорки, без которых цифры врут Приёмка засчитана с ремонтами: у быстрой их три, у медленной два, у связки один. Работает связка с проверками, а не модель сама по себе. И набор сценариев сменился. В прежнем были состязательные проверки: подмена запроса, утечка конфиденциального, специально противоречащие источники. В новом их нет. Значит десять из десяти не означают, что модель держит трудные случаи — она их не проходила. Что забрать Проверку выносите из того контекста, где делалась работа. Для модели это отдельное окно без истории рассуждений, для команды — человек, который не участвовал в решении. Оценивать результат должно что-то внешнее: код, тест, чек-лист. Не мнение того же, кто делал. И смотрите, чем куплен результат. Прохождение с тремя ремонтами и без них — разные вещи, даже когда цифра одна.