нашел скилл: sx4im/skillcheck https://github.com/sx4im/skillcheck Маленький, но концептуально важный. Делает A/B-тест для SKILL.md: с навыком и без навыка, слепая оценка, доверительный интервал, итог помогает/вредит/плацебо. Большинство «навыков для агентов» никто не проверял. Решил проверить те, которые Вам рекомендовал в предыдущих. Вот какие выводы на моем флоте агентов(важно! Опенкло+ Кодекс): Я прогнал сравнительный тест: одна и та же задача решается с навыком и без, а слепой судья не знает, где какой вариант.

Результат неприятный. Навык копирайтинга на DeepSeek(через опенроутер): 16,7% задач решено с навыком и 16,7% без. Ноль эффекта. Навык первопринципного мышления на DeepSeek: 26,7% с навыком против 33,3% без. Тоже плацебо, даже чуть хуже.

Но тот же навык на моей боевой модели gpt-5.5-codex помог 3 раза из 3.

Вывод: проверка навыка не переносится между моделями. Преимущество не в 100 навыках, а в знании, какие работают именно в твоём стеке.

Проверял не «на ощущениях».

Метод такой: задача решается в двух режимах — с навыком и без. Потом судья оценивает ответы вслепую и выдаёт один из трёх вердиктов: помогает, плацебо или вредит.

Отдельно я не стал полагаться на настройки чужого инструмента: у него по умолчанию стоят старые модели. Поэтому собрал свой тестовый стенд и прогнал навык на той же модели, на которой работает мой флот агентов.