Линейка решает, кто победит
Результат сравнения зависит от линейки, которую построили до теста.
Один автор, пишущий об устройстве бенчмарков, разбирает два исследования. В первом квантовая модель, подогнанная под динамику генератора данных, набрала 0,994 ROC-AUC против 0,699 у лучшего из проверенных общих классических методов, а точный классический симулятор того же семейства — 0,993. По выводу автора, точность объясняется совпадением семейства модели с генератором, а преимущество в ресурсах требует отдельного доказательства. Во втором модель улучшения звука подняла PESQ с 1,76 до 1,94, а расхождение смысла в распознавании выросло с 0,135 до 0,318: по его оценке, линейка вознаграждает то, чему училась модель, а системе нужно другое. Он же оговаривает, что предопределён не каждый рейтинг: бенчмарк, отвергший технологию собственных авторов, заслуживает доверия, и что его собственное лекарство, аудит инструмента, может само стать публичной мишенью для оптимизации.
Другие авторы лечат родственную проблему сменой метрики. Один в аналогии с компанией из 1 000 ненадёжных сотрудников и компанией из 20 надёжных предлагает считать надёжные кубиты, а не их число. Крупная лаборатория, в пересказе рассылки, предлагает мерить сложность схем, выполненных надёжно, а не одну характеристику железа.