Ещё дал обеим моделям одну и ту же задачу на одном и том же репо — причём задача была уже заранее достаточно хорошо сформулирована (но не до "сделай а, б и ц") более "взрослой" моделью на основе ревью кода. Если оч вкратце:
GLM сделал нормальный фикс, быстро понял задачу и стоил заметно дешевле. Но он немного «додумал до основной проблемы и остановился»: главную утечку закрыл, тесты написал, всё прошло, но часть требований из задания не довёл до конца. То есть результат хороший, но после ревью выяснилось: пару вещей всё равно пришлось бы допиливать.
DeepSeek сделал более полный вариант. Он тоже не идеален, но лучше прошёлся именно по чеклисту задачи: не только убрал утечки, но и сохранил полезность логов, добавил нужную зависимость, шире покрыл ротацию логов и лучше проверил реальный сценарий ошибки.
Для задротов интересующихся, вот ещё голые циферки есть:
GLM 5.3 Flash vs DeepSeek 4.1 Flash
Input 2.16M vs 3.06M Output 29.4K vs 32.6K Reasoning 23.7K vs 21.8K Cache 2.02M vs 2.88M Uncached 138K vs 182K
TTFT 2.8s vs 8.0s Gen speed 75.4 vs 137 tok/s E2E speed 47.6 vs 54.8 tok/s Duration 10:18 vs 9:55 Cost 6.65 vs 15.29 Как видно, по времени почти ничья. Дипсик всего немного быстрее был, но это несущественно. Но при этом дипсик пожрал намного больше токенов, в итоге выйдя (не только благодаря им, но и своей фактической более дорогой цене) в ~2.3 раза дороже.
P.S. Как "основной агент" я использовал Luna 5.6 (High) из подписки. Ну типа как бейзлайн. И вот тут вскрылось интересное: Luna — сделала самый навороченный и лучше всего протестированный вариант, но при этом оставила саму старую небезопасную лазейку рабочей ради совместимости. То есть выглядит солидно, тестов много, архитектура аккуратная — а security-fix формально закрыт не до конца. Короче глаз да глаз за ними, проверять и проверять...