Как я два дня с хомяком возился, который теперь за меня проект тащит.

Решил я замутить парсер, который на базе LLM работает, но персональные данные не ест и выдаёт результат с точностью 98%. Хотел, чтобы данные были в определённом формате, чтобы можно было с ними дальше работать. Но в какой-то момент я понял, что это тупая и надоедливая работа.

Чтобы улучшить модели, нужно было делать две вещи:

1. Искать модель, которая быстро и качественно работает и недорого стоит. 2. Постоянно тюнить парсер.

У меня был парсер, верификатор, инструмент для разбора текста по полям, инструмент для вычленения персональных данных и так далее. Я брал модель, 100 резюме разных размеров и форматов и прогонял их через эксперимент. Через два часа он мне сообщал о результатах, ошибках и неточностях. Я копировал список ошибок в проект, обновлял версию с правками и снова прогонял.

Сначала у меня было около 80–85% точности, но за 1–20 прогонов я довёл её до 91–92%. В пятницу я решил, что устал всё это руками делать и хочу сделать агента, который будет принимать сложные решения. Я написал такого агента, дал ему личность хомяка (я последнее время помешан на животных), и он делает вот что:

— Запускает эксперимент. — Говорит: «Смотри, есть 100 резюме и модель, надо гонять, пока точность не будет 98%». — Берёт резюме, прогоняет, находит ошибки, вносит их в код, делает коммит, deploy, обновляет версию парсера и снова запускает эксперимент. — Прогоняет, получает результат и так далее.

Когда у него средний результат становится 98%, он приходит и говорит: «Привет, я всё сделал». Только у меня стоит ограничение в 7 итераций. Сегодня он весь день тестирует модели и улучшает парсер без моего участия, просто присылает отчёты.

Ещё интересный факт. Я сравнил статистики по моделям и вот что заметил: лидируют ChatGPT-4o и Яндекс GPT-5. Они обе дают очень высокий результат. Яндекс GPT-5.1 работает быстрее, чем ChatGPT. На один документ ChatGPT уходит 20 секунд, а у Яндекс GPT — 15 секунд. Но вот стоимость у них разная: ChatGPT — 20–30 копеек, а Яндекс GPT — почти 4 рубля. Приятно, что модели выдают отличный результат.

Я тестирую почти все модели, которые доступны в OpenRouter и локально, и хочу сказать, что Яндекс GPT не отстают. Они где-то в первой пятёрке, наравне с ChatGPT-5 и Квен 3.5.

Как я два дня с хомяком возился, который теперь за меня проект тащит.
Решил я замутить парсер, который на базе LLM работает, но персональные данные не ест и выдаёт результат с точностью 98% | Сетка — социальная сеть от hh.ru