Как я делал производственный календарь регионов ⚔️ TL;DR: 100₽ на анализ 2 000 доков от органов власти, 12 ч. разработки, OpenClaw закрывший тупую рутину без разработки, косяк с выбором CRM и неожиданные твисты из сферы

Итак, думал, что соберу быстро с ИИ. Будет изи.

Что получилось и зачем в предыдущем посте...

А сейчас про 6 проблем на пути и итоговые выводы.

🔍 Проблема №1 — первоисточник данных

Их два: • Законы регионов (когда одна дата каждый год) • Постановления правительства/главы региона (дата меняется)

Все публикуются как PDF на государственном сайте. API там шикарное, и можно подписаться на все новинки.

Но вот нюанс: есть то, что нигде официально не публикуется, но каким-то чудом попадает к агрегаторам типа Контур и Консультант.

Эти агрегаторы дают посмотреть бесплатно, но не дают использовать в коммерческих целях.

📄 Проблема №2 — работа с постановлениями

PDF, конечно же, со сканами страниц. Значит, распознаём текст: • Для старта взял mistral-ocr за 0,15₽/лист в OpenRouter • Дальше перешёл на бесплатный Tesseract OCR на своём сервере

Текст анализирует grok-4.1-fast: 0,03₽/лист в OpenRouter

💰 Проблема №3 — доков много, дорого

По мета-информации из госAPI настроил фильтрацию заведомо нерелевантных доков.

На GPT OSS 20B выходило меньше 0,01₽/документ в OpenRouter.

Чтобы не платить в целом, подрубил ту же модель через подписку на Ollama Cloud с бездонными лимитами за $20/мес.

🗂 Проблема №4 — CRM для данных

Важный нюанс: праздники повторяются каждый год, но точная дата многих становится известной в рандомный момент. Может за 12 мес., а может и за 2 дня (реальные кейсы).

Но я хочу показывать и прогнозные даты праздников.

Чтобы не пилить ничего, просто взял Notion и сделал 5 баз через Codex: регионы, праздники (план), праздники (факт), документы, ошибки обработки.

🙈 Проблема №5 — API

О том, что из Notion будет сложно тянуть данные в API, я подумал слишком поздно.

Но данные обновляются редко, поэтому они просто выкачиваются периодически из Notion, и дальше API раздаёт.

Понял, что Notion был ошибкой, но оставил, ибо всё уже работало.

😒 Проблема №6 — цифры не сошлись

Тут я узнал про распоряжения и постановления, которые почему-то есть только на агрегаторах, и другие приколы.

Как я выяснил дальше, у меня не было 40% праздников.

Отправил OpenClaw жечь лимиты в Ollama и ₽₽ на поиск Perplexity (~1₽/регион), который нашёл мне все недостающие праздники в каждом регионе, все документы и прочие штуки с 0% разработки.

Ну и доблестный батлер Альберто (как себя самоидентифицирует мой OpenClaw) теперь на страже целостности данных и следит за выходом новых постановлений.

~2 ч. на настройку и отладку

⚔️ Разработка

ChatGPT Codex собрал всё поверх текущего проекта безукоризненно.

Было стрёмно, что ты В ЧАТЕ и код не видишь, как привык в IDE. Скатиться в LGTM стало сложнее, но я справился.

📊 Итого:

• Первичное наполнение базы: ~100₽ с экспериментами

• Обработка новых постановлений: < 1₽ в неделю

• Разработка: 2 недели и 12 часов чистого времени

• Подписки: $20/мес. на ChatGPT и $20/мес. на Ollama, которые у меня много где ещё используются

Ещё год назад эти цифры были бы совершенно другими — как по времени разработки, так и по затратам на модели.

С нетерпением жду, что будет ещё через год 😅

@tsvetkovdaily #ии_в_работе


В этом посте были ссылки, но мы их удалили по правилам Сетки