Как я делал производственный календарь регионов ⚔️ TL;DR: 100₽ на анализ 2 000 доков от органов власти, 12 ч. разработки, OpenClaw закрывший тупую рутину без разработки, косяк с выбором CRM и неожиданные твисты из сферы
Итак, думал, что соберу быстро с ИИ. Будет изи.
Что получилось и зачем в предыдущем посте...
А сейчас про 6 проблем на пути и итоговые выводы.
🔍 Проблема №1 — первоисточник данных
Их два: • Законы регионов (когда одна дата каждый год) • Постановления правительства/главы региона (дата меняется)
Все публикуются как PDF на государственном сайте. API там шикарное, и можно подписаться на все новинки.
Но вот нюанс: есть то, что нигде официально не публикуется, но каким-то чудом попадает к агрегаторам типа Контур и Консультант.
Эти агрегаторы дают посмотреть бесплатно, но не дают использовать в коммерческих целях.
📄 Проблема №2 — работа с постановлениями
PDF, конечно же, со сканами страниц. Значит, распознаём текст: • Для старта взял mistral-ocr за 0,15₽/лист в OpenRouter • Дальше перешёл на бесплатный Tesseract OCR на своём сервере
Текст анализирует grok-4.1-fast: 0,03₽/лист в OpenRouter
💰 Проблема №3 — доков много, дорого
По мета-информации из госAPI настроил фильтрацию заведомо нерелевантных доков.
На GPT OSS 20B выходило меньше 0,01₽/документ в OpenRouter.
Чтобы не платить в целом, подрубил ту же модель через подписку на Ollama Cloud с бездонными лимитами за $20/мес.
🗂 Проблема №4 — CRM для данных
Важный нюанс: праздники повторяются каждый год, но точная дата многих становится известной в рандомный момент. Может за 12 мес., а может и за 2 дня (реальные кейсы).
Но я хочу показывать и прогнозные даты праздников.
Чтобы не пилить ничего, просто взял Notion и сделал 5 баз через Codex: регионы, праздники (план), праздники (факт), документы, ошибки обработки.
🙈 Проблема №5 — API
О том, что из Notion будет сложно тянуть данные в API, я подумал слишком поздно.
Но данные обновляются редко, поэтому они просто выкачиваются периодически из Notion, и дальше API раздаёт.
Понял, что Notion был ошибкой, но оставил, ибо всё уже работало.
😒 Проблема №6 — цифры не сошлись
Тут я узнал про распоряжения и постановления, которые почему-то есть только на агрегаторах, и другие приколы.
Как я выяснил дальше, у меня не было 40% праздников.
Отправил OpenClaw жечь лимиты в Ollama и ₽₽ на поиск Perplexity (~1₽/регион), который нашёл мне все недостающие праздники в каждом регионе, все документы и прочие штуки с 0% разработки.
Ну и доблестный батлер Альберто (как себя самоидентифицирует мой OpenClaw) теперь на страже целостности данных и следит за выходом новых постановлений.
~2 ч. на настройку и отладку
⚔️ Разработка
ChatGPT Codex собрал всё поверх текущего проекта безукоризненно.
Было стрёмно, что ты В ЧАТЕ и код не видишь, как привык в IDE. Скатиться в LGTM стало сложнее, но я справился.
📊 Итого:
• Первичное наполнение базы: ~100₽ с экспериментами
• Обработка новых постановлений: < 1₽ в неделю
• Разработка: 2 недели и 12 часов чистого времени
• Подписки: $20/мес. на ChatGPT и $20/мес. на Ollama, которые у меня много где ещё используются
Ещё год назад эти цифры были бы совершенно другими — как по времени разработки, так и по затратам на модели.
С нетерпением жду, что будет ещё через год 😅
@tsvetkovdaily #ии_в_работе
В этом посте были ссылки, но мы их удалили по правилам Сетки