ИИ-ассистент — день 19 из 30 ✅

Продолжаю биться над одной из самых упёртых задач: 📄 как корректно извлекать текст из PDF и DOC-документов, чтобы потом загружать его в векторную базу данных.

Звучит вроде просто. Но на практике — адский микс из костылей, недописанных библиотек, странных форматов и полной тишины в официальной документации.

Пересмотрел кучу видео на YouTube. И если честно — особенно в русском сегменте это какой-то карнавал жульничества: люди просто копируют готовые workflows с Reddit или GitHub, слегка переименовывают ноды, и выдают это за свой опыт. Записывают туториалы, монетизируют аудиторию, собирают донаты — а по сути продают воздух. Никакой отладки, никакой глубины, никакой поддержки — просто красиво поданная копипаста.

По факту — решить задачу пока не удалось. Работаю в режиме «ищу выход», постоянно проверяю новые библиотеки, подключаюсь к англоязычным коммьюнити, тестирую разные связки. Но стабильного решения пока нет.

Периодически появляется мысль: «Может, уже вложиться деньгами? Купить готовый модуль, API или найти консультанта». Но даже это не просто — сложно понять, куда вкладываться, если нет уверенности, что оно реально сработает.

Тем не менее — продолжаю. Это как мини-R&D внутри моего проекта: пробую, ломаю, чиню. Всё ради того, чтобы ассистент умел работать с реальными файлами и отвечать на вопросы на основе конкретных документов, а не абстракций.

Если у тебя был подобный опыт или ты решал такие задачи — поделись. Любой вменяемый инсайт сейчас на вес золота 💬

ИИ-ассистент — день 19 из 30 ✅ | Сетка — социальная сеть от hh.ru ИИ-ассистент — день 19 из 30 ✅ | Сетка — социальная сеть от hh.ru