ИИ-ассистент — день 19 из 30 ✅
Продолжаю биться над одной из самых упёртых задач: 📄 как корректно извлекать текст из PDF и DOC-документов, чтобы потом загружать его в векторную базу данных.
Звучит вроде просто. Но на практике — адский микс из костылей, недописанных библиотек, странных форматов и полной тишины в официальной документации.
Пересмотрел кучу видео на YouTube. И если честно — особенно в русском сегменте это какой-то карнавал жульничества: люди просто копируют готовые workflows с Reddit или GitHub, слегка переименовывают ноды, и выдают это за свой опыт. Записывают туториалы, монетизируют аудиторию, собирают донаты — а по сути продают воздух. Никакой отладки, никакой глубины, никакой поддержки — просто красиво поданная копипаста.
По факту — решить задачу пока не удалось. Работаю в режиме «ищу выход», постоянно проверяю новые библиотеки, подключаюсь к англоязычным коммьюнити, тестирую разные связки. Но стабильного решения пока нет.
Периодически появляется мысль: «Может, уже вложиться деньгами? Купить готовый модуль, API или найти консультанта». Но даже это не просто — сложно понять, куда вкладываться, если нет уверенности, что оно реально сработает.
Тем не менее — продолжаю. Это как мини-R&D внутри моего проекта: пробую, ломаю, чиню. Всё ради того, чтобы ассистент умел работать с реальными файлами и отвечать на вопросы на основе конкретных документов, а не абстракций.
Если у тебя был подобный опыт или ты решал такие задачи — поделись. Любой вменяемый инсайт сейчас на вес золота 💬
· 20.08.2025
Понимаю, вот и ищу способ как его разархивировать в xml хотя бы и в plain text перевести, про md текст пока даже не мечтаю
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён