Распознавание текста с использованием Snowflake Cortex AI
🤯 Всего 4 строки SQL — и у тебя уже работает распознавание текста (OCR) прямо в Snowflake!
🔎 Функция PARSE_DOCUMENT — это LLM-функция в Snowflake Cortex AI. Она использует OCR для извлечения данных из PDF-файлов (и не только). Идеально подходит для:
• RAG-пайплайнов, которые питают Cortex Search • Обработки LLM-задач, например, для суммаризации или перевода документов • Извлечения сущностей “с нуля” с использованием структурированного вывода (моя любимая фишка!)
📁 У тебя есть stage, забитый PDF-файлами? Просто укажи PARSE_DOCUMENT на нужный stage — и извлекай данные. Но вот где начинается настоящая магия 👇
🤖 Ответ приходит в виде JSON-объекта, который ты можешь сразу передать… другой LLM-функции в Snowflake, например, COMPLETE!
Всего 7 строк SQL — и ты уже применяешь мощные AI-инструменты в своих проектах.
🎉 Режим OCR теперь доступен всем, а режим LAYOUT — в публичной превью-версии.
https://docs.snowflake.com/en/user-guide/snowflake-cortex/parse-document#using-parse-document
Примеров использования огромное множество: Обработка договоров, архивных документов, извлечение данных из актов счетов ,