Продолжаем блог по проекту пока не найду работу
На прошлом этапе я распарсил новости с нескольких сайтов и загрузил их в базу. Теперь самое главное понять, действительно ли новость полезна и затрагивает ли она компании которые меня интересуют. Для анализа развернул Ollama буду использовать ИИ локально на своём железе. API стоят денег, а задача пока не настолько требовательная, чтобы платить. У меня RTX 3060 на 12 ГБ видеопамяти, под неё поставил Qwen3 на 8B параметров. В загруженном состоянии модель потребляет около 60% памяти — запас нужен, потому что промты, которые я буду в неё заливать, существенно увеличат потребление. Начал с простого: написал код, кинул короткий промт вместе с новостью и спросил ИИ, насколько она хорошая, получил ответ, а значит все работает. Быстро понял, что ответы нужно парсить. Тогда переписал подход заставил модель отдавать данные строго в формате JSON. В ответе теперь тикер компании, важность новости, комментарий и ещё несколько параметров. В промте подробно описал, что писать в каждом поле и как всё считать. Если новость не рыночная по типу спорта, кошечка на дереве или стример поругался то прошу вернуть JSON без тикера, и такая запись в БД не уходит. Дальше вспомнил что одна новость может влиять на несколько компаний из одной отрасли. Санкции против финансового сектора, например, бьют сразу по всем банкам. Пришлось модернизировать базу, промт и парсер, чтобы корректно обрабатывать массив тикеров По итогу получил рабочий способ проверки новостей, хоть и не без нюансов. Несмотря на кучу требований присылать JSON и только JSON, примерно каждая 18-я новость приходит каким-то отчётом на несколько абзацев. Пока не знаю, как с этим бороться, вернусь позже
P.S. проект все равно буду писать даже если найду работу) P.P.S.Если у вас есть какие то советы к примеру моему проекту или как улучшить резюме то пишите, всегда рад выслушать и улучшить себя и свои навыки