Я долго думал, как показать то, над чем сейчас работаю. В итоге решил начать не с кода, а с одной проблемы.
Можно ли взять клинические рекомендации на сотню страниц и превратить их в интерактивную модель заболевания так, чтобы LLM не начинала додумывать связи сама?
Оказалось, что построить красивый граф - это самая простая часть. Гораздо сложнее сделать так, чтобы: - каждая сущность имела источник - каждая связь была привязана к исходному тексту - модель не могла создавать новые сущности на лету - неподтверждённые связи не превращались в медицинские факты - результат можно было проверить, а не просто поверить AI
В итоге вместо одного большого запроса получился отдельный pipeline Graph -> Entities -> Relations -> Evidence -> Verify
На одном большом документе полный pipeline может обрабатывать около 2,2 млн токенов и занимать порядка 12 - 15 минут. И это уже не тот случай, когда можно просто нажать сгенерировать для каждого пользователя.
Поэтому я построил систему так, чтобы один раз созданное исследование становилось версионируемым knowledge artifact и могло использоваться многими пользователями. Сейчас Curatio находится на финальной стадии перед релизом. В следующей статье покажу, как это устроено изнутри: - почему one-shot генерация не сработала - как разделение entities и relations уменьшает пространство ошибок - как каждое утверждение связывается с исходным текстом - почему confidence и importance разные вещи - и как один и тот же набор медицинских знаний можно представить в виде графа, пути, ленты или блока.
Продолжение скоро. #medicalAI #clinicalinformatics #LLM #knowledgegraph #healthtech #AI
· 22.08
2,2 млн токенов на документ — это ж какой счёт за api выходит за один прогон? и сколько времени ушло на отладку verify-шага, чтобы он реально резал галлюцинации, а не просто переспрашивал модель
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён