Я долго думал, как показать то, над чем сейчас работаю. В итоге решил начать не с кода, а с одной проблемы.

Можно ли взять клинические рекомендации на сотню страниц и превратить их в интерактивную модель заболевания так, чтобы LLM не начинала додумывать связи сама?

Оказалось, что построить красивый граф - это самая простая часть. Гораздо сложнее сделать так, чтобы: - каждая сущность имела источник - каждая связь была привязана к исходному тексту - модель не могла создавать новые сущности на лету - неподтверждённые связи не превращались в медицинские факты - результат можно было проверить, а не просто поверить AI

В итоге вместо одного большого запроса получился отдельный pipeline Graph -> Entities -> Relations -> Evidence -> Verify

На одном большом документе полный pipeline может обрабатывать около 2,2 млн токенов и занимать порядка 12 - 15 минут. И это уже не тот случай, когда можно просто нажать сгенерировать для каждого пользователя.

Поэтому я построил систему так, чтобы один раз созданное исследование становилось версионируемым knowledge artifact и могло использоваться многими пользователями. Сейчас Curatio находится на финальной стадии перед релизом. В следующей статье покажу, как это устроено изнутри: - почему one-shot генерация не сработала - как разделение entities и relations уменьшает пространство ошибок - как каждое утверждение связывается с исходным текстом - почему confidence и importance разные вещи - и как один и тот же набор медицинских знаний можно представить в виде графа, пути, ленты или блока.

Продолжение скоро. #medicalAI #clinicalinformatics #LLM #knowledgegraph #healthtech #AI

Я долго думал, как показать то, над чем сейчас работаю.
В итоге решил начать не с кода, а с одной проблемы | Сетка — социальная сеть от hh.ru