«Исследование» парадокса безопасности локальных LLM 🤖
Попалась на Хабре статья-перевод о парадоксе безопасности в локально развернутых LLM.
Если коротко — чем меньше модель, тем хуже она распознаёт пасхалки и бэкдоры в технических задачах. А значит, тем выше риск уязвимостей в решениях, которые на ней строятся.
В статье приводят примеры обхода проверок безопасности — через аргументацию о "подарках и сюрпризах" или перегрузку внимания, когда модель засыпают отвлекающими вопросами, а затем просят написать вредоносный код.
И вроде бы всё правильно, но в очередной раз лишь подчёркивает — LLM, в первую очередь, инструмент.
Им можно пользоваться по назначению, а можно — попытаться микроскопом гвозди забить. Всё зависит от того, кто держит инструмент в руках.
Вряд ли стоит ожидать, что ребёнок без присмотра взрослого сможет, даже по инструкции, приготовить торт и не разгромить кухню. (Ладно, ещё пример 😉) Не стоит бездумно пускать джунов с LLM в руках в разработку без надзора старших.
Для тех, кто хочет ознакомиться с источниками: Перевод: Habr Оригинал: Quesma Blog