«Исследование» парадокса безопасности локальных LLM 🤖

Попалась на Хабре статья-перевод о парадоксе безопасности в локально развернутых LLM.

Если коротко — чем меньше модель, тем хуже она распознаёт пасхалки и бэкдоры в технических задачах. А значит, тем выше риск уязвимостей в решениях, которые на ней строятся.

В статье приводят примеры обхода проверок безопасности — через аргументацию о "подарках и сюрпризах" или перегрузку внимания, когда модель засыпают отвлекающими вопросами, а затем просят написать вредоносный код.

И вроде бы всё правильно, но в очередной раз лишь подчёркивает — LLM, в первую очередь, инструмент.

Им можно пользоваться по назначению, а можно — попытаться микроскопом гвозди забить. Всё зависит от того, кто держит инструмент в руках.

Вряд ли стоит ожидать, что ребёнок без присмотра взрослого сможет, даже по инструкции, приготовить торт и не разгромить кухню. (Ладно, ещё пример 😉) Не стоит бездумно пускать джунов с LLM в руках в разработку без надзора старших.

Для тех, кто хочет ознакомиться с источниками: Перевод: Habr Оригинал: Quesma Blog