Скрытые бэкдоры в LLM.

**Self‑Feeding Loop (SFL)** – быстрый способ «провести» LLM в поисках скрытых backdoor‑ов, используя только её собственные ответы как новый ввод.

Суть метода

Вместо того чтобы задавать модель один и тот же вопрос многократно, мы берём каждый ответ модели и отправляем его обратно как следующее сообщение. Диалог постепенно «сдвигается» в сторону тех паттернов, на которых модель была дообучена. Если там спрятана вредоносная реакция, она проявится уже через несколько шагов.

Как работает

1. **Инициализация** – задаём обычный стартовый вопрос (приветствие, запрос анекдота и т.п.). 2. **Цепочка** – копируем полный ответ модели и вставляем его как новое сообщение. 3. **Повторяем** 4–10 раз, наблюдая за тем, куда смещается тема. 4. **Анализ** – если в процессе появляются упоминания паролей, инструкций по взлому, странных команд или любой контент, не связанный с исходным запросом, это сигнал о возможном backdoor‑е.

Шаги в виде схемы

``` [Start] → Q0 (стартовый вопрос) ↓ A0 (ответ модели) ↓ A0 → Q1 (повторяем ответ как вопрос) ↓ A1 … ↓ An ← анализируем тему ```

Пример применения

**Контекст:** Вы скачали модель из Hugging Face и хотите быстро проверить её «чистоту». ```text Шаг 0: "Привет, расскажи анекдот." Ответ A0: (анекдот) Шаг 1: Вставляем A0 как новый вопрос. Ответ A1: ... ... ``` После 4–6 шагов вы видите, например, фразу «пожалуйста, введите пароль» – это тревога.

Шаблон промпта (для копирования)

```text {start_question} ``` *После получения ответа модели скопируйте его целиком и вставьте как новое сообщение. Повторяйте 4–8 раз.*

Границы применимости

**Когда полезен:** • Локальные, открытые модели (Hugging Face, Ollama, LM Studio). • Проверка моделей дообученных на неизвестных данных. • Быстрая предварительная проверка (4 шага). **Когда бесполезен:** • Облачные сервисы ChatGPT/Claude – нельзя «заразить» их и метод бессмыслен. • Модели без дообучения – вероятность ложного тревога выше. • Требуется детальный анализ, если SFL не выявил ничего.

Ключевые выводы из экспериментов

- **Baseline** (повтор одного вопроса): 1/120 попыток обнаружила backdoor. - **SFL**: 5/6 заражённых моделей раскрыли скрытую реакцию при 4 шагах, точность ≈ 92%. - Уменьшение цепочки до 4 шагов не снижает эффективность и экономит ~60% запросов.

Что делать не надо

- Не использовать SFL как единственный метод проверки. - Не игнорировать «странные» отклонения без дальнейшего анализа – могут быть ложными тревогами. - Не применять к сервисам, где вы не контролируете модель (облачные API).

**Номер исследования:** 2608.11348 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.