Про AI Native …

Почему данные становятся тормозом для ИИ

Пока все смотрят на новые архитектуры LLM 2025-2026 (DeepSeek с гиперсвязями, гибридные модели Google, рекурсивную память от MIT), на земле происходит гораздо менее заметная, но критическая трансформация.

Компании, которые всерьез заходят в AI-native сценарии, упираются не в мощности GPU и не в качество моделей. Они упираются в данные.

Вот типичная картина в крупных организациях сегодня:

Доступ к данным — месяц согласований. Управление доступом на уровне “человек — объект”. Данные обновляются раз в сутки (batch). Аналитики работают через BI с t-1 данными. Любой запрос за пределы стандартного отчета — это отдельный проект с разработкой. И в этой инфраструктуре пытаются запустить ИИ-агентов.

Спойлер: не взлетит.

Агенты работают принципиально иначе. Им нужен доступ: — за секунды, а не недели — к real-time данным, а не ко “вчера” — через self-service, а не через тикеты в поддержку

Что происходит на практике?

Компании, которые проходят эту трансформацию, пересобирают подход к данным под три принципа:

1. Data Lake First

Любой источник обязан иметь слой хранения данных. “Распил монолитов” без сохранения истории убивает возможность обучать модели на ретроспективе.

2. Real-time как baseline

Микробатчи раз в 15 минут — это уже legacy. Агенты должны видеть состояние системы здесь и сейчас, иначе их ответы бесполезны.

3. Управление доступом через процессы

Ручное согласование каждого запроса не масштабируется. Когда придут тысячи агентов (а они придут), старая модель рухнет. Нужна ролевая модель, зашитая в процесс, а не в переписку с безопасником.

Цифры для понимания масштаба:

В некоторых организациях количество инцидентов мониторинга данных растет с 6 до 9 тысяч в месяц. Нагрузка на инженеров — в 2-3 раза за год.

И это ДО массового внедрения агентов. Дальше будет кратный всплеск self-service запросов, и текущая инфраструктура его просто не выдержит.

Парадокс в том, что: Модели становятся все эффективнее (MoE, гибридные архитектуры, сжатие KV-кэша), они требуют все меньше вычислительных ресурсов на токен. Но узкое место смещается с compute на data pipeline.

Можно иметь самую продвинутую LLM, но если данные, до которых она добирается, — это устаревший слепок реальности с ручным доступом, результат будет плачевным.

О чем молчат вендоры ИИ Ни один провайдер LLM не расскажет вам, что ваши данные — главная проблема. Они продают модели. Но модель без данных — это двигатель без топлива.

Поэтому стратегия на 2025-2026 у тех, кто действительно внедряет ИИ, выглядит не как “купим самую большую модель”, а как:

— инвентаризация данных по критическим процессам — внедрение метрик качества (не 10% процессов, а 100%) — перевод доступа на ролевую модель — real-time везде, где это возможно — подготовка к 10x росту self-service запросов

Итог Данные перестают быть “IT-активом”. Они становятся операционным фундаментом для ИИ. И те, кто не перестроит управление данными сейчас, через два года будут смотреть, как конкуренты кратно быстрее выводят продукты, потому что их агенты не ждут доступа месяц и не работают с данными “за вчера”.

AI-native — это не про модели. Это про данные, готовые к тому, чтобы модели к ним обращались.

Мой канал https://t.me/manager_dot_exe

Про AI Native … | Сетка — социальная сеть от hh.ru