Про AI Native …
Почему данные становятся тормозом для ИИ
Пока все смотрят на новые архитектуры LLM 2025-2026 (DeepSeek с гиперсвязями, гибридные модели Google, рекурсивную память от MIT), на земле происходит гораздо менее заметная, но критическая трансформация.
Компании, которые всерьез заходят в AI-native сценарии, упираются не в мощности GPU и не в качество моделей. Они упираются в данные.
Вот типичная картина в крупных организациях сегодня:
Доступ к данным — месяц согласований. Управление доступом на уровне “человек — объект”. Данные обновляются раз в сутки (batch). Аналитики работают через BI с t-1 данными. Любой запрос за пределы стандартного отчета — это отдельный проект с разработкой. И в этой инфраструктуре пытаются запустить ИИ-агентов.
Спойлер: не взлетит.
Агенты работают принципиально иначе. Им нужен доступ: — за секунды, а не недели — к real-time данным, а не ко “вчера” — через self-service, а не через тикеты в поддержку
Что происходит на практике?
Компании, которые проходят эту трансформацию, пересобирают подход к данным под три принципа:
1. Data Lake First
Любой источник обязан иметь слой хранения данных. “Распил монолитов” без сохранения истории убивает возможность обучать модели на ретроспективе.
2. Real-time как baseline
Микробатчи раз в 15 минут — это уже legacy. Агенты должны видеть состояние системы здесь и сейчас, иначе их ответы бесполезны.
3. Управление доступом через процессы
Ручное согласование каждого запроса не масштабируется. Когда придут тысячи агентов (а они придут), старая модель рухнет. Нужна ролевая модель, зашитая в процесс, а не в переписку с безопасником.
Цифры для понимания масштаба:
В некоторых организациях количество инцидентов мониторинга данных растет с 6 до 9 тысяч в месяц. Нагрузка на инженеров — в 2-3 раза за год.
И это ДО массового внедрения агентов. Дальше будет кратный всплеск self-service запросов, и текущая инфраструктура его просто не выдержит.
Парадокс в том, что: Модели становятся все эффективнее (MoE, гибридные архитектуры, сжатие KV-кэша), они требуют все меньше вычислительных ресурсов на токен. Но узкое место смещается с compute на data pipeline.
Можно иметь самую продвинутую LLM, но если данные, до которых она добирается, — это устаревший слепок реальности с ручным доступом, результат будет плачевным.
О чем молчат вендоры ИИ Ни один провайдер LLM не расскажет вам, что ваши данные — главная проблема. Они продают модели. Но модель без данных — это двигатель без топлива.
Поэтому стратегия на 2025-2026 у тех, кто действительно внедряет ИИ, выглядит не как “купим самую большую модель”, а как:
— инвентаризация данных по критическим процессам — внедрение метрик качества (не 10% процессов, а 100%) — перевод доступа на ролевую модель — real-time везде, где это возможно — подготовка к 10x росту self-service запросов
Итог Данные перестают быть “IT-активом”. Они становятся операционным фундаментом для ИИ. И те, кто не перестроит управление данными сейчас, через два года будут смотреть, как конкуренты кратно быстрее выводят продукты, потому что их агенты не ждут доступа месяц и не работают с данными “за вчера”.
AI-native — это не про модели. Это про данные, готовые к тому, чтобы модели к ним обращались.
Мой канал https://t.me/manager_dot_exe
· 14.03
Да, про данные тоже на всех конференциях говорят :) 👍
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён