Главный ресурс AI — не модель, а данные
Что если следующий прорыв в AI будет зависеть не от новой модели, а от старых данных, которые никто не может нормально соединить? NSF выделил для этого отдельную программу.
22 июля Национальный научный фонд США объявил программу Unlocking Dataset Value for AI-Enabled Scientific Discovery.
NSF планирует вложить до 100 миллионов долларов в проекты, которые помогут исследовательским сообществам превратить существующие научные данные в доступную, совместимую и пригодную для AI инфраструктуру.
Фокус программы показательный: не собирать еще больше данных, а повысить ценность уже накопленных массивов.
Проблема знакомая не только ученым. Данные часто:
— лежат в разных форматах;
— имеют неполные или несовместимые метаданные;
— закрыты для других команд;
— не имеют понятного происхождения;
— не готовы к автоматической обработке.
Модель может быть очень сильной, но если она получает несвязанные, плохо описанные или неподтвержденные данные, результат будет выглядеть умнее, чем он есть на самом деле.
Поэтому AI-инфраструктура все больше похожа не на "подключили модель к базе", а на инженерную цепочку:
источник → схема → метаданные → права доступа → проверка качества → воспроизводимый результат.
Для BigTech и банков это особенно важный сигнал. Конкуренция будет идти не только за размер модели и GPU, но и за то, насколько быстро компания умеет превращать разрозненные данные в надежный контекст для решений.
Вопрос уже не только в том, какую модель выбрать. Вопрос в том, сможет ли команда доказать:
— откуда взялся каждый важный факт;
— почему этим данным можно доверять;
— кто имеет право их использовать;
— можно ли повторить результат через месяц.
AI не отменяет работу с данными. Он делает цену плохой работы с ними намного выше.
Где у вас сейчас главный bottleneck: в модели, вычислениях или в том, что данные до сих пор не умеют нормально разговаривать друг с другом?
Источник: National Science Foundation, 22.07.2026. https://www.nsf.gov/news/new-nsf-initiative-aims-unlock-dataset-value-ai-enabled
#AI #dataengineering #datascience #BigTech #банки #research #izagprog