Большие проблемы с большими данными.
Первый раз я вошёл в интернет в сентябре 1995 года и до появления поисковой системы Google оставалось ещё два года. На ранних этапах развития интернета люди пытались эту мусорную корзину каталогизировать. Популярные тематические каталоги вела, например, America Online. Вскоре стало понятно, что количество сайтов стало так велико, что сами каталоги замусорились, а информация в них устарела.
Необходимо было автоматизированное решение, которое позволит искать информацию в интернете по запросу. И появились первые поисковые машины. Помню пользовался сначала Lycos, потом AltaVista и др. Поисковые машины того периода в основном анализировали содержание страниц: если там много раз использовалось слово «халва», то явно страница сладкая. Тогда же сайты начали обманывать поисковые машины, например, после основного текста белым шрифтом на белом фоне долго и нудно прописывались ключевые слова.
Потом пришёл Google c его алгоритмом PageRank, который считал важными те сайты, на которые больше всего ссылаются другие сайты по заданному запросу. Поисковая выдача была на порядок лучше и Google на долгое время стал безоговорочным лидером. Естественно, его пытались обманывать, но описывать многолетнюю борьбу поисковых движков и поисковой оптимизации сайтов я здесь не буду, так как это займёт много времени.
Сейчас на поляну поиска в интернете пытаются выйти большие лингвистические модели aka «искусственный интеллект». Не то, чтобы они искали лучше, чем Google или Yandex, но выдают сразу выжимку по запросу в виде текста, а также находят информацию про несуществующие вещи. Этим я иногда пользуюсь, ведь интересно иногда посмотреть на химеру. Можно ли обмануть LLM? А как же: в научных статьях начали появляться скрытые промты для ИИ, чтобы нейросети хвалили такие работы.
Стоп. Заметили закономерность? America Online, AltaVista, Google или ChatGPT реализуют стратегию для пользователя «сжатых измерений», как бабочка, управляющая своим полётом. Человеку не нужно читать весь интернет, чтобы найти нужную информацию, нужно правильно сделать запрос или промт, что, однако, не всегда просто. И да, сжатые измерения реализуют через алгоритмы, а значит их можно попытаться обмануть.
А теперь вспомним, насколько модным стал термин «большие данные» в последнее время, всякие там озёра данных, системы управления данными, даже нацпроект есть «Экономика данных и цифровая трансформация государства». А нужны ли для бизнеса и государства именно большие данные или им нужна правильная реализация сжатых измерений?