95% компаний сталкиваются с проблемами при внедрении ИИ
Все вокруг внедряют ИИ Тратят на это огромные бюджеты и делаю красивые презентации с надписью Искусственный Интеллект на каждом слайде. А как иначе? Это очень нравится акционерам, нравится чувство, что ты вкладываешься в прогрессивную IT компанию.
Согласно исследованию AI and Information Management Report 2024 (AvePoint), большинство компаний в ближайшие пять лет планируют направлять не меньше 25% технологического бюджета на ИИ. Звучит внушительно и очень по-взрослому. Но дальше мне стало очевидно, что ИИ еще не скоро кого-либо из нас заменит. Потому что при всех этих бюджетах только 46% компаний реально обучают сотрудников работе с ИИ. То есть инструмент купили, доступ выдали, а дальше они думают, что люди сами как-нибудь разберутся. При этом эксперты рекомендуют, что до 40% AI-бюджета логично тратить именно на обучение.
А потом мы переходим к данным. На вопрос, где вы храните данные организации ответили так: 87% хранят в облаке, 51% хранилища на собственных серверах и 46% в физических документах!!! Где-то между этим всем, я уверена, живёт та самая главная экселька, в которой всё самое важное. Именно её потом и планируют скормить ИИ, чтобы он начал приносить пользу. При этом у почти половины компаний нет нормальных политик архивирования и хранения данных. Примерно столько же вообще не управляют жизненным циклом данных. А около половины всего массива — это данные старше пяти лет, которые с высокой вероятностью являются устаревшими и не могут быть использованы для обучения ИИ.
95% компаний сталкиваются с проблемами в данных при внедрении ИИ, но при этом 88% из них до начала проекта считали себя полностью готовыми к внедрению ИИ. Данные в трёх местах, часть на бумаге, половина устарела, но мы готовы.
ROI при этом почти никто не считает. А без этого внедрение ИИ всего лишь красивый слив бюджета с модным названием.
Мой главный вывод. Инженеры данных без работы не останутся ещё лет десять точно. Потому что мусор на входе всегда даёт мусор на выходе. И никакой ИИ это не чинит.
А что вы думаете по этому поводу? Пишите в комментариях.
· 02.02
ИИ переоценен.
Машинное обучение в целом очень хорошая штука, когда контролируешь входные данные, дата дрифт, процент ошибок на выходе. И саму модель.
Вот этот контроль обычно стоит дорого, делается людьми, а без него оно работает ненадежно.
Потом, внедрили ИИ всегда вопрос - куда? Зачем? Как обучили? Как соотнесли бизнес-метрики с ML-метриками? Если не обучали, как тестировали работу модели на срезе логов бизнес - задач?
Если все эти вопросы без ответа, это не внедрили. Это отчитались в духе "мы оксфордов конечно не кончали, /бумага и у нас в сортирах есть"
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 03.02
Главное не потратить на модель больше денег, чем если нанять людей, которые будут классифицировать данные вручную.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 03.02
Обычно на модель довольно трудно потратить столько денег, если это не какая-то LLM где платишь за доступ. Классификация текстов вообще ну примерно - снять срез текстов, разметить (10 тыс текстов даже для моделей с хреновой обобщающей способностью достаточно, а что-то над русскими эмбеддингами нужно и того меньше) - ну пусть десять, двадцать тыс рублей (это даже не чья-то зарплата) - любой предсказуемо работающий классический ML (своя обученная модель, можно над pretrained эмбедами, для классификации текста много не надо, это не звук) - метрика - прод. Плюс пара зарплат вносить туда изменения.
Но! Если на эту модель подсел бизнес, и за ней не присмотрели - утеряны данные, метрики, артефакты модели - обновлять иногда стоит как сделать новое, убытки бизнеса тоже могут быть дорогими.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 03.02
В ваших расчетах нет затрат на ФОТ МЛ инженеров. Если эту модельку 2 инженера будут разрабатывать 2 месяца, то это 0.5 млн в месяц с учетом налогов, а за 2 уже лям. И ее еще поддерживать надо. Но вы правы в том, что бизнес легко подсаживается на метрики и слишком сильно им доверяет.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 03.02
Не “Оксфордов”, а “Академиев”.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 03.02
Это цитата из Филатова. “Ещё раз о голом короле” 😊
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 03.02
Всё так, но, допустим, принято решение пойти в сторону разметки руками (через краудсорс). Допустим, надо разметить 4 млн текстов всего. Траты на организацию краудсорса (тоже уметь же надо, ФОТ этого человека) никуда не деваются. При этом latency работы такой “ручной модели”, черного куба с людьми - очень непредсказуемый. То есть если текстов мало и запроса на постоянную онлайн - работу такой системы нет, почему бы нет. 😊 Можно и руками краудсорсом. Есть некоторая погрешность работы любой ML модели относительно человеческой работы - обычно применять ML имеет смысл там, где эта погрешность маленькая (привет, непредсказуемые LLM, примененные вне задач генерации текста), задача простая и формализуется легко, а сама ML модель лёгонькая и предсказуемо учится. Ну в звуке это сложнее, чем в текстах, но синтез и появился не так давно 😊
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён