Так получилось, что последние пару лет я зарабатываю на хлеб разметкой данных. Сфера, прямо скажем, обделённая вниманием (поищите посты в Сетке). Про машинное обучение знаете? Слышали, что для него нужны какие-то «датасеты»? Вот. Их пока делают люди: сидят и решают простые задачи, чтобы потом передать машинам. Выделяют слова в диалогах, сравнивают, какое смузи красивее, оцифровывают рукописи, выделяют карнизы на фотках и т. д. Смотрели «Possessor»? Там в одном эпизоде как раз показан процесс, с, так скажем, художественными преувеличениями 🍆(кино же). И вокруг этих простых задач существует целая экосистема: платформы для разметки, ETL, хранилища, всякая малая и большая автоматизация и, конечно, LLM. Данных бизнесу нужно много, производство обходится в кругленькую сумму. Естественно, хочется сэкономить. И в нашем цеху есть большое поле для экспериментов. Подключая LLM к человечьей работе, я могу количественно оценить точность их ответов в разных задачах. Так вот, из коробки, без файн-тюнинга, без RAG на задачах классификации текста лучшее, что удалось получить, — 95% точность в задачах с двумя классами. И то после многочасовой полировки промптов. На сложных задачах со 100+ классами — это 60–70%, если повезёт. К чему я веду. Когда вам будут продавать очередного AI-агента, робо-разгребатора резюме, ИИ-передаста или какого другого болванчика с LLM под капотом, задумайтесь, сколько неправильных решений он будет принимать? Какова цена ошибки? Готовы ли вы из-за неправильных решений, например, отказать в обслуживании трети клиентов или отправить пятую часть резюме профессионалов в мусор? Заплатить за десяток яиц, где одно — тухлое? Может быть, отправите на нары человека, который на 60% похож на фоторобот? Сколько сил у вас займёт контроль качества? Выявление и решение проблем? Стоит ли того хайп и кажущаяся экономия?
12 комментов
· 21.08.2025
о, так вот вы где 😄
я когда то на заре появления дипсик душнил ее про то что она(нейросеть) вообще такое как ее учат и т. д. и вот от нее узнал что есть целые корпорации которые занимаются подготовкой данных для обучения, а если этим не заниматься то начинаются перекосы, в стиле: 70% научных работ по математике написали мужчины, поэтому если женщина спросит может ли она были математиком - нейросеть ответит что нет.
крутое дело делаете )
0
ответить
коммент удалён
· 21.08.2025
Познавательно и полезно. Тем не менее, человек также не застрахован от ошибок и процент человеческих ошибок едва ли не больше, чем у ИИ. Нет, я не защищаю ИИ и разделяю тезисы приведенные в посте. Но справедливости ради, разве человек является гарантом точности данных и их правдивости. И разве корректность данных не зависит от контекста? Что верно для одного, то ошибка для другого. Знания или данные, это результат проекции точки зрения на объект исследования. Если провести параллель с гео позиционированием, то для стандартного позиционирования достаточно 4 спутников это точность от 1 метра до 5. Для позиционирования 2-5 см, необходимо уже 11 спутников. Также и со знаниями и датасетами. Истина где то рядом, но не в знаниях и датасетах, он лишь проекция.
0
ответить
коммент удалён
· 21.08.2025
Всё так. И люди ошибаются. Риски есть всегда. Важно оценивать их при выборе решения. Об этом пост. Про 4 спутника - хороший пример. В краудсорсинге данных широко используется т.н. перекрытие, когда один и тот же вопрос задаётся нескольким асессорам, а ответы либо усредняются, либо выбираются в зависимости от распределения голосов (и, возможно, других факторов). Это гарантирует желаемую точность, с некоторыми допущениями. Тема интересная и обширная.
0
ответить
ответ удалён
· 22.08.2025
Мне интересен механизм краудсорсинга данных, в определенных предметных областях и формате. Поэтому, был бы очень признателен за совет и рекомендации по организации процесса.
0
ответить
ответ удалён
· 22.08.2025
Проще всего начать с инструкций для заказчиков в Яндекс Заданиях и ТегМи. Оттуда будет понятен процесс в общих чертах. https://yandex.ru/support/tasks-requester/ru/guide/overview https://tagme.sberdevices.ru/docs/customer/index.html Особое внимание - разделам про контроль качества.
Ещё можно поискать плейлист Toloka 101 от TolokaAI на медленном видеохостинге.
0
ответить
ответ удалён
· 22.08.2025
Спасибо, материала не на 5 минут. Если не возражаете, вернусь за советом, после изучения
0
ответить
ответ удалён
· 22.08.2025
Не возражаю)
0
ответить
ответ удалён
· 22.08.2025
Своим ходом и для своих потребностей я придумал некий интернет-проект для решения определённой потребности. Но в попытках его реализовать и заинтересовать им потенциальных заказчиков/инвесторов нашёл в проекте, скажем так, "незаявленные возможности". И среди них, возможно, что "разметку" информации по смыслу/значению…. но может я в этом ошибаюсь? Если будет интересно, посмотрите описание по ссылке https://walks.ru/text/ В той части, где рассказ про "Каталог различной информации..." Ведь если не ошибаюсь, то этот проект — способ получения "размеченых", осмысленных данных не только для людей, но и для качественного машиного обучения.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 22.08.2025
Мне откликается идея "каталога информации", реализованного как протокол. Но не откликается идея ограничения контента. Вдруг Земля правда плоская😜? Или завтра выяснится, что она не геоид, а ещё более замысловатой формы? Или для решения моих задач лучше подходит модель плоской Земли? А вот получить механизм выбора информации, где бы пользователь сам выбирал, кому он доверяет и в какой мере, и механизмы агрегации - это интересно. Как нибудь пофилософствую на эту нему.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 22.08.2025
Про "ограничения" информации — вопрос из самых сложных и важных. Поэтому и придуманы "уровни" подачи информации. Это когда одна и таже тема может быть изложена для разного "потребителя": ребёнок, подросток, студент, профессор, "просто мимо проходил". На определённых уровнях можно добавлять в "коллекцию" материалы и про "плоскую землю", и про "пересекающийся параллельные", и про то, что почему-то делить на 0 нельзя, а умножать можно??? 🤗😁🙃 Кроме уровней "сложности" в этой системе могут быть и другие уровни, слои, пространства и миры.
Но я так и не понял — подойдёт ли данный подход для сбора "размеченных" данных ещё на уровне их внесения?
ПС небольшой пример реализации идеи https://www.walks.ru/wm_dr/
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 22.08.2025
Скорее для визуализации. Разметка (непосредственно сбор данных) сейчас выглядит как составление таблиц вроде: "img001.jpg" | "Кот" "img002.jpg" | "Пёс" "img003.jpg" | "Кот" ...
Но разметка не просто про внесение. Это целый конвеер. Посмотрите, как это выглядит, здесь в комментах я оставлял ссылки на материалы.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 22.08.2025
Вероятно я плохо расписал в файле про "каталог..." организацию каталогизации информации. Посмотрите на "Древо рода.." Как пример организации каталога по смыслам/значениям информации. Это когда в теме пёс есть общие описания, рассказы, .... И другие темы о разных породах собак с более подробными данными, видео, фото... научными и популярными текстами и, может, записями лая ... 🤭
Но самое интересное в моём предложении это то, что заполнением базы данных / разметкой информации будут заниматься те, кто "в теме": — собачники любители; — ветеринары; — научные работники; — .... — грумеры...
Как то так...
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён