Microsoft решила доказать, что ИИ действительно способен хорошо выполнять работу людей и легко заменять сотрудников, но в итоге доказала обратное.

Для этого были взяты известные нейронки (ChatGPT, Grok, Claude, Gemini и т.д.), которым давали длинную рабочую задачу без проверки человеком.

Все модели оказались «ненадёжными делегатами». ИИ хорошо начинает выполнять задачу, несколько первых этапов работает нормально, а затем внезапно удаляет часть документа, переписывает важные данные, ломает формат, вставляет выдуманную информацию и многое другое.

При этом ошибки часто тихие и незаметные, из-за чего пользователь может их не увидеть.

Крупнейшие нейронки Gemini, Claude и GPT в среднем повреждали около четверти содержимого файла. Более слабые модели ломали до половины.

Иногда они всё делают идеально, но в какой-то момент создают катастрофический сбой одним действием, из-за чего ломается и их работа, и работа всего остального.

Кто бы мог подумать r/#technology


В этом посте были ссылки, но мы их удалили по правилам Сетки

Microsoft решила доказать, что ИИ действительно способен хорошо выполнять работу людей и легко заменять сотрудников, но в итоге доказала обратное | Сетка — социальная сеть от hh.ru