Microsoft решила доказать, что ИИ действительно способен хорошо выполнять работу людей и легко заменять сотрудников, но в итоге доказала обратное.
Для этого были взяты известные нейронки (ChatGPT, Grok, Claude, Gemini и т.д.), которым давали длинную рабочую задачу без проверки человеком.
Все модели оказались «ненадёжными делегатами». ИИ хорошо начинает выполнять задачу, несколько первых этапов работает нормально, а затем внезапно удаляет часть документа, переписывает важные данные, ломает формат, вставляет выдуманную информацию и многое другое.
При этом ошибки часто тихие и незаметные, из-за чего пользователь может их не увидеть.
Крупнейшие нейронки Gemini, Claude и GPT в среднем повреждали около четверти содержимого файла. Более слабые модели ломали до половины.
Иногда они всё делают идеально, но в какой-то момент создают катастрофический сбой одним действием, из-за чего ломается и их работа, и работа всего остального.
Кто бы мог подумать r/#technology
В этом посте были ссылки, но мы их удалили по правилам Сетки
· 18.05
Есть такое. Сейчас бьюсь с Claude, доделать мелкие штрихи, ни в какую. То начинает усложнять, не работает, потом опять упрощать, не работает. А самое противное, просишь сделать одно, ломает заодно и другое. Мрак. Такое ощущение, что последнюю неделю круто тупит.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён